ウェブ検索クエリのトピック分類は、情報科学における課題の一つです。この課題は、ウェブ検索クエリをそのトピックに基づいて、あらかじめ定義された1つ以上のカテゴリに割り当てることです。クエリ分類の重要性は、ウェブ検索が提供する多くのサービスによって強調されています。直接的な応用例としては、異なるカテゴリに関心を持つユーザーに対して、より適切な検索結果ページを提供することが挙げられます。例えば、「apple」というウェブ検索クエリを発行するユーザーは、果物のリンゴに関連するウェブページが表示されることを期待するかもしれませんし、コンピュータ会社に関連する製品やニュースが表示されることを好むかもしれません。オンライン広告サービスは、クエリ分類の結果を利用して、さまざまな製品をより正確に宣伝することができます。検索結果ページは、クエリ分類アルゴリズムによって予測されたカテゴリに従ってグループ化できます。しかし、クエリ分類の計算は容易ではありません。文書分類タスクとは異なり、ウェブ検索ユーザーが送信するクエリは通常短く曖昧であり、またクエリの意味は時間とともに変化します。そのため、クエリのトピック分類は、従来の文書分類タスクよりもはるかに困難です。
Webクエリのトピック分類とは、クエリを事前に定義されたカテゴリに自動的に割り当てることです。従来の文書分類タスクとは異なり、Webクエリの理解の進歩を妨げるいくつかの大きな課題があります。
多くのクエリは短く、クエリ用語にはノイズが多い。例えば、KDDCUP 2005データセットでは、3単語のクエリが最も多く(22%)、79%のクエリは4単語以下である。ユーザーのクエリは複数の意味を持つことが多い。例えば、「apple」は果物の種類やコンピュータ会社を指す場合があり、「Java」はプログラミング言語やインドネシアの島を指す場合がある。KDDCUP 2005データセットでは、クエリの大部分が複数の意味を持つ。したがって、クエリのキーワードのみを使用して分類用のベクトル空間モデルを構築することは適切ではない。
クエリエンリッチメントに基づく手法[ 1 ] [ 2 ]は、検索エンジンを通じてユーザーのクエリをテキスト文書のコレクションにエンリッチすることから始まります。そのため、各クエリは、検索エンジンによって取得された上位の結果ページの抜粋で構成される擬似文書で表されます。その後、テキスト文書は、同義語ベースの分類器またはナイーブベイズ(NB)やサポートベクターマシン(SVM)などの統計的分類器を使用して、ターゲットカテゴリに分類されます。
クエリの意味も時間とともに変化する可能性があります。そのため、古いラベル付きトレーニングクエリはすぐに時代遅れになり、役に立たなくなる可能性があります。分類器を時間とともに適応させる方法が大きな課題となります。例えば、「バルセロナ」という言葉は、2007年以前は都市やサッカークラブを指していましたが、現在はAMDの新しいマイクロプロセッサという意味で使われています。したがって、この用語の意味の分布は、Web上での時間経過によって変化します。
中間分類法に基づく手法[ 3 ]では、まずオフラインモードでOpen Directory Project (ODP)などの中間分類法に基づいてブリッジング分類器を構築します。次に、この分類器をオンラインモードで使用して、中間分類法を介してユーザーのクエリをターゲットカテゴリにマッピングします。このアプローチの利点は、ブリッジング分類器を一度だけトレーニングすればよく、新しいターゲットカテゴリと受信クエリのセットごとに適応できることです。
クエリ分類のための手動ラベル付けされたトレーニングデータは高価であるため、膨大な量のウェブ検索エンジンのクエリログをラベルなしデータのソースとして利用し、自動クエリ分類を支援する方法が注目を集めている。これらのログには、ウェブユーザーが検索エンジンを介して情報を検索する際の行動が記録されている。長年にわたり、クエリログはウェブユーザーのワールドワイドウェブに関する知識を豊富に含むリソースとなっている。
クエリクラスタリング手法[ 4 ]は、単一のユーザー操作からの複数のクエリとクリック情報を含む「セッションデータ」をクラスタリングすることで、関連するクエリを関連付けようとします。この手法では、一連のクエリに共通する結果ドキュメントの用語を考慮に入れます。クエリキーワードとセッションデータを組み合わせることが、クエリクラスタリングを実行する最も効果的な方法であることが示されています。
選択選好に基づく手法[ 5 ]は、クエリ用語間の関連ルールを利用してクエリ分類を支援しようとします。訓練データに基づいて、ラベル付きデータを使用した完全一致、ラベル付きデータを使用したNグラム一致、知覚に基づく分類器など、いくつかの分類アプローチを利用します。彼らは、計算言語学から採用した選択選好と呼ばれるアプローチを重視します。xとyがペア(x; y)を形成し、yがカテゴリcに属する場合、xが先頭となる他のすべてのペア(x; z)はcに属します。ラベルなしクエリログデータを使用してこれらのルールをマイニングし、いくつかのラベル付きクエリでアプローチの有効性を検証します。
これらのサービスはすべて、ウェブユーザーの検索意図をウェブ検索クエリを通して理解することに依存している。