クエリ理解とは、検索者のキーワードから意味を抽出して検索エンジンユーザーの意図を推測するプロセスです。 [1]クエリ理解手法は、通常、検索エンジンが結果を取得してランク付けする前に行われます。これは自然言語処理に関連していますが、特に検索クエリの理解に重点を置いています。
方法
語幹処理と見出し語化
多くの言語では、単語が出現する発話での役割を反映するために語形変化が行われます。単語のさまざまな形の変化は、検索システムに含まれる比較的粗い意味モデルにとってはあまり重要ではないため、単語のさまざまな形を融合するタスクは、検索システムのリコールを向上させるために潜在的に有用な手法です。[2]
ステミングアルゴリズム(ステマーとも呼ばれる)は、通常、言語の語形変化の規則をモデル化するために、接尾辞を削除するための一連の単純な規則を使用します。 [3]
一部の言語では、クエリ内の単語をその見出し語や語幹、または語幹に簡略化する単純な見出し語化手法がありますが、他の言語では、この操作には非自明な文字列処理が含まれ、単語の品詞を認識したり、語彙データベースを参照したりする 必要がある場合もあります。
語幹化とレマタイズ化の有効性は言語によって異なります。 [4] [5]
クエリのセグメンテーション
クエリのセグメンテーションは、クエリを意味のあるセグメントに分割する目的で、クエリを理解するための重要な要素です。バッグオブワードモデルなどの従来のアプローチでは、個々の単語を独立した単位として扱うため、解釈の精度が制限される可能性があります。単語がスペースで区切られていない中国語などの言語では、個々の文字が独立した意味を持たないことが多いため、セグメンテーションが不可欠です。英語でも、BOW モデルでは完全な意味を捉えられない場合があります。「ニューヨーク」などの特定のフレーズは、独立した用語としてではなく、全体として意味を持ちます。クエリセグメンテーションは、クエリ内のフレーズまたはエンティティを識別することで解釈を強化し、検索エンジンが近接性と順序の制約を適用できるようにして、最終的に検索の精度とユーザー満足度を向上させます。[6]
エンティティ認識
エンティティ認識は、テキスト文字列内のエンティティを見つけて分類するプロセスです。名前付きエンティティ認識は、人名、場所、組織名などの名前付きエンティティに特に焦点を当てています。さらに、エンティティ認識には、複数語のフレーズで表される可能性のあるクエリ内の概念を識別することも含まれます。エンティティ認識システムは通常、文法ベースの言語技術または統計的機械学習モデルを使用します。[7]
クエリの書き換え
クエリ書き換えは、検索クエリを自動的に書き直して、その意図をより正確に捉えるプロセスです。クエリ拡張では、同義語などのクエリ用語を追加して、より多くのドキュメントを取得し、再現率を高めます。クエリ緩和では、クエリ用語を削除して、ドキュメントがクエリに一致する要件を減らし、再現率を高めます。連続するクエリ用語をフレーズに自動的に変換したり、クエリ用語を特定のフィールドに制限したりするなど、他の形式のクエリ書き換えは、精度の向上を目的としています。
スペル修正
自動スペル修正は、ユーザーのクエリでよくあるスペルミスに対処するために設計された、現代の検索エンジンの重要な機能です。このようなエラーは、ユーザーがなじみのないトピックを検索することが多いため、特に頻繁に発生します。スペルミスのあるクエリを修正することで、検索エンジンはユーザーの意図をより深く理解し、検索結果の関連性と品質、および全体的なユーザーエクスペリエンスを向上させます。[8]
外部リンク
- ACM SIGIR 2011 クエリ表現と理解に関するワークショップの議事録
- 検索エンジンのクエリ理解 (Yi Chang および Hongbo Deng 編)
参考文献
- ^ 「ACM (Association for Computing Machinery) Special Interest Group on Information Retrieval (SIGIR) 2010 Workshop on Query Representation and Understanding」(PDF)。
- ^ Lowe, Thomas; Roberts, David; Kurtz, Peter日付=1973.オンライン検索のための追加テキスト処理 (RADCOL システム)。第 1 巻。DTIC ドキュメント。
{{cite book}}: CS1 maint: 数値名: 著者リスト (リンク) レノン、マーティン、ピアース、ブライアン D、ウィレット、ピーター (1981)。「情報検索のためのいくつかの融合アルゴリズムの評価」。情報科学者。3 (4)。SAGE。 - ^ Lovins, Julie (1968).ステミングアルゴリズムの開発。MIT 情報処理グループ。
- ^ Harman, Donna (1991). 「サフィックスはどの程度効果的か?」アメリカ情報科学会誌。42 ( 1 ): 7– 15. doi :10.1002/(SICI)1097-4571(199101)42:1<7::AID-ASI2>3.0.CO;2-P.
- ^ Popovic, Mirkoc; Willett, Peter (1981). 「スロベニア語のテキストデータへの自然言語アクセスにおける語幹抽出の有効性」Information Scientist . 3 (4). SAGE.
- ^ Li, Hang; Xu, Jun; Zhang, Min (2021).検索エンジンのクエリ理解。Springer。
- ^ 「名前付きエンティティの認識と分類に関する調査」(PDF)。
- ^ Li, Hang; Xu, Jun; Zhang, Min (2021).検索エンジンのクエリ理解。Springer。
