テキスト処理における近接検索では、2 つ以上の別々に一致する用語の出現が指定された距離内にあるドキュメントを検索します。距離は中間の単語または文字の数です。近接に加えて、一部の実装では単語の順序に制約が課される場合もあります。つまり、検索対象テキストの順序は検索クエリの順序と同じである必要があります。近接検索は、近接の制約を追加することで単純な単語の一致を超えており、一般に高度な検索の形式と見なされています。
たとえば、検索を使用して「赤レンガの家」を見つけ、「赤いレンガの家」や「赤レンガで作られた家」などのフレーズを一致させることができます。近接性を制限することで、単語がページ全体に散らばったり広がったりしているドキュメントや、アンソロジー内の無関係な記事を回避しながら、これらのフレーズを一致させることができます。
根拠
近接検索の基本的な言語的仮定は、文書内の単語の近接性は単語間の関係を暗示するというものです。文書の作成者は、1 つのアイデア、または隣接する文内または段落にまとめられた関連するアイデアのクラスターを含む文を作成しようとするため、文書構造内で一緒に使用される単語が関連している可能性は、本質的に比較的高くなります。一方、2 つの単語が本の反対側にある場合、単語間の関係の可能性は比較的低くなります。指定された最大近接性または距離内に単語がある一致のみを含むように検索結果を制限することで、単語が散在している一致よりも 検索結果の関連性が高くなると想定されます。
商用インターネット検索エンジンは、平均的な検索クエリに対して、一致 (リコールと呼ばれる) が多すぎる傾向があります。近接検索は、一致するページ数を減らし、単語の近接性を使用してランキングを支援することで、一致したページの関連性を高める方法の 1 つです。追加の利点として、近接検索は、辞書リストや数千語のショットガン リストを含む Web ページを回避することで、スパムデクシングの防止に役立ちます。検索エンジンが単語の頻度に大きく偏っていた場合、これらの Web ページは高いランキングになります。
ブール構文と演算子
近接検索では、一部のキーワードのみが指定の距離内にある必要があることを指定できることに注意してください。近接検索を他の検索構文やコントロールと組み合わせて使用すると、より明確な検索クエリが可能になります。NEAR、NOT NEAR、FOLLOWED BY、NOT FOLLOWED BY、SENTENCE、FAR などのクエリ演算子は、指定されたキーワード間の近接検索制限を示すために使用されることがあります。たとえば、「brick NEAR house」などです。
商用検索エンジンでの使用
暗黙的/自動的な近接検索と明示的な近接検索について、2008 年 11 月現在、ほとんどのインターネット検索エンジンは暗黙的な近接検索機能のみを実装しています。つまり、ユーザーのキーワードがそのような結果で良好な「全体的な近接スコア」を持つ検索結果は、自動的に上位にランク付けされます。検索クエリに 2 つのキーワードのみが含まれている場合、これは 2 つのキーワードの間に NEAR 演算子を配置する明示的な近接検索と違いはありません。ただし、3 つ以上のキーワードが存在する場合、これらのキーワードのどのサブセットが検索結果で近接性を期待するかをユーザーが指定することが重要になることがよくあります。これは、ユーザーが先行技術検索を実行したい場合 (たとえば、特定のタスクを完了するための既存のアプローチを検索する場合、複数のコンポーネントとこれらのコンポーネント間のリンクによって共同で実行される手順の動作を示すシステムを開示するドキュメントを検索する場合) に役立ちます。
クエリ言語で明示的な近接演算子を介して近接検索をサポートする Web 検索エンジンには、 Walhello、Exalead、Yandex、Yahoo!、Altavista、Bingなどがあります。
- Walhello検索エンジンを使用する場合、近接性はキーワード間の文字数によって定義できます。[1]
- 検索エンジンExaleadでは、キーワード間の最大単語数として必要な近接性を指定することができます。構文は、
(keyword1 NEAR/n keyword2)nが単語数です。[2] - Yandexは、
keyword1 /n keyword2最大2つの単語で区切られたキーワードを検索する構文を使用しており、この構文の他のいくつかのバリエーションをサポートしています。[3] - Yahoo!とAltavistaはどちらも、文書化されていないNEAR演算子をサポートしています。[4] [5]構文は次のとおりです
keyword1 NEAR keyword2。 - Google検索はAROUND(#)をサポートしています。[6] [7]
- BingはNEARをサポートしています。[8]構文は、
keyword1 near:n keyword2n=最大区切り単語数です。
GoogleとYahoo! の検索エンジンでは、アスタリスク (*) の完全単語ワイルドカードを使用して順序付けられた検索が可能です。Google では 1 つ以上の単語に一致し、[9] Yahoo! 検索では 1 つの単語に一致します。[10] (これは、Google と Yahoo! の両方で「addictive * of biblioscopy」というフレーズを検索することで簡単に確認できます。)
NEAR 演算子の順序なし検索をエミュレートするには、順序付き検索の組み合わせを使用します。たとえば、「house」と「dog」の近い共起を指定するには、次の検索式を指定できます: 「house dog」OR「dog house」OR「house * dog」OR「dog * house」OR「house * * dog」OR「dog * * house」。
参照
注記
- ^ 「Walhello について」 2012 年 5 月 1 日に archive.todayにアーカイブ、2009 年 12 月 23 日に閲覧
- ^ 「Web Search Syntax」、2009 年 12 月 23 日閲覧
- ^ クエリ言語に関する Yandex ヘルプ ページ (ロシア語)
- ^ 「Yahoo! 近接クエリが成功しました」(2010 年 2 月 22 日)
- ^ 「Yahoo! 近接クエリが失敗しました」(2010 年 2 月 22 日)
- ^ 「GuidingTech: Google 検索のあまり知られていない AROUND 演算子を紹介します」
- ^ 「Google が近接検索を提供」(2011 年 2 月 8 日)
- ^ 「Bing の高度な検索演算子の使い方」
- ^ 「Google 検索のその他のヘルプ」2009 年 12 月 23 日閲覧
- ^ 「Yahoo! 検索のレビュー」、Search Engine Showdown、2009 年 12 月 23 日閲覧
