文書検索とは、ユーザーが指定したクエリを、一連の自由記述形式のテキストレコードと照合することと定義されます。これらのレコードは、新聞記事、不動産記録、マニュアルの段落など、主に非構造化されたあらゆる種類のテキストである可能性があります。ユーザーのクエリは、情報ニーズを詳細に記述した複数文から、数語の短いものまで多岐にわたります。
文書検索は、テキスト検索、あるいはテキスト検索の一分野と呼ばれることがあります。テキスト検索は、情報が主にテキスト形式で保存されている情報検索の一分野です。テキストデータベースは、パーソナルコンピュータのおかげで分散化されました。テキスト検索は、すべてのインターネット検索エンジンの基本的な基盤であるため、今日では重要な研究分野となっています。
文書検索システムは、テキストレコード(文書)をユーザーのクエリと照合することで、指定された基準に合致する情報を検索します。これに対し、エキスパートシステムは、論理的な知識データベースに基づいて推論を行い、質問に答えます。文書検索システムは、文書データベース、全文インデックスを作成するための分類アルゴリズム、およびデータベースにアクセスするためのユーザーインターフェースで構成されます。
文書検索システムには主に2つのタスクがあります。
インターネット検索エンジンは、文書検索の典型的な応用例である。現在使用されている検索システムの大部分は、単純なブール演算システムから、統計的手法や自然言語処理技術を用いたシステムまで多岐にわたる。
文書検索システムにおける索引付け方式には、大きく分けて2つの種類があります。形式ベース(または単語ベース)の索引付けと、内容ベースの索引付けです。使用される文書分類方式(または索引付けアルゴリズム)によって、文書検索システムの性質が決まります。
形式ベースの文書検索は、文字列検索における部分文字列照合と同様に、テキストの正確な構文特性を対象とします。テキストは一般的に非構造化されており、必ずしも自然言語である必要はありません。このシステムは、例えば分子生物学における大量の化学表現を処理するために使用できます。接尾辞ツリーアルゴリズムは、形式ベースのインデックス作成の一例です。
コンテンツベースのアプローチは、文書とその一部間の意味的関連性、およびクエリと文書間の意味的関連性を活用します。ほとんどのコンテンツベースの文書検索システムは、転置インデックスアルゴリズムを使用しています。
シグネチャファイルとは、クエリに一致するすべてのドキュメントと、一致しないドキュメントを少数残すような、ブルームフィルタなどの簡易的なフィルタを作成する手法です。この手法は、各ファイルにシグネチャ(通常はハッシュ化されたバージョン)を作成することで実現されます。その方法の一つとして、重ね合わせ符号化があります。後処理ステップでは、誤検出を除外します。ほとんどの場合、この構造は速度、サイズ、機能の点で転置インデックスに劣るため、広くは使用されていません。しかし、適切なパラメータを設定すれば、特定の環境では転置インデックスを上回る性能を発揮することもあります。
PubMed [ 1 ]のフォームインターフェースには、「関連論文」検索機能があり、単語重み付けアルゴリズムを使用して、文書のタイトル、抄録、MeSH用語の単語を比較することで機能します。 [ 2 ] [ 3 ]
{{cite journal}}: CS1 maint: 数値名: 著者リスト (リンク)