コンピューティングと情報科学における情報検索( IR ) は、情報ニーズに関連する情報システムリソースを識別して取得するタスクです。情報ニーズは、検索クエリの形式で指定できます。ドキュメント検索の場合、クエリはフルテキストまたはその他のコンテンツベースのインデックスに基づくことができます。情報検索は、ドキュメント内の情報の検索、ドキュメント自体の検索、およびデータを記述するメタデータの検索、およびテキスト、画像、または音声のデータベースの検索を行う科学[1]です。
自動情報検索システムは、いわゆる情報過多を軽減するために使用されます。IR システムは、書籍、ジャーナル、その他の文書へのアクセスを提供するソフトウェア システムであり、それらの文書を保存および管理します。Web検索エンジンは、最もよく知られている IR アプリケーションです。
概要
情報検索プロセスは、ユーザーがシステムにクエリを入力すると開始されます。クエリは、Web 検索エンジンの検索文字列など、情報ニーズの正式なステートメントです。情報検索では、クエリはコレクション内の単一のオブジェクトを一意に識別しません。代わりに、関連性の度合いが異なる複数のオブジェクトがクエリに一致する場合があります。
オブジェクトとは、コンテンツコレクションまたはデータベース内の情報によって表されるエンティティです。ユーザークエリは、データベース情報と照合されます。ただし、データベースの従来のSQLクエリとは異なり、情報検索では、返される結果がクエリと一致する場合と一致しない場合があるため、結果は通常ランク付けされます。この結果のランク付けは、情報検索検索とデータベース検索の主な違いです。[2]
アプリケーションに応じて、データオブジェクトは、たとえば、テキスト文書、画像、[3]オーディオ、[4] マインドマップ[5]またはビデオである可能性があります。多くの場合、文書自体はIRシステムに直接保存されず、代わりに文書サロゲートまたはメタデータによってシステム内で表現されます。
ほとんどのIRシステムは、データベース内の各オブジェクトがクエリにどの程度一致するかの数値スコアを計算し、この値に従ってオブジェクトをランク付けします。その後、上位ランクのオブジェクトがユーザーに表示されます。ユーザーがクエリを絞り込みたい場合は、このプロセスを繰り返すことができます。[6]
歴史
ユニバックと呼ばれる機械があり、文字や数字が長いスチールテープ上の磁気スポットのパターンとしてコード化されます。これにより、文書のテキストを、その主題コード記号の前に記録することができます。機械は、任意の方法でコード化された参照を自動的に選択して、1分間に120語の速度で入力します。
— JE ホルムストロム、1948年
関連情報の検索にコンピュータを使用するというアイデアは、1945年にヴァネヴァー・ブッシュが論文「As We May Think 」で普及しました。 [7]ブッシュは、フィルムに保存された文書を検索する「統計マシン」の特許(エマニュエル・ゴールドバーグが1920年代と1930年代に出願)に触発されたようです。[8]情報を検索するコンピュータの最初の説明は、1948年にホルムストロムによって説明され、[9]ユニバックコンピュータの初期の言及が詳述されています。自動化された情報検索システムは1950年代に導入され、1957年のロマンチックコメディ「デスクセット」にも登場しました。1960年代には、最初の大規模な情報検索研究グループがコーネル大学のジェラルド・サルトンによって結成されました。1970年代までには、いくつかの異なる検索手法が、クランフィールドコレクション(数千の文書)などの小さなテキストコーパスで優れたパフォーマンスを発揮することが示されました。 [7]ロッキード・ダイアログシステムのような大規模な回収システムは1970年代初頭に使用されるようになりました。
1992 年、米国国防総省は、国立標準技術研究所(NIST) と共同で、 TIPSTER テキスト プログラムの一環として、テキスト検索会議(TREC) を主催しました。この会議の目的は、非常に大規模なテキスト コレクションでテキスト検索方法を評価するのに必要なインフラストラクチャを提供することで、情報検索コミュニティを調査することでした。この会議は、巨大なコーパスに拡張できる方法の研究を促進しました。Web検索エンジンの導入により、非常に大規模な検索システムの必要性がさらに高まりました。
アプリケーション
情報検索技術が使用される分野は次のとおりです (各カテゴリ内のエントリはアルファベット順です)。
一般的なアプリケーション
ドメイン固有のアプリケーション
その他の検索方法
情報検索技術が使用される方法/技術には次のものがあります。
モデルの種類

IR 戦略によって関連文書を効果的に検索するために、文書は通常、適切な表現に変換されます。各検索戦略には、文書表現の目的に応じた特定のモデルが組み込まれています。右の図は、いくつかの一般的なモデルの関係を示しています。図では、モデルは数学的基礎とモデルのプロパティという 2 つの次元に従って分類されています。
第一次元: 数学的基礎
- 集合論的モデルは、文書を単語またはフレーズの集合として表します。類似性は通常、それらの集合に対する集合論的操作から導き出されます。一般的なモデルは次のとおりです。
- 代数モデルは、通常、ドキュメントとクエリをベクトル、行列、またはタプルとして表します。クエリ ベクトルとドキュメント ベクトルの類似性は、スカラー値として表されます。
- 確率モデルは、ドキュメント検索のプロセスを確率的推論として扱います。類似性は、ドキュメントが特定のクエリに関連する確率として計算されます。ベイズの定理などの確率定理は、これらのモデルでよく使用されます。
- 特徴ベースの検索モデルは、ドキュメントを特徴関数(または単に特徴)の値のベクトルとして扱い、通常はランク付け方法を学習することによって、これらの特徴を 1 つの関連性スコアに結合する最適な方法を探します。特徴関数はドキュメントとクエリの任意の関数であるため、他のほとんどすべての検索モデルを別の特徴として簡単に組み込むことができます。
2次元目: モデルのプロパティ
- 用語の相互依存性のないモデルでは、異なる用語/単語は独立したものとして扱われます。この事実は、通常、ベクトル空間モデルでは用語ベクトルの直交性仮定によって、確率モデルでは用語変数の独立性仮定によって表されます。
- 内在的な用語の相互依存性を持つモデルでは、用語間の相互依存性を表現できます。ただし、2 つの用語間の相互依存性の度合いは、モデル自体によって定義されます。これは通常、ドキュメント セット全体におけるそれらの用語の共起から直接的または間接的に (たとえば、次元削減によって)導出されます。
- 超越的な用語の相互依存性を持つモデルでは、用語間の相互依存性を表現できますが、2 つの用語間の相互依存性がどのように定義されるかは示されません。2 つの用語間の相互依存性の度合いについては、外部ソースに依存します (たとえば、人間または高度なアルゴリズム)。
パフォーマンスと正確性の測定
情報検索システムの評価は、システムがユーザーの情報ニーズをどの程度満たしているかを評価するプロセスです。一般的に、測定では、検索対象となる文書のコレクションと検索クエリが考慮されます。ブール検索[説明が必要]またはトップ k 検索用に設計された従来の評価指標には、精度と再現率が含まれます。すべての測定は、関連性のグラウンド トゥルースの概念を前提としています。つまり、すべての文書は、特定のクエリに関連するか、関連しないかのいずれかであることがわかっています。実際には、クエリが不適切である場合があり、関連性の程度が異なる場合があります。
タイムライン
- 1900年代以前
- 1801年:ジョセフ・マリー・ジャカードが、パンチカードを使用して一連の操作を制御する最初の機械であるジャカード織機を発明しました。
- 1880 年代:ハーマン・ホレリスが、機械読み取り可能な媒体としてパンチカードを使用する電気機械式データ集計装置を発明しました。
- 1890年の米国国勢調査データを処理するために使用されたホレリスカード、キーパンチ、および集計装置。
- 1920年代-1930年代
- エマニュエル・ゴールドバーグは、光電セルとパターン認識を使用してマイクロフィルム化された文書のロール上のメタデータを検索する文書検索エンジン「統計マシン」の特許を申請しました。
- 1940年代~1950年代
- 1940 年代後半: 米軍はドイツ軍から押収した戦時中の科学研究文書の索引作成と検索という問題に直面しました。
- 1945年:ヴァネヴァー・ブッシュの『As We May Think』がアトランティック・マンスリー誌に掲載される。
- 1947年:ハンス・ピーター・ルーン(1941年よりIBMの研究エンジニア)が、化合物を検索するための機械化されたパンチカードベースのシステムの開発に着手しました。
- 1950 年代: 米国におけるソ連との「科学格差」に対する懸念の高まりが動機となり、資金提供を奨励し、機械化された文献検索システム (アレン・ケント 他) とユージン・ガーフィールドによる引用索引の発明の背景となった。
- 1950年:「情報検索」という用語はカルビン・ムーアズによって造られた。[10]
- 1951年:フィリップ・バグリーがMITの修士論文でコンピュータによる文書検索に関する最初の実験を行った。[11]
- 1955年:アレン・ケントがケース・ウェスタン・リザーブ大学に加わり、最終的にはドキュメンテーションおよびコミュニケーション研究センターの副所長に就任した。同年、ケントと同僚はAmerican Documentation誌に論文を発表し、精度と再現率の測定法について説明し、また、検索されなかった関連文書の数を決定するための統計的サンプリング法を含むIRシステムを評価する「フレームワーク」の提案を詳述した。[12]
- 1958 年: ワシントン DC で開催された国際科学情報会議では、特定された問題の解決策として IR システムの検討が行われました。参照: 1958 年国際科学情報会議の議事録(米国科学アカデミー、ワシントン DC、1959 年)
- 1959年:Hans Peter Luhnが「情報検索のための文書の自動エンコード」を出版。
- 1940 年代後半: 米軍はドイツ軍から押収した戦時中の科学研究文書の索引作成と検索という問題に直面しました。
- 1960年代:
- 1960 年代初頭:ジェラルド・サルトンがハーバード大学で国際関係論の研究を開始し、後にコーネル大学に移りました。
- 1960年:メルビン・アール・マロンとジョン・ラリー・クーンズ[13]は、1960年7月のJournal of the ACM 7(3):216–244に「関連性、確率的索引付け、情報検索について」を発表しました。
- 1962年:
- Cyril W. Cleverdon は、クランフィールド研究の初期結果を発表し、IR システム評価のモデルを開発しました。参照: Cyril W. Cleverdon、「インデックス システムの比較効率に関する調査のテストと分析に関するレポート」。Cranfield Collection of Aeronautics、Cranfield、イギリス、1962 年。
- ケントは『Information Analysis and Retrieval』を出版した。
- 1963年:
- ワインバーグ報告書「科学、政府、情報」は、「科学情報の危機」という概念を全面的に表現した。この報告書はアルヴィン・ワインバーグ博士にちなんで名付けられた。
- ジョセフ・ベッカーとロバート・M・ヘイズは情報検索に関するテキストを出版しました。ベッカー、ジョセフ、ヘイズ、ロバート・メイヨー。情報の保存と検索:ツール、要素、理論。ニューヨーク、ワイリー(1963年)。
- 1964年:
- Karen Spärck Jones はケンブリッジ大学で「同義語と意味分類」という論文を完成させ、 IR に適用される計算言語学の研究を続けました。
- 米国国立標準規格協会は、「機械化された文書作成のための統計的関連法」と題するシンポジウムを主催しました。G. Salton によるSMARTシステムに関する最初の公開された参考文献 (と思われる) を含む、非常に重要な論文がいくつか発表されました。
- 1960年代半ば:
- 国立医学図書館は、最初の主要な機械可読データベースおよびバッチ検索システムであるMEDLARS医学文献分析および検索システムを開発しました。
- MIT の Project Intrex。
- 1965年:JCR Lickliderが『Libraries of the Future』を出版。
- 1966年:ドン・スワンソンはシカゴ大学で将来のカタログの要件に関する研究に参加しました。
- 1960 年代後半: F. Wilfrid Lancaster がMEDLARS システムの評価研究を完了し、情報検索に関するテキストの初版を出版しました。
- 1968年:
- Gerard Salton が『Automatic Information Organization and Retrieval』を出版しました。
- John W. Sammon, Jr. の RADC Tech レポート「情報の保存と検索に関する数学」では、ベクトル モデルの概要が説明されています。
- 1969 : Sammon の「データ構造分析のための非線形マッピング ( Wayback Machineに 2017-08-08 にアーカイブ)」(IEEE Transactions on Computers) は、IR システムへの視覚化インターフェイスの最初の提案でした。
- 1970年代
- 1970年代初頭:
- 最初のオンライン システム - NLM の AIM-TWX、MEDLINE、Lockheed の Dialog、SDC の ORBIT。
- セオドア・ネルソンはハイパーテキストの概念を推進し、『Computer Lib/Dream Machines』を出版した。
- 1971年:ニコラス・ジャーディンとコーネリス・J・ファン・ライスベルゲンが「情報検索における階層的クラスタリングの利用」を発表し、「クラスター仮説」を明確にした。[14]
- 1975 年: サルトンによる 3 つの非常に影響力のある出版物では、ベクトル処理フレームワークと用語識別モデルが完全に説明されました。
- 1978年:第1回ACM SIGIRカンファレンス。
- 1979年: CJ van Rijsbergen がInformation Retrieval (Butterworths) を出版。確率モデルに重点が置かれる。
- 1979年:タマス・ドシュコチが国立医学図書館のMEDLINEにCITE自然言語ユーザーインターフェースを実装した。CITEシステムは自由形式のクエリ入力、ランク付けされた出力、関連性のフィードバックをサポートしていた。 [15]
- 1970年代初頭:
- 1980年代
- 1980 年: ケンブリッジで英国コンピュータ協会 IR グループと共同で、初の国際 ACM SIGIR 会議を開催。
- 1982 : Nicholas J. Belkin、Robert N. Oddy、Helen M. Brooks が情報検索のための ASK (Anomalous State of Knowledge) 観点を提案しました。これは重要な概念でしたが、彼らの自動分析ツールは最終的に期待外れに終わりました。
- 1983 年: Salton (および Michael J. McGill) が、ベクトル モデルに重点を置いた『Introduction to Modern Information Retrieval』 (McGraw-Hill) を出版しました。
- 1985年:デビッド・ブレアとビル・マロンが「全文文書検索システムの検索有効性の評価」を発表
- 1980 年代半ば: 商用 IR システムのエンド ユーザー バージョンの開発に向けた取り組み。
- 1985~1993年:視覚化インターフェースに関する主要な論文と実験システム。
- Donald B. Crouch、 Robert R. Korfhage、Matthew Chalmers、Anselm Spoerri らによる作品。
- 1989年:CERNのティム・バーナーズ=リーによる最初のワールドワイドウェブ提案。
- 1990年代
- 1992年:最初のTREC会議。
- 1997年:視覚化とマルチ参照点システムに重点を置いたKorfhageのInformation Storage and Retrieval [16]の出版。
- 1999年:Ricardo Baeza-YatesとBerthier Ribeiro-Netoの共著『Modern Information Retrieval』がAddison Wesleyによって出版されました。これはIRのすべてを網羅しようとした最初の本です。
- 1990 年代後半:以前は実験的な IR システムにのみ存在していた多くの機能がWeb 検索エンジンに実装されました。検索エンジンは、IR モデルの最も一般的な、そしておそらく最も優れたインスタンス化になりました。
主要会議
- SIGIR: 情報検索の研究開発に関する会議
- ECIR:欧州情報検索会議
- CIKM:情報と知識管理に関する会議
- WWW:国際ワールドワイドウェブ会議
- WSDM: Web検索とデータマイニングに関する会議
- ICTIR: 情報検索理論に関する国際会議
当該分野の受賞歴
参照
- 敵対的情報検索 – データセット内の情報検索戦略
- コンピュータメモリ – すぐに使用できるように情報を保存するコンピュータコンポーネント
- 統制語彙 – 知識を整理する方法
- クロスランゲージ情報検索 – 異なる言語での情報の検索
- データマイニング – 大規模なデータセットからパターンを抽出して発見するプロセス
- データ取得 – データベースからデータを取得する方法
- 欧州情報検索サマースクール – ESSIR は、若手および上級研究者、学生、専門家、開発者に方法論と技術の両面におけるこの分野の最新の開発状況を教育することにより、情報アクセス システムの研究、革新、開発を促進します。
- 人間とコンピュータの情報検索( HCIR )
- 情報抽出 – 非構造化文書の機械読み取り
- 情報探索 – 人間とテクノロジーの両方の文脈で情報を取得しようとするプロセスまたは活動
- 情報探索 § 情報検索と比較して
- 共同情報探索
- 社会的情報探索 – 参加型オンラインソーシャルサイトで人々が情報を探したり共有したりする状況、動機、方法を研究する研究分野
- 情報検索施設 - オーストリア、ウィーンの組織 2006-2012
- 知識の視覚化 – メッセージを伝えるために画像、図、アニメーションを作成するための一連のテクニック
- マルチメディア情報検索
- 個人情報管理 - 自分のデータを管理するためのツールとシステム
- 真珠養殖 – 検索戦略の種類
- クエリ理解 – 検索エンジンの処理ステップ
- 関連性(情報検索) – 特定の主題または検索クエリに対する文書の適用性の尺度
- 関連性フィードバック – フィードバックの種類
- ロッキオ分類 – 重心に基づく機械学習の分類モデル
- 検索エンジンのインデックス作成 – データ管理の方法
- 情報検索に関する特別興味グループ – 計算機協会のサブグループ
- 主題索引 – 索引用語による文書の分類
- 時間的情報検索 – 適時性を中心とした情報検索に関する研究分野
- tf-idf – 文書内の単語の重要度の推定
- XML 検索 – XML ドキュメントのコンテンツベースの検索
- ウェブマイニング – 大規模なデータセットからパターンを抽出して発見するプロセス
参考文献
- ^ Luk, RWP (2022). 「なぜ情報検索は科学分野なのか?」. Foundations of Science . 27 (2): 427–453. doi :10.1007/s10699-020-09685-x. hdl : 10397/94873 . S2CID 220506422.
- ^ Jansen, BJ および Rieh, S. (2010) 情報検索と情報取得の 17 の理論的構成 Archived 2016-03-04 at the Wayback Machine . Journal of the American Society for Information Sciences and Technology. 61(8), 1517-1534.
- ^ Goodrum, Abby A. (2000). 「画像情報検索: 現在の研究の概要」. Informing Science . 3 (2).
- ^ Foote, Jonathan (1999). 「オーディオ情報検索の概要」.マルチメディアシステム. 7 : 2–10. CiteSeerX 10.1.1.39.6339 . doi :10.1007/s005300050106. S2CID 2000641.
- ^ Beel, Jöran; Gipp, Bela; Stiller, Jan-Olaf (2009). マインドマップの情報検索 - 何に役立つのか? Proceedings of the 5th International Conference on Collaborative Computing: Networking, Applications and Worksharing (CollaborateCom'09). Washington, DC: IEEE. 2011-05-13 にオリジナルからアーカイブ。2012-03-13に取得。
- ^ Frakes, William B.; Baeza-Yates, Ricardo (1992). 情報検索データ構造とアルゴリズム. Prentice-Hall, Inc. ISBN 978-0-13-463837-92013年9月28日時点のオリジナルよりアーカイブ。
- ^ ab Singhal, Amit (2001). 「現代の情報検索: 概要」(PDF) . IEEE Computer Society Technical Committee on Data Engineering の紀要. 24 (4): 35–43.
- ^ Mark Sanderson & W. Bruce Croft (2012). 「情報検索研究の歴史」. Proceedings of the IEEE . 100 : 1444–1451. doi : 10.1109/jpcroc.2012.2189916 .
- ^ JE Holmstrom (1948)。「セクション III. 開会総会」。王立協会科学情報会議、1948 年 6 月 21 日~7 月 2 日: 報告書および提出論文: 85。
- ^ Mooers, Calvin N.;非数値情報のデジタル処理理論と機械経済学へのその影響(Zator Technical Bulletin No. 48)、Fairthorne, RA (1958) で引用。「記録された情報の自動検索」。The Computer Journal。1 ( 1): 37。doi : 10.1093/comjnl/1.1.36。
- ^ ドイル、ローレン、ベッカー、ジョセフ (1975)。情報検索と処理。メルヴィル。410 ページ。ISBN 978-0-471-22151-7。
- ^ペリー、ジェームズ W.; ケント 、アレン; ベリー、マデリン M. (1955)。「機械文献検索 X. 機械言語; その設計と開発の基礎となる要因」。アメリカドキュメンテーション。6 (4): 242–254。doi :10.1002/asi.5090060411。
- ^ Maron, Melvin E. (2008). 「確率的インデックスの起源に関する歴史的ノート」(PDF) .情報処理と管理. 44 (2): 971–972. doi :10.1016/j.ipm.2007.02.012.
- ^ N. Jardine、CJ van Rijsbergen (1971 年12月)。「情報検索における階層的クラスタリングの利用」。情報の保存と検索。7 (5): 217–240。doi :10.1016/0020-0271(71)90051-9。
- ^ Doszkocs, TE & Rapp, BA (1979)。「英語での MEDLINE の検索: 自然言語クエリ、ランク付けされた出力、および関連性フィードバックを備えたプロトタイプ ユーザー インターフェイス」、ASIS 年次会議の議事録、16: 131-139。
- ^ Korfhage, Robert R. (1997).情報の保存と検索. Wiley. 368 ページ. ISBN 978-0-471-14338-3。
さらに読む
- Ricardo Baeza-Yates、Berthier Ribeiro-Neto。現代の情報検索:検索の背後にある概念と技術(第2版)Wayback Machineに2017年9月18日にアーカイブ。Addison-Wesley、英国、2011年。
- Stefan Büttcher、Charles LA Clarke、Gordon V. Cormack。情報検索:検索エンジンの実装と評価。Wayback Machineに 2020-10-05 にアーカイブ。MIT Press、マサチューセッツ州ケンブリッジ、2010 年。
- 「情報検索システム」。図書館・情報科学ネットワーク。2015年4月24日。2020年5月11日時点のオリジナルよりアーカイブ。2020年5月3日閲覧。
- Christopher D. Manning、Prabhakar Raghavan、Hinrich Schütze。情報検索入門。ケンブリッジ大学出版局、2008年。
- Yeo, ShinJoung. (2023) Behind the Search Box: Google and the Global Internet Industry (U of Illinois Press, 2023) ISBN 10:0252087127 オンライン
外部リンク
- ACM SIGIR: 情報検索特別興味グループ
- BCS IRSG: 英国コンピュータ協会 – 情報検索専門家グループ
- テキスト検索会議 (TREC)
- 情報検索評価フォーラム (FIRE)
- Information Retrieval (オンライン ブック) CJ van Rijsbergen著
- 情報検索 Wiki 2015-11-24 にWayback Machineにアーカイブされました
- 情報検索機能 2008-05-22 にWayback Machineにアーカイブされました
- 情報検索評価技術に関するTRECレポート
- eBayが検索関連性を測定する方法
- 情報検索パフォーマンス評価ツール @ アテナ研究センター
