歴史 ユニバックと呼ばれる機械があり、文字や数字は長い鋼鉄テープ上の磁気スポットのパターンとして符号化される。この方法により、文書の主題コード記号を先頭に付けたテキストを記録できる。この機械は、任意の方法で符号化された参照を自動的に選択し、毎分120語の速度で入力する。
コンピュータを使って関連情報を検索するというアイデアは、1945年にヴァネヴァー・ブッシュ が書いた記事「As We May Think」で広まった。 [ 9 ] ブッシュは、1920年代から1930年代にかけてエマニュエル・ゴールドバーグ が出願した、フィルムに保存された文書を検索する「統計機械」の特許に触発されたようだ。 [ 10 ] コンピュータが情報を検索する最初の記述は、1948年にホルムストロムによって書かれ、[ 11 ] ユニバック・ コンピュータの初期の言及が詳しく述べられている。自動情報検索システムは1950年代に導入され、1957年のロマンティック・コメディ映画「デスク・セット」 にも登場した。1960年代には、コーネル大学のジェラード・サルトン によって最初の大規模な情報検索研究グループが結成された。 1970年代までに、クランフィールド・コレクション(数千の文書)のような小規模なテキスト・コーパスでは、さまざまな検索技術が良好な性能を発揮することが示されました。 [ 9 ] ロッキード・ダイアログ・システムのような大規模な検索システムは、1970年代初頭に実用化されました。
1992年、米国国防総省は国立標準技術研究所 (NIST)と共同で、 TIPSTERテキストプログラムの一環としてテキスト検索会議 (TREC)を主催しました。その目的は、膨大なテキストコレクションに対するテキスト検索手法の評価に必要なインフラを提供することで、情報検索コミュニティを調査することでした。これにより、大規模なコーパスに対応できる手法の研究が促進されました。 ウェブ検索エンジン の登場は、超大規模検索システムの必要性をさらに高めています。
1990年代後半までに、ワールドワイドウェブの台頭により、情報検索は根本的に変革されました。AltaVista (1995年)やYahoo! ( 1994年)などの初期の検索エンジンはキーワードベースの検索を提供していましたが、規模とランキングの精緻化には限界がありました。1998年にGoogle が設立され、ウェブのハイパーリンク構造を使用してページの重要度を評価し、関連性ランキングを向上させるPageRankアルゴリズム [ 12 ]を導入したことで、画期的な進歩がもたらされました。
2000年代には、機械学習技術の統合により、ウェブ検索システムが急速に進化しました。これらのシステムは、検索精度とパーソナライゼーションを向上させるために、ユーザー行動データ(クリックログなど)、クエリの再定式化、コンテンツベースのシグナルを組み込み始めました。2009年、マイクロソフトは Bingを リリースし、後にSatori知識ベースの開発を通じてセマンティックウェブ技術を組み込むことになる機能を導入しました。学術分析 [ 13 ] では、構造化データの使用やエンティティ認識を含むBingのセマンティック機能が、自然言語処理を通じて検索の関連性を向上させ、ユーザーの意図を理解するという、より広範な業界の変化の一部として強調されています。
2018年に、Googleがクエリやドキュメントの文脈上の意味をよりよく理解するためにBERT(Bidirectional Encoder Representations from Transformers ) を導入 したことで、大きな飛躍が起こりました。これは、深層ニューラル言語モデルが実世界の検索システムで大規模に使用された最初の事例の1つでした。 [ 14 ] BERTの双方向トレーニングにより、文脈における単語間の関係をより洗練された形で理解できるようになり、自然言語クエリの処理が改善されました。その成功により、トランスフォーマーベースのモデルは学術研究や商用検索アプリケーションで注目を集めるようになりました。[ 15 ]
同時に、研究コミュニティは、従来の語彙ベースの手法を凌駕するニューラルランキングモデルの探求を開始しました。1992 年に開始された Text REtrieval Conference (TREC) などの長年のベンチマークや、より最近の評価フレームワークである Microsoft MARCO ( MAchine Reading COmprehension ) ( 2019 ) [ 16 ] は 、 複数 のタスクとドメインにわたる検索システムのトレーニングと評価の中心となりました。MS MARCO は、TREC のディープラーニングトラックでも採用されており、標準化されたベンチマーク環境内でニューラルランキングモデルの進歩を評価するためのコアデータセットとして機能しています。[ 17 ]
ディープラーニングが情報検索システムに不可欠なものとなるにつれ、研究者たちはニューラルアプローチをスパース 、デンス 、ハイブリッド の3つの大まかなクラスに分類し始めました。スパースモデルは、従来の用語ベースの手法やSPLADEのような学習されたバリアントを含め、解釈可能な表現と転置インデックスに依存して、意味信号を追加した効率的な正確な用語マッチングを可能にします。[ 18 ] デンスモデルは、ColBERTのようなデュアルエンコーダーアーキテクチャなど、連続ベクトル埋め込み を使用して、キーワードの重複を超えた意味的類似性をサポートします。[ 19 ] ハイブリッドモデルは、スパース手法の語彙(トークン)精度 とデンスモデルの意味的深さのバランスを取り、両方の利点を組み合わせることを目指しています。このモデルの分類方法は、検索システムの拡張性、関連性、効率性のバランスを取ります。[ 20 ]
情報検索システムが深層学習への依存度を高めるにつれ、偏り、公平性、説明可能性といった問題も浮上してきた。現在、研究は関連性や効率性だけでなく、透明性、説明責任、そして検索アルゴリズムに対するユーザーの信頼にも焦点を当てている。
アプリケーション 情報検索技術が用いられる分野には、以下のようなものがあります(各カテゴリ内の項目はアルファベット順です)。
その他の検索方法 情報検索技術が用いられる方法/手法には、以下のようなものがある。
モデルタイプ IRモデルの分類(ドイツ語のエントリー からの翻訳、原典:Dominik Kuropka) 情報検索戦略によって関連文書を効果的に検索するためには、通常、文書を適切な表現形式に変換する必要があります。各検索戦略は、文書表現のために特定のモデルを採用しています。右の図は、いくつかの一般的なモデルの関係性を示しています。この図では、モデルは数学的基礎とモデルの特性という2つの側面に基づいて分類されています。
第一次元:数学的基礎 集合論的モデルでは、文書を単語やフレーズの 集合 として表現します。類似性は通常、これらの集合に対する集合論的演算から導き出されます。一般的なモデルは以下のとおりです。 代数モデルでは 、文書とクエリは通常、ベクトル、行列、またはタプルとして表現されます。クエリベクトルと文書ベクトルの類似性は、スカラー値で表されます。 確率モデルでは 、文書検索のプロセスを確率的推論として扱います。類似性は、特定のクエリに対して文書が関連性を持つ確率として計算されます。これらのモデルでは、ベイズの定理 などの確率論的定理がよく用いられます。 特徴ベースの検索モデルは、文書を 特徴関数 (または単に特徴 )の値のベクトルとして捉え、これらの特徴を単一の関連性スコアに組み合わせる最適な方法を、通常はランク付け手法を学習する ことによって模索します。特徴関数は文書とクエリの任意の関数であり、そのため、他のほとんどすべての検索モデルを単なる特徴として容易に組み込むことができます。データ融合モデル: 情報検索におけるデータ融合は、複数の検索システムまたは検索モデルの結果を組み合わせてパフォーマンスを向上させます。ランク付けされたリストを統合することで、さまざまなアプローチの強みを活用し、多くの場合、再現率と精度を向上させます。一般的な方法には、スコア正規化や、CombSUMやBordaカウントなどの投票技術があります。このメタ検索戦略は、個々のシステムが補完的なカバレッジを持っている場合や、クエリの難易度が異なる場合に特に効果的で、より堅牢で信頼性の高い最終ランキングスパース性を生み出します。[ 21 ] [ 22 ]
第二の次元:モデルの特性 項間の相互依存性を考慮しないモデルでは、 異なる項/単語は独立したものとして扱われます。この事実は、ベクトル空間モデルでは通常、項ベクトルの直交性仮定によって、確率モデルでは項変数の 独立性 仮定によって表されます。用語間の相互依存関係を内在的に持つモデルは、 用語間の相互依存関係を表現することを可能にする。ただし、2つの用語間の相互依存関係の度合いは、モデル自体によって定義される。これは通常、文書セット全体におけるそれらの用語の共起 から直接的または間接的に(例えば次元削減によって)導き出される。 超越的な項間相互依存関係を持つモデルは 、項間の相互依存関係を表現することを可能にするが、2つの項間の相互依存関係がどのように定義されるかは明示しない。これらのモデルは、2つの項間の相互依存関係の度合いを外部の情報源(例えば、人間または高度なアルゴリズム)に依存する。
第三次元:表現アプローチに基づく分類 理論的な区別に加えて、現代の情報検索モデルは、クエリとドキュメントがどのように表現され比較されるかによっても分類され、スパースモデル、デンスモデル、ハイブリッドモデルを区別する実用的な分類が用いられています。[ 18 ]
スパース モデルは、解釈可能な用語ベースの表現を利用し、通常は逆インデックス構造に依存します。TF-IDFやBM25などの古典的な手法は、スパース性を維持しながらニューラルアーキテクチャを統合した最近の学習済みスパースモデルとともに、このカテゴリに属します。 [ 23 ] 密な モデルは、ディープラーニングモデル(通常はトランスフォーマーベースのエンコーダー)を使用して、クエリとドキュメントを連続ベクトルとして表現します。これらのモデルは、用語の完全な重複を超えた意味的類似性のマッチングを可能にし、意味検索や質問応答などのタスクで使用されます。 [ 24 ] ハイブリッド モデルは、両方のアプローチの長所を組み合わせることを目指しており、スコア融合、後期のインタラクション、または多段階ランキングパイプラインを通じて語彙(トークン)と意味シグナルを統合します。 [ 25 ] この分類は学術分野と実世界のアプリケーションの両方でますます一般的になり、情報検索モデルの評価ベンチマークで広く採用され使用されています。[ 20 ] [ 23 ]
情報検索システムの評価とは、システムがユーザーの情報ニーズをどの程度満たしているかを評価するプロセスです。一般的に、評価では検索対象となる文書の集合と検索クエリを考慮します。ブール検索 やトップk検索向けに設計された従来の評価指標には、精度と再現率 があります。これらの指標はすべて、関連性に関する真の 概念を前提としています。つまり、すべての文書は特定のクエリに対して関連性があるか、ないかのいずれかであると既知であると仮定しています。しかし実際には、クエリは不適切に設定される 可能性があり、関連性にもさまざまな段階が存在する可能性があります。
タイムライン 1900年代 以前1801年 :ジョゼフ・マリー・ジャカールが ジャカード織機 を発明。これは、パンチカードを使って一連の動作を制御する最初の機械だった。1880年代 :ヘルマン・ホレリスが、 機械読み取り可能な媒体としてパンチカードを使用した電気機械式データ集計機を発明する。1890年の米国国勢調査 データの処理に使用された、1890年式の ホレリスカード 、キーパンチ 、および集計機 。1920年代~1930年代 エマニュエル・ゴールドバーグは 、光電セルとパターン認識を用いてマイクロフィルム化された文書のメタデータを検索する文書検索エンジン「統計マシン」の特許を出願した。1940年代~1950年代 1940年代後半 :米軍は、ドイツ軍から押収した戦時中の科学研究文書の索引付けと検索という問題に直面した。 1945年 :ヴァネヴァー・ブッシュ の「As We May Think」が アトランティック・マンスリー誌 に掲載された。1947年 :ハンス・ペーター・ルーン (1941年からIBMの研究エンジニア)は、化学化合物を検索するための機械化されたパンチカードベースのシステムの開発に着手した。1950年代 :米国でソ連との「科学格差」に対する懸念が高まり、機械化された文献検索システム(アレン・ケント 他)の開発や ユージン・ガーフィールド による引用索引 の発明の動機付け、資金提供、背景となった。1950年: カルビン・ムーアーズ が「情報検索」という用語を造語した。[ 26 ] 1951年:フィリップ・バグリーは MIT の修士論文で、コンピュータによる文書検索に関する最初の実験を行った。[ 27 ] 1955年 :アレン・ケントはケース・ウェスタン・リザーブ大学 に入学し、後に文書・コミュニケーション研究センターの副所長となった。同年、ケントと同僚はAmerican Documentation誌に論文を発表し、精度と再現率の測定方法を記述するとともに、検索されなかった関連文書の数を決定するための統計的サンプリング方法を含む、情報検索システムを評価するための提案された「フレームワーク」の詳細を述べた。[ 28 ] 1958年 :ワシントンDCで開催された国際科学情報会議では、特定された問題に対する解決策としてIRシステムが検討された。参照:国際科学情報会議議事録、1958年 (米国科学アカデミー、ワシントンDC、1959年)1959年 :ハンス・ペーター・ルーンが 「情報検索のための文書の自動符号化」を発表。1960年代 : 1960年代初頭 :ジェラード・サルトンは ハーバード大学で国際関係論の研究を開始し、後にコーネル大学に移籍した。1960年 :メルビン・アール・マロン とジョン・ラリー・クーンズ[ 29 ] は、1960年7月にJournal of the ACM 7(3):216–244に「関連性、確率的インデックス、および情報検索について」を発表しました。1962年 :*シリル・W・クレバードンは、 クランフィールド研究の初期調査結果を発表し、IRシステム評価のためのモデルを開発した。参照:シリル・W・クレバードン、「索引システムの比較効率に関する調査の試験および分析に関する報告書」。クランフィールド航空学コレクション、クランフィールド、イングランド、1962年。 * ケントは『情報分析と検索』 を出版した。 1963年 :* ワインバーグ報告書「科学、政府、情報」は、「科学情報の危機」という概念を包括的に論じた。この報告書は、アルビン・ワインバーグ 博士にちなんで名付けられた。 * ジョセフ・ベッカーとロバート・M・ヘイズは 情報検索に関する著作を出版した。ベッカー、ジョセフ;ヘイズ、ロバート・メイヨー。『情報ストレージと検索:ツール、要素、理論 』ニューヨーク、ワイリー(1963年)。 1964年 :カレン・スパーク・ジョーンズはケンブリッジ大学で 「同義語と意味分類」という 論文を完成させ、情報検索に適用される計算言語学の研究を続けた。 *米国標準局は、 「機械化された文書作成のための統計的関連性手法」と題したシンポジウムを主催しました。その中で、G. SaltonによるSMART システムに関する最初の発表論文(と思われる)を含む、非常に重要な論文がいくつか発表されました。 1960年代半ば : *米国国立医学図書館 (NLM)は、初の主要な機械可読データベースおよびバッチ検索システムであるMEDLARS 医学文献分析検索システムを開発しました。 * MITのプロジェクトIntrex。 1965年 :JCR・リックライダーが 『未来の図書館』 を出版。1966年 :ドン・スワンソンは 、シカゴ大学で将来のカタログの要件に関する研究に携わった。1960年代後半 :F・ウィルフリッド・ランカスターは MEDLARSシステムの評価研究を完了し、情報検索に関する著書の初版を出版した。 1968年 :* ジェラード・サルトンは『自動情報整理と検索』 を出版した。 * ジョン・W・サモン・ジュニアのRADC技術報告書「情報ストレージと検索の数学について…」では、ベクトルモデルの概要が説明されています。 1969年 :Sammonの「データ構造解析のための非線形マッピング(IEEE Transactions on Computers)」は、 IRシステムへの視覚化 インターフェース の最初の提案でした。 1970年代 1970年代初頭 : * 最初のオンラインシステム—NLMのAIM-TWX、MEDLINE、ロッキードのDialog、SDCのORBIT。 *テオドール・ネルソンは ハイパーテキスト の概念を提唱し、『コンピュータライブラリ/ドリームマシン』 を出版した。 1971年 :ニコラス・ジャーディン とコーネリス・J・ファン・ライスベルゲンは「情報検索における 階層的クラスタリング の使用」を発表し、「クラスタ仮説」を明確にした。[ 30 ] 1975年 :サルトンによる3つの非常に影響力のある出版物で、彼のベクトル処理フレームワークと用語識別 モデルが完全に明確に示された。 *インデックス理論 (産業応用数学会) *自動テキスト分析における用語重要度理論 (JASIS v. 26) *自動インデックス作成のためのベクトル空間モデル (CACM 18:11) 1978年 :第1回ACM SIGIR 会議開催。1979年 :CJ・ファン・ライスベルゲンが『情報検索』 (バターワース社)を出版。確率モデルに重点が置かれている。1979年 :タマス・ドスコックスは、国立医学図書館のMEDLINE向けにCITE自然言語ユーザーインターフェース を実装した。CITEシステムは、自由形式のクエリ入力、ランク付けされた出力、および関連性のフィードバックをサポートしていた。[ 31 ] 1980年代 1980年 :英国コンピュータ協会IRグループとの共催で、ケンブリッジにて第1回ACM SIGIR国際会議が開催される。1982年 :ニコラス・J・ベルキン 、ロバート・N・オディ、ヘレン・M・ブルックスは、情報検索におけるASK(異常な知識状態)という視点を提唱した。これは重要な概念であったが、彼らが開発した自動分析ツールは最終的には期待外れに終わった。1983年 :サルトン(とマイケル・J・マクギル)は、 『現代情報検索入門』 (マグロウヒル社)を出版し、ベクトルモデルに重点を置いた。1985年 :デビッド・ブレアとビル・マロンが 「全文文書検索システムの検索有効性の評価」 を発表。[ 32 ] 1986年 : NLM所長のドナルド・AB・リンドバーグ 医師は、MEDLINEやその他のMEDLARSデータベースへの医療専門家向け直接インターフェースを実装した。グレイトフル・メッド( グレイトフル・デッド をもじったもの)は、NLMメインフレームに接続する前にクエリ言語を組み立てるELHILLユーザーインターフェースであるMicrosearchを改良したものである。クエリ結果を取得した後、グレイトフル・メッドは検索コストを低く抑えるためにメインフレームから切断した。[ 33 ] 1980年代半ば :市販の赤外線システムのエンドユーザー向けバージョンの開発に向けた取り組み。 1985年~1993年 :可視化インターフェースに関する主要論文および実験システム。ドナルド・B・クラウチ 、ロバート・R・コーファージ 、マシュー・チャルマーズ、アンセルム・スポエリらの作品。1989年 :CERN のティム・バーナーズ=リーが ワールドワイドウェブの 最初の提案を行う。1990年代 1992年 :第1回TREC 会議開催。1997年 :視覚化とマルチ参照点システムに重点を置いたKorfhage のInformation Storage and Retrieval [ 34 ]が出版されました。 1998年: ラリー・ペイジ とセルゲイ・ブリンによって Google が設立される。Googleは、ハイパーリンク構造に基づいてウェブページの重要度を評価するPageRankアルゴリズムを導入した。[ 12 ] 1999年: リカルド・バエザ=イェーツ とベルティエ・リベイロ=ネトによる『現代情報検索』 がアディソン・ウェスリー社から出版される。これは情報検索のすべてを網羅しようと試みた最初の書籍である。2000年代 2001年: ウィキペディアが 無料の共同編集型オンライン百科事典として開設される。ウィキペディアはすぐに情報検索、特に自然言語処理と意味検索のベンチマークのための主要なリソースとなる。[ 35 ] 2009年: マイクロソフトはBingをリリースし、関連検索、意味的候補などの機能を導入し、後にディープラーニング技術をランキングアルゴリズムに組み込みました。[ 13 ] 2010年代 2013年: Googleのハミングバードアルゴリズムが稼働開始し、キーワードマッチングから検索クエリの意図と意味的文脈 の理解へと移行した。[ 36 ] 2018年: Google AIの研究者がBERT (Bidirectional Encoder Representations from Transformers)をリリースし、言語の深い双方向理解を可能にし、情報検索における文書ランキングとクエリ理解を向上させた。[ 14 ] 2019年:マイクロソフトは 、 機械読解と文章ランキングモデルのトレーニングと評価用に設計された大規模データセットであるMS MARCO(Microsoft MAChine Reading CO mprehension)を発表しました。 [ 16 ] 2020年代 2020年: 文脈埋め込みを用いた効率的なパッセージ検索のために設計されたColBERT (Contextualized Late Interaction over BERT)モデルがSIGIR 2020で発表されました。 [ 37 ] [ 19 ] 2021: SPLADE はSIGIR 2021で発表されました。これは、マスク言語モデリングとスパース性正則化を使用して語彙的特徴と意味的特徴のバランスをとるスパースニューラル検索モデルです。[ 38 ] 2022年: BEIRベンチマークがリリースされ、多様なタスクをカバーする18のデータセットでゼロショットIRを評価します。これは、密なIRモデル、疎なIRモデル、およびハイブリッドIRモデル間の比較を標準化します。 [ 23 ]
参考文献 ↑ Luk, RWP (2022). 「情報検索はなぜ科学分野なのか?」. Foundations of Science . 27 (2): 427–453 . doi : 10.1007/s10699-020-09685-x . hdl : 10397/94873 . S2CID 220506422 . ↑ Jansen, BJ; Rieh, S. (2010). "情報検索と情報取得の17の理論的構成要素" (PDF) . Journal of the American Society for Information Sciences and Technology . 61 (8): 1517– 34. doi : 10.1002/asi.21358 . ↑ Goodrum, Abby A. (2000). "画像情報検索:現在の研究の概要" (PDF) . Informing Science . 3 (2): 063– 066. doi : 10.28945/578 . ↑ ↑ Beel, Jöran; Gipp, Bela; Stiller, Jan-Olaf (2009). マインドマップによる情報検索 ― 何に役立つのか? (PDF) . 第5回国際協調コンピューティング会議:ネットワーキング、アプリケーション、ワークシェアリング (CollaborateCom'09) 議事録. IEEE. doi : 10.4108/ICST.COLLABORATECOM2009.8298 . ISBN 978-963-9799-76-9 。↑ フレイクス、ウィリアム・B.、バエザ=イェーツ、リカルド (1992). 情報検索データ構造とアルゴリズム . プレンティス・ホール社. ISBN 978-0-13-463837-9 2013年9月28日にオリジナルからアーカイブされました。↑ H・アイデンバーガー著『メディアの基礎理解』 、atpress、2011年、1ページ。 ↑ Sikos, LF (2016). "RDF を利用したセマンティックビデオ注釈ツールと、次世代ビデオインデックス作成のための Linked Data への概念マッピング: 包括的なレビュー" . Multimedia Tools and Applications . 76 (12): 14437– 14460. doi : 10.1007/s11042-016-3705-7 . S2CID 254832794 . 1 2 Singhal, Amit (2001). "現代の情報検索: 概要」 (PDF) . IEEE Computer Society Technical Committee on Data Engineering Bulletin . 24 (4): 35– 43. ↑ Mark Sanderson & W. Bruce Croft (2012). "情報検索研究の歴史" . Proceedings of the IEEE . 100 : 1444– 51. doi : 10.1109/jproc.2012.2189916 . ↑ JE ホルムストロム (1948) 。 「セクション III. 開会全体会議」。王立協会科学情報会議、1948 年 6 月 21 日~ 7 月 2 日: 提出された報告書と論文 : 85。1 2 Brin, Sergey; Page, Lawrence (1998). "大規模ハイパーテキストWeb検索エンジンの構造" (PDF) . Computer Networks and ISDN Systems . 30 ( 1– 7): 107– 117. doi : 10.1016/S0169-7552(98)00110-X . 1 2 Uyar, Ahmet; Aliyu, Farouk Musa (2015-01-01). "Google Knowledge GraphとBing Satoriの検索機能の評価: エンティティタイプ、リスト検索、クエリインターフェース" . Online Information Review . 39 (2): 197– 213. doi : 10.1108/OIR-10-2014-0257 . ISSN 1468-4527 . 1 2 Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (2018). "BERT: 言語理解のための深層双方向トランスフォーマーの事前学習". arXiv : 1810.04805 [ cs.CL ]. ↑ Gardazi, Nadia Mushtaq; Daud, Ali; Malik, Muhammad Kamran; Bukhari, Amal; Alsahfi, Tariq; Alshemaimri, Bader (2025-03-15). "BERTの自然言語処理への応用:レビュー" . Artificial Intelligence Review . 58 (6): 166. doi : 10.1007/s10462-025-11162-5 . ISSN 1573-7462 . 1 2 Bajaj, Payal; Campos, Daniel; Craswell, Nick; Deng, Li; Gao, Jianfeng; Liu, Xiaodong; Majumder, Rangan; McNamara, Andrew; Mitra, Bhaskar; Nguyen, Tri; Rosenberg, Mir; Song, Xia; Stoica, Alina; Tiwary, Saurabh; Wang, Tong (2016). "MS MARCO: 人間が生成した機械読解データセット". arXiv : 1611.09268 [ cs.CL ]. ↑ Craswell, Nick; Mitra, Bhaskar; Yilmaz, Emine; Rahmani, Hossein A.; Campos, Daniel; Lin, Jimmy; Voorhees, Ellen M.; Soboroff, Ian (2024 年 2 月). "TREC 2023 ディープラーニングトラックの概要" . Text REtrieval Conference (TREC) – Microsoft 経由。 1 2 Kim, Dohyun; Zhao, Lina; Chung, Eric; Park, Eun-Jae (2021). "圧力に強いスタッガードDG法による一般メッシュ上のNavier-Stokes方程式の解法". arXiv : 2107.09226 [ math.NA ]. 1 2 Khattab, Omar; Zaharia, Matei (2020-07-25). "ColBERT: BERT 上での文脈化された遅延インタラクションによる効率的かつ効果的なパッセージ検索" . 第 43 回国際 ACM SIGIR 情報検索研究開発会議議事録 . SIGIR '20. ニューヨーク州ニューヨーク、米国: Association for Computing Machinery. pp. 39–48 . doi : 10.1145/3397271.3401075 . ISBN 978-1-4503-8016-4 。1 2 Lin, Jimmy; Nogueira, Rodrigo; Yates, Andrew (2020). "テキストランキングのための事前学習済みTransformer: BERTとその先". arXiv : 2010.06467 [ cs.IR ]. ↑ Shaw, Joseph A; Fox, Edward A. (1994) 複数検索の組み合わせ。TREC 1994: 105-108 ↑ Wu, Shengli (2012). Data Fusion in Information Retrieval . Springer. pp. 1–212 . ISBN 978-3-642-28865-4 。1 2 3 Thakur, Nandan; Reimers, Nils; Rücklé, Andreas; Srivastava, Abhishek; Gurevych, Iryna (2021). "BEIR: 情報検索モデルのゼロショット評価のための異種ベンチマーク". arXiv : 2104.08663 [ cs.IR ]. ↑ Lau, Jey Han; Armendariz, Carlos; Lappin, Shalom; Purver, Matthew; Shu, Chang (2020). Johnson, Mark; Roark, Brian; Nenkova, Ani (eds.). "How Furiously Can Colorless Green Ideas Sleep? Sentence Acceptability in Context" . Transactions of the Association for Computational Linguistics . 8 : 296– 310. doi : 10.1162/tacl_a_00315 . ↑ Arabzadeh, Negar; Yan, Xinyi; Clarke, Charles LA (2021). "Predicting Efficiency/Effectiveness Trade-offs for Dense vs. Sparse Retrieval Strategy Selection". arXiv : 2109.10739 [ cs.IR ]. ↑ Mooers, Calvin N. (1951). 非数値情報のデジタル処理の理論と機械経済学へのその影響 . Zator Technical Bulletin (技術報告). 48. Fairthorne, RA (1958). "Automatic Retrieval of Recorded Information" .The Computer Journal . 1 (1): 37. doi : 10.1093/comjnl/1.1.36 に引用。 ↑ ドイル、ローレン;ベッカー、ジョセフ(1975)。 情報検索と処理 。メルヴィル 。ISBN 978-0-471-22151-7 。↑ Perry, James W.; Kent, Allen; Berry, Madeline M. (1955). "機械文献検索 X. 機械語; その設計と開発の根底にある要因". American Documentation . 6 (4): 242– 254. doi : 10.1002/asi.5090060411 . ↑ Maron, Melvin E. (2008). "確率的インデックスの起源に関する歴史的注記" (PDF) . Information Processing and Management . 44 (2): 971– 2. doi : 10.1016/j.ipm.2007.02.012 . ↑ N. ジャーディン、CJ ファン ライスベルゲン (1971 年 12 月)。 「情報検索における階層的クラスタリングの使用」。 情報の保存と検索 。 7 (5): 217–240 。 土井 : 10.1016/0020-0271(71)90051-9 。 ↑ Doszkocs, TE; Rapp, BA (1979). "Searching MEDLINE in English: a Prototype User Interface with Natural Language Query, Ranked Output, and relevance feedback" . Information choices and policies : 42nd annual meeting, Minneapolis, Minnesota, October 14-18, 1979. American Society for Information Science. Vol. 16. Knowledge Industry Publications. pp. 131–9 . OCLC 271407392. OSTI 5047496 . ↑ Blair, DC; Maron, ME (1985). 「全文文書検索システムの検索有効性の評価」. Communications of the ACM . 28 (3): 289–299 . doi : 10.1145/3166.3197 . ↑ Dorsch JL、Faughnan JG、Humphreys BL (2022年6月)。 「Grateful Med: パーソナルコンピュータを持つ医療従事者のためのMEDLINEへの直接アクセス」 。Inf Serv Use。42 ( 2 ) : 151–160。doi : 10.3233 / ISU - 220147。PMC 9196098。PMID 35720429 。 ↑ コーファージ、ロバート R. (1997). 情報ストレージと検索 . ワイリー. 368 ページ . ISBN 978-0-471-14338-3 。↑ 「ウィキペディアの歴史」 、 ウィキペディア 、2025年2月21日、 2025年4月9日 取得 ↑ サリバン、ダニー (2013-09-26). 「FAQ: Googleの新しい「ハミングバード」アルゴリズムについて」 . Search Engine Land . 2025-04-09 に閲覧。 ↑ Khattab, Omar; Zaharia, Matei (2020). "ColBERT: BERT 上での文脈化された遅延インタラクションによる効率的かつ効果的なパッセージ検索". arXiv : 2004.12832 [ cs.IR ]. ↑ Jones, Rosie; Zamani, Hamed; Schedl, Markus; Chen, Ching-Wei; Reddy, Sravana; Clifton, Ann; Karlgren, Jussi; Hashemi, Helia; Pappu, Aasish; Nazari, Zahra; Yang, Longqi; Semerci, Oguz; Bouchard, Hugues; Carterette, Ben (2021-07-11). "ポッドキャスト情報アクセスにおける現在の課題と今後の方向性" . 第44回国際ACM SIGIR情報検索研究開発会議議事録 . SIGIR '21. ニューヨーク州ニューヨーク、米国: Association for Computing Machinery. pp. 1554–65 . arXiv : 2106.09227 . doi : 10.1145/3404835.3462805 . ISBN 978-1-4503-8037-9 。
さらに読む Baeza-Yates, Ricardo; Ribeiro-Neto, Berthier (2011).現代情報検索:検索の概念と技術 (第2 版). Addison-Wesley. ISBN 978-0-321-41691-9 。 Büttcher, Stefan; Clarke, Charles LA; Cormack, Gordon V. (2010).情報検索:検索エンジンの実装と評価 . MIT Press. ISBN 978-0-262-02651-2 OCLC 473652398 「情報検索システム」 .図書館情報科学ネットワーク . 2015年4月24日。2020年5月11日にオリジナルからアーカイブ済み。2020年5月3日 に取得。 マニング、クリストファー D.ラガヴァン、プラバーカール。シュッツェ、ハインリッヒ (2008)。情報検索の概要 。ケンブリッジ大学出版局。ISBN 978-0-521-86571-5 。 シンジョン・ヨ(2023)。 『検索ボックスの裏側:Googleと グローバルインターネット産業 』イリノイ大学出版局。ISBN 978-0-252-05417-4 。JSTOR jj.4116455。OCLC 1371410330。
外部リンク ACM SIGIR:情報検索特別関心グループ BCS IRSG:英国コンピュータ協会 – 情報検索専門家グループ テキスト検索会議(TREC) 情報検索評価フォーラム(FIRE) Information Retrieval (オンライン ブック) CJ van Rijsbergen著 情報検索Wiki(2015年11月24日時点の アーカイブ) 情報検索機能は、 2008年5月22日にWayback Machine に アーカイブされました。 TRECによる情報検索評価技術に関する報告書 eBayが検索関連性を測定する方法 アテナ研究センターの情報検索性能評価ツール