情報科学と情報検索において、関連性は、検索された文書または文書セットがユーザーの情報ニーズをどの程度満たしているかを示します。関連性には、結果の適時性、権威、新規性などの考慮事項が含まれる場合があります。
歴史
関連情報を見つける問題への関心は、少なくとも 17 世紀に科学雑誌が初めて出版されたときまで遡ります。[引用が必要]
関連性の正式な研究は、20 世紀に、後に計量書誌学と呼ばれる研究から始まりました。1930 年代と 1940 年代に、SC ブラッドフォードは、主題に関連する記事を特徴付けるために「関連性のある」という用語を使用しました (ブラッドフォードの法則を参照)。1950 年代に最初の情報検索システムが登場し、研究者は関連性のない記事の検索が重要な問題であると認識しました。1958 年、BC ヴィッカリーは、国際科学情報会議での演説で関連性の概念を明確にしました。[1]
1958年以来、情報科学者は関連性の定義を探求し、議論してきました。議論の焦点となったのは、「主題への関連性」または「トピックの関連性」と「ユーザーの関連性」の区別でした。[1]
評価
情報検索コミュニティは、1960年代初頭のクランフィールド実験から始まり、情報検索研究の主な評価フレームワークとして今日まで続いているTREC評価に至るまで、トピックの関連性を測定するためのテストコレクションとベンチマークタスクの使用を重視してきました。 [2]
情報検索システムがトピックに関連する結果をどれだけうまく検索したかを評価するには、検索された結果の関連性を定量化する必要があります。クランフィールド スタイルの評価では、通常、検索された各結果に関連性レベルを割り当てます。このプロセスは関連性評価と呼ばれます。関連性レベルは、バイナリ (結果が関連しているかどうかを示す) または等級 (結果のトピックと情報ニーズの一致度が一定でないことを示す) のいずれかになります。検索された結果に関連性レベルが割り当てられると、情報検索パフォーマンス測定を使用して検索システムの出力の品質を評価できます。
情報科学コミュニティは、トピックの関連性のみに焦点を当てるのとは対照的に、ユーザーの関連性を考慮したユーザー研究を重視してきました。[3]これらの研究は、多くの場合、人間とコンピュータの相互作用の側面に焦点を当てています(人間とコンピュータの情報検索も参照)。
クラスタリングと関連性
1979年にCJ van Rijsbergenによって提唱されたクラスター仮説は、互いに類似した2つの文書は、同じ情報ニーズに関連する可能性が高いと主張しています。埋め込み類似性空間に関しては、クラスター仮説はグローバルまたはローカルに解釈できます。[4] グローバル解釈では、文書間の類似性から派生した基礎となるトピックの固定セットが存在すると想定しています。これらのグローバルクラスターまたはその代表を使用して、2つの文書の関連性を関連付けることができます(たとえば、同じクラスター内の2つの文書は、どちらも同じ要求に関連している必要があります)。この精神に基づく方法には次のものがあります。
- クラスターベースの情報検索[5] [6]
- 潜在的意味解析やそれに相当する言語モデリングなどのクラスターベースの文書拡張。 [7] クラスターが(単独または組み合わせのいずれであっても)関連する可能性のある文書のセットを正常にモデル化できるようにすることが重要です。
2番目の解釈は、エレン・ボーヒーズ[8]によって最も顕著に提唱され 、文書間のローカルな関係に焦点を当てています。ローカルな解釈は、コレクション内のクラスターの数やサイズをモデル化する必要がなくなり、複数のスケールでの関連性を可能にします。この精神に基づく方法には次のものがあります。
- 多重クラスター検索[6] [8]
- 活性化拡散法[9]と関連性伝播法[10]
- ローカルドキュメントの拡張[11]
- スコア正規化[12]
ローカル メソッドには、正確で適切なドキュメント類似性の測定が必要です。
問題と代替案
最も関連性の高い文書は、必ずしも検索結果の最初のページに表示するのに最も役立つ文書とは限りません。たとえば、重複する 2 つの文書は、個別にはかなり関連していると見なされるかもしれませんが、そのうちの 1 つを表示することだけが役立ちます。この欠点に対処するために、「最大限界関連度」(MMR) と呼ばれる尺度が提案されています。これは、以前の結果に基づいて各文書がもたらす新しい情報の量という観点からのみ、各文書の関連性を考慮します。[13]
場合によっては、クエリの解釈が曖昧であったり、さまざまな応答が考えられたりすることもあります。結果セットの有用性を評価する際には、結果の多様性を提供することが考慮されることがあります。[14]
参照
参考文献
- ^ ab Mizzaro, Stefano (1997). 「関連性: 歴史全体」(PDF) .アメリカ情報科学協会誌. 48 (9): 810–832. doi :10.1002/(SICI)1097-4571(199709)48:9<810::AID-ASI6>3.0.CO;2-U.
- ^ Sanderson, P. Clough, M. (2013-06-15). 「テストコレクションを使用した情報検索システムのパフォーマンスの評価」informationr.net . 2020-05-28閲覧。
{{cite web}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ Yunjie, Xu (2006). 「関連性の判断: 情報ユーザーは話題性以外に何を考慮するのか?」アメリカ情報科学技術学会誌. 57 (7): 961–973. doi :10.1002/asi.20361.
- ^ F. Diaz、「クエリベースの検索スコアの自己相関と正規化」。博士論文、マサチューセッツ大学アマースト校、マサチューセッツ州アマースト、2008 年 2 月、第 3 章。
- ^ Croft, W.Bruce (1980). 「分類に基づくクラスター検索モデル」.情報システム. 5 (3): 189–195. doi :10.1016/0306-4379(80)90010-1.
- ^ ab Griffiths, Alan; Luckhurst, H. Claire; Willett, Peter (1986). 「文書検索システムにおける文書間類似性情報の使用」(PDF) . Journal of the American Society for Information Science . 37 : 3–11. doi :10.1002/(SICI)1097-4571(198601)37:1<3::AID-ASI1>3.0.CO;2-O.
- ^ X. Liu および WB Croft、「言語モデルを使用したクラスターベースの検索」、SIGIR '04: 情報検索の研究開発に関する第 27 回国際会議の議事録、(ニューヨーク、ニューヨーク、米国)、pp. 186–193、ACM Press、2004 年。
- ^ ab EM Voorhees、「クラスター仮説の再考」、SIGIR '85: 情報検索の研究開発に関する第8回国際ACM SIGIR会議の議事録、(ニューヨーク、ニューヨーク、米国)、pp. 188–196、ACM Press、1985年。
- ^ S. Preece、「情報検索のための拡散活性化ネットワークモデル」、イリノイ大学アーバナシャンペーン校博士論文、1981 年。
- ^ T. Qin、T.-Y. Liu、X.-D. Zhang、Z. Chen、および W.-Y. Ma、「Web 検索の関連性伝播の研究」、SIGIR '05: 情報検索の研究開発に関する第 28 回国際 ACM SIGIR 会議の議事録、(ニューヨーク、ニューヨーク、米国)、pp. 408–415、ACM Press、2005 年。
- ^ A. Singhal および F. Pereira、「音声検索のためのドキュメント拡張」、SIGIR '99: 情報検索の研究開発に関する第 22 回国際 ACM SIGIR 会議の議事録、(ニューヨーク、ニューヨーク、米国)、pp. 34–41、ACM Press、1999 年。
- ^ Qin, Tao; Liu, Tie-Yan; Zhang, Xu-Dong; Chen, Zheng; Ma, Wei-Ying (2005). 「Web 検索における関連性の伝播に関する研究」( PDF)。情報検索の研究開発に関する第 28 回国際 ACM SIGIR カンファレンスの議事録。p. 408。doi : 10.1145 /1076034.1076105。ISBN 1595930345. S2CID 15310025。
- ^ Carbonell, Jaime; Goldstein, Jade (1998). 「MMR の使用、多様性に基づく再ランキングによる文書の並べ替えと要約の作成」。情報検索における研究開発に関する第 21 回国際 ACM SIGIR カンファレンスの議事録。pp . 335–336。CiteSeerX 10.1.1.50.2490。doi : 10.1145 / 290941.291025。ISBN 978-1581130157. S2CID 6334682。
- ^ 「文書検索の多様性 (DDR) 2012」。
さらに読む
- Hjørland, Birger (2010). 「関連性の概念の基礎」(PDF) .アメリカ情報科学技術学会誌. 61 (2): 217–237. doi :10.1002/asi.21261.
- 関連性:コミュニケーションと認知。ダン・スパーバー、ディアドラ・ウィルソン著。第2版。オックスフォード、マサチューセッツ州ケンブリッジ:ブラックウェル出版社、2001年。ISBN 978-0-631-19878-9
- Saracevic, Tefko (1975). 「関連性: 情報科学における概念に関する考察と思考の枠組み」(PDF) .アメリカ情報科学協会誌. 26 (6): 321–343. doi :10.1002/asi.4630260604.
- Saracevic, Tefko (2007)。「関連性: 情報科学における概念を考えるための文献レビューとフレームワーク。パート II: 関連性の性質と現れ方」( PDF )。アメリカ情報科学技術協会誌。58 (13): 1915–1933。doi :10.1002/asi.20682。2008-02-21にオリジナル(PDF)からアーカイブ。
- Saracevic, Tefko (2007)。「関連性: 情報科学における概念に関する文献のレビューと思考の枠組み。パート III: 関連性の行動と影響」( PDF )。アメリカ情報科学技術協会誌。58 (13): 2126–2144。doi :10.1002/asi.20681。2008-02-21にオリジナル(PDF)からアーカイブ。
- Saracevic, T. (2007)。情報科学における関連性。テネシー大学情報科学学部でのトムソンサイエンティフィック ラゼロウ記念年次講演会招待講演。2007 年 9 月 19 日。(ビデオ)
- 情報検索入門: 評価。スタンフォード。(PDF でのプレゼンテーション)
