Loading article…
確率的関連性モデル[ 1] [2]は、将来の確率モデルのフレームワークとしてStephen E. RobertsonとKaren Spärck Jonesによって考案されました。これは、検索エンジンや Web検索エンジンが検索クエリとの関連性に応じて一致する文書をランク付けするために使用するランキング関数を導出するのに役立つ情報検索の形式です。
これは、ドキュメントd jがクエリqに関連する確率を推定する理論モデルです。このモデルでは、この関連性の確率はクエリとドキュメントの表現によって決まると想定しています。さらに、すべてのドキュメントのうち、クエリqの回答セットとしてユーザーが好む部分があると想定しています。このような理想的な回答セットはRと呼ばれ、そのユーザーに対する全体的な関連性の確率を最大化する必要があります。このセットR内のドキュメントはクエリに関連し、セットに存在しないドキュメントは関連しない という予測です。
関連モデル
このフレームワークには、さらなる開発で対処する必要があるいくつかの制限があります。
- 初回の確率を正確に推定することはできない
- 索引用語は重み付けされていない
- 用語は相互に独立しているとみなされる
これらの懸念やその他の懸念に対処するために、確率的関連性フレームワークから他のモデルが開発されてきました。その中には、同じ著者によるバイナリ独立モデルがあります。このフレームワークの最もよく知られている派生モデルは、Okapi (BM25)重み付けスキームとそのマルチフィールド改良版である BM25F です。
