コンピューティングと情報科学において、バイナリ独立モデル(BIM)[ 1 ] [ 2 ] は確率的情報検索技術である。このモデルは、文書/クエリの類似性の推定を確率的かつ実現可能にするために、いくつかの単純な仮定を置いている。
二項独立性の仮定は、文書が二項ベクトルであることを示しています。つまり、文書に用語が存在するか存在しないかのみが記録されます。用語は、関連する文書のセット内で独立して分布し、無関係な文書のセット内でも独立して分布します。表現は、ブール変数の順序付きセットです。つまり、文書またはクエリの表現は、検討対象の各用語に対して 1 つのブール要素を持つベクトルです。より具体的には、文書はベクトルd = ( x 1 , ..., x m )で表され、用語t が文書dに存在する場合はx t =1 、存在しない場合はx t =0となります。この簡略化により、多くの文書が同じベクトル表現を持つことができます。クエリも同様の方法で表現されます。「独立性」とは、文書内の用語が互いに独立して考慮され、用語間の関連性はモデル化されないことを意味します。この仮定は非常に制限的ですが、多くの状況で十分な結果が得られることが示されています。この独立性は、ナイーブベイズ分類器の「素朴な」仮定であり、互いに意味をなす特性であっても、簡略化のために独立したものとして扱われます。この仮定により、各項を他の項に使用される次元と直交する次元に沿った0または1の値として扱うことで、表現をベクトル空間モデルのインスタンスとして扱うことができます。
確率文書が関連性があるかどうかは、その文書の用語ベクトルの関連性の確率から導き出される。ベイズの定理を用いると、次のようになります。
どこそしてはそれぞれ、関連文書または非関連文書を取得する確率です。該当する場合、その文書の表現はxとなります。正確な確率は事前に知ることはできないため、文書コレクションに関する統計情報から推定値を使用する必要があります。
そしてクエリqに対して、それぞれ関連文書または非関連文書を取得する以前の確率を示します。たとえば、コレクション内の関連文書の割合がわかっている場合、それを使用してこれらの確率を推定できます。文書はクエリに対して関連しているか非関連であるかのどちらかであるため、次のようになります。
バイナリクエリと、ドキュメントとクエリ間の類似度関数としてのドット積が与えられた場合、問題は、検索効率が高くなるようにクエリ内の用語に重みを割り当てることです。そしては、それぞれ関連文書と無関係文書がi番目の項を持つ確率とする。BIM を最初に導入した Yu とSalton [ 1 ]は、i番目の項の重みが増加関数であると提案している。したがって、より高い用語iの重みは用語jの重みよりも高くなります。 Yu と Salton [ 1 ]は、クエリ用語にこのような重みを割り当てると、クエリ用語に均等に重みが付けられている場合よりも優れた検索効果が得られることを示しました。RobertsonとSpärck Jones [ 2 ]は後に、i番目の用語に重みが割り当てられると、すると、二項独立性の仮定の下で最適な検索効率が得られる。
二項独立モデルは、YuとSaltonによって導入されました。[ 1 ]二項独立モデルという用語は、RobertsonとSpärck Jonesによって造語されました[ 2 ]。彼らは、確率的関連性モデルの対数オッズ確率を使用して、ここで、対数オッズ確率は関連性の確率とランク等価であることが示されています(つまり、)Lukによる[ 3 ]確率順位原理に従う。[ 4 ]