Loading article…
用語差別化とは、情報検索においてキーワードがどれほど有用であるかをランク付けする方法である。
これはtf-idfに似た手法ですが、情報検索に適したキーワードとそうでないキーワードを区別することを目的としています。まずはベクトル空間モデルを参照してください。
この方法は、ベクトル空間密度の概念を利用しており、出現行列の密度が低いほど、情報検索クエリの精度が向上するというものです。
最適なインデックス用語とは、2つの異なる文書を区別し、2つの類似した文書を関連付けることができる用語である。一方、最適とは言えないインデックス用語は、2つの異なる文書と2つの類似した文書を区別することができない。
識別値とは、出現行列のベクトル空間密度と、インデックス項を含まない同じ行列のベクトル空間密度との差のことである。
させて: 発生行列とする インデックス項を除いた出現行列とする そして密度。 それから: 指標項の識別値は:
発生行列が与えられた場合:そしてキーワードが1つ:
値が高いほど良い。なぜなら、キーワードを含めることで、より良い情報検索が可能になるからだ。
出現頻度の低いキーワードは再現率が低いため識別力が低いはずであり、出現頻度 の高いキーワードは精度が低いため識別力が低いはずである。