Loading article…
トピックベースベクトル空間モデル(TVSM)[ 1 ](文献:)は、用語ベクトルが直交するという制約を取り除くことで、情報検索のベクトル空間モデルを拡張します。直交する用語という仮定は自然言語においては誤りであり、同義語や強い関連用語で問題が生じます。これにより、TVSM ではストップワード リスト、ステミング、シソーラスの使用が容易になります。一般化されたベクトル空間モデルとは対照的に、 TVSM は用語間の同時発生に基づく類似性に依存しません。
TVSM の基本的な前提は、軸の切片がすべて正であるd次元空間Rの存在です。つまり、 R は R +に、d は N +に含まれます。R の各次元は、基本的なトピックを表します。用語ベクトルt は、特定のRに対して特定の重みを持ちます。これらの重みを計算するために、文書の内容を考慮した仮定が立てられます。理想的には、重要な用語は高い重みを持ち、ストップワードやトピックに関係のない用語は低い重みを持ちます。TVSM 文書モデルは、文書内の用語を表す用語ベクトルの合計として得られます。2 つの文書DiとDjの類似性は、文書ベクトルのスカラー積として定義されます。
拡張トピックベースベクトル空間モデル (eTVSM) [ 2 ] (文献:)は、オントロジーから用語ベクトルを導出する方法に関する提案です。WordNet Kuropkaから作成された同義語オントロジーを使用すると、文書類似性に関して良好な結果が得られます。単純なオントロジーを使用した場合、結果はベクトル空間モデルと同様になります。