確率的潜在意味解析(PLSA)は、確率的潜在意味インデックス(PLSI、特に情報検索分野では)とも呼ばれ、2モードデータや共起データの分析に用いられる統計的手法です。実際、PLSAの起源となった潜在意味解析と同様に、観測変数と特定の隠れ変数との類似性に基づいて、低次元の表現を導き出すことができます。
線形代数から派生し、出現テーブルを縮小する(通常は特異値分解による)標準的な潜在意味解析と比較して、確率的潜在意味解析は潜在クラスモデルから導出された混合分解に基づいています。

共起という形で観測結果を考慮する単語や文書の場合、PLSAは各共起の確率を条件付き独立多項分布の混合としてモデル化します。
とは単語のトピックである。トピックの数は事前に選択する必要のあるハイパーパラメータであり、データから推定されるものではないことに注意する。最初の定式化は対称定式化であり、そしてどちらも潜在クラスから生成される同様の方法で(条件付き確率を使用して)そして)、一方、2番目の定式化は非対称定式化であり、各文書について、潜在クラスは、文書に応じて条件付きで選択されます。そして、そのクラスから単語が生成されます。この例では単語と文書を使用しましたが、任意の2つの離散変数の同時発生も全く同じ方法でモデル化できます。
したがって、パラメータの数はパラメータの数は文書数に比例して増加します。また、PLSAは推定対象となる文書コレクション内の文書の生成モデルではありますが、新しい文書の生成モデルではありません。
それらのパラメータはEMアルゴリズムを用いて学習される。
PLSAは、フィッシャーカーネルを介して識別的な設定で使用できます。[ 1 ]
PLSAは、情報検索とフィルタリング、自然言語処理、テキストからの機械学習、バイオインフォマティクス[ 2 ]および関連分野に応用されています。
確率的潜在意味解析で使用されるアスペクトモデルには、深刻な過学習の問題があることが報告されている。[ 3 ]
これは潜在クラスモデルの一例であり(参考文献を参照)、非負行列因子分解[ 6 ] [ 7 ] に関連している。現在の用語は1999年にトーマス・ホフマンによって造語された。[ 8 ]