自然言語処理において、潜在的ディリクレ配分(LDA)は、テキスト文書の集合が、観測されていない一連の「トピック」によってどのように記述されるかを説明する生成統計モデルです。例えば、ニュース記事の集合が与えられた場合、LDAは、あるトピックは「大統領」「政府」「選挙」といった単語で特徴づけられ、別のトピックは「チーム」「試合」「スコア」といった単語で特徴づけられることを発見するかもしれません。これは最も一般的なトピックモデルの1つです。
LDAモデルは、2000年にJK Pritchard、M. Stephens、P. Donnellyによって集団遺伝学のグラフィカルモデルとして初めて発表されました。 [ 1 ]このモデルはその後、2003年にDavid Blei、Andrew Ng、Michael I. Jordanによって機械学習に適用されました。 [ 2 ]テキストコーパスのモデリングに最も頻繁に使用されていますが、臨床心理学、社会科学、計算音楽学などの他の問題にも使用されています。
LDA の基本的な前提は、文書が潜在トピックのランダムな混合として表現され、各トピックは単語の確率分布によって特徴付けられるというものです。このモデルは確率的潜在意味解析(pLSA) の一般化であり、主に LDA がトピックの混合をディリクレ事前分布として扱うことで、より妥当な混合が得られ、過学習の影響を受けにくくなるという点で異なります。コーパスから潜在トピックとその関連確率を学習するには、通常、ベイズ推論が用いられ、多くの場合、ギブスサンプリングや変分ベイズなどの手法が使用されます。
集団遺伝学の分野では、LDAは2000年にJK Pritchard、M. Stephens、P. Donnellyによって提案されました。[ 1 ] [ 3 ]
LDAは2003年にDavid Blei、Andrew Ng、Michael I. Jordanによって機械学習に適用されました。 [ 2 ]
集団遺伝学において、このモデルは個体群における構造化された遺伝的変異の存在を検出するために用いられる。このモデルは、研究対象個体が持つ対立遺伝子が、現存する、あるいは過去の様々な集団に由来すると仮定する。このモデルと様々な推論アルゴリズムを用いることで、科学者はこれらの起源集団における対立遺伝子頻度と、研究対象個体が持つ対立遺伝子の起源を推定することができる。起源集団は、事後的に様々な進化シナリオの観点から解釈することができる。関連研究において、遺伝的構造の存在を検出することは、交絡因子を回避するために必要な予備的ステップであると考えられている。
臨床心理学の研究では、LDAは若者が社会的な状況で経験する自己イメージの共通テーマを特定するために使用されてきました。[ 4 ]他の社会科学者は、ソーシャルメディア上の議論(処方薬に関するツイートなど)からのトピックデータの大規模なセットを分析するためにLDAを使用しています。[ 5 ]
さらに、共変量を用いた教師あり潜在ディリクレ配分(SLDAX)は、テキストで特定された潜在トピックを他の顕在変数と組み合わせるために特別に開発されました。このアプローチにより、テキストデータを統計的回帰分析の予測因子として統合することができ、メンタルヘルスの予測精度が向上します。従来の2段階アプローチに対するSLDAXの主な利点の1つは、バイアスのかかった推定値や不正確な標準誤差を回避できるため、心理学テキストのより正確な分析が可能になることです。[ 6 ] [ 7 ]
社会科学の分野では、LDAはソーシャルメディアの議論などの大規模データセットの分析に有用であることが証明されています。たとえば、研究者はLDAを使用して、処方薬の使用や中国の文化の違いなど、社会的に関連するトピックについて議論するツイートを調査しています。[ 8 ]これらの大規模なテキストコーパスを分析することで、見過ごされがちなパターンやテーマを明らかにすることができ、リアルタイムの公共の議論や認識に関する貴重な洞察が得られます。[ 9 ] [ 10 ]
機械学習におけるLDAの応用例の一つ、特に自然言語処理におけるサブ問題であるトピック発見は、文書コレクションからトピックを発見し、コレクション内の個々の文書を、発見された各トピックとの「関連性」に基づいて自動的に分類することです。トピックとは、共通のテーマを示唆する用語(つまり、個々の単語やフレーズ)の集合とみなされます。
例えば、ペット動物に関する文書コレクションでは、「犬」「スパニエル」「ビーグル」「ゴールデンレトリバー」「子犬」 「吠える」 「ワンワン」といった用語は「犬」関連のテーマを示唆し、「猫」「シャム猫」「メインクーン」「トラ猫」「マンクス」「ニャー」「ゴロゴロ」「子猫」といった用語は「猫」関連のテーマを示唆します。コレクションには、食事、グルーミング、健康管理、行動など、他にも多くのトピックが含まれている可能性がありますが、ここでは簡潔にするために触れません。(言語でよく使われる、いわゆるストップワード(例:「the」「an」「that」「are」「is」など)はトピックを区別しないため、LDAを実行する前に前処理で除外されるのが一般的です。また、前処理では用語を「語根」に変換します(例:「barks」「barking」「barked」は「bark」に変換されます)。)
文書コレクションが十分に大きい場合、LDAは個々の用語の共起に基づいてそのような用語セット(つまりトピック)を発見しますが、個々のトピックに意味のあるラベル(つまり、すべての用語がDOG_relatedである)を割り当てる作業はユーザー次第であり、多くの場合、専門知識が必要となります(たとえば、技術文書のコレクションの場合)。LDAアプローチは、次のことを前提としています。
LDA機械学習を用いる場合、両方の確率セットは、ベイズ法と期待値最大化アルゴリズムを用いて、トレーニング段階で計算されます。
LDAは、確率的潜在意味解析(pLSA)という古いアプローチの一般化です。pLSAモデルは、一様ディリクレ事前分布の下ではLDAと同等です。[ 12 ] pLSAは上記の最初の2つの仮定のみに依存し、残りは考慮しません。両方の方法は原理的には似ており、トレーニング開始前にユーザーが発見するトピックの数を指定する必要があります(k -meansクラスタリングと同様)。LDAはpLSAに比べて次のような利点があります。

確率的グラフィカルモデル(PGM)を表す際によく用いられるプレート表記法 では、多数の変数間の依存関係を簡潔に捉えることができます。ボックスは、繰り返し出現する要素を表す「プレート」です。外側のプレートは文書を表し、内側のプレートは特定の文書における繰り返し出現する単語の位置を表します。各位置は、トピックと単語の選択に関連付けられています。変数名は次のように定義されます。

Wがグレー表示されているということは、単語がは唯一の観測可能な変数であり、その他の変数は潜在変数です。元の論文[ 2 ]で提案されているように、トピック内の単語の確率分布は歪んでいるため、少数の単語のみが高い確率を持つという直感に従って、スパースなディリクレ事前分布を使用してトピック単語分布をモデル化できます。結果として得られるモデルは、今日最も広く適用されているLDAのバリアントです。このモデルのプレート表記は右側に示されており、はトピックの数を表し、はディリクレ分布に従うトピック単語分布のパラメータを格納する次元ベクトル((語彙に含まれる単語数)
によって表される実体を考えることは有益ですそしてモデル化される文書コーパスを表す元の文書-単語行列を分解して作成された行列として、行は文書によって定義され、列はトピックによって定義される。トピックによって定義される行と、単語によって定義される列で構成されます。したがって、 は、単語の分布を表す行またはベクトルの集合を指し、これは、各行がトピックの分布を表す一連の行を指します。
コーパス内のトピックを実際に推論するために、文書が生成される生成プロセスを想定することで、それを推論、つまりリバースエンジニアリングすることができます。生成プロセスは次のように想定されます。文書は潜在トピックのランダムな混合として表現され、各トピックはすべての単語の分布によって特徴付けられます。LDAは、コーパスに対して次の生成プロセスを想定から構成されるそれぞれ長さの文書:
1. 選択する、 どこそして は対称パラメータを持つディリクレ分布であるこれは通常まばらである()
2. 選択する、 どこそして通常はまばらである
3. 各単語の位置について、 どこ、 そして
(ここでいう多項分布とは、試行回数が1回のみの多項分布を指し、カテゴリカル分布とも呼ばれます。)
長さ他のすべてのデータ生成変数とは独立しているものとして扱われます(そして) 下付き文字は、ここに示した図のように省略されることが多い。
LDAの正式な説明は以下のとおりです。
すると、確率変数は数学的に次のように記述できる。
さまざまな分布(トピックの集合、それらに関連する単語の確率、各単語のトピック、および各文書の特定のトピックの組み合わせ)を学習することは、統計的推論の問題です。
Pritchard らによる元の論文[ 1 ]では、モンテカルロ シミュレーションによる事後分布の近似が用いられた。推論手法の代替案としては、ギブス サンプリングがある。[ 13 ]
ブロック緩和アルゴリズムによる尤度の直接最適化は、MCMC の高速な代替手段であることが証明されている。[ 14 ]
実際には、最適な集団数やトピック数は事前にわかっていません。可逆ジャンプマルコフ連鎖モンテカルロ法による事後分布の近似によって推定できます。[ 15 ]
近年の研究は、膨大な数の文書から大量のトピックを捉えることを支援するために、潜在的ディリクレ配分の推論を高速化することに焦点を当てています。前述の縮約ギブスサンプラーの更新式には、利用できる自然なスパース性があります。直感的に、各文書にはトピックのサブセットしか含まれていないため、また、単語はトピックのサブセットにのみ出現する。上記の更新式は、この疎性を利用するように書き換えることができる。[ 17 ]
この方程式には3つの項があり、そのうち2つは疎で、残りの1つは小さい。これらの項をそしてそれぞれ。ここで、各項をすべてのトピックにわたって合計することで正規化すると、次のようになります。
ここでは、これは文書に登場するトピックの要約です、 そしてまた、単語が扱うトピックの簡潔な要約でもある。コーパス全体にわたって割り当てられます。一方、は密ですが、の値が小さいため&その値は、他の2つの項に比べて非常に小さい。
さて、トピックをサンプリングする際に、ランダム変数を一様にサンプリングすると、サンプルがどのバケットに入るかを確認できます。小さいので、このバケツに陥る可能性は非常に低いですが、このバケツに陥った場合は、トピックのサンプリングには時間 (元の Collapsed Gibbs Sampler と同じ)。ただし、他の 2 つのバケットに該当する場合は、疎なトピックの記録を保持すれば、トピックのサブセットのみをチェックすれば済みます。トピックは、バケット時間、そしてトピックはバケット時間そしてそれぞれ、現在の文書および現在の単語タイプに割り当てられているトピックの数を示します。
各トピックをサンプリングした後、これらのバケットを更新するのはすべて基本的なことです。算術演算。
以下は、縮退ギブスサンプリングの式を導出したものである。sとsは積分消去されます。簡略化のため、この導出では文書はすべて同じ長さであると仮定します。文書の長さが異なる場合でも、この導出は同様に有効である。
このモデルによると、モデル全体の確率は次のとおりです。
ここで、太字の変数は変数のベクトルバージョンを表します。まず、そして統合から除外する必要がある。
すべてのは互いに独立しており、すべて同じです。s。だから私たちはそれぞれを扱うことができますそしてそれぞれ別々に。私たちは今、一部。
さらに、1つだけに焦点を当てることができます以下のように:
実際には、それはモデルの隠された部分です。文書。ここで、上記の式の確率を真の分布式に置き換えて、明示的な式を書き出します。
させて単語トークンの数同じ単語記号を持つ文書(語彙の中の単語)に割り当てられたトピック。それで、は3次元です。3次元のいずれかが特定の値に制限されていない場合は、括弧付きの点を使用します。示す。例えば、は、単語トークンの数を表します。割り当てられた文書トピック。したがって、上記の式の右端の部分は次のように書き換えることができます。
だから積分式は次のように変更できます。
積分内の式はディリクレ分布と同じ形式です。ディリクレ分布によれば、
したがって、
次に、部分。実際には、その部分はパート。ここでは導出の手順のみを列挙します。
分かりやすくするために、ここでは両方の式を含む最終的な方程式を書き出します。そして統合アウト:
ここでのギブスサンプリングの目的は、分布を近似することです。。 以来Z のいずれに対しても不変であり、ギブスサンプリング方程式は以下から導出できる。直接的に。重要な点は、以下の条件付き確率を導出することです。
どこは隠された変数単語トークン文書。さらに、その単語のシンボルは語彙の中の単語、つまり。すべてを表すs しかしギブスサンプリングでは、値をサンプリングする必要があるのは上記の確率によれば、正確な値は必要ない。
しかし、確率の比率は値をとることができます。したがって、上記の式は次のように簡略化できます。
最後に同じ意味であるしかし、除外。上記の式は、ガンマ関数の性質を利用してさらに簡略化できます。まず総和を分割し、次にそれを再び結合して、次の式を得ます。-独立した合計(省略可能):
なお、同じ式はディリクレ多項分布に関する記事でも導出されており、ベイジアンネットワークからディリクレ分布の事前分布を統合するというより一般的な議論の一部として用いられています。
トピックモデリングは、リンクトデータとセマンティックウェブ技術を使用した情報検索の問題に対する古典的な解決策です。 [ 18 ]関連するモデルと技術には、潜在意味インデックス、独立成分分析、確率的潜在意味インデックス、非負行列因子分解、ガンマ・ポアソン分布などがあります。
LDA モデルは高度にモジュール化されているため、簡単に拡張できます。主な関心分野は、トピック間の関係をモデル化することです。これは、ディリクレ分布の代わりに単体上の別の分布を使用することで実現されます。相関トピック モデル[ 19 ]はこのアプローチに従い、ディリクレ分布の代わりにロジスティック正規分布を使用することで、トピック間の相関構造を誘導します。もう 1 つの拡張は階層的 LDA (hLDA) [ 20 ]で、ネストされた中国料理店プロセスを使用してトピックを階層的に結合し、その構造はデータから学習されます。LDA は、LDA デュアル モデル[ 21 ]のように、文書に 2 種類の情報 (単語と名前など) が含まれるコーパスにも拡張できます。LDA のノンパラメトリック拡張には、トピックの数を無制限にしてデータから学習できる階層的ディリクレ プロセス混合モデルが含まれます。
前述のように、pLSAはLDAと類似しています。LDAモデルは基本的にpLSAモデルのベイズ版です。ベイズ法はデータへの過学習を回避できるため、ベイズ定式化は小規模データセットでより優れた性能を発揮する傾向があります。非常に大規模なデータセットでは、2つのモデルの結果は収束する傾向があります。1つの違いは、pLSAが変数を使用することです。トレーニングセット内の文書を表現するため。したがって、pLSA では、モデルが以前に見たことのない文書が提示された場合、固定します。トピックの下にある単語の確率は、トレーニングセットから学習されたものであり、同じEMアルゴリズムを使用して推論します。—トピック分布ブレイ氏は、この手順は実質的に新しいデータに合わせてモデルを再適合させることになるため、不正行為だと主張している。
進化生物学では、観察された個体の地理的位置がその祖先に関する情報をもたらすと考えるのが自然であることが多い。これは、地理参照遺伝子データのさまざまなモデルの根拠となっている。[ 15 ] [ 22 ]
LDAのバリエーションは、画像を文書として扱い、画像の小さな部分を単語として扱うことで、「寝室」や「森」などのカテゴリに自然画像を自動的に分類するために使用されてきました。[ 23 ]そのバリエーションの1つは、空間潜在ディリクレ配分と呼ばれています。[ 24 ]