確率論および統計学において、ディリクレ多項分布は、非負整数の有限台上の離散多変量確率分布の族です。これは、ディリクレ複合多項分布(DCM)または多変量ポリア分布(ジョージ・ポリアにちなんで)とも呼ばれます。これは複合確率分布であり、確率ベクトルpは、パラメータベクトルを持つディリクレ分布から抽出されます。、そして確率ベクトルpと試行回数nを持つ多項分布から抽出された観測値。ディリクレパラメータベクトルは状況に関する事前の信念を捉え、擬似カウントと見なすことができます。これは、実際のデータが収集される前に発生する各結果の観測値です。この合成は、ポリアの壺スキームに対応します。これは、ベイズ統計、機械学習、経験ベイズ法、および古典統計において、過分散多項分布として頻繁に登場します。
n = 1の場合には、カテゴリカル分布に帰着します。また、α が大きい場合には、多項分布を任意に良好に近似します。ディリクレ多項分布は、ベータ二項分布の多変量拡張です。多項分布とディリクレ分布は、それぞれ二項分布とベータ分布の多変量バージョンだからです。
ディリクレ分布は多項分布の共役分布です。この事実から、解析的に扱いやすい複合分布が得られます。カテゴリカウントのランダムベクトルの場合、多項分布に従って分布する場合、周辺分布は、ディリクレ分布に従うランダムベクトルと考えることができるpの分布を積分することによって得られます。
その結果、以下の明示的な式が得られる。
どこは合計として定義されるこの同じ複合分布をベータ関数Bを用いてより簡潔に表した別の形式は 次のとおりです。
後者の形式は、計算においてカウントがゼロのカテゴリを無視できることを強調しています。これは、カテゴリの数が非常に多く、かつ疎である場合(例えば、文書内の単語数など)に役立ちます。
pdfがベータ二項分布であることに注目してください。また、多項分布に近づくことも示せる。無限大に近づく。パラメータ多項分布に対する過分散またはバースト性の度合いを制御する。文献にはSとAが見られる。
ディリクレ多項分布は、ベクトルの正の整数値に対する壺モデルによっても説明できる。ポリアの壺モデルとして知られています。具体的には、ボールが入った壺を想像してください。色の番号付けi 番目の色については、ランダムにボールが引かれます。ボールがランダムに引かれて観察されると、同じ色のボールが 2 つ壺に戻されます。これが実行されると、 回数、そしてランダムベクトルを観測する確率色のカウントは、パラメータを持つディリクレ多項分布です。そしてランダム抽出が単純復元抽出(観察されたボール以外にボールを壺に追加しない)で行われる場合、分布は多項分布に従い、ランダム抽出が非復元抽出で行われる場合、分布は多変量超幾何分布に従います。
もう一度、そしてすると、n回の試行で結果iが観測される期待回数は
共分散行列は次のようになります。各対角要素はベータ二項分布に従う確率変数の分散であり、したがって
対角以外の要素は共分散です。
iとj は異なる。
すべての共分散は負の値になります。なぜなら、 nが固定されている場合、ディリクレ多項式ベクトルの1つの成分が増加すると、他の成分が減少する必要があるからです。
対応する相関行列の要素は次のとおりです。
この式ではサンプルサイズは省略されます。
k個の各成分はそれぞれベータ二項分布に従う。
ディリクレ多項分布のサポートは集合である。
その要素数は
行列表記では、
そして
p T = 列ベクトルpの行ベクトル転置とする。
パラメータこれは「クラス内相関」または「クラスター内相関」として知られています。この正の相関が、多項分布に対する過分散を引き起こす原因となります。
もし
次に、添え字iとjを持つ確率変数をベクトルから削除し、それらの合計に置き換えると、
この集計特性は、周辺分布を導出するために使用できます。。
概念的には、 K個のカテゴリを持つカテゴリ分布からN個の独立した抽出を行っています。これらの独立した抽出をランダムなカテゴリ変数として表現しましょう。のために特定のカテゴリが出現した回数を、見られた(すべてのカテゴリ変数の中で、 そしてすると、この問題については2つの異なる見解がある。
前者は個々の結果を指定する確率変数の集合であり、後者はK個のカテゴリそれぞれの結果の数を指定する変数である。両者の確率分布はそれぞれ異なるため、この区別は重要である。
カテゴリ分布のパラメータはどこ値を引く確率は ; 同様に、多項分布のパラメータでもある。指定する代わりに 直接的に、共役事前分布を与えると、パラメータベクトルを持つディリクレ分布から抽出されます。。
統合することですると、複合分布が得られます。ただし、分布の形状は、どの視点を取るかによって異なります。
カテゴリ変数については周辺同時分布は、積分によって得られる。:
その結果、以下の明示的な式が得られる。
どこはガンマ関数であり、
この式は各カテゴリ内の出現回数に対する確率ではなく、カテゴリ変数の系列の確率に関するものであるため、多項係数は含まれていないことに注意してください。
変数は上記の式には明示的には現れませんが、価値観。
特にギブスサンプリングの文脈で役立つもう1つの公式は、特定の変数の条件付き密度は何かという問いである。これは、他のすべての変数(これを次のように表す)を条件としている。)非常にシンプルな形式であることが判明しました。
どこカテゴリのカウント数を指定します以外のすべての変数で見られる。
この公式の導出方法を示すと役立つかもしれません。一般に、条件付き分布は対応する同時分布に比例するので、すべての同時分布の上記の公式から始めます。値を設定し、特定の値に依存しない要因を排除します。問題となっている。これを行うために、次の表記法を使用する。上記で定義したとおり、
また、
それから:
一般的に、条件付き分布の式を導出する際には、正規化定数について心配する必要はありません。正規化定数は、分布からのサンプリングアルゴリズムの一部として決定されます(カテゴリカル分布#サンプリングを参照)。ただし、条件付き分布を上記の単純な形式で記述すると、正規化定数も単純な形式になることがわかります。
したがって
この式は、極限を取ることによって得られる中国料理店のプロセスと密接に関連しています。。
より大きなベイジアンネットワークにおいて、カテゴリカル分布(またはいわゆる「多項分布」)がディリクレ分布の事前分布とともにネットワークの一部として存在する場合、ディリクレ事前分布に依存するノードがカテゴリカル分布のみである限り、すべてのディリクレ事前分布を統合することができます。統合は、各ディリクレ分布ノードごとに他のノードとは独立して行われ、カテゴリカル分布に依存する可能性のある他のノードの有無に関わらず行われます。また、カテゴリカル分布がディリクレ事前分布以外のノードに依存しているかどうかにも関わらず行われます(ただし、その場合、他のノードは追加の条件付け因子として残しておく必要があります)。基本的に、特定のディリクレ分布ノードに依存するすべてのカテゴリカル分布は、上記の式で定義される単一のディリクレ多項分布に統合されます。このように定義された統合分布は、統合されたディリクレ事前分布ノードの親ノード、およびディリクレ事前分布ノード以外のカテゴリカルノードの親ノードに依存します。
以下のセクションでは、ベイジアンネットワークでよく見られるさまざまな構成について説明します。上記の確率密度を繰り返し、記号を用いて定義します。:
次のような階層モデルを想像してみてください。
このような場合、複数のディリクレ事前分布が存在し、それぞれが一定数のカテゴリカル観測値を生成します(事前分布ごとに異なる数になる場合もあります)。それらがすべて同じ超事前分布に依存しているという事実は、たとえそれが上記のように確率変数であっても、何ら違いを生みません。ディリクレ事前分布を積分消去すると、その事前分布に付随するカテゴリカル変数がリンクされ、それらの同時分布はディリクレ事前分布の条件付け要因をそのまま継承します。複数の事前分布が超事前分布を共有しているという事実は、何ら違いを生みません。
どここれは、事前のdに依存するカテゴリ変数の集合です。
したがって、条件付き確率分布は次のように表すことができます。
どこ具体的には、セット内の変数の数を意味します(除く)それ自体が価値を持つ。
対象となる変数と同じ事前分布を持つことで関連付けられている、値kを持つ変数のみを数える必要があります。値kを持つ他の変数は数える必要はありません。
では、もう少し複雑な階層モデルを以下のように想像してみましょう。
このモデルは上記と同じですが、さらに各カテゴリ変数にはそれに依存する子変数があります。これは混合モデルの典型的な特徴です。
繰り返しになりますが、同時分布では、同じ事前分布に依存するカテゴリ変数のみが単一のディリクレ多項分布にリンクされます。
親と祖先のみに依存するカテゴリ変数の条件付き分布は、より単純なケースでは上記と同じ形式になります。しかし、ギブスサンプリングでは、特定のノードの条件付き分布を決定する必要があります。依存しているのはそして、次のような祖先しかし、他のすべてのパラメータについては。
条件付き分布の簡略化された式は、上記で示した同時確率の式を書き換えて定数項を取り除くことで簡単に導出できます。したがって、このモデルのように、ディリクレ多項分布の密度関数と、カテゴリ変数の値に依存する他の多くの確率変数の係数から構成される、より大規模な同時確率の式にも、同様の簡略化を適用できます。
これにより、以下の結果が得られます。
ここで確率密度は直接表示されます。我々は、すべてのK の可能性について正規化されていない確率を計算する。上記の式を用いて正規化し、カテゴリ分布に関する記事で説明されているアルゴリズムに従って通常どおり処理を進めてください。
厳密に言えば、条件付き分布に現れる追加要素は、モデル仕様からではなく、結合分布から直接導出されます。この区別は、ディリクレ事前分布を持つ親ノードが複数の子ノードに依存するモデル、特にそれらの子ノードが互いに依存している場合(例えば、親ノードが共通で、その親ノードが縮約されている場合)に重要となります。これについては後述します。
ここで、以下のような階層モデルを想像してみましょう。
ここでは、以前と同様に複数のディリクレ事前分布と従属カテゴリ変数のセットが存在するものの、事前分布と従属変数の関係が以前とは異なり固定されていないという、やや厄介な状況が生じます。代わりに、どの事前分布を使用するかの選択は、別のランダムなカテゴリ変数に依存します。これは、例えばトピックモデルで発生し、実際、上記の変数名は潜在ディリクレ配分における変数名に対応するように意図されています。この場合、セットはは単語のセットであり、それぞれの単語は可能なトピック、各トピックは語彙に対するディリクレ事前分布であるトピック内の様々な単語の出現頻度を示す可能性のある単語。ただし、特定の単語のトピックへの所属は固定されておらず、むしろ一連の潜在変数から決定される。単語ごとに潜在変数が1つあります。単語が属するトピックを指定する、n次元のカテゴリ変数。
この場合、与えられた事前分布に依存するすべての変数は、以前と同様にグループ内で結び付けられ(つまり相関し)、具体的には、特定のトピックに属するすべての単語がリンクされます。ただし、この場合、グループのメンバーシップは変化し、単語は特定のトピックに固定されるのではなく、トピックは単語に関連付けられた潜在変数の値に依存します。しかし、ディリクレ多項分布の密度の定義は、実際にはグループ内のカテゴリ変数の数(つまり、特定のトピックから生成された文書内の単語の数)には依存せず、グループ内の変数のうち特定の値を持つ変数の数(つまり、特定のトピックから生成されたすべての単語トークンのうち、特定の単語がいくつあるか)にのみ依存します。したがって、結合分布の明示的な式を記述することができます。
ここでは、表記法を使用します。単語記号vの値が与えられ、トピックkに属する単語トークンの数を表す。
条件付き分布は依然として同じ形式です。
ここでも、特定のトピックに属する単語のカテゴリ変数のみがリンクされています(ただし、このリンクは潜在変数の割り当てに依存します)。したがって、単語数は特定のトピックによって生成された単語のみを対象としればよいのです。したがって、この記号はこれは、単語記号vを持つ単語トークンの数ですが、トピックkによって生成されたもののみを対象とし、分布が記述されている単語自体は除外されます。
(単語自体を除外する必要がある理由、そしてそもそも除外することが意味を持つ理由は、ギブスサンプリングの文脈では、すべての以前の変数をサンプリングした後、各確率変数の値を繰り返し再サンプリングするからです。したがって、変数は既に値を持っているため、使用するさまざまなカウントからこの既存の値を除外する必要があります。)
ここでは、上記のシナリオのいくつかを組み合わせて、現実世界のモデル、具体的には平滑化された潜在的ディリクレ配分(LDA)トピックモデルをギブスサンプリングする方法を示します。
モデルは以下のとおりです。
基本的に、これまでの3つのシナリオを組み合わせます。すなわち、ハイパー事前分布を共有する複数の事前分布に依存するカテゴリ変数、依存する子変数(潜在変数トピックの識別子)を持つカテゴリ変数、そしてハイパー事前分布を共有する複数の事前分布への所属が変化するカテゴリ変数です。標準的なLDAモデルでは、単語は完全に観測されるため、再サンプリングする必要はありません。(ただし、単語の一部または全部が観測されない場合でも、ギブスサンプリングは同様に可能です。そのような場合、結果として得られる事後潜在変数分布が意味をなすように、例えば機械翻訳モデルのような文を生成するプロセスの出力から、単語の分布を何らかの妥当な方法で初期化する必要があります。)
上記の公式を用いると、条件付き確率を直接書き出すことができます。
ここでは、単語数とトピック数を明確に区別するために、カウントをより具体的に定義しました。
上記のように、従属子を持つカテゴリ変数の場合と同様に、これらの従属子の条件付き確率は、親の条件付き確率の定義に現れます。この場合、各潜在変数には従属子となる単語が1つしかないため、そのような項は1つだけ現れます。(従属子が複数ある場合は、異なる親と同一の子の間に重複があるかどうか、つまり、ある親の従属子が他の親も持っているかどうかに関わらず、すべての従属子が親の条件付き確率に現れる必要があります。子が複数の親を持つ場合、その子の条件付き確率は、それぞれの親の条件付き確率の定義に現れます。)
上記の定義では、単語の正規化されていない条件付き確率のみが指定されていますが、トピックの条件付き確率には実際の(つまり正規化された)確率が必要です。したがって、すべての単語記号について合計することで正規化する必要があります。
どこ
また、条件付き確率の上記の2番目の要素に関するもう1つの点を詳しく述べておく価値があります。条件付き分布は一般に同時分布から導出され、条件付き分布の定義域(縦棒の左側の部分)に依存しない項を削除することによって単純化されることを覚えておいてください。ノードが扶養家族がいる場合、1つ以上の要因が存在します結合分布において依存するもの通常、 各依存ノードには 1 つの因子があり、その因子は数学的定義に現れる分布と同じ密度関数を持ちます。ただし、依存ノードに別の親 (共親) も存在し、その共親が縮約されると、そのノードはその共親を共有する他のすべてのノードに依存するようになり、そのようなノードごとに複数の項の代わりに、結合分布には 1 つの結合項のみが含まれます。ここではまさにその状況です。子供は一人だけその子には、私たちが縮約したディリクレ共同親子関係があり、それがノードの集合全体にわたってディリクレ多項式を誘導します。。
この場合、この問題が大きな問題を引き起こさないのは、まさに次の1対1の関係によるものです。そして結合分布は次のように書き換えることができます。
セット内の(つまりノードの集合)除外)、どのノードも親として。したがって、条件付け要因として排除することができ(2行目)、つまり、条件付き分布から要因全体を排除することができます(3行目)。
ここに、異なる課題を抱えた別のモデルを示します。これは、文書クラスタリングのための教師なしナイーブベイズモデルの実装です。つまり、テキストの内容に基づいて、文書を複数のカテゴリ(例えば、「スパム」または「非スパム」、「学術論文」、「金融に関する新聞記事」、「政治に関する新聞記事」、「ラブレター」など)に分類したいと考えています。ただし、どの文書についても正しいカテゴリは事前に分かっていません。代わりに、相互の類似性に基づいてクラスタリングを行います。(例えば、一連の学術論文は単語の使い方が互いに似ている傾向がありますが、一連のラブレターとは大きく異なります。)これは教師なし学習の一種です。(同じ手法は、半教師あり学習にも使用できます。つまり、文書の一部について正しいカテゴリが分かっており、その知識を利用して残りの文書をクラスタリングする場合です。)
モデルは以下のとおりです。
多くの点で、このモデルは上述のLDAトピックモデルと非常によく似ていますが、単語ごとに1つのトピックではなく、文書ごとに1つのトピックを想定しており、文書は複数のトピックの混合から構成されています。これは上記のモデルを見れば明らかで、潜在変数が単語ごとではなく文書ごとに1つだけである点を除けば、LDAモデルと同一です。ここでも、すべてのディリクレ事前分布を統合することを前提としています。
特定の単語の条件付き確率は、LDA の場合とほぼ同じです。ここでも、同じディリクレ事前分布によって生成されたすべての単語は相互に依存しています。この場合、これは特定のラベルを持つすべての文書の単語を意味します。これもラベルの割り当てによって異なる場合がありますが、ここでは合計カウントのみに関心があります。したがって、次のようになります。
どこ
しかし、ラベル割り当ての潜在変数の条件付き分布には重要な違いがあります。それは、特定のラベル変数が1つではなく複数の子ノードを持つということです。具体的には、ラベルの文書内のすべての単語に対応するノードです。これは、上記の因子に関する議論と密接に関連しています。これは結合分布から生じる。この場合、結合分布は、値と等しいラベル割り当てを含むすべての文書のすべての単語について取得する必要がある。、そしてディリクレ多項分布の値をとります。さらに、この同時分布を単一の単語に対する条件付き分布に縮小することはできません。むしろ、問題のラベルの文書内の単語に対するより小さな同時条件付き分布に縮小することしかできず、したがって、期待カウントと事前確率の単純な和が得られる上記のトリックを使用してこれを単純化することはできません。実際には、このような個々の和の積として書き直すことは可能ですが、因子の数が非常に多く、ディリクレ多項分布の確率を直接計算するよりも明らかに効率的ではありません。
ディリクレ多項分布の1次元版は、ベータ二項分布として知られています。
ディリクレ多項分布は、自動文書分類およびクラスタリング、遺伝学、経済学、戦闘モデリング、定量的マーケティングなどの分野で利用されている。