数学的導出
KLダイバージェンス 最も一般的な変分ベイズ法では、非類似度関数としてQ とPの Kullback–Leiblerダイバージェンス (KLダイバージェンス)が用いられます。この選択により、この最小化問題が扱いやすくなります。KLダイバージェンスは次のように定義されます。
D K L ( Q ∥ P ) ≜ ∑ Z Q ( Z ) ログ Q ( Z ) P ( Z ∣ X ) 。 {\displaystyle D_{\mathrm {KL} }(Q\Parallel P)\triangleq \sum _{\mathbf {Z} }Q(\mathbf {Z} )\log {\frac {Q(\mathbf {Z} )}{P(\mathbf {Z} \mid \mathbf {X} )}} Q とPが 予想とは逆になっていることに注意してください。この逆KLダイバージェンスの使用法は、概念的には期待値最大化アルゴリズム と類似しています。(KLダイバージェンスを逆方向に用いると、期待値伝播 アルゴリズムが得られます。)
証明 KLダイバージェンスはブレグマンダイバージェンス の特殊なケースである一般化されたピタゴラスの定理 により、次のことが示されます。[ 1 ] [ 2 ]
ブレグマン発散 に対する一般化されたピタゴラスの定理[ 2 ] D K L ( Q ∥ P ) ≥ D K L ( Q ∥ Q * ) + D K L ( Q * ∥ P ) 、 ∀ Q * ∈ C {\displaystyle D_{\mathrm {KL} }(Q\parallel P)\geq D_{\mathrm {KL} }(Q\parallel Q^{*})+D_{\mathrm {KL} }(Q^{*}\parallel P),\forall Q^{*}\in {\mathcal {C}}} どこ C {\displaystyle {\mathcal {C}}} は凸集合 であり、等号が成り立つのは、以下の条件を満たす場合である。
Q = Q * ≜ 引数 ミニ Q ∈ C D K L ( Q ∥ P ) 。 {\displaystyle Q=Q^{*}\triangleq \arg \min _{Q\in {\mathcal {C}}}D_{\mathrm {KL} }(Q\parallel P).} この場合、グローバル最小化Q * ( Z ) = q * ( Z 1 ∣ Z 2 ) q * ( Z 2 ) = q * ( Z 2 ∣ Z 1 ) q * ( Z 1 ) 、 {\displaystyle Q^{*}(\mathbf {Z} )=q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})q^{*}(\mathbf {Z} _{2})=q^{*}(\mathbf {Z} _{2}\mid \mathbf {Z} _{1})q^{*}(\mathbf {Z} _{1}),} とZ = { Z 1 、 Z 2 } 、 {\displaystyle \mathbf {Z} =\{\mathbf {Z_{1}} ,\mathbf {Z_{2}} \},} 以下のように見つけることができます: [ 1 ]
q * ( Z 2 ) = P ( X ) ζ ( X ) P ( Z 2 ∣ X ) exp ( D K L ( q * ( Z 1 ∣ Z 2 ) ∥ P ( Z 1 ∣ Z 2 、 X ) ) ) = 1 ζ ( X ) exp E q * ( Z 1 ∣ Z 2 ) ( ログ P ( Z 、 X ) q * ( Z 1 ∣ Z 2 ) ) 、 {\displaystyle {\begin{array}{rl}q^{*}(\mathbf {Z} _{2})&={\frac {P(\mathbf {X} )}{\zeta (\mathbf {X} )}}{\frac {P(\mathbf {Z} _{2}\mid \mathbf {X} )}{\exp(D_{\mathrm {KL} }(q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})\parallel P(\mathbf {Z} _{1}\mid \mathbf {Z} _{2},\mathbf {X} )))}}\\&={\frac {1}{\zeta (\mathbf {X} )}}\exp \mathbb {E} _{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}\left(\log {\frac {P(\mathbf {Z} ,\mathbf {X} )}{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}}\right),\end{array}}} ここで、正規化定数は次のとおりである。
ζ ( X ) = P ( X ) ∫ Z 2 P ( Z 2 ∣ X ) exp ( D K L ( q * ( Z 1 ∣ Z 2 ) ∥ P ( Z 1 ∣ Z 2 、 X ) ) ) = ∫ Z 2 exp E q * ( Z 1 ∣ Z 2 ) ( ログ P ( Z 、 X ) q * ( Z 1 ∣ Z 2 ) ) 。 {\displaystyle {\begin{array}{rl}\zeta (\mathbf {X} )&=P(\mathbf {X} )\int _{\mathbf {Z} _{2}}{\frac {P(\mathbf {Z} _{2}\mid \mathbf {X} )}{\exp(D_{\mathrm {KL} }(q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})\parallel P(\mathbf {Z} _{1}\mid \mathbf {Z} _{2},\mathbf {X} )))}}\\&=\int _{\mathbf {Z} _{2}}\exp \mathbb {E} _{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}\left(\log {\frac {P(\mathbf {Z} ,\mathbf {X} )}{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}}\right).\end{array}}} 用語ζ ( X ) {\displaystyle \zeta (\mathbf {X} )} 実際には、証拠 下限 ( ELBO )と呼ばれることが多い。P ( X ) ≥ ζ ( X ) = exp ( L ( Q * ) ) {\displaystyle P(\mathbf {X} )\geq \zeta (\mathbf {X} )=\exp({\mathcal {L}}(Q^{*}))} [ 1 ] 上記のとおり。
役割を入れ替えることでZ 1 {\displaystyle \mathbf {Z} _{1}} そしてZ 2 、 {\displaystyle \mathbf {Z} _{2},} 近似値を反復計算することができますq * ( Z 1 ) {\displaystyle q^{*}(\mathbf {Z} _{1})} そしてq * ( Z 2 ) {\displaystyle q^{*}(\mathbf {Z} _{2})} 真のモデルの周辺値P ( Z 1 ∣ X ) {\displaystyle P(\mathbf {Z} _{1}\mid \mathbf {X} )} そしてP ( Z 2 ∣ X ) 、 {\displaystyle P(\mathbf {Z} _{2}\mid \mathbf {X} ),} それぞれ。この反復スキームは単調に収束することが保証されているが、[ 1 ] 収束したQ * {\displaystyle Q^{*}} は、D K L ( Q ∥ P ) {\displaystyle D_{\mathrm {KL} }(Q\parallel P)} 。
制約された空間C {\displaystyle {\mathcal {C}}} 独立した空間内に閉じ込められている、つまりq * ( Z 1 ∣ Z 2 ) = q * ( Z 1 ) 、 {\displaystyle q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})=q^{*}(\mathbf {Z_{1}} ),} 上記の反復スキームは、いわゆる平均場近似となる。Q * ( Z ) = q * ( Z 1 ) q * ( Z 2 ) 、 {\displaystyle Q^{*}(\mathbf {Z} )=q^{*}(\mathbf {Z} _{1})q^{*}(\mathbf {Z} _{2}),} 以下に示すように。
基本的な例 平均 と分散 が未知のガウス分布からの iid 観測値のセットで構成される単純な非階層ベイズモデルを考えます。[ 6 ] 以下では、変分ベイズ法の仕組みを説明するために、このモデルを詳細に検討します。
数学的な便宜上、以下の例では、分散そのものではなく、精度 、すなわち分散の逆数(多変量ガウス分布の場合は共分散行列の逆数)を用いて計算します。(理論的には、精度と分散は 1対1の対応関係 にあるため、両者は等価です。)
数学モデル 未知の平均値に共役事前 分布を設定しますμ {\displaystyle \mu } そして精度τ {\displaystyle \tau } つまり、平均値はガウス分布に従い、精度はガンマ分布 に従う。言い換えれば:
τ ~ ガンマ ( 1 0 、 b 0 ) μ | τ ~ N ( μ 0 、 ( λ 0 τ ) − 1 ) { x 1 、 … 、 x N } ~ N ( μ 、 τ − 1 ) N = データポイントの数 {\displaystyle {\begin{aligned}\tau &\sim \operatorname {Gamma} (a_{0},b_{0})\\\mu |\tau &\sim {\mathcal {N}}(\mu _{0},(\lambda _{0}\tau )^{-1})\\\{x_{1},\dots ,x_{N}\}&\sim {\mathcal {N}}(\mu ,\tau ^{-1})\\N&={\text{number of data points}}\end{aligned}}} ハイパーパラメータ μ 0 、 λ 0 、 1 0 {\displaystyle \mu _{0},\lambda _{0},a_{0}} そしてb 0 {\displaystyle b_{0}} 事前分布では、固定された値が与えられます。これらは、事前分布に関する無知を示す広範な事前分布を与えるために、小さな正の数に設定できます。μ {\displaystyle \mu } そしてτ {\displaystyle \tau } 。
私たちには与えられていますN {\displaystyle N} データポイントX = { x 1 、 … 、 x N } {\displaystyle \mathbf {X} =\{x_{1},\ldots ,x_{N}\}} そして私たちの目標は事後分布を推測することです q ( μ 、 τ ) = p ( μ 、 τ ∣ x 1 、 … 、 x N ) {\displaystyle q(\mu ,\tau )=p(\mu ,\tau \mid x_{1},\ldots ,x_{N})} パラメータのμ {\displaystyle \mu } そしてτ 。 {\displaystyle \tau .}
同時確率 すべての変数の同時確率は 次のように書き換えることができます。
p ( X 、 μ 、 τ ) = p ( X ∣ μ 、 τ ) p ( μ ∣ τ ) p ( τ ) {\displaystyle p(\mathbf {X} ,\mu ,\tau )=p(\mathbf {X} \mid \mu ,\tau )p(\mu \mid \tau )p(\tau )} 個々の要因は
p ( X ∣ μ 、 τ ) = ∏ n = 1 N N ( x n ∣ μ 、 τ − 1 ) p ( μ ∣ τ ) = N ( μ ∣ μ 0 、 ( λ 0 τ ) − 1 ) p ( τ ) = ガンマ ( τ ∣ 1 0 、 b 0 ) {\displaystyle {\begin{aligned}p(\mathbf {X} \mid \mu ,\tau )&=\prod _{n=1}^{N}{\mathcal {N}}(x_{n}\mid \mu ,\tau ^{-1})\\p(\mu \mid \tau )&={\mathcal {N}}\left(\mu \mid \mu _{0},(\lambda _{0}\tau )^{-1}\right)\\p(\tau )&=\operatorname {Gamma} (\tau \mid a_{0},b_{0})\end{aligned}}} どこ
N ( x ∣ μ 、 σ 2 ) = 1 2 π σ 2 e − ( x − μ ) 2 2 σ 2 ガンマ ( τ ∣ 1 、 b ) = 1 Γ ( 1 ) b 1 τ 1 − 1 e − b τ {\displaystyle {\begin{aligned}{\mathcal {N}}(x\mid \mu ,\sigma ^{2})&={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}e^{\frac {-(x-\mu )^{2}}{2\sigma ^{2}}}\\\operatorname {Gamma} (\tau \mid a,b)&={\frac {1}{\Gamma (a)}}b^{a}\tau ^{a-1}e^{-b\tau }\end{aligned}}}
因数分解近似 と仮定するq ( μ 、 τ ) = q ( μ ) q ( τ ) {\displaystyle q(\mu ,\tau )=q(\mu )q(\tau )} つまり、事後分布は独立した因子に分解される。μ {\displaystyle \mu } そしてτ {\displaystyle \tau } この種の仮定は、変分ベイズ法の基礎となっている。実際の事後分布はこのように因数分解されるわけではない(実際、この単純なケースでは、ガウス・ガンマ分布 であることが知られている)。したがって、得られる結果は近似値となる。
q( τ ) の導出の派生q τ * ( τ ) {\displaystyle q_{\tau }^{*}(\tau )} 上記と同様ですが、簡潔にするために一部の詳細は省略します。
ln q τ * ( τ ) = E μ [ ln p ( X ∣ μ 、 τ ) + ln p ( μ ∣ τ ) ] + ln p ( τ ) + 絶え間ない = ( 1 0 − 1 ) ln τ − b 0 τ + 1 2 ln τ + N 2 ln τ − τ 2 E μ [ ∑ n = 1 N ( x n − μ ) 2 + λ 0 ( μ − μ 0 ) 2 ] + 絶え間ない {\displaystyle {\begin{aligned}\ln q_{\tau }^{*}(\tau )&=\operatorname {E} _{\mu }[\ln p(\mathbf {X} \mid \mu ,\tau )+\ln p(\mu \mid \tau )]+\ln p(\tau )+{\text{constant}}\\&=(a_{0}-1)\ln \tau -b_{0}\tau +{\frac {1}{2}}\ln \tau +{\frac {N}{2}}\ln \tau -{\frac {\tau }{2}}\operatorname {E} _{\mu }\left[\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right]+{\text{constant}}\end{aligned}}} 両辺を指数関数すると、次のことがわかります。q τ * ( τ ) {\displaystyle q_{\tau }^{*}(\tau )} ガンマ分布 です。具体的には:
q τ * ( τ ) ~ ガンマ ( τ ∣ 1 N 、 b N ) 1 N = 1 0 + N + 1 2 b N = b 0 + 1 2 E μ [ ∑ n = 1 N ( x n − μ ) 2 + λ 0 ( μ − μ 0 ) 2 ] {\displaystyle {\begin{aligned}q_{\tau }^{*}(\tau )&\sim \operatorname {Gamma} (\tau \mid a_{N},b_{N})\\a_{N}&=a_{0}+{\frac {N+1}{2}}\\b_{N}&=b_{0}+{\frac {1}{2}}\operatorname {E} _{\mu }\left[\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right]\end{aligned}}}
さらなる議論
最も重要なポイント 数学的な操作が多岐にわたるため、全体像を見失いがちです。重要な点は以下のとおりです。
変分ベイズの考え方は、データが与えられた場合に、観測されていない変数(パラメータと潜在変数)の事後確率の解析的近似を構築することです。これは、解の形式が ギブスサンプリング などの他のベイズ推論 法と似ていることを意味します。つまり、変数について知られているすべてのことを記述しようとする分布です。他のベイズ法と同様に、ただし、例えば期待値最大化 (EM)法や他の最尤法とは異なり、観測されていない変数(つまり、パラメータと潜在変数)の両方のタイプは、 確率変数 として同じように扱われます。その後、分布の平均を計算して単一の点推定値を取得したり、 信頼区間 、最高密度領域などを導出したりするなど、標準的なベイズ法で変数の推定値を導出できます。 「解析的近似」とは、事後分布を表す式を記述できることを意味します。この式は一般的に、既知の確率分布の積で構成され、それぞれの確率分布は、観測されていない変数の集合に対して因数分解されます(つまり、観測データが与えられた場合、他の変数とは 条件付きで独立して います)。この式は真の事後分布ではなく、その近似値です。特に、観測されていない変数の最小モーメント、例えば 平均 や分散 については、一般的にかなり近い値になります。 一連の数学的操作の結果、(1)因子を構成する確率分布の同一性、および(2)これらの分布のパラメータに関する相互依存的な式が得られます。これらのパラメータの実際の値は、EMアルゴリズムによく似た交互反復手順によって数値的に計算されます。
期待値最大化(EM)アルゴリズムと比較すると変分ベイズ(VB)は、期待値最大化 (EM)法とよく比較される。実際の数値計算手順は非常に似ており、どちらも最適なパラメータ値に順次収束していく交互反復法である。それぞれの手順を導出する最初のステップも漠然と似ており、どちらも確率密度関数の式から始まり、どちらもかなりの量の数学的操作を伴う。
しかし、いくつかの違いがある。最も重要なのは、何 が計算されているかという点だ。
EMアルゴリズムは、「パラメータ」として分類できる確率変数の事後分布の点推定値を算出しますが、潜在変数の実際の事後分布の推定値しか算出しません(少なくとも「ソフトEM」の場合、そして多くの場合、潜在変数が離散的な場合に限られます)。算出される点推定値はこれらのパラメータの最頻値 であり、その他の情報は得られません。 一方、VB は、パラメータと潜在変数の両方を含むすべての変数の実際の事後分布の推定値を計算します。点推定値を導出する必要がある場合、ベイズ推論で通常行われるように、モードではなく平均 が使用されます。これに伴い、VB で計算されるパラメータは、 EM のパラメータと同じ意味を持ちません 。EM は、ベイズ ネットワーク自体のパラメータの最適値を計算します。VB は、ベイズ ネットワークのパラメータと潜在変数を近似するために使用される分布のパラメータの最適値を計算します。たとえば、典型的なガウス混合モデル には、各混合成分の平均と分散のパラメータがあります。EM は、これらのパラメータの最適値を直接推定します。しかし、VB は、まずこれらのパラメータに分布を適合させます (通常は事前分布 の形式、たとえば正規スケールの逆ガンマ分布 )。次に、この事前分布のパラメータの値、つまり本質的にはハイパーパラメータ を計算します。この場合、VBは、成分の平均と分散の同時分布を表す正規スケール逆ガンマ分布の4つのパラメータの最適推定値を計算します。
より複雑な例 プレート表記 を使用したベイズガウス混合モデル。小さい四角は固定パラメータ、大きい円はランダム変数を表します。塗りつぶされた図形は既知の値を表します。[K] はサイズK のベクトル、[ D , D ] はサイズ D × D の行列、K のみはK 個の 結果を持つカテゴリ変数を表します。z から伸びて 十字 で終わる波線はスイッチ を表します。この変数の値は、他の入力変数に対して、サイズK の可能な値の配列からどの値を使用するかを選択します。次のように記述されるベイズガウス混合モデル を想像してください。[ 3 ]
π ~ SymDir ( K 、 α 0 ) Λ 私 = 1 … K ~ W ( W 0 、 ν 0 ) μ 私 = 1 … K ~ N ( μ 0 、 ( β 0 Λ 私 ) − 1 ) z [ 私 = 1 … N ] ~ マルチ ( 1 、 π ) x 私 = 1 … N ~ N ( μ z 私 、 Λ z 私 − 1 ) K = 混合成分の数 N = データポイントの数 {\displaystyle {\begin{aligned}\mathbf {\pi } &\sim \operatorname {SymDir} (K,\alpha _{0})\\\mathbf {\Lambda } _{i=1\dots K}&\sim {\mathcal {W}}(\mathbf {W} _{0},\nu _{0})\\\mathbf {\mu } _{i=1\dots K}&\sim {\mathcal {N}}(\mathbf {\mu } _{0},(\beta _{0}\mathbf {\Lambda } _{i})^{-1})\\\mathbf {z} [i=1\dots N]&\sim \operatorname {Mult} (1,\mathbf {\pi } )\\\mathbf {x} _{i=1\dots N}&\sim {\mathcal {N}}(\mathbf {\mu } _{z_{i}},{\mathbf {\Lambda } _{z_{i}}}^{-1})\\K&={\text{number of mixing components}}\\N&={\text{number of data points}}\end{aligned}}} 注記:
上記の変数の解釈は以下のとおりです。
X = { x 1 、 … 、 x N } {\displaystyle \mathbf {X} =\{\mathbf {x} _{1},\dots ,\mathbf {x} _{N}\}} は、N {\displaystyle N} データポイントはそれぞれD {\displaystyle D} 多変量ガウス分布 に従って分布する次元ベクトル。Z = { z 1 、 … 、 z N } {\displaystyle \mathbf {Z} =\{\mathbf {z} _{1},\dots ,\mathbf {z} _{N}\}} は、データポイントごとに1つずつ、対応するデータポイントがどの混合成分に属するかを指定する潜在変数のセットであり、成分を持つ「1つ/K」のベクトル表現を使用します。z n k {\displaystyle z_{nk}} のためにk = 1 … K {\displaystyle k=1\dots K} 上記のとおり。π {\displaystyle \mathbf {\pi } } 混合比率はK {\displaystyle K} 混合物の成分。μ 私 = 1 … K {\displaystyle \mathbf {\mu } _{i=1\dots K}} そしてΛ 私 = 1 … K {\displaystyle \mathbf {\Lambda } _{i=1\dots K}} 各混合成分に関連付けられたパラメータ(平均値 と精度)を指定します。 すべての変数の同時確率は次のように書き換えることができます。
p ( X 、 Z 、 π 、 μ 、 Λ ) = p ( X ∣ Z 、 μ 、 Λ ) p ( Z ∣ π ) p ( π ) p ( μ ∣ Λ ) p ( Λ ) {\displaystyle p(\mathbf {X} ,\mathbf {Z} ,\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )=p(\mathbf {X} \mid \mathbf {Z} ,\mathbf {\mu } ,\mathbf {\Lambda } )p(\mathbf {Z} \mid \mathbf {\pi } )p(\mathbf {\pi } )p(\mathbf {\mu } \mid \mathbf {\Lambda } )p(\mathbf {\Lambda } )} 個々の要因は
p ( X ∣ Z 、 μ 、 Λ ) = ∏ n = 1 N ∏ k = 1 K N ( x n ∣ μ k 、 Λ k − 1 ) z n k p ( Z ∣ π ) = ∏ n = 1 N ∏ k = 1 K π k z n k p ( π ) = Γ ( K α 0 ) Γ ( α 0 ) K ∏ k = 1 K π k α 0 − 1 p ( μ ∣ Λ ) = ∏ k = 1 K N ( μ k ∣ μ 0 、 ( β 0 Λ k ) − 1 ) p ( Λ ) = ∏ k = 1 K W ( Λ k ∣ W 0 、 ν 0 ) {\displaystyle {\begin{aligned}p(\mathbf {X} \mid \mathbf {Z} ,\mathbf {\mu } ,\mathbf {\Lambda } )&=\prod _{n=1}^{N}\prod _{k=1}^{K}{\mathcal {N}}(\mathbf {x} _{n}\mid \mathbf {\mu } _{k},\mathbf {\Lambda } _{k}^{-1})^{z_{nk}}\\p(\mathbf {Z} \mid \mathbf {\pi } )&=\prod _{n=1}^{N}\prod _{k=1}^{K}\pi _{k}^{z_{nk}}\\p(\mathbf {\pi } )&={\frac {\Gamma (K\alpha _{0})}{\Gamma (\alpha _{0})^{K}}}\prod _{k=1}^{K}\pi _{k}^{\alpha _{0}-1}\\p(\mathbf {\mu } \mid \mathbf {\Lambda } )&=\prod _{k=1}^{K}{\mathcal {N}}(\mathbf {\mu } _{k}\mid \mathbf {\mu } _{0},(\beta _{0}\mathbf {\Lambda } _{k})^{-1})\\p(\mathbf {\Lambda } )&=\prod _{k=1}^{K}{\mathcal {W}}(\mathbf {\Lambda } _{k}\mid \mathbf {W} _{0},\nu _{0})\end{aligned}}} どこ
N ( x ∣ μ 、 Σ ) = 1 ( 2 π ) D / 2 1 | Σ | 1 / 2 exp { − 1 2 ( x − μ ) T Σ − 1 ( x − μ ) } W ( Λ ∣ W 、 ν ) = B ( W 、 ν ) | Λ | ( ν − D − 1 ) / 2 exp ( − 1 2 Tr ( W − 1 Λ ) ) B ( W 、 ν ) = | W | − ν / 2 { 2 ν D / 2 π D ( D − 1 ) / 4 ∏ 私 = 1 D Γ ( ν + 1 − 私 2 ) } − 1 D = 各データポイントの次元 {\displaystyle {\begin{aligned}{\mathcal {N}}(\mathbf {x} \mid \mathbf {\mu } ,\mathbf {\Sigma } )&={\frac {1}{(2\pi )^{D/2}}}{\frac {1}{|\mathbf {\Sigma } |^{1/2}}}\exp \left\{-{\frac {1}{2}}(\mathbf {x} -\mathbf {\mu } )^{\rm {T}}\mathbf {\Sigma } ^{-1}(\mathbf {x} -\mathbf {\mu } )\right\}\\{\mathcal {W}}(\mathbf {\Lambda } \mid \mathbf {W} ,\nu )&=B(\mathbf {W} ,\nu )|\mathbf {\Lambda } |^{(\nu -D-1)/2}\exp \left(-{\frac {1}{2}}\operatorname {Tr} (\mathbf {W} ^{-1}\mathbf {\Lambda } )\right)\\B(\mathbf {W} ,\nu )&=|\mathbf {W} |^{-\nu /2}\left\{2^{\nu D/2}\pi ^{D(D-1)/4}\prod _{i=1}^{D}\Gamma \left({\frac {\nu +1-i}{2}}\right)\right\}^{-1}\\D&={\text{dimensionality of each data point}}\end{aligned}}} と仮定するq ( Z 、 π 、 μ 、 Λ ) = q ( Z ) q ( π 、 μ 、 Λ ) {\displaystyle q(\mathbf {Z} ,\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )=q(\mathbf {Z} )q(\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )} 。
次に[ 3 ]
ln q * ( Z ) = E π 、 μ 、 Λ [ ln p ( X 、 Z 、 π 、 μ 、 Λ ) ] + 絶え間ない = E π [ ln p ( Z ∣ π ) ] + E μ 、 Λ [ ln p ( X ∣ Z 、 μ 、 Λ ) ] + 絶え間ない = ∑ n = 1 N ∑ k = 1 K z n k ln ρ n k + 絶え間ない {\displaystyle {\begin{aligned}\ln q^{*}(\mathbf {Z} )&=\operatorname {E} _{\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } }[\ln p(\mathbf {X} ,\mathbf {Z} ,\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )]+{\text{constant}}\\&=\operatorname {E} _{\mathbf {\pi } }[\ln p(\mathbf {Z} \mid \mathbf {\pi } )]+\operatorname {E} _{\mathbf {\mu } ,\mathbf {\Lambda } }[\ln p(\mathbf {X} \mid \mathbf {Z} ,\mathbf {\mu } ,\mathbf {\Lambda } )]+{\text{constant}}\\&=\sum _{n=1}^{N}\sum _{k=1}^{K}z_{nk}\ln \rho _{nk}+{\text{constant}}\end{aligned}}} ここで定義した
ln ρ n k = E [ ln π k ] + 1 2 E [ ln | Λ k | ] − D 2 ln ( 2 π ) − 1 2 E μ k 、 Λ k [ ( x n − μ k ) T Λ k ( x n − μ k ) ] {\displaystyle \ln \rho _{nk}=\operatorname {E} [\ln \pi _{k}]+{\frac {1}{2}}\operatorname {E} [\ln |\mathbf {\Lambda } _{k}|]-{\frac {D}{2}}\ln(2\pi )-{\frac {1}{2}}\operatorname {E} _{\mathbf {\mu } _{k},\mathbf {\Lambda } _{k}}[(\mathbf {x} _{n}-\mathbf {\mu } _{k})^{\rm {T}}\mathbf {\Lambda } _{k}(\mathbf {x} _{n}-\mathbf {\mu } _{k})]} 式の両辺を指数化すると、ln q * ( Z ) {\displaystyle \ln q^{*}(\mathbf {Z} )} 収量
q * ( Z ) ∝ ∏ n = 1 N ∏ k = 1 K ρ n k z n k {\displaystyle q^{*}(\mathbf {Z} )\propto \prod _{n=1}^{N}\prod _{k=1}^{K}\rho _{nk}^{z_{nk}}} これを正規化する必要があるとすると、ρ n k {\displaystyle \rho _{nk}} すべての値の合計が 1 になるk {\displaystyle k} 結果として
q * ( Z ) = ∏ n = 1 N ∏ k = 1 K r n k z n k {\displaystyle q^{*}(\mathbf {Z} )=\prod _{n=1}^{N}\prod _{k=1}^{K}r_{nk}^{z_{nk}}} どこ
r n k = ρ n k ∑ j = 1 K ρ n j {\displaystyle r_{nk}={\frac {\rho _{nk}}{\sum _{j=1}^{K}\rho _{nj}}}} 言い換えると、q * ( Z ) {\displaystyle q^{*}(\mathbf {Z} )} これは、各個人に対する単一観測多項分布 と因子の積です。z n {\displaystyle \mathbf {z} _{n}} これは、パラメータを持つ単一観測多項分布として分布します。r n k {\displaystyle r_{nk}} のためにk = 1 … K {\displaystyle k=1\dots K} 。
さらに、我々は以下の点に注目する。
E [ z n k ] = r n k {\displaystyle \operatorname {E} [z_{nk}]=r_{nk}\,} これはカテゴリカル分布における標準的な結果である。
さて、その要因を考慮するとq ( π 、 μ 、 Λ ) {\displaystyle q(\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )} 、自動的に考慮されることに注意してくださいq ( π ) ∏ k = 1 K q ( μ k 、 Λ k ) {\displaystyle q(\mathbf {\pi } )\prod _{k=1}^{K}q(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})} これは、上記で説明したガウス混合モデルを定義するグラフィカルモデルの構造によるものです。
それから、
ln q * ( π ) = ln p ( π ) + E Z [ ln p ( Z ∣ π ) ] + 絶え間ない = ( α 0 − 1 ) ∑ k = 1 K ln π k + ∑ n = 1 N ∑ k = 1 K r n k ln π k + 絶え間ない {\displaystyle {\begin{aligned}\ln q^{*}(\mathbf {\pi } )&=\ln p(\mathbf {\pi } )+\operatorname {E} _{\mathbf {Z} }[\ln p(\mathbf {Z} \mid \mathbf {\pi } )]+{\text{constant}}\\&=(\alpha _{0}-1)\sum _{k=1}^{K}\ln \pi _{k}+\sum _{n=1}^{N}\sum _{k=1}^{K}r_{nk}\ln \pi _{k}+{\text{constant}}\end{aligned}}} 両辺の指数を取ると、q * ( π ) {\displaystyle q^{*}(\mathbf {\pi } )} ディリクレ分布 として
q * ( π ) ~ ディレクター ( α ) {\displaystyle q^{*}(\mathbf {\pi } )\sim \operatorname {Dir} (\mathbf {\alpha } )\,} どこ
α k = α 0 + N k {\displaystyle \alpha _{k}=\alpha _{0}+N_{k}\,} どこ
N k = ∑ n = 1 N r n k {\displaystyle N_{k}=\sum _{n=1}^{N}r_{nk}\,} ついに
ln q * ( μ k 、 Λ k ) = ln p ( μ k 、 Λ k ) + ∑ n = 1 N E [ z n k ] ln N ( x n ∣ μ k 、 Λ k − 1 ) + 絶え間ない {\displaystyle \ln q^{*}(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})=\ln p(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})+\sum _{n=1}^{N}\operatorname {E} [z_{nk}]\ln {\mathcal {N}}(\mathbf {x} _{n}\mid \mathbf {\mu } _{k},\mathbf {\Lambda } _{k}^{-1})+{\text{constant}}} 用語のグループ化と読み上げμ k {\displaystyle \mathbf {\mu } _{k}} そしてΛ k {\displaystyle \mathbf {\Lambda } _{k}} その結果、ガウス・ウィシャート分布 が得られる。
q * ( μ k 、 Λ k ) = N ( μ k ∣ m k 、 ( β k Λ k ) − 1 ) W ( Λ k ∣ W k 、 ν k ) {\displaystyle q^{*}(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})={\mathcal {N}}(\mathbf {\mu } _{k}\mid \mathbf {m} _{k},(\beta _{k}\mathbf {\Lambda } _{k})^{-1}){\mathcal {W}}(\mathbf {\Lambda } _{k}\mid \mathbf {W} _{k},\nu _{k})} 定義を考慮すると
β k = β 0 + N k m k = 1 β k ( β 0 μ 0 + N k x ¯ k ) W k − 1 = W 0 − 1 + N k S k + β 0 N k β 0 + N k ( x ¯ k − μ 0 ) ( x ¯ k − μ 0 ) T ν k = ν 0 + N k N k = ∑ n = 1 N r n k x ¯ k = 1 N k ∑ n = 1 N r n k x n S k = 1 N k ∑ n = 1 N r n k ( x n − x ¯ k ) ( x n − x ¯ k ) T {\displaystyle {\begin{aligned}\beta _{k}&=\beta _{0}+N_{k}\\\mathbf {m} _{k}&={\frac {1}{\beta _{k}}}(\beta _{0}\mathbf {\mu } _{0}+N_{k}{\bar {\mathbf {x} }}_{k})\\\mathbf {W} _{k}^{-1}&=\mathbf {W} _{0}^{-1}+N_{k}\mathbf {S} _{k}+{\frac {\beta _{0}N_{k}}{\beta _{0}+N_{k}}}({\bar {\mathbf {x} }}_{k}-\mathbf {\mu } _{0})({\bar {\mathbf {x} }}_{k}-\mathbf {\mu } _{0})^{\rm {T}}\\\nu _{k}&=\nu _{0}+N_{k}\\N_{k}&=\sum _{n=1}^{N}r_{nk}\\{\bar {\mathbf {x} }}_{k}&={\frac {1}{N_{k}}}\sum _{n=1}^{N}r_{nk}\mathbf {x} _{n}\\\mathbf {S} _{k}&={\frac {1}{N_{k}}}\sum _{n=1}^{N}r_{nk}(\mathbf {x} _{n}-{\bar {\mathbf {x} }}_{k})(\mathbf {x} _{n}-{\bar {\mathbf {x} }}_{k})^{\rm {T}}\end{aligned}}} 最後に、これらの関数には以下の値が必要であることに注意してください。r n k {\displaystyle r_{nk}} 利用するρ n k {\displaystyle \rho _{nk}} これは、E [ ln π k ] {\displaystyle \operatorname {E} [\ln \pi _{k}]} 、E [ ln | Λ k | ] {\displaystyle \operatorname {E} [\ln |\mathbf {\Lambda } _{k}|]} 、 そしてE μ k 、 Λ k [ ( x n − μ k ) T Λ k ( x n − μ k ) ] {\displaystyle \operatorname {E} _{\mathbf {\mu } _{k},\mathbf {\Lambda } _{k}}[(\mathbf {x} _{n}-\mathbf {\mu } _{k})^{\rm {T}}\mathbf {\Lambda } _{k}(\mathbf {x} _{n}-\mathbf {\mu } _{k})]} これらの期待値が算出される分布が決定できたので、それらの公式を導出できます。
E μ k 、 Λ k [ ( x n − μ k ) T Λ k ( x n − μ k ) ] = D β k − 1 + ν k ( x n − m k ) T W k ( x n − m k ) ln Λ ~ k ≡ E [ ln | Λ k | ] = ∑ 私 = 1 D ψ ( ν k + 1 − 私 2 ) + D ln 2 + ln | W k | ln π ~ k ≡ E [ ln | π k | ] = ψ ( α k ) − ψ ( ∑ 私 = 1 K α 私 ) {\displaystyle {\begin{aligned}\operatorname {E} _{\mathbf {\mu } _{k},\mathbf {\Lambda } _{k}}[(\mathbf {x} _{n}-\mathbf {\mu } _{k})^{\rm {T}}\mathbf {\Lambda } _{k}(\mathbf {x} _{n}-\mathbf {\mu } _{k})]&=D\beta _{k}^{-1}+\nu _{k}(\mathbf {x} _{n}-\mathbf {m} _{k})^{\rm {T}}\mathbf {W} _{k}(\mathbf {x} _{n}-\mathbf {m} _{k})\\\ln {\widetilde {\Lambda }}_{k}&\equiv \operatorname {E} [\ln |\mathbf {\Lambda } _{k}|]=\sum _{i=1}^{D}\psi \left({\frac {\nu _{k}+1-i}{2}}\right)+D\ln 2+\ln |\mathbf {W} _{k}|\\\ln {\widetilde {\pi }}_{k}&\equiv \operatorname {E} \left[\ln |\pi _{k}|\right]=\psi (\alpha _{k})-\psi \left(\sum _{i=1}^{K}\alpha _{i}\right)\end{aligned}}} これらの結果から
r n k ∝ π ~ k Λ ~ k 1 / 2 exp { − D 2 β k − ν k 2 ( x n − m k ) T W k ( x n − m k ) } {\displaystyle r_{nk}\propto {\widetilde {\pi }}_{k}{\widetilde {\Lambda }}_{k}^{1/2}\exp \left\{-{\frac {D}{2\beta _{k}}}-{\frac {\nu _{k}}{2}}(\mathbf {x} _{n}-\mathbf {m} _{k})^{\rm {T}}\mathbf {W} _{k}(\mathbf {x} _{n}-\mathbf {m} _{k})\right\}} これらは、比例値から絶対値に正規化することで変換できます。k {\displaystyle k} 対応する値の合計が1になるようにします。
ご了承ください:
パラメータの更新式β k {\displaystyle \beta _{k}} 、m k {\displaystyle \mathbf {m} _{k}} 、W k {\displaystyle \mathbf {W} _{k}} そしてν k {\displaystyle \nu _{k}} 変数のμ k {\displaystyle \mathbf {\mu } _{k}} そしてΛ k {\displaystyle \mathbf {\Lambda } _{k}} 統計によって異なるN k {\displaystyle N_{k}} 、x ¯ k {\displaystyle {\bar {\mathbf {x} }}_{k}} 、 そしてS k {\displaystyle \mathbf {S} _{k}} そしてこれらの統計は、r n k {\displaystyle r_{nk}} 。 パラメータの更新式α 1 … K {\displaystyle \alpha _{1\dots K}} 変数のπ {\displaystyle \mathbf {\pi } } 統計に依存するN k {\displaystyle N_{k}} これは、r n k {\displaystyle r_{nk}} 。 更新方程式r n k {\displaystyle r_{nk}} 直接的な循環依存関係を持つβ k {\displaystyle \beta _{k}} 、m k {\displaystyle \mathbf {m} _{k}} 、W k {\displaystyle \mathbf {W} _{k}} そしてν k {\displaystyle \nu _{k}} 間接的な循環依存W k {\displaystyle \mathbf {W} _{k}} 、ν k {\displaystyle \nu _{k}} そしてα 1 … K {\displaystyle \alpha _{1\dots K}} を通してπ ~ k {\displaystyle {\widetilde {\pi }}_{k}} そしてΛ ~ k {\displaystyle {\widetilde {\Lambda }}_{k}} 。 これは、2つのステップを交互に繰り返す反復手順を示唆している。
値を計算するEステップr n k {\displaystyle r_{nk}} 他のすべてのパラメータの現在の値を使用します。 新しい値を使用する M ステップr n k {\displaystyle r_{nk}} 他のすべてのパラメータの新しい値を計算する。 これらの手順は、ガウス混合モデル のパラメータに対する最尤法 または最大事後確率 (MAP)解を導出するための標準的なEMアルゴリズムと密接に対応していることに注意してください。r n k {\displaystyle r_{nk}} Eステップでは、データが与えられた場合の潜在変数の事後確率に密接に対応します。 p ( Z ∣ X ) {\displaystyle p(\mathbf {Z} \mid \mathbf {X} )} 統計の計算N k {\displaystyle N_{k}} 、x ¯ k {\displaystyle {\bar {\mathbf {x} }}_{k}} 、 そしてS k {\displaystyle \mathbf {S} _{k}} これは、データに対する対応する「ソフトカウント」統計量の計算と密接に対応しており、これらの統計量を使用してパラメータの新しい値を計算することは、ガウス混合モデル上の通常のEMにおいて、ソフトカウントを使用して新しいパラメータ値を計算することと密接に対応しています。
指数型分布族 前の例では、観測されていない変数の分布が「パラメータ」の分布と「潜在データ」の分布に因数分解されると仮定すると、各変数について導出された「最適」分布は、その変数に対応する事前分布と同じ族に属していました。これは、指数族 から導出されたすべての事前分布に当てはまる一般的な結果です。
参考文献 1 2 3 4 Tran, Viet Hung (2018). "情報幾何学によるコピュラ変分ベイズ推論". arXiv : 1803.10998 [ cs.IT ]. 1 2 Adamčík , Martin (2014). "ブレグマンダイバージェンスの情報 幾何 学 とマルチエキスパート推論へのいくつかの応用" .Entropy.16 ( 12 ) : 6338–6381.Bibcode : 2014Entrp..16.6338A.doi : 10.3390/e16126338 . 1 2 3 Nguyen, Duy (2023年8月15日). 「変分ベイズに関する詳細な入門ノート」 . doi : 10.2139/ssrn.4541076 . SSRN 4541076 . 2023年 8月15日 取得 . 1 2 3 Lee, Se Yoon (2021). "Gibbs sampler and coordinate ascent variational inference: A set-theoretical review". Communications in Statistics - Theory and Methods . 51 (6): 1–21 . arXiv : 2008.01006 . doi : 10.1080/03610926.2021.1921214 . S2CID 220935477 . ↑ Boyd, Stephen P.; Vandenberghe, Lieven (2004). Convex Optimization (PDF) . Cambridge University Press. ISBN 978-0-521-83378-3 2011年10月15日 に取得 。↑ ビショップ、クリストファー M. (2006). 「第 10 章」. パターン認識と機械学習 . Springer. ISBN 978-0-387-31073-2 。↑ Sotirios P. Chatzis、「無限マルコフスイッチング最大エントロピー識別マシン」、第30回国際機械学習会議(ICML)議事録。Journal of Machine Learning Research: Workshop and Conference Proceedings、第28巻、第3号、729~737ページ、2013年6月。
外部リンク オンライン教科書「情報理論、推論、学習アルゴリズム」(Wayback Machine に2017年5月12日に アーカイブ済み)は、David JC MacKay 氏によるもので、変分法の入門書として提供されています(422ページ)。 変分ベイズに関するチュートリアル。Fox, C. および Roberts, S. 2012. Artificial Intelligence Review、doi : 10.1007/s10462-011-9236-8。 変分ベイズリポジトリ2003年までの近似ベイズ学習における変分法の使用に関連する研究論文、ソフトウェア、およびリンクのリポジトリ。 MJ Beal著『近似ベイズ推論のための変分アルゴリズム』には、EMアルゴリズムと変分ベイズEMアルゴリズムの比較、および変分ベイズHMMを含むいくつかのモデルの導出が含まれています。 ジェイソン・アイスナーによる変分推論の高度な解説は、より数学的に詳細な解説を読む前に読んでおくと良いかもしれません。 情報幾何学によるコピュラ変分ベイズ推論(pdf) Tran, VH 2018。この論文は主に学生向けに書かれています。ブレグマンダイバージェンス を通して、変分ベイズは真のモデルを任意の相関(コピュラ)分布空間に一般化したピタゴラス射影にすぎず、独立空間はその特殊なケースにすぎないことを示しています。 変分ベイズ法の詳細な入門ノート。Nguyen, D. 2023