変分ベイズ法 では、エビデンス下限 (ELBO と略されることが多く、変分下限 [ 1 ] または負の変分自由エネルギー とも呼ばれる)は、観測されたデータの対数尤度の有用な下限です。
ELBOは、ある分布の対数尤度の最悪ケースについて保証を提供するので有用です(例:p ( X ) {\displaystyle p(X)} ELBOはデータセットをモデル化します。実際の対数尤度は、ELBOよりも高くなる可能性があります(分布への適合度がさらに高いことを示します)。これは、ELBOにはKullback-Leiblerダイバージェンス (KLダイバージェンス)項が含まれており、モデル全体としては適合度が良好であっても、モデルの内部の一部が不正確であるためにELBOが低下するためです。したがって、ELBOスコアの向上は、モデルの尤度の向上を示します。p ( X ) {\displaystyle p(X)} またはモデル内部のコンポーネントの適合性、あるいはその両方であり、ELBOスコアは、例えば、モデル全体と内部コンポーネントの両方を改善するために深層ニューラルネットワークをトレーニングする場合など、優れた 損失関数 になります。(内部コンポーネントはq ϕ ( ⋅ | x ) {\displaystyle q_{\phi }(\cdot |x)} (詳細は本稿後半で説明する。)
モチベーション
ELBOの導出 変分推論における基本的な結果として、カルバック・ライブラー情報量 (KL情報量)を最小化することは、対数尤度を最大化することと同等である。E x ~ p * ( x ) [ ln p θ ( x ) ] = − H ( p * ) − D K L ( p * ( x ) ‖ p θ ( x ) ) {\displaystyle \mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]=-H(p^{*})-D_{\mathit {KL}}(p^{*}(x)\|p_{\theta }(x))} どこH ( p * ) = − E x ~ p * [ ln p * ( x ) ] {\displaystyle H(p^{*})=-\mathbb {\mathbb {E} } _{x\sim p^{*}}[\ln p^{*}(x)]} は真の分布のエントロピー です。したがって、最大化できればE x ~ p * ( x ) [ ln p θ ( x ) ] {\displaystyle \mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]} 最小限に抑えることができますD K L ( p * ( x ) ‖ p θ ( x ) ) {\displaystyle D_{\mathit {KL}}(p^{*}(x)\|p_{\theta }(x))} 結果として正確な近似値を見つけるp θ ≈ p * {\displaystyle p_{\theta }\approx p^{*}} 。
最大化するためにE x ~ p * ( x ) [ ln p θ ( x ) ] {\displaystyle \mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]} 単純に多くのサンプルを抽出しますx 私 ~ p * ( x ) {\displaystyle x_{i}\sim p^{*}(x)} つまり、重点サンプリングを使用する N 最大 θ E x ~ p * ( x ) [ ln p θ ( x ) ] ≈ 最大 θ ∑ 私 ln p θ ( x 私 ) {\displaystyle N\max _{\theta }\mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]\approx \max _{\theta }\sum _{i}\ln p_{\theta }(x_{i})} どこN {\displaystyle N} は真の分布から抽出されたサンプルの数です。この近似は過学習 と見なすことができます。[ 注1 ]
最大化するために∑ 私 ln p θ ( x 私 ) {\displaystyle \sum _{i}\ln p_{\theta }(x_{i})} 見つける必要があるln p θ ( x ) {\displaystyle \ln p_{\theta }(x)} :ln p θ ( x ) = ln ∫ p θ ( x | z ) p ( z ) d z {\displaystyle \ln p_{\theta }(x)=\ln \int p_{\theta }(x|z)p(z)dz} これは通常、閉じた形式で表すことができず、推定する必要がある。積分を推定する一般的な方法は、重点サンプリング を用いたモンテカルロ積分 である。∫ p θ ( x | z ) p ( z ) d z = E z ~ q ϕ ( ⋅ | x ) [ p θ ( x 、 z ) q ϕ ( z | x ) ] {\displaystyle \int p_{\theta }(x|z)p(z)dz=\mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[{\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]} どこq ϕ ( z | x ) {\displaystyle q_{\phi }(z|x)} は標本分布 であるz {\displaystyle z} モンテカルロ積分を実行するために使用するものです。
つまり、サンプリングするとz ~ q ϕ ( ⋅ | x ) {\displaystyle z\sim q_{\phi }(\cdot |x)} 、 それからp θ ( x 、 z ) q ϕ ( z | x ) {\displaystyle {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}} は不偏推定量であるp θ ( x ) {\displaystyle p_{\theta }(x)} 残念ながら、これは不偏推定量を与えてくれません。ln p θ ( x ) {\displaystyle \ln p_{\theta }(x)} 、 なぜならln {\displaystyle \ln } は非線形である。実際、イェンセンの不等式 により、ln p θ ( x ) = ln E z ~ q ϕ ( ⋅ | x ) [ p θ ( x 、 z ) q ϕ ( z | x ) ] ≥ E z ~ q ϕ ( ⋅ | x ) [ ln p θ ( x 、 z ) q ϕ ( z | x ) ] {\displaystyle \ln p_{\theta }(x)=\ln \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[{\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]\geq \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]} 実際、明白な推定値はすべてln p θ ( x ) {\displaystyle \ln p_{\theta }(x)} サンプル数がいくつあっても、下方バイアスがかかっている。z 私 ~ q ϕ ( ⋅ | x ) {\displaystyle z_{i}\sim q_{\phi }(\cdot |x)} イェンセンの不等式を用いると、次のようになる。E z 私 ~ q ϕ ( ⋅ | x ) [ ln ( 1 N ∑ 私 p θ ( x 、 z 私 ) q ϕ ( z 私 | x ) ) ] ≤ ln E z 私 ~ q ϕ ( ⋅ | x ) [ 1 N ∑ 私 p θ ( x 、 z 私 ) q ϕ ( z 私 | x ) ] = ln p θ ( x ) {\displaystyle \mathbb {E} _{z_{i}\sim q_{\phi }(\cdot |x)}\left[\ln \left({\frac {1}{N}}\sum _{i}{\frac {p_{\theta }(x,z_{i})}{q_{\phi }(z_{i}|x)}}\right)\right]\leq \ln \mathbb {E} _{z_{i}\sim q_{\phi }(\cdot |x)}\left[{\frac {1}{N}}\sum _{i}{\frac {p_{\theta }(x,z_{i})}{q_{\phi }(z_{i}|x)}}\right]=\ln p_{\theta }(x)} 右辺を引くと、問題はゼロの偏りのある推定値に帰着することがわかる。E z 私 ~ q ϕ ( ⋅ | x ) [ ln ( 1 N ∑ 私 p θ ( z 私 | x ) q ϕ ( z 私 | x ) ) ] ≤ 0 {\displaystyle \mathbb {E} _{z_{i}\sim q_{\phi }(\cdot |x)}\left[\ln \left({\frac {1}{N}}\sum _{i}{\frac {p_{\theta }(z_{i}|x)}{q_{\phi }(z_{i}|x)}}\right)\right]\leq 0} この時点で、重要度重み付けオートエンコーダの開発へと分岐することもできますが[ 注2 ] 、代わりに最も単純なケースで続けます。N = 1 {\displaystyle N=1} :ln p θ ( x ) = ln E z ~ q ϕ ( ⋅ | x ) [ p θ ( x 、 z ) q ϕ ( z | x ) ] ≥ E z ~ q ϕ ( ⋅ | x ) [ ln p θ ( x 、 z ) q ϕ ( z | x ) ] {\displaystyle \ln p_{\theta }(x)=\ln \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[{\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]\geq \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]} 不等式の厳しさは、閉じた形で表せる。ln p θ ( x ) − E z ~ q ϕ ( ⋅ | x ) [ ln p θ ( x 、 z ) q ϕ ( z | x ) ] = D K L ( q ϕ ( ⋅ | x ) ‖ p θ ( ⋅ | x ) ) ≥ 0 {\displaystyle \ln p_{\theta }(x)-\mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]=D_{\mathit {KL}}(q_{\phi }(\cdot |x)\|p_{\theta }(\cdot |x))\geq 0} こうしてELBO関数が得られました。L ( ϕ 、 θ ; x ) := ln p θ ( x ) − D K L ( q ϕ ( ⋅ | x ) ‖ p θ ( ⋅ | x ) ) {\displaystyle L(\phi ,\theta ;x):=\ln p_{\theta }(x)-D_{\mathit {KL}}(q_{\phi }(\cdot |x)\|p_{\theta }(\cdot |x))}
主な形態 ELBOには様々な表現方法があり、それぞれに異なる強調点がある。
E z ~ q ϕ ( ⋅ | x ) [ ln p θ ( x 、 z ) q ϕ ( z | x ) ] = ∫ q ϕ ( z | x ) ln p θ ( x 、 z ) q ϕ ( z | x ) d z {\displaystyle \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]=\int q_{\phi }(z|x)\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}dz} 上記の形式は、サンプリングするとz ~ q ϕ ( ⋅ | x ) {\displaystyle z\sim q_{\phi }(\cdot |x)} 、 それからln p θ ( x 、 z ) q ϕ ( z | x ) {\displaystyle \ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}} はELBOの不偏推定量 である。
ln p θ ( x ) − D K L ( q ϕ ( ⋅ | x ) ‖ p θ ( ⋅ | x ) ) {\displaystyle \ln \ p_{\theta }(x)-D_{\mathit {KL}}(q_{\phi }(\cdot |x)\;\|\;p_{\theta }(\cdot |x))} 上記の形式は、ELBOが証拠の下限であることを示している。ln p θ ( x ) {\displaystyle \ln \ p_{\theta }(x)} ELBOを最大化することは、ϕ {\displaystyle \phi } これは、KLダイバージェンスを最小化することと同等である。 p θ ( ⋅ | x ) {\displaystyle p_{\theta }(\cdot |x)} にq ϕ ( ⋅ | x ) {\displaystyle q_{\phi }(\cdot |x)} 。
E z ~ q ϕ ( ⋅ | x ) [ ln p θ ( x | z ) ] − D K L ( q ϕ ( ⋅ | x ) ‖ p ( ⋅ ) ) {\displaystyle \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}[\ln \ p_{\theta }(x|z)]-D_{\mathit {KL}}(q_{\phi }(\cdot |x)\;\|\;p(\cdot ))} また、⋅ {\displaystyle \cdot } 値の範囲z {\displaystyle z} 上記の形式は、ELBO を最大化することで集中できることを示しています。q ϕ ( ⋅ | x ) {\displaystyle q_{\phi }(\cdot |x)} それらのz {\displaystyle z} 高い成果を達成するln p θ ( x | z ) {\displaystyle \ln \ p_{\theta }(x|z)} (言い換えれば、観測された現象に対する可能性の高い説明)x {\displaystyle x} )しかし維持するためにq ϕ ( ⋅ | x ) {\displaystyle q_{\phi }(\cdot |x)} 前のものに近いp ( ⋅ ) {\displaystyle p(\cdot )} 実際には、近似事後分布と事前分布の両方がガウス分布としてパラメータ化されている特殊なケースでは、この形式はELBOの低分散不偏推定量を提供する。なぜなら、その場合、KL項(それ自体は期待値であるが)は閉形式の式 を持つため、最初の期待値項のみをサンプリングによって推定すればよいからである。z {\displaystyle z} 。
データ処理の不平等 仮にN {\displaystyle N} 独立したサンプルp * {\displaystyle p^{*}} それらをデータセットに収集するD = { x 1 、 。 。 。 、 x N } {\displaystyle D=\{x_{1},...,x_{N}\}} すると、経験分布が得られます。 q D ( x ) = 1 N ∑ 私 δ x 私 {\displaystyle q_{D}(x)={\frac {1}{N}}\sum _{i}\delta _{x_{i}}} 。
フィッティングp θ ( x ) {\displaystyle p_{\theta }(x)} にq D ( x ) {\displaystyle q_{D}(x)} 通常通り、対数尤度を最大化することで実行できます。ln p θ ( D ) {\displaystyle \ln \ p_{\theta }(D)} :D K L ( q D ( x ) ‖ p θ ( x ) ) = − 1 N ∑ 私 ln p θ ( x 私 ) − H ( q D ) = − 1 N ln p θ ( D ) − H ( q D ) {\displaystyle D_{\mathit {KL}}(q_{D}(x)\|p_{\theta }(x))=-{\frac {1}{N}}\sum _{i}\ln \ p_{\theta }(x_{i})-H(q_{D})=-{\frac {1}{N}}\ln \ p_{\theta }(D)-H(q_{D})} さて、ELBO不等式により、ln p θ ( D ) {\displaystyle \ln \ p_{\theta }(D)} それでD K L ( q D ( x ) ‖ p θ ( x ) ) ≤ − 1 N L ( ϕ 、 θ ; D ) − H ( q D ) {\displaystyle D_{\mathit {KL}}(q_{D}(x)\|p_{\theta }(x))\leq -{\frac {1}{N}}L(\phi ,\theta ;D)-H(q_{D})} 右辺はKLダイバージェンスに簡略化され、次の式が得られます。D K L ( q D ( x ) ‖ p θ ( x ) ) ≤ − 1 N ∑ 私 L ( ϕ 、 θ ; x 私 ) − H ( q D ) = D K L ( q D 、 ϕ ( x 、 z ) ; p θ ( x 、 z ) ) {\displaystyle D_{\mathit {KL}}(q_{D}(x)\|p_{\theta }(x))\leq -{\frac {1}{N}}\sum _{i}L(\phi ,\theta ;x_{i})-H(q_{D})=D_{\mathit {KL}}(q_{D,\phi }(x,z);p_{\theta }(x,z))} この結果は、データ処理不等式 の特殊なケースとして解釈できる。
この解釈では、最大化L ( ϕ 、 θ ; D ) = ∑ 私 L ( ϕ 、 θ ; x 私 ) {\displaystyle L(\phi ,\theta ;D)=\sum _{i}L(\phi ,\theta ;x_{i})} 最小化しているD K L ( q D 、 ϕ ( x 、 z ) ; p θ ( x 、 z ) ) {\displaystyle D_{\mathit {KL}}(q_{D,\phi }(x,z);p_{\theta }(x,z))} これは、関心のある実数に上限を与える。D K L ( q D ( x ) ; p θ ( x ) ) {\displaystyle D_{\mathit {KL}}(q_{D}(x);p_{\theta }(x))} データ処理不等式を介して。つまり、観測可能な空間に潜在空間を追加し、KLダイバージェンスの計算効率を高めるために不等式を弱めるという代償を払います。[ 6 ]
参考文献 ↑ キングマ、ディーデリク P.;ウェリング、マックス (2014-05-01)。 「変分ベイズの自動エンコーディング」。arXiv : 1312.6114 [ stat.ML ]。 ↑ Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). 「第19章」. ディープラーニング . 適応型計算と機械学習. マサチューセッツ州ケンブリッジ: MIT Press. ISBN 978-0-262-03561-3 。↑ Hinton, Geoffrey E; Zemel, Richard (1993). "オートエンコーダー、最小記述長、ヘルムホルツ自由エネルギー" . Advances in Neural Information Processing Systems . 6 . Morgan-Kaufmann. ↑ Burda, Yuri; Grosse, Roger; Salakhutdinov, Ruslan (2015-09-01). "重要度加重オートエンコーダー". arXiv : 1509.00519 [ stat.ML ]. ↑ Neal, Radford M.; Hinton, Geoffrey E. (1998), "A View of the Em Algorithm that Justifies Incremental, Sparse, and other Variants" , Learning in Graphical Models , Dordrecht: Springer Netherlands, pp. 355–368 , doi : 10.1007/978-94-011-5014-9_12 , ISBN 978-94-010-6104-9 S2CID 17947141 ↑ Kingma, Diederik P.; Welling, Max (2019-11-27). "An Introduction to Variational Autoencoders" . Foundations and Trends in Machine Learning . 12 (4). Section 2.7. arXiv : 1906.02691 . doi : 10.1561/2200000056 . ISSN 1935-8237 . S2CID 174802445 .