数理統計学 では、カルバック・ライブラー (KL )ダイバージェンス (相対エントロピー およびIダイバージェンス とも呼ばれる)[ 1 ] は、D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} は統計的距離 の一種であり、近似確率分布 Q が 真の確率分布P とどれだけ異なるかを示す尺度である。[ 2 ] 数学的には、次のように定義される。
D クアラルンプール ( P ∥ Q ) = ∑ x ∈ X P ( x ) ログ P ( x ) Q ( x ) 。 {\displaystyle D_{\text{KL}}(P\parallel Q)=\sum _{x\in {\mathcal {X}}}P(x)\,\log {\frac {P(x)}{Q(x)}}{\text{.}}}
P とQ の KL ダイバージェンスの簡単な解釈は 、実際のP がP である場合に、近似値Qを P の代わりに使用した場合に期待される 過剰驚き です。これは 2 つの分布がどれだけ異なるかの尺度であり、ある意味では距離ですが、最もよく知られた形式的なタイプの距離であるメトリック ではありません。特に、これは 2 つの分布で対称ではなく (情報の変動とは対照的に)、 三角不等式を 満たしません。代わりに、情報 幾何学の観点からは、これはダイバージェンス の一種であり、二乗距離 の一般化であり、特定のクラスの分布 (特に指数族 ) については、一般化されたピタゴラスの定理 (二乗距離に適用される) を満たします。
KLダイバージェンスは常に非負の実数 であり、2つの分布が同一である場合に限り値が0になります。その応用範囲は幅広く、情報システムにおける相対(シャノン)エントロピー 、連続時系列におけるランダム性、 推論 の統計モデルを比較する際の情報利得などを特徴付ける理論的な応用と、応用統計学、流体力学 、神経科学 、バイオインフォマティクス 、機械学習 などの実用的な応用があります。
はじめにおよび背景 2つの確率分布、真の分布P と近似分布Q を考えます。多くの場合、Pは データ、観測値、または測定された確率分布を表し、分布Qは代わりに P の理論、モデル、記述、または別の近似を表します。ただし、真の分布Pが モデルを表し、近似分布Qが 真の分布に一致するように意図された(シミュレーションされた)データを表す場合もあります。カルバック・ライブラー情報量D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} これは、 P 用に最適化されたコードではなく、Q 用に最適化されたコード を 使用してP のサンプルをエンコードするために必要なビット数の平均差として解釈されます。
P とQ の役割は、計算が容易で目標が最小化である場合、状況によっては逆転する可能性があることに注意してください。D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} 例えば、期待値最大化アルゴリズム(EM) やエビデンス下限(ELBO) 計算など。この役割逆転アプローチは、D クアラルンプール ( P ∥ Q ) = 0 {\displaystyle D_{\text{KL}}(P\parallel Q)=0} かつその場合に限りD クアラルンプール ( Q ∥ P ) = 0 {\displaystyle D_{\text{KL}}(Q\parallel P)=0} そして多くの場合、一方を減らすと他方も減少する効果がある。
意味 同じ標本空間上で定義された 離散確率分布 P とQ について、X \displaystyle {\mathcal {X}}} Qから P への相対エントロピーは[ 12 ] で次のように定義される。
D クアラルンプール ( P ∥ Q ) = ∑ x ∈ X P ( x ) ログ P ( x ) Q ( x ) 、 {\displaystyle D_{\text{KL}}(P\parallel Q)=\sum _{x\in {\mathcal {X}}}P(x)\,\log {\frac {P(x)}{Q(x)}}{\text{,}}}
これは以下と同等です
D クアラルンプール ( P ∥ Q ) = ( − ∑ x ∈ X P ( x ) ログ Q ( x ) ) − ( − ∑ x ∈ X P ( x ) ログ P ( x ) ) 。 {\displaystyle D_{\text{KL}}(P\parallel Q)=\left(-\sum _{x\in {\mathcal {X}}}P(x)\,\log Q(x)\right)-\left(-\sum _{x\in {\mathcal {X}}}P(x)\,\log P(x)\right){\text{.}}}
言い換えれば、これは確率P とQの間の対数差の 期待値 であり、期待値は確率P を使用して計算されます。
相対エントロピーは、すべてのx に対して、Q ( x ) = 0 {\displaystyle Q(x)=0} 暗示するP ( x ) = 0 {\displaystyle P(x)=0} (絶対連続性 )。それ以外の場合は、次のように定義されることが多い。+ ∞ {\displaystyle +\infty } [ 1 ] しかし値は + ∞ {\displaystyle \ +\infty \ } 可能であってもQ ( x ) ≠ 0 {\displaystyle Q(x)\neq 0} どこでも、[ 13 ] [ 14 ] ただし、X \displaystyle {\mathcal {X}}} 範囲は無限である。同様の考察は、以下に定義する連続測度および一般測度の場合にも当てはまる。
いつでもP ( x ) {\displaystyle P(x)} がゼロの場合、対応する項の寄与はゼロと解釈されます。
リム x → 0 + x ログ ( x ) = 0 。 \lim_{x\to 0^{+}}x\,\log(x)=0.
連続確率変数 の分布P とQ に対して、相対エントロピーは積分として定義される[ 15 ]
D クアラルンプール ( P ∥ Q ) = ∫ − ∞ ∞ p ( x ) ログ p ( x ) q ( x ) d x 。 ${\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{-\infty }^{\infty }p(x)\,\log {\frac {p(x)}{q(x)}}\,dx{\text{.}}}$
ここで、p とqは P とQ の確率密度関数 を表す。
より一般的には、P とQが 可測空間 上の確率測度である場合 X 、 {\displaystyle {\mathcal {X}}\,,} P がQ に関して絶対連続で ある場合、 Qから P への相対エントロピーは次のように定義される。
D クアラルンプール ( P ∥ Q ) = ∫ x ∈ X ログ d P ( x ) d Q ( x ) d P ( x ) 、 {\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{x\in {\mathcal {X}}}\log {\frac {dP(x)}{dQ(x)}}\,dP(x){\text{,}}}
どこd P ( x ) d Q ( x ) {\displaystyle {\frac {dP(x)}{dQ(x)}}} は、 Q に関するP のラドン・ニコディム微分、 すなわち、ほぼ至るところで定義される一意のQ関数 r である。X \displaystyle {\mathcal {X}}} そのためd P ( x ) = r ( x ) d Q ( x ) {\displaystyle dP(x)=r(x)dQ(x)} これは、 Pが Q に関して絶対連続であるため存在する。また、右辺の式が存在すると仮定する。同様に(連鎖律 により)、これは次のように書ける。
D クアラルンプール ( P ∥ Q ) = ∫ x ∈ X d P ( x ) d Q ( x ) ログ d P ( x ) d Q ( x ) d Q ( x ) 、 {\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{x\in {\mathcal {X}}}{\frac {dP(x)}{dQ(x)}}\ \log {\frac {dP(x)}{dQ(x)}}\ dQ(x){\text{,}}}
これは、Q に対するP のエントロピー です。この場合、μ {\displaystyle \mu } いかなる尺度もX \displaystyle {\mathcal {X}}} 密度p とq がd P ( x ) = p ( x ) d μ ( x ) {\displaystyle dP(x)=p(x)\,d\mu (x)} そしてd Q ( x ) = q ( x ) d μ ( x ) {\displaystyle dQ(x)=q(x)\,d\mu (x)} 存在する(つまり、P とQは 両方とも絶対連続である)μ {\displaystyle \mu } ) の場合、Qから P への相対エントロピーは次のように表されます。
D クアラルンプール ( P ∥ Q ) = ∫ x ∈ X p ( x ) ログ p ( x ) q ( x ) d μ ( x ) 。 {\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{x\in {\mathcal {X}}}p(x)\,\log {\frac {p(x)}{q(x)}}\ d\mu (x){\text{.}}}
このような措置には注意が必要ですμ {\displaystyle \mu } 密度を定義できるものは常に存在する。なぜなら、μ = 1 2 ( P + Q ) {\textstyle \mu ={\frac {1}{2}}\left(P+Q\right)} ただし、実際には、離散分布の場合は計数測度、連続分布の場合は ルベーグ測度 、あるいはその便利な変形であるガウス測度や 球面 上の均一測度、リー群 上のハール測度 など、その文脈に適用されるものが用いられるのが一般的です。これらの式における対数は、情報がビット単位で測定される場合は通常 底 が2 、情報がナット 単位で測定される場合は通常底がe となります。相対エントロピーを含むほとんどの式は、対数の底に関係なく成り立ちます。
参照するためのさまざまな慣習が存在するD クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} 言葉で言うと、 P とQ の間の 乖離と呼ばれることが多いですが、これでは関係の根本的な非対称性を伝えることができません。この記事のように、P から Q への乖離、または Q から P への乖離と表現されることもあります。 これ は 、 事前 分布 Q から始めて事後 分布 P に更新 するベイズ 推論 の非対称 性を 反映しています。D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} これは、 Q に対する P の相対エントロピー、またはQ に対するP の情報利得として定義されます。
解釈
統計 統計学の分野では、ネイマン・ピアソン補題によれば、観測値 Y (どちらかの分布から抽出されたもの)に基づいて2つの分布P とQ を区別する最も強力な方法は、それらの尤度の比の対数を用いることである。ログ P ( Y ) − ログ Q ( Y ) {\displaystyle \log P(Y)-\log Q(Y)} KLダイバージェンスは、 Yが実際に P から抽出された場合のこの統計量の期待値です。カルバックはこの統計量を期待対数尤度比として提唱しました。
コーディング 符号理論 の文脈では、D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} これは、 P用に最適化されたコードではなく、 Q 用に最適化されたコードを使用してP からのサンプルを符号化 するために必要な追加ビット数 の期待値を測定することによって構築できます。
推論 機械学習 の文脈では、D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} これは、現在使用されているQ の代わりにPを 使用した場合に得られる情報利得 と呼ばれることが多い。情報理論との類推から、これはQ に対するP の相対エントロピー と呼ばれる。
ベイズ推論 の言葉で表現すると、D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} これは、事前確率分布 Qから 事後確率分布 P への信念の修正によって得られる情報の尺度である。言い換えれば、これはQ を使ってP を 近似するときに失われる情報の量である。[ 17 ]
金融(ゲーム理論)相互に排他的な結果を持つ公平なゲーム(例えば、公式オッズの合計が 1 になる「競馬」)における成長最適化投資家を考えてみましょう。このような投資家が期待する収益率は、投資家が信じる確率と公式オッズの間の相対エントロピーに等しくなります。[ 21 ] これは、金融収益と乖離尺度の間のより一般的な関係の特殊なケースです。[ 22 ]
金融リスクはD クアラルンプール {\displaystyle D_{\text{KL}}} 情報幾何学を通して。[ 23 ] 投資家の見解、一般的な市場の見解、およびリスクシナリオは、関連する確率分布の多様体上に三角形を形成します。三角形の形状は、主要な金融リスク(定性的にも定量的にも)を決定します。たとえば、投資家の見解とリスクシナリオが市場に対して「反対側」にある鈍角三角形は負のリスクを表し、鋭角三角形は正のエクスポージャーを表し、中央の直角の状況はゼロリスクに対応します。この概念を拡張すると、たとえば、資金フローの事前の期待からの大きさや乖離によって表されるとすれば、相対エントロピーは情報を持つ投資家の行動を特定するために仮説的に使用できます。[ 24 ]
物件 相対エントロピーは常に非負で あり、D クアラルンプール ( P ∥ Q ) ≥ 0 、 {\displaystyle D_{\text{KL}}(P\parallel Q)\geq 0,} ギブスの不等式 として知られる結果、D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} ゼロになるのは、 P = Q {\displaystyle P=Q} 対策として。 特に、P ( d x ) = p ( x ) μ ( d x ) {\displaystyle P(dx)=p(x)\mu (dx)} そしてQ ( d x ) = q ( x ) μ ( d x ) {\displaystyle Q(dx)=q(x)\mu (dx)} 、 それからp ( x ) = q ( x ) {\displaystyle p(x)=q(x)} μ {\displaystyle \mu } ほぼどこにでもある 。エントロピーH ( P ) {\displaystyle \mathrm {H} (P)} これにより、交差エントロピーの最小値が設定される。H ( P 、 Q ) {\displaystyle \mathrm {H} (P,Q)} は、P ではなくQ に基づくコードを使用する場合に必要なビット数 の期待 値であり、したがって、カルバック・ライブラー情報量は、真の分布Pではなく確率分布 Q に対応するコードを使用する場合に、X から抽出された値x を識別するために送信しなければならない追加のビット数の期待値を表します。
一般の場合の上限は存在しない。しかし、P とQが 同じ離散量を分配することによって構築された2つの離散確率分布である場合、最大値はD クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} 計算できる。[ 28 ] 相対エントロピーは連続分布に対して明確に定義されており、さらにパラメータ変換 に対して不変である。例えば、変数x から変数への変換が行われた場合y ( x ) {\displaystyle y(x)} すると、P ( d x ) = p ( x ) d x = p ~ ( y ) d y = p ~ ( y ( x ) ) | d y d x ( x ) | d x {\displaystyle P(dx)=p(x)\,dx={\tilde {p}}(y)\,dy={\tilde {p}}(y(x))\left|{\tfrac {dy}{dx}}(x)\right|\,dx} そしてQ ( d x ) = q ( x ) d x = q ~ ( y ) d y = q ~ ( y ) | d y d x ( x ) | d x {\displaystyle Q(dx)=q(x)\,dx={\tilde {q}}(y)\,dy={\tilde {q}}(y)\left|{\tfrac {dy}{dx}}(x)\right|dx} どこ| d y d x ( x ) | {\displaystyle \left|{\tfrac {dy}{dx}}(x)\right|} は導関数の絶対値、より一般的には ヤコビアン の値であり、相対エントロピーは次のように書き換えることができる。D クアラルンプール ( P ∥ Q ) = ∫ x 1 x b p ( x ) ログ p ( x ) q ( x ) d x = ∫ x 1 x b p ~ ( y ( x ) ) | d y d x | ログ p ~ ( y ( x ) ) | d y d x | q ~ ( y ( x ) ) | d y d x | d x = ∫ y 1 y b p ~ ( y ) ログ p ~ ( y ) q ~ ( y ) d y {\displaystyle {\begin{aligned}D_{\text{KL}}(P\parallel Q)&=\int _{x_{a}}^{x_{b}}p(x)\,\log {\frac {p(x)}{q(x)}}\,dx\\[6pt]&=\int _{x_{a}}^{x_{b}}{\tilde {p}}(y(x))\left|{\frac {dy}{dx}}\right|\log {\frac {{\tilde {p}}(y(x))\,\left|{\frac {dy}{dx}}\right|}{{\tilde {q}}(y(x))\,\left|{\frac {dy}{dx}}\right|}}\,dx\\&=\int _{y_{a}}^{y_{b}}{\tilde {p}}(y)\,\log {\frac {{\tilde {p}}(y)}{{\tilde {q}}(y)}}\,dy\end{aligned}}} どこy 1 = y ( x 1 ) {\displaystyle y_{a}=y(x_{a})} そしてy b = y ( x b ) {\displaystyle y_{b}=y(x_{b})} 変換は連続であると仮定したが、必ずしもそうである必要はない。また、これは相対エントロピーが次元的に一貫した 量を生成することを示している。なぜなら、x が 次元を持つ変数である場合、p ( x ) {\displaystyle p(x)} そしてq ( x ) {\displaystyle q(x)} 寸法も付けられています。例えばP ( d x ) = p ( x ) d x {\displaystyle P(dx)=p(x)\,dx} は無次元です。対数項の引数は無次元であり、当然無次元のままです。したがって、非離散確率では定義されないか負になる可能性がある情報理論[ 29 ] の他のいくつかの特性(自己情報 やシャノンエントロピー など)よりも、ある意味でより基本的な量と見なすことができます。 相対エントロピーは、シャノンエントロピーとほぼ同じように、独立分布 に対して加算されます。 P 1 、 P 2 {\displaystyle P_{1},P_{2}} は独立分布であり、P ( d x 、 d y ) = P 1 ( d x ) P 2 ( d y ) {\displaystyle P(dx,dy)=P_{1}(dx)P_{2}(dy)} 、同様にQ ( d x 、 d y ) = Q 1 ( d x ) Q 2 ( d y ) {\displaystyle Q(dx,dy)=Q_{1}(dx)Q_{2}(dy)} 独立した分布の場合Q 1 、 Q 2 {\displaystyle Q_{1},Q_{2}} それからD クアラルンプール ( P ∥ Q ) = D クアラルンプール ( P 1 ∥ Q 1 ) + D クアラルンプール ( P 2 ∥ Q 2 ) 。 {\displaystyle D_{\text{KL}}(P\parallel Q)=D_{\text{KL}}(P_{1}\parallel Q_{1})+D_{\text{KL}}(P_{2}\parallel Q_{2}).} 相対エントロピーD クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} 確率測度 のペアにおいて凸で ある( P 、 Q ) {\displaystyle (P,Q)} つまり、( P 1 、 Q 1 ) {\displaystyle (P_{1},Q_{1})} そして( P 2 、 Q 2 ) {\displaystyle (P_{2},Q_{2})} 2組の確率測度はD クアラルンプール ( λ P 1 + ( 1 − λ ) P 2 ∥ λ Q 1 + ( 1 − λ ) Q 2 ) ≤ λ D クアラルンプール ( P 1 ∥ Q 1 ) + ( 1 − λ ) D クアラルンプール ( P 2 ∥ Q 2 ) のために 0 ≤ λ ≤ 1. {\displaystyle D_{\text{KL}}(\lambda P_{1}+(1-\lambda )P_{2}\parallel \lambda Q_{1}+(1-\lambda )Q_{2})\leq \lambda D_{\text{KL}}(P_{1}\parallel Q_{1})+(1-\lambda )D_{\text{KL}}(P_{2}\parallel Q_{2}){\text{ for }}0\leq \lambda \leq 1.} D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} 最小値付近でテイラー展開される可能性がある(つまりP = Q {\displaystyle P=Q} ) としてD クアラルンプール ( P ∥ Q ) = ∑ n = 2 ∞ 1 n ( n − 1 ) ∑ x ∈ X ( Q ( x ) − P ( x ) ) n Q ( x ) n − 1 {\displaystyle D_{\text{KL}}(P\parallel Q)=\sum _{n=2}^{\infty }{\frac {1}{n(n-1)}}\sum _{x\in {\mathcal {X}}}{\frac {(Q(x)-P(x))^{n}}{Q(x)^{n-1}}}} これは、以下の場合に限り収束する。P ≤ 2 Q {\displaystyle P\leq 2Q} ほぼ確実 にQ {\displaystyle Q} 。
ドンスカーとヴァラダンによる以下の結果[ 30 ] は、ドンスカーとヴァラダンの変分公式 として知られています。
例
多変量正規分布 平均値が である 2 つの多変量正規分布が あると仮定します。μ 0 、 μ 1 {\displaystyle \mu _{0},\mu _{1}} そして(非特異な)共分散行列を持つ Σ 0 、 Σ 1 。 {\displaystyle \Sigma _{0},\Sigma _{1}.} 2 つの分布が同じ次元k を持つ場合、分布間の相対エントロピーは次のようになります。[ 31 ]
D クアラルンプール ( N 0 ∥ N 1 ) = 1 2 [ tr ( Σ 1 − 1 Σ 0 ) − k + ( μ 1 − μ 0 ) T Σ 1 − 1 ( μ 1 − μ 0 ) + ln 検出 Σ 1 検出 Σ 0 ] 。 {\displaystyle D_{\text{KL}}\left({\mathcal {N}}_{0}\parallel {\mathcal {N}}_{1}\right)={\frac {1}{2}}\left[\operatorname {tr} \left(\Sigma _{1}^{-1}\Sigma _{0}\right)-k+\left(\mu _{1}-\mu _{0}\right)^{\mathsf {T}}\Sigma _{1}^{-1}\left(\mu _{1}-\mu _{0}\right)+\ln {\frac {\det \Sigma _{1}}{\det \Sigma _{0}}}\right]{\text{.}}}
最後の項の対数は底を e にする必要があります。なぜなら、 最後 の項以外のすべての項は、密度関数の因数であるか、または自然に生じる式の底をe とする対数だからです。したがって、この式は nats 単位 で測定された結果を与えます。上記の式全体を で割ると、ln ( 2 ) {\displaystyle \ln(2)} ビット単位 の発散が得られます。
数値計算においては、結果をコレスキー分解を用いて表現すると便利である。L 0 、 L 1 {\displaystyle L_{0},L_{1}} そのためΣ 0 = L 0 L 0 T {\displaystyle \Sigma _{0}=L_{0}L_{0}^{T}} そしてΣ 1 = L 1 L 1 T {\displaystyle \Sigma _{1}=L_{1}L_{1}^{T}} すると、M とy を用いて三角線形システムの解が得られます。L 1 M = L 0 {\displaystyle L_{1}M=L_{0}} 、 そしてL 1 y = μ 1 − μ 0 {\displaystyle L_{1}y=\mu _{1}-\mu _{0}} 、
D クアラルンプール ( N 0 ∥ N 1 ) = 1 2 ( ∑ 私 、 j = 1 k ( M 私 j ) 2 − k + | y | 2 + 2 ∑ 私 = 1 k ln ( L 1 ) 私 私 ( L 0 ) 私 私 ) 。 {\displaystyle D_{\text{KL}}\left({\mathcal {N}}_{0}\parallel {\mathcal {N}}_{1}\right)={\frac {1}{2}}\left(\sum _{i,j=1}^{k}{\left(M_{ij}\right)}^{2}-k+|y|^{2}+2\sum _{i=1}^{k}\ln {\frac {(L_{1})_{ii}}{(L_{0})_{ii}}}\right){\text{.}}}
変分推論 における一般的な量であり、特殊なケースとして、対角多変量正規分布と標準正規分布(平均ゼロ、分散1)との間の相対エントロピーが挙げられる。
D クアラルンプール ( N ( ( μ 1 、 … 、 μ k ) T 、 診断 ( σ 1 2 、 … 、 σ k 2 ) ) ∥ N ( 0 、 私 ) ) = 1 2 ∑ 私 = 1 k [ σ 私 2 + μ 私 2 − 1 − ln ( σ 私 2 ) ] 。 {\displaystyle D_{\text{KL}}\left({\mathcal {N}}\left(\left(\mu _{1},\ldots ,\mu _{k}\right)^{\mathsf {T}},\operatorname {diag} \left(\sigma _{1}^{2},\ldots ,\sigma _{k}^{2}\right)\right)\parallel {\mathcal {N}}\left(\mathbf {0} ,\mathbf {I} \right)\right)={\frac {1}{2}}\sum _{i=1}^{k}\left[\sigma _{i}^{2}+\mu _{i}^{2}-1-\ln \left(\sigma _{i}^{2}\right)\right]{\text{.}}}
2 つの単変量正規分布p とq の場合、上記は[ 32 ]に簡略化されます。 D クアラルンプール ( p ∥ q ) = ログ σ 1 σ 0 + σ 0 2 + ( μ 0 − μ 1 ) 2 2 σ 1 2 − 1 2 {\displaystyle D_{\text{KL}}\left({\mathcal {p}}\parallel {\mathcal {q}}\right)=\log {\frac {\sigma _{1}}{\sigma _{0}}}+{\frac {\sigma _{0}^{2}+{\left(\mu _{0}-\mu _{1}\right)}^{2}}{2\sigma _{1}^{2}}}-{\frac {1}{2}}}
中心が一致する正規分布の場合k = σ 1 / σ 0 {\displaystyle k=\sigma _{1}/\sigma _{0}} これにより、[ 33 ] は以下のように簡略化されます。
D クアラルンプール ( p ∥ q ) = ログ 2 k + ( k − 2 − 1 ) / 2 / ln ( 2 ) b 私 t s {\displaystyle D_{\text{KL}}\left({\mathcal {p}}\parallel {\mathcal {q}}\right)=\log _{2}k+(k^{-2}-1)/2/\ln(2)\mathrm {bits} }
2 つの一様分布を考えます。p = [ A 、 B ] {\displaystyle p=[A,B]} 囲まれたq = [ C 、 D ] {\displaystyle q=[C,D]} (C ≤ A < B ≤ D {\displaystyle C\leq A<B\leq D} ) すると、情報利得は次のようになります。
D クアラルンプール ( p ∥ q ) = ログ D − C B − A {\displaystyle D_{\text{KL}}\left({\mathcal {p}}\parallel {\mathcal {q}}\right)=\log {\frac {D-C}{B-A}}}
直感的に、[ 33 ] k 倍狭い一様分布の情報利得には以下が含まれるログ 2 k {\displaystyle \log _{2}k} ビット。これはコンピューティングにおけるビットの使用と関連しており、ログ 2 k {\displaystyle \log _{2}k} kビット の長さのストリームの1つの要素を識別するには、ビットが必要になります。
指標との関連性 相対エントロピーは統計的距離 ではあるが、確率分布空間上の距離尺度 ではなく、むしろ発散 である。距離尺度は対称であり、三角不等式を満たす 線形 距離を一般化するが、発散は一般に非対称であり、二乗 距離を一般化し、場合によっては一般化されたピタゴラスの定理 を満たす。一般にD クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} 等しくないD クアラルンプール ( Q ∥ P ) {\displaystyle D_{\text{KL}}(Q\parallel P)} 、これは対称化できるが(§ 対称化された発散 を参照)、非対称性は幾何学の重要な部分である。
これは確率分布 の空間上にトポロジーを 生成します。より具体的には、{ P 1 、 P 2 、 … } {\displaystyle \{P_{1},P_{2},\ldots \}} は分布の列であり、
リム n → ∞ D クアラルンプール ( P n ∥ Q ) = 0 、 {\displaystyle \lim _{n\to \infty }D_{\text{KL}}(P_{n}\parallel Q)=0{\text{,}}}
すると、
P n → D Q 。 {\displaystyle P_{n}\xrightarrow {D} \,Q{\text{.}}}
ピンスカーの不等式 は、
P n → D P ⇒ P n → T V P 、 {\displaystyle P_{n}\xrightarrow {D} P\Rightarrow P_{n}\xrightarrow {TV} P{\text{,}}}
ここで後者は、全変動 における通常の収束を表す。
相対エントロピーはフィッシャー情報量 と直接関係があります。これは次のように明確に説明できます。確率分布P とQは どちらも何らかの(おそらく多次元の)パラメータによってパラメータ化されていると仮定します。θ {\displaystyle \theta } では、次の2つの近い値について考えてみましょう。P = P ( θ ) {\displaystyle P=P(\theta )} そしてQ = P ( θ 0 ) {\displaystyle Q=P(\theta _{0})} そのため、パラメータθ {\displaystyle \theta } パラメータ値とわずかに異なるθ 0 {\displaystyle \theta _{0}} 具体的には、(アインシュタインの総和規約 を用いると) 一次までで次のようになる。P ( θ ) = P ( θ 0 ) + Δ θ j P j ( θ 0 ) + ⋯ {\displaystyle P(\theta )=P(\theta _{0})+\Delta \theta _{j}\,P_{j}(\theta _{0})+\cdots }
とΔ θ j = ( θ − θ 0 ) j {\displaystyle \Delta \theta _{j}=(\theta -\theta _{0})_{j}} 小さな変化θ {\displaystyle \theta } j 方向において、P j ( θ 0 ) = ∂ P ∂ θ j ( θ 0 ) {\displaystyle P_{j}\left(\theta _{0}\right)={\frac {\partial P}{\partial \theta _{j}}}(\theta _{0})} 確率分布における対応する変化率。相対エントロピーは絶対最小値0を持つためP = Q {\displaystyle P=Q} つまりθ = θ 0 {\displaystyle \theta =\theta _{0}} 小さなパラメータに関しては、 2 次までしか変化しない。Δ θ j {\displaystyle \Delta \theta _{j}} より厳密に言えば、任意の最小値の場合と同様に、発散の一次導関数はゼロになる。
∂ ∂ θ j | θ = θ 0 D クアラルンプール ( P ( θ ) ∥ P ( θ 0 ) ) = 0 、 {\displaystyle \left.{\frac {\partial }{\partial \theta _{j}}}\right|_{\theta =\theta _{0}}D_{\text{KL}}(P(\theta )\parallel P(\theta _{0}))=0,}
テイラー展開 により、2次までで
D クアラルンプール ( P ( θ ) ∥ P ( θ 0 ) ) = 1 2 Δ θ j Δ θ k g j k ( θ 0 ) + ⋯ {\displaystyle D_{\text{KL}}(P(\theta )\parallel P(\theta _{0}))={\frac {1}{2}}\,\Delta \theta _{j}\,\Delta \theta _{k}\,g_{jk}(\theta _{0})+\cdots }
ここで、発散のヘッセ行列は
g j k ( θ 0 ) = ∂ 2 ∂ θ j ∂ θ k | θ = θ 0 D クアラルンプール ( P ( θ ) ∥ P ( θ 0 ) ) {\displaystyle g_{jk}(\theta _{0})=\left.{\frac {\partial ^{2}}{\partial \theta _{j}\,\partial \theta _{k}}}\right|_{\theta =\theta _{0}}D_{\text{KL}}(P(\theta )\parallel P(\theta _{0}))}
正半定値で なければならない。θ 0 {\displaystyle \theta _{0}} ヘッセ行列を変化させる(そして添え字0を削除する)g j k ( θ ) {\displaystyle g_{jk}(\theta )} θ パラメータ空間 上の(場合によっては退化している)リーマン計量 を定義する。これはフィッシャー情報計量と呼ばれる。
関連する定理がある。p ( x 、 ρ ) {\displaystyle p_{(x,\rho )}} 以下の正則性条件を満たす。
∂ ログ ( p ) ∂ ρ 、 ∂ 2 ログ ( p ) ∂ ρ 2 、 ∂ 3 ログ ( p ) ∂ ρ 3 {\displaystyle {\frac {\partial \log(p)}{\partial \rho }},{\frac {\partial ^{2}\log(p)}{\partial \rho ^{2}}},{\frac {\partial ^{3}\log(p)}{\partial \rho ^{3}}}} 存在する、 | ∂ p ∂ ρ | < F ( x ) : ∫ x = 0 ∞ F ( x ) d x < ∞ 、 | ∂ 2 p ∂ ρ 2 | < G ( x ) : ∫ x = 0 ∞ G ( x ) d x < ∞ | ∂ 3 ログ ( p ) ∂ ρ 3 | < H ( x ) : ∫ x = 0 ∞ p ( x 、 0 ) H ( x ) d x < ξ < ∞ {\displaystyle {\begin{aligned}\left|{\frac {\partial p}{\partial \rho }}\right|&<F(x):\int _{x=0}^{\infty }F(x)\,dx<\infty ,\\\left|{\frac {\partial ^{2}p}{\partial \rho ^{2}}}\right|&<G(x):\int _{x=0}^{\infty }G(x)\,dx<\infty \\\left|{\frac {\partial ^{3}\log(p)}{\partial \rho ^{3}}}\right|&<H(x):\int _{x=0}^{\infty }p(x,0)H(x)\,dx<\xi <\infty \end{aligned}}}
ここでξは ρ に依存しない。∫ x = 0 ∞ ∂ p ( x 、 ρ ) ∂ ρ | ρ = 0 d x = ∫ x = 0 ∞ ∂ 2 p ( x 、 ρ ) ∂ ρ 2 | ρ = 0 d x = 0 {\displaystyle \left.\int _{x=0}^{\infty }{\frac {\partial p(x,\rho )}{\partial \rho }}\right|_{\rho =0}\,dx=\left.\int _{x=0}^{\infty }{\frac {\partial ^{2}p(x,\rho )}{\partial \rho ^{2}}}\right|_{\rho =0}\,dx=0}
それから: D ( p ( x 、 0 ) ∥ p ( x 、 ρ ) ) = c ρ 2 2 + O ( ρ 3 ) として ρ → 0 。 {\displaystyle {\mathcal {D}}(p(x,0)\parallel p(x,\rho ))={\frac {c\rho ^{2}}{2}}+{\mathcal {O}}\left(\rho ^{3}\right){\text{ as }}\rho \to 0{\text{.}}}
モーヴメトリック MAUVEは、モデルによって生成されたテキストと人間が書いたテキストの違いなど、2つのテキスト分布間の統計的なギャップを測定する指標です。この指標は、基礎モデル の量子化された埋め込み空間における2つの分布間のカルバック・ライブラー情報量を用いて計算されます。
情報理論における他の多くの量は、相対エントロピーを特定の事例に適用したものとして解釈できる。
自己情報量 (信号、確率変数、または事象の 情報量 とも呼ばれる)は、特定の事象が発生する確率 の負の対数として定義される。
離散確率変数 に適用した場合、自己情報は次のように表すことができます。
私 ( m ) = D クアラルンプール ( δ 私は ∥ { p 私 } ) 、 {\displaystyle \operatorname {\operatorname {I} } (m)=D_{\text{KL}}\left(\delta _{\text{im}}\parallel \{p_{i}\}\right),}
確率分布の相対エントロピーP ( 私 ) {\displaystyle P(i)} 確実性を表すクロネッカーデルタ から私 = m {\displaystyle i=m} つまり、確率分布のみの場合、i を 識別するために送信する必要のある追加ビット数P ( 私 ) {\displaystyle P(i)} 受信者が利用できるのは、私 = m {\displaystyle i=m} 。
相互情報量 、
私 ( X ; Y ) = D クアラルンプール ( P X 、 Y ∥ P X ⋅ P Y ) = E X [ D クアラルンプール Y ( P Y ∣ X ∥ P Y ) ] = E Y [ D クアラルンプール X ( P X ∣ Y ∥ P X ) ] {\displaystyle {\begin{aligned}\operatorname {I} (X;Y)&=D_{\text{KL}}(P_{X,Y}\parallel P_{X}\cdot P_{Y})\\&=\operatorname {E} _{X}[D_{\text{KL}}^{Y}(P_{Y\mid X}\parallel P_{Y})]\\&=\operatorname {E} _{Y}[D_{\text{KL}}^{X}(P_{X\mid Y}\parallel P_{X})]\end{aligned}}}
は結合確率分布 の相対エントロピーである。P X 、 Y ( x 、 y ) {\displaystyle P_{X,Y}(x,y)} 製品から( P X ⋅ P Y ) ( x 、 y ) = P X ( x ) P Y ( y ) {\displaystyle (P_{X}\cdot P_{Y})(x,y)=P_{X}(x)P_{Y}(y)} 2 つの周辺確率分布のうち、つまり、X と Y を結合分布ではなく周辺分布のみを使用して符号化した場合に、 X とY を 識別するために送信する必要がある追加ビット数の期待値。
条件付きエントロピー 条件付きエントロピー [ 35 ] 、
H ( X ∣ Y ) = ログ N − D クアラルンプール ( P ( X 、 Y ) ∥ P U ( X ) P ( Y ) ) = ログ N − D クアラルンプール ( P ( X 、 Y ) ∥ P ( X ) P ( Y ) ) − D クアラルンプール ( P ( X ) ∥ P U ( X ) ) = H ( X ) − 私 ( X ; Y ) = ログ N − E Y [ D クアラルンプール ( P ( X ∣ Y ) ∥ P U ( X ) ) ] {\displaystyle {\begin{aligned}\mathrm {H} (X\mid Y)&=\log N-D_{\text{KL}}(P(X,Y)\parallel P_{U}(X)P(Y))\\[5pt]&=\log N-D_{\text{KL}}(P(X,Y)\parallel P(X)P(Y))-D_{\text{KL}}(P(X)\parallel P_{U}(X))\\[5pt]&=\mathrm {H} (X)-\operatorname {I} (X;Y)\\[5pt]&=\log N-\operatorname {E} _{Y}\left[D_{\text{KL}}\left(P\left(X\mid Y\right)\parallel P_{U}(X)\right)\right]\end{aligned}}}
これは、 N個 の等確率な可能性の中からXを 識別するために送信する必要のあるビット数から、真の同時分布の相対エントロピーを差し引いた値である。 P ( X 、 Y ) {\displaystyle P(X,Y)} 製品流通からP U ( X ) P ( Y ) {\displaystyle P_{U}(X)P(Y)} つまり、X の値が一様分布に従って符号化された場合に送信する必要があったであろう、節約されたビット数の期待値を差し引いた値である。 P U ( X ) {\displaystyle P_{U}(X)} 条件付き分布ではなくP ( X | Y ) {\displaystyle P(X|Y)} Y が与えられた場合のX。
交差エントロピー 分布p から得られる一連の可能なイベントがある場合、エントロピー符号化を使用してそれらを( ロスレスデータ圧縮 で)エンコードできます。これは、各固定長の入力シンボルを対応する一意の可変長の接頭辞なしコード に置き換えることでデータを圧縮します(例:確率 p = (1/2, 1/4, 1/4) のイベント (A, B, C) は、ビット (0, 10, 11) としてエンコードできます)。分布p が事前にわかっている場合は、最適なエンコードを考案できます(例:ハフマン符号化を 使用)。つまり、エンコードされたメッセージは平均して最短の長さになります(エンコードされたイベントがp からサンプリングされていると仮定した場合)。これは、p のシャノンのエントロピー (と表記)に等しくなります。H ( p ) {\displaystyle \mathrm {H} (p)} ただし、エントロピー符号化方式を作成する際に異なる確率分布(q )を使用すると、可能性のセットからイベントを識別するために(平均して)より多くの ビットが使用されます。この新しい(より大きな)数は、 p とq の間のクロスエントロピー によって測定されます。
2 つの確率分布 ( p とq ) 間の交差エントロピーは、与えられた確率分布 q に基づく符号化方式を使用した場合に、可能性の集合からイベントを識別するために必要な平均ビット数を測定 し ます。 これは、「真の」分布p を使用した場合とは異なります。したがって、同じ確率空間上の 2 つの分布 p とq の交差エントロピーは、次のように定義されます。
H ( p 、 q ) = E p [ − ログ q ] = H ( p ) + D クアラルンプール ( p ∥ q ) {\displaystyle \mathrm {H} (p,q)=\operatorname {E} _{p}[-\log q]=\mathrm {H} (p)+D_{\text{KL}}(p\parallel q)}
この導出過程の詳細については、上記の「動機」の 項を参照してください。
このシナリオでは、相対エントロピー(klダイバージェンス)は、平均して必要なビットの追加数(H ( p ) {\displaystyle \mathrm {H} (p)} )エンコードスキームを構築するためにpの代わりに q を使用するため、イベントをエンコードします。
ベイズ更新 ベイズ統計学 では、相対エントロピーは、事前分布から 事後分布 への移行における情報利得の尺度として使用できます。p ( x ) → p ( x ∣ 私 ) {\displaystyle p(x)\to p(x\mid I)} もし新たな事実がY = y {\displaystyle Y=y} が発見されると、 X の事後分布を更新するために使用できます。p ( x ∣ 私 ) {\displaystyle p(x\mid I)} 新しい事後分布へp ( x ∣ y 、 私 ) {\displaystyle p(x\mid y,I)} ベイズの定理 を用いる:
p ( x ∣ y 、 私 ) = p ( y ∣ x 、 私 ) p ( x ∣ 私 ) p ( y ∣ 私 ) {\displaystyle p(x\mid y,I)={\frac {p(y\mid x,I)p(x\mid I)}{p(y\mid I)}}}
この分布には新しいエントロピー があります。
H ( p ( x ∣ y 、 私 ) ) = − ∑ x p ( x ∣ y 、 私 ) ログ p ( x ∣ y 、 私 ) 、 {\displaystyle \mathrm {H} {\big (}p(x\mid y,I){\big )}=-\sum _{x}p(x\mid y,I)\log p(x\mid y,I){\text{,}}}
これは元のエントロピーよりも小さい場合も大きい場合もある。H ( p ( x ∣ 私 ) ) {\displaystyle \mathrm {H} (p(x\mid I))} しかし、新しい確率分布の観点からは、元のコードに基づいて、p ( x ∣ 私 ) {\displaystyle p(x\mid I)} 新しいコードの代わりにp ( x ∣ y 、 私 ) {\displaystyle p(x\mid y,I)} 予想通りのビット数が追加されるはずだった:
D クアラルンプール ( p ( x ∣ y 、 私 ) ∥ p ( x ∣ 私 ) ) = ∑ x p ( x ∣ y 、 私 ) ログ p ( x ∣ y 、 私 ) p ( x ∣ 私 ) {\displaystyle D_{\text{KL}}{\big (}p(x\mid y,I)\parallel p(x\mid I){\big )}=\sum _{x}p(x\mid y,I)\log {\frac {p(x\mid y,I)}{p(x\mid I)}}}
メッセージの長さに比例します。したがって、これは、 X を発見することによって得られた有用な情報、つまり情報利得の量を表します。Y = y {\displaystyle Y=y} 。
さらにデータがあれば、Y 2 = y 2 {\displaystyle Y_{2}=y_{2}} その後、x の確率分布がさらに更新され、新しい最良推定値が得られます。p ( x ∣ y 1 、 y 2 、 私 ) {\displaystyle p(x\mid y_{1},y_{2},I)} 情報利得を再調査する場合p ( x ∣ y 1 、 私 ) {\displaystyle p(x\mid y_{1},I)} それよりもp ( x ∣ 私 ) {\displaystyle p(x\mid I)} 実際には、以前の推定値よりも大きい場合も小さい場合もあることが判明した。
∑ x p ( x ∣ y 1 、 y 2 、 私 ) ログ p ( x ∣ y 1 、 y 2 、 私 ) p ( x ∣ 私 ) {\displaystyle \sum _{x}p(x\mid y_{1},y_{2},I)\log {\frac {p(x\mid y_{1},y_{2},I)}{p(x\mid I)}}} ≤ または > となる可能性がある∑ x p ( x ∣ y 1 、 私 ) ログ p ( x ∣ y 1 、 私 ) p ( x ∣ 私 ) {\textstyle \sum _{x}p(x\mid y_{1},I)\log {\frac {p(x\mid y_{1},I)}{p(x\mid I)}}}
したがって、合成情報利得は三角不等式を満たさない。
D クアラルンプール ( p ( x ∣ y 1 、 y 2 、 私 ) ∥ p ( x ∣ 私 ) ) {\displaystyle D_{\text{KL}}{\big (}p(x\mid y_{1},y_{2},I)\parallel p(x\mid I){\big )}} <、=、または> になる可能性があるD クアラルンプール ( p ( x ∣ y 1 、 y 2 、 私 ) ∥ p ( x ∣ y 1 、 私 ) ) + D クアラルンプール ( p ( x ∣ y 1 、 私 ) ∥ p ( x ∣ 私 ) ) {\displaystyle D_{\text{KL}}{\big (}p(x\mid y_{1},y_{2},I)\parallel p(x\mid y_{1},I){\big )}+D_{\text{KL}}{\big (}p(x\mid y_{1},I)\parallel p(x\mid I){\big )}}
平均 的に言えば、平均化してp ( y 2 ∣ y 1 、 x 、 私 ) {\displaystyle p(y_{2}\mid y_{1},x,I)} 両者は平均化されるだろう。
ベイズ実験計画法 ベイズ実験計画法 の一般的な目標は、事前分布と事後分布の間の期待相対エントロピーを最大化することです。[ 36 ] 事後分布がガウス分布に近似される場合、期待相対エントロピーを最大化する計画は、ベイズd最適 と呼ばれます。
ヒルベルト空間 上の密度行列 P とQ に対して、Q からP への量子相対エントロピーは 次のように定義される。
D クアラルンプール ( P ∥ Q ) = Tr ( P ( ログ P − ログ Q ) ) 。 {\displaystyle D_{\text{KL}}(P\parallel Q)=\operatorname {Tr} (P(\log P-\log Q)).}
量子情報科学 では、D クアラルンプール ( P ∥ Q ) {\displaystyle D_{\text{KL}}(P\parallel Q)} すべての分離可能な状態Q は 、状態Pにおける エンタングルメント の尺度としても使用できます。
対称化された発散 Kullback & Leibler (1951) は対称化された関数も検討した:
D クアラルンプール ( P ∥ Q ) + D クアラルンプール ( Q ∥ P ) {\displaystyle D_{\text{KL}}(P\parallel Q)+D_{\text{KL}}(Q\parallel P)}
彼らはこれを「発散」と呼んでいたが、今日では「KL発散」は非対称関数を指す(用語の進化については§ 語源を 参照)。この関数は対称かつ非負であり、 1948年にハロルド・ジェフリーズによって既に定義され使用されていた 。そのため、ジェフリーズ発散 と呼ばれている。
この量は、分類 問題における特徴選択 に用いられることがあり、 P とQは 、2つの異なるクラスにおける特徴の条件付き確率密度関数を表します。銀行・金融業界では、この量は 人口安定性指数 (PSI )と呼ばれ、モデルの特徴における時間経過に伴う分布の変化を評価するために使用されます。
代替案はλ {\displaystyle \lambda } -発散、
D λ ( P ∥ Q ) = λ D クアラルンプール ( P ∥ λ P + ( 1 − λ ) Q ) + ( 1 − λ ) D クアラルンプール ( Q ∥ λ P + ( 1 − λ ) Q ) 、 {\displaystyle D_{\lambda }(P\parallel Q)=\lambda D_{\text{KL}}(P\parallel \lambda P+(1-\lambda )Q)+(1-\lambda )D_{\text{KL}}(Q\parallel \lambda P+(1-\lambda )Q){\text{,}}}
これは、 Xが どの確率分布(P またはQ) から抽出されたかを発見することによって得られるX に関する期待情報利得として解釈できる。ただし、現在、確率が与えられている場合に限る。λ {\displaystyle \lambda } そして1 − λ {\displaystyle 1-\lambda } それぞれ。
価値λ = 0.5 {\displaystyle \lambda =0.5} ジェンセン・シャノン発散 は、次のように定義される。
D JS = 1 2 D クアラルンプール ( P ∥ M ) + 1 2 D クアラルンプール ( Q ∥ M ) {\displaystyle D_{\text{JS}}={\tfrac {1}{2}}D_{\text{KL}}(P\parallel M)+{\tfrac {1}{2}}D_{\text{KL}}(Q\parallel M)}
ここで、M は2つの分布の平均であり、
M = 1 2 ( P + Q ) 。 {\displaystyle M={\tfrac {1}{2}}\left(P+Q\right){\text{.}}}
また解釈することもできますD JS {\displaystyle D_{\text{JS}}} 2 つの入力から出力分布P とQ が得られるノイズのある情報チャネルの容量として定義されます。ジェンセン・シャノン発散は、すべてのf 発散と同様に、局所的に フィッシャー情報量 に比例します。統計的多様体 上に同じアフィン接続を 誘導するという点で、ヘリンジャー計量 に似ています。
さらに、ジェンセン・シャノン発散は、抽象的な平均Mに依存する抽象的な統計的M混合を用いて一般化することができる。[ 46 ] [ 47 ]
データ差分 絶対エントロピーが データ圧縮 の理論的背景となるのと同様に、相対エントロピーは データ差分 の理論的背景となる。この意味でのデータセットの絶対エントロピーは、それを復元するために必要なデータ(最小圧縮サイズ)であり、ソースデータセットが与えられた場合のターゲットデータセットの相対エントロピーは、ソースが与えられた場合のターゲットを復元するために必要なデータ( パッチ の最小サイズ)である。
参考文献 1 2 Csiszar, I (1975 年 2 月). "確率分布と最小化問題の I-発散幾何学" . Ann. Probab . 3 (1): 146– 158. doi : 10.1214/aop/1176996454 . ↑ Kullback, S. ; Leibler, RA (1951). "情報と十分性について" . Annals of Mathematical Statistics . 22 (1): 79– 86. doi : 10.1214/aoms/1177729694 . JSTOR 2236703 . MR 0039968 . ↑ Kullback, S. (1987). "編集者への手紙: カルバック-ライブラー距離" . The American Statistician . 41 (4): 340– 341. doi : 10.1080/00031305.1987.10475510 . JSTOR 2684769 . ↑ MacKay , David JC (2003). 情報理論、推論、学習アルゴリズム (第1 版). Cambridge University Press. p. 34. ISBN 978-0-521-64298-9 ―Google ブックス経由。↑ 「カルバック・ライブラー(KL)ダイバージェンスの最大値は?」 。機械学習。Statistics Stack Exchange(stats.stackexchange.com) 。クロスバリデーション済み。 ↑ 「どのような状況で積分は無限大になるのか?」 . 積分。Mathematics Stack Exchange (math.stackexchange.com) . ↑ ビショップ、クリストファー M. パターン認識と機械学習 。p . 55。OCLC 1334664824 。 ↑ Burnham , KP; Anderson, DR (2002). Model Selection and Multi-Model Inference (2nd ed.). Springer. p. 51. ISBN 978-0-387-95364-9 。↑ Abdulkadirov, Ruslan; Lyakhov, Pavel; Nagornov, Nikolay (2023 年 1 月). "現代ニューラル ネットワークにおける最適化アルゴリズムの概観" . Mathematics . 11 (11): 2466. doi : 10.3390/math11112466 . ISSN 2227-7390 . ↑ Matassa, Marco (2021 年 12 月). "量子射影空間における Fubini-Study 計量と Levi-Civita 接続" . Advances in Mathematics . 393 108101. arXiv : 2010.03291 . doi : 10.1016/j.aim.2021.108101 . ISSN 0001-8708 . ↑ Lan, Guanghui (2023 年 3 月). "強化学習のためのポリシーミラー降下法: 線形収束、新しいサンプリング複雑性、および一般化された問題クラス" . Mathematical Programming . 198 (1): 1059– 1106. arXiv : 2102.00135 . doi : 10.1007/s10107-022-01816-5 . ISSN 1436-4646 . 2025 年 11 月 3 日のオリジナルから アーカイブ済み。2024 年 11 月 18 日 取得 。 ↑ Kelly, JL Jr. (1956). "情報レートの新しい解釈". Bell Syst. Tech. J . 2 (4): 917– 926. doi : 10.1002/j.1538-7305.1956.tb03809.x . ↑ Soklakov, AN (2020). "意見の相違の経済学 ― レニー発散の金融的直観" . Entropy . 22 (8): 860. arXiv : 1811.08308 . Bibcode : 2020Entrp..22..860S . doi : 10.3390/e22080860 . PMC 7517462 . PMID 33286632 . ↑ Soklakov, AN (2023). "リスクとリターンの情報幾何学". Risk . 6月 . SSRN 4134885 . ↑ Henide, Karim (2024年9月30日). 「フローライダー:取引可能なエコシステムの相対的エントロピーが相対的価値の決定要因となる」 The Journal of Investing . 33 (6): 34– 58. doi : 10.3905/joi.2024.1.321 . ↑ Sanov, IN (1957). 「ランダムな大きさの大きな偏差の確率について」. Mat. Sbornik . 42 (84): 11–44 . ↑ Novak SY (2011), Extreme Value Methods with Applications to Finance ch. 14.5 ( Chapman & Hall ). ISBN 978-1-4398-3574-6 。 ↑ ホブソン、アーサー(1971)。 統計力学の概念 。ニューヨーク:ゴードン・アンド・ブリーチ 。ISBN 978-0-677-03240-5 。↑ Bonnici, V. (2020). "量子分布間のカルバック・ライブラー発散とその上限". arXiv : 2008.05932 [ cs.LG ]. ↑ セルジオ・ベルドゥによる NIPS 2009の ビデオ講義( Wayback Machine に2018年12月25日に アーカイブ済み)の「 微分 エントロピー – 4」のセクションを参照 ↑ Donsker, Monroe D.; Varadhan, SR Srinivasa (1983). "長時間における特定のマルコフ過程期待値の漸近評価 IV". Communications on Pure and Applied Mathematics . 36 (2): 183– 212. doi : 10.1002/cpa.3160360204 . ↑ Duchi J. 「線形代数と最適化のための導出」 (PDF) 。p. 13。 2018年4月17日に オリジナル (PDF) からアーカイブ済み。 ↑ Belov, Dmitry I.; Armstrong, Ronald D. (2011-04-15). "Kullback-Leibler divergence の分布とその応用". British Journal of Mathematical and Statistical Psychology . 64 (2): 291– 309. doi : 10.1348/000711010x522227 . ISSN 0007-1102 . PMID 21492134 . 1 2 Buchner, Johannes (2022-04-29). 物理学者のための直観:実験からの情報利得 . OCLC 1363563215 . ↑ Nielsen, Frank; Garcia, Vincent (2011). "統計的指数型分布族:フラッシュカード付きダイジェスト". arXiv : 0911.4863 [ cs.LG ]. 1 2 カバー、トーマス M.、トーマス、ジョイ A. (1991)、 『情報理論の要素』 、 ジョン・ワイリー&サンズ 、p. 22 ↑ Chaloner, K.; Verdinelli, I. (1995). "ベイズ実験計画法:レビュー" . Statistical Science . 10 (3): 273– 304. doi : 10.1214/ss/1177009939 . hdl : 11299/199630 . ↑ Press, WH; Teukolsky, SA; Vetterling, WT; Flannery, BP (2007). 「セクション 14.7.2. カルバック・ライブラー距離」. Numerical Recipes: The Art of Scientific Computing (第 3 版). Cambridge University Press. ISBN 978-0-521-88068-8 。↑ トリバス、マイロン (1959)。 熱力学と熱力学:エネルギー、情報、物質の状態への入門、および工学的応用 。ヴァン・ノストランド。 ↑ Jaynes, ET (1957). "情報理論と統計力学" (PDF) . Physical Review . 106 (4): 620– 630. Bibcode : 1957PhRv..106..620J . doi : 10.1103/physrev.106.620 . S2CID 17870175 . 2024-12-14 のオリジナルから アーカイブ (PDF) . 2008-02-18 に取得 . ↑ Jaynes, ET (1957). "情報理論と統計力学 II" (PDF) . Physical Review . 108 (2): 171– 190. Bibcode : 1957PhRv..108..171J . doi : 10.1103/physrev.108.171 . 2011-05-14 のオリジナルから アーカイブ (PDF) . 2008-02-18 に取得 . ↑ ギブス、ジョサイア・ウィラード (1871)。 表面を用いた物質の熱力学的性質の幾何学的表現法 。アカデミー。 52ページの脚注。↑ Tribus, M.; McIrvine, EC (1971). "エネルギーと情報". Scientific American . 224 (3): 179–186 . Bibcode : 1971SciAm.225c.179T . doi : 10.1038/scientificamerican0971-179 . ↑ Fraundorf, P. (2007). "相関に基づく複雑性の熱的根源" . Complexity . 13 (3): 18– 26. arXiv : 1103.2481 . Bibcode : 2008Cmplx..13c..18F . doi : 10.1002/cplx.20195 . S2CID 20794688 . {{cite journal}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)↑ Burnham, KP; Anderson, DR (2001). "生態学的研究における強力な推論の基礎としてのKullback–Leibler情報" . Wildlife Research . 28 (2): 111– 119. doi : 10.1071/WR99107 . ↑ Burnham, Kenneth P. (2010年12月). モデル選択とマルチモデル推論:実践的な情報理論的アプローチ . Springer. ISBN 978-1-4419-2973-0 OCLC 878132909 ↑ Nielsen, Frank (2019). "抽象的な平均に基づく距離の Jensen–Shannon 対称化について" . Entropy . 21 (5): 485. arXiv : 1904.04017 . Bibcode : 2019Entrp..21..485N . doi : 10.3390/e21050485 . PMC 7514974 . PMID 33267199 . ↑ Nielsen, Frank (2020). "On a Generalization of the Jensen–Shannon Divergence and the Jensen–Shannon Centroid" . Entropy . 22 (2): 221. arXiv : 1912.00610 . Bibcode : 2020Entrp..22..221N . doi : 10.3390/e22020221 . PMC 7516653 . PMID 33285995 . ↑ ブレタニョール、J.; Huber, C. (1978)、「Estimation des densités : Risque minimax」、 Séminaire de Probabilités XII 、Lecture Notes in Mathematics (フランス語)、vol. 649、ベルリン、ハイデルベルク:シュプリンガー ベルリン ハイデルベルク、pp. 342–363 、 doi : 10.1007/bfb0064610 、 ISBN 978-3-540-08761-8 S2CID 122597694 補題2.1↑ B.) 、 Tsybakov、AB (Alexandre (2010)。 非パラメトリック推定入門 。Springer。ISBN 978-1-4419-2709-5 . OCLC 757859245 . {{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク) 式 2.25。↑ Rubner, Y.; Tomasi, C.; Guibas, LJ (2000). "The earth mover's distance as a metric for image retrieval". International Journal of Computer Vision . 40 (2): 99–121 . doi : 10.1023/A:1026543900054 . S2CID 14106275 . 天里俊一 (2016).情報幾何学とその応用 . 応用数理科学. 第 194巻. シュプリンガージャパン. pp. XIII, 374. doi : 10.1007/978-4-431-55978-8 . ISBN 978-4-431-55977-1 。ソロモン・クルバック(1959)『情報理論と統計学 』ジョン・ワイリー・アンド・サンズ 1968年にドーバー出版 より再版、1978年に再版。ISBN 0-8446-5625-9 。ジェフリーズ、ハロルド(1948)。確率論 (第2 版)。オックスフォード大学出版局。
外部リンク 情報理論的推定ツールボックス カルバック・ライブラー情報量を計算するためのRuby gem ジョン・シュレンズによるカルバック・ライブラー情報量と尤度理論に関するチュートリアル 離散分布のカルバック・ライブラー情報量を計算するためのMATLABコード( 2007年9月29日にWayback Machine に アーカイブ済み) セルジオ・ベルドゥ 、「相対エントロピー」、NIPS 2009。1時間のビデオ講義。情報理論的乖離尺度の現代的な要約