数理統計距離測定
数理統計学 において 、 カルバック・ライブラー ( KL ) ダイバージェンス ( 相対エントロピー や Iダイバージェンス [1] とも呼ばれる)は、 統計的距離 の一種であり、1つの基準 確率分布 Pが2番目の確率分布 Q とどの程度異なるかを 示す尺度である 。 [2] 数学的には次のように定義される。
だ
クアラルンプール
(
ポ
∠
質問
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
だ
クアラルンプール
(
ポ
∠
質問
)
=
∑
x
∈
バツ
ポ
(
x
)
ログ
(
ポ
(
x
)
質問
(
x
)
)
。
{\displaystyle D_{\text{KL}}(P\parallel Q)=\sum _{x\in {\mathcal {X}}}P(x)\ \log \left({\frac {\ P(x)\ }{Q(x)}}\right).}
P から Q への KL ダイバージェンスの単純な解釈は、 実際の分布が Pであるときに、 Pの代わりに Q を モデルとして 使用することによって 予想される 過剰 サプライズ です 。これは 2 つの分布がどれだけ異なるかを測定するものであり、ある意味では「距離」ですが、実際には、最もよく知られた正式な種類の距離である メトリックではありません。特に、これは 2 つの分布で対称ではなく ( 情報の変化 とは対照的 )、 三角不等式を 満たしません。代わりに、 情報幾何学の観点から、これは ダイバージェンス の一種であり 、 平方距離 の一般化であり 、分布の特定のクラス (特に 指数族) に対して、一般化された ピタゴラスの定理 (平方距離に適用される)を満たします 。
相対エントロピーは常に非負の実数で、2 つの分布が同一の場合のみ、値が 0 になります。相対エントロピーは、 情報システムにおける相対 (シャノン) エントロピー、連続 時系列におけるランダム性、 推論の統計モデルを比較する際の情報ゲインなどの理論的な用途と、応用統計、 流体力学 、 神経科学 、 バイオインフォマティクス 、 機械学習 などの実用的な用途の両方で、多岐 にわたります 。
はじめにと背景
2 つの確率分布 P と Q を考えてみましょう。通常、 P は データ、観測値、または測定された確率分布を表します。分布 Q は、 P の理論、モデル、説明、または近似を表します 。Kullback–Leibler 情報量は、 P に最適化されたコードではなく Q に最適化されたコードを使用して P のサンプルをエンコードするために必要なビット数の平均差として解釈されます。 期待値最大化アルゴリズム (EM) や 証拠下限値 (ELBO) の計算
など、計算が容易な状況では、 P と Q の役割が逆転する可能性があることに注意してください。
だ
クアラルンプール
(
ポ
∠
質問
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
語源
相対エントロピーは、 ソロモン・カルバック と リチャード・ライブラー によって、カルバック&ライブラー(1951)で「からの観測ごとに と を 判別するための平均情報 」として導入されました。 ここで、2つの確率測度 を比較しており 、 は それぞれ測度 から選択する仮説です 。彼らはこれを で表し、「 と の間の「ダイバージェンス」 」を対称化された量 として定義しました。これは、 1948年に ハロルド・ジェフリーズ によってすでに定義され、使用されていました。 カルバック(1959)では、対称化された形式は再び「ダイバージェンス」と呼ばれ、各方向の相対エントロピーは、2つの分布間の「有向ダイバージェンス」と呼ばれています。 判別情報 という用語を好みました 。 [9] 「ダイバージェンス」という用語は、距離(メトリック)とは対照的です。対称化されたダイバージェンスは三角不等式を満たさないためです。 対称化されたダイバージェンスの以前の使用法と他の 統計的距離 については、Kullback(1959、pp. 6–7、§1.3 Divergence)に多数言及されています。非対称の「有向ダイバージェンス」はKullback-Leiblerダイバージェンスとして知られるようになり、対称化された「ダイバージェンス」は現在 Jeffreysダイバージェンス と呼ばれています。
H
1
{\displaystyle H_{1}}
H
2
{\displaystyle H_{2}}
μ
1
{\displaystyle \mu_{1}}
μ
1
、
μ
2
{\displaystyle \mu _{1},\mu _{2}}
H
1
、
H
2
{\displaystyle H_{1},H_{2}}
μ
1
、
μ
2
{\displaystyle \mu _{1},\mu _{2}}
私
(
1
:
2
)
{\displaystyle I(1:2)}
μ
1
{\displaystyle \mu_{1}}
μ
2
{\displaystyle \mu_{2}}
J
(
1
、
2
)
=
私
(
1
:
2
)
+
私
(
2
:
1
)
{\displaystyle J(1,2)=I(1:2)+I(2:1)}
意味
同じ 標本空間上で定義された 離散確率分布 P と Q に対して 、 Qから P へ の相対エントロピーは [11] で次のように
定義される。
バツ
、
{\displaystyle \ {\mathcal {X}}\ ,}
だ
クアラルンプール
(
ポ
∠
質問
)
=
∑
x
∈
バツ
ポ
(
x
)
ログ
(
ポ
(
x
)
質問
(
x
)
)
、
{\displaystyle D_{\text{KL}}(P\parallel Q)=\sum _{x\in {\mathcal {X}}}P(x)\ \log \left({\frac {\ P(x)\ }{Q(x)}}\right)\ ,}
これは次の式と同等である。
だ
クアラルンプール
(
ポ
∠
質問
)
=
−
∑
x
∈
バツ
ポ
(
x
)
ログ
(
質問
(
x
)
ポ
(
x
)
)
。
{\displaystyle D_{\text{KL}}(P\parallel Q)=-\sum _{x\in {\mathcal {X}}}P(x)\ \log \left({\frac {\ Q(x)\ }{P(x)}}\right)~.}
言い換えれば、 確率 P と Qの対数差の 期待値 であり、期待値は確率 P を 使用して求められます。
相対エントロピーは、すべての x に対して( 絶対連続性 )が成り立つ 場合にのみ、このように定義されます。それ以外の場合は、多くの場合 、 と定義されます [1]。 ただし、 の値は、の範囲が無限大である 限り 、どこでも の 場合でも可能です [12] [13] 。同様のコメントが、以下で定義する連続測度および一般測度の場合にも当てはまります。
質問
(
x
)
=
0
{\displaystyle \Q(x)=0\}
ポ
(
x
)
=
0
{\displaystyle \P(x)=0\}
+
∞
{\displaystyle +\infty}
+
∞
{\displaystyle \+\infty\}
質問
(
x
)
≠
0
{\displaystyle \Q(x)\neq 0\}
バツ
{\displaystyle \ {\mathcal {X}}\ }
がゼロのときは、 対応する項の寄与はゼロと解釈される。
ポ
(
x
)
{\displaystyle \P(x)\}
リム
x
→
0
+
x
ログ
(
x
)
=
0
。
{\displaystyle \lim _{x\to 0^{+}}x\log(x)=0~.}
連続確率変数 の 分布 P と Q に対して、相対エントロピーは積分として定義される [14]
だ
クアラルンプール
(
ポ
∠
質問
)
=
∫
−
∞
∞
p
(
x
)
ログ
(
p
(
x
)
q
(
x
)
)
d
x
、
{\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{-\infty }^{\infty }p(x)\ \log \left({\frac {p(x)}{q(x)}}\right)\ \mathrm {d} \ \!x\ ,}
ここで、 p と qは P と Q の 確率密度 を表します 。
より一般的には、 P と Qが 測定可能な空間 上の 確率 測度 であり、 Pが Q に関して 絶対連続で ある場合、 Qから P へ の相対エントロピーは 次のように定義される。
バツ
、
{\displaystyle \ {\mathcal {X}}\ ,}
だ
クアラルンプール
(
ポ
∠
質問
)
=
∫
x
∈
バツ
ログ
(
ポ
(
d
x
)
質問
(
d
x
)
)
ポ
(
d
x
)
、
{\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{x\in {\mathcal {X}}}\ \log \left({\frac {P(\mathrm {d} \ \!x)}{Q(\mathrm {d} \ \!x)}}\right)\ P(\mathrm {d} \ \!x)\ ,}
ここで は P の Q に関する ラドン ・ニコディム微分、つまり P が Q に関して絶対連続である ため存在する、 上 の唯一の Q の ほぼどこでも定義される関数 r です。また、右辺の式が存在すると仮定します。同様に (連鎖律 により ) 、これは次のように書くことができます。
ポ
(
d
x
)
質問
(
d
x
)
{\displaystyle \ {\frac {\ P(\mathrm {d} \ \!x)\ }{Q(\mathrm {d} \ \!x)\ }}}
バツ
{\displaystyle \ {\mathcal {X}}\ }
ポ
(
d
x
)
=
r
(
x
)
質問
(
d
x
)
{\displaystyle \P(\mathrm {d} \ \!x)=r(x)Q(\mathrm {d} \ \!x)\ }
だ
クアラルンプール
(
ポ
∠
質問
)
=
∫
x
∈
バツ
ポ
(
d
x
)
質問
(
d
x
)
ログ
(
ポ
(
d
x
)
質問
(
d
x
)
)
質問
(
d
x
)
、
{\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{x\in {\mathcal {X}}}{\frac {P(\mathrm {d} \ \!x)}{Q(\mathrm {d} \ \!x)}}\ \log \left({\frac {P(\mathrm {d} \ \!x)}{Q(\mathrm {d} \ \!x)}}\right)\ Q(\mathrm {d} \ \!x)\ ,}
これはP の Q に対する相対的な エントロピー です 。この場合、 が 上の任意の測度で、 および の 密度 p および q が 存在する場合(つまり、 P と Q は 両方とも に関して絶対連続である)、 Qから P へ の相対エントロピーは 次のように与えられます。
μ
{\displaystyle \mu}
バツ
{\displaystyle {\mathcal {X}}}
ポ
(
d
x
)
=
p
(
x
)
μ
(
d
x
)
{\displaystyle \ P(\mathrm {d} \ \!x)=p(x)\mu (\mathrm {d} \ \!x)\ }
Q
(
d
x
)
=
q
(
x
)
μ
(
d
x
)
{\displaystyle \ Q(\mathrm {d} \ \!x)=q(x)\mu (\mathrm {d} \ \!x)\ }
μ
{\displaystyle \ \mu \ }
D
KL
(
P
∥
Q
)
=
∫
x
∈
X
p
(
x
)
log
(
p
(
x
)
q
(
x
)
)
μ
(
d
x
)
.
{\displaystyle D_{\text{KL}}(P\parallel Q)=\int _{x\in {\mathcal {X}}}p(x)\ \log \left({\frac {\ p(x)\ }{q(x)}}\right)\ \mu (\mathrm {d} \ \!x)~.}
密度を定義できる 測度は常に存在することに注意してください。なぜなら、 を取ることができるからです。 ただし、実際には、連続分布の場合は、通常、 という文脈では という測度になります 。 これら の 式 の 対数は 、情報が ビット 単位 で 測定 される場合は通常 2 を 底 とし、情報が nats 単位で測定される場合は e を 底とします。相対エントロピー を 含むほとんどの式は、対数の底に関係なく成り立ちます
。
μ
{\displaystyle \mu }
μ
=
1
2
(
P
+
Q
)
{\displaystyle \ \mu ={\frac {1}{2}}\left(P+Q\right)\ }
を言葉で 表す際には、さまざまな慣例があります。多くの場合、これは P と Q の 相違と呼ばれますが、これでは関係の基本的な非対称性が伝わりません。この記事のように、 Pの Q からの相違、または Q から P へ の相違と説明されることもあります 。これは、事前 Q から開始して事後 P に更新するベイズ推論の非対称性を反映しています 。 を 表す もう 1 つ の 一般 的 な 方法 は 、 Q に関する P の 相対 エントロピー、または Q に対する P の 情報ゲイン です 。
D
KL
(
P
∥
Q
)
{\displaystyle \ D_{\text{KL}}(P\parallel Q)\ }
D
KL
(
P
∥
Q
)
{\displaystyle \ D_{\text{KL}}(P\parallel Q)\ }
基本的な例
Kullback 次の例を示しています(表2.1、例2.1)。P と Qを 表 と図に示されている分布とします。P は 図の左側の分布で、 および の 二項分布 です。Q は 図の右側の分布で、3つの可能な結果を持つ離散一様分布です。
N
=
2
{\displaystyle N=2}
p
=
0.4
{\displaystyle p=0.4}
x
=
{\displaystyle x=}
0 , 1 、 2 (すなわち )、それぞれ確率 です 。
X
=
{
0
,
1
,
2
}
{\displaystyle {\mathcal {X}}=\{0,1,2\}}
p
=
1
/
3
{\displaystyle p=1/3}
相対エントロピーを示す2つの分布
相対エントロピー と は 次のように計算されます。 この例では、 底 e の自然対数を ln として 使用し、結果を nats で取得します ( 情報の単位 を参照)。
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
D
KL
(
Q
∥
P
)
{\displaystyle D_{\text{KL}}(Q\parallel P)}
D
KL
(
P
∥
Q
)
=
∑
x
∈
X
P
(
x
)
ln
(
P
(
x
)
Q
(
x
)
)
=
9
25
ln
(
9
/
25
1
/
3
)
+
12
25
ln
(
12
/
25
1
/
3
)
+
4
25
ln
(
4
/
25
1
/
3
)
=
1
25
(
32
ln
(
2
)
+
55
ln
(
3
)
−
50
ln
(
5
)
)
≈
0.0852996
,
{\displaystyle {\begin{aligned}D_{\text{KL}}(P\parallel Q)&=\sum _{x\in {\mathcal {X}}}P(x)\ln \left({\frac {P(x)}{Q(x)}}\right)\\&={\frac {9}{25}}\ln \left({\frac {9/25}{1/3}}\right)+{\frac {12}{25}}\ln \left({\frac {12/25}{1/3}}\right)+{\frac {4}{25}}\ln \left({\frac {4/25}{1/3}}\right)\\&={\frac {1}{25}}\left(32\ln(2)+55\ln(3)-50\ln(5)\right)\approx 0.0852996,\end{aligned}}}
D
KL
(
Q
∥
P
)
=
∑
x
∈
X
Q
(
x
)
ln
(
Q
(
x
)
P
(
x
)
)
=
1
3
ln
(
1
/
3
9
/
25
)
+
1
3
ln
(
1
/
3
12
/
25
)
+
1
3
ln
(
1
/
3
4
/
25
)
=
1
3
(
−
4
ln
(
2
)
−
6
ln
(
3
)
+
6
ln
(
5
)
)
≈
0.097455.
{\displaystyle {\begin{aligned}D_{\text{KL}}(Q\parallel P)&=\sum _{x\in {\mathcal {X}}}Q(x)\ln \left({\frac {Q(x)}{P(x)}}\right)\\&={\frac {1}{3}}\ln \left({\frac {1/3}{9/25}}\right)+{\frac {1}{3}}\ln \left({\frac {1/3}{12/25}}\right)+{\frac {1}{3}}\ln \left({\frac {1/3}{4/25}}\right)\\&={\frac {1}{3}}\left(-4\ln(2)-6\ln(3)+6\ln(5)\right)\approx 0.097455.\end{aligned}}}
解釈
統計
統計学の分野では、 ネイマン・ピアソンの補題 は、2つの分布 P と Q を、観測値 Y (どちらか一方から抽出)に基づいて区別する最も強力な方法は、それらの尤度の比の対数を使用することであると述べている 。KLダイバージェンスは、 Yが実際に P から抽出された 場合のこの統計量の期待値である 。カルバックは、この統計量を期待対数尤度比として提案した。
log
P
(
Y
)
−
log
Q
(
Y
)
{\displaystyle \log P(Y)-\log Q(Y)}
コーディング
符号理論 の文脈では 、 Pに最適化されたコードではなく Q に最適化されたコードを使用して P からのサンプル を 符号化するために必要な追加 ビット の予想数を測定する ことによって、 を構築できます 。
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
推論
機械学習 の文脈では 、これは現在使用されている Qの代わりに P が 使用された 場合に達成される 情報ゲイン と呼ばれることがよくあります。情報理論との類推により、これは Q に関する P の 相対エントロピー と呼ばれます 。
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
ベイズ推論 の言語で表現すると 、 事前確率分布 Qから 事後確率分布 P に 信念を修正することによって得られる情報の尺度です 。言い換えれば、 Qが Pを 近似するために使用されるときに失われる情報の量です 。 [16]
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
アプリケーションでは、 P は 通常、データ、観測値、または正確に計算された理論分布の「真の」分布を表しますが、 Q は通常、 P の 理論、モデル、説明、または 近似値を表します。 P に最も近い分布 Q を 見つけるために 、KL ダイバージェンスを最小化し、 情報投影 を計算します。
これは統計的距離 ではあるが、 距離の最も一般的な種類 である 計量ではなく、 発散 である。 計量は対称で、一般化して 線形 距離となり、 三角不等式 を 満たすのに対し、発散 は非対称で、一般化して 二乗距離となり、一般化された ピタゴラスの定理 を満たす場合もある 。一般に は と 等しくなく 、この非対称性は幾何学の重要な部分である。 相対エントロピーの 無限小 形式、具体的にはその ヘッセ行列 は 、 フィッシャー情報計量 に等しい 計量テンソルを 与える。§ フィッシャー情報計量を参照。特定の確率分布上のフィッシャー情報計量により、情報幾何最適化アルゴリズムの自然勾配が決定される。 [17] その量子バージョンはフビニ研究計量である。 [18]相対エントロピーは 指数族 (幾何学的には 双対平坦多様体 として解釈される)に対する一般化されたピタゴラスの定理を満たし 、これにより 情報射影 や 最大尤度推定 などの幾何学的手段によって相対エントロピーを最小化することが可能になる。
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
D
KL
(
Q
∥
P
)
{\displaystyle D_{\text{KL}}(Q\parallel P)}
相対エントロピーは負のエントロピーによって生成される ブレグマンダイバージェンスですが、 f ダイバージェンス の形でもあります。有限 アルファベット 上の確率の場合、この2つの 統計的ダイバージェンス クラスの両方のメンバーであるという点でユニークです 。ブレグマンダイバージェンスの応用はミラー降下法で見つけることができます。 [19]
金融(ゲーム理論)
相互に排他的な結果をもたらす公正なゲーム(例えば、公式のオッズが合計1になる「競馬」)における成長最適化投資家について考えてみましょう。そのような投資家が期待する収益率は、投資家が信じる確率と公式のオッズの間の相対エントロピーに等しくなります。 [20]
これは、金融収益と乖離指標の間のより一般的な関係の特殊なケースです。 [21]
金融リスクは情報幾何学を介して結びついています 。 [22] 投資家の見解、市場の支配的な見解、およびリスクのあるシナリオは、関連する確率分布の多様体上で三角形を形成します。三角形の形状によって、主要な金融リスクが決まります(定性的および定量的の両方)。たとえば、投資家の見解とリスクシナリオが市場に対して「反対側」に現れる鈍角三角形はマイナスのリスクを表し、鋭角三角形はプラスのエクスポージャーを表し、真ん中の直角の状況はゼロリスクに対応します。この概念を拡張して、たとえば資金フローの大きさと事前の期待からの偏差によって表されるとすると、相対エントロピーは情報に通じた投資家の行動を特定するために仮説的に利用できます [23] 。
D
KL
{\displaystyle D_{\text{KL}}}
モチベーション
2 つの正規分布 の相対エントロピーの図 。典型的な非対称性がはっきりとわかります。
情報理論において、 クラフト・マクミラン定理は 、メッセージを符号化して 可能性の集合 X から1 つの値を識別する直接デコード可能な符号化方式は、 X 上の 暗黙の確率分布を表すものと見なすことができることを確立しています。 ここ で、 はビット単位 のコード長です。したがって、相対エントロピーは、真の分布 P に基づくコードを使用する場合と比較して、特定の (誤った) 分布 Q に最適なコードを使用する場合に通信する必要があるデータあたりの予想される余分なメッセージ長として解釈できます。これが 過剰 エントロピーです 。
x
i
{\displaystyle x_{i}}
q
(
x
i
)
=
2
−
ℓ
i
{\displaystyle q(x_{i})=2^{-\ell _{i}}}
ℓ
i
{\displaystyle \ell _{i}}
x
i
{\displaystyle x_{i}}
D
KL
(
P
∥
Q
)
=
∑
x
∈
X
p
(
x
)
log
1
q
(
x
)
−
∑
x
∈
X
p
(
x
)
log
1
p
(
x
)
=
H
(
P
,
Q
)
−
H
(
P
)
{\displaystyle {\begin{aligned}D_{\text{KL}}(P\parallel Q)&=\sum _{x\in {\mathcal {X}}}p(x)\log {\frac {1}{q(x)}}-\sum _{x\in {\mathcal {X}}}p(x)\log {\frac {1}{p(x)}}\\[5pt]&=\mathrm {H} (P,Q)-\mathrm {H} (P)\end{aligned}}}
ここで、は P に対する Q の クロスエントロピー であり 、は P の エントロピー です (これは P 自身とのクロスエントロピーと同じです)。
H
(
P
,
Q
)
{\displaystyle \mathrm {H} (P,Q)}
H
(
P
)
{\displaystyle \mathrm {H} (P)}
相対エントロピーは、幾何学的には 統計距離、つまり分布 Q が分布 P からどれだけ離れているかを表す尺度 として考えることができます。 幾何学的には、これは 発散 、つまり距離の二乗の非対称な一般化された形式です。クロスエントロピー 自体はそのような尺度(正式には 損失関数 )ですが、はゼロではない ため、距離として考えることはできません。これは、 を減算して、 過剰 損失として、距離の概念とより一致するように することで修正できます 。結果として得られる関数は非対称であり、これを対称化できますが(§ 対称化された発散を参照)、非対称形式の方が便利です。幾何学的解釈の詳細については、 § 解釈を参照してください。
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
H
(
P
,
Q
)
{\displaystyle H(P,Q)}
H
(
P
,
P
)
=:
H
(
P
)
{\displaystyle H(P,P)=:H(P)}
H
(
P
)
{\displaystyle H(P)}
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
相対エントロピーは 大偏差 理論における「 速度関数 」と関連している。 [24] [25]
アーサー・ホブソンは、相対エントロピーが、エントロピーの 一般的な特徴付けに現れるものの標準的な拡張であるいくつかの望ましい特性を満たす、確率分布間の差の唯一の尺度であることを証明した 。 [26] その結果、 相互情報量は 、カルバック・ライブラー情報量の観点から定義できるため、特定の関連条件に 従う相互依存性の唯一の尺度となる 。
プロパティ
相対エントロピーは常に 非負で あり、これは ギブスの不等式 として知られる結果です 。が ゼロになる のは、 の尺度である場合のみです 。
D
KL
(
P
∥
Q
)
≥
0
,
{\displaystyle D_{\text{KL}}(P\parallel Q)\geq 0,}
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
P
=
Q
{\displaystyle P=Q}
特に、 およびの場合 、 ほぼどこでも と なります 。したがって、エントロピーは、 クロスエントロピー 、つまり P ではなく Q に基づくコードを使用するときに必要な ビットの 予想 数の最小値を設定します。したがって、カルバック・ライブラー情報とは、確率分布 Q (「真の」分布 P ではない)に対応するコードが使用される場合に、 X から抽出された 値 x を 識別するために送信する必要がある追加ビットの予想数を表します 。
P
(
d
x
)
=
p
(
x
)
μ
(
d
x
)
{\displaystyle P(dx)=p(x)\mu (dx)}
Q
(
d
x
)
=
q
(
x
)
μ
(
d
x
)
{\displaystyle Q(dx)=q(x)\mu (dx)}
p
(
x
)
=
q
(
x
)
{\displaystyle p(x)=q(x)}
μ
{\displaystyle \mu }
H
(
P
)
{\displaystyle \mathrm {H} (P)}
H
(
P
,
Q
)
{\displaystyle \mathrm {H} (P,Q)}
一般的なケースでは上限は存在しません。しかし、 P と Q が同じ離散量を分布させることによって構築された2つの離散確率分布である場合、の最大値 を計算することができることが示されています。 [27]
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
相対エントロピーは連続分布に対して明確に定義され、さらに パラメータ変換 に対して不変です。たとえば、変数 x から変数 への変換が行われた場合 、 であり、 が導関数の絶対値、またはより一般的にはヤコビアン の絶対値であるため 、 相対 エントロピー は次のよう に書き直すことができます。 であり 、 。変換は連続であると仮定しましたが、そうである必要はありません。これはまた、 x が 次元付き変数である 場合、 および も次元付きであるため、相対エントロピーが 次元的に一貫した量を生成することも示しています。eg は無次元です。対数項の引数は であり、無次元のままであり、そうあるべきです。したがって、それは、非離散確率に対して未定義または負になる可能性がある情報理論 [28] の他のいくつかの特性( 自己情報量 や シャノンエントロピー など ) よりも、ある意味でより基本的な量と見なすことができます。
y
(
x
)
{\displaystyle y(x)}
P
(
d
x
)
=
p
(
x
)
d
x
=
p
~
(
y
)
d
y
=
p
~
(
y
(
x
)
)
|
d
y
d
x
(
x
)
|
d
x
{\displaystyle P(dx)=p(x)\,dx={\tilde {p}}(y)\,dy={\tilde {p}}(y(x))|{\tfrac {dy}{dx}}(x)|\,dx}
Q
(
d
x
)
=
q
(
x
)
d
x
=
q
~
(
y
)
d
y
=
q
~
(
y
)
|
d
y
d
x
(
x
)
|
d
x
{\displaystyle Q(dx)=q(x)\,dx={\tilde {q}}(y)\,dy={\tilde {q}}(y)|{\tfrac {dy}{dx}}(x)|dx}
|
d
y
d
x
(
x
)
|
{\displaystyle |{\tfrac {dy}{dx}}(x)|}
D
KL
(
P
∥
Q
)
=
∫
x
a
x
b
p
(
x
)
log
(
p
(
x
)
q
(
x
)
)
d
x
=
∫
x
a
x
b
p
~
(
y
(
x
)
)
|
d
y
d
x
(
x
)
|
log
(
p
~
(
y
(
x
)
)
|
d
y
d
x
(
x
)
|
q
~
(
y
(
x
)
)
|
d
y
d
x
(
x
)
|
)
d
x
=
∫
y
a
y
b
p
~
(
y
)
log
(
p
~
(
y
)
q
~
(
y
)
)
d
y
{\displaystyle {\begin{aligned}D_{\text{KL}}(P\parallel Q)&=\int _{x_{a}}^{x_{b}}p(x)\log \left({\frac {p(x)}{q(x)}}\right)\,dx\\[6pt]&=\int _{x_{a}}^{x_{b}}{\tilde {p}}(y(x))|{\frac {dy}{dx}}(x)|\log \left({\frac {{\tilde {p}}(y(x))\,|{\frac {dy}{dx}}(x)|}{{\tilde {q}}(y(x))\,|{\frac {dy}{dx}}(x)|}}\right)\,dx\\&=\int _{y_{a}}^{y_{b}}{\tilde {p}}(y)\log \left({\frac {{\tilde {p}}(y)}{{\tilde {q}}(y)}}\right)\,dy\end{aligned}}}
y
a
=
y
(
x
a
)
{\displaystyle y_{a}=y(x_{a})}
y
b
=
y
(
x
b
)
{\displaystyle y_{b}=y(x_{b})}
p
(
x
)
{\displaystyle p(x)}
q
(
x
)
{\displaystyle q(x)}
P
(
d
x
)
=
p
(
x
)
d
x
{\displaystyle P(dx)=p(x)\,dx}
相対エントロピーは、 シャノンエントロピーとほぼ同じように、 独立分布 に対して 加算的で ある。 が独立分布で の場合、 独立分布の 場合も 同様である 。
P
1
,
P
2
{\displaystyle P_{1},P_{2}}
P
(
d
x
,
d
y
)
=
P
1
(
d
x
)
P
2
(
d
y
)
{\displaystyle P(dx,dy)=P_{1}(dx)P_{2}(dy)}
Q
(
d
x
,
d
y
)
=
Q
1
(
d
x
)
Q
2
(
d
y
)
{\displaystyle Q(dx,dy)=Q_{1}(dx)Q_{2}(dy)}
Q
1
,
Q
2
{\displaystyle Q_{1},Q_{2}}
D
KL
(
P
∥
Q
)
=
D
KL
(
P
1
∥
Q
1
)
+
D
KL
(
P
2
∥
Q
2
)
.
{\displaystyle D_{\text{KL}}(P\parallel Q)=D_{\text{KL}}(P_{1}\parallel Q_{1})+D_{\text{KL}}(P_{2}\parallel Q_{2}).}
相対エントロピーは 確率測度 のペアにおいて 凸で ある 。つまり 、とが 2つの確率測度のペアである 場合、
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
(
P
,
Q
)
{\displaystyle (P,Q)}
(
P
1
,
Q
1
)
{\displaystyle (P_{1},Q_{1})}
(
P
2
,
Q
2
)
{\displaystyle (P_{2},Q_{2})}
D
KL
(
λ
P
1
+
(
1
−
λ
)
P
2
∥
λ
Q
1
+
(
1
−
λ
)
Q
2
)
≤
λ
D
KL
(
P
1
∥
Q
1
)
+
(
1
−
λ
)
D
KL
(
P
2
∥
Q
2
)
for
0
≤
λ
≤
1.
{\displaystyle D_{\text{KL}}(\lambda P_{1}+(1-\lambda )P_{2}\parallel \lambda Q_{1}+(1-\lambda )Q_{2})\leq \lambda D_{\text{KL}}(P_{1}\parallel Q_{1})+(1-\lambda )D_{\text{KL}}(P_{2}\parallel Q_{2}){\text{ for }}0\leq \lambda \leq 1.}
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
は、その最小値 (すなわち ) についてテイラー展開され、 に関して ほぼ確実に である 場合に限り収束します 。
P
=
Q
{\displaystyle P=Q}
D
KL
(
P
∥
Q
)
=
∑
n
=
2
∞
1
n
(
n
−
1
)
∑
x
∈
X
(
Q
(
x
)
−
P
(
x
)
)
n
Q
(
x
)
n
−
1
{\displaystyle D_{\text{KL}}(P\parallel Q)=\sum _{n=2}^{\infty }{\frac {1}{n(n-1)}}\sum _{x\in {\mathcal {X}}}{\frac {(Q(x)-P(x))^{n}}{Q(x)^{n-1}}}}
P
≤
2
Q
{\displaystyle P\leq 2Q}
Q
{\displaystyle Q}
ドンスカーとバラダンによる次の結果 [29]は、 ドンスカーとバラダンの変分公式 として知られています 。
定理 [変分推論の双対性公式] — 適切な - 体 と 2 つの確率測度 P および Q を 持つ集合を、 で 2 つの確率空間 および を ます 。 ( はQ が P に関して絶対連続である ことを示します 。) h を 上の 実数値の積分可能な ランダム変数 とします。このとき、次の等式が成り立ちます。
Θ
{\displaystyle \Theta }
σ
{\displaystyle \sigma }
F
{\displaystyle {\mathcal {F}}}
(
Θ
,
F
,
P
)
{\displaystyle (\Theta ,{\mathcal {F}},P)}
(
Θ
,
F
,
Q
)
{\displaystyle (\Theta ,{\mathcal {F}},Q)}
Q
≪
P
{\displaystyle Q\ll P}
Q
≪
P
{\displaystyle Q\ll P}
(
Θ
,
F
,
P
)
{\displaystyle (\Theta ,{\mathcal {F}},P)}
log
E
P
[
exp
h
]
=
sup
Q
≪
P
{
E
Q
[
h
]
−
D
KL
(
Q
∥
P
)
}
.
{\displaystyle \log E_{P}[\exp h]={\text{sup}}_{Q\ll P}\{E_{Q}[h]-D_{\text{KL}}(Q\parallel P)\}.}
さらに、右辺の上限は、
Q
(
d
θ
)
P
(
d
θ
)
=
exp
h
(
θ
)
E
P
[
exp
h
]
,
{\displaystyle {\frac {Q(d\theta )}{P(d\theta )}}={\frac {\exp h(\theta )}{E_{P}[\exp h]}},}
確率測度P に関してほぼ確実に 、ここで は P に関する Q のラドン・ニコディム微分を表します 。
Q
(
d
θ
)
P
(
d
θ
)
{\displaystyle {\frac {Q(d\theta )}{P(d\theta )}}}
測度論 を用いた別の証明については [30] を参照。
例
多変量正規分布
平均 と(非特異) 共分散行列を持つ2つの 多変量正規分布 があるとします。2 つの分布が同じ次元 kを 持つ場合、分布間の相対エントロピーは次のようになります。 [31]
μ
0
,
μ
1
{\displaystyle \mu _{0},\mu _{1}}
Σ
0
,
Σ
1
.
{\displaystyle \Sigma _{0},\Sigma _{1}.}
D
KL
(
N
0
∥
N
1
)
=
1
2
(
tr
(
Σ
1
−
1
Σ
0
)
−
k
+
(
μ
1
−
μ
0
)
T
Σ
1
−
1
(
μ
1
−
μ
0
)
+
ln
(
det
Σ
1
det
Σ
0
)
)
.
{\displaystyle D_{\text{KL}}\left({\mathcal {N}}_{0}\parallel {\mathcal {N}}_{1}\right)={\frac {1}{2}}\left(\operatorname {tr} \left(\Sigma _{1}^{-1}\Sigma _{0}\right)-k+\left(\mu _{1}-\mu _{0}\right)^{\mathsf {T}}\Sigma _{1}^{-1}\left(\mu _{1}-\mu _{0}\right)+\ln \left({\frac {\det \Sigma _{1}}{\det \Sigma _{0}}}\right)\right).}
最後の項の対数 は e を 底とする必要があります。これは、 最後の項を除くすべての項が、密度関数の因数であるか、自然に生じる式の e を底と する対数であるためです。したがって、この式は nats で測定された結果をもたらします 。上記の式全体を で割ると、 ビット 単位の発散が得られます 。
ln
(
2
)
{\displaystyle \ln(2)}
数値実装では、結果を およびと なる コレスキー分解で表現すると便利です 。すると、 三角線形システム 、 、の M および y 解で、
L
0
,
L
1
{\displaystyle L_{0},L_{1}}
Σ
0
=
L
0
L
0
T
{\displaystyle \Sigma _{0}=L_{0}L_{0}^{T}}
Σ
1
=
L
1
L
1
T
{\displaystyle \Sigma _{1}=L_{1}L_{1}^{T}}
L
1
M
=
L
0
{\displaystyle L_{1}M=L_{0}}
L
1
y
=
μ
1
−
μ
0
{\displaystyle L_{1}y=\mu _{1}-\mu _{0}}
D
KL
(
N
0
∥
N
1
)
=
1
2
(
∑
i
,
j
=
1
k
(
M
i
j
)
2
−
k
+
|
y
|
2
+
2
∑
i
=
1
k
ln
(
L
1
)
i
i
(
L
0
)
i
i
)
.
{\displaystyle D_{\text{KL}}\left({\mathcal {N}}_{0}\parallel {\mathcal {N}}_{1}\right)={\frac {1}{2}}\left(\sum _{i,j=1}^{k}(M_{ij})^{2}-k+|y|^{2}+2\sum _{i=1}^{k}\ln {\frac {(L_{1})_{ii}}{(L_{0})_{ii}}}\right).}
変分推論 における特殊なケースであり一般的な量は 、対角多変量正規分布と標準正規分布(平均ゼロ、分散1)間の相対エントロピーです。
D
KL
(
N
(
(
μ
1
,
…
,
μ
k
)
T
,
diag
(
σ
1
2
,
…
,
σ
k
2
)
)
∥
N
(
0
,
I
)
)
=
1
2
∑
i
=
1
k
(
σ
i
2
+
μ
i
2
−
1
−
ln
(
σ
i
2
)
)
.
{\displaystyle D_{\text{KL}}\left({\mathcal {N}}\left(\left(\mu _{1},\ldots ,\mu _{k}\right)^{\mathsf {T}},\operatorname {diag} \left(\sigma _{1}^{2},\ldots ,\sigma _{k}^{2}\right)\right)\parallel {\mathcal {N}}\left(\mathbf {0} ,\mathbf {I} \right)\right)={1 \over 2}\sum _{i=1}^{k}\left(\sigma _{i}^{2}+\mu _{i}^{2}-1-\ln \left(\sigma _{i}^{2}\right)\right).}
2つの一変量正規分布 p と q の場合、上記は次のように簡略化される [32]。
D
KL
(
p
∥
q
)
=
log
σ
1
σ
0
+
σ
0
2
+
(
μ
0
−
μ
1
)
2
2
σ
1
2
−
1
2
{\displaystyle D_{\text{KL}}\left({\mathcal {p}}\parallel {\mathcal {q}}\right)=\log {\frac {\sigma _{1}}{\sigma _{0}}}+{\frac {\sigma _{0}^{2}+(\mu _{0}-\mu _{1})^{2}}{2\sigma _{1}^{2}}}-{\frac {1}{2}}}
の共心正規分布の場合 、 [33]は 次のように簡略化される。
k
=
σ
1
/
σ
0
{\displaystyle k=\sigma _{1}/\sigma _{0}}
D
KL
(
p
∥
q
)
=
log
2
k
+
(
k
−
2
−
1
)
/
2
/
ln
(
2
)
b
i
t
s
{\displaystyle D_{\text{KL}}\left({\mathcal {p}}\parallel {\mathcal {q}}\right)=\log _{2}k+(k^{-2}-1)/2/\ln(2)\mathrm {bits} }
( ) で囲まれた サポートを持つ2つの一様分布を考えます 。情報ゲインは次のようになります。
p
=
[
A
,
B
]
{\displaystyle p=[A,B]}
q
=
[
C
,
D
]
{\displaystyle q=[C,D]}
C
≤
A
<
B
≤
D
{\displaystyle C\leq A<B\leq D}
D
KL
(
p
∥
q
)
=
log
D
−
C
B
−
A
{\displaystyle D_{\text{KL}}\left({\mathcal {p}}\parallel {\mathcal {q}}\right)=\log {\frac {D-C}{B-A}}}
直感的に言えば、 [33] k 倍狭い均一分布 の情報利得にはビットが含まれます。これは、 kの 長さのストリーム
の1つの要素を識別するためにビットが必要になる コンピューティングにおけるビットの使用と関連しています。
log
2
k
{\displaystyle \log _{2}k}
log
2
k
{\displaystyle \log _{2}k}
指標との関係
相対エントロピーは 統計的距離 であるが、確率分布の空間上の 計量 ではなく、 発散 である。 計量は対称であり、 線形 距離を一般化して 三角不等式 を満たすのに対し、発散は一般に非対称であり、 二乗 距離を一般化して、一般化された ピタゴラスの定理 を満たす場合もある 。一般に は と等しくなく 、これは対称化できるが(§ 対称化された発散を参照)、非対称性は幾何学の重要な部分である。
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
D
KL
(
Q
∥
P
)
{\displaystyle D_{\text{KL}}(Q\parallel P)}
これは 確率分布 の空間上の 位相を 生成する。より具体的には、が 次のような分布の列である
場合、
{
P
1
,
P
2
,
…
}
{\displaystyle \{P_{1},P_{2},\ldots \}}
lim
n
→
∞
D
KL
(
P
n
∥
Q
)
=
0
{\displaystyle \lim _{n\to \infty }D_{\text{KL}}(P_{n}\parallel Q)=0}
、
そして、
P
n
→
D
Q
{\displaystyle P_{n}{\xrightarrow {D}}Q}
。
ピンスカーの不等式 は、
P
n
→
D
P
⇒
P
n
→
T
V
P
{\displaystyle P_{n}\xrightarrow {D} P\Rightarrow P_{n}\xrightarrow {TV} P}
、
ここで後者は 全変化 における通常の収束を表します。
相対エントロピーは フィッシャー情報量 に直接関係しています。これは次のように明示することができます。確率分布 P と Q の 両方が何らかの(多次元の可能性がある)パラメータ によってパラメータ化されている と仮定します。次に、 パラメータ が パラメータ値 とわずかに異なる 2 つの近い値 を考えます 。具体的には、1 次まで( アインシュタインの総和規則 を使用)
θ
{\displaystyle \theta }
P
=
P
(
θ
)
{\displaystyle P=P(\theta )}
Q
=
P
(
θ
0
)
{\displaystyle Q=P(\theta _{0})}
θ
{\displaystyle \theta }
θ
0
{\displaystyle \theta _{0}}
P
(
θ
)
=
P
(
θ
0
)
+
Δ
θ
j
P
j
(
θ
0
)
+
⋯
{\displaystyle P(\theta )=P(\theta _{0})+\Delta \theta _{j}\,P_{j}(\theta _{0})+\cdots }
j 方向の 小さな変化 と 、それに 対応する確率分布の変化率を伴います。相対エントロピーは に対して絶対最小値0を持つため 、つまり、 小さなパラメータ では 2 次までしか変化しません 。より正式には、任意の最小値の場合と同様に、発散の1次導関数は消えます。
Δ
θ
j
=
(
θ
−
θ
0
)
j
{\displaystyle \Delta \theta _{j}=(\theta -\theta _{0})_{j}}
θ
{\displaystyle \theta }
P
j
(
θ
0
)
=
∂
P
∂
θ
j
(
θ
0
)
{\displaystyle P_{j}\left(\theta _{0}\right)={\frac {\partial P}{\partial \theta _{j}}}(\theta _{0})}
P
=
Q
{\displaystyle P=Q}
θ
=
θ
0
{\displaystyle \theta =\theta _{0}}
Δ
θ
j
{\displaystyle \Delta \theta _{j}}
∂
∂
θ
j
|
θ
=
θ
0
D
KL
(
P
(
θ
)
∥
P
(
θ
0
)
)
=
0
,
{\displaystyle \left.{\frac {\partial }{\partial \theta _{j}}}\right|_{\theta =\theta _{0}}D_{\text{KL}}(P(\theta )\parallel P(\theta _{0}))=0,}
テイラー展開 により 2次まで
D
KL
(
P
(
θ
)
∥
P
(
θ
0
)
)
=
1
2
Δ
θ
j
Δ
θ
k
g
j
k
(
θ
0
)
+
⋯
{\displaystyle D_{\text{KL}}(P(\theta )\parallel P(\theta _{0}))={\frac {1}{2}}\,\Delta \theta _{j}\,\Delta \theta _{k}\,g_{jk}(\theta _{0})+\cdots }
ここで、 発散の
ヘッセ行列は
g
j
k
(
θ
0
)
=
∂
2
∂
θ
j
∂
θ
k
|
θ
=
θ
0
D
KL
(
P
(
θ
)
∥
P
(
θ
0
)
)
{\displaystyle g_{jk}(\theta _{0})=\left.{\frac {\partial ^{2}}{\partial \theta _{j}\,\partial \theta _{k}}}\right|_{\theta =\theta _{0}}D_{\text{KL}}(P(\theta )\parallel P(\theta _{0}))}
は半正定値 でなければなりません 。 を変化させると(そしてサブインデックス 0 を削除すると)、ヘッセ行列は θ パラメータ空間上の (おそらく退化した) リーマン計量を 定義します。これはフィッシャー情報計量と呼ばれます。
θ
0
{\displaystyle \theta _{0}}
g
j
k
(
θ
)
{\displaystyle g_{jk}(\theta )}
次の規則性条件を満たす
場合:
p
(
x
,
ρ
)
{\displaystyle p_{(x,\rho )}}
∂
log
(
p
)
∂
ρ
,
∂
2
log
(
p
)
∂
ρ
2
,
∂
3
log
(
p
)
∂
ρ
3
{\displaystyle {\frac {\partial \log(p)}{\partial \rho }},{\frac {\partial ^{2}\log(p)}{\partial \rho ^{2}}},{\frac {\partial ^{3}\log(p)}{\partial \rho ^{3}}}}
存在する、
|
∂
p
∂
ρ
|
<
F
(
x
)
:
∫
x
=
0
∞
F
(
x
)
d
x
<
∞
,
|
∂
2
p
∂
ρ
2
|
<
G
(
x
)
:
∫
x
=
0
∞
G
(
x
)
d
x
<
∞
|
∂
3
log
(
p
)
∂
ρ
3
|
<
H
(
x
)
:
∫
x
=
0
∞
p
(
x
,
0
)
H
(
x
)
d
x
<
ξ
<
∞
{\displaystyle {\begin{aligned}\left|{\frac {\partial p}{\partial \rho }}\right|&<F(x):\int _{x=0}^{\infty }F(x)\,dx<\infty ,\\\left|{\frac {\partial ^{2}p}{\partial \rho ^{2}}}\right|&<G(x):\int _{x=0}^{\infty }G(x)\,dx<\infty \\\left|{\frac {\partial ^{3}\log(p)}{\partial \rho ^{3}}}\right|&<H(x):\int _{x=0}^{\infty }p(x,0)H(x)\,dx<\xi <\infty \end{aligned}}}
ここで ξは ρ に依存しない
∫
x
=
0
∞
∂
p
(
x
,
ρ
)
∂
ρ
|
ρ
=
0
d
x
=
∫
x
=
0
∞
∂
2
p
(
x
,
ρ
)
∂
ρ
2
|
ρ
=
0
d
x
=
0
{\displaystyle \left.\int _{x=0}^{\infty }{\frac {\partial p(x,\rho )}{\partial \rho }}\right|_{\rho =0}\,dx=\left.\int _{x=0}^{\infty }{\frac {\partial ^{2}p(x,\rho )}{\partial \rho ^{2}}}\right|_{\rho =0}\,dx=0}
それから:
D
(
p
(
x
,
0
)
∥
p
(
x
,
ρ
)
)
=
c
ρ
2
2
+
O
(
ρ
3
)
as
ρ
→
0.
{\displaystyle {\mathcal {D}}(p(x,0)\parallel p(x,\rho ))={\frac {c\rho ^{2}}{2}}+{\mathcal {O}}\left(\rho ^{3}\right){\text{ as }}\rho \to 0.}
もう一つの情報理論的測定基準は 情報の変化であり、これは 条件付きエントロピー の対称化に近いものであり、 離散 確率空間の 分割 集合に関する測定基準である 。
モーブ メトリック
MAUVE は、モデルによって生成されたテキストと人間が書いたテキストの違いなど、2 つのテキスト分布間の統計的ギャップの尺度です。この尺度は、基礎モデルの量子化された埋め込み空間における 2 つの分布間の Kullback-Leibler ダイバージェンスを使用して計算されます。
情報理論の他の量の多くは、特定のケースへの相対エントロピーの適用として解釈できます。
自己 情報量は 、信号、ランダム変数、または イベントの 情報量 とも呼ばれ、 特定の結果が発生する
確率 の負の対数として定義されます。
離散確率変数 に適用した場合 、自己情報は次のように表される [ 要出典 ]
I
(
m
)
=
D
KL
(
δ
im
∥
{
p
i
}
)
,
{\displaystyle \operatorname {\operatorname {I} } (m)=D_{\text{KL}}\left(\delta _{\text{im}}\parallel \{p_{i}\}\right),}
は、クロネッカーのデルタ からの 確率分布の相対エントロピーであり 、確実性を表します。つまり、 確率分布のみが 受信者に利用可能であり、事実ではない場合に、 i を 識別するために送信する必要がある追加ビットの数です 。
P
(
i
)
{\displaystyle P(i)}
i
=
m
{\displaystyle i=m}
P
(
i
)
{\displaystyle P(i)}
i
=
m
{\displaystyle i=m}
相互情報 量 、
I
(
X
;
Y
)
=
D
KL
(
P
(
X
,
Y
)
∥
P
(
X
)
P
(
Y
)
)
=
E
X
{
D
KL
(
P
(
Y
∣
X
)
∥
P
(
Y
)
)
}
=
E
Y
{
D
KL
(
P
(
X
∣
Y
)
∥
P
(
X
)
)
}
{\displaystyle {\begin{aligned}\operatorname {I} (X;Y)&=D_{\text{KL}}(P(X,Y)\parallel P(X)P(Y))\\[5pt]&=\operatorname {E} _{X}\{D_{\text{KL}}(P(Y\mid X)\parallel P(Y))\}\\[5pt]&=\operatorname {E} _{Y}\{D_{\text{KL}}(P(X\mid Y)\parallel P(X))\}\end{aligned}}}
は、 2 つの 周辺確率分布 の積から得られる 結合確率分布 の相対エントロピーです 。つまり、 結合分布ではなく周辺分布のみを使用してコード化された場合に、 X と Y を識別するために送信する必要がある追加ビットの予想数です。同様に、結合確率 がわかっている場合、 X の値が受信者にまだわかっていない場合に、 Y を 識別するために平均して送信する必要がある追加ビットの予想数です 。
P
(
X
,
Y
)
{\displaystyle P(X,Y)}
P
(
X
)
P
(
Y
)
{\displaystyle P(X)P(Y)}
P
(
X
,
Y
)
{\displaystyle P(X,Y)}
シャノンエントロピー
シャノン エントロピー 、
H
(
X
)
=
E
[
I
X
(
x
)
]
=
log
(
N
)
−
D
KL
(
p
X
(
x
)
∥
P
U
(
X
)
)
{\displaystyle {\begin{aligned}\mathrm {H} (X)&=\operatorname {E} \left[\operatorname {I} _{X}(x)\right]\\&=\log(N)-D_{\text{KL}}\left(p_{X}(x)\parallel P_{U}(X)\right)\end{aligned}}}
は、 N 個の 等確率の可能性 から X を 識別するために送信しなければならないビット数から、 X の ランダム変量 に対する一様分布の相対エントロピー 、 真の分布からの相対エントロピーを引いた もの です。つまり、 X の値が真の分布ではなく一様分布 に従って コード化されていた 場合に送信しなければならなかった節約されたビット数の期待値を引いたものです 。シャノンのエントロピーのこの定義は、 ET ジェインズ による連続分布への代替一般化、 離散点の極限密度(通常の 微分エントロピー とは対照的 ) の基礎を形成し、連続エントロピーを次のように定義します。
P
U
(
X
)
{\displaystyle P_{U}(X)}
P
(
X
)
{\displaystyle P(X)}
P
U
(
X
)
{\displaystyle P_{U}(X)}
P
(
X
)
{\displaystyle P(X)}
lim
N
→
∞
H
N
(
X
)
=
log
(
N
)
−
∫
p
(
x
)
log
p
(
x
)
m
(
x
)
d
x
,
{\displaystyle \lim _{N\rightarrow \infty }H_{N}(X)=\log(N)-\int p(x)\log {\frac {p(x)}{m(x)}}\,dx,}
これは次と同等です:
log
(
N
)
−
D
KL
(
p
(
x
)
|
|
m
(
x
)
)
{\displaystyle \log(N)-D_{\text{KL}}(p(x)||m(x))}
条件付きエントロピー
条件付きエントロピー [ 34] 、
H
(
X
∣
Y
)
=
log
(
N
)
−
D
KL
(
P
(
X
,
Y
)
∥
P
U
(
X
)
P
(
Y
)
)
=
log
(
N
)
−
D
KL
(
P
(
X
,
Y
)
∥
P
(
X
)
P
(
Y
)
)
−
D
KL
(
P
(
X
)
∥
P
U
(
X
)
)
=
H
(
X
)
−
I
(
X
;
Y
)
=
log
(
N
)
−
E
Y
[
D
KL
(
P
(
X
∣
Y
)
∥
P
U
(
X
)
)
]
{\displaystyle {\begin{aligned}\mathrm {H} (X\mid Y)&=\log(N)-D_{\text{KL}}(P(X,Y)\parallel P_{U}(X)P(Y))\\[5pt]&=\log(N)-D_{\text{KL}}(P(X,Y)\parallel P(X)P(Y))-D_{\text{KL}}(P(X)\parallel P_{U}(X))\\[5pt]&=\mathrm {H} (X)-\operatorname {I} (X;Y)\\[5pt]&=\log(N)-\operatorname {E} _{Y}\left[D_{\text{KL}}\left(P\left(X\mid Y\right)\parallel P_{U}(X)\right)\right]\end{aligned}}}
は、 N 個 の同等に起こりうる可能性 から X を 識別するために送信しなければならないビット数から、 真の結合分布から の積分布の相対エントロピーを引いた ものです 。つまり、 Xの値が、 Y が与えられたときの X の 条件付き分布ではなく、 一様分布に従ってコード化された場合に送信しなければならなかっ た であろう節約されたビット数の予想値を引いたものです 。
P
U
(
X
)
P
(
Y
)
{\displaystyle P_{U}(X)P(Y)}
P
(
X
,
Y
)
{\displaystyle P(X,Y)}
P
U
(
X
)
{\displaystyle P_{U}(X)}
P
(
X
|
Y
)
{\displaystyle P(X|Y)}
クロスエントロピー
分布p から得られる可能性のあるイベントのセットがある場合、 エントロピー符号化を 使用してそれらをエンコードできます ( ロスレスデータ圧縮 を使用) 。これは、各固定長入力シンボルを対応する一意の可変長の プレフィックスフリーコード に置き換えることによってデータを圧縮します (例: 確率 p = (1/2、1/4、1/4) のイベント (A、B、C) は、ビット (0、10、11) としてエンコードできます)。分布 p が 事前 にわかっている場合は、最適なエンコードを考案できます (例: ハフマン符号化を 使用)。つまり、エンコードしたメッセージは平均して最短の長さになり (エンコードされたイベントが pからサンプリングされていると仮定)、これは p の シャノンのエントロピー ( と表記) に等しくなります 。ただし、エントロピー符号化方式を作成するときに異なる確率分布 ( q ) を使用すると、可能性のセットからイベントを識別するために (平均して) より多くの ビット が使用されます。この新しい(より大きな)数値は、 p と q 間の クロスエントロピー によって測定されます。
H
(
p
)
{\displaystyle \mathrm {H} (p)}
2 つの 確率分布 ( p と q )間の クロス エントロピーは 、 "真の" 分布 p ではなく、特定の確率分布 qに基づくコーディング スキームが使用される場合に、 一連 の可能性からイベントを識別するために必要な平均ビット数を測定します。 同じ 確率空間上の 2 つの分布 p と q のクロス エントロピーは、 次のように定義されます。
H
(
p
,
q
)
=
E
p
[
−
log
(
q
)
]
=
H
(
p
)
+
D
KL
(
p
∥
q
)
.
{\displaystyle \mathrm {H} (p,q)=\operatorname {E} _{p}[-\log(q)]=\mathrm {H} (p)+D_{\text{KL}}(p\parallel q).}
この明確な導出については、上記の「動機」セクションを参照してください。
このシナリオでは、相対エントロピー(kl ダイバージェンス)は、エンコード スキームの構築にp ではなく q を 使用するため、イベントをエンコードするために 必要な平均して追加のビット数( を超える)として解釈できます 。
H
(
p
)
{\displaystyle \mathrm {H} (p)}
ベイズ更新
ベイズ統計 では、相対エントロピーは 事前分布から 事後分布 に 移行する際の情報ゲインの尺度として使用できます 。 新しい事実が発見された場合、 ベイズの定理 を使用して、 X の事後分布を新しい事後分布に 更新 することができます 。
p
(
x
)
→
p
(
x
∣
I
)
{\displaystyle p(x)\to p(x\mid I)}
Y
=
y
{\displaystyle Y=y}
p
(
x
∣
I
)
{\displaystyle p(x\mid I)}
p
(
x
∣
y
,
I
)
{\displaystyle p(x\mid y,I)}
p
(
x
∣
y
,
I
)
=
p
(
y
∣
x
,
I
)
p
(
x
∣
I
)
p
(
y
∣
I
)
{\displaystyle p(x\mid y,I)={\frac {p(y\mid x,I)p(x\mid I)}{p(y\mid I)}}}
この分布には新しい エントロピー があります:
H
(
p
(
x
∣
y
,
I
)
)
=
−
∑
x
p
(
x
∣
y
,
I
)
log
p
(
x
∣
y
,
I
)
,
{\displaystyle \mathrm {H} {\big (}p(x\mid y,I){\big )}=-\sum _{x}p(x\mid y,I)\log p(x\mid y,I),}
これは、元のエントロピー より小さいか大きい可能性があります 。ただし、新しい確率分布の観点から、 に基づく 新しいコードの代わりに に基づく元のコードを使用した場合 、予想されるビット数が追加されると推定できます。
H
(
p
(
x
∣
I
)
)
{\displaystyle \mathrm {H} (p(x\mid I))}
p
(
x
∣
I
)
{\displaystyle p(x\mid I)}
p
(
x
∣
y
,
I
)
{\displaystyle p(x\mid y,I)}
D
KL
(
p
(
x
∣
y
,
I
)
∥
p
(
x
∣
I
)
)
=
∑
x
p
(
x
∣
y
,
I
)
log
(
p
(
x
∣
y
,
I
)
p
(
x
∣
I
)
)
{\displaystyle D_{\text{KL}}{\big (}p(x\mid y,I)\parallel p(x\mid I){\big )}=\sum _{x}p(x\mid y,I)\log \left({\frac {p(x\mid y,I)}{p(x\mid I)}}\right)}
メッセージの長さに比例します。したがって、これはを発見することによって得られた X に関する有用な情報の量、つまり情報ゲインを表します 。
Y
=
y
{\displaystyle Y=y}
その後、さらなるデータ が 入ると、 x の確率分布はさらに更新され、新たな最善の推測 が得られます。 ではなく を 使用した場合の情報ゲインを再調査すると 、以前の推定よりも大きくなるか小さくなる可能性があることがわかります。
Y
2
=
y
2
{\displaystyle Y_{2}=y_{2}}
p
(
x
∣
y
1
,
y
2
,
I
)
{\displaystyle p(x\mid y_{1},y_{2},I)}
p
(
x
∣
y
1
,
I
)
{\displaystyle p(x\mid y_{1},I)}
p
(
x
∣
I
)
{\displaystyle p(x\mid I)}
∑
x
p
(
x
∣
y
1
,
y
2
,
I
)
log
(
p
(
x
∣
y
1
,
y
2
,
I
)
p
(
x
∣
I
)
)
{\displaystyle \sum _{x}p(x\mid y_{1},y_{2},I)\log \left({\frac {p(x\mid y_{1},y_{2},I)}{p(x\mid I)}}\right)}
≤ または > である可能性がある
∑
x
p
(
x
∣
y
1
,
I
)
log
(
p
(
x
∣
y
1
,
I
)
p
(
x
∣
I
)
)
{\displaystyle \displaystyle \sum _{x}p(x\mid y_{1},I)\log \left({\frac {p(x\mid y_{1},I)}{p(x\mid I)}}\right)}
そして、総合的な情報利得は 三角不等式に従わ
ない。
D
KL
(
p
(
x
∣
y
1
,
y
2
,
I
)
∥
p
(
x
∣
I
)
)
{\displaystyle D_{\text{KL}}{\big (}p(x\mid y_{1},y_{2},I)\parallel p(x\mid I){\big )}}
<、=、>のいずれかである可能性がある
D
KL
(
p
(
x
∣
y
1
,
y
2
,
I
)
∥
p
(
x
∣
y
1
,
I
)
)
+
D
KL
(
p
(
x
∣
y
1
,
I
)
∥
p
(
x
∣
I
)
)
{\displaystyle D_{\text{KL}}{\big (}p(x\mid y_{1},y_{2},I)\parallel p(x\mid y_{1},I){\big )}+D_{\text{KL}}{\big (}p(x\mid y_{1},I)\parallel p(x\mid I){\big )}}
言えることは、 平均し て、 を使用して平均すると 、両側が平均化されるということです。
p
(
y
2
∣
y
1
,
x
,
I
)
{\displaystyle p(y_{2}\mid y_{1},x,I)}
ベイズ実験計画
ベイズ実験計画法 における共通の目標 は、事前分布と事後分布の間の期待される相対エントロピーを最大化することである。 [35] 事後分布がガウス分布に近似される場合、期待される相対エントロピーを最大化する計画は ベイズd最適 と呼ばれる。
相対エントロピーは、を 超える 場合の期待される 判別情報、 すなわち、仮説が正しい 場合に、 仮説 に対して 仮説 を支持する判別を行うためのサンプルあたりの平均情報 として解釈することもできます。 [36] IJ Good によって与えられたこの量の別名は、各サンプルから を 超える場合 の期待される証拠の重みです 。
D
KL
(
p
(
x
∣
H
1
)
∥
p
(
x
∣
H
0
)
)
{\textstyle D_{\text{KL}}{\bigl (}p(x\mid H_{1})\parallel p(x\mid H_{0}){\bigr )}}
H
1
{\displaystyle H_{1}}
H
0
{\displaystyle H_{0}}
H
1
{\displaystyle H_{1}}
H
0
{\displaystyle H_{0}}
H
1
{\displaystyle H_{1}}
H
1
{\displaystyle H_{1}}
H
0
{\displaystyle H_{0}}
以上 の証拠の期待重みは、 仮説の
確率分布に関するサンプルあたりの期待情報ゲインと同じで は ない。
H
1
{\displaystyle H_{1}}
H
0
{\displaystyle H_{0}}
p
(
H
)
{\displaystyle p(H)}
D
KL
(
p
(
x
∣
H
1
)
∥
p
(
x
∣
H
0
)
)
≠
I
G
=
D
KL
(
p
(
H
∣
x
)
∥
p
(
H
∣
I
)
)
.
{\displaystyle D_{\text{KL}}(p(x\mid H_{1})\parallel p(x\mid H_{0}))\neq IG=D_{\text{KL}}(p(H\mid x)\parallel p(H\mid I)).}
どちらの量も、ベイズ実験設計における 効用関数 として使用して、次に調査する最適な質問を選択できますが、一般的には、かなり異なる実験戦略につながります。
情報ゲイン のエントロピー スケールでは、 ほぼ確実性と絶対確実性の間にはほとんど違いがありません。ほぼ確実性に従ってコーディングする場合、絶対確実性に従ってコーディングする場合よりもビット数が多くなることはありません。一方、証拠の重みによって暗示される ロジット スケールでは、両者の違いは非常に大きく、おそらく無限大です。これは、たとえば リーマン予想 が正しいとほぼ確信していること (確率レベルで) と、数学的証明があるために正しいと確信していることの違いを反映している可能性があります。 不確実性に対する 損失関数 のこれら 2 つの異なるスケールは、それぞれが問題の特定の状況をどの程度反映しているかに応じて、
どちらも有用です。
相対エントロピーを識別情報として捉えるという考えから、カルバックは 最小識別情報 ( MDI できるだけ 区別しにくい 新しい分布 f できるだけ小さくなります。
f
0
{\displaystyle f_{0}}
D
KL
(
f
∥
f
0
)
{\displaystyle D_{\text{KL}}(f\parallel f_{0})}
たとえば、 x と a に関する事前分布があり 、その後 a の真の分布が であるとわかった場合、 x と a の新しい結合分布、 と以前の事前分布との間の相対エントロピーは次 の ようになります。
p
(
x
,
a
)
{\displaystyle p(x,a)}
u
(
a
)
{\displaystyle u(a)}
q
(
x
∣
a
)
u
(
a
)
{\displaystyle q(x\mid a)u(a)}
D
KL
(
q
(
x
∣
a
)
u
(
a
)
∥
p
(
x
,
a
)
)
=
E
u
(
a
)
{
D
KL
(
q
(
x
∣
a
)
∥
p
(
x
∣
a
)
)
}
+
D
KL
(
u
(
a
)
∥
p
(
a
)
)
,
{\displaystyle D_{\text{KL}}(q(x\mid a)u(a)\parallel p(x,a))=\operatorname {E} _{u(a)}\left\{D_{\text{KL}}(q(x\mid a)\parallel p(x\mid a))\right\}+D_{\text{KL}}(u(a)\parallel p(a)),}
すなわち、更新された分布 からの a の事前分布 の相対エントロピーの合計と 、 新しい条件付き分布 からの 事前条件付き分布の相対エントロピーの期待値 (確率分布 を使用)を加えたものです 。(後者の期待値は 条件付き相対エントロピー (または 条件付きカルバック・ライブラー情報) と呼ばれ、 [34] と表記されることに注意してください)。これは、 のサポート全体で で ある場合に最小化されます。また、新しい分布が実際に a が 特定の値を持つ
ことの確実性を表す δ 関数で ある場合、この結果にはベイズの定理が組み込まれていることに注意してください。
p
(
a
)
{\displaystyle p(a)}
u
(
a
)
{\displaystyle u(a)}
u
(
a
)
{\displaystyle u(a)}
p
(
x
∣
a
)
{\displaystyle p(x\mid a)}
q
(
x
∣
a
)
{\displaystyle q(x\mid a)}
D
KL
(
q
(
x
∣
a
)
∥
p
(
x
∣
a
)
)
{\displaystyle D_{\text{KL}}(q(x\mid a)\parallel p(x\mid a))}
q
(
x
∣
a
)
=
p
(
x
∣
a
)
{\displaystyle q(x\mid a)=p(x\mid a)}
u
(
a
)
{\displaystyle u(a)}
u
(
a
)
{\displaystyle u(a)}
MDI は、ラプラス の 不十分理由原理 と、 ET ジェインズ の 最大エントロピー原理 の拡張と見ることができます 。特に、これは離散分布から連続分布への最大エントロピー原理の自然な拡張であり、この場合、シャノン エントロピーはそれほど役に立たなくなりますが ( 微分エントロピー を参照)、相対エントロピーは同様に関連性を持ち続けます。
工学文献では、MDIは 最小交差エントロピー原理 (MCE)または 略して Minxentと呼ばれることもあります 。mから p への相対エントロピーを m に関して最小化することは、 p と m の交差エントロピーを最小化することと同じです 。
H
(
p
,
m
)
=
H
(
p
)
+
D
KL
(
p
∥
m
)
,
{\displaystyle \mathrm {H} (p,m)=\mathrm {H} (p)+D_{\text{KL}}(p\parallel m),}
これは、 p への適切な近似値を選択しようとしている場合には適切です 。しかし、これは達成しようとしているタスクで はないこと がほとんどです。その代わりに、多くの場合、 m は 何らかの固定された事前参照尺度であり、 p は何らかの制約の下で最小化することで最適化しようとしています。これにより、文献に曖昧さが生じ、一部の著者は、クロスエントロピーを [ 引用が必要 ] ではなく に 再定義することで矛盾を解決しようとしています 。
D
KL
(
p
∥
m
)
{\displaystyle D_{\text{KL}}(p\parallel m)}
D
KL
(
p
∥
m
)
{\displaystyle D_{\text{KL}}(p\parallel m)}
H
(
p
,
m
)
{\displaystyle \mathrm {H} (p,m)}
利用可能な仕事との関係
圧力対体積プロット(アルゴンガス1モルから得られる仕事量を周囲圧力に対して相対的に表したもの。Kullback -Leibler ダイバージェンスの倍数として計算)
T
o
{\displaystyle T_{o}}
驚き [37]は確率が乗算されるところで加算される。確率 p のイベントの驚きは と定義される 。kが の場合 、 驚きは ナット、ビット、または で表され 、例えば、 N枚 のコインを投げてすべて「表」が出た場合の驚きは N ビットとなる。
s
=
k
ln
(
1
/
p
)
{\displaystyle s=k\ln(1/p)}
{
1
,
1
/
ln
2
,
1.38
×
10
−
23
}
{\displaystyle \left\{1,1/\ln 2,1.38\times 10^{-23}\right\}}
{
{\displaystyle \{}
J
/
K
}
{\displaystyle J/K\}}
最善の推測状態(例えば、気体中の原子)は、 与えられた制御パラメータ(圧力 P や体積 Vなど)の 平均サプライズ S ( エントロピー )を最大化することによって推定される。この制約付き エントロピー最大化は 、古典的 [38] および量子力学的 [39]の両方において、エントロピー単位 [40]での ギブス 可用性を 最小化する。 ここで、 Zは 制約付き多重度または 分割関数 である。
A
≡
−
k
ln
(
Z
)
{\displaystyle A\equiv -k\ln(Z)}
温度 T が固定されている場合、自由エネルギー ( ) も最小化されます。したがって、分子数 N が一定であれば 、 システム が 「 平衡」するにつれて ヘルムホルツ自由エネルギー ( U はエネルギー、 S はエントロピー) が最小化されます。Tと P が一定に保たれている場合 (体内での処理中など)、代わりに ギブスの自由エネルギーが最小化されます。これらの条件下での自由エネルギーの変化は、プロセスで行われる可能性のある利用可能な 仕事 の尺度です。したがって、一定の温度 と圧力 での理想気体の利用可能な仕事は 、および ( ギブス の不等式 も参照)
です。
T
×
A
{\displaystyle T\times A}
T
,
V
{\displaystyle T,V}
F
≡
U
−
T
S
{\displaystyle F\equiv U-TS}
G
=
U
+
P
V
−
T
S
{\displaystyle G=U+PV-TS}
T
o
{\displaystyle T_{o}}
P
o
{\displaystyle P_{o}}
W
=
Δ
G
=
N
k
T
o
Θ
(
V
/
V
o
)
{\displaystyle W=\Delta G=NkT_{o}\Theta (V/V_{o})}
V
o
=
N
k
T
o
/
P
o
{\displaystyle V_{o}=NkT_{o}/P_{o}}
Θ
(
x
)
=
x
−
1
−
ln
x
≥
0
{\displaystyle \Theta (x)=x-1-\ln x\geq 0}
より一般的には [41]、 ある周囲温度に対する相対的な仕事量は、周囲温度に相対エントロピーまたはネットサプライズを掛けて得られる 。 これ は 、 周囲条件下での特定の状態の確率 の平均値として定義される。例えば、一原子理想気体を および の周囲値に平衡化させるのに利用可能な仕事量 は であり 、相対エントロピーは である。
T
o
{\displaystyle T_{o}}
Δ
I
≥
0
,
{\displaystyle \Delta I\geq 0,}
k
ln
(
p
/
p
o
)
{\displaystyle k\ln(p/p_{o})}
p
o
{\displaystyle p_{o}}
V
o
{\displaystyle V_{o}}
T
o
{\displaystyle T_{o}}
W
=
T
o
Δ
I
{\displaystyle W=T_{o}\Delta I}
Δ
I
=
N
k
[
Θ
(
V
V
o
)
+
3
2
Θ
(
T
T
o
)
]
.
{\displaystyle \Delta I=Nk\left[\Theta \left({\frac {V}{V_{o}}}\right)+{\frac {3}{2}}\Theta \left({\frac {T}{T_{o}}}\right)\right].}
右図に示すように、標準温度と標準圧力におけるアルゴン1モルの相対エントロピーが一定となる等高線は、例えば、炎で動くエアコンや、ここで議論されている沸騰水を氷水に変える無動力装置における熱から冷気への変換に制限を課します。 [42] このように、相対エントロピーは熱力学的利用可能性をビット単位で測定します。
ヒルベルト空間 上の 密度行列 P と Q に対して 、 Q から P への 量子相対エントロピーは 次のように定義される。
D
KL
(
P
∥
Q
)
=
Tr
(
P
(
log
(
P
)
−
log
(
Q
)
)
)
.
{\displaystyle D_{\text{KL}}(P\parallel Q)=\operatorname {Tr} (P(\log(P)-\log(Q))).}
量子情報科学 では、 すべての分離可能な状態 Q の最小値は、 状態 Pにおける エンタングルメント の尺度としても使用できます 。
D
KL
(
P
∥
Q
)
{\displaystyle D_{\text{KL}}(P\parallel Q)}
モデルと現実の関係
「周囲温度からの実際の」相対エントロピーが熱力学的利用可能性を測定するのと同様に、「モデルからの現実」の相対エントロピーも、たとえ現実について私たちが持っている唯一の手がかりがいくつかの実験測定であったとしても有用です。前者の場合、相対エントロピーは 平衡までの距離 、または(周囲温度を乗じた場合) 利用可能な仕事 の量を表しますが、後者の場合、それは現実が秘めている驚き、つまり、 モデルがまだどれだけ学習する必要があるか を示します。
実験的にアクセス可能なシステムに対してモデルを評価するこのツールは、あらゆる分野に適用できますが、 赤池情報量基準 による 統計モデルの 選択への応用は、バーナムとアンダーソンによる論文 [43] と書籍 [44]で特に詳しく説明されています。簡単に言えば、モデルからの現実の相対エントロピーは、データとモデルの予測値の間で観察された偏差( 平均二乗偏差 など)の関数によって、一定の加法項内で推定 できます。同じ加法項を共有するモデルのこのような発散の推定値は、モデルの選択に使用できます。
パラメータ化されたモデルをデータに適合させようとする場合、最大尤度推定量 や 最大間隔 推定量など、相対エントロピーを最小化しようとするさまざまな推定量があります 。 [ 引用が必要 ]
対称発散
Kullback & Leibler (1951)も対称化された関数を検討した:
D
KL
(
P
∥
Q
)
+
D
KL
(
Q
∥
P
)
{\displaystyle D_{\text{KL}}(P\parallel Q)+D_{\text{KL}}(Q\parallel P)}
彼らはこれを「ダイバージェンス」と呼んでいたが、今日では「KLダイバージェンス」は非対称関数を指す(この用語の変遷については§ 語源を参照)。この関数は対称かつ非負であり、 1948年に ハロルド・ジェフリーズ によってすでに定義され使用されていたため、 ジェフリーズ・ダイバージェンス と呼ばれている 。
この量は、分類 問題 における 特徴選択 に使用されることがあります。ここで、 P と Q は 、2 つの異なるクラスにおける特徴の条件付き pdfです。銀行および金融業界では、この量は Population Stability Index ( PSI )と呼ばれ 、時間の経過に伴うモデル特徴の分布の変化を評価するために使用されます。
別の方法としては 、-発散によって与えられる。
λ
{\displaystyle \lambda }
D
λ
(
P
∥
Q
)
=
λ
D
KL
(
P
∥
λ
P
+
(
1
−
λ
)
Q
)
+
(
1
−
λ
)
D
KL
(
Q
∥
λ
P
+
(
1
−
λ
)
Q
)
,
{\displaystyle D_{\lambda }(P\parallel Q)=\lambda D_{\text{KL}}(P\parallel \lambda P+(1-\lambda )Q)+(1-\lambda )D_{\text{KL}}(Q\parallel \lambda P+(1-\lambda )Q),}
これは、現在それぞれ確率が と である場合に、 確率分布 P または Q のどちらから X が抽出されるかを発見することによる、 X についての期待情報ゲインとして解釈できます 。 [ 説明が必要 ] [ 引用が必要 ]
λ
{\displaystyle \lambda }
1
−
λ
{\displaystyle 1-\lambda }
この値は 、次のように定義される
ジェンセン・シャノン距離 を与える。
λ
=
0.5
{\displaystyle \lambda =0.5}
D
JS
=
1
2
D
KL
(
P
∥
M
)
+
1
2
D
KL
(
Q
∥
M
)
{\displaystyle D_{\text{JS}}={\frac {1}{2}}D_{\text{KL}}(P\parallel M)+{\frac {1}{2}}D_{\text{KL}}(Q\parallel M)}
ここで Mは 2つの分布の平均であり、
M
=
1
2
(
P
+
Q
)
.
{\displaystyle M={\frac {1}{2}}(P+Q).}
出力分布 P と Q を 与える 2 つの入力を持つノイズの多い情報チャネルの容量として解釈することもできます 。ジェンセン・シャノン ダイバージェンスは、すべての f ダイバージェンスと同様に、 フィッシャー情報メトリック に 局所的に比例します。これは、 ヘリンガー メトリック に似ています( 統計多様 体 に同じアフィン接続を誘導するという意味で )。
D
JS
{\displaystyle D_{\text{JS}}}
さらに、ジェンセン・シャノン情報量は、抽象的な平均Mに依存する抽象的な統計的M混合を使用して一般化することができる。 [45] [46]
他の確率距離尺度との関係
確率距離 の重要な尺度は他にもたくさんあります 。これらのいくつかは特に相対エントロピーと関連しています。例えば、
全 変動距離 、 。これは、 ピンスカー不等式 を介して発散と関連しています 。 全変動距離は最大でも 1 であるため、となる分布に対してはピンスカー不等式は空です。このような分布に対しては、 Bretagnolle と Huber [47] による別の境界を使用できます(Tsybakov [48] も参照 )。
δ
(
p
,
q
)
{\displaystyle \delta (p,q)}
δ
(
P
,
Q
)
≤
1
2
D
KL
(
P
∥
Q
)
.
{\displaystyle \delta (P,Q)\leq {\sqrt {{\frac {1}{2}}D_{\text{KL}}(P\parallel Q)}}.}
D
K
L
(
P
∥
Q
)
>
2
{\displaystyle D_{\mathrm {KL} }(P\parallel Q)>2}
δ
(
P
,
Q
)
≤
1
−
e
−
D
K
L
(
P
∥
Q
)
.
{\displaystyle \delta (P,Q)\leq {\sqrt {1-e^{-D_{\mathrm {KL} }(P\parallel Q)}}}.}
レーニイ ダイバージェンス の族は 相対エントロピーを一般化します。特定のパラメータの値に応じて、 さまざまな不等式が推定されます。
α
{\displaystyle \alpha }
その他の注目すべき距離の尺度としては、 ヘリンガー距離 、 ヒストグラム交差 、 カイ二乗統計量 、 二次形式距離 、 一致距離 、 コルモゴロフ・スミルノフ距離 、 アースムーバー距離 などがある。 [49]
データの差分
絶対エントロピーが データ 圧縮 の理論的背景として機能するの と同様に 、 相対エントロピーは データ 差分 の理論的背景として機能します。この意味でのデータセットの絶対エントロピーは、データセットを再構築するために必要なデータ (最小圧縮サイズ) であり、ソースデータセットが与えられたターゲットデータセットの相対エントロピーは、 ソース が与えられた ターゲットを再構築するために必要なデータ( パッチ の最小サイズ) です。
参照
参考文献
^ ab Csiszar, I (1975年2月). 「確率分布と最小化問題のI発散幾何学」. Ann. Probab . 3 (1): 146–158. doi : 10.1214/aop/1176996454 .
^ Kullback, S. ; Leibler, RA (1951). 「情報と十分性について」 Annals of Mathematical Statistics . 22 (1): 79–86. doi : 10.1214/aoms/1177729694 . JSTOR 2236703. MR 0039968.
^ Kullback, S. (1987). 「編集者への手紙: Kullback–Leibler 距離」. アメリカ統計学者 . 41 (4): 340–341. doi :10.1080/00031305.1987.10475510. JSTOR 2684769.
^ MacKay, David JC (2003). 情報理論、推論、学習アルゴリズム(第1版)。ケンブリッジ大学出版局。p. 34。ISBN 9780521642989 – Google ブックス経由。
^ 「Kullback-Leibler (KL) ダイバージェンスの最大値はいくらですか?」。機械学習。Statistics Stack Exchange (stats.stackexchange.com) 。クロス検証済み。
^ 「どのような状況で積分は無限大に等しくなりますか?」。積分。 数学 Stack Exchange (math.stackexchange.com) 。
^ ビショップ、クリストファーM. パターン認識と機械学習。p.55。OCLC 1334664824 。
^ Burnham, KP; Anderson, DR (2002). モデル選択とマルチモデル推論 (第2版)。Springer。p. 51。ISBN 9780387953649 。
^ Abdulkadirov, Ruslan; Lyakhov, Pavel; Nagornov, Nikolay (2023年1月). 「現代のニューラルネットワークにおける最適化アルゴリズムの調査」. 数学 . 11 (11): 2466. doi : 10.3390/math11112466 . ISSN 2227-7390.
^ Matassa, Marco (2021年12月). 「量子射影空間上のFubini-StudyメトリクスとLevi-Civita接続」. Advances in Mathematics . 393 :108101. arXiv : 2010.03291 . doi :10.1016/j.aim.2021.108101. ISSN 0001-8708.
^ Lan, Guanghui (2023年3月). 「強化学習のためのポリシーミラー降下法:線形収束、新しいサンプリング複雑性、一般化された問題クラス」. 数学プログラミング . 198 (1): 1059–1106. doi :10.1007/s10107-022-01816-5. ISSN 1436-4646.
^ Kelly, JL Jr. (1956). 「情報レートの新しい解釈」. Bell Syst. Tech. J. 2 ( 4): 917–926. doi :10.1002/j.1538-7305.1956.tb03809.x.
^ Soklakov, AN (2020). 「意見の相違の経済学—レーニイ・ダイバージェンスに関する金融直感」. エントロピー . 22 (8): 860. arXiv : 1811.08308 . Bibcode :2020Entrp..22..860S. doi : 10.3390/e22080860 . PMC 7517462. PMID 33286632 .
^ Soklakov, AN (2023). 「リスクとリターンの情報幾何学」. リスク . 6月 . SSRN 4134885.
^ヘニデ、カリム(2024年9月30日)。「フローライダー:相対価値 の 決定要因としての取引可能なエコシステムのフローの相対エントロピー」。 投資ジャーナル 。33 (6):34–58。doi : 10.3905 / joi.2024.1.321。
^ Sanov, IN (1957). 「ランダムな大きさの大きな偏差の確率について」 Mat. Sbornik . 42 (84): 11–44.
^ Novak SY (2011)、 「極値法と金融への応用」 第14.5章 ( Chapman & Hall )。ISBN 978-1-4398-3574-6 。
^ ホブソン、アーサー (1971)。 統計力学の概念 。ニューヨーク:ゴードン&ブリーチ 。ISBN 978-0677032405 。
^ Bonnici, V. (2020). 「量子分布間のカルバック・ライブラーダイバージェンスとその上限」 arXiv : 2008.05932 [cs.LG].
^ Sergio Verdú NIPS 2009 による相対エントロピービデオ講義の「微分エントロピー – 4」のセクションを参照してください。
^ Donsker , Monroe D.; Varadhan, SR Srinivasa (1983). 「長時間にわたる特定のマルコフ過程期待値の漸近的評価。IV」。 純粋 および応用数学に関する通信 。36 (2): 183–212。doi :10.1002/cpa.3160360204。
^ Lee, Se Yoon (2021). 「ギブスサンプラーと座標上昇変分推論:集合論的レビュー」. Communications in Statistics - Theory and Methods . 51 (6): 1549–1568. arXiv : 2008.01006 . doi :10.1080/03610926.2021.1921214. S2CID 220935477.
^ Duchi J.「線形代数と最適化の導出」 (PDF) 。p. 13。
^ Belov, Dmitry I.; Armstrong, Ronald D. (2011-04-15). 「Kullback-Leibler ダイバージェンスの分布とその応用」. British Journal of Mathematical and Statistical Psychology . 64 (2): 291–309. doi :10.1348/000711010x522227. ISSN 0007-1102. PMID 21492134.
^ ab Buchner, Johannes (2022-04-29). 物理学者のための直感:実験からの情報獲得。OCLC 1363563215 。
^ ab Cover, Thomas M.; Thomas, Joy A. (1991) 『 情報理論の要素 』 John Wiley & Sons 、p. 22
^ Chaloner, K.; Verdinelli, I. (1995). 「ベイズ実験デザイン:レビュー」. 統計科学 . 10 (3): 273–304. doi : 10.1214/ss/1177009939 . hdl : 11299/199630 .
^ Press, WH; Teukolsky, SA; Vetterling, WT; Flannery, BP (2007). 「セクション 14.7.2. Kullback–Leibler 距離」。 数値レシピ: 科学計算の芸術 (第 3 版)。ケンブリッジ大学出版局 。ISBN 978-0-521-88068-8 。
^ トリバス、マイロン (1959)。『サーモスタティックスと熱力学: エネルギー、情報、物質の状態への入門、工学的応用』ヴァン・ノストランド。
^ Jaynes, ET (1957). 「情報理論と統計力学」 (PDF) . Physical Review . 106 (4): 620–630. Bibcode :1957PhRv..106..620J. doi :10.1103/physrev.106.620. S2CID 17870175.
^ Jaynes, ET (1957). 「情報理論と統計力学 II」 (PDF) . Physical Review . 108 (2): 171–190. Bibcode :1957PhRv..108..171J. doi :10.1103/physrev.108.171.
^ ギブス、ジョサイア・ウィラード(1871)。表面による物質の熱力学的性質の幾何学的表現の方法。アカデミー。 脚注52ページ。
^ Tribus, M.; McIrvine, EC (1971). 「エネルギーと情報」. Scientific American . 224 (3): 179–186. Bibcode :1971SciAm.225c.179T. doi :10.1038/scientificamerican0971-179.
^ Fraundorf, P. (2007). 「相関ベースの複雑性の熱的根」. Complexity . 13 (3): 18–26. arXiv : 1103.2481 . Bibcode :2008Cmplx..13c..18F. doi :10.1002/cplx.20195. S2CID 20794688. 2011-08-13にオリジナルからアーカイブ。
^ Burnham, KP; Anderson, DR (2001). 「生態学的研究における強力な推論の基礎としてのKullback–Leibler情報」. Wildlife Research . 28 (2): 111–119. doi : 10.1071/WR99107 .
^ バーナム、ケネス P. (2010 年 12 月)。モデル選択とマルチモデル推論: 実用的な情報理論的アプローチ。シュプリンガー 。ISBN 978-1-4419-2973-0 . OCLC 878132909.
^ Nielsen, Frank (2019). 「抽象的手段に基づく距離のJensen-Shannon対称化について」. エントロピー . 21 (5): 485. arXiv : 1904.04017 . Bibcode :2019Entrp..21..485N. doi : 10.3390/e21050485 . PMC 7514974. PMID 33267199 .
^ Nielsen, Frank (2020). 「Jensen–ShannonダイバージェンスとJensen–Shannonセントロイドの一般化について」. エントロピー . 22 (2): 221. arXiv : 1912.00610 . Bibcode :2020Entrp..22..221N. doi : 10.3390/e22020221 . PMC 7516653. PMID 33285995 .
^ ブレタニョール、J.; Huber, C. (1978)、「Estimation des densités : Risque minimax」、Séminaire de Probabilités XII、数学講義ノート (フランス語)、vol. 649、ベルリン、ハイデルベルク:シュプリンガー ベルリン ハイデルベルク、pp. 342–363、 doi :10.1007/bfb0064610、 ISBN 978-3-540-08761-8 , S2CID 122597694 , 2023-02-14 取得 補題2.1
^ B.), Tsybakov, AB (Alexandre (2010). ノンパラメトリック推定入門. Springer. ISBN 978-1-4419-2709-5 . OCLC 757859245. {{cite book}}: CS1 maint: multiple names: authors list (link)式2.25.
^ Rubner, Y.; Tomasi, C.; Guibas, LJ (2000). 「画像検索の指標としての地球移動距離」 International Journal of Computer Vision . 40 (2): 99–121. doi :10.1023/A:1026543900054. S2CID 14106275.
天利俊一 (2016). 情報幾何学とその応用 . 応用数理科学. 第194巻. シュプリンガージャパン. pp. XIII, 374. doi :10.1007/978-4-431-55978-8. ISBN 978-4-431-55977-1 。
カルバック、ソロモン(1959)、 情報理論と統計 、 ジョン・ワイリー&サンズ 1968年にDover Publications から再出版 、1978年に再版: ISBN 0-8446-5625-9 。
ジェフリーズ、ハロルド(1948年)。 確率論 (第2版)。オックスフォード大学出版局。
外部リンク
情報理論的推定ツールボックス
カルバック・ライブラー距離を計算するための Ruby gem
Jon Shlens による Kullback–Leibler ダイバージェンスと尤度理論に関するチュートリアル
離散分布の Kullback–Leibler ダイバージェンスを計算する Matlab コード
Sergio Verdú 、「相対エントロピー」、 NIPS 2009。1 時間のビデオ講義。
情報理論的発散尺度の現代的な要約