測定定数を含む分布
応用上重要な多くの統計分布は、モーメントやその他の測定可能な量が定数に制約されるものである。ルートヴィヒ・ボルツマンによる次の定理は、これらの制約の下での確率密度関数の形式を示す。
継続ケース
仮定する
は実数の連続した閉部分集合である。
そして私たちは指定することを選びます
測定可能な関数
そして
数字
クラスを検討します
実数値のランダム変数のうち、
(つまり、密度関数がゼロである)
)そして、
モーメント条件:
![\displaystyle \operatorname {E} [f_{j}(X)]\geq a_{j}\qquad {\text{for }}\quad j=1,\ldots ,n}](https://wikimedia.org/api/rest_v1/media/math/render/svg/3ad3559915dd27c26e0a089885b218f58f122461)
メンバーがいる場合
その密度関数は、
そして、最大エントロピー分布が存在する場合
そしてその確率密度
以下の形式をとります。

ここで我々は、
定数
そして
ラグランジュ乗数
制約付き最適化問題を解く
(これにより、
(1に積分される):[ 4 ]

Karush–Kuhn–Tucker条件を用いると、最適化問題の目的関数が凹関数であるため、最適化問題には一意の解が存在することが示される。
モーメント制約が等式(不等式ではなく)である場合、つまり、
![{\displaystyle \operatorname {E} [f_{j}(X)]=a_{j}\qquad {\text{ for }}~j=1,\ldots ,n\,,}](https://wikimedia.org/api/rest_v1/media/math/render/svg/4526dad9b84597e480bc07c3ec87fed012cd701c)
すると制約条件
削除できるため、ラグランジュ乗数に対する最適化は制約を受けなくなります。
離散的なケース
仮定する
は実数の(有限または無限の)離散部分集合であり、我々はそれを指定することを選択する。
関数
そして
数字
クラスを検討します
すべての離散確率変数
以下でサポートされています
そして、
モーメント条件
![\displaystyle \operatorname {E} [f_{j}(X)]\geq a_{j}\qquad ~{\text{ for }}~j=1,\ldots ,n}](https://wikimedia.org/api/rest_v1/media/math/render/svg/265289cdc38038d2928ee3d3de06c90e05522ff4)
クラスのメンバーが存在する場合
これは、すべてのメンバーに正の確率を割り当てます。
そして、最大エントロピー分布が存在する場合
この場合、この分布は次のような形状になります。

ここで我々は、
そして定数
制約付き最適化問題を解く
: [ 5 ]

上記と同様に、モーメント条件が等式(不等式ではなく)である場合、制約条件は
最適化には含まれていません。
等式制約の場合の証明
等式制約の場合、この定理は変分法とラグランジュ乗数法を用いて証明される。制約は次のように記述できる。

関数を考察する

どこ
そして
はラグランジュ乗数です。ゼロ番目の制約は確率の第2公理を保証します。その他の制約は、関数の測定値が次数まで定数として与えられることです。
エントロピーは、関数微分がゼロに等しいときに極値をとる。

したがって、この場合の極値エントロピー確率分布は次の形式である必要があります(
)

それを覚えておいてください
この解の周りの変動が常に負であることを確認することで、これが最大解であることを検証できます。
最大化の独自性
仮定する
そして
は期待値制約を満たす分布である。
分布を考慮すると
この分布は期待制約を満たし、さらにサポートも備えていることは明らかです。
エントロピーに関する基本的な事実から、次のことが成り立つ。
限界を設ける
そして
それぞれ、収量
期待値制約を満たしエントロピーを最大化する分布は、必然的に完全なサポートを持つ、つまり分布はほとんど至るところで厳密に正である。したがって、最大化分布は期待値制約を満たす分布の空間内の内部点、すなわち局所極値でなければならない。したがって、局所極値が一意であることを示すだけで、エントロピー最大化分布が一意であることを示すことができ(そして、これは局所極値が全体最大値であることも示す)、十分である。
仮定する
そして
これらは局所的な極値です。上記の計算を再定式化すると、これらはパラメータによって特徴付けられます。
経由
同様に
どこ
ここで一連の恒等式に注目します。期待制約を満たし、勾配/方向微分を利用することにより、次の式が得られます。
同様に
賃貸
得られるもの:

どこ
一部の人にとって
さらに計算すると、
![{\displaystyle {\begin{aligned}0&={\left.D_{u}^{2}\log C(\cdot )\right|}_{\boldsymbol {\gamma }}\\[1ex]&={\left.D_{u}\left({\frac {D_{u}C(\cdot )}{C(\cdot )}}\right)\right|}_{\boldsymbol {\gamma }}={\left.{\frac {D_{u}^{2}C(\cdot )}{C(\cdot )}}\right|}_{\boldsymbol {\gamma }}-{\left.{\frac {{\left(D_{u}C(\cdot )\right)}^{2}}{C(\cdot )^{2}}}\right|}_{\boldsymbol {\gamma }}\\[1ex]&=\operatorname {E} _{q}\left[{\left\langle u,\mathbf {f} (X)\right\rangle }^{2}\right]-{\left(\operatorname {E} _{q}\left[\left\langle u,\mathbf {f} (X)\right\rangle \right]\right)}^{2}\\[2ex]&=\operatorname {Var} _{q}\left[\left\langle u,\mathbf {f} (X)\right\rangle \right]\end{aligned}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/14c7198d43d8c2accf5ee296ca742035414def47)
どこ
上記の分布と似ていますが、パラメータ化されているのは
観測量の非自明な線形結合がほとんど至るところで定数(ae)にならないと仮定すると(これは、例えば観測量が独立でae定数でない場合に成り立つ)、次のことが成り立つ。
分散がゼロでない場合を除き、
上記の式から、後者が真であることは明らかである。したがって
したがって、局所極値を特徴付けるパラメータは
これらは同一であり、つまり分布自体が同一である。したがって、局所極値は一意であり、上記の議論から、局所極値が実際に存在する場合、最大値も一意である。
注意点
すべての分布クラスに最大エントロピー分布が含まれるわけではないことに注意してください。クラスには任意に大きなエントロピーの分布が含まれる可能性があります(たとえば、平均が 0 で標準偏差が任意のR上のすべての連続分布のクラス)。また、エントロピーは上限が定められていますが、最大エントロピーを達成する分布は存在しません。[ a ]クラスCの期待値の制約により、 Sの特定の部分集合で確率分布がゼロになる可能性もあります。その場合、私たちの定理は適用されませんが、集合Sを縮小することでこれを回避できます。
例
確率分布は、分布が独自のエントロピーを持つという制約の下では、自明に最大エントロピー確率分布である。これを確認するには、密度を次のように書き換える。
そして、上記の定理の表現と比較します。
測定可能な関数であり、

不変であること、
制約条件の下での最大エントロピー確率分布は

非自明な例としては、エントロピーの割り当てとは異なる複数の制約を受ける分布が挙げられる。これらは多くの場合、同じ手順から始めることで見つかる。
そして、
複数の部分に分けることができる。
最大エントロピー分布の例の表は、Lisman (1972) [ 6 ]および Park & Bera (2009) [ 7 ]に示されている。
区間 [ a , b ] 上の一様分布は、区間 [ a , b ] 内でサポートされるすべての連続分布の中で最大のエントロピー分布であり、したがって、区間外では確率密度は 0 になります。この一様密度は、ラプラスの無差別原理(不十分な理由の原理とも呼ばれる)と関連付けることができます。より一般的に、区間 [ a , b ] の分割a = a 0 < a 1 < ... < a k = bと、合計が 1 になる確率p 1 ,..., p kが与えられている場合、次のようなすべての連続分布のクラスを考えることができます。
このクラスの最大エントロピー分布の密度は、各区間 [ a j −1 , a j ) で一定です。有限集合 { x 1 ,..., x n } 上の一様分布 (これらの各値に 1/ nの確率を割り当てる) は、この集合でサポートされているすべての離散分布の中で最大のエントロピー分布です。
正の値で指定された平均値:指数分布
指数分布の密度関数は

は、[0,∞) の範囲内でサポートされているすべての連続分布の中で、指定された平均値が 1/λ である最大エントロピー分布です。
[0,∞) でサポートされる分布の場合、最大エントロピー分布は、1 次モーメントと 2 次モーメントの関係に依存します。特定のケースでは、指数分布になる場合もあれば、別の分布になる場合もあり、定義できない場合もあります。[ 8 ]
指定された平均と分散:正規分布
正規分布N ( μ , σ 2 ) の密度関数は次のようになります。

は、特定の分散σ²を持つ(特定のモーメント) 上の実数値分布の中で、最大のエントロピーを持ちます。平均μと分散σ²が指定されている場合 (最初の 2 つのモーメント) も同様です。エントロピーは ( −∞ ,∞)上で並進不変であるためです。したがって、正規性の仮定は、これらのモーメントを超える最小限の事前構造制約を課します。(導出については、微分エントロピーの記事を参照してください。)
指定された平均値を持つ離散分布
指定された平均μを持つ集合{ x1 , ..., xn }上でサポートされるすべての離散分布の中で、最大エントロピー分布は次の形状を持つ。
ここで、正の定数Cとr は、すべての確率の合計が 1 であり、期待値が μ でなければならないという要件によって決定できます。
例えば、N個のサイコロを投げ、出た目の合計がSであるとします。この情報だけに基づいて、1、2、...、6 の目が出たサイコロの数について、妥当な仮定は何でしょうか。これは、{ x 1 ,..., x 6 } = {1,...,6}でμ = S / Nとなる、上記で検討した状況の一例です。
最後に、無限集合上にサポートされるすべての離散分布の中で
平均μの場合、最大エントロピー分布は次の形状になります。
ここでも定数Cとr は、すべての確率の合計が 1 であり、期待値が μ でなければならないという要件によって決定されます。たとえば、 x k = kの場合、これは次のようになります 。
それぞれの最大エントロピー分布が幾何分布となるように。
円形確率変数
連続確率変数
単位円上に分布するフォン・ミーゼス分布は、第1円モーメントの実部と虚部が指定されている場合[ 9 ]、または同等に、円平均と円分散が指定されている場合にエントロピーを最大化します。
角度の平均と分散が
モジュロ
が指定されている場合、ラップされた正規分布はエントロピーを最大化する。[ 9 ]
指定された平均、分散、歪度を最大化する
連続確率変数のエントロピーには上限が存在する。
指定された平均、分散、歪度を持つ。しかし、この上限を達成する分布は存在しない。なぜなら
は、
(カバー &トーマス(2006年:第12章)を参照)。
しかし、最大エントロピーはε達成可能であり、分布のエントロピーは上限に任意に近づけることができます。指定された平均と分散の正規分布から始めます。正の歪度を導入するには、正規分布を平均よりσ倍大きい値でわずかに上方に摂動させます。歪度は3次モーメントに比例するため、低次のモーメントよりも影響を受けます。
これは、 xに関する任意の奇数次多項式の指数が有界でない一般の場合の特殊なケースです。
。 例えば、
同様に無制限になる
しかし、サポートが有界または半有界の区間に限定されている場合、上限エントロピー境界が達成される可能性があります(たとえば、x が区間 [0, ∞ ] にあり、λ < 0の場合、指数分布が得られます)。
その他の例
以下の表では、リストされている各分布は、3 列目に記載されている特定の機能制約のセットのエントロピーを最大化し、制約は
確率密度のサポートに含まれるものとし、これは第4列に記載されています。[ 6 ] [ 7 ]
挙げられている例のいくつか(ベルヌーイ分布、幾何分布、指数分布、ラプラス分布、パレート分布)は、関連する制約がエントロピーの割り当てと等価であるため、自明に正しい。しかし、これらの制約は一般的な量、あるいは容易に測定できる量に関係しているため、あえて含めている。
参考までに、
ガンマ関数は、
はディガンマ関数です。
はベータ関数であり、
はオイラー・マスケローニ定数です。
最大エントロピー原理は、統計的混合物のエントロピーの上限を求めるために使用できる。[ 13 ]