ジェンセンの不等式は 、凸関数の割線はそのグラフの上にあるという命題を一般化したものである。凸性とイェンセンの不等式の視覚化 数学 において、デンマークの数学者ヨハン・イェンセンにちなんで名付けられた イェンセンの不等式は、 積分の 凸関数 の値と凸関数の積分を関連付けます。これは、 1889年にオットー・ヘルダー が二回微分可能な関数に対して同じ不等式を証明したことを基に、1906年にイェンセンによって証明されました。 [ 1 ] [ 2 ] この不等式は 一般性があるため、文脈に応じてさまざまな形で現れ、そのいくつかを以下に示します。最も単純な形では、この不等式は、平均の凸変換は、凸変換を適用した後の平均以下である(または同等に、凹変換の場合は逆の不等式)と述べています。[ 3 ]
ジェンセンの不等式は、凸関数の割線が 関数 のグラフの上 に あるという記述を一般化したもので、これは 2 つの点に対するジェンセンの不等式です。割線は凸関数の加重平均で構成されます ( t ∈ [0,1] の場合)。
t f ( x 1 ) + ( 1 − t ) f ( x 2 ) 、 {\displaystyle tf(x_{1})+(1-t)f(x_{2}),} 関数のグラフは加重平均の凸関数である一方、
f ( t x 1 + ( 1 − t ) x 2 ) 。 {\displaystyle f(tx_{1}+(1-t)x_{2}).} したがって、この場合のイェンセンの不等式は次のようになる。
f ( t x 1 + ( 1 − t ) x 2 ) ≤ t f ( x 1 ) + ( 1 − t ) f ( x 2 ) 。 {\displaystyle f(tx_{1}+(1-t)x_{2})\leq tf(x_{1})+(1-t)f(x_{2}).} 確率論 の文脈では、一般的に次の形式で述べられます。Xが 確率変数 で、φ が 凸関数である場合、
φ ( E [ X ] ) ≤ E [ φ ( X ) ] 。 \displaystyle \varphi (\operatorname {E} [X])\leq \operatorname {E} \left[\varphi (X)\right].} 不等式の両辺の差は、E [ φ ( X ) ] − φ ( E [ X ] ) {\displaystyle \operatorname {E} \left[\varphi (X)\right]-\varphi \left(\operatorname {E} [X]\right)} これはジェンセンギャップ と呼ばれている。[ 4 ]
声明 イェンセンの不等式の古典的な形式には、いくつかの数値と重みが含まれます。この不等式は、測度論 または(同等に)確率論の言語を使用して、かなり一般的に記述できます。確率論的設定では、この不等式は完全な強度 までさらに一般化できます。
させて( Ω 、 A 、 μ ) {\displaystyle (\Omega ,A,\mu )} を確率空間 とする。f : Ω → R {\displaystyle f:\Omega \to \mathbb {R} } になるμ {\displaystyle \mu } -積分可能な関数とφ : R → R {\displaystyle \varphi :\mathbb {R} \to \mathbb {R} } は凸である。すると: [ 5 ] φ ( ∫ Ω f d μ ) ≤ ∫ Ω φ ∘ f d μ {\displaystyle \varphi \left(\int _{\Omega }f\,\mathrm {d} \mu \right)\leq \int _{\Omega }\varphi \circ f\,\mathrm {d} \mu }
実際の分析 では、推定値が必要になる場合があります。
φ ( ∫ 1 b f ( x ) d x ) {\displaystyle \varphi \left(\int _{a}^{b}f(x)\,dx\right)} どこ1 、 b ∈ R {\displaystyle a,b\in \mathbb {R} } 、 そしてf : [ 1 、 b ] → R {\displaystyle f\colon [a,b]\to \mathbb {R} } は非負のルベーグ積分可能な 関数です。この場合、のルベーグ測度は [ 1 、 b ] {\displaystyle [a,b]} 1 である必要はありません。ただし、置換積分により、区間を再スケーリングして、その尺度が 1 になるようにすることができます。次に、イェンセンの不等式を適用して[ 6 ]を得ることができます。
φ ( 1 b − 1 ∫ 1 b f ( x ) d x ) ≤ 1 b − 1 ∫ 1 b φ ( f ( x ) ) d x 。 {\displaystyle \varphi \left({\frac {1}{b-a}}\int _{a}^{b}f(x)\,dx\right)\leq {\frac {1}{b-a}}\int _{a}^{b}\varphi (f(x))\,dx.}
証明
λ 1 とλ 2が λ 1 + λ 2 = 1 を満たす任意の非負の実数である場合、 φ の凸性は以下を意味する。
∀ x 1 、 x 2 : φ ( λ 1 x 1 + λ 2 x 2 ) ≤ λ 1 φ ( x 1 ) + λ 2 φ ( x 2 ) 。 {\displaystyle \forall x_{1},x_{2}:\qquad \varphi \left(\lambda _{1}x_{1}+\lambda _{2}x_{2}\right)\leq \lambda _{1}\,\varphi (x_{1})+\lambda _{2}\,\varphi (x_{2}).} これは一般化できる。λ 1 、 ...、λ n が非負の実数で、λ 1 + ... + λ n = 1 である場合、
φ ( λ 1 x 1 + λ 2 x 2 + ⋯ + λ n x n ) ≤ λ 1 φ ( x 1 ) + λ 2 φ ( x 2 ) + ⋯ + λ n φ ( x n ) 、 {\displaystyle \varphi (\lambda _{1}x_{1}+\lambda _{2}x_{2}+\cdots +\lambda _{n}x_{n})\leq \lambda _{1}\,\varphi (x_{1})+\lambda _{2}\,\varphi (x_{2})+\cdots +\lambda _{n}\,\varphi (x_{n}),} 任意のx 1 、 ...、x n に対して。
イェンセンの不等式の有限形は帰納法で証明できます。凸 性 の仮定により、n = 2 の場合、この命題は真です。あるn に対してこの命題が真であると仮定すると、
φ ( ∑ 私 = 1 n λ 私 x 私 ) ≤ ∑ 私 = 1 n λ 私 φ ( x 私 ) {\displaystyle \varphi \left(\sum _{i=1}^{n}\lambda _{i}x_{i}\right)\leq \sum _{i=1}^{n}\lambda _{i}\varphi \left(x_{i}\right)} λ 1 , ..., λ n に対して、 λ 1 + ... + λ n = 1 となる。
n + 1 の 場合について証明する必要がある。λ i の少なくとも 1 つは厳密により小さい。 1 {\displaystyle 1} λ n +1 とすると、凸性不等式により次のようになる。
φ ( ∑ 私 = 1 n + 1 λ 私 x 私 ) = φ ( ( 1 − λ n + 1 ) ∑ 私 = 1 n λ 私 1 − λ n + 1 x 私 + λ n + 1 x n + 1 ) ≤ ( 1 − λ n + 1 ) φ ( ∑ 私 = 1 n λ 私 1 − λ n + 1 x 私 ) + λ n + 1 φ ( x n + 1 ) 。 {\displaystyle {\begin{aligned}\varphi \left(\sum _{i=1}^{n+1}\lambda _{i}x_{i}\right)&=\varphi \left((1-\lambda _{n+1})\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}x_{i}+\lambda _{n+1}x_{n+1}\right)\\&\leq (1-\lambda _{n+1})\varphi \left(\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}x_{i}\right)+\lambda _{n+1}\,\varphi (x_{n+1}).\end{aligned}}} λ 1 + ... + λ n + λ n +1 = 1 なので、
∑ 私 = 1 n λ 私 1 − λ n + 1 = 1 {\displaystyle \sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}=1} 、帰納的仮説を適用すると、
φ ( ∑ 私 = 1 n λ 私 1 − λ n + 1 x 私 ) ≤ ∑ 私 = 1 n λ 私 1 − λ n + 1 φ ( x 私 ) {\displaystyle \varphi \left(\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}x_{i}\right)\leq \sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}\varphi (x_{i})} したがって
φ ( ∑ 私 = 1 n + 1 λ 私 x 私 ) ≤ ( 1 − λ n + 1 ) ∑ 私 = 1 n λ 私 1 − λ n + 1 φ ( x 私 ) + λ n + 1 φ ( x n + 1 ) = ∑ 私 = 1 n + 1 λ 私 φ ( x 私 ) {\displaystyle {\begin{aligned}\varphi \left(\sum _{i=1}^{n+1}\lambda _{i}x_{i}\right)&\leq (1-\lambda _{n+1})\sum _{i=1}^{n}{\frac {\lambda _{i}}{1-\lambda _{n+1}}}\varphi (x_{i})+\lambda _{n+1}\,\varphi (x_{n+1})=\sum _{i=1}^{n+1}\lambda _{i}\varphi (x_{i})\end{aligned}}} 我々は、 n + 1 の場合に不等式が成り立つことを推論し、帰納法により、 2 より大きいすべての整数n に対しても結果が成り立つことを導きます。
この有限形式から一般不等式を得るには、稠密性論証を用いる必要がある。有限形式は次のように書き換えることができる。
φ ( ∫ x d μ n ( x ) ) ≤ ∫ φ ( x ) d μ n ( x ) 、 {\displaystyle \varphi \left(\int x\,d\mu _{n}(x)\right)\leq \int \varphi (x)\,d\mu _{n}(x),} ここで、μ n はディラックのデルタ の任意の凸結合 によって与えられる尺度である。
μ n = ∑ 私 = 1 n λ 私 δ x 私 。 {\displaystyle \mu _{n}=\sum _{i=1}^{n}\lambda _{i}\delta _{x_{i}}.} 凸関数は連続 であり、ディラックのデルタ関数の凸結合は確率測度の集合において弱 稠密であるため(これは容易に検証できる)、一般的な命題は単に極限操作によって得られる。
応用例および特殊なケース
Ω は実数直線の可測部分集合であり、f ( x ) は非負関数であると仮定する。
∫ − ∞ ∞ f ( x ) d x = 1. {\displaystyle \int _{-\infty }^{\infty }f(x)\,dx=1.} 確率論的な言葉で言えば、fは 確率密度関数 である。
すると、イェンセンの不等式は凸積分に関する次の式となる。
g が任意の実数値可測関数であり、φ {\textstyle \varphi } g の範囲で凸である場合、
φ ( ∫ − ∞ ∞ g ( x ) f ( x ) d x ) ≤ ∫ − ∞ ∞ φ ( g ( x ) ) f ( x ) d x 。 {\displaystyle \varphi \left(\int _{-\infty }^{\infty }g(x)f(x)\,dx\right)\leq \int _{-\infty }^{\infty }\varphi (g(x))f(x)\,dx.} g ( x ) = x の場合、この不等式の形式は、よく使われる特殊なケースに簡略化されます。
φ ( ∫ − ∞ ∞ x f ( x ) d x ) ≤ ∫ − ∞ ∞ φ ( x ) f ( x ) d x 。 {\displaystyle \varphi \left(\int _{-\infty }^{\infty }x\,f(x)\,dx\right)\leq \int _{-\infty }^{\infty }\varphi (x)\,f(x)\,dx.} これは変分ベイズ法 に適用される。
g ( x ) = x²n で、X が確率変数である場合、 g は凸関数である。
d 2 g d x 2 ( x ) = 2 n ( 2 n − 1 ) x 2 n − 2 ≥ 0 ∀ x ∈ R {\displaystyle {\frac {d^{2}g}{dx^{2}}}(x)=2n(2n-1)x^{2n-2}\geq 0\quad \forall \ x\in \mathbb {R} } など
g ( E [ X ] ) = ( E [ X ] ) 2 n ≤ E [ X 2 n ] 。 {\displaystyle g(\operatorname {E} [X])=(\operatorname {E} [X])^{2n}\leq \operatorname {E} [X^{2n}].} 特に、X の偶数次モーメント2n が有限であれば、X は 有限の平均を持つ。この議論を拡張すると、X は あらゆる次数において有限のモーメントを持つことが示される。l ∈ N {\displaystyle l\in \mathbb {N} } n を割る。
Ω = { x 1 , ... x n } とし、 μ を Ω 上の計数測度 とすると、一般形は和に関する記述に帰着する。
φ ( ∑ 私 = 1 n g ( x 私 ) λ 私 ) ≤ ∑ 私 = 1 n φ ( g ( x 私 ) ) λ 私 、 {\displaystyle \varphi \left(\sum _{i=1}^{n}g(x_{i})\lambda _{i}\right)\leq \sum _{i=1}^{n}\varphi (g(x_{i}))\lambda _{i},} ただし、λ i ≥ 0 であり、
λ 1 + ⋯ + λ n = 1. {\displaystyle \lambda _{1}+\cdots +\lambda _{n}=1.} 無限に離散的な形式も存在する。
統計物理学 ジェンセンの不等式は、凸関数が指数関数である場合に統計物理学において特に重要であり、次の式が成り立つ。
e E [ X ] ≤ E [ e X ] 、 {\displaystyle e^{\operatorname {E} [X]}\leq \operatorname {E} \left[e^{X}\right],} ここで、期待値は 確率変数 X の何らかの確率分布 に関するものです。
p ( x )がX の真の確率密度であり、q ( x ) が別の密度である場合、確率変数Y ( X ) = q ( X )/ p ( X ) と凸関数φ ( y ) = −log( y ) に対してイェンセンの不等式を適用すると、次のようになる。
E [ φ ( Y ) ] ≥ φ ( E [ Y ] ) {\displaystyle \operatorname {E} [\varphi (Y)]\geq \varphi (\operatorname {E} [Y])} したがって:
− D ( p ( x ) ‖ q ( x ) ) = ∫ p ( x ) ログ ( q ( x ) p ( x ) ) d x ≤ ログ ( ∫ p ( x ) q ( x ) p ( x ) d x ) = ログ ( ∫ q ( x ) d x ) = 0 {\displaystyle -D(p(x)\|q(x))=\int p(x)\log \left({\frac {q(x)}{p(x)}}\right)\,dx\leq \log \left(\int p(x){\frac {q(x)}{p(x)}}\,dx\right)=\log \left(\int q(x)\,dx\right)=0} ギブスの不等式 と呼ばれる結果。
これは、符号が他の分布qではなく真の確率 p に基づいて割り当てられる場合に平均メッセージ長が最小化されることを示している。非負の量は、q とp のカルバック・ライブラー情報量 と呼ばれ、D ( p ( x ) ‖ q ( x ) ) = ∫ p ( x ) ログ ( p ( x ) q ( x ) ) d x {\displaystyle D(p(x)\|q(x))=\int p(x)\log \left({\frac {p(x)}{q(x)}}\right)dx} 。
−log( x )は x > 0 に対して厳密に凸関数であるため、 p ( x )がq ( x ) とほぼ至るところで等しい場合に等号が成り立つことがわかる。
ラオ・ブラックウェル定理L が凸関数であり、G {\displaystyle {\mathfrak {G}}} サブシグマ代数では、イェンセンの不等式の条件付きバージョンから、次の式が得られます。
L ( E [ δ ( X ) ∣ G ] ) ≤ E [ L ( δ ( X ) ) ∣ G ] ⟹ E [ L ( E [ δ ( X ) ∣ G ] ) ] ≤ E [ L ( δ ( X ) ) ] 。 {\displaystyle L(\operatorname {E} [\delta (X)\mid {\mathfrak {G}}])\leq \operatorname {E} [L(\delta (X))\mid {\mathfrak {G}}]\quad \Longrightarrow \quad \operatorname {E} [L(\operatorname {E} [\delta (X)\mid {\mathfrak {G}}])]\leq \operatorname {E} [L(\delta (X))].} したがって、δ( X )が観測可能なベクトルXが与えられたときの未観測パラメータθの 推定値 であり、T ( X )がθの十分統計量である場合、期待損失 Lが 小さいという意味で改善された推定値は、計算によって得られます。
δ 1 ( X ) = E θ [ δ ( X ′ ) ∣ T ( X ′ ) = T ( X ) ] 、 {\displaystyle \delta _{1}(X)=\operatorname {E} _{\theta }[\delta (X')\mid T(X')=T(X)],} 観測されたT ( X )と同じ値と互換性のある観測X のすべての可能なベクトルについて取られた、θに関するδの期待値。さらに、Tは十分統計量であるため、δ 1 ( X ) {\displaystyle \delta _{1}(X)} θに依存しないため、統計量となる。
この結果はラオ・ブラックウェル定理 として知られている。
リスク回避 リスク回避 とスカラー結果に対する限界効用逓減 の関係は、イェンセンの不等式を用いて形式的に表現できる。リスク回避とは、ある特定の結果を好むことであると表現できる。u ( E [ x ] ) {\displaystyle u(E[x])} 潜在的に大きな不確実な結果を伴う公平な賭けu ( x ) {\displaystyle u(x)} :
u ( E [ x ] ) > E [ u ( x ) ] {\displaystyle u(E[x])>E[u(x)]} 。
しかしこれは単に凹関数 に対するイェンセンの不等式であるu ( x ) {\displaystyle u(x)} :限界効用逓減を示す効用関数。 [ 11 ]
一般化 実数と凸関数に関する古典的な定式化を超えて、イェンセンの不等式は作用素論 の領域にまで拡張されている。この非可換な設定では、不等式は作用素凸関数、すなわち区間 I 上で定義され、以下の条件を満たす関数を用いて表現される。
f ( λ x + ( 1 − λ ) y ) ≤ λ f ( x ) + ( 1 − λ ) f ( y ) {\displaystyle f{\bigl (}\lambda x+(1-\lambda )y{\bigr )}\leq \lambda f(x)+(1-\lambda )f(y)} 自己共役演算子 x と y (スペクトルが I に属する) の任意のペアとすべてのスカラーに対してλ ∈ [ 0 、 1 ] {\displaystyle \lambda \in [0,1]} ハンセンとペダーセン[ 12 ]は 、真の非可換凸結合を考慮することにより、この不等式の決定版を確立した。特に、n個の有界自己共役作用素の組がある場合、x 1 、 … 、 x n {\displaystyle x_{1},\dots ,x_{n}} I のスペクトルと n 組の演算子1 1 、 … 、 1 n {\displaystyle a_{1},\dots ,a_{n}} 満足
∑ 私 = 1 n 1 私 * 1 私 = 私 、 {\displaystyle \sum _{i=1}^{n}a_{i}^{*}a_{i}=I,} すると、次の演算子ジェンセン不等式が成り立つ。
f ( ∑ 私 = 1 n 1 私 * x 私 1 私 ) ≤ ∑ 私 = 1 n 1 私 * f ( x 私 ) 1 私 。 {\displaystyle f{\Bigl (}\sum _{i=1}^{n}a_{i}^{*}x_{i}a_{i}{\Bigr )}\leq \sum _{i=1}^{n}a_{i}^{*}f(x_{i})a_{i}.} この結果は、凸変換が非可換凸結合を「尊重」し、定義区間に追加の制約を課すことなく古典的な不等式を演算子に拡張することを示している。[ 12 ] 密接に関連する拡張は、Jensen トレース不等式によって与えられる。I 上で定義された連続凸関数 f に対して、自己共役行列を考えると、x 1 、 … 、 x n {\displaystyle x_{1},\dots ,x_{n}} (I のスペクトルを含む)および行列1 1 、 … 、 1 n {\displaystyle a_{1},\dots ,a_{n}} 満足∑ 私 = 1 n 1 私 * 1 私 = 私 {\displaystyle \sum _{i=1}^{n}a_{i}^{*}a_{i}=I} すると、
Tr ( f ( ∑ 私 = 1 n 1 私 * x 私 1 私 ) ) ≤ Tr ( ∑ 私 = 1 n 1 私 * f ( x 私 ) 1 私 ) 。 {\displaystyle \operatorname {Tr} {\Bigl (}f{\Bigl (}\sum _{i=1}^{n}a_{i}^{*}x_{i}a_{i}{\Bigr )}{\Bigr )}\leq \operatorname {Tr} {\Bigl (}\sum _{i=1}^{n}a_{i}^{*}f(x_{i})a_{i}{\Bigr )}.} この不等式は有限トレースを備えたC*-環に自然に拡張され、 量子統計力学 から情報理論に至るまでの応用において特に有用である。さらに、これらの演算子不等式の縮小版は、∑ 私 = 1 n 1 私 t 1 私 ≤ 私 {\displaystyle \sum _{i=1}^{n}a_{i}^{t}a_{i}\leq I} ただし、次のような追加条件を満たす必要があります。f ( 0 ) ≤ 0 {\displaystyle f(0)\leq 0} (0 ∈ I の場合)が課せられる。作用素の連続体や、C 代数上の条件付き期待値を含む設定への拡張は、これらの一般化の幅広い適用可能性をさらに示している。
注記 ↑ ジェンセン、JLWV (1906)。「凸面と非対称性の境界線を越えて」。アクタ・マセマティカ 。30 (1): 175–193 。土井 : 10.1007/BF02418571 。↑ Guessab, A.; Schmeisser, G. (2013). "イェンセンの不等式の妥当性に関する必要十分条件". Archiv der Mathematik . 100 (6): 561– 570. doi : 10.1007/s00013-013-0522-3 . MR 3069109 . S2CID 56372266 . ↑ Dekking, FM; Kraaikamp, C.; Lopuhaa, HP; Meester, LE (2005). A Modern Introduction to Probability and Statistics: Understanding Why and How . Springer Texts in Statistics. London: Springer. doi : 10.1007/1-84628-168-7 . ISBN 978-1-85233-896-1 。↑ Gao, Xiang; Sitharam, Meera; Roitberg, Adrian (2019). "Jensenギャップの境界と平均集中分布への影響" (PDF) . The Australian Journal of Mathematical Analysis and Applications . 16 (2). arXiv : 1712.05267 . ↑ リック・デュレット (2019) 『確率:理論と例』 (第5 版)ケンブリッジ大学出版局、 25ページ。ISBN 978-1108473682 。 ↑ ニクレスク、コンスタンティン P.「積分不等式」、P. 12。 ↑ リック・デュレット (2019). 確率:理論と例 (第 5 版). ケンブリッジ大学出版局. p. 5. ISBN 978-1108473682 。↑ 注意: この一般性においては、凸関数および/または位相ベクトル空間に関する追加の仮定が必要となります。詳細は、 Perlman , Michael D. (1974). "無限次元空間上の凸ベクトル値関数に対するJensenの不等式" . Journal of Multivariate Analysis . 4 (1): 52– 65. doi : 10.1016/0047-259X(74)90005-0 . hdl : 11299/199167 の53ページの例(1.3)を参照してください。 ↑ Liao, J.; Berg, A (2018). "Sharpening Jensen's Inequality". American Statistician . 73 (3): 278– 281. arXiv : 1707.08644 . doi : 10.1080/00031305.2017.1419145 . S2CID 88515366 . ↑ Bradley, CJ (2006). 不等式入門 . 英国リーズ: 英国数学トラスト. p. 97. ISBN 978-1-906001-11-7 。↑ バック、ケリー(2010)。 資産価格決定とポートフォリオ選択理論 。オックスフォード大学出版局。5 ページ 。ISBN 978-0-19-538061-3 。1 2 Hansen, Frank; Pedersen, Gert K. (2003). "Jensenの作用素不等式".Bulletin of the London Mathematical Society . 35 (4). Cambridge University Press: 553–564 .