例
最小平均二乗誤差推定 ベイズ推定で最も一般的に使用されるリスク関数は、平均二乗誤差 (MSE)であり、二乗誤差リスク とも呼ばれます。MSEは次のように定義されます。
M S E = E [ ( θ ^ ( x ) − θ ) 2 ] 、 {\displaystyle \mathrm {MSE} =E\left[({\widehat {\theta }}(x)-\theta )^{2}\right],} ここで期待値は、θ {\displaystyle \theta } そしてx {\displaystyle x} 。
事後平均 MSEをリスクとして使用すると、未知のパラメータのベイズ推定値は事後分布 の平均になります。[ 3 ]
θ ^ ( x ) = E [ θ | x ] = ∫ θ p ( θ | x ) d θ 。 {\displaystyle {\widehat {\theta }}(x)=E[\theta |x]=\int \theta \,p(\theta |x)\,d\theta .} これは最小平均二乗誤差 (MMSE)推定量として知られています。
共役事前分布に対するベイズ推定量 事前確率分布を他の分布よりも優先する明確な理由がない場合、簡便性のために共役事前分布が選択されることがあります。共役事前分布とは、ある パラメトリック族 に属する事前分布であり、その結果得られる事後分布も同じ族に属するものと定義されます。これは重要な特性です。なぜなら、ベイズ推定量とその統計的特性(分散、信頼区間など)はすべて事後分布から導出できるからです。
共役事前分布は、逐次推定において特に有用です。逐次推定では、現在の測定値の事後分布が次の測定値の事前分布として使用されます。逐次推定において、共役事前分布を使用しない限り、事後分布は測定値が追加されるごとに複雑化するため、ベイズ推定量を計算するには、通常、数値計算手法に頼らざるを得ません。
以下に、共役事前分布の例をいくつか示します。
もしx | θ {\displaystyle x|\theta } 正常 です、x | θ ~ N ( θ 、 σ 2 ) {\displaystyle x|\theta \sim N(\theta ,\sigma ^{2})} 、そして事前分布は正常である。θ ~ N ( μ 、 τ 2 ) {\displaystyle \theta \sim N(\mu ,\tau ^{2})} すると事後分布も正規分布となり、MSE に基づくベイズ推定量は次のように与えられる。 θ ^ ( x ) = σ 2 σ 2 + τ 2 μ + τ 2 σ 2 + τ 2 x 。 {\displaystyle {\widehat {\theta }}(x)={\frac {\sigma ^{2}}{\sigma ^{2}+\tau ^{2}}}\mu +{\frac {\tau ^{2}}{\sigma ^{2}+\tau ^{2}}}x.} もしx 1 、 。 。 。 、 x n {\displaystyle x_{1},...,x_{n}} は独立同分布の ポアソン 確率変数である。x 私 | θ ~ P ( θ ) {\displaystyle x_{i}|\theta \sim P(\theta )} 事前分布がガンマ分布 である場合θ ~ G ( 1 、 b ) {\displaystyle \theta \sim G(a,b)} すると事後分布もガンマ分布となり、MSE の下でのベイズ推定量は次のように与えられる。 θ ^ ( X ) = n X ¯ + 1 n + b 。 {\displaystyle {\widehat {\theta }}(X)={\frac {n{\overline {X}}+a}{n+b}}.} もしx 1 、 。 。 。 、 x n {\displaystyle x_{1},...,x_{n}} 独立同分布で一様分布し ているx 私 | θ ~ U ( 0 、 θ ) {\displaystyle x_{i}|\theta \sim U(0,\theta )} 事前分布がパレート分布 である場合θ ~ P 1 ( θ 0 、 1 ) {\displaystyle \theta \sim Pa(\theta _{0},a)} すると事後分布もパレート分布となり、MSE の下でのベイズ推定量は次のように与えられる。 θ ^ ( X ) = ( 1 + n ) 最大 ( θ 0 、 x 1 、 。 。 。 、 x n ) 1 + n − 1 。 {\displaystyle {\widehat {\theta }}(X)={\frac {(a+n)\max {(\theta _{0},x_{1},...,x_{n})}}{a+n-1}}.}
代替リスク関数 リスク関数は、推定値と未知のパラメータ間の距離をどのように測定するかによって選択されます。MSEは、その単純さから最も一般的に使用されているリスク関数です。ただし、代替のリスク関数も時折使用されます。以下に、そのような代替の例をいくつか示します。事後一般化分布関数をで表します。F {\displaystyle F} 。
後方モード 以下の損失関数は、次の極限における事後モードを与える。 K > 0 {\displaystyle K>0} 後方の特定の条件下では[ 4 ] :
L ( θ 、 θ ^ ) = { 0 、 のために | θ − θ ^ | < K L 、 のために | θ − θ ^ | ≥ K 、 {\displaystyle L(\theta ,{\widehat {\theta }})={\begin{cases}0,&{\mbox{for }}|\theta -{\widehat {\theta }}|<K\\L,&{\mbox{for }}|\theta -{\widehat {\theta }}|\geq K,\end{cases}}} どこL > 0 {\displaystyle L>0} 定数です。
線形計画法推定器 また、L P \displaystyle L^{P}} 損失が与えられるリスク
L ( θ 、 θ ^ ) = | θ − θ ^ | p 、 p > 0. {\displaystyle L(\theta ,{\hat {\theta }})=|\theta -{\hat {\theta }}|^{p},\,p>0.} 最適L p \displaystyle L^{p}} 推定量は閉形式で特徴付けるのが難しい場合があるが、L 2 \displaystyle L^{2}} 事例。[ 5 ]
平均二乗誤差 が最も広く使用され、検証されている ものの、他の損失関数も考案可能である。他の損失関数は統計学、特にロバスト統計学 で使用されている。
一般化ベイズ推定量 事前分布p {\displaystyle p} これまで真の確率分布であると想定されてきたが、
∫ p ( θ ) d θ = 1. {\displaystyle \int p(\theta )d\theta =1.} しかし、これは時として制約的な要件となることがあります。例えば、すべての実数の集合Rを網羅する分布で、すべての実数が等確率で出現するような分布は存在しません。しかし、ある意味では、このような「分布」は、 無情報事前分布 、つまり未知のパラメータの特定の値に対する選好を意味しない事前分布として自然な選択肢のように思えます。それでも関数を定義することは可能です。p ( θ ) = 1 {\displaystyle p(\theta )=1} しかし、これは質量が無限であるため、適切な確率分布ではありません。
∫ p ( θ ) d θ = ∞ 。 {\displaystyle \int {p(\theta )d\theta }=\infty .} このような措置 p ( θ ) {\displaystyle p(\theta )} 確率分布ではないものは、不適切な事前分布 と呼ばれます。
不適切な事前分布を用いると、ベイズリスクは定義されない(事前分布は確率分布ではないため、その下での期待値を求めることができない)。結果として、ベイズリスクを最小化するベイズ推定量について語ることはもはや意味をなさない。しかしながら、多くの場合、事後分布を定義することは可能である。
p ( θ | x ) = p ( x | θ ) p ( θ ) ∫ p ( x | θ ) p ( θ ) d θ 。 {\displaystyle p(\theta |x)={\frac {p(x|\theta )p(\theta )}{\int p(x|\theta )p(\theta )d\theta }}.} これは定義であって、ベイズの定理 の応用ではありません。なぜなら、ベイズの定理はすべての分布が適切な場合にのみ適用できるからです。しかし、結果として得られる「事後分布」が有効な確率分布となることは珍しくありません。この場合、事後期待損失は
∫ L ( θ 、 1 ) p ( θ | x ) d θ {\displaystyle \int {L(\theta ,a)p(\theta |x)d\theta }} は通常、明確に定義され、有限です。適切な事前分布の場合、ベイズ推定量は事後期待損失を最小化することを思い出してください。事前分布が不適切な場合、事後期待損失を最小化する推定量は、一般化ベイズ推定量 と呼ばれます。[ 2 ]
経験ベイズ推定量 経験ベイズ法 によって導出されたベイズ推定量は、経験ベイズ推定量 と呼ばれます。経験ベイズ法では、関連するパラメータの観測値から得られる補助的な経験データを、ベイズ推定量の開発に利用することができます。これは、推定されるパラメータが共通の事前分布から得られるという仮定の下で行われます。例えば、異なるパラメータの独立した観測が行われた場合、他の観測値からのデータを利用することで、特定のパラメータの推定精度が向上することがあります。
経験ベイズ推定には、パラメトリックアプローチ とノンパラメトリック アプローチの両方がある。 [ 6 ]
例 以下は、パラメトリック経験ベイズ推定の簡単な例です。過去の観測値が与えられた場合、x 1 、 … 、 x n {\displaystyle x_{1},\ldots ,x_{n}} 条件付き分布を持つf ( x 私 | θ 私 ) {\displaystyle f(x_{i}|\theta _{i})} 推定に関心があるのはθ n + 1 {\displaystyle \theta _{n+1}} に基づくx n + 1 {\displaystyle x_{n+1}} . と仮定すると、θ 私 {\displaystyle \theta _{i}} は共通の事前情報を持っていますπ {\displaystyle \pi } これは未知のパラメータに依存します。たとえば、π {\displaystyle \pi } 平均値が不明な正規分布μ π {\displaystyle \mu _{\pi }\,\!} および分散σ π 。 {\displaystyle \sigma _{\pi }\,\!.} 過去の観測値を使用して、平均と分散を決定できます。π {\displaystyle \pi } 以下の方法で。
まず、平均を推定しますμ m {\displaystyle \mu _{m}\,\!} および分散σ m {\displaystyle \sigma _{m}\,\!} 周辺分布のx 1 、 … 、 x n {\displaystyle x_{1},\ldots ,x_{n}} 最尤法 を用いる場合:
μ ^ m = 1 n ∑ x 私 、 {\displaystyle {\widehat {\mu }}_{m}={\frac {1}{n}}\sum {x_{i}},} σ ^ m 2 = 1 n ∑ ( x 私 − μ ^ m ) 2 。 {\displaystyle {\widehat {\sigma }}_{m}^{2}={\frac {1}{n}}\sum {(x_{i}-{\widehat {\mu }}_{m})^{2}}.} 次に、全期待値の法則 を用いて計算します。μ m {\displaystyle \mu _{m}} そして全分散の法則 を計算しますσ m 2 {\displaystyle \sigma _{m}^{2}} そのため
μ m = E π [ μ f ( θ ) ] 、 {\displaystyle \mu _{m}=E_{\pi }[\mu _{f}(\theta )]\,\!,} σ m 2 = E π [ σ f 2 ( θ ) ] + E π [ ( μ f ( θ ) − μ m ) 2 ] 、 {\displaystyle \sigma _{m}^{2}=E_{\pi }[\sigma _{f}^{2}(\theta )]+E_{\pi }[(\mu _{f}(\theta )-\mu _{m})^{2}],} どこμ f ( θ ) {\displaystyle \mu _{f}(\theta )} そしてσ f ( θ ) {\displaystyle \sigma _{f}(\theta )} は条件付き分布のモーメントであるf ( x 私 | θ 私 ) {\displaystyle f(x_{i}|\theta _{i})} これらは既知であると仮定する。特に、μ f ( θ ) = θ {\displaystyle \mu _{f}(\theta )=\theta } そしてそれはσ f 2 ( θ ) = K {\displaystyle \sigma _{f}^{2}(\theta )=K} すると、
μ π = μ m 、 {\displaystyle \mu _{\pi }=\mu _{m}\,\!,} σ π 2 = σ m 2 − σ f 2 = σ m 2 − K 。 {\displaystyle \sigma _{\pi }^{2}=\sigma _{m}^{2}-\sigma _{f}^{2}=\sigma _{m}^{2}-K.} 最後に、事前分布の推定モーメントを取得します。
μ ^ π = μ ^ m 、 {\displaystyle {\widehat {\mu }}_{\pi }={\widehat {\mu }}_{m},} σ ^ π 2 = σ ^ m 2 − K 。 {\displaystyle {\widehat {\sigma }}_{\pi }^{2}={\widehat {\sigma }}_{m}^{2}-K.} 例えば、x 私 | θ 私 ~ N ( θ 私 、 1 ) {\displaystyle x_{i}|\theta _{i}\sim N(\theta _{i},1)} 、そして正規事前分布(この場合は共役事前分布)を仮定すると、次の結論が得られます。θ n + 1 ~ N ( μ ^ π 、 σ ^ π 2 ) {\displaystyle \theta _{n+1}\sim N({\widehat {\mu }}_{\pi },{\widehat {\sigma }}_{\pi }^{2})} 、そこからベイズ推定量はθ n + 1 {\displaystyle \theta _{n+1}} に基づくx n + 1 {\displaystyle x_{n+1}} 計算可能です。
不動産
受理可能性 ベイズリスクが有限であるベイズルールは、一般的に許容される 。以下に、許容性定理の具体的な例をいくつか示す。
ベイズルールが一意であれば、それは許容される。[ 7 ] 例えば、上記のように、平均二乗誤差(MSE)の下では、ベイズルールは一意であり、したがって許容される。 θが離散集合 に属する場合、すべてのベイズ規則が許容される。θが連続(非離散)集合に属し、リスク関数R(θ,δ)がすべてのδに対してθに関して連続である場合、すべてのベイズ規則が許容される。 対照的に、一般化ベイズルールは、不適切な事前分布の場合、ベイズリスクが定義されないことがよくあります。これらのルールはしばしば不適切であり、その妥当性の検証は困難な場合があります。たとえば、ガウスサンプルに基づく位置パラメータθの一般化ベイズ推定量(上記の「一般化ベイズ推定量」のセクションで説明)は、次のような場合に不適切です。p > 2 {\displaystyle p>2} これはスタイン現象 として知られています。
漸近効率 θを未知の確率変数とし、x 1 、 x 2 、 … {\displaystyle x_{1},x_{2},\ldots } 密度を持つiidサンプル f ( x 私 | θ ) {\displaystyle f(x_{i}|\theta )} 。 させてδ n = δ n ( x 1 、 … 、 x n ) {\displaystyle \delta _{n}=\delta _{n}(x_{1},\ldots ,x_{n})} は、増加する測定数に基づく θ のベイズ推定量のシーケンスです。我々は、この推定量のシーケンスの漸近的性能、すなわち、δ n {\displaystyle \delta _{n}} n が大きい場合。
この目的のために、θ を真の値が決定論的パラメータとみなすのが一般的である。θ 0 {\displaystyle \theta _{0}} 特定の条件下では、[ 8 ] サンプルサイズが大きい場合(n の値が大きい場合)、θ の事後密度はほぼ正規分布になります。言い換えれば、n が大きい場合、事前確率が事後分布に与える影響は無視できます。さらに、δ が MSE リスク下のベイズ推定量である場合、漸近的に不偏で あり、分布は 正規分布 に収束します。
n ( δ n − θ 0 ) → N ( 0 、 1 私 ( θ 0 ) ) 、 {\displaystyle {\sqrt {n}}(\delta _{n}-\theta _{0})\to N\left(0,{\frac {1}{I(\theta _{0})}}\right),} ここで、 I (θ 0 ) はθ 0 のフィッシャー情報量 です。したがって、MSE の下でのベイズ推定量 δ n は漸近的に効率的 です。
漸近的に正規分布に従い、かつ効率的な推定量として、最尤推定量 (MLE)があります。最尤推定量とベイズ推定量の関係は、以下の簡単な例で示すことができます。
例:二項分布におけるpの推定 二項標本x ~b(θ, n )に基づく θ の推定量を考えます。ここで θ は成功確率を表します。θ が共役事前分布に従って分布していると仮定すると、この場合ベータ分布 B( a , b ) となり、事後分布は B(a+x,b+nx) であることがわかっています。したがって、MSE に基づくベイズ推定量は次のようになります。
δ n ( x ) = E [ θ | x ] = 1 + x 1 + b + n 。 {\displaystyle \delta _{n}(x)=E[\theta |x]={\frac {a+x}{a+b+n}}.} この場合の最尤推定値は x/n なので、次のようになります。
δ n ( x ) = 1 + b 1 + b + n E [ θ ] + n 1 + b + n δ M L E 。 {\displaystyle \delta _{n}(x)={\frac {a+b}{a+b+n}}E[\theta ]+{\frac {n}{a+b+n}}\delta _{MLE}.} 最後の式は、n → ∞ の場合、ベイズ推定量(記述された問題の場合)が最尤推定量に近いことを意味している。
一方、n が小さい場合、事前情報は依然として意思決定問題に関係し、推定値に影響を与えます。事前情報の相対的な重みを確認するために、a = b と仮定します。この場合、各測定によって1ビットの新しい情報が得られます。上記の式は、事前情報が新しい情報のa+b ビットと同じ重みを持つことを示しています。実際の応用では、事前分布の細かい詳細についてはほとんど知らないことがよくあります。特に、それがB( a , b )と完全に一致すると仮定する理由はありません。このような場合、この計算の考えられる解釈の1つは、「平均値0.5、標準偏差dの非病理的な事前分布が存在し、事前情報の重みは新しい情報の1/( 4d2 )-1ビットに等しい」というものです。
同じ現象の別の例として、事前推定値と測定値が正規分布に従う場合が挙げられます。事前分布が偏差 Σ でB を中心とし、測定値が偏差 σ でbを中心とする 場合 、事後分布はα α + β B + β α + β b {\displaystyle {\frac {\alpha }{\alpha +\beta }}B+{\frac {\beta }{\alpha +\beta }}b} ここで、この加重平均における重みはα=σ²、β=Σ²である。さらに、事後偏差の二乗はΣ²+σ²である。言い換えれば、事前分布は、あたかも追加の測定値であるかのように、測定値と全く 同じように組み合わされる。
例えば、Σ=σ/2 の場合、4 つの測定値を組み合わせた偏差は事前分布の偏差と一致します (測定誤差が独立であると仮定した場合)。また、事後分布の式の重み α、β もこれと一致します。事前分布の重みは測定値の重みの 4 倍です。この事前分布を平均vの n 個の測定値と組み合わせると、事後分布の中心は次のようになります。4 4 + n V + n 4 + n v {\displaystyle {\frac {4}{4+n}}V+{\frac {n}{4+n}}v} 特に、事前分布は、事前に行われた4つの測定値と同じ役割を果たします。一般に、事前分布は(σ/Σ)²の測定値の重みを持ちます。
二項分布の例と比較してみましょう。二項分布では、事前分布の重みは(σ/Σ)²−1個の測定値に相当します。正確な重みは分布の詳細によって異なることがわかりますが、σ≫Σの場合、その差は小さくなります。
ベイズ推定量の実際的な例 インターネット映画データベースは、 ユーザーによる映画の評価を計算および比較するための数式を使用しており、その中には「真のベイズ推定値」を提供するとされるトップ250タイトル も含まれています。[ 9 ] 当初、トップ250の加重平均スコアを計算するために次のベイズ数式が使用されていましたが、その後数式は変更されました。
W = R v + C m v + m {\displaystyle W={Rv+Cm \over v+m}\ } どこ:
W {\displaystyle W\ } = 加重評価R {\displaystyle R\ } = 映画の平均評価(1~10の数値)(平均値) = (評価)v {\displaystyle v\ } = 映画の投票数/評価数 = (投票数)m {\displaystyle m\ } = 事前推定値に与えられた重み(この場合、IMDBが平均評価が統計的妥当性に近づくために必要と判断した投票数)C {\displaystyle C\ } = 全体の投票数の平均(現在7.0)W は 、重みベクトル(v, m)を用いた R とC の加重算術平均 であることに注意してください。評価数がm を 超えると、平均評価の信頼度が全映画の平均投票 (C) の信頼度を上回り、加重ベイズ評価 (W) は単純平均 (R) に近づきます。v (映画の評価数) がゼロに近いほど 、Wは C に近づきます。ここで、W は加重評価、C は全映画の平均評価です。つまり、簡単に言うと、映画に対する評価/投票数が少ないほど、その映画の加重評価は全映画の平均に偏り、評価/投票数が多い映画は、純粋な算術平均評価に近づきます。
IMDbの方式では、例えば評価が50万件以上あり、平均評価が9.2の「ゴッドファーザー」のような作品よりも、評価数が少ない映画が上位にランクインすることはない。
注記 ↑ レーマンとカゼラ、定理4.1.1 1 2 レーマンとカセラ、定義4.2.9 ↑ Jaynes , ET (2007). Probability Theory: The Logic of Science (5. print. ed.). Cambridge [ua]: Cambridge Univ. Press. p. 172. ISBN 978-0-521-59271-0 。 ↑ Bassett, Robert; Deride, Julio (2019 年 3 月). "最大事後確率推定器はベイズ推定器の極限である". Mathematical Programming . 174 ( 1– 2): 129– 144. arXiv : 1611.05917 . doi : 10.1007/s10107-018-1241-0 . ↑ Dytso, A.; Bustin, R.; Tuninetti, D.; Devroye, N.; Poor, HV; Shamai Shitz, S. (2018). "On the Minimum Mean pth Error in Gaussian Noise Channels and Its Applications". IEEE Transactions on Information Theory . 64 (3). IEEE : 2012–2037 . arXiv : 1607.01461 . doi : 10.1109/TIT.2017.2782786 . ↑ Berger (1980)、第4.5節。 ↑ レーマンとカセラ (1998)、定理 5.2.4。 ↑ レーマンとカセラ(1998)、第6.8節 ↑ 「IMDbトップ250」 。 2012年6月1日に オリジナル からアーカイブされました。
参考文献 Berger, James O. (1985).統計的決定理論とベイズ分析 (第2 版). ニューヨーク:Springer-Verlag. ISBN 0-387-96098-8 MR 0804611 . レーマン、EL;カセラ、G.(1998)。点推定理論 (第2 版)。スプリンガー。ISBN 0-387-98502-6 。 ピルツ、ユルゲン(1991)。「ベイズ推定」。線形回帰モデルにおけるベイズ推定と実験計画 。チチェスター:ジョン・ワイリー・アンド・サンズ。38 ~ 117頁。ISBN 0-471-91732-X 。
外部リンク 「ベイズ推定量」、数学百科事典 、EMS Press、2001 [1994]