コンセプト 独立同分布の データ点の集合が与えられた場合X = ( x 1 、 … 、 x n ) 、 {\displaystyle \mathbf {X} =(x_{1},\ldots ,x_{n}),} どこx 私 ~ p ( x | θ ) {\displaystyle x_{i}\sim p(x|\theta )} パラメータ化されたいくつかの確率分布によると θ {\displaystyle \theta } 、 どこθ {\displaystyle \theta } それ自体は分布によって記述される確率変数である。 θ ~ p ( θ ∣ α ) 、 {\displaystyle \theta \sim p(\theta \mid \alpha ),} 周辺尤度は一般的に確率が何であるかを問うp ( X ∣ α ) {\displaystyle p(\mathbf {X} \mid \alpha )} は、θ {\displaystyle \theta } 周縁化されて排除さ れた(統合から排除された):
p ( X ∣ α ) = ∫ θ p ( X ∣ θ ) p ( θ ∣ α ) d θ {\displaystyle p(\mathbf {X} \mid \alpha )=\int _{\theta }p(\mathbf {X} \mid \theta )\,p(\theta \mid \alpha )\ \operatorname {d} \!\theta } 上記の定義はベイズ統計 の文脈で述べられており、その場合p ( θ ∣ α ) {\displaystyle p(\theta \mid \alpha )} これは事前密度と呼ばれ、p ( X ∣ θ ) {\displaystyle p(\mathbf {X} \mid \theta )} は尤度です。周辺尤度はベイズ事後密度の正規化定数であることを認識してください。p ( θ ∣ X 、 α ) {\displaystyle p(\theta \mid \mathbf {X} ,\alpha )} また、別の表現もある[ 2 ]
p ( X ∣ α ) = p ( X ∣ θ 、 α ) p ( θ ∣ α ) p ( θ ∣ X 、 α ) {\displaystyle p(\mathbf {X} \mid \alpha )={\frac {p(\mathbf {X} \mid \theta ,\alpha )p(\theta \mid \alpha )}{p(\theta \mid \mathbf {X} ,\alpha )}}} これはアイデンティティですθ {\displaystyle \theta } 周辺尤度は、データと事前分布の一致度を幾何学的な意味で定量化するものであり、de Carvalho et al. (2019) ではヒルベルト空間を用いて厳密に定義されています。古典的な(頻度論的 )統計学では、周辺尤度の概念は、結合パラメータの文脈で用いられます。θ = ( ψ 、 λ ) {\displaystyle \theta =(\psi ,\lambda )} 、 どこψ {\displaystyle \psi } は実際に関心のあるパラメータであり、λ {\displaystyle \lambda } は、興味のない邪魔なパラメータ です。 の確率分布が存在する場合λ {\displaystyle \lambda } 尤度関数を以下の点のみで考えることが望ましい場合が多い。ψ {\displaystyle \psi } 疎外することによってλ {\displaystyle \lambda } :
L ( ψ ; X ) = p ( X ∣ ψ ) = ∫ λ p ( X ∣ λ 、 ψ ) p ( λ ∣ ψ ) d λ {\displaystyle {\mathcal {L}}(\psi ;\mathbf {X} )=p(\mathbf {X} \mid \psi )=\int _{\lambda }p(\mathbf {X} \mid \lambda ,\psi )\,p(\lambda \mid \psi )\ \operatorname {d} \!\lambda } 残念ながら、周辺尤度を計算するのは一般的に困難です。厳密解は、特に周辺化されるパラメータがデータの分布の共役事前分布である場合など、ごく一部の分布クラスについてのみ知られています。それ以外の場合は、 ガウス積分 やモンテカルロ法 などの一般的な方法、あるいはラプラス近似 、ギブス /メトロポリス サンプリング、EMアルゴリズム などの統計問題に特化した方法など、何らかの数値積分 法が必要となります。
上記の考察は、単一の確率変数(データ点)にも適用できる。x {\displaystyle x} 観測値の集合ではなく、データポイントの事前予測分布です。ベイズ統計の文脈では、これはデータポイントの事前予測分布に相当します。
アプリケーション
ベイズモデルの比較 ベイズモデル比較 では、周辺変数θ {\displaystyle \theta } は特定のタイプのモデルのパラメータであり、残りの変数はM {\displaystyle M} これはモデル自体の識別子です。この場合、周辺尤度は、特定のモデルパラメータを仮定せずに、モデルタイプが与えられた場合のデータの確率です。θ {\displaystyle \theta } モデルパラメータの場合、モデルM の周辺尤度は
p ( X ∣ M ) = ∫ p ( X ∣ θ 、 M ) p ( θ ∣ M ) d θ {\displaystyle p(\mathbf {X} \mid M)=\int p(\mathbf {X} \mid \theta ,M)\,p(\theta \mid M)\,\operatorname {d} \!\theta } この文脈において、モデルエビデンスという用語は通常用いられる。この量は重要である。なぜなら 、モデル M1 と別のモデルM2 の 事後オッズ比には、ベイズ因子 と呼ばれる周辺尤度の比が含まれるからである。
p ( M 1 ∣ X ) p ( M 2 ∣ X ) = p ( M 1 ) p ( M 2 ) p ( X ∣ M 1 ) p ( X ∣ M 2 ) {\displaystyle {\frac {p(M_{1}\mid \mathbf {X} )}{p(M_{2}\mid \mathbf {X} )}}={\frac {p(M_{1})}{p(M_{2})}}\,{\frac {p(\mathbf {X} \mid M_{1})}{p(\mathbf {X} \mid M_{2})}}} これは概略的に次のように表すことができる。
事後オッズ = 事前オッズ ×ベイズ係数
参考文献 ↑ Šmídl, Václav; Quinn, Anthony (2006). "ベイズ理論".信号処理における変分ベイズ法 . Springer. pp. 13–23 . doi : 10.1007/3-540-28820-1_2 . ↑ Chib, Siddhartha (1995). "ギブス出力からの周辺尤度". Journal of the American Statistical Association . 90 (432): 1313– 1321. doi : 10.1080/01621459.1995.10476635 .
さらに読む Charles S. Bos.「周辺尤度計算方法の比較」。W. HärdleおよびB. Ronz編『COMPSTAT 2002: 計算統計学論文集』 、pp. 111–117 、 2002年。 ( SSRN 332860 にてプレプリントとして入手可能) de Carvalho, Miguel; Page, Garritt; Barney, Bradley (2019). 「ベイズ推論の幾何学について」。ベイズ分析 。14 (4): 1013‒1036。(ウェブ上でプレプリントとして入手可能:) ランバート、ベン(2018)。「悪魔は分母にある」。ベイズ 統計学入門 。Sage。pp. 109–120。ISBN 978-1-4739-1636-4 。 オンライン教科書:情報理論、推論、学習アルゴリズム(著者:David JC MacKay )。