意味 フィッシャー情報とは、観測可能な確率変数 が持つ情報量を測定する方法である。X {\displaystyle X} 未知のパラメータ を運ぶθ {\displaystyle \theta } 確率に基づいてX {\displaystyle X} 場合によります。f ( X ; θ ) {\displaystyle f(X;\theta )} を、の確率密度関数 (または確率質量関数 )とする。X {\displaystyle X} 値に応じてθ {\displaystyle \theta } これは、特定の結果を観察する確率を表します。X {\displaystyle X} 既知の値の 場合θ {\displaystyle \theta } 。 もしf {\displaystyle f} 変化に関して急激にピークが現れるθ {\displaystyle \theta } 正しい値を示すのは簡単ですθ {\displaystyle \theta } データから、あるいは同等に、データがX {\displaystyle X} パラメータに関する多くの情報を提供しますθ {\displaystyle \theta } 。 もしf {\displaystyle f} 平らで広がっている場合は、多くのサンプルが必要になります。X {\displaystyle X} 実際の「真の」値を推定するためにθ {\displaystyle \theta } これは、サンプルとして抽出される全人口を使用して得られるものです 。これは、何らかの分散を研究することを示唆しています。θ {\displaystyle \theta } 。
形式 的には、θ {\displaystyle \theta } 尤度関数 の自然対数 の はスコア と呼ばれます。特定の正則条件の下で、θ {\displaystyle \theta } は真のパラメータです(つまりX {\displaystyle X} 実際には次のように配布されますf ( X ; θ ) {\displaystyle f(X;\theta )} )真のパラメータ値で評価したスコアの期待値 (1次モーメント) は、 θ {\displaystyle \theta } 、は0です: [ 5 ]
E [ ∂ ∂ θ ログ f ( X ; θ ) | θ ] = ∫ R ∂ ∂ θ f ( x ; θ ) f ( x ; θ ) f ( x ; θ ) d x = ∂ ∂ θ ∫ R f ( x ; θ ) d x = ∂ ∂ θ 1 = 0. {\displaystyle {\begin{aligned}\operatorname {E} \left[\left.{\frac {\partial }{\partial \theta }}\log f(X;\theta )\,\,\right|\,\,\theta \right]={}&\int _{\mathbb {R} }{\frac {{\frac {\partial }{\partial \theta }}f(x;\theta )}{f(x;\theta )}}f(x;\theta )\,dx\\[6pt]={}&{\frac {\partial }{\partial \theta }}\int _{\mathbb {R} }f(x;\theta )\,dx\\[6pt]={}&{\frac {\partial }{\partial \theta }}1\\[6pt]={}&0.\end{aligned}}} フィッシャー情報 は、スコアの分散 として定義されます。
私 ( θ ) = E [ ( ∂ ∂ θ ログ f ( X ; θ ) ) 2 | θ ] = ∫ R ( ∂ ∂ θ ログ f ( x ; θ ) ) 2 f ( x ; θ ) d x 、 {\displaystyle {\mathcal {I}}(\theta )=\operatorname {E} \left[\left.\left({\frac {\partial }{\partial \theta }}\log f(X;\theta )\right)^{2}\,\,\right|\,\,\theta \right]=\int _{\mathbb {R} }\left({\frac {\partial }{\partial \theta }}\log f(x;\theta )\right)^{2}f(x;\theta )\,dx,} ご了承ください私 ( θ ) ≥ 0 {\displaystyle {\mathcal {I}}(\theta )\geq 0} フィッシャー情報量が高い確率変数は、そのスコアの絶対値が高いことが多いことを意味します。確率変数 X は平均化されているため、フィッシャー情報量は特定の観測値の関数ではありません。
log f ( x ; θ )が θ に関して 2 回微分可能であり、かつ特定の追加の正則条件を満たす場合、フィッシャー情報は次のように記述することもできます
私 ( θ ) = − E [ ∂ 2 ∂ θ 2 ログ f ( X ; θ ) | θ ] 、 {\displaystyle {\mathcal {I}}(\theta )=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\log f(X;\theta )\,\,\right|\,\,\theta \right],}
したがって、フィッシャー情報量は、支持曲線 (対数尤度のグラフ)の曲率と見なすことができる。最尤推定 値付近では、フィッシャー情報量が低いほど、最大値が「鈍い」ように見える、つまり、近傍に類似した対数尤度を示す点が多数存在することを示す。逆に、フィッシャー情報量が高いほど、最大値が「鋭い」ことを示す。
規則性条件 正則条件は以下のとおりです。[ 8 ]
f ( X ; θ )の θ に関する偏微分は、ほぼ至るところで 存在します。(零集合 上では存在しない場合もありますが、その集合がθ に依存しない限りにおいてです。)f ( X ; θ )の積分は、θ に関して積分記号の下で微分することができる。f ( X ; θ )のサポートはθ に 依存しません。θ がベクトルである場合、 θ のすべての成分に対して正則条件が満たされなければなりません。正則条件を満たさない密度の例を見つけるのは簡単です。Uniform(0, θ )変数の密度は条件1と3を満たしません。この場合、定義からフィッシャー情報を計算できますが、通常想定されるような特性は持ちません。
可能性の観点から X が与えられたときのθ の尤度 は常に確率f ( X ; θ ) に比例するため、これらの対数はθ に依存しない定数だけ異なり、 θ に関するこれらの対数の導関数は必ず等しくなります。したがって、フィッシャー情報の定義において、log f ( X ; θ ) の代わりに対数尤度l ( θ ; X ) を代入することができます。
あらゆるサイズのサンプル 値X は 、単一の分布から抽出された単一のサンプルを表すことも、複数の分布から抽出されたサンプルの集合を表すこともできます。サンプルがn 個あり、対応するn 個の分布が統計的に独立して いる場合、フィッシャー情報は、各分布からの単一サンプルごとに 1 つずつ、単一サンプルのフィッシャー情報値の合計になります。特に、n 個 の分布が独立かつ同一分布で ある場合、フィッシャー情報は、共通分布からの単一サンプルのフィッシャー情報のn 倍になります。言い換えれば、母集団から抽出されたサイズnのサンプルの iid 観測値のフィッシャー情報は、 n と同一母集団からの単一観測値のフィッシャー情報の積に等しくなります。
Cramér –Rao 境界 は、Fisher 情報の逆数がθ の任意の不偏推定量 の分散の下限であることを述べています。Van Trees (1968) とFrieden (2004) は 、Fisher 情報の使用を説明する結果であるCramér–Rao 境界 を導出する次の方法を提供しています。
非公式には、まず不偏推定量 について考察することから始めます。θ ^ ( X ) {\displaystyle {\hat {\theta }}(X)} 数学的に「偏りがない」とは、
E [ θ ^ ( X ) − θ | θ ] = ∫ ( θ ^ ( x ) − θ ) f ( x ; θ ) d x = 0 価値に関係なく θ 。 {\displaystyle \operatorname {E} \left[\left.{\hat {\theta }}(X)-\theta \,\,\right|\,\,\theta \right]=\int \left({\hat {\theta }}(x)-\theta \right)\,f(x;\theta )\,dx=0{\text{ regardless of the value of }}\theta .} この式はθ に依存しないゼロなので、 θ に関する偏微分もゼロでなければなりません。積の法則 により、この偏微分も に等しくなります。
0 = ∂ ∂ θ ∫ ( θ ^ ( x ) − θ ) f ( x ; θ ) d x = ∫ ( θ ^ ( x ) − θ ) ∂ f ∂ θ d x − ∫ f d x 。 {\displaystyle 0={\frac {\partial }{\partial \theta }}\int \left({\hat {\theta }}(x)-\theta \right)\,f(x;\theta )\,dx=\int \left({\hat {\theta }}(x)-\theta \right){\frac {\partial f}{\partial \theta }}\,dx-\int f\,dx.} 各θ について、尤度関数は確率密度関数であり、したがって∫ f d x = 1 {\displaystyle \int f\,dx=1} 偏微分に連鎖律を 適用することによりログ f {\displaystyle \log f} そして、f ( x ; θ ) {\displaystyle f(x;\theta )} 検証できるのは
∂ f ∂ θ = f ∂ ログ f ∂ θ 。 {\displaystyle {\frac {\partial f}{\partial \theta }}=f\,{\frac {\partial \log f}{\partial \theta }}.} 上記の2つの事実を用いると、
∫ ( θ ^ − θ ) f ∂ ログ f ∂ θ d x = 1. {\displaystyle \int \left({\hat {\theta }}-\theta \right)f\,{\frac {\partial \log f}{\partial \theta }}\,dx=1.} 被積分関数を因数分解すると
∫ ( ( θ ^ − θ ) f ) ( f ∂ ログ f ∂ θ ) d x = 1. {\displaystyle \int \left(\left({\hat {\theta }}-\theta \right){\sqrt {f}}\right)\left({\sqrt {f}}\,{\frac {\partial \log f}{\partial \theta }}\right)\,dx=1.} 積分式を二乗すると、コーシー・シュワルツの不等式 から次の式が得られる。
1 = ( ∫ [ ( θ ^ − θ ) f ] ⋅ [ f ∂ ログ f ∂ θ ] d x ) 2 ≤ [ ∫ ( θ ^ − θ ) 2 f d x ] ⋅ [ ∫ ( ∂ ログ f ∂ θ ) 2 f d x ] 。 {\displaystyle 1={\biggl (}\int \left[\left({\hat {\theta }}-\theta \right){\sqrt {f}}\right]\cdot \left[{\sqrt {f}}\,{\frac {\partial \log f}{\partial \theta }}\right]\,dx{\biggr )}^{2}\leq \left[\int \left({\hat {\theta }}-\theta \right)^{2}f\,dx\right]\cdot \left[\int \left({\frac {\partial \log f}{\partial \theta }}\right)^{2}f\,dx\right].} 括弧内の2番目の因子はフィッシャー情報量と定義され、括弧内の1番目の因子は推定量の平均二乗誤差 (MSE)である。θ ^ {\displaystyle {\hat {\theta }}} 推定量は不偏であるため、そのMSEは分散に等しくなります。式を整理すると、次の不等式が得られます。
バラ ( θ ^ ) ≥ 1 私 ( θ ) 。 {\displaystyle \operatorname {Var} ({\hat {\theta }})\geq {\frac {1}{{\mathcal {I}}\left(\theta \right)}}.} 言い換えれば、θ を推定できる精度は、尤度関数のフィッシャー情報量によって根本的に制限される。
あるいは、同じ結論は確率変数に対するコーシー・シュワルツの不等式 から直接得ることができる。| カバー ( A 、 B ) | 2 ≤ バラ ( A ) バラ ( B ) {\displaystyle |\operatorname {Cov} (A,B)|^{2}\leq \operatorname {Var} (A)\operatorname {Var} (B)} 確率変数に適用θ ^ ( X ) {\displaystyle {\hat {\theta }}(X)} そして∂ θ ログ f ( X ; θ ) {\displaystyle \partial _{\theta }\log f(X;\theta )} 不偏推定量については、カバー [ θ ^ ( X ) 、 ∂ θ ログ f ( X ; θ ) ] = ∫ θ ^ ( x ) ∂ θ f ( x ; θ ) d x = ∂ θ E [ θ ^ ] = 1. {\displaystyle \operatorname {Cov} [{\hat {\theta }}(X),\partial _{\theta }\log f(X;\theta )]=\int {\hat {\theta }}(x)\,\partial _{\theta }f(x;\theta )\,dx=\partial _{\theta }\operatorname {E} [{\hat {\theta }}]=1.}
例
単一パラメータベルヌーイ実験 ベルヌーイ試行は 、0と1の2つの結果を持つ確率変数であり、1が出る確率はθ です。結果は、偏りのあるコインを投げることによって決まると考えることができ、表(1)が出る確率はθ 、裏(0)が出る確率は1- θ です。
X を 分布からの1つのサンプルのベルヌーイ試行とする。Xに含まれるフィッシャー情報は次のように計算できる。
私 ( θ ) = − E [ ∂ 2 ∂ θ 2 ログ ( θ X ( 1 − θ ) 1 − X ) | θ ] = − E [ ∂ 2 ∂ θ 2 ( X ログ θ + ( 1 − X ) ログ ( 1 − θ ) ) | θ ] = E [ X θ 2 + 1 − X ( 1 − θ ) 2 | θ ] = θ θ 2 + 1 − θ ( 1 − θ ) 2 = 1 θ ( 1 − θ ) 。 {\displaystyle {\begin{aligned}{\mathcal {I}}(\theta )&=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\log \left(\theta ^{X}(1-\theta )^{1-X}\right)\right|\theta \right]\\[5pt]&=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\left(X\log \theta +(1-X)\log(1-\theta )\right)\,\,\right|\,\,\theta \right]\\[5pt]&=\operatorname {E} \left[\left.{\frac {X}{\theta ^{2}}}+{\frac {1-X}{(1-\theta )^{2}}}\,\,\right|\,\,\theta \right]\\[5pt]&={\frac {\theta }{\theta ^{2}}}+{\frac {1-\theta }{(1-\theta )^{2}}}\\[5pt]&={\frac {1}{\theta (1-\theta )}}.\end{aligned}}} フィッシャー情報は加法性を持つため、 n 回 の独立したベルヌーイ試行 に含まれるフィッシャー情報は
私 ( θ ) = n θ ( 1 − θ ) 。 {\displaystyle {\mathcal {I}}(\theta )={\frac {n}{\theta (1-\theta )}}.} もしx 私 {\displaystyle x_{i}} は2 n {\displaystyle 2^{n}} n 回 の独立したベルヌーイ試行の可能な結果とx 私 j {\displaystyle x_{ij}} i番目の試行の j 番目の結果である場合、確率はx 私 {\displaystyle x_{i}} は
p ( x 私 、 θ ) = ∏ j = 0 n θ x 私 j ( 1 − θ ) x 私 j {\displaystyle p(x_{i},\theta )=\prod _{j=0}^{n}\theta ^{x_{ij}}(1-\theta )^{x_{ij}}} i 番目の試行の標本平均はμ 私 = ( 1 / n ) ∑ j = 1 n x 私 j {\displaystyle \mu _{i}=(1/n)\sum _{j=1}^{n}x_{ij}} 標本平均の期待値(標本分布 全体にわたって)は
E ( μ ) = ∑ x 私 μ 私 p ( x 私 、 θ ) = θ 、 {\displaystyle E(\mu )=\sum _{x_{i}}\mu _{i}\,p(x_{i},\theta )=\theta ,} 合計は全体にわたる2 n {\displaystyle 2^{n}} 考えられる試験結果。標本平均の二乗の期待値は
E ( μ 2 ) = ∑ x 私 μ 私 2 p ( x 私 、 θ ) = ( 1 + ( n − 1 ) θ ) θ n {\displaystyle E(\mu ^{2})=\sum _{x_{i}}\mu _{i}^{2}\,p(x_{i},\theta )={\frac {(1+(n-1)\theta )\theta }{n}}} 平均値の分散は
E ( μ 2 ) − E ( μ ) 2 = θ ( 1 − θ ) n {\displaystyle E(\mu ^{2})-E(\mu )^{2}={\frac {\theta (1-\theta )}{n}}} フィッシャー情報量は、 n回の ベルヌーイ試行 における平均成功回数の分散 の逆数であることがわかります。これは一般的に正しいです。この場合、クラメール・ラオ限界は等式になります。
パラメータがN 個ある場合、θ はN ×1ベクトルとなる。 θ = [ θ 1 θ 2 … θ N ] T 、 {\displaystyle \theta ={\begin{bmatrix}\theta _{1}&\theta _{2}&\dots &\theta _{N}\end{bmatrix}}^{\textsf {T}},} フィッシャー情報はN × N 行列の形をとります。この行列は フィッシャー情報行列 (FIM)と呼ばれ、典型的な要素を持ちます。
[ 私 ( θ ) ] 私 、 j = E [ ( ∂ ∂ θ 私 ログ f ( X ; θ ) ) ( ∂ ∂ θ j ログ f ( X ; θ ) ) | θ ] 。 {\displaystyle {\bigl [}{\mathcal {I}}(\theta ){\bigr ]}_{i,j}=\operatorname {E} \left[\left.\left({\frac {\partial }{\partial \theta _{i}}}\log f(X;\theta )\right)\left({\frac {\partial }{\partial \theta _{j}}}\log f(X;\theta )\right)\,\,\right|\,\,\theta \right].} FIMはN × N の正定値半行列 です。正定値であれば、N 次元パラメータ 空間 上にリーマン計量 [ 11 ] を定義します。情報幾何学の分野では、これを利用してフィッシャー情報を 微分幾何学 に結び付けており、その文脈では、この計量はフィッシャー情報計量 として知られています。
特定の規則性条件の下では、フィッシャー情報行列は次のように記述することもできます。
[ 私 ( θ ) ] 私 、 j = − E [ ∂ 2 ∂ θ 私 ∂ θ j ログ f ( X ; θ ) | θ ] 。 {\displaystyle {\bigl [}{\mathcal {I}}(\theta ){\bigr ]}_{i,j}=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta _{i}\,\partial \theta _{j}}}\log f(X;\theta )\,\,\right|\,\,\theta \right]\,.} その結果は、いくつかの点で興味深い。
2 つのパラメータ成分ベクトルθ 1 とθ 2 は、フィッシャー情報行列がブロック対角行列であり、これらの成分が別々のブロックにある場合、情報的に直交していると言います。[ 16 ] 直交パラメータは、その最尤推定値が 漸近的に無相関であるという意味で扱いやすいです。統計モデルを分析する方法を検討する際には、特に関心のあるパラメータが 1 次元であるのに対し、邪魔なパラメータは任意の次元を持つ可能性がある場合、モデルの直交パラメータ化を探すことに時間を費やすことが 推奨されます。[ 17 ]
多変量正規分布 N 変数多変量正規分布 の FIM 、X ~ N ( μ ( θ ) 、 Σ ( θ ) ) {\displaystyle \,X\sim N\left(\mu (\theta ),\,\Sigma (\theta )\right)} は特別な形式を持つ。K 次元のパラメータベクトルを次のようにする。θ = [ θ 1 … θ K ] T {\displaystyle \theta ={\begin{bmatrix}\theta _{1}&\dots &\theta _{K}\end{bmatrix}}^{\textsf {T}}} そして正規乱数のベクトルはX = [ X 1 … X N ] T {\displaystyle X={\begin{bmatrix}X_{1}&\dots &X_{N}\end{bmatrix}}^{\textsf {T}}} これらの確率変数の平均値は次の通りであると仮定します。μ ( θ ) = [ μ 1 ( θ ) … μ N ( θ ) ] T {\displaystyle \,\mu (\theta )={\begin{bmatrix}\mu _{1}(\theta )&\dots &\mu _{N}(\theta )\end{bmatrix}}^{\textsf {T}}} 、そしてΣ ( θ ) {\displaystyle \,\Sigma (\theta )} を共分散行列 とする。すると、1 ≤ m 、 n ≤ K {\displaystyle 1\leq m,\,n\leq K} 、 FIM の( m , n ) エントリは次のようになります。 [ 20 ]
私 m 、 n = ∂ μ T ∂ θ m Σ − 1 ∂ μ ∂ θ n + 1 2 tr ( Σ − 1 ∂ Σ ∂ θ m Σ − 1 ∂ Σ ∂ θ n ) 、 {\displaystyle {\mathcal {I}}_{m,n}={\frac {\partial \mu ^{\textsf {T}}}{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \theta _{n}}}+{\frac {1}{2}}\operatorname {tr} \left(\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{n}}}\right),} どこ( ⋅ ) T {\displaystyle (\cdot )^{\textsf {T}}} ベクトルの転置 を表します。tr ( ⋅ ) {\displaystyle \operatorname {tr} (\cdot )} は正方行列 のトレース を表し、次のようになります。
∂ μ ∂ θ m = [ ∂ μ 1 ∂ θ m ∂ μ 2 ∂ θ m ⋯ ∂ μ N ∂ θ m ] T ; ∂ Σ ∂ θ m = [ ∂ Σ 1 、 1 ∂ θ m ∂ Σ 1 、 2 ∂ θ m ⋯ ∂ Σ 1 、 N ∂ θ m ∂ Σ 2 、 1 ∂ θ m ∂ Σ 2 、 2 ∂ θ m ⋯ ∂ Σ 2 、 N ∂ θ m ⋮ ⋮ ⋱ ⋮ ∂ Σ N 、 1 ∂ θ m ∂ Σ N 、 2 ∂ θ m ⋯ ∂ Σ N 、 N ∂ θ m ] 。 {\displaystyle {\begin{aligned}{\frac {\partial \mu }{\partial \theta _{m}}}&={\begin{bmatrix}{\dfrac {\partial \mu _{1}}{\partial \theta _{m}}}&{\dfrac {\partial \mu _{2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \mu _{N}}{\partial \theta _{m}}}\end{bmatrix}}^{\textsf {T}};\\[8pt]{\dfrac {\partial \Sigma }{\partial \theta _{m}}}&={\begin{bmatrix}{\dfrac {\partial \Sigma _{1,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{1,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{1,N}}{\partial \theta _{m}}}\\[5pt]{\dfrac {\partial \Sigma _{2,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{2,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{2,N}}{\partial \theta _{m}}}\\\vdots &\vdots &\ddots &\vdots \\{\dfrac {\partial \Sigma _{N,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{N,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{N,N}}{\partial \theta _{m}}}\end{bmatrix}}.\end{aligned}}} 特別な、しかし非常に一般的なケースとして、Σ ( θ ) = Σ {\displaystyle \Sigma (\theta )=\Sigma } 定数。
私 m 、 n = ∂ μ T ∂ θ m Σ − 1 ∂ μ ∂ θ n 。 {\displaystyle {\mathcal {I}}_{m,n}={\frac {\partial \mu ^{\textsf {T}}}{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \theta _{n}}}.\ } この場合、フィッシャー情報行列は、最小二乗 推定理論 の正規方程式 の係数行列と同一視できる。
もう1つの特殊なケースは、平均と共分散が2つの異なるベクトルパラメータ、例えばβ とθ に依存する場合です。これは、相関のある残差を持つ線形モデルをよく使用する空間データの分析で特に一般的です。この場合、[ 21 ]
私 ( β 、 θ ) = 診断 ( 私 ( β ) 、 私 ( θ ) ) {\displaystyle {\mathcal {I}}(\beta ,\theta )=\operatorname {diag} \left({\mathcal {I}}(\beta ),{\mathcal {I}}(\theta )\right)} どこ
私 ( β ) m 、 n = ∂ μ T ∂ β m Σ − 1 ∂ μ ∂ β n 、 私 ( θ ) m 、 n = 1 2 tr ( Σ − 1 ∂ Σ ∂ θ m Σ − 1 ∂ Σ ∂ θ n ) {\displaystyle {\begin{aligned}{\mathcal {I}}{(\beta )_{m,n}}&={\frac {\partial \mu ^{\textsf {T}}}{\partial \beta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \beta _{n}}},\\[5pt]{\mathcal {I}}{(\theta )_{m,n}}&={\frac {1}{2}}\operatorname {tr} \left(\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{m}}}{\Sigma ^{-1}}{\frac {\partial \Sigma }{\partial \theta _{n}}}\right)\end{aligned}}}
物件
連鎖律 エントロピー や相互情報量 と同様に、フィッシャー情報量も連鎖律 分解を持ちます。特に、X とYが 同時分布する確率変数である場合、次のようになります。[ 22 ]
私 X 、 Y ( θ ) = 私 X ( θ ) + 私 Y ∣ X ( θ ) 、 {\displaystyle {\mathcal {I}}_{X,Y}(\theta )={\mathcal {I}}_{X}(\theta )+{\mathcal {I}}_{Y\mid X}(\theta ),} どこ私 Y ∣ X ( θ ) = E X [ 私 Y ∣ X = x ( θ ) ] {\displaystyle {\mathcal {I}}_{Y\mid X}(\theta )=\operatorname {E} _{X}\left[{\mathcal {I}}_{Y\mid X=x}(\theta )\right]} そして私 Y ∣ X = x ( θ ) {\displaystyle {\mathcal {I}}_{Y\mid X=x}(\theta )} Y のフィッシャー情報は、θ {\displaystyle \theta } 特定の値X = xが与えられた場合の Y の条件付き密度に関して計算されます。
特殊なケースとして、2つの確率変数が独立で ある場合、2つの確率変数から得られる情報は、それぞれの確率変数から得られる情報の合計になります。
私 X 、 Y ( θ ) = 私 X ( θ ) + 私 Y ( θ ) 。 {\displaystyle {\mathcal {I}}_{X,Y}(\theta )={\mathcal {I}}_{X}(\theta )+{\mathcal {I}}_{Y}(\theta ).} したがって、 n個の 独立かつ同一の分布に従う 観測値からなるランダムサンプルに含まれる情報は、サイズ1のサンプルに含まれる情報のn 倍になります。
十分な統計 十分統計量 によって提供される情報は、標本X の情報と同じです。これは、 十分統計量に対するネイマンの因数分解基準 を使用することで確認できます。T ( X ) がθ に対して十分である場合、
f ( X ; θ ) = g ( T ( X ) 、 θ ) h ( X ) {\displaystyle f(X;\theta )=g(T(X),\theta )h(X)} いくつかの関数g とh について。h ( X )がθ に依存しないということは、
∂ ∂ θ ログ [ f ( X ; θ ) ] = ∂ ∂ θ ログ [ g ( T ( X ) ; θ ) ] 、 {\displaystyle {\frac {\partial }{\partial \theta }}\log \left[f(X;\theta )\right]={\frac {\partial }{\partial \theta }}\log \left[g(T(X);\theta )\right],} そして、情報の等価性はフィッシャー情報の定義から導かれる。より一般的には、T = t ( X )が統計量 である場合、
私 T ( θ ) ≤ 私 X ( θ ) {\displaystyle {\mathcal {I}}_{T}(\theta )\leq {\mathcal {I}}_{X}(\theta )} T が十分統計量で ある場合に限り、 等号が成立する。[ 24 ]
アプリケーション
最適な実験計画法 フィッシャー情報は、最適な実験計画 において広く用いられています。推定値の分散とフィッシャー情報には相互関係があるため、分散を 最小化することは 情報を 最大化すること に対応します。
線形 (または線形化 )統計モデル に複数のパラメータ がある場合、パラメータ推定量の平均は ベクトル であり、その分散は 行列 になります。分散行列の逆行列は「情報行列」と呼ばれます。パラメータベクトルの推定量の分散は行列であるため、「分散を最小化する」問題は複雑になります。統計学者は統計理論を用いて、実数値の 要約統計量 を使用して情報行列を圧縮します。これらの「情報基準」は実数値関数であるため、最大化することができます。
従来、統計学者は、推定量や設計を評価する際に、共分散行列(不偏推定量の)の要約統計量(通常は正の実数値( 行列式 や行列トレース など))を考慮してきました。正の実数を扱うことで、いくつかの利点が得られます。単一パラメータの推定量の分散が正であれば、分散とフィッシャー情報はどちらも正の実数になります。したがって、これらは非負の実数の凸錐 の要素となります(非ゼロの要素の逆数は、同じ錐の中に存在します)。
いくつかのパラメータの場合、共分散行列と情報行列は、レーヴナー (レーヴナー)順序のもとで、半 順序ベクトル空間内の 非負定値 対称行列の凸錐の要素になります。この錐は、行列の加算と逆行列、および正の実数と行列の乗算に関して閉じています。行列理論とレーヴナー順序の説明は、Pukelsheim に掲載されています。[ 31 ]
従来の最適性基準は、不変式理論 の意味での情報行列の不変量です。代数的には、従来の最適性基準は、(フィッシャー)情報行列の固有値 の関数です( 最適設計を 参照)。
計算神経科学 フィッシャー情報量は、ニューラルコード の精度の限界を見つけるために使用されてきました。この場合、Xは通常、低次元変数 θ ( 刺激 パラメータなど)を表す多数のニューロンの同時応答です。特に、ニューラル応答のノイズにおける相関の役割が研究されています。[ 33 ]
相対エントロピーとの関係 フィッシャー情報は相対エントロピー に関連している。[ 38 ] 2 つの分布間の相対エントロピー、またはカルバック・ライブラー情報量 p {\displaystyle p} そしてq {\displaystyle q} 次のように書くことができます
K L ( p : q ) = ∫ p ( x ) ログ p ( x ) q ( x ) d x 。 {\displaystyle KL(p:q)=\int p(x)\log {\frac {p(x)}{q(x)}}\,dx.} ここで、確率分布の族を考えてみましょう。f ( x ; θ ) {\displaystyle f(x;\theta )} パラメータ化θ ∈ Θ {\displaystyle \theta \in \Theta } すると、この族内の2つの分布間のカルバック・ライブラー情報量 は次のように表される。
D ( θ 、 θ ′ ) = K L ( p ( ⋅ ; θ ) : p ( ⋅ ; θ ′ ) ) = ∫ f ( x ; θ ) ログ f ( x ; θ ) f ( x ; θ ′ ) d x 。 {\displaystyle D(\theta ,\theta ')=KL(p({}\cdot {};\theta ):p({}\cdot {};\theta '))=\int f(x;\theta )\log {\frac {f(x;\theta )}{f(x;\theta ')}}\,dx.} もしθ {\displaystyle \theta } が固定されている場合、同じファミリーの 2 つの分布間の相対エントロピーは、θ ′ = θ {\displaystyle \theta '=\theta } 。 のためにθ ′ {\displaystyle \theta '} 近いθ {\displaystyle \theta } 前述の式を2次までの級数に展開することができる。
D ( θ 、 θ ′ ) = 1 2 ( θ ′ − θ ) T ( ∂ 2 ∂ θ 私 ′ ∂ θ j ′ D ( θ 、 θ ′ ) ) θ ′ = θ ( θ ′ − θ ) + o ( ( θ ′ − θ ) 2 ) {\displaystyle D(\theta ,\theta ')={\frac {1}{2}}(\theta '-\theta )^{\textsf {T}}\left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}D(\theta ,\theta ')\right)_{\theta '=\theta }(\theta '-\theta )+o\left((\theta '-\theta )^{2}\right)} しかし、2階微分は次のように書ける。
( ∂ 2 ∂ θ 私 ′ ∂ θ j ′ D ( θ 、 θ ′ ) ) θ ′ = θ = − ∫ f ( x ; θ ) ( ∂ 2 ∂ θ 私 ′ ∂ θ j ′ ログ ( f ( x ; θ ′ ) ) ) θ ′ = θ d x = [ 私 ( θ ) ] 私 、 j 。 {\displaystyle \left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}D(\theta ,\theta ')\right)_{\theta '=\theta }=-\int f(x;\theta )\left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}\log(f(x;\theta '))\right)_{\theta '=\theta }\,dx=[{\mathcal {I}}(\theta )]_{i,j}.} したがって、フィッシャー情報は、条件付き分布の相対エントロピーの、そのパラメータに関する曲率を表す。
歴史 フィッシャー情報量は、初期の統計学者数名、特にF.Y. エッジワース によって議論されました。例えば、サベージは次のように述べています。「フィッシャー情報量に関しては、彼[フィッシャー]はある程度先取りされていました(エッジワース 1908–9、特に 502、507–8、662、677–8、82–5、および彼[エッジワース]が引用しているピアソンとフィロン 1898 [...]を含む参考文献)。」初期の歴史的資料が多数存在します。
注記 ↑ロバート 、 クリスチャン( 2007)。「非情報事前分布」。ベイズ選択 (第2 版)。シュプリンガー。pp. 127–141。ISBN 978-0-387-71598-8 。 ↑ル・カム 、 ルシアン (1986)。 統計的決定理論における漸近的方法 。ニューヨーク:スプリンガー。618-621 頁 。ISBN 0-387-96307-3 。↑ Kass, Robert E.; Tierney, Luke; Kadane, Joseph B. (1990). 「ラプラス法に基づく事後分布展開の妥当性」. Geisser, S.; Hodges, JS; Press, SJ; Zellner, A. (編)『 統計学および計量経済学におけるベイズ法と尤度法 』 . Elsevier. pp. 473–488 . ISBN 0-444-88376-2 。↑ Suba Rao. 「統計的推論に関する講義」 (PDF) 。 2020年9月26日に オリジナル (PDF)からアーカイブ済み 。 2013年4月12日 に取得。 ↑ マーク J シャービッシュ (1995)。 統計理論 。ニューヨーク州ニューヨーク: スプリンガー ニューヨーク。 p. 111.ISBN 978-1-4612-4250-5 OCLC 852790658 ↑ Nielsen, Frank (2023). "多変量正規分布間のフィッシャー・ラオ距離の単純な近似法" . Entropy . 25 (4): 654. arXiv : 2302.08175 . Bibcode : 2023Entrp..25..654N . doi : 10.3390/e25040654 . PMC 10137715 . PMID 37190442 . ↑ ニールセン、フランク (2013). 「クラ メール ・ラオ下限と情報幾何学」。Connected at Infinity II。Texts and Readings in Mathematics。第67巻、 18–37 頁 。arXiv : 1301.3578。doi : 10.1007 /978-93-86279-56-9_2。ISBN 978-93-80250-51-9 . S2CID 16759683 . ↑ Spall, JC (2005). "非標準設定におけるフィッシャー情報行列のモンテカルロ計算". Journal of Computational and Graphical Statistics . 14 (4): 889–909 . doi : 10.1198/106186005X78800 . S2CID 16090098 . ↑ Spall, JC (2008)、「フィッシャー情報行列のモンテカルロ推定のための改良された方法」、アメリカ制御会議議事録 、シアトル、ワシントン州、2008年6月11~13日、pp. 2395~2400。https: //doi.org/10.1109/ACC.2008.4586850 ↑ Das, S.; Spall, JC; Ghanem, R. (2010). "事前情報を用いたフィッシャー情報行列の効率的なモンテカルロ計算". Computational Statistics and Data Analysis . 54 (2): 272– 289. doi : 10.1016/j.csda.2009.09.018 . ↑ Barndorff-Nielsen, OE; Cox, DR (1994). Inference and Asymptotics . Chapman & Hall. ISBN 978-0-412-49440-6 。↑ Cox, DR; Reid, N. (1987). "パラメータ直交性と近似条件付き推論(議論付き)". J. Royal Statistical Soc. B . 49 : 1– 39. doi : 10.1111/j.2517-6161.1987.tb01422.x . ↑ 渡辺 聡 (2008)、「特異統計推定における代数幾何学的方法」、L. Accardi、W. Freudenberg、M. Ohya 編『 量子バイオインフォマティクス 』 、 World Scientific 、pp. 325–336 、 Bibcode : 2008qbi..conf..325W 、 doi : 10.1142/9789812793171_0024 、 ISBN 978-981-279-316-4 。↑ 渡辺 聡 (2013). 「広く適用可能なベイズ情報量規準」. Journal of Machine Learning Research . 14 : 867–897 . ↑ Malagò, Luigi; Pistone, Giovanni (2015). "確率的最適化の観点から見たガウス分布の情報幾何学". Proceedings of the 2015 ACM Conference on Foundations of Genetic Algorithms XIII . pp. 150–162 . doi : 10.1145/2725494.2725510 . ISBN 978-1-4503-3434-1 . S2CID 693896 . ↑ Mardia, KV; Marshall, RJ (1984). "空間回帰における残差共分散モデルの最尤推定" . Biometrika . 71 (1): 135– 46. doi : 10.1093/biomet/71.1.135 . ↑ Zamir, R. ( 1998). "データ処理論証によるフィッシャー情報不等式の証明". IEEE Transactions on Information Theory . 44 (3): 1246–1250 . CiteSeerX 10.1.1.49.6628 . doi : 10.1109/18.669301 . ↑ Polyanskiy, Yury (2017). "情報理論に関する講義ノート、第29章、ECE563 (UIUC)" (PDF) 。 情報理論に関する講義ノート 。 2022年5月24日にオリジナルから アーカイブ (PDF) 。 2022年5月24日 に取得 。 ↑ マーク J シャービッシュ (1995)。 統計理論 。スプリンガー・フェルラーク。 p. 113. ↑ Janke, W.; Johnston, DA; Kenna, R. (2004). "Information Geometry and Phase Transitions". Physica A . 336 ( 1– 2): 181. arXiv : cond-mat/0401092 . Bibcode : 2004PhyA..336..181J . doi : 10.1016/j.physa.2004.01.023 . S2CID 119085942 . ↑ Prokopenko, M.; Lizier, Joseph T.; Lizier, JT; Obst, O.; Wang, XR (2011). "フィッシャー情報と秩序パラメーターの関係". Physical Review E . 84 (4) 041116. Bibcode : 2011PhRvE..84d1116P . doi : 10.1103/PhysRevE.84.041116 . PMID 22181096 . S2CID 18366894 . ↑ Costa, M.; Cover, T. (1984年11月). 「エントロピーべき乗不等式とブルン・ミンコフスキー不等式の類似性について」. IEEE Transactions on Information Theory . 30 (6): 837–839 . doi : 10.1109/TIT.1984.1056983 . ISSN 1557-9654 . ↑ カバー、トーマス M. (2006). 情報理論の要素 . ジョイ A. トーマス (第 2 版). ホーボーケン、ニュージャージー州: ワイリー・インターサイエンス. p. 256. ISBN 0-471-24195-4 . OCLC 59879802 . ↑ プケルスハイム、フリードリヒ(1993)。 実験計画法の最適設計 。ニューヨーク:ワイリー 。ISBN 978-0-471-61971-0 。↑ ベルナルド、ホセ・M.、スミス、エイドリアン・FM (1994). ベイズ理論 . ニューヨーク: ジョン・ワイリー・アンド・サンズ. ISBN 978-0-471-92416-6 。↑ Abbott, Larry F.; Dayan, Peter (1999). " 相関変動が集団コードの精度に及ぼす影響". Neural Computation . 11 (1): 91– 101. doi : 10.1162/089976699300016827 . PMID 9950724. S2CID 2958438 . ↑ Parag, KV; Donnelly, CA; Zarebski, AE (2022). "ノイズの多い流行曲線の情報の定量化" . Nature Computational Science . 2 (9): 584– 594. doi : 10.1038/s43588-022-00313-1 . hdl : 10044/1/100205 . PMID 38177483 . S2CID 248811793 . ↑ Kirkpatrick, James; Pascanu, Razvan; Rabinowitz, Neil; Veness, Joel; Desjardins, Guillaume; Rusu, Andrei A.; Milan, Kieran; Quan, John; Ramalho, Tiago (2017-03-28). "ニューラルネットワークにおける壊滅的忘却の克服" . Proceedings of the National Academy of Sciences . 114 (13): 3521– 3526. arXiv : 1612.00796 . Bibcode : 2017PNAS..114.3521K . doi : 10.1073/pnas.1611835114 . ISSN 0027-8424 . PMC 5380101 . PMID 28292907 . ↑ Martens, James (2020年8月). 「自然勾配法に関する新たな洞察と展望」. Journal of Machine Learning Research (21). arXiv : 1412.1193 . ↑ da Fonseca, Maria; Samengo, In'es (2016 年 12 月 1 日). 「色空間における距離の情報理論的概念からの人間の色覚弁別能力の導出」. Neural Computation . 28 (12): 2628–2655 . arXiv : 1611.07272 . doi : 10.1162 /NECO_a_00903 . PMID 27764598 . ↑ グーリエルー&モンフォール(1995)、87ページ
参考文献 クラメール、ハラルド (1946)。統計学の数学的方法 。プリンストン数学シリーズ。プリンストン:プリンストン大学出版局。ISBN 0-691-08004-6 。Edgeworth, FY (1908年6月) 「頻度定数の推定誤差について」 . Journal of the Royal Statistical Society . 71 (2): 381–397 . doi : 10.2307/2339461 . JSTOR 2339461 . Edgeworth, FY (1908年9月) 「頻度定数の推定誤差について(続き)」 . Journal of the Royal Statistical Society . 71 (3): 499–512 . doi : 10.2307/2339293 . JSTOR 2339293 . Edgeworth, FY (1908年12月) 「頻度定数の推定誤差について(続き)」 . Journal of the Royal Statistical Society . 71 (4): 651–678 . doi : 10.2307/2339378 . JSTOR 2339378 . Fisher, RA (1922-01-01). 「理論統計学の数学的基礎について」 . Philosophical Transactions of the Royal Society of London, Series A. 222 ( 594–604 ) : 309–368 . Bibcode : 1922RSPTA.222..309F . doi : 10.1098/rsta.1922.0009 . hdl : 2440/15172 .フリーデン、BR (2004)。フィッシャー情報からの科学:統一 。ケンブリッジ大学出版局。ISBN 0-521-00911-1 。Frieden, B. Roy; Gatenby, Robert A. (2013). "統計システムに適用されたハーディの公理からの最大フィッシャー情報量の原理" . Physical Review E . 88 (4) 042144. arXiv : 1405.0007 . Bibcode : 2013PhRvE..88d2144F . doi : 10.1103/PhysRevE.88.042144 . PMC 4010149 . PMID 24229152 . Hald, A. (1999年5月). 「逆確率と最小二乗法に関連する最尤法の歴史について」 . Statistical Science . 14 (2): 214–222 . doi : 10.1214/ss/1009212248 . JSTOR 2676741 . ハルド、A. (1998). 1750年から1930年までの数学統計学の歴史 . ニューヨーク: ワイリー. ISBN 978-0-471-17912-2 。 レーマン、EL ;カセラ、G.(1998)。点推定理論 (第2 版)。スプリンガー。ISBN 978-0-387-98502-2 。ル・カム、ルシアン (1986)。統計的決定理論における漸近的方法 。シュプリンガー・フェルラーク。ISBN 978-0-387-96307-5 。Pratt, John W. (1976 年 5 月). 「FY Edgeworth と RA Fisher による最尤推定の効率性について」 . Annals of Statistics . 4 (3): 501–514 . doi : 10.1214/aos/1176343457 . JSTOR 2958222 . Rao, C. Radhakrishna ( 1945). 「情報と統計パラメータ推定における達成可能な精度」。統計学におけるブレークスルー 。Springer Series in Statistics。第37巻、81-91 頁。doi : 10.1007 /978-1-4612-0919-5_16。ISBN 978-0-387-94037-3 . S2CID 117034671 . ; Savage, LJ (1976 年 5 月). 「RA Fisher の再読について」 . Annals of Statistics . 4 (3): 441–500 . doi : 10.1214/aos/1176343456 . JSTOR 2958221 . シャービッシュ、マーク J. (1995)。統計理論 。ニューヨーク:スプリンガー。ISBN 978-0-387-94546-0 。 スティグラー、SM (1986)。統計学の歴史:1900年以前の不確実性の測定 。ハーバード大学出版局。ISBN 978-0-674-40340-6 。Stigler, SM (1978). "Francis Ysidro Edgeworth, Statistician" . Journal of the Royal Statistical Society, Series A. 141 ( 3): 287–322 . doi : 10.2307/2344804 . JSTOR 2344804 . スティグラー、SM (1999)。統計学の表:統計概念と方法の歴史 。ハーバード大学出版局。ISBN 978-0-674-83601-3 。ヴァン・ツリーズ、HL (1968)。検出、 推定、変調理論、パートI。 ニューヨーク:ワイリー。ISBN 978-0-471-09517-0 。