統計学の概念
数理統計学 において 、 フィッシャー情報量 は、観測可能な ランダム変数 X が、 X をモデル化する分布の 未知のパラメータ θについて持つ 情報 量を測定する方法です。正式には、 スコア の 分散 、または 観測された情報 の 期待値 です 。
最尤推定 の漸近理論におけるフィッシャー情報の役割は、統計学者の ロナルド・フィッシャー卿 によって強調され、研究されました ( フランシス・イシドロ・エッジワース によるいくつかの初期の結果に続いて)。フィッシャー情報行列は、 最尤 推定値 に関連する 共分散行列を計算するために使用されます。また、 ワルド検定 などの検定統計量の定式化にも使用できます 。
ベイズ統計学 では、フィッシャー情報量は ジェフリーズの規則 に従って非情報 事前分布 を導出する役割を果たします 。 [1] また、事前分布が十分に滑らかであれば、 事後分布 の大サンプル共分散としても現れます( 指数族 に対して ラプラス が予見した、 ベルンシュタイン・フォン・ミーゼスの定理 として知られる結果)。 [2]事後分布を ラプラス近似 で近似する場合にも同じ結果が使用され 、フィッシャー情報は近似されたガウス分布の共分散として現れます。 [3]
尤度関数がシフト不変性 に従う科学的性質(物理的、生物学的など)の統計システムは、 最大フィッシャー情報量に従うことが示されている。 最大値のレベルは、システムの制約の性質に依存する。
意味
フィッシャー情報とは、観測可能なランダム変数が 、 の確率が依存する 未知の パラメータ について持つ情報量を測定する方法です 。 を の値で条件付けされたの 確率密度関数 (または 確率質量関数 ) とします。これは、 の既知の値 が与えられた場合 に、の 特定の結果が観測される確率を表します。 が の変化に対して鋭くピークになっている 場合、 データから の「正しい」値を示すことは簡単です。つまり、データが パラメータ について多くの情報を提供しているということです 。 が平坦で広がっている場合、 の 実際の「真の」値を推定するには 、サンプルを多数取得する必要があり ます 。これは、 に関する何らかの分散を調べることを示唆しています 。
バツ
{\displaystyle X}
θ
{\displaystyle \theta}
バツ
{\displaystyle X}
ふ
(
バツ
;
θ
)
{\displaystyle f(X;\theta )}
バツ
{\displaystyle X}
θ
{\displaystyle \theta}
バツ
{\displaystyle X}
θ
{\displaystyle \theta}
ふ
{\displaystyle f}
θ
{\displaystyle \theta}
θ
{\displaystyle \theta}
バツ
{\displaystyle X}
θ
{\displaystyle \theta}
ふ
{\displaystyle f}
バツ
{\displaystyle X}
θ
{\displaystyle \theta}
θ
{\displaystyle \theta}
正式には、 尤度関数 の 自然対数 の に関する 偏微分は スコア と呼ばれます 。特定の規則性条件下では、 が真のパラメータである場合(つまり、 が実際に として分布している場合)、 真のパラメータ値 で評価されたスコアの 期待値 (第 1 モーメント )は 0 であることが示されます 。 [5]
θ
{\displaystyle \theta}
θ
{\displaystyle \theta}
バツ
{\displaystyle X}
ふ
(
バツ
;
θ
)
{\displaystyle f(X;\theta )}
θ
{\displaystyle \theta}
え
[
∂
∂
θ
ログ
ふ
(
バツ
;
θ
)
|
θ
]
=
∫
R
∂
∂
θ
ふ
(
x
;
θ
)
ふ
(
x
;
θ
)
ふ
(
x
;
θ
)
d
x
=
∂
∂
θ
∫
R
ふ
(
x
;
θ
)
d
x
=
∂
∂
θ
1
=
0.
{\displaystyle {\begin{aligned}\operatorname {E} \left[\left.{\frac {\partial }{\partial \theta }}\log f(X;\theta )\,\,\right|\,\,\theta \right]={}&\int _{\mathbb {R} }{\frac {{\frac {\partial }{\partial \theta }}f(x;\theta )}{f(x;\theta )}}f(x;\theta )\,dx\\[6pt]={}&{\frac {\partial }{\partial \theta }}\int _{\mathbb {R} }f(x;\theta )\,dx\\[6pt]={}&{\frac {\partial }{\partial \theta }}1\\[6pt]={}&0.\end{aligned}}}
フィッシャー 情報 はスコアの 分散 として定義される:
私
(
θ
)
=
え
[
(
∂
∂
θ
ログ
ふ
(
バツ
;
θ
)
)
2
|
θ
]
=
∫
R
(
∂
∂
θ
ログ
ふ
(
x
;
θ
)
)
2
ふ
(
x
;
θ
)
d
x
、
{\displaystyle {\mathcal {I}}(\theta )=\operatorname {E} \left[\left.\left({\frac {\partial }{\partial \theta }}\log f(X;\theta )\right)^{2}\,\,\right|\,\,\theta \right]=\int _{\mathbb {R} }\left({\frac {\partial }{\partial \theta }}\log f(x;\theta )\right)^{2}f(x;\theta )\,dx,}
注意してください 。高いフィッシャー情報量を持つランダム変数は、スコアの絶対値が高いことが多いことを意味します。ランダム変数 X は 平均化されているため、フィッシャー情報は特定の観測値の関数ではありません。
私
(
θ
)
≥
0
{\displaystyle {\mathcal {I}}(\theta )\geq 0}
log f ( x ; θ )が θ に関して2回微分可能で あり 、特定の正則性条件の下では、フィッシャー情報は次のようにも表される
私
(
θ
)
=
−
え
[
∂
2
∂
θ
2
ログ
ふ
(
バツ
;
θ
)
|
θ
]
、
{\displaystyle {\mathcal {I}}(\theta )=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\log f(X;\theta )\,\,\right|\,\,\theta \right],}
以来
∂
2
∂
θ
2
ログ
ふ
(
バツ
;
θ
)
=
∂
2
∂
θ
2
ふ
(
バツ
;
θ
)
ふ
(
バツ
;
θ
)
−
(
∂
∂
θ
ふ
(
バツ
;
θ
)
ふ
(
バツ
;
θ
)
)
2
=
∂
2
∂
θ
2
ふ
(
バツ
;
θ
)
ふ
(
バツ
;
θ
)
−
(
∂
∂
θ
ログ
ふ
(
バツ
;
θ
)
)
2
{\displaystyle {\frac {\partial ^{2}}{\partial \theta ^{2}}}\log f(X;\theta )={\frac {{\frac {\partial ^{2}}{\partial \theta ^{2}}}f(X;\theta )}{f(X;\theta )}}-\left({\frac {{\frac {\partial }{\partial \theta }}f(X;\theta )}{f(X;\theta )}}\right)^{2}={\frac {{\frac {\partial ^{2}}{\partial \theta ^{2}}}f(X;\theta )}{f(X;\theta )}}-\left({\frac {\partial }{\partial \theta }}\log f(X;\theta )\right)^{2}}
そして
E
[
∂
2
∂
θ
2
f
(
X
;
θ
)
f
(
X
;
θ
)
|
θ
]
=
∂
2
∂
θ
2
∫
R
f
(
x
;
θ
)
d
x
=
0.
{\displaystyle \operatorname {E} \left[\left.{\frac {{\frac {\partial ^{2}}{\partial \theta ^{2}}}f(X;\theta )}{f(X;\theta )}}\,\,\right|\,\,\theta \right]={\frac {\partial ^{2}}{\partial \theta ^{2}}}\int _{\mathbb {R} }f(x;\theta )\,dx=0.}
したがって、フィッシャー情報は サポート曲線 (対数尤度のグラフ) の曲率として見ることができます。 最大尤度 推定値の近くでは、フィッシャー情報が低いということは、最大値が「鈍い」ように見える、つまり最大値が浅く、同様の対数尤度を持つ値が多数存在することを示します。逆に、フィッシャー情報が高いということは、最大値が鋭いことを示します。
規則性条件
規則性の条件は以下のとおりです。 [8]
f ( X ; θ ) の θ に関する 偏微分は、 ほぼどこにでも 存在します。 (この集合が θ に依存しない限り、空集合上には存在しない可能性があります 。)
f ( X ; θ )の積分は、 θ に関する積分符号の下で微分することができます 。
f ( X ; θ )の サポート は θ に依存しません 。
θ がベクトルの 場合、 θ のすべての成分に対して正則性条件が満たされる必要があります。正則性条件を満たさない密度の例は簡単に見つかります。Uniform(0, θ ) 変数の密度は条件 1 と 3 を満たしません。この場合、定義からフィッシャー情報を計算できますが、通常想定される特性は持ちません。
可能性に関して
X が与えられたときの θ の 尤度 は常に確率 f ( X ; θ ) に比例するため、それらの対数は必然的に θ に依存しない定数だけ異なり、これらの対数の θ に関する導関数は必然的に等しくなります。したがって、 フィッシャー情報の定義では、
log f ( X ; θ ) の代わりに対数尤度 l ( θ ; X )を代入することができます。
あらゆるサイズのサンプル
値 X は 、単一の分布から抽出された単一のサンプルを表すことも、分布の集合から抽出されたサンプルの集合を表すこともできます 。n 個の サンプルがあり、対応する n 個の分布が 統計的に独立し ている場合、フィッシャー情報は、その分布からの単一のサンプルごとに 1 つずつ、単一サンプルのフィッシャー情報値の合計になります。特に、 n 個の分布が 独立しており、同一に分布している場合、フィッシャー情報は、共通分布からの単一のサンプルのフィッシャー情報の n 倍になります 。言い換えると、母集団からのサイズ nのサンプルの iid 観測値のフィッシャー情報は、 n と同じ母集団からの単一の観測値のフィッシャー情報
との積に等しくなります。
クラ メール・ラオ境界 は、フィッシャー情報量の逆数は、 θ の 不偏推定量 の分散の下限値であると述べている。Van Trees(1968)とFrieden(2004)は、フィッシャー情報量の使用を説明する結果で
ある クラメール・ラオ境界 を導出する次の方法を提供している。
非公式には、まず不偏推定量 を考えることから始めます 。数学的には、「不偏」とは、
θ
^
(
X
)
{\displaystyle {\hat {\theta }}(X)}
E
[
θ
^
(
X
)
−
θ
|
θ
]
=
∫
(
θ
^
(
x
)
−
θ
)
f
(
x
;
θ
)
d
x
=
0
regardless of the value of
θ
.
{\displaystyle \operatorname {E} \left[\left.{\hat {\theta }}(X)-\theta \,\,\right|\,\,\theta \right]=\int \left({\hat {\theta }}(x)-\theta \right)\,f(x;\theta )\,dx=0{\text{ regardless of the value of }}\theta .}
この式はθ に依存せずゼロなので、 θ に関する偏微分 もゼロになる。 積の法則 により、この偏微分は
0
=
∂
∂
θ
∫
(
θ
^
(
x
)
−
θ
)
f
(
x
;
θ
)
d
x
=
∫
(
θ
^
(
x
)
−
θ
)
∂
f
∂
θ
d
x
−
∫
f
d
x
.
{\displaystyle 0={\frac {\partial }{\partial \theta }}\int \left({\hat {\theta }}(x)-\theta \right)\,f(x;\theta )\,dx=\int \left({\hat {\theta }}(x)-\theta \right){\frac {\partial f}{\partial \theta }}\,dx-\int f\,dx.}
各 θ に対して、尤度関数は確率密度関数であるため、 となる。 の偏微分に関する 連鎖律 を用いて を で 割って を掛けると 、次のことが証明できる。
∫
f
d
x
=
1
{\displaystyle \int f\,dx=1}
log
f
{\displaystyle \log f}
f
(
x
;
θ
)
{\displaystyle f(x;\theta )}
∂
f
∂
θ
=
f
∂
log
f
∂
θ
.
{\displaystyle {\frac {\partial f}{\partial \theta }}=f\,{\frac {\partial \log f}{\partial \theta }}.}
上記の2つの事実を用いると、
∫
(
θ
^
−
θ
)
f
∂
log
f
∂
θ
d
x
=
1.
{\displaystyle \int \left({\hat {\theta }}-\theta \right)f\,{\frac {\partial \log f}{\partial \theta }}\,dx=1.}
被積分関数を因数分解すると、
∫
(
(
θ
^
−
θ
)
f
)
(
f
∂
log
f
∂
θ
)
d
x
=
1.
{\displaystyle \int \left(\left({\hat {\theta }}-\theta \right){\sqrt {f}}\right)\left({\sqrt {f}}\,{\frac {\partial \log f}{\partial \theta }}\right)\,dx=1.}
積分式を二乗すると、 コーシー・シュワルツの不等式は 次のようになる。
1
=
(
∫
[
(
θ
^
−
θ
)
f
]
⋅
[
f
∂
log
f
∂
θ
]
d
x
)
2
≤
[
∫
(
θ
^
−
θ
)
2
f
d
x
]
⋅
[
∫
(
∂
log
f
∂
θ
)
2
f
d
x
]
.
{\displaystyle 1={\biggl (}\int \left[\left({\hat {\theta }}-\theta \right){\sqrt {f}}\right]\cdot \left[{\sqrt {f}}\,{\frac {\partial \log f}{\partial \theta }}\right]\,dx{\biggr )}^{2}\leq \left[\int \left({\hat {\theta }}-\theta \right)^{2}f\,dx\right]\cdot \left[\int \left({\frac {\partial \log f}{\partial \theta }}\right)^{2}f\,dx\right].}
2番目の括弧内の因子はフィッシャー情報量として定義され、最初の括弧内の因子は 推定値の期待 平均二乗誤差 である。整理すると、不等式は次のようになる。
θ
^
{\displaystyle {\hat {\theta }}}
Var
(
θ
^
)
≥
1
I
(
θ
)
.
{\displaystyle \operatorname {Var} \left({\hat {\theta }}\right)\geq {\frac {1}{{\mathcal {I}}\left(\theta \right)}}.}
言い換えれば、 θ を 推定できる精度は、基本的に尤度関数のフィッシャー情報によって制限されます。
あるいは、ランダム変数、 に対するコーシー・シュワルツ不等式を ランダム変数 およびに適用し 、不偏推定量に対して次の式が成り立つことを観察することで、 同じ結論を直接得ることができる。
|
Cov
(
A
,
B
)
|
2
≤
Var
(
A
)
Var
(
B
)
{\displaystyle |\operatorname {Cov} (A,B)|^{2}\leq \operatorname {Var} (A)\operatorname {Var} (B)}
θ
^
(
X
)
{\displaystyle {\hat {\theta }}(X)}
∂
θ
log
f
(
X
;
θ
)
{\displaystyle \partial _{\theta }\log f(X;\theta )}
Cov
[
θ
^
(
X
)
,
∂
θ
log
f
(
X
;
θ
)
]
=
∫
θ
^
(
x
)
∂
θ
f
(
x
;
θ
)
d
x
=
∂
θ
E
[
θ
^
]
=
1.
{\displaystyle \operatorname {Cov} [{\hat {\theta }}(X),\partial _{\theta }\log f(X;\theta )]=\int {\hat {\theta }}(x)\,\partial _{\theta }f(x;\theta )\,dx=\partial _{\theta }\operatorname {E} [{\hat {\theta }}]=1.}
例
単一パラメータベルヌーイ実験
ベルヌーイ 試行は 、0 と 1 の 2 つの結果 が考えられ、 1 の確率は θです。結果は、偏ったコインを投げて表 (1) が出る確率が θで、裏 (0) が出る確率が 1 − θ であると考えることができます 。
X を 分布からの 1 つのサンプルのベルヌーイ試行とします。X に含まれるフィッシャー情報は 次 の ように計算されます。
I
(
θ
)
=
−
E
[
∂
2
∂
θ
2
log
(
θ
X
(
1
−
θ
)
1
−
X
)
|
θ
]
=
−
E
[
∂
2
∂
θ
2
(
X
log
θ
+
(
1
−
X
)
log
(
1
−
θ
)
)
|
θ
]
=
E
[
X
θ
2
+
1
−
X
(
1
−
θ
)
2
|
θ
]
=
θ
θ
2
+
1
−
θ
(
1
−
θ
)
2
=
1
θ
(
1
−
θ
)
.
{\displaystyle {\begin{aligned}{\mathcal {I}}(\theta )&=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\log \left(\theta ^{X}(1-\theta )^{1-X}\right)\right|\theta \right]\\[5pt]&=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta ^{2}}}\left(X\log \theta +(1-X)\log(1-\theta )\right)\,\,\right|\,\,\theta \right]\\[5pt]&=\operatorname {E} \left[\left.{\frac {X}{\theta ^{2}}}+{\frac {1-X}{(1-\theta )^{2}}}\,\,\right|\,\,\theta \right]\\[5pt]&={\frac {\theta }{\theta ^{2}}}+{\frac {1-\theta }{(1-\theta )^{2}}}\\[5pt]&={\frac {1}{\theta (1-\theta )}}.\end{aligned}}}
フィッシャー情報は加法的であるため、 n回 の独立した ベルヌーイ試行 に含まれるフィッシャー情報 は、
I
(
θ
)
=
n
θ
(
1
−
θ
)
.
{\displaystyle {\mathcal {I}}(\theta )={\frac {n}{\theta (1-\theta )}}.}
がn 回の 独立したベルヌーイ試行 の可能な結果 の 1 つであり、が i 番目の試行の j 番目の結果である 場合 、 の確率は 次のように与えられます。
x
i
{\displaystyle x_{i}}
2
n
{\displaystyle 2^{n}}
x
i
j
{\displaystyle x_{ij}}
x
i
{\displaystyle x_{i}}
p
(
x
i
,
θ
)
=
∏
j
=
0
n
θ
x
i
j
(
1
−
θ
)
x
i
j
{\displaystyle p(x_{i},\theta )=\prod _{j=0}^{n}\theta ^{x_{ij}}(1-\theta )^{x_{ij}}}
i 番目の試行 の平均は、
試行の平均の期待値は次のとおりです。
μ
i
=
(
1
/
n
)
∑
j
=
1
n
x
i
j
{\displaystyle \mu _{i}=(1/n)\sum _{j=1}^{n}x_{ij}}
E
(
μ
)
=
∑
x
i
μ
i
p
(
x
i
,
θ
)
=
θ
{\displaystyle E(\mu )=\sum _{x_{i}}\mu _{i}\,p(x_{i},\theta )=\theta }
ここで、合計はすべての 可能な試行結果にわたります。平均の二乗の期待値は次のようになります。
2
n
{\displaystyle 2^{n}}
E
(
μ
2
)
=
∑
x
i
μ
i
2
p
(
x
i
,
θ
)
=
(
1
+
(
n
−
1
)
θ
)
θ
n
{\displaystyle E(\mu ^{2})=\sum _{x_{i}}\mu _{i}^{2}\,p(x_{i},\theta )={\frac {(1+(n-1)\theta )\theta }{n}}}
したがって平均値の分散は次のようになります。
E
(
μ
2
)
−
E
(
μ
)
2
=
(
1
/
n
)
θ
(
1
−
θ
)
{\displaystyle E(\mu ^{2})-E(\mu )^{2}=(1/n)\theta (1-\theta )}
フィッシャー情報量は、 n 回の ベルヌーイ試行 における成功の平均回数の 分散 の逆数であることが分かります 。これは一般的に当てはまります。この場合、クラメール・ラオ境界は等式です。
見積もり θ から バツ ∼ ベルン(√ θ )
別の例として、ある に対して、それぞれ確率 と で 、 結果が 0 と 1 になる ランダム変数を考えてみましょう 。私たちの目標は、 の観測値から を推定することです 。
X
{\displaystyle X}
p
0
=
1
−
θ
{\displaystyle p_{0}=1-{\sqrt {\theta }}}
p
1
=
θ
{\displaystyle p_{1}={\sqrt {\theta }}}
θ
∈
[
0
,
1
]
{\displaystyle \theta \in [0,1]}
θ
{\displaystyle \theta }
X
{\displaystyle X}
この場合のフィッシャー情報は、 この式は、以下の再パラメータ化の変更式から直接導くこともできる。より一般的には、 となる十分に正則な関数に対して、 から 取り出すフィッシャー情報は 、同様に計算されて次のように表される。
I
(
θ
)
=
E
[
(
∂
∂
θ
log
f
(
X
;
θ
)
)
2
|
θ
]
=
(
1
−
θ
)
(
−
1
2
θ
(
1
−
θ
)
)
2
+
θ
(
1
2
θ
)
2
=
1
4
θ
(
1
1
−
θ
+
1
θ
)
.
{\displaystyle {\begin{aligned}{\mathcal {I}}(\theta )&=\mathrm {E} \left[\left({\frac {\partial }{\partial \theta }}\log f(X;\theta )\right)^{2}{\Bigg |}\,\theta \right]\\&=(1-{\sqrt {\theta }})\left({\frac {-1}{2{\sqrt {\theta }}(1-{\sqrt {\theta }})}}\right)^{2}+{\sqrt {\theta }}\left({\frac {1}{2\theta }}\right)^{2}\\&={\frac {1}{4\theta }}\left({\frac {1}{1-{\sqrt {\theta }}}}+{\frac {1}{\sqrt {\theta }}}\right)\end{aligned}}.}
f
{\displaystyle f}
f
(
θ
)
∈
[
0
,
1
]
{\displaystyle f(\theta )\in [0,1]}
θ
{\displaystyle \theta }
X
∼
Bern
(
f
(
θ
)
)
{\displaystyle X\sim \operatorname {Bern} (f(\theta ))}
I
(
θ
)
=
f
′
(
θ
)
2
(
1
1
−
f
(
θ
)
+
1
f
(
θ
)
)
.
{\displaystyle {\mathcal {I}}(\theta )=f'(\theta )^{2}\left({\frac {1}{1-f(\theta )}}+{\frac {1}{f(\theta )}}\right).}
N個の パラメータ があり、 θ が N ×1 ベクトルの場合、フィッシャー情報は N × N 行列 の形をとります。この行列は フィッシャー情報行列 (FIM)
と呼ばれ、典型的な要素を持ちます。
θ
=
[
θ
1
θ
2
…
θ
N
]
T
,
{\displaystyle \theta ={\begin{bmatrix}\theta _{1}&\theta _{2}&\dots &\theta _{N}\end{bmatrix}}^{\textsf {T}},}
[
I
(
θ
)
]
i
,
j
=
E
[
(
∂
∂
θ
i
log
f
(
X
;
θ
)
)
(
∂
∂
θ
j
log
f
(
X
;
θ
)
)
|
θ
]
.
{\displaystyle {\bigl [}{\mathcal {I}}(\theta ){\bigr ]}_{i,j}=\operatorname {E} \left[\left.\left({\frac {\partial }{\partial \theta _{i}}}\log f(X;\theta )\right)\left({\frac {\partial }{\partial \theta _{j}}}\log f(X;\theta )\right)\,\,\right|\,\,\theta \right].}
FIMは N × N の半正定値行列 です。正定値であれば、 N 次元 パラメータ 空間 上に リーマン計量 [11] を定義します。 情報幾何学のトピックでは、これを使用してフィッシャー情報量を 微分幾何学 に結び付けており 、その文脈では、この計量は フィッシャー情報計量 として知られています。
一定の規則性条件下では、フィッシャー情報行列は次のようにも書ける。
[
I
(
θ
)
]
i
,
j
=
−
E
[
∂
2
∂
θ
i
∂
θ
j
log
f
(
X
;
θ
)
|
θ
]
.
{\displaystyle {\bigl [}{\mathcal {I}}(\theta ){\bigr ]}_{i,j}=-\operatorname {E} \left[\left.{\frac {\partial ^{2}}{\partial \theta _{i}\,\partial \theta _{j}}}\log f(X;\theta )\,\,\right|\,\,\theta \right]\,.}
結果はいくつかの点で興味深いものです。
フィッシャー情報行列がブロック対角で、これらの成分が別々のブロックにある場合、 2つのパラメータ成分ベクトル θ 1 と θ 2 は情報直交していると言えます。 [16]直交パラメータは 、最大尤度推定値 が漸近的に無相関であるという意味で扱いやすいです 。統計モデルの分析方法を検討する際、モデル作成者は、特に関心のあるパラメータが1次元であるが、迷惑パラメータは任意の次元を持つことができる場合、モデルの直交パラメータ化を探すのに時間を費やすことをお勧めします。 [17]
特異統計モデル
フィッシャー情報行列がすべての θ に対して正定値である場合、対応する 統計モデルは 正規 であると言われ 、そうでない場合、統計モデルは 特異 であると言われます。 [18] 特異統計モデルの例としては、正規 混合 、二項混合、多項混合、 ベイジアンネットワーク 、 ニューラルネットワーク 、 ラジアル基底関数 、 隠れマルコフモデル 、 確率的文脈自由文法 、縮小ランク回帰、 ボルツマンマシン などがあります。
機械学習 では 、ランダムな現象から隠れた構造を抽出するような統計モデルを考案すると、自然に特異なものとなる。 [19]
多変量正規分布
N 変量 多変量正規分布 の FIM は 特別な形式を持ちます。パラメータの K 次元ベクトルを 、ランダム正規変数のベクトルをとします 。これらのランダム変数の平均値が 、 共分散行列 をとします 。すると、 に対して、 FIM の ( m , n ) 要素は次のようになります: [20]
X
∼
N
(
μ
(
θ
)
,
Σ
(
θ
)
)
{\displaystyle \,X\sim N\left(\mu (\theta ),\,\Sigma (\theta )\right)}
θ
=
[
θ
1
…
θ
K
]
T
{\displaystyle \theta ={\begin{bmatrix}\theta _{1}&\dots &\theta _{K}\end{bmatrix}}^{\textsf {T}}}
X
=
[
X
1
…
X
N
]
T
{\displaystyle X={\begin{bmatrix}X_{1}&\dots &X_{N}\end{bmatrix}}^{\textsf {T}}}
μ
(
θ
)
=
[
μ
1
(
θ
)
…
μ
N
(
θ
)
]
T
{\displaystyle \,\mu (\theta )={\begin{bmatrix}\mu _{1}(\theta )&\dots &\mu _{N}(\theta )\end{bmatrix}}^{\textsf {T}}}
Σ
(
θ
)
{\displaystyle \,\Sigma (\theta )}
1
≤
m
,
n
≤
K
{\displaystyle 1\leq m,\,n\leq K}
I
m
,
n
=
∂
μ
T
∂
θ
m
Σ
−
1
∂
μ
∂
θ
n
+
1
2
tr
(
Σ
−
1
∂
Σ
∂
θ
m
Σ
−
1
∂
Σ
∂
θ
n
)
,
{\displaystyle {\mathcal {I}}_{m,n}={\frac {\partial \mu ^{\textsf {T}}}{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \theta _{n}}}+{\frac {1}{2}}\operatorname {tr} \left(\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{n}}}\right),}
ここで、 は ベクトルの 転置 を表し、 は 正方行列 の トレース を表し 、次のようになります。
(
⋅
)
T
{\displaystyle (\cdot )^{\textsf {T}}}
tr
(
⋅
)
{\displaystyle \operatorname {tr} (\cdot )}
∂
μ
∂
θ
m
=
[
∂
μ
1
∂
θ
m
∂
μ
2
∂
θ
m
⋯
∂
μ
N
∂
θ
m
]
T
;
∂
Σ
∂
θ
m
=
[
∂
Σ
1
,
1
∂
θ
m
∂
Σ
1
,
2
∂
θ
m
⋯
∂
Σ
1
,
N
∂
θ
m
∂
Σ
2
,
1
∂
θ
m
∂
Σ
2
,
2
∂
θ
m
⋯
∂
Σ
2
,
N
∂
θ
m
⋮
⋮
⋱
⋮
∂
Σ
N
,
1
∂
θ
m
∂
Σ
N
,
2
∂
θ
m
⋯
∂
Σ
N
,
N
∂
θ
m
]
.
{\displaystyle {\begin{aligned}{\frac {\partial \mu }{\partial \theta _{m}}}&={\begin{bmatrix}{\dfrac {\partial \mu _{1}}{\partial \theta _{m}}}&{\dfrac {\partial \mu _{2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \mu _{N}}{\partial \theta _{m}}}\end{bmatrix}}^{\textsf {T}};\\[8pt]{\dfrac {\partial \Sigma }{\partial \theta _{m}}}&={\begin{bmatrix}{\dfrac {\partial \Sigma _{1,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{1,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{1,N}}{\partial \theta _{m}}}\\[5pt]{\dfrac {\partial \Sigma _{2,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{2,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{2,N}}{\partial \theta _{m}}}\\\vdots &\vdots &\ddots &\vdots \\{\dfrac {\partial \Sigma _{N,1}}{\partial \theta _{m}}}&{\dfrac {\partial \Sigma _{N,2}}{\partial \theta _{m}}}&\cdots &{\dfrac {\partial \Sigma _{N,N}}{\partial \theta _{m}}}\end{bmatrix}}.\end{aligned}}}
特別ではあるが非常に一般的なケースとして、定数
の場合が挙げられます。
Σ
(
θ
)
=
Σ
{\displaystyle \Sigma (\theta )=\Sigma }
I
m
,
n
=
∂
μ
T
∂
θ
m
Σ
−
1
∂
μ
∂
θ
n
.
{\displaystyle {\mathcal {I}}_{m,n}={\frac {\partial \mu ^{\textsf {T}}}{\partial \theta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \theta _{n}}}.\ }
この場合、フィッシャー情報行列は、最小二乗 推定理論の 正規方程式 の係数行列と同一視される可能性があります 。
もう一つの特殊なケースは、平均と共分散が2つの異なるベクトルパラメータ、例えば β と θ に依存する場合である。これは特に空間データの解析でよく見られ、相関残差を持つ線形モデルがよく使用される。この場合、 [21]
I
(
β
,
θ
)
=
diag
(
I
(
β
)
,
I
(
θ
)
)
{\displaystyle {\mathcal {I}}(\beta ,\theta )=\operatorname {diag} \left({\mathcal {I}}(\beta ),{\mathcal {I}}(\theta )\right)}
どこ
I
(
β
)
m
,
n
=
∂
μ
T
∂
β
m
Σ
−
1
∂
μ
∂
β
n
,
I
(
θ
)
m
,
n
=
1
2
tr
(
Σ
−
1
∂
Σ
∂
θ
m
Σ
−
1
∂
Σ
∂
θ
n
)
{\displaystyle {\begin{aligned}{\mathcal {I}}{(\beta )_{m,n}}&={\frac {\partial \mu ^{\textsf {T}}}{\partial \beta _{m}}}\Sigma ^{-1}{\frac {\partial \mu }{\partial \beta _{n}}},\\[5pt]{\mathcal {I}}{(\theta )_{m,n}}&={\frac {1}{2}}\operatorname {tr} \left(\Sigma ^{-1}{\frac {\partial \Sigma }{\partial \theta _{m}}}{\Sigma ^{-1}}{\frac {\partial \Sigma }{\partial \theta _{n}}}\right)\end{aligned}}}
プロパティ
チェーンルール
エントロピー や 相互情報量 と同様に 、フィッシャー情報量も 連鎖律 分解を持つ。特に、 X と Yが 共分布するランダム変数である場合、次の式が成り立つ。 [22]
I
X
,
Y
(
θ
)
=
I
X
(
θ
)
+
I
Y
∣
X
(
θ
)
,
{\displaystyle {\mathcal {I}}_{X,Y}(\theta )={\mathcal {I}}_{X}(\theta )+{\mathcal {I}}_{Y\mid X}(\theta ),}
ここで 、およびは、 特定の値 X = xが与えられた場合の Y の条件付き密度に関して計算された、 に対する Y の フィッシャー情報量です 。
I
Y
∣
X
(
θ
)
=
E
X
[
I
Y
∣
X
=
x
(
θ
)
]
{\displaystyle {\mathcal {I}}_{Y\mid X}(\theta )=\operatorname {E} _{X}\left[{\mathcal {I}}_{Y\mid X=x}(\theta )\right]}
I
Y
∣
X
=
x
(
θ
)
{\displaystyle {\mathcal {I}}_{Y\mid X=x}(\theta )}
θ
{\displaystyle \theta }
特別なケースとして、2 つのランダム変数が 独立して いる場合、2 つのランダム変数によって得られる情報は、各ランダム変数からの情報を個別に合計したものになります。
I
X
,
Y
(
θ
)
=
I
X
(
θ
)
+
I
Y
(
θ
)
.
{\displaystyle {\mathcal {I}}_{X,Y}(\theta )={\mathcal {I}}_{X}(\theta )+{\mathcal {I}}_{Y}(\theta ).}
その結果、 n 個の 独立した同一分布の 観測値 のランダム サンプルの情報は、 サイズ 1 のサンプルの情報の
n倍になります。
ふ -発散
すべての 、 、 (無限大の場合もある)に対して有限な 凸関数 が与えられると 、 f ダイバージェンスが定義されます。 が で 厳密に凸である 場合 、 において局所的に、フィッシャー情報行列は [23] の意味で計量です。 ここで、 は によってパラメータ化された分布です。 つまり、pdf を持つ分布です 。
f
:
[
0
,
∞
)
→
(
−
∞
,
∞
]
{\displaystyle f:[0,\infty )\to (-\infty ,\infty ]}
f
(
x
)
{\displaystyle f(x)}
x
>
0
{\displaystyle x>0}
f
(
1
)
=
0
{\displaystyle f(1)=0}
f
(
0
)
=
lim
t
→
0
+
f
(
t
)
{\displaystyle f(0)=\lim _{t\to 0^{+}}f(t)}
D
f
{\displaystyle D_{f}}
f
{\displaystyle f}
1
{\displaystyle 1}
θ
∈
Θ
{\displaystyle \theta \in \Theta }
(
δ
θ
)
T
I
(
θ
)
(
δ
θ
)
=
1
f
″
(
1
)
D
f
(
P
θ
+
δ
θ
∥
P
θ
)
{\displaystyle (\delta \theta )^{T}I(\theta )(\delta \theta )={\frac {1}{f''(1)}}D_{f}(P_{\theta +\delta \theta }\parallel P_{\theta })}
P
θ
{\displaystyle P_{\theta }}
θ
{\displaystyle \theta }
f
(
x
;
θ
)
{\displaystyle f(x;\theta )}
この形式では、フィッシャー情報行列がリーマン計量であり、変数の変更に応じて正しく変化することが明らかです。(再パラメータ化のセクションを参照)
十分な統計
十分な統計量によって提供 さ れる情報は、サンプル X の情報と同じです。これは、 十分な統計量に対する ネイマンの因数分解基準 を使用することで確認できます。T ( X )が θ に対して十分である場合 、
f
(
X
;
θ
)
=
g
(
T
(
X
)
,
θ
)
h
(
X
)
{\displaystyle f(X;\theta )=g(T(X),\theta )h(X)}
関数 g と hに対しては、 h ( X )が θ から 独立している こと
から、
∂
∂
θ
log
[
f
(
X
;
θ
)
]
=
∂
∂
θ
log
[
g
(
T
(
X
)
;
θ
)
]
,
{\displaystyle {\frac {\partial }{\partial \theta }}\log \left[f(X;\theta )\right]={\frac {\partial }{\partial \theta }}\log \left[g(T(X);\theta )\right],}
そして情報の等価性はフィッシャー情報の定義から導かれる。より一般的には、 T = t ( X ) が 統計量 である場合、
I
T
(
θ
)
≤
I
X
(
θ
)
{\displaystyle {\mathcal {I}}_{T}(\theta )\leq {\mathcal {I}}_{X}(\theta )}
Tが 十分な統計量 である 場合に限り、 等式となる 。 [24]
再パラメータ化
フィッシャー情報は問題のパラメータ化に依存する。θ と η が 推定問題の2つのスカラーパラメータ化であり、 θが η の 連続微分可能な 関数 である場合 、
I
η
(
η
)
=
I
θ
(
θ
(
η
)
)
(
d
θ
d
η
)
2
{\displaystyle {\mathcal {I}}_{\eta }(\eta )={\mathcal {I}}_{\theta }(\theta (\eta ))\left({\frac {d\theta }{d\eta }}\right)^{2}}
ここで 、およびはそれぞれ η と θ のフィッシャー情報量である 。
I
η
{\displaystyle {\mathcal {I}}_{\eta }}
I
θ
{\displaystyle {\mathcal {I}}_{\theta }}
ベクトルの場合、 およびが 推定問題をパラメータ化する k ベクトルであり、 がの連続微分可能関数であるとする と、
θ
{\displaystyle {\boldsymbol {\theta }}}
η
{\displaystyle {\boldsymbol {\eta }}}
θ
{\displaystyle {\boldsymbol {\theta }}}
η
{\displaystyle {\boldsymbol {\eta }}}
I
η
(
η
)
=
J
T
I
θ
(
θ
(
η
)
)
J
{\displaystyle {\mathcal {I}}_{\boldsymbol {\eta }}({\boldsymbol {\eta }})={\boldsymbol {J}}^{\textsf {T}}{\mathcal {I}}_{\boldsymbol {\theta }}({\boldsymbol {\theta }}({\boldsymbol {\eta }})){\boldsymbol {J}}}
ここで、 k × k ヤコビ行列 の( i , j )番目の要素は次 のように定義される。
J
{\displaystyle {\boldsymbol {J}}}
J
i
j
=
∂
θ
i
∂
η
j
,
{\displaystyle J_{ij}={\frac {\partial \theta _{i}}{\partial \eta _{j}}},}
そして、 転置行列は
J
T
{\displaystyle {\boldsymbol {J}}^{\textsf {T}}}
J
.
{\displaystyle {\boldsymbol {J}}.}
情報幾何学 では、これは リーマン多様体 上の座標の変更として見られ 、曲率の固有の性質は異なるパラメータ化の下では変化しません。一般に、フィッシャー情報行列は熱力学的状態の多様体に対してリーマン計量(より正確にはフィッシャー・ラオ計量)を提供し、 相転移 の分類のための情報幾何学的複雑さの尺度として使用できます。たとえば、熱力学的計量テンソルのスカラー曲率は相転移点で(そして相転移点でのみ)発散します。 [27]
熱力学の文脈では、フィッシャー情報行列は対応する秩序パラメータ の変化率に直接関係している 。 [28] 特に、このような関係はフィッシャー情報行列の個々の要素の発散を介して2次相転移を識別する。
等周不等式
フィッシャー情報行列は、等周不等式 のような不等式で役割を果たします 。 [29] 与えられたエントロピーを持つすべての確率分布の中で、フィッシャー情報行列のトレースが最も小さいのはガウス分布です。これは、与えられた体積を持つすべての有界集合の中で、球の表面積が最小であるのと同じです。
証明には、 密度関数を持つ多変量ランダム変数を取り 、位置パラメータを追加して密度族を形成することが含まれる。次に、 ミンコフスキー-シュタイナーの公式 からの類推により 、の「表面積」は 次のように定義される。
X
{\displaystyle X}
f
{\displaystyle f}
{
f
(
x
−
θ
)
∣
θ
∈
R
n
}
{\displaystyle \{f(x-\theta )\mid \theta \in \mathbb {R} ^{n}\}}
X
{\displaystyle X}
S
(
X
)
=
lim
ε
→
0
e
H
(
X
+
Z
ε
)
−
e
H
(
X
)
ε
{\displaystyle S(X)=\lim _{\varepsilon \to 0}{\frac {e^{H(X+Z_{\varepsilon })}-e^{H(X)}}{\varepsilon }}}
ここで、 は 共分散行列 を持つガウス変数です 。エントロピー累乗は 「有効サポート セット」の体積であるため、「表面積」という名前が適切です。 [30] 有効サポート セットの体積の「導関数」も ミンコフスキー-シュタイナーの公式によく似ています。証明の残りの部分では、 ブルン-ミンコフスキーの不等式 に似た エントロピー累乗不等式 を使用します。フィッシャー情報行列のトレースは の因数であることがわかっています 。
Z
ε
{\displaystyle Z_{\varepsilon }}
ε
I
{\displaystyle \varepsilon I}
e
H
(
X
)
{\displaystyle e^{H(X)}}
S
(
X
)
{\displaystyle S(X)}
S
(
X
)
{\displaystyle S(X)}
アプリケーション
実験の最適設計
フィッシャー情報は、最適な実験設計 で広く使用されています 。推定値分散とフィッシャー情報量の相互性により、 分散 を 最小化すること は情報 の 最大化 に対応します 。
線形 (または 線形化 ) 統計モデルに 複数の パラメータ がある場合 、 パラメータ推定値の 平均は ベクトル で、その 分散は 行列 です 。分散行列の逆は「情報行列」と呼ばれます。パラメータベクトルの推定値の分散は行列であるため、「分散を最小化する」問題は複雑です。 統計理論を使用して、統計学者は実数値の 要約統計量 を使用して情報行列を圧縮します 。実数値関数であるため、これらの「情報基準」を最大化できます。
従来、統計学者は、 共分散行列(不偏推定量の)の 要約統計量(通常は正の実数値( 行列式 または 行列トレース など))を考慮して推定量と設計を評価してきました。正の実数を使用すると、いくつかの利点があります。単一のパラメータの推定量が正の分散を持つ場合、分散とフィッシャー情報は両方とも正の実数です。したがって、これらは非負の実数の凸錐のメンバーです(非ゼロのメンバーは同じ錐内に逆数を持ちます)。
いくつかのパラメータについて、共分散行列と情報行列は、 ローナー (Löwner)順序のもとで、 半順序 ベクトル空間における 非負定値 対称行列の凸錐の要素である 。この錐は、行列の加算と反転、および正の実数と行列の乗算に対して閉じている。行列理論とローナー順序の説明は、Pukelsheimに掲載されている。 [31]
従来の最適性基準は、不変理論 の意味での、情報行列の不変量です 。代数的には、従来の最適性基準は、 (フィッシャー)情報行列の 固有値 の 関数です( 最適設計を 参照)。
ベイズ統計におけるジェフリーズ事前分布
ベイズ統計学 では 、フィッシャー情報量は 連続分布パラメータの標準的な非情報事前分布である ジェフリーズ事前分布を計算するために使用されます。 [32]
計算神経科学
フィッシャー情報は、 神経コード の精度の限界を見つけるために使用されてきた。その場合、 Xは 通常、低次元変数 θ ( 刺激 パラメータなど )を表す多くのニューロンの共同応答である。特に、神経応答のノイズにおける相関の役割が研究されてきた。 [33]
疫学
フィッシャー情報量は、SARS-CoV-2の 再生産数 を推定する上で、さまざまなデータソースがどの程度有益であるかを研究するために使用されました。 [34]
物理法則の導出
フィッシャー情報は、フリーデン が物理法則の基礎として提唱した物議を醸す原理において中心的な役割を果たしているが 、この主張は論争の的となっている。 [35]
機械学習
フィッシャー情報は、 弾性重み統合 [36] などの機械学習技術で使用され、 人工ニューラルネットワーク における 壊滅的な忘却を 軽減します 。
フィッシャー情報は、2次勾配降下法ネットワークのトレーニングにおける損失関数のヘッセ行列の代替として使用することができます。 [37]
色彩識別
ダ・フォンセカら [38]は、 フィッシャー情報量 を用いて、 網膜光受容体の
応答関数から マカダム楕円 (色識別楕円)をどの程度 導出できるかを調査した。
相対エントロピーとの関係
フィッシャー情報量は相対エントロピー と関係がある 。 [39] 2つの分布と間の 相対エントロピー、または カルバック ・ライブラー情報量 は次のように表される。
p
{\displaystyle p}
q
{\displaystyle q}
K
L
(
p
:
q
)
=
∫
p
(
x
)
log
p
(
x
)
q
(
x
)
d
x
.
{\displaystyle KL(p:q)=\int p(x)\log {\frac {p(x)}{q(x)}}\,dx.}
ここで、によってパラメータ化された 確率分布の族を考えてみましょう 。 族内の2つの分布間の
カルバック・ライブラー距離 は次のように表すことができます。
f
(
x
;
θ
)
{\displaystyle f(x;\theta )}
θ
∈
Θ
{\displaystyle \theta \in \Theta }
D
(
θ
,
θ
′
)
=
K
L
(
p
(
⋅
;
θ
)
:
p
(
⋅
;
θ
′
)
)
=
∫
f
(
x
;
θ
)
log
f
(
x
;
θ
)
f
(
x
;
θ
′
)
d
x
.
{\displaystyle D(\theta ,\theta ')=KL(p({}\cdot {};\theta ):p({}\cdot {};\theta '))=\int f(x;\theta )\log {\frac {f(x;\theta )}{f(x;\theta ')}}\,dx.}
が固定されている場合 、同じ族の 2 つの分布間の相対エントロピーは で最小になります 。 に近い場合 、前の式を 2 次までの級数に展開できます。
θ
{\displaystyle \theta }
θ
′
=
θ
{\displaystyle \theta '=\theta }
θ
′
{\displaystyle \theta '}
θ
{\displaystyle \theta }
D
(
θ
,
θ
′
)
=
1
2
(
θ
′
−
θ
)
T
(
∂
2
∂
θ
i
′
∂
θ
j
′
D
(
θ
,
θ
′
)
)
θ
′
=
θ
(
θ
′
−
θ
)
+
o
(
(
θ
′
−
θ
)
2
)
{\displaystyle D(\theta ,\theta ')={\frac {1}{2}}(\theta '-\theta )^{\textsf {T}}\left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}D(\theta ,\theta ')\right)_{\theta '=\theta }(\theta '-\theta )+o\left((\theta '-\theta )^{2}\right)}
しかし、2階微分は次のように書ける。
(
∂
2
∂
θ
i
′
∂
θ
j
′
D
(
θ
,
θ
′
)
)
θ
′
=
θ
=
−
∫
f
(
x
;
θ
)
(
∂
2
∂
θ
i
′
∂
θ
j
′
log
(
f
(
x
;
θ
′
)
)
)
θ
′
=
θ
d
x
=
[
I
(
θ
)
]
i
,
j
.
{\displaystyle \left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}D(\theta ,\theta ')\right)_{\theta '=\theta }=-\int f(x;\theta )\left({\frac {\partial ^{2}}{\partial \theta '_{i}\,\partial \theta '_{j}}}\log(f(x;\theta '))\right)_{\theta '=\theta }\,dx=[{\mathcal {I}}(\theta )]_{i,j}.}
したがって、フィッシャー情報量は、条件付き分布の相対エントロピーの 曲率を そのパラメータに関して表します。
歴史
フィッシャー情報は、初期の統計学者、特に F.Y.エッジワース によって議論された。 例えば、サベージ 次のように述べている。「[フィッシャー情報]において、彼[フィッシャー]はある程度先取りされていた(エッジワース1908–9、特に502、507–8、662、677–8、82–5、および彼[エッジワース]が引用するピアソンとフィロン1898 [...]を含む参考文献)。」初期の歴史的資料は数多くあり 、この初期の研究に関するレビューも数多くある。
参照
情報理論 で用いられる他の尺度 :
注記
^ ロバート、クリスチャン (2007)。「非情報事前分布」。 ベイズ選択 (第 2 版)。シュプリンガー。pp. 127–141。ISBN 978-0-387-71598-8 。
^ ル・カム、ルシアン (1986)。統計的意思決定理論 における 漸近的手法 。ニューヨーク:シュプリンガー。pp.618-621。ISBN 0-387-96307-3 。
^ Kass, Robert E.; Tierney, Luke; Kadane, Joseph B. (1990)。「ラプラス法に基づく事後展開の妥当性」。Geisser, S.、Hodges, JS、Press, SJ、Zellner, A. (編)。 統計と計量経済学におけるベイズ法と尤度法 。Elsevier。pp. 473–488。ISBN 0-444-88376-2 。
^ Suba Rao. 「統計的推論に関する講義」 (PDF) 。 2020年9月26日時点の オリジナル (PDF)からアーカイブ。 2013年4月12日 閲覧 。
^ マーク J シャービッシュ (1995)。統計理論。ニューヨーク州ニューヨーク: スプリンガー ニューヨーク。 p. 111.ISBN 978-1-4612-4250-5 . OCLC 852790658.
^ Nielsen, Frank (2023). 「多変量正規分布間のフィッシャー・ラオ距離の簡単な近似法」. エントロピー . 25 (4): 654. arXiv : 2302.08175 . Bibcode :2023Entrp..25..654N. doi : 10.3390/e25040654 . PMC 10137715. PMID 37190442 .
^ ニールセン、フランク (2013)。「クラメール・ラオ下限と情報幾何学」。Connected at Infinity II 。数学テキストと読書。第 67 巻。pp. 18–37。arXiv : 1301.3578。doi : 10.1007 / 978-93-86279-56-9_2。ISBN 978-93-80250-51-9 . S2CID 16759683。
^ Spall, JC (2005). 「非標準設定 で のフィッシャー情報行列のモンテカルロ計算」。 計算およびグラフィカル統計ジャーナル 。14 ( 4): 889–909。doi : 10.1198 /106186005X78800。S2CID 16090098。
^ Spall, JC (2008)、「フィッシャー情報行列のモンテカルロ推定の改良法」、 アメリカ制御会議議事録 、ワシントン州シアトル、2008 年 6 月 11 ~ 13 日、pp. 2395 ~ 2400。https://doi.org/10.1109/ACC.2008.4586850
^ Das, S.; Spall, JC; Ghanem, R. (2010). 「事前情報を用いたフィッシャー情報行列の効率的なモンテカルロ計算」. 計算統計とデータ分析 . 54 (2): 272–289. doi :10.1016/j.csda.2009.09.018.
^ Barndorff-Nielsen, OE; Cox, DR (1994). 推論と漸近論 . Chapman & Hall. ISBN 9780412494406 。
^ Cox, DR; Reid, N. (1987). 「パラメータ直交性と近似条件付き推論(考察付き)」. J. Royal Statistical Soc. B. 49 : 1–39. doi :10.1111/j.2517-6161.1987.tb01422.x.
^ 渡辺 誠 (2008)、Accardi, L.、Freudenberg, W.、Ohya, M. (編)、「特異統計推定における代数幾何学的手法」、 Quantum Bio-Informatics 、 World Scientific : 325–336、 Bibcode :2008qbi..conf..325W、 doi :10.1142/9789812793171_0024、 ISBN 978-981-279-316-4 。
^ 渡辺 誠 (2013). 「広く適用可能なベイズ情報量基準」. 機械学習研究ジャーナル . 14 : 867–897.
^ Malagò, Luigi; Pistone , Giovanni (2015). 「確率的最適化の観点から見たガウス分布の情報幾何学」。2015 ACM 遺伝的アルゴリズムの基礎に関する会議 XIII の議事録 。pp. 150–162。doi :10.1145/ 2725494.2725510。ISBN 9781450334341 . S2CID 693896。
^ Mardia, KV; Marshall, RJ (1984). 「空間回帰における残差共分散モデルの最大尤度推定」 Biometrika . 71 (1): 135–46. doi :10.1093/biomet/71.1.135.
^ Zamir, R. (1998). 「データ処理の議論によるフィッシャー情報不等式の証明」. IEEE Transactions on Information Theory . 44 (3): 1246–1250. CiteSeerX 10.1.1.49.6628 . doi :10.1109/18.669301.
^ Polyanskiy, Yury (2017). 「情報理論に関する講義ノート、第29章、ECE563 (UIUC)」 (PDF) 。 情報理論に関する講義ノート 。 2022年5月24日時点のオリジナルより アーカイブ (PDF) 。 2022年5月24日 閲覧 。
^ マーク J シャービッシュ (1995)。 統計理論 。スプリンガー・フェルラーク。 p. 113.
^ Janke, W.; Johnston, DA; Kenna, R. (2004). 「情報幾何学と相転移」. Physica A. 336 ( 1–2): 181. arXiv : cond-mat/0401092 . Bibcode :2004PhyA..336..181J. doi :10.1016/j.physa.2004.01.023. S2CID 119085942.
^ Prokopenko, M.; Lizier, Joseph T.; Lizier, JT; Obst, O.; Wang, XR (2011). 「フィッシャー情報と秩序パラメータの関係」. Physical Review E. 84 ( 4): 041116. Bibcode :2011PhRvE..84d1116P. doi :10.1103/PhysRevE.84.041116. PMID 22181096. S2CID 18366894.
^ Costa, M.; Cover, T. (1984年11月). 「エントロピーのべき乗不等式とブルン・ミンコフスキー不等式の類似性について」. IEEE Transactions on Information Theory . 30 (6): 837–839. doi :10.1109/TIT.1984.1056983. ISSN 1557-9654.
^ Cover, Thomas M. (2006). 情報理論の要素。Joy A. Thomas (第2版)。ホーボーケン、ニュージャージー州: Wiley-Interscience。p. 256。ISBN 0-471-24195-4 . OCLC 59879802.
^ Pukelsheim, Friedrich (1993). 最適実験計画法 . ニューヨーク: Wiley. ISBN 978-0-471-61971-0 。
^ ベルナルド、ホセ・M.; スミス、エイドリアンFM (1994)。 ベイズ理論 。ニューヨーク:ジョン・ワイリー・アンド・サンズ 。ISBN 978-0-471-92416-6 。
^ Abbott, Larry F.; Dayan, Peter (1999). 「集団コードの精度に対する相関変動の影響」. Neural Computation . 11 (1): 91–101. doi :10.1162/089976699300016827. PMID 9950724. S2CID 2958438.
^ Parag, KV; Donnelly, CA; Zarebski, AE (2022). 「ノイズの多い流行曲線の情報の定量化」. Nature Computational Science . 2 (9): 584–594. doi : 10.1038/s43588-022-00313-1 . hdl : 10044/1/100205 . PMID 38177483. S2CID 248811793.
^ ストリーター、RF(2007年)。 物理学における失われた原因とそれ以降 。 シュプリンガー。p.69。ISBN 978-3-540-36581-5 。
^ カークパトリック、ジェームズ; パスカヌ、ラズバン; ラビノウィッツ、ニール; ヴェネス、ジョエル; デジャルダン、ギヨーム; ルス、アンドレイ A.; ミラン、キエラン; クアン、ジョン; ラマーリョ、ティアゴ (2017-03-28). 「ニューラルネットワークにおける破滅的な忘却の克服」。 米国 科学 アカデミー 紀要 。114 ( 13 ): 3521–3526。arXiv : 1612.00796。Bibcode : 2017PNAS..114.3521K。doi : 10.1073 / pnas.1611835114。ISSN 0027-8424。PMC 5380101。PMID 28292907 。
^ Martens, James (2020年8月). 「自然勾配法に関する新たな洞察と展望」. 機械学習研究ジャーナル (21). arXiv : 1412.1193 .
^ da Fonseca, Maria; Samengo, In´es (2016 年 12 月 1 日). 「色空間における距離の情報理論的概念からの人間の色彩識別能力の導出」. Neural Computation . 28 (12): 2628–2655. arXiv : 1611.07272 . doi :10.1162/NECO_a_00903. PMID 27764598.
^ Gourieroux & Montfort (1995)、87ページ
参考文献
Cramér, Harald (1946)。 統計の数学的方法 。プリンストン数学シリーズ。プリンストン:プリンストン大学出版局 。ISBN 0691080046 。
エッジ ワース、FY ( 1908年 6 月)。「周波数定数の誤差について」。 王立統計学会誌 。71 (2):381–397。doi :10.2307/2339461。JSTOR 2339461。
エッジ ワース、F.Y. ( 1908 年 9 月)。「周波数定数の誤差の可能性について (続)」。 王立統計学会誌 。71 (3): 499–512。doi :10.2307/2339293。JSTOR 2339293。
エッジ ワース、FY ( 1908 年 12 月)。「周波数定数の誤差の可能性について (続)」。 王立統計学会誌 。71 (4): 651–678。doi :10.2307/2339378。JSTOR 2339378。
フィッシャー、RA (1922-01-01)。「理論統計の 数学 的基礎について」。 ロンドン王立協会哲学論文集、シリーズA。222 ( 594–604 ):309–368。Bibcode :1922RSPTA.222..309F。doi : 10.1098 / rsta.1922.0009。hdl : 2440/15172 。
フリーデン、BR (2004)。 フィッシャー情報からの科学:統一 。ケンブリッジ大学出版局 。ISBN 0-521-00911-1 。
Frieden, B. Roy; Gatenby, Robert A. (2013). 「統計システムに適用されたハーディの公理からの最大フィッシャー情報量の原理」. Physical Review E. 88 ( 4): 042144. arXiv : 1405.0007 . Bibcode : 2013PhRvE..88d2144F. doi :10.1103/PhysRevE.88.042144. PMC 4010149. PMID 24229152.
Hald, A. (1999 年5 月)。「逆確率と 最小 二乗法との関係における最大尤度の歴史について」。 統計科学 。14 (2): 214–222。doi : 10.1214/ss/1009212248。JSTOR 2676741 。
Hald, A. (1998). 1750年から1930年までの数理統計学の歴史 。ニューヨーク: Wiley。ISBN 978-0-471-17912-2 。
Lehmann, EL ; Casella, G. (1998). 点推定の理論 (第2版) 。Springer。ISBN 978-0-387-98502-2 。
ル・カム、ルシアン (1986)。 統計的意思決定理論における漸近的手法 。シュプリンガー・フェアラーク 。ISBN 978-0-387-96307-5 。
Pratt, John W. (1976年5 月)。「FY Edgeworth とRA Fisher による最大尤 度 推定の効率性」。Annals of Statistics。4 ( 3): 501–514。doi : 10.1214/aos/1176343457。JSTOR 2958222 。
ラオ、C. ラダクリシュナ (1945)。「統計パラメータの推定で得られる情報と精度」。 統計のブレークスルー 。シュプリンガー統計シリーズ。第 37 巻。pp. 81–91。doi : 10.1007 / 978-1-4612-0919-5_16。ISBN 978-0-387-94037-3 . S2CID 117034671。
サベージ、LJ (1976年5 月)。「 RA フィッシャーの再読について」 。Annals of Statistics。4 (3):441–500。doi : 10.1214 /aos/1176343456。JSTOR 2958221 。
シャービッシュ、マーク J. (1995)。 統計理論 。ニューヨーク:スプリンガー。 ISBN 978-0-387-94546-0 。
スティグラー、SM (1986年)。 統計の歴史:1900年以前の不確実性の測定 。ハーバード大学出版局 。ISBN 978-0-674-40340-6 。 [ ページが必要 ]
スティグラー、SM ( 1978)。 「フランシス・イシドロ・エッジワース、統計学者」 。 王立 統計 学会誌、シリーズA。141 ( 3): 287–322。doi :10.2307/2344804。JSTOR 2344804。
スティグラー、SM (1999)。 表の統計:統計概念と方法の歴史 。ハーバード大学出版局 。ISBN 978-0-674-83601-3 。 [ ページが必要 ]
Van Trees, HL (1968)。 検出、推定、変調理論、パート I。 ニューヨーク: Wiley。ISBN 978-0-471-09517-0 。