統計的性質
統計学 では 、 推定量のバイアス (または バイアス関数) は、この 推定量 の 期待値 と 推定されるパラメータの 真の値 との差です。バイアスがゼロの推定量または決定ルールは 、偏りのない と 呼ばれます。統計学では、「バイアス」は推定量の 客観的な特性です。バイアスは 一貫性 とは異なる概念です。一貫性のある推定量は、確率的にパラメータの真の値に収束しますが、偏りがある場合も偏りがない場合もあります (詳細については、 バイアスと一貫性を 参照してください )。
他の条件がすべて同じであれば、不偏推定量の方が偏りのある推定量よりも望ましいですが、実際には、偏りのある推定量 (一般にバイアスが小さい) が頻繁に使用されます。偏りのある推定量を使用する場合、バイアスの境界が計算されます。偏りのある推定量は、さまざまな理由で使用されることがあります。不偏推定量は、母集団についてのさらなる仮定なしには存在しないため、推定量の計算が困難であるため ( 標準偏差の不偏推定など)、偏りのある推定量は、 中心傾向 のさまざまな尺度に関して不偏である可能性があるため 、偏りのある推定量は、 不偏推定量と比較して、いくつかの 損失関数 (特に 平均二乗誤差) の値が低くなるため (特に 収縮推定量 の場合)、または、場合によっては不偏であることが条件として強すぎるため、不偏推定量だけでは役に立たないためです。
バイアスは、平均(期待値)ではなく、中央値 を基準にして測定することもできます 。その場合、 中央 値不偏性と通常の 平均 不偏性特性を区別します。平均不偏性は非線形 変換 では保持されませんが、中央値不偏性は保持されます(§ 変換の影響を参照)。たとえば、 標本分散は 母分散のバイアスのある推定値です。これらはすべて以下に示されています。
パラメータの不偏推定量は必ずしも存在する必要はない。例えば、二項確率変数のパラメータの逆数には不偏推定量は存在しない。 [1]
意味
実数 θでパラメータ化された 統計モデル があり 、観測データの確率分布 と、 任意の観測データに基づく θ の 推定値 として機能する統計量 がある とします。つまり、データが何らかの未知の分布 ( θ はこの分布の一部である固定された未知の定数)に従うと仮定し、観測データを θ に近いと思われる値にマッピングする推定値を構築します 。 に対する の バイアス は次のように定義されます [2]
ポ
θ
(
x
)
=
ポ
(
x
∣
θ
)
{\displaystyle P_{\theta }(x)=P(x\mid \theta )}
θ
^
{\displaystyle {\hat {\theta }}}
x
{\displaystyle x}
ポ
(
x
∣
θ
)
{\displaystyle P(x\mid \theta )}
θ
^
{\displaystyle {\hat {\theta }}}
θ
^
{\displaystyle {\hat {\theta }}}
θ
{\displaystyle \theta}
バイアス
(
θ
^
、
θ
)
=
バイアス
θ
[
θ
^
]
=
え
x
∣
θ
[
θ
^
]
−
θ
=
え
x
∣
θ
[
θ
^
−
θ
]
、
{\displaystyle \operatorname {バイアス} ({\hat {\theta }},\theta )=\operatorname {バイアス} _{\theta }[\,{\hat {\theta }}\,]=\operatorname {E} _{x\mid \theta }[\,{\hat {\theta }}\,]-\theta =\operatorname {E} _{x\mid \theta }[\,{\hat {\theta }}-\theta \,],}
ここで、 は 分布 上の 期待値 (つまり、すべての可能な観測値 の平均) を表します。 θ は 条件付き分布 に関して測定可能である ため、2番目の式が続きます 。
え
x
∣
θ
{\displaystyle \operatorname {E} _{x\mid \theta}}
ポ
(
x
∣
θ
)
{\displaystyle P(x\mid \theta )}
x
{\displaystyle x}
ポ
(
x
∣
θ
)
{\displaystyle P(x\mid \theta )}
推定量は、パラメータ θ のすべての値に対してバイアスがゼロに等しい場合 、または同等に、推定量の期待値がパラメータの期待値と一致する場合、 不偏であると言われます。 [3] 不偏性は継承される保証はありません。たとえば、がパラメータ θ に対して不偏推定量である場合、g( ) が g( θ ) に対して不偏推定量である ことは保証されません。 [4]
θ
^
{\displaystyle {\hat {\theta }}}
θ
^
{\displaystyle {\hat {\theta }}}
推定量の特性に関するシミュレーション実験では、 平均符号付き差 を使用して推定量のバイアスを評価することができます。
例
サンプル分散
ランダム変数の標本 分散は 、推定値のバイアスの 2 つの側面を示しています。まず、単純な推定値にはバイアスがありますが、これはスケール係数で修正できます。次に、不偏推定値は 平均二乗誤差 (MSE) の点で最適ではありませんが、異なるスケール係数を使用することで最小化でき、結果として不偏推定値よりも MSE が低いバイアス推定値になります。具体的には、単純な推定値は二乗偏差を合計し、 バイアスのある nで割ります。代わりに n − 1 で割ると、不偏推定値になります。逆に、MSE は別の数 (分布によって異なります) で割ることで最小化できますが、その結果バイアスのある推定値になります。この数は常に n − 1 より大きいため、これは不偏推定値をゼロに向かって「縮小」するため、 収縮推定値 と呼ばれます。正規分布の場合、最適値は n + 1 です。
X 1 , ..., X n が 、期待値 μ と 分散 σ 2 を持つ 独立かつ同一分布 (iid) の確率変数で あると する 。 標本平均 と補正されていない 標本分散 が次のように定義される
場合、
バツ
¯
=
1
ん
∑
私
=
1
ん
バツ
私
S
2
=
1
ん
∑
私
=
1
ん
(
バツ
私
−
バツ
¯
)
2
{\displaystyle {\overline {X}}\,={\frac {1}{n}}\sum _{i=1}^{n}X_{i}\qquad S^{2}={\frac {1}{n}}\sum _{i=1}^{n}{\big (}X_{i}-{\overline {X}}\,{\big )}^{2}\qquad }
すると、 S 2 は σ 2 の偏った推定値となる 。なぜなら、
え
[
S
2
]
=
え
[
1
ん
∑
私
=
1
ん
(
バツ
私
−
バツ
¯
)
2
]
=
え
[
1
ん
∑
私
=
1
ん
(
(
バツ
私
−
μ
)
−
(
バツ
¯
−
μ
)
)
2
]
=
え
[
1
ん
∑
私
=
1
ん
(
(
バツ
私
−
μ
)
2
−
2
(
バツ
¯
−
μ
)
(
バツ
私
−
μ
)
+
(
バツ
¯
−
μ
)
2
)
]
=
え
[
1
ん
∑
私
=
1
ん
(
バツ
私
−
μ
)
2
−
2
ん
(
バツ
¯
−
μ
)
∑
私
=
1
ん
(
バツ
私
−
μ
)
+
1
ん
(
バツ
¯
−
μ
)
2
∑
私
=
1
ん
1
]
=
え
[
1
ん
∑
私
=
1
ん
(
バツ
私
−
μ
)
2
−
2
ん
(
バツ
¯
−
μ
)
∑
私
=
1
ん
(
バツ
私
−
μ
)
+
1
ん
(
バツ
¯
−
μ
)
2
⋅
ん
]
=
え
[
1
ん
∑
私
=
1
ん
(
バツ
私
−
μ
)
2
−
2
ん
(
バツ
¯
−
μ
)
∑
私
=
1
ん
(
バツ
私
−
μ
)
+
(
バツ
¯
−
μ
)
2
]
{\displaystyle {\begin{aligned}\operatorname {E} [S^{2}]&=\operatorname {E} \left[{\frac {1}{n}}\sum _{i=1}^{n}{\big (}X_{i}-{\overline {X}}{\big )}^{2}\right]=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}{\bigg (}(X_{i}-\mu )-({\overline {X}}-\mu ){\bigg )}^{2}{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}{\bigg (}(X_{i}-\mu )^{2}-2({\overline {X}}-\mu )(X_{i}-\mu )+({\overline {X}}-\mu )^{2}{\bigg )}{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}-{\frac {2}{n}}({\overline {X}}-\mu )\sum _{i=1}^{n}(X_{i}-\mu )+{\frac {1}{n}}({\overline {X}}-\mu )^{2}\sum _{i=1}^{n}1{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}-{\frac {2}{n}}({\overline {X}}-\mu )\sum _{i=1}^{n}(X_{i}-\mu )+{\frac {1}{n}}({\overline {X}}-\mu )^{2}\cdot n{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}-{\frac {2}{n}}({\overline {X}}-\mu )\sum _{i=1}^{n}(X_{i}-\mu )+({\overline {X}}-\mu )^{2}{\bigg ]}\\[8pt]\end{aligned}}}
続けて、の両辺から を 引くと 、
μ
{\displaystyle \mu}
バツ
¯
=
1
ん
∑
私
=
1
ん
バツ
私
{\displaystyle {\overline {X}}={\frac {1}{n}}\sum _{i=1}^{n}X_{i}}
X
¯
−
μ
=
1
n
∑
i
=
1
n
X
i
−
μ
=
1
n
∑
i
=
1
n
X
i
−
1
n
∑
i
=
1
n
μ
=
1
n
∑
i
=
1
n
(
X
i
−
μ
)
.
{\displaystyle {\begin{aligned}{\overline {X}}-\mu ={\frac {1}{n}}\sum _{i=1}^{n}X_{i}-\mu ={\frac {1}{n}}\sum _{i=1}^{n}X_{i}-{\frac {1}{n}}\sum _{i=1}^{n}\mu \ ={\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu ).\\[8pt]\end{aligned}}}
つまり、(クロス乗算によって) 。すると、前の式は次のようになります。
n
⋅
(
X
¯
−
μ
)
=
∑
i
=
1
n
(
X
i
−
μ
)
{\displaystyle n\cdot ({\overline {X}}-\mu )=\sum _{i=1}^{n}(X_{i}-\mu )}
E
[
S
2
]
=
E
[
1
n
∑
i
=
1
n
(
X
i
−
μ
)
2
−
2
n
(
X
¯
−
μ
)
∑
i
=
1
n
(
X
i
−
μ
)
+
(
X
¯
−
μ
)
2
]
=
E
[
1
n
∑
i
=
1
n
(
X
i
−
μ
)
2
−
2
n
(
X
¯
−
μ
)
⋅
n
⋅
(
X
¯
−
μ
)
+
(
X
¯
−
μ
)
2
]
=
E
[
1
n
∑
i
=
1
n
(
X
i
−
μ
)
2
−
2
(
X
¯
−
μ
)
2
+
(
X
¯
−
μ
)
2
]
=
E
[
1
n
∑
i
=
1
n
(
X
i
−
μ
)
2
−
(
X
¯
−
μ
)
2
]
=
E
[
1
n
∑
i
=
1
n
(
X
i
−
μ
)
2
]
−
E
[
(
X
¯
−
μ
)
2
]
=
σ
2
−
E
[
(
X
¯
−
μ
)
2
]
=
(
1
−
1
n
)
σ
2
<
σ
2
.
{\displaystyle {\begin{aligned}\operatorname {E} [S^{2}]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}-{\frac {2}{n}}({\overline {X}}-\mu )\sum _{i=1}^{n}(X_{i}-\mu )+({\overline {X}}-\mu )^{2}{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}-{\frac {2}{n}}({\overline {X}}-\mu )\cdot n\cdot ({\overline {X}}-\mu )+({\overline {X}}-\mu )^{2}{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}-2({\overline {X}}-\mu )^{2}+({\overline {X}}-\mu )^{2}{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}-({\overline {X}}-\mu )^{2}{\bigg ]}\\[8pt]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}{\bigg ]}-\operatorname {E} {\bigg [}({\overline {X}}-\mu )^{2}{\bigg ]}\\[8pt]&=\sigma ^{2}-\operatorname {E} {\bigg [}({\overline {X}}-\mu )^{2}{\bigg ]}=\left(1-{\frac {1}{n}}\right)\sigma ^{2}<\sigma ^{2}.\end{aligned}}}
これは、上記の未補正標本分散の期待値に関する不等式の項について、 ビエネイメの公式 から導かれる次の公式に注目することでわかります 。
E
[
(
X
¯
−
μ
)
2
]
=
1
n
σ
2
{\displaystyle \operatorname {E} {\big [}({\overline {X}}-\mu )^{2}{\big ]}={\frac {1}{n}}\sigma ^{2}}
言い換えれば、補正されていない標本分散の期待値は、正規化係数を乗じない限り、母集団分散σ 2 と等しくならない 。一方、標本平均は、 母集団平均 μの不偏推定値である [5] 。 [3]
標本分散の通常の定義は であり 、これは母分散の不偏推定値であることに注意してください。
S
2
=
1
n
−
1
∑
i
=
1
n
(
X
i
−
X
¯
)
2
{\displaystyle S^{2}={\frac {1}{n-1}}\sum _{i=1}^{n}(X_{i}-{\overline {X}}\,)^{2}}
代数的に言えば、 次の理由により偏りがありません。
E
[
S
2
]
{\displaystyle \operatorname {E} [S^{2}]}
E
[
S
2
]
=
E
[
1
n
−
1
∑
i
=
1
n
(
X
i
−
X
¯
)
2
]
=
n
n
−
1
E
[
1
n
∑
i
=
1
n
(
X
i
−
X
¯
)
2
]
=
n
n
−
1
(
1
−
1
n
)
σ
2
=
σ
2
,
{\displaystyle {\begin{aligned}\operatorname {E} [S^{2}]&=\operatorname {E} \left[{\frac {1}{n-1}}\sum _{i=1}^{n}{\big (}X_{i}-{\overline {X}}{\big )}^{2}\right]={\frac {n}{n-1}}\operatorname {E} \left[{\frac {1}{n}}\sum _{i=1}^{n}{\big (}X_{i}-{\overline {X}}{\big )}^{2}\right]\\[8pt]&={\frac {n}{n-1}}\left(1-{\frac {1}{n}}\right)\sigma ^{2}=\sigma ^{2},\\[8pt]\end{aligned}}}
ここで、2 行目への移行では、上で導出されたバイアス推定値の結果が使用されます。したがって 、 、および は、母分散 σ 2 の バイアスのない推定値です 。 分散のバイアスのある (補正されていない) 推定値とバイアスのない推定値の比率は、 ベッセル補正 として知られています。
E
[
S
2
]
=
σ
2
{\displaystyle \operatorname {E} [S^{2}]=\sigma ^{2}}
S
2
=
1
n
−
1
∑
i
=
1
n
(
X
i
−
X
¯
)
2
{\displaystyle S^{2}={\frac {1}{n-1}}\sum _{i=1}^{n}(X_{i}-{\overline {X}}\,)^{2}}
補正されていない標本分散S 2 が偏っている理由は 、標本平均が μの 通常の最小二乗法 (OLS) 推定値であるという事実に由来します 。μは、 合計を可能な限り小さくする数値です 。つまり、この合計に他の数値を代入すると、合計は増加するだけです。特に、選択 により、
X
¯
{\displaystyle {\overline {X}}}
∑
i
=
1
n
(
X
i
−
X
¯
)
2
{\displaystyle \sum _{i=1}^{n}(X_{i}-{\overline {X}})^{2}}
μ
≠
X
¯
{\displaystyle \mu \neq {\overline {X}}}
1
n
∑
i
=
1
n
(
X
i
−
X
¯
)
2
<
1
n
∑
i
=
1
n
(
X
i
−
μ
)
2
,
{\displaystyle {\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-{\overline {X}})^{2}<{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2},}
その後
E
[
S
2
]
=
E
[
1
n
∑
i
=
1
n
(
X
i
−
X
¯
)
2
]
<
E
[
1
n
∑
i
=
1
n
(
X
i
−
μ
)
2
]
=
σ
2
.
{\displaystyle {\begin{aligned}\operatorname {E} [S^{2}]&=\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-{\overline {X}})^{2}{\bigg ]}<\operatorname {E} {\bigg [}{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-\mu )^{2}{\bigg ]}=\sigma ^{2}.\end{aligned}}}
上記の議論は、幾何学的な用語で理解することができます。ベクトルは、 の方向 とその方向の直交補超平面に投影することによって、「平均部分」と「分散部分」に分解できます。 に沿った部分は 、 補部分については となります。これは直交分解であるため、ピタゴラスの定理によれば となり 、期待値を取ると 、上記のように が得られます (ただし を掛けます)。 がガウス分布からサンプリングされる 場合のように 、 の分布が回転対称である場合、平均して、 に沿った次元は に垂直な方向 と等しく に寄与するため 、 および となります 。これは、上で説明したように、一般には実際に当てはまります。
C
→
=
(
X
1
−
μ
,
…
,
X
n
−
μ
)
{\displaystyle {\vec {C}}=(X_{1}-\mu ,\ldots ,X_{n}-\mu )}
u
→
=
(
1
,
…
,
1
)
{\displaystyle {\vec {u}}=(1,\ldots ,1)}
A
→
=
(
X
¯
−
μ
,
…
,
X
¯
−
μ
)
{\displaystyle {\vec {A}}=({\overline {X}}-\mu ,\ldots ,{\overline {X}}-\mu )}
u
→
{\displaystyle {\vec {u}}}
B
→
=
(
X
1
−
X
¯
,
…
,
X
n
−
X
¯
)
{\displaystyle {\vec {B}}=(X_{1}-{\overline {X}},\ldots ,X_{n}-{\overline {X}})}
|
C
→
|
2
=
|
A
→
|
2
+
|
B
→
|
2
{\displaystyle |{\vec {C}}|^{2}=|{\vec {A}}|^{2}+|{\vec {B}}|^{2}}
n
σ
2
=
n
E
[
(
X
¯
−
μ
)
2
]
+
n
E
[
S
2
]
{\displaystyle n\sigma ^{2}=n\operatorname {E} \left[({\overline {X}}-\mu )^{2}\right]+n\operatorname {E} [S^{2}]}
n
{\displaystyle n}
C
→
{\displaystyle {\vec {C}}}
X
i
{\displaystyle X_{i}}
u
→
{\displaystyle {\vec {u}}}
|
C
→
|
2
{\displaystyle |{\vec {C}}|^{2}}
n
−
1
{\displaystyle n-1}
u
→
{\displaystyle {\vec {u}}}
E
[
(
X
¯
−
μ
)
2
]
=
σ
2
n
{\displaystyle \operatorname {E} \left[({\overline {X}}-\mu )^{2}\right]={\frac {\sigma ^{2}}{n}}}
E
[
S
2
]
=
(
n
−
1
)
σ
2
n
{\displaystyle \operatorname {E} [S^{2}]={\frac {(n-1)\sigma ^{2}}{n}}}
ポアソン確率の推定
偏りのある推定値が偏りのない推定値よりも優れているという、より極端な例は ポアソン分布 から生じる。 [6] [7] Xが期待値 λ のポアソン分布 に従うと
仮定する。
P
(
X
=
0
)
2
=
e
−
2
λ
{\displaystyle \operatorname {P} (X=0)^{2}=e^{-2\lambda }\quad }
サンプルサイズは 1 です。(たとえば、電話交換機への着信がポアソン過程としてモデル化され、 λ が 1 分あたりの平均着信数である場合、 e −2 λ は 次の 2 分間に着信がない確率です。)
不偏推定量の期待値 δ ( X )は 推定量 に等しいので 、すなわち
E
(
δ
(
X
)
)
=
∑
x
=
0
∞
δ
(
x
)
λ
x
e
−
λ
x
!
=
e
−
2
λ
,
{\displaystyle \operatorname {E} (\delta (X))=\sum _{x=0}^{\infty }\delta (x){\frac {\lambda ^{x}e^{-\lambda }}{x!}}=e^{-2\lambda },}
不偏推定量を構成するデータの唯一の機能は
δ
(
x
)
=
(
−
1
)
x
.
{\displaystyle \delta (x)=(-1)^{x}.\,}
これを理解するには、上記の期待値の式から e − λ を 分解すると、残った合計 も e − λ のテイラー級数展開となり、 e − λ e − λ = e −2 λ となることに注意してください( 「指数関数の特性」を 参照)。
X の観測値 が 100 の場合、推定値は 1 になりますが、推定される量の真の値は 0 に近い可能性が非常に高く、これは反対の極端です。また、 X が 101 と観測された場合、推定値はさらに不合理になります。推定される量は正であるはずなのに、推定値は -1 になります。
(バイアス付き) 最大尤度推定量
e
−
2
X
{\displaystyle e^{-2{X}}\quad }
は、この不偏推定量よりもはるかに優れています。その値は常に正であるだけでなく、 平均二乗誤差が
e
−
4
λ
−
2
e
λ
(
1
/
e
2
−
3
)
+
e
λ
(
1
/
e
4
−
1
)
{\displaystyle e^{-4\lambda }-2e^{\lambda (1/e^{2}-3)}+e^{\lambda (1/e^{4}-1)}\,}
より小さい。不偏推定量のMSEと比較すると、
1
−
e
−
4
λ
.
{\displaystyle 1-e^{-4\lambda }.\,}
MSE は真の値 λ の関数です。最大尤度推定値のバイアスは次のようになります。
e
−
2
λ
−
e
λ
(
1
/
e
2
−
1
)
.
{\displaystyle e^{-2\lambda }-e^{\lambda (1/e^{2}-1)}.\,}
最尤推定量の偏りは、かなり大きくなる可能性があります。1から n までの番号が付けられた n 枚の チケットが箱に入れられ、そのうち 1 枚がランダムに選択されて値 Xが与えられる場合を考えてみましょう 。n が不明な場合、 n が与えられたときの X の 期待 値は ( n + 1)/2に過ぎない にもかかわらず、 n の最尤推定量は X になります 。n が少なくとも X であり、おそらくそれ以上である ことだけが確かです。この場合、自然な不偏推定量は 2 X − 1です 。
中央値 不偏推定量 の理論は1947年にジョージ・W・ブラウンによって復活した。 [8]
1 次元パラメータ θ の推定値は、固定された θ に対して推定値の分布の中央値が値 θ にある場合、中央値不偏であると言われます。つまり、推定値は過大評価する頻度と過小評価する頻度が同じです。この要件は、ほとんどの目的において、平均不偏の要件と同程度に達成されるようであり、1 対 1 の変換に対して不変であるという追加の特性があります。
中央値不偏推定量のさらなる特性は、レーマン、バーンバウム、ファンデルファート、ファンツァグルによって指摘されている。 [9]特に、中央値不偏推定量は、平均不偏推定量や 最大尤度 推定量が存在しない場合に存在します。これらは 1対1変換 に対して不変です 。
単調な尤度関数 を持つ確率分布 (例えば1パラメータ指数族)に対して、中央値不偏推定量を構築して、それらが最適であることを保証する方法がある(ある意味では、平均不偏推定量で考慮される最小分散特性に類似している)。 [10] [11] そのような手順の1つは、平均不偏推定量に対するラオ-ブラックウェル手順の類似物である。この手順は、平均不偏推定に対するラオ-ブラックウェル手順よりも小さい確率分布のクラスに有効であるが、より大きな損失関数のクラスに有効である。 [11]
他の損失関数に対するバイアス
任意の最小分散 平均 不偏推定量は、 ガウス [12] によって観察されたように、 二乗誤差 損失関数(平均不偏推定量の間で)に関して リスク ( 期待損失 )を最小化します。 [12] 最小 平均絶対偏差 中央値不偏推定量は、 ラプラス[12]によって観察されたように、 絶対 損失関数(中央値不偏推定量の間で) に関してリスクを最小化します 。 [ 13]その他の損失関数は、統計、特に ロバスト統計 で使用されます 。 [12] [14]
単変量パラメータの場合、中央値不偏推定量は 、順序を維持する(または順序を逆にする) 変換の下では中央値不偏のままです。変換を平均不偏推定量に適用した場合、結果は対応する母集団統計量の平均不偏推定量である必要はないことに注意してください。Jensen の不等式 により、変換としての 凸関数は 正のバイアスを、 凹関数は 負のバイアスを、混合凸関数は特定の関数と分布に応じていずれかの方向にバイアスを生じさせる可能性があります。つまり、非線形関数 f とパラメータ p の平均不偏推定量 U の場合、複合推定量 f ( U ) は f ( p )の平均不偏推定量である必要はありません 。たとえば、母 分散 の不偏推定量の 平方根は、母 標準 偏差の平均不偏推定量 では ありません。不偏 標本分散 の平方根 、つまり修正 標本標準偏差 は偏っています。偏りは推定量の標本分布と変換の両方に依存し、計算がかなり複雑になることがあります 。このケースについては、
標準偏差の不偏推定を参照してください。
バイアス、分散、平均二乗誤差
パラメータ β 0 の 2 つの代替推定値のサンプリング分布。 β 1 ^ は不偏ですが、偏りのある β 2 ^ より明らかに劣っています。 リッジ回帰は、 わずかな偏りを許容することで分散が大幅に減少し、全体的に推定値の信頼性が向上する可能性がある手法の一例です。
バイアスは推定値と基礎パラメータ間の平均 差を定量化するが 、有限サンプルに基づく推定値はサンプルのランダム性によりパラメータと異なることが予想される。バイアスを最小化する推定値は必ずしも平均二乗誤差を最小化するわけではない。両方のタイプの差を反映するために使用される1つの尺度は平均二乗誤差である 。 [ 2]
MSE
(
θ
^
)
=
E
[
(
θ
^
−
θ
)
2
]
.
{\displaystyle \operatorname {MSE} ({\hat {\theta }})=\operatorname {E} {\big [}({\hat {\theta }}-\theta )^{2}{\big ]}.}
これはバイアスの2乗と分散を加えたものに等しいことが示される: [2]
MSE
(
θ
^
)
=
(
E
[
θ
^
]
−
θ
)
2
+
E
[
(
θ
^
−
E
[
θ
^
]
)
2
]
=
(
Bias
(
θ
^
,
θ
)
)
2
+
Var
(
θ
^
)
{\displaystyle {\begin{aligned}\operatorname {MSE} ({\hat {\theta }})=&(\operatorname {E} [{\hat {\theta }}]-\theta )^{2}+\operatorname {E} [\,({\hat {\theta }}-\operatorname {E} [\,{\hat {\theta }}\,])^{2}\,]\\=&(\operatorname {Bias} ({\hat {\theta }},\theta ))^{2}+\operatorname {Var} ({\hat {\theta }})\end{aligned}}}
パラメータがベクトルの場合、同様の分解が適用される: [15]
MSE
(
θ
^
)
=
trace
(
Cov
(
θ
^
)
)
+
‖
Bias
(
θ
^
,
θ
)
‖
2
{\displaystyle \operatorname {MSE} ({\hat {\theta }})=\operatorname {trace} (\operatorname {Cov} ({\hat {\theta }}))+\left\Vert \operatorname {Bias} ({\hat {\theta }},\theta )\right\Vert ^{2}}
ここで、は 推定量の 共分散行列 のトレース(対角和)であり、 は 二乗 ベクトルノルム です。
trace
(
Cov
(
θ
^
)
)
{\displaystyle \operatorname {trace} (\operatorname {Cov} ({\hat {\theta }}))}
‖
Bias
(
θ
^
,
θ
)
‖
2
{\displaystyle \left\Vert \operatorname {Bias} ({\hat {\theta }},\theta )\right\Vert ^{2}}
例: 母分散の推定
例えば [16] の推定量が
T
2
=
c
∑
i
=
1
n
(
X
i
−
X
¯
)
2
=
c
n
S
2
{\displaystyle T^{2}=c\sum _{i=1}^{n}\left(X_{i}-{\overline {X}}\,\right)^{2}=cnS^{2}}
上と同様に母分散を求めますが、今回はMSEを最小化します。
MSE
=
E
[
(
T
2
−
σ
2
)
2
]
=
(
E
[
T
2
−
σ
2
]
)
2
+
Var
(
T
2
)
{\displaystyle {\begin{aligned}\operatorname {MSE} =&\operatorname {E} \left[(T^{2}-\sigma ^{2})^{2}\right]\\=&\left(\operatorname {E} \left[T^{2}-\sigma ^{2}\right]\right)^{2}+\operatorname {Var} (T^{2})\end{aligned}}}
変数 X 1 ... X nが 正規分布に従う場合、 nS 2 /σ 2は自由度 n − 1の カイ2乗分布 を持ち 、次のようになります。
E
[
n
S
2
]
=
(
n
−
1
)
σ
2
and
Var
(
n
S
2
)
=
2
(
n
−
1
)
σ
4
.
{\displaystyle \operatorname {E} [nS^{2}]=(n-1)\sigma ^{2}{\text{ and }}\operatorname {Var} (nS^{2})=2(n-1)\sigma ^{4}.}
など
MSE
=
(
c
(
n
−
1
)
−
1
)
2
σ
4
+
2
c
2
(
n
−
1
)
σ
4
{\displaystyle \operatorname {MSE} =(c(n-1)-1)^{2}\sigma ^{4}+2c^{2}(n-1)\sigma ^{4}}
少し代数的に計算すると、バイアスの二乗のみを最小化する c = 1/ ( n − 1) ではなく、この複合損失関数を最小化する c = 1/ ( n + 1) で ある こと が 確認 できます。
より一般的には、パラメータ値とは無関係に MSE を最小化する推定値が存在できるのは、制限されたクラスの問題の場合のみです。
しかし、バイアスと分散のトレードオフ があると認識されることは非常に一般的であり 、バイアスの小さな増加と分散の大きな減少がトレードオフされ、全体としてより望ましい推定値が得られます。
ベイジアンの見解
ベイズ主義者のほとんどは、推定値の偏り(少なくとも上記の正式な標本理論の意味で)についてはあまり関心がありません。たとえば、ゲルマンと共著者(1995)は次のように書いています。「ベイズの観点から見ると、偏りの原則は大規模なサンプルの限界では合理的ですが、それ以外の場合は誤解を招く可能性があります。」 [17]
基本的に、ベイズ的アプローチ と上記の標本理論アプローチ の違いは、標本理論アプローチではパラメータが固定されているとみなされ、データの予測標本分布に基づいて統計の確率分布が考慮される点です。一方、ベイズ的アプローチでは、既知で固定されているのは データであり、 ベイズの定理を 使用して確率分布を構築しようとするのは未知のパラメータです 。
p
(
θ
∣
D
,
I
)
∝
p
(
θ
∣
I
)
p
(
D
∣
θ
,
I
)
{\displaystyle p(\theta \mid D,I)\propto p(\theta \mid I)p(D\mid \theta ,I)}
ここで、2 番目の項、 つまり未知のパラメータ値 θ が与えられた場合のデータの 尤度は、取得されたデータとデータ生成プロセスのモデリングにのみ依存します。ただし、ベイズ計算には、最初の項、つまり θ の 事前確率も含まれます。これは、データが取り込まれる 前に 分析者が θ について知っている、または推測しているすべてのことを考慮に入れます 。この情報は、サンプリング理論アプローチではまったく役に立ちません。実際、この情報を含めようとすると、純粋にデータによって示されたものから「偏り」が生じるとみなされます。ベイズ計算に事前情報が含まれる限り、その結果がサンプリング理論の用語で「偏りのない」ものでなくなることは、本質的に避けられません。
しかし、ベイズ主義者が「無情報」な事前分布を採用しようとしたとしても、ベイズ的アプローチの結果はサンプリング理論アプローチとは異なる場合があります。
例えば、未知の平均を持つ正規分布の未知の母分散σ 2 の推定を再度考えてみましょう。ここでは、期待損失関数の
cを 最適化することが望まれます。
ExpectedLoss
=
E
[
(
c
n
S
2
−
σ
2
)
2
]
=
E
[
σ
4
(
c
n
S
2
σ
2
−
1
)
2
]
{\displaystyle \operatorname {ExpectedLoss} =\operatorname {E} \left[\left(cnS^{2}-\sigma ^{2}\right)^{2}\right]=\operatorname {E} \left[\sigma ^{4}\left(cn{\tfrac {S^{2}}{\sigma ^{2}}}-1\right)^{2}\right]}
この問題に対する非情報事前分布の標準的な選択は ジェフリーズ事前分布 であり、これは ln(σ 2 ) に対して再スケーリング不変の平坦事前分布を採用することと同等です 。
p
(
σ
2
)
∝
1
/
σ
2
{\displaystyle \scriptstyle {p(\sigma ^{2})\;\propto \;1/\sigma ^{2}}}
この事前分布を採用することによる1つの結果は、 S 2 / σ 2が 重要な量 のままであること です。つまり、 S 2 /σ 2 の確率分布は、 S 2またはσ 2 の値とは無関係に、 S 2 / σ 2 のみに依存します 。
p
(
S
2
σ
2
∣
S
2
)
=
p
(
S
2
σ
2
∣
σ
2
)
=
g
(
S
2
σ
2
)
{\displaystyle p\left({\tfrac {S^{2}}{\sigma ^{2}}}\mid S^{2}\right)=p\left({\tfrac {S^{2}}{\sigma ^{2}}}\mid \sigma ^{2}\right)=g\left({\tfrac {S^{2}}{\sigma ^{2}}}\right)}
しかし、
E
p
(
S
2
∣
σ
2
)
[
σ
4
(
c
n
S
2
σ
2
−
1
)
2
]
=
σ
4
E
p
(
S
2
∣
σ
2
)
[
(
c
n
S
2
σ
2
−
1
)
2
]
{\displaystyle \operatorname {E} _{p(S^{2}\mid \sigma ^{2})}\left[\sigma ^{4}\left(cn{\tfrac {S^{2}}{\sigma ^{2}}}-1\right)^{2}\right]=\sigma ^{4}\operatorname {E} _{p(S^{2}\mid \sigma ^{2})}\left[\left(cn{\tfrac {S^{2}}{\sigma ^{2}}}-1\right)^{2}\right]}
対照的に
E
p
(
σ
2
∣
S
2
)
[
σ
4
(
c
n
S
2
σ
2
−
1
)
2
]
≠
σ
4
E
p
(
σ
2
∣
S
2
)
[
(
c
n
S
2
σ
2
−
1
)
2
]
{\displaystyle \operatorname {E} _{p(\sigma ^{2}\mid S^{2})}\left[\sigma ^{4}\left(cn{\tfrac {S^{2}}{\sigma ^{2}}}-1\right)^{2}\right]\neq \sigma ^{4}\operatorname {E} _{p(\sigma ^{2}\mid S^{2})}\left[\left(cn{\tfrac {S^{2}}{\sigma ^{2}}}-1\right)^{2}\right]}
—ベイズの場合のように、 期待値が S 2 が与えられたσ 2ではなく S 2 が与えられた σ 2の確率分布にわたって取られると、 σ 4 を 定数として因数分解すること ができなくなります。この結果、サンプリング理論の計算と比較すると、ベイズ計算では σ 2 のより大きな値に重みが置かれ、この二乗損失関数の下では、 σ 2 の大きな値を過小評価する結果が、 σ 2 の小さな値を過大評価する結果よりも二乗損失の点でコストがかかるということが適切に考慮されます(サンプリング理論の計算では考慮されません ) 。
計算されたベイズ計算により、 事後確率分布 σ 2に対して自由度 n − 1の スケール逆カイ二乗分布 が得られます。期待損失は cnS 2 = <σ 2 > のときに最小化されます。これは c = 1/( n − 3)
のときに発生します。
したがって、情報価値のない事前分布であっても、ベイズ計算では、対応するサンプリング理論の計算と同じ期待損失最小化結果が得られない可能性があります。
参照
科学ポータル 数学ポータル
注記
^ 「二項分布の場合、$1/p$ に対して不偏推定量が存在しないのはなぜですか?」。 Mathematics Stack Exchange 。 2023年12月27日 閲覧 。
^ abc Kozdron, Michael (2016年3月). 「推定量の良さの評価: バイアス、平均二乗誤差、相対効率 (第3章)」 (PDF) . stat.math.uregina.ca . 2020年9月11日 閲覧 。
^ ab Taylor, Courtney (2019年1月13日). 「Unbiased and Biased Estimators」. ThoughtCo . 2020年9月12日 閲覧 。
^ デッキング、ミシェル編 (2005)。 確率と統計の現代的入門:なぜ、どのように理解するか 。シュプリンガー統計テキスト。ロンドン [ハイデルベルク]:シュプリンガー 。ISBN 978-1-85233-896-1 。
^ リチャード・アーノルド・ジョンソン、ディーン・W・ウィチャーン(2007年)。応用多変量統計分析。ピアソン・プレンティス・ホール 。ISBN 978-0-13-187715-3 . 2012年 8月10日 閲覧 。
^ Romano, JP; Siegel, AF (1986). 確率と統計における反例 モントレー 、カリフォルニア州、米国: Wadsworth & Brooks / Cole. p. 168.
^ Hardy, M. (2003年3月1日). 「啓発的な反例」. American Mathematical Monthly . 110 (3): 234– 238. arXiv : math/0206006 . doi :10.2307/3647938. ISSN 0002-9890. JSTOR 3647938.
^ ブラウン(1947年)、583ページ
^ リーマン、1951年。バーンバウム 1961;ファン・デル・ファールト 1961年。ファンザグル 1994
^ Pfanzagl, Johann (1979). 「迷惑パラメータが存在する場合の最適な中央値不偏推定量について」. 統計年報 . 7 (1): 187– 193. doi : 10.1214/aos/1176344563 .
^ ab Brown, LD; Cohen, Arthur; Strawderman, WE (1976). 「厳密な単調尤度比の完全クラス定理とその応用」. Ann. Statist . 4 (4): 712– 722. doi : 10.1214/aos/1176343543 .
^ abc Dodge, Yadolah 編 (1987)。L 1 ノルムと関連手法 に基づく統計データ分析 。1987 年 8 月 31 日から 9 月 4 日までヌーシャテルで開催された第 1 回国際会議の論文。アムステルダム: 北ホラント 。ISBN 0-444-70273-3 。
^ Jaynes, ET (2007). 確率論:科学の論理 。ケンブリッジ:ケンブリッジ大学出版局。p. 172。ISBN 978-0-521-59271-0 。
^ Klebanov, Lev B.; Rachev, Svetlozar T.; Fabozzi, Frank J. (2009). 「損失関数と不偏推定理論」。 統計におけるロバストモデルと非ロバストモデル 。ニューヨーク: Nova Scientific。ISBN 978-1-60741-768-2 。
^ Taboga, Marco (2010). 「確率論と数理統計の講義」
^ DeGroot, Morris H. (1986). 確率と統計 (第2版). Addison-Wesley. pp. 414–5. ISBN 0-201-11366-X 。 しかし、例えば、 Casella、Berger (2001)の 「Statistical Inference (2nd ed.)」、Duxbury、p. 332、 ISBNでの議論と比較してみましょう。 0-534-24312-6 。
^ Gelman, A.; et al. (1995). ベイズデータ分析 . Chapman and Hall. p. 108. ISBN 0-412-03991-5 。
参考文献
Brown, George W. 「小サンプル推定について」 『数理統計年報 』第18巻第4号(1947年12月)、582~585頁。JSTOR 2236236 。
Lehmann, EL (1951 年 12 月)。 「不偏性 の 一般概念」。 数理統計年報 。22 (4): 587– 592。JSTOR 2236928。
バーンバウム、アラン(1961年3月)。「 推定 の統一理論、I」。 数理統計年報 。32 (1): 112-135 。 {{cite journal}}: CS1 maint: date and year (link)
Van der Vaart, HR (1961 年 6 月)。「バイアスの 概念のいくつかの拡張」。 数理統計年報 。32 (2): 436– 447。 {{cite journal}}: CS1 maint: date and year (link)
ファンザグル、ヨハン (1994)。 パラメトリック統計理論 。ウォルター・デ・グルイテル。
スチュアート、アラン、オルド、スティーブン [F.] (2010)。 古典的推論と線形モデル 。ケンドールの統計の高度な理論。第 2A 巻。ワイリー 。ISBN 978-0-4706-8924-0 。 。
Voinov, Vassily [G.]; Nikulin, Mikhail [S.] (1993)。 不偏推定量とその応用 。 第 1 巻: 単変量の場合。住所: Kluwer Academic Publishers。ISBN 0-7923-2382-3 。
Voinov, Vassily [G.]; Nikulin, Mikhail [S.] (1996)。 不偏推定量とその応用 。 第 2 巻: 多変量の場合。住所: Kluwer Academic Publishers。ISBN 0-7923-3939-8 。
Klebanov, Lev [B.]; Rachev, Svetlozar [T.]; Fabozzi, Frank [J.] (2009)。 統計におけるロバストモデルと非ロバストモデル 。ニューヨーク: Nova Scientific Publishers。ISBN 978-1-60741-768-2 。
外部リンク