推定値の誤差の測定
統計学 では 、 平均二乗誤差 ( MSE ) [1] または 平均二乗偏差 ( MSD )は、 (観測されない量を推定する手順の) 推定量では、 誤差 の二乗の 平均 、つまり推定値と実際の値の平均二乗差を測定します。MSEは リスク関数であり、 二乗誤差損失 の 期待値 に対応します 。 [2] MSEがほぼ常に厳密に正である(ゼロではない)という事実は、 ランダム性 のため、または推定量が より正確な推定値を生成できる 情報を考慮していないためです。 [3] 機械学習 、特に 経験的リスク最小化 では 、MSEは 経験的 リスク(観測されたデータセットの平均損失)を真のMSE(真のリスク:実際の母集団分布の平均損失)の推定値として参照する場合があります。
MSE は推定値の品質の尺度です。 ユークリッド距離 の 2 乗から導出されるため、常に正の値となり、誤差がゼロに近づくにつれて減少します。
MSE は 誤差の(原点を中心とした) 2 次 モーメント であるため、推定値の 分散( データ サンプル 間で推定値がどれだけ広がっているか)と バイアス (平均推定値が真の値からどれだけ離れているか)の両方が組み込まれています。 [ 出典が必要 ] 不偏推定値 の場合 、MSE は推定値の分散です。分散と同様に、MSE は推定される量の 2 乗と同じ測定単位を持ちます。 標準偏差 と同様に、MSE の平方根を取ると、推定される量と同じ単位を持つ 二乗平均平方根誤差 または 二乗平均平方根偏差 (RMSE または RMSD) が得られます。不偏推定値の場合、RMSE は分散 の平方根であり、 標準誤差 と呼ばれます 。
定義と基本特性
MSE は、予測子 ( つまり、任意の入力を何らかのランダム変数 の値のサンプルにマッピングする関数 ) または 推定子 (つまり、データの サンプル を、データがサンプリングされた母集団の パラメータ の推定値に マッピングする 数学関数) の 品質を評価します。予測のコンテキストでは、 予測区間 を理解することも役立ちます。予測区間は、 将来の観測値が一定の確率で含まれる範囲を提供するためです。MSE の定義は、予測子と推定子のどちらを記述するかによって異なります。
予測者
予測ベクトルがすべての変数のデータポイント のサンプルから生成され 、が 予測される変数の観測値のベクトルであり、が 予測値(たとえば、 最小二乗適合 から)である場合、予測子のサンプル内MSEは次のように計算されます。
ん
{\displaystyle n}
ん
{\displaystyle n}
はい
{\displaystyle Y}
はい
^
{\displaystyle {\hat {Y}}}
MSE
=
1
ん
∑
私
=
1
ん
(
はい
私
−
はい
私
^
)
2
{\displaystyle \operatorname {MSE} ={\frac {1}{n}}\sum _{i=1}^{n}\left(Y_{i}-{\hat {Y_{i}}}\right)^{2}}
言い換えれば、MSE は 誤差の二乗 の 平均 です。これは特定のサンプルに対して簡単に計算できる量です (したがって、サンプルに依存します)。
(
1
ん
∑
私
=
1
ん
)
{\textstyle \left({\frac {1}{n}}\sum _{i=1}^{n}\right)}
(
はい
私
−
はい
私
^
)
2
{\textstyle \left(Y_{i}-{\hat {Y_{i}}}\right)^{2}}
行列 表記では 、
MSE
=
1
ん
∑
私
=
1
ん
(
e
私
)
2
=
1
ん
e
T
e
{\displaystyle \operatorname {MSE} ={\frac {1}{n}}\sum _{i=1}^{n}(e_{i})^{2}={\frac {1}{n }}\mathbf {e} ^{\mathsf {T}}\mathbf {e} }
ここで 、 は列ベクトル です 。
e
私
{\displaystyle e_{i}}
(
はい
私
−
はい
私
^
)
{\displaystyle (Y_{i}-{\hat {Y_{i}}})}
e
{\displaystyle \mathbf {e} }
ん
×
1
{\displaystyle n\times 1}
MSEは、モデルの推定に使用されなかった q個の データポイントに対しても計算される。これは、この目的のために保持されていたか、これらのデータが新たに取得されたためである。このプロセスは クロスバリデーション と呼ばれ、MSEはテストMSEと呼ばれることが多く、 [4] 次のように計算される。
MSE
=
1
q
∑
私
=
ん
+
1
ん
+
q
(
はい
私
−
はい
私
^
)
2
{\displaystyle \operatorname {MSE} ={\frac {1}{q}}\sum _{i=n+1}^{n+q}\left(Y_{i}-{\hat {Y_{i}}}\right)^{2}}
見積もり
未知のパラメータに対する 推定量のMSEは 次のように定義される [1]
θ
^
{\displaystyle {\hat {\theta }}}
θ
{\displaystyle \theta}
MSE
(
θ
^
)
=
え
θ
[
(
θ
^
−
θ
)
2
]
。
{\displaystyle \operatorname {MSE} ({\hat {\theta }})=\operatorname {E} _{\theta }\left[({\hat {\theta }}-\theta )^{2}\right].}
この定義は未知のパラメータに依存しますが、MSE は推定値の 事前 特性です。MSE は未知のパラメータの関数である可能性があり、その場合、これらのパラメータの推定値に基づく MSE の 推定値は データの関数 (つまりランダム変数) になります。推定値 がサンプル統計量として導出され、何らかの母集団パラメータを推定するために使用される場合、期待値はサンプル統計量の標本分布に関するものになります。
θ
^
{\displaystyle {\hat {\theta }}}
MSEは推定値の 分散 と推定値の バイアス の二乗の合計として表すことができ、MSEを計算する便利な方法を提供し、偏りのない推定値の場合にはMSEと分散が同等であることを意味しています。 [5]
MSE
(
θ
^
)
=
ヴァール
θ
(
θ
^
)
+
バイアス
(
θ
^
、
θ
)
2
。
{\displaystyle \operatorname {MSE} ({\hat {\theta }})=\operatorname {Var} _{\theta }({\hat {\theta }})+\operatorname {Bias} ({\hat {\theta }},\theta )^{2}.}
差異とバイアスの関係の証明
MSE
(
θ
^
)
=
え
θ
[
(
θ
^
−
θ
)
2
]
=
え
θ
[
(
θ
^
−
え
θ
[
θ
^
]
+
え
θ
[
θ
^
]
−
θ
)
2
]
=
え
θ
[
(
θ
^
−
え
θ
[
θ
^
]
)
2
+
2
(
θ
^
−
え
θ
[
θ
^
]
)
(
え
θ
[
θ
^
]
−
θ
)
+
(
え
θ
[
θ
^
]
−
θ
)
2
]
=
え
θ
[
(
θ
^
−
え
θ
[
θ
^
]
)
2
]
+
え
θ
[
2
(
θ
^
−
え
θ
[
θ
^
]
)
(
え
θ
[
θ
^
]
−
θ
)
]
+
え
θ
[
(
え
θ
[
θ
^
]
−
θ
)
2
]
=
え
θ
[
(
θ
^
−
え
θ
[
θ
^
]
)
2
]
+
2
(
え
θ
[
θ
^
]
−
θ
)
え
θ
[
θ
^
−
え
θ
[
θ
^
]
]
+
(
え
θ
[
θ
^
]
−
θ
)
2
え
θ
[
θ
^
]
−
θ
=
定数。
=
え
θ
[
(
θ
^
−
え
θ
[
θ
^
]
)
2
]
+
2
(
え
θ
[
θ
^
]
−
θ
)
(
え
θ
[
θ
^
]
−
え
θ
[
θ
^
]
)
+
(
え
θ
[
θ
^
]
−
θ
)
2
え
θ
[
θ
^
]
=
定数。
=
え
θ
[
(
θ
^
−
え
θ
[
θ
^
]
)
2
]
+
(
え
θ
[
θ
^
]
−
θ
)
2
=
ヴァール
θ
(
θ
^
)
+
バイアス
θ
(
θ
^
、
θ
)
2
{\displaystyle {\begin{aligned}\operatorname {MSE} ({\hat {\theta }})&=\operatorname {E} _{\theta }\left[({\hat {\theta }}-\theta )^{2}\right]\\&=\operatorname {E} _{\theta }\left[\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]+\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)^{2}\right]\\&=\operatorname {E} _{\theta }\left[\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)^{2}+2\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)+\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)^{2}\right]\\&=\operatorname {E} _{\theta }\left[\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)^{2}\right]+\operatorname {E} _{\theta }\left[2\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)\right]+\operatorname {E} _{\theta }\left[\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)^{2}\right]\\&=\operatorname {E} _{\theta }\left[\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)^{2}\right]+2\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)\operatorname {E} _{\theta }\left[{\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right]+\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)^{2}&&\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta ={\text{const.}}\\&=\operatorname {E} _{\theta }\left[\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)^{2}\right]+2\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)+\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)^{2}&&\operatorname {E} _{\theta }[{\hat {\theta }}]={\text{const.}}\\&=\operatorname {E} _{\theta }\left[\left({\hat {\theta }}-\operatorname {E} _{\theta }[{\hat {\theta }}]\right)^{2}\right]+\left(\operatorname {E} _{\theta }[{\hat {\theta }}]-\theta \right)^{2}\\&=\operatorname {Var} _{\theta }({\hat {\theta }})+\operatorname {Bias} _{\theta }({\hat {\theta }},\theta )^{2}\end{aligned}}}
よく知られた公式、つまりランダム変数 に対して が成り立つことを用いると、さらに短い証明が行えます。 を に代入すると、 が得られます。しかし、実際のモデリングの場合、MSE は、モデル分散、モデル バイアス、および削減不可能な不確実性 (バイアスと分散のトレードオフを参照) の加算として説明できます 。 関係 に従って 、 推定 量の MSE は、推定量の分散とバイアスの情報を含む 効率 比較に簡単に使用できます。これを MSE 基準と呼びます。
X
{\textstyle X}
E
(
X
2
)
=
Var
(
X
)
+
(
E
(
X
)
)
2
{\textstyle \mathbb {E} (X^{2})=\operatorname {Var} (X)+(\mathbb {E} (X))^{2}}
X
{\textstyle X}
θ
^
−
θ
{\textstyle {\hat {\theta }}-\theta }
MSE
(
θ
^
)
=
E
[
(
θ
^
−
θ
)
2
]
=
Var
(
θ
^
−
θ
)
+
(
E
[
θ
^
−
θ
]
)
2
=
Var
(
θ
^
)
+
Bias
2
(
θ
^
,
θ
)
{\displaystyle {\begin{aligned}\operatorname {MSE} ({\hat {\theta }})&=\mathbb {E} [({\hat {\theta }}-\theta )^{2}]\\&=\operatorname {Var} ({\hat {\theta }}-\theta )+(\mathbb {E} [{\hat {\theta }}-\theta ])^{2}\\&=\operatorname {Var} ({\hat {\theta }})+\operatorname {Bias} ^{2}({\hat {\theta }},\theta )\end{aligned}}}
回帰では
回帰分析 では 、プロットはデータ全体の全体的な傾向を表示するより自然な方法です。各ポイントから予測された回帰モデルまでの距離の平均を計算し、平均二乗誤差として表示できます。二乗は、負の符号による複雑さを軽減するために重要です。MSEを最小限に抑えるには、モデルをより正確にする必要があります。つまり、モデルが実際のデータに近づくということです。この方法を使用する線形回帰の1つの例は、 最小二乗法です。これは、線形回帰モデルが 2変量データセットを モデル化するのに適切かどうかを評価しますが 、 [6] その制限はデータの既知の分布に関連しています。
平均二乗誤差 という用語は 、誤差分散の不偏推定値を指すために使用されることがあります。これは、 残差二乗和を 自由度の 数で割ったものです 。既知の計算された量のこの定義は、異なる分母が使用されるという点で、予測変数の計算されたMSEに対する上記の定義とは異なります。分母は、同じデータから推定されたモデルパラメータの数、 p個の 回帰変数の場合は( n − p ) 、 切片が使用される場合は ( n − p −1)によって削減されたサンプルサイズです(詳細については、 統計における誤差と残差を参照してください)。 [7] MSE(この記事で定義されているように)は誤差分散の不偏推定値ではありませんが、 予測変数の一貫性を考えると、
一貫しています。
回帰分析では、「平均二乗誤差」は、 平均二乗予測誤差 または「標本外平均二乗誤差」とも呼ばれ、 特定の標本空間 で推定されたモデルによって生成された、 標本外テスト 空間での予測値の真の値からの 二乗偏差 の平均値を指すこともあります。これも既知の計算量であり、標本および標本外テスト空間によって異なります。
勾配降下アルゴリズムのコンテキストでは、 導関数を取った後の計算を容易にするために、MSE に の係数を導入するのが一般的です。したがって、技術的には二乗誤差の平均の半分の値は、MSE と呼ばれることがあります。
1
/
2
{\displaystyle 1/2}
例
平均
母集団から サイズのランダムサンプルがあるとします 。サンプルユニットは で置換 選択されたとします。つまり、 ユニットは一度に 1 つずつ選択され、以前に選択されたユニットはすべての抽選で選択対象となります 。 の通常の推定値 はサンプル平均です。
n
{\displaystyle n}
X
1
,
…
,
X
n
{\displaystyle X_{1},\dots ,X_{n}}
n
{\displaystyle n}
n
{\displaystyle n}
μ
{\displaystyle \mu }
X
¯
=
1
n
∑
i
=
1
n
X
i
{\displaystyle {\overline {X}}={\frac {1}{n}}\sum _{i=1}^{n}X_{i}}
これは、期待値が真の平均に等しく (したがって偏りがない)、平均二乗誤差が
μ
{\displaystyle \mu }
MSE
(
X
¯
)
=
E
[
(
X
¯
−
μ
)
2
]
=
(
σ
n
)
2
=
σ
2
n
{\displaystyle \operatorname {MSE} \left({\overline {X}}\right)=\operatorname {E} \left[\left({\overline {X}}-\mu \right)^{2}\right]=\left({\frac {\sigma }{\sqrt {n}}}\right)^{2}={\frac {\sigma ^{2}}{n}}}
ここで、 は 母分散 です 。
σ
2
{\displaystyle \sigma ^{2}}
ガウス分布 の場合 、これは 最良の不偏推定量 (つまり、すべての不偏推定量の中で MSE が最も低い推定量)ですが、 一様分布 の場合はそうではありません。
分散
分散の通常の推定値は、 修正された 標本分散 です。
S
n
−
1
2
=
1
n
−
1
∑
i
=
1
n
(
X
i
−
X
¯
)
2
=
1
n
−
1
(
∑
i
=
1
n
X
i
2
−
n
X
¯
2
)
.
{\displaystyle S_{n-1}^{2}={\frac {1}{n-1}}\sum _{i=1}^{n}\left(X_{i}-{\overline {X}}\right)^{2}={\frac {1}{n-1}}\left(\sum _{i=1}^{n}X_{i}^{2}-n{\overline {X}}^{2}\right).}
これは不偏(期待値は )であるため、 不偏標本分散とも呼ばれ、 そのMSEは [8]である。
σ
2
{\displaystyle \sigma ^{2}}
MSE
(
S
n
−
1
2
)
=
1
n
(
μ
4
−
n
−
3
n
−
1
σ
4
)
=
1
n
(
γ
2
+
2
n
n
−
1
)
σ
4
,
{\displaystyle \operatorname {MSE} (S_{n-1}^{2})={\frac {1}{n}}\left(\mu _{4}-{\frac {n-3}{n-1}}\sigma ^{4}\right)={\frac {1}{n}}\left(\gamma _{2}+{\frac {2n}{n-1}}\right)\sigma ^{4},}
ここで、 は 分布または母集団の 4 番目の 中心モーメントであり、 は 過剰尖度 です 。
μ
4
{\displaystyle \mu _{4}}
γ
2
=
μ
4
/
σ
4
−
3
{\displaystyle \gamma _{2}=\mu _{4}/\sigma ^{4}-3}
しかし、 に比例する他の推定量を使用することもできます 。適切な選択は常により低い平均二乗誤差をもたらします。定義すると
σ
2
{\displaystyle \sigma ^{2}}
S
n
−
1
2
{\displaystyle S_{n-1}^{2}}
S
a
2
=
n
−
1
a
S
n
−
1
2
=
1
a
∑
i
=
1
n
(
X
i
−
X
¯
)
2
{\displaystyle S_{a}^{2}={\frac {n-1}{a}}S_{n-1}^{2}={\frac {1}{a}}\sum _{i=1}^{n}\left(X_{i}-{\overline {X}}\,\right)^{2}}
次に計算します:
MSE
(
S
a
2
)
=
E
[
(
n
−
1
a
S
n
−
1
2
−
σ
2
)
2
]
=
E
[
(
n
−
1
)
2
a
2
S
n
−
1
4
−
2
(
n
−
1
a
S
n
−
1
2
)
σ
2
+
σ
4
]
=
(
n
−
1
)
2
a
2
E
[
S
n
−
1
4
]
−
2
(
n
−
1
a
)
E
[
S
n
−
1
2
]
σ
2
+
σ
4
=
(
n
−
1
)
2
a
2
E
[
S
n
−
1
4
]
−
2
(
n
−
1
a
)
σ
4
+
σ
4
E
[
S
n
−
1
2
]
=
σ
2
=
(
n
−
1
)
2
a
2
(
γ
2
n
+
n
+
1
n
−
1
)
σ
4
−
2
(
n
−
1
a
)
σ
4
+
σ
4
E
[
S
n
−
1
4
]
=
MSE
(
S
n
−
1
2
)
+
σ
4
=
n
−
1
n
a
2
(
(
n
−
1
)
γ
2
+
n
2
+
n
)
σ
4
−
2
(
n
−
1
a
)
σ
4
+
σ
4
{\displaystyle {\begin{aligned}\operatorname {MSE} (S_{a}^{2})&=\operatorname {E} \left[\left({\frac {n-1}{a}}S_{n-1}^{2}-\sigma ^{2}\right)^{2}\right]\\&=\operatorname {E} \left[{\frac {(n-1)^{2}}{a^{2}}}S_{n-1}^{4}-2\left({\frac {n-1}{a}}S_{n-1}^{2}\right)\sigma ^{2}+\sigma ^{4}\right]\\&={\frac {(n-1)^{2}}{a^{2}}}\operatorname {E} \left[S_{n-1}^{4}\right]-2\left({\frac {n-1}{a}}\right)\operatorname {E} \left[S_{n-1}^{2}\right]\sigma ^{2}+\sigma ^{4}\\&={\frac {(n-1)^{2}}{a^{2}}}\operatorname {E} \left[S_{n-1}^{4}\right]-2\left({\frac {n-1}{a}}\right)\sigma ^{4}+\sigma ^{4}&&\operatorname {E} \left[S_{n-1}^{2}\right]=\sigma ^{2}\\&={\frac {(n-1)^{2}}{a^{2}}}\left({\frac {\gamma _{2}}{n}}+{\frac {n+1}{n-1}}\right)\sigma ^{4}-2\left({\frac {n-1}{a}}\right)\sigma ^{4}+\sigma ^{4}&&\operatorname {E} \left[S_{n-1}^{4}\right]=\operatorname {MSE} (S_{n-1}^{2})+\sigma ^{4}\\&={\frac {n-1}{na^{2}}}\left((n-1)\gamma _{2}+n^{2}+n\right)\sigma ^{4}-2\left({\frac {n-1}{a}}\right)\sigma ^{4}+\sigma ^{4}\end{aligned}}}
これは、
a
=
(
n
−
1
)
γ
2
+
n
2
+
n
n
=
n
+
1
+
n
−
1
n
γ
2
.
{\displaystyle a={\frac {(n-1)\gamma _{2}+n^{2}+n}{n}}=n+1+{\frac {n-1}{n}}\gamma _{2}.}
ガウス分布 (ただし) の場合 、これは合計を で割ったときに MSE が最小になることを意味します 。最小過剰尖度は ([a]) であり、 これは p = 1/2 (コイン投げ)の ベルヌーイ分布 によって達成され 、MSE は に対して最小になります。 したがって、尖度に関係なく、不偏推定量を少し縮小することで「より良い」推定値(より低い MSE を持つという意味で)が得られます。これは、 収縮推定量 の簡単な例です。推定量をゼロに向かって「縮小」します(不偏推定量を縮小します)。
γ
2
=
0
{\displaystyle \gamma _{2}=0}
a
=
n
+
1
{\displaystyle a=n+1}
γ
2
=
−
2
{\displaystyle \gamma _{2}=-2}
a
=
n
−
1
+
2
n
.
{\displaystyle a=n-1+{\tfrac {2}{n}}.}
さらに、補正された標本分散は、ガウス分布の分散の 最良の不偏推定量 (不偏推定量の中で最小の平均二乗誤差)であるが、分布がガウス分布でない場合は、不偏推定量の中でも、分散の最良の不偏推定量は
S
n
−
1
2
.
{\displaystyle S_{n-1}^{2}.}
ガウス分布
次の表は、ガウス分布の場合の 母集団の真のパラメータμとσ2のいくつかの推定値を示しています 。 [9]
解釈
MSE がゼロの場合、つまり推定値が パラメータの観測値を 完全な精度で予測することが理想的です (ただし通常は不可能です)。
θ
^
{\displaystyle {\hat {\theta }}}
θ
{\displaystyle \theta }
MSE の値は比較の目的で使用できます。2 つ以上の 統計モデルを、 それらの統計モデルが特定の観測セットをどの程度適切に説明しているかの尺度として MSE を使用して比較できます。すべての不偏推定量の中で最小の分散を持つ不偏推定量 (統計モデルから推定) が、 最良不偏推定量 または MVUE ( 最小分散不偏推定量 ) です。
分散分析 と 線形回帰の どちらの 手法も、分析の一環として MSE を推定し、推定された MSE を使用して、 調査対象の因子または予測子の 統計的有意性を判断します。 実験設計 の目標は、観察結果を分析したときに、推定された処理効果の少なくとも 1 つの大きさに対して MSE がゼロに近くなるように実験を構築することです。
一元配置分散分析 では 、平均二乗誤差の合計と自由度を割ることで MSE を計算できます。また、f 値は平均二乗処理と MSE の比です。
MSE は、特定の観測セットのモデルに含める候補セットの予測変数の数を決定する一環として、
いくつかの 段階的回帰 手法でも使用されます。
アプリケーション
MSE を最小化することは、推定量を選択する際の重要な基準です。 最小平均二乗誤差を 参照してください。不偏推定量では、MSE を最小化することは分散を最小化することと同等であり、これを実現する推定量は 最小分散不偏推定量 です。ただし、偏りのある推定量は MSE が低くなる可能性があります。 推定量のバイアス を参照してください。
統計モデリング では 、MSE は実際の観測値とモデルによって予測された観測値との差を表すことができます。このコンテキストでは、モデルがデータにどの程度適合するか、またモデルの予測能力を大幅に損なうことなく説明変数の一部を削除できるかどうかを判断するために使用されます。
予測 と 予言 において 、 ブライアースコアは MSE に基づいた 予測スキル の尺度です。
損失関数
二乗誤差損失は統計学で最も広く使用されている 損失関数 の1つですが、その広範な使用は、アプリケーションでの実際の損失の考慮よりも、数学的な利便性に起因しています。平均二乗誤差の使用を導入した カール・フリードリヒ・ガウスは 、その恣意性を認識しており、この理由で反対意見に同意していました。 [3]平均二乗誤差の数学的利点は、 線形回帰 のパフォーマンスを分析する際に特に顕著であり 、データセットの変動を、モデルによって説明される変動とランダム性によって説明される変動に分割できるためです。
批判
平均二乗誤差を疑問なく使用することは、意思決定理論家 ジェームズ・バーガー によって批判されてきた。平均二乗誤差は、特定の 効用関数 である二次効用関数の期待値の負の値であり 、特定の状況下では適切な効用関数ではない可能性がある。しかし、平均二乗誤差がアプリケーションで自然に発生する損失関数の適切な近似値として機能できるシナリオもいくつかある。 [10]
分散 と同様に 、平均二乗誤差には 外れ値 に大きな重みが付くという欠点があります。 [11]これは各項を二乗した結果であり、大きな誤差は小さな誤差よりも実質的に大きな重みが付きます。この特性は多くの用途では望ましくないため、研究者は 平均絶対誤差 や 中央値 に基づくものなどの代替手段を使用しています 。
参照
注記
^これは、次のように ジェンセンの不等式 で証明できます 。4 番目の 中心モーメントは 分散の 2 乗の上限であるため、それらの比の最小値は 1 になります。したがって、 過剰尖度 の最小値は -2 であり、これは、たとえば p =1/2 のベルヌーイによって達成されます。
参考文献
^ ab 「平均二乗誤差(MSE)」 www.probabilitycourse.com . 2020年9月12日 閲覧 。
^ Bickel, Peter J. ; Doksum, Kjell A. (2015). Mathematical Statistics: Basic Ideas and Selected Topics . Vol. I (Second ed.). p. 20. 2次損失を使用する場合、リスク関数は 平均二乗誤差 (MSE) と呼ばれます...
^ ab Lehmann, EL; Casella, George (1998). 点推定の理論 (第2版). ニューヨーク: Springer. ISBN 978-0-387-98502-2 . MR 1639875。
^ ガレス、ジェームズ、ウィッテン、ダニエラ、ハスティー、トレバー、ティブシラニ、ロブ(2021)。統計学習入門:Rのアプリケーション付き。シュプリンガー 。ISBN 978-1071614174 。
^ Wackerly, Dennis; Mendenhall, William; Scheaffer, Richard L. (2008). Mathematical Statistics with Applications (第 7 版). Belmont, CA, USA: Thomson Higher Education. ISBN 978-0-495-38508-0 。
^ 確率と統計の現代的入門:なぜ、どのように理解するか 。デッキング、ミシェル、1946-。ロンドン:シュプリンガー。2005年 。ISBN 978-1-85233-896-1 . OCLC 262680588. {{cite book}}: CS1 maint: others (link)
^ Steel, RGD、および Torrie, JH、 「生物学を専門とする統計の原理と手順」 、 McGraw Hill 、1960年、288ページ。
^ Mood, A.; Graybill, F.; Boes, D. (1974). 統計理論入門 (第3版). McGraw-Hill. p. 229.
^ DeGroot, Morris H. (1980). 確率と統計 (第2版). Addison-Wesley.
^ Berger, James O. (1985). 「2.4.2 特定の標準損失関数」。 統計的決定理論とベイズ分析 (第 2 版)。ニューヨーク: Springer-Verlag。p. 60。ISBN 978-0-387-96098-2 MR 0804611 。
^ Bermejo, Sergio; Cabestany, Joan (2001). 「大きなマージン分類器のための指向主成分分析」. ニューラルネットワーク . 14 (10): 1447–1461. doi :10.1016/S0893-6080(01)00106-X. PMID 11771723.