統計における適合度の測定
統計学 において 、 ラルフ・ダゴスティーノ にちなんで名付けられた ダゴスティーノの K 2 検定は 、 正規性 からの逸脱の 適合度の 尺度であり、与えられたデータと、データが独立した同一分布のガウス確率変数の実現であるという帰無仮説との適合性を測定することを目的としています。この検定は、サンプルの 尖度 と 歪度の 変換に基づいており、分布が歪んでいる、または尖っているという対立仮説に対してのみ検出力があります。
歪度と尖度
以下では、{ x i } はn 個 の観測値 の標本 、 g 1 と g 2 は標本の 歪度 と 尖度 、 m j は j 番目の標本 中心積率 、は 標本 平均を表します。 正規性検定 に関する文献では 、歪度と尖度はそれぞれ √ β 1 と β 2 と表記されることがよくあります。このような表記は、たとえば √ β 1 が負の量になる場合があるため、不便です。
x
¯
{\displaystyle {\bar {x}}}
標本の歪度と尖度は次のように定義される。
グ
1
=
メートル
3
メートル
2
3
/
2
=
1
ん
∑
私
=
1
ん
(
x
私
−
x
¯
)
3
(
1
ん
∑
私
=
1
ん
(
x
私
−
x
¯
)
2
)
3
/
2
、
グ
2
=
メートル
4
メートル
2
2
−
3
=
1
ん
∑
私
=
1
ん
(
x
私
−
x
¯
)
4
(
1
ん
∑
私
=
1
ん
(
x
私
−
x
¯
)
2
)
2
−
3
。
{\displaystyle {\begin{aligned}&g_{1}={\frac {m_{3}}{m_{2}^{3/2}}}={\frac {{\frac {1}{n}}\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{3}}{\left({\frac {1}{n}}\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}\right)^{3/2}}}\ ,\\&g_{2}={\frac {m_{4}}{m_{2}^{2}}}-3={\frac {{\frac {1}{n}}\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{4}}{\left({\frac {1}{n}}\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}\right)^{2}}}-3\ .\end{aligned}}}
これらの量は、 それぞれ分布の理論的な歪度と尖度を一貫し て推定します。さらに、サンプルが実際に正規母集団から取得された場合、歪度と尖度の正確な有限サンプル分布は、平均 μ 1 、分散 μ 2 、歪度 γ 1 、尖度 γ 2 の観点から分析できます。これはピアソン (1931) によって行われ、次の式が導き出されました。 [ より良いソースが必要 ]
μ
1
(
g
1
)
=
0
,
μ
2
(
g
1
)
=
6
(
n
−
2
)
(
n
+
1
)
(
n
+
3
)
,
γ
1
(
g
1
)
≡
μ
3
(
g
1
)
μ
2
(
g
1
)
3
/
2
=
0
,
γ
2
(
g
1
)
≡
μ
4
(
g
1
)
μ
2
(
g
1
)
2
−
3
=
36
(
n
−
7
)
(
n
2
+
2
n
−
5
)
(
n
−
2
)
(
n
+
5
)
(
n
+
7
)
(
n
+
9
)
.
{\displaystyle {\begin{aligned}&\mu _{1}(g_{1})=0,\\&\mu _{2}(g_{1})={\frac {6(n-2)}{(n+1)(n+3)}},\\&\gamma _{1}(g_{1})\equiv {\frac {\mu _{3}(g_{1})}{\mu _{2}(g_{1})^{3/2}}}=0,\\&\gamma _{2}(g_{1})\equiv {\frac {\mu _{4}(g_{1})}{\mu _{2}(g_{1})^{2}}}-3={\frac {36(n-7)(n^{2}+2n-5)}{(n-2)(n+5)(n+7)(n+9)}}.\end{aligned}}}
そして
μ
1
(
g
2
)
=
−
6
n
+
1
,
μ
2
(
g
2
)
=
24
n
(
n
−
2
)
(
n
−
3
)
(
n
+
1
)
2
(
n
+
3
)
(
n
+
5
)
,
γ
1
(
g
2
)
≡
μ
3
(
g
2
)
μ
2
(
g
2
)
3
/
2
=
6
(
n
2
−
5
n
+
2
)
(
n
+
7
)
(
n
+
9
)
6
(
n
+
3
)
(
n
+
5
)
n
(
n
−
2
)
(
n
−
3
)
,
γ
2
(
g
2
)
≡
μ
4
(
g
2
)
μ
2
(
g
2
)
2
−
3
=
36
(
15
n
6
−
36
n
5
−
628
n
4
+
982
n
3
+
5777
n
2
−
6402
n
+
900
)
n
(
n
−
3
)
(
n
−
2
)
(
n
+
7
)
(
n
+
9
)
(
n
+
11
)
(
n
+
13
)
.
{\displaystyle {\begin{aligned}&\mu _{1}(g_{2})=-{\frac {6}{n+1}},\\&\mu _{2}(g_{2})={\frac {24n(n-2)(n-3)}{(n+1)^{2}(n+3)(n+5)}},\\&\gamma _{1}(g_{2})\equiv {\frac {\mu _{3}(g_{2})}{\mu _{2}(g_{2})^{3/2}}}={\frac {6(n^{2}-5n+2)}{(n+7)(n+9)}}{\sqrt {\frac {6(n+3)(n+5)}{n(n-2)(n-3)}}},\\&\gamma _{2}(g_{2})\equiv {\frac {\mu _{4}(g_{2})}{\mu _{2}(g_{2})^{2}}}-3={\frac {36(15n^{6}-36n^{5}-628n^{4}+982n^{3}+5777n^{2}-6402n+900)}{n(n-3)(n-2)(n+7)(n+9)(n+11)(n+13)}}.\end{aligned}}}
たとえば、 正規分布する母集団から抽出されたサイズ n = 1000のサンプルは、歪度 0、SD 0.08 、尖度 0、SD 0.15 になることが予想されます。ここで、SD は標準偏差を示します。 [ 引用が必要 ]
標本の歪度 g 1 と尖度 g 2 は、どちらも漸近的に正規分布です。しかし、分布の限界への収束速度は、特に g 2 の場合、イライラするほど遅いです。たとえば、 n = 5000 の観測値であっても、標本の尖度 g 2 は 歪度と尖度がどちらも約 0.3 であり、無視できない値です。この状況を改善するために、 分布が標準正規分布にできるだけ近くなるように
量 g 1 と g 2 を変換することが提案されています。
特に、D'Agostino & Pearson (1973) は、サンプルの歪度について次のような変換を提案しました。
Z
1
(
g
1
)
=
δ
asinh
(
g
1
α
μ
2
)
,
{\displaystyle Z_{1}(g_{1})=\delta \operatorname {asinh} \left({\frac {g_{1}}{\alpha {\sqrt {\mu _{2}}}}}\right),}
ここで定数 α と δは 次のように計算される。
W
2
=
2
γ
2
+
4
−
1
,
δ
=
1
/
ln
W
,
α
2
=
2
/
(
W
2
−
1
)
,
{\displaystyle {\begin{aligned}&W^{2}={\sqrt {2\gamma _{2}+4}}-1,\\&\delta =1/{\sqrt {\ln W}},\\&\alpha ^{2}=2/(W^{2}-1),\end{aligned}}}
ここで、 μ 2 = μ 2 ( g 1 ) は g 1 の分散 、 γ 2 = γ 2 ( g 1 ) は尖度です(前のセクションで示した式)。
同様に、Anscombe & Glynn (1983)は、サンプルサイズが20以上の場合に適切に機能する
g 2 の変換を提案しました。
Z
2
(
g
2
)
=
9
A
2
{
1
−
2
9
A
−
(
1
−
2
/
A
1
+
g
2
−
μ
1
μ
2
2
/
(
A
−
4
)
)
1
/
3
}
,
{\displaystyle Z_{2}(g_{2})={\sqrt {\frac {9A}{2}}}\left\{1-{\frac {2}{9A}}-\left({\frac {1-2/A}{1+{\frac {g_{2}-\mu _{1}}{\sqrt {\mu _{2}}}}{\sqrt {2/(A-4)}}}}\right)^{\!1/3}\right\},}
どこ
A
=
6
+
8
γ
1
(
2
γ
1
+
1
+
4
/
γ
1
2
)
,
{\displaystyle A=6+{\frac {8}{\gamma _{1}}}\left({\frac {2}{\gamma _{1}}}+{\sqrt {1+4/\gamma _{1}^{2}}}\right),}
μ 1 = μ 1 ( g 2 )、 μ 2 = μ 2 ( g 2 ) 、 γ 1 = γ 1 ( g 2 ) はピアソンによって計算された量です。
オムニバス け 2 統計
統計 Z 1 と Z 2 を組み合わせると、歪度または尖度による正規性からの偏差を検出できるオムニバス テストを作成できます (D'Agostino、Belanger、D'Agostino 1990)。
K
2
=
Z
1
(
g
1
)
2
+
Z
2
(
g
2
)
2
{\displaystyle K^{2}=Z_{1}(g_{1})^{2}+Z_{2}(g_{2})^{2}\,}
正規性の帰無仮説 が正しい場合 、 K 2 は自由度 2 で
近似的に χ 2 分布します。
統計量 g 1 、 g 2 は 独立ではなく、相関がないだけであることに注意する。したがって、それらの変換 Z 1 、 Z 2 も 従属的になり (Shenton & Bowman 1977)、 χ 2 近似の妥当性が疑わしくなる。シミュレーションでは、帰無仮説の下では K 2 検定統計量は次のように特徴付けられる。
参照
参考文献
Anscombe, FJ; Glynn, William J. (1983). 「正規統計における 尖度統計量 b 2の分布」. Biometrika . 70 (1): 227–234. doi :10.1093/biomet/70.1.227. JSTOR 2335960.
D'Agostino, Ralph B. (1970). 「 g 1 のヌル分布の正規性への変換 」。Biometrika . 57 ( 3): 679–681. doi :10.1093/biomet/57.3.679. JSTOR 2334794.
D'Agostino, Ralph B.; Pearson, ES (1973). 「正規性からの逸脱のテスト。b 2 および√b 1 の分布に関する実験結果」。 Biometrika . 60 (3): 613–622. JSTOR 2335012.
D'Agostino, Ralph B.; Belanger, Albert; D'Agostino, Ralph B. Jr. (1990). 「強力で有益な正規性検定の使用に関する提案」 (PDF) . The American Statistician . 44 (4): 316–321. doi :10.2307/2684359. JSTOR 2684359. 2012-03-25 に オリジナル (PDF)からアーカイブ。
ピアソン、エゴン S. (1931)。「正規性の 検定 に関する注記」。 バイオメトリカ 。22 (3/4): 423–424。doi : 10.1093 /biomet/22.3-4.423。JSTOR 2332104 。
Shenton, LR; Bowman, Kimiko O. (1977). 「√b 1 と b 2 の分布の二変量モデル 」 アメリカ統計学会誌 . 72 (357): 206–211. doi :10.1080/01621459.1977.10479940. JSTOR 2286939.