回帰分析におけるデータポイントの影響の測定
統計学 において 、 クックの距離 または クックの Dは 、最小二乗回帰分析を 実行する際にデータポイントの 影響力 を推定するためによく使用されます 。 [1] 実際の通常 の最小二乗 分析では、クックの距離は、特に妥当性を確認する価値がある影響力のあるデータポイントを示すため、またはより多くのデータポイントを取得できることが望ましい設計空間の領域を示すために、いくつかの方法で使用できます。これは、 1977年にこの概念を導入したアメリカの統計学者 R.デニスクックにちなんで名付けられました。 [2] [3]
意味
大きな残差 ( 外れ値 ) や高い レバレッジ を持つデータ ポイントは、 回帰の結果と精度を歪める可能性があります。Cook の距離は、特定の観測値を削除した場合の影響を測定します。Cook の距離が大きいポイントは、分析でより詳しく調べる価値があると見なされます。
代数式では、まず定義する
ええ
ん
×
1
=
バツ
ん
×
p
β
p
×
1
+
ε
ん
×
1
{\displaystyle {\underset {n\times 1}{\mathbf {y} }}={\underset {n\times p}{\mathbf {X} }}\quad {\underset {p\times 1}{\boldsymbol {\beta }}}\quad +\quad {\underset {n\times 1}{\boldsymbol {\varepsilon }}}}
ここで、 は 誤差項 、 は係数行列、 は各観測値の共変量または予測変数の数、 は 定数を含む 計画行列 です。 最小二乗 推定量は であり 、したがって の平均の適合(予測)値 は
ε
〜
いいえ
(
0
、
σ
2
私
)
{\displaystyle {\boldsymbol {\varepsilon}}\sim {\mathcal {N}}\left(0,\sigma ^{2}\mathbf {I} \right)}
β
=
[
β
0
β
1
…
β
p
−
1
]
T
{\displaystyle {\boldsymbol {\beta }}=\left[\beta _{0}\,\beta _{1}\dots \beta _{p-1}\right]^{\mathsf {T}}}
p
{\displaystyle p}
バツ
{\displaystyle \mathbf {X} }
b
=
(
バツ
T
バツ
)
−
1
バツ
T
ええ
{\displaystyle \mathbf {b} =\left(\mathbf {X} ^{\mathsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\mathsf {T}}\mathbf {y} }
ええ
{\displaystyle \mathbf {y} }
ええ
^
=
バツ
b
=
バツ
(
バツ
T
バツ
)
−
1
バツ
T
ええ
=
H
ええ
{\displaystyle \mathbf {\widehat {y}} =\mathbf {X} \mathbf {b} =\mathbf {X} \left(\mathbf {X} ^{\mathsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\mathsf {T}}\mathbf {y} =\mathbf {H} \mathbf {y} }
ここで、 は 射影行列 (またはハット行列) である 。 の - 番目の対角要素 は で与えられ 、 [4] は - 番目の観測 値 のてこ比として知られている 。同様に、 残差ベクトルの - 番目の要素 は で表される 。
H
≡
バツ
(
バツ
T
バツ
)
−
1
バツ
T
{\displaystyle \mathbf {H} \equiv \mathbf {X} (\mathbf {X} ^{\mathsf {T}}\mathbf {X} )^{-1}\mathbf {X} ^{\mathsf {T}}}
私
{\displaystyle i}
H
{\displaystyle \mathbf {H} \,}
h
私
私
≡
x
私
T
(
バツ
T
バツ
)
−
1
x
私
{\displaystyle h_{ii}\equiv \mathbf {x} _{i}^{\mathsf {T}}(\mathbf {X} ^{\mathsf {T}}\mathbf {X} )^{-1}\mathbf {x} _{i}}
私
{\displaystyle i}
私
{\displaystyle i}
e
=
ええ
−
ええ
^
=
(
私
−
H
)
ええ
{\displaystyle \mathbf {e} =\mathbf {y} -\mathbf {\widehat {y\,}} =\left(\mathbf {I} -\mathbf {H} \right)\mathbf {y} }
e
私
{\displaystyle e_{i}}
クックの 観測距離は、回帰 モデルから 観測を取り除いたときの回帰モデルのすべての変化の合計として定義される [5]
だ
私
{\displaystyle D_{i}}
私
(
のために
私
=
1
、
…
、
ん
)
{\displaystyle i\;({\text{for }}i=1,\dots ,n)}
私
{\displaystyle i}
だ
私
=
∑
じゅう
=
1
ん
(
ええ
^
じゅう
−
ええ
^
じゅう
(
私
)
)
2
p
s
2
{\displaystyle D_{i}={\frac {\sum _{j=1}^{n}\left({\widehat {y\,}}_{j}-{\widehat {y\,}}_{j(i)}\right)^{2}}{ps^{2}}}}
ここで p はモデルの順位(すなわち、設計行列内の独立変数の数)であり、は を除外したときに得られる適合応答値であり 、は 回帰モデルの 平均二乗誤差 である。 [6]
ええ
^
じゅう
(
私
)
{\displaystyle {\widehat {y\,}}_{j(i)}}
私
{\displaystyle i}
s
2
=
e
⊤
e
ん
−
p
{\displaystyle s^{2}={\frac {\mathbf {e} ^{\top }\mathbf {e} }{np}}}
同様に、レバレッジ [5] ( )を使用して表現することもできます。
h
私
私
{\displaystyle h_{ii}}
だ
私
=
e
私
2
p
s
2
[
h
私
私
(
1
−
h
私
私
)
2
]
。
{\displaystyle D_{i}={\frac {e_{i}^{2}}{ps^{2}}}\left[{\frac {h_{ii}}{(1-h_{ii})^{2}}}\right].}
非常に影響力のある観察を検出する
非常に影響力のある点 を見つけるためにどのようなカットオフ値を使用するかについてはさまざまな意見があります 。クックの距離は 、 (上記の計画行列で定義されているように)自由度 が と である F 分布 の測定基準であるため、中央値(つまり、 )をカットオフとして使用できます。 [7] この値は が大きい場合に1に近づくため 、 の簡単な操作ガイドラインが 提案されています。 [8]
p
{\displaystyle p}
ん
−
p
{\displaystyle np}
バツ
{\displaystyle \mathbf {X} }
ふ
0.5
(
p
、
ん
−
p
)
{\displaystyle F_{0.5}(p,n-p)}
n
{\displaystyle n}
D
i
>
1
{\displaystyle D_{i}>1}
次元 ランダムベクトル は、 - 番目の観測値 の削除による の変化であり 、ランク 1 の共分散行列を持ち、したがって- 次元空間 の 1 次元部分空間 (直線、たとえば )全体に分布します 。 前述の の分布特性は、 によって提供される - 番目の観測値
の影響に関する情報は、 直線の外部からではなく 、直線 自体から取得される必要があることを意味します。 しかし、クックの距離の導入では、フルランクのスケーリング行列 が選択され、結果として は 次元 の空間全体に分布するランダムベクトルであるかのように扱われます。 これは、クックの距離を通じて によって提供される - 番目の観測値 の影響に関する情報が、次元 の空間全体から得られることを意味します 。 したがって、クックの距離の尺度は、観測値の実際の影響を歪め、影響力のある観測値の正しい識別を誤らせる可能性があります。 [9] [10]
p
{\displaystyle p}
b
−
b
(
i
)
{\displaystyle \mathbf {b} -\mathbf {b\,} _{(i)}}
b
{\displaystyle \mathbf {b} }
i
{\displaystyle i}
L
{\displaystyle L}
p
{\displaystyle p}
b
−
b
(
i
)
{\displaystyle \mathbf {b} -\mathbf {b\,} _{(i)}}
i
{\displaystyle i}
b
−
b
(
i
)
{\displaystyle \mathbf {b} -\mathbf {b\,} _{(i)}}
L
{\displaystyle L}
L
{\displaystyle L}
p
{\displaystyle p}
b
−
b
(
i
)
{\displaystyle \mathbf {b} -\mathbf {b\,} _{(i)}}
p
{\displaystyle p}
i
{\displaystyle i}
b
−
b
(
i
)
{\displaystyle \mathbf {b} -\mathbf {b\,} _{(i)}}
p
{\displaystyle p}
他の影響指標との関係(および解釈)
D
i
{\displaystyle D_{i}}
は、てこ比[5] ( )と 内部 スチューデント化残差 ( ) の二乗 を用いて次のように表される 。
0
≤
h
i
i
≤
1
{\displaystyle 0\leq h_{ii}\leq 1}
0
≤
t
i
2
{\displaystyle 0\leq t_{i}^{2}}
D
i
=
e
i
2
p
s
2
⋅
h
i
i
(
1
−
h
i
i
)
2
=
1
p
⋅
e
i
2
1
n
−
p
∑
j
=
1
n
ε
^
j
2
(
1
−
h
i
i
)
⋅
h
i
i
1
−
h
i
i
=
1
p
⋅
t
i
2
⋅
h
i
i
1
−
h
i
i
.
{\displaystyle {\begin{aligned}D_{i}&={\frac {e_{i}^{2}}{ps^{2}}}\cdot {\frac {h_{ii}}{(1-h_{ii})^{2}}}={\frac {1}{p}}\cdot {\frac {e_{i}^{2}}{{1 \over n-p}\sum _{j=1}^{n}{\widehat {\varepsilon \,}}_{j}^{\,2}(1-h_{ii})}}\cdot {\frac {h_{ii}}{1-h_{ii}}}\\[5pt]&={\frac {1}{p}}\cdot t_{i}^{2}\cdot {\frac {h_{ii}}{1-h_{ii}}}.\end{aligned}}}
最後の定式化の利点は、 と の関係が明確に示されていることです (p と n はすべての観測値で同じです)。 が大きい場合、 は( の値が極端でない場合 )増加します 。 が 0 に近い場合は は 小さくなり、 が 1 に近い場合は は 非常に大きくなります( 、つまり、観測値 が観測値なしで適合された回帰直線上に正確に存在しない限り )。
t
i
2
{\displaystyle t_{i}^{2}}
h
i
i
{\displaystyle h_{ii}}
D
i
{\displaystyle D_{i}}
t
i
2
{\displaystyle t_{i}^{2}}
h
i
i
{\displaystyle h_{ii}}
D
i
{\displaystyle D_{i}}
h
i
i
{\displaystyle h_{ii}}
D
i
{\displaystyle D_{i}}
h
i
i
{\displaystyle h_{ii}}
D
i
{\displaystyle D_{i}}
t
i
2
>
0
{\displaystyle t_{i}^{2}>0}
i
{\displaystyle i}
i
{\displaystyle i}
D
i
{\displaystyle D_{i}}
は、次の関係を通じて DFFITS と関連しています( は 外部 スチューデント化残差であり 、 は ここで 定義されていることに注意してください )。
σ
^
σ
^
(
i
)
t
i
=
t
i
(
i
)
{\displaystyle {{\widehat {\sigma }} \over {\widehat {\sigma }}_{(i)}}t_{i}=t_{i(i)}}
σ
^
,
σ
^
(
i
)
{\displaystyle {\widehat {\sigma }},{\widehat {\sigma }}_{(i)}}
D
i
=
1
p
⋅
t
i
2
⋅
h
i
i
1
−
h
i
i
=
1
p
⋅
σ
^
(
i
)
2
σ
^
2
⋅
σ
^
2
σ
^
(
i
)
2
⋅
t
i
2
⋅
h
i
i
1
−
h
i
i
=
1
p
⋅
σ
^
(
i
)
2
σ
^
2
⋅
(
t
i
(
i
)
h
i
i
1
−
h
i
i
)
2
=
1
p
⋅
σ
^
(
i
)
2
σ
^
2
⋅
DFFITS
2
{\displaystyle {\begin{aligned}D_{i}&={\frac {1}{p}}\cdot t_{i}^{2}\cdot {\frac {h_{ii}}{1-h_{ii}}}\\&={\frac {1}{p}}\cdot {\frac {{\widehat {\sigma }}_{(i)}^{2}}{{\widehat {\sigma }}^{2}}}\cdot {\frac {{\widehat {\sigma }}^{2}}{{\widehat {\sigma }}_{(i)}^{2}}}\cdot t_{i}^{2}\cdot {\frac {h_{ii}}{1-h_{ii}}}={\frac {1}{p}}\cdot {\frac {{\widehat {\sigma }}_{(i)}^{2}}{{\widehat {\sigma }}^{2}}}\cdot \left(t_{i(i)}{\sqrt {\frac {h_{ii}}{1-h_{ii}}}}\right)^{2}\\&={\frac {1}{p}}\cdot {\frac {{\widehat {\sigma }}_{(i)}^{2}}{{\widehat {\sigma }}^{2}}}\cdot {\text{DFFITS}}^{2}\end{aligned}}}
D
i
{\displaystyle D_{i}}
パラメータの妥当な値の領域を表す信頼楕円体内での推定値の移動する距離として解釈できます。 [ 説明が必要 ] これは、特定の観測が回帰分析に含まれるか除外されるかのケース間の回帰パラメータの推定値の変化に関して、クックの距離の代替的だが同等の表現によって示されます。
の代替案 が提案されています。単一の観測がモデル全体に及ぼす影響を考慮する代わりに、統計は、元のデータセット内の各観測の削除に対して、番目の観測 の予測がどの程度敏感であるかの尺度として機能します 。これは、すべてのデータポイントのの重み付き線形結合として定式化できます 。ここでも、 必要な重みを取得する計算に
投影行列が含まれます。
D
i
{\displaystyle D_{i}}
S
i
{\displaystyle S_{i}}
i
{\displaystyle i}
D
j
{\displaystyle D_{j}}
S
i
=
∑
j
=
1
n
(
y
^
i
−
y
^
i
(
j
)
)
2
p
s
2
h
i
i
=
∑
j
=
1
n
h
i
j
2
⋅
D
j
h
i
i
⋅
h
j
j
=
∑
j
=
1
n
ρ
i
j
2
⋅
D
j
{\displaystyle S_{i}={\frac {\sum _{j=1}^{n}\left({\widehat {y}}_{i}-{{\widehat {y}}_{i}}_{(j)}\right)^{2}}{ps^{2}h_{ii}}}=\sum _{j=1}^{n}{\frac {h_{ij}^{2}\cdot D_{j}}{h_{ii}\cdot h_{jj}}}=\sum _{j=1}^{n}\rho _{ij}^{2}\cdot D_{j}}
この文脈では、 ( )は予測値 と [a] の相関に似ています 。
とは対照的に 、大きなサンプルサイズと多くの予測変数を持つモデルでは、の分布は漸近 的に正規分布します。外れ値がない場合、の期待値は およそ です 。影響力のある観測値は、次の場合に特定できます。
ρ
i
j
{\displaystyle \rho _{ij}}
≤
1
{\displaystyle \leq 1}
y
^
i
{\displaystyle {\widehat {y\,}}_{i}}
y
^
j
{\displaystyle {\widehat {y\,}}_{j}}
D
i
{\displaystyle D_{i}}
S
i
{\displaystyle S_{i}}
S
i
{\displaystyle S_{i}}
p
−
1
{\displaystyle p^{-1}}
|
S
i
−
med
(
S
)
|
≥
4.5
⋅
MAD
(
S
)
{\displaystyle \left|S_{i}-\operatorname {med} (S)\right|\geq 4.5\cdot \operatorname {MAD} (S)}
は 元のデータセット内の すべての値の 中央値、 中央 絶対偏差 は として 表されます。つまり、 の分布の位置と 規模の堅牢な尺度です 。係数 4.5 は、その中心の周りの の約 3 標準偏差 をカバーします。
クックの距離と比較すると、 は、が失敗した マスキング効果が存在する場合でも、高および中程度のてこ比の外れ値に対して優れたパフォーマンスを発揮することがわかりました 。 [12]
興味深いことに、 と は密接に関連しています。これは、どちらも、 番目のデータポイント の削除が 番目の予測に与える影響を保持する 行列で表すことができるためです 。
med
(
S
)
{\displaystyle \operatorname {med} (S)}
MAD
(
S
)
{\displaystyle \operatorname {MAD} (S)}
S
{\displaystyle S}
S
i
{\displaystyle S_{i}}
S
{\displaystyle S}
S
i
{\displaystyle S_{i}}
D
i
{\displaystyle D_{i}}
D
i
{\displaystyle D_{i}}
S
i
{\displaystyle S_{i}}
T
{\displaystyle \mathbf {T} }
j
{\displaystyle j}
i
{\displaystyle i}
T
=
[
y
^
1
−
y
^
1
(
1
)
y
^
1
−
y
^
1
(
2
)
y
^
1
−
y
^
1
(
3
)
⋯
y
^
1
−
y
^
1
(
n
−
1
)
y
^
1
−
y
^
1
(
n
)
y
^
2
−
y
^
2
(
1
)
y
^
2
−
y
^
2
(
2
)
y
^
2
−
y
^
2
(
3
)
⋯
y
^
2
−
y
^
2
(
n
−
1
)
y
^
2
−
y
^
2
(
n
)
⋮
⋮
⋮
⋱
⋮
⋮
y
^
n
−
1
−
y
^
n
−
1
(
1
)
y
^
n
−
1
−
y
^
n
−
1
(
2
)
y
^
n
−
1
−
y
^
n
−
1
(
3
)
⋯
y
^
n
−
1
−
y
^
n
−
1
(
n
−
1
)
y
^
n
−
1
−
y
^
n
−
1
(
n
)
y
^
n
−
y
^
n
(
1
)
y
^
n
−
y
^
n
(
2
)
y
^
n
−
y
^
n
(
3
)
⋯
y
^
n
−
y
^
n
(
n
−
1
)
y
^
n
−
y
^
n
(
n
)
]
=
H
E
G
=
H
[
e
1
0
0
⋯
0
0
0
e
2
0
⋯
0
0
⋮
⋮
⋮
⋱
⋮
⋮
0
0
0
⋯
e
n
−
1
0
0
0
0
⋯
0
e
n
]
[
1
1
−
h
11
0
0
⋯
0
0
0
1
1
−
h
22
0
⋯
0
0
⋮
⋮
⋮
⋱
⋮
⋮
0
0
0
⋯
1
1
−
h
n
−
1
,
n
−
1
0
0
0
0
⋯
0
1
1
−
h
n
n
]
{\displaystyle {\begin{aligned}&\mathbf {T} =\left[{\begin{matrix}{\widehat {y}}_{1}-{{\widehat {y}}_{1}}_{\left(1\right)}&{\widehat {y}}_{1}-{{\widehat {y}}_{1}}_{\left(2\right)}&{\widehat {y}}_{1}-{{\widehat {y}}_{1}}_{\left(3\right)}&\cdots &{\widehat {y}}_{1}-{{\widehat {y}}_{1}}_{\left(n-1\right)}&{\widehat {y}}_{1}-{{\widehat {y}}_{1}}_{\left(n\right)}\\{\widehat {y}}_{2}-{{\widehat {y}}_{2}}_{\left(1\right)}&{\widehat {y}}_{2}-{{\widehat {y}}_{2}}_{\left(2\right)}&{\widehat {y}}_{2}-{{\widehat {y}}_{2}}_{\left(3\right)}&\cdots &{\widehat {y}}_{2}-{{\widehat {y}}_{2}}_{\left(n-1\right)}&{\widehat {y}}_{2}-{{\widehat {y}}_{2}}_{\left(n\right)}\\\vdots &\vdots &\vdots &\ddots &\vdots &\vdots \\{\widehat {y}}_{n-1}-{{\widehat {y}}_{n-1}}_{\left(1\right)}&{\widehat {y}}_{n-1}-{{\widehat {y}}_{n-1}}_{\left(2\right)}&{\widehat {y}}_{n-1}-{{\widehat {y}}_{n-1}}_{\left(3\right)}&\cdots &{\widehat {y}}_{n-1}-{{\widehat {y}}_{n-1}}_{\left(n-1\right)}&{\widehat {y}}_{n-1}-{{\widehat {y}}_{n-1}}_{\left(n\right)}\\{\widehat {y}}_{n}-{{\widehat {y}}_{n}}_{\left(1\right)}&{\widehat {y}}_{n}-{{\widehat {y}}_{n}}_{\left(2\right)}&{\widehat {y}}_{n}-{{\widehat {y}}_{n}}_{\left(3\right)}&\cdots &{\widehat {y}}_{n}-{{\widehat {y}}_{n}}_{\left(n-1\right)}&{\widehat {y}}_{n}-{{\widehat {y}}_{n}}_{\left(n\right)}\end{matrix}}\right]\\\\&\ \ =\mathbf {H} \mathbf {E} \mathbf {G} =\mathbf {H} \left[{\begin{matrix}e_{1}&0&0&\cdots &0&0\\0&e_{2}&0&\cdots &0&0\\\vdots &\vdots &\vdots &\ddots &\vdots &\vdots \\0&0&0&\cdots &e_{n-1}&0\\0&0&0&\cdots &0&e_{n}\end{matrix}}\right]\left[{\begin{matrix}{\frac {1}{1-h_{11}}}&0&0&\cdots &0&0\\0&{\frac {1}{1-h_{22}}}&0&\cdots &0&0\\\vdots &\vdots &\vdots &\ddots &\vdots &\vdots \\0&0&0&\cdots &{\frac {1}{1-h_{n-1,n-1}}}&0\\0&0&0&\cdots &0&{\frac {1}{1-h_{nn}}}\end{matrix}}\right]\end{aligned}}}
手元に あるのは、 次の式で与えられます。
T
{\displaystyle \mathbf {T} }
D
{\displaystyle \mathbf {D} }
D
=
[
D
1
D
2
⋮
D
n
−
1
D
n
]
=
1
p
s
2
diag
(
T
T
T
)
=
1
p
s
2
diag
(
G
E
H
T
H
E
G
)
=
diag
(
M
)
{\displaystyle \mathbf {D} =\left[{\begin{matrix}D_{1}\\D_{2}\\\vdots \\D_{n-1}\\D_{n}\end{matrix}}\right]={\frac {1}{ps^{2}}}\operatorname {diag} \left(\mathbf {T} ^{\mathsf {T}}\mathbf {T} \right)={\frac {1}{ps^{2}}}\operatorname {diag} \left(\mathbf {G} \mathbf {E} \mathbf {H} ^{\mathsf {T}}\mathbf {H} \mathbf {E} \mathbf {G} \right)=\operatorname {diag} (\mathbf {M} )}
ここで、 は 対称かつべき等 です が 、 必ずしもそうとは 限りません 。対照的に、は次 のように計算できます。
H
T
H
=
H
{\displaystyle \mathbf {H} ^{\mathsf {T}}\mathbf {H} =\mathbf {H} }
H
{\displaystyle \mathbf {H} }
S
{\displaystyle \mathbf {S} }
S
=
[
S
1
S
2
⋮
S
n
−
1
S
n
]
=
1
p
s
2
F
diag
(
T
T
T
)
=
1
p
s
2
[
1
h
11
0
0
⋯
0
0
0
1
h
22
0
⋯
0
0
⋮
⋮
⋮
⋱
⋮
⋮
0
0
0
⋯
1
h
n
−
1
n
−
1
0
0
0
0
⋯
0
1
h
n
n
]
diag
(
T
T
T
)
=
1
p
s
2
F
diag
(
H
E
G
G
E
H
T
)
=
F
diag
(
P
)
{\displaystyle {\begin{aligned}&\mathbf {S} =\left[{\begin{matrix}S_{1}\\S_{2}\\\vdots \\S_{n-1}\\S_{n}\end{matrix}}\right]={\frac {1}{ps^{2}}}\mathbf {F} \operatorname {diag} \left(\mathbf {T} \mathbf {T} ^{\mathsf {T}}\right)={\frac {1}{ps^{2}}}\left[{\begin{matrix}{\frac {1}{h_{11}}}&0&0&\cdots &0&0\\0&{\frac {1}{h_{22}}}&0&\cdots &0&0\\\vdots &\vdots &\vdots &\ddots &\vdots &\vdots \\0&0&0&\cdots &{\frac {1}{h_{n-1n-1}}}&0\\0&0&0&\cdots &0&{\frac {1}{h_{nn}}}\end{matrix}}\right]\operatorname {diag} \left(\mathbf {T} \mathbf {T} ^{\mathsf {T}}\right)\\\\&\ \ ={\frac {1}{ps^{2}}}\mathbf {F} \operatorname {diag} \left(\mathbf {H} \mathbf {E} \mathbf {G} \mathbf {G} \mathbf {E} \mathbf {H} ^{\mathsf {T}}\right)=\mathbf {F} \operatorname {diag} (\mathbf {P} )\end{aligned}}}
ここで、は 正方行列の主対角成分を抽出します 。この文脈では、は 影響行列と呼ばれ、は いわゆる感度行列に似ています。 と の 固有ベクトル解析は 、 どちらも同じ固有値を共有しており、外れ値検出のツールとして機能しますが、感度行列の固有ベクトルの方が強力です。 [13]
diag
(
A
)
{\displaystyle \operatorname {diag} (\mathbf {A} )}
A
{\displaystyle \mathbf {A} }
M
=
p
−
1
s
−
2
G
E
H
T
H
E
G
{\displaystyle \mathbf {M} =p^{-1}s^{-2}\mathbf {G} \mathbf {E} \mathbf {H} ^{\mathsf {T}}\mathbf {H} \mathbf {E} \mathbf {G} }
P
=
p
−
1
s
−
2
H
E
G
G
E
H
T
{\displaystyle \mathbf {P} =p^{-1}s^{-2}\mathbf {H} \mathbf {E} \mathbf {G} \mathbf {G} \mathbf {E} \mathbf {H} ^{\mathsf {T}}}
M
{\displaystyle \mathbf {M} }
P
{\displaystyle \mathbf {P} }
ソフトウェア実装
R 、 Python 、 Julia などの多くのプログラムや統計パッケージには 、Cook の距離の実装が含まれています。
拡張機能
高次元影響尺度(HIM)は、クックの距離の代替手段です (つまり、観測値よりも予測変数が多い場合)。 [14] クックの距離は、最小二乗回帰係数推定値に対する個々の観測値の影響を定量化しますが、HIMは、観測値が限界相関に与える影響を測定します。
p
>
n
{\displaystyle p>n}
参照
注記
^ 通常の線形回帰では 投影行列 が対称であるため、指標 とが 元の出版物ではしばしば入れ替わっています。つまり、 です 。これは常に当てはまるとは限らないため、例えば加重線形回帰では、潜在的な非対称性を考慮して指標をここで一貫して記述し、直接使用できるようにしています。
i
{\displaystyle i}
j
{\displaystyle j}
H
{\displaystyle \mathbf {H} }
h
i
j
=
h
j
i
{\displaystyle h_{ij}=h_{ji}}
参考文献
^ メンデンホール、ウィリアム、シンシッチ、テリー (1996)。 統計学第2コース:回帰分析 (第5版)。アッパーサドルリバー、ニュージャージー:プレンティスホール。p. 422。ISBN 0-13-396821-9 外れ値の観測が推定係数に及ぼす全体的な影響の尺度は 、RD Cook (1979) によって提案されました。Cook の距離 D i は 次のように計算されます...
β
{\displaystyle \beta }
^ Cook, R. Dennis (1977 年 2 月). 「線形回帰における影響力のある観測値の検出」. Technometrics . 19 (1). American Statistical Association : 15–18. doi :10.2307/1268249. JSTOR 1268249. MR 0436478.
^ Cook, R. Dennis (1979 年 3 月). 「線形回帰における影響力のある観察」. Journal of the American Statistical Association . 74 (365). American Statistical Association: 169–174. doi :10.2307/2286747. hdl : 11299/199280 . JSTOR 2286747. MR 0529533.
^ 林文夫(2000年)『計量経済学』プリンストン大学出版局、pp.21-23、 ISBN 1400823838 。
^ abc 「クックの距離」。
^ 「統計512: 応用線形モデル」 (PDF) 。 パデュー大学 。 2016年11月30日時点の オリジナル (PDF)からアーカイブ。 2016年3月25日 閲覧 。
^ Bollen, Kenneth A. ; Jackman, Robert W. (1990)。「回帰診断: 外れ値と影響力のあるケースの説明的扱い」。Fox, John、 Long, J. Scott (編)。 現代のデータ分析方法 。ニューベリーパーク、カリフォルニア州: Sage。pp. 266。ISBN 0-8039-3366-5 。
^ Cook, R. Dennis; Weisberg, Sanford (1982). 「回帰における残差と影響」ニューヨーク、NY: Chapman & Hall. hdl :11299/37076. ISBN 0-412-24280-X 。
^ Kim, Myung Geun (2017年5月31日). 「Cookの距離の使用に関する注意点」. Communications for Statistical Applications and Methods . 24 (3): 317–324. doi : 10.5351/csam.2017.24.3.317 . ISSN 2383-4757.
^ 回帰分析における削除診断統計について
^ペーニャ、ダニエル (2005)。「線形 回帰 における影響に関する新しい統計」。 テクノ メトリクス 。47 (1)。 アメリカ品質協会 および アメリカ統計協会 : 1–12。doi :10.1198/004017004000000662。S2CID 1802937 。
^ ペーニャ、ダニエル (2006). ファム、ホアン (編). シュプリンガー ハンドブック オブ エンジニアリング 統計. シュプリンガー ロンドン. pp. 523–536. doi :10.1007/978-1-84628-288-1. ISBN 978-1-84628-288-1 . S2CID 60460007。
^ 高次元影響度測定
さらに読む
アトキンソン、アンソニー、リアニ、マルコ (2000)。「欠失診断」。 ロバスト診断と回帰分析 。ニューヨーク: シュプリンガー。pp. 22–25。ISBN 0-387-95017-6 。
Heiberger, Richard M.; Holland, Burt (2013)。「ケース統計」。 統計分析とデータ表示 。Springer Science & Business Media。pp. 312–27。ISBN 9781475742848 。
Krasker, William S.; Kuh, Edwin ; Welsch, Roy E. (1983). 「ダーティデータと欠陥のあるモデルの推定」. 計量経済学ハンドブック . 第 1 巻. Elsevier. pp. 651–698. doi :10.1016/S1573-4412(83)01015-6. ISBN 9780444861856 。
Aguinis, Herman; Gottfredson, Ryan K.; Joo, Harry (2013). 「外れ値の定義、識別、および処理に関するベストプラクティスの推奨事項」。Organizational Research Methods . 16 (2). Sage: 270–301. doi :10.1177/1094428112470848. S2CID 54916947 . 2015年 12月4日 閲覧 。