ジャックナイフ再サンプリングの概略図 統計学 において、ジャックナイフ法 (ジャックナイフ交差検証法)は交差検証手法であり、したがって リサンプリング の一種です。特にバイアス と分散の 推定に役立ちます。ジャックナイフ法は、ブートストラップ法 などの他の一般的なリサンプリング手法よりも古くから存在します。サンプルサイズが与えられた場合、n {\displaystyle n} ジャックナイフ推定量は 、サイズ の各サブサンプルからのパラメータ推定値を集計することによって構築できます。( n − 1 ) {\displaystyle (n-1)} 1 つの観測値を省略することによって得られる。 ジャックナイフはブートストラップ の線形近似である。
ジャックナイフ技法は、モーリス・クヌイユ (1924~1973)によって1949年から開発され、1956年に改良されました。ジョン・テューキーは 1958年にこの技法を拡張し、「ジャックナイフ」という名前を提案しました。これは、物理的なジャックナイフ(コンパクトな折りたたみナイフ)のように、 特定 の問題には専用の道具でより効率的に解決できる場合でも、さまざまな問題に対して即席の解決策を提供できる粗雑な道具だからです。
簡単な例:平均値の推定 パラメータのジャックナイフ推定量は、データセットから各観測値を系統的に除外し、残りの観測値についてパラメータ推定値を計算し、これらの計算結果を集計することによって求められます。
例えば、推定するパラメータが確率変数の母平均である場合x {\displaystyle x} すると、与えられたiid 観測値のセットに対してx 1 、 。 。 。 、 x n {\displaystyle x_{1},...,x_{n}} 自然な推定値は標本平均である。 x ¯ = 1 n ∑ 私 = 1 n x 私 = 1 n ∑ 私 ∈ [ n ] x 私 、 {\displaystyle {\bar {x}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}={\frac {1}{n}}\sum _{i\in [n]}x_{i},} 最後の合計は、インデックスを示す別の方法を使用していました私 {\displaystyle i} セットの上を走る[ n ] = { 1 、 … 、 n } {\displaystyle [n]=\{1,\ldots ,n\}} 。
次に、以下のように進めます。私 ∈ [ n ] {\displaystyle i\in [n]} 平均を計算しますx ¯ ( 私 ) \displaystyle {\bar {x}}_{(i)}} ジャックナイフサブサンプルのうち、私 {\displaystyle i} これは 番目のデータポイントであり、私 {\displaystyle i} -th ジャックナイフ複製: x ¯ ( 私 ) = 1 n − 1 ∑ j ∈ [ n ] 、 j ≠ 私 x j 、 私 = 1 、 … 、 n 。 {\displaystyle {\bar {x}}_{(i)}={\frac {1}{n-1}}\sum _{j\in [n],j\neq i}x_{j},\qquad i=1,\dots ,n.}
これらについて考えることが役立つかもしれないn {\displaystyle n} ジャックナイフの複製x ¯ ( 1 ) 、 … 、 x ¯ ( n ) \displaystyle {\bar {x}}_{(1)},\ldots ,{\bar {x}}_{(n)}} 標本平均の分布を近似するx ¯ {\displaystyle {\bar {x}}} より大きなn {\displaystyle n} 近似精度が向上します。そして最後にジャックナイフ推定量を得るために、n {\displaystyle n} ジャックナイフ法による複製結果を平均化する。 x ¯ ジャック = 1 n ∑ 私 = 1 n x ¯ ( 私 ) 。 {\displaystyle {\bar {x}}_{\text{jack}}={\frac {1}{n}}\sum _{i=1}^{n}{\bar {x}}_{(i)}.}
バイアスと分散について質問するかもしれないx ¯ ジャック {\displaystyle {\bar {x}}_{\text{jack}}} 定義からx ¯ ジャック {\displaystyle {\bar {x}}_{\text{jack}}} ジャックナイフの複製の平均として、明示的に計算を試みることができる。バイアスは簡単な計算だが、分散はx ¯ ジャック {\displaystyle {\bar {x}}_{\text{jack}}} ジャックナイフ複製は独立していないため、より複雑になります。
平均値の特殊なケースでは、ジャックナイフ推定値が通常の推定値と等しいことを明示的に示すことができる。 1 n ∑ 私 = 1 n x ¯ ( 私 ) = x ¯ 。 {\displaystyle {\frac {1}{n}}\sum _{i=1}^{n}{\bar {x}}_{(i)}={\bar {x}}.} これによりアイデンティティが確立されるx ¯ ジャック = x ¯ {\displaystyle {\bar {x}}_{\text{jack}}={\bar {x}}} 期待値を取ると、E [ x ¯ ジャック ] = E [ x ¯ ] = E [ x ] {\displaystyle E[{\bar {x}}_{\text{jack}}]=E[{\bar {x}}]=E[x]} 、 それでx ¯ ジャック {\displaystyle {\bar {x}}_{\text{jack}}} は不偏ですが、分散を取ると、V [ x ¯ ジャック ] = V [ x ¯ ] = V [ x ] / n {\displaystyle V[{\bar {x}}_{\text{jack}}]=V[{\bar {x}}]=V[x]/n} しかし、これらの性質は一般的に平均値以外のパラメータには当てはまりません。
平均値推定の場合のこの単純な例は、ジャックナイフ推定量の構築方法を説明するためのものであり、真の微妙な点(および有用性)は、平均値よりも高いモーメントや分布の他の関数など、他のパラメータを推定する場合に明らかになります。
x ¯ ジャック {\displaystyle {\bar {x}}_{\text{jack}}} バイアスの経験的推定値を構築するために使用できるx ¯ {\displaystyle {\bar {x}}} すなわちバイアス ^ ( x ¯ ) ジャック = c ( x ¯ ジャック − x ¯ ) {\displaystyle {\widehat {\operatorname {bias} }}({\bar {x}})_{\text{jack}}=c({\bar {x}}_{\text{jack}}-{\bar {x}})} 適切な係数を用いてc > 0 {\displaystyle c>0} ただし、この場合は次のことがわかっています。x ¯ ジャック = x ¯ {\displaystyle {\bar {x}}_{\text{jack}}={\bar {x}}} したがって、この構成は意味のある知識を追加するものではありませんが、バイアスの正しい推定値(ゼロ)を与えます。
分散のジャックナイフ推定x ¯ {\displaystyle {\bar {x}}} ジャックナイフ法の反復実験の分散から計算できるx ¯ ( 私 ) \displaystyle {\bar {x}}_{(i)}} : [ 5 ] 変数 ^ ( x ¯ ) ジャック = n − 1 n ∑ 私 = 1 n ( x ¯ ( 私 ) − x ¯ ジャック ) 2 = 1 n ( n − 1 ) ∑ 私 = 1 n ( x 私 − x ¯ ) 2 。 \displaystyle {\widehat {\operatorname {var} }}({\bar {x}})_{\text{jack}}={\frac {n-1}{n}}\sum _{i=1}^{n}({\bar {x}}_{(i)}-{\bar {x}}_{\text{jack}})^{2}={\frac {1}{n(n-1)}}\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}.} 左側の等式は推定量を定義する変数 ^ ( x ¯ ) ジャック {\displaystyle {\widehat {\operatorname {var} }}({\bar {x}})_{\text{jack}}} そして、正しい等式は直接検証可能な同一性である。次に期待値を取ると、E [ 変数 ^ ( x ¯ ) ジャック ] = V [ x ] / n = V [ x ¯ ] {\displaystyle E[{\widehat {\operatorname {var} }}({\bar {x}})_{\text{jack}}]=V[x]/n=V[{\bar {x}}]} なので、これは分散の不偏推定量です。x ¯ {\displaystyle {\bar {x}}} 。
推定量のバイアスを推定する ジャックナイフ法は、サンプル全体にわたって計算された推定量のバイアスを推定(および補正)するために使用できる。
仮定するθ {\displaystyle \theta } は関心のある目標パラメータであり、 の分布の何らかの関数であると仮定される。x {\displaystyle x} 限られた数の観測結果に基づくx 1 、 。 。 。 、 x n {\displaystyle x_{1},...,x_{n}} これは、iid の コピーで構成されていると想定される。x {\displaystyle x} 推定器θ ^ {\displaystyle {\hat {\theta }}} 構築される:
θ ^ = f n ( x 1 、 … 、 x n ) 。 {\displaystyle {\hat {\theta }}=f_{n}(x_{1},\ldots ,x_{n}).} 価値θ ^ {\displaystyle {\hat {\theta }}} これはサンプルに依存するため、この値はランダムサンプルごとに変化します。
定義上、バイアスθ ^ {\displaystyle {\hat {\theta }}} 内容は以下のとおりです。
バイアス ( θ ^ ) = E [ θ ^ ] − θ 。 {\displaystyle {\text{bias}}({\hat {\theta }})=E[{\hat {\theta }}]-\theta .} いくつか値を計算したい場合もあるθ ^ {\displaystyle {\hat {\theta }}} 複数のサンプルから平均して、経験的な近似値を計算する。E [ θ ^ ] {\displaystyle E[{\hat {\theta }}]} しかし、利用可能な観測値の全セットが「他のサンプル」でない場合、これは不可能です。x 1 、 。 。 。 、 x n {\displaystyle x_{1},...,x_{n}} 計算に使用されましたθ ^ {\displaystyle {\hat {\theta }}} このような状況では、ジャックナイフ法によるリサンプリングが役立つ場合があります。
ジャックナイフの複製を製作します。
θ ^ ( 1 ) = f n − 1 ( x 2 、 x 3 … 、 x n ) {\displaystyle {\hat {\theta }}_{(1)}=f_{n-1}(x_{2},x_{3}\ldots ,x_{n})} θ ^ ( 2 ) = f n − 1 ( x 1 、 x 3 、 … 、 x n ) {\displaystyle {\hat {\theta }}_{(2)}=f_{n-1}(x_{1},x_{3},\ldots ,x_{n})} ⋮ {\displaystyle \vdots } θ ^ ( n ) = f n − 1 ( x 1 、 x 2 、 … 、 x n − 1 ) {\displaystyle {\hat {\theta }}_{(n)}=f_{n-1}(x_{1},x_{2},\ldots ,x_{n-1})} ここで、各複製は、データポイントのうち1つを除くすべてからなるジャックナイフサブサンプルに基づく「リーブワンアウト」推定値である。
θ ^ ( 私 ) = f n − 1 ( x 1 、 … 、 x 私 − 1 、 x 私 + 1 、 … 、 x n ) 私 = 1 、 … 、 n 。 {\displaystyle {\hat {\theta }}_{(i)}=f_{n-1}(x_{1},\ldots ,x_{i-1},x_{i+1},\ldots ,x_{n})\quad \quad i=1,\dots ,n.} 次に、それらの平均値を定義します。
θ ^ j 1 c k = 1 n ∑ 私 = 1 n θ ^ ( 私 ) {\displaystyle {\hat {\theta }}_{\mathrm {jack} }={\frac {1}{n}}\sum _{i=1}^{n}{\hat {\theta }}_{(i)}} バイアスのジャックナイフ推定θ ^ {\displaystyle {\hat {\theta }}} 次のように与えられます。
バイアス ^ ( θ ^ ) j 1 c k = ( n − 1 ) ( θ ^ j 1 c k − θ ^ ) {\displaystyle {\widehat {\text{bias}}}({\hat {\theta }})_{\mathrm {jack} }=(n-1)({\hat {\theta }}_{\mathrm {jack} }-{\hat {\theta }})} そして、結果として得られるバイアス補正ジャックナイフ推定値はθ {\displaystyle \theta } 次のように与えられます。
θ ^ ジャック * = θ ^ − バイアス ^ ( θ ^ ) j 1 c k = n θ ^ − ( n − 1 ) θ ^ j 1 c k 。 {\displaystyle {\hat {\theta }}_{\text{jack}}^{*}={\hat {\theta }}-{\widehat {\text{bias}}}({\hat {\theta }})_{\mathrm {jack} }=n{\hat {\theta }}-(n-1){\hat {\theta }}_{\mathrm {jack} }.} これは、バイアスがO ( n − 1 ) {\displaystyle O(n^{-1})} そしてそれをO ( n − 2 ) {\displaystyle O(n^{-2})} その他の場合。
推定量の分散を推定する ジャックナイフ法は、標本全体にわたって計算された推定量の分散を推定するためにも使用できます。
文学 Berger, YG (2007). "不均等な確率を持つ単段階層化標本に対するジャックナイフ分散推定量". Biometrika . 94 (4): 953–964 . doi : 10.1093/biomet/asm072 . Berger, YG; Rao, JNK (2006). "不等確率サンプリングにおける補完のための調整済みジャックナイフ法(非復元抽出)" . Journal of the Royal Statistical Society, Series B. 68 ( 3): 531– 547. doi : 10.1111/j.1467-9868.2006.00555.x . Berger, YG; Skinner, CJ (2005). "不均等確率サンプリングのためのジャックナイフ分散推定量". Journal of the Royal Statistical Society, Series B. 67 ( 1): 79–89 . doi : 10.1111/j.1467-9868.2005.00489.x . Jiang, J.; Lahiri, P.; Wan, SM. (2002). "M推定による経験的最適予測のための統一ジャックナイフ理論" .統計学年報 . 30 (6): 1782–810 . doi : 10.1214/aos/1043351257 . Jones, HL (1974). "層別平均の関数のジャックナイフ推定". Biometrika . 61 (2): 343– 348. doi : 10.2307/2334363 . JSTOR 2334363 . Kish, L.; Frankel, MR (1974). 「複雑な標本からの推論」. Journal of the Royal Statistical Society, Series B. 36 ( 1): 1–37 . Krewski, D.; Rao, JNK (1981). "層別標本からの推論: 線形化法、ジャックナイフ法、バランス反復複製法の特性" .統計学年報 . 9 (5): 1010– 1019. doi : 10.1214/aos/1176345580 . ミネソタ州クヌイユ(1956年)。 「推定の偏りに関する注意事項」。バイオメトリカ 。43 ( 3–4 ): 353–360 .土井 : 10.1093/biomet/43.3-4.353。 Rao, JNK; Shao, J. (1992). "ホットデック補完による調査データを用いたジャックナイフ分散推定". Biometrika . 79 (4): 811– 822. doi : 10.1093/biomet/79.4.811 . Rao, JNK; Wu, CFJ; Yue, K. (1992). 「複雑な調査のためのリサンプリング方法に関する最近の研究」. Survey Methodology . 18 (2): 209–217 . Shao, J. および Tu, D. (1995). ジャックナイフ法とブートストラップ法. Springer-Verlag, Inc. Tukey, JW (1958). 「それほど大きくないサンプルにおけるバイアスと信頼性(要旨)」. The Annals of Mathematical Statistics . 29 (2): 614.Wu, CFJ (1986). 「回帰分析におけるジャックナイフ法、ブートストラップ法、その他のリサンプリング法」 . The Annals of Statistics . 14 (4): 1261– 1295. doi : 10.1214/aos/1176350142 .
注記 ↑ McIntosh, Avery I. 「ジャックナイフ推定法」 (PDF) . ボストン大学 . Avery I. McIntosh. p. 3. 2016年5月14日に オリジナル (PDF) からアーカイブ済み。 2016年4月30日 取得 。
参考文献 エフロン、 ブラッドリー、ティビシラニ、RJ (1994)。ブートストラップ入門 。チャップマン・アンド・ホール/CRC。ISBN 9780412042317 。キャメロン、エイドリアン;トリヴェディ、プラヴィン・K. (2005).ミクロ計量経済学 :方法と応用 . ケンブリッジ、ニューヨーク:ケンブリッジ大学出版局. ISBN 9780521848053 。 エフロン、ブラッドリー ;スタイン、チャールズ(1981 年5 月 )。「分散のジャックナイフ推定」。統計学年報 。9 (3):586–596。doi : 10.1214 / aos / 1176345462。JSTOR 2240822 。 エフロン、ブラッドリー(1982)。ジャックナイフ法、ブートストラップ法、その他のリサンプリング法 。フィラデルフィア、ペンシルベニア州:応用数理学会。ISBN 9781611970319 。 Quenouille, Maurice H. (1949年9月). 「平面サンプリングの問題」 . The Annals of Mathematical Statistics . 20 (3): 355–375 . doi : 10.1214/aoms/1177729989 . JSTOR 2236533 . クヌイユ、モーリス H. (1956)。 「推定のバイアスに関する注意事項」。バイオメトリカ 。43 ( 3–4 ): 353–360 .土井 : 10.1093/biomet/43.3-4.353。JSTOR 2332914。 Tukey, John W. (1958). 「それほど大きくないサンプルにおけるバイアスと信頼度(要旨)」 . The Annals of Mathematical Statistics . 29 (2): 614. doi : 10.1214/aoms/1177706647 .