
コルモゴロフ・スミルノフ検定(K-S検定またはKS検定)は、連続(または不連続、セクション2.2を参照)な1次元確率分布の等式を検定するノンパラメトリック検定であり、標本が特定の参照確率分布から得られたかどうかを検定(1標本K-S検定)したり、2つの標本が同じ分布から得られたかどうかを検定(2標本K-S検定)するために使用できます。直感的には、この検定は「その確率分布から抽出された場合、このような標本のコレクションが見られる可能性はどれくらいですか?」、または2番目のケースでは「同じ(しかし未知の)確率分布から抽出された場合、このような2組の標本が見られる可能性はどれくらいですか?」という質問に定性的に答える方法を提供します。この検定は、 アンドレイ・コルモゴロフとニコライ・スミルノフにちなんで名付けられました。
コルモゴロフ・スミルノフ統計量は、サンプルの経験的分布関数と参照分布の累積分布関数との距離、または 2 つのサンプルの経験的分布関数間の距離を定量化します。この統計量の帰無分布は、サンプルが参照分布から抽出される (1 サンプルの場合) か、サンプルが同じ分布から抽出される (2 サンプルの場合) という帰無仮説に基づいて計算されます。1 サンプルの場合、帰無仮説に基づいて考慮される分布は、連続分布 (セクション 2 を参照)、完全に離散的、または混合分布 (セクション 2.2 を参照) のいずれかです。2 サンプルの場合 (セクション 3 を参照)、帰無仮説に基づいて考慮される分布は連続分布ですが、それ以外は制限されません。ただし、2 サンプル検定は、サンプル間の不連続性、異質性、および依存性を許容するより一般的な条件下で実行することもできます。[1]
2 サンプル K-S 検定は、2 つのサンプルの経験的累積分布関数の位置と形状の両方の違いに敏感であるため、2 つのサンプルを比較するための最も有用かつ一般的なノンパラメトリック手法の 1 つです。
コルモゴロフ–スミルノフ検定は、適合度検定として機能するように修正することができます。分布の正規性を検定する特殊なケースでは、標本を標準化し、標準正規分布と比較します。これは、参照分布の平均と分散を標本推定値と等しく設定することと同等であり、これらを使用して特定の参照分布を定義すると、検定統計量の帰無分布が変化することが知られています (推定パラメータによる検定を参照)。さまざまな研究により、この修正された形式であっても、この検定は正規性を検定する上でシャピロ–ウィルク検定やアンダーソン–ダーリング検定よりも強力ではないことがわかっています。[2]ただし、これらの他の検定には独自の欠点があります。たとえば、シャピロ–ウィルク検定は、多くの同一値を含む標本ではうまく機能しないことが知られています。
1標本コルモゴロフ・スミルノフ統計
n個の独立かつ同一分布(iid)の順序付けられた観測値X iに対する経験分布関数 F n は次のように定義される。
- ここで、は指示関数であり、 の場合は 1 、 以外の場合は 0 になります。
与えられた累積分布関数F ( x ) に対するコルモゴロフ・スミルノフ統計量は
ここで、sup x は距離セットの上限です。直感的には、この統計は、すべてのx値にわたって 2 つの分布関数間の最大絶対差を取ります。
グリヴェンコ・カンテリ定理によれば、サンプルが分布F ( x ) から得られる場合、Dnは、が無限大に近づく極限でほぼ確実に0 に収束します。コルモゴロフは、この収束率を効果的に提供することで、この結果を強化しました (コルモゴロフ分布を参照)。ドンスカーの定理は、さらに強力な結果を提供します。
実際には、統計では、帰無仮説を適切に棄却するために、 比較的多数のデータ ポイント (アンダーソン - ダーリング検定統計などの他の適合度基準と比較して) が必要になります。
コルモゴロフ分布

コルモゴロフ分布は、確率変数の分布である。
ここで、B ( t ) はブラウン橋である。Kの累積分布関数は[3]で与えられる。
これはヤコビのシータ関数 でも表すことができます。コルモゴロフ・スミルノフ検定統計量の形式と帰無仮説の下での漸近分布はアンドレイ・コルモゴロフによって発表されました。 [4]分布表はニコライ・スミルノフによって発表されました。[5]有限サンプルにおける検定統計量の分布の回帰関係が利用可能です。[4]
標本が仮定分布F ( x )から来ているという帰無仮説のもとでは、
分布 において、B ( t ) はブラウン橋です。Fが連続であれば、帰無仮説の下ではFに依存しないコルモゴロフ分布に収束します。この結果はコルモゴロフの定理としても知られています。
が有限のときの正確な累積分布関数の近似としてのこの極限の精度は、それほど印象的ではありません。 のときでさえ、対応する最大誤差は約 です。この誤差はのときは まで増加し、のときは まで全く受け入れられないほど大きくなります。しかし、を で 置き換えるという非常に単純な方法があります。
ヤコビシータ関数の引数では、これらの誤差はそれぞれ、、に減少します 。このような精度は通常、すべての実用的なアプリケーションで十分すぎるほどであると考えられます。[6]
適合度検定またはコルモゴロフ・スミルノフ検定は、コルモゴロフ分布の臨界値を使用して構築できます。この検定は、次の 場合に漸近的に有効です。
ここでK αは
このテストの漸近検出力は 1 です。
任意の および のcdfまたはその補数を計算する高速で正確なアルゴリズムは、以下から入手できます。
- [7]と[8]に はCとJavaのコードを含む連続ヌル分布が記載されている。[7]
- [9]純粋に離散的、混合的、または連続的なヌル分布については、統計計算のためのRプロジェクトのKSgeneralパッケージ[10]に実装されており、与えられたサンプルに対してKS検定統計量とそのp値も計算します。代替のC++実装はから入手できます。[9]
推定パラメータによるテスト
F ( x )の形かパラメータのいずれかがデータX iから決定される場合、このように決定された臨界値は無効です。そのような場合、モンテカルロ法または他の方法が必要になることがありますが、いくつかのケースについては表が用意されています。検定統計量に必要な修正と、正規分布と指数分布の臨界値の詳細は公開されており、[11]以降の出版物にはGumbel 分布も含まれています。[12] Lilliefors検定は、正規分布に対するこの特別なケースを表します。対数変換は、コルモゴロフ検定データが正規分布からのものであるという仮定に適合しないと思われるケースを克服するのに役立つ場合があります。
推定パラメータを使用すると、どの推定方法を使用するべきかという疑問が生じます。通常、これは最尤法ですが、たとえば正規分布の場合、 MLE はシグマに大きなバイアス誤差があります。代わりにモーメント適合または KS 最小化を使用すると、臨界値に大きな影響を与え、検定力にもいくらか影響を与えます。 KS 検定によって df = 2 の Student-T データに対してデータが正規分布かどうかを判断する必要がある場合、 H 0 (データは正規分布なので、スケールに標準偏差を使用) に基づく ML 推定では、最小 KS による適合よりもはるかに大きな KS 距離が得られます。この場合、 H 0 を拒否する必要があります。これは、 MLE の場合によくあるケースです。T-2 データの場合、サンプル標準偏差が非常に大きくなる可能性があるためです。ただし、 KS 最小化を使用すると、 H 0 を拒否するには KS が低すぎる場合があります。 Student-T の場合、 MLE の代わりに KS 推定を使用して修正した KS 検定を行うと、 KS 検定は確かにわずかに悪くなります。しかし、他の場合には、このように修正された KS テストにより、テストの検出力がわずかに向上します。[引用が必要]
離散分布と混合ヌル分布
が非減少かつ右連続であり、ジャンプの数が可算(おそらく無限)であるという仮定の下で、KS 検定統計量は次のように表すことができます。
の右連続性から、および であることがわかり、したがって の分布は帰無分布 に依存する、つまり、連続の場合のように分布フリーではなくなる。したがって、が純粋に離散的または混合的である場合に の正確な漸近分布を計算する高速で正確な方法が開発されており、 [9] C++ およびR 言語のKSgeneral パッケージ[10]で実装されている。関数、および は、純粋に離散的、混合的、または連続的な帰無分布および任意のサンプル サイズに対して、KS 検定統計量およびp 値も計算する。離散的な帰無分布および小さいサンプル サイズに対する KS 検定およびその p 値は、[13]でもR 言語の dgof パッケージの一部として計算されている。SAS 、[14]、Stata [ 15]などの主要な統計パッケージは、 が連続するという仮定の下で KS 検定を実装しており、帰無分布が実際には連続していない場合は、この仮定がより保守的になる ( [16] [17] [18]を参照)。
disc_ks_test()mixed_ks_test()cont_ks_test() PROC NPAR1WAY ksmirnov
2標本コルモゴロフ・スミルノフ検定

コルモゴロフ・スミルノフ検定は、2つの1次元確率分布が異なるかどうかを検定するためにも使用できます。この場合、コルモゴロフ・スミルノフ統計量は
ここで、 および はそれぞれ第 1 および第 2 サンプルの経験分布関数であり、 は上限関数です。
大規模なサンプルの場合、帰無仮説はレベル1で棄却される。
ここで、と はそれぞれ第1および第2のサンプルのサイズです。の値は、最も一般的なレベルの以下の表に示されています。
そして一般的に[ 19]
条件は次のようになります
ここでも、サンプル サイズが大きいほど、最小境界はより敏感になります。つまり、特定のサンプル サイズの比率 (例) に対して、最小境界はいずれかのサンプルのサイズに応じてその逆平方根に応じて変化します。
2標本検定では、2つのデータ標本が同じ分布から来ているかどうかをチェックすることに注意してください。これは、その共通分布が何であるか(正規分布かそうでないかなど)を指定するものではありません。この場合も、臨界値の表が公開されています。単変量コルモゴロフ・スミルノフ検定の欠点は、2つの分布関数間のあらゆる種類の差異に対して敏感になるように設計されているため、あまり強力ではないことです。[20] [21]もともと場所とスケールを同時に比較するために提案されたクッコーニ検定は、2つの分布関数を比較する場合、コルモゴロフ・スミルノフ検定よりもはるかに強力であると主張する人もいます。
2標本KS検定は、非対称効果の検出や自然実験の研究のために経済学に応用されてきた。[22]
分布関数の形状に対する信頼限界の設定
コルモゴロフ・スミルノフ検定は通常、与えられたF ( x ) がF n ( x )の基礎となる確率分布であるかどうかを検定するために使用されますが、この手順を逆にしてF ( x ) 自体の信頼限界を求めることもできます。検定統計量D αの臨界値を P( D n > D α ) = αとなるように選択すると、 F n ( x )の周囲の幅 ± D αの帯にF ( x ) が完全に含まれ、その確率は 1 − αになります。
多次元におけるコルモゴロフ・スミルノフ統計
分布に依存しない多変量コルモゴロフ・スミルノフ適合度検定は、Justel、Peña、Zamar(1997)によって提案されている。[23]この検定では、ローゼンブラット変換を使用して構築された統計量を使用し、2変量の場合にそれを計算するためのアルゴリズムが開発されている。また、任意の次元で簡単に計算できる近似検定も提示されている。
同様の検定を多変量データに適用する場合は、コルモゴロフ・スミルノフ検定統計量を修正する必要があります。これは簡単ではありません。2 つの結合累積分布関数の最大差は、一般的には相補分布関数の最大差と同じではないからです。したがって、最大差は、 またはあるいは他の 2 つの可能な配置のどちらを使用するかによって異なります。使用する検定の結果が、どの選択を行ったかによって左右されないようにする必要があるかもしれません。
上記の懸念事項を満たす、コルモゴロフ・スミルノフ統計量を高次元に一般化する 1 つの方法は、2 つのサンプルの cdf をすべての可能な順序で比較し、結果として得られる KS 統計量のセットの中で最大のものを取ることです。d 次元では、このような順序は 2 d − 1通りあります。このようなバリエーションの 1 つは Peacock [24] によるもので ( 3D バージョンについてはGosset [25]も参照)、もう 1 つは Fasano と Franceschini [26]によるものです(比較と計算の詳細については Lopes らを参照)。[27]検定統計量の臨界値はシミュレーションによって取得できますが、結合分布の依存構造に依存します。
1 次元では、コルモゴロフ - スミルノフ統計はいわゆるスター ディスクレパンシー D と同一であるため、高次元へのもう 1 つのネイティブ KS 拡張は、高次元でも D を使用するだけです。残念ながら、高次元ではスター ディスクレパンシーを計算するのは困難です。
2021年に多変量KS検定統計量の関数形が提案され、統計検定に必要な多変量KS検定統計量の裾確率を推定する問題が簡素化されました。多変量の場合、F i がk個の変数を持つ確率分布のi番目の連続周辺分布である場合、
したがって、限界分布は周辺分布に依存しません。[1]
実装
コルモゴロフ・スミルノフ検定は多くのソフトウェア プログラムに実装されています。そのほとんどは 1 サンプル検定と 2 サンプル検定の両方を実装しています。
- Mathematica にはKolmogorovSmirnovTest があります。
- MATLABの Statistics Toolbox には、それぞれ 1 サンプルおよび 2 サンプルの Kolmogorov–Smirnov 検定用の kstest と kstest2 があります。
- Rパッケージ「KSgeneral」[10]は、任意の離散分布、混合分布、連続分布の下でKS検定統計量とそのp値を計算します。
- Rの統計基本パッケージは、その「stats」パッケージ内で ks.test {stats} としてテストを実装します。
- SAS はPROC NPAR1WAY プロシージャでテストを実装します。
- Pythonでは、SciPyパッケージはscipy.stats.kstest関数でテストを実装しています。[28]
- SYSTAT (SPSS Inc.、イリノイ州シカゴ)
- JavaにはApache Commonsによって提供されるこのテストの実装があります。[29]
- KNIMEには上記のJava実装に基づいてこのテストを実装したノードがあります。[30]
- Juliaには、 ExactOneSampleKSTest(x::AbstractVector{<:Real}, d::UnivariateDistribution)関数を含むHypothesisTests.jlパッケージがあります。[31]
- StatsDirect (StatsDirect Ltd、英国マンチェスター) は、すべての一般的なバリアントを実装します。
- Stata(Stata Corporation、テキサス州カレッジステーション)は、ksmirnov(コルモゴロフ・スミルノフ分布等式検定)コマンドで検定を実装している。[32]
- PSPP は、KOLMOGOROV-SMIRNOV (または KS ショートカット関数を使用) でテストを実装します。
- Excel用のReal Statistics Resource PackはKSCRITおよびKSPROBとしてテストを実行します。[33]
参照
参考文献
- ^ ab Naaman, Michael (2021). 「多変量Dvoretzky-Kiefer-Wolfowitz不等式におけるタイト定数について」。 統計と確率の手紙。173 :109088。doi : 10.1016 / j.spl.2021.109088。S2CID 233844405。
- ^ Stephens, MA (1974). 「適合度といくつかの比較のための EDF 統計」アメリカ統計学会誌。69 ( 347 ): 730–737. doi :10.2307/2286009. JSTOR 2286009.
- ^ Marsaglia G、Tsang WW、Wang J ( 2003)。「コルモゴロフ分布の評価」。統計ソフトウェアジャーナル。8 (18): 1–4。doi : 10.18637/ jss.v008.i18。
- ^ ab コルモゴロフ A (1933)。 「配布の継続性を決定する」。G.Ist.イタル。アツアリ。4:83-91。
- ^ Smirnov N (1948). 「経験分布の適合度を推定するための表」. Annals of Mathematical Statistics . 19 (2): 279–281. doi : 10.1214/aoms/1177730256 .
- ^ Vrbik, Jan (2018). 「コルモゴロフ・スミルノフ検定統計量に対する小サンプル補正」.パイオニア理論・応用統計ジャーナル. 15 (1–2): 15–23.
- ^ ab Simard R, L'Ecuyer P (2011). 「両側コルモゴロフ・スミルノフ分布の計算」.統計ソフトウェアジャーナル. 39 (11): 1–18. doi : 10.18637/jss.v039.i11 .
- ^ Moscovich A, Nadler B (2017). 「ポアソン過程の境界交差確率の高速計算」.統計と確率の手紙. 123 :177–182. arXiv : 1503.04363 . doi :10.1016/j.spl.2016.11.027. S2CID 12868694.
- ^ abc Dimitrova DS、Kaishev VK 、 Tan S (2020)。「基礎となるcdfが純粋に離散、混合、または連続である場合のKolmogorov–Smirnov分布の計算」。Journal of Statistical Software。95 ( 10): 1–42。doi : 10.18637/ jss.v095.i10。
- ^ abc Dimitrova, Dimitrina; Yun, Jia; Kaishev, Vladimir; Tan, Senren (2024年5月21日). 「KSgeneral: KSgeneral: (不)連続ヌル分布に対する1サンプルKS検定と2サンプルKSおよびKuiper検定のP値の計算」CRAN.R-project.org/package=KSgeneral .
- ^ ピアソン、ES; ハートレー、HO、編 (1972)。統計学者のためのバイオメトリカ表。第2巻。ケンブリッジ大学出版局。pp. 117–123、表54、55。ISBN 978-0-521-06937-3。
- ^ Shorack, Galen R.; Wellner, Jon A. (1986).経験的プロセスと統計への応用. Wiley. p. 239. ISBN 978-0-471-86725-8。
- ^ Arnold, Taylor B.; Emerson, John W. (2011). 「離散ヌル分布のノンパラメトリック適合度検定」(PDF) . The R Journal . 3 (2): 34\[Dash]39. doi : 10.32614/rj-2011-016 .
- ^ 「SAS/STAT(R) 14.1 ユーザーズガイド」。support.sas.com 。 2018年4月14日閲覧。
- ^ 「ksmirnov — Kolmogorov–Smirnov 分布の等式検定」(PDF) . stata.com . 2018年4月14日閲覧。
- ^ Noether GE (1963). 「離散ケースにおけるコルモゴロフ統計量に関する注記」Metrika . 7 (1): 115–116. doi :10.1007/bf02613966. S2CID 120687545.
- ^ Slakter MJ (1965). 「ピアソンカイ2乗検定とコルモゴロフ適合度検定の妥当性に関する比較」アメリカ統計学会誌. 60 (311): 854–858. doi :10.2307/2283251. JSTOR 2283251.
- ^ Walsh JE (1963). 「離散データに対するコルモゴロフ・スミルノフおよび類似統計の有界確率特性」.統計数学研究所紀要. 15 (1): 153–158. doi :10.1007/bf02865912. S2CID 122547015.
- ^ 式 (15)、Knuth, DE, The Art of Computer Programming, Volume 2 (Seminumerical Algorithms), 3rd Edition, Addison Wesley, Reading Mass, 1998 のセクション 3.3.1。
- ^ Marozzi, Marco (2009). 「ロケーションスケールCucconi検定に関するいくつかの注釈」.ノンパラメトリック統計ジャーナル. 21 (5): 629–647. doi :10.1080/10485250902952435. S2CID 120038970.
- ^ Marozzi, Marco (2013). 「位置とスケールのテストのためのノンパラメトリック同時テスト:いくつかの方法の比較」. Communications in Statistics – Simulation and Computation . 42 (6): 1298–1317. doi :10.1080/03610918.2012.665546. S2CID 28146102.
- ^ Monge, Marco (2023). 「因果関係検定としての 2標本コルモゴロフ・スミルノフ検定。2020年から2022年までのラテンアメリカのインフレの物語」。17 (1): 68–78。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ ジュステル、A . ;ペーニャ、D.ザマー、R. (1997)。 「適合度の多変量コルモゴロフ・スミルノフ検定」。統計と確率の手紙。35 (3): 251–259。CiteSeerX 10.1.1.498.7631。土井:10.1016/S0167-7152(97)00020-5。
- ^ Peacock JA (1983). 「天文学における2次元適合度検定」.王立天文学会月報. 202 (3): 615–627. Bibcode :1983MNRAS.202..615P. doi : 10.1093/mnras/202.3.615 .
- ^ Gosset E. (1987). 「天文学における有用なツールとしての3次元拡張コルモゴロフ・スミルノフ検定」.天文学と天体物理学. 188 (1): 258–264.書誌コード:1987A&A...188..258G.
- ^ Fasano, G.; Franceschini, A. (1987). 「コルモゴロフ・スミルノフ検定の多次元バージョン」. Monthly Notices of the Royal Astronomical Society . 225 : 155–170. Bibcode :1987MNRAS.225..155F. doi : 10.1093/mnras/225.1.155 . ISSN 0035-8711.
- ^ Lopes, RHC; Reid, I.; Hobson, PR (2007 年 4 月 23 ~ 27 日)。2 次元コルモゴロフ・スミルノフ検定(PDF)。第 11 回物理学研究における高度なコンピューティングおよび分析技術に関する国際ワークショップ。アムステルダム、オランダ。
- ^ "scipy.stats.kstest". SciPy v1.7.1 マニュアル. Scipy コミュニティ. 2021 年10 月 26 日閲覧。
- ^ 「KolmogorovSmirnovTest」 . 2019年6月18日閲覧。
- ^ 「新しい統計ノード」 。 2020年6月25日閲覧。
- ^ 「ノンパラメトリック検定 · HypothesisTests.jl」。
- ^ 「ksmirnov — Kolmogorov –Smirnov 分布の等式検定」(PDF) 。 2019年6月18日閲覧。
- ^ 「正規性仮説検定のためのコルモゴロフ・スミルノフ検定」。2019年6月18日閲覧。
さらに読む
- ダニエル、ウェイン W. (1990)。 「コルモゴロフ – スミルノフ 1 サンプル検定」。応用ノンパラメトリック統計(第 2 版)。ボストン: PWS-ケント。 319–330ページ。ISBN 978-0-534-91976-4。
- Eadie, WT; D. Drijard; FE James; M. Roos; B. Sadoulet (1971).実験物理学における統計的手法アムステルダム: 北ホラント。pp. 269–271。ISBN 978-0-444-10117-4。
- スチュアート、アラン、オルド、スティーブン [F.] (1999)。古典的推論と線形モデル。ケンドールの統計の高度な理論。第 2A 巻 (第 6 版)。ロンドン: アーノルド。pp. 25.37–25.43。ISBN 978-0-340-66230-4. MR 1687411。
- Corder, GW; Foreman, DI (2014).ノンパラメトリック統計: ステップバイステップのアプローチ. Wiley. ISBN 978-1-118-84031-3。
- Stephens, MA (1979). 「経験的分布関数に基づくロジスティック分布の適合度検定」Biometrika . 66 (3): 591–595. doi :10.1093/biomet/66.3.591.
- Kesemen, O.; Tiryaki, BK; Tezel, Ö.; Özkul, E. (2021). 「多変量正規性のための新しい適合度検定」. Hacettepe Journal of Mathematics and Statistics . 50 : 872–894. doi : 10.15672/hujms.644516 .
外部リンク
- 「コルモゴロフ・スミルノフ検定」、数学百科事典、EMS Press、2001 [1994]
- 簡単な紹介
- KSテストの説明
- 片側テストと両側テストの JavaScript 実装
- KS テストのオンライン計算機
- コルモゴロフ分布を計算し、KS テストを実行するオープンソースの C++ コード
- コルモゴロフ分布の評価に関する論文。C 実装が含まれています。これはMatlabで使用される方法です。
- 両側コルモゴロフ・スミルノフ分布の計算に関する論文。C または Java で KS 統計量の cdf を計算します。
- 論文 powerlaw: 裾の厚い分布を分析するための Python パッケージ、Jeff Alstott、Ed Bullmore、Dietmar Plenz。このパッケージは、コルモゴロフ-スミルノフ検定も実行します。powerlaw パッケージのソース コードとインストーラーは、PyPi で入手できます。
