検定統計量とは、統計的仮説検定のために標本から得られる量である。[ 1 ]仮説検定は通常、検定統計量によって規定される。検定統計量は、データセットを仮説検定に使用できる1つの値に縮小する数値要約とみなされる。一般に、検定統計量は、観測データ内で、対立仮説が指定されている場合は帰無仮説と対立仮説を区別する挙動を定量化するように、または対立仮説が明示的に示されていない場合は帰無仮説を特徴付けるように選択または定義される。
検定統計量の重要な特性は、帰無仮説の下での標本分布が、正確または近似的に計算可能であることであり、これによりp値を計算できます。検定統計量は記述統計量といくつかの共通点があり、多くの統計量は検定統計量と記述統計量の両方として使用できます。ただし、検定統計量は統計的検定での使用を目的としているのに対し、記述統計量の主な特性は解釈が容易であることです。標本範囲などの情報量の多い記述統計量の中には、標本分布を決定するのが難しいため、検定統計量として適さないものもあります。
コインが公平かどうか(つまり、表と裏が出る確率が等しいかどうか)をテストするという課題を考えてみましょう。コインを100回投げ、その結果を記録すると、生データは100回の表と裏のシーケンスとして表すことができます。裏が出る周辺確率に関心がある場合は、 100回の投げのうち裏が出た回数Tだけを記録すれば十分です。しかし、 Tは次の2つの方法のいずれかで検定統計量として使用することもできます。
これらの標本分布のいずれかを用いることで、コインが公平であるという帰無仮説に対する片側検定または両側検定のp値を計算することが可能です。この場合、検定統計量は100個の数値を、検定に使用できる単一の数値要約に集約します。
1標本検定は、仮説に基づいて標本を母集団と比較する場合に適しています。母集団の特性は理論から既知であるか、母集団から計算されます。
2標本検定は、2つの標本、典型的には科学的に管理された実験から得られた実験標本と対照標本を比較するのに適しています。
ペア検定は、重要な変数を制御することが不可能な2つのサンプルを比較する場合に適しています。2つのセットを直接比較するのではなく、サンプル間でメンバーをペアにして、メンバー間の差をサンプルとします。通常、その差の平均値をゼロと比較します。ペア差検定が適切な一般的な例としては、単一の被験者グループに何らかの処置を施し、その効果を検証する場合が挙げられます。
Z検定は、正規性に関する厳密な条件と既知の標準偏差の下で平均値を比較するのに適しています。
t検定は、より緩やかな条件下(仮定が少ない場合)での平均値の比較に適しています。
比率の検定は、平均値の検定(50%比率)と類似している。
カイ二乗検定は、異なる用途においても、同じ計算方法と確率分布を用いる。
F検定(分散分析、ANOVA)は、データをカテゴリー別にグループ化することが意味があるかどうかを判断する際によく用いられます。例えば、あるクラスにおける左利きの生徒のテストスコアの分散が、クラス全体の分散よりもはるかに小さい場合、左利きの生徒をグループとして研究することは有益かもしれません。帰無仮説は、2つの分散が同じであるというものであり、したがって提案されたグループ化は意味がないということになります。
以下の表で使用されている記号は、表の下部に定義されています。他の多くの検定は、他の記事で見つけることができます。検定統計量が適切であるという証明が存在します。[ 2 ]