

統計的有意性検定では、片側検定と両側検定は、検定統計量の観点から、データセットから推測されるパラメータの統計的有意性を計算する代替方法です。両側検定は、推定値が特定の値の範囲より大きいか小さいか、たとえば、受験者が特定のスコア範囲より上か下かを判断する場合に適しています。この方法は帰無仮説検定に使用され、推定値が臨界領域に存在する場合、帰無仮説よりも対立仮説が受け入れられます。片側検定は、推定値が基準値から左または右のいずれか一方の方向にのみ逸脱し、両方向には逸脱しない場合に適しています。[ 1 ]例として、機械が1%を超える不良品を生産するかどうかが挙げられます。この状況では、推定値が関心のある方向(より大きいか小さいか)に応じて、片側臨界領域のいずれかに存在する場合、帰無仮説よりも対立仮説が受け入れられます。別名として、片側検定と両側検定があります。 「テール」という用語が使われるのは、分布の極端な部分、つまり観測結果が帰無仮説の棄却につながる部分が小さく、正規分布(黄色で示されている)や「ベルカーブ」(右図の緑色で示されている)のように、ゼロに向かって「テールオフ」することが多いからです。
片側検定は、適合度を測定する際によく用いられるカイ二乗分布のように片側のみに分布する非対称分布、または位置を推定する際によく用いられる正規分布のように両側に分布する分布の片側に用いられます。これは方向を指定することに相当します。両側検定は、正規分布のように両側に分布がある場合にのみ適用可能であり、どちらの方向も有意であるとみなすことに相当します。[ 2 ] [ 3 ]
ロナルド・フィッシャーのアプローチでは、検定統計量のp値が十分に極端(検定統計量の標本分布と比較して)であり、偶然の結果である可能性が低いと判断された場合、帰無仮説H₀は棄却されます。これは通常、得られたp値を指定された有意水準と比較することによって行われます。パラメータの統計的有意性を計算する場合、片側 検定では、「極端」は「十分に小さい」または「十分に大きい」のいずれかとして事前に決定され、反対方向の値は有意ではないとみなされます。左側または右側の確率を片側p値として報告することができ、これは最終的に検定統計量がH₀から逸脱する方向に対応します。[ 4 ]両側検定では、「極端」は「十分に小さいか十分に大きいか」のいずれかを意味し、どちらの方向の値も有意であるとみなされます。[ 5 ]特定の検定統計量に対して、1つの両側検定と、それぞれの方向に対応する2つの片側検定があります。有意水準が指定されている場合臨界領域は分布の両端に存在し、その面積はそれぞれ両側検定の場合。あるいは、棄却域は片側尾端にのみ存在し、その面積は片側検定の場合。検定統計量に対する両側検定で与えられた有意水準に対して、同じ検定統計量に対する対応する片側検定は、データが検定で指定された方向にある場合は2倍有意(p値の半分)とみなされ、そうでない場合はまったく有意ではない(p値が以上)とみなされます。データがテストで指定された臨界領域とは反対方向にある場合。
例えば、コインを投げる場合、表に偏っているかどうかをテストするのは片側検定であり、「すべて表」のデータが得られれば非常に有意とみなされ、「すべて裏」のデータが得られても全く有意ではない ( p = 1)。対照的に、どちらかの方向に偏っているかどうかをテストするのは両側検定であり、「すべて表」または「すべて裏」のどちらも非常に有意なデータとみなされる。医学的検査では、一般的に治療が偶然よりも良い結果をもたらすかどうかに関心があり、片側検定が示唆されるが、科学分野では悪い結果も興味深いので、治療が偶然とは異なる結果をもたらすかどうか、つまり、より良いかより悪いかをテストする両側検定を使用すべきである。 [ 6 ]典型的な女性がお茶を味わう実験では、フィッシャーは、問題の女性が2種類のお茶の淹れ方を区別する能力が偶然よりも優れているかどうかをテストしたのであって、彼女の能力が偶然と異なるかどうかをテストしたわけではないので、片側検定を使用した。
コイン投げでは、帰無仮説は確率0.5のベルヌーイ試行の系列であり、表が出た場合は1、裏が出た場合は0となる確率変数Xが得られます。一般的な検定統計量は標本平均(表が出た回数)です。コインが表に偏っているかどうかをテストする場合、片側検定が使用されます。つまり、表の数が多い場合のみ有意になります。この場合、サンプル平均が 1 の 5 つの表 (HHHHH) のデータセットは、発生する確率は、(2つの結果が連続する5回のコイン投げ - ((1/2)^5 = 1/32)です。検定を以下の有意水準で分析した場合、有意となる(帰無仮説を棄却する)。(カットオフ境界に対応する有意水準)。ただし、コインが表か裏に偏っているかどうかをテストする場合は、両側検定が使用され、表が5回(標本平均1)のデータセットは、裏が5回(標本平均0)のデータセットと同じくらい極端です。結果として、p値はそして、この検定を以下の有意水準で分析した場合、これは有意ではない(帰無仮説を棄却しない)だろう。。

p値は、カール・ピアソン[ 7 ]がピアソンのカイ二乗検定で導入したもので、彼はP(元の表記)を、統計量が特定のレベル以上になる確率として定義しました。これは片側検定の定義であり、カイ二乗分布は非対称で、正またはゼロの値のみを取り、上側の片側のみを持ちます。これは、データが理論分布にどれだけ適合しているかを測定するもので、ゼロは理論分布と完全に一致することを意味します。したがって、 p値は適合度がこれより悪いか、あるいはさらに悪い可能性を測定します。

片側検定と両側検定の区別は、ロナルド・フィッシャーが影響力のある著書『研究者のための統計的方法』 [ 8 ]で広めたもので、彼は特に、両側に等しい裾を持つ対称分布である正規分布にこの区別を適用した。正規分布は適合度ではなく位置の一般的な尺度であり、位置の推定値が理論上の位置より上か下かに対応する両側の裾を持つ(例:標本平均と理論平均の比較)。正規分布のような対称分布の場合、片側p値は両側p値のちょうど半分になる。[ 8 ]
場合によっては、正であることがわかっている偏差が観測値を超える確率を知りたいのに対し、別のケースでは、正負が同程度に発生する偏差が観測値を超える確率を知りたいという事実によって、混乱が生じることがある。後者の確率は常に前者の半分である。
フィッシャーは著書『実験計画法』(1935年)の中で、特定の結果の確率そのものだけでなく、検定統計量の観測値とそれよりも極端な値である裾野を測定することの重要性を強調した。 [ 9 ]彼は、特定のデータセットは(帰無仮説では)起こりにくいかもしれないが、より極端な結果は起こりやすいので、この観点から見ると、特定の、しかし極端ではない起こりにくいデータは有意とはみなすべきではないと説明している。
検定統計量が帰無仮説においてスチューデントのt分布に従う場合(これは、基礎となる変数が未知のスケーリング係数を持つ正規分布に従う場合によく見られる)、その検定は片側t検定または両側t検定と呼ばれます。検定が標本からの推定値ではなく、実際の母平均と分散を使用して実行される場合、それは片側Z検定または両側Z検定と呼ばれます。
t値とZ値の統計表には、片側検定と両側検定の両方に対する臨界値が記載されています。つまり、標本分布の一方の端またはもう一方の端で領域全体を切り離す臨界値と、標本分布の両端で(半分の大きさの)領域を切り離す臨界値が示されています。
{{cite book}}: CS1 メンテナンス: その他 (リンク){{cite book}}ISBN /日付の不一致(ヘルプ)