2標本比率Z検定(2標本比率Z検定とも呼ばれる)は、 2つのグループ間で二値結果の割合に、偶然では説明できないほど有意な差があるかどうかを評価するための統計的仮説検定です。例えば、臨床試験における治療に対する肯定的な反応を示した患者の割合と対照群との比較、 2つの生産ラインにおける品質管理上の不良率、または2つの異なるウェブページデザインのA/Bテストにおけるクリック率の比較などが挙げられます。
この検定は、各観測値が互いに独立しており、成功または失敗に分類でき(すなわち、ベルヌーイ試行)、かつサンプルサイズが十分に大きく、各サンプル比率の標本分布が中心極限定理によって適切に近似できる場合に適しています。このような条件下では、観測されたサンプル比率の差を標準化されたz統計量(プールされた標準誤差を使用)に変換し、標準正規分布と比較することで、 p値を取得したり、比率の差に対する信頼区間(導出方法は若干異なります)を形成したりできます。また、これにより、最小検出可能効果の計算に必要なサンプルサイズを決定することもできます。
この検定は、ピアソンのカイ二乗検定、小標本に対するフィッシャーの正確確率検定、ペアになった二値データに対するマクネマー検定など、他のよく知られた検定と関連している。
2標本比率Z検定または2標本比率Z検定は、二項分布から得られた2つのグループの比率の差が統計的に有意であるかどうかを判断するために使用される統計的手法です。 [ 1 ]このアプローチは、(十分に大きなサンプルの場合)標本比率が中心極限定理の下で正規分布に従うという観察に基づいており、仮説検定(スコア検定)および信頼区間推定(ワルド検定)のためのZ検定の構築を可能にします。[ 2 ]これは、さまざまな分野で、異なるグループ間での成功率、応答率、またはその他の比率を比較するために使用されます。
2 つの比率を比較するためのz 検定は、2 つの独立したサンプルが二値結果に対して異なる母集団比率を持つかどうかを評価するために使用される頻度論的統計的仮説検定です。緩やかな正則条件 (十分なサンプルサイズと独立したサンプリング) の下では、サンプル比率(ベルヌーイ分布から得られた観測値の平均) は、中心極限定理の下でほぼ正規分布に従うため、サンプル比率の差と推定標準誤差から構築された z 統計量を使用できます。[ 2 ]
このテストには、2つの対立する仮説が含まれる。
2つの比率を比較するためのz統計量は、以下の式を用いて計算されます。[ 3 ] [ 4 ] [ 5 ] [ 2 ]: 10.6.2どこそしては、第1サンプルと第2サンプルのサンプル比率です。そしてはそれぞれ第1および第2のサンプルのサイズである。プールされた割合は、次のように計算されます。、 どこそしては、2 つのサンプルにおける成功の数です。プールされた割合は、帰無仮説の下での成功の共通確率を推定するために使用され、標準誤差は、2 つのサンプル間の変動を考慮に入れています。
z検定は、計算されたz統計量を臨界値と比較することによって統計的有意性を判定します。たとえば、有意水準が帰無仮説を棄却するのは、(両側検定の場合)。または、p値を計算して帰無仮説を棄却することによって、。
上記の定義に基づくと、2つの比率の差の信頼区間は次のようになります。 [ 5 ] [ 2 ]: 10.6.3どこは標準正規分布の臨界値です(例えば、95%信頼水準の場合は1.96)。
この区間は、人口比率の真の差について、妥当な値の範囲を示す。
仮説検定と信頼区間では、分散の推定方法が異なる点に注目してください。前者は(帰無仮説に基づく)プールされた分散を使用しますが、後者は(比率の差の範囲を信頼区間が考慮できるようにするために)各サンプルを個別に用いて分散を推定する必要があります。この違いにより、仮説検定の代わりに信頼区間を用いる場合、結果が若干異なる可能性があります。
サンプルサイズ決定とは、統計検定を実施するために各グループに含める観測値の数を選択することです。2標本比率Z検定の場合、これは最小検出可能効果の決定と密接に関連しています。
必要なサンプルサイズを見つけるため(ある効果量が与えられた場合)、 力、そして第一種過誤)、我々は次のように定義する。(κ = 1 の場合、各グループのサンプルサイズは等しいと仮定される)次に:[ 6 ] [ 7 ]
最小検出可能効果またはMDEは、2つの比率間の最小差です(そして) 選択された第一種過誤レベルに対して統計的検定が検出できるもの()統計的検出力()、およびサンプルサイズ(そしてこれは、研究デザインにおいて、サンプルサイズが意味のある差を検出するのに十分な感度を持つテストを可能にするかどうかを判断するためによく使用されます。
2 つの比率を比較するための (両側) z 検定式を使用する場合の MDE には、臨界値が含まれています。そして、および比率の標準誤差:[ 8 ] [ 9 ]どこは有意水準の臨界値であり、は、所望の電力の分位数であり、これは、帰無仮説が正しいと仮定した場合です。
MDEはサンプルサイズ、ベースライン比率()、およびテストパラメータ。ベースラインの割合が不明な場合は、仮定するか、小規模な研究から概算する必要があります。サンプルサイズが大きい、または検出力要件が小さいほど、MDEは小さくなり、テストはより小さな差に対して敏感になります。研究者は、研究を実施する前に、MDEを使用して意味のある差を検出できる可能性を評価することができます。
最小検出可能効果(MDE)は、最小の差であり、次のように表されます。これは、仮説検定における2つの重要な基準を満たしている。
帰無仮説と対立仮説の下で分布が正規であると仮定すると、2 つの基準が発生するためには、距離が帰無仮説を棄却するための臨界値は、)は、帰無仮説の下でこの値を超える確率が(また、この値を超える確率は、代替案では次のようになる。。
最初の基準は、帰無仮説を棄却するために必要な臨界値を確立します。2番目の基準は、代替分布がどれだけ離れていなければならないかを指定します。対立仮説の下でそれを超える確率が少なくとも[ 10 ] [ 11 ]
条件1:拒否する
帰無仮説の下では、検定統計量はプールされた標準誤差に基づいています():
(上記のように)推定される可能性がある。
拒否する観測された差は臨界閾値を超えなければならない() 南東方向に適切に膨張させた後:
MDEが以下のように定義される場合代替分布が閾値に関して対称であるため、統計的検出力はわずか50%にとどまります。より高い検出力を得るには、MDE計算に追加の要素が必要です。
条件2:権力の獲得
対立仮説の下では、標準誤差は() これは、代替分布が何らかの値 (例:)、次に最小値少なくとも以下でなければならない対立仮説の下での差を検出する確率が少なくとも。
条件の組み合わせ
両方の条件を満たすために、検出可能な総差は、帰無分布と対立分布の両方からの要素を取り込む。MDEは次のように定義される。
MDEは、帰無仮説からの臨界閾値を合計し、それに代替分布からの関連する分位数を加えることで、検定が棄却の二重要件を満たすことを保証します。有意水準で少なくとも統計的検出力を達成する。
有効な結果を得るためには、以下の前提条件を満たす必要があります。
z検定は、サンプルサイズが大きく、かつすべての前提条件が満たされている場合に最も信頼性が高い。
仮説検定(スコア検定)にz検定を使用すると、2×2分割表に対するピアソンのカイ二乗検定と同じ結果が得られます。[ 14 ]: 216-7 [ 15 ]: 875サンプルサイズが小さい場合は、フィッシャーの正確検定の方が適しています。
2×2分割表の扱いは19世紀にはすでに研究されており[ 16 ] 、 20世紀にもさらに研究が進められた[ 17 ] 。
以下の点にご注目ください。
ベイズ推論の文脈では、比率はベータ分布を使用してモデル化できます。2つの比率のz検定と並行して、2つのベータ分布の差を使用して同様の推論を実行します。[ 18 ]
比率の差に対する標準的な漸近信頼区間(ワルド区間)は、特にサンプルサイズが小さい場合や比率が0または1に近い場合に、カバレッジ確率が低いという問題が生じる可能性があります。さらに、ワルド法では、意味のある[−1, 1]の範囲を超える「オーバーシュート」限界が生じる場合があります。 [ 19 ]この問題を解決するために、Robert G. Newcombeは、ウィルソンスコア区間に基づく非常に堅牢な代替方法を提案しました。
ニューカム法は、差の信頼区間を計算する。まず、各標本比率についてこれらの個別のスコア区間を個別に計算します。の下限と上限は、 そしての下限と上限は特定の標本比率に対する区間境界サンプルサイズ計算方法は以下のとおりです。 どこは標準正規分布からの臨界値です(例えば、95%信頼水準の場合は1.96)。
個々の境界が計算されると、下限は上限2つの比率の差は次のように構築されます。[ 19 ]
この方法は、結果として得られる区間が厳密に-1から1の間に限定され、連続性補正を必要とせずに名目上の信頼水準に非常に近いことから、従来のワルド法よりも頻繁に推奨されています。[ 19 ] [ 20 ]
グループ1が1000回の試行のうち120回成功したと仮定します(グループ2は1000回の試行のうち150回成功しました() プールされた割合はプールされた標準誤差は
z統計量は両側p値は約0.0497(0.05をわずかに下回る)となる。プールされていない標準誤差を用いた差の近似95%信頼区間は95%信頼区間が(かろうじて)0を除外し、p値が約0.0497であるため、通常の大標本基準では5%水準で統計的に有意差がある(ただし、境界線上の差であるため、結論は研究の文脈と、該当する場合は多重検定を考慮する必要がある)。
多くの統計環境で実装が利用可能です。以下に、いくつかの一般的な言語での実装の詳細を示します。SPSS [ 21 ] 、 SAS [ 22 ]、Minitab [ 5 ]用の実装も存在します。
連続性補正を無効にして使用してくださいprop.test()。
prop.test ( x = c ( 120 , 150 ), n = c ( 1000 , 1000 ), correct = FALSE )出力には、z検定に相当する結果(カイ二乗統計量、p値、信頼区間)が含まれます。
連続性補正なしの比率の等価性に関する2標本検定 データ: c(120, 150) / c(1000, 1000) X二乗値 = 3.8536、自由度 = 1、p値 = 0.04964 対立仮説:両側 95%信頼区間: -5.992397e-02 -7.602882e-05 サンプル推定値: プロップ1 プロップ2 0.12 0.15 proportions_zteststatsmodelsからの使用: [ 23 ]
from statsmodels.stats.proportion import proportions_ztest z , p = proportions_ztest ([ 120 , 150 ], [ 1000 , 1000 ], 0 ) # 信頼区間の場合: from statsmodels.stats.proportion import test_proportions_2indep上記の数式をPresto版SQLを使用して直接実装します(VALUES、[ 24 ]、inverse_normal_cdf、[ 25 ]、normal_cdf [ 26 ]に依存)。
WITH input_data AS ( SELECT * , (( n_1 * p_1 + n_2 * p_2 ) / ( n_1 + n_2 )) AS p_pooled FROM ( VALUES ( 1000 , 1000 , 0 . 12 , 0 . 15 ) ) AS t ( n_1 , n_2 , p_1 , p_2 ) ), stats_computed AS ( SELECT n_1 , n_2 , p_1 , p_2 , p_2 - p_1 AS p2_minus_p1 , SQRT ( ( p_1 * ( 1 - p_1 ) / n_1 ) + ( p_2 * ( 1 - p_2 ) / n_2 ) ) AS se_p2_minus_p1 , SQRT ( p_pooled * ( 1 - p_pooled ) * ( 1 . 0 / n_1 + 1 . 0 / n_2 ) ) AS pooled_se 、inverse_normal_cdf ( 0 、1 、0 . 975 ) AS z_975 -- 95% CI (1.96) FROM input_data ) SELECT n_1 、n_2 、ROUND ( p_1 、3 ) AS p_1 、ROUND ( p_2 、3 ) AS p_2 、ROUND ( p2_minus_p1 、3 ) AS p2_minus_p1 、ROUND ( se_p2_minus_p1 、3 ) AS se_p2_minus_p1 、ROUND ( p2_minus_p1 - z_975 *se_p2_minus_p1 、3 ) AS p2_minus_p1_ci_lower 、ROUND ( p2_minus_p1 + z_975 * se_p2_minus_p1 、3 ) AS p2_minus_p1_ci_upper 、ROUND ( 2 * ( 1 - normal_cdf ( 0 、1 、ABS ( p2_minus_p1 ) / pooled_se )), 3 ) AS p_value FROM stats_computed ;{{cite journal}}: CS1メンテナンス: DOIは2025年10月現在非アクティブです(リンク)