スチューデントのt 検定 は、2つのグループの応答の差が統計的に有意 であるかどうかを検定するために使用される統計的検定です。これは、 帰無仮説 の下で検定統計量が スチューデントの t 分布 に従う統計的仮説検定 です。検定統計量のスケーリング項 の値が既知であれば検定統計量が正規分布 に従う場合に最も一般的に適用されます(通常、スケーリング項は未知であり、したがって邪魔なパラメータ です)。スケーリング項がデータ に基づいて推定されると、特定の条件下で検定統計量はスチューデントのt 分布に従います。t検定 の最も一般的な用途は、2つの母集団の平均が有意に異なるかどうかを検定することです。多くの場合、データセットのサイズが大きくなるにつれて後者が前者に収束するため、 Z 検定は t 検定と非常によく似た結果をもたらします。
用途
1標本t 検定 1標本スチューデントのt 検定 は、母集団の平均が帰無仮説で指定された値を持つかどうかを検定する 位置検定 です。母集団の平均が指定された値μ₀ に等しいという帰無仮説を検定する場合、統計量を使用します。
t = x ¯ − μ 0 s / n 、 {\displaystyle t={\frac {{\bar {x}}-\mu _{0}}{s/{\sqrt {n}}}},} どこx ¯ {\displaystyle {\bar {x}}} は標本平均、s は標本標準偏差 、n は標本サイズです。この検定で使用される自由度は n − 1 です。母集団は正規分布である必要はありませんが、標本平均の母集団の分布はx ¯ {\displaystyle {\bar {x}}} 正常であると想定される。
中心極限定理 によれば、観測値が独立であり、2次モーメントが存在する場合、t {\displaystyle t} ほぼ通常通りN ( 0 、 1 ) {\textstyle {\mathcal {N}}(0,1)} これはあくまで近似値です。中心極限定理は、sが x の実際の標準偏差である場合にt に適用されますが、実際にはsは標本 標準偏差であり、実際の標準偏差は一般には不明です。したがって、tは 漸近的にスチューデントのt分布に従います。
2標本t 検定 相関係数の関数としての、対応のない2標本t検定および対応のある2標本t 検定における第一種過誤率。シミュレーションされた乱数は、分散が1の二変量正規分布から生成されます。有意水準は5%、ケース数は60です。 相関係数の関数としての、対応のないt検定と対応のあるt 検定の検出力。シミュレーションされた乱数は、分散が1、期待値の偏差が0.4の二変量正規分布から生成されます。有意水準は5%、ケース数は60です。 2 つの母集団の平均が等しいという帰無仮説に対する 2 標本位置検定。このような検定はすべて通常、スチューデントのt 検定 と呼ばれますが、厳密には、 2 つの母集団の分散 も等しいと仮定する場合にのみこの名前を使用する必要があります。この仮定を外す場合に使用される検定の形式は、ウェルチのt 検定と呼ばれることがあります。これらの検定は、比較される 2 つの標本の基礎となる 統計単位が 重複しない場合に適用されることが多いため、しばしば対応のない 標本 t 検定または独立標本 t 検定と呼ばれます。 [ 14 ]
平均値の差を調べるための2 標本t検定では、独立標本 (非対応標本) または 対応標本 を使用します。対応t検定は ブロッキング の一種であり、比較対象の 2 つのグループへの所属とは無関係な「ノイズ要因」( 交絡因子 を参照) に関して対応標本が類似している場合、非対応検定よりも検出力 (偽陰性とも呼ばれる II 型エラーを回避する確率) が高くなります。[ 15 ] 別の文脈では、対応t検定は 観察研究 における交絡因子 の影響を軽減するために使用できます。
独立した(対応のない)サンプル独立標本t 検定は、互いに独立で分布が同じ 標本が2つ得られ、それぞれの標本から1つの変数を比較する場合に使用されます。例えば、医療処置の効果を評価するために、100人の 被験者を研究に登録し、そのうち50 人を治療群に、残りの50人を対照群にランダムに割り当てたとします。この場合、2つの独立した標本が得られるため、対応のないt 検定を使用します。
ペアサンプル 対応のあるサンプル t検定は通常、類似した 単位 の対応のあるペアのサンプル、または2回テストされた1つの単位のグループ(「反復測定」t 検定)で構成されます。
反復測定t 検定の典型的な例としては、高血圧などの治療前に被験者を検査し、降圧剤による治療後に同じ被験者を再度検査する場合が挙げられます。治療前後の同じ患者の数値を比較することで、各患者を実質的に自身の対照群として用いることができます。このようにして、帰無仮説(ここでは治療による差がないという仮説)を正しく棄却できる可能性がはるかに高くなり、患者間のランダムな変動が排除されるため、統計的検出力が向上します。しかし、統計的検出力の向上には代償が伴います。つまり、より多くの検査が必要となり、各被験者を2回検査しなければなりません。
サンプルの半分が残りの半分に依存するため、スチューデントのt 検定のペア版の自由度は n / 2 − 1しかありません ( n は観測の総数です)。ペアは個々のテスト単位となり、同じ自由度を達成するにはサンプルを2倍にする必要があります。通常、自由度はn − 1 です( n は観測の総数です)。[ 16 ]
「対応のあるペアサンプル」に基づく対応のあるサンプルt 検定は、対応のないサンプルから、関心のある変数とともに測定された追加の変数を使用して、対応のあるサンプルを形成するために後で使用されるものです。[ 17 ] マッチングは、2つのサンプルのそれぞれから1つの観測値で構成される値のペアを特定することによって実行され、そのペアは他の測定された変数に関して類似しています。このアプローチは、交絡因子の影響を軽減または排除するために、観察研究で使用されることがあります。
対応のあるサンプルt検定は、「従属サンプル t 検定」と呼ばれることが多い。
前提条件 ほとんどの検定統計量はt = Z / s の 形式で表され、Z とs は データの関数です。
Zは 対立仮説に敏感である可能性があり(つまり、対立仮説が正しい場合、その値は大きくなる傾向がある)、一方、 sは t の分布を決定できるようにするスケーリングパラメータ である。
例えば、1標本t 検定では
t = Z s = X ¯ − μ σ ^ / n 、 {\displaystyle t={\frac {Z}{s}}={\frac {{\bar {X}}-\mu }{{\hat {\sigma }}/{\sqrt {n}}}},} どこX ¯ {\displaystyle {\bar {X}}} は、サイズn のサンプルX 1 、 X 2 、 …、 X n からのサンプル平均 であり、s は平均の標準誤差 です。σ ^ = 1 n − 1 ∑ 私 ( X 私 − X ¯ ) 2 {\displaystyle {\hat {\sigma }}={\sqrt {{\frac {1}{n-1}}\sum _{i}(X_{i}-{\bar {X}})^{2}}}} は母集団の標準偏差 の推定値であり、 μ は母集団の平均 である。
上記の最も単純な形式のt 検定の前提条件は以下のとおりです。
2つの独立したサンプルの平均値を比較するt 検定では、以下の前提条件を満たす必要があります。
比較対象となる 2 つの母集団の平均は、おおよそ正規分布 に従うはずです。弱い仮定の下では、各グループの観測値の分布が正規分布でない場合でも、大きなサンプルでは中心極限定理 からこれが導かれます。[ 18 ] スチューデントのt 検定の元の定義を使用する場合、比較される2つの母集団は同じ分散を持つ必要があります(F 検定 、レーベン検定 、バートレット検定 、またはブラウン・フォーサイス検定 を使用してテスト可能、またはQ-Qプロット を使用してグラフで評価可能)。比較される2つのグループのサンプルサイズが等しい場合、スチューデントの元のt 検定は、不等分散の存在に対して非常に頑健です。[ 19 ] ウェルチのt 検定は 、サンプルサイズが似ているかどうかに関係なく、分散の等しさに対して感度がありません。 テストを実行するために使用されるデータは、比較対象の 2 つの母集団から独立してサンプリングされるか、完全にペアになっている必要があります。これは一般的にデータからテストすることはできませんが、データが従属的であることがわかっている場合 (たとえば、テスト設計によってペアになっている場合)、従属的テストを適用する必要があります。部分的にペアになっているデータの場合、テスト統計量がt分布に従わない可能性があるため、古典的な独立 t 検定では無効な結果が返される可能性がありますが、従属的t 検定はペアになっていないデータを破棄するため最適ではありません。[ 20 ] ほとんどの2標本t 検定は、仮定からの大きな逸脱を除いて、頑健である。[ 21 ]
正確性を確保する ためには、t 検定とZ 検定では標本平均の正規性が必要であり、t 検定ではさらに標本分散がスケーリングされたχ 2 分布 に従うこと、および標本平均と標本分散が統計的に独立して いることが必要です。これらの条件が満たされる場合、個々のデータ値の正規性は必要ありません。中心極限定理 により、データが正規分布していなくても、中程度の大きさの標本の標本平均は正規分布でよく近似されることがよくあります。ただし、標本平均が正規分布に収束するために必要な標本サイズは、元のデータの分布の歪度に依存します。標本は、歪度に応じて 30 から 100 またはそれ以上の値まで変化する可能性があります。[ 22 ] [ 23 ]
非正規分布データの場合、標本分散の分布はχ²分布から大きく逸脱する可能性 が ある。
しかし、サンプルサイズが大きい場合、スルツキーの定理 によれば、サンプル分散の分布は検定統計量の分布にほとんど影響を与えません。つまり、サンプルサイズが大きいほど、n {\displaystyle n} 増加:
n ( X ¯ − μ ) → d N ( 0 、 σ 2 ) {\displaystyle {\sqrt {n}}({\bar {X}}-\mu )\xrightarrow {d} N(0,\sigma ^{2})} 中心極限定理 によれば、s 2 → p σ 2 {\displaystyle s^{2}\xrightarrow {p} \sigma ^{2}} 大数の法則 によれば、∴ n ( X ¯ − μ ) s → d N ( 0 、 1 ) {\displaystyle \therefore {\frac {{\sqrt {n}}({\bar {X}}-\mu )}{s}}\xrightarrow {d} N(0,1)} 。
計算 様々なt 検定を実施するために使用できる具体的な式を以下に示します。各式において、帰無仮説の下でt 分布に完全に従うか、または近似する検定統計量の式が示されています。また、各式における適切な自由度も示されています。これらの統計量は 、片側検定または両側検定の いずれにも使用できます。
t 値と自由度が決定したら、スチューデントの t 分布の値表を用いて p 値を 求めることができます。計算されたp値が 統計的有意性 の閾値(通常は0.10、0.05、または0.01)を下回る場合、帰無仮説は棄却され、対立仮説が採択されます。
回帰直線の傾き モデルを当てはめていると仮定します
Y = α + β x + ε 、 {\displaystyle Y=\alpha +\beta x+\varepsilon ,} ここで、 x は既知であり、α とβ は未知であり、ε は平均 0 で未知の分散 σ 2 を持つ正規分布に従う確率変数であり、Y は 関心のある結果です。我々は、傾きβが特定の値 β 0 に等しいという帰無仮説を検定したいと考えています(多くの場合 0 とみなされ、その場合、帰無仮説はx とy が無相関であるということです)。
させて
α ^ 、 β ^ = 最小二乗推定量 、 S E α ^ 、 S E β ^ = 最小二乗推定量の標準誤差 。 {\displaystyle {\begin{aligned}{\hat {\alpha }},{\hat {\beta }}&={\text{least-squares estimators}},\\SE_{\hat {\alpha }},SE_{\hat {\beta }}&={\text{the standard errors of least-squares estimators}}.\end{aligned}}} それから
t スコア = β ^ − β 0 S E β ^ ~ T n − 2 {\displaystyle t_{\text{score}}={\frac {{\hat {\beta }}-\beta _{0}}{SE_{\hat {\beta }}}}\sim {\mathcal {T}}_{n-2}} 帰無仮説が真である場合、 n − 2 の自由度を持つt 分布に従います。傾き係数の標準誤差は次のとおりです 。
S E β ^ = 1 n − 2 ∑ 私 = 1 n ( y 私 − y ^ 私 ) 2 ∑ 私 = 1 n ( x 私 − x ¯ ) 2 {\displaystyle SE_{\hat {\beta }}={\frac {\sqrt {\displaystyle {\frac {1}{n-2}}\sum _{i=1}^{n}(y_{i}-{\hat {y}}_{i})^{2}}}{\sqrt {\displaystyle \sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}} は残差を用いて表すことができる。
ε ^ 私 = y 私 − y ^ 私 = y 私 − ( α ^ + β ^ x 私 ) = 残差 = 推定誤差 、 SSR = ∑ 私 = 1 n ε ^ 私 2 = 残差の二乗和 。 {\displaystyle {\begin{aligned}{\hat {\varepsilon }}_{i}&=y_{i}-{\hat {y}}_{i}=y_{i}-({\hat {\alpha }}+{\hat {\beta }}x_{i})={\text{residuals}}={\text{estimated errors}},\\{\text{SSR}}&=\sum _{i=1}^{n}{{\hat {\varepsilon }}_{i}}^{2}={\text{sum of squares of residuals}}.\end{aligned}}} t スコアは 次のように与えられます。
t スコア = ( β ^ − β 0 ) n − 2 S S R ∑ 私 = 1 n ( x 私 − x ¯ ) 2 。 {\displaystyle t_{\text{score}}={\frac {({\hat {\beta }}-\beta _{0}){\sqrt {n-2}}}{\sqrt {\frac {SSR}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}.} t スコア を決定する別の方法は
t スコア = r n − 2 1 − r 2 、 {\displaystyle t_{\text{score}}={\frac {r{\sqrt {n-2}}}{\sqrt {1-r^{2}}}},} ここで、rは ピアソン相関係数 である。
t 値と傾きから、 t 値と切片を 求めることができます。
t スコア、インターセプト = α β t スコア、傾き s x 2 + x ¯ 2 、 {\displaystyle t_{\text{score,intercept}}={\frac {\alpha }{\beta }}{\frac {t_{\text{score,slope}}}{\sqrt {s_{\text{x}}^{2}+{\bar {x}}^{2}}}},} ここで、s x 2 は標本分散です。
独立2標本t 検定
サンプルサイズと分散が等しい 2つのグループ(1、2)が与えられた場合、このテストは次のような場合にのみ適用可能です。
2つのサンプルサイズは同じで、 2つの分布は同じ分散を持つと仮定できる。 これらの前提に反する事例については、以下で説明する。
平均値に差があるかどうかを検定するためのt 統計量は、次のように計算できます。
t = X ¯ 1 − X ¯ 2 s p 2 n 、 {\displaystyle t={\frac {{\bar {X}}_{1}-{\bar {X}}_{2}}{s_{p}{\sqrt {\frac {2}{n}}}}},} どこ
s p = s X 1 2 + s X 2 2 2 。 {\displaystyle s_{p}={\sqrt {\frac {s_{X_{1}}^{2}+s_{X_{2}}^{2}}{2}}}.} ここで、s p はn = n 1 = n 2 のプールされた標準偏差 であり、s 2 X 1 とs 2 X 2 は母分散の不偏推定量 です。t の分母は、2 つの平均値の差の標準誤差 です。
有意性検定の場合、この検定の自由度は 2 n − 2 であり、n はサンプルサイズです。
サンプルサイズ が 等しいか等しくないか、分散が類似している( 1 / 2 < s X 1 / s X 2 < 2 )この検定は、2 つの分布の分散が同じであると仮定できる場合にのみ使用されます (この仮定が満たされない場合は、以下を参照してください)。前の式は、以下の式の特殊なケースであり、両方のサンプルのサイズが等しい場合 ( n = n 1 = n 2 ) に復元されます。
平均値に差があるかどうかを検定するためのt 統計量は、次のように計算できます。
t = X ¯ 1 − X ¯ 2 s p ⋅ 1 n 1 + 1 n 2 、 {\displaystyle t={\frac {{\bar {X}}_{1}-{\bar {X}}_{2}}{s_{p}\cdot {\sqrt {{\frac {1}{n_{1}}}+{\frac {1}{n_{2}}}}}}},} どこ
s p = ( n 1 − 1 ) s X 1 2 + ( n 2 − 1 ) s X 2 2 n 1 + n 2 − 2 {\displaystyle s_{p}={\sqrt {\frac {(n_{1}-1)s_{X_{1}}^{2}+(n_{2}-1)s_{X_{2}}^{2}}{n_{1}+n_{2}-2}}}} は、2 つのサンプルのプールされた標準偏差 です。これは、母平均が同じかどうかに関わらず、その二乗が共通分散の不偏推定量となるように定義されています。これらの式では、 n i − 1 は各グループの自由度であり、総サンプルサイズから 2 を引いた数 (つまり、n 1 + n 2 − 2 ) が総自由度であり、有意性検定で使用されます。
最小検出可能効果 (MDE)は次のとおりです。[ 24 ]
δ ≥ 2 S p 2 n ( t 1 − α 、 ν + t 1 − β 、 ν ) {\displaystyle \delta \geq {\sqrt {\frac {2S_{p}^{2}}{n}}}(t_{1-\alpha ,\nu }+t_{1-\beta ,\nu })}
サンプルサイズが等しいか等しくないか、分散が等しくないか(s X 1 > 2 s X 2 またはs X 2 > 2 s X 1 )この検定はウェルチのt 検定とも呼ばれ、2つの母集団分散が等しいと仮定されない場合(2つの標本サイズが等しい場合も等しくない場合も含む)にのみ使用され、したがって個別に推定する必要があります。母集団平均が異なるかどうかを検定するためのt 統計量は次のように計算されます。
t = X ¯ 1 − X ¯ 2 s Δ ¯ 、 {\displaystyle t={\frac {{\bar {X}}_{1}-{\bar {X}}_{2}}{s_{\bar {\Delta }}}},} どこ
s Δ ¯ = s 1 2 n 1 + s 2 2 n 2 。 {\displaystyle s_{\bar {\Delta }}={\sqrt {{\frac {s_{1}^{2}}{n_{1}}}+{\frac {s_{2}^{2}}{n_{2}}}}}.} ここで、s i 2は、 n i = グループi の参加者数( i = 1 または 2)の 2 つのサンプルそれぞれの分散 の不偏推定量 です。( s Δ ¯ ) 2 {\displaystyle (s_{\bar {\Delta }})^{2}} これはプールされた分散ではありません。有意性検定で使用する場合、検定統計量の分布は、以下の式を使用して計算された自由度を持つ通常のスチューデントのt分布として近似されます。
df = ( s 1 2 n 1 + s 2 2 n 2 ) 2 ( s 1 2 / n 1 ) 2 n 1 − 1 + ( s 2 2 / n 2 ) 2 n 2 − 1 。 {\displaystyle {\text{d.f.}}={\frac {\left({\frac {s_{1}^{2}}{n_{1}}}+{\frac {s_{2}^{2}}{n_{2}}}\right)^{2}}{{\frac {(s_{1}^{2}/n_{1})^{2}}{n_{1}-1}}+{\frac {(s_{2}^{2}/n_{2})^{2}}{n_{2}-1}}}}.} これはウェルチ・サタースウェイト方程式 として知られています。検定統計量の真の分布は、実際には(わずかに)2つの未知の母集団分散に依存します(ベーレンス・フィッシャー問題を 参照)。
分散とサンプルサイズが異なる場合の正確な方法 この検定[ 25 ] は、有名なベーレンス・フィッシャー問題 を扱っており、2つの独立したサンプルに基づいて、2つの母集団の分散が等しいと仮定しない場合に、2つの正規分布母集団の平均の差を比較します。
このテストは、 2 つの母集団のサンプルサイズ と分散が等しくない場合 にも対応できる厳密なテスト として開発されました。厳密性は、サンプルサイズが 極めて小さく 不均衡な場合でも依然として成り立ちます(例: m ≡ n X = 50 {\displaystyle \ m\equiv n_{\mathsf {X}}=50\ } 対 n ≡ n Y = 5 {\displaystyle \ n\equiv n_{\mathsf {Y}}=5\ } )
平均値に差があるかどうかを検定するための統計量は、次のように計算できます。
させて X = [ X 1 、 X 2 、 … 、 X m ] ⊤ {\displaystyle \ X=\left[\ X_{1},X_{2},\ldots ,X_{m}\ \right]^{\top }\ } そして Y = [ Y 1 、 Y 2 、 … 、 Y n ] ⊤ {\displaystyle \ Y=\left[\ Y_{1},Y_{2},\ldots ,Y_{n}\ \right]^{\top }\ } 独立同分布のサンプルベクトルとする( m ≥ n {\displaystyle \ m\geq n\ } ) から N o r m ( μ X 、 σ X 2 ) {\displaystyle \ {\mathsf {Norm}}\left(\ \mu _{\mathsf {X}},\ \sigma _{\mathsf {X}}^{2}\ \right)\ } そして N o r m ( μ Y 、 σ Y 2 ) {\displaystyle \ {\mathsf {Norm}}\left(\ \mu _{\mathsf {Y}},\ \sigma _{\mathsf {Y}}^{2}\ \right)\ } 別々に。
させて ( P ⊤ ) n × n {\displaystyle \ (P^{\top })_{n\times n}\ } になるn × n {\displaystyle n\times n} 最初の行の要素がすべて 1 n 、 {\displaystyle \ {\tfrac {1}{\sqrt {n\ }}}\ ,} 同様に、 ( Q ⊤ ) n × m {\displaystyle \ (Q^{\top })_{n\times m}\ } 最初に n {\displaystyle \ n\ } 列 m × m {\displaystyle \ m\times m\ } 直交行列(最初の行の要素はすべて 1 m {\displaystyle \ {\tfrac {1}{\sqrt {m\ }}}\ } )
それから Z ≡ ( Q ⊤ ) n × m X m − ( P ⊤ ) n × n Y n {\displaystyle \ Z\equiv {\frac {\ \left(Q^{\top }\right)_{n\times m}\ X\ }{\sqrt {m\ }}}\ -\ {\frac {\ \left(P^{\top }\right)_{n\times n}\ Y\ }{\sqrt {n\ }}}\ } はn 次元の正規乱数ベクトルです。
Z ~ N o r m ( [ μ X − μ Y 、 0 、 0 、 … 、 0 ] ⊤ 、 ( σ X 2 m + σ Y 2 n ) 私 n ) 。 {\displaystyle Z~\sim ~{\mathsf {Norm}}\left(\ \left[\ \mu _{\mathsf {X}}-\mu _{\mathsf {Y}},\ 0,\ 0,\ \ldots ,\ 0\ \right]^{\top }\ ,\ \left({\frac {\ \sigma _{\mathsf {X}}^{2}\ }{m}}+{\frac {\ \sigma _{\mathsf {Y}}^{2}\ }{n}}\right)\ I_{n}\ \right)~.} 上記の分布から、ベクトルZ の最初の要素は
Z 1 = X ¯ − Y ¯ = 1 m ∑ 私 = 1 m X 私 − 1 n ∑ j = 1 n Y j 、 {\displaystyle Z_{1}={\bar {X}}-{\bar {Y}}={\frac {1}{\ m\ }}\sum _{i=1}^{m}\ X_{i}-{\frac {1}{\ n\ }}\sum _{j=1}^{n}\ Y_{j}\ ,} したがって、最初の要素は次のように分配されます。
Z 1 − ( μ X − μ Y ) ~ N o r m ( 0 、 σ X 2 m + σ Y 2 n ) 、 {\displaystyle Z_{1}-\left(\mu _{\mathsf {X}}-\mu _{\mathsf {Y}}\right)~\sim ~{\mathsf {Norm}}\left(\ 0,\ {\frac {\ \sigma _{\mathsf {X}}^{2}\ }{m}}+{\frac {\ \sigma _{\mathsf {Y}}^{2}\ }{n}}\ \right)\ ,} そして、 Z の残りの要素の二乗はカイ二乗 分布に 従う。
∑ 私 = 2 n Z 私 2 n − 1 ~ χ n − 1 2 n − 1 × ( σ X 2 m + σ Y 2 n ) {\displaystyle {\frac {\ \sum _{i=2}^{n}Z_{i}^{2}\ }{\ n-1\ }}~\sim ~{\frac {\ \chi _{n-1}^{2}\ }{\ n-1\ }}\times \left({\frac {\ \sigma _{\mathsf {X}}^{2}\ }{m}}+{\frac {\ \sigma _{\mathsf {Y}}^{2}\ }{n}}\right)} そして直交行列P とQ の構成により、
Z 1 − ( μ X − μ Y ) ⊥ ∑ 私 = 2 n Z 私 2 、 {\displaystyle Z_{1}-\left(\mu _{\mathsf {X}}-\mu _{\mathsf {Y}}\right)\quad \perp \quad \sum _{i=2}^{n}Z_{i}^{2}\ ,} したがって、 Z の最初の要素であるZ 1 は、直交性により、残りの要素とは統計的に独立しています。最後に、検定統計量として、
T e ≡ Z 1 − ( μ X − μ Y ) ( ∑ 私 = 2 n Z 私 2 ) / ( n − 1 ) ~ t n − 1 。 {\displaystyle T_{\mathsf {e}}~\equiv ~{\frac {\ Z_{1}-\left(\mu _{\mathsf {X}}-\mu _{\mathsf {Y}}\right)\ }{\ {\sqrt {\left(\sum _{i=2}^{n}Z_{i}^{2}\right)/\left(n-1\right)\ }}\ }}~\sim ~t_{n-1}~.}
対応のあるサンプルに対する従属t検定 この検定は、サンプルが従属している場合、つまり、1つのサンプルが2回テストされている場合(反復測定)、または2つのサンプルが対応付けられている場合に使用されます。これは、対応のある差の検定 の例です。t統計 量は次のように計算されます。
t = X ¯ D − μ 0 s D / n 、 {\displaystyle t={\frac {{\bar {X}}_{D}-\mu _{0}}{s_{D}/{\sqrt {n}}}},} どこX ¯ D {\displaystyle {\bar {X}}_{D}} そしてs D {\displaystyle s_{D}} は、すべてのペア間の差の平均と標準偏差です。ペアとは、例えば、ある人の事前テストと事後テストのスコア、または意味のあるグループにマッチングされた人同士のペア(例えば、同じ家族や年齢層から抽出された人:表を参照)です。差の平均が有意に異なるかどうかを検定したい場合は、定数μ 0 はゼロになります。使用される自由度はn − 1 で、n は ペアの数を表します。
計算例 A 1 を 、6 つの測定値からランダムにサンプルを抽出して得られた集合とする。
A 1 = { 30.02 、 29.99 、 30.11 、 29.97 、 30.01 、 29.99 } {\displaystyle A_{1}=\{30.02,\ 29.99,\ 30.11,\ 29.97,\ 30.01,\ 29.99\}} また、A 2 は 同様の方法で得られた第 2 の集合を表すものとする。
A 2 = { 29.89 、 29.93 、 29.72 、 29.98 、 30.02 、 29.98 } {\displaystyle A_{2}=\{29.89,\ 29.93,\ 29.72,\ 29.98,\ 30.02,\ 29.98\}} 例えば、2種類の異なる機械で製造されたネジの重量などがこれに該当する可能性がある。
我々は、2つの標本が抽出された母集団の平均値 が等しいという帰無仮説の検定を実施する。
上記で説明したすべての2標本検定手法の分子に現れる、それぞれX i で表される2つの標本平均の差は、次のとおりである。
X ¯ 1 − X ¯ 2 = 0.095。 {\displaystyle {\bar {X}}_{1}-{\bar {X}}_{2}=0.095.} 2つの標本の標本標準偏差 は、それぞれ約0.05と0.11です。このような小さな標本では、2つの母集団分散の等価性を検定しても検出力はあまり高くありません。標本サイズが等しいため、この例では2標本t検定の2つの形式は同様の結果を示します。
不均等な分散 不等分散に対するアプローチ(上記で説明した)に従うと、結果は次のようになる。
s 1 2 n 1 + s 2 2 n 2 ≈ 0.04849 {\displaystyle {\sqrt {{\frac {s_{1}^{2}}{n_{1}}}+{\frac {s_{2}^{2}}{n_{2}}}}}\approx 0.04849} そして自由度
df ≈ 7.031。 {\displaystyle {\text{d.f.}}\approx 7.031.} 検定統計量は約1.959であり、両側検定のp 値は0.09077となる。
等分散 等分散のアプローチ(上記で説明した)に従うと、結果は次のようになる。
s p ≈ 0.08399 {\displaystyle s_{p}\approx 0.08399} そして自由度
df = 10. {\displaystyle {\text{d.f.}}=10.} 検定統計量は約1.959であり、両側検定のp 値は0.07857となる。
位置問題に対するt 検定の代替案 t検定は、 分散が未知ではあるが等しい2つの独立同分布正規母集団の平均の等価性について正確な検定を提供する。(ウェルチのt 検定 は、データが正規分布に従うが分散が異なる場合のほぼ正確な検定である。) 中程度の大きさのサンプルと片側検定の場合、t 検定は正規性仮定の軽微な違反に対して比較的頑健である。[ 26 ] 十分に大きなサンプルでは、t検定は漸近的に z 検定 に近づき、正規性からの大きな逸脱に対しても頑健になる。[ 18 ]
データが著しく非正規分布であり、かつサンプルサイズが小さい場合、t 検定は誤解を招く結果をもたらす可能性があります。特定の非正規分布族に関する理論については、「ガウス尺度混合分布の位置検定」を 参照してください。
正規性の仮定が成り立たない場合、t 検定のノンパラメトリックな代替法の方が 統計的検出力が 高い可能性があります。ただし、データが非正規分布でグループ間の分散が異なる場合、t 検定の方が一部のノンパラメトリックな代替法よりも第一種過誤の 制御が優れている可能性があります。 [ 27 ] さらに、以下で説明するMann-Whitney U 検定 などのノンパラメトリックな方法は、通常、平均値の差を検定しないため、平均値の差が主な科学的関心事である場合は、慎重に使用する必要があります。[ 18 ] 例えば、Mann-Whitney U 検定は、両方のグループが同じ分布を持つ場合、第一種過誤を望ましいレベル α に維持します。また、グループ B が A と同じ分布を持つが定数分だけシフトしているという代替案を検出する検出力も持ちます (この場合、実際に 2 つのグループの平均値に差が生じます)。しかし、グループAとグループBの分布は異なるものの平均値が同じになるケースも考えられます(例えば、正の歪度を持つ分布と負の歪度を持つ分布が、平均値が同じになるようにシフトされている場合など)。このような場合、MW検定は帰無仮説を棄却する際に有意水準αを超える検出力を持つ可能性がありますが、平均値の差の解釈をこのような結果に帰するのは誤りです。
外れ値 が存在する場合、t 検定は頑健ではありません。たとえば、2 つの独立したサンプルについて、データ分布が非対称 (つまり、分布が歪ん でいる) または分布の裾が大きい場合、ウィルコクソン順位和検定 (マン・ホイットニーU 検定とも呼ばれる) は t 検定よりも 3 ~ 4 倍高い検出力を持つことがあります。[ 26 ] [ 28 ] [ 29 ] 対応のあるサンプルt 検定のノンパラメトリック対応物は、対応のあるサンプルのウィルコクソン符号順位検定です。t 検定 とノンパラメトリックな代替手段の選択に関する議論については、Lumley ら (2002) を参照してください。[ 18 ]
一元配置分散分析 (ANOVA)は、データが2つ以上のグループに属する場合に、2標本t検定を一般化したものです。
対になった観測と独立した観測の両方を含む設計 2 つのサンプル設計において、ペアの観測値と独立した観測値の両方が存在する場合、データが完全にランダムに欠損している (MCAR) と仮定すると、上記の標準検定を進めるために、ペアの観測値または独立した観測値を破棄することができます。あるいは、正規性と MCAR を仮定して、利用可能なすべてのデータを使用して、一般化された部分的に重複するサンプルt 検定を使用することもできます。[ 30 ]
多変量検定 スチューデントのt 統計量の一般化であるホテリングのt 二乗統計量 を用いると、同一サンプル内の複数の(多くの場合相関のある)測定値について仮説検定を行うことができる。例えば、研究者は複数の性格尺度(ミネソタ多面人格目録など)からなる性格検査に被験者を複数回実施するかもしれない。この種の測定値は通常正の相関があるため、仮説検定のために個別の単変量 t 検定を実施することは推奨されない。なぜなら、これらの検定では測定値間の共分散が無視され、少なくとも1つの仮説を誤って棄却する可能性(第一種過誤 )が増大するからである。この場合、仮説検定には単一の多変量検定が望ましい。検定間の正の相関に対して α値 を低減して複数の検定を組み合わせるフィッシャー法は その一つである。もう一つは、ホテリングのT² 統計量がT²分布に従うというもの で ある。しかし、 T² の 表形式の値を見つけるのが難しいため、実際にはこの分布はほとんど使用されない。通常、T2 は F 統計量に変換されます。
1標本多変量検定の場合、仮説は平均ベクトル(μ ) が 与えられたベクトル(μ₀ )に等しいというものです。検定統計量はホテリングのt² です 。
t 2 = n ( x ¯ − μ 0 ) ′ S − 1 ( x ¯ − μ 0 ) {\displaystyle t^{2}=n({\bar {\mathbf {x} }}-{{\boldsymbol {\mu }}_{0}})'{\mathbf {S} }^{-1}({\bar {\mathbf {x} }}-{{\boldsymbol {\mu }}_{0}})} ここで、 n はサンプルサイズ、x は列平均のベクトル、Sは m × m のサンプル共分散行列 である。
2標本多変量検定の場合、仮説は2つの標本の平均ベクトル(μ1、μ2)が等しいというものです。 検定 統計量 は ホテリングの2標本t2 です 。
t 2 = n 1 n 2 n 1 + n 2 ( x ¯ 1 − x ¯ 2 ) ′ S プールされた − 1 ( x ¯ 1 − x ¯ 2 ) 。 {\displaystyle t^{2}={\frac {n_{1}n_{2}}{n_{1}+n_{2}}}\left({\bar {\mathbf {x} }}_{1}-{\bar {\mathbf {x} }}_{2}\right)'{\mathbf {S} _{\text{pooled}}}^{-1}\left({\bar {\mathbf {x} }}_{1}-{\bar {\mathbf {x} }}_{2}\right).}
2標本t 検定は、単純線形回帰の特殊なケースである。 2標本t検定は単純 線形回帰 の特殊なケースである[ 31 ] [ 32 ] [ 33 ] [ 34 ] [ 35 ] [ 36 ] 。この関係は次の例で示される。
臨床試験では、6人の患者に薬剤またはプラセボを投与します。3人の患者には薬剤を投与せず(プラセボ群)、残りの3人の患者には薬剤を投与します(有効治療群)。治療終了後、研究者は各患者が記憶力テストで思い出すことができる単語数のベースラインからの変化を測定します。
患者の単語想起能力と薬剤投与量の値を示す表を以下に示します。
t検定と線形回帰のための関数と関数を用いたRプログラミング言語 による分析のためのデータとコードが提供されています。以下は、上記と同じ(架空の)データをRで生成したものです。t.testlm
> word.recall.data = data.frame ( drug.dose = c ( 0 , 0 , 0 , 1 , 1 , 1 ), word.recall = c ( 1 , 2 , 3 , 5 , 6 , 7 )) t 検定を実行してください。var.equal=T分析を単純線形回帰と完全に等価にするためには、等分散性の仮定が必要であることに注意してください。
> ( word.recall.data 、 t.test ( word.recall ~ drug.dose 、 var.equal = T ) ) Rコードを実行すると、以下の結果が得られます。
0 薬物投与群の平均単語想起数は 2 です。 1 薬物投与群の平均単語想起数は 6 です。 治療群間の平均単語想起率の差は 6 - 2 = 4 です。 薬物投与量による単語想起率の差は有意である(p=0.00805)。 同じデータに対して線形回帰分析を実行します。計算は、Rlm()の線形モデル関数を使用して実行できます。
> word.recall.data.lm = lm ( word.recall ~ drug.dose , data = word.recall.data ) > summary ( word.recall.data.lm ) 線形回帰分析では、係数とp値の表が提供されます。
係数表から以下の結果が得られます。
切片の推定値2は、薬剤投与量が0の場合の単語想起の平均値である。 薬剤投与量の推定値4は、薬剤投与量が1単位変化する(0から1へ)と、平均単語想起率が4単位変化する(2から6へ)ことを示しています。これは、2つのグループの平均値を結ぶ直線の傾きです。 傾きが4であることと0であることのp値はp = 0.00805です。 線形回帰の係数は、グラフに示すように、2つのグループ平均を結ぶ直線の傾きと切片を指定します。切片は2、傾きは4です。
線形回帰分析の結果とt 検定の結果を比較してください。
t 検定の結果、グループ平均の差は6-2=4である。回帰分析の結果、傾きも4であり、これは薬剤投与量が1単位変化する(0から1へ)と、平均単語想起数が4単位変化する(2から6へ)ことを示している。 平均値の差に関するt検定のp 値 と、傾きに関する回帰分析のp値は、いずれも0.00805である。これらの手法は同一の結果をもたらす。 この例は、値が0と1の単一のx変数を持つ単純線形回帰の特殊なケースにおいて、t 検定が線形回帰と同じ結果をもたらすことを示しています。この関係は代数的にも示すことができます。
t 検定と線形回帰の関係を認識することで、重回帰分析や多変量分散分析 の使用が容易になります。これらのt検定の代替手法では、応答に関連する追加の 説明変数 を含めることができます 。回帰分析や分散分析を用いてこのような追加の説明変数を含めることで、説明されない分散が 減少し、2標本t検定よりも差を検出する 力が 大きくなります。[ 37 ]
t検定における検出力とサンプルサイズ 検定力とは、対立仮説が真である場合に、検定が帰無仮説を棄却する確率のことである。
2標本t検定の検出力計算には、以下の情報が必要です。[ 38 ]
2つのグループの平均値の差 グループ内標準偏差(2つのグループの標準偏差が同じ場合) 各グループのサンプルサイズ(被験者数) 有意性を示すために必要なp値(アルファ) 検出力を計算するには、標準化効果量を計算すると便利です。標準化効果量とは、2つの平均値の差をグループ内標準偏差で割った値です。たとえば、グループAの平均が14、グループBの平均が10で、グループ内標準偏差が8単位(2つのグループの標準偏差が同じであると仮定)だとします。この場合、グループ平均の差は14-10=4単位となり、標準化効果量は(14-10)/8=4/8=0.5となります。
下のグラフは、標準化効果量が0.1から1まで、グループあたりのサンプルサイズが10から50までの場合の検出力を示しています。ただし、グループあたりの被験者数は均等であると仮定しています。グループあたりのNは、各グループの観測数です。例えば、標準化効果量が0.5の場合、グループあたりのサンプルサイズがN=10であれば検出力は0.2弱となり、グループあたりのサンプルサイズがN=50であれば検出力は約0.7となります。
2標本t検定の検出力と標準化効果量および標本サイズの関係を示すグラフ 検出力とサンプルサイズを計算するツールは、以下のような多くのウェブサイトで利用できます。
サンプルサイズ計算ツール
2つの独立した平均値を比較するためのサンプルサイズ計算ツール
検出力とサンプルサイズを計算するための無料ソフトウェアパッケージについては、以下のウェブサイトで説明されています。
2群独立標本t検定の検出力分析|Rデータ分析例
G*Power
追伸
以下のような市販のソフトウェアパッケージは、t検定をはじめとする多くの統計検定において、検出力とサンプルサイズを提供します。
サンプルサイズソフトウェア | 検出力分析ソフトウェア | PASS | NCSS.com
nQueryを使用して臨床試験デザインを最適化する
IBM SPSS Statistics
Stataの検出力とサンプルサイズに関する機能
Minitabには、どのような検出力分析とサンプルサイズ分析が含まれていますか?
参考文献 ↑ 『健康と疾患におけるマイクロバイオーム』 。アカデミック・プレス。2020年5月29日。397 ページ。ISBN 978-0-12-820001-8 。↑ イシュトヴァーンのサボー (2003)。 「Systeme aus einer endlichen Anzahl starrer Körper」。 Einführung in die Technische Mechanik (ドイツ語)。シュプリンガー ベルリン ハイデルベルク。 pp. 196–199 . doi : 10.1007/978-3-642-61925-0_16 (2025 年 7 月 12 日に非アクティブ)。 ISBN 978-3-540-13293-6 。{{cite book}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)↑ シュリヴィッチ、B. (1937 年 10 月)。 「Untersuhungen über den anasomotischen Kanal zwischen der Arteria coeliaca und mesenterica優れた und damit in Zusammenhang stehende Fragen」。 Zeitschrift für Anatomy und Entwicklungsgeschichte (ドイツ語)。 107 (6): 709–737 . 土井 : 10.1007/bf02118337 。 ISSN 0340-2061 。 S2CID 27311567 。 ↑ ヘルマート(1876年)。 「Die Genauigkeit der Formel von Peters zur Berechnung des wahrscheinlichen Beobachtungsfehlers 監督 Beobachtungen gleicher Genauigkeit」 。 Astronomische Nachrichten (ドイツ語)。 88 ( 8–9 ): 113–131 . Bibcode : 1876AN....88....113H 。 土井 : 10.1002/asna.18760880802 。 ↑ ルーロス、J. (1876)。 「Vergleichung von zwei Werthen des wahrscheinlichen Fehlers」 。 Astronomische Nachrichten (ドイツ語)。 87 (14): 209–220 。 ビブコード : 1876AN....87....209L 。 土井 : 10.1002/asna.18760871402 。 ↑ Pfanzagl, J. (1996). "確率と統計の歴史に関する研究 XLIV. t 分布の先駆け ". Biometrika . 83 (4): 891– 898. doi : 10.1093/biomet/83.4.891 . MR 1766040 . ↑ Sheynin, Oscar (1995). "Helmert's work in the theory of errors". Archive for History of Exact Sciences . 49 (1): 73– 104. doi : 10.1007/BF00374700 . ISSN 0003-9519 . S2CID 121241599 . ↑ Pearson, Karl (1895). "X. 進化の数学的理論への貢献.—II. 均質な物質における歪んだ変動" . Philosophical Transactions of the Royal Society of London A . 186 : 343– 414. Bibcode : 1895RSPTA.186..343P . doi : 10.1098/rsta.1895.0010 . 1 2 Student (1908). "平均の推定誤差" (PDF) . Biometrika . 6 (1): 1– 25. doi : 10.1093/biomet/6.1.1 . hdl : 10338.dmlcz/143545 . 2016年 7月24日 取得 . ↑ Wendl, Michael C. (2016). "偽名による名声". Science . 351 (6280): 1406. doi : 10.1126/science.351.6280.1406 . PMID 27013722 . ↑ ウォルポール、ロナルド E. (2006). エンジニアと科学者のための確率と統計 . マイヤーズ、H. レイモンド (第 7 版). ニューデリー: ピアソン. ISBN 81-7758-404-9 . OCLC 818811849 . ↑ Raju, TN (2005). "William Sealy Gosset と William A. Silverman: 2 人の「科学の学生」". Pediatrics . 116 (3): 732– 735. doi : 10.1542/peds.2005-1134 . PMID 16140715 . S2CID 32745754 . ↑ドッジ 、 ヤドラ (2008)。 統計学簡潔百科事典 。シュプリンガー・ サイエンス&ビジネス・メディア。pp. 234–235。ISBN 978-0-387-31742-7 。↑ ファデム、バーバラ(2008)。 高収益行動科学 。高収益シリーズ。メリーランド州ヘイガーズタウン:リッピンコット・ウィリアムズ&ウィルキンス 。ISBN 9781451130300 。↑ ライス、ジョン A. (2006). 数理統計学とデータ分析 (第 3 版). ダックスベリー アドバンスト。 ↑ Weisstein, Eric. "Student's t -Distribution" . mathworld.wolfram.com . ↑ David, H. A.; Gunnink, Jason L. (1997). " 人工ペアリング下での ペア t検定". The American Statistician . 51 (1): 9– 12. doi : 10.2307/2684684 . JSTOR 2684684 . 1 2 3 4 Lumley, Thomas; Diehr, Paula ; Emerson, Scott; Chen, Lu (2002 年 5 月) 「大規模な公衆衛生データセットにおける正規性仮定の重要性」 . Annual Review of Public Health . 23 (1): 151– 169. doi : 10.1146/annurev.publhealth.23.100901.140546 . ISSN 0163-7525 . PMID 11910059 . ↑ Markowski, Carol A.; Markowski, Edward P. (1990). "分散の予備検定の有効性の条件". The American Statistician . 44 (4): 322– 326. doi : 10.2307/2684360 . JSTOR 2684360 . ↑ Guo, Beibei; Yuan, Ying (2017). "部分的にペアになったデータを使用して平均値を比較する方法の比較レビュー". Statistical Methods in Medical Research . 26 (3): 1323– 1340. doi : 10.1177/0962280215577111 . PMID 25834090. S2CID 46598415 . ↑ ブランド、マーティン(1995)。 『医学統計学入門 』オックスフォード大学出版局、 168ページ 。ISBN 978-0-19-262428-4 。↑ 「中心極限定理と正規性の仮定 > 正規性 > 連続分布 > 分布 > 統計リファレンスガイド | Analyse-it® 6.15 ドキュメント」 。analyse -it.com 。 2024年5月17日 取得 。 ↑ DEMİR, Süleyman (2022-06-26). "異なる歪度と尖度係数の下でのサンプルサイズに関する正規性検定の比較" . International Journal of Assessment Tools in Education . 9 (2): 397– 409. doi : 10.21449/ijate.1101295 . ISSN 2148-7456 . ↑ 「私のウェブスペースファイル」 (PDF) . webspace.ship.edu . ↑ Wang, Chang; Jia, Jinzhu (2022). "Te Test: Behrens-Fisher問題に対する新しい非漸近T検定". arXiv : 2210.16473 [ math.ST ]. 1 2 Sawilowsky, Shlomo S.; Blair, R. Clifford (1992). " 母集団正規性からの逸脱に対する t検定の頑健性とタイプIIエラー特性に関するより現実的な考察". Psychological Bulletin . 111 (2): 352– 360. doi : 10.1037/0033-2909.111.2.352 . ↑ Zimmerman, Donald W. (1998 年 1 月). 「 2 つの仮定の同時違反によるパラメトリックおよびノンパラメトリック統計検定の無効化」. The Journal of Experimental Education . 67 (1): 55–68 . doi : 10.1080/00220979809598344 . ISSN 0022-0973 . ↑ Blair, R. Clifford; Higgins, James J. (1980). "A Comparison of the Power of Wilcoxon's Rank-Sum Statistic to That of Student's t Statistic Under Various Nonnormal Distributions". Journal of Educational Statistics . 5 (4): 309– 335. doi : 10.2307/1164905 . JSTOR 1164905 . ↑ Fay, Michael P.; Proschan, Michael A. (2010). "Wilcoxon–Mann–Whitney または t -test? 仮説検定の仮定と決定ルールの複数の解釈について" . Statistics Surveys . 4 : 1– 39. doi : 10.1214/09-SS051 . PMC 2857732 . PMID 20414472 . ↑ Derrick, B; Toher, D; White, P (2017). "How to compare the means of two samples that include paired observations and independent observations: A companion to Derrick, Russ, Toher and White (2017)" (PDF) . The Quantitative Methods for Psychology . 13 (2): 120– 126. doi : 10.20982/tqmp.13.2.p120 . ↑ クトナー、マイケル H.、ナハトシャイム、C.J.、ネター、ジョン (2004)、 『応用線形回帰モデル』 、マグロウヒル、 ISBN 9780073521442 ↑ ウォーカー、マイケル (2024)、 生物学研究でp値を0.05未満にする方法:検出力を高め、サンプルサイズを減らし、より良い統計検定を選択する方法の実践例 (PDF) 、Amazon、 ISBN 979-8877882577 ↑ Pandis, Nikolaos J (2016). "t検定と分散分析のための線形回帰の使用" . American Journal of Orthodontics and Dentofacial Orthopedics . 149 (5p769May): 269– 284. ↑ 2標本t検定は線形回帰の特殊なケースである ↑ Rにおける線形モデルとしての独立t検定 ↑ 2.9 2標本t検定と線形回帰の関連性の構築 ↑ Shieh, Gwowen (2020 年 3月) 「ANCOVAデザインにおける検出力分析とサンプルサイズ計画」 Psychometrika . 85 ( 1): 101– 120. doi : 10.1007/s11336-019-09692-3 . ISSN 1860-0980 . PMC 8225521. PMID 31823115 . ↑ Julious, Steven A. (2010), Sample sizes for clinical trials , Chapman and Hall/CRC, ISBN 978-1584887393
さらに読む Boneau, C. Alan (1960). 「 t 検定の前提条件違反の影響」. Psychological Bulletin . 57 (1): 49–64 . doi : 10.1037/h0041412 . PMID 13802482 . Edgell, Stephen E.; Noon, Sheila M. (1984). "相関係数のt 検定における正規性の違反の影響". Psychological Bulletin . 95 (3): 576–583 . doi : 10.1037/0033-2909.95.3.576 . Chicco D.; Sichenze A.; Jurman G. (2025). "生物統計学におけるスチューデントのt検定、マン・ホイットニーU検定、カイ二乗検定、およびクラスカル・ウォリス検定の使用に関する簡単なガイド" . BioData Mining . 18 (56) 56: 1– 51. doi : 10.1186/s13040-025-00465-6 . PMC 12366075 . PMID 40835959 .