統計学において、効果量とは現象の大きさを定量的に表す尺度である。[ 1 ]これは、データのサンプルから計算された統計量の値、仮想母集団の1つのパラメータの値、または統計量やパラメータが効果量値にどのように繋がるかを操作的に表す方程式を指す。[ 1 ]効果量の例としては、2つの変数間の相関[ 2 ] 、回帰分析における回帰係数、平均差、特定の事象(心臓発作など)のリスクなどがある。効果量は統計的仮説検定の補完的なツールであり、新しい実験に必要なサンプルサイズを評価するための統計的検出力分析において重要な役割を果たす。 [ 3 ]効果量の計算はメタ分析の基礎であり、メタ分析は複数の研究のデータに基づいて統合効果量を提供することを目的としている。効果量に関するデータ分析手法のグループは推定統計と呼ばれる。
効果量は統計的主張の強さを評価する上で不可欠な要素であり、MAGIC基準の最初の項目(大きさ)です。効果量の標準偏差は、観測された測定値にどれだけの不確実性が含まれているかを示すため、非常に重要です。標準偏差が大きすぎると、測定値はほとんど意味をなさなくなります。複数の効果量を単一の推定値にまとめることを目的とするメタ分析では、各研究の効果量の不確実性を使用して各研究の貢献度を重み付けするため、規模の大きい研究は規模の小さい研究よりも重要であるとみなされます。効果量の不確実性の計算方法は効果量の種類ごとに異なりますが、一般的には研究のサンプルサイズ(N )、つまり各グループの観測数(n )を知るだけで済みます。
多くの分野で実証研究の結果を発表する際には、効果量またはその推定値(効果推定値[EE]、効果の推定値)を報告することが良い慣行とみなされています。[ 4 ] [ 5 ]効果量の報告は、統計的有意性とは対照的に、研究結果の重要性の解釈を容易にします。[ 6 ]効果量は、社会科学や医学研究において特に重要であり、後者では平均治療効果の大きさの重要性が強調されます。
効果量は、相対値または絶対値で測定できます。相対効果量では、オッズ比や相対リスクのように、2つのグループが直接比較されます。絶対効果量の場合、絶対値が大きいほど効果が強いことを示します。多くの種類の測定値は、絶対値または相対値のいずれかで表現でき、これらは異なる情報を伝えるため、併用できます。心理学研究コミュニティの著名なタスクフォースは、次の勧告を行いました。
主要アウトカムについては必ず効果量を提示してください。測定単位が実用的なレベルで意味を持つ場合(例:1日あたりの喫煙本数)、通常は標準化された尺度(rまたはd)よりも非標準化された尺度(回帰係数または平均差)を好みます。[ 4 ]
統計的推定と同様に、真の効果量は観測された効果量とは区別されます。たとえば、集団における疾病リスク(集団効果量)を測定するには、その集団の標本におけるリスク(標本効果量)を測定できます。真の効果量と観測された効果量を記述するための慣例は、標準的な統計的手法に従います。一般的なアプローチの1つは、母集団パラメータを表すためにρ [rho]のようなギリシャ文字を使用し、対応する統計量を表すためにrのようなラテン文字を使用することです。あるいは、統計量を表すために母集団パラメータの上に「ハット」を付けることができます。たとえば、パラメータの推定値。
あらゆる統計的状況と同様に、効果量は標本誤差を伴って推定され、使用される効果量推定量がデータのサンプリング方法と測定方法に適切でない限り、偏りが生じる可能性があります。その一例として出版バイアスがあり、これは推定された効果量が大きい場合、または統計的に有意な場合にのみ科学者が結果を報告する場合に発生します。その結果、多くの研究者が統計的検出力の低い研究を実施すると、報告される効果量は、もしあれば真の(母集団)効果よりも大きくなる傾向があります。[ 7 ]効果量が歪む可能性のあるもう1つの例は、複数回の試行実験で、効果量の計算が試行全体の平均または集計された応答に基づいている場合です。[ 8 ]
小規模な研究では、大規模な研究とは異なる、しばしばより大きな効果量を示すことがあります。この現象は小規模研究効果として知られており、出版バイアスを示唆している可能性があります。[ 9 ]
サンプルに基づく効果量は、仮説検定で使用される検定統計量とは異なり、観察された関係の大きさが偶然によるものかどうかを反映する有意水準を割り当てるのではなく、例えば見かけ上の関係の強さ(大きさ)を推定します。効果量は有意水準を直接決定するものではなく、またその逆もありません。サンプルサイズが十分に大きい場合、母集団効果量が正確にゼロでない限り、非ゼロの統計的比較は常に統計的に有意な結果を示します(たとえゼロであっても、使用される第一種過誤率で統計的有意性を示します)。たとえば、サンプルサイズが1000の場合、サンプルピアソン相関係数が0.01であれば、統計的に有意です。相関係数が0.01と小さすぎて特定の用途では関心がない場合、この分析から有意なp値のみを報告すると誤解を招く可能性があります。
効果量という用語は、標準化された効果量(r、コーエンのd、オッズ比など)または非標準化された効果量(グループ平均の差、非標準化回帰係数など)を指す場合があります。標準化された効果量は通常、次のような場合に使用されます。
メタ分析では、標準化された効果量が共通の指標として用いられ、異なる研究ごとに計算して、全体的な要約に統合することができる。
効果量が小さい、中程度、大きいと解釈されるかどうかは、その実質的な文脈と操作的定義によって決まります。ジェイコブ・コーエン[ 10 ]は、多くの分野でほぼ普遍的に用いられている解釈ガイドラインを提案しました。しかし、コーエンは次のように注意を促しています。
「『小』『中』『大』という用語は、互いに相対的なだけでなく、行動科学の分野、あるいはより具体的には、特定の調査で用いられる内容や研究方法によっても相対的な意味合いを持ちます。このような相対性があるため、行動科学のように多様な研究分野における検出力分析で使用するために、これらの用語に慣習的な操作的定義を与えることには、一定のリスクが伴います。しかしながら、ES指標を推定するためのより良い基準がない場合にのみ使用することが推奨される共通の慣習的な参照枠を提供することで、失うものよりも得るものの方が大きいという信念に基づき、このリスクは受け入れられています。」(25ページ)
Sawilowsky [ 11 ]は、効果量の目安となるルールを見直し、説明を「非常に小さい」「非常に大きい」「巨大」に拡張することを推奨した。Funder と Ozer [ 12 ]は、効果量はベンチマークと研究結果の結果に基づいて解釈されるべきであり、その結果、ガイドラインの推奨事項が調整されることを示唆した。
Lenth [ 13 ]は、中程度の効果量について、「測定機器の正確性や信頼性、対象者の狭さや多様性に関係なく、同じn を選択することになる。明らかに、重要な考慮事項がここでは無視されている。研究者は、結果を意味のある文脈に基づかせるか、知識への貢献を定量化することによって、結果の実質的な意義を解釈する必要があり、Cohen の効果量の記述は出発点として役立つ可能性がある」と指摘した。[ 6 ]同様に、米国教育省が後援した報告書では、Cohen の解釈ガイドラインの広範な無差別使用は不適切で誤解を招く可能性があると主張した。[ 14 ]代わりに、基準は比較可能な研究の効果量の分布に基づいて設定されるべきだと提案した。したがって、効果がその分野の類似の研究よりも大きい場合、小さな効果(絶対値)は大きいとみなされる可能性がある。関連する点については、 Abelson のパラドックスと Sawilowsky のパラドックスを参照のこと。 [ 15 ] [ 16 ] [ 17 ]
以下の表には、Jacob Cohen [ 10 ]が最初に提案し、後に Sawilowsky [ 11 ]および Funder & Ozer [ 12 ]によって拡張された、 d、r、f 、およびomegaのさまざまな大きさの記述子が含まれています。
効果量の指標としては、約50~100種類が知られています。多くの効果量は2つの分布の分離を推定するものであるため、数学的に関連しており、様々な種類の効果量を他の種類に変換することができます。例えば、相関係数はコーエンのd値に変換でき、その逆も可能です。
これらの効果量は、実験モデルによって「説明」または「説明される」実験内の分散の量を推定します(説明された変動)。
ピアソンの相関係数( rで表されることが多く、カール・ピアソンによって提唱された)は、ペアになった量的データが利用可能な場合の効果量として広く用いられています。例えば、出生体重と寿命の関係を研究する場合などがこれに該当します。相関係数は、データが二値データの場合にも使用できます。ピアソンのrの値は-1から1まで変化し、-1は完全な負の線形関係、1は完全な正の線形関係、0は2つの変数間に線形関係がないことを示します。
関連する効果量として、決定係数r² ( R²または「r二乗」とも呼ばれる)があり、これはピアソン相関係数rの二乗として計算されます。ペアデータの場合、これは 2 つの変数によって共有される分散の割合を示す尺度であり、0 から 1 まで変化します。たとえば、rが 0.21 の場合、決定係数は 0.0441 となり、これは、いずれかの変数の分散の 4.4% がもう一方の変数と共有されていることを意味します。r² は常に正の値をとるため、2 つの変数間の相関の方向を示すものではありません。
η二乗は、他の予測変数を制御しながら、従属変数の分散のうち予測変数によって説明される割合を表すもので、r²に類似しています。η二乗は、母集団におけるモデルによって説明される分散の偏りのある推定値です(サンプルにおける効果量のみを推定します)。この推定値は、変数を追加するたびにη²の値が自動的に増加するという点で、r²と共通の弱点を持っています。さらに、母集団ではなくサンプルの説明される分散を測定するため、常に効果量を過大評価することになりますが、サンプルが大きくなるにつれて偏りは小さくなります。
母集団で説明される分散のバイアスが少ない推定値はω 2 [ 18 ]である。
この形式の式は、すべてのセルでサンプルサイズが等しい被験者間分析に限定されます。[ 18 ] ω 2は η 2よりもバイアスが少ない (ただしバイアスがないわけではない) ため好ましいですが、複雑な分析では計算がより不便になる場合があります。推定量の一般化された形式は、被験者間および被験者内分析、反復測定、混合デザイン、およびランダム化ブロックデザイン実験用に公開されています。[ 19 ]さらに、最大 3 つの独立変数を持つデザインで個々の因子と複合因子の部分ω 2を計算する方法も公開されています。[ 19 ]
コーエンのf 2は、 ANOVAまたは重回帰のF 検定で使用される効果量尺度の 1 つです。そのバイアス (ANOVA の効果量の過大評価) の量は、説明される分散の基礎となる測定値 (例: R 2、η 2、ω 2 )のバイアスに依存します。
重回帰分析におけるf2効果量指標は、次のように定義され ます。
同様に、f 2 は次のように定義できます。 または これらの効果量指標で記述されるモデルの場合。[ 20 ]
の逐次多重回帰における効果量尺度であり、PLSモデリングでも一般的に用いられる[ 21 ]は、次のように定義される。 ここで、R 2 Aは 1 つ以上の独立変数Aのセットによって説明される分散であり、R 2 ABはAと関心のある別の 1 つ以上の独立変数Bのセットによって説明される結合分散です。慣例として、f 2効果量は、、 そしてそれぞれ小、中、大と呼ばれます。[ 10 ]
コーエンのまた、以下の方法を用いて、逆算して因子分散分析(ANOVA)を行うこともできます。
ANOVAのバランスのとれたデザイン(グループ間でサンプルサイズが等しい)では、対応する母集団パラメータはは ここで、μ j は全K個のグループのうちj番目のグループにおける母平均を表し、σ は各グループにおける母標準偏差を表します。SSはANOVA における平方和です。
相関差で用いられるもう1つの指標は、コーエンのqです。これは、2つのフィッシャー変換されたピアソン回帰係数の差です。記号で表すと次のようになります。
ここで、r 1とr 2は比較対象の回帰係数です。q の期待値はゼロで、その分散は ここで、N 1とN 2はそれぞれ第1回および第2回回帰におけるデータポイントの数である。
2つのグループを比較する際の生の効果量は、本来、2つの平均値の差として算出されます。しかし、解釈を容易にするために、効果量を標準化することが一般的です。統計的標準化のための様々な慣例を以下に示します。

平均値に基づく(母集団)効果量θは、通常、2つの母集団間の標準化平均差(SMD)を考慮する[ 22 ]: 78 ここで、μ 1は一方の母集団の平均、μ 2はもう一方の母集団の平均、σ はどちらか一方または両方の母集団に基づく標準偏差である。
実際の現場では、母集団の値は通常不明であり、標本統計量から推定する必要がある。平均値に基づく効果量のいくつかのバージョンは、使用する統計量によって異なる。
この効果量の形式は、 t検定統計量の計算に似ていますが、 t検定統計量には係数が含まれているという重要な違いがあります。これは、特定の効果量に対して、有意水準はサンプルサイズとともに上昇することを意味します。t検定統計量とは異なり、効果量は母集団パラメータを推定することを目的としており、サンプルサイズの影響を受けません。
SMD値が0.2~0.5の場合は小さい、0.5~0.8の場合は中程度、0.8より大きい場合は大きいとみなされます。[ 23 ]
コーエンのdは、2つの平均値の差をデータの標準偏差で割った値として定義されます。
ジェイコブ・コーエンは、プールされた標準偏差sを(2つの独立したサンプルについて)次のように定義した。 [ 10 ]: 67 ここで、一方のグループの分散は次のように定義される。 そして、もう一方のグループについても同様である。
他の著者らは、「コーエンのd」を参照する際に、分母に「-2」を含まない標準偏差の計算方法をわずかに変更している[ 24 ] [ 25 ]: 14 この「コーエンのd 」の定義は、ヘッジスとオルキン[ 22 ]によって最尤推定量と呼ばれ、スケーリング係数によってヘッジスのg と関連付けられています(下記参照)。
2つのペアサンプルでは、差分スコアの分布を調べるというアプローチがあります。この場合、sは差分スコアの分布の標準偏差です(差分スコアの標準偏差は、ペアサンプル間の相関に依存することに注意してください)。これにより、2つのペアグループの平均値の差を検定するためのt統計量と、Cohenのd'(差分スコアで計算)の間には、次の関係が生まれます。 そして しかし、ペアサンプルについては、コーエンは、d' は d の検定力を得るための正しい推定値を提供しないため、d の表で値を調べる前に、次の式のように r で補正する必要があると述べています。[ 26 ]ここで、rはペアになった測定値間の相関係数です。サンプルサイズが同じ場合、rの値が大きいほど、ペアになった差の検定における検出力が高くなります。
d' は r に依存するため、効果量の尺度としては解釈が困難です。したがって、ペア分析の文脈では、d' または d (プールされた標準偏差、またはグループまたは時点の標準偏差で推定) を計算できるため、どちらが報告されているかを明示的に示す必要があります。効果量の尺度としては、d (プールされた標準偏差、またはグループまたは時点の標準偏差で推定) の方が、例えばメタ分析においてより適切です。[ 27 ]
コーエンのdは、統計的検定のサンプルサイズを推定する際によく使用されます。コーエンのdが低いほど、より大きなサンプルサイズが必要であることを示し、その逆もまた然りです。これは、望ましい有意水準と統計的検出力という追加のパラメータとともに決定できます。[ 28 ]
1976年、ジーン・V・グラスは、第2グループの標準偏差のみを使用する効果量の推定値を提案した[ 22 ]: 78
2番目のグループは対照群とみなすことができ、グラスは、複数の治療法を対照群と比較する場合、平均値が等しく分散が異なる場合でも効果の大きさが異ならないように、対照群から計算された標準偏差のみを使用する方が良いと主張した。
母集団の分散が等しいという正しい仮定の下では、σの統合推定値はより正確である。
1981年にラリー・ヘッジスによって提案されたヘッジスのg [ 29 ]は、 標準化された差に基づく他の尺度と同様である[ 22 ]: 79 ここでプールされた標準偏差計算方法は以下のとおりです。
しかし、母集団効果量θの推定値としては偏りがある。とはいえ、この偏りは係数を乗じることで近似的に補正できる。 ヘッジスとオルキンはこのバイアスの少ない推定量について言及している。dと同様ですが、[ 22 ]コーエンのdとは異なります。補正係数J ()の正確な形式はガンマ関数を含みます[ 22 ] : 104 ヘッジのgの多段階バリアントもあり、例えばクラスター無作為化比較試験(CRT)で使用されるものなどがあります。[ 30 ] CRTでは、学校や教室などのクラスターを異なる条件に無作為に割り当て、教育研究で頻繁に使用されます。
多重比較( ANOVAなど)に対する同様の効果量推定値は、Ψ二乗平均平方根標準化効果です。[ 20 ] ここで、kは比較対象となるグループの数である。
これは基本的に、 dやgと同様に、二乗平均平方根で調整されたモデル全体の包括的な差分を示しています。
さらに、多因子設計に対する一般化も提供されている。[ 20 ]
データがガウス分布に従う場合、スケーリングされたヘッジのg、は、非心度パラメータを持つ非心t分布に従います。そして、( n 1 + n 2 − 2)の自由度を持つ。同様に、スケーリングされたグラスの Δ は、 n 2 − 1の自由度で分布する。
分布から、効果量の期待値と分散を計算することが可能です。
場合によっては、分散の大きなサンプル近似が使用される。ヘッジの不偏推定量の分散に関する提案の1つは[ 22 ]: 86である。
統計パラメータとして、SSMD(次のように表記される)は、2 つのグループからそれぞれ得られた 2 つのランダム値の差の平均と標準偏差の比として定義されます。ランダム値を持つ一方のグループの平均が であると仮定します。および分散また別のグループの平均はおよび分散2つのグループ間の共分散は 次に、これら2つのグループの比較のためのSSMDは次のように定義されます[ 31 ]
2つのグループが独立している場合、
2 つの独立したグループの分散が等しい場合、
マハラノビス距離(D)は、変数間の関係を考慮に入れたコーエンのdの多変量一般化である。[ 32 ]
スビンのE()は、ペアになった反復評価データに対する制限付き効果量です。これは、参照スプレッドを使用して平均ゲインを標準化し、個々のゲインスコアの異質性を組み込み、制限付きアークタンジェント変換を適用します。これは、反復評価の機会にわたるグループ内のペア比較を目的としています。[ 33 ] [ 34 ]
どこ
この方法の公表された校正では、推奨されるパラメータ値は以下のとおりでした。そして[ 33 ]
ここそして2つの評価時点における平均値を表す。そして対応する標準偏差を表す。は個々のゲインスコアの標準偏差であり、は小標本補正係数です。この方法について報告されている実際的な近似では、[ 33 ]
カイ二乗検定で一般的に使用される関連性の尺度は、ファイ係数とクレイマーのV(クレイマーのファイと呼ばれることもあり、φcと表記される)です。ファイは点双列相関係数とコーエンのdに関連しており、2つの変数(2 × 2)間の関係の程度を推定します。[ 35 ]クレイマーのVは、2つ以上のレベルを持つ変数にも使用できます。
ファイ値は、カイ二乗統計量を標本サイズで割った値の平方根を求めることで計算できます。
同様に、クレイマーのVは、カイ二乗統計量をサンプルサイズと最小次元の長さ( kは行数rまたは列数cの小さい方)で割った値の平方根を取ることによって計算されます。
φ cは 2 つの離散変数の相互相関[ 36 ]であり、 rまたはcの任意の値に対して計算できます。ただし、カイ二乗値はセルの数とともに増加する傾向があるため、 rとc の差が大きいほど、意味のある相関の強い証拠がない場合でも V が 1 に近づく可能性が高くなります。
カイ二乗検定で使用される効果量のもう1つの尺度は、コーエンのオメガ(これは次のように定義されます。 ここで、p 0 iはH 0の下にあるi番目の細胞の割合、p 1 iはH 1の下にあるi番目の細胞の割合、mは細胞の数です。
オッズ比(OR)は、もう一つの有用な効果量です。これは、研究課題が2つの二値変数間の関連性の程度に焦点を当てている場合に適しています。たとえば、スペリング能力の研究を考えてみましょう。対照群では、不合格者1人に対して合格者が2人なので、合格のオッズは2対1(または2/1 = 2)です。治療群では、不合格者1人に対して合格者が6人なので、合格のオッズは6対1(または6/1 = 6)です。治療群の合格のオッズは対照群の3倍である(6÷2は3なので)ことに注目すれば、効果量を計算できます。したがって、オッズ比は3です。オッズ比の統計量はコーエンのdとは異なる尺度であるため、この「3」はコーエンのdの 3とは比較できません。
相対リスク(RR)、またはリスク比とは、ある独立変数に対する事象のリスク(確率)のことです。この効果量の尺度は、オッズ比とは異なり、オッズではなく確率を比較しますが、確率が小さい場合は漸近的にオッズ比に近づきます。上記の例を用いると、対照群と治療群の合格確率はそれぞれ 2/3(または 0.67)と 6/7(または 0.86)です。効果量は、上記と同様に計算できますが、確率を使用します。したがって、相対リスクは 1.28 です。合格確率がかなり高かったため、相対リスクとオッズ比の間には大きな差があります。もし事象として(合格ではなく)失敗(より低い確率)を使用していたら、2 つの効果量の尺度の差はそれほど大きくなかったでしょう。
どちらの指標も有用ですが、統計的な用途が異なります。医学研究では、オッズ比は症例対照研究でよく使用されます。これは、確率ではなくオッズが通常推定されるためです。[ 37 ] 相対リスクはランダム化比較試験やコホート研究でよく使用されますが、相対リスクは介入の効果を過大評価する原因となります。[ 38 ]
リスク差(RD)は、絶対リスク減少とも呼ばれ、2 つのグループ間のイベントのリスク(確率)の差です。RD は、実験的介入がイベントまたは結果の確率をどの程度変化させるかを示すため、実験研究において有用な指標です。上記の例では、対照群と治療群の合格確率はそれぞれ 2/3(または 0.67)と 6/7(または 0.86)であり、RD 効果量は 0.86 − 0.67 = 0.19(または 19%)です。RD は、介入の有効性を評価するための優れた指標です。[ 38 ]
2つの独立した比率を比較する際の検出力分析で使用される指標の1つに、コーエンのhがあります。これは次のように定義されます。 ここで、p 1とp 2は比較対象となる 2 つのサンプルの割合であり、arcsin はアークサイン変換です。
統計学以外の人々に効果量の意味をより簡単に説明するために、その名の通り、平易な英語で伝えることを目的とした共通言語効果量が考案されました。これは2つのグループ間の差を説明するために使用され、1992年にケネス・マクグローとSP・ウォンによって提案され、命名されました。[ 39 ]彼らは、共通言語効果量の母集団値を説明する際に、次の例(男性と女性の身長について)を使用しました。「若い成人男性と女性の任意のランダムなペアリングでは、男性が女性より背が高い確率は0.92です。さらに簡単に言うと、若い成人の100回のブラインドデートのうち92回は、男性が女性より背が高いでしょう」[ 39 ]。
クリフのデルタまたはもともとノーマン・クリフが順序データで使用するために開発した[ 40 ]は、ある分布の値が別の分布の値よりも大きい頻度を測定するものです。重要なのは、2つの分布の形状や広がりについて何の仮定も必要としないことです。
サンプル推定値次のように与えられます。 ここで、2つの分布のサイズはそしてアイテム付きそしてそれぞれ、これはアイバーソンブラケットであり、内容が真の場合は1、偽の場合は0になります。
はマン・ホイットニーU統計量と線形関係にあるが、符号の差の方向を捉えている。マン・ホイットニー、は:
割合が50%からどれだけ異なるかを測定する最も単純な効果量の1つは、コーエンのgです。[ 10 ]: 147これは、割合が50%からどれだけ異なるかを測定します。たとえば、自動車窃盗で逮捕された人の85.2%が男性である場合、コーエンのgで測定した逮捕に対する性別の効果量は次のようになります。。 一般的に:
コーエンのgの単位は、他の効果量に比べて直感的に理解しやすい(割合)ものです。二項検定と組み合わせて使用されることもあります。
標準化された効果量の信頼区間、特にコーエンのそして非心度パラメータ( ncp )の信頼区間の計算に依存します。ncp の信頼区間を構築する一般的なアプローチは、観測された統計量をテール分位数α /2 および (1 − α /2) に適合させる臨界ncp値を見つけることです。SAS および R パッケージ MBESS には、ncpの臨界値を見つける関数が用意されています。
単一グループの場合、Mは標本平均、μは母平均、SDは標本の標準偏差、σは母の標準偏差、nはグループの標本サイズを表します。t値は、平均と基準値μ baselineとの差に関する仮説を検定するために使用されます。通常、μ baselineはゼロです。関連する2つのグループの場合、単一グループは標本のペアの差によって構成され、SDとσは元の2つのグループ内ではなく、標本と母の差の標準偏差を表します。 そしてコーエンの
は、
それで、
n1またはn2は、それぞれサンプルサイズです。
その中に
そしてコーエンの は、
それで、
一元配置分散分析では、非心F分布が適用されます。母集団の標準偏差が与えられた場合、同じテスト問題では、非心カイ二乗分布が適用されます。
i番目のグループX i、j内の各j番目のサンプルについて、
その間、
したがって、Fのncp ( s )と等しい
の場合同じサイズのK個の独立したグループの場合、合計サンプルサイズはN := n · Kです。
2つの独立したグループに対するt検定は、一元配置分散分析の特殊なケースです。非心度パラメータに注意してください。Fの値は非心度パラメータとは比較できない対応するtの。実際には、、 そして。
SMD の値が 0.2~0.5 の場合は小さい、0.5~0.8 の場合は中程度、0.8 を超える場合は大きいとみなされます。独立したグループを比較する精神薬理学研究では、統計的に有意な SMD はほぼ常に小さいから中程度の範囲にあります。大きな SMD が得られることはまれです。
さらなる説明