統計学において、ファミリーワイズエラー率( FWER )とは、複数の仮説検定を実行するときに1 つ以上の誤った発見、つまりタイプ I のエラーが発生する確率です。
家族別および実験別のエラー率
ジョン・テューキーは1953年に、特定のグループ、つまり「ファミリー」のテストでタイプIエラーが発生する確率として、ファミリーワイズエラー率の概念を開発しました。[1]ライアン(1959)は、関連する概念である実験ワイズエラー率を提唱しました。これは、特定の実験でタイプIエラーが発生する確率です。[2]したがって、実験ワイズエラー率は、ファミリーに実験内で実行されるすべてのテストが含まれる場合のファミリーワイズエラー率です。
Ryan (1959, 脚注 3) が説明したように、実験には 2 つ以上の多重比較ファミリーが含まれる場合があり、それぞれが特定の統計的推論に関連し、それぞれに個別のファミリーワイズエラー率があります。[2]したがって、ファミリーワイズエラー率は通常、理論的に有益な多重比較のコレクションに基づいています。対照的に、実験ワイズエラー率は、さまざまな範囲の個別の推論を参照する同時比較のコレクションに基づいています。このような場合、実験ワイズエラー率を制御することは有用ではないと主張する人もいます。[3]実際、Tukey は、このような場合にはファミリーワイズコントロールが望ましいと示唆しました (Tukey、1956、私信、Ryan、1962、p. 302)。[4]
背景
統計的枠組みの中で、「家族」という用語にはいくつかの定義があります。
- Hochberg & Tamhane (1987)は、「ファミリー」を「何らかの複合的な誤差の尺度を考慮することが意味のある推論の集合」と定義した。[3]
- Cox (1982) によれば、一連の推論はファミリーとみなされるべきである: [引用が必要]
- データドレッジによる選択効果を考慮する
- 一連の推論の同時正確性を確保し、全体的な正しい決定を保証する
要約すると、ファミリーは、直面している潜在的な選択的推論によって最もよく定義できます。ファミリーとは、分析における推論項目の最小セットであり、研究の目標に対する意味について互換性があり、そこからアクション、プレゼンテーション、または強調表示の結果を選択できます ( Yoav Benjamini )。[引用が必要]
多重仮説検定の分類
次の表は、複数の帰無仮説を検定する場合に起こり得る結果を定義しています。H 1、 H 2、...、 H mで表されるm個の帰無仮説があるとします。統計的検定 を使用して、検定が有意であると宣言された場合は帰無仮説を棄却します。検定が有意でない場合は、帰無仮説を棄却しません。すべてのH iについて各タイプの結果を合計すると 、次のランダム変数が生成されます。
- mはテストされた仮説の総数である
- は真の帰無仮説の数であり、未知のパラメータである
- 真の対立仮説の数
- V は偽陽性(タイプ I の誤り)の数です(「偽発見」とも呼ばれます)。
- S は真陽性(「真の発見」とも呼ばれる)の数です。
- Tは偽陰性(タイプIIエラー)の数です。
- Uは真陰性の数である
- 棄却された帰無仮説(「発見」とも呼ばれ、真か偽かのいずれか)の数です。
真の帰無仮説であるm個の仮説検定において、R は観測可能なランダム変数であり、S、T、U、およびVは観測不可能なランダム変数です。
意味
FWERは、家族内で 少なくとも1つのタイプIエラーが発生する確率です。
または同等に、
したがって、 を保証することによって、ファミリー内で1 つ以上のタイプ I エラーが発生する確率はレベル に制御されます。
レベルにおけるFWERの制御が、すべての帰無仮説が真であるとき(つまり、「グローバル帰無仮説」が真であるとき)のみ保証される場合、手順は弱い意味でFWERを制御します。 [5]
レベルでのFWER制御が、真の帰無仮説と真でない帰無仮説のあらゆる構成に対して保証される場合、手順は強い意味でFWERを制御します(全体的な帰無仮説が真であるかどうかに関係なく)。[6]
管理手順
強力なレベルの FWER 制御を保証するいくつかの古典的なソリューションと、いくつかの新しいソリューションが存在します。
ボンフェローニ法
- 検定のp値で示す
- 拒否する
シダック手順
- レベルで各仮説をテストするのが、シダックの多重検定手順です。
- この手順は Bonferroni よりも強力ですが、得られる利益は小さいです。
- この手順では、テストが負の依存関係にある場合、FWER を制御できない可能性があります。
テューキー法
- Tukey の手順は、ペアワイズ比較にのみ適用できます。
- これは、テストされる観測値の独立性と、観測値間の均等な変動 (等分散性) を前提としています。
- この手順では、各ペアのスチューデント化された範囲統計を計算します。ここで、は比較される 2 つの平均値のうち大きい方、は小さい方、は問題のデータの標準誤差です。[引用が必要]
- Tukey の検定は、基本的にはStudent の t 検定ですが、ファミリーワイズ誤差率を修正する点が異なります。[引用が必要]
ホルムのステップダウン手順(1979)
- まずp値を(最低から最高まで)並べ、関連する仮説を次のようにします。
- を最小の指数とすると、
- 帰無仮説を棄却します。この場合、どの仮説も棄却されません。[要出典]
この手順は、ボンフェローニ手順よりも一様に強力です。[7] この手順が強い意味でレベルαですべてのm個の仮説のファミリーワイズエラー率を制御する理由は、それが閉じた検定手順であるためです。そのため、各交差点は単純なボンフェローニ検定を使用して検定されます。[引用が必要]
ホッホバーグのステップアップ手順
ホッホバーグのステップアップ法(1988)は次の手順で実行される。[8]
- まずp値を(最低から最高まで)並べ、関連する仮説を次のようにします。
- 与えられた に対して、が最大となるような値をとるものとする。
- 帰無仮説を棄却する
ホッホバーグの手順はホルムの手順よりも強力です。しかし、ホルムの手順は閉じた検定手順である(したがって、ボンフェローニと同様に検定統計量の結合分布に制限がない)のに対し、ホッホバーグの手順はシムズ検定に基づいているため、非負の従属関係の下でのみ成立します。[要出典]シムズ検定は独立した検定の仮定の下で導出されます。[9]これは、ある意味で正の従属関係にある検定に対しては保守的です[10] [11]が、負の従属関係の特定のケースでは反保守的です。[12] [13]ただし、ホッホバーグ手順の修正版は、一般的な負の従属関係の下でも有効であることが示唆されています。[14]
ダネットの訂正
チャールズ・ダネット(1955、1966)は、 kグループを同じコントロール グループと比較する場合の代替アルファ誤差調整について説明しました。現在ダネットのテストとして知られるこの方法は、ボンフェローニ調整よりも保守的ではありません。[引用が必要]
シェッフェ法
再サンプリング手順
Bonferroni と Holm の手順は、p値 (または個々のテスト統計量と同等) の依存関係構造の下で FWER を制御します。基本的に、これは「最悪のケース」の依存関係構造 (ほとんどの実用的な目的のために独立に近い) に対応することで実現されます。ただし、依存関係が実際に正である場合、このようなアプローチは保守的です。極端な例を挙げると、完全な正の依存関係の下では、実質的に 1 つのテストのみが存在するため、FWER は膨らみません。
p値(または個々の検定統計量)の依存構造を考慮すると、より強力な手順が生まれます。これは、ブートストラップ法や順列法などの再サンプリング法を適用することで実現できます。WestfallとYoung(1993)の手順では、実際には必ずしも当てはまらない特定の条件(つまり、サブセットのピボタリティ)が必要です。 [15] RomanoとWolf(2005a、b)の手順ではこの条件が不要であるため、より一般的に有効です。[16] [17]
調和平均p-値手順
調和平均p値(HMP)手順[18] [19]は、強義のファミリーワイズエラー率を制御しながら仮説グループの有意性を評価することにより、ボンフェローニ補正の検出力を向上させるマルチレベルテストを提供します。 テストの任意のサブセットの有意性は、サブセットのHMPを計算することによって評価されます。ここで、 は合計が1になる重みです(つまり)。 レベルで強義のファミリーワイズエラー率を制御する近似手順は、[20](ここで)のときにサブセット内のp値がいずれも有意ではないという帰無仮説を近似的に棄却します。 この近似は が小さい場合(例)に妥当であり、 がゼロに近づくにつれて任意に良好になります。 漸近的に正確なテストも利用できます(メイン記事 を参照)。
代替アプローチ
FWER制御は、偽発見率(FDR)手順と比較して、偽発見に対してより厳格な制御を行います。FWER制御は少なくとも1つの偽発見の確率を制限しますが、FDR制御は(緩い意味で)偽発見の予想される割合を制限します。したがって、FDR手順は、タイプIエラー、つまり実際には正しい帰無仮説を棄却する割合の増加を犠牲にして、より大きな力を持っています。[21]
一方、FWER制御は、ファミリーごとのエラー率制御よりも厳格ではありません。ファミリーごとのエラー率制御は、ファミリーごとのエラー数の予測値を制限するものです。FWER制御は少なくとも1つの誤検出に関係するため、ファミリーごとのエラー率制御とは異なり、複数の同時誤検出を1つの誤検出よりも悪いものとして扱いません。ボンフェローニ補正は、単にFWERを制御するものと考えられることが多いですが、実際にはファミリーごとのエラー率も制御します。[22]
参考文献
- ^ Tukey, JW (1953).多重比較の問題。Tukey (1953) に基づいて、
- ^ ab Ryan, Thomas A. (1959). 「心理学研究における多重比較」.心理学速報. 56 (1). アメリカ心理学会 (APA): 26–47. doi :10.1037/h0042478. ISSN 1939-1455.
- ^ ab Hochberg, Y.; Tamhane, AC (1987).多重比較手順. ニューヨーク: Wiley. p. 5. ISBN 978-0-471-82222-6。
- ^ Ryan, TA (1962). 「誤差率を計算する単位としての実験」.心理学速報. 59 (4): 301–305. doi :10.1037/h0040562. PMID 14495585.
- ^ Dmitrienko, Alex; Tamhane, Ajit; Bretz, Frank (2009).製薬統計における多重検定問題(第 1 版). CRC Press. p. 37. ISBN 9781584889847。
- ^ Dmitrienko, Alex; Tamhane, Ajit; Bretz, Frank (2009).製薬統計における多重検定問題(第 1 版). CRC Press. p. 37. ISBN 9781584889847。
- ^ Aickin, M; Gensler, H (1996). 「研究結果を報告する際の多重検定の調整: Bonferroni法とHolm法」. American Journal of Public Health . 86 (5): 726–728. doi :10.2105/ajph.86.5.726. PMC 1380484. PMID 8629727 .
- ^ Hochberg, Yosef (1988). 「多重有意性検定のためのよりシャープな Bonferroni 法」(PDF) . Biometrika . 75 (4): 800–802. doi :10.1093/biomet/75.4.800.
- ^ Simes, RJ (1986). 「有意差の多重検定のための改良されたBonferroni法」Biometrika . 73 (3): 751–754. doi :10.1093/biomet/73.3.751.
- ^ Sarkar, Sanat K.; Chang, Chung-Kuei (1997). 「正に依存する検定統計量による多重仮説検定のための Simes 法」. Journal of the American Statistical Association . 92 (440): 1601–1608. doi :10.1080/01621459.1997.10473682.
- ^ Sarkar, Sanat K. (1998). 「順序付きMTP2ランダム変数のいくつかの確率不等式:Simes予想の証明」.統計年報. 26 (2): 494–504.
- ^ Samuel-Cahn, Ester (1996). 「Simes の改良 Bonferroni 法は保守的か?」Biometrika . 83 (4): 928–933. doi :10.1093/biomet/83.4.928.
- ^ Block, Henry W.; Savits, Thomas H.; Wang, Jie (2008). 「負の依存性と Simes 不等式」. Journal of Statistical Planning and Inference . 138 (12): 4107–4110. doi :10.1016/j.jspi.2008.03.026.
- ^ Gou, Jiangtao; Tamhane, Ajit C. (2018). 「負の依存性の下でのHochberg手順」(PDF) . Statistica Sinica . 28 : 339–362. doi :10.5705/ss.202016.0306.
- ^ Westfall, PH; Young, SS (1993).再サンプリングベースの多重検定: p値調整の例と方法. ニューヨーク: John Wiley. ISBN 978-0-471-55761-6。
- ^ Romano, JP; Wolf, M. (2005a). 「多重仮説検定のための厳密なステップダウン法と近似ステップダウン法」アメリカ統計学会誌. 100 (469): 94–108. doi :10.1198/016214504000000539. hdl : 10230/576 . S2CID 219594470.
- ^ Romano, JP; Wolf, M. (2005b). 「形式化されたデータスヌーピングとしての段階的多重検定」Econometrica . 73 (4): 1237–1282. CiteSeerX 10.1.1.198.2473 . doi :10.1111/j.1468-0262.2005.00615.x.
- ^ Good, IJ (1958). 「並列および直列の有意性検定」アメリカ統計学会誌53 ( 284): 799–813. doi :10.1080/01621459.1958.10501480. JSTOR 2281953.
- ^ Wilson, DJ (2019). 「従属検定 を組み合わせる場合の調和平均p値」。 米国科学アカデミー紀要。116 (4): 1195–1200。doi : 10.1073 / pnas.1814092116。PMC 6347718。PMID 30610179。
- ^ Sciences 、全米科学アカデミー (2019-10-22)。「ウィルソンの補正、従属検定を組み合わせるための調和平均p値」。 全米科学アカデミー紀要。116 (43): 21948。doi : 10.1073 / pnas.1914128116。PMC 6815184。PMID 31591234。
- ^ Shaffer, JP (1995). 「多重仮説検定」. Annual Review of Psychology . 46 : 561–584. doi :10.1146/annurev.ps.46.020195.003021. hdl : 10338.dmlcz/142950 .
- ^ Frane, Andrew (2015). 「家族ごとのタイプIエラー率は社会科学と行動科学に関連しているのでしょうか?」Journal of Modern Applied Statistical Methods . 14 (1): 12–23. doi : 10.22237/jmasm/1430453040 .
外部リンク
- ファミリーワイズエラー率の理解 - False Discovery Rate と比較した有用性を含むブログ投稿
