
多重比較、多重性、または多重検定の問題は、同じデータセットに対して多数の統計的検定を実行するときに発生します。各検定にはタイプIエラー(偽陽性)が発生する可能性があり、検定の数が増えるにつれて、少なくとも1つの偽陽性が発生する全体的な確率が高くなります。統計学では、これは一連の統計的推論を同時に考慮する場合[ 1 ]、または観測値に基づいて選択されたパラメータのサブセットを推定する場合に発生します[ 2 ] 。
偽陽性の確率は、ファミリーワイズエラー率(FWER)によって測定されます。一連のテストで行われる推論の数が多いほど、誤った推論が生じる可能性が高くなります。推論の数を補正するために、いくつかの統計的手法が開発されています。例えば、個々の比較に対してより厳格な有意水準を設定するなどです。
多重比較の問題は、1950年代にTukeyやSchefféなどの統計学者の研究によって注目を集めるようになりました。その後数十年にわたり、この問題に対処するための多くの手法が開発されました。1996年には、テルアビブで多重比較手法に関する最初の国際会議が開催されました。[ 3 ]この分野では、Emmanuel CandèsやVladimir Vovkなど、多くの研究者が活躍しています。

多重比較は、統計分析において複数の同時統計検定が行われ、それぞれが「発見」をもたらす可能性がある場合に発生します。通常、明示された信頼水準は個別に検討される各検定にのみ適用されますが、多くの場合、同時検定のファミリー全体に対する信頼水準が望ましいです。[ 4 ] 多重比較を補正しないと、次の例に示すように、現実世界で重大な結果を招く可能性があります。
どちらの例においても、比較回数が増えるにつれて、比較対象となるグループが少なくとも1つの属性において異なっているように見える可能性が高くなります。複数の比較を含む分析の一部として得られた結果が、単一の比較のみを含む分析の一部として得られた結果よりも、独立したデータにも一般化できるという確信は、一般的に弱くなるはずです。
例えば、1つの検定を5%の有意水準で実施し、対応する帰無仮説が真である場合、帰無仮説を誤って棄却するリスクはわずか5%です。しかし、100回の検定をそれぞれ5%の有意水準で実施し、対応するすべての帰無仮説が真である場合、誤って棄却される回数(偽陽性または第一種過誤とも呼ばれる)は5回と予想されます。検定が統計的に互いに独立している場合(つまり、独立したサンプルに対して実施されている場合)、少なくとも1回の誤った棄却が発生する確率は約99.4%です。
多重比較の問題は信頼区間にも当てはまります。95%の包含確率を持つ単一の信頼区間は、95%のサンプルでパラメータの真の値を含みます。しかし、それぞれ95%の包含確率を持つ100個の信頼区間を同時に考慮すると、包含しない区間の期待値は5になります。これらの区間が統計的に互いに独立している場合、少なくとも1つの区間が母集団パラメータを含まない確率は99.4%です。
複数の統計検定を行う際に発生する偽陽性率や非網羅率の過大評価を防ぐための技術が開発されている。
以下の表は、複数の帰無仮説を検定する際の可能な結果を定義しています。帰無仮説の数をmとし、 H 1、H 2、...、H m とします。統計的検定 を用いて、検定が有意であると判断された場合、帰無仮説を棄却します。検定が有意でない場合は、帰無仮説を棄却しません。すべてのH i について各タイプの結果を合計すると、次の確率変数が得られます。
mの仮説検定では、は真の帰無仮説であり、Rは観測可能な確率変数であり、S、T、U、Vは観測不可能な確率変数である。
多重検定補正とは、多重検定の問題に対処するために統計的検定をより厳密にすることを指します。最もよく知られている補正方法はボンフェローニ補正ですが、他にも様々な方法が開発されています。これらの方法は通常、ファミリーワイズエラー率または偽発見率を制御するように設計されています。
m 回の独立した比較が行われる場合、ファミリーワイズエラー率(FWER) は次のように表されます。
したがって、テストが完全に正の相関関係にある(つまり同一である)場合を除き、比較回数が増えるにつれて増加する。比較が独立であると仮定しない場合でも、次のように言える。
これはブールの不等式から導かれる。例:
ファミリーワイズエラー率が最大でも最も保守的な方法は、依存関係や分布に関する仮定を必要としないボンフェローニ補正である。わずかに保守的でない修正は、ファミリーワイズエラー率の方程式を解くことによって得られる。独立した比較これにより、これはシダック補正として知られています。別の手順はホルム・ボンフェローニ法で、これは最も低いp値のみをテストすることにより、単純なボンフェローニ補正よりも一様に高い検出力を提供します()最も厳しい基準に対して、より高いp値(徐々に緩やかな基準に対して。[ 5 ]。
古典的なボンフェローニ法は理解しやすいが、過度に保守的であるため使用すべきではない。より現代的なホルム・ボンフェローニ法またはベンジャミニ・ホッホベルグ法を使用して多重比較を補正するためのオンライン計算ツールがある。[ 6 ]
連続的な問題に対しては、ベイズ論理を用いて計算することができる。前後の体積比から。ボンフェローニ補正とシダック補正の連続的な一般化は[ 7 ]に示されている。
多重比較補正の従来の方法は、分散分析などで行われるような、少数の比較の補正に重点を置いています。一方、数千、あるいはそれ以上の数の検定を行う「大規模多重検定」には、異なる手法が開発されています。例えば、ゲノミクスでは、マイクロアレイなどの技術を用いることで、数万個の遺伝子の発現レベルを測定したり、数百万個の遺伝子マーカーの遺伝子型を測定したりすることができます。特に遺伝子関連研究の分野では、再現性の欠如、つまりある研究では統計的に有意な結果が得られたにもかかわらず、追跡調査で再現されないという深刻な問題が生じています。このような再現性の欠如には多くの原因が考えられますが、多重比較の結果を十分に考慮していないことが原因の一つであると広く考えられています。[ 8 ]測定技術と情報技術の進歩により、探索的分析のための大規模なデータセットを生成することがはるかに容易になり、その結果、多くの仮説が真であると事前に期待する根拠がないまま、多数の仮説をテストすることがしばしば行われていると主張されている。このような状況では、多重比較調整を行わない限り、非常に高い偽陽性率が予想される。
決定的な結果を得ることを目的とする大規模なテスト問題では、統計的検定に有意水準を割り当てるための最も受け入れられているパラメータはファミリーワイズエラー率です。一方、研究が探索的であるとみなされる場合、または有意な結果を独立した研究で容易に再テストできる場合は、偽発見率(FDR) [ 9 ] [ 10 ] [ 11 ]の制御が好まれることがよくあります。FDR は、すべての有意なテストの中で偽陽性の期待される割合として大まかに定義され、研究者は追跡調査でより厳密に評価できる「候補陽性」のセットを特定できます。[ 12 ]
有意な比較を見つけることを期待して、調整されていない比較を多数試みる行為は、意図的であろうとなかろうと、既知の問題であり、「p値ハッキング」と呼ばれることもある。[ 13 ] [ 14 ]

多数の検定結果を分析する際に最初に直面する基本的な疑問は、いずれかの対立仮説が真である証拠があるかどうかです。検定が互いに独立していると仮定する場合に適用できる単純なメタ検定の1つは、すべての帰無仮説が真である場合に、特定の有意水準αで有意な結果の数をモデルとしてポアソン分布を使用することです。 観測された陽性の数が期待される数よりも大幅に多い場合、これは有意な結果の中に真の陽性が含まれている可能性が高いことを示唆しています。
例えば、α = 0.05 のレベルで 1000 回の独立した検定を実行すると、すべての帰無仮説が真である場合、0.05 × 1000 = 50 回の有意な検定が発生すると予想されます。平均 50 のポアソン分布に基づくと、61 回を超える有意な検定が発生する確率は 0.05 未満であるため、61 回を超える有意な結果が観測された場合、それらのいくつかは対立仮説が成り立つ状況に対応している可能性が非常に高いです。このアプローチの欠点は、検定統計量が正の相関関係にある場合(これは実際によく起こります)、 対立仮説の一部が真であるという証拠を過大評価してしまうことです。一方、ポアソン分布が有意な結果の数の良い近似値を提供することが示されれば、検定統計量間に相関関係があってもこのアプローチは有効です。このシナリオは、例えば、トランザクションデータセットから有意な頻出アイテムセットをマイニングする場合に発生します。さらに、慎重な 2 段階分析により、FDR を事前に指定されたレベルに制限することができます。[ 15 ]
検定統計量をZスコアに標準化できる状況で用いられるもう一つの一般的なアプローチは、検定統計量の正規分位点プロットを作成することです。観測された分位点が正規分位点よりも著しく分散している場合、有意な結果の一部が真の陽性である可能性が示唆されます。
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)