統計学では、特定のデータセットによって示唆された仮説は、それを示唆した同じデータセットでテストされた場合、真実でなくても受け入れられる可能性が高くなります。これは、循環論法(二重のディッピング) が関係するためです。つまり、限定されたデータセットでは真実であると思われるものがあるため、一般的には真実であると仮定します。そのため、同じ限定されたデータセットで誤ってテストし、真実であることが確認されたように見えます。すでに観察されたデータに基づいて仮説を作成し、新しいデータでテストしないことは、事後理論化と呼ばれます(ラテン語の post hoc、「これの後で」から)。
正しい手順は、仮説を生成するために使用されなかったデータ セットで仮説をテストすることです。
一般的な問題
データによって示唆された仮説をテストすると、偽陽性 (タイプ I エラー)に陥りやすくなります。十分な時間をかけて十分な数の異なる場所を調べれば、最終的には仮説を裏付けるデータが見つかります。ただし、これらの陽性データだけでは、仮説が正しいという証拠にはなりません。除外された陰性のテスト データも同様に重要です。なぜなら、陽性の結果が偶然に比べてどの程度一般的であるかを知る手がかりになるからです。実験を実行し、データのパターンを確認し、そのパターンから仮説を提案し、同じ実験データを新しい仮説の証拠として使用することは、非常に疑わしいものです。なぜなら、完了した実験も潜在的な実験も、他のすべての実験のデータが、新しい仮説を最初に示唆した実験のみに目を向けることによって、実質的に「除外」されているからです。
上で説明したように、大規模なテスト セットでは、仮説に最も有利なデータ以外はすべて破棄されるため、タイプ I の誤りの確率が大幅に高まります。これは、仮説検定だけでなく、すべての統計的推論においてリスクとなります。データの検索と破棄のプロセスを正確に記述することが困難な場合が多いためです。言い換えると、すべてのデータ (仮説を支持する傾向にあるか反証する傾向にあるかに関係なく) を「良いテスト」から除外したいのですが、「良いテスト」が何であるかを判断するのが難しい場合があります。これは、結果を公開する前に試行錯誤によって多くの異なるモデルが拒否される統計モデリングで特に問題になります (過剰適合、出版バイアスも参照)。
このエラーは、データマイニングや機械学習で特に多く発生しています。また、学術出版でもよく発生し、否定的な結果ではなく肯定的な結果の報告のみが受け入れられる傾向があり、出版バイアスと呼ばれる影響が生じます。
正しい手順
データによって示唆された仮説を健全にテストするためのすべての戦略には、新しい仮説を検証または反証するためのより広範なテストを含めることが含まれます。これには次のものが含まれます。
ヘンリー・シェッフェによる多重比較問題におけるすべての対比の同時検定は、分散分析の場合の最もよく知られた解決策である。 [ 1]これは、上記の誤りを避けながら、データによって示唆された仮説を検定するために設計された方法である。
参照
注釈と参考文献
- ^ Henry Scheffé、「分散分析におけるすべての対比を判断する方法」、Biometrika、40、87-104ページ(1953年)。doi : 10.1093/biomet/40.1-2.87
