
データマイニングは、データスヌーピングやpハッキングとも呼ばれ、[ 1 ] [ a ]統計的に有意であるかのように提示できるデータ内のパターンを見つけるためにデータ分析を誤用し、偽陽性のリスクを劇的に増加させ、過小評価します。これは、データに対して多数の統計的テストを実行し、有意な結果が得られたものだけを報告することによって行われます。[ 2 ]したがって、データマイニングは、誤用または誤って適用されたデータマイニングの形態でもあります。
データマイニングのプロセスでは、単一のデータセットを使用して複数の仮説を検証します。これは、相関関係を示す可能性のある変数の組み合わせや、平均値や他の変数による内訳に違いを示すケースや観測値のグループを徹底的に検索することによって行われます。
従来の統計的有意性検定は、偶然のみによって特定の結果が生じる確率に基づいており、必然的にある種の誤った結論(帰無仮説の誤った棄却)のリスクをある程度受け入れることになります。このリスクのレベルは有意性と呼ばれます。多数の検定を実行すると、この種の誤った結果が生じる場合があります。したがって、ランダムに選択された仮説の 5% が 5% の有意水準で統計的に有意であると(誤って)報告され、1% が 1% の有意水準で統計的に有意であると(誤って)報告されるなど、偶然のみによって同様のことが起こります。十分な数の仮説を検定すると、ほぼすべてのランダム性を持つデータセットには(たとえば)偽の相関関係が含まれる可能性が高いため、統計的に有意であると報告される仮説がほぼ確実に存在します(これは誤解を招く可能性があります) 。データマイニング技術を使用する研究者は、注意を怠ると、これらの結果に容易に惑わされる可能性があります。p値に関する用語であるpハッキングは、社会科学研究におけるこうした問題の解明に焦点を当ててきたブログ「Data Colada」の3人の研究者によって2014年の論文で造語されました。 [ 3 ] [ 4 ] [ 5 ]
データマイニングは、多重比較問題を無視する例です。その一例として、サブグループを比較する際に、検討したサブグループ比較の総数を読者に知らせない場合が挙げられます。[ 6 ]誤用されると、科学的誠実性を損なう可能性のある疑わしい研究手法となります。
頻度論的確率を用いた従来の統計的仮説検定の手順は、「社会階層の高い人ほど長生きする」といった研究仮説を立て、関連データを収集することである。最後に、統計的有意性検定を実施して、結果が偶然のみによって生じる可能性がどの程度あるかを調べる(帰無仮説に対する検定とも呼ばれる)。
適切な統計分析における重要な点は、仮説の構築に用いられなかった証拠(データ)を用いて仮説を検証することです。これは、あらゆるデータセットには偶然によるパターンが含まれているため、極めて重要です。同じ統計母集団から得られた別のデータセットで仮説を検証しなければ、偶然だけでそのようなパターンが生じる可能性を評価することは不可能です。
例えば、コインを5回投げて表が2回、裏が3回出たとすると、裏が出る確率は3/5対2/5だと推測できるかもしれません。この仮説を既存のデータセットで検証すると、確かに裏が出ますが、この検証結果自体に意味はありません。正しい手順は、裏が出る確率を事前に仮説として立て、その仮説が正しいか間違っているかを検証するために、コインを何度も投げることです。裏が3回、表が2回出た場合でも、裏が出る確率は3/5であるという別の仮説を立てることはできますが、これは新たなコイン投げによってのみ検証可能です。このような誤った手順で得られた統計的有意性は全くの偽りであり、有意性検定はデータの掘り起こしを防ぐものではありません。

任意停止法とは、何らかの停止基準に達するまでデータを収集する手法です。これは有効な手順ですが、誤用されやすいです。問題は、任意停止法を用いた統計検定のp値が、見た目よりも大きくなることです。直感的には、これはp値が、観測された事象と少なくとも同程度に稀なすべての事象の合計であるべきだとされているためです。任意停止法では、任意停止ルールをトリガーせず、停止する前にさらに多くのデータを収集するなど、考慮するのが難しいさらに稀な事象が存在します。これらの事象を無視すると、p値が低すぎます。実際、帰無仮説が真である場合、データ収集を続け、目的の p 値 (常に正確にこれだけのデータを収集する計画を立てていたかのように計算される) が得られた時点で停止することが許されれば、任意の有意水準に達することができます。 [ 7 ]公平なコインの検定の具体的な例については、p値 § 任意停止法を参照してください。
あるいは、より簡潔に言えば、 p値の適切な計算には反事実、つまり実験者が起こり得たデータに対してどのような反応を示したかを考慮する必要がある。起こり得たことを考慮するのは、誠実な研究者にとっても難しい。[ 7 ]事前登録の利点の 1 つは、すべての反事実を考慮に入れ、p値を正しく計算できるようにすることである。[ 8 ]
早期中止の問題は、研究者の不正行為だけに限ったことではない。データ収集のコストが高い場合、早期中止を迫られることがよくある。動物倫理委員会の中には、研究の途中で有意な結果が得られた場合、早期中止を義務付けるところもある。[ 9 ]
データ分析が既に行われた後に、「外れ値の除去」などの名目でデータが削除されると、偽陽性率が上昇します。外れ値は、異常なデータの原因となる特別な変動要因が存在することを適切に特定し、合意または同意した後にのみ、データセットから削除する必要があります。「外れ値」を代替データで置き換えると、偽陽性率がさらに上昇します。 [ 10 ]
データセットに複数の特徴が含まれている場合、1つ以上の特徴をグループ化として使用し、統計的に有意な結果を生み出す可能性があります。たとえば、患者のデータセットに年齢と性別が記録されている場合、研究者は年齢でグループ化して、病気の回復率が年齢と相関しているかどうかを確認することを検討できます。うまくいかない場合は、性別との相関を確認するかもしれません。相関がない場合は、性別をコントロールした後に年齢と相関があるかもしれません。可能なグループ化の数は、特徴の数とともに指数関数的に増加します。[ 10 ]
ある無作為抽出されたサンプル調査で、誕生日が8月7日の人がメアリーとジョンの2人だけ含まれていたとします。データマイニングを行う人は、メアリーとジョンの間にさらに共通点を見つけようとするかもしれません。2人の間に考えられる何百、何千もの共通点を一つ一つ検証していくと、それぞれが真実である確率は低いものの、必ずと言っていいほど、何か珍しい共通点が見つかる可能性があります。例えば、ジョンとメアリーは、大学で専攻を3回も変更した唯一の2人だったとします。データマイニングによって偏った仮説としては、「8月7日生まれの人は、大学で専攻を2回以上変更する可能性がはるかに高い」というものが考えられます。
文脈を無視してデータだけを取り出すと、大学時代に3回も専攻を変更した誕生日が異なる人はいないため、この相関関係を強く裏付けているように見えるかもしれない。しかし、(おそらくそうであるように)これが誤った仮説であれば、この結果は再現不可能だろう。8月7日生まれの他の人が同様の割合で専攻を変更しているかどうかを調べようとすれば、ほぼ間違いなくすぐに矛盾する結果が得られるだろう。
バイアスとは、分析における系統的な誤差のことです。例えば、医師は心血管疾患リスクの高いHIV患者には特定のHIV治療薬であるアバカビルを、リスクの低い患者には他の薬を処方したため、アバカビルと他の治療法との単純な比較評価が妨げられました。このバイアスを補正しなかった分析では、アバカビルの患者はリスクが高いため心臓発作を起こす患者が多く、アバカビルが不当に不利な評価を受けることになりました。[ 6 ]この問題は、例えば観察研究において非常に深刻なものとなる可能性があります。[ 6 ] [ 2 ]
欠落した要因、測定されていない交絡因子、追跡不能もバイアスにつながる可能性があります。[ 6 ]有意なp値を持つ論文を選択することで、否定的な研究が除外され、これが出版バイアスです。これは、有意性の低いp値の結果がファイル引き出しに残され、決して出版されないため、ファイル引き出しバイアスとしても知られています。
データの知識によって統計的検定が条件付けられるもう1つの側面は、システム分析や機械分析、線形回帰を用いてデータの頻度を観察する際に見ることができます。このプロセスにおける重要なステップは、1つ以上の他の変数を説明する関係にどの共変量を含めるかを決定することです。著者がモデルを他のモデルよりも優先するに至る統計的(ステップワイズ回帰を参照)および実質的な考慮事項があり、統計的検定が多用されています。しかし、データに基づいて説明関係から1つ以上の変数を除外すると、何も起こらなかったかのように、関係に残った変数に標準的な統計的手順を正当に適用することはできません。この場合、残った変数は、除外された変数が失敗した何らかの予備的テスト(おそらく不正確な直感的テスト)に合格している必要があります。1966年、セルビンとスチュアートは、モデルに残った変数を網に落ちない魚に例えました。つまり、網に落ちた魚よりも、残った魚の影響の方が大きくなるということです。これは、保持された説明モデルに対するその後のすべてのテストのパフォーマンスを変えるだけでなく、バイアスを導入し、推定における平均二乗誤差を変える可能性もあります。 [ 11 ] [ 12 ]
気象学では、仮説はしばしば現在までの気象データを用いて立てられ、将来の気象データと比較検証されます。これにより、将来のデータが無意識のうちに仮説の形成に影響を与えることがないように保証されます。もちろん、このような学問分野では、立てられた理論の予測力を帰無仮説と比較して示すために、新たなデータが入手されるまで待つ必要があります。このプロセスにより、今後の気象データがまだ入手できないため、研究者が手持ちのデータに合わせて予測モデルを人為的に調整したと非難されることはなくなります。
別の例として、ある特定の町に癌の集積が見られると観察者が気づいたものの、その理由について確固たる仮説がないとします。しかし、観察者はその町とその周辺地域に関する膨大な人口統計データにアクセスでき、そのデータには数百から数千もの異なる変数の測定値が含まれており、それらの変数はほとんど相関していません。これらの変数がすべて癌の発生率とは無関係であったとしても、少なくとも1つの変数が地域全体の癌発生率と有意に相関している可能性は非常に高いです。これは仮説を示唆するかもしれませんが、同じ変数を使用しながら別の場所のデータを用いてさらに検証することで、仮説を裏付けることができます。p値が0.01ということは、少なくとも1%の確率で、少なくともその極端な結果が偶然に得られることを示唆していることに注意してください。数百から数千もの仮説(互いに比較的相関のない独立変数を持つ)を検証すると、多くの帰無仮説に対してp値が0.01未満になる可能性が高くなります。
p値操作の問題は、医薬品の開発と研究において憂慮すべきほど一般的です。[ 13 ] [ 14 ]効果の明らかなない薬でも、同じデータに対して、異なる対象グループ、主要評価項目、年齢調整、その他無数の変数を用いて、数百回、場合によっては数千回もの分析を実行すると、統計的に有意な効果があると示されることがあります。これらの変数は、意味のある結果を得るために選択または削除することができます。[ 15 ]薬に測定可能な効果がまったくない場合でも、十分な数の分析を実行すれば、統計的に意味のある強い効果が見つかります(例えば、「この薬は40歳以上の女性の記憶機能を著しく改善した」など。記憶機能は、当初評価されていた主要評価項目ではありませんでした)。これには、データの改ざんや、都合の悪い結果の省略は必要ありません。代わりに、p値操作は、研究者が「最適」なp値との相関関係を見つけるまで、同じデータの分析を繰り返すことに依存しています。分析は、データを操作するのではなく、データに合わせて微調整されます。
一例として、ジャーナリストのジョン・ボハノンが行ったチョコレート減量詐欺研究がある。彼はギズモードの記事で、この研究は社会実験として意図的に不正に行われたと公に説明した。[ 16 ]この研究は2015年頃に多くのメディアで広く取り上げられ、多くの人が良識に反して、毎日チョコレートバーを食べれば体重が減るという主張を信じた。この研究は栄養と健康研究所で発表された。ボハノンによれば、p値を0.05未満に減らすには、テスト時に18の異なる変数を考慮することが重要だった。
データ内のパターンを探すことは正当な行為ですが、パターンが現れるまで同じデータに統計的有意性検定や仮説検定を繰り返し適用することは、濫用につながる可能性があります。データマイニングを避けながら仮説を構築する一つの方法は、ランダム化されたサンプル外テストを実施することです。研究者はデータセットを収集し、それをランダムに2つのサブセットAとBに分割します。仮説を作成するために、サブセットAなど、一方のサブセットのみを調べます。仮説が定式化されたら、その仮説の構築に使用されていないサブセットBでテストする必要があります。Bもその仮説を支持する場合にのみ、その仮説が妥当であると考えるのが妥当です。(これは単純なタイプの交差検証であり、トレーニングテスト検証または分割検証と呼ばれることもあります。)
データマイニングのもう1つの対策は、研究中に実施されたすべての有意性検定の数を記録し、有意性の基準 (アルファ) をこの数で単純に割ることです。これがボンフェローニ補正です。ただし、これは非常に保守的な指標です。ファミリーワイズアルファが 0.05 の場合、1,000 回の有意性検定を考慮して、このように 1,000 で割ると、仮説ごとの非常に厳格なアルファ 0.00005 になります。分散分析や、基底関数を含む回帰の同時信頼帯の構築に特に役立つ方法は、シェッフェ法と、研究者がペアワイズ比較のみを念頭に置いている場合はテューキー法です。ボンフェローニ補正の極端な保守性を避けるために、より洗練された選択的推論法が利用可能です。[ 17 ]最も一般的な選択的推論方法は、ベンジャミニとホックバーグの偽発見率制御手順の使用です。これは、複数の仮説検定を制御するための一般的な方法となった、保守的でないアプローチです。
どちらの方法も実用的でない場合、確認的なデータ分析と探索的なデータ分析を明確に区別することができる。統計的推論は前者にのみ適している。[ 12 ]
最終的に、検定の統計的有意性と結果の統計的信頼性は、データと、そのデータを分析するために使用された方法の両方の特性です。したがって、ある事象の確率が20%±2%であると誰かが言った場合、これは、 20%という推定値を得るために使用されたのと同じ方法でその事象の確率を推定すると、確率0.95で18%から22%の間になることを意味します。データの評価に使用された方法を十分に考慮せずに、単にデータを見るだけで統計的有意性を主張することはできません。
学術誌は、データマイニングやHARKingといった深刻な問題に対抗することを目的とした登録レポート形式への移行をますます進めており、これらの問題は理論検証研究の信頼性を著しく低下させています。例えば、Nature Human Behaviourは登録レポート形式を採用しており、「研究結果から、研究を導く疑問と、それに答えるために使用された方法へと重点を移す」としています。[ 18 ] European Journal of Personalityはこの形式を次のように定義しています。「登録レポートでは、著者は理論的および経験的背景、研究課題/仮説、パイロットデータ(入手可能な場合)を含む研究提案を作成します。提出後、この提案はデータ収集前に審査され、受理された場合、この査読手続きを経て作成された論文は、研究結果に関わらず出版されます。」[ 19 ]
オープンサイエンスのアプローチのように、方法と結果を一般に公開することも可能であり、データマイニングが行われるのをさらに困難にする。[ 20 ]
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)