
無効な科学とは、再現できない実験に基づく、あるいは再現可能な実験によって反証される科学的主張のことである。最近の分析によると、科学文献における撤回された主張の割合は着実に増加している。[ 1 ]撤回数は過去10年間で10倍に増加したが、それでも学術誌に毎年掲載される140万本の論文の約0.2%を占めるに過ぎない 。[ 2 ]
Science誌は撤回された論文数で70件で1位となり、 69件の撤回を行ったPNASをわずかに上回った。Science誌の撤回のうち32件は不正または不正の疑いによるもので、37件は誤りによるものだった。その後の「撤回指数」によると、 Science、 Nature、 Cellなどのインパクトファクターが比較的高いジャーナルは撤回率が高いことが示された。PubMedに掲載された論文のうち、1940年代まで遡る2500万件以上の論文のうち、撤回されたのは0.1%未満だった。 [ 3 ] [ 4 ]
1977年以降に発表された2,047本の論文の研究によると、撤回された論文のうち、科学的不正行為によるものは3分の2と推定されている。不正行為には詐欺や盗用が含まれる。残りの5分の1は間違いによるもので、残りは不明またはその他の理由で撤回された。[ 3 ]
別の研究では、男性と女性で異なるさまざまな健康リスクの遺伝的関連性に関する432の主張を分析しました。これらの主張のうち、一貫して再現可能であることが証明されたのは1つだけでした。別のメタレビューでは、1990年から2003年の間に発表された最も引用された49の臨床研究のうち、40%以上が後に完全に間違っているか、著しく間違っていることが判明しました。[ 5 ] [ 6 ]
2012年、バイオテクノロジー企業のアムジェンは、がん研究における53の重要な研究のうち、わずか6つしか再現できなかった。それ以前には、製薬会社のバイエルのグループが、67の重要な論文のうち、4分の1しか再現できなかった。2000年から2010年にかけて、約8万人の患者が、後に誤りや不正のために撤回された研究に基づく臨床試験に参加した。[ 1 ]
ネイサン・ミルボルドは、恐竜の成長に関するいくつかの論文の結果を再現しようと試みたが、繰り返し失敗した。恐竜は毎年骨に層を一枚ずつ追加していた。ティラノサウルス・レックスは年間700kg以上も大きくなったと考えられていた が、ミルボルドはこれが2倍も大きすぎることを示した。彼が調べた12の論文のうち4つでは、元のデータが失われていた。3つでは統計は正しかったが、3つには結論を無効にする重大な誤りがあった。2つの論文は、誤ってこれら3つの論文のデータに依拠していた。彼は、論文のグラフの一部がデータを反映していないことを発見した。あるケースでは、グラフ上の9つの点のうち4つだけが論文で引用されたデータから得られたものであることを発見した。[ 7 ]
トルセトラピブは当初、 HDLコレステロールをLDLに変換するタンパク質を阻害し、「心血管疾患治療を再定義する」可能性のある薬剤として宣伝されていました。ある臨床試験では、この薬剤がHDLを増加させ、LDLを減少させることが示されました。ファイザーがこの薬剤の計画を発表してから2日後、胸痛と心不全の発生率が高く、全死亡率が60%増加したため、第III相臨床試験を中止しました。ファイザーはこの薬剤の開発に10億ドル以上を投資していました。[ 5 ]
最も多く引用されているバイオマーカー(その存在は病気の推測や治療効果の測定に用いられる)の詳細なレビューでは、想定されていた相関関係の 83% がその後の研究で著しく弱くなったと主張されている。ホモシステインは、その濃度が心臓病と相関するアミノ酸である。しかし、2010 年の研究では、ホモシステインを 30% 近く下げても心臓発作や脳卒中には影響がないことが示された。[ 5 ]
プライミング研究では、被験者が選択を行う直前に目撃する一見無関係な出来事によって意思決定が影響を受ける可能性があると主張している。ノーベル賞受賞者のダニエル・カーネマンは、その多くは根拠が乏しいと主張している。研究者たちは、より広く引用されている例のいくつかを再現できていない。PLoS ONE [ 8 ]の論文では、9 つの別々の実験で、知能テストを受ける前に教授について考えると、サッカーのフーリガンを想像するよりも高いスコアにつながることを示す研究を再現できなかったと報告している。[ 2 ] 世界中の 40 の異なる研究室が参加したさらなる体系的な再現では、主要な発見は再現されなかった。[ 9 ]しかし、この後者の体系的な再現では、フーリガンと教授について考えることの間に関連性がないと考えている参加者は、プライミング操作に対して有意に感受性が高かったことが示された。
1950年代、冷戦中に学術研究が加速した当時、科学者の総数は数十万人でした。[ 1 ] 2023年現在、世界の研究者の総数は推定800万人です。[ 10 ]研究職の数は、この増加に見合っていません。毎年、6人の博士号取得者が1つの学術ポストを競い合っています。他の研究者の結果を再現することは、価値があるとは考えられていません。競争の激しさから、研究結果の誇張や偏ったデータ選択が助長されています。最近の調査では、研究者の3人に1人が、少なくともある程度結果を歪曲した同僚を知っていることがわかりました。[ 1 ]
主要な学術誌は投稿された原稿の90%以上を却下し、最も劇的な主張を好む傾向がある。研究者が主張を検証するために使用する統計的手法により、誤った主張の一部が有効であるかのように見せかけることができる。誤った主張は(誤っているため)劇的である可能性が高い。再現性がなければ、そのような誤りは発見されにくくなる。[ 1 ]
逆に、仮説を証明できなかった研究は、出版されることすらほとんどない。「否定的な結果」は現在、出版された論文のわずか14%を占めるに過ぎず、1990年の30%から減少している。何が真実でないかを知ることは、何が真実であるかを知ることと同じくらい重要である。[ 1 ]
査読は科学出版物で採用されている主要な検証手法です。しかし、ある著名な医学雑誌がこのシステムをテストしたところ、重大な欠陥が見つかりました。その雑誌は研究に意図的に誤りを加え、テストについて知らされた後でも、ほとんどの査読者が間違いに気づけなかったことを発見しました。[ 1 ]
地衣類由来の化学物質が癌細胞に及ぼす影響に関する偽名で捏造された論文が、査読のために304の学術誌に投稿された。この論文は、研究デザイン、分析、解釈に誤りが満載だった。157の格下の学術誌がこれを受理した。別の研究では、研究デザイン、分析、解釈に意図的に8つの誤りを含む論文が、British Medical Journalの200人以上の定期査読者に送られた。平均して、査読者は2つ未満の問題点しか報告しなかった。[ 2 ]
査読者は通常、データを最初から再分析することはなく、著者の分析が適切に考案されているかどうかのみを確認します。[ 2 ]
科学者は、誤りを、仮説の正しさを誤って主張する第一種誤り(偽陽性)と、正しい仮説を否定する第二種誤り(偽陰性)に分類します。統計的チェックでは、仮説を支持するように見えるデータが単なる偶然によって生じる確率を評価します。確率が5%未満であれば、証拠は「統計的に有意」と評価されます。定義上の結果として、第一種誤り率は20分の1です。[ 2 ]
2005年、スタンフォード大学の疫学者ジョン・イオアニディスは、 20件の論文のうち偽陽性結果を示すのは1件だけだという考えは誤りであることを示した。彼は「発表された研究結果のほとんどはおそらく偽である」と主張した。彼は3つのカテゴリーの問題を発見した。不十分な「統計的検出力」(第II種過誤の回避)、仮説の信憑性の低さ、そして新しい主張を優先する出版バイアスである。[ 2 ]
統計的に強力な研究では、データにわずかな影響しか与えない要因を特定します。一般的に、実験をより多くの被験者に対してより多く繰り返す研究は、より高い検出力を持ちます。検出力が0.8ということは、テストされた10個の真の仮説のうち、2つの影響が見逃されることを意味します。イオアニディスは、神経科学における典型的な統計的検出力は0.21であることを発見しました。別の研究では、心理学研究の平均は0.35であることがわかりました。[ 2 ]
可能性の低さは、結果の驚きの度合いを示す尺度である。科学者は驚くべき結果を好むため、可能性が低い、あるいは非常に低い仮説を検証する。イオアニディスは、疫学では仮説の10分の1が正しいはずだと主張した。遺伝子やタンパク質に関する膨大なデータの調査に依存するゲノミクスのような探索的分野では、1000分の1だけが正しいと証明されるはずだ。[ 2 ]
1,000 個の仮説のうち 100 個が正しい分野では、検出力 0.8 の研究では 80 個が正解で 20 個が見逃されます。 900 個の誤った仮説のうち、5% または 45 個は第一種過誤により受け入れられます。 45 個の偽陽性を 80 個の真陽性に加えると、125 個の陽性結果、つまり 36% が見かけ上の結果となります。 多くの分野では楽観的な統計的検出力を 0.4 に下げても、偽陽性は 45 個のままですが、真陽性は 40 個しか得られず、半分以下になります。[ 2 ]
否定的な結果の方が信頼性が高い。統計的検出力0.8では875件の否定的な結果が得られ、そのうち偽陽性はわずか20件で、97%以上の精度が得られる。しかし、否定的な結果は発表された結果の少数派であり、分野によって異なる。4,600件の論文を調査したところ、発表された否定的な結果の割合は1990年から2007年の間に30%から14%に減少した。[ 2 ]
素粒子物理学では、許容される偽陽性率を350万分の1(ファイブシグマ標準として知られる)に設定している。しかし、これでも完全な保護は得られない。あるレビューによると、この問題により機械学習研究の約4分の3が無効になるという。[ 2 ]
統計的有意性とは、統計的相関を検定するための尺度です。これは、1920年代にイギリスの数学者ロナルド・フィッシャーによって考案されました。統計的有意性とは、偶然によって5%未満(より厳密には1%未満)の確率でしか得られないデータポイントを「有意な」結果と定義します。有意な結果は、相関がランダムではないことを示す重要な指標として広く認識されています。[ 5 ]
相関関係は、喫煙と癌のように真に独立した測定値間の関係を追跡するが、変数を分離できない場合(生物システムではよくある状況)には、その効果ははるかに低下する。たとえば、統計学では腰痛と椎間板の異常との間に高い相関関係が見出されたが、後に痛みのない患者の3分の2に深刻な異常が存在することが判明した。[ 5 ]
PLoS Oneのようなジャーナルは「最低限の基準」を採用し、最良の研究を選び出すのではなく、できるだけ多くの科学論文を掲載しようとしています。査読者は論文が方法論的に妥当かどうかのみを評価します。投稿論文のほぼ半分は、依然としてこの基準で却下されています。[ 2 ]
米国国立衛生研究所(NIH)が資金提供した臨床試験のうち、完了後1年以内に要約結果を公表したのはわずか22%に過ぎない。NIHは公表を義務付けているにもかかわらずである。30か月以内に公表されたのは半数以下で、3分の1は51か月経過しても公表されていない。 [ 2 ]他の科学者が無効な研究に頼ると、それ自体が無効な研究に時間を浪費する可能性がある。失敗を報告しないということは、研究者が他の科学者によって既に調査された行き止まりを探索するためにお金と労力を浪費することを意味する。[ 1 ]
1987年から2008年の間に実施された21の調査(主に生物医学分野だが、土木工学、化学、経済学分野も含む)では、2%がデータの捏造を認めたが、28%が疑わしい研究慣行に従事している同僚を知っていると主張した。[ 2 ]
臨床試験は一般的に費用がかかりすぎるため、再実施は困難です。試験データへのアクセスは、再評価のための唯一の現実的なアプローチです。製薬会社にすべての試験データを公開するよう説得するキャンペーンは、2013年2月にグラクソ・スミスクラインが最初に同意したことで、最初の賛同者を得ました。[ 2 ]
治験で使用されるソフトウェアは一般的に専有知的財産とみなされ、複製者には提供されないため、事態はさらに複雑になる。データ共有を強く求めるジャーナルは、ソフトウェアに関しては同様の対応をしない傾向がある。[ 2 ]
よく書かれた論文であっても、再現を成功させるのに十分な詳細や暗黙知(注目に値しない微妙なスキルや即興)が含まれていない場合があります。再現失敗の一因は、プロトコルの管理が不十分なことであり、これが元の研究者と再現研究者の間で論争を引き起こす可能性があります。[ 2 ]
遺伝学者たちは、特に統計的手法の使用に関して、より慎重なレビューを開始した。その結果、ゲノムシーケンスから生じる見せかけの結果の氾濫を食い止めることができた。[ 1 ]
研究プロトコルを事前に登録し、研究の過程で監視することで、研究者が都合の良い結果を強調するために途中でプロトコルを変更することを防ぐことができます。他の研究者が検証およびテストできるように生データを提供することも、研究者の責任をより明確にするのに役立ちます。[ 1 ]
査読を出版後の評価に置き換えることで、研究者は過剰な主張や根拠のない主張の長期的な影響についてより深く考えるようになる可能性がある。このシステムは物理学や数学の分野で採用され、良好な結果を得ている。[ 1 ]
研究者、特に若手研究者は、先輩研究者との関係を守るため、他者の研究を再現する機会を求めることはほとんどない。[ 2 ]
再現性は、元の研究の方法とデータへのアクセスによって向上する。84のジャーナルに掲載された238の生物医学論文のうち、半数以上が結果を再現するために必要なすべてのリソース(化学試薬など)を特定できなかった。2008年には研究者の約60%が生データを共有すると答えたが、2013年にはわずか45%にとどまった。ジャーナルは少なくとも一部の生データを提供するよう要求し始めているが、データ共有ポリシーの対象となる351の論文のうち、実際にそれに従ったのは143だけだった。[ 2 ]
再現性イニシアチブは、生命科学者が独立した研究所に研究の検証を依頼するために料金を支払うことができるサービスです。2013年10月、このイニシアチブは、2010年から2012年の間に発表された最も影響力の大きいがん研究結果50件をレビューするための資金を受け取りました。ブログSynは、論文で報告された化学反応を再現することに特化した大学院生が運営するウェブサイトです。[ 2 ]
2013 年、再現性の取り組みがより注目を集めるようになった。Natureおよび関連出版物は、5 月に生命科学の著者向けに 18 項目のチェックリストを導入し[ 11 ]、掲載された研究が再現可能であることを保証しようとした。拡張された「方法」セクションとすべてのデータはオンラインで利用可能になる予定だった。オープン サイエンス センターは、再現性に特化した独立した研究所として開設された。Perspectives on Psychological Science 誌は、再現性に特化したセクションを発表した。別のプロジェクトでは、2008 年の最初の 3 か月に 3 つの主要な心理学ジャーナルに掲載された 100 の研究を再現する計画を発表した。[ 2 ]
欧州研究会議、米国国立科学財団、英国研究評議会などの主要な資金提供者は、再現研究よりも新規研究を優先する姿勢を変えていない。[ 2 ]