
ランダム化比較試験(RCT )は、参加者を1つ以上の比較グループにランダムに割り当てることでバイアスを最小限に抑え、介入の有効性または安全性を評価するように設計された統計実験の一種です。[ 2 ]
このアプローチでは、少なくとも1つのグループが研究対象の介入またはプロセス(薬、外科手術、医療機器、食事など)を受け、他のグループは代替治療、プラセボ、または標準治療を受けます。[ 3 ] [ 4 ]
RCTは現代の臨床試験における基本的な方法論であり、選択バイアスや交絡因子の影響を軽減できることから、エビデンスに基づいた医療において最も質の高いエビデンス源の一つとして広く認識されてきました。しかし、場合によってはバイアスを軽減できないという批判も受けています。[ 5 ]
ランダム化比較試験(RCT)に参加する被験者は、研究結果に影響を与える可能性のある既知および未知の様々な点で互いに異なっており、それらの違いを直接制御することはできません。RCTは、比較対象となる治療法間で被験者をランダムに割り当てることで、これらの影響を統計的に制御することを可能にします。適切に設計され、正しく実施され、十分な数の被験者が登録されれば、RCTはこれらの交絡因子を十分に制御し、研究対象となる治療法の有用な比較結果をもたらすことができます。
臨床研究におけるランダム化比較試験(RCT)では、通常、提案された新しい治療法と既存の標準治療を比較します。これらはそれぞれ「実験治療」と「対照治療」と呼ばれます。一般的に認められている治療法がない場合、対照群にはプラセボが用いられ、参加者は治療割り当てに関する情報を知らされない、つまり盲検化されます。この盲検化の原則は、研究者、技術者、データアナリスト、評価者など、他の関係者にも可能な限り適用されることが理想的です。効果的な盲検化は、治療の生理学的効果を、さまざまな心理的バイアス源から実験的に分離します。
参加者を治療に割り当てる際のランダム性は、選択バイアスと割り当てバイアスを軽減し、治療の割り当てにおいて既知および未知の予後因子をバランスさせる。[ 6 ]盲検化は、実験者および被験者の他の形態のバイアスを軽減する。
盲検化RCTは臨床試験のゴールドスタンダードと考えられています。盲検化RCTは医療介入の有効性をテストするためによく使用され、薬物反応などの副作用に関する情報も提供する場合があります。ランダム化比較試験は、研究治療が人間の健康に影響を与えるという説得力のある証拠を提供できます。[ 7 ]
「RCT」と「ランダム化試験」という用語は同義語として使われることもありますが、後者の用語は対照群について言及していないため、対照群がない状態で複数の治療群を相互に比較する研究を記述することができます。[ 8 ]同様に、この頭字語は「ランダム化臨床試験」または「ランダム化比較試験」と拡張されることがあり、科学文献で曖昧さが生じています。[ 9 ] [ 10 ]すべてのRCTがランダム化対照試験であるとは限りません(対照群を使用することが非現実的または非倫理的である場合など、一部のRCTは決してランダム化試験にはなり得ません)。ランダム化対照臨床試験という用語は、臨床研究で使用される代替用語です。[ 11 ]ただし、RCTは、社会科学の多くを含む他の研究分野でも使用されています。
死後に出版された『Ortus Medicinae』(1648年)の中で、ヤン・バプティスト・ファン・ヘルモントは、発熱の2つの治療法を検証するためのRCTを初めて提案した。1つの治療法は瀉血と下剤を用いたガレノス医学の施術者によって行われ、もう1つはファン・ヘルモント自身によって行われることになっていた。彼はおそらくこの試験を実施せず、単に実施可能な実験として提案しただけだったと思われる。[ 12 ]
最初に報告された臨床試験は、壊血病の治療法を特定するために1747年にジェームズ・リンドによって実施され[ 13 ]、対照試験を実施するための原則は、1843年にアイルランドの医師ジェームズ・ヘンリーによってさらに詳しく説明されました[ 14 ]。最初の盲検実験は、メスメリズムの主張を調査するために、1784年にフランス王立動物磁気委員会によって実施されました。研究者の盲検化を提唱した初期の論文は、19世紀後半にクロード・ベルナールによって発表されました。ベルナールは、実験の観察者は検証されている仮説を知らないようにすべきだと提唱しました。この提案は、科学的観察は十分に教育され、知識のある科学者によって行われた場合にのみ客観的に有効であるという啓蒙時代の一般的な考え方とは著しく対照的でした[ 15 ] 。盲検化された研究者が記録された最初の研究は、カフェインの効果を調査するために1907年にWHRリバースとHNウェバーによって発表されました[ 16 ] 。
ランダム化実験は、 1880年代にチャールズ・サンダース・パースとジョセフ・ジャストロウによって導入された心理学[ 17 ]と教育[ 18 ] [ 19 ] [ 20 ]で初めて登場しました。治療群と対照群を比較した最初の実験は、1901年にロバート・ウッドワースとエドワード・ソーンダイク[ 21 ]によって、 1907年にジョン・E・クーバーとフランク・アンジェルによって発表されました[ 22 ] [ 23 ]。
20世紀初頭、イェジー・ネイマン[ 24 ]とロナルド・A・フィッシャーにより、農業分野で無作為化実験が登場した。フィッシャーの実験研究と著作は無作為化実験を普及させた[ 25 ] 。
医学における最初の無作為化比較試験は、1948年に発表された「肺結核のストレプトマイシン治療」という論文に掲載されたもので、医学研究評議会の調査について記述している。[ 26 ] [ 27 ] [ 28 ]この論文の著者の1人はオースティン・ブラッドフォード・ヒルで、彼は現代のRCTを考案した人物として知られている。[ 29 ]
試験デザインは、1980年代に実施された心臓発作治療に関する大規模なISIS試験の影響も受けた。 [ 30 ]
20世紀後半までに、RCTは医学における「合理的治療」の標準的な方法として認識されるようになりました。[ 31 ] 2004年時点で、15万件以上のRCTがコクラン・ライブラリーに収録されています。[ 29 ] 医学文献におけるRCTの報告を改善するために、科学者と編集者の国際グループが1996年、2001年、2010年に臨床試験報告の統合基準(CONSORT)声明を発表し、これらは広く受け入れられるようになりました。[ 1 ] [ 6 ]
被験者はほぼ常にRCTへの参加についてインフォームドコンセントを提供しているが、1982年以降の研究では、RCTの被験者は自分にとって最適な治療を受けられると確信している可能性があり、つまり、研究と治療の違いを理解していないことが報告されている。 [ 32 ] [ 33 ]インフォームドコンセントを確保するために必要な情報量を決定することは困難であり、[ 34 ]治療的誤解の蔓延と対処方法を決定するには、さらなる研究が必要である。[ 33 ]
プラセボ対照試験は、治療を受けないことが症状の悪化や死亡リスクなど患者に害を及ぼす可能性がある場合には非倫理的であるとみなされてきた。クロスオーバー試験、実薬対照試験、その他のアプローチがこの問題を軽減するために使用されてきたが、これらの選択肢は必ずしも研究に適しているとは限らず、それ自体も批判を受けている。[ 34 ]
特にアクティブコントロール試験では、臨床的均衡に関する倫理的考察が生じる可能性がある。均衡の原則(「専門家医療コミュニティ内で、好ましい治療法について真の不確実性があること」)は臨床試験に共通し、RCTにも適用されているが、均衡の確認は困難であり、[ 34 ] RCTの倫理には特別な考慮事項がある。均衡自体がRCTを正当化するのに不十分であると主張されている。[ 35 ] 「集団的均衡」は、患者を含む個人の均衡(つまり、介入が効果的であるという個人的な信念)の欠如と矛盾する可能性がある。 [ 36 ]一部のRCTで使用されているゼレンのデザインは、被験者がインフォームドコンセントを提供する前に被験者をランダム化するものであり、スクリーニングや選択された治療法のRCTでは倫理的である可能性があるが、「ほとんどの治療試験」では非倫理的である可能性が高い。[ 37 ] [ 38 ]患者が効果の低い治療を受けるリスクを最小限に抑えるために、患者を不均等な割合でランダム化したり、試験期間中に結果に基づいて割合を調整したりするなど、いくつかのランダム化アプローチが使用されてきましたが、これらの解決策は解決するよりも多くの倫理的問題を引き起こすとして批判されています。[ 34 ]
上記の問題により、RCTの実施に関する厳格な実践ガイドラインが策定されたが、バランスの取れた規制を策定することは困難である。厳格な保護は先住民族には有利に働くかもしれないが、その導入により、より低い基準とより経済的に脆弱な人口を抱える国への試験のアウトソーシングが促されるため、グローバル化された環境では失敗する可能性がある。患者の幸福を非常に重視する枠組みは、父権主義的であると批判されることもある。[ 34 ]
RCT法のバリエーションは、十分に理解されていない文化的影響も生み出す可能性がある。[ 39 ]例えば、末期疾患の患者は、治療が成功する可能性が低い場合でも、治癒を期待して治験に参加することがある。
2004年、国際医学雑誌編集者委員会(ICMJE)は、2005年7月1日以降に登録を開始するすべての試験は、同委員会の12の加盟誌のいずれかに掲載される前に登録しなければならないと発表した。[ 40 ]しかし、試験登録は遅れて行われるか、まったく行われない場合もある。[ 41 ] [ 42 ] 医学雑誌は、掲載の前提条件として臨床試験の登録を義務付ける方針の導入に遅れている。[ 43 ]
RCTを分類する方法の1つは、研究デザインによるものです。医療文献で最も一般的なものから最も一般的でないものまで、RCT研究デザインの主なカテゴリは次のとおりです。[ 44 ]
2006年12月にPubMedに索引付けされた616件のRCTの分析によると、78%が並行群試験、16%がクロスオーバー試験、2%が分割体試験、2%がクラスター試験、2%が要因試験であった。[ 44 ]
RCTは「説明型」または「実用型」に分類できます。[ 52 ]説明型RCTは、厳選された参加者と厳密に管理された条件下での研究環境における有効性を検証します。 [ 52 ]一方、実用型RCT(pRCT)は、比較的選択されていない参加者と柔軟な条件下での日常診療における有効性を検証します。このようにして、実用型RCTは「診療に関する意思決定に役立つ」ことができます。[ 52 ]
RCT の別の分類では、方法論と報告が異なる「優越性試験」、「非劣性試験」、「同等性試験」に分類されます。[ 53 ]ほとんどの RCT は優越性試験であり、ある介入が統計的に有意な方法で別の介入よりも優れていると仮定されています。[ 53 ]一部の RCT は「新しい治療法が参照治療法よりも悪くないかどうかを判断する」ための非劣性試験です。[ 53 ]他の RCT は、2 つの介入が互いに区別できないという仮説に基づく同等性試験です。[ 53 ]
RCTにおける適切なランダム化の利点には以下が含まれます。 [ 54 ]
患者を異なる介入にランダムに割り付けるプロセスには 2 つの手順があります。1 つ目は、予測不可能な割り当てのシーケンスを生成するランダム化手順を選択することです。これは、患者を任意のグループに等しい確率で単純にランダムに割り当てる方法、制限付きランダム化、または適応型ランダム化のいずれかです。2 つ目の、より実際的な問題は割り当ての隠蔽です。これは、患者をそれぞれのグループに最終的に割り当てる前に、患者のグループ割り当てが明らかにならないようにするための厳格な予防措置を指します。あるグループと別のグループの間で被験者を交互に割り当てるなどの非ランダムな「体系的」グループ割り当て方法は、「無限の汚染の可能性」を引き起こし、割り当ての隠蔽違反を引き起こす可能性があります。[ 55 ]
しかし、適切なランダム化が不十分なランダム化と比較して結果を変えるという経験的証拠は検出が困難であった。[ 56 ]
治療割り当てとは、各治療群における患者の望ましい割合のことである。
理想的なランダム化手順は、次の目標を達成するだろう。[ 57 ]
しかし、あらゆる状況においてこれらの目標を満たす単一のランダム化手法は存在しないため、研究者は、それぞれの研究における利点と欠点を考慮して、適切な手法を選択しなければならない。
これは「公平なコイン投げを繰り返す」のと同様に、一般的に使用されている直感的な手順です。[ 54 ]また、「完全」または「無制限」ランダム化としても知られており、選択バイアスと偶発的バイアスの両方に対して頑健です。ただし、主な欠点は、小規模なRCTでグループのサイズが不均衡になる可能性があることです。そのため、200人以上の被験者がいるRCTにのみ推奨されます。[ 61 ]
小規模なRCTでグループサイズを均衡させるためには、何らかの「制限付き」ランダム化が推奨される。[ 61 ] RCTで使用される主な制限付きランダム化の種類は以下のとおりである。
RCTでは少なくとも2種類の「適応型」無作為化手順が用いられてきたが、単純無作為化や制限付き無作為化に比べると使用頻度ははるかに低い。
「割り付けの隠蔽」(「患者が研究に参加する前に割り付けられる治療法が分からないように、ランダム化プロセスを保護する手順」と定義される)は、RCTにおいて重要である。[ 63 ]実際には、RCTの臨床研究者は公平性を維持することが難しい場合が多い。研究者が封筒を光にかざしたり、オフィスをくまなく探したりしてグループ割り当てを決定し、次の患者の割り当てを指示するという話は数多くある。[ 55 ]このような行為は選択バイアスと交絡因子(どちらもランダム化によって最小限に抑えられるべきである)を導入し、研究結果を歪める可能性がある。[ 55 ]適切な割り付けの隠蔽は、研究が開始された後や研究が終了した後に、患者と研究者が治療の割り付けを知ることを阻止するはずである。治療に関連する副作用や有害事象は、研究者や患者に割り付けを明らかにするほど具体的である可能性があり、それによってバイアスが導入されたり、研究者によって収集された、または被験者から要求された主観的パラメータに影響を与えたりする可能性がある。
割り付けの隠蔽を確実にするための標準的な方法には、連番の不透明な密封封筒(SNOSE)、連番の容器、薬局管理ランダム化、中央ランダム化などがあります。[ 55 ]割り付けの隠蔽方法は RCT のプロトコルに含めるべきであり、割り付けの隠蔽方法は RCT の結果の発表で詳細に報告されるべきですが、2005 年の研究では、ほとんどの RCT のプロトコル、発表、またはその両方で割り付けの隠蔽が不明確であることが判明しました。[ 64 ]一方、146 件のメタ分析に関する 2008 年の研究では、割り付けの隠蔽が不十分または不明確な RCT の結果は、RCT の結果が客観的ではなく主観的である場合にのみ、有益な効果に偏る傾向があると結論付けました。[ 65 ]
対照群と治療群に割り当てられた治療単位(被験者または被験者のグループ)の数は、RCTの信頼性に影響します。治療の効果が小さい場合、いずれのグループの治療単位の数も、それぞれの統計的検定で帰無仮説を棄却するには不十分である可能性があります。帰無仮説を棄却できないということは、その治療が特定の検定において被験者に対して統計的に有意な効果を示さないことを意味します。しかし、サンプルサイズが増加すると、同じRCTでも、たとえその効果が小さくても、治療の有意な効果を実証できる可能性があります。[ 66 ]
RCTは、「研究参加者、介護者、または結果評価者がどの介入を受けたかを知ることができないようにする手順」によって盲検化(「マスキング」とも呼ばれる)されることがある。[ 65 ]割り付けの隠蔽とは異なり、盲検化はRCTでは不適切または不可能な場合がある。たとえば、RCTに患者の積極的な参加が必要な治療(例:理学療法)が含まれる場合、参加者を介入について盲検化することはできない。
従来、盲検RCTは「単盲検」、「二重盲検」、「三重盲検」に分類されてきましたが、2001年と2006年の2つの研究で、これらの用語は人によって意味が異なることが示されました。[ 67 ] [ 68 ] 2010年のCONSORT声明では、著者と編集者は「単盲検」、「二重盲検」、「三重盲検」という用語を使用すべきではなく、代わりに盲検RCTの報告では「実施された場合、介入への割り当て後に誰が盲検化されたか(例えば、参加者、医療提供者、結果を評価する者)、そしてどのように盲検化されたか」について議論すべきであると規定しています。[ 6 ]
盲検化されていない RCT は、「非盲検」 [ 69 ]、「オープン」[ 70 ]、または (介入が薬剤の場合)「オープンラベル」 [ 71 ]と呼ばれます。2008年の研究では、非盲検 RCT の結果は、RCT の結果が客観的ではなく主観的である場合にのみ、有益な効果に偏る傾向があると結論付けられました。[ 65 ]例えば、多発性硬化症の治療に関する RCT では、盲検化されていない神経科医 (盲検化されていない神経科医ではない) は、治療が有益であると感じました。[ 72 ]実用的 RCT では、参加者と提供者はしばしば盲検化されていませんが、「評価者を盲検化するか、結果の評価のための客観的なデータソースを取得することは依然として望ましく、多くの場合可能です。」[ 52 ]
RCTで使用される統計的手法の種類は、データの特性によって異なり、以下のようなものがあります。
使用する統計的手法に関わらず、RCTデータの分析において重要な考慮事項は以下のとおりです。
CONSORT 2010声明は、「RCTの報告に関するエビデンスに基づいた最低限の推奨事項」です。[ 77 ] CONSORT 2010チェックリストには、最も一般的なタイプのRCTである「個別にランダム化された2群並行試験」に焦点を当てた25項目(多くはサブ項目付き)が含まれています。[ 1 ]
その他のRCT研究デザインについては、「CONSORT拡張版」が発表されており、その例をいくつか挙げる。
2000年にニューイングランド・ジャーナル・オブ・メディシンに掲載された2つの研究では、観察研究とRCTは全体的に同様の結果を示したことがわかった。[ 82 ] [ 83 ] 2000年の調査結果の著者らは、「観察研究はエビデンスに基づいた医療を定義するために使用すべきではない」という考えと、RCTの結果が「最高レベルのエビデンス」であるという考えに疑問を呈した。[ 82 ] [ 83 ]しかし、2001年に米国医師会誌に掲載された研究では、観察研究とRCTの間で「偶然を超える不一致は実際に発生し、治療効果の推定値の差は非常に一般的である」と結論付けた。[ 84 ] 2014年(2024年に更新)のコクランレビューによると、観察研究とランダム化比較試験の間に有意な効果の差があるというエビデンスはほとんどない。[ 85 ] 差を評価するには、異質性、対象集団、介入、比較対象など、デザイン以外のものを考慮する必要がある。[ 85 ]
他の2つの論理的根拠は、RCTが他の種類の研究を超えて科学的知識に貢献しているかどうかを疑問視している。
すべての統計的手法と同様に、RCT はタイプ I (「偽陽性」) とタイプ II (「偽陰性」) の両方の統計的エラーの影響を受けます。タイプ I エラーに関しては、典型的な RCT では、同等に効果的な 2 つの治療法が有意に異なると誤って判断される確率として 0.05 (つまり 20 分の 1) を使用します。[ 90 ]タイプ II エラーに関しては、多くの「陰性」 RCT のサンプル サイズが小さすぎて、陰性の結果について決定的な結論を出すことができないと指摘した 1978 年の論文が発表されたにもかかわらず、[ 91 ] 2005 ~ 2006 年までに、かなりの割合の RCT でサンプル サイズ計算が不正確または不完全に報告されていました。[ 92 ]
結果の査読は科学的方法の重要な部分です。査読者は、信頼性の低い結果につながる可能性のある設計上の問題(例えば、系統的バイアスを生み出すこと)がないか研究結果を検証し、関連する研究や他の証拠との関連で研究を評価し、研究が結論を証明したと合理的に考えられるかどうかを評価します。査読の必要性と結論の過度の一般化の危険性を強調するために、ボストン地域の2人の医学研究者は、複葉機またはヘリコプターから飛び降りる23人のボランティアにパラシュートまたは空のバックパックをランダムに割り当てる無作為化比較試験を実施しました。この研究は、パラシュートは空のバックパックと比較して怪我を軽減しないことを正確に報告することができました。この結論の一般適用性を制限する重要な状況は、航空機が地上に駐機しており、参加者が約2フィートしか飛び降りていなかったことです。[ 93 ]
RCTは、偽の因果関係やバイアスを低減するため、医療政策や医療行為に影響を与えるエビデンスの階層において、最も信頼性の高い科学的エビデンス形態であると考えられています。RCTの結果は、エビデンスに基づいた医療行為の実施においてますます活用されているシステマティックレビューに統合されることがあります。RCTまたはRCTのシステマティックレビューを最高品質のエビデンスとみなしている科学団体の例をいくつか挙げます。
臨床診療の変化に貢献した、予想外の結果を示した注目すべきランダム化比較試験(RCT)には、以下のようなものがある。
多くの論文でRCTの欠点が議論されている。[ 87 ] [ 105 ] [ 106 ] 最も頻繁に挙げられる欠点には以下のようなものがある。
RCTは費用がかかる場合があります。[ 106 ]ある研究では、2000年以前に国立神経疾患・脳卒中研究所が資金提供した第III相RCTが28件あり、総費用は3億3500万米ドルでした。 [ 107 ] RCT1件あたりの平均費用は1200万米ドルでした。それにもかかわらず、 RCTの投資収益率は高い可能性があります。同じ研究では、質調整生存年を当時の平均一人当たり国内総生産と同等と評価した場合、28件のRCTが「10年後の社会への純利益」を試験プログラムの費用の46倍にすると予測しています。[ 107 ]
RCTの実施には発表までに数年かかるため、データは長期間にわたって医療界から制限され、発表時には関連性が低くなっている可能性がある。[ 108 ]
一部の介入を評価するのに理想的な数年または数十年にわたってRCTを維持するには費用がかかります。[ 87 ] [ 106 ]
まれにしか発生しない事象(例:乳幼児突然死症候群)やまれな有害事象(例:薬剤のまれな副作用)を予防するための介入には、非常に大規模なサンプルサイズを用いたRCTが必要となるため、観察研究によって評価するのが最適であると考えられる。[ 87 ]
RCT の実施コストのため、通常は 1 つの変数またはごく少数の変数しか調査せず、複雑な医療状況の全体像を反映することはまれです。一方、症例報告では、例えば、患者の医療状況の多くの側面 (患者の病歴、身体診察、診断、心理社会的側面、フォローアップなど) を詳細に記述することができます。[ 108 ]
2011年に実施された、医学メタアナリシスに使用された基礎研究における潜在的な利益相反を明らかにするための研究では、29のメタアナリシスをレビューし、メタアナリシスの基礎となる研究における利益相反がほとんど開示されていないことを発見した。29のメタアナリシスには、一般医学誌からの11件、専門医学誌からの15件、およびコクラン・システマティック・レビュー・データベースからの3件が含まれていた。29のメタアナリシスは、合計509件のランダム化比較試験(RCT)をレビューした。これらのうち、318件のRCTが資金源を報告しており、219件(69%)は企業からの資金提供を受けていた。509件のRCTのうち132件が著者の利益相反の開示を報告しており、91件の研究(69%)が1人以上の著者と企業との金銭的関係を開示していた。しかし、この情報はメタアナリシスにはほとんど反映されていなかった。RCTの資金源を報告したのはわずか2件(7%)で、RCTの著者と企業との関係を報告したものはなかった。著者らは、「メタアナリシスに含まれるRCTからの業界資金提供や著者の業界との金銭的関係による利益相反を認めなければ、メタアナリシスからのエビデンスに対する読者の理解と評価が損なわれる可能性がある」と結論付けた。[ 109 ]
一部の RCT は、政府、非営利団体、その他の資金源ではなく、医療業界 (製薬業界など) によって全額または一部資金提供されています。2003 年に発表されたシステマティック レビューでは、業界がスポンサーとなった RCT と業界がスポンサーとしていない RCT を比較した 1986 ~ 2002 年の 4 つの論文が見つかり、すべての論文で業界のスポンサーシップと肯定的な研究結果との相関関係が見られました。 [ 110 ]主要な医学および外科ジャーナルに掲載された 1999 ~ 2001 年の RCT に関する 2004 年の研究では、業界が資金提供した RCT は「統計的に有意な業界有利な結果と関連する可能性が高い」と判断されました。[ 111 ]これらの結果は外科の試験でも反映されており、業界の資金提供は試験の中止率には影響しませんでしたが、完了した試験の出版の可能性が低いことと関連していました。[ 112 ]業界資金による発表された RCT で業界有利な結果が出る理由の 1 つは出版バイアスである。[ 111 ] 他の著者らは、学術研究と業界スポンサーによる研究の目的の違いが、この違いの一因となっていると指摘している。商業スポンサーは、初期段階の試験で有望な結果を示した薬剤の試験を実施すること、および医薬品承認の規制要件を満たすために以前の肯定的な結果を再現することに重点を置いている可能性がある。[ 113 ]
RCTはエビデンスに基づいた医療における研究のゴールドスタンダードと考えられているが、特定の状況では研究に適さない場合がある。例えば、RCTは患者に「明らかな」利益をもたらす医療介入の研究には不適切である可能性がある[ 87 ]。なぜなら、そのような行為は対照群に効果的な治療を倫理的に否定することになるからである[ 34 ] 。また、心理療法や地域開発に基づくアプローチなど、治療に参加者の積極的な関与が必要な場合にも課題が生じる可能性がある[ 87 ] 。
歴史的に、外科手術の研究にRCTを効果的に利用することは困難でした。プラセボによって盲検化が比較的容易な薬剤の研究とは異なり、外科試験では研究者である外科医の盲検化は不可能な場合があり、[ 114 ]また、手術の明らかな生理学的影響により、偽手術対照群を使用しない限り、被験者の盲検化が損なわれる可能性があり、偽手術対照群は限られた範囲の外科的介入でのみ可能であると考えられています。[ 115 ]
RCTは、明らかな身体的影響を伴う介入の精神的健康への影響を研究するには、実行不可能または非倫理的であると考えられる場合もある。特に、中絶や思春期の性転換医療のように、患者が強く求めている介入の場合はなおさらである。[ 116 ]盲検化を損なうことに加えて、これらの介入の一部に対するRCT研究デザインでは、対照群における脱落、非遵守、および応答バイアスの可能性が高くなり、RCTの信頼性が低下する可能性がある。[ 116 ]
社会科学におけるRCTの最近の出現により、これらの分野におけるRCTの適用は、学者の間で依然として議論の的となっている。医学や健康分野の出身の著者の中には、さまざまな社会科学分野における既存の研究は厳密さに欠けており、ランダム化比較試験をより多く使用することで改善されるべきだと主張する者もいる。[ 117 ]同様に、多くの経済学者は、RCTは結果が単なる相関関係ではなく因果推論を表していることを保証するためのゴールドスタンダードであると認識している。[ 118 ]総じて、RCTの社会科学への適用は、ここ数十年で重要なものとなっている。
RCTは、ミクロ経済学の研究、特に開発経済学において、因果推論を特定するための定番の手法となっている。1994年、後にノーベル賞を受賞するポール・グリューウェ、マイケル・クレーマー、シルヴィー・ムーランは、ケニアの学校で長期介入を実施し、経済学の分野で最も初期のRCTの1つを開始し、15年後にその結果を発表した。[ 119 ] 3年後の1997年には、開発途上国における最大規模のフィールド実験であるメキシコのPROGRESAプログラムが、多数の経済学研究者によって研究された。[ 120 ] [ 121 ]経済学者がこの方法を因果推論の特定に対する最良のアプローチと見なすようになったため、RCTが学問分野に与える影響はますます大きくなっている。ランダム化比較試験(RCT)は最先端とは言えないものの、実証ミクロ経済学における信頼性革命を後押しするのに役立っており、より厳密な識別方法の必要性から普及が進んでいる。
研究においてRCTを使用する方向への変化が見られるものの、経済学者の間ではその使用法について意見の相違が残っている。[ 118 ] フィールド実験、特にRCTの提唱者であるジョン・A・リストは、この方法は実験室実験とは大きく異なり、より確実な識別方法を提供すると述べている。[ 122 ] RCTには、データがないために因果モデルの構築が困難な場合に使用できる真の観察データを提供するという利点もある。
アメリカ経済学会は、経済学分野における進行中および完了したすべてのRCTの登録簿を維持しています。[ 123 ]この登録簿は無料で利用でき、研究者が進行中のフィールドワークや研究設定の失敗または限界に関する情報を共有できるように設計されています。[ 124 ] 2013年の設立以来、AEAは100か国にわたる7,400を超えるフィールド実験を追跡しており、RCT登録簿の年間件数は年々増加しています。[ 125 ]
交通科学の研究者たちは、学校通学計画などのプログラムへの公的支出は、ランダム化比較試験によってその有効性が実証されない限り正当化できないと主張している。[ 126 ]グラハム・ロウらは[ 127 ] 、文献で見つかった交通介入に関する77件の評価をレビューし、5つの「品質レベル」に分類した。彼らは、ほとんどの研究の質が低いと結論付け、今後の交通研究では可能な限りランダム化比較試験を使用することを提唱した。
スティーブ・メリア博士[ 128 ]はこれらの結論に異議を唱え、因果関係の確立とバイアスの回避におけるRCTの利点に関する主張は誇張されていると主張した。彼は、介入が効果を発揮するために人間の行動を変える必要がある状況でRCTを使用するための次の8つの基準を提案した。
介入:
そして、その因果メカニズムは以下の通りです。
2005年のレビューでは、1982年から2004年に発表された犯罪学の無作為化実験は83件であるのに対し、1957年から1981年に発表されたのはわずか35件であることが判明した。 [ 129 ]著者らは、発見した研究を「警察活動」、「予防」、「矯正」、「裁判所」、「コミュニティ」の5つのカテゴリーに分類した。[ 129 ] ホリン(2008)は、犯罪行動プログラムのみに焦点を当て、RCTは実施が難しい場合がある(例えば、RCTで「犯罪者をプログラムにランダムに割り当てる判決を下す」必要がある場合)ため、準実験的デザインによる実験が依然として必要であると主張した。[ 130 ]
RCTは、数多くの教育的介入の評価に用いられてきました。1980年から2016年の間に、1,000件を超えるRCTの報告が発表されています。[ 131 ]例えば、2009年の研究では、小学校教師260人の教室を、行動スクリーニング、教室介入、および保護者トレーニングのプログラムを受けるグループと受けないグループにランダムに割り付け、生徒の行動と学業成績を測定しました。[ 132 ]また、2009年の別の研究では、1年生678人の教室を、教室中心の介入、保護者中心の介入、または介入なしのグループにランダムに割り付け、19歳まで学業成績を追跡しました。[ 133 ]
2018年に最も多く引用された10件のランダム化比較試験をレビューしたところ、背景特性の分布が不十分であること、盲検化が困難であること、ランダム化比較試験に内在するその他の仮定やバイアスが指摘された。これらには、「独自の期間評価バイアス」、「背景特性は一定であるという仮定」、「平均治療効果の制限」、「個人レベルでの単純な治療の制限」、「すべての前提条件が完全に満たされているという仮定」、「量的変数の制限」、「プラセボのみまたは従来の治療のみの制限」などが含まれる。[ 5 ]
ロナルド・A・フィッシャーは「統計的手法の応用と普及に関心を持ち、1925年に出版された初期の著書『研究者のための統計的手法』は何度も改訂され、多くの研究分野における統計の実践的な利用を促し、影響を与えた。彼の『実験計画法』(1935年)は統計的手法とその応用を推進した。この本の中で彼は例を挙げ、統計的な観点から体系的に実験を設計する方法を強調した。記述された手法の数学的正当性は強調されておらず、実際、証明はしばしば概略的にしか示されなかったり、完全に省略されたりしていた。この事実が、HB・マンが彼の有名な論文『マン』(1949年)で厳密な数学的処理によってそのギャップを埋めることになった。」Conniffe D (1990–1991). 「RA Fisherと統計学の発展―生誕100周年の視点」 . Journal of the Statistical and Social Inquiry Society of Ireland . Vol. XXVI, no. 3. Dublin: Statistical and Social Inquiry Society of Ireland . p. 87. hdl : 2262/2764 . ISSN 0081-4776 . Mann HB (1949).実験の分析と設計:分散分析と分散分析設計. ニューヨーク:ドーバー出版. MR 0032177 .
{{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク){{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク)