平均治療効果(ATE)は、ランダム化実験、政策介入の評価、および臨床試験において、治療(または介入)を比較するために使用される指標です。ATEは、治療群に割り当てられた単位と対照群に割り当てられた単位の平均(平均)結果の差を測定します。ランダム化試験(すなわち、実験的研究)では、治療を受けた単位と治療を受けていない単位の平均結果を比較することにより、サンプルから平均治療効果を推定できます。しかし、ATEは一般的に、研究デザインや推定手順とは無関係に定義される、研究者が知りたい因果パラメータ(すなわち、母集団の推定値または特性)として理解されています。ランダム割り当てを伴う観察研究と実験的研究デザインの両方で、さまざまな方法でATEを推定することが可能です。
農業や医学の分野における初期の統計分析に由来する「治療」という用語は、現在ではより一般的に、心理学、政治学、経済学などの自然科学や社会科学の他の分野にも適用されており、例えば公共政策の影響評価などに用いられています。治療や結果の性質は、ATEの推定においては比較的重要ではありません。つまり、ATEの計算には、治療を一部の対象に適用し、他の対象には適用しないことが必要ですが、その治療の性質(例えば、医薬品、インセンティブ支払い、政治広告など)は、ATEの定義や推定には関係ありません。
「治療効果」とは、特定の治療や介入(例えば、薬剤の投与)が、関心のある結果変数(例えば、患者の健康状態)に及ぼす因果効果を指します。ネイマン=ルービンの因果関係の「潜在的結果フレームワーク」では、治療効果は、各個体について2つの「潜在的結果」によって定義されます。各個体には、治療を受けた場合に現れる結果と、対照群に置かれた場合に現れる結果があります。「治療効果」は、これら2つの潜在的結果の差です。しかし、個体レベルの治療効果は、個体は治療または対照群のどちらか一方しか受けることができず、両方を受けることはできないため、観察できません。治療へのランダム割り当てにより、治療群に割り当てられた個体と対照群に割り当てられた個体は(実験の多数の反復にわたって)同一であることが保証されます。実際、両群の個体は、共変量と潜在的結果の分布が同一です。したがって、治療群の個体間の平均結果は、対照群の個体間の平均結果に対する反事実として機能します。これら2つの平均値の差はATEであり、これは観測不可能な個人レベルの治療効果の分布の中心傾向の推定値である。 [ 2 ]サンプルが母集団からランダムに構成されている場合、サンプルATE(SATEと略記)は母集団ATE(PATEと略記)の推定値でもある。[ 3 ]
実験では、期待値としては、治療群と対照群で潜在的な結果(およびすべての共変量)が均等に分布することが保証されますが、観察研究ではそうではありません。観察研究では、対象者は治療群と対照群にランダムに割り当てられるわけではないため、治療群への割り当ては、観察されていない要因や観察不可能な要因に依存する可能性があります。観察された要因は統計的に制御できますが(例えば、回帰分析やマッチングなど)、治療群と対照群のどちらがどの対象者を対象とするかに影響を与えた観察不可能な要因によって、ATEの推定値が交絡される可能性があります。
ATEを正式に定義するために、2つの潜在的な結果を定義します 。は、個々の結果変数の値です。治療しなければ、は、個々の結果変数の値です。治療された場合。例えば、 研究対象の薬剤を投与されない場合の個人の健康状態と薬を投与された場合の健康状態はどうなるか。
個人に対する治療効果は一般的には、この効果が個人間で一定であると期待する理由はない。平均治療効果は次のように表される。
そして(大数の法則が成り立つ場合)推定することができる。
総和はすべての範囲にわたって行われます人口の中の個人。
個々の人について観察できれば、そして人口の代表的サンプルの大規模サンプルでは、ATE を単純に平均値を取ることで推定できます。サンプル全体で。しかし、両方を観察することはできませんそして個人ごとに、治療を受けると同時に治療を受けないということはあり得ないため、各個人についてのみ観察できます。たとえば、薬の例では、観察できるのは 薬を投与された個人および治療を受けられなかった人々にとって、これは治療効果の評価において科学者が直面する主な問題であり、数多くの推定手法が生み出されるきっかけとなった。
データとその背景にある状況に応じて、ATEを推定するために多くの方法が用いられます。最も一般的な方法は次のとおりです。
すべての対象が失業者であり、一部の対象者(介入群)が政策介入を受け、他の対象者(対照群)は政策介入を受けないという例を考えてみましょう。ここで関心のある因果効果は、求職活動監視政策(介入)が失業期間に及ぼす影響です。つまり、介入を受けた場合、平均して失業期間はどれだけ短くなるでしょうか。この場合のATEは、介入群と対照群の失業期間の期待値(平均値)の差です。
この例では、ATEが正の値であれば、雇用政策によって失業期間が長くなったことを示唆します。ATEが負の値であれば、雇用政策によって失業期間が短くなったことを示唆します。ATEの推定値がゼロであれば、失業期間に関して、その政策を実施することに利点も欠点もなかったことを示唆します。ATEの推定値がゼロと区別できるかどうか(正または負のどちらであるか)を判断するには、統計的推論が必要です。
平均治療効果(ATE)は治療の平均的な効果の推定値であるため、ATEが正の値か負の値かは、特定の個人が治療によって利益を得るか害を受けるかを示すものではありません。したがって、平均治療効果は治療効果の分布を無視しています。平均効果が正であっても、人口の一部は治療によって悪化する可能性があります。
研究者によっては、治療効果が異なる個人に異なる影響を与える場合(異質的)、その治療効果を「異質」と呼ぶことがあります。例えば、上記の求職活動監視政策による治療は、男性と女性、あるいは異なる州に住む人々に異なる影響を与えた可能性があります。ATEは、安定単位治療値仮定(SUTVA)と呼ばれる強い仮定を必要とし、これは潜在的結果の値を必要とします。治療の割り当てに使用されるメカニズムおよび他のすべての個人に対する治療曝露の影響を受けないこと。治療、個人に対する治療効果はSUTVAの仮定により、我々は宣言することができる。。
治療効果の異質性を調べる方法の一つは、研究データをサブグループ(例えば、男性と女性、または州別)に分け、サブグループごとに平均治療効果が異なるかどうかを確認することです。平均治療効果が異なる場合、SUTVA(単一治療効果の妥当性)は満たされません。サブグループごとの平均治療効果は「条件付き平均治療効果」(CATE)と呼ばれ、これはサブグループへの所属を条件とした平均治療効果です。CATEは、SUTVAが成り立たない場合の推定値として使用できます。
このアプローチの課題は、各サブグループのデータが研究全体に比べて大幅に少ない可能性があることです。そのため、サブグループ分析を行わずに主効果を検出できるだけの検出力を持つように研究が設計されている場合、サブグループへの影響を適切に判断するのに十分なデータが得られない可能性があります。
ランダムフォレストを使用して異質な治療効果を検出する研究[ 4 ] [ 5 ]や、クラスター分析を使用して異質なサブポピュレーションを検出する研究[ 6 ] [ 7 ]がある。最近では、任意の回帰フレームワークをベース学習器として使用して CATE を推論するメタ学習アプローチが開発されている[ 8 ] [ 9 ]。表現学習は、これらの方法のパフォーマンスをさらに向上させるために使用できる[ 10 ] [ 11 ] 。