ルービン因果モデル(RCM)、別名ネイマン・ルービン因果モデル[ 1 ]は、ドナルド・ルービンにちなんで名付けられた、潜在的結果の枠組みに基づく原因と結果の統計分析へのアプローチである。 「ルービン因果モデル」という名称は、ポール・W・ホランドによって考案された[ 2 ]。潜在的結果の枠組みは、イェジー・ネイマンが1923年の修士論文で初めて提案したが[ 3 ] 、彼はそれを完全無作為化実験の文脈でのみ議論した[ 4 ]。 ルービンはそれを、観察研究と実験研究の両方における因果関係を考えるための一般的な枠組みに拡張した[ 1 ] 。
ルービンの因果モデルは、潜在的結果の考え方に基づいています。例えば、ある人が大学に通っていた場合、40歳で特定の収入を得ているのに対し、大学に通っていなければ、40歳での収入は異なるとします。この人にとって大学に行くことの因果効果を測定するには、同じ個人の2つの異なる未来の結果を比較する必要があります。両方の潜在的結果を同時に見ることは不可能なので、潜在的結果の1つは常に欠落しています。このジレンマが「因果推論の根本的な問題」です。[ 2 ]
因果推論の根本的な問題により、単位レベルの因果効果を直接観察することはできません。しかし、ランダム化実験では、集団レベルの因果効果を推定することができます。[ 5 ]ランダム化実験では、人々をランダムに治療群(大学進学か非進学か)に割り当てます。このランダム割り当てにより、グループは(平均的に)同等となり、40歳時点での収入の差は、グループ間の唯一の違いである大学進学の割り当てに起因すると考えられます。平均因果効果(平均治療効果またはATEとも呼ばれる)の推定値は、治療群(大学進学)と対照群(非大学進学)のサンプル間の平均値の差を計算することによって得られます。
しかし、多くの場合、倫理的または実際的な懸念から、無作為化実験は不可能です。そのような場合、非無作為割り当てメカニズムが用いられます。大学進学の例がまさにこれに該当します。人々は無作為に大学進学に割り当てられるわけではありません。むしろ、経済状況や両親の学歴などに基づいて大学進学を選択する可能性があります。傾向スコアマッチングなど、因果推論のための多くの統計的手法が開発されています。これらの手法は、治療群と類似した対照群を見つけることで、割り当てメカニズムによる影響を補正しようとします。
ルービンは因果関係を次のように定義している。
直感的に言えば、ある治療 E が別の治療 C に対して特定の単位と時間間隔に対して及ぼす因果効果は、に時刻に何が起こっていたかの違いもしユニットがEに曝露されていた場合そして、もしユニットがCに曝露されていた場合「1時間前に水1杯ではなくアスピリン2錠を飲んでいたら、頭痛はもう治っていたでしょう」とか、「1時間前に水1杯ではなくアスピリン2錠を飲んだので、頭痛はもう治りました」といった直感的な意味合いを、EとCの治療の因果効果の定義に反映させます。[ 5 ]
RCMによれば、1時間前にアスピリンを服用したか服用しなかったかの因果効果は、ケース1(アスピリンを服用した場合)とケース2(アスピリンを服用しなかった場合)で頭痛がどう感じられたかの差です。アスピリンを服用しなければ頭痛が残るが、服用すれば頭痛がなくなるのであれば、アスピリンを服用することの因果効果は頭痛の緩和です。ほとんどの場合、私たちは2つの将来を比較することに関心があります。一方は一般的に「治療」、もう一方は「対照」と呼ばれます。これらのラベルはやや恣意的です。
ジョーが新しい高血圧治療薬のFDA臨床試験に参加していると仮定しましょう。すべてを知っている観察者は、治療(新薬)と対照(無治療または現在の標準治療)の両方におけるジョーの結果を把握しています。因果効果、つまり治療効果とは、これら2つの潜在的な結果の差のことです。
は、ジョーが新しい薬を服用した場合の血圧です。一般に、この表記は、単位uに対する治療tによって生じる可能性のある結果を表します。同様に、これは、異なる処理cまたは対照が単位uに及ぼす影響です。この場合、ジョーが薬を飲まなかった場合の血圧はどうなるでしょうか。 これは、新薬を服用することによる因果関係のある効果である。
この表からは、ジョーに対する因果効果しか分かりません。研究に参加した他の被験者は、薬を服用すれば血圧が上昇する可能性があります。しかし、他の被験者に対する因果効果がどうであれ、ジョーに対する因果効果は、薬を服用しなかった場合の血圧と比較して、血圧が低下することです。
より多くの患者を対象としたサンプルを検討してみましょう。
因果関係は被験者ごとに異なるが、ジョー、メアリー、ボブにとっては、因果関係が負であるため、薬は効果を発揮する。彼らの血圧は、薬を服用しなかった場合よりも薬を服用した方が低い。一方、サリーにとっては、薬は血圧の上昇を引き起こす。
潜在的な結果が意味を持つためには、少なくとも先験的に可能でなければならない。例えば、ジョーがどんな状況下でも新薬を入手する方法がない場合、彼にとってそれは不可能だ。そんなことは決して起こり得ない。そしてもし理論上であっても観察できない場合、治療がジョーの血圧に及ぼす因果効果は定義されない。
新薬の因果効果は、起こりうる2つの結果の単純な差であるため、明確に定義できます。この場合、私たち(あるいは他の何か)は、少なくとも概念的には世界を操作できるため、ある事象または別の事象が発生する可能性が生まれます。
因果関係の定義は、起こりうる結果の 1 つが絶対に起こり得ない場合、はるかに問題が多くなります。たとえば、ジョーの身長が彼の体重に及ぼす因果効果は何でしょうか? 素朴に考えると、これは他の例と似ているように思えます。2 つの起こりうる結果を比較すればよいだけです。治療(治療とは身長が 3 インチ高くなることと定義)の場合のジョーの体重と、対照(対照とは現在の身長と定義)の場合のジョーの体重です。
少し考えてみれば問題点が明らかになる。ジョーの身長を伸ばすことはできない。ジョーの身長が伸びたら体重がどうなるかを、概念的にさえ観察することはできない。なぜなら、ジョーの身長を伸ばす方法がないからだ。ジョーの身長を操作することはできないので、身長が体重に及ぼす因果関係を調査することに意味はない。だからこそ、「操作なしに因果関係は存在しない」というスローガンが生まれたのだ。
私たちは、「ある単位における(潜在的結果の)観察は、他の単位への特定の処置の割り当てによって影響を受けてはならない」ことを要求します(Cox 1958、§2.4)。これは安定単位処置値仮定(SUTVA)と呼ばれ、独立性の概念を超えたものです。
私たちの例の文脈では、ジョーの血圧はメアリーが薬を服用するかどうかに左右されるべきではありません。しかし、もし左右されるとしたらどうでしょうか?ジョーとメアリーが同じ家に住んでいて、メアリーがいつも料理をしているとしましょう。薬を服用するとメアリーは塩辛い食べ物を欲するようになるので、薬を服用すると普段よりも多くの塩を使って料理をするでしょう。塩分の多い食事はジョーの血圧を上昇させます。したがって、ジョーの血圧は、彼が受けた治療とメアリーが受けた治療の両方に左右されることになります。
SUTVA違反は因果推論をより困難にする。より多くの処置を考慮することで、従属的な観測値を説明できる。メアリーが処置を受けるかどうかを考慮することで、4つの処置を作成する。
因果効果は、2 つの潜在的な結果の差として定義されることを思い出してください。この場合、潜在的な結果が 2 つ以上あるため、複数の因果効果が存在します。1 つは、メアリーが治療を受けたときにジョーに及ぼす薬の因果効果であり、計算されます。もう一つは、メアリーが治療を受けず、計算された場合のジョーへの因果効果である。3つ目は、ジョーが治療を受けていない場合における、メアリーの治療がジョーに及ぼす因果効果です。これは次のように計算されます。メアリーが受ける治療は、ジョーが受ける治療よりもジョーに及ぼす因果効果が大きく、その方向性は逆である。
このように、より多くの潜在的な結果を考慮することで、SUTVA を成立させることができます。ただし、ジョー以外のユニットがメアリーに依存している場合は、さらに多くの潜在的な結果を考慮する必要があります。依存するユニットの数が多いほど、考慮しなければならない潜在的な結果が増え、計算が複雑になります(20 人の異なる人が参加する実験を考えてみてください。それぞれの人の治療状況が他の全員の結果に影響を与える可能性があります)。単一の治療の因果効果を対照群と比較して(容易に)推定するには、SUTVA が成立している必要があります。
考慮する:
平均因果効果(平均治療効果またはATEとも呼ばれる)は、すべての因果効果の平均を取ることによって計算できる。
反応をどのように測定するかによって、どのような推論が導き出されるかが変わってきます。血圧の変化を絶対値ではなくパーセント変化で測定するとしましょう。すると、具体的な数値によっては、平均的な因果効果は血圧の上昇となる可能性があります。例えば、ジョージの血圧がコントロール下で154、治療下で140だとします。因果効果の絶対値は-14ですが、パーセント差(治療レベル140を基準とした場合)は-10%です。サラの血圧が治療下で200、コントロール下で184の場合、因果効果は絶対値では16ですが、治療値で表すと8%になります。血圧の絶対値の変化が小さい(-14対16)ため、ジョージの場合はパーセント変化が大きくなります(-10%対8%)。ジョージとサラの平均的な因果効果は絶対値では+2ですが、パーセントでは-2になります。
これまで見てきた結果は、実際には決して測定されることはありません。定義上、特定の期間にわたって被験者に対する複数の治療法の効果を観察することは不可能です。ジョーは薬を服用すると同時に服用しないということはできません。したがって、データは次のようになります。
疑問符は、観察できなかった反応を表します。因果推論の根本的な問題[ 2 ]は、因果効果を直接観察することが不可能であるということです。しかし、これは因果推論を不可能にするものではありません。特定の手法と仮定により、根本的な問題を克服することができます。
以下のデータがあると仮定します。
一定の効果を仮定すれば、ジョーがコントロール下にあった場合の潜在的な結果がどうなっていたかを推測することができる。
そして
ここでTは平均治療効果であり、この場合は-10である。
観測されていない値を推測したい場合は、一定の効果を仮定することができます。以下の表は、一定の効果を仮定した場合に矛盾しないデータを示しています。
治療による結果は異なっても、すべての被験者は同じ因果関係を持っている。
治療を割り当てる方法である割り当てメカニズムは、平均因果効果の計算に影響を与えます。そのような割り当てメカニズムの1つがランダム化です。各被験者について、治療を受けるかどうかはコインを投げて決めることができます。5人の被験者に治療を受けさせたい場合、帽子から最初に引いた5人の名前に治療を割り当てることができます。治療をランダムに割り当てると、異なる結果が得られる可能性があります。
このデータが真実であると仮定します。
真の平均因果効果は-8です。しかし、これらの個人に対する因果効果は決してこの平均値と等しくなることはありません。因果効果は、現実世界では一般的に(常に?)変動します。治療をランダムに割り当てた後、因果効果を次のように推定することができます。
治療法のランダム割り当て方法が異なると、平均因果効果の推定値も異なる。
サンプルサイズが小さく、応答のばらつきが大きいため、平均因果効果は変動します。サンプルサイズが大きく、ばらつきが小さければ、治療群にランダムに割り当てられた個々の単位に関わらず、平均因果効果は真の平均因果効果に近くなるでしょう。
あるいは、その仕組みが治療をすべての男性に、そして男性のみに割り当てると仮定してみましょう。
この割り当てメカニズムでは、女性が治療を受けることは不可能であり、したがって女性被験者に対する平均的な因果効果を判断することは不可能である。被験者に対する因果効果を推論するためには、被験者が治療を受ける確率が0より大きく1より小さくなければならない。
理想的な医師を割り当てメカニズムとして考えてみましょう。理想的な医師は、各被験者が薬剤または対照群にどのように反応するかを知っており、各被験者に最も有益な治療法を割り当てます。理想的な医師は、患者サンプルについて以下の情報を把握しています。
この知識に基づいて、彼女は以下の治療割り当てを行うだろう。
理想的な医師は、治療群と対照群の両方に対する反応の悪い被験者を除外することで、両方の平均値を歪めてしまう。平均値の差、つまり想定される平均的な因果効果は、詳細によって異なる方向に歪められる。例えば、薬の服用によって害を受けたライラのような被験者は、理想的な医師によって対照群に割り当てられるため、薬の悪影響は隠蔽されてしまう。
ある時点における単一個体に対する治療の因果効果は、治療を行った場合と行わなかった場合の結果変数の差である。因果推論の根本的な問題は、単一個体に対する因果効果を観察することが不可能であるという点にある。アスピリンを服用するかしないかのどちらかしかない。したがって、欠落している反事実を推定するためには、何らかの仮定を置く必要がある。
ルービン因果モデルは、操作変数(Angrist、Imbens、Rubin、1996)[ 6 ] 、ネガティブコントロール、および他の因果推論手法とも関連付けられています。ルービン因果モデル、構造方程式モデリング、および他の因果推論統計手法間の関連性については、Morgan and Winship(2007)[ 7 ]、Pearl(2000)[ 8 ]、Peters et al.(2017)[ 9 ] 、およびIbeling & Icard(2023) [ 10 ]を参照してください。Pearl (2000)は、すべての潜在的結果は構造方程式モデル(SEM)から導き出すことができ、それによって計量経済学と現代の因果分析が統合されると主張しています。