確率的因果関係とは、確率論の手法を用いて原因と結果の関係性を特徴づけようとする哲学理論群における概念である。これらの理論の根底にある考え方は、他の条件がすべて同じであれば、原因は結果の確率を高めるというものである。
因果関係を決定論的な関係として解釈すると、 AがBを引き起こす場合、Aの後には必ずBが続くことになる。この意味では、戦争は死を引き起こすものではなく、喫煙も癌を引き起こすものではない。そのため、多くの人が確率的因果関係という概念に目を向ける。非公式には、Aの発生がBの発生確率を高める場合、Aは確率的にBを引き起こす。これは、決定論的なシステムに関する不完全な知識を反映していると解釈される場合もあれば、研究対象の因果システムが本質的に非決定論的な 性質を持っていることを意味すると解釈される場合もある。(傾向確率はこれと類似した考え方であり、確率は客観的に存在し、単に個人の知識の限界ではないとされる。)
ヒュー・メラー[ 1 ]やパトリック・サップス[ 2 ]などの哲学者は、原因が結果に先行し、結果の確率を高めるという観点から因果関係を定義している。(さらに、メラーは、原因と結果はどちらも事実であり、出来事ではないと主張している。なぜなら、列車が到着しないといった非出来事でさえ、私がバスに乗るといった結果を引き起こす可能性があるからである。対照的に、サップスは集合論的に定義された出来事に依拠しており、彼の議論の多くはこの用語に基づいている。)[ 3 ]
パール[ 4 ]は、確率的因果関係という営み全体が最初から誤っていたと主張する。なぜなら、原因が結果の「確率を高める」という中心的な概念は、確率論の言葉では表現できないからである。特に、哲学者が因果関係を定義するために用いた不等式Pr(結果 | 原因) > Pr(結果 | ~原因)や、その多くのバリエーションやニュアンスは、「確率を高める」という直感を捉えきれていない。これは本質的に操作的、あるいは反事実的な概念である。パールによれば、正しい定式化は次のようになるべきである。
ここで、do(C)はCの真実性を強制する外部介入を表します。一方、条件付き確率Pr(E | C) は、 Cの受動的な観測から生じる確率を表し、Pr(E | do(C))と一致することはまれです。実際、気圧計が下がるのを観測すると嵐が来る確率は上がりますが、嵐を「引き起こす」わけではありません。気圧計を操作する行為が嵐の確率を変えるのであれば、気圧計が下がることは嵐の原因とみなされます。一般に、do演算子の計算体系[ 4 ]内で「確率上昇」の概念を定式化することで、過去半世紀にわたって確率的因果関係が直面してきた困難[ 2 ] [ 5 ] [ 6 ] 、中でも悪名高いシンプソンのパラドックスが解決され、確率と因果関係の間にどのような関係が存在するかが明確になります。
たとえこのような緩やかな解釈であっても、因果関係を確立することは非常に困難であり、「相関関係は因果関係を意味しない」という広く受け入れられている声明に表れている。例えば、喫煙者の肺がん罹患率が劇的に高いという観察結果は、喫煙がその罹患率上昇の原因であるとは断定できない。がんとニコチンへの渇望の両方を引き起こす特定の遺伝的欠陥が存在するかもしれないし、あるいはニコチンへの渇望は、他に検出できないごく初期の肺がんの症状である可能性さえある。科学者は常に、事象Aが事象Bを引き起こす正確なメカニズムを探求している。しかし、確率論によれば、両者の統計的相関が偶然よりもはるかに大きい場合、科学者は「喫煙はおそらくがんを引き起こす」といった声明を出すことにも抵抗を感じない。この二重のアプローチにおいて、科学者は決定論的因果関係と確率論的因果関係の両方を用語として受け入れている。
統計学では、観察研究(喫煙者と非喫煙者における癌症例数を数え、両者を比較するなど)は手がかりを与えることはできるが、因果関係を確立することは決してできないというのが一般的な見解である。しかし、多くの場合、定性的な因果関係の仮定(例えば、いくつかの変数間に因果関係がないこと)によって、観察研究から一貫した因果効果の推定値を導き出すことができる。[ 4 ]
因果関係を検証する上で最も優れた方法は、無作為化比較試験です。多数の被験者を無作為に2つのグループに分け、一方のグループには喫煙を強制し、もう一方のグループには喫煙を禁止します。そして、どちらかのグループで肺がんの発症率が有意に高くなるかどうかを判定します。無作為割り付けは、因果関係の推論において極めて重要な役割を果たします。なぜなら、長期的には、結果(がん)に対する他のあらゆる影響に関して両グループを同等にし、結果の変化は操作(喫煙)のみを反映するものとなるからです。倫理的な理由から、このような実験は実施できませんが、この方法は、より害の少ない実験には広く適用可能です。しかし、実験の限界の一つは、何らかの因果関係の存在を検証することには優れているものの、対象集団におけるその影響の大きさを推定することには劣るという点です。(これは、食品添加物の安全性に関する研究において、実際に摂取する量よりもはるかに多い量を用いる場合によく見られる批判です。)
閉鎖系では、データは原因A * B が一定の時間間隔τ内に結果Cに先行することを示唆する可能性がある。この関係は、 τによって制限される信頼度で因果関係を決定できる。しかし、制御されていない要因が結果に影響を与える可能性がある開放系では、同じ関係が確信を持って決定できるとは限らない。[ 7 ]
例えば、A、B、Cが既知であるA、B、Cのシステムを考えてみましょう。特性は以下に示され、特定の時間(例えば50ミリ秒、または50時間)に限定されます。「^」は「否定」、「*」は「かつ」を意味します。
^A * ^B => ^C (99.9999998027%)
A * ^B => ^C (99.9999998027%)
^A * B => ^C (99.9999998027%)
A * B => C (99.9999998027%)
時間境界(例えば50ミリ秒または50時間)が与えられた場合、A * BがCの原因であると合理的に主張できるのは、A、B、Cが問題となっているシステムの唯一の構成要素である場合に限り、6標準偏差の範囲内である。この範囲外の結果は、偏差とみなされる可能性がある。