
統計学において、偽りの関係または偽りの相関[ 1 ] [ 2 ]とは、偶然または特定の第三の目に見えない要因(「共通応答変数」、「交絡因子」、「潜在変数」と呼ばれる)の存在により、2つ以上の事象または変数が関連しているが因果関係がない数学的な関係のことである。
見かけ上の相関関係の例は時系列分析の文献に見られる。見かけ上の回帰とは、独立した非定常変数間の線形関係について誤解を招く統計的証拠を提供する回帰のことである。実際には、非定常性は両方の変数に単位根が存在することに起因する可能性がある。 [ 3 ] [ 4 ]特に、2つの名目経済変数は、どちらも他方に因果関係がない場合でも、互いに相関している可能性が高い。なぜなら、それぞれが実質変数に物価水準を掛けた値であり、2つのデータ系列に物価水準が共通して存在するため、相関が生じるからである。(比率の見かけ上の相関も参照。)
見かけ上の関係のもう一つの例は、ある都市のアイスクリームの売上を調べることで見ることができます。市のプールでの溺死率が最も高い時期に、アイスクリームの売上も最も高くなるかもしれません。アイスクリームの売上が溺死の原因である、あるいはその逆であると主張することは、両者の間に見かけ上の関係があることを示唆することになります。実際には、熱波が両方の原因となっている可能性があります。熱波は、隠れた変数、つまり交絡変数とも呼ばれる、目に見えない変数の一例です。
もう一つよく知られている例は、一連の春に営巣するコウノトリの数と、その時期に生まれた人間の赤ちゃんの数との間に正の相関関係があることを示すオランダの統計です。もちろん、因果関係はありません。これらは、2つの独立した偶然の一致によってのみ相関関係が見られました。少なくとも600年以上前の中世に遡ることができる異教の時代には、夏は豊穣と関連付けられていたため、カップルが毎年夏至に結婚するのが一般的でした。同時に、コウノトリはヨーロッパからアフリカまで飛んで、毎年恒例の渡りを開始します。そして、鳥たちは翌春、ちょうど9か月後に帰ってきます。[ 5 ]
まれに、ワシントン・コマンダーズというプロフットボールチームが各大統領選挙前の特定の試合で収めた成績と、その選挙における現職大統領の政党の成績との間に、交絡変数なしに、全く関係のない 2 つの変数の間に偽りの関係が生じることがあります。1940 年から 2000 年までの 16 回連続の選挙で、レッドスキンズ ルールは現職大統領の政党が大統領の座を維持するか失うかを正しく予測していました。このルールは、2000 年にイライアス スポーツ ビューローがこの相関関係を発見した直後に最終的に破綻しました。2004 年、2012 年、2016 年の選挙では、コマンダーズの試合結果と選挙結果は一致しませんでした。[ 6 ] [ 7 ] [ 8 ] 1970 年代には、ナショナル フットボール リーグに関連する同様の偽りの関係で、レナード コペットは、株式市場の方向性と、その年のスーパーボウルの優勝カンファレンスとの間に相関関係があることを指摘しました。これがスーパーボウル インジケーターです。この関係は20世紀の大半の間維持されたが、21世紀に入るとよりランダムな行動に戻った。 [ 9 ]
多くの場合、2つの変数間に相関がないという帰無仮説を検定し、データサンプルから計算された相関が、帰無仮説が真である場合にデータサンプルの(例えば)5%未満で発生する場合に、仮説を棄却することを事前に決定します。真の帰無仮説は95%の確率で受け入れられますが、残りの5%では、相関がないという真の帰無仮説が存在するにもかかわらず、相関がゼロであるという仮説が誤って棄却され、偽の相関が受け入れられてしまいます(これは第一種過誤として知られています)。ここでサンプルにおける偽の相関は、基礎となる母集団の真の特性を反映していないサンプルをランダムに選択した結果生じたものです。
「偽相関」という用語は、統計学、特に実験研究手法においてよく用いられます。これらの手法は、直接的な因果関係(X → Y)を理解し予測しようとするものです。非因果的な相関は、(W → X と W → Y の両方を引き起こす)先行要因によって偽って生じる可能性があります。 媒介変数(X → M → Y)が検出されない場合、媒介変数 M を調整せずに、直接的な効果ではなく総効果を推定することになります。このため、偽相関を排除できない限り、実験的に特定された相関は因果関係を表すものではありません。
実験では、理論的に交絡因子として特定されているものを含め、他の要因を制御することで、見かけ上の相関関係を特定できる場合が多い。例えば、ある研究者が新薬が細菌を殺すかどうかを判断しようとしているとしよう。研究者が細菌培養にその薬を投与すると、細菌は死滅する。しかし、交絡変数の存在を排除するために、別の培養を、最初の培養とできる限り同じ条件下に置いたが、その培養には薬を投与しなかった。もしその条件下に目に見えない交絡因子があれば、この対照培養も死滅するため、最初の培養の結果から薬の有効性について結論を出すことはできない。一方、対照培養が死滅しなければ、研究者はその薬が有効であるという仮説を棄却することはできない。
経済学のように、データが主に非実験的な学問分野では、通常、観察データを用いて因果関係を確立します。経済学で使用される統計的手法の体系は計量経済学と呼ばれます。計量経済学における主要な統計的手法は多変量回帰分析です。通常、線形関係、例えば、
仮説として、は従属変数(原因変数であると仮定される)であり、j = 1, ..., kはj番目の独立変数(原因変数であると仮定)であり、 は誤差項です(他のすべての原因変数の複合効果を含み、含まれる独立変数とは相関がない必要があります)。s はyによって引き起こされ、係数の推定値得られた。帰無仮説がが棄却された場合、次の代替仮説が成り立つ。そして同様に原因y は棄却できない。一方、帰無仮説が棄却できないならば、同様に、因果効果がないという仮説はyに関する結果は棄却できません。ここでの因果関係の概念は 寄与因果関係です。真の値がすると、回帰に含まれるか誤差項に暗黙的に含まれる他の原因変数が、その影響を正確に相殺するような形で変化しない限り、 y の変化が生じる。したがって、はy を変更するのに十分ではない。同様に、 y を変更する必要はありません。なぜなら、 yの変化は、誤差項に内在する何らかの要因(またはモデルに含まれる他の原因となる説明変数)によって引き起こされる可能性があるからです。
回帰分析では、他の関連変数を回帰変数(説明変数)として含めることで、それらの変数を制御します。これにより、潜在的に原因となる変数と潜在的に原因となる変数の両方に影響を与える第三の根本的な変数の存在による因果関係の誤った推論を回避できます。潜在的に原因となる変数に対するその影響は、回帰に直接含めることで捉えられるため、その影響が関心のある潜在的に原因となる変数の偽の影響として検出されることはありません。さらに、多変量回帰を使用することで、例えばx 1の間接効果(例: x 1 → x 2 → y)が直接効果(x 1 → y)であると誤って推論することを回避できます。
実験者がすべての交絡因子を制御する実験計画を採用するように注意しなければならないのと同様に、重回帰分析の利用者も、すべての交絡因子を回帰変数に含めることでそれらを制御するように注意しなければなりません。交絡因子が回帰分析から除外されると、その影響はデフォルトで誤差項に反映され、結果として生じる誤差項が、含まれている回帰変数の 1 つ (または複数) と相関している場合、推定された回帰は偏っているか、一貫性がない可能性があります (省略変数バイアスを参照)。
回帰分析に加えて、データを調べてグレンジャー因果関係が存在するかどうかを判断することもできます。グレンジャー因果関係が存在するということは、 xがyに先行することと、xがyに関する独自の情報を含んでいることの両方を示しています。
統計分析において定義されるその他の関係性は、以下のようにいくつかあります。