

統計学において、平均への回帰(平均への回帰、平均への回帰、平凡への回帰とも呼ばれる)とは、ある確率変数の標本が極端である場合、同じ確率変数の次の標本がその平均値に近づく可能性が高いという現象である。[ 2 ] [ 3 ] [ 4 ]さらに、多くの確率変数を標本化し、最も極端な結果を意図的に選び出す場合、(多くの場合)これらの選び出された変数の2回目の標本化によって、すべての変数の初期平均値に近づき、「極端でない」結果が得られるという事実を指す。
数学的に言えば、この「回帰」効果の強さは、すべての確率変数が同じ分布から抽出されているかどうか、あるいは各確率変数の基となる分布に真の差異があるかどうかによって決まります。前者の場合、「回帰」効果は統計的に発生する可能性が高いですが、後者の場合、その効果は弱まるか、あるいは全く発生しない可能性があります。
平均への回帰は、意図的に最も極端な事象を選択するあらゆる科学的実験、データ分析、またはテストを設計する際に考慮すべき有用な概念です。これは、これらの事象について誤った結論に飛びつくことを避けるために、追跡調査が有用である可能性があることを示しています。それらは真の極端な事象である場合もあれば、統計的ノイズによる全く意味のない選択である場合、またはその両方のケースが混在している場合もあります。[ 5 ]
ある科目について、100問の正誤問題からなるテストを受ける生徒のクラスを考えてみましょう。すべての生徒がすべての問題にランダムに解答すると仮定します。すると、各生徒の得点は、期待平均が50である独立同分布の確率変数の集合のいずれかになります。当然ながら、偶然にも、50を大幅に上回る点数を取る生徒もいれば、大幅に下回る点数を取る生徒もいます。もし、上位10%の生徒だけを選び、再びすべての問題にランダムに解答する2回目のテストを受けさせた場合、平均得点は再び50に近い値になると予想されます。つまり、これらの生徒の平均点は、最初のテストを受けたすべての生徒の平均点まで「回帰」することになります。最初のテストで生徒が何点を取ったとしても、2回目のテストでの得点を最も正確に予測できるのは50点です。
テスト問題の解答の選択がランダムでなかった場合、つまり、生徒が解答する際に運(良い運も悪い運も)や無作為な推測が一切含まれていなかった場合、すべての生徒は2回目のテストで最初のテストと同じ点数を取ると予想され、平均への回帰は起こらないだろう。
現実的な状況のほとんどは、これら二つの極端なケースの中間に位置します。例えば、試験の点数は、スキルと運の組み合わせと考えることができます。この場合、平均点以上の成績を収めた生徒は、スキルが高く、特に運が悪かったわけでもない生徒と、スキルは低いものの非常に運が良かった生徒で構成されます。この生徒グループを再テストした場合、スキルが低い生徒は再び幸運に恵まれる可能性は低く、スキルが高い生徒は再び不運に見舞われる可能性があります。したがって、たとえ最初のテストを再現できなかったとしても、以前に好成績を収めた生徒は、2回目のテストで同じように良い成績を収める可能性は低いでしょう。
以下は、この2番目のタイプの平均への回帰の例です。あるクラスの生徒が、2日連続で同じテストを2回受けます。初日の成績が最も悪かった生徒は2日目に成績が上がる傾向があり、初日の成績が最も良かった生徒は2日目に成績が下がる傾向があることがよく観察されています。この現象は、生徒の成績が、潜在能力と偶然の両方によって決まるために起こります。最初のテストでは、運良く実力以上の点数を取る生徒もいれば、運が悪く実力以下の点数を取る生徒もいます。最初のテストで運が良かった生徒の中には、2回目のテストでも運が良かった生徒もいますが、平均点かそれ以下の点数を取る生徒の方が多くなります。したがって、最初のテストで運良く実力以上の成績を収めた生徒は、2回目のテストでより良い点数を取るよりも、悪い点数を取る可能性の方が高くなります。同様に、最初のテストで運悪く実力以下の点数を取ってしまった生徒は、2回目のテストで点数が上がる傾向があります。極端な出来事を引き起こす上で運の要素が大きいほど、その運が複数の出来事で繰り返される可能性は低くなる。
緑色のボールのプールと青色のボールのプールがあり、それぞれ1つずつボールを選んで6個にした場合、緑色のボールが6個になる確率は1/64、緑色のボールが5個と青色のボールが1個になる確率は6/64、緑色のボールが4個と青色のボールが2個になる確率は15/64、緑色のボールが3個と青色のボールが3個になる確率は20/64です。別のボールのプールからボールを選んだ場合、同じ色のボールが約半分になる可能性が高くなります。
昨年、お気に入りのスポーツチームが優勝した場合、来シーズンの優勝の可能性はどうなるでしょうか?この結果が実力によるもの(チームのコンディションが良い、優秀なコーチがいるなど)であれば、その優勝は来年も優勝する可能性が高いことを示しています。しかし、運による部分が大きいほど(他のチームが薬物スキャンダルに巻き込まれた、有利な組み合わせ、ドラフト指名選手が活躍したなど)、来年も優勝する可能性は低くなります。[ 6 ]
企業組織が、業績の根本的な理由が変わっていないにもかかわらず、非常に収益性の高い四半期を過ごしたとしても、次の四半期は業績が悪化する可能性が高い。[ 7 ]
野球選手は、ルーキーシーズンに好成績を収めると、2年目には成績が悪くなる傾向がある。これは「2年目のジンクス」と呼ばれる。同様に、平均への回帰は、スポーツ・イラストレイテッド誌の表紙のジンクスの説明にもなる。表紙を飾るような素晴らしい成績を収めた時期の後には、平凡な成績の時期が続く傾向があり、表紙を飾ると選手の成績が落ち込むという印象を与える。[ 8 ]

回帰の概念は遺伝学に由来し、19 世紀後半にフランシス・ゴルトン卿が『遺伝的身長における平凡への回帰』を出版したことで広く知られるようになった。[ 9 ]ゴルトンは、親の極端な特性(例えば身長)が子孫に完全に受け継がれるわけではないことを観察した。むしろ、子孫の特性は平凡な点(後に平均値として特定された点)に向かって回帰する。数百人の身長を測定することで、彼は平均への回帰を定量化し、その効果の大きさを推定することができた。ゴルトンは、「子孫の平均回帰は、それぞれの両親の平均値からの偏差の一定の割合である」と書いた。これは、ある特性における子供と両親の差が、両親の集団における典型的な人々からの偏差に比例することを意味する。両親の身長が男女それぞれの平均身長より2インチ高い場合、平均的に見て、子供の身長は両親の身長よりある係数(今日では、1マイナス回帰係数と呼ぶ)に2インチを掛けた値だけ低くなる。身長に関して、ガルトンはこの係数を約2/3と推定した。つまり、個人の身長は、両親の身長が人口平均からどれだけ乖離しているかの3分の2の中間値付近になるということである。
ガルトンは、ペレットがガルトンボードを通過して、その入口の真下を中心とした正規分布を形成するという、より単純な例を用いて これらの結果を発表した[ 10 ]。これらのペレットは、2回目の測定に対応する2番目のギャラリーに放出される可能性がある。ガルトンは、次に逆の質問をした。「これらのペレットはどこから来たのか?」
答えは「平均的には真上」ではなく、 「平均的には中央寄り」だった。その理由は単純に、左端で右内側に移動する可能性のあるペレットよりも、中央寄りの上方で左に移動する可能性のあるペレットの方が多かったからである。[ 11 ]
ガルトンは、多因子量的遺伝形質の遺伝における観察可能な事実を説明するために「回帰」という用語を作り出しました。それは、分布の両端に位置する親から生まれた子孫の形質は、分布の中心、つまり平均値に近づく傾向があるという事実です。彼はこの傾向を定量化し、その過程で線形回帰分析を発明し、現代の統計モデリングの基礎を築きました。それ以来、「回帰」という用語は他の文脈でも使用されるようになり、現代の統計学者は、ガルトンが遺伝学の分野で最初に観察した現象とはほとんど関係のない、サンプリングバイアスなどの現象を説明するためにこの用語を使用することもあります。
ゴルトンは生物学で観察した回帰現象について次のように説明しました。「子供は両親から一部を受け継ぎ、祖先からも一部を受け継ぎます。一般的に言えば、家系図を遡れば遡るほど、祖先はより多く多様になり、最終的には人種全体から無作為に抽出した同数のサンプルと違いがなくなります。」[ 9 ]ゴルトンのこの発言は、遺伝学の知識に照らして若干の明確化が必要です。子供は両親から遺伝物質を受け取りますが、先祖からの遺伝情報(例えば、遺伝形質の値)は両親を通して受け継がれる可能性があり(そして、両親には発現していない可能性があります)。形質の平均はランダムではなく、選択圧によって決定される可能性がありますが、平均値の周りの値の分布は正規統計分布を反映しています。
両親が同じハプロタイプを持ち、各遺伝子について優性対立遺伝子と劣性対立遺伝子をそれぞれ1つずつ持っている場合、その子孫のほとんどは中間的な表現型を示し、一部は優性表現型または劣性表現型に傾く傾向がある。
ガルトンが研究した集団遺伝学的現象は、「平均への回帰」の特殊なケースである。この用語は、データが平均値を中心とした正規分布を示す多くの統計現象を説明する際によく用いられる。
平均への回帰は、実験計画において重要な考慮事項である。
仮に、年齢が近い1,000人を対象に心臓発作のリスクを検査し、スコアをつけたとしましょう。統計学を用いて、リスクが最も高いと判定された50人に対する介入の効果を測定できます。このリスク判定は、ある程度の不確実性を伴う検査によって行われました。介入の内容は、食事療法、運動、薬物療法などです。たとえ介入が無益であったとしても、平均への回帰効果により、被験者グループは次回の身体検査で改善が見られると予想されます。この効果に対処する最善の方法は、被験者グループを無作為に治療群と非治療群に分けることです。そして、治療群が非治療群よりも改善した場合にのみ、治療は有効であると判断されます。
あるいは、恵まれない境遇にある子供たちのグループを対象にテストを実施し、大学進学の可能性が最も高い子供たちを特定するという方法もある。上位1%の子供たちを特定し、特別な補習授業、個別指導、カウンセリング、コンピューターなどを提供する。たとえこのプログラムが効果的であったとしても、1年後にテストを繰り返すと、平均スコアは低下する可能性がある。しかし、このような状況では、特別なニーズを無視した恵まれない境遇にある子供たちの対照群を設けることは、倫理的に問題があると考えられるかもしれない。縮小率を数式で計算することでこの影響を調整できるが、対照群を用いる方法ほど信頼性は高くない(スタインの例も参照)。
この効果は、一般的な推論や推定にも利用できます。今日国内で最も暑い場所は、明日には今日よりも暑くなるよりも涼しくなる可能性が高いでしょう。過去3年間で最もパフォーマンスの高かった投資信託は、今後3年間で相対的なパフォーマンスが向上するよりも低下する可能性が高いでしょう。今年最も成功したハリウッド俳優は、次の映画の興行収入が増えるよりも減る可能性が高いでしょう。シーズン途中の時点で打率が最も高い野球選手は、シーズンの残りの期間で打率が高くなるよりも低くなる可能性が高いでしょう。
平均への回帰という概念は、非常に簡単に誤用される可能性がある。
上記の学生テストの例では、測定対象が2回の測定間で変化しないことが暗黙のうちに前提とされていました。しかし、もしそのコースが合否判定で、合格するには両方のテストで70点以上を取る必要があったとしましょう。すると、初回に70点未満だった学生は、2回目のテストで良い成績を取ろうとする動機がなくなり、平均点がさらに下がる可能性があります。一方、70点をわずかに上回った学生は、テスト中に勉強して集中する強い動機を持つでしょう。この場合、 70点から離れて、70点未満のスコアが下がり、70点以上のスコアが上がるという動きが見られるかもしれません。このように、測定間の変化によって、平均への回帰という統計的傾向が強まったり、相殺されたり、逆転したりする可能性があるのです。
平均への統計的回帰は因果関係のある現象ではありません。初日のテストで最低点を取った生徒が、その効果によって2日目に点数を大幅に上げるとは限りません。平均的には最低点の生徒は成績が向上しますが、それは最低点の生徒が幸運よりも不運だった可能性が高いからにすぎません。生徒の学力や「真の値」によって決定されるのではなく、点数がランダムに決定されるか、ランダムな変動や誤差がある限り、この現象は影響を及ぼします。この点に関する典型的な間違いは教育分野で見られました。良い仕事をした生徒を褒めた生徒は次の評価で成績が悪くなり、悪い仕事をした生徒を罰した生徒は次の評価で成績が良くなったことが観察されました。教育者はこのことを根拠に褒めるのをやめて罰し続けることにしました。[ 12 ]このような決定は間違いでした。なぜなら、平均への回帰は因果関係に基づくものではなく、平均値を中心とした自然な分布におけるランダムな誤差に基づいているからです。
極端な個々の測定値は平均値に回帰するものの、2 番目の測定値のサンプルは、最初の測定値のサンプルよりも平均値に近づくことはありません。もう一度生徒について考えてみましょう。極端な個人の傾向が、平均値80 に 10% 回帰すると仮定すると、初日に 100 点を取った生徒は2 日目に 98 点を取ると予想され、初日に 70 点を取った生徒は 2 日目に 71 点を取ると予想されます。これらの予想は、初日のスコアよりも平均値に近くなります。しかし、2 日目のスコアは予想を中心にばらつき、高いスコアを取る生徒もいれば低いスコアを取る生徒もいます。極端な個人については、2 番目のスコアが最初のスコアよりも平均値に近くなると予想されますが、すべての個人については、両方の測定値のサンプルで平均値からの距離の分布は同じであると予想されます。
上記の点に関連して、平均への回帰はどちらの方向にも同様に作用します。2日目に最も高いテストスコアを獲得した生徒は、1日目の成績が悪かったと予想されます。また、1日目の最高得点者と2日目の最高得点者を比較した場合、それが同一人物であるか否かにかかわらず、どちらの方向にも平均への回帰傾向は見られません。両日の最高得点は、平均から同じくらい離れていると予想されます。
平均への回帰を考慮しない場合、多くの現象は誤った原因に帰せられる傾向がある。
極端な例として、ホレス・セクリストの1933年の著書『ビジネスにおける凡庸さの勝利』がある。この統計学教授は、競争の激しい企業の利益率が時間の経過とともに平均値に近づくことを証明するために膨大なデータを収集した。実際には、そのような効果はなく、利益率の変動は時間の経過とともにほぼ一定である。セクリストは、平均への一般的な回帰について説明したに過ぎない。憤慨した評論家の一人、ハロルド・ホテリングは、この本を「象を列と行に並べて九九を証明し、その後、他の多くの種類の動物についても同じことをする」に例えた。[ 13 ]
マサチューセッツ州における標準化された教育テストの「改善スコア」の算出と解釈は、回帰の誤謬のもう一つの例と言えるだろう。1999年、各学校に改善目標が設定された。教育省は各学校について、1999年と2000年の生徒の平均スコアの差を集計した。成績の悪い学校のほとんどが目標を達成していたことがすぐに明らかになり、教育省はこれを政策の正当性の証明とみなした。しかし、ブルックライン高校(全米優秀奨学生最終候補者18名を輩出)など、州内で最も優秀とされていた学校の多くが目標未達と判定されたことも指摘された。統計と公共政策に関わる多くの事例と同様に、この問題は議論の的となっているが、その後数年間は「改善スコア」は発表されず、今回の結果は平均への回帰の一例であるように思われる。
2002年にノーベル経済学賞を受賞した心理学者のダニエル・カーネマンは、平均への回帰が、叱責が業績向上につながるように見える一方で、賞賛が逆効果になるように見える理由を説明できるかもしれないと指摘した。[ 14 ]
飛行教官たちに、技能習得を促進するには罰よりも褒める方が効果的だと教えようとしていた時、私のキャリアの中で最も満足のいく「ユリイカ!」体験をしました。熱のこもったスピーチを終えると、聴衆の中で最も経験豊富な教官の一人が手を挙げ、短いスピーチを始めました。彼はまず、肯定的な強化は鳥には良いかもしれないと認めつつも、飛行訓練生には最適ではないと断言しました。彼はこう言いました。「私はこれまで何度も、飛行訓練生が曲技飛行を完璧にこなしたことを褒めてきましたが、たいていの場合、彼らは次に同じことを試みると、うまくいきません。一方で、私は訓練生がうまくできなかった時に怒鳴りつけることもよくありますが、たいていの場合、彼らは次にうまくやります。ですから、強化は効果があり、罰は効果がないなどと言わないでください。実際はその逆なのです。」これは喜びの瞬間であり、私は世界についての重要な真実を理解しました。それは、私たちは他人がうまくやったときには褒美を与え、うまくいかなかったときには罰する傾向があり、平均への回帰があるため、統計的に他人を褒美を与えると罰せられ、罰すると褒美をもらうというのは人間の条件の一部であるということです。私はすぐに、参加者それぞれがフィードバックなしで背後の的に向かって2枚のコインを投げるデモンストレーションを手配しました。的からの距離を測定したところ、1回目に最も成績が良かった人は2回目の試みで成績が悪化し、その逆もまた然りであることが分かりました。しかし、このデモンストレーションが、生涯にわたって受けてきたこの不自然な偶然性の影響を覆すことはできないと私は知っていました。
回帰の誤謬については、ロルフ・ドベリの著書『明晰思考の技術』でも解説されている。
英国の法執行政策では、事故多発地点に固定式または移動式の速度取締カメラを目に見える場所に設置することを推奨している。この政策は、カメラ設置後に重大な交通事故が相応に減少するという認識に基づいて正当化されている。しかし、統計学者は、救命という純便益はあるものの、平均への回帰の影響を考慮しないと、有益な効果が過大評価されることになると指摘している。[ 15 ] [ 16 ] [ 17 ]
統計分析家は、スポーツにおける平均への回帰効果を長年認識しており、それを「2年目のスランプ」と呼んでいます。例えば、NBAデンバー・ナゲッツのカーメロ・アンソニーは、2004年に素晴らしいルーキーシーズンを送りました。その活躍があまりにも素晴らしかったため、2005年にはルーキーシーズンの成績が落ち込みました。スポーツは調整と反調整に依存するため、「2年目のスランプ」の理由は数多くありますが、ルーキー時代の運に頼った卓越した成績も、その理由の一つとして挙げられます。スポーツにおける平均への回帰は、いわゆる「スポーツ・イラストレイテッド誌の表紙のジンクス」や「マッデン・カース」も説明できるかもしれません。ジョン・ホリンジャーは、平均への回帰現象を「偶然の法則」と呼んでおり、ビル・ジェームズは「プレキシガラスの原理」と呼んでいます。
一般的に、アスリートのパフォーマンスがシーズンごとに低下する原因として平均への回帰が注目されてきたため、そのような回帰がパフォーマンスの向上にもつながるという事実が見過ごされてきた。例えば、あるシーズンのメジャーリーグベースボール選手の打率を見ると、打率がリーグ平均を上回った選手は翌年には平均に向かって低下する傾向があり、打率が平均を下回った選手は翌年には平均に向かって上昇する傾向がある。[ 18 ]
平均への回帰とは、極端なランダムな事象の後には、次のランダムな事象はそれほど極端ではない可能性が高いという単純な事実です。将来の事象が前の事象を「補償」したり「均衡」させたりするわけではありませんが、ギャンブラーの誤謬(および平均の法則の変形)では、そのようなことが想定されています。同様に、大数の法則は、長期的には平均値が期待値に近づく傾向があると述べていますが、個々の試行については何も述べていません。例えば、公平なコインを投げて10回連続で表が出た場合(まれな極端な事象)、平均への回帰によれば、次の表の連続は10回未満になる可能性が高い一方、大数の法則によれば、長期的にはこの事象は平均化され、表の平均割合は1/2に近づく可能性が高いとされています。これに対し、ギャンブラーの誤謬は、コインが均衡するために今度は裏が連続する「番」が来たと誤って想定しています。
反対の効果は、無限大に向かって確率密度がゼロにならない分布から生じる裾野への回帰である。[ 19 ]
これは、フランシス・ゴルトン卿の本来の用法に非常に近い、平均への回帰の定義である。 [ 9 ]
n個のデータ点{ y i , x i } ( i = 1, 2, ..., n)があるとします。回帰直線、つまり直線 の式を求めたいとします。 これはデータ点に最もよく適合する曲線です。(直線は、与えられたデータ点に対して適切な回帰曲線ではない場合があります。)ここで「最適」とは、最小二乗法における「最適」という意味です。つまり、線形回帰モデルの残差の二乗和を最小化する直線のことです。言い換えれば、数値αとβは、次の最小化問題を解きます。
微積分を用いると、目的関数Qを最小化するαとβの値は次 のようになることが示される。
ここで、r xyはxとyの間の標本相関係数、s xはxの標準偏差、s yはそれに対応するyの標準偏差です。変数の上に水平線が付いている場合は、その変数の標本平均を表します。例:
上記の︿ αと︿ βの式をy = α + βxに代入すると、適合値が得られます。
これにより
これは、標準化されたデータポイントの回帰直線において、r xy が果たす役割を示しています。
−1 < r xy < 1の場合、データ点は平均への回帰を示していると言えます。言い換えれば、標本相関係数が完全ではないデータ点のセットに対して線形回帰が適切なモデルである場合、平均への回帰が見られます。予測された(または適合された)yの標準化値は、 xの標準化値がその平均値からどれだけ離れているかよりも、その平均値に近くなります。
X 1、X 2 を平均μを持つ同一の周辺分布を持つ確率変数とする。この定式化では、X 1とX 2の二変量分布が平均への回帰を示すとは、任意の数c > μに対して、 次の式が成り立つ場合をいう。c < μ の場合、逆の不等式が成り立つ。[ 20 ] [ 21 ]
以下は、上記の定義の非公式な説明です。ウィジェットの集団を考えます。各ウィジェットには、X 1とX 2という2 つの数値があります。たとえば、左スパン ( X 1 ) と右スパン ( X 2 ) です。集団内のX 1とX 2の確率分布が同一であり、 X 1とX 2の平均が両方ともμ であるとします。ここで、集団からランダムにウィジェットを 1 つ取り出し、そのX 1 の値をcとします( c はμより大きい場合も、等しい場合も、小さい場合もあります)。このウィジェットのX 2の値はまだわかりません。この特定のウィジェットのX 2の期待値をdとします。つまり、dは、 X 1 = cである集団内のすべてのウィジェットのX 2の平均値を表します。次の条件が真である場合:
つまり、 X 1とX 2 は平均への回帰を示していると言う。
この定義は、ガルトンの当初の用法から発展した「平均への回帰」という用語の現在の一般的な用法とほぼ一致する。この定義では、周辺分布が同一のすべての二変量分布が平均への回帰を示すわけではないという意味で「制限的」である。[ 21 ]
確率変数のペア(X、Y)が二変量正規分布に従う場合、条件付き平均E( Y | X )はXの線形関数となります。XとYの相関係数r 、およびXとYの周辺平均と周辺分散によって、この線形関係が決まります 。
ここで、E [ X ]とE[ Y ]はそれぞれXとYの期待値であり、σxとσyはそれぞれXとYの標準偏差である。
したがって、 X が平均よりt標準偏差上である場合( t < 0の場合、平均より下の場合も含む)の条件付きYの期待値は、 Yの平均よりrt標準偏差上になります。| r | ≤ 1なので、標準偏差の数で測ると、YはXよりも平均から遠くありません。 [ 22 ]
したがって、0 ≤ r < 1の場合、( X , Y )は平均への回帰を示します (この定義による)。
平均への回帰のより制限的な定義に代わるものとして、サミュエルズによって以下の平均への回帰の定義が提案された。[ 20 ]
X 1とX 2を、平均μを持つ同一の周辺分布を持つ確率変数とする。この定式化では、X 1とX 2の二変量分布が平均への回帰を示すとは、任意の数cに対して、次の式が成り立つ 場合をいう。
この定義は、周辺分布が同一の二変量分布はすべて平均への回帰を示すという意味で「一般的」であり、いくつかの弱い基準(サミュエルズの論文[ 20 ]で説明されている非退化と弱い正の依存性)が満たされれば、平均への回帰を示す。
ジェレミー・シーゲルは、「平均への回帰」という用語を用いて、短期的には非常に不安定だが長期的には非常に安定している金融時系列を説明する。より定量的に言えば、これは平均年間収益の標準偏差が保有期間の逆数よりも速く減少するものであり、プロセスがランダムウォークではなく、例えば多くの季節性ビジネスの場合のように、収益の低い期間の後には体系的に収益の高い期間が続くことを意味する。[ 23 ]
{{cite journal}}: CS1メンテナンス: 日付と年 (リンク)