
統計モデリングにおいて、回帰分析は、従属変数(多くの場合、結果変数または応答変数、あるいは機械学習の用語ではラベルと呼ばれる)と1つ以上のエラーのない独立変数(多くの場合、回帰子、予測子、共変量、説明変数、または特徴と呼ばれる)との関係を推定するための一連の統計プロセスです。回帰分析の最も一般的な形式は線型回帰であり、特定の数学的基準に従ってデータに最もよく適合する直線(またはより複雑な線型結合)を見つけます。たとえば、通常の最小二乗法は、真のデータとその直線(または超平面)との差の二乗和を最小化する唯一の直線(または超平面)を計算します。特定の数学的な理由により(線型回帰を参照)、これにより研究者は、独立変数が特定の値セットをとった場合の従属変数の条件付き期待値(または母集団平均値)を推定できます。あまり一般的ではない回帰分析では、わずかに異なる手順を使用して代替位置パラメータを推定したり(例えば、分位点回帰や必要条件分析[1])、より広範な非線形モデルの集合にわたって条件付き期待値を推定したり(例えば、ノンパラメトリック回帰)します。
回帰分析は、主に概念的に異なる 2 つの目的で使用されます。第 1 に、回帰分析は予測と予報に広く使用されており、その用途は機械学習の分野とかなり重複しています。第 2 に、状況によっては、回帰分析を使用して独立変数と従属変数の因果関係を推測できます。重要なことは、回帰分析だけでは、固定されたデータセット内の従属変数と独立変数の集合の関係しか明らかにならないことです。回帰を予測に使用する場合や因果関係を推測する場合は、研究者は、既存の関係が新しいコンテキストに対して予測力を持つ理由や、2 つの変数の関係に因果関係の解釈がある理由を慎重に正当化する必要があります。後者は、研究者が 観測データを使用して因果関係を推定したい場合に特に重要です。[2] [3]
歴史
最も初期の回帰法は最小二乗法であり、1805年にルジャンドル[4] 、 1809年にガウス[5]によって発表された。ルジャンドルとガウスはともに、天文観測から太陽の周りの天体(主に彗星だが、後には当時新たに発見された小惑星も)の軌道を決定する問題にこの方法を適用した。ガウスは1821年に最小二乗法の理論をさらに発展させたものを発表した[6]が、これにはガウス・マルコフの定理のバージョンが含まれていた。
「回帰」という用語は、19世紀にフランシス・ゴルトンが生物学的現象を説明するために作った造語である。その現象とは、背の高い先祖の子孫の身長が、通常の平均値に向かって下がる傾向があるというものである(平均への回帰としても知られる現象)。[7] [8] ゴルトンにとって、回帰はこの生物学的意味のみを持っていた。[9] [10]しかし、彼の研究は後に、ユールとカール・ピアソンによってより一般的な統計的文脈に拡張された。 [11] [12]ユールとピアソンの研究では、応答変数と説明変数の結合分布はガウス分布であると仮定されている。この仮定は、 RAフィッシャーの1922年と1925年の研究で弱められた。[13] [14] [15]フィッシャーは、応答変数の条件付き分布はガウス分布であると仮定したが、結合分布はそうである必要はない。この点で、フィッシャーの仮定は 1821 年のガウスの定式化に近いです。
1950年代と1960年代には、経済学者は電気機械式卓上計算機を使用して回帰分析を計算していました。1970年以前は、1回の回帰分析の結果が出るまでに最大24時間かかることもありました。[16]
回帰法は、引き続き活発に研究されている分野です。ここ数十年で、ロバスト回帰、時系列や成長曲線などの相関応答を含む回帰、予測子(独立変数)または応答変数が曲線、画像、グラフ、またはその他の複雑なデータオブジェクトである回帰、さまざまな種類の欠損データに対応する回帰法、ノンパラメトリック回帰、ベイズ法による回帰、予測変数が誤差で測定される回帰、観測値よりも多くの予測変数を含む回帰、および回帰による因果推論のための新しい方法が開発されました。
回帰モデル
実際には、研究者はまず推定したいモデルを選択し、次に選択した方法(通常の最小二乗法など)を使用してそのモデルのパラメータを推定します。回帰モデルには次のコンポーネントが含まれます。
- 未知のパラメータ。多くの場合、スカラーまたはベクトル として表されます。
- 独立変数はデータ内で観測され、多くの場合ベクトルとして表されます(ここで はデータの行を表します)。
- 従属変数はデータ内で観測され、多くの場合スカラーを使用して表されます。
- 誤差項はデータ内で直接観測されることはなく、多くの場合スカラーを使用して表されます。
さまざまな応用分野では、従属変数と独立変数の代わりに異なる用語が使用されます。
ほとんどの回帰モデルでは、 はおよびの関数(回帰関数)であり、 は のモデル化されていない行列式またはランダムな統計ノイズの代わりになる可能性のある加法的な誤差項を表すと提案されています。
独立変数にはエラーがないものと想定されていることに注意してください。独立変数にエラーが含まれていると想定される場合、変数内エラー モデルを使用できますが、この重要な想定は見落とされがちです。
研究者の目標は、データに最もよく適合する関数を推定することです。回帰分析を実行するには、関数の形式を指定する必要があります。この関数の形式は、データに依存しないとの関係についての知識に基づく場合があります。そのような知識がない場合は、 の柔軟で便利な形式が選択されます。たとえば、単純な単変量回帰では が提案される場合があります。これは、研究者がデータを生成する統計プロセスの妥当な近似値であると考えていることを示しています。
研究者が好みの統計モデルを決定すると、さまざまな形式の回帰分析によってパラメータを推定するツールが提供されます。たとえば、最小二乗法(最も一般的な変形である通常の最小二乗法を含む) は、二乗誤差の合計を最小化するの値を見つけます。特定の回帰法は最終的に の推定値を提供します。これは通常、推定値を、データを生成した真の (未知の) パラメータ値と区別するために と示されます。この推定値を使用して、研究者は予測に適合した値を使用したり、データを説明するモデルの精度を評価したりすることができます。研究者が本質的に推定値に興味があるか、予測値に興味があるかは、状況と目的によって異なります。通常の最小二乗法で説明したように、推定された関数が条件付き期待値を近似するため、最小二乗法が広く使用されています。[5]ただし、研究者が他の関数をモデル化したい場合は、代替の変形 (最小絶対偏差や分位回帰など) が役立ちます。
回帰モデルを推定するには、十分なデータが必要であることに注意することが重要です。たとえば、研究者が1 つの従属変数と 2 つの独立変数を含むデータ行にアクセスできるとします。さらに、研究者が最小二乗法を使用して 2 変量線型モデルを推定するとします。研究者がデータ ポイントにしかアクセスできない場合、データを同等に説明する組み合わせが無限に見つかります。つまり、 を満たす任意の組み合わせを選択でき、そのすべてが につながるため、残差の二乗和を最小化する有効な解になります。無限に多くのオプションがある理由を理解するには、方程式系を3 つの未知数について解く必要があるため、システムが不確定になることに注意してください。あるいは、固定点 を通過する無限の数の 3 次元平面を視覚化することもできます。
より一般的には、異なるパラメータを持つ最小二乗モデルを推定するには、異なるデータ ポイントが必要です。の場合、データに完全に適合するパラメータのセットは一般に存在しません。 この量は回帰分析でよく使用され、モデルの自由度と呼ばれます。 さらに、最小二乗モデルを推定するには、独立変数が線形独立である必要があります。つまり、残りの独立変数を加算および乗算しても、独立変数を再構築できない必要があります。通常の最小二乗法で説明したように、この条件により、 が可逆行列であり、したがって一意の解が存在することが保証されます。
根底にある前提
回帰分析は、それ自体では、データを使用した計算にすぎません。回帰分析の出力を、現実世界の関係を測定する意味のある統計量として解釈するために、研究者は多くの場合、いくつかの古典的な仮定に依存します。これらの仮定には、次のようなものが含まれます。
- サンプルは人口全体を代表するものです。
- 独立変数は誤差なく測定されます。
- モデルからの偏差は、共変量の条件に応じて、期待値がゼロになります。
- 残差の分散は観測値全体で一定です(等分散性)。
- 残差は互いに無相関です。数学的には、誤差の分散共分散行列は対角行列です。
最小二乗推定量が望ましい特性を持つためには、いくつかの条件を満たすだけで十分です。特に、ガウス・マルコフ仮定は、パラメータ推定値が線形不偏推定量のクラスにおいて不偏、一貫性、効率的であることを意味しています。これらの古典的な仮定が正確に当てはまる可能性は低いため、専門家は現実世界の設定でこれらの望ましい特性の一部またはすべてを維持するさまざまな方法を開発してきました。たとえば、変数内誤差をモデル化すると、独立変数が誤差を伴って測定されるという合理的な推定値が得られます。不均一分散一貫性のある標準誤差により、 の分散がの値にわたって変化することができます。データのサブセット内に存在する、または特定のパターンに従う相関誤差は、クラスター化標準誤差、地理加重回帰、またはNewey–West標準誤差などの手法を使用して処理できます。データの行が空間内の位置に対応している場合、地理単位内でモデル化する方法の選択は重要な結果をもたらす可能性があります。[17] [18]計量経済学の分野は、古典的な仮定が正確には当てはまらない現実世界の設定において、研究者が合理的な現実世界の結論を導き出すことを可能にする技術の開発に主に焦点を当てています。
線形回帰
線形回帰では、従属変数がパラメータの線形結合であることがモデルの仕様です(ただし、独立変数では線形である必要はありません)。たとえば、データ ポイントをモデル化する単純な線形回帰では、1 つの独立変数と 2 つのパラメータおよびがあります。
- 直線:
多重線形回帰では、複数の独立変数または独立変数の関数が存在します。
前の回帰 に項を追加すると、次のようになります。
- 放物線:
これは依然として線形回帰です。右辺の式は独立変数 では2次式ですが、パラメータ では線形であり、
どちらの場合も、は誤差項であり、下付き文字は特定の観測値を示します。
直線の場合に戻って考えてみましょう。母集団からランダムに抽出したサンプルから母集団パラメータを推定し、サンプル線形回帰モデルを取得します。
残差は、モデルによって予測された従属変数の値と従属変数の真の値 との差です。推定方法の 1 つは、通常の最小二乗法です。この方法では、残差の二乗和SSR を最小化するパラメータ推定値が得られます。
この関数を最小化すると、パラメータの同時線形方程式の集合である正規方程式の集合が得られ、これを解くとパラメータ推定値が得られます。

単回帰の場合、最小二乗推定値の式は次のようになる。
ここで、は値の平均であり、は値の平均です。
母集団の誤差項が一定の分散を持つという仮定の下で、その分散の推定値は次のように与えられます。
これは回帰の平均二乗誤差(MSE)と呼ばれます。分母は、回帰変数の場合、または切片が使用される場合、同じデータから推定されたモデルパラメータの数によって削減されたサンプルサイズです。 [19]この場合、分母は です。
パラメータ推定値の標準誤差は次のように与え られる。
さらに、母集団の誤差項が正規分布しているという仮定の下で、研究者はこれらの推定標準誤差を使用して信頼区間を作成し、母集団パラメータに関する仮説検定を実施することができます。
一般線形モデル
より一般的な多重回帰モデルでは、独立変数が存在します。
ここで、 は、番目の独立変数における 番目の観測値です。最初の独立変数がすべての、に対して値 1 を取る場合、 は回帰切片と呼ばれます。
最小二乗パラメータ推定値は正規方程式から得られる。残差は次のように表される。
正規方程式は
行列表記では、正規方程式は次のように表される。
ここでの要素は、列ベクトルの要素は、の要素はです。したがっては、は、 はです。解は
診断
回帰モデルが構築されたら、モデルの適合度と推定パラメータの統計的有意性を確認することが重要になる場合があります。適合度の一般的なチェックには、 R 二乗、残差パターンの分析、仮説検定などがあります。統計的有意性は、全体的な適合度のF 検定、続いて個々のパラメータのt 検定によって確認できます。
これらの診断テストの解釈は、モデルの仮定に大きく依存します。残差の検査はモデルを無効にするために使用できますが、モデルの仮定に違反している場合は、 t テストまたはF テストの結果の解釈がより困難になる場合があります。たとえば、誤差項が正規分布していない場合、小さなサンプルでは推定パラメータが正規分布に従わず、推論が複雑になります。ただし、比較的大きなサンプルでは、中心極限定理を適用して、漸近近似を使用して仮説検定を進めることができます。
限定された従属変数
限定従属変数は、カテゴリ変数である応答変数、または特定の範囲にのみ収まるように制約された変数であり、計量経済学でよく使用されます。
応答変数は非連続(実線の一部のサブセット上に「限定」)であってもよい。バイナリ(ゼロまたは1)変数の場合、分析が最小二乗線型回帰で進められる場合、モデルは線型確率モデルと呼ばれる。バイナリ従属変数の非線型モデルには、プロビットモデルとロジットモデルがある。多変量プロビットモデルは、いくつかのバイナリ従属変数といくつかの独立変数の間の結合関係を推定する標準的な手法である。2つ以上の値を持つカテゴリ変数の場合、多項ロジットモデルがある。2つ以上の値を持つ順序変数の場合、順序ロジットモデルと順序プロビットモデルがある。従属変数が時々しか観測されない場合は、打ち切り回帰モデルが使用されることがあり、サンプルが対象の母集団からランダムに選択されていない場合は、ヘックマン補正型モデルが使用されることがある。このような手順の代替として、カテゴリ変数間のポリコリック相関(またはポリシリアル相関)に基づく線型回帰がある。このような手順は、母集団内の変数の分布に関する仮定が異なります。変数が低い値で正であり、イベントの発生の繰り返しを表す場合は、ポアソン回帰や負の二項モデルなどのカウント モデルを使用できます。
非線形回帰
モデル関数がパラメータに対して線形でない場合は、反復手順によって二乗和を最小化する必要があります。これにより、多くの複雑な問題が生じますが、これらは「線形最小二乗法と非線形最小二乗法の違い」にまとめられています。
予測(内挿と外挿)

回帰モデルは、X変数の既知の値に基づいてY変数の値を予測します。モデル適合に使用されるデータセット内の値の範囲内での予測は、非公式には内挿と呼ばれます。データのこの範囲外の予測は 外挿 と呼ばれます。外挿の実行は、回帰の仮定に大きく依存します。外挿がデータから外れれば外れれば外れるほど、仮定とサンプル データまたは真の値との差によってモデルが失敗する余地が大きくなります。
不確実性を表す予測区間が、ポイント予測に付随する場合があります。このような区間は、独立変数の値が観測データの範囲外に移動すると、急速に拡大する傾向があります。
このような理由やその他の理由から、外挿を行うことは賢明ではないと言う人もいます。[21]
ただし、これは、起こり得るモデリング エラーのすべてを網羅しているわけではありません。特に、YとXの関係について特定の形式を想定する場合です。適切に実施された回帰分析には、想定された形式が観測データとどの程度一致しているかの評価が含まれますが、実際に利用可能な独立変数の値の範囲内でのみ行うことができます。つまり、外挿は、回帰関係の構造形式に関する想定に特に依存することになります。この知識に、従属変数が特定の値の範囲外にはならないという事実が含まれている場合、モデルの選択にこれを利用できます。観測されたデータセットにそのような境界に特に近い値がない場合でもです。回帰に適切な関数形式を選択するこの手順の影響は、外挿を考慮するときに大きくなります。少なくとも、適合モデルから生じる外挿が「現実的」 (または既知のものと一致する) であることを保証できます。
検出力とサンプルサイズの計算
モデルにおける観測値の数と独立変数の数を関連付ける一般的な方法は存在しない。グッドとハーディンが推測した方法の1つは であり、はサンプルサイズ、は独立変数の数、 はモデルに独立変数が1つしかない場合に望ましい精度に達するために必要な観測値の数である。[22]たとえば、研究者が1000人の患者を含むデータセット( )を使用して線形回帰モデルを構築しているとします。研究者が直線()を正確に定義するには5つの観測値が必要であると判断した場合、モデルがサポートできる独立変数の最大数は4です。
- 。
その他の方法
回帰モデルのパラメータは通常、最小二乗法を使用して推定されますが、他に次のような方法も使用されています。
- ベイズ法、例:ベイズ線形回帰
- パーセンテージ回帰は、パーセンテージ誤差を減らすことがより適切であると考えられる状況で用いられる。[23]
- 最小絶対偏差は外れ値が存在する場合に堅牢性が高く、分位回帰につながる。
- ノンパラメトリック回帰は、多数の観測値を必要とし、計算量が多い。
- シナリオ最適化、区間予測モデルにつながる
- 距離メトリック学習は、与えられた入力空間内で意味のある距離メトリックを探索することによって学習される。[24]
ソフトウェア
主要な統計ソフトウェア パッケージはすべて、最小二乗回帰分析と推論を実行します。最小二乗法を使用した単純な線形回帰と多重回帰は、一部のスプレッドシートアプリケーションと一部の計算機で実行できます。多くの統計ソフトウェア パッケージは、さまざまな種類のノンパラメトリック回帰とロバスト回帰を実行できますが、これらの方法は標準化されていません。ソフトウェア パッケージによって実装される方法は異なり、同じ名前の方法がパッケージによって異なる方法で実装されることもあります。調査分析や神経画像処理などの分野で使用するために、専用の回帰ソフトウェアが開発されています。
参照
参考文献
- ^ 必要条件分析
- ^ David A. Freedman (2009年4月27日)。統計モデル:理論と実践。ケンブリッジ大学出版局。ISBN 978-1-139-47731-4。
- ^ R. デニス クック、サンフォード ワイスバーグ『回帰分析における批判と影響分析』、社会学的方法論、第 13 巻 (1982)、313 ~ 361 ページ
- ^ AM ルジャンドル。 Nouvelles méthodes pour la détermination des orbites des comètes、Firmin Didot、パリ、1805。「Sur la Méthode des moindres quarrés」は付録として掲載されています。
- ^ ab 第 1 章: Angrist, JD, & Pischke, JS (2008)。Mostly Harmless Econometrics: An Empiricist's Companion。プリンストン大学出版局。
- ^ CF ガウス。理論の組み合わせは観察上の誤りを最小限に抑えます。 (1821/1823)
- ^ Mogull, Robert G. (2004). Second-Semester Applied Statistics . Kendall/Hunt Publishing Company. p. 59. ISBN 978-0-7575-1181-3。
- ^ ガルトン、フランシス (1989). 「親族関係と相関関係 (1989年再版)」.統計科学. 4 (2): 80–86. doi : 10.1214/ss/1177012581 . JSTOR 2245330.
- ^ フランシス・ゴルトン。「遺伝の典型的な法則」、ネイチャー 15 (1877)、492–495、512–514、532–533。(ゴルトンは、エンドウ豆の大きさについて論じたこの論文で「復帰」という用語を使用している。)
- ^ フランシス・ゴルトン。大統領演説、H 部、人類学。(1885) (ゴルトンは人間の身長について論じたこの論文で「回帰」という用語を使用しています。)
- ^ Yule, G. Udny (1897). 「相関理論について」.王立統計学会誌. 60 (4): 812–54. doi :10.2307/2979746. JSTOR 2979746.
- ^ ピアソン、カール、ユール、GU、ブランチャード、ノーマン、リー、アリス( 1903)。「祖先遺伝の法則」。バイオメトリカ。2 (2):211–236。doi :10.1093/biomet/2.2.211。JSTOR 2331683 。
- ^ Fisher, RA (1922). 「回帰式の適合度と回帰係数の分布」.英国王立統計学会誌. 85 (4): 597–612. doi :10.2307/2341124. JSTOR 2341124. PMC 1084801 .
- ^ ロナルド・A・フィッシャー(1954年)。研究者のための統計手法(第12版)。エディンバラ:オリバー・アンド・ボイド。ISBN 978-0-05-002170-5。
- ^ Aldrich, John (2005). 「Fisherと回帰」(PDF) .統計科学. 20 (4): 401–417. doi : 10.1214/088342305000000331 . JSTOR 20061201.
- ^ ロドニー・ラムチャラン。回帰分析:経済学者はなぜそれに執着するのか? 2006 年 3 月。2011 年 12 月 3 日にアクセス。
- ^ フォザリンガム、A. スチュワート、ブランズドン、クリス、チャールトン、マーティン (2002)。地理加重回帰分析: 空間的に変化する関係の分析(再版)。チチェスター、イギリス: ジョン ワイリー。ISBN 978-0-471-49616-8。
- ^ Fotheringham, AS; Wong, DWS (1991年1月1日). 「多変量統計分析における修正可能な面積単位問題」.環境と計画A. 23 ( 7): 1025–1044. doi :10.1068/a231025. S2CID 153979055.
- ^ Steel, RGD、および Torrie, JH、「生物学を専門とする統計の原理と手順」、McGraw Hill、1960年、288ページ。
- ^ Rouaud, Mathieu (2013). 確率、統計、推定(PDF) . p. 60.
- ^ Chiang, CL, (2003)統計的分析方法、World Scientific。ISBN 981-238-310-7 - 274ページ、セクション 9.7.4「内挿と外挿」
- ^ Good, PI ; Hardin, JW (2009).統計におけるよくある間違い(およびその回避方法)(第3版). ホーボーケン、ニュージャージー:ワイリー。p. 211。ISBN 978-0-470-45798-6。
- ^ Tofallis, C. (2009). 「最小二乗パーセンテージ回帰」. Journal of Modern Applied Statistical Methods . 7 : 526–534. doi :10.2139/ssrn.1406472. hdl : 2299/965 . SSRN 1406472.
- ^ YangJing Long (2009). 「回帰問題に対するメトリック学習による人間の年齢推定」(PDF)。Proc. International Conference on Computer Analysis of Images and Patterns : 74–82。 2010-01-08 のオリジナル(PDF)からアーカイブ。
さらに読む
- ウィリアム・H・クラスカルとジュディス・M・タヌール編(1978年)「線形仮説」国際統計百科事典、フリープレス、第1巻、
- エヴァン・J・ウィリアムズ、「I. 回帰」、pp.523-41。
- Julian C. Stanley、「II. 分散分析」、pp. 541-554。
- Lindley, DV (1987)「回帰分析と相関分析」『New Palgrave: A Dictionary of Economics』第4巻、120~123ページ。
- バークス、デイビッド、ドッジ、Y. 、回帰分析の代替法。ISBN 0-471-56881-3
- Chatfield, C. (1993)「区間予測の計算」『ビジネスと経済統計ジャーナル』 11 . pp. 121–135。
- Draper, NR; Smith, H. (1998).応用回帰分析(第 3 版). John Wiley. ISBN 978-0-471-17082-2。
- Fox , J. (1997). 応用回帰分析、線形モデルおよび関連手法。Sage
- Hardle, W.,応用ノンパラメトリック回帰(1990)、ISBN 0-521-42950-1
- ミード、ナイジェル、イスラム、トウィドゥル( 1995)。「成長曲線予測の予測区間」。予測ジャーナル。14 (5): 413–430。doi :10.1002/for.3980140502。
- A. Sen、M. Srivastava、「回帰分析 — 理論、方法、およびアプリケーション」、Springer-Verlag、ベルリン、2011年(第4版)。
- T. Strutz:データフィッティングと不確実性(加重最小二乗法とその先への実践的な入門) Vieweg+Teubner、ISBN 978-3-8348-1022-9。
- Stulp、Freek、Olivier Sigaud。「多数の回帰アルゴリズム、1 つの統合モデル: レビュー」。Neural Networks、vol. 69、2015 年 9 月、pp. 60–79。https://doi.org/10.1016/j.neunet.2015.05.005。
- Malakooti, B. (2013)。「複数の目的を持つオペレーションと生産システム」John Wiley & Sons。
- Chicco, Davide; Warrens, Matthijs J.; Jurman, Giuseppe (2021). 「回帰分析評価では、決定係数 R 二乗は SMAPE、MAE、MAPE、MSE、RMSE よりも有益である」。PeerJ Computer Science。7 ( e623 ): e623。doi : 10.7717/ peerj - cs.623。PMC 8279135。PMID 34307865。
