統計学において、線形回帰とは、スカラー応答(従属変数)と1つ以上の説明変数(回帰変数または独立変数)との関係を推定するモデルです。説明変数がちょうど1つだけのモデルは単純線形回帰、説明変数が2つ以上あるモデルは重回帰線形回帰と呼ばれます。[ 1 ]この用語は、単一の従属変数ではなく、複数の相関のある従属変数を予測する多変量線形回帰とは異なります。 [ 2 ]
線形回帰では、関係は線形予測関数を用いてモデル化され、その未知のモデルパラメータはデータから推定されます。最も一般的には、説明変数(または予測変数)の値が与えられた場合の応答の条件付き平均は、それらの値のアフィン関数であると仮定されます。あまり一般的ではありませんが、条件付き中央値やその他の分位数が使用されます。回帰分析のすべての形式と同様に、線形回帰は、予測変数の値が与えられた場合の応答の条件付き確率分布に焦点を当てており、多変量解析の領域であるこれらの変数すべての同時確率分布には焦点を当てていません。
線形回帰も機械学習アルゴリズムの一種であり、より具体的には教師ありアルゴリズムであり、ラベル付きデータセットから学習し、データポイントを新しいデータセットの予測に使用できる最適な線形関数にマッピングします。[ 3 ]
線形回帰は、厳密に研究され、実用的な用途で広く使用された最初のタイプの回帰分析でした。[ 4 ]これは、未知のパラメータに線形に依存するモデルは、パラメータに非線形に関連するモデルよりも適合しやすく、結果として得られる推定量の統計的特性を決定しやすいためです。
線形回帰には多くの実用的な用途がある。ほとんどの応用例は、以下の2つの大まかなカテゴリのいずれかに分類される。
Linear regression models are often fitted using the least squares approach, but they may also be fitted in other ways, such as by minimizing the "lack of fit" in some other norm (as with least absolute deviations regression), or by minimizing a penalized version of the least squares cost function as in ridge regression (L2-norm penalty) and lasso (L1-norm penalty). Use of the Mean Squared Error (MSE) as the cost on a dataset that has many large outliers, can result in a model that fits the outliers more than the true data due to the higher importance assigned by MSE to large errors. So, cost functions that are robust to outliers should be used if the dataset has many large outliers. Conversely, the least squares approach can be used to fit models that are not linear models. Thus, although the terms "least squares" and "linear model" are closely linked, they are not synonymous.

Given a data setn 個の統計単位からなる線形回帰モデルでは、従属変数yと回帰変数ベクトルxの関係が線形であると仮定します。この関係は、撹乱項または誤差変数εによってモデル化されます。εは、従属変数と回帰変数間の線形関係に余分な「ノイズ」を加える、観測されないランダム変数です。したがって、モデルは次の形式をとります。ここでTは転置を表すので、x i T β はベクトルx iとβの内積である。
これらのn個の方程式は、多くの場合、積み重ねられ、行列表記で次のように書かれます。
どこ
与えられたデータセットに線形モデルを当てはめるには、通常、回帰係数を推定する必要がある。誤差項が最小化される。例えば、二乗誤差の合計を用いるのが一般的である。の尺度として最小化のため。
小さなボールを空中に投げ上げ、様々な時刻t iにおける上昇高さh iを測定する状況を考えてみましょう。物理学によれば、空気抵抗を無視すれば、その関係は次のようにモデル化できます。
ここで、β 1 はボールの初速度を決定し、β 2は標準重力に比例し、ε i は測定誤差によるものです。線形回帰を用いて、測定データからβ 1とβ 2の値を推定できます。このモデルは時間変数に関しては非線形ですが、パラメータβ 1とβ 2に関しては線形です。回帰変数x i = ( x i 1 , x i 2 ) = ( t i , t i 2 )を取ると、モデルは標準形になります。
線形回帰モデルのパラメータを通常の最小二乗法などの標準的な推定手法で推定する場合、有限サンプルで不偏推定量を得るために、予測変数、応答変数、およびそれらの関係についていくつかの仮定を置く必要があります。これらの仮定をそれぞれ緩和(より弱い形式に縮小)したり、場合によっては完全に排除したりできる多数の拡張が開発されています。一般に、これらの拡張では、同等の精度のモデルを生成するために、より多くのデータまたはモデリングの仮定が必要になります[ 5 ]。

適合させた線形回帰モデルを使用すると、モデル内の他のすべての予測変数が「固定」されている場合に、単一の予測変数x jと応答変数yの間の関係を特定できます。具体的には、 β jの解釈は、他の共変量が固定されている場合にx jが 1 単位変化したときのyの期待される変化、つまり、x jに関するyの偏微分の期待値です。これは、x jがyに及ぼす固有の効果と呼ばれることもあります。これに対し、x jがyに及ぼす限界効果は、相関係数またはx jとyのみを関連付ける単純な線形回帰モデルを使用して評価できます。この効果は、x jに関するyの全微分です。
回帰分析の結果を解釈する際には注意が必要です。回帰変数の中には、わずかな変化を許容しないもの(ダミー変数や切片項など)もあれば、固定できないもの(導入部の例を思い出してください。t i を固定したまま t i 2 の値を変更することは不可能です)もあるからです。
限界効果が大きい場合でも、固有効果がほぼゼロになる可能性はあります。これは、他の共変量がx jに含まれるすべての情報を捉えているため、その変数がモデルに含まれると、yの変動に対するx jの寄与がなくなることを示唆している可能性があります。逆に、 x jの固有効果は大きいのに、限界効果がほぼゼロになる場合もあります。これは、他の共変量がyの変動の大部分を説明しているものの、主にx jによって捉えられるものと相補的な方法で変動を説明している場合に起こります。この場合、他の変数をモデルに含めると、yの変動のうちx jと無関係な部分が減り、それによってx jとの見かけ上の関係が強まります。
「固定する」という表現の意味は、予測変数の値がどのように決定されるかによって異なる場合がある。実験者が研究計画に基づいて予測変数の値を直接設定する場合、関心のある比較は、実験者によって予測変数が「固定」された単位間の比較に文字通り対応する可能性がある。一方、「固定する」という表現は、データ分析の文脈で行われる選択を指す場合もある。この場合、特定の予測変数に対して共通の値を持つデータのサブセットに注目を限定することで、「変数を固定する」ことになる。観察研究において使用できる「固定する」の解釈は、この方法のみである。
複数の相互に関連する要素が応答変数に影響を与える複雑なシステムを研究する場合、「固有の効果」という概念は魅力的です。場合によっては、予測変数の値に関連する介入の因果効果として文字通り解釈できます。しかし、予測変数が互いに相関していて、研究デザインに従って割り当てられていない場合、多重回帰分析では予測変数と応答変数の関係を明確にできないケースが多いと指摘されています。[ 6 ]
線形回帰には数多くの拡張版が開発されており、それによって基本モデルの前提条件の一部または全部を緩和することが可能になっている。

単一のスカラー予測変数xと単一のスカラー応答変数yの最も単純なケースは、単純線形回帰として知られています。複数の、またはベクトル値の予測変数 (大文字のXで表記)への拡張は、多重線形回帰、または多変数線形回帰(多変量線形回帰と混同しないように) として知られています。[ 7 ]
重回帰分析は、独立変数が複数ある場合の単純回帰分析の一般化であり、従属変数が1つに限定された一般線形モデルの特殊なケースです。重回帰分析の基本モデルは次のとおりです。
各観測値について。
上記の式では、 1つの従属変数のn個の観測値とp個の独立変数を考慮します。したがって、Y iは従属変数のi番目の観測値、 X ijはj番目の独立変数のi番目の観測値であり、j = 1, 2, ..., pです。β jの値は推定されるパラメータを表し、ε iはi番目の独立同分布正規誤差です。
より一般的な多変量線形回帰では、同じ説明変数セットを共有し、したがって互いに同時に推定されるm > 1個の従属変数それぞれに対して、上記のような形式の式が1つ存在します。
i = 1, ..., nとインデックス付けされたすべての観測値と、 j = 1, ..., mとインデックス付けされたすべての従属変数について。
実際の回帰モデルのほぼすべては複数の予測変数を含み、線形回帰の基本的な説明はしばしば重回帰モデルの観点から表現されます。ただし、これらの場合、応答変数yは依然としてスカラーであることに注意してください。別の用語である多変量線形回帰は、 yがベクトルである場合、つまり一般線形回帰と同じ場合を指します。
一般線形モデルは、応答変数が(各観測値に対して)スカラーではなくベクトルy iである場合の状況を考慮します。条件付き線形性は依然として仮定されており、古典的な線形回帰モデルのベクトルβの代わりに行列Bが用いられます。通常の最小二乗法(OLS) および一般化最小二乗法(GLS) の多変量版が開発されています。「一般線形モデル」は「多変量線形モデル」とも呼ばれます。これらは多変数線形モデル (「多重線形モデル」とも呼ばれる) とは異なります。
異分散性、すなわち異なる応答変数の誤差が異なる分散を持つ場合を許容する様々なモデルが作成されてきました。例えば、重み付き最小二乗法は、応答変数の誤差分散が異なり、場合によっては相関のある誤差を持つ場合に線形回帰モデルを推定する方法です。(重み付き線形最小二乗法、および一般化最小二乗法も参照してください。)異分散性に一貫性のある標準誤差は、相関はないものの異分散性を持つ可能性のある誤差に使用するための改良された方法です。
一般化線形モデル(GLM)は、境界値または離散値を持つ応答変数をモデル化するためのフレームワークです。これは、例えば次のような場合に使用されます。
一般化線形モデルでは、応答変数の平均と予測変数を関連付ける任意のリンク関数gを許容します。リンク関数は応答の分布と関連していることが多く、特に通常は、線形予測子の範囲と応答変数の範囲。
GLMの一般的な例としては、以下のようなものがあります。
単一インデックスモデルでは、xとyの関係にある程度の非線形性を許容しつつ、古典的な線形回帰モデルと同様に、線形予測子β ′ xの中心的な役割を維持します。特定の条件下では、単一インデックスモデルからのデータに単純に OLS を適用するだけで、比例定数を除いてβ を一貫して推定できます。[ 8 ]
階層線形モデル(または多段階回帰)は、データを回帰の階層構造に整理します。例えば、AをBに回帰させ、BをCに回帰させるといった具合です。これは、教育統計のように、対象となる変数が自然な階層構造を持つ場合によく用いられます。教育統計では、生徒は教室に、教室は学校に、学校は学区などの行政単位にそれぞれ入れ子になっています。応答変数は、テストの点数など生徒の学業成績を示す指標であり、教室、学校、学区の各レベルで異なる共変量が収集されます。
誤差変数モデル(または「測定誤差モデル」)は、従来の線形回帰モデルを拡張し、予測変数Xに誤差が生じることを許容します。この誤差により、βの標準的な推定値は偏りを持つようになります。一般的に、この偏りは減衰という形で現れ、効果がゼロに近づくように偏ります。
多重線形回帰モデルでは
パラメータ予測変数個々の効果を表すこれは、応答変数の期待される変化として解釈される。いつ他の予測変数を一定に保ったまま、1単位増加する。他の予測変数と強い相関関係にある場合、他の変数を一定に保ったまま、1単位増加させることができます。この場合、これはありそうもない条件に基づいているため問題となり、単独で評価することはできない。
例えば、予測変数のグループについて、グループ効果は、それらのパラメータの線形結合として定義される。
どこは、以下の条件を満たす重みベクトルである。制約により、正規化グループ効果とも呼ばれます。グループ効果は、期待される変化として解釈される。グループ内の変数金額だけ変更それぞれ、他の変数(グループに含まれていない)を一定に保った状態で同時に。これは、変数の個々の効果を変数のグループに一般化するものであり、) もしすると、グループ効果は個人効果に縮小し、() もしそしてのためにすると、グループ効果も個人効果に還元される。グループ効果の根底にある同時変化が意味を持つと言われている変数可能性が高い。
グループ効果は、線形回帰モデルにおいて、相関性の高い予測変数の集合的な影響を研究する手段を提供する。このような変数の個々の効果は、そのパラメータの解釈が適切ではないため、明確に定義されていない。さらに、サンプルサイズが大きくない場合、多重共線性の問題により、最小二乗回帰によってどのパラメータも正確に推定することはできない。しかしながら、解釈が適切で、最小二乗回帰によって正確に推定できる意味のあるグループ効果が存在する。これらの意味のあるグループ効果を特定する簡単な方法は、相関性の高い変数をすべて正の相関(APC)で配置し、その配置の下では、これらの変数間のペアワイズ相関がすべて正であり、すべての相関を標準化することである。モデル内の予測変数はすべて平均がゼロで長さが 1 になるようにします。これを説明するために、は、APC配置における相関性の高い変数群であり、グループ外の予測変数とは相関性が低い。中心となるそして標準化されるすると、標準化線形回帰モデルは次のようになります。
パラメータオリジナルモデルには、は、の単純な関数です標準化モデルでは、変数の標準化は相関関係を変えないため、APC配置における強く相関する変数群であり、標準化モデル内の他の予測変数とは強く相関していない。は
そしてその最小分散不偏線形推定量は
どこは、の最小二乗推定量である。特に、グループの平均効果は標準化変数は
これは、期待される変化として解釈されます。すべて強い相関関係にあるグループでは、グループ外の変数を一定に保った状態で、同時に単位の 1/2 だけ増加します。強い正の相関があり、標準化された単位の場合、グループ内の変数はほぼ等しいので、同時に同様の量だけ増加する可能性が高くなります。したがって、平均グループ効果はこれは意味のある効果である。最小分散不偏線形推定量によって正確に推定することができる。たとえ個々に正確に推定できる。
すべてのグループ効果が意味のあるものであるとは限らず、正確に推定できるとは限りません。例えば、重み付けされた特別なグループ効果ですそしてのためにしかし、それは正確に推定することはできないまた、意味のある効果でもありません。一般的に、標準化モデルにおける APC 配置の相関性の高い予測変数、重みベクトルを持つグループ効果単体の中心またはその近くにある()は意味があり、最小分散不偏線形推定量によって正確に推定できます。中心から遠く離れた重みベクトルを持つ効果は意味がありません。なぜなら、そのような重みベクトルは、APC配置における標準化変数の強い正の相関に反する変数の同時変化を表しているからです。したがって、それらは起こりそうにありません。これらの効果は正確に推定することもできません。
グループ効果の応用には、(1) 応答変数に対する意味のあるグループ効果の推定と推論、(2) の「グループ有意性」の検定が含まれます。変数をテストによって対(3)最小二乗推定モデルによる予測が正確である予測変数空間の領域を特徴づける。
元の変数のグループ効果標準化変数のグループ効果に定数を掛けたものとして表現できる後者が意味を持つ場合に前者も意味を持つ。したがって、標準化された変数のグループ効果の意味を持つことによって、元の変数の意味を持つグループ効果を見つけることができる。[ 9 ]
デンプスター・シェーファー理論、特に線形信念関数においては、線形回帰モデルは部分的に掃引された行列として表現することができ、これは観測値やその他の仮定された正規分布および状態方程式を表す同様の行列と組み合わせることができる。掃引された行列または掃引されていない行列の組み合わせは、線形回帰モデルを推定するための代替手段を提供する。
線形回帰におけるパラメータ推定と推論のために、数多くの手法が開発されてきた。これらの手法は、アルゴリズムの計算の容易さ、閉形式解の存在、裾の重い分布に対するロバスト性、そして一貫性や漸近効率といった望ましい統計的特性を検証するために必要な理論的仮定において異なっている。
線形回帰におけるより一般的な推定手法のいくつかを以下にまとめる。

独立変数がモデルのパラメータはすると、モデルの予測は次のようになります。
もし拡張されるそれからパラメータと独立ベクトルの内積になる、つまり
最小二乗法の設定では、最適パラメータベクトルは、平均二乗損失の合計を最小化するように定義されます。
独立変数と従属変数を行列に表すそしてそれぞれ、損失関数は次のように書き換えることができる。
損失関数は凸関数であるため、最適解は勾配がゼロの点に存在する。損失関数の勾配は(分母レイアウト規則を用いて)次のようになる。
勾配をゼロに設定すると、最適なパラメータが得られます。
注:得られた解は確かに局所最小値である可能性があり、ヘッセ行列を得るためにもう一度微分して、それが正定値であることを示す必要があります。これはガウス・マルコフの定理によって得られます。
線形最小二乗法には主に以下のものが含まれます。
誤差項の分布が特定のパラメトリック確率分布族ƒ θに属することがわかっている場合、最尤推定を実行できます。[ 12 ] f θ が平均ゼロ、分散 θの正規分布である場合、得られる推定値は OLS 推定値と同一になります。 ε が既知の共分散行列を持つ多変量正規分布に従う場合、GLS 推定値は最尤推定値になります。各データポイントを で表します。そして回帰パラメータは、およびすべてのデータのセットそしてコスト関数は。
以下に示すように、最小化する最適なパラメータは同じです。最大尤度も達成する。[ 13 ]ここでの仮定は従属変数がはガウス分布に従う確率変数であり、標準偏差は固定され、平均は の線形結合である。:
さて、この尤度関数を最大化するパラメータを探す必要があります。対数関数は厳密に増加するので、この関数を最大化する代わりに、その対数を最大化して最適なパラメータを見つけることもできます。[ 13 ]
したがって、最適なパラメータは次のようになります。[ 13 ]
このようにして、最大化するパラメータは最小化するものと同じこれは、線形回帰において、最小二乗法の結果が最尤推定法の結果と同じであることを意味する。[ 13 ]
リッジ回帰[ 14 ] [ 15 ] [ 16 ]や、ラッソ回帰[ 17 ]などのペナルティ付き推定の他の形式は、推定値の変動を減らすために、βの推定に意図的にバイアスを導入します。結果として得られる推定値は、特に多重共線性が存在する場合や過学習が問題となる場合、一般的に OLS 推定値よりも平均二乗誤差が低くなります。これらは、まだ観測されていない予測変数xの値に対して応答変数yの値を予測することが目的の場合に一般的に使用されます。バイアスを考慮するのが難しいため、推論が目的の場合はこれらの方法はあまり使用されません。
最小絶対偏差(LAD) 回帰は、OLS よりも外れ値の存在に対する感度が低いという点で、ロバストな推定手法です (ただし、外れ値が存在しない場合は OLS よりも効率が劣ります)。これは、 εのラプラス分布モデルの下での最尤推定と同等です。[ 18 ]
誤差項が回帰変数と独立していると仮定すると、すると、最適な推定量は2段階最尤推定法となり、最初の段階では誤差項の分布をノンパラメトリックに推定する。[ 19 ]

線形回帰は、生物学、行動科学、社会科学において、変数間の関係性を記述するために広く用いられている。これらの分野において、最も重要な分析ツールの1つとして位置づけられている。
トレンドラインは、他の要素を考慮した後の時系列データの長期的な動き、つまりトレンドを表します。特定のデータセット(例えば、GDP、原油価格、株価など)が一定期間にわたって増加したか減少したかを示します。トレンドラインは、データポイントの集合を目視で描くこともできますが、より正確には、線形回帰などの統計的手法を用いてその位置と傾きを計算します。トレンドラインは通常直線ですが、曲線の度合いに応じて、より高次の多項式を用いる場合もあります。
トレンドラインは、ビジネス分析において、データの経時的な変化を示すために用いられることがあります。その利点は、シンプルであることです。トレンドラインは、特定の行動やイベント(トレーニングや広告キャンペーンなど)が、ある時点での観測された変化を引き起こしたと主張する際によく用いられます。これはシンプルな手法であり、対照群、実験計画、高度な分析手法を必要としません。しかし、他の潜在的な変化がデータに影響を与える可能性がある場合、科学的な妥当性に欠けるという欠点があります。
喫煙と死亡率および罹患率との関連性を示す初期の証拠は、回帰分析を用いた観察研究から得られた。観察データを分析する際に偽相関を減らすため、研究者は通常、主要な関心変数に加えて、回帰モデルに複数の変数を含める。例えば、喫煙が主要な関心独立変数であり、従属変数が年単位で測定された寿命である回帰モデルでは、喫煙が寿命に及ぼす影響が他の社会経済的要因によるものではないことを確認するために、教育や収入を追加の独立変数として含めることがある。しかし、経験的分析において考えられるすべての交絡変数を含めることは決して不可能である。例えば、ある仮説上の遺伝子が死亡率を上昇させると同時に、喫煙量を増加させる可能性もある。このため、ランダム化比較試験は、観察データの回帰分析で得られるよりも、因果関係のより説得力のある証拠を生み出すことができる場合が多い。対照実験が実施できない場合、操作変数回帰などの回帰分析の変種を用いて、観察データから因果関係を推定する試みが行われることがある。
資本資産価格モデル(CAPM)は、投資のシステマティックリスクを分析・定量化するために、線形回帰とベータ値の概念を用います。これは、投資収益率とすべてのリスク資産の収益率の関係を示す線形回帰モデルのベータ係数から直接導き出されるものです。
線形回帰は経済学において最もよく用いられる実証的手法である。例えば、消費支出[ 25 ] 、固定投資支出、在庫投資、国の輸出品の購入[ 26 ]、輸入支出[ 26 ]、流動資産保有需要[ 27 ] 、 労働需要[ 28 ]、労働供給[ 28 ]の予測に用いられる。
線形回帰は、土地利用[ 29 ] 、感染症[ 30 ]、大気汚染[ 31 ]など、環境科学の幅広い分野で応用されています。例えば、線形回帰は自動車汚染の変化の影響を予測するために使用できます[32]。感染症におけるこの応用の注目すべき例の1つは、 COVID-19パンデミックの初期に強調されたカーブを平坦化する戦略です。この戦略では、公衆衛生当局は、感染者に関するまばらなデータと、COVID-19の蔓延を特徴付けるための高度な疾病伝播モデルを扱いました[ 33 ] 。
線形回帰は、建物の居住者の特性を導き出すために、建築科学の現場調査でよく使用されます。温熱快適性の現場調査では、建築科学者は通常、居住者に温熱感覚投票(-3(寒いと感じる)から0(中立)から+3(暑いと感じる)までの範囲)を尋ね、居住者の周囲の温度データを測定します。温熱感覚投票と室内温度の間の線形回帰に基づいて、温熱感覚投票をゼロに設定することで、中立または快適な温度を計算できます。ただし、回帰の方向、つまり温熱感覚投票(y軸)を室内温度(x軸)に対して回帰させるか、その逆、つまり室内温度(y軸)を温熱感覚投票(x軸)に対して回帰させるかについて議論があります。[ 34 ]
線形回帰は、機械学習として知られる人工知能のサブ分野で重要な役割を果たしています。線形回帰アルゴリズムは、その比較的単純さとよく知られた特性により、基本的な教師あり機械学習アルゴリズムの1つです。 [ 35 ]
アイザック・ニュートンは、1700年の春分点に関する研究で「今日では線形回帰分析として知られるある手法」を発明したとされ、通常の最小二乗法の2つの正規方程式のうち最初のものを書き留めた。[ 36 ] [ 37 ]最小二乗線形回帰は、一連の点に対する良好な大まかな線形近似を見つける手段として、ルジャンドル(1805年)とガウス(1809年)によって惑星運動の予測に実行された。ケトレは、この手順を広く知らしめ、社会科学で広く使用したことに貢献した。[ 38 ]
単純回帰方程式の右辺には切片と傾き係数を持つ説明変数があります。重回帰方程式の右辺には、それぞれ独自の傾き係数を持つ変数があります。
回帰分析... は、おそらく約 200 年前に遡る数学統計学の最も古いトピックの 1 つです。線形回帰の最も初期の形式は最小二乗法であり、1805 年にルジャンドルによって、1809 年にガウスによって発表されました... ルジャンドルとガウスは両方とも、天体観測から太陽の周りの天体の軌道を決定する問題にこの方法を適用しました。