

回帰分析において、最小二乗法とは、残差の二乗和(観測値とモデルによって予測された値との差)を最小化することによって、最適なモデルを決定する手法である。
最小二乗問題は、モデル関数がすべての未知数に関して線形であるかどうかに応じて、線形最小二乗問題(または通常の最小二乗問題)と非線形最小二乗問題の2つのカテゴリに分類されます。線形最小二乗問題は統計的回帰分析で発生し、閉形式の解を持ちます。非線形問題は通常、反復的な改良によって解かれます。各反復において、システムは線形システムで近似されるため、どちらの場合もコアとなる計算は同様です。
多項式最小二乗法は、従属変数の予測値の分散を、独立変数と適合曲線からの偏差の関数として記述します。
観測値が、その自然十分統計量として恒等分布を持つ指数族から得られ、緩やかな条件が満たされている場合(例えば、正規分布、指数分布、ポアソン分布、二項分布の場合)、標準化された最小二乗推定値と最尤推定値は同一になります。[ 1 ]最小二乗法は、モーメント法推定量としても導出できます。
この方法は、18世紀中に起こったいくつかの進歩の集大成であった。[ 2 ]

最小二乗法の最初の明快かつ簡潔な解説は、1805年にルジャンドルによって発表された。 [ 6 ]この手法は、データに線形方程式を当てはめる代数的手順として説明されており、ルジャンドルは地球の形状についてラプラスと同じデータを分析することで、この新しい手法を実証した。ルジャンドルの発表から10年以内に、最小二乗法はフランス、イタリア、プロイセンの天文学と測地学の標準的なツールとして採用され、これは科学的手法の非常に速い受容であった。[ 2 ]
1809年、カール・フリードリヒ・ガウスは天体の軌道を計算する方法を発表した。その著作の中で、彼は1795年から最小二乗法を所有していたと主張した。 [ 7 ]これは当然、ルジャンドルとの優先権争いにつながった。しかし、ガウスの功績は、ルジャンドルを凌駕し、最小二乗法を確率の原理と正規分布に結びつけることに成功した点にある。彼は、有限個の未知のパラメータに依存する観測値の確率密度の数学的形式を指定し、推定誤差を最小化する推定方法を定義するというラプラスのプログラムを完成させた。ガウスは、確率密度と推定方法の両方を変更することで、算術平均が位置パラメータの最良の推定値であることを示した。そして彼は、位置パラメータの推定値として算術平均を得るために、密度はどのような形式であるべきか、またどのような推定方法を用いるべきかという問いを立てることで、問題を逆転させた。この試みの中で、彼は正規分布を発明した。
ガウスの方法の有効性が早くから実証されたのは、新しく発見された小惑星ケレスの将来の位置を予測するために用いられた時だった。1801年1月1日、イタリアの天文学者ジュゼッペ・ピアッツィはケレスを発見し、太陽の眩しさに隠れるまでの40日間、その軌道を追跡することができた。天文学者たちは、これらのデータに基づいて、ケプラーの複雑な非線形惑星運動方程式を解くことなく、太陽の背後から現れた後のケレスの位置を特定しようとした。ハンガリーの天文学者フランツ・クサヴァー・フォン・ザッハがケレスの位置を特定することに成功した唯一の予測は、当時24歳だったガウスが最小二乗法を用いて行ったものだった。
1810年、ラプラスはガウスの研究を読んだ後、中心極限定理を証明し、それを用いて最小二乗法と正規分布の大規模標本による正当化を行った。1822年、ガウスは、回帰分析における最小二乗法は最適であると述べることができた。すなわち、誤差の平均がゼロで、無相関で、正規分布に従い、分散が等しい線形モデルでは、係数の最良の線形不偏推定量は最小二乗推定量である。この結果の拡張版はガウス・マルコフの定理として知られている。
最小二乗分析の考え方は、1808年にアメリカ人のロバート・エイドリアンによって独自に定式化された。次の2世紀にわたり、誤差理論と統計学の研究者たちは、最小二乗法を実装するさまざまな方法を発見した。[ 8 ]
目的は、モデル関数のパラメータを調整してデータセットに最適に適合させることです。単純なデータセットはn個の点(データペア)で構成されます。、i = 1, …, n、ここでは独立変数であり、は観測によって値が求められる従属変数です。モデル関数は次の形式をとります。ここで、m個の調整可能なパラメータがベクトルに保持されている。目標は、データに「最も」適合するモデルのパラメータ値を見つけることです。モデルとデータポイントの適合度は、残差によって測定されます。残差とは、従属変数の観測値とモデルによって予測された値との差として定義されます。

最小二乗法は、残差の二乗和を最小化することによって最適なパラメータ値を見つけます。: [ 9 ]
最も単純なケースでは、そして、最小二乗法の結果は、入力データの算術平均である。
2次元モデルの一例として、直線がある。y切片を次のように表す。そして傾斜はモデル関数は次のように与えられる。このモデルの詳細な例については、線形最小二乗法を参照してください。
データポイントは、複数の独立変数から構成される場合があります。例えば、高さの測定値に平面を当てはめる場合、その平面は、xとzという2つの独立変数の関数となります。最も一般的なケースでは、各データポイントに1つ以上の独立変数と1つ以上の従属変数が存在する可能性があります。
右側は、ランダムな変動を示す残差プロットです。線形モデルであることを示している適切である。は独立した確率変数である。[ 9 ]

残差点が何らかの形状を持ち、ランダムに変動していない場合、線形モデルは適切ではありません。たとえば、右図のように残差プロットが放物線形状をしている場合、放物線モデルは適切ではありません。データにはこれが適切でしょう。放物線モデルの残差は次のように計算できます。[ 9 ]
この回帰式は従属変数の観測誤差のみを考慮している(ただし、代替の最小二乗回帰では両方の変数の誤差を考慮できる)。意味合いの異なる、かなり異なる2つの状況がある。
二乗和の最小値は、勾配をゼロに設定することによって求められます。モデルにはm個のパラメータが含まれているため、 m個の勾配方程式が存在します。 そしてそれ以来勾配方程式は次のようになる
勾配方程式はすべての最小二乗問題に適用されます。それぞれの問題には、モデルとその偏導関数の特定の表現が必要です。[ 11 ]
回帰モデルは、モデルがパラメータの 線形結合で構成されている場合、線形モデルである。 関数は関数である[ 11 ]
賃貸そして、独立変数と従属変数を行列にまとめるそしてそれぞれ、最小二乗法を次のように計算できます。はすべてのデータの集合です。[ 11 ] [ 12 ]
損失関数の勾配は次のとおりです。
損失の勾配をゼロに設定して解くすると、次のようになります。[ 12 ] [ 11 ]
非線形最小二乗問題には、場合によっては閉形式解が存在するが、一般的には存在しない。閉形式解が存在しない場合は、数値アルゴリズムを用いてパラメータの値を求める。目的関数を最小化する。ほとんどのアルゴリズムでは、パラメータの初期値を選択する。次に、パラメータは反復的に改良される。つまり、逐次近似によって値が得られる。 ここで、上付き文字kは反復回数であり、増分のベクトルはこれはシフトベクトルと呼ばれます。一般的に使用されるアルゴリズムでは、各反復において、モデルは の周りの一次テイラー級数展開への近似によって線形化される場合があります。:
ヤコビ行列Jは定数、独立変数、およびパラメータの関数であるため、反復ごとに変化します。残差は次のように与えられます。
二乗和を最小化するために勾配方程式をゼロに設定して解く: これらを整理すると、m個の連立一次方程式、すなわち正規方程式となる。
正規方程式は行列表記で次のように表される。
これらはガウス・ニュートン法の定義式である。
非線形最小二乗問題の解を求める際には、これらの違いを考慮しなければならない。[ 11 ]
物理学から簡単な例を挙げてみましょう。バネはフックの法則に従うはずです。フックの法則とは、バネの伸びyは、バネに加わる力Fに比例するという法則です。 はモデルを構成し、Fは独立変数です。力定数kを推定するために、異なる力でn回の測定を行い、データセットを作成します。ここで、y iは測定されたバネの伸びである。[ 13 ]各実験観測には何らかの誤差が含まれる。したがって、我々は観測結果に対する経験的モデルを特定することができる。
未知のパラメータkを推定するために使用できる方法は数多くあります。データ内のm個の変数のn 個の方程式は、未知数が 1 つとn個の方程式を持つ過剰決定システムを構成するため、最小二乗法を使用してkを推定します。最小化すべき二乗和は[ 11 ]です。
力定数kの最小二乗推定値は次式で与えられる。
力を加えるとバネが伸びると仮定します。最小二乗法で力定数を求めた後、フックの法則から伸びを予測します。
単位重みを用いた最小二乗法の計算、または線形回帰では、j番目のパラメータの分散は、は、通常以下のように推定されます。 ここで、真の誤差分散σ 2は、残差平方和(目的関数) Sの最小値に基づく推定値である縮小カイ二乗統計量に置き換えられます。分母n − mは統計的自由度です。一般化については、有効自由度を参照してください。[ 11 ] Cは共分散行列です 。
パラメータの確率分布が既知であるか、漸近近似が行われている場合には、信頼限界を求めることができます。同様に、残差の確率分布が既知であるか仮定されている場合は、残差に対する統計的検定を実施できます。実験誤差の確率分布が既知であるか仮定されている場合は、従属変数の任意の線形結合の確率分布を導出できます。誤差が正規分布に従うと仮定すると推論は容易であり、その結果、独立変数の値に応じてパラメータ推定値と残差も正規分布に従うことになります。[ 11 ]
実験結果を統計的に検証するためには、実験誤差の性質について仮定を置く必要がある。一般的な仮定は、誤差が正規分布に従うというものである。中心極限定理は、多くの場合、これが良い近似であることを裏付けている。
しかし、誤差が正規分布に従わない場合を考えてみましょう。その場合でも、中心極限定理によれば、標本サイズが十分に大きければ、パラメータ推定値は近似的に正規分布に従うことがしばしば示唆されます。このため、誤差の平均が独立変数に依存しないという重要な性質を考慮すると、回帰分析において誤差項の分布は重要な問題ではありません。具体的には、誤差項が正規分布に従うかどうかは、通常重要ではありません。

一般化最小二乗法の特殊なケースである重み付き最小二乗法は、Ω(残差の相関行列)の非対角要素がすべてゼロの場合に発生します。観測値の分散(共分散行列の対角線に沿ったもの)は依然として不等である可能性があります(異分散性)。簡単に言うと、異分散性とは、値によって異なるこれにより、残差プロットはより大きな値またはより小さな値に向かって「扇状に広がる」効果を生み出します。右側の残差プロットに見られる値。一方、等分散性とは、分散が分散等しい。[ 9 ]
一連の点の平均に関する第一主成分は、データ点に最も近づく直線(最も近い接近距離の二乗、つまり直線に垂直な距離で測定)によって表すことができます。対照的に、線形最小二乗法は、距離を最小化しようとします。方向のみ。したがって、両者は類似した誤差指標を使用するものの、線形最小二乗法はデータの1つの次元を優先的に扱う方法であるのに対し、PCAはすべての次元を均等に扱います。
著名な統計学者サラ・ファン・デ・ゲールは、経験過程理論とヴァプニック・チェルヴォネンキス次元を用いて、最小二乗推定量が二乗可積分関数の空間上の尺度として解釈できることを証明した。[ 15 ]
状況によっては、最小二乗解の正則化バージョンの方が好ましい場合がある。ティホノフ正則化(またはリッジ回帰)は、次の制約を追加する。二乗パラメータベクトルのノルムは、最小二乗定式化において与えられた値を超えないため、制約付き最小化問題となる。これは、目的関数が残差平方和にペナルティ項を加えたものである制約なし最小化問題と同等である。そしては調整パラメータです(これは制約付き最小化問題のラグランジュ形式です)。 [ 16 ]
ベイズ統計の観点から言えば、これはパラメータベクトルに対して平均ゼロの正規分布事前分布を設定することに相当する。
最小二乗法の代替となる正則化バージョンはLasso(最小絶対収縮選択演算子)であり、これは次の制約を使用する。パラメータベクトルのL 1ノルムは、与えられた値以下である。[ 17 ] [ 18 ] [ 19 ](上記と同様にラグランジュ乗数法を用いて、これが最小二乗ペナルティの制約なし最小化と同等であることを示すことができる。(追記)ベイズ的文脈では、これはパラメータベクトルに平均ゼロのラプラス事前分布を置くことと同等である。 [ 20 ]最適化問題は、二次計画法やより一般的な凸最適化手法、最小角度回帰アルゴリズムなどの特定のアルゴリズムを使用して解くことができる。
Lassoとリッジ回帰の主な違いの1つは、リッジ回帰ではペナルティが増加すると、すべてのパラメータがゼロにならないまま減少するのに対し、Lassoではペナルティが増加すると、ますます多くのパラメータがゼロに近づくことです。これは、パラメータをゼロに近づけることで回帰から特徴が除外されるため、リッジ回帰に対するLassoの利点です。したがって、Lassoはより関連性の高い特徴を自動的に選択し、他の特徴を破棄しますが、リッジ回帰はどの特徴も完全に破棄することはありません。いくつかの特徴選択手法は、サンプルをブートストラップするBolasso [ 21 ] や、異なる値に対応する回帰係数を分析するFeaLectなど、LASSOに基づいて開発されています。すべての特徴を評価する。[ 22 ]
L 1正則化定式化は、より多くのパラメータがゼロである解を好む傾向があるため、いくつかの状況で有用であり、より少ない変数に依存する解が得られます。[ 17 ]このため、Lasso とその変種は圧縮センシングの分野で基本となっています。このアプローチの拡張が、エラスティックネット正則化です。
{{cite book}}: CS1 maint: location (リンク) CS1 maint: location missing publisher (リンク) CS1 maint: multiple names: authors list (リンク) CS1 maint: numeric names: authors list (リンク)