単一の説明変数を持つ線形回帰モデル
マクロ経済学 における オークンの法則 は、単純な線形回帰の一例です。ここでは、従属変数 (GDP 成長率) は失業率の変化と線形関係にあると想定されます。
統計学 において 、 単純線型回帰 ( SLR )は、 単一の 説明変数を持つ 線型回帰 モデルである。 [1] [2] [3] [4] [5] つまり、 1つの独立変数と1つの従属変数 (慣例的には、 直交座標系の x 座標と y 座標 )を持つ2次元のサンプルポイントに関係し、独立変数の関数として従属変数の値を可能な限り正確に予測する線型関数(垂直でない 直線 )を求める。形容詞「 単純」 は、結果変数が単一の予測変数に関連しているという事実を指す。
通常の最小二乗 法 (OLS) を使用する という追加の規定を設けるのが一般的です。各予測値の精度は、その 残差 の二乗(データ セットのポイントと近似線の間の垂直距離) によって測定され、目標はこれらの二乗偏差の合計をできるだけ小さくすることです。この場合、近似線の傾きは、これらの変数の標準偏差の比率で補正された y と x の 相関 に等しくなります。近似線の切片は、線がデータ ポイントの
質量の中心 ( x 、 y ) を通過するようになります。
モデル 関数
を考える
y
=
α
+
β
x
,
{\displaystyle y=\alpha +\beta x,}
これは傾きβ 、 y 切片 α の直線を描きます 。一般に、このような関係は、独立変数と従属変数の値のほとんどが観測されていない集団に対しては正確には当てはまりません。上記の式からの観測されていない偏差を 誤差と呼びます。n 個の データ ペア を観測し、それらを {( x i , y i ), i = 1, ..., n } と呼ぶとします。この誤差項 ε i を含むy i と x i の間の基本的な関係は、次のように
記述できます。
y
i
=
α
+
β
x
i
+
ε
i
.
{\displaystyle y_{i}=\alpha +\beta x_{i}+\varepsilon _{i}.}
真の(しかし観測されていない)基礎パラメータ α および β とデータ ポイント間のこの関係は、線形回帰モデルと呼ばれます。
目標は、 データ ポイントに対してある意味で「最適な」適合を提供する パラメータ α と β の推定値とを見つけることです。導入で述べたように、この記事では「最適な」適合は最小二乗 法で理解されます。つまり、 残差の二乗和 ( 誤差と残差 も参照) (従属変数 y の実際の値と予測値の差) を最小化する線です。各残差は、 任意 の候補パラメータ値とに対して、 次のように与えられます 。
α
^
{\displaystyle {\widehat {\alpha }}}
β
^
{\displaystyle {\widehat {\beta }}}
ε
^
i
{\displaystyle {\widehat {\varepsilon }}_{i}}
α
{\displaystyle \alpha }
β
{\displaystyle \beta }
ε
^
i
=
y
i
−
α
−
β
x
i
.
{\displaystyle {\widehat {\varepsilon }}_{i}=y_{i}-\alpha -\beta x_{i}.}
言い換えれば、 次 の 最小化問題 を解きます。
α
^
{\displaystyle {\widehat {\alpha }}}
β
^
{\displaystyle {\widehat {\beta }}}
(
α
^
,
β
^
)
=
argmin
(
Q
(
α
,
β
)
)
,
{\displaystyle ({\hat {\alpha }},\,{\hat {\beta }})=\operatorname {argmin} \left(Q(\alpha ,\beta )\right),}
ここで 目的関数 Qは 次のようになります。
Q
(
α
,
β
)
=
∑
i
=
1
n
ε
^
i
2
=
∑
i
=
1
n
(
y
i
−
α
−
β
x
i
)
2
.
{\displaystyle Q(\alpha ,\beta )=\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}=\sum _{i=1}^{n}(y_{i}-\alpha -\beta x_{i})^{2}\ .}
を展開して2次式を得ることで 、 関数の引数を最小化する値を導き出すことができ、次のように表記される : [ 6]
α
{\displaystyle \alpha }
β
,
{\displaystyle \beta ,}
α
^
{\displaystyle {\widehat {\alpha }}}
β
^
{\displaystyle {\widehat {\beta }}}
α
^
=
y
¯
−
(
β
^
x
¯
)
,
β
^
=
∑
i
=
1
n
(
x
i
−
x
¯
)
(
y
i
−
y
¯
)
∑
i
=
1
n
(
x
i
−
x
¯
)
2
=
∑
i
=
1
n
Δ
x
i
Δ
y
i
∑
i
=
1
n
Δ
x
i
2
{\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\bar {y}}-({\widehat {\beta }}\,{\bar {x}}),\\[5pt]{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}={\frac {\sum _{i=1}^{n}\Delta x_{i}\Delta y_{i}}{\sum _{i=1}^{n}\Delta x_{i}^{2}}}\end{aligned}}}
ここで紹介したのは
x
¯
{\displaystyle {\bar {x}}}
および それぞれ x i と y i の平均として
y
¯
{\displaystyle {\bar {y}}}
Δ
x
i
{\displaystyle \Delta x_{i}}
x i と y i の それぞれの平均値に対する 偏差 として表され ます。
Δ
y
i
{\displaystyle \Delta y_{i}}
上記の式は、x変数とy変数の平均( )がわかっている場合に効率的に使用できます。計算時に平均がわからない場合は、式の拡張バージョンを使用する方が効率的です。これらの拡張された式は、 回帰多項式を1次と定義することで、
より一般的な 多項式回帰 式 [7] [8] から次のように導出できます。
x
¯
and
y
¯
{\displaystyle {\bar {x}}{\text{ and }}{\bar {y}}}
α
^
and
β
^
{\displaystyle {\widehat {\alpha }}{\text{ and }}{\widehat {\beta }}}
[
n
∑
i
=
1
n
x
i
∑
i
=
1
n
x
i
∑
i
=
1
n
x
i
2
]
[
α
^
β
^
]
=
[
∑
i
=
1
n
y
i
∑
i
=
1
n
y
i
x
i
]
{\displaystyle {\begin{bmatrix}n&\sum _{i=1}^{n}x_{i}\\\sum _{i=1}^{n}x_{i}&\sum _{i=1}^{n}x_{i}^{2}\end{bmatrix}}{\begin{bmatrix}{\widehat {\alpha }}\\{\widehat {\beta }}\end{bmatrix}}={\begin{bmatrix}\sum _{i=1}^{n}y_{i}\\\sum _{i=1}^{n}y_{i}x_{i}\end{bmatrix}}}
上記の 線形方程式系は 直接解くこともできるし、上記の行列方程式を展開することで の独立した方程式 を導くこともできる。結果として得られる方程式は前段落で示したものと代数的に等価であり、証明なしで以下に示す。 [9] [7]
α
^
and
β
^
{\displaystyle {\widehat {\alpha }}{\text{ and }}{\widehat {\beta }}}
α
^
=
∑
i
=
1
n
y
i
∑
i
=
1
n
x
i
2
−
∑
i
=
1
n
x
i
∑
i
=
1
n
x
i
y
i
n
∑
i
=
1
n
x
i
2
−
(
∑
i
=
1
n
x
i
)
2
β
^
=
n
∑
i
=
1
n
x
i
y
i
−
∑
i
=
1
n
x
i
∑
i
=
1
n
y
i
n
∑
i
=
1
n
x
i
2
−
(
∑
i
=
1
n
x
i
)
2
{\displaystyle {\begin{aligned}&\qquad {\widehat {\alpha }}={\frac {\sum _{i=1}^{n}y_{i}\sum _{i=1}^{n}x_{i}^{2}-\sum _{i=1}^{n}x_{i}\sum _{i=1}^{n}x_{i}y_{i}}{n\sum _{i=1}^{n}x_{i}^{2}-(\sum _{i=1}^{n}x_{i})^{2}}}\\[5pt]\\&\qquad {\widehat {\beta }}={\frac {n\sum _{i=1}^{n}x_{i}y_{i}-\sum _{i=1}^{n}x_{i}\sum _{i=1}^{n}y_{i}}{n\sum _{i=1}^{n}x_{i}^{2}-(\sum _{i=1}^{n}x_{i})^{2}}}\\&\qquad \end{aligned}}}
解釈
標本共分散行列との関係
共分散行列 の要素を使用して解を再定式化することができます 。
β
^
=
s
x
,
y
s
x
2
=
r
x
y
s
y
s
x
{\displaystyle {\widehat {\beta }}={\frac {s_{x,y}}{s_{x}^{2}}}=r_{xy}{\frac {s_{y}}{s_{x}}}}
どこ
上記の式を 元の解に
代入する と、
α
^
{\displaystyle {\widehat {\alpha }}}
β
^
{\displaystyle {\widehat {\beta }}}
y
−
y
¯
s
y
=
r
x
y
x
−
x
¯
s
x
.
{\displaystyle {\frac {y-{\bar {y}}}{s_{y}}}=r_{xy}{\frac {x-{\bar {x}}}{s_{x}}}.}
これは、 r xy が 標準化された データ ポイントの回帰直線の傾きである (そしてこの直線は原点を通過する) ことを示しています。したがって 、x が何らかの測定値であり、y が同じ項目からのフォローアップ測定値である場合、y (平均して) は x の元の値よりも平均測定値に近くなることが予想されます。この現象は 平均への回帰 として知られています。
−
1
≤
r
x
y
≤
1
{\displaystyle -1\leq r_{xy}\leq 1}
表記法を一般化すると 、式の上に水平バーを書いて、サンプル セット全体におけるその式の平均値を示すことができます。例:
x
¯
{\displaystyle {\bar {x}}}
x
y
¯
=
1
n
∑
i
=
1
n
x
i
y
i
.
{\displaystyle {\overline {xy}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}y_{i}.}
この表記により、 r xy の簡潔な式が得られます 。
r
x
y
=
x
y
¯
−
x
¯
y
¯
(
x
2
¯
−
x
¯
2
)
(
y
2
¯
−
y
¯
2
)
.
{\displaystyle r_{xy}={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}}{\sqrt {\left({\overline {x^{2}}}-{\bar {x}}^{2}\right)\left({\overline {y^{2}}}-{\bar {y}}^{2}\right)}}}.}
決定係数 ( 「R 二乗」) は 、モデルが単一の独立変数を持つ線形である場合 に等しくなります。 詳細については、
サンプル相関係数を参照してください。
r
x
y
2
{\displaystyle r_{xy}^{2}}
傾斜についての解釈
分子の合計のすべての要素に を掛けると (それによって変化しない):
(
x
i
−
x
¯
)
(
x
i
−
x
¯
)
=
1
{\displaystyle {\begin{aligned}{\frac {(x_{i}-{\bar {x}})}{(x_{i}-{\bar {x}})}}=1\end{aligned}}}
β
^
=
∑
i
=
1
n
(
x
i
−
x
¯
)
(
y
i
−
y
¯
)
∑
i
=
1
n
(
x
i
−
x
¯
)
2
=
∑
i
=
1
n
(
x
i
−
x
¯
)
2
(
y
i
−
y
¯
)
(
x
i
−
x
¯
)
∑
i
=
1
n
(
x
i
−
x
¯
)
2
=
∑
i
=
1
n
(
x
i
−
x
¯
)
2
∑
j
=
1
n
(
x
j
−
x
¯
)
2
(
y
i
−
y
¯
)
(
x
i
−
x
¯
)
{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}{\frac {(y_{i}-{\bar {y}})}{(x_{i}-{\bar {x}})}}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}=\sum _{i=1}^{n}{\frac {(x_{i}-{\bar {x}})^{2}}{\sum _{j=1}^{n}(x_{j}-{\bar {x}})^{2}}}{\frac {(y_{i}-{\bar {y}})}{(x_{i}-{\bar {x}})}}\\[6pt]\end{aligned}}}
回帰直線の傾き (角度の正接) は、 i 番目の点をすべての点の平均に接続する直線の傾き (角度の正接) の加重平均であることがわかります。 これは、点の位置の小さな誤差が中心点に接続する傾きに大きく影響するため、点が遠いほど「重要」になるためです。
(
y
i
−
y
¯
)
(
x
i
−
x
¯
)
{\displaystyle {\frac {(y_{i}-{\bar {y}})}{(x_{i}-{\bar {x}})}}}
(
x
i
−
x
¯
)
2
{\displaystyle (x_{i}-{\bar {x}})^{2}}
傍受についての解釈
α
^
=
y
¯
−
β
^
x
¯
,
{\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\bar {y}}-{\widehat {\beta }}\,{\bar {x}},\\[5pt]\end{aligned}}}
直線が正のx軸となす角度を 考える と、
β
^
=
tan
(
θ
)
=
d
y
/
d
x
→
d
y
=
d
x
×
β
^
{\displaystyle {\widehat {\beta }}=\tan(\theta )=dy/dx\rightarrow dy=dx\times {\widehat {\beta }}}
θ
{\displaystyle \theta }
y
i
n
t
e
r
s
e
c
t
i
o
n
=
y
¯
−
d
x
×
β
^
=
y
¯
−
d
y
{\displaystyle y_{\rm {intersection}}={\bar {y}}-dx\times {\widehat {\beta }}={\bar {y}}-dy}
相関関係についての解釈
上記の式では、それぞれが 定数(「事前にわかっている」)値であるのに対し、は 線形関数 とランダム項に依存するランダム変数であることに注意してください 。この仮定は、傾きの標準誤差を導出し、それが 偏りがない ことを示すときに使用されます。
x
i
{\displaystyle x_{i}}
y
i
{\displaystyle y_{i}}
x
i
{\displaystyle x_{i}}
ε
i
{\displaystyle \varepsilon _{i}}
この枠組みでは、 が実際には ランダム変数 ではない場合 、経験的相関はどのようなタイプのパラメータを推定するのでしょうか。問題は、各値 i について、 および になることです 。 の考えられる解釈は、 がサンプル内の x 値の 経験的分布 から抽出されたランダム変数を定義する と想像することです 。たとえば、 x に 自然数[1,2,3...,10] からの 10 個の値がある場合、 x は 離散一様分布 であると想像できます 。この解釈では、すべてが同じ期待値といくらかの正の分散を持ちます。この解釈では 、 をランダム変数 y とランダム変数 x (先ほど定義したとおり) の間の
ピアソンの相関 の推定値として 考えることができます。
x
i
{\displaystyle x_{i}}
r
x
y
{\displaystyle r_{xy}}
E
(
x
i
)
=
x
i
{\displaystyle E(x_{i})=x_{i}}
V
a
r
(
x
i
)
=
0
{\displaystyle Var(x_{i})=0}
r
x
y
{\displaystyle r_{xy}}
x
i
{\displaystyle x_{i}}
x
i
{\displaystyle x_{i}}
r
x
y
{\displaystyle r_{xy}}
数値特性
モデルに切片項が含まれている場合(つまり、原点を通らない場合)、 回帰直線は 質量中心点 を通ります。
(
x
¯
,
y
¯
)
{\displaystyle ({\bar {x}},\,{\bar {y}})}
モデルに切片項が含まれている場合、残差の合計はゼロになります。
∑
i
=
1
n
ε
^
i
=
0.
{\displaystyle \sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}=0.}
残差と x 値は相関がありません (モデルに切片項があるかどうかに関係なく)。これは次のことを意味します。
∑
i
=
1
n
x
i
ε
^
i
=
0
{\displaystyle \sum _{i=1}^{n}x_{i}{\widehat {\varepsilon }}_{i}\;=\;0}
( 母集団の相関係数 )と( ) の母分散および ( ) の誤差項 との関係は : [10] :401
ρ
x
y
{\displaystyle \rho _{xy}}
y
{\displaystyle y}
σ
y
2
{\displaystyle \sigma _{y}^{2}}
ϵ
{\displaystyle \epsilon }
σ
ϵ
2
{\displaystyle \sigma _{\epsilon }^{2}}
σ
ϵ
2
=
(
1
−
ρ
x
y
2
)
σ
y
2
{\displaystyle \sigma _{\epsilon }^{2}=(1-\rho _{xy}^{2})\sigma _{y}^{2}}
の極端な値については、 これは自明です。 のときは 。 そして のとき は 。
ρ
x
y
{\displaystyle \rho _{xy}}
ρ
x
y
=
0
{\displaystyle \rho _{xy}=0}
σ
ϵ
2
=
σ
y
2
{\displaystyle \sigma _{\epsilon }^{2}=\sigma _{y}^{2}}
ρ
x
y
=
1
{\displaystyle \rho _{xy}=1}
σ
ϵ
2
=
0
{\displaystyle \sigma _{\epsilon }^{2}=0}
統計的特性
単純な線形回帰推定値からの推定値の統計的特性の説明には、統計モデル の使用が必要です。以下は、推定値が最適となるモデルの妥当性を仮定することに基づいています。 不均一性 などの他の仮定の下で特性を評価することも可能です が、これについては別の場所で説明します。 [ 説明が必要 ]
偏見のなさ
推定値 と は 偏りがありませ ん 。
α
^
{\displaystyle {\widehat {\alpha }}}
β
^
{\displaystyle {\widehat {\beta }}}
この主張を形式化するには、これらの推定量がランダム変数であるフレームワークを定義する必要があります。残差 ε i は、平均がゼロである分布から独立して抽出されたランダム変数であると考えます。言い換えると、 xの各値に対して、対応する y の値は 、平均応答 α + βx と、平均でゼロに等しい 誤差項 と呼ばれる追加のランダム変数 ε として生成されます。このような解釈では、最小二乗推定量 と自体は、平均が「真の値」 α と β に等しいランダム変数になります 。これが、不偏推定量の定義です。
α
^
{\displaystyle {\widehat {\alpha }}}
β
^
{\displaystyle {\widehat {\beta }}}
平均応答の分散
この文脈におけるデータは観測値ごとに ( x , y ) ペアとして定義されているため、与えられた x 値、例えば x d での 平均応答は、 x 値 x d における母集団の y 値の平均の推定値、 つまり となる 。平均応答の分散は次のように与えられる: [11]
E
^
(
y
∣
x
d
)
≡
y
^
d
{\displaystyle {\hat {E}}(y\mid x_{d})\equiv {\hat {y}}_{d}\!}
Var
(
α
^
+
β
^
x
d
)
=
Var
(
α
^
)
+
(
Var
β
^
)
x
d
2
+
2
x
d
Cov
(
α
^
,
β
^
)
.
{\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\operatorname {Var} \left({\hat {\alpha }}\right)+\left(\operatorname {Var} {\hat {\beta }}\right)x_{d}^{2}+2x_{d}\operatorname {Cov} \left({\hat {\alpha }},{\hat {\beta }}\right).}
この式は次のように簡略化できる。
Var
(
α
^
+
β
^
x
d
)
=
σ
2
(
1
m
+
(
x
d
−
x
¯
)
2
∑
(
x
i
−
x
¯
)
2
)
,
{\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right),}
ここで、 m は データ ポイントの数です。
この単純化を証明するために、次の等式を使用することができる。
∑
(
x
i
−
x
¯
)
2
=
∑
x
i
2
−
1
m
(
∑
x
i
)
2
.
{\displaystyle \sum (x_{i}-{\bar {x}})^{2}=\sum x_{i}^{2}-{\frac {1}{m}}\left(\sum x_{i}\right)^{2}.}
予測された応答の分散
予測 応答分布は、与えられた点 x d における残差の予測分布である 。したがって、分散は次のように与えられる。
Var
(
y
d
−
[
α
^
+
β
^
x
d
]
)
=
Var
(
y
d
)
+
Var
(
α
^
+
β
^
x
d
)
−
2
Cov
(
y
d
,
[
α
^
+
β
^
x
d
]
)
=
Var
(
y
d
)
+
Var
(
α
^
+
β
^
x
d
)
.
{\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)-2\operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)\\&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right).\end{aligned}}}
2 行目は、新しい予測ポイントがモデルの適合に使用されたデータに依存しないため、 がゼロであるという事実から導き出されます 。また、 項は 平均応答に対して以前に計算されています。
Cov
(
y
d
,
[
α
^
+
β
^
x
d
]
)
{\displaystyle \operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)}
Var
(
α
^
+
β
^
x
d
)
{\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)}
(推定可能な固定だが未知のパラメータ)
なので、予測される応答の分散は次のように表される。
Var
(
y
d
)
=
σ
2
{\displaystyle \operatorname {Var} (y_{d})=\sigma ^{2}}
Var
(
y
d
−
[
α
^
+
β
^
x
d
]
)
=
σ
2
+
σ
2
(
1
m
+
(
x
d
−
x
¯
)
2
∑
(
x
i
−
x
¯
)
2
)
=
σ
2
(
1
+
1
m
+
(
x
d
−
x
¯
)
2
∑
(
x
i
−
x
¯
)
2
)
.
{\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\sigma ^{2}+\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)\\[4pt]&=\sigma ^{2}\left(1+{\frac {1}{m}}+{\frac {(x_{d}-{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right).\end{aligned}}}
信頼区間
前のセクションで示した式を使用すると、 α と β の 点推定値 、つまり、特定のデータ セットの回帰直線の係数を計算できます。ただし、これらの式では、推定値の精度、つまり、指定されたサンプル サイズで推定値 が サンプルごとにどの程度変化するかはわかりません。 信頼区間は 、実験を非常に多くの回数繰り返した場合に得られる推定値の妥当なセットを提供するために考案されました。
α
^
{\displaystyle {\widehat {\alpha }}}
β
^
{\displaystyle {\widehat {\beta }}}
線形回帰係数の信頼区間を構築する標準的な方法は、正規性仮定に依存しており、次のいずれかの場合に正当化されます。
回帰分析における誤差は 正規分布している (いわゆる 古典的な回帰の 仮定)、または
観測数 n が十分に大きい場合、推定値はほぼ正規分布します。
後者の場合は 中心極限定理 によって正当化されます。
正規性仮定
上記の最初の仮定、つまり誤差項の正規性の下では、傾き係数の推定量自体は平均 β と分散σ 2 で正規分布する。 ここで σ 2 は誤差項の分散である( 通常の最小二乗法に関する証明 を参照)。同時に、残差二乗和 Qは χ 2 に比例してn − 2 の自由度で 分布し 、 からは独立している。これにより、 t 値
を構築することができる。
σ
2
/
∑
(
x
i
−
x
¯
)
2
,
{\displaystyle \sigma ^{2}\left/\sum (x_{i}-{\bar {x}})^{2}\right.,}
β
^
{\displaystyle {\widehat {\beta }}}
t
=
β
^
−
β
s
β
^
∼
t
n
−
2
,
{\displaystyle t={\frac {{\widehat {\beta }}-\beta }{s_{\widehat {\beta }}}}\ \sim \ t_{n-2},}
どこ
s
β
^
=
1
n
−
2
∑
i
=
1
n
ε
^
i
2
∑
i
=
1
n
(
x
i
−
x
¯
)
2
{\displaystyle s_{\widehat {\beta }}={\sqrt {\frac {{\frac {1}{n-2}}\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}
は推定値の 不偏 標準誤差 推定値です。
β
^
{\displaystyle {\widehat {\beta }}}
この t 値は自由度 n − 2の スチューデントの t 分布に従います。これを使用して β の信頼区間を構築できます 。
β
∈
[
β
^
−
s
β
^
t
n
−
2
∗
,
β
^
+
s
β
^
t
n
−
2
∗
]
,
{\displaystyle \beta \in \left[{\widehat {\beta }}-s_{\widehat {\beta }}t_{n-2}^{*},\ {\widehat {\beta }}+s_{\widehat {\beta }}t_{n-2}^{*}\right],}
信頼水準 (1 − γ ) で、 t n −2 分布の分位数 です 。たとえば、 γ = 0.05 の場合、信頼水準は95%です。
t
n
−
2
∗
{\displaystyle t_{n-2}^{*}}
(
1
−
γ
2
)
-th
{\displaystyle \scriptstyle \left(1\;-\;{\frac {\gamma }{2}}\right){\text{-th}}}
同様に、切片係数 α の信頼区間は次のように与えられる。
α
∈
[
α
^
−
s
α
^
t
n
−
2
∗
,
α
^
+
s
α
^
t
n
−
2
∗
]
,
{\displaystyle \alpha \in \left[{\widehat {\alpha }}-s_{\widehat {\alpha }}t_{n-2}^{*},\ {\widehat {\alpha }}+s_{\widehat {\alpha }}t_{n-2}^{*}\right],}
信頼水準(1 − γ )において、
s
α
^
=
s
β
^
1
n
∑
i
=
1
n
x
i
2
=
1
n
(
n
−
2
)
(
∑
i
=
1
n
ε
^
i
2
)
∑
i
=
1
n
x
i
2
∑
i
=
1
n
(
x
i
−
x
¯
)
2
{\displaystyle s_{\widehat {\alpha }}=s_{\widehat {\beta }}{\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}x_{i}^{2}}}={\sqrt {{\frac {1}{n(n-2)}}\left(\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}\right){\frac {\sum _{i=1}^{n}x_{i}^{2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}}
米国の「失業率の変化 - GDP 成長」回帰分析(95% 信頼区間付き)。
α と β の信頼区間は、 これらの回帰係数が最もありそうな場所を大まかに示します。例えば、ここに示した オークンの法則の 回帰では、点推定値は次のようになります。
α
^
=
0.859
,
β
^
=
−
1.817.
{\displaystyle {\widehat {\alpha }}=0.859,\qquad {\widehat {\beta }}=-1.817.}
これらの推定値の95%信頼区間は
α
∈
[
0.76
,
0.96
]
,
β
∈
[
−
2.06
,
−
1.58
]
.
{\displaystyle \alpha \in \left[\,0.76,0.96\right],\qquad \beta \in \left[-2.06,-1.58\,\right].}
この情報を回帰直線の周りの信頼帯の形でグラフで表すためには、慎重に進め、推定値の結合分布を考慮する必要がある。 [12] によれば、信頼水準(1 − γ )では信頼帯は次式で与えられる双曲線形をとる。
(
α
+
β
ξ
)
∈
[
α
^
+
β
^
ξ
±
t
n
−
2
∗
(
1
n
−
2
∑
ε
^
i
2
)
⋅
(
1
n
+
(
ξ
−
x
¯
)
2
∑
(
x
i
−
x
¯
)
2
)
]
.
{\displaystyle (\alpha +\beta \xi )\in \left[\,{\widehat {\alpha }}+{\widehat {\beta }}\xi \pm t_{n-2}^{*}{\sqrt {\left({\frac {1}{n-2}}\sum {\widehat {\varepsilon }}_{i}^{\,2}\right)\cdot \left({\frac {1}{n}}+{\frac {(\xi -{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)}}\,\right].}
モデルが切片を固定して0( )に等しいと仮定した場合、傾きの標準誤差は次のようになります。
α
=
0
{\displaystyle \alpha =0}
s
β
^
=
1
n
−
1
∑
i
=
1
n
ε
^
i
2
∑
i
=
1
n
x
i
2
{\displaystyle s_{\widehat {\beta }}={\sqrt {{\frac {1}{n-1}}{\frac {\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}x_{i}^{2}}}}}}
と:
ε
^
i
=
y
i
−
y
^
i
{\displaystyle {\hat {\varepsilon }}_{i}=y_{i}-{\hat {y}}_{i}}
漸近的仮定
2 番目の仮定は、データセット内の点の数が「十分に大きい」場合、 大数の法則 と 中心極限定理が適用され、推定値の分布がほぼ正規分布になるというものです。この仮定の下では、前のセクションで導出されたすべての式は、 スチューデントの t 分布の分位数t* n −2 が 標準正規分布 の分位数 q* に置き換えられる という例外を除いて、有効な ままです。時折、分数 1 / n −2 は に置き換えられます 1 / ん . n が大きい場合、このような変更によって結果が大幅に変わることはありません。
数値例
このデータセットは、30~39 歳のアメリカ人女性をサンプルとして、身長の関数として女性の平均体重を示しています。OLS の記事では、 この データには二次回帰を実行する方が適切であると主張していますが、ここでは代わりに単純な線形回帰モデルを適用しています。
このデータ セットにはn = 15 個のポイントがあります 。手計算は、次の 5 つの合計を求めることから始まります。
S
x
=
∑
x
i
=
24.76
,
S
y
=
∑
y
i
=
931.17
,
S
x
x
=
∑
x
i
2
=
41.0532
,
S
y
y
=
∑
y
i
2
=
58498.5439
,
S
x
y
=
∑
x
i
y
i
=
1548.2453
{\displaystyle {\begin{aligned}S_{x}&=\sum x_{i}\,=24.76,\qquad S_{y}=\sum y_{i}\,=931.17,\\[5pt]S_{xx}&=\sum x_{i}^{2}=41.0532,\;\;\,S_{yy}=\sum y_{i}^{2}=58498.5439,\\[5pt]S_{xy}&=\sum x_{i}y_{i}=1548.2453\end{aligned}}}
これらの量は、回帰係数の推定値とその標準誤差を計算するために使用されます。
β
^
=
n
S
x
y
−
S
x
S
y
n
S
x
x
−
S
x
2
=
61.272
α
^
=
1
n
S
y
−
β
^
1
n
S
x
=
−
39.062
s
ε
2
=
1
n
(
n
−
2
)
[
n
S
y
y
−
S
y
2
−
β
^
2
(
n
S
x
x
−
S
x
2
)
]
=
0.5762
s
β
^
2
=
n
s
ε
2
n
S
x
x
−
S
x
2
=
3.1539
s
α
^
2
=
s
β
^
2
1
n
S
x
x
=
8.63185
{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {nS_{xy}-S_{x}S_{y}}{nS_{xx}-S_{x}^{2}}}=61.272\\[8pt]{\widehat {\alpha }}&={\frac {1}{n}}S_{y}-{\widehat {\beta }}{\frac {1}{n}}S_{x}=-39.062\\[8pt]s_{\varepsilon }^{2}&={\frac {1}{n(n-2)}}\left[nS_{yy}-S_{y}^{2}-{\widehat {\beta }}^{2}(nS_{xx}-S_{x}^{2})\right]=0.5762\\[8pt]s_{\widehat {\beta }}^{2}&={\frac {ns_{\varepsilon }^{2}}{nS_{xx}-S_{x}^{2}}}=3.1539\\[8pt]s_{\widehat {\alpha }}^{2}&=s_{\widehat {\beta }}^{2}{\frac {1}{n}}S_{xx}=8.63185\end{aligned}}}
単純線形回帰の数値例における点と線形最小二乗線のグラフ
自由度13の スチューデント t分布の0.975分位数は t * 13 = 2.1604 であり、したがって α と β の95%信頼区間は
α
∈
[
α
^
∓
t
13
∗
s
α
]
=
[
−
45.4
,
−
32.7
]
β
∈
[
β
^
∓
t
13
∗
s
β
]
=
[
57.4
,
65.1
]
{\displaystyle {\begin{aligned}&\alpha \in [\,{\widehat {\alpha }}\mp t_{13}^{*}s_{\alpha }\,]=[\,{-45.4},\ {-32.7}\,]\\[5pt]&\beta \in [\,{\widehat {\beta }}\mp t_{13}^{*}s_{\beta }\,]=[\,57.4,\ 65.1\,]\end{aligned}}}
積率相関係数も 次の ように計算できます。
r
^
=
n
S
x
y
−
S
x
S
y
(
n
S
x
x
−
S
x
2
)
(
n
S
y
y
−
S
y
2
)
=
0.9946
{\displaystyle {\widehat {r}}={\frac {nS_{xy}-S_{x}S_{y}}{\sqrt {(nS_{xx}-S_{x}^{2})(nS_{yy}-S_{y}^{2})}}}=0.9946}
代替案
二乗誤差を最小化することで線形モデルのパラメータを計算します。
SLR では、従属変数のみに測定誤差が含まれるという前提が根底にあります。説明変数も誤差を伴って測定される場合、回帰希釈 によってバイアスがかかるため、単純回帰は根底にある関係を推定するのに適切ではありません 。
通常の最小二乗法の代わりに使用できる他の推定方法には、 最小絶対偏差 (残差の絶対値の合計を最小化する)や Theil–Sen 推定量 (サンプル ポイントのペアによって決定される傾きの 中央値を 傾き とする線を選択する)
などが あります。
デミング回帰 (合計最小二乗法) も、2 次元のサンプル ポイントのセットに適合する線を見つけますが、(通常の最小二乗法、最小絶対偏差、および中央傾き回帰とは異なり) 座標を 1 つの従属変数と 1 つの独立変数に分割せず、適合として垂直線を返す可能性があるため、実際には単純な線形回帰の例ではありません。データよりも外れ値を適合させようとするモデルにつながる可能性があります。
ラインフィッティング
ラインフィッティング は、一連のデータポイントに最もよく適合する
直線 を構築するプロセスです。
以下を考慮すると、いくつかの方法があります。
垂直距離: 単純線形回帰
外れ値 に対する耐性 : ロバストな単純線形回帰
垂直距離 : 直交回帰 (これはスケール不変ではありません。つまり、測定単位を変更すると、異なる線が生成されます。)
加重幾何距離: デミング回帰
スケール不変アプローチ: 主軸回帰 これにより、両方の変数の測定誤差が考慮され、測定単位が変更された場合でも同等の方程式が得られます。
切片項のない単純な線形回帰(単一回帰変数)
x と yは 比例関係にあると仮定されるため、回帰直線を原点に強制的に通すのが適切な場合もあります 。切片項のないモデル、 y = βx の場合、 β のOLS推定量は 次のように簡略化されます。
β
^
=
∑
i
=
1
n
x
i
y
i
∑
i
=
1
n
x
i
2
=
x
y
¯
x
2
¯
{\displaystyle {\widehat {\beta }}={\frac {\sum _{i=1}^{n}x_{i}y_{i}}{\sum _{i=1}^{n}x_{i}^{2}}}={\frac {\overline {xy}}{\overline {x^{2}}}}}
( x , y ) の代わりに ( x − h , y − k ) を代入すると、 ( h , k ) を通した回帰式が得られます 。
β
^
=
∑
i
=
1
n
(
x
i
−
h
)
(
y
i
−
k
)
∑
i
=
1
n
(
x
i
−
h
)
2
=
(
x
−
h
)
(
y
−
k
)
¯
(
x
−
h
)
2
¯
=
x
y
¯
−
k
x
¯
−
h
y
¯
+
h
k
x
2
¯
−
2
h
x
¯
+
h
2
=
x
y
¯
−
x
¯
y
¯
+
(
x
¯
−
h
)
(
y
¯
−
k
)
x
2
¯
−
x
¯
2
+
(
x
¯
−
h
)
2
=
Cov
(
x
,
y
)
+
(
x
¯
−
h
)
(
y
¯
−
k
)
Var
(
x
)
+
(
x
¯
−
h
)
2
,
{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-h)(y_{i}-k)}{\sum _{i=1}^{n}(x_{i}-h)^{2}}}={\frac {\overline {(x-h)(y-k)}}{\overline {(x-h)^{2}}}}\\[6pt]&={\frac {{\overline {xy}}-k{\bar {x}}-h{\bar {y}}+hk}{{\overline {x^{2}}}-2h{\bar {x}}+h^{2}}}\\[6pt]&={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}+({\bar {x}}-h)({\bar {y}}-k)}{{\overline {x^{2}}}-{\bar {x}}^{2}+({\bar {x}}-h)^{2}}}\\[6pt]&={\frac {\operatorname {Cov} (x,y)+({\bar {x}}-h)({\bar {y}}-k)}{\operatorname {Var} (x)+({\bar {x}}-h)^{2}}},\end{aligned}}}
ここで、Cov と Var はサンプル データの共分散と分散 (バイアス補正なし) を表します。上記の最後の形式は、線をデータ ポイントの質量の中心から遠ざけると、傾きにどのような影響があるかを示しています。
参照
参考文献
^ Seltman, Howard J. (2008-09-08). 実験計画と分析 (PDF) . p. 227.
^ 「統計的サンプリングと回帰:単純線形回帰」。コロンビア大学。 2016年10月17日 閲覧 。 回帰分析で1つの独立変数が使用される場合、それは単純回帰と呼ばれます。(...)
^ レーン、デビッドM.統計学入門 (PDF) 。p.462。
^ Zou KH; Tuncali K; Silverman SG (2003). 「相関と単純線形回帰」. 放射線学 . 227 (3): 617–22. doi :10.1148/radiol.2273011499. ISSN 0033-8419. OCLC 110941167. PMID 12773666.
^ Altman, Naomi; Krzywinski, Martin (2015). 「単純線形回帰」. Nature Methods . 12 (11): 999–1000. doi : 10.1038/nmeth.3627 . ISSN 1548-7091. OCLC 5912005539. PMID 26824102. S2CID 261269711.
^ Kenney, JF および Keeping, ES (1962)「線形回帰と相関」。 統計数学 第 1 部第 3 版 第 15 章。プリンストン、ニュージャージー: Van Nostrand、pp. 252–285
^ ab Muthukrishnan, Gowri (2018年6月17日). 「多項式回帰の背後にある数学、Muthukrishnan」。 多項式回帰の背後にある数学。 2024年 1月30日 閲覧 。
^ 「多項式回帰の数学」。 多項式回帰、PHP 回帰クラス 。
^ 「数値能力、数学、統計 - アカデミックスキルキット、ニューカッスル大学」。 単純線形回帰。 2024年 1月30日 閲覧 。
^ ヴァリアント、リチャード、ジル・A・デバー、フラウケ・クロイター。調査サンプルの設計と重み付けのための実用的なツール。ニューヨーク:シュプリンガー、2013年。
^ Draper, NR; Smith, H. (1998). 応用回帰分析 (第3版). John Wiley. ISBN 0-471-17082-8 。
^ Casella, G. および Berger, RL (2002)、「統計的推論」(第 2 版)、Cengage、 ISBN 978-0-534-24312-8 、pp. 558–559。
外部リンク
Wolfram MathWorldによる最小二乗法の説明とその計算方法
単回帰の数学(ロバート・ナウ、デューク大学)