マクロ経済学 におけるオオクンの法則 は、単純線形回帰の一例である。ここでは、従属変数(GDP成長率)は失業率の変化と線形関係にあると仮定されている。統計学 において、単純線形回帰 ( SLR ) は、単一の説明変数を持つ 線形回帰 モデルです。[ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] つまり、1 つの独立変数と 1 つの従属変数 (慣例的に、デカルト座標系の x 座標とy 座標) を持つ 2 次元のサンプル点に関係し、独立変数の関数として従属変数の値をできるだけ正確に予測する線形関数 (垂直でない直線) を見つけます。 単純という 形容詞は、結果変数が単一の予測変数に関連しているという事実を指します。
一般的に、最小二乗 法(OLS)を用いるという追加条件が設けられます。各予測値の精度は、残差の二乗( データセットの点と近似直線との間の垂直距離)によって測定され、目標はこれらの二乗偏差の合計をできるだけ小さくすることです。この場合、近似直線の傾きは、y とxの 相関を これらの変数の標準偏差の比で補正したものに等しくなります。近似直線の切片は、直線がデータ点の重心( x 、 y )を通るように設定されます。
モデル 関数 について考えてみましょうy = α + β x 、 {\displaystyle y=\alpha +\beta x,} これは、傾きβ とy 切片α を持つ直線を表します。一般に、このような関係は、独立変数と従属変数の値の大部分が観測されない母集団に対して厳密には成り立たない場合があります。上記の式からの観測されない偏差を誤差と呼びます。n 個の データ ペアを観測し、それらを{( x i , y i ), i = 1, ..., n } とします。この誤差項ε i を含むy i とx i の間の根本的な関係は、次のように記述できます。
y 私 = α + β x 私 + ε 私 。 {\displaystyle y_{i}=\alpha +\beta x_{i}+\varepsilon _{i}.}
真の(しかし観測されない)基礎となるパラメータα とβ とデータポイントとの間のこの関係は、線形回帰モデルと呼ばれます。
目標は推定値を求めることですα ^ {\displaystyle {\ワイドハット {\alpha }}} そしてβ ^ {\displaystyle {\ワイドハット {\beta }}} データ点に対してある意味で「最適」な適合を与えるパラメータα とβについて検討します。序論で述べたように、この記事では「最適」な適合とは 最小二乗法における適合、すなわち 残差の二乗和を 最小化する直線を指します(誤差と残差 も参照)。ε ^ 私 {\displaystyle {\widehat {\varepsilon }}_{i}} (従属変数y の実際値と予測値の差)は、それぞれ任意の候補パラメータ値に対して次のように表される。α {\displaystyle \alpha } そしてβ {\displaystyle \beta } 、
ε ^ 私 = y 私 − α − β x 私 。 \displaystyle {\widehat {\varepsilon }}_{i}=y_{i}-\alpha -\beta x_{i}.}
言い換えると、α ^ {\displaystyle {\ワイドハット {\alpha }}} そしてβ ^ {\displaystyle {\ワイドハット {\beta }}} 以下の最小化問題 を解いてください。
( α ^ 、 β ^ ) = アルグミン ( Q ( α 、 β ) ) 、 {\displaystyle ({\hat {\alpha }},\,{\hat {\beta }})=\operatorname {argmin} \left(Q(\alpha ,\beta )\right),} ここで、目的関数 Q は次のとおりである。 Q ( α 、 β ) = ∑ 私 = 1 n ε ^ 私 2 = ∑ 私 = 1 n ( y 私 − α − β x 私 ) 2 。 {\displaystyle Q(\alpha ,\beta )=\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}=\sum _{i=1}^{n}(y_{i}-\alpha -\beta x_{i})^{2}\ .}
展開して二次式を得るとα {\displaystyle \alpha } そしてβ 、 {\displaystyle \beta ,} 関数引数の最小値を導出できます。α ^ {\displaystyle {\ワイドハット {\alpha }}} そしてβ ^ {\displaystyle {\ワイドハット {\beta }}} : [ 6 ]
α ^ = y ¯ − β ^ x ¯ 、 β ^ = ∑ 私 = 1 n ( x 私 − x ¯ ) ( y 私 − y ¯ ) ∑ 私 = 1 n ( x 私 − x ¯ ) 2 = ∑ 私 = 1 n Δ x 私 Δ y 私 ∑ 私 = 1 n Δ x 私 2 {\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\bar {y}}-{\widehat {\beta }}\,{\bar {x}},\\[5pt]{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)\left(y_{i}-{\bar {y}}\right)}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}={\frac {\sum _{i=1}^{n}\Delta x_{i}\Delta y_{i}}{\sum _{i=1}^{n}\Delta x_{i}^{2}}}\end{aligned}}}
ここでは、
x ¯ {\displaystyle {\bar {x}}} そしてy ¯ {\displaystyle {\bar {y}}} x i とy i のそれぞれの平均としてΔ x 私 \displaystyle \Delta x_{i}} そしてΔ y 私 \displaystyle \Delta y_{i}} x i とy i のそれぞれの平均値からの偏差 として表されます。
上記の式は、x 変数と y 変数の平均が (x ¯ そして y ¯ {\displaystyle {\bar {x}}{\text{ および }}{\bar {y}}} )が既知である場合。計算時に平均値が不明な場合は、拡張版を使用する方が効率的かもしれません。α ^ そして β ^ \displaystyle {\widehat {\alpha }}{\text{ および }}{\widehat {\beta }}} これらの拡張された方程式は、回帰多項式を次数 1 と定義することにより、より一般的な多項式回帰 方程式[ 7 ] [ 8 ]から次のように導出できます。
[ n ∑ 私 = 1 n x 私 ∑ 私 = 1 n x 私 ∑ 私 = 1 n x 私 2 ] [ α ^ β ^ ] = [ ∑ 私 = 1 n y 私 ∑ 私 = 1 n y 私 x 私 ] {\displaystyle {\begin{bmatrix}n&\sum _{i=1}^{n}x_{i}\\[1ex]\sum _{i=1}^{n}x_{i}&\sum _{i=1}^{n}x_{i}^{2}\end{bmatrix}}{\begin{bmatrix}{\widehat {\alpha }}\\[1ex]{\widehat {\beta }}\end{bmatrix}}={\begin{bmatrix}\sum _{i=1}^{n}y_{i}\\[1ex]\sum _{i=1}^{n}y_{i}x_{i}\end{bmatrix}}}
上記の連立一次方程式は 直接解くことも、独立した方程式として解くこともできます。α ^ そして β ^ \displaystyle {\widehat {\alpha }}{\text{ および }}{\widehat {\beta }}} 上記の行列方程式を展開することで導出できます。結果として得られる方程式は、前の段落で示した方程式と代数的に等価であり、証明なしで以下に示します。[ 9 ] [ 7 ]
α ^ = ∑ 私 = 1 n y 私 ∑ 私 = 1 n x 私 2 − ∑ 私 = 1 n x 私 ∑ 私 = 1 n x 私 y 私 n ∑ 私 = 1 n x 私 2 − ( ∑ 私 = 1 n x 私 ) 2 β ^ = n ∑ 私 = 1 n x 私 y 私 − ∑ 私 = 1 n x 私 ∑ 私 = 1 n y 私 n ∑ 私 = 1 n x 私 2 − ( ∑ 私 = 1 n x 私 ) 2 {\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\frac {\sum \limits _{i=1}^{n}y_{i}\sum \limits _{i=1}^{n}x_{i}^{2}-\sum \limits _{i=1}^{n}x_{i}\sum \limits _{i=1}^{n}x_{i}y_{i}}{n\sum \limits _{i=1}^{n}x_{i}^{2}-\left(\sum \limits _{i=1}^{n}x_{i}\right)^{2}}}\\[2ex]{\widehat {\beta }}&={\frac {n\sum \limits _{i=1}^{n}x_{i}y_{i}-\sum \limits _{i=1}^{n}x_{i}\sum \limits _{i=1}^{n}y_{i}}{n\sum \limits _{i=1}^{n}x_{i}^{2}-\left(\sum \limits _{i=1}^{n}x_{i}\right)^{2}}}\end{aligned}}}
解釈
標本共分散行列との関係 共分散行列 の要素を用いて、解を再定式化することができる。 β ^ = s x 、 y s x 2 = r x y s y s x {\displaystyle {\widehat {\beta }}={\frac {s_{x,y}}{s_{x}^{2}}}=r_{xy}{\frac {s_{y}}{s_{x}}}}
どこ
上記の式を代入するとα ^ {\displaystyle {\ワイドハット {\alpha }}} そしてβ ^ {\displaystyle {\ワイドハット {\beta }}} 元の溶液に加えると
y − y ¯ s y = r x y x − x ¯ s x 。 {\displaystyle {\frac {y-{\bar {y}}}{s_{y}}}=r_{xy}{\frac {x-{\bar {x}}}{s_{x}}}.}
これは、r xy が 標準化された データ点の回帰直線の傾きであること(そしてこの直線が原点を通ること)を示しています。− 1 ≤ r x y ≤ 1 {\displaystyle -1\leq r_{xy}\leq 1} つまり、x がある測定値で、y が同じ項目からの追跡測定値である場合、y は(平均的に)元の x の値よりも平均測定値に近くなると予想されます。この現象は平均への回帰 として知られています。
一般化するx ¯ {\displaystyle {\bar {x}}} 表記法では、式の上に横棒を書いて、その式のサンプルセットにおける平均値を表すことができます。例:
x y ¯ = 1 n ∑ 私 = 1 n x 私 y 私 。 {\displaystyle {\overline {xy}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}y_{i}.}
この表記法により、 r xy の簡潔な公式が得られます。
r x y = x y ¯ − x ¯ y ¯ ( x 2 ¯ − x ¯ 2 ) ( y 2 ¯ − y ¯ 2 ) 。 {\displaystyle r_{xy}={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}}{\sqrt {\left({\overline {x^{2}}}-{\bar {x}}^{2}\right)\left({\overline {y^{2}}}-{\bar {y}}^{2}\right)}}}.}
決定係数 (「R二乗」)はr x y 2 {\displaystyle r_{xy}^{2}} モデルが単一の独立変数を持つ線形モデルの場合。詳細については、サンプル相関係数を参照してください。
傾斜に関する解釈 分子の総和のすべての要素に以下を掛ける :x 私 − x ¯ x 私 − x ¯ = 1 {\displaystyle {\frac {x_{i}-{\bar {x}}}{x_{i}-{\bar {x}}}}=1} (それによって変更しない):
β ^ = ∑ 私 = 1 n ( x 私 − x ¯ ) ( y 私 − y ¯ ) ∑ 私 = 1 n ( x 私 − x ¯ ) 2 = ∑ 私 = 1 n ( x 私 − x ¯ ) 2 y 私 − y ¯ x 私 − x ¯ ∑ 私 = 1 n ( x 私 − x ¯ ) 2 = ∑ 私 = 1 n ( x 私 − x ¯ ) 2 ∑ j = 1 n ( x j − x ¯ ) 2 y 私 − y ¯ x 私 − x ¯ {\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)\left(y_{i}-{\bar {y}}\right)}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}\\[1ex]&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}{\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}\\[1ex]&=\sum _{i=1}^{n}{\frac {\left(x_{i}-{\bar {x}}\right)^{2}}{\sum _{j=1}^{n}\left(x_{j}-{\bar {x}}\right)^{2}}}{\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}\\[6pt]\end{aligned}}}
回帰直線の傾き(角度の正接)は、y 私 − y ¯ x 私 − x ¯ {\displaystyle {\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}} それは、i 番目の点とすべての点の平均を結ぶ直線の傾き(角度の正接)であり、重みは( x 私 − x ¯ ) 2 {\displaystyle (x_{i}-{\bar {x}})^{2}} なぜなら、その点が遠ければ遠いほど「重要」になるからである。その点の位置のわずかな誤差が、中心点とそれを結ぶ傾きに及ぼす影響が大きくなるからだ。
統計的特性 単純線形回帰推定値から得られる推定量の統計的性質を記述するには、統計モデル を用いる必要がある。以下では、推定値が最適となるモデルの妥当性を前提としている。不均一性 などの他の仮定の下でも性質を評価することは可能であるが、これについては別の箇所で論じる。
公平性 推定者α ^ {\displaystyle {\widehat {\alpha }}} そしてβ ^ {\displaystyle {\widehat {\beta }}} 偏見 がない。
この主張を形式化するために、これらの推定量が確率変数であるという枠組みを定義する必要があります。残差ε i は 、平均がゼロである何らかの分布から独立に抽出された確率変数とみなします。言い換えれば、xの各値に対して、対応する y の値は、平均応答α + βx に、平均的にゼロに等しい誤差項 と呼ばれる追加の確率変数ε を加えたものとして生成さ れます。このような解釈の下では、最小二乗推定量はα ^ {\displaystyle {\widehat {\alpha }}} そしてβ ^ {\displaystyle {\widehat {\beta }}} これらはそれ自体が確率変数であり、その平均値は「真の値」α とβ に等しくなります。これが不偏推定量の定義です。
平均応答の分散 この文脈ではデータは各観測値に対して( x , y ) のペアとして定義されているため、特定のx の値(例えばx d ) における平均応答 は、xの値x d における母集団のy 値の平均の推定値、 つまり、E ^ ( y ∣ x d ) ≡ y ^ d {\displaystyle {\hat {E}}(y\mid x_{d})\equiv {\hat {y}}_{d}\!} 平均応答の分散は次のように与えられます。[ 11 ]
バラ ( α ^ + β ^ x d ) = バラ ( α ^ ) + ( バラ β ^ ) x d 2 + 2 x d カバー ( α ^ 、 β ^ ) 。 {\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\operatorname {Var} \left({\hat {\alpha }}\right)+\left(\operatorname {Var} {\hat {\beta }}\right)x_{d}^{2}+2x_{d}\operatorname {Cov} \left({\hat {\alpha }},{\hat {\beta }}\right).}
この式は次のように簡略化できます。
バラ ( α ^ + β ^ x d ) = σ 2 ( 1 m + ( x d − x ¯ ) 2 ∑ ( x 私 − x ¯ ) 2 ) 、 {\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right),}
ここで、m はデータポイントの数である。
この簡略化を示すために、次の恒等式を用いることができる。
∑ 私 ( x 私 − x ¯ ) 2 = ∑ 私 x 私 2 − 1 m ( ∑ 私 x 私 ) 2 。 {\displaystyle \sum _{i}(x_{i}-{\bar {x}})^{2}=\sum _{i}x_{i}^{2}-{\frac {1}{m}}\left(\sum _{i}x_{i}\right)^{2}.}
予測応答の分散 予測応答分布は、与えられた点 x d における残差の予測分布です。したがって、分散は次のように与えられます。
バラ ( y d − [ α ^ + β ^ x d ] ) = バラ ( y d ) + バラ ( α ^ + β ^ x d ) − 2 カバー ( y d 、 [ α ^ + β ^ x d ] ) = バラ ( y d ) + バラ ( α ^ + β ^ x d ) 。 {\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)-2\operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)\\&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right).\end{aligned}}}
2行目は、カバー ( y d 、 [ α ^ + β ^ x d ] ) {\displaystyle \operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)} 新しい予測ポイントはモデルの適合に使用されたデータとは無関係であるため、ゼロになります。さらに、この項はバラ ( α ^ + β ^ x d ) {\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)} 平均応答については、先に計算済みである。
以来バラ ( y d ) = σ 2 {\displaystyle \operatorname {Var} (y_{d})=\sigma ^{2}} (推定可能な固定だが未知のパラメータ)予測応答の分散は次式で与えられる。
バラ ( y d − [ α ^ + β ^ x d ] ) = σ 2 + σ 2 ( 1 m + ( x d − x ¯ ) 2 ∑ ( x 私 − x ¯ ) 2 ) = σ 2 ( 1 + 1 m + ( x d − x ¯ ) 2 ∑ ( x 私 − x ¯ ) 2 ) 。 {\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\sigma ^{2}+\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)\\[4pt]&=\sigma ^{2}\left(1+{\frac {1}{m}}+{\frac {(x_{d}-{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right).\end{aligned}}}
信頼区間 前節で示した式を用いることで、α とβ の点推定値 、すなわち与えられたデータセットに対する回帰直線の係数を計算できます。しかし、これらの式は推定値の精度、つまり推定量がどの程度正確であるかを示していません。α ^ {\displaystyle {\widehat {\alpha }}} そしてβ ^ {\displaystyle {\widehat {\beta }}} 指定されたサンプルサイズであっても、サンプルごとに値が異なる。信頼区間は 、実験を非常に多数回繰り返した場合に得られるであろう推定値に対して、妥当な値の範囲を示すために考案された。
線形回帰係数の信頼区間を構築する標準的な方法は、正規性の仮定に基づいています。この仮定は、以下のいずれかの場合に正当化されます。
回帰における誤差は正規分布に 従う(いわゆる古典的回帰 仮定)、または 観測数n が十分に大きい場合、推定値は近似的に正規分布に従う。 後者のケースは中心極限定理 によって正当化される。
正規性の仮定 上記の最初の仮定、つまり誤差項の正規性の下では、傾き係数の推定値自体が平均β と分散の正規分布に従います。σ 2 / ∑ 私 ( x 私 − x ¯ ) 2 、 {\textstyle \sigma ^{2}\left/\sum _{i}(x_{i}-{\bar {x}})^{2}\right.,} ここでσ 2 は誤差項の分散です (通常の最小二乗法の証明を 参照)。同時に、二乗残差の合計Qは n − 2 の自由度でχ 2 に比例して分布し、独立しています。β ^ {\displaystyle {\widehat {\beta }}} これにより、 t 値を構築することができます。
t = β ^ − β s β ^ ~ t n − 2 、 {\displaystyle t={\frac {{\widehat {\beta }}-\beta }{s_{\widehat {\beta }}}}\ \sim \ t_{n-2},}
どこ
s β ^ = 1 n − 2 ∑ 私 = 1 n ε ^ 私 2 ∑ 私 = 1 n ( x 私 − x ¯ ) 2 {\displaystyle s_{\widehat {\beta }}={\sqrt {\frac {{\frac {1}{n-2}}\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}
は推定量の不偏標準誤差推定量である。 β ^ {\displaystyle {\widehat {\beta }}} 。
このt 値は、自由度n -2の t 分布に従います。これを用いて、 β の信頼区間を構築できます。
β ∈ [ β ^ − s β ^ t n − 2 * 、 β ^ + s β ^ t n − 2 * ] 、 {\displaystyle \beta \in \left[{\widehat {\beta }}-s_{\widehat {\beta }}t_{n-2}^{*},\ {\widehat {\beta }}+s_{\widehat {\beta }}t_{n-2}^{*}\right],}
信頼水準(1 − γ ) において、t n − 2 * {\displaystyle t_{n-2}^{*}} は( 1 − γ 2 ) -th {\displaystyle \scriptstyle \left(1\;-\;{\frac {\gamma }{2}}\right){\text{-th}}} t n −2 分布の分位点。例えば、γ = 0.05 の場合、信頼水準は95%です。
同様に、切片係数α の信頼区間は次のように与えられる。
α ∈ [ α ^ − s α ^ t n − 2 * 、 α ^ + s α ^ t n − 2 * ] 、 {\displaystyle \alpha \in \left[{\widehat {\alpha }}-s_{\widehat {\alpha }}t_{n-2}^{*},\ {\widehat {\alpha }}+s_{\widehat {\alpha }}t_{n-2}^{*}\right],}
信頼水準 (1 − γ ) において、
s α ^ = s β ^ 1 n ∑ 私 = 1 n x 私 2 = 1 n ( n − 2 ) ( ∑ 私 = 1 n ε ^ 私 2 ) ∑ 私 = 1 n x 私 2 ∑ 私 = 1 n ( x 私 − x ¯ ) 2 {\displaystyle s_{\widehat {\alpha }}=s_{\widehat {\beta }}{\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}x_{i}^{2}}}={\sqrt {{\frac {1}{n(n-2)}}\left(\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}\right){\frac {\sum _{i=1}^{n}x_{i}^{2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}}
米国の「失業率の変化-GDP成長率」の回帰分析結果(95%信頼区間付き)。 α とβ の信頼区間は、これらの回帰係数が最も可能性の高い位置にあるおおよその目安を与えてくれます。例えば、ここに示したオークンの法則 回帰では、点推定値は次のようになります。
α ^ = 0.859 、 β ^ = − 1.817。 {\displaystyle {\widehat {\alpha }}=0.859,\qquad {\widehat {\beta }}=-1.817.}
これらの推定値の95%信頼区間は次のとおりです。
α ∈ [ 0.76 、 0.96 ] 、 β ∈ [ − 2.06 、 − 1.58 ] 。 {\displaystyle \alpha \in \left[\,0.76,0.96\right],\qquad \beta \in \left[-2.06,-1.58\,\right].}
この情報を回帰直線の周りの信頼帯という形でグラフで表現するには、慎重に進めて推定量の同時分布を考慮する必要があります。信頼水準 (1 − γ ) では、信頼帯は次の式で与えられる双曲線形式になることが示されています[ 12 ] 。
( α + β ξ ) ∈ [ α ^ + β ^ ξ ± t n − 2 * ( 1 n − 2 ∑ ε ^ 私 2 ) ⋅ ( 1 n + ( ξ − x ¯ ) 2 ∑ ( x 私 − x ¯ ) 2 ) ] 。 {\displaystyle (\alpha +\beta \xi )\in \left[\,{\widehat {\alpha }}+{\widehat {\beta }}\xi \pm t_{n-2}^{*}{\sqrt {\left({\frac {1}{n-2}}\sum {\widehat {\varepsilon }}_{i}^{\,2}\right)\cdot \left({\frac {1}{n}}+{\frac {(\xi -{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)}}\,\right].}
モデルが切片が固定されていて 0 に等しいと仮定した場合 (α = 0 {\displaystyle \alpha =0} ) 傾きの標準誤差は次のようになります。
s β ^ = 1 n − 1 ∑ 私 = 1 n ε ^ 私 2 ∑ 私 = 1 n x 私 2 {\displaystyle s_{\widehat {\beta }}={\sqrt {{\frac {1}{n-1}}{\frac {\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}x_{i}^{2}}}}}}
と:ε ^ 私 = y 私 − y ^ 私 {\displaystyle {\hat {\varepsilon }}_{i}=y_{i}-{\hat {y}}_{i}}
漸近仮定 もう一つの仮定は、データセットの点数が「十分に大きい」場合、大数の法則 と中心極限定理が 適用可能となり、推定量の分布がほぼ正規分布になるというものです。この仮定の下では、前のセクションで導出されたすべての式が有効ですが、唯一の例外として、スチューデントの t 分布の分位数t* n −2が標準正規分布 の分位数q* に置き換えられます。場合によっては、分数1 / n −2 が 1 / n に置き換えられます。n が 大きい場合、この ような変更は結果を大きく変えません。
数値例 このデータセットは、30歳から39歳のアメリカ人女性のサンプルにおける、身長に対する女性の平均体重を示しています。OLSに関する記事では、この データには二次回帰分析を行う方が適切であると主張していますが、ここでは代わりに単純線形回帰モデルを適用します。
このデータセットにはn = 15個のデータポイントが含まれています。手計算は、まず以下の5つの合計を求めることから始まります。
S x = ∑ 私 x 私 = 24.76 、 S y = ∑ 私 y 私 = 931.17 、 S x x = ∑ 私 x 私 2 = 41.0532 、 S y y = ∑ 私 y 私 2 = 58498.5439 、 S x y = ∑ 私 x 私 y 私 = 1548.2453 {\displaystyle {\begin{aligned}S_{x}&=\sum _{i}x_{i}\,=24.76,&\qquad S_{y}&=\sum _{i}y_{i}\,=931.17,\\[5pt]S_{xx}&=\sum _{i}x_{i}^{2}=41.0532,&\;\;\,S_{yy}&=\sum _{i}y_{i}^{2}=58498.5439,\\[5pt]S_{xy}&=\sum _{i}x_{i}y_{i}=1548.2453&\end{aligned}}}
これらの数値は、回帰係数の推定値とその標準誤差を計算するために使用されます。
β ^ = n S x y − S x S y n S x x − S x 2 = 61.272 α ^ = 1 n S y − β ^ 1 n S x = − 39.062 s ε 2 = 1 n ( n − 2 ) [ n S y y − S y 2 − β ^ 2 ( n S x x − S x 2 ) ] = 0.5762 s β ^ 2 = n s ε 2 n S x x − S x 2 = 3.1539 s α ^ 2 = s β ^ 2 1 n S x x = 8.63185 {\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {nS_{xy}-S_{x}S_{y}}{nS_{xx}-S_{x}^{2}}}=61.272\\[8pt]{\widehat {\alpha }}&={\frac {1}{n}}S_{y}-{\widehat {\beta }}{\frac {1}{n}}S_{x}=-39.062\\[8pt]s_{\varepsilon }^{2}&={\frac {1}{n(n-2)}}\left[nS_{yy}-S_{y}^{2}-{\widehat {\beta }}^{2}(nS_{xx}-S_{x}^{2})\right]=0.5762\\[8pt]s_{\widehat {\beta }}^{2}&={\frac {ns_{\varepsilon }^{2}}{nS_{xx}-S_{x}^{2}}}=3.1539\\[8pt]s_{\widehat {\alpha }}^{2}&=s_{\widehat {\beta }}^{2}{\frac {1}{n}}S_{xx}=8.63185\end{aligned}}}
単純線形回帰の数値例における点と最小二乗直線のグラフ 自由度13のスチューデントのt 分布の0.975分位点はt * 13 = 2.1604であり、したがってα とβ の95%信頼区間は次のようになる。
α ∈ [ α ^ ∓ t 13 * s α ^ ] = [ − 45.4 、 − 32.7 ] β ∈ [ β ^ ∓ t 13 * s β ^ ] = [ 57.4 、 65.1 ] {\displaystyle {\begin{aligned}&\alpha \in [\,{\widehat {\alpha }}\mp t_{13}^{*}s_{\widehat {\alpha }}\,]=[\,{-45.4},\ {-32.7}\,]\\[5pt]&\beta \in [\,{\widehat {\beta }}\mp t_{13}^{*}s_{\widehat {\beta }}\,]=[\,57.4,\ 65.1\,]\end{aligned}}}
積率相関係数 も計算できる。
r ^ = n S x y − S x S y ( n S x x − S x 2 ) ( n S y y − S y 2 ) = 0.9946 {\displaystyle {\widehat {r}}={\frac {nS_{xy}-S_{x}S_{y}}{\sqrt {(nS_{xx}-S_{x}^{2})(nS_{yy}-S_{y}^{2})}}}=0.9946}
代替案 二乗誤差を最小化することによって、線形モデルのパラメータを計算する。 SLRでは、従属変数のみに測定誤差が含まれているという前提があります。説明変数も誤差を伴って測定されている場合、回帰希釈 によりバイアスが生じるため、単純回帰は根本的な関係を推定するのに適していません。
通常の最小二乗法の代わりに使用できる他の推定方法としては、最小絶対偏差法 (残差の絶対値の合計を最小化する)や、テイル・セン推定量 (標本点のペアによって決定される傾きのメディアンとなる 傾き を持つ直線を選択する)などがある。
デミング回帰 (全最小二乗法)も、2 次元のサンプル点のセットに適合する直線を見つけますが、(通常の最小二乗法、最小絶対偏差法、中央値傾斜回帰とは異なり)座標を 1 つの従属変数と 1 つの独立変数に分離しないため、単純な線形回帰の例ではありません。また、適合結果として垂直線を返す可能性もあります。この方法は、データよりも外れ値に適合しようとするモデルにつながる可能性があります。
ラインフィッティング 直線近似と は、一連のデータ点に最もよく適合する直線 を構築するプロセスである。
考慮すべきいくつかの方法が存在する。
切片項を含まない単純線形回帰(単一説明変数)x とy が比例関係にあると仮定される場合、回帰直線が原点を通るように強制することが適切な場合もあります。切片項のないモデル、y = βx の場合、 β のOLS推定量は次のように簡略化されます。
β ^ = ∑ 私 = 1 n x 私 y 私 ∑ 私 = 1 n x 私 2 = x y ¯ x 2 ¯ {\displaystyle {\widehat {\beta }}={\frac {\sum _{i=1}^{n}x_{i}y_{i}}{\sum _{i=1}^{n}x_{i}^{2}}}={\frac {\overline {xy}}{\overline {x^{2}}}}}
( x , y ) の代わりに( x − h , y − k ) を代入すると、 ( h , k ) を通る回帰式が得られます。
β ^ = ∑ 私 = 1 n ( x 私 − h ) ( y 私 − k ) ∑ 私 = 1 n ( x 私 − h ) 2 = ( x − h ) ( y − k ) ¯ ( x − h ) 2 ¯ = x y ¯ − k x ¯ − h y ¯ + h k x 2 ¯ − 2 h x ¯ + h 2 = x y ¯ − x ¯ y ¯ + ( x ¯ − h ) ( y ¯ − k ) x 2 ¯ − x ¯ 2 + ( x ¯ − h ) 2 = カバー ( x 、 y ) + ( x ¯ − h ) ( y ¯ − k ) バラ ( x ) + ( x ¯ − h ) 2 、 {\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-h)(y_{i}-k)}{\sum _{i=1}^{n}(x_{i}-h)^{2}}}={\frac {\overline {(x-h)(y-k)}}{\overline {(x-h)^{2}}}}\\[6pt]&={\frac {{\overline {xy}}-k{\bar {x}}-h{\bar {y}}+hk}{{\overline {x^{2}}}-2h{\bar {x}}+h^{2}}}\\[6pt]&={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}+({\bar {x}}-h)({\bar {y}}-k)}{{\overline {x^{2}}}-{\bar {x}}^{2}+({\bar {x}}-h)^{2}}}\\[6pt]&={\frac {\operatorname {Cov} (x,y)+({\bar {x}}-h)({\bar {y}}-k)}{\operatorname {Var} (x)+({\bar {x}}-h)^{2}}},\end{aligned}}}
ここで、CovとVarは、サンプルデータの共分散と分散(バイアス補正なし)を表します。上記の最後の式は、データ点の重心から線を離すと傾きにどのような影響があるかを示しています。
参考文献 ↑ Seltman, Howard J. (2008-09-08).実験計画と分析 (PDF) . p. 227. ↑ 「統計的サンプリングと回帰:単純線形回帰」 コロンビア大学。 2016年10月17日 取得 。 回帰分析で独立変数が1つだけ使用される場合、それは単純回帰と呼ばれます。(...) ↑ Lane, David M. 統計学入門 (PDF) . p. 462. ↑ Zou KH; Tuncali K; Silverman SG (2003). "相関と単純線形回帰" . Radiology . 227 (3): 617– 22. doi : 10.1148/radiol.2273011499 . ISSN 0033-8419 . OCLC 110941167 . PMID 12773666 . ↑ Altman, Naomi; Krzywinski, Martin (2015). "単純線形回帰" . Nature Methods . 12 (11): 999– 1000. doi : 10.1038/nmeth.3627 . ISSN 1548-7091 . OCLC 5912005539 . PMID 26824102 . S2CID 261269711 . ↑ Kenney, JF および Keeping, ES (1962) 「線形回帰と相関」『統計学の数学 』第 1 部、第 3 版、第 15 章、プリンストン、ニュージャージー州: Van Nostrand、pp. 252–285 1 2 Muthukrishnan, Gowri (2018年6月17日). "多項式回帰の背後にある数学、Muthukrishnan" . 多項式回帰の背後にある数学. 2024年 1月30日 取得 . ↑ 「多項式回帰の数学」 。 多項式回帰、PHP 回帰クラス 。 ↑ 「数的理解、数学、統計学 - アカデミックスキルキット、ニューカッスル大学」 。 単純線形回帰 。 2024年 1月30日 取得。 ↑ ヴァリアント、リチャード、ジル A. デヴァー、フラウケ クロイター。調査サンプルの設計と重み付けのための実践的なツール。ニューヨーク:スプリンガー、2013 年。 ↑ Draper, NR; Smith, H. (1998). 応用回帰分析 (第3 版). John Wiley. ISBN 0-471-17082-8 。↑ Casella, G. および Berger, RL (2002)、「統計的推論」(第 2 版)、Cengage、 ISBN 978-0-534-24312-8 、558~559ページ。
外部リンク Wolfram MathWorldによる最小二乗法の説明と計算方法 単純回帰の数学(ロバート・ナウ、デューク大学)