データポイントに対するモデルの適合度は、残差 によって測定されます。r 私 \displaystyle r_{i}} 従属変数の測定値と、y 私 \displaystyle y_{i}} そしてモデルによって予測された値、f ( x 私 、 β ) {\displaystyle f(x_{i},{\boldsymbol {\beta }})} : r 私 ( β ) = y 私 − f ( x 私 、 β ) 。 {\displaystyle r_{i}({\boldsymbol {\beta }})=y_{i}-f(x_{i},{\boldsymbol {\beta }}).}
誤差が無相関で分散が等しい場合、関数は S ( β ) = ∑ 私 r 私 ( β ) 2 、 {\displaystyle S({\boldsymbol {\beta }})=\sum _{i}r_{i}({\boldsymbol {\beta }})^{2},} 最小化されるのはβ ^ {\displaystyle {\boldsymbol {\hat {\beta }}}} 、したがって∂ S ∂ β j ( β ^ ) = 0 \displaystyle {\frac {\partial S}{\partial \beta _{j}}}({\hat {\boldsymbol {\beta }}})=0} 。
ガウス・マルコフの定理 によれば、この場合には、β ^ {\displaystyle {\hat {\boldsymbol {\beta }}}} は最良線形不偏推定量 (BLUE )です。ただし、測定値が無相関であっても不確実性が異なる場合は、修正されたアプローチが採用される可能性があります。エイトケンは 、残差の二乗の重み付き和が最小化される場合、β ^ {\displaystyle {\hat {\boldsymbol {\beta }}}} 各重みが測定値の分散の逆数に等しい場合、 BLUE はS = ∑ 私 = 1 n W 私 私 r 私 2 、 W 私 私 = 1 σ 私 2 {\displaystyle {\begin{aligned}S&=\sum _{i=1}^{n}W_{ii}{r_{i}}^{2},&W_{ii}&={\frac {1}{{\sigma _{i}}^{2}}}\end{aligned}}}
この二乗和の勾配方程式は次のとおりです。 − 2 ∑ 私 W 私 私 ∂ f ( x 私 、 β ) ∂ β j r 私 = 0 、 j = 1 、 … 、 m {\displaystyle -2\sum _{i}W_{ii}{\frac {\partial f(x_{i},{\boldsymbol {\beta }})}{\partial \beta _{j}}}r_{i}=0,\quad j=1,\ldots ,m}
線形最小二乗システムでは、修正正規方程式 が得られる。 ∑ 私 = 1 n ∑ k = 1 m X 私 j W 私 私 X 私 k β ^ k = ∑ 私 = 1 n X 私 j W 私 私 y 私 、 j = 1 、 … 、 m 。 {\displaystyle \sum _{i=1}^{n}\sum _{k=1}^{m}X_{ij}W_{ii}X_{ik}{\hat {\beta }}_{k}=\sum _{i=1}^{n}X_{ij}W_{ii}y_{i},\quad j=1,\ldots ,m\,.} マトリックスX {\displaystyle X} 上記は、線形最小二乗法の対応する説明 で定義されているとおりです。
観測誤差が無相関で、重み行列 W = Ω −1 が対角行列である場合、これら は 次の よう に記述できます。 ( X T W X ) β ^ = X T W y 。 {\displaystyle \mathbf {\left(X^{\textsf {T}}WX\right){\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}Wy} .}
誤差が相関している場合、重み行列が観測値の分散共分散行列 の逆行列と等しい場合、得られる推定量はBLUEとなる。
誤差が無相関の場合、計算を簡略化して重み行列を因数分解すると便利です。w 私 私 = W 私 私 {\displaystyle w_{ii}={\sqrt {W_{ii}}}} 正規方程式は、通常の最小二乗法と同じ形式で記述できます。 ( X ′ T X ′ ) β ^ = X ′ T y ′ {\displaystyle \mathbf {\left(X'^{\textsf {T}}X'\right){\hat {\boldsymbol {\beta }}}=X'^{\textsf {T}}y'} \,}
ここで、以下のスケーリングされた行列とベクトルを定義します。 X ′ = 診断 ( w ) X 、 y ′ = 診断 ( w ) y = y ⊘ σ 。 {\displaystyle {\begin{aligned}\mathbf {X'} &=\operatorname {diag} \left(\mathbf {w} \right)\mathbf {X} ,\\\mathbf {y'} &=\operatorname {diag} \left(\mathbf {w} \right)\mathbf {y} =\mathbf {y} \oslash \mathbf {\sigma } .\end{aligned}}}
これは一種のホワイトニング変換 です。最後の式は、エントリごとの除算 を含みます。
非線形最小二乗 システムの場合も同様の議論により、正規方程式は次のように修正する必要があることが示される。 ( J T W J ) Δ β = J T W Δ y 。 {\displaystyle \mathbf {\left(J^{\textsf {T}}WJ\right)\,{\boldsymbol {\Delta }}\beta =J^{\textsf {T}}W\,{\boldsymbol {\Delta }}y} .\,}
経験的検定においては、適切なWの値 は確実には分かっておらず、推定する必要があることに注意してください。このために、実行可能一般化最小二乗 法(FGLS)を用いることができます。この場合、FGLSは対角共分散行列に特化しており、実行可能な重み付き最小二乗解が得られます。
観測値の不確実性が外部の情報源から不明な場合は、与えられた観測値から重みを推定することができます。これは、例えば外れ値を特定するのに役立ちます。外れ値がデータセットから削除された後、重みは1にリセットする必要があります。[ 3 ]
モチベーション 場合によっては、観測値に重み付けをする必要があるかもしれません。例えば、観測値の信頼性が等しくない場合などです。このような場合、重み付き二乗和を最小化することができます。 1 r g m 私 n β ∑ 私 = 1 n w 私 | y 私 − ∑ j = 1 m X 私 j β j | 2 = 1 r g m 私 n β ‖ W 1 2 ( y − X β ) ‖ 2 。 {\displaystyle {\underset {\boldsymbol {\beta }}{\operatorname {arg\ min} }}\,\sum _{i=1}^{n}w_{i}\left|y_{i}-\sum _{j=1}^{m}X_{ij}\beta _{j}\right|^{2}={\underset {\boldsymbol {\beta }}{\operatorname {arg\ min} }}\,\left\|W^{\frac {1}{2}}\left(\mathbf {y} -X{\boldsymbol {\beta }}\right)\right\|^{2}.} ここで、w i > 0 はi 番目の観測値の重みであり、W はそのような重みの対角行列 である。
重みは、理想的には測定値の分散 の逆数 に等しくなければなりません。(これは、観測値が無相関であることを意味します。観測値が相関して いる場合は、式はS = ∑ k ∑ j r k W k j r j {\textstyle S=\sum _{k}\sum _{j}r_{k}W_{kj}r_{j}\,} が適用される。この場合、重み行列は理想的には観測値の分散共分散行列 の逆行列と等しくなるはずである。[ 3 ] 正規方程式は次のようになる。 ( X T W X ) β ^ = X T W y 。 {\displaystyle \left(X^{\textsf {T}}WX\right){\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}W\mathbf {y} .}
この方法は、反復重み付き最小二乗法 で使用されます。
解決
パラメータの信頼限界 具体的な証拠がないため、中心極限定理( 正規分布#発生と応用を 参照)に依拠し て、各観測値の誤差は平均ゼロ、標準偏差σの正規分布 に従うと仮定されることが多い。σ {\displaystyle \sigma } この仮定の下では、単一のスカラーパラメータ推定値について、その推定標準誤差の観点から以下の確率を導出することができる。s e β {\displaystyle se_{\beta }} (ここに 記載)
68%がその間隔β ^ ± s e β {\displaystyle {\hat {\beta }}\pm se_{\beta }} 真の係数値を包含する 95%の確率でその区間はβ ^ ± 2 s e β {\displaystyle {\hat {\beta }}\pm 2se_{\beta }} 真の係数値を包含する 99%の確率でその区間はβ ^ ± 2.5 s e β {\displaystyle {\hat {\beta }}\pm 2.5se_{\beta }} 真の係数値を包含する n >> m の場合、この仮定は不合理ではありません。実験誤差が正規分布に従う場合、パラメータは自由度 n − mの スチューデントの t 分布 に従います。n ≫ m の場合、 スチューデント のt 分布は正規分布に近似します。ただし、これらの信頼限界は系統誤差を考慮に入れることができないことに注意してください。また、パラメータ誤差は標本誤差の 影響を受けるため、有効数字 1 桁でのみ表示する必要があります。[ 4 ]
観測数が比較的少ない場合、実験誤差の分布に関する仮定に関係なく、チェビシェフの不等式を 確率の上限として使用できます。パラメータが期待値から1、2、または3標準偏差以上離れる最大確率は、それぞれ100%、25%、および11%です。
残差値と相関 残差は 観測値と次のように関連付けられます。 r ^ = y − X β ^ = y − H y = ( 私 − H ) y 、 {\displaystyle \mathbf {\hat {r}} =\mathbf {y} -X{\hat {\boldsymbol {\beta }}}=\mathbf {y} -H\mathbf {y} =(I-H)\mathbf {y} ,}
ここで、H はハット行列 として知られる冪等行列 である。 H = X ( X T W X ) − 1 X T W 、 {\displaystyle H=X\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}W,}
Iは 単位行列 である。残差の分散共分散行列M r は次のように与えられる。 M r = ( 私 − H ) M ( 私 − H ) T 。 {\displaystyle M^{\mathbf {r} }=(I-H)M(I-H)^{\textsf {T}}.}
したがって、観測値自体に相関がなくても、残差には相関がある。
いつW = M − 1 {\displaystyle W=M^{-1}} 、 M r = ( 私 − H ) M 。 {\displaystyle M^{\mathbf {r} }=(I-H)M.}
モデル関数に定数項が含まれる場合、重み付き残差値の合計はゼロになります。残差の式にX T W T を左から乗算します。 X T W r ^ = X T W y − X T W X β ^ = X T W y − ( X T W X ) ( X T W X ) − 1 X T W y = 0 。 {\displaystyle X^{\textsf {T}}W{\hat {\mathbf {r} }}=X^{\textsf {T}}W\mathbf {y} -X^{\textsf {T}}WX{\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}W\mathbf {y} -\left(X^{\rm {T}}WX\right)\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}W\mathbf {y} =\mathbf {0} .}
例えば、モデルの最初の項が定数であるとすると、X 私 1 = 1 {\displaystyle X_{i1}=1} すべてのi について。この場合、次のことが導かれる。 ∑ 私 m X 私 1 W 私 r ^ 私 = ∑ 私 m W 私 r ^ 私 = 0. {\displaystyle \sum _{i}^{m}X_{i1}W_{i}{\hat {r}}_{i}=\sum _{i}^{m}W_{i}{\hat {r}}_{i}=0.}
したがって、上記の動機付けの例では、残差値の合計がゼロになるという事実は偶然ではなく、モデルに定数項αが存在することの結果である。
実験誤差が正規分布 に従う場合、残差と観測値の間には線形関係があるため、残差も正規分布に従うはずですが、[ 5 ] 観測値はすべての可能な観測値の母集団のサンプルにすぎないため、残差はスチューデントのt分布 に従うはずです。スチューデント化された残差は、特定の残差が過度に大きいように見える場合に 外れ値 の統計的検定を行うのに役立ちます。
参考文献 ↑ 「加重回帰」 。 2022年4月21日にオリジナルからアーカイブ済み。2018年10月16日 に取得。 ↑ 「加重回帰を視覚化する」 。 1 2 Strutz, T. (2016). "3". データフィッティングと不確実性(重み付き最小二乗法とその先への実践的入門) . Springer Vieweg. ISBN 978-3-658-11455-8 。↑ マンデル、ジョン (1964). 実験データの統計分析 . ニューヨーク: インターサイエンス. ↑ Mardia, KV; Kent, JT; Bibby, JM (1979). 多変量解析 . ニューヨーク: Academic Press. ISBN 0-12-471250-9 。