統計学において、説明二乗和( ESS ) は、モデル二乗和または回帰二乗和( SSR –残差二乗和(RSS) または誤差二乗和と混同しないでください) とも呼ばれ、モデル (多くの場合は回帰モデル) がモデル化されているデータをどの程度適切に表しているかを説明するために使用される数量です。特に、説明二乗和はモデル化された値にどれだけの変動があるかを測定し、これが観測データにどれだけの変動があるかを測定する総二乗和(TSS) および観測データとモデル化された値間の誤差の変動を測定する残差二乗和と比較されます。
意味
説明二乗和 (ESS) は、標準的な回帰モデルにおける応答変数の平均値からの予測値の偏差の二乗の合計です。たとえば、y i = a + b 1 x 1 i + b 2 x 2 i + ... + ε iです。ここで、y i は応答変数のi 番目の観測値、x jiはj番目の説明変数のi番目の観測値、aとb jは係数、i は1 からnまでの観測値のインデックス、ε i は誤差項のi番目の値です。一般に、ESS が大きいほど、推定モデルのパフォーマンスは向上します。
およびが推定係数である場合、
応答変数のi 番目の予測値です。ESS は次のようになります。
- ここで、は回帰直線によって推定された値である。[1]
いくつかのケースでは(下記参照):総二乗和 (TSS)=説明二乗和(ESS)+残差二乗和 (RSS)。
単純線形回帰における分割
総二乗和 (TSS) は残差二乗和 (=SSE: 予測値の二乗誤差の合計) と説明二乗和 (SSR: 回帰による二乗和または説明二乗和) の合計に等しいという次の等式は、一般に単純線形回帰では当てはまります。
簡単な導出
両辺を二乗し、全体を合計します 。
上記の最後の項が単純な線形回帰からゼロになる理由は次のとおりです[2]
それで、
したがって、
一般的な最小二乗モデルにおける分割
n個の観測値とk個の説明変数を持つ一般的な回帰モデルは、最初の説明変数が定数単位ベクトルであり、その係数は回帰切片である。
ここで、yは従属変数の観測値のn ×1ベクトル、n × k行列Xの各列はk個の説明変数のうちの1つに関する観測値のベクトル、は真の係数のk ×1ベクトル、eは真の根底にある誤差のn ×1ベクトルである。の通常の最小二乗推定量は、
残差ベクトルはなので、簡略化後の残差二乗和は、
を定数ベクトルとして表し、そのすべての要素はベクトルyの従属変数値の標本平均である。すると、総二乗和は
説明二乗和は、予測値と観測平均値yの偏差の二乗和として定義され、
これに を使用し、簡略化して を得ると、の場合に限り、TSS = ESS + RSSという結果になります。 この式の左辺はyの要素の合計を掛けたもので、右辺はの要素の合計を掛けたものなので、条件はyの要素の合計が の要素の合計に等しい、つまり予測誤差(残差)の合計がゼロになるというものです。 これは、 k × 1 ベクトルというよく知られた OLS プロパティに注目することで真であることがわかります。X の最初の列は 1 のベクトルなので、このベクトルの最初の要素は残差の合計であり、 はゼロに等しくなります。 これは、 TSS = ESS + RSSという結果に対して条件が成り立つことを証明しています。
線形代数では、、、となります。証明は、 と記すことで簡略化できます。証明は次のとおりです。
したがって、
これによって、TSS = ESS + RSSという結果が再び得られます。
参照
注記
- ^ 「平方和 - 定義、公式、回帰分析」。Corporate Finance Institute 。 2020年6月11日閲覧。
- ^ メンデンホール、ウィリアム (2009)。確率と統計入門(第 13 版)。カリフォルニア州ベルモント: ブルックス/コール。p. 507。ISBN 9780495389538。
参考文献
- SE Maxwell および HD Delaney (1990)、「実験の設計とデータの分析: モデル比較の観点」。Wadsworth。pp. 289–290。
- GA ミリケンと DE ジョンソン (1984)、「乱雑なデータの分析」、第 1 巻: 計画された実験。ヴァン ノストランド ラインホールド。pp. 146–151。
- BG Tabachnick および LS Fidell (2007)、「ANOVA を使用した実験デザイン」。Duxbury。p. 220。
- BG Tabachnick および LS Fidell (2007)、「多変量統計の使用」、第 5 版、Pearson Education。pp. 217–218。
