統計学において、説明変動とは、数学モデルが与えられたデータセットの変動(分散)をどの程度説明できるかを示す指標です。多くの場合、変動は分散として定量化されるため、より具体的な用語である説明分散を用いることができます。
全変動の補完的な部分は、説明不能な変動または残差変動と呼ばれます。同様に、分散そのものについて議論する場合、これは説明不能な分散または残差分散と呼ばれます。
ケント(1983)[ 1 ]に倣い、フレーザーの情報(フレーザー 1965)[ 2 ]を使用する。
どこ確率変数の確率密度、 そしてと(は、2 つのパラメトリック モデルファミリーです。モデルファミリー 0 は、パラメータ空間が制限された、より単純なモデルです。。
パラメータは最尤推定によって決定されます。
モデル1のモデル0に対する情報利得は次のように表される。
便宜上、係数 2 が含まれています。Γ は常に非負であり、g ( r ) を説明する上で、ファミリー 1 の最良モデルがファミリー 0 の最良モデルよりも優れている度合いを測定します。
2次元の確率変数を仮定するここで、Xは説明変数、 Yは従属変数とみなされる。ファミリー1のモデルは、 Xの観点からYを「説明」する。
一方、ファミリー0では、XとYは独立であると仮定される。Yのランダム性は次のように定義される。、そして、 Xが与えられたときのYのランダム性は、。 それから、
これは、 Xによって「説明される」データ分散の割合として解釈できます。
説明されない分散の割合は、線形回帰の文脈では確立された概念である。決定係数の一般的な定義は、説明される分散という基本的な概念に基づいている。
Xをランダムベクトルとし、Yを中心とする正規分布でモデル化されるランダム変数とする。この場合、上記で導出された説明された変動の割合は相関係数の二乗に等しい。
モデルの強い仮定に注意してください。Y分布の中心はXの線形関数でなければならず、任意のxに対してY分布は正規分布でなければなりません。その他の状況では、一般的に解釈することは正当化されません。説明された分散の割合として。
説明分散は主成分分析において日常的に用いられる。しかし、フレーザー・ケント情報利得との関係はまだ解明されていない。
「説明された分散」の割合は相関係数の二乗に等しいので後者の欠点をすべて共有している。回帰の質だけでなく、独立変数(条件変数)の分布も反映する。
ある批評家の言葉を借りれば、「回帰分析によって説明される「分散の割合」を示すが、この表現はほとんどの社会科学者にとって意味が疑わしいものの、修辞的な価値は非常に高い。この数値が大きい場合、回帰分析は良好な適合を示し、追加の変数を探す意味はほとんどない。異なるデータセットに対する他の回帰方程式は、その低い。 これらの主張を裏付けている」[ 3 ]: 58そして、例を構築した後、2つの異なる集団からのデータを共同で考慮するだけで強化される。「説明された分散は何も説明しない。」[ 3 ] [ 4 ]: 183