確率論における定理
確率論 における 全分散の法則 [ 1] 、 分散分解公式 、 条件付き分散公式 、 反復分散の法則( イヴの法則 としても知られる ) [2] は、 とが 同じ 確率空間上の ランダム変数 であり 、 の 分散 が有限である場合、
バツ
{\displaystyle X}
はい
{\displaystyle Y}
はい
{\displaystyle Y}
ヴァール
(
はい
)
=
え
[
ヴァール
(
はい
∣
バツ
)
]
+
ヴァール
(
え
[
はい
∣
バツ
]
)
。
{\displaystyle \operatorname {Var} (Y)=\operatorname {E} [\operatorname {Var} (Y\mid X)]+\operatorname {Var} (\operatorname {E} [Y\mid X]).}
確率論者よりも統計学者によく知られている言葉で言えば、この2つの用語はそれぞれ分散の「説明されない」要素と「説明される」要素である( 説明されない分散の割合 、 説明される変動 を参照)。 保険数理科学 、特に 信頼性理論 では、最初の要素はプロセス分散の期待値( EVPV )、2番目は仮説的平均の分散( VHM )と呼ばれる。 [3] これら2つの要素は、「分散の期待値」と「期待値の分散」の頭文字EV VEから「イブの法則」という用語の由来でもある。
説明
上記の式を理解するには、ランダム変数 とを理解する必要があります。これらの変数は 、 与えられた に対して の値に依存し 、 は定数です。基本的に、 の可能な値を使用して 結果をグループ化し、各グループの期待値と分散を計算します。
え
[
はい
|
バツ
]
{\displaystyle \operatorname {E} [Y|X]}
ヴァール
(
はい
|
バツ
)
{\displaystyle \operatorname {Var} (Y|X)}
バツ
{\displaystyle X}
x
{\displaystyle x}
え
[
はい
|
バツ
=
x
]
{\displaystyle \operatorname {E} [Y|X=x]}
ヴァール
(
はい
|
バツ
=
x
)
{\displaystyle \operatorname {Var} (Y|X=x)}
バツ
{\displaystyle X}
「説明できない」要素は、 各グループ内の のすべての分散の平均です。 「説明できる」要素 は、期待値の分散です。つまり、各グループの の平均値の変動によって説明される分散の部分を表します 。
え
(
ヴァール
[
はい
|
バツ
]
)
{\displaystyle \operatorname {E} (\operatorname {Var} [Y|X])}
はい
{\displaystyle Y}
ヴァール
(
え
[
はい
|
バツ
]
)
{\displaystyle \operatorname {Var} (\operatorname {E} [Y|X])}
はい
{\displaystyle Y}
犬種別の体重
例として、ドッグショーの例を考えてみましょう ( Analysis_of_variance#Example から抜粋 )。ランダム変数を 犬の体重に対応させ、 犬種に対応させます。この状況では、犬種の平均体重に大きなばらつきがあるため、犬種が体重のばらつきの大部分を説明すると予想するのが妥当です。もちろん、犬種ごとに体重に多少のばらつきはありますが、これは「説明できない」項で考慮されます。
はい
{\displaystyle Y}
バツ
{\displaystyle X}
「説明される」という用語は、実際には「平均値によって説明される」という意味であることに注意してください。固定された各変数 (上記の例では各品種) の差異が非常に異なる場合、それらの差異は「説明されない」という用語にまとめられます。
バツ
{\displaystyle X}
例
例1
大学院生 5 名が 0 から 100 までで採点される試験を受けます。 は 学生の成績を表し、 は 学生が国際学生か国内学生かを示します。 データは次のようにまとめられます。
はい
{\displaystyle Y}
バツ
{\displaystyle X}
留学生の場合、平均は 、分散は です 。
え
[
はい
|
バツ
=
国際的
]
=
50
{\displaystyle \operatorname {E} [Y|X={\text{国際}}]=50}
ヴァール
(
はい
|
バツ
=
国際的
)
=
3800
3
=
1266年。
6
¯
{\displaystyle \operatorname {Var} (Y|X={\text{International}})={\frac {3800}{3}}=1266.{\overline {6}}}
国内の学生の平均は 、分散は です 。
え
[
はい
|
バツ
=
国内
]
=
50
{\displaystyle \operatorname {E} [Y|X={\text{国内}}]=50}
ヴァール
(
はい
|
バツ
=
国内
)
=
100
{\displaystyle \operatorname {Var} (Y|X={\text{国内}})=100}
「説明できない」 の分散の による部分は 、各グループの分散の平均です。この場合、 です。 「説明できる」 の分散の による部分は、 の値によって定義される各グループ内の の平均の分散です 。この場合、平均は各グループで同じなので、 はゼロです。したがって、全体の分散は次のようになります。
はい
{\displaystyle Y}
バツ
{\displaystyle X}
(
3
5
)
(
3800
3
)
+
(
2
5
)
(
100
)
=
800
{\displaystyle \left({\frac {3}{5}}\right)\left({\frac {3800}{3}}\right)+\left({\frac {2}{5}}\right)(100)=800}
はい
{\displaystyle Y}
バツ
{\displaystyle X}
はい
{\displaystyle Y}
バツ
{\displaystyle X}
ヴァール
(
はい
)
=
え
[
ヴァール
(
はい
|
バツ
)
]
+
ヴァール
(
え
[
はい
|
バツ
]
)
=
800
+
0
=
800。
{\displaystyle \operatorname {Var} (Y)=\operatorname {E} [\operatorname {Var} (Y|X)]+\operatorname {Var} (\operatorname {E} [Y|X])=800+0=800.}
例2
X がコイン投げで、表が出る可能性が h であるとします 。 X が表 のとき、 Y は 平均 μ h 、標準偏差 σ h の正規分布 から抽出され 、 X が裏の とき、 Y は平均 μ t 、標準偏差 σ t の正規分布から抽出されるとします 。この場合、上記の式の右側にある最初の「説明されていない」項は、分散の加重平均 hσ h 2 + (1 − h ) σ t 2 であり、2 番目の「説明されている」項は、確率 hで μ h を 与え、 確率 1 − hで μ t を 与える分布の分散です 。
成分に対する一般的な分散分解式がある (下記参照)。 [4] 例えば、2つの条件付きランダム変数の場合:
これは全条件付き分散の法則に従う: [4]
c
≥
2
{\displaystyle c\geq 2}
ヴァール
[
はい
]
=
え
[
ヴァール
(
はい
∣
バツ
1
、
バツ
2
)
]
+
え
[
ヴァール
(
え
[
はい
∣
バツ
1
、
バツ
2
]
∣
バツ
1
)
]
+
ヴァール
(
え
[
はい
∣
バツ
1
]
)
、
{\displaystyle \operatorname {Var} [Y]=\operatorname {E} \left[\operatorname {Var} \left(Y\mid X_{1},X_{2}\right)\right]+\operatorname {E} [\operatorname {Var} (\operatorname {E} \left[Y\mid X_{1},X_{2}\right]\mid X_{1})]+\operatorname {Var} (\operatorname {E} \left[Y\mid X_{1}\right]),}
Var
(
Y
∣
X
1
)
=
E
[
Var
(
Y
∣
X
1
,
X
2
)
∣
X
1
]
+
Var
(
E
[
Y
∣
X
1
,
X
2
]
∣
X
1
)
.
{\displaystyle \operatorname {Var} (Y\mid X_{1})=\operatorname {E} \left[\operatorname {Var} (Y\mid X_{1},X_{2})\mid X_{1}\right]+\operatorname {Var} \left(\operatorname {E} \left[Y\mid X_{1},X_{2}\right]\mid X_{1}\right).}
条件付き期待値は、 それ自体がランダム変数であり、その値は の値に依存することに 注意してください。 イベント が与えられた場合 の の条件付き期待値は の関数であることに注意してください (これが、確率論の従来の、大文字と小文字を厳密に区別する表記法に従うことが重要になるところです)。 と書くと 、ランダム変数 はになります。同様のコメントが 条件付き分散 にも当てはまります 。
E
(
Y
∣
X
)
{\displaystyle \operatorname {E} (Y\mid X)}
X
.
{\displaystyle X.}
Y
{\displaystyle Y}
X
=
x
{\displaystyle X=x}
x
{\displaystyle x}
E
(
Y
∣
X
=
x
)
=
g
(
x
)
{\displaystyle \operatorname {E} (Y\mid X=x)=g(x)}
E
(
Y
∣
X
)
{\displaystyle \operatorname {E} (Y\mid X)}
g
(
X
)
.
{\displaystyle g(X).}
一つの特別なケース( 総期待値の法則 に似ている)は、が 全体の結果空間の分割である場合、つまりこれらのイベントが相互に排他的で網羅的である場合、
A
1
,
…
,
A
n
{\displaystyle A_{1},\ldots ,A_{n}}
Var
(
X
)
=
∑
i
=
1
n
Var
(
X
∣
A
i
)
Pr
(
A
i
)
+
∑
i
=
1
n
E
[
X
∣
A
i
]
2
(
1
−
Pr
(
A
i
)
)
Pr
(
A
i
)
−
2
∑
i
=
2
n
∑
j
=
1
i
−
1
E
[
X
∣
A
i
]
Pr
(
A
i
)
E
[
X
∣
A
j
]
Pr
(
A
j
)
.
{\displaystyle {\begin{aligned}\operatorname {Var} (X)={}&\sum _{i=1}^{n}\operatorname {Var} (X\mid A_{i})\Pr(A_{i})+\sum _{i=1}^{n}\operatorname {E} [X\mid A_{i}]^{2}(1-\Pr(A_{i}))\Pr(A_{i})\\[4pt]&{}-2\sum _{i=2}^{n}\sum _{j=1}^{i-1}\operatorname {E} [X\mid A_{i}]\Pr(A_{i})\operatorname {E} [X\mid A_{j}]\Pr(A_{j}).\end{aligned}}}
この式では、最初の要素は条件付き分散の期待値であり、他の 2 つの要素は条件付き期待値の分散です。
証拠
有限の場合
を繰り返しての観測値と します 。
(
x
1
,
y
1
)
,
…
,
(
x
n
,
y
n
)
{\displaystyle (x_{1},y_{1}),\ldots ,(x_{n},y_{n})}
(
X
,
Y
)
{\displaystyle (X,Y)}
を設定し 、 の可能な値ごとに を 設定します 。
y
¯
=
E
[
Y
]
{\displaystyle {\bar {y}}=\operatorname {E} [Y]}
x
{\displaystyle x}
X
{\displaystyle X}
y
¯
x
i
=
E
[
Y
|
X
=
x
i
]
{\displaystyle {\bar {y}}_{x_{i}}=\operatorname {E} [Y|X=x_{i}]}
ご了承ください
(
y
i
−
y
¯
)
2
=
(
y
i
−
y
¯
x
i
+
y
¯
x
i
−
y
¯
)
2
=
(
y
i
−
y
¯
x
i
)
2
+
(
y
¯
x
i
−
y
¯
)
2
+
2
(
y
i
−
y
¯
x
i
)
(
y
¯
x
i
−
y
¯
)
.
{\displaystyle (y_{i}-{\bar {y}})^{2}=\left(y_{i}-{\bar {y}}_{x_{i}}+{\bar {y}}_{x_{i}}-{\bar {y}}\right)^{2}=(y_{i}-{\bar {y}}_{x_{i}})^{2}+({\bar {y}}_{x_{i}}-{\bar {y}})^{2}+2(y_{i}-{\bar {y}}_{x_{i}})({\bar {y}}_{x_{i}}-{\bar {y}}).}
これらを合計すると 、最後の小包は次のようになる。
1
≤
i
≤
n
{\displaystyle 1\leq i\leq n}
∑
i
=
1
n
2
(
y
i
−
y
¯
x
i
)
(
y
¯
x
i
−
y
¯
)
=
2
∑
x
(
∑
{
1
≤
i
≤
n
|
x
i
=
x
}
(
y
i
−
y
¯
x
)
)
(
y
¯
x
−
y
¯
)
=
2
∑
x
0
⋅
(
y
¯
x
−
y
¯
)
=
0.
{\displaystyle \sum _{i=1}^{n}2(y_{i}-{\bar {y}}_{x_{i}})({\bar {y}}_{x_{i}}-{\bar {y}})=2\sum _{x}\left(\sum _{\{1\leq i\leq n|x_{i}=x\}}(y_{i}-{\bar {y}}_{x})\right)({\bar {y}}_{x}-{\bar {y}})=2\sum _{x}0\cdot ({\bar {y}}_{x}-{\bar {y}})=0.}
したがって、
Var
(
Y
)
=
1
n
∑
i
=
1
n
(
y
i
−
y
¯
)
2
=
1
n
∑
i
=
1
n
(
y
i
−
y
¯
x
i
)
2
+
1
n
∑
i
=
1
n
(
y
¯
x
i
−
y
¯
)
2
=
E
[
Var
(
Y
∣
X
)
]
+
Var
(
E
[
Y
∣
X
]
)
.
{\displaystyle \operatorname {Var} (Y)={\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-{\bar {y}})^{2}={\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-{\bar {y}}_{x_{i}})^{2}+{\frac {1}{n}}\sum _{i=1}^{n}({\bar {y}}_{x_{i}}-{\bar {y}})^{2}=\operatorname {E} [\operatorname {Var} (Y\mid X)]+\operatorname {Var} (\operatorname {E} [Y\mid X]).}
一般的なケース
全分散の法則は、 全期待値の法則 を使って証明できる。 [5] まず、
分散の定義から。再び、分散の定義から、全期待値の法則を適用すると、
Var
(
Y
)
=
E
[
Y
2
]
−
E
[
Y
]
2
{\displaystyle \operatorname {Var} (Y)=\operatorname {E} \left[Y^{2}\right]-\operatorname {E} [Y]^{2}}
E
[
Y
2
]
=
E
[
E
[
Y
2
∣
X
]
]
=
E
[
Var
(
Y
∣
X
)
+
E
[
Y
∣
X
]
2
]
.
{\displaystyle \operatorname {E} \left[Y^{2}\right]=\operatorname {E} \left[\operatorname {E} [Y^{2}\mid X]\right]=\operatorname {E} \left[\operatorname {Var} (Y\mid X)+\operatorname {E} [Y\mid X]^{2}\right].}
ここで、 の条件付き第 2 モーメントを分散と第 1 モーメントで書き直し 、右側に全期待値の法則を適用します。
Y
{\displaystyle Y}
E
[
Y
2
]
−
E
[
Y
]
2
=
E
[
Var
(
Y
∣
X
)
+
E
[
Y
∣
X
]
2
]
−
E
[
E
[
Y
∣
X
]
]
2
.
{\displaystyle \operatorname {E} \left[Y^{2}\right]-\operatorname {E} [Y]^{2}=\operatorname {E} \left[\operatorname {Var} (Y\mid X)+\operatorname {E} [Y\mid X]^{2}\right]-\operatorname {E} [\operatorname {E} [Y\mid X]]^{2}.}
合計の期待値は期待値の合計であるため、項を次のように再グループ化できます。
=
(
E
[
Var
(
Y
∣
X
)
]
)
+
(
E
[
E
[
Y
∣
X
]
2
]
−
E
[
E
[
Y
∣
X
]
]
2
)
.
{\displaystyle =\left(\operatorname {E} [\operatorname {Var} (Y\mid X)]\right)+\left(\operatorname {E} \left[\operatorname {E} [Y\mid X]^{2}\right]-\operatorname {E} [\operatorname {E} [Y\mid X]]^{2}\right).}
最後に、2番目の括弧内の項を条件付き期待値の分散として認識します 。
E
[
Y
∣
X
]
{\displaystyle \operatorname {E} [Y\mid X]}
=
E
[
Var
(
Y
∣
X
)
]
+
Var
(
E
[
Y
∣
X
]
)
.
{\displaystyle =\operatorname {E} [\operatorname {Var} (Y\mid X)]+\operatorname {Var} (\operatorname {E} [Y\mid X]).}
動的システムに適用可能な一般的な分散分解
次の式は、一般的な測度理論的分散分解式 [4] を確率的動的システムに適用する方法を示しています。 を時刻 におけるシステム変数の値とします。 内部履歴 ( 自然濾過 ) があり 、それぞれが異なるシステム変数のコレクションの履歴 (軌跡) に対応しているとします。コレクションは互いに素である必要はありません。 の分散は、すべての時刻について、次のように成分 に 分解できます 。
Y
(
t
)
{\displaystyle Y(t)}
t
.
{\displaystyle t.}
H
1
t
,
H
2
t
,
…
,
H
c
−
1
,
t
{\displaystyle H_{1t},H_{2t},\ldots ,H_{c-1,t}}
Y
(
t
)
{\displaystyle Y(t)}
t
,
{\displaystyle t,}
c
≥
2
{\displaystyle c\geq 2}
Var
[
Y
(
t
)
]
=
E
(
Var
[
Y
(
t
)
∣
H
1
t
,
H
2
t
,
…
,
H
c
−
1
,
t
]
)
+
∑
j
=
2
c
−
1
E
(
Var
[
E
[
Y
(
t
)
∣
H
1
t
,
H
2
t
,
…
,
H
j
t
]
∣
H
1
t
,
H
2
t
,
…
,
H
j
−
1
,
t
]
)
+
Var
(
E
[
Y
(
t
)
∣
H
1
t
]
)
.
{\displaystyle {\begin{aligned}\operatorname {Var} [Y(t)]={}&\operatorname {E} (\operatorname {Var} [Y(t)\mid H_{1t},H_{2t},\ldots ,H_{c-1,t}])\\[4pt]&{}+\sum _{j=2}^{c-1}\operatorname {E} (\operatorname {Var} [\operatorname {E} [Y(t)\mid H_{1t},H_{2t},\ldots ,H_{jt}]\mid H_{1t},H_{2t},\ldots ,H_{j-1,t}])\\[4pt]&{}+\operatorname {Var} (\operatorname {E} [Y(t)\mid H_{1t}]).\end{aligned}}}
分解は一意ではありません。逐次分解における条件付けの順序に依存します。
が条件付き期待値が線形となる場合 、つまり
共分散の双線型性から および となり
、
分散の説明成分を全分散で割った値が と の 相関 の2乗となる場合、つまり、このような場合、
(
Y
,
X
)
{\displaystyle (Y,X)}
E
(
Y
∣
X
)
=
a
X
+
b
,
{\displaystyle \operatorname {E} (Y\mid X)=aX+b,}
a
=
Cov
(
Y
,
X
)
Var
(
X
)
{\displaystyle a={\operatorname {Cov} (Y,X) \over \operatorname {Var} (X)}}
b
=
E
(
Y
)
−
Cov
(
Y
,
X
)
Var
(
X
)
E
(
X
)
{\displaystyle b=\operatorname {E} (Y)-{\operatorname {Cov} (Y,X) \over \operatorname {Var} (X)}\operatorname {E} (X)}
Y
{\displaystyle Y}
X
;
{\displaystyle X;}
Var
(
E
(
Y
∣
X
)
)
Var
(
Y
)
=
Corr
(
X
,
Y
)
2
.
{\displaystyle {\operatorname {Var} (\operatorname {E} (Y\mid X)) \over \operatorname {Var} (Y)}=\operatorname {Corr} (X,Y)^{2}.}
この状況の一例としては、 二変量正規(ガウス)分布がある場合が挙げられます。
(
X
,
Y
)
{\displaystyle (X,Y)}
より一般的には、条件付き期待値が [4] の非線形関数である場合
、これは の結合分布から得られたデータを使用して の 非線形 回帰から の二乗として推定できます 。 がガウス分布(および の可逆関数)である 場合 、または自体が(限界)ガウス分布である場合、この説明された変動成分は 相互情報 量の下限を設定します 。 [4]
E
(
Y
∣
X
)
{\displaystyle \operatorname {E} (Y\mid X)}
X
{\displaystyle X}
ι
Y
∣
X
=
Var
(
E
(
Y
∣
X
)
)
Var
(
Y
)
=
Corr
(
E
(
Y
∣
X
)
,
Y
)
2
,
{\displaystyle \iota _{Y\mid X}={\operatorname {Var} (\operatorname {E} (Y\mid X)) \over \operatorname {Var} (Y)}=\operatorname {Corr} (\operatorname {E} (Y\mid X),Y)^{2},}
R
{\displaystyle R}
Y
{\displaystyle Y}
X
,
{\displaystyle X,}
(
X
,
Y
)
.
{\displaystyle (X,Y).}
E
(
Y
∣
X
)
{\displaystyle \operatorname {E} (Y\mid X)}
X
{\displaystyle X}
Y
{\displaystyle Y}
I
(
Y
;
X
)
≥
ln
(
[
1
−
ι
Y
∣
X
]
−
1
/
2
)
.
{\displaystyle \operatorname {I} (Y;X)\geq \ln \left([1-\iota _{Y\mid X}]^{-1/2}\right).}
より高い瞬間
第三中心モーメント に関する同様の法則 は、
μ
3
{\displaystyle \mu _{3}}
μ
3
(
Y
)
=
E
(
μ
3
(
Y
∣
X
)
)
+
μ
3
(
E
(
Y
∣
X
)
)
+
3
cov
(
E
(
Y
∣
X
)
,
var
(
Y
∣
X
)
)
.
{\displaystyle \mu _{3}(Y)=\operatorname {E} \left(\mu _{3}(Y\mid X)\right)+\mu _{3}(\operatorname {E} (Y\mid X))+3\operatorname {cov} (\operatorname {E} (Y\mid X),\operatorname {var} (Y\mid X)).}
高次の キュムラント については一般化が存在します。 全キュムラントの法則 を参照してください。
参照
全共分散の法則 – 確率論の公式 − 一般化
誤差伝播の法則 – 変数の不確実性がそれに基づく関数の不確実性に与える影響 Pages displaying short descriptions of redirect targets
参考文献
^ ニール・A・ワイス 『確率論 』アディソン・ウェズレー、2005年、385~386ページ。
^ ジョセフ・K・ブリッツスタインとジェシカ・ファン:「確率入門」
^ Mahler, Howard C.; Dean, Curtis Gary (2001). 「第 8 章: 信頼性」 (PDF) 。Casualty Actuarial Society (ed.) の 「Foundations of Casualty Actuarial Science (第 4 版)」。 Casualty Actuarial Society。pp . 525–526。ISBN 978-0-96247-622-8 . 2015年 6月25日 閲覧 。
^ abcde Bowsher, CGおよびPS Swain、「生化学ネットワークにおける変異源と情報の流れの特定」、PNAS、2012年5月15日、109(20)E1320-E1328。
^ ニール・A・ワイス 『確率論 』アディソン・ウェズレー、2005年、380~383ページ。
Blitzstein, Joe. 「Stat 110 Final Review (Eve's Law)」 (PDF) . stat110.net . ハーバード大学統計学部. 2014 年 7 月 9 日 閲覧 。
ビリングスリー、パトリック(1995年)。 確率と測定 。ニューヨーク、ニューヨーク:ジョン・ワイリー・アンド・サンズ社 。ISBN 0-471-00710-2 。 (問題34.10(b))