モチベーション 統計学 では、多くの場合、従属変数 y のデータが、独立変数 x のさまざまな値の範囲で収集されます。たとえば、エンジン負荷を一定に保ちながら、エンジン回転数の関数として燃料消費量を観測することがあります。yの分散を 小さくするために、x の各値で多数の繰り返しテストが必要な場合、テストの費用が膨大になる可能性があります。分散の妥当な推定値は、特定の x で各 テスト を数回繰り返すだけで、プールされた分散 の原理を使用して決定できます 。
定義と計算 プールされた分散は、固定された共通分散の推定値です。σ 2 \displaystyle \sigma ^{2}} 様々な手段を持つ多様な集団の根底にあるもの。
サンプル分散 のセットが与えられていますs 私 2 \displaystyle s_{i}^{2}} 人口がインデックス化されている私 = 1 、 … 、 m {\displaystyle i=1,\ldots ,m} 、
s 私 2 \displaystyle s_{i}^{2}} =1 n 私 − 1 ∑ j = 1 n 私 ( y 私 、 j − y ¯ 私 ) 2 。 {\displaystyle {\frac {1}{n_{i}-1}}\sum _{j=1}^{n_{i}}\left(y_{i,j}-{\overline {y}}_{i}\right)^{2}.} サンプルサイズが 均一であると仮定すると、n 私 = n {\displaystyle n_{i}=n} すると、プールされた分散s p 2 s_p^2 算術平均 によって計算できます。
s p 2 = ∑ 私 = 1 m s 私 2 m = s 1 2 + s 2 2 + ⋯ + s m 2 m 。 {\displaystyle s_{p}^{2}={\frac {\sum _{i=1}^{m}s_{i}^{2}}{m}}={\frac {s_{1}^{2}+s_{2}^{2}+\cdots +s_{m}^{2}}{m}}.} サンプルサイズが均一でない場合、プールされた分散はs p 2 s_p^2 は、重みとして を使用する加重平均 によって計算できます。w 私 = n 私 − 1 {\displaystyle w_{i}=n_{i}-1} それぞれの自由度( ベッセルの補正 も参照):
s p 2 = ∑ 私 = 1 m ( n 私 − 1 ) s 私 2 ∑ 私 = 1 m ( n 私 − 1 ) = ( n 1 − 1 ) s 1 2 + ( n 2 − 1 ) s 2 2 + ⋯ + ( n m − 1 ) s m 2 n 1 + n 2 + ⋯ + n m − m 。 {\displaystyle s_{p}^{2}={\frac {\sum _{i=1}^{m}(n_{i}-1)s_{i}^{2}}{\sum _{i=1}^{m}(n_{i}-1)}}={\frac {(n_{1}-1)s_{1}^{2}+(n_{2}-1)s_{2}^{2}+\cdots +(n_{m}-1)s_{m}^{2}}{n_{1}+n_{2}+\cdots +n_{m}-m}}.} 分布s p 2 ( ∑ 私 n 私 − m ) σ 2 {\displaystyle {\frac {s_{p}^{2}(\sum _{i}n_{i}-m)}{\sigma ^{2}}}} はχ 2 ( ∑ 私 n 私 − m ) {\displaystyle \chi ^{2}(\sum _{i}n_{i}-m)} 。
証明。 平均値が1つしかない場合、分布は( y 1 − y ¯ 、 … 、 y n − y ¯ ) {\displaystyle (y_{1}-{\bar {y}},\dots ,y_{n}-{\bar {y}})} はガウス分布ですΔ n − 1 {\displaystyle \Delta _{n-1}} 、( n − 1 ) {\displaystyle (n-1)} 次元単体、標準偏差σ {\displaystyle \sigma } 複数の平均値がある場合、分布は( y 1 、 1 − y ¯ 1 、 … 、 y 1 、 n 1 − y ¯ 1 、 … 、 y m 、 1 − y ¯ m 、 … 、 y m 、 n m − y ¯ m ) {\displaystyle (y_{1,1}-{\bar {y}}_{1},\dots ,y_{1,n_{1}}-{\bar {y}}_{1},\dots ,y_{m,1}-{\bar {y}}_{m},\dots ,y_{m,n_{m}}-{\bar {y}}_{m})} はガウス分布ですΔ n 1 − 1 × ⋯ × Δ n m − 1 {\displaystyle \Delta _{n_{1}-1}\times \dots \times \Delta _{n_{m}-1}} 。
例 独立変数xのさまざまなレベルで得られた y の以下のデータセットを考えてみましょう。
試行回数、平均値、分散、標準偏差は次の表に示されています。
これらの統計値は、 x のさまざまなレベルにおける各データサブセットの分散と標準偏差を表しています 。x のすべてのレベルで同じ現象がランダム誤差 を生成していると仮定できる場合、上記のデータを「プール」して、分散と標準偏差の単一の推定値を表すことができます。ある意味では、これは上記の 5 つの結果の平均分散または平均標準偏差を求めることを示唆しています。この平均分散は、 x の各レベルのサブセットのサイズで個々の値を重み付けすることによって計算されます。したがって、プールされた分散は次のように定義されます。
s p 2 = ( n 1 − 1 ) s 1 2 + ( n 2 − 1 ) s 2 2 + ⋯ + ( n k − 1 ) s k 2 ( n 1 − 1 ) + ( n 2 − 1 ) + ⋯ + ( n k − 1 ) {\displaystyle s_{p}^{2}={\frac {(n_{1}-1)s_{1}^{2}+(n_{2}-1)s_{2}^{2}+\cdots +(n_{k}-1)s_{k}^{2}}{(n_{1}-1)+(n_{2}-1)+\cdots +(n_{k}-1)}}} ここで、n 1 、n 2 、...、n k は変数x の各レベルにおけるデータサブセットのサイズであり、s 1 2 、s 2 2 、...、s k 2 はそれぞれの分散である。
したがって、上記のデータのプールされた分散は次のようになります。
s p 2 = 2.764 {\displaystyle s_{p}^{2}=2.764\,}
精度への影響 プールされた分散は、プールされたデータセット間に相関がある場合、またはデータセットの平均が一致しない場合に推定される値です。プールされた分散は、相関がゼロでないほど、またはデータセット間の平均値の差が大きいほど、精度が低くなります。
重複しないデータセットのデータ変動は次のとおりです。
σ X 2 = ∑ 私 [ ( N X 私 − 1 ) σ X 私 2 + N X 私 μ X 私 2 ] − [ ∑ 私 N X 私 ] μ X 2 ∑ 私 N X 私 − 1 {\displaystyle \sigma _{X}^{2}={\frac {\sum _{i}\left[(N_{X_{i}}-1)\sigma _{X_{i}}^{2}+N_{X_{i}}\mu _{X_{i}}^{2}\right]-\left[\sum _{i}N_{X_{i}}\right]\mu _{X}^{2}}{\sum _{i}N_{X_{i}}-1}}} ここで、平均値は次のように定義される。
μ X = ∑ 私 N X 私 μ X 私 ∑ 私 N X 私 {\displaystyle \mu _{X}={\frac {\sum _{i}N_{X_{i}}\mu _{X_{i}}}{\sum _{i}N_{X_{i}}}}} バイアスのかかった最尤度は次のように定義される。
s p 2 = ∑ 私 = 1 k ( n 私 − 1 ) s 私 2 ∑ 私 = 1 k n 私 、 {\displaystyle s_{p}^{2}={\frac {\sum _{i=1}^{k}(n_{i}-1)s_{i}^{2}}{\sum _{i=1}^{k}n_{i}}},} すると、偏りのある最尤推定値の誤差は次のようになります。
エラー = s p 2 − σ X 2 = ∑ 私 ( N X 私 − 1 ) s 私 2 ∑ 私 N X 私 − 1 ∑ 私 N X 私 − 1 ( ∑ 私 [ ( N X 私 − 1 ) σ X 私 2 + N X 私 μ X 私 2 ] − [ ∑ 私 N X 私 ] μ X 2 ) {\displaystyle {\begin{aligned}{\text{Error}}&=s_{p}^{2}-\sigma _{X}^{2}\\[6pt]&={\frac {\sum _{i}(N_{X_{i}}-1)s_{i}^{2}}{\sum _{i}N_{X_{i}}}}-{\frac {1}{\sum _{i}N_{X_{i}}-1}}\left(\sum _{i}\left[(N_{X_{i}}-1)\sigma _{X_{i}}^{2}+N_{X_{i}}\mu _{X_{i}}^{2}\right]-\left[\sum _{i}N_{X_{i}}\right]\mu _{X}^{2}\right)\end{aligned}}} Nが 十分に大きいと仮定すると、次のようになります。
∑ 私 N X 私 ≈ ∑ 私 N X 私 − 1 {\displaystyle \sum _{i}N_{X_{i}}\approx \sum _{i}N_{X_{i}}-1} すると、推定誤差は以下のように減少します。
E = − ( ∑ 私 [ N X 私 μ X 私 2 ] − [ ∑ 私 N X 私 ] μ X 2 ) ∑ 私 N X 私 = μ X 2 − ∑ 私 [ N X 私 μ X 私 2 ] ∑ 私 N X 私 {\displaystyle {\begin{aligned}E&=-{\frac {\left(\sum _{i}\left[N_{X_{i}}\mu _{X_{i}}^{2}\right]-\left[\sum _{i}N_{X_{i}}\right]\mu _{X}^{2}\right)}{\sum _{i}N_{X_{i}}}}\\[3pt]&=\mu _{X}^{2}-{\frac {\sum _{i}\left[N_{X_{i}}\mu _{X_{i}}^{2}\right]}{\sum _{i}N_{X_{i}}}}\end{aligned}}} あるいは別の言い方をすれば:
E = [ ∑ 私 N X 私 μ X 私 ∑ 私 N X 私 ] 2 − ∑ 私 [ N X 私 μ X 私 2 ] ∑ 私 N X 私 = [ ∑ 私 N X 私 μ X 私 ] 2 − ∑ 私 N X 私 ∑ 私 [ N X 私 μ X 私 2 ] [ ∑ 私 N X 私 ] 2 {\displaystyle {\begin{aligned}E&=\left[{\frac {\sum _{i}N_{X_{i}}\mu _{X_{i}}}{\sum _{i}N_{X_{i}}}}\right]^{2}-{\frac {\sum _{i}\left[N_{X_{i}}\mu _{X_{i}}^{2}\right]}{\sum _{i}N_{X_{i}}}}\\[3pt]&={\frac {\left[\sum _{i}N_{X_{i}}\mu _{X_{i}}\right]^{2}-\sum _{i}N_{X_{i}}\sum _{i}\left[N_{X_{i}}\mu _{X_{i}}^{2}\right]}{\left[\sum _{i}N_{X_{i}}\right]^{2}}}\end{aligned}}}
標準偏差データの集計 プールされた標準偏差を推定するのではなく、より多くの統計情報が利用可能な場合は、以下の方法で標準偏差を正確に集計します。
人口統計 重複する可能性のある集合の個体数は、以下のように簡単に計算できます。
N X ∪ Y = N X + N Y − N X ∩ Y {\displaystyle {\begin{aligned}&&N_{X\cup Y}&=N_{X}+N_{Y}-N_{X\cap Y}\\\end{aligned}}} 重複しない集合の個体数は、以下のように簡単に計算できます。
X ∩ Y = ∅ ⇒ N X ∩ Y = 0 ⇒ N X ∪ Y = N X + N Y {\displaystyle {\begin{aligned}X\cap Y=\varnothing &\Rightarrow &N_{X\cap Y}&=0\\&\Rightarrow &N_{X\cup Y}&=N_{X}+N_{Y}\end{aligned}}} 重複しない(X ∩ Y = ∅ )部分集団の標準偏差は、それぞれのサイズ(実際のサイズまたは相対的なサイズ)と平均値が分かっている場合、次のように集計できます。
μ X ∪ Y = N X μ X + N Y μ Y N X + N Y σ X ∪ Y = N X σ X 2 + N Y σ Y 2 N X + N Y + N X N Y ( N X + N Y ) 2 ( μ X − μ Y ) 2 {\displaystyle {\begin{aligned}\mu _{X\cup Y}&={\frac {N_{X}\mu _{X}+N_{Y}\mu _{Y}}{N_{X}+N_{Y}}}\\[3pt]\sigma _{X\cup Y}&={\sqrt {{\frac {N_{X}\sigma _{X}^{2}+N_{Y}\sigma _{Y}^{2}}{N_{X}+N_{Y}}}+{\frac {N_{X}N_{Y}}{(N_{X}+N_{Y})^{2}}}(\mu _{X}-\mu _{Y})^{2}}}\end{aligned}}} 例えば、アメリカ人男性の平均身長は70 インチ、標準偏差は3インチ、アメリカ人女性の平均身長は65 インチ、標準偏差は2インチであることが分かっているとします。また、男性の数N と女性の数は等しいとします。すると、アメリカ人成人の身長の平均値と標準偏差は次のように計算できます。
μ = N ⋅ 70 + N ⋅ 65 N + N = 70 + 65 2 = 67.5 σ = 3 2 + 2 2 2 + ( 70 − 65 ) 2 2 2 = 12.75 ≈ 3.57 {\displaystyle {\begin{aligned}\mu &={\frac {N\cdot 70+N\cdot 65}{N+N}}={\frac {70+65}{2}}=67.5\\[3pt]\sigma &={\sqrt {{\frac {3^{2}+2^{2}}{2}}+{\frac {(70-65)^{2}}{2^{2}}}}}={\sqrt {12.75}}\approx 3.57\end{aligned}}} より一般的なケースでは、重複しないM個の集団 X 1 からX M までと、集合集団X = ⋃ 私 X 私 {\textstyle X\,=\,\bigcup _{i}X_{i}} 、
μ X = ∑ 私 N X 私 μ X 私 ∑ 私 N X 私 σ X = ∑ 私 N X 私 σ X 私 2 ∑ 私 N X 私 + ∑ 私 < j N X 私 N X j ( μ X 私 − μ X j ) 2 ( ∑ 私 N X 私 ) 2 {\displaystyle {\begin{aligned}\mu _{X}&={\frac {\sum _{i}N_{X_{i}}\mu _{X_{i}}}{\sum _{i}N_{X_{i}}}}\\[3pt]\sigma _{X}&={\sqrt {{\frac {\sum _{i}N_{X_{i}}\sigma _{X_{i}}^{2}}{\sum _{i}N_{X_{i}}}}+{\frac {\sum _{i<j}N_{X_{i}}N_{X_{j}}(\mu _{X_{i}}-\mu _{X_{j}})^{2}}{{\big (}\sum _{i}N_{X_{i}}{\big )}^{2}}}}}\end{aligned}}} 、どこ
X 私 ∩ X j = ∅ 、 ∀ 私 < j 。 {\displaystyle X_{i}\cap X_{j}=\varnothing ,\quad \forall \ i<j.} 重複する2つの母集団のサイズ(実際のサイズまたは相対的なサイズ)、平均値、標準偏差が、それぞれの母集団とそれらの共通部分について分かっている場合、全体の母集団の標準偏差は次のように計算できます。
μ X ∪ Y = 1 N X ∪ Y ( N X μ X + N Y μ Y − N X ∩ Y μ X ∩ Y ) σ X ∪ Y = 1 N X ∪ Y ( N X [ σ X 2 + μ X 2 ] + N Y [ σ Y 2 + μ Y 2 ] − N X ∩ Y [ σ X ∩ Y 2 + μ X ∩ Y 2 ] ) − μ X ∪ Y 2 {\displaystyle {\begin{aligned}\mu _{X\cup Y}&={\frac {1}{N_{X\cup Y}}}\left(N_{X}\mu _{X}+N_{Y}\mu _{Y}-N_{X\cap Y}\mu _{X\cap Y}\right)\\[3pt]\sigma _{X\cup Y}&={\sqrt {{\frac {1}{N_{X\cup Y}}}\left(N_{X}[\sigma _{X}^{2}+\mu _{X}^{2}]+N_{Y}[\sigma _{Y}^{2}+\mu _{Y}^{2}]-N_{X\cap Y}[\sigma _{X\cap Y}^{2}+\mu _{X\cap Y}^{2}]\right)-\mu _{X\cup Y}^{2}}}\end{aligned}}} 2つ以上のデータセットをデータポイントごとに加算する場合、各データセットの標準偏差と各データセット間の共分散が分かっていれば、結果の標準偏差を計算できます。
σ X = ∑ 私 σ X 私 2 + 2 ∑ 私 、 j カバー ( X 私 、 X j ) {\displaystyle \sigma _{X}={\sqrt {\sum _{i}{\sigma _{X_{i}}^{2}}+2\sum _{i,j}\operatorname {cov} (X_{i},X_{j})}}} データセットのペア間に相関関係が全く存在しない特殊なケースでは、この関係は平方根和に帰着する。
カバー ( X 私 、 X j ) = 0 、 ∀ 私 < j ⇒ σ X = ∑ 私 σ X 私 2 。 {\displaystyle {\begin{aligned}&\operatorname {cov} (X_{i},X_{j})=0,\quad \forall i<j\\\Rightarrow &\;\sigma _{X}={\sqrt {\sum _{i}{\sigma _{X_{i}}^{2}}}}.\end{aligned}}}
サンプルベースの統計 重複しない(X ∩ Y = ∅ )サブサンプルの標準偏差は、それぞれの実際のサイズと平均値が分かっている場合、次のように集計できます。
μ X ∪ Y = 1 N X ∪ Y ( N X μ X + N Y μ Y ) σ X ∪ Y = 1 N X ∪ Y − 1 ( [ N X − 1 ] σ X 2 + N X μ X 2 + [ N Y − 1 ] σ Y 2 + N Y μ Y 2 − [ N X + N Y ] μ X ∪ Y 2 ) {\displaystyle {\begin{aligned}\mu _{X\cup Y}&={\frac {1}{N_{X\cup Y}}}\left(N_{X}\mu _{X}+N_{Y}\mu _{Y}\right)\\[3pt]\sigma _{X\cup Y}&={\sqrt {{\frac {1}{N_{X\cup Y}-1}}\left([N_{X}-1]\sigma _{X}^{2}+N_{X}\mu _{X}^{2}+[N_{Y}-1]\sigma _{Y}^{2}+N_{Y}\mu _{Y}^{2}-[N_{X}+N_{Y}]\mu _{X\cup Y}^{2}\right)}}\end{aligned}}} より一般的なケースとして、重複しないデータセットM 個 (X 1から X M まで) と集計データセットの場合、X = ⋃ 私 X 私 {\textstyle X\,=\,\bigcup _{i}X_{i}} 、
μ X = 1 ∑ 私 N X 私 ( ∑ 私 N X 私 μ X 私 ) σ X = 1 ∑ 私 N X 私 − 1 ( ∑ 私 [ ( N X 私 − 1 ) σ X 私 2 + N X 私 μ X 私 2 ] − [ ∑ 私 N X 私 ] μ X 2 ) {\displaystyle {\begin{aligned}\mu _{X}&={\frac {1}{\sum _{i}{N_{X_{i}}}}}\left(\sum _{i}{N_{X_{i}}\mu _{X_{i}}}\right)\\[3pt]\sigma _{X}&={\sqrt {{\frac {1}{\sum _{i}{N_{X_{i}}-1}}}\left(\sum _{i}{\left[(N_{X_{i}}-1)\sigma _{X_{i}}^{2}+N_{X_{i}}\mu _{X_{i}}^{2}\right]}-\left[\sum _{i}{N_{X_{i}}}\right]\mu _{X}^{2}\right)}}\end{aligned}}} どこ
X 私 ∩ X j = ∅ 、 ∀ 私 < j 。 {\displaystyle X_{i}\cap X_{j}=\varnothing ,\quad \forall i<j.} 2 つの重複するサンプルのサイズ、平均、標準偏差が、サンプル自体とそれらの交差部分についてわかっている場合、集計されたサンプルの標準偏差を計算することができます。一般に、
μ X ∪ Y = 1 N X ∪ Y ( N X μ X + N Y μ Y − N X ∩ Y μ X ∩ Y ) σ X ∪ Y = [ N X − 1 ] σ X 2 + N X μ X 2 + [ N Y − 1 ] σ Y 2 + N Y μ Y 2 − [ N X ∩ Y − 1 ] σ X ∩ Y 2 − N X ∩ Y μ X ∩ Y 2 − [ N X + N Y − N X ∩ Y ] μ X ∪ Y 2 N X ∪ Y − 1 {\displaystyle {\begin{aligned}\mu _{X\cup Y}&={\frac {1}{N_{X\cup Y}}}\left(N_{X}\mu _{X}+N_{Y}\mu _{Y}-N_{X\cap Y}\mu _{X\cap Y}\right)\\[3pt]\sigma _{X\cup Y}&={\sqrt {\frac {[N_{X}-1]\sigma _{X}^{2}+N_{X}\mu _{X}^{2}+[N_{Y}-1]\sigma _{Y}^{2}+N_{Y}\mu _{Y}^{2}-[N_{X\cap Y}-1]\sigma _{X\cap Y}^{2}-N_{X\cap Y}\mu _{X\cap Y}^{2}-[N_{X}+N_{Y}-N_{X\cap Y}]\mu _{X\cup Y}^{2}}{N_{X\cup Y}-1}}}\end{aligned}}}
参考文献 Killeen PR (2005 年 5 月) 「帰無仮説有意性検定の代替法」 Psychol Sci . 16 (5): 345–53 . doi : 10.1111/j.0956-7976.2005.01538.x . PMC 1473027. PMID 15869691 .
外部リンク IUPACゴールドブック – プールされた標準偏差 ― コーエンのd値 についても言及(6ページ参照)