
統計量(通常は平均値や平均などのパラメータの推定値)の標準誤差(SE)[ 1 ]は、その標本分布の標準偏差です。[ 1 ] [ 2 ]標準誤差は、信頼区間の計算によく使用されます。[ 3 ]
平均値の標本分布は、同じ母集団から繰り返し標本抽出を行い、標本ごとに標本平均を記録することによって生成されます。これにより、異なる標本平均の分布が形成され、この分布は独自の平均と分散を持ちます。数学的には、得られた標本平均分布の分散は、母集団の分散を標本サイズで割った値に等しくなります。これは、標本サイズが大きくなるにつれて、標本平均が母集団平均の周りに密集するようになるためです。
したがって、平均の標準誤差と標準偏差の関係は、与えられた標本サイズに対して、平均の標準誤差が標準偏差を標本サイズの平方根で割った値に等しくなるというものです。 [ 1 ]言い換えれば、平均の標準誤差は、標本平均が母平均の周りにどれだけばらついているかを示す尺度です。
回帰分析では、「標準誤差」という用語は、信頼区間で使用される特定の回帰係数の標準誤差を説明する際の一般的な使用法に加えて、縮小カイ二乗統計量の平方根を指すためにも使用できます。
統計的に独立したサンプルを仮定すると、観察結果は、標準偏差が(母集団の標準偏差)。標本から計算された平均値、平均値には関連する標準誤差が伴います。、以下によって与えられる:[ 1 ]
実際には、これは母集団平均の値を推定しようとする場合、推定値の誤差を2分の1に減らすには、標本中の観測値を4倍に増やす必要があり、10分の1に減らすには、観測値を100倍に増やす必要がある。
標準偏差標本抽出される母集団の はめったに知られていない。したがって、平均の標準誤差は通常、 を置き換えることによって推定される。サンプル標準偏差その代わり:
これは真の「標準誤差」の 推定値にすぎないため、以下のような他の表記が用いられることもよくあります。 :={\frac {s}{\sqrt {n}}}.}
よくある混乱の原因は、以下の点を明確に区別できない場合です。
サンプルサイズが小さい場合、母集団の真の標準偏差の代わりにサンプルの標準偏差を使用すると、母集団の標準偏差、ひいては標準誤差を系統的に過小評価する傾向があります。n = 2 の場合、過小評価は約 25% ですが、n = 6 の場合はわずか 5% です。Gurland と Tripathi (1971) はこの影響に対する補正と式を提供しています。[ 4 ] Sokal と Rohlf (1981) は、 n < 20の小サンプルに対する補正係数の式を示しています。[ 5 ]詳しい議論については、標準偏差の不偏推定を参照してください。
平均値の標準誤差は、分散の定義とそのいくつかの性質から、独立な確率変数の和の分散から導出できる。[ 6 ]はサンプルです平均を持つ母集団からの独立した観測標準偏差そうすれば合計を定義できますビエネメの公式により、分散は
これらの測定値の平均(標本平均)は次のように表される。平均の分散は次のようになります。
ここで、 2番目の等式では分散の伝播が用いられています。標準誤差は、定義により、標準偏差です。これは分散の平方根です。
言い換えれば、サンプリングあたりの観測数が多い場合(母集団の分散と比較すると高い)、次にサンプルごとの計算された平均値人口平均に近いと予想される。
相関のある確率変数については、標本分散はマルコフ連鎖中心極限定理に従って計算する必要があります。
事前に、ある基準に従って許容される観測値がいくつになるか分からないままサンプルを採取するケースがあります。そのような場合、サンプルサイズはは、変動が の変動に加算される確率変数です。そのため、[ 7 ]これは全分散の法則 から導かれる。
もしポアソン分布を持つ場合、推定器付きしたがって、推定値はになる標準誤差については、以下の式が得られる。 (標準偏差は分散の平方根であるため)。
多くの実用的な応用例では、 σの真の値は不明です。そのため、考えられるσのばらつきを考慮した分布を使用する必要があります。真の基礎となる分布がガウス分布であることがわかっているものの、σ が不明な場合、結果として得られる推定分布はスチューデントの t 分布に従います。標準誤差は、スチューデントの t 分布の標準偏差です。t 分布はガウス分布とはわずかに異なり、サンプルサイズによって変化します。サンプルが小さいほど、母集団の標準偏差を過小評価し、真の母集団平均とは異なる平均値を持つ可能性がやや高くなります。スチューデントの t 分布は、ガウス分布と比較して裾がやや重いこれらの事象の確率を考慮しています。スチューデントの t 分布の標準誤差を推定するには、σの代わりにサンプル標準偏差「s」を使用すれば十分であり、この値を使用して信頼区間を計算できます。
注:サンプルサイズが100を超える場合、スチューデントの確率分布はガウス分布でよく近似されます。このようなサンプルでは、より単純なガウス分布を使用できます。また、母集団の「真の」分布は不明ですが、適切なサンプルサイズで特定のサンプリング条件を満たす場合、標本分布が正規分布であると仮定することは理にかなっています(中心極限定理を参照)。これらの条件が満たされない場合は、ブートストラップ分布を使用して標準誤差を推定することが有効な回避策となることが多いですが、計算負荷が高くなる可能性があります。
例として、(標準誤差)は、未知の母平均の信頼区間を作成するために使用されます。標本分布が正規分布である場合、標本平均、標準誤差、および正規分布の分位数を使用して、真の母平均の信頼区間を計算できます。次の式を使用して、95%信頼区間の上限と下限を計算できます。は標本平均を表します。は標本平均の標準誤差(標本平均値の標準偏差)を表し、1.96は正規分布の97.5パーセンタイル点の近似値です。
特に、標本統計量(標本平均など)の標準誤差は、標本平均が生成された過程における標本平均の実際の標準偏差または推定標準偏差です。言い換えれば、標本統計量の標本分布の実際の標準偏差または推定標準偏差です。標準誤差の表記は、SE、SEM(測定または平均の標準誤差)、または S Eのいずれかになります。
標準誤差は値の不確実性を簡単に測定できる指標であり、次のような理由でよく用いられます。
科学技術文献では、実験データは、標本データの平均値と標準偏差、または平均値と標準誤差のいずれかを使用して要約されることがよくあります。そのため、これらの互換性について混乱が生じることがよくあります。しかし、平均値と標準偏差は記述統計量であるのに対し、平均値の標準誤差はランダムサンプリングプロセスを記述するものです。標本データの標準偏差は測定値のばらつきを記述するものであり、平均値の標準誤差は中心極限定理に照らして、標本サイズが母平均の推定値のより良い上限をどのように提供するかについての確率的な記述です。[ 8 ]
簡単に言うと、標本平均の標準誤差は標本平均が母平均からどれだけ離れているかの推定値であり、標本の標準偏差は標本内の個体が標本平均からどれだけ異なるかの度合いです。[ 9 ]母標準偏差が有限であれば、標本平均の推定値が改善されるため、標本平均の標準誤差は標本サイズの増加とともにゼロに近づき、標本標準偏差は標本サイズの増加とともに母標準偏差に近づく傾向があります。
上記の標準誤差の式は、母集団が無限であることを前提としています。しかしながら、有限母集団の現状を解明する過程(分析的研究と呼ばれる)に関心がある場合、有限母集団に対してもこの式が用いられることがよくあります。母集団が有限の場合、上記の式は厳密には正しくありませんが、標本抽出率が小さい場合(例えば、有限母集団のごく一部を調査する場合)、有限母集団と無限母集団の式の差は小さくなります。このような場合、有限母集団に対する補正を行わず、実質的に「ほぼ無限」の母集団として扱うことがよくあります。
時間の経過とともに変化しない既存の有限母集団を測定することに関心がある場合は、母集団のサイズを調整する必要があります(列挙調査と呼ばれます)。列挙調査で標本抽出率(多くの場合fと呼ばれます)が大きい場合(約 5% 以上) 、標準誤差の推定値は「有限母集団補正」(別名: FPC)を乗じて補正する必要があります。 [ 10 ] [ 11 ]これは、 N が大きい場合: 母集団のより大きな割合に近いサンプルを採取することで得られる精度向上を考慮するため。FPCの効果は、サンプルサイズnが母集団サイズNと等しい場合に誤差がゼロになることである。

測定量Aの値が統計的に独立ではないが、パラメータ空間x内の既知の位置から得られたものである場合、サンプルの計算された標準誤差に係数fを乗じることで、平均の真の標準誤差の不偏推定値 (実際には標準偏差部分の補正) を得ることができます。 ここで、標本バイアス係数ρは、すべての標本点ペアの自己相関係数(-1から+1の間の値)の広く使用されているPrais–Winsten推定値です。この近似式は中規模から大規模の標本サイズ用です。参照文献には任意の標本サイズに対する正確な式が記載されており、ウォール街の株価のような自己相関の高い時系列にも適用できます。さらに、この式はρが正の場合も負の場合も同様に機能します。[ 12 ]詳細な議論については、標準偏差の不偏推定も参照してください。