

統計学において、標準偏差は変数の値がその(算術)平均からどれだけばらついているかを示す尺度です。[ 1 ]標準偏差が小さいということは、あるセットの値が平均値に近い傾向にあることを示し、標準偏差が大きいということは、値がより広い範囲に広がっていることを示します。標準偏差はSDまたはstd devと略記されることがあり、数学のテキストや方程式では、小文字のギリシャ文字σ(シグマ)で表されることが最も一般的です。
正規分布(対称的なベル型の曲線に代表される)の場合、全値の約68%が平均値から1標準偏差の範囲内に、95%が2標準偏差の範囲内に、99.7%が3標準偏差の範囲内に収まります。
確率変数、標本、統計的母集団、データセット、または確率分布の標準偏差は、その分散の平方根です(分散は平均からの偏差の二乗の平均です)。標準偏差の便利な特性は、分散とは異なり、データと同じ単位で表されることです。標準偏差は、有限標本の標準誤差を計算したり、統計的有意性を判定したりするためにも使用できます。
母集団から抽出したサンプルデータしか入手できない場合、サンプルの標準偏差またはサンプル標準偏差という用語は、上記の量をそのデータに適用した場合、または母集団標準偏差(母集団全体の標準偏差)の不偏推定値である修正された量のいずれかを指すことがあります。
母集団または標本の標準偏差と、統計量(例えば標本平均)の標準誤差は、全く異なるものですが、関連性があります。標本平均の標準誤差は、母集団から無限に繰り返し標本を抽出し、各標本の平均を計算することによって得られる平均値の標準偏差です。平均の標準誤差は、母集団の標準偏差を標本サイズの平方根で割った値に等しく、標本標準偏差を標本サイズの平方根で割ることによって推定されます。例えば、世論調査の標準誤差(世論調査の誤差範囲として報告されるもの)は、同じ世論調査を複数回実施した場合に推定される平均値の期待標準偏差です。このように、標準誤差は推定値の標準偏差を推定するものであり、推定値自体は、母集団から抽出された特定の標本に推定値がどの程度依存するかを示します。
科学分野では、データの標準偏差(要約統計量として)と推定値の標準誤差(結果における潜在的な誤差の尺度として)の両方を報告するのが一般的です。慣例として、帰無仮説から2標準誤差以上離れた効果のみが「統計的に有意」とみなされます。これは、実際にはランダムなサンプリング誤差によるものであるにもかかわらず、誤った結論を導き出すことを防ぐための安全策です。
対象となる集団全体が、ある特定のクラスの8人の生徒であると仮定します。彼らの成績は以下の8つの値です。
有限個の数値の集合の場合、母集団標準偏差は、各値の平均値から各値の偏差の二乗を引いた値の二乗の平均の平方根を求めることによって求められます。すなわち、次のようになります。
これら8つのデータポイントの平均値は5です。
次に、各データポイントの平均値からの偏差を計算します。そして、それぞれの結果を二乗します。
次に、分散はこれらの値の平均です。
最後に、母集団標準偏差は分散の平方根です。
最初に用いた8つの値が対象となる母集団全体を表していない場合、これは母集団全体の標準偏差の推定値として考えられる多くの値のうちの1つにすぎません。この推定値は偏りがあり、繰り返しサンプリングを行った際の期待値は真の値からずれますが、それでも一貫性は保たれています。一方、その平均二乗誤差は、不偏推定量のそれよりも小さくなる可能性があります。
対象となる母集団がほぼ正規分布している場合、標準偏差は、特定の値より上または下の観測値の割合に関する情報を提供します。たとえば、米国の成人男性の平均身長は約69インチで、標準偏差は約3インチです。 [ 2 ]これは、ほとんどの男性 (正規分布を仮定すると約 68%) が平均 ( 66 ~ 72インチ)から 3 インチ以内( 1 標準偏差)の身長を持ち、ほぼすべての男性 (約 95%) が平均 ( 63 ~ 75インチ)から6インチ以内( 2 標準偏差) の身長を持つことを意味します。標準偏差がゼロの場合、すべての男性の身長は同じ 69 インチになります。分布が正規分布またはベル型であると仮定すると、3 標準偏差は調査対象の標本母集団の 99.73% を占めます(詳細については、 68-95-99.7 ルールまたは経験則を参照してください)。
μを確率密度関数fを持つ確率変数Xの期待値(平均値)とする。 Xの 標準偏差σは次のように定義される。 これは等しいと示せる
つまり、標準偏差はXの分散の平方根である。
確率分布の標準偏差は、その分布を持つ確率変数の標準偏差と同じである。
すべての確率変数に標準偏差があるとは限りません。分布の裾が無限大まで伸びている場合、積分が収束しない可能性があるため、標準偏差は存在しないかもしれません。正規分布は裾が無限大まで伸びていますが、裾が十分に速く減少するため、平均と標準偏差は存在します。パラメータを持つパレート分布平均値は存在するが、標準偏差は存在しない(大まかに言えば、標準偏差は無限大である)。コーシー分布は、平均値も標準偏差も持たない。
X が有限データセットx 1 , x 2 , ..., x Nからランダムな値を取り、各値が同じ確率を持つ場合、標準偏差は
注:上記の式にはバイアスが組み込まれています。ベッセル補正については、後述の説明を参照してください。
または、総和記号を用いると、
値が等しい確率を持つのではなく、異なる確率を持つ場合、x 1 の確率をp 1、x 2の確率をp 2、...、x N の確率をp Nとします。この場合、標準偏差は次のようになります。
確率密度関数p ( x )を持つ連続実数値確率変数Xの標準偏差は
ここで、積分は、確率変数Xの可能な値の集合を表すXの範囲にわたるxに対して取られる定積分である。
パラメトリック分布族の場合、標準偏差は多くの場合、基礎となる分布のパラメータを用いて表すことができます。例えば、基礎となる正規分布のパラメータがμとσ²である対数正規分布の場合、対数正規変数の標準偏差は次の式で与えられます。
母集団のすべてのメンバーをサンプリングする場合(標準化テストなど)には、母集団全体の標準偏差を求めることができます。それができない場合は、母集団から無作為に抽出したサンプルを調べ、そのサンプルの統計量を計算して、母集団標準偏差の推定値として標準偏差σを推定します。このような統計量を推定値と呼び、推定値(または推定値の値、すなわち推定値)を標本標準偏差と呼び、s(修飾語が付く場合もある)で表します。
正規分布の母平均を推定する場合とは異なり、標本平均は多くの望ましい特性(不偏、効率的、最尤)を持つ単純な推定量であるのに対し、標準偏差にはこれらの特性をすべて備えた単一の推定量は存在せず、標準偏差の不偏推定は非常に技術的に複雑な問題である。多くの場合、標準偏差は、以下で定義される補正標本標準偏差(N − 1を使用)を使用して推定され、これは修飾語なしで「標本標準偏差」と呼ばれることが多い。しかし、他の推定量は他の点で優れている。補正されていない推定量(Nを使用)は平均二乗誤差が低く、N − 1.5(正規分布の場合)を使用するとバイアスがほぼなくなる。
(有限母集団の)母集団標準偏差の公式は、標本のサイズを母集団のサイズとして使用して標本に適用できます(ただし、標本が抽出された実際の母集団のサイズははるかに大きい場合があります)。この推定値はs Nで表され、補正されていない標本標準偏差、または標本の標準偏差(母集団全体とみなされる)として知られており、次のように定義されます。[ 3 ] ここで、{ x 1 , x 2 , … , x N }はサンプル項目の観測値であり、x ̄はこれらの観測値の平均値です。分母Nはサンプルのサイズを表します。これはサンプル分散の平方根であり、サンプル平均からの偏差の二乗の平均です。
これは一貫性のある推定量であり(サンプル数が無限大に近づくにつれて確率的に母集団の値に収束する)、母集団が正規分布している場合の最尤推定値です。 [ 4 ]ただし、これはバイアスのある推定量であり、推定値は一般的に低すぎます。バイアスはサンプルサイズが大きくなるにつれて減少し、1 / Nに比例して減少するため、サンプルサイズが小さいか中程度の場合に最も顕著になります。N > 75 の場合、バイアスは 1% 未満です。したがって、非常に大きなサンプルサイズの場合、補正されていないサンプル標準偏差は一般的に許容範囲内です。この推定量は、補正されたサンプル標準偏差よりも平均二乗誤差が均一に小さくなります。
偏りのある標本分散(標本の2次中心モーメント、つまり母集団分散の下方偏り推定値)を使用して母集団の標準偏差の推定値を計算すると、結果は次のようになります。
ここで平方根を取ると、平方根が凹関数であることから、イェンセンの不等式により、さらに下方へのバイアスが生じます。分散のバイアスは容易に修正できますが、平方根によるバイアスは修正がより難しく、対象となる分布によって異なります。
分散の不偏推定量は、ベッセルの補正を適用し、Nの代わりにN − 1を使用することで得られ、不偏標本分散s 2と表記される。
この推定量は、分散が存在し、標本値が復元抽出で独立に抽出される場合に不偏である。N − 1 は、平均からの偏差のベクトルの自由度数に対応する。
平方根を取るとバイアスが再び導入されます(平方根は期待値と可換でない非線形関数であるため、多くの場合)、補正された標本標準偏差sが得られる。
前述のように、s 2は母分散の不偏推定量ですが、sは母標準偏差の偏り推定量であり、補正されていない標本標準偏差よりは著しく偏りが少ないものの、依然として偏りがあります。この推定量は一般的に使用され、単に「標本標準偏差」として知られています。標本サイズが小さい場合 ( N が10 未満) は、偏りが大きくなる可能性があります。標本サイズが大きくなるにつれて、偏りの量は減少します。より多くの情報が得られ、そして小さくなる。
標準偏差の不偏推定には、平均や分散とは異なり、すべての分布に適用できる公式はありません。代わりに、s を基準として補正係数でスケーリングすることで、不偏推定値が得られます。正規分布の場合、不偏推定値は s / c 4 で与えられます。ここで、補正係数 ( Nに依存します) はガンマ関数で表され、次のようになります。
これは、標本標準偏差の標本分布が(スケーリングされた)カイ分布に従い、補正係数がカイ分布の平均であることに起因します。
N − 1 をN − 1.5に置き換えることで近似値が得られ、次のようになる。
この近似における誤差は二乗に比例して減少し(1 / N² )、最小のサンプルまたは最高の精度を除けば、すべてに適しています。N = 3の場合、バイアスは 13% であり、N = 9の場合、バイアスは 3% です。
より正確な近似は、上記のN − 1.5 をN − 1.5 + 1 / 8 ( N − 1 )に置き換えることである。[ 5 ]
その他の分布については、正しい式は分布によって異なりますが、経験則としては、近似式をさらに改良したものを使用することです。
ここで、γ 2 は母集団の過剰尖度を表す。過剰尖度は、特定の分布については事前にわかっている場合もあれば、データから推定される場合もある。[ 6 ]
分布をサンプリングして得られる標準偏差は、数学的な理由(ここでは信頼区間によって説明される)と測定上の実際的な理由(測定誤差)の両方から、絶対的に正確ではありません。この数学的な影響は、信頼区間(CI)によって説明できます。
サンプルサイズが大きくなると信頼区間が狭くなることを示すために、次の例を考えてみましょう。N = 2の小さな母集団では、標準偏差を推定するための自由度は 1 つしかありません。その結果、SD の 95% 信頼区間は0.45 × SDから31.9 × SDまでになります。ここでの要因は次のとおりです。
どこは自由度kのカイ二乗分布のp分位点であり、1 − αは信頼水準です。これは以下と同等です。
k = 1 の場合、q 0.025 = 0.000982およびq 0.975 = 5.024となります。これらの 2 つの数の平方根の逆数から、上記の係数 0.45 と 31.9 が得られます。
N = 10のより大きな母集団では、標準偏差を推定するための自由度が 9 つあります。上記と同じ計算を行うと、この場合の 95% 信頼区間は0.69 × SDから1.83 × SDまでとなります。したがって、標本母集団が 10 であっても、実際の SD は標本標準偏差のほぼ 2 倍になることがあります。標本母集団がN = 100の場合、これは0.88 × SDから1.16 × SDまで下がります。標本標準偏差が実際の標準偏差に近いことをより確実にするには、多数の点を標本にする必要があります。
これらの同じ式は、標準正規理論に基づく最小二乗法による残差の分散の信頼区間を求めるためにも使用できます。ここで、 kは誤差の自由度です。
値の範囲RにわたるN > 4のデータのセットの場合、標準偏差sの上限はs = 0.6 Rで与えられます。[ 7 ]ほぼ正規分布であると仮定されるN > 100 のデータ に対する標準偏差の推定値は、正規曲線の下の面積の 95% が平均の両側におよそ 2 標準偏差あるという経験則から導き出され、したがって、95% の確率で値の全範囲Rは 4 標準偏差を表し、s ≈ R /4となります。このいわゆる範囲ルールは、標準偏差よりも可能な値の範囲を推定する方が容易であるため、サンプルサイズの推定に役立ちます。s ≈ R / K ( N ) となる範囲の他の除数K ( N )は、他のNの値や非正規分布に対して利用可能です。 [ 8 ]
標準偏差は位置の変化に対して不変であり、確率変数のスケールに直接比例します。したがって、定数cと確率変数XおよびYに対して、次のようになります。
2つの確率変数の合計の標準偏差は、それぞれの確率変数の標準偏差と、それらの間の共分散に関係づけることができる。
どこそしてはそれぞれ分散と共分散を表します。
二乗偏差の合計の計算は、データから直接計算されるモーメントと関連付けることができます。以下の式において、文字Eは期待値、すなわち平均値を意味します。
標本標準偏差は次のように計算できます。
すべての点で確率が等しい有限集団の場合、次のようになります。
つまり、標準偏差は、値の二乗の平均と平均値の二乗との差の平方根に等しいということです。
証明として分散の計算式、および標本標準偏差に関する同様の結果については、それぞれの式を参照してください。

標準偏差が大きいほど、データ点が平均値から大きくばらつくことを示し、標準偏差が小さいほど、データ点が平均値の周りに密集していることを示します。
例えば、3 つの母集団 {0, 0, 14, 14}、{0, 6, 8, 14}、{6, 6, 8, 8} はそれぞれ平均が 7 です。標準偏差はそれぞれ 7、5、1 です。3 番目の母集団は、値がすべて 7 に近いため、他の 2 つの母集団よりも標準偏差がはるかに小さくなっています。これらの標準偏差は、データ ポイント自体と同じ単位を持ちます。例えば、データセット {0, 6, 8, 14} が 4 人の兄弟の年齢 (年) を表している場合、標準偏差は 5 年です。別の例として、母集団 {1000, 1006, 1008, 1014} は、4 人のアスリートの移動距離 (メートル) を表している可能性があります。平均は 1007 メートル、標準偏差は 5 メートルです。
標準偏差は不確実性の尺度として用いられることがあります。例えば、物理科学では、繰り返し測定を行った際の標準偏差は、その測定の精度を示します。測定値が理論予測と一致するかどうかを判断する際には、測定値の標準偏差が非常に重要です。測定値の平均が予測値から大きく離れている場合(その距離を標準偏差で表すと)、検証対象の理論を修正する必要があると考えられます。これは、予測が正しく、標準偏差が適切に定量化されている場合に、測定値が妥当に期待できる値の範囲外にあるため、理にかなっています。予測区間を参照してください。
標準偏差は、典型的な値が平均値からどれだけ離れているかを測定する指標ですが、他にも様々な指標があります。例えば、平均絶対偏差は、標準偏差に含まれる二乗平均平方根偏差に比べて、平均的な距離をより直接的に表す指標と言えるでしょう。
一連の値の標準偏差を理解することの実際的な価値は、平均値(平均)からのばらつきの大きさを把握することにある。
標準偏差は、モデルのテストのために、実際のデータとモデルを比較する際によく使用されます。たとえば、工業用途では、生産ラインから出てくる製品の重量が、法律で定められた値に準拠する必要がある場合があります。製品の一部を計量することで平均重量を求めることができますが、これは常に長期平均とはわずかに異なります。標準偏差を使用することで、平均重量が非常に高い割合(99.9%以上)で収まる最小値と最大値を計算できます。平均重量がこの範囲外にある場合は、生産プロセスを修正する必要があるかどうかが判断されます。このような統計的テストは、テストに比較的コストがかかる場合に特に重要です。たとえば、製品を開封して中身を抜き、計量する必要がある場合や、テストによって製品が消費されてしまう場合などです。
実験科学では、現実の理論モデルが用いられます。素粒子物理学では、発見の宣言に「 5シグマ」という基準が慣例的に用いられます。5シグマレベルとは、ランダムな変動によってその結果が生じる確率が350万分の1であることを意味します。例えば、 CERNで行われた2つの独立した素粒子物理学実験では、ヒッグス粒子が発見されたと発表するために、このレベルの確実性が必要でした[ 9 ]。また、LIGO科学コラボレーションでは、重力波の存在を決定的に確認するために、このレベルの確実性が必要でした[ 10 ]。
簡単な例として、内陸の都市と沿岸の都市の2つの都市における日平均最高気温を考えてみましょう。沿岸に近い都市の日最高気温の変動幅は、内陸の都市よりも小さいことを理解しておくと役立ちます。したがって、これら2つの都市の平均最高気温が同じであっても、沿岸の都市の日最高気温の標準偏差は内陸の都市よりも小さくなります。これは、特定の日において、実際の最高気温が沿岸の都市よりも内陸の都市の平均最高気温から大きく乖離する可能性が高いからです。
金融分野では、標準偏差は、特定の資産(株式、債券、不動産など)の価格変動に伴うリスク、または資産ポートフォリオ(アクティブ運用型投資信託、インデックス型投資信託、ETFなど)のリスクの尺度としてよく用いられます[ 11 ]。リスクは、資産またはポートフォリオのリターンの変動を決定し、投資家に投資判断のための数学的根拠(平均分散最適化として知られる)を与えるため、投資ポートフォリオを効率的に管理する方法を決定する上で重要な要素です。リスクの基本的な概念は、リスクが増加すると、投資の期待収益率も増加するはずであり、この増加はリスクプレミアムとして知られています。言い換えれば、投資家は、投資がより高いレベルのリスクまたは不確実性を伴う場合、より高い投資収益率を期待するべきです。投資を評価する際には、投資家は期待収益率と将来の収益率の不確実性の両方を推定する必要があります。標準偏差は、将来の収益率の不確実性を定量的に推定します。
例えば、投資家が2つの株式から選択しなければならないとします。株式Aは過去20年間で平均リターンが10%、標準偏差が20パーセントポイント(pp)でした。一方、株式Bは同じ期間で平均リターンが12%でしたが、標準偏差は30ppと高くなっています。リスクとリターンの観点から、投資家は株式Aの方が安全な選択だと判断するかもしれません。なぜなら、株式Bのリターンが2パーセントポイント高い分、標準偏差が10pp高くなる(期待リターンのリスクや不確実性が高まる)ことに見合うものではないからです。株式Bは同じ状況下では株式Aよりも初期投資額を下回る(ただし上回る)可能性が高く、平均リターンはわずか2%高いと推定されます。この例では、株式Aは将来の年間リターンの約3分の2にあたる約10%±20pp(30%から-10%の範囲)の収益を上げると予想されます。将来的に起こりうる極端なリターンや結果を考慮する場合、投資家は最大でプラスマイナス10%、つまり70%からマイナス50%の範囲の結果を想定すべきです。これには、平均リターンから3標準偏差離れた結果(起こりうるリターンの約99.7%)が含まれます。
一定期間における証券のリターンの平均値(算術平均)を計算することで、その資産の期待リターンが得られます。各期間において、実際のリターンから期待リターンを差し引くことで、平均値との差が得られます。各期間の差を二乗し、その平均値を取ることで、資産のリターンの全体的な分散が得られます。分散が大きいほど、その証券が抱えるリスクは高くなります。この分散の平方根を求めることで、当該投資商品の標準偏差が得られます。
金融時系列データは非定常系列であることが知られていますが、標準偏差などの上記の統計計算は定常系列にのみ適用されます。上記の統計ツールを非定常系列に適用するには、まず時系列データを定常系列に変換する必要があります。そうすることで、統計ツールが有効な基盤に基づいて機能するようになります。
幾何学的な洞察と明確化を得るために、3つの値x 1、x 2、x 3の集合から始めます。これは、 R 3内の点P = ( x 1、x 2、x 3 )を定義します。直線L = {( r、r、r ) : r ∈ R }を考えます。これは原点を通る「主対角線」です。与えられた3つの値がすべて等しい場合、標準偏差はゼロになり、P はL上にあります。したがって、標準偏差がPからLまでの距離に関係していると考えるのは不合理ではありません。実際、その通りです。L から点Pへ直交するには、次の点から始めます。
その座標は、最初に設定した値の平均値です。
簡単な代数計算で、 PとMの間の距離(これはPと直線Lの間の直交距離と同じである)がわかる。これは、ベクトル( x 1 , x 2 , x 3 )の標準偏差に、ベクトルの次元数 (この場合は 3) の平方根を掛けたものに等しい。
観測値は、平均値から数標準偏差以上離れることはめったにありません。チェビシェフの不等式は、標準偏差が定義されているすべての分布において、平均値から数標準偏差以内の範囲にあるデータの量が、少なくとも以下の表に示されている量以上であることを保証します。

中心極限定理は、多数の独立同分布確率変数の平均分布が、確率密度関数が の有名なベル型の正規分布に近づくことを述べている。
ここで、μは確率変数の期待値、 σ は分布の標準偏差をn 1 ⁄ 2で割った値、nは確率変数の数です。したがって、標準偏差は単に曲線の幅を調整するスケーリング変数ですが、正規化定数にも現れます。
データ分布がほぼ正規分布である場合、平均値からz標準偏差以内にあるデータ値の割合は次のように定義されます。
どこは誤差関数です。数値x以下の割合は、累積分布関数によって与えられます。[ 13 ]
データ分布がほぼ正規分布である場合、データ値の約68%は平均値から1標準偏差以内(数学的にはμ ± σ、ここでμは算術平均)に収まり、約95%は2標準偏差以内(μ ± 2σ )、約99.7%は3標準偏差以内(μ ± 3σ )に収まります。これは68-95-99.7ルール、または経験則として知られています。
zのさまざまな値に対して、対称区間CI = (− z' σ , z' σ )内および外に位置すると予想される値の割合は次のとおりです。


標準偏差行列は、標準偏差を多次元に拡張したものです。これは、共分散行列の対称平方根です。。
複数の次元でランダムベクトルを線形にスケーリングするのと同じように、1次元の場合。スカラー確率変数分散付き次のように書くことができます、 どこ単位分散を持つ。同様に、ランダムベクトル共分散を持つ複数の次元において次のように書くことができます、 どこは、単位共分散を持つ正規化された変数です。これには以下が必要です。すると、解は無限に存在する。、したがって分布を白色化する方法は複数存在する。[ 14 ]対称平方根解決策の一つです。
例えば、多変量正規ベクトル定義できる、 どこは多変量標準正規分布です。

データセットの平均と標準偏差は、通常一緒に報告される記述統計量です。ある意味では、データの中心が平均を基準に測定される場合、標準偏差は統計的ばらつきの「自然な」尺度となります。これは、平均からの標準偏差が他のどの点からの標準偏差よりも小さいためです。正確な記述は次のとおりです。x 1 、 ...、x nを実数とし、関数を定義します。
微積分を用いるか平方完成を用いることで、 σ ( r )が平均値において唯一の最小値を持つことを示すことができる。
変動性は、標準偏差と平均値の比である変動係数によっても測定できます。これは無次元数です。
多くの場合、得られた平均値の精度に関する情報が必要になります。これは、標本平均の標準偏差を求めることで得られます。標本内の値が統計的に独立していると仮定すると、平均の標準偏差(SDOM)は分布の標準偏差と次の関係にあります。
ここで、Nは平均を推定するために使用される標本中の観測値の数です。これは、(分散の基本特性を参照)で簡単に証明できます。 (統計的独立性を仮定する。)
したがって
その結果:
平均値の標準偏差σを推定するには、母集団全体の標準偏差σを事前に知っておく必要があります。しかし、ほとんどの応用例では、このパラメータは未知です。例えば、実験室で未知の量を10回測定した場合、結果として得られる標本平均と標本標準偏差を計算することはできますが、平均値の標準偏差を計算することはできません。しかし、標本から母集団全体の標準偏差を推定することは可能であり、それによって平均値の標準誤差の推定値を得ることができます。
以下の2つの式は、移動標準偏差(繰り返し更新される標準偏差)を表すことができます。x 1 、 ...、x Nと表記されるN個のxの値に対して、2 つのべき乗和s 1とs 2が計算されます。
これらの累積和の結果に基づいて、N、s1、s2の値を用いて、いつでも現在の累積標準偏差の値を計算できます。
ここで、 N は、前述のように、値の集合のサイズです (またはs 0とみなすこともできます)。
同様に、標本標準偏差についても、
コンピュータ実装では、2 つのs j の合計が大きくなるにつれて、丸め誤差、算術オーバーフロー、算術アンダーフローを考慮する必要があります。以下の方法は、丸め誤差を減らした実行合計法を計算します。[ 15 ]これは、計算中に以前のデータを保存する必要なく、 n個のサンプルの分散を計算する「1 パス」アルゴリズムです。この方法を時系列に適用すると、一定幅のスライディング ウィンドウ計算ではなく、新しいサンプルごとにnが大きくなるにつれて、 nデータ ポイントに対応する連続した標準偏差の値が得られます。
k = 1, ..., nの場合:
ここでAは平均値である。
注: k − 1 = 0またはx 1 = A 1なのでQ 1 = 0です。
標本分散:
母集団の分散:
値が不均等な重み付けがされている電力和s 0、s 1、s 2はそれぞれ次のように計算されます。
そして、標準偏差の式は変わりません。s 0はサンプル数Nではなく、重みの合計になります。
丸め誤差を低減した増分法も適用可能ですが、若干の複雑さが増します。
1からnまでの各kについて、重みの累積合計を計算する必要があります。
また、上記で1/ kが使用されている箇所は、:
最終部門では、
そして
または
ここで、 nは要素の総数、n ′は重みがゼロでない要素の数である。
重みを1とすると、上記の式は、先に述べたより単純な式と等しくなります。
標準偏差という用語は、カール・ピアソンが講義で使用した後、1894年に初めて文書で使用されました。 [ 16 ] [ 17 ]これは、同じ概念を表す以前の別の名称の代替として使用されました。たとえば、ガウスは平均誤差を使用していました。[ 18 ]