

統計学において、標準偏差とは、変数の値がその平均値を中心にどれだけ変動しているかを測る尺度です。[1]標準偏差が低いということは、値が集合の平均値(期待値とも呼ばれる)に近い傾向があることを示し、標準偏差が高いということは、値がより広い範囲に広がっていることを示します。標準偏差は、何が外れ値で何が外れ値でないかを判断する際によく使用されます。標準偏差は、 SDまたはStd Devと略され、数学のテキストや方程式では、母標準偏差の場合は小文字のギリシャ文字 σ (シグマ)、標本標準偏差の場合はラテン文字 sで表されるのが最も一般的です。
ランダム変数、サンプル、統計的母集団、データ セット、または確率分布の標準偏差は、その分散の平方根です。(有限母集団の場合、分散は平均からの偏差の二乗の平均です。) 標準偏差の便利な特性は、分散と異なり、データと同じ単位で表現されることです。標準偏差は、有限サンプルの標準誤差を計算したり、統計的有意性を判断したりするためにも使用できます。
母集団からのデータのサンプルのみが利用可能な場合、サンプルの標準偏差またはサンプル標準偏差という用語は、それらのデータに適用される上記の量、または母集団標準偏差(母集団全体の標準偏差)の偏りのない推定値である修正された量のいずれかを指します。
標準誤差と統計的有意性との関係
母集団または標本の標準偏差と統計の標準誤差(例: 標本平均の標準誤差) はまったく異なりますが、関連しています。標本平均の標準誤差は、母集団から無限の数の標本を繰り返し抽出し、各標本の平均を計算することによって得られる平均セットの標準偏差です。平均の標準誤差は、母集団標準偏差を標本サイズの平方根で割った値に等しくなり、標本標準偏差を標本サイズの平方根で割って推定されます。たとえば、世論調査の標準誤差 (世論調査の誤差範囲として報告されるもの) は、同じ世論調査を複数回実施した場合に推定される平均の標準偏差の予想値です。したがって、標準誤差は推定値の標準偏差を推定するものであり、それ自体が推定値が母集団から抽出された特定の標本にどの程度依存するかを測定します。
科学では、データの標準偏差(要約統計として)と推定値の標準誤差(結果の潜在的な誤差の尺度として)の両方を報告するのが一般的です。慣例により、ヌル期待値から 2 標準誤差以上離れた効果のみが「統計的に有意」とみなされます。これは、実際にはランダムサンプリング誤差による誤った結論に対する予防策です。
基本的な例
8人の生徒の成績の母標準偏差
対象となる母集団全体が、特定のクラスの 8 人の生徒であるとします。有限の数値セットの場合、母集団の標準偏差は、平均値から値の偏差の二乗を引いた平均の平方根を取ることで求められます。8 人の生徒のクラス (つまり、統計的母集団) の成績は、次の 8 つの値です。
これらの 8 つのデータ ポイントの平均は 5 です。
まず、各データ ポイントの平均からの偏差を計算し、それぞれの結果を 二乗します。
分散は次の値の平均です。
そして、母標準偏差は分散の平方根に等しくなります。
この式は、最初の 8 つの値が完全な母集団を形成する場合にのみ有効です。値が大規模な親母集団から抽出された無作為標本である場合 (たとえば、200 万人のクラスから無作為に独立して選択された 8 人の学生である場合)、最後の式の分母を8 ( n )ではなく7 ( n − 1 )で割ることになり、結果はその場合、元の式の結果は標本標準偏差と呼ばれ、 ではなく で表されます。 で割るのではなくで割ると、より大きな親母集団の分散の不偏推定値が得られます。これはベッセル補正として知られています。[2] [3]大まかに言えば、その理由は、標本分散の式は観測値と標本平均の差を計算することに依存しており、標本平均自体は観測値にできるだけ近くなるように構成されているため、 nで割るだけでは変動性を過小評価してしまうためです。
成人男性の平均身長の標準偏差
対象の母集団がほぼ正規分布している場合、標準偏差は特定の値を上回るまたは下回る観測値の割合に関する情報を提供します。たとえば、米国の成人男性の平均身長は約69インチ[4]で、標準偏差は約3インチです。これは、ほとんどの男性(正規分布を想定すると約68% )の身長が平均値(66〜72インチ)の3インチ以内(1標準偏差)であり、ほぼすべての男性(約95%)の身長が平均値(63〜75インチ)の6インチ以内(2標準偏差)であることを意味します。標準偏差がゼロの場合、すべての男性の身長は69インチで同一になります。分布が正規またはベル型であると想定すると、3標準偏差で調査対象の標本母集団の99.73%を説明します(詳細については、 68–95–99.7ルールまたは経験則を参照してください)。
人口値の定義
μを密度f ( x )の確率変数Xの期待値(平均)とすると 、 Xの 標準偏差σは 次のように定義され、
言葉で言えば、標準偏差はXの分散の平方根です。
確率分布の標準偏差は、その分布を持つランダム変数の標準偏差と同じです。
すべてのランダム変数に標準偏差があるわけではありません。分布の裾が無限大に広がっている場合、積分が収束しない可能性があるため、標準偏差は存在しない可能性があります。正規分布の裾は無限大に広がっていますが、裾が十分に早く減少するため、平均と標準偏差は存在します。パラメータ付きパレート分布には平均がありますが、標準偏差はありません (大まかに言えば、標準偏差は無限大です)。コーシー分布には平均も標準偏差もありません。
離散確率変数
Xが有限データセットx 1、x 2、...、x Nからランダムな値を取り、各値が同じ確率を持つ場合、標準偏差は
注: 上記の式にはバイアスが組み込まれています。ベッセル補正については、下記の説明を参照してください。
または、加算記法を使うと、
値が等しい確率を持つのではなく、異なる確率を持つ場合、x 1 は確率p 1、x 2は確率p 2、...、x N は確率p N を持つものとします。この場合、標準偏差は次のようになります。
連続ランダム変数
確率密度関数p ( x )を持つ連続実数値確率変数 Xの標準偏差は
ここで、積分は、確率変数Xの可能な値の集合にわたる xについての定積分です。
パラメトリック分布族の場合、標準偏差はパラメータで表すことができます。たとえば、パラメータμとσ 2 を持つ対数正規分布の場合、標準偏差は
推定
母集団の標準偏差は、母集団のすべてのメンバーがサンプル抽出される場合(標準化されたテストなど)に見つけることができます。それができない場合は、母集団からランダムに抽出されたサンプルを調べ、サンプルの統計量を計算して標準偏差σを推定します。この統計量は母集団標準偏差の推定値として使用されます。このような統計量は推定量と呼ばれ、推定量(または推定値の値、つまり推定値)はサンプル標準偏差と呼ばれ、 s (修飾子が付く場合もあります)で表されます。
正規分布の母平均を推定する場合、標本平均は多くの望ましい特性 (不偏、効率的、最大尤度 ) を備えた単純な推定量ですが、標準偏差にはこれらすべての特性を備えた単一の推定量は存在せず、標準偏差の不偏推定は非常に技術的に複雑な問題です。 ほとんどの場合、標準偏差は、以下に定義される補正標本標準偏差( N − 1 を使用) を使用して推定され、修飾語なしで「標本標準偏差」と呼ばれることがよくあります。 ただし、他の推定量の方が他の点では優れています。補正されていない推定量 ( N を使用) では平均二乗誤差が低くなり、N − 1.5 (正規分布の場合) を使用するとバイアスがほぼ完全に排除されます。
補正されていないサンプル標準偏差
母集団標準偏差(有限母集団)の式は、標本の大きさを母集団の大きさとして標本に適用することができます(ただし、標本が抽出される実際の母集団の大きさははるかに大きい可能性があります)。この推定値はs Nで表され、未補正標本標準偏差、または標本(母集団全体とみなされる)の標準偏差として知られており、次のように定義されます。[5]
ここで、はサンプル項目の観測値、 はこれらの観測値の平均値です。分母 N はサンプルのサイズを表します。これはサンプル分散の平方根であり、サンプル平均を中心とした偏差の二乗の平均です。
これは整合的な推定量(サンプル数が無限大に近づくにつれて確率的に母集団の値に収束する)であり、母集団が正規分布している場合の最大尤度推定値である。 [6]しかし、推定値が一般に低すぎるため、これは偏りのある推定量である。サンプルサイズが大きくなるにつれてバイアスは減少し、1/ Nに比例して低下するため、小規模または中規模のサンプルサイズで最も顕著になる。バイアスは1%未満であるためである。したがって、サンプルサイズが非常に大きい場合、補正されていないサンプル標準偏差は一般に許容される。この推定量の平均二乗誤差は、補正されたサンプル標準偏差より も一様に小さくなる。
修正サンプル標準偏差
偏りのある標本分散(標本の2番目の中心モーメント、つまり母集団分散の下方偏り推定値)を使用して母集団の標準偏差の推定値を計算すると、結果は次のようになります 。
ここで平方根を取ると、平方根が凹関数であるため、ジェンセンの不等式によってさらに下向きのバイアスが生じます。分散のバイアスは簡単に修正できますが、平方根によるバイアスは修正が難しく、問題の分布に依存します。
ベッセル補正を適用し、N の代わりにN − 1を使用して、不偏標本分散s 2を生成することによって、分散の不偏推定量が与えられます。
この推定量は、分散が存在し、標本値が独立に復元抽出されている場合には不偏である。N − 1は平均からの偏差ベクトルの自由度 の数に対応する。
平方根を取るとバイアスが再導入されます(平方根は期待値と交換しない非線形関数であるため、多くの場合)。これにより、 sで表される修正されたサンプル標準偏差が生成されます。
上で説明したように、s 2 は母集団分散の不偏推定値ですが、s は母集団標準偏差の偏りのある推定値です。ただし、補正されていないサンプル標準偏差よりは偏りが著しく少なくなっています。この推定値はよく使用され、一般に単に「サンプル標準偏差」として知られています。小さなサンプル ( Nが 10 未満) では、偏りがまだ大きい場合があります。サンプル サイズが大きくなると、偏りの量は減少します。より多くの情報が得られ、との違いは小さくなります。
偏りのない標本標準偏差
標準偏差の不偏推定では、平均や分散とは異なり、すべての分布に当てはまる公式はありません。代わりに、s が基準として使用され、補正係数でスケーリングされて不偏推定値が生成されます。正規分布の場合、不偏推定量は次のように与えられますs/4位 、ここで補正係数( Nに依存)はガンマ関数で与えられ、次の式に等しくなります。
これは、標本標準偏差の標本分布が(尺度化された)カイ二乗分布に従い、補正係数がカイ二乗分布の平均であるために発生します。
N − 1 をN − 1.5に置き換えると近似値が得られ、次のようになります。
この近似値の誤差は2乗的に減少する(1/2番)、これは最小のサンプルまたは最高の精度を除くすべての場合に適しています。N = 3 の場合、バイアスは1.3% に等しく、 N = 9の場合、バイアスはすでに 0.1% 未満です。
より正確な近似値は、上記のN − 1.5をN − 1.5 + に置き換えることです。1/8( N − 1) の . [7]
他の分布の場合、正しい式は分布によって異なりますが、経験則としては近似値をさらに改良したものを使用します。
ここでγ2は母集団過剰尖度を表す。過剰尖度は特定の分布に対して事前に分かっている場合もあれば、データから推定される場合もある。[8]
標本標準偏差の信頼区間
分布をサンプリングして得られる標準偏差自体は、数学的な理由(ここでは信頼区間で説明)と測定上の実際的な理由(測定誤差)の両方から、絶対的に正確というわけではありません。数学的な効果は、信頼区間またはCI で説明できます。
サンプル数を増やすと信頼区間が狭くなる様子を示すために、次の例を考えてみましょう。N = 2の小さな母集団では、標準偏差を推定する自由度は 1 つしかありません。その結果、SD の 95% CI は 0.45 × SD から 31.9 × SD の範囲になります。ここでの要因は次のとおりです。
ここで、 は自由度kのカイ二乗分布のp番目の分位数であり、1 − αは信頼水準です。これは次の式と同等です。
k = 1の場合、q 0.025 = 0.000982、q 0.975 = 5.024となります。これら 2 つの数値の平方根の逆数から、上記の係数 0.45 と 31.9 が得られます。
N = 10のより大きな母集団では、標準偏差を推定するための自由度は 9 です。上記と同じ計算により、この場合の 95% CI は 0.69 × SD から 1.83 × SD の範囲になります。したがって、サンプル母集団が 10 であっても、実際の SD はサンプル SD よりほぼ 2 倍高くなる可能性があります。サンプル母集団N = 100の場合、これは 0.88 × SD から 1.16 × SD まで下がります。サンプル SD が実際の SD に近いことをより確実にするには、多数のポイントをサンプリングする必要があります。
これらの同じ式は、標準正規理論に基づく最小二乗近似から残差の分散の信頼区間を取得するために使用できます。ここで、 k は誤差の 自由度の数です。
標準偏差の境界
値の範囲R にまたがるN > 4のデータ セットの場合、標準偏差sの上限はs = 0.6 Rで与えられます。[9]ほぼ正規分布と見なされるN > 100データ の標準偏差の推定値は、正規曲線の下の領域の 95% が平均の両側に約 2 標準偏差分あるという経験則から得られます。そのため、95% の確率で値の全範囲R は4 標準偏差を表し、 s ≈ R /4となります。このいわゆる範囲ルールは、可能な値の範囲の方が標準偏差よりも推定しやすいため、サンプル サイズの推定に役立ちます。s ≈ R / K ( N )となる範囲の他の約数K ( N )は、 Nの他の値や非正規分布に対しても使用できます。 [10]
恒等式と数学的性質
標準偏差は位置の変化に対して不変であり、ランダム変数のスケールに直接比例します。したがって、定数cとランダム変数XとYの場合、次のようになります。
2 つのランダム変数の合計の標準偏差は、それぞれの標準偏差とそれらの間の共分散に関連付けることができます。
ここで、 と はそれぞれ分散と共分散を表します。
偏差の二乗和の計算は、データから直接計算されたモーメントに関連付けることができます。次の式では、文字E は期待値、つまり平均を意味すると解釈されます。
サンプル標準偏差は次のように計算できます。
全ての点で等しい確率を持つ有限の集団の場合、
つまり、標準偏差は、値の二乗の平均と平均値の二乗の差の平方根に等しくなります。
証明については分散の計算式を、サンプル標準偏差の同様の結果については計算式を参照してください。
解釈と応用

標準偏差が大きい場合は、データ ポイントが平均から遠くに広がっている可能性があり、標準偏差が小さい場合は、データ ポイントが平均の周囲に密集していることを示します。
たとえば、3 つの母集団 {0, 0, 14, 14}、{0, 6, 8, 14}、{6, 6, 8, 8} の平均はそれぞれ 7 です。標準偏差はそれぞれ 7、5、1 です。3 番目の母集団は、値がすべて 7 に近いため、他の 2 つの母集団よりも標準偏差がはるかに小さくなります。これらの標準偏差の単位は、データ ポイント自体と同じです。たとえば、データ セット {0, 6, 8, 14} が 4 人の兄弟の年齢を表す場合、標準偏差は 5 歳です。別の例として、母集団 {1000, 1006, 1008, 1014} は、4 人の運動選手が移動した距離をメートル単位で表すことができます。平均は 1007 メートル、標準偏差は 5 メートルです。
標準偏差は不確実性の尺度として役立ちます。たとえば、物理科学では、一連の繰り返し測定の報告された標準偏差は、それらの測定の精度を示します。測定値が理論的な予測と一致するかどうかを判断する場合、それらの測定値の標準偏差は非常に重要です。測定値の平均が予測から大きく離れている場合 (距離は標準偏差で測定されます)、テストされている理論を修正する必要がある可能性があります。これは、予測が正しく、標準偏差が適切に定量化されている場合に合理的に予測できる値の範囲外にあるため、理にかなっています。予測区間を参照してください。
標準偏差は、典型的な値が平均値からどのくらい離れているかを測定しますが、他の測定方法も利用できます。一例として、平均絶対偏差が挙げられます。これは、標準偏差に固有の二乗平均平方根距離と比較して、平均距離のより直接的な測定方法であると考えられます。
アプリケーション例
一連の値の標準偏差を理解することの実用的な価値は、平均からの変動がどの程度あるかを認識することにあります。
実験、産業、仮説検証
標準偏差は、モデルをテストするために、実際のデータとモデルを比較するのによく使用されます。たとえば、工業用途では、生産ラインから出荷される製品の重量が法的に要求される値に準拠する必要がある場合があります。製品の一部を計量すると平均重量がわかりますが、これは常に長期平均とわずかに異なります。標準偏差を使用すると、平均重量が非常に高い割合 (99.9% 以上) の範囲内になる最小値と最大値を計算できます。範囲外になった場合は、生産プロセスを修正する必要がある可能性があります。このような統計テストは、テストのコストが比較的高い場合に特に重要です。たとえば、製品を開いて水を抜いて計量する必要がある場合や、製品がテストによって使い切られた場合などです。
実験科学では、現実の理論モデルが使用される。素粒子物理学では、発見の宣言に「5シグマ」という基準が慣例的に使用されている。5シグマレベルは、ランダムな変動によって結果が生じる確率が350万分の1であることを意味する。このレベルの確実性は、 CERNでの2つの独立した実験でヒッグス粒子と一致する粒子が発見されたと主張するために必要であり、[11]また、重力波の最初の観測の宣言にもつながった。[12]
天気
簡単な例として、内陸都市と海岸沿いの 2 つの都市の平均最高気温を考えてみましょう。海岸近くの都市の最高気温の範囲は内陸都市よりも狭いことを理解しておくと役立ちます。したがって、これら 2 つの都市の平均最高気温は同じかもしれませんが、海岸沿いの都市の最高気温の標準偏差は内陸都市のそれよりも小さくなります。これは、特定の日において、実際の最高気温は内陸都市の平均最高気温から海岸沿いの都市よりも離れている可能性が高いためです。
ファイナンス
金融において、標準偏差は、特定の資産(株式、債券、不動産など)の価格変動に関連するリスク、または資産ポートフォリオ[13](アクティブに運用される投資信託、インデックス投資信託、または ETF)のリスクの尺度としてよく使用されます。リスクは、資産またはポートフォリオの収益の変動を決定し、投資家に投資決定の数学的根拠(平均分散最適化として知られています)を提供するため、投資ポートフォリオを効率的に管理する方法を決定する上で重要な要素です。リスクの基本的な概念は、リスクが増加すると、投資の期待収益も増加するはずであり、この増加はリスクプレミアムとして知られています。言い換えれば、投資家は、その投資がより高いレベルのリスクまたは不確実性を伴う場合、投資に対してより高い収益を期待する必要があります。投資を評価する際、投資家は期待収益と将来の収益の不確実性の両方を見積もる必要があります。標準偏差は、将来の収益の不確実性の定量化された推定値を提供します。
たとえば、投資家が 2 つの株式のどちらかを選択しなければならないとします。過去 20 年間の株式 A の平均収益率は 10 パーセントで、標準偏差は 20パーセント ポイント(pp) でした。同じ期間の株式 B の平均収益率は 12 パーセントでしたが、標準偏差は 30 pp と高くなっています。リスクと収益に基づいて、投資家は株式 A の方が安全な選択であると判断する場合があります。株式 B の追加の収益率 2 パーセント ポイントは、追加の 10 pp 標準偏差 (期待収益のリスクまたは不確実性が高い) に見合わないからです。同じ状況では、株式 B は株式 A よりも初期投資額を下回る可能性が高く (ただし、初期投資額を上回る可能性も高い)、平均で 2 パーセントだけ高い収益しか得られないと推定されます。この例では、株式 A は約 10 パーセント、プラスマイナス 20 pp (30 パーセントから -10 パーセントの範囲)、つまり将来の年間収益の約 3 分の 2 の収益を得ると予想されます。将来的にさらに極端なリターンや結果が起こり得ることを考慮すると、投資家は最大 10 パーセントプラスマイナス 60 ポイント、または 70 パーセントから -50 パーセントの範囲の結果を予想する必要があります。これには、平均リターン (可能性のあるリターンの約 99.7 パーセント) からの 3 標準偏差の結果が含まれます。
特定の期間における証券の収益の平均 (または算術平均) を計算すると、資産の期待収益が得られます。各期間について、実際の収益から期待収益を差し引くと、平均との差が算出されます。各期間の差を二乗して平均を取ると、資産の収益の全体的な分散が得られます。分散が大きいほど、証券のリスクは大きくなります。この分散の平方根を求めると、問題の投資ツールの標準偏差が得られます。
金融時系列は非定常系列であることが知られていますが、標準偏差などの上記の統計計算は定常系列にのみ適用されます。上記の統計ツールを非定常系列に適用するには、まず系列を定常系列に変換して、有効な基準に基づいた統計ツールを使用できるようにする必要があります。
幾何学的解釈
幾何学的な洞察と明確化のために、まず 3 つの値x 1、x 2、x 3の集合から始めます。これにより、 R 3内の点P = ( x 1、x 2、x 3 )が定義されます。直線L = {( r、r、r ) : r ∈ R }を考えます。これは、原点を通る「主対角線」です。与えられた 3 つの値がすべて等しい場合、標準偏差は 0 になり、P はL上にあります。したがって、標準偏差はPからLまでの距離に関連していると仮定しても不合理ではありません。実際、その通りです。Lから点Pに直交して移動するには、次の点から始めます。
その座標は、最初に設定した値の平均です。
少し代数的に計算すると、PとMの間の距離 ( Pと直線Lの間の直交距離と同じ)は、ベクトルの標準偏差( x 1、x 2、x 3 )にベクトルの次元数 (この場合は 3) の平方根を掛けたものに等しいことがわかります。
チェビシェフの不等式
観測値が平均値から数標準偏差以上離れることはほとんどありません。チェビシェフの不等式により、標準偏差が定義されているすべての分布について、平均値の標準偏差数以内のデータ量は、少なくとも次の表に示されている量と同じになります。
正規分布データのルール

中心極限定理は、多数の独立した同一分布のランダム変数の平均分布は、確率密度関数が
ここで、μはランダム変数の期待値、 σ は分布の標準偏差をn 1 ⁄ 2で割った値、n はランダム変数の数です。したがって、標準偏差は、曲線の幅を調整する単なるスケーリング変数ですが、正規化定数にも現れます。
データ分布がほぼ正規分布である場合、平均値の z標準偏差内のデータ値の割合は次のように定義されます。
ここで は誤差関数である。ある数値x以下となる割合は累積分布関数によって与えられる: [15]
データ分布がほぼ正規分布である場合、データ値の約 68 パーセントが平均値の 1 標準偏差以内 (数学的にはμ ± σ、μは算術平均) にあり、約 95 パーセントが 2 標準偏差以内 ( μ ± 2 σ ) にあり、約 99.7 パーセントが 3 標準偏差以内 ( μ ± 3 σ ) にあります。これは68-95-99.7 ルール、または経験則として知られています。
zの様々な値に対して、対称区間CI = (− z σ、z σ )内と外にあると予想される値の割合は次のとおりです。


標準偏差と平均の関係
データ セットの平均と標準偏差は、通常一緒に報告される記述統計です。ある意味では、データの中心が平均のまわりで測定される場合、標準偏差は統計的分散の「自然な」尺度です。これは、平均からの標準偏差が他のどの点からの標準偏差よりも小さいためです。正確な記述は次のとおりです。x 1 、...、x n が実数であると仮定し、関数を定義します。
微積分や平方完成法を使うと、 σ ( r )が平均値で一意に最小値を持つこと を示すことができます。
変動性は、標準偏差と平均値の比である変動係数によっても測定できます。これは無次元数です。
平均値の標準偏差
多くの場合、得られた平均値の精度に関する情報が必要になります。これは、サンプル平均値の標準偏差を決定することで得られます。サンプル内の値が統計的に独立していると仮定すると、平均値の標準偏差は分布の標準偏差と次の式で関係します。
ここで、N は平均を推定するために使用されるサンプル内の観測値の数です。これは次のように簡単に証明できます (分散の基本的な特性を参照)。
(統計的独立性が仮定されます。)
したがって
その結果:
平均の標準偏差σ平均を推定するには、母集団全体の標準偏差σを事前に知っておく必要があります。ただし、ほとんどのアプリケーションでは、このパラメータは不明です。たとえば、実験室で未知の量の一連の 10 回の測定を実行すると、結果のサンプル平均とサンプル標準偏差を計算することはできますが、平均の標準偏差を計算することはできません。ただし、サンプルから母集団全体の標準偏差を推定し、平均の標準誤差の推定値を取得することはできます。
高速計算方法
次の 2 つの式は、実行中の (繰り返し更新される) 標準偏差を表すことができます。2 つの累乗和s 1とs 2のセットは、 x 1、...、x Nと表記されるN個のx値のセットに対して計算されます。
これらの累積合計の結果が与えられた場合、値N、s 1、s 2はいつでも実行標準偏差の 現在の値を計算するのに使用できます。
ここで、 N は前述のように、値のセットのサイズです(またはs 0と見なすこともできます)。
同様に標本標準偏差についても、
コンピュータ実装では、2 つのs j の合計が大きくなると、丸め誤差、算術オーバーフロー、算術アンダーフローを考慮する必要があります。以下の方法では、丸め誤差を減らした実行中合計法を計算します。[16]これは、計算中に以前のデータを保存する必要がなく、 n 個のサンプルの分散を計算する「ワンパス」アルゴリズムです。この方法を時系列に適用すると、一定幅のスライディングウィンドウ計算ではなく、 n が新しいサンプルごとに大きくなるにつれて、 nデータポイントに対応する標準偏差の連続値が得られます。
k = 1, ..., n の場合:
ここで、A は平均値です。
注: k − 1 = 0またはx 1 = A 1なので、 Q 1 = 0です。
サンプル分散:
人口分散:
加重計算
値が不均等な重みで重み付けされている場合、累乗和s 0、s 1、s 2はそれぞれ次のように計算されます。
標準偏差の式は変更されません。s 0はサンプル数Nではなく、重みの合計になります。
丸め誤差が低減された増分方式も適用できますが、複雑さが増します。
1からnまでの各kについて重みの合計を計算する必要があります。
上記で1/ kが使用されている箇所は次のように置き換える必要があります。
最終部門では、
そして
または
ここで、nは要素の総数、n ′ は重みがゼロでない要素の数です。
重みを 1 とすると、上記の式は上記のより単純な式と等しくなります。
歴史
標準偏差という用語は、 1894年にカール・ピアソンが講義で使用した後、初めて文書で使用されました。 [17] [18]これは、同じ概念に対する以前の別名の代わりとして使われました。たとえば、ガウスは平均誤差を使用しました。[19]
標準偏差指数
標準偏差指数(SDI)は、特に医療検査室の外部品質評価に使用され、次のように計算されます。[20]
高次元

2次元では、標準偏差は標準偏差楕円で表すことができます(多変量正規分布 § 幾何学的解釈を参照)。
代替案
標準偏差は平均絶対偏差よりも代数的には単純であるが[例が必要]、実際にはそれほど堅牢ではない。[21] [22]
参照
参考文献
- ^ Bland, JM; Altman, DG (1996). 「統計ノート: 測定誤差」. BMJ . 312 (7047): 1654. doi :10.1136/bmj.312.7047.1654. PMC 2351401. PMID 8664723 .
- ^ Weisstein, Eric W.「ベッセルの補正」。MathWorld。
- ^ 「標準偏差の公式」www.mathsisfun.com . 2020年8月21日閲覧。
- ^ 米国小児および成人の人体測定基準データ、2015~2018年(PDF)、国立健康統計センター:人口動態・健康統計、第3巻、疾病管理予防センター、2021年1月、16ページ、表12
- ^ Weisstein, Eric W. 「標準偏差」。mathworld.wolfram.com 。 2020年8月21日閲覧。
- ^ 「Consistent estimator」www.statlect.com . 2022年10月10日閲覧。
- ^ ガーランド、ジョン; トリパシ、ラム C. (1971)、「標準偏差の偏りのない推定のための簡単な近似値」、アメリカ統計学者、25 (4): 30– 32、doi :10.2307/2682923、JSTOR 2682923
- ^ 「標準偏差計算機」。PureCalculators 。2021年7月11日。 2021年9月14日閲覧。
- ^ Shiffler, Ronald E.; Harsha, Phillip D. (1980). 「サンプル標準偏差の上限と下限」.統計教育. 2 (3): 84– 86. doi :10.1111/j.1467-9639.1980.tb00398.x.
- ^ Browne, Richard H. (2001). 「検出力計算におけるサンプルサイズの計算基準としてのサンプル範囲の使用」.アメリカ統計学者. 55 (4): 293– 298. doi :10.1198/000313001753272420. JSTOR 2685690. S2CID 122328846.
- ^ 「CERNの実験で、長年探し続けてきたヒッグス粒子と一致する粒子が観測される | CERN プレスオフィス」 Press.web.cern.ch. 2012年7月4日。2016年3月25日時点のオリジナルよりアーカイブ。 2015年5月30日閲覧。
- ^ LIGO Scientific Collaboration、Virgo Collaboration (2016)、「バイナリブラックホール合体からの重力波の観測」、Physical Review Letters、116 (6): 061102、arXiv : 1602.03837、Bibcode :2016PhRvL.116f1102A、doi :10.1103/PhysRevLett.116.061102、PMID 26918975、S2CID 124959784
- ^ 「標準偏差とは何か」。Pristine 。 2011年10月29日閲覧。
- ^ Ghahramani, Saeed (2000).確率の基礎(第2版). ニュージャージー: Prentice Hall. p. 438. ISBN 9780130113290。
- ^ Eric W. Weisstein. 「分布関数」. MathWorld . Wolfram . 2014年9月30日閲覧。
- ^ Welford, BP (1962年8月). 「修正平方和と積の計算方法に関する注記」. Technometrics . 4 (3): 419– 420. CiteSeerX 10.1.1.302.7503 . doi :10.1080/00401706.1962.10490022.
- ^ ドッジ、ヤドラー(2003年)。オックスフォード統計用語辞典。オックスフォード大学出版局。ISBN 978-0-19-920613-1。
- ^ ピアソン、カール( 1894)。「非対称周波数曲線の分析について」。王立協会哲学論文集 A 185 : 71–110。Bibcode : 1894RSPTA.185...71P。doi : 10.1098/ rsta.1894.0003。
- ^ ミラー、ジェフ。「数学用語の最も古い使用例」。
- ^ Harr, Robert R. (2012). Medical Laboratory Science Review . フィラデルフィア: FA Davis Co. p. 236. ISBN 978-0-8036-3796-2. OCLC 818846942.
- ^ ガウス、カール・フリードリヒ(1816)。 「Bestimmung der Genauigkeit der Beobachtungen」。天文学と展望に関するツァイツシュリフト。1 : 187–197 .
- ^ ウォーカー、ヘレン(1931年)。統計手法の歴史研究。ボルチモア、MD:ウィリアムズ&ウィルキンス社 。pp.24-25。
外部リンク
