

統計学(ドイツ語: Statistik、元々は「国家、国の記述」 [ 1 ] )は、データの収集、整理、分析、解釈、および提示に関する学問分野です。[ 2 ]統計学を科学的、産業的、または社会的な問題に適用する場合、研究対象となる統計的母集団または統計モデルから始めるのが一般的です。母集団は、「ある国に住むすべての人々」や「結晶を構成するすべての原子」など、さまざまな人や物のグループである可能性があります。統計学は、調査や実験の設計という観点からのデータ収集の計画を含め、データのあらゆる側面を扱います。[ 3 ]統計学は、物理学、化学、地理学、地政学、そして特に数学などの分野と深く関連しています。
国勢調査データ(対象集団の全メンバーを含む)を収集できない場合、統計学者は特定の実験計画と標本調査によってデータを収集します。無作為抽出法を用いることで、標本から母集団全体への推論と結論の妥当性を確保できます。実験的研究では、調査対象システムの測定を行い、システムを操作し、その後同じ手順で追加の測定を行い、操作によって測定値が変化したかどうかを判断します。一方、観察研究では、実験的な操作は行いません。
データ分析では主に 2 つの統計的手法が用いられます。1つは平均や標準偏差などの指標を用いて標本からのデータを要約する記述統計、もう1 つはランダムな変動 (観測誤差、標本変動など) を受けるデータから結論を導き出す推測統計です。 [ 4 ]記述統計は、分布(標本または母集団)の 2 つの特性に最も関心を寄せます。中心傾向(または位置) は分布の中心値または典型的な値を特徴づけようとし、分散(または変動性) は分布の要素が中心や他の要素からどの程度離れているかを特徴づけます。数理統計を用いて行われる推論は、ランダムな現象の分析を扱う確率論の枠組みを採用しています。
標準的な統計的手順では、 2 つの統計データセット間の関係、またはデータセットと理想化されたモデルから抽出された合成データとの関係を検定するためのデータ収集が行われます。2 つのデータセット間の統計的関係について仮説が提案され、これは2 つのデータセット間に関係がないという理想化された帰無仮説の代替となります。帰無仮説の棄却または反証は、検定で使用されるデータに基づいて帰無仮説がどの程度偽であると証明できるかを定量化する統計的検定を使用して行われます。帰無仮説から出発して、2 つの基本的なエラーが認識されます。タイプ I エラー(帰無仮説が実際には真であるにもかかわらず棄却され、「偽陽性」となる) とタイプ II エラー(帰無仮説が実際には偽であるにもかかわらず棄却されず、「偽陰性」となる) です。このフレームワークには、十分なサンプルサイズの取得から適切な帰無仮説の指定まで、さまざまな問題が関連付けられるようになりました。[ 4 ]
統計的測定プロセスは、生成されるデータに関して誤差が生じやすい。これらの誤差の多くは、ランダム誤差(ノイズ)または系統誤差(バイアス)に分類されるが、その他の種類の誤差(例えば、分析者が誤った単位を報告する場合などのミス)も発生する可能性がある。欠損データや打ち切りデータが存在すると、推定値にバイアスが生じる可能性があり、これらの問題に対処するための特定の手法が開発されている。
「統計学は不確実性の科学であると同時に、データから情報を抽出する技術でもある。」 - 国際統計科学百科事典に掲載。[ 5 ]
統計学は、意味のある情報が推測されるデータ、事実、数値を扱う学問分野です。データは、量的データのように数値で表される場合もあれば、質的データのようにラベルで表される場合もあります。データは、記述統計と呼ばれる2つの方法のいずれかで収集、提示、要約されます。データの基本的な要約は、平均と分散の2つで、これらは統計量と呼ばれます。一方、推測統計は、母集団サンプルからのデータを解釈して、母集団に関する記述や予測を導き出します。[ 6 ] [ 7 ] [ 5 ]
統計学は科学の一分野[ 8 ]または数学の一分野[ 9 ]とみなされています。統計学は、ランダムな事象を研究する数学の一分野である確率に基づいています。統計学は不確実性の科学と考えられています。これは、測定誤差や標本誤差に対処する方法、およびモデリングにおける不確実性に対処する方法から生じます。確率と統計はかつては単一の科目として一緒に扱われていましたが、概念的には互いに異なります。前者は確率の一般理論から特定の状況に対する答えを導き出すことに基づいているのに対し、統計学はデータセットに基づいて母集団に関する記述を導き出します。統計学は、確率と応用数学分野の間のギャップを埋める役割を果たします。[ 10 ] [ 5 ] [ 11 ]
統計学は、数学の一分野ではなく、独立した数学科学であると考える人もいます。多くの科学的調査ではデータが利用されますが、統計学は一般的に、不確実性の文脈におけるデータの利用と、不確実性に直面した意思決定に関係しています。 [ 12 ] [ 13 ]統計学は、数学主題分類では、確率論と確率過程のサブクラスである62に索引付けされています。[ 14 ]数理統計学は、米国議会図書館分類では、サブクラスQA(科学 > 数学)の276-280の範囲に含まれています。[ 15 ]
統計という言葉は、最終的にはラテン語の Status に由来し、これは社会における「状況」または「状態」を意味し、後期ラテン語では「状態」という意味になりました。この語から派生して、政治学者のゴットフリート・アッヘンヴァルは、ドイツ語の statistik (現状の要約) という言葉を作り出しました。1770 年に、この用語はドイツ語から英語に入り、政治的取り決めの研究を指すようになりました。この用語は、1790 年代にジョン・シンクレアの著作で現代的な意味を獲得しました。[ 16 ] [ 17 ]現代ドイツ語では、statistik という用語は数学統計と同義です。単数形の statistic という用語は、同じ名前の値を返す関数を説明するために使用されます。[ 18 ]
国勢調査データが収集できない場合、統計学者は特定の実験計画や標本調査を実施することで標本データを収集します。統計学自体も、統計モデルを通して予測や予報を行うためのツールを提供します。
標本を母集団全体の指針として用いるためには、標本が母集団全体を真に代表していることが重要です。代表標本抽出法を用いることで、標本から母集団全体への推論や結論の適用が安全になります。大きな課題は、選択された標本が実際にどの程度代表的であるかを判断することです。統計学は、標本抽出法やデータ収集手順におけるあらゆる偏りを推定し、補正するための手法を提供します。また、実験計画法を用いることで、研究の初期段階でこれらの問題を軽減し、母集団に関する真実を見抜く能力を高めることができます。
標本理論は、確率論という数学分野の一部です。確率は、数理統計学において標本統計量の標本分布、そしてより一般的には統計的手法の特性を研究するために用いられます。統計的手法は、対象となるシステムまたは母集団がその手法の仮定を満たす場合にのみ有効です。古典的な確率論と標本理論の観点の違いは、おおまかに言えば、確率論は母集団全体の与えられたパラメータから標本に関する確率を推論するのに対し、統計的推論は逆の方向、つまり標本からより大きな母集団全体のパラメータを帰納的に推論するという点にあります。
統計研究プロジェクトの一般的な目標は因果関係を調査することであり、特に予測変数または独立変数の値の変化が従属変数に及ぼす影響について結論を出すことです。因果関係を統計的に調査する研究には、実験研究と観察研究という2つの主要なタイプがあります。どちらのタイプの研究でも、独立変数(または複数の独立変数)の差異が従属変数の挙動に及ぼす影響が観察されます。この2つのタイプの相違点は、研究が実際にどのように実施されるかにあります。どちらも非常に効果的です。実験研究では、研究対象のシステムを測定し、システムを操作し、同じ手順を使用して異なるレベルで追加の測定を行い、操作によって測定値が変わったかどうかを判断します。一方、観察研究では実験的な操作は行いません。代わりに、データを収集し、予測変数と応答変数の間の相関関係を調査します。データ分析のツールはランダム化研究のデータに最も効果的ですが、自然実験や観察研究[ 19 ]などの他の種類のデータにも適用され、統計学者は一貫性のある推定値を生成する修正されたより構造化された推定方法(例えば、差分の差分推定や操作変数など)を使用します。
統計実験の基本的な手順は以下のとおりです。
人間の行動に関する実験には特別な注意点があります。有名なホーソン実験では、ウェスタン・エレクトリック社のホーソン工場の作業環境の変化を調査しました。研究者たちは、照明を増やすと組立ライン作業員の生産性が向上するかどうかを調べることに関心がありました。研究者たちはまず工場の生産性を測定し、次に工場の特定のエリアの照明を変更し、照明の変化が生産性に影響するかどうかを確認しました。実験条件下では、生産性は実際に向上したことがわかりました。しかし、この研究は、特にコントロールグループの欠如と盲検化など、実験手順の誤りについて今日では厳しく批判されています。ホーソン効果とは、観察そのものによって結果(この場合は作業員の生産性)が変化するという発見を指します。ホーソン実験の参加者は、照明が変更されたからではなく、観察されたために生産性が向上しました。[ 20 ]
観察研究の一例として、喫煙と肺がんの関連性を調査する研究が挙げられます。この種の研究では、通常、調査を用いて関心領域に関する観察データを収集し、統計分析を行います。この場合、研究者は、おそらくコホート研究を通じて、喫煙者と非喫煙者の両方に関する観察データを収集し、各グループにおける肺がんの症例数を調べます。[ 21 ]症例対照研究は、関心のある結果(例えば肺がん)を持つ人と持たない人が参加を求められ、曝露歴が収集される別のタイプの観察研究です。
測定レベルの分類体系を作成しようとする試みは数多く行われてきた。精神物理学者のスタンリー・スミス・スティーブンスは、名義尺度、順序尺度、間隔尺度、比率尺度を定義した。名義尺度は値の間に意味のある順位がなく、任意の1対1(単射)変換が可能である。順序尺度は連続する値の間に不正確な差があるが、それらの値には意味のある順序があり、任意の順序保持変換が可能である。間隔尺度は測定値間の意味のある距離が定義されているが、ゼロ値は任意であり(摂氏または華氏での経度や温度測定の場合など)、任意の線形変換が可能である。比率尺度は意味のあるゼロ値と異なる測定値間の距離の両方が定義されており、任意の再スケーリング変換が可能である。
名義尺度または順序尺度にのみ適合する変数は、数値的に適切に測定できないため、カテゴリ変数としてまとめられることがあります。一方、比率尺度および間隔尺度は、数値的な性質から、離散的または連続的である量的変数としてまとめられます。このような区別は、コンピュータサイエンスのデータ型と緩やかに相関していることが多く、二値カテゴリ変数はブールデータ型で、多値カテゴリ変数は整数データ型で任意に割り当てられた整数で、連続変数は浮動小数点演算を含む実数データ型で表現できます。しかし、コンピュータサイエンスのデータ型と統計データ型のマッピングは、後者のどの分類が実装されているかによって異なります。
他の分類方法も提案されている。例えば、MostellerとTukey(1977)[ 22 ]は、等級、順位、計数分数、計数、量、および残高を区別した。Nelder(1990)[ 23 ]は、連続計数、連続比、計数比、およびカテゴリカルなデータモードについて説明した。(Chrisman(1998) [ 24 ] 、 van den Berg(1991)[ 25 ]も参照のこと)
異なる測定手順から得られたデータに異なる統計的手法を適用することが適切かどうかという問題は、変数の変換や研究課題の正確な解釈に関する問題によって複雑化する。「データとそれが記述するものとの関係は、ある種の統計的記述の真偽値が、いくつかの変換の下で不変ではない可能性があるという事実を反映しているにすぎない。変換を検討することが妥当かどうかは、答えようとしている質問によって決まる。」[ 26 ]: 82
記述統計(可算名詞の意味)とは、情報の集合の特徴を定量的に記述または要約する要約統計量であり、[ 27 ]一方、記述統計(不可算名詞の意味)とは、それらの統計量を使用して分析するプロセスです。記述統計は、推測統計(または帰納統計)とは区別されます。なぜなら、記述統計は、データのサンプルが代表していると考えられる母集団について学ぶためにデータを使用するのではなく、サンプルを要約することを目的としているからです。[ 28 ]
統計的推論とは、データ分析を用いて基礎となる確率分布の特性を推論するプロセスである。[ 29 ]推論統計分析は、例えば仮説検定や推定値の導出によって、母集団の特性を推論する。観測データセットはより大きな母集団からサンプリングされたものと想定される。推論統計は記述統計とは対照的である。記述統計は観測データの特性のみに関心があり、データがより大きな母集団から得られたものであるという仮定には基づいていない。[ 30 ]
与えられた確率分布を持つ独立同分布(IID)確率変数を考えます。標準的な統計的推論と推定理論では、ランダムサンプルはこれらのIID変数の列ベクトルによって与えられるランダムベクトルとして定義されます。[ 31 ]調査対象の母集団は、未知のパラメータを持つ可能性のある確率分布によって記述されます。
統計量とは、ランダムサンプルの関数ではあるが、未知のパラメータの関数ではない確率変数です。ただし、統計量の確率分布には未知のパラメータが含まれる場合があります。ここで、未知のパラメータの関数を考えてみましょう。推定量とは、そのような関数を推定するために使用される統計量です。一般的に使用される推定量には、標本平均、不偏標本分散、標本共分散などがあります。
ランダムサンプルと未知のパラメータの関数であるが、その確率分布が未知のパラメータに依存しない確率変数は、ピボット量またはピボットと呼ばれます。広く用いられているピボットには、 zスコア、カイ二乗統計量、スチューデントのt値などがあります。
あるパラメータの2つの推定量のうち、平均二乗誤差が小さい方が効率的であると言われます。さらに、推定量の期待値が推定対象の未知のパラメータの真の値と等しい場合、その推定量は不偏であると言われ、その期待値が極限においてそのパラメータの真の値に収束する場合、漸近的に不偏であると言われます。
推定器に求められるその他の望ましい特性としては、推定対象となるパラメータのすべての可能な値に対して分散が最小となるUMVUE推定器(これは通常、効率性よりも検証しやすい特性である)や、確率的にそのパラメータの真の値に収束する一貫性推定器などが挙げられる。
与えられた状況で推定値を取得して計算を実行する方法という問題が依然として残っています。モーメント法、最尤法、最小二乗法、そしてより新しい推定方程式法など、いくつかの方法が提案されています。
統計情報の解釈には、通常(必ずしもそうとは限りませんが)、変数間に何の関連性も存在しない、または時間の経過とともに変化が起こらなかったという帰無仮説を立てることがよく伴います。[ 32 ] [ 33 ]対立仮説は、帰無仮説と矛盾する仮説の名前です。
初心者にとって最も分かりやすい例は、刑事裁判で直面するジレンマです。帰無仮説 H₀は被告人が無罪であると主張し、対立仮説 H₁は被告人が有罪であると主張します。起訴は有罪の疑いから行われます。H₀ (現状)はH₁と対立し、 H₁ が「合理的な疑いを超える」証拠によって裏付けられない限り維持されます。しかし、この場合の「 H₀を棄却しない」ことは無罪を意味するのではなく、単に有罪判決を下すには証拠が不十分であったことを意味します。つまり、陪審は必ずしもH₀を受け入れたわけではなく、H₀を棄却しなかっただけです。帰無仮説を「証明」することはできませんが、第 2 種のエラーをテストする検出力テストによって、帰無仮説が真である可能性をテストすることはできます。テストが実施される時点で帰無仮説はすでに真であると仮定されているため、帰無仮説が真であることを証明することはできません。
帰無仮説から出発して、大きく分けて2つの種類の誤差が認識される。
標準偏差とは、標本中の個々の観測値が、標本平均や母平均などの中心値からどの程度離れているかを示す指標であり、標準誤差とは、標本平均と母平均の差の推定値を示す指標である。
統計誤差とは、観測値が期待値からどれだけ乖離しているかを示すものです。残差とは、観測値が、与えられた標本に基づいて期待値の推定値(予測値とも呼ばれる)からどれだけ乖離しているかを示すものです。
平均二乗誤差は、効率的な推定量を得るために用いられ、これは広く用いられている推定量のクラスである。二乗平均平方根誤差は、平均二乗誤差の平方根である。

多くの統計的手法は残差平方和を最小化しようとし、これらは最小絶対偏差とは対照的に「最小二乗法」と呼ばれます。後者は小さな誤差と大きな誤差に等しい重みを与えますが、前者は大きな誤差により大きな重みを与えます。残差平方和は微分可能でもあり、回帰を行う上で便利な性質を提供します。線形回帰に適用される最小二乗法は通常の最小二乗法と呼ばれ、非線形回帰に適用される最小二乗法は非線形最小二乗法と呼ばれます。また、線形回帰モデルでは、モデルの非決定論的な部分は誤差項、撹乱、または単にノイズと呼ばれます。線形回帰と非線形回帰の両方は多項式最小二乗法で扱われ、従属変数(y軸)の予測の分散を独立変数(x軸)の関数として、また推定(適合)曲線からの偏差(誤差、ノイズ、撹乱)として記述します。
統計データを生成する測定プロセスも誤差の影響を受けます。これらの誤差の多くはランダム誤差(ノイズ)または系統誤差(バイアス)に分類されますが、他の種類の誤差(例えば、アナリストが誤った単位を報告する場合などのミス)も重要になることがあります。欠損データや打ち切りデータが存在すると、推定値にバイアスが生じる可能性があり、これらの問題に対処するための特定の手法が開発されています。[ 34 ]

ほとんどの研究では母集団の一部しかサンプリングしないため、結果は母集団全体を完全に代表するものではありません。サンプルから得られた推定値は、母集団の値の近似値にすぎません。信頼区間を用いることで、統計学者はサンプル推定値が母集団全体の真の値にどれだけ近いかを表現することができます。多くの場合、信頼区間は95%信頼区間として表されます。正式には、ある値の95%信頼区間とは、同じ条件下でサンプリングと分析を繰り返した場合(異なるデータセットが得られる場合)、その区間が考えられるすべてのケースの95%で真の(母集団の)値を含む範囲のことです。これは、真の値が信頼区間内にある確率が95%であることを意味するものではありません。頻度論の観点からすると、真の値は確率変数ではないため、そのような主張はそもそも意味をなしません。真の値は、与えられた区間内にあるか、そうでないかのどちらかです。しかし、データがサンプリングされ、信頼区間の構築方法が計画される前に、まだ計算されていない区間が真の値を含む確率が 95% であることは事実です。この時点では、区間の限界はまだ観測されていない確率変数です。真の値を含む特定の確率を持つと解釈できる区間が得られるアプローチの 1 つは、ベイズ統計学の信用区間を使用することです。このアプローチは、 「確率」の意味を異なる方法で解釈することに依存しており、つまり、ベイズ確率として解釈します。
原則として、信頼区間は対称にも非対称にもなり得ます。区間が非対称になるのは、それがパラメータの下限または上限として機能する場合(左側区間または右側区間)ですが、推定値を中心とした対称性を損なう両側区間が構築される場合にも非対称になります。信頼区間の境界は漸近的に到達することがあり、これらは真の境界を近似するために使用されます。
統計学は、分析対象の質問に対して単純なイエス/ノーの答えを出すことはめったにありません。解釈は多くの場合、数値に適用される統計的有意性のレベルに左右され、帰無仮説を正確に棄却する値の確率(p値と呼ばれることもあります)を指すことがよくあります。

標準的なアプローチ[ 31 ]は、帰無仮説を対立仮説に対して検定することです。棄却域とは、帰無仮説を棄却する結果となる推定量の値の集合です。したがって、第一種過誤の確率は、帰無仮説が真である(統計的有意性がある)場合に推定量が棄却域に属する確率であり、第二種過誤の確率は、対立仮説が真である場合に推定量が棄却域に属さない確率です。検定の統計的検出力とは、帰無仮説が偽である場合に、検定が帰無仮説を正しく棄却する確率です。
統計的有意性を示すことは、必ずしも現実世界において全体的な結果が有意であることを意味するわけではありません。例えば、ある薬剤の大規模な研究において、その薬剤が統計的に有意ではあるものの、非常に小さな有益な効果しか示さない場合があり、患者に目立った効果をもたらす可能性は低いでしょう。
原則として、統計的有意水準の許容範囲については議論の余地があるかもしれないが、有意水準とは、検定が帰無仮説を棄却できる最大のp値のことである。この検定は、p値が、帰無仮説が真であると仮定した場合に、検定統計量と同程度に極端な結果が観測される確率である、と論理的に同等である。したがって、有意水準が小さいほど、第一種過誤を犯す確率は低くなる。
この枠組みには通常、いくつかの問題点が伴います(仮説検定に対する批判を参照)。
よく知られている統計的検定および手順には、以下のようなものがあります。
一般的な頻度主義的パラダイムに代わるパラダイムとして、ベイズの定理を用いて、収集された証拠の相対的な尤度に基づいて検討中の仮説の事前確率を更新し、事後確率を得る方法がある。
例えば、ある集団の女性1000人に1人が乳がんを患っているとします。がん患者全員(100%)が検査で陽性反応(がんの検出)を示す一方、乳がんではない女性の5%も陽性反応(がんの誤検出)を示すとします。つまり、この検査の偽陽性率は5%です。
この集団の女性がマンモグラフィーで陽性反応を示したとします。ベイズの定理によれば、実際に癌である確率は、癌である事前確率(約 1:1000)に尤度比 20:1(癌患者は健康な患者よりも陽性結果が出る可能性が 20 倍高い)を掛けて事後確率 20:1000 = 1:50 を得ることで求められ、これは約 2% です。癌のベース レートが低いことを無視しているため、この確率は直感に反して小さいと感じる人が多くいます。たとえば、ある研究では、医師の 18% しか正解できず、そのうち 45% は癌の確率を 95% としており、平均確率は 56%(30 倍過大評価)でした。[ 36 ]
尤度比を用いる概念は、医療診断検査においても顕著に見られる。
統計モデリングの目的では、ベイズモデルは階層的になる傾向があります。たとえば、各YouTubeチャンネルの動画再生回数は、チャンネルごとに異なる平均と分散を持つ正規分布に従うとモデル化できます。一方、チャネルの平均値は、チャネルごとの平均動画視聴回数の分布を表す正規分布から得られたものとしてモデル化し、分散は別の分布から得られたものとしてモデル化します。
ベイズ法は、マルコフ連鎖モンテカルロ法のような数値近似技術を用いて事後確率を計算するための計算能力の向上によって促進されてきた。
探索的データ分析(EDA )は、データセットを分析し てその主な特徴を要約する手法であり、多くの場合、視覚的な方法を用います。統計モデルを用いる場合も用いない場合もありますが、EDAの主な目的は、形式的なモデリングや仮説検定といった作業を超えて、データから何が読み取れるかを把握することです。
数理統計学は、統計学に数学を応用したものです。これに用いられる数学的手法には、数理解析、線形代数、確率解析、微分方程式、測度論的確率論などがあります。[ 1 ] [ 7 ]すべての統計解析は少なくとも何らかの数学を利用しており、したがって数理統計学は一般統計学の基本的な構成要素とみなすことができます。[ 8 ]

推論に関する正式な議論は、8 世紀から 13 世紀にかけてのイスラム黄金時代の数学者や暗号学者にまで遡ります。アル=ハリール(717–786) は『暗号メッセージの書』を著し、母音の有無にかかわらず可能なすべてのアラビア語の単語を列挙するために順列と組み合わせを初めて使用した例の 1 つが含まれています。 [ 37 ]アル=キンディーの『暗号メッセージの解読に関する手稿』は、暗号化されたメッセージを解読するために頻度分析を使用する方法を詳細に説明しており、解読のための統計的推論の初期の例を提供しています。イブン・アドラン(1187–1268) は後に頻度分析におけるサンプルサイズの使用に関して重要な貢献をしました。 [ 37 ]
統計という用語は、1589 年にイタリアの学者ジローラモ・ギリーニによって国家に関する事実や情報の集合を指して導入されましたが、この用語を定量的な情報の集合として、つまりこの科学の現代的な用法で使い始めたのは、1749 年にドイツのゴットフリート・アッヘンヴァルでした。 [ 38 ] [ 39 ]ヨーロッパで統計を含む最も古い文献は、1663 年にジョン・グラントによって出版された『死亡率に関する自然および政治的観察』に遡ります。[ 40 ]
統計的思考の初期の応用は、国家が人口統計データや経済データに基づいて政策を策定する必要性から始まったため、統計学という語源が生まれた。19世紀初頭には、統計学の適用範囲は拡大し、データの収集と分析全般を含むようになった。今日では、統計学は政府、企業、自然科学、社会科学など、幅広い分野で活用されている。

統計学の数学的基礎は、ジェロラモ・カルダーノ、ブレーズ・パスカル、ピエール・ド・フェルマー、クリスティアーン・ホイヘンスなどの数学者たちの間での偶然のゲームに関する議論から発展した。確率の概念は、古代および中世の法律や哲学(フアン・カラミュエルの著作など)ですでに検討されていたが、数学の学問分野としての確率論が形を成したのは、17 世紀末、特にヤコブ・ベルヌーイの死後出版された著作『推測術』においてである。[ 41 ]これは、偶然のゲームの世界と、確率の世界(意見、証拠、議論に関わるもの)が組み合わされ、数学的分析にかけられた最初の本であった。[ 42 ]最小二乗法は、1805 年にアドリアン=マリー・ルジャンドルによって初めて記述されたが、カール・フリードリヒ・ガウスはおそらくその 10 年前の 1795 年にそれを利用したと思われる。[ 43 ]

1830年代から1850年代にかけて、ヨーロッパとアメリカで「統計局」と各国の「統計協会」が設立され、19世紀半ばには「非公式な交流はそれ以前からあったものの、異なる国の統計家間の組織的な交流」という考え方が生まれた。[ 44 ]当時、「統計」という名称は主に「国家の問題」を指しており、イギリスの統計家はしばしば「統計学者」と呼ばれていた。[ 45 ]
ベルギーの科学者アドルフ・ケトレ(1796~1874)は、犯罪率、結婚率、自殺率などの複雑な社会現象を理解する手段として、 「平均的な人」( l'homme moyen )という概念を導入した。[ 46 ] 1853年、ケトレは統計研究における測定を統一するために、ブリュッセルで第1回国際統計会議を組織した。 [ 47 ]
現代の統計学は、19 世紀後半から 20 世紀初頭にかけて 3 つの段階を経て出現しました。[ 48 ]世紀の変わり目の最初の波は、フランシス・ゴルトンとカール・ピアソンの研究によって主導され、彼らは統計学を、科学だけでなく産業や政治においても分析に使用される厳密な数学的規律へと変えました。ゴルトンの貢献には、標準偏差、相関、回帰分析の概念の導入、およびこれらの方法を身長、体重、まつげの長さなど、さまざまな人間の特性の研究に適用したことが含まれます。[ 49 ]ピアソンは、積モーメントとして定義されるピアソン積率相関係数、 [ 50 ]分布をサンプルに適合させるためのモーメント法、ピアソン分布などを開発しました。[ 51 ]ガルトンとピアソンは、数理統計学と生物統計学(当時はバイオメトリクスと呼ばれていた)の最初の学術誌としてバイオメトリカを創刊し、後者はユニバーシティ・カレッジ・ロンドンに世界初の大学統計学部を設立した。[ 52 ]
1910年代と20年代の第二波はウィリアム・シーリー・ゴセットによって始められ、世界中の大学で学問分野を定義することになる教科書を書いたロナルド・フィッシャーの洞察によって頂点に達した。フィッシャーの最も重要な出版物は、1918年の画期的な論文「メンデル遺伝の仮定に基づく親族間の相関」(統計用語「分散」を初めて使用した)、1925年の古典的著作「研究者のための統計的方法」、そして1935年の「実験計画法」 [ 53 ] [ 54 ] [ 55 ]であり、そこで彼は厳密な実験計画モデルを開発した。彼は十分性、補助統計量、フィッシャーの線形判別、フィッシャー情報の概念を考案した。[ 56 ]彼はまた、淑女がお茶を試飲する実験中に「証明も確立もされないが、実験の過程で反証される可能性がある」という「帰無仮説」という用語を作り出した。 [ 57 ] [ 58 ] 1930 年の著書『自然選択の遺伝学的理論』では、フィッシャーの原理[ 59 ] ( AWF エドワーズはこれを「進化生物学で恐らく最も有名な議論」と呼んだ) やフィッシャーの暴走[ 60 ] [ 61 ] [ 62 ] [ 63 ] [ 64 ] [ 65 ]など、さまざまな生物学的概念に統計学を適用した。フィッシャーの暴走とは、進化で見られる正のフィードバック暴走効果に関する性的選択の概念である。
最後の波は、主に以前の発展の洗練と拡大が見られ、 1930年代のエゴン・ピアソンとイェジー・ネイマンの共同研究から生まれた。彼らは「タイプII」エラー、検定力、信頼区間の概念を導入した。イェジー・ネイマンは1934年に、層化無作為抽出法は一般的に目的抽出法(割当抽出法)よりも優れた推定方法であることを示した。[ 66 ]
国民経済活動を測定しようとする初期の試みの中には、 17世紀のウィリアム・ペティによるものがあった。20世紀には、統一国民経済計算体系が開発された。[ 67 ]
今日、統計的手法は、収集されたデータから正確な推論を行うため、また統計的手法に基づいて不確実性に直面した意思決定を行うために、意思決定を伴うすべての分野で応用されています。現代のコンピュータの使用により、大規模な統計計算が迅速化され、手作業では実行不可能な新しい手法も可能になりました。統計学は、例えばビッグデータの分析方法の問題など、活発な研究分野であり続けています。[ 68 ]
応用統計学は、統計科学とも呼ばれ、 [ 69 ]記述統計学と推論統計学の応用から成ります。[ 70 ]理論統計学は、統計的推論のアプローチの正当性を支える論理的議論に関係し、数理統計学も含まれます。数理統計学には、推定と推論の方法に関連する結果を導き出すために必要な確率分布の操作だけでなく、計算統計学のさまざまな側面や実験計画も含まれます。
統計コンサルタントは、特定の課題に関連する専門知識を社内に持たない組織や企業を支援することができます。
機械学習モデルとは、計算アルゴリズムを用いてデータ内のパターンを捉える統計的・確率的モデルのことである。
統計学は、自然科学や社会科学、政府、ビジネスなど、幅広い学問分野に適用できます。ビジネス統計学は、計量経済学、監査、生産および業務、サービス改善、マーケティング調査などに統計的手法を適用します。[ 71 ]熱帯生物学の2つのジャーナルの調査では、最も頻繁に使用される12の統計的検定は、分散分析(ANOVA)、カイ二乗検定、スチューデントのt検定、線形回帰、ピアソンの相関係数、マン・ホイットニーU検定、クラスカル・ウォリス検定、シャノンの多様性指数、テューキーの範囲検定、クラスター分析、スピアマンの順位相関係数、主成分分析であることがわかりました。[ 72 ]
典型的な統計学のコースでは、記述統計、確率、二項分布と正規分布、仮説検定と信頼区間、線形回帰、相関を扱います。[ 73 ]現代の学部生向けの基礎統計学のコースでは、正しい検定の選択、結果の解釈、無料の統計ソフトウェアの使用に重点を置いています。[ 72 ]

20世紀後半から始まった計算能力の急速かつ持続的な向上は、統計科学の実践に大きな影響を与えた。初期の統計モデルはほぼ常に線形モデルであったが、高性能コンピュータと適切な数値アルゴリズムの登場により、非線形モデル(ニューラルネットワークなど)への関心が高まり、一般化線形モデルやマルチレベルモデルといった新しいタイプのモデルも誕生した。
計算能力の向上により、順列検定やブートストラップなどのリサンプリングに基づく計算集約型手法の人気が高まっており、ギブスサンプリングなどの手法によってベイズモデルの利用がより容易になっています。コンピュータ革命は、統計学の未来に影響を与え、「実験的」統計学と「経験的」統計学に新たな重点が置かれるようになっています。現在では、汎用および特殊用途の統計ソフトウェアが多数利用可能です。複雑な統計計算が可能なソフトウェアの例としては、 Mathematica、SAS、SPSS、Rなどのプログラムが挙げられます。
ビジネスにおいて、「統計」は経営および意思決定支援ツールとして広く利用されています。特に、財務管理、マーケティング管理、生産、サービス、オペレーション管理に活用されています。[ 74 ] [ 75 ]また、管理会計や監査においても統計は多用されています。経営科学という学問分野は、ビジネスにおける統計やその他の数学の利用を体系化したものです。(計量経済学とは、経済関係に実証的な内容を与えるために、経済データに統計的手法を適用する学問です。)
典型的な「ビジネス統計」コースは、ビジネス専攻の学生を 対象としており、記述統計(データの収集、記述、分析、要約)、確率(通常は二項分布と正規分布)、仮説検定と信頼区間、線形回帰、相関関係を扱います。(後続の)コースには、予測、時系列、決定木、重回帰分析、およびより一般的なビジネス分析のその他のトピックが含まれる場合があります。CFAなどの専門資格プログラムには、統計学のトピックが含まれていることがよくあります。
統計的手法は、生物統計学、計算生物学、計算社会学、ネットワーク生物学、社会科学、社会学、社会調査など、幅広い種類の科学的および社会的研究で使用されています。一部の研究分野では、応用統計学が非常に広範に使用されているため、専門用語が存在します。これらの分野には以下が含まれます。
さらに、統計分析には、それぞれ独自の専門用語や方法論を発展させてきた特定の種類も存在する。
統計学は、ビジネスや製造業においても重要な基礎ツールです。測定システムのばらつきを理解したり、プロセス(統計的プロセス管理(SPC)など)を管理したり、データを要約したり、データに基づいた意思決定を行うために用いられます。
統計の誤用は、記述や解釈において、微妙ながらも深刻な誤りを生じさせる可能性がある。微妙というのは、経験豊富な専門家でさえそのような誤りを犯す可能性があるという意味であり、深刻というのは、それが壊滅的な意思決定の誤りにつながる可能性があるという意味である。例えば、社会政策、医療行為、橋梁などの構造物の信頼性などは、いずれも統計の適切な使用に依存している。
統計的手法が正しく適用されたとしても、専門知識のない人にとっては結果の解釈が難しい場合があります。データの傾向の統計的有意性(サンプル内のランダムな変動によって傾向がどの程度引き起こされるかを測定する指標)は、直感的な有意性の感覚と一致する場合もあれば、一致しない場合もあります。人々が日常生活で情報を適切に扱うために必要な基本的な統計スキル(および懐疑心)は、統計的リテラシーと呼ばれます。
統計的知識は、発表者に都合の良いデータだけを解釈する方法を見つけることで、非常に頻繁に意図的に悪用されているという一般的な認識がある。 [ 77 ]統計に対する不信感と誤解は、「嘘には3種類ある。嘘、ひどい嘘、そして統計だ」という引用と関連付けられている。統計の悪用は、意図的である場合も不注意である場合もある。ダレル・ハフ著の『統計で嘘をつく方法』[ 77 ]では、さまざまな考慮事項が概説されている。統計の使用と悪用を明らかにするために、特定の分野で使用されている統計的手法のレビューが行われている(例:Warne、Lazo、Ramos、およびRitter(2012))。[ 78 ]
統計の誤用を避ける方法には、適切な図表の使用やバイアスの回避などがある。[ 79 ]誤用は、結論が過度に一般化され、実際よりも多くのものを代表していると主張する場合に発生する可能性があり、多くの場合、意図的または無意識的にサンプリングバイアスを見落としている。[ 80 ]棒グラフはおそらく最も使いやすく理解しやすい図表であり、手書きでも簡単なコンピュータプログラムでも作成できる。[ 79 ]ほとんどの人はバイアスやエラーを探さないため、それらは気づかれない。したがって、人々は、適切に表現されていなくても、何かが真実であると信じることが多い。[ 80 ]統計から収集されたデータを信頼できる正確なものにするには、採取されたサンプルが全体を代表していなければならない。[ 81 ]ハフによれば、「サンプルの信頼性は[バイアス]によって損なわれる可能性がある…ある程度の懐疑心を持つようにする。」[ 82 ]
統計の理解を助けるために、ハフは各ケースで尋ねるべき一連の質問を提案した。[ 77 ]

相関の概念は、それが引き起こす可能性のある混乱という点で特に注目に値します。データセットの統計分析では、検討対象の集団の 2 つの変数 (特性) が、まるで関連しているかのように一緒に変化する傾向があることがしばしば明らかになります。たとえば、死亡年齢も調査した年間所得の研究では、貧しい人は裕福な人よりも寿命が短い傾向があることがわかります。この 2 つの変数は相関していると言われますが、互いに原因となっている場合もあれば、そうでない場合もあります。相関は、代わりに、これまで考慮されていなかった第 3 の要因、つまり潜在変数または交絡変数によって生じている可能性があります。[ 83 ]たとえば、所得が高いと余暇時間が長くなり、その結果、運動に費やす時間も長くなる傾向があります。この高い活動レベルが、より裕福なグループで観察される長寿の原因となっている可能性があります。したがって、所得水準を上げることは、それ自体が人々の寿命を延ばす原因ではありません。むしろ、交絡変数が寿命の延長の原因となっています。
このため、相関関係は因果関係を意味するものではありません。2つの変数間の因果関係は、相関関係だけでは推論できません。[ 84 ]
サンプルの信頼性は[バイアス]によって損なわれる可能性があります...ある程度の懐疑心を持つようにしてください。