現代的な意味での統計は、工業化する主権国家の新たなニーズに応えて 18 世紀に発展し始めました。
初期には、その意味は、特に人口などの人口統計など、国家に関する情報に限定されていました。これは後に、あらゆる種類の情報の収集すべてを含むように拡張され、さらに後には、そのようなデータの分析と解釈を含むように拡張されました。現代の用語では、「統計」は、国民経済計算や気温記録などの収集された情報セットと、統計的推論を必要とする分析作業の両方を意味します。統計活動は、確率を使用して表現されたモデルに関連付けられることが多く、したがって確率理論と関連しています。データ処理の大規模な要件により、統計はコンピューティングの重要なアプリケーションになっています。多くの統計概念が、幅広い科学に重要な影響を及ぼしています。これには、実験の設計やベイズ推論などの統計的推論へのアプローチが含まれ、それぞれが現代の統計の基礎となるアイデアの発展において独自の順序を持っていると考えることができます。
導入
18 世紀までに、「統計」という用語は、国家による人口統計データや経済データの体系的な収集を指すようになりました。少なくとも 2 千年間、これらのデータは主に、課税対象になったり軍事利用されたりする可能性のある人的資源や物的資源の集計でした。19 世紀初頭には、収集が活発化し、「統計」の意味はデータの収集、要約、分析に関する分野を含むように広がりました。今日では、データが収集され、統計が計算され、政府、企業、ほとんどの科学やスポーツ、さらには多くの娯楽で広く配布されています。電子コンピュータは、データの収集と集約を容易にすると同時に、より精巧な統計計算を迅速化しました。1 人のデータ アナリストが、それぞれ数十または数百の個別の測定値を含む数百万のレコードを含む一連のデータ ファイルを持っている場合があります。これらは、コンピュータ アクティビティ (たとえば、証券取引所) またはコンピュータ化されたセンサー、POS レジスタなどから時間の経過とともに収集されました。すると、コンピューターは単純で正確な要約を作成し、大きな行列の反転や何百もの反復ステップの実行など、手作業では決して試みられないような面倒な分析が可能になります。より高速な計算により、統計学者は「コンピューター集約型」の方法を開発して、すべての順列を調べたり、ランダム化を使用して問題の 10,000 通りの順列を調べたりして、理論だけでは定量化が難しい答えを推定できるようになりました。
「数理統計」という用語は、統計の実践で使われる確率と統計的推論の数学的理論を指します。しかし、統計と確率論の関係は、かなり遅れて発展しました。19 世紀には、統計はますます確率論を使用するようになりました。確率論の最初の結果は、特にギャンブルの分析において、17 世紀と 18 世紀に見つかりました。1800 年までには、天文学は確率モデルと統計理論、特に最小二乗法を使用しました。初期の確率論と統計は 19 世紀に体系化され、統計的推論と確率モデルは、社会科学者によって実験心理学や社会学という新しい科学を発展させるために、また物理学者によって熱力学や統計力学に使用されました。統計的推論の発展は、帰納的論理と科学的方法の発展と密接に関連しており、これらは統計学者を数理統計という狭い領域から遠ざける懸念事項です。理論的研究の多くは、それらを利用できるコンピューターが利用可能になった頃には、すぐに利用できるようになりました。 1970 年代までに、ジョンソンとコッツは4 巻からなる『統計分布の概要』(第 1 版、1969 ~ 1972 年)を出版しましたが、これは今でも貴重なリソースとなっています。
応用統計学は数学の一分野ではなく、コンピュータサイエンスやオペレーションズリサーチのような独立した数理科学とみなすことができます。数学とは異なり、統計学は行政学に起源があります。その応用は人口統計学や経済学で早くから始まりました。今日のミクロ経済学とマクロ経済学の大部分は、時系列分析に重点を置いた「統計学」です。データから学習し、最善の予測を行うことに重点を置く統計学は、心理テスト、医学、疫学などの学術研究の分野によっても形作られてきました。統計テストの考え方は、意思決定科学とかなり重なっています。データの検索と効果的な提示に関心を持つ統計学は、情報科学やコンピュータサイエンスと重なっています。
語源
- 無料辞書『ウィクショナリー』で統計を調べてみましょう。
統計学という用語は、最終的には新ラテン語の statisticum collegium (「国家評議会」) とイタリア語のstatista (「政治家」または「政治家」)に由来しています。ゴットフリート・アッヘンヴァル(1749)によって初めて導入されたドイツ語の Statistik は、もともと国家に関するデータの分析を指し、「国家の科学」(当時は英語でpolitical arithmeticと呼ばれていました) を意味していました。19 世紀初頭には、一般的にデータの収集と分類の意味を獲得しました。1791 年にジョン・シンクレア卿がStatistical Account of Scotlandと題された 21 巻の最初の巻を出版したときに、英語に導入されました。[1]
確率論の起源
基本的な統計形式は文明の始まり以来使われてきました。初期の帝国では人口調査をまとめたり、さまざまな商品の取引を記録したりすることがよくありました。漢王朝とローマ帝国は、帝国の人口、地理的領域、富に関するデータを広範囲に収集した最初の国家でした。
統計的手法の使用は、少なくとも紀元前 5 世紀にまで遡ります。歴史家トゥキュディデスは、ペロポネソス戦争史[2]の中で、アテネ人がプラタイアの城壁の高さを、兵士たちに十分近い位置にある漆喰を塗っていない部分のレンガの数を数えることで計算した方法について説明しています。この計算は、何人かの兵士によって何度も繰り返されました。こうして決定された最も頻繁な値 (現代の用語では最頻値)が、レンガの数の最も可能性の高い値とされました。この値に壁に使用されたレンガの高さを掛けることで、アテネ人は城壁を登るのに必要なはしごの高さを決定することができました。[要出典]
ピクスの試練は、12 世紀から定期的に行われている王立造幣局の貨幣の純度をテストするものです。試練自体は統計的サンプリング法に基づいています。一連の貨幣 (もともとは銀 10 ポンドから) を鋳造した後、1 枚の貨幣がピクス (ウェストミンスター寺院の箱) に入れられます。一定期間後 (現在は 1 年に 1 回)、貨幣が取り出され、重量が測定されます。その後、箱から取り出された貨幣のサンプルの純度がテストされます。
フィレンツェの銀行家で役人のジョヴァンニ・ヴィラーニによる14世紀のフィレンツェの歴史書『新歴史書』には、人口、法令、商業と貿易、教育、宗教施設に関する統計情報が多数含まれており、統計を歴史の肯定的な要素として初めて導入したと言われています[3]。ただし、当時は統計という用語も、特定の分野としての概念も存在していませんでした。
算術平均はギリシャ人には知られた概念であったが、16 世紀まで 2 つ以上の値に一般化されることはなかった。1585年にシモン・ステヴィンが十進法を発明したことで、これらの計算が容易になったと思われる。この方法は、さまざまな天体の位置の推定値の誤差を減らそうとしていた ティコ・ブラーエによって天文学に初めて採用された。
中央値という考え方は、 1599年にエドワード・ライトが航海に関する著書(『航海におけるある誤り』)のコンパスによる位置の決定に関する章で生まれた。ライトは一連の観察においてこの値が正しい値である可能性が最も高いと感じた。平均値と中央値の違いは、1669年にクリスティアーン・ホイヘンスがグラウントの表を使用する中で気づいた。[4]

「統計」という用語は、1589年にイタリアの学者ジローラモ・ギリーニによってこの科学に関連して導入されました。[5] [6]統計の誕生は、ジョン・グラントがウィリアム・ペティとともに、現代の人口統計学の枠組みを提供した初期の人類の統計および国勢調査の方法を開発した1662年までさかのぼることがよくあります。彼は、各年齢の生存確率を示す最初の生命表を作成しました。彼の著書「死亡率に関する自然および政治的観察」では、死亡名簿の分析を使用して、ロンドンの人口を統計に基づいて初めて推定しました。彼は、ロンドンで年間約13,000件の葬儀が行われ、11家族につき年間3人が死亡することを知っていました。彼は、教区の記録から平均家族サイズが8であると推定し、ロンドンの人口は約384,000であると算出しました。これは、比率推定器が初めて使用された例として知られています。 1802 年にラプラスは同様の方法でフランスの人口を推定しました。詳細については、比率推定法 § 歴史を参照してください。
統計学の本来の範囲は統治に有用なデータに限られていたが、19世紀にはそのアプローチは科学的または商業的な性質の多くの分野に拡大された。統計学の数学的基礎は、16世紀にジェロラモ・カルダーノ、ピエール・ド・フェルマー、ブレーズ・パスカルによって開拓された新しい確率論に大きく依存している。クリスティアーン・ホイヘンス(1657年)は、統計学の最古の科学的扱いを示した。ヤコブ・ベルヌーイの『予想論』(死後出版、1713年)とアブラハム・ド・モアブルの『偶然の理論』(1718年)は、統計学を数学の一分野として扱った。ベルヌーイは著書の中で、完全な確実性を1で表し、確率を0と1の間の数で表すという考え方を導入した。
18世紀における統計学の初期の重要な応用は、出生時の人間の性比であった。 [7] ジョン・アーバスノットは1710年にこの問題を研究した。 [8] [9] [10] [11]アーバスノットは1629年から1710年までの82年間、ロンドンの出生記録を調べた。どの年でも、ロンドンで生まれた男性の数は女性の数を上回っていた。男性の出生と女性の出生のどちらが多いかが同じ確率であるとすると、観察された結果の確率は0.5^82、つまり約4,8360,0000,0000,0000,0000,0000分の1であり、現代の言葉で言えばp値である。これは無視できるほど小さいため、アーバスノットはこれが偶然ではなく神の摂理によるものだと考えた。「そこから、支配するのは偶然ではなく芸術であるということが分かる。」この研究とアーバスノットの他の研究は、「有意性検定の最初の使用」[12]、統計的有意性と道徳的確実性についての推論の最初の例[13] 、そして「...おそらくノンパラメトリック検定の最初の公表された報告...」[9] 、特に符号検定として評価されています。詳細については、符号検定 § 歴史を参照してください。
誤差理論の正式な研究は、ロジャー・コーツの『オペラ雑集』(死後出版、1722年)に遡るが、トーマス・シンプソンが1755年に執筆した回想録(1756年に印刷)が、この理論を観測誤差の議論に初めて適用した。この回想録の再版(1757年)では、正の誤差と負の誤差は同程度の確率で発生すること、すべての誤差が収まると考えられる特定の割り当て可能な限界があることが公理として示されており、連続誤差が議論され、確率曲線が示されている。シンプソンは、誤差の分布の可能性をいくつか議論した。彼は最初に均一分布を検討し、次に離散対称三角分布を検討し、その後連続対称三角分布を検討した。トビアス・マイヤーは、月の秤動に関する研究(コスモグラフィシェ・ナハリヒテン、ニュルンベルク、1750年)において、同一の状況下での観測値の平均化を類似の方程式のグループの平均化に一般化することにより、未知の量を推定する最初の正式な方法を発明しました。
1755年、ロジャー・ジョセフ・ボスコヴィッチは地球の形状に関する研究に基づき、著書『教皇による文学探検、24時間年中無休の2日間』の中で、一連の観測値の真の値は絶対誤差の合計を最小化する値であると提唱した。現代の用語では、この値は中央値である。後に正規曲線として知られるようになった最初の例は、1733年11月12日にこの曲線をプロットしたアブラハム・ド・モアブルによって研究された。 [14]ド・モアブルは「公平な」コインを投げたときに表が出る回数を研究していた。
1763 年、リチャード・プライスは、二項分布を使用して過去の出来事の事後確率を計算する規則の証明を 王立協会のトーマス・ベイズに提出しました。
1765 年にジョセフ・プリーストリーが最初のタイムラインチャートを発明しました。
ヨハン・ハインリヒ・ランベルトは、 1765 年に出版した著書『建築学の原理』の中で、誤差の分布として 半円を提案しました。
ただし -1 < x < 1 です。

ピエール=シモン・ラプラス(1774)は、確率論の原理から観測値の組み合わせの規則を導き出す最初の試みを行いました。彼は誤差の確率の法則を曲線で表し、3 つの観測値の平均を求める式を導き出しました。
ラプラスは1774年に、誤差の頻度は符号を無視すればその大きさの指数関数として表せることに気づいた。[15] [16]この分布は現在ラプラス分布として知られている。ラグランジュは1776年に誤差の放物線フラクタル分布を提唱した。
ラプラスは1778年に誤差の第二法則を発表し、誤差の頻度はその大きさの二乗の指数に比例することを指摘しました。これはその後ガウスによって再発見され(おそらく1795年)、現在では統計学で中心的な重要性を持つ正規分布として最もよく知られています。 [17]この分布は1873年に物体を木製の台の上に落としたときの測定誤差を研究していたCSパースによって初めて正規分布と呼ばれました。 [18]彼が「正規」という用語を選んだのは、それが自然発生的な変数に頻繁に現れるためです。
ラグランジュは 1781 年に、誤差に関する他の 2 つの分布、つまり二乗余弦分布と対数分布も提案しました。
ラプラスは (1781) 誤差の容易さの法則 (ジョセフ・ルイ・ラグランジュによる用語、1774) の公式を提示しましたが、これは扱いにくい方程式につながるものでした。ダニエル・ベルヌーイ(1778) は、同時誤差のシステムの確率の最大積の原理を導入しました。
1786年、ウィリアム・プレイフェア(1759年 - 1823年)は、統計にグラフ表示の考え方を導入しました。彼は折れ線グラフ、棒グラフ、ヒストグラムを発明し、経済学の著書である『商業および政治地図帳』に取り入れました。続いて1795年には円グラフと円グラフを発明し、イギリスの輸出入の推移を表示するために使用しました。これらのグラフは、彼が1801年に『統計書簡』で例を発表したときに、一般の注目を集めました。
ラプラスは、1787 年に土星と木星の運動を調査し、単一の方程式群の異なる線形結合を使用することでマイヤーの方法を一般化しました。
1791年、ジョン・シンクレア卿は著書『スコットランドの統計』の中で「統計」という用語を英語に導入しました。
1802年、ラプラスはフランスの人口を28,328,612人と推定した。[19]彼はこの数字を前年の出生数と3つのコミュニティの国勢調査データを使って計算した。これらのコミュニティの国勢調査データによると、人口は2,037,615人で出生数は71,866人だった。これらのサンプルがフランスを代表するものであると仮定して、ラプラスは全人口の推定値を算出した。

データ測定の誤差を最小化するために使用された最小二乗法は、アドリアン=マリー・ルジャンドル(1805 年)、ロバート・アドリアン(1808 年)、カール・フリードリヒ・ガウス(1809 年) によって独立に発表されました。ガウスは、1801 年に準惑星ケレスの位置を予測した際にこの方法を使用していました。ガウスの計算の基礎となった観測は、イタリアの修道士ピアッツィによって行われました。
最小二乗法の前には、中央回帰勾配が使用されていました。この方法は、絶対偏差の合計を最小化します。この勾配を推定する方法は、 1760 年にロジャー ジョセフ ボスコヴィッチによって発明され、天文学に応用されました。
確率誤差( der wahrscheinliche Fehler )という用語は、平均値からの中央偏差であり、1815 年にドイツの天文学者フレデリック・ヴィルヘルム・ベッセルによって導入されました。1843年にアントワーヌ・オーギュスタン・クールノーが、確率分布を 2 つの等しい半分に分割する値に対して中央値( valeur médiane )という用語を初めて使用しました。
誤差理論の他の貢献者には、エリス(1844)、ド・モルガン(1864)、グレイシャー(1872)、ジョヴァンニ・スキアパレッリ(1875)がいた。[要出典]ピーターズ(1856)の の式、すなわち単一観測値の「確率的誤差」は広く使用され、初期のロバスト統計(外れ値に耐性がある:パースの基準を参照)に影響を与えた。
19 世紀の統計理論の著者には、ラプラス、S. ラクロワ(1816 年)、リトロウ (1833 年)、デデキント(1860 年)、ヘルメルト (1872 年)、ローラン( 1873 年)、リアグル、ディディオン、ド モルガン、ブールなどが含まれます。
グスタフ・テオドール・フェヒナーは、社会学的および心理学的現象において中央値(セントラルヴェルト)を使用しました。 [20]それ以前は、天文学と関連分野でのみ使用されていました。フランシス・ゴルトンは、1869年にmiddle-most value、1880年にmediumという用語を使用していましたが、1881年に初めて英語のmedianという用語を使用しました。[21]
統計学のもう一人の重要な創始者であるアドルフ・ケトレー(1796年 - 1874年)は、犯罪率、結婚率、自殺率などの複雑な社会現象を理解する手段として「平均的な人間」(l'homme moyen )という概念を導入した。[22]
正規分布の最初の検定は、1870 年代にドイツの統計学者ヴィルヘルム・レクシスによって発明されました。彼が正規分布していることを示すことができた唯一のデータ セットは出生率でした。
現代統計の発展
統計理論の起源は18世紀の確率論の進歩にあるが、現代の統計分野は19世紀後半から20世紀初頭にかけて3段階を経て誕生した。世紀の変わり目の第1波は、フランシス・ゴルトンおよびカール・ピアソンの研究によって牽引され、彼らは統計を科学だけでなく産業や政治でも分析に用いられる厳密な数学的分野へと変貌させた。1910年代から20年代の第2波はウィリアム・シーリー・ゴセットによって始められ、ロナルド・フィッシャーの洞察によって頂点に達した。これには、より優れた実験計画モデル、仮説検定、および小規模なデータサンプルで使用する手法の開発が含まれていた。最後の波は、主に初期の開発の改良と拡張であり、 1930年代のエゴン・ピアソンおよびイェジ・ネイマンの共同研究から生まれた。 [23]今日、統計的手法は、収集されたデータから正確な推論を行うため、また統計的手法に基づいて不確実性に直面した際に意思決定を行うために、意思決定に関わるあらゆる分野に適用されています。

最初の統計機関は 19 世紀初頭に設立されました。王立統計協会は1834 年に設立され、その最初の女性会員であるフローレンス ナイチンゲールは、疫学的理解と公衆衛生の実践を促進するために、統計分析を健康問題に適用する先駆者となりました。しかし、当時使用されていた方法は、今日では現代の統計とはみなされません。
オックスフォード大学の学者フランシス・イシドロ・エッジワースの著書『確率と効用の測定法』(1887年)は帰納的推論の基礎として確率を扱い、その後の著作は「偶然の哲学」に焦点を当てた。[24]統計に関する彼の最初の論文(1883年)は誤差の法則(正規分布)を探究し、『統計の方法』 (1885年)ではt分布の初期のバージョン、エッジワース展開、エッジワース級数、変量変換法、最大尤度推定値の漸近理論を紹介した。
ノルウェーのアンダース・ニコライ・キエールは1895年に層別抽出法の概念を導入した。[25] アーサー・リヨン・ボウリーは1906年に社会統計の研究中に新しいデータ抽出法を導入した。社会状況の統計調査はチャールズ・ブースの『ロンドンの人々の暮らしと労働』(1889-1903年)やシーボーム・ロウントリーの『貧困、都市生活の研究』(1901年)から始まっていたが、ボウリーの重要な革新はランダム抽出法の使用であった。彼の努力はロンドン生活と労働の新調査で最高潮に達した。[26]
フランシス・ゴルトンは統計理論の創始者の一人として知られています。この分野への彼の貢献には、標準偏差、相関、 回帰の概念の導入と、これらの手法を身長、体重、まつげの長さなど、さまざまな人間の特性の研究に適用したことが含まれます。彼は、これらの多くが正規分布曲線に当てはめられることを発見しました。[27]
ゴルトンは1907年にネイチャー誌に中央値の有用性に関する論文を投稿した。 [28]彼は田舎のフェアで行われた雄牛の体重の推測787件の正確さを調べた。実際の体重は1208ポンドで、中央値の推測は1198ポンドだった。推測は著しく非正規分布していた(「群衆の知恵」参照)。

ゴルトンが1889年に出版した『自然遺伝』は、当時ロンドン大学ユニバーシティ・カレッジに勤めていた優秀な数学者カール・ピアソン[29]の興味を引いて、彼は数理統計学という学問を創始した。[30]彼は科学法則の統計的基礎を強調してその研究を推進し、彼の研究室には彼の新しい分析手法に惹かれて世界中から学生が集まり、その中にはユールもいた。彼の研究は生物学、疫学、人体測定学、医学、社会史の分野にまで広がった。1901年、彼は生物測定学の創始者であるウォルター・ウェルドンおよびゴルトンとともに、数理統計学と生物測定学の最初の雑誌である Biometrika誌を創刊した。
彼とゴルトンの研究は、今日一般的に使用されている多くの「古典的な」統計手法の基礎となっている。これには、積率として定義される相関係数[31] 、分布を標本に当てはめるモーメント法、現在では慣例となっている連続確率分布の基礎となっているピアソンの連続曲線システム、マハラノビス距離の前身で特殊なケースであるカイ距離[32]、仮定値を中心点、カイ距離を半径とする球の補数の確率測度として定義されるP値[32]などがある。彼は「標準偏差」という用語も導入した。
彼はまた、統計的仮説検定理論、[32] ピアソンのカイ二乗検定、主成分分析を創始した。[33] [34] 1911年に彼はロンドン大学ユニバーシティ・カレッジに世界初の大学統計学部を設立した。
数理統計学の第二波は、ロナルド・フィッシャーによって開拓されました。彼は1925年に『研究者のための統計的方法』、 1935年に『実験計画法』という2冊の教科書を執筆し、世界中の大学でこの学問分野を定義することになりました。彼はまた、以前の研究結果を体系化し、しっかりとした数学的基盤の上に置きました。1918年の画期的な論文『メンデル遺伝の仮定に基づく親族間の相関関係』では、分散という統計用語を初めて使用しました。1919年、彼はロザムステッド実験ステーションで、長年にわたり記録された膨大なデータコレクションの大規模な研究を開始しました。これは、総称して「作物の変異の研究」というタイトルの一連の報告書につながりました。1930年には、統計を進化に適用した『自然選択の遺伝理論』を出版しました。
その後の7年間で、彼は実験計画法の原理(下記参照)を開拓し、分散分析の研究を精緻化しました。また、小規模サンプルの統計に関する研究も進めました。さらに重要なのは、実際のデータの体系的な分析手法を、新しい統計手法の開発への足がかりとして始めたことです。バランスのとれた実験計画法から得たデータを分析するための計算アルゴリズムを開発したのです。この研究の結果、1925年に彼の最初の著書『研究者のための統計的手法』が出版されました。[35]この本はその後、何度も版を重ね、翻訳され、多くの分野の科学者にとって標準的な参考書となりました。1935年には、この本に続いて『実験計画法』が出版され、これも広く使われるようになりました。
分散分析に加えて、フィッシャーは最大尤度推定法に名前を付け、これを推進した。また、フィッシャーは十分性、補助統計量、フィッシャーの線型判別子、フィッシャー情報量の概念を生み出した。彼の論文「いくつかのよく知られた統計量の誤差関数を生み出す分布について」(1924年)では、ピアソンのカイ2乗検定とウィリアム・シーリー・ゴセットのtをガウス分布と同じ枠組みで提示し、分散分析における彼自身のパラメータであるフィッシャーのz分布(数十年後にF分布の形でより一般的に使用されるようになった)を提示した。[36] 5%の有意水準は、1925年にフィッシャーによって導入されたと思われる。[37]フィッシャーは、標準偏差の2倍を超える偏差は有意であるとみなされると述べた。それ以前は、確率誤差の3倍を超える偏差が有意であると考えられていた。対称分布の場合、確率誤差は四分位範囲の半分である。正規分布の場合、起こり得る誤差は標準偏差の約 2/3 です。フィッシャーの 5% 基準は、以前の慣例に根ざしているようです。
当時の他の重要な貢献としては、ピアソン相関係数の有用な拡張であるチャールズ・スピアマンの順位相関係数が挙げられる。スチューデントのペンネームでよく知られているイギリスの統計学者ウィリアム・シーリー・ゴセットは、サンプルサイズが小さく母集団の標準偏差が不明な状況で有用な連続確率分布であるスチューデントのt分布を導入した。
エゴン・ピアソン(カールの息子)とイェジ・ネイマンは、「タイプII」の誤り、検定力、信頼区間の概念を導入した。イェジ・ネイマンは1934年に、層別ランダムサンプリングは一般に目的的(割当)サンプリングよりも優れた推定方法であることを示した。[38]
実験計画

1747年、HMバークソールズベリー号の軍医を務めていたジェームズ・リンドは、壊血病の治療法を開発するための対照実験を行った。[39]この研究では、被験者の症例は「可能な限り類似したもの」であり、外部の変動を減らすために厳格な参加要件を設けた。被験者はペアにされ、ブロックされた。現代の視点から見ると、欠けている主な点は、被験者を治療に無作為に割り当てた点である。
リンドは今日、しばしば「1因子ずつ実験する人」と評される。[40]同様の「1因子ずつ実験する人(OFAT)」実験は、1840年代にジョン・ローズ卿によってロザムステッド研究ステーションで行われ、小麦に使用する最適な無機肥料を決定するために行われた。[40]
統計的推論の理論は、チャールズ・S・パースが「科学の論理の図解」(1877-1878年)と「確率的推論の理論」(1883年)で展開した。この2つの出版物は、統計におけるランダム化に基づく推論の重要性を強調した。別の研究では、パースは盲検反復測定設計にボランティアをランダムに割り当て、重みを識別する能力を評価した。[41] [42] [43] [44]
ピアースの実験は心理学や教育学の他の研究者に影響を与え、1800年代には実験室や専門の教科書でランダム化実験を行う研究の伝統が生まれた。[ 41] [42] [43] [44]ピアースはまた、 1876年に英語で初めて回帰モデルの最適設計に関する出版物を執筆した。 [45]多項式回帰の先駆的な最適設計は、1815年にジェルゴンヌによって提案された。 [要出典] 1918年にカースティン・スミスは6次(およびそれ以下)の多項式の最適設計を発表した。[46]
実験を中止する決定を含め、各実験の設計が以前の実験の結果に依存する可能性がある一連の実験の使用は、統計的仮説の逐次検定の文脈でアブラハム・ウォルドによって開拓されました[47] 。 [48]最適な逐次設計、[49]および適応設計に関する調査が利用可能です。[50]逐次設計の特定のタイプは「2本腕バンディット」であり、これは多腕バンディットに一般化され、 1952年にハーバート・ロビンズによって初期の研究が行われました。 [51]
「実験計画法」(DOE)という用語は、ロナルド・フィッシャー卿が行った初期の統計研究に由来しています。アンダース・ハルドは彼を「ほぼ独力で現代の統計科学の基礎を築いた天才」と評しました。 [52]フィッシャーは実験計画法の原則を考案し、「分散分析」の研究を詳しく行いました。おそらくさらに重要なのは、フィッシャーが実際のデータの分析に対する体系的なアプローチを、新しい統計手法の開発の足掛かりとして始めたことです。彼は手作業で行われる必要な計算に伴う労力に特に注意を払い始め、厳密さに基づいた実用的な手法を開発しました。1925年、この研究は彼の最初の著書「研究者のための統計的手法」の出版で最高潮に達しました。[53] この本は後年何度も版を重ね、翻訳され、多くの分野の科学者にとって標準的な参考書となりました。[54]
実験を計画するための方法論は、ロナルド・A・フィッシャーによって革新的な著書『実験計画法』(1935年)で提案され、これも標準となった。[55] [56] [57] [58]一例として、彼は、ある婦人がカップに最初にミルクと紅茶のどちらを入れたのかを風味だけで区別できるという仮説を検定する方法を説明している。これは取るに足らない応用のように聞こえるが、これによって彼は実験計画法の最も重要な考え方を説明することができた。 「紅茶を味わう婦人」を参照。
農業科学の進歩は、都市人口の増加と農場の減少という組み合わせを満たすのに役立ちました。しかし、作物学者が地理的に大きく異なる生育気候とニーズを適切に考慮するためには、地元の生育条件を差別化することが重要でした。地元の作物に関する実験を全国規模に外挿するには、作物サンプルのテストを経済的に全体の集団に拡張する必要がありました。統計的手法が進歩するにつれて (主に、一度に 1 つの要因の実験ではなく、計画された実験の有効性)、実験の代表要因設計により、推論によって、実験サンプルの結果を全体の集団に有意義に拡張できるようになりました。[引用が必要]しかし、選択された作物サンプルがどの程度代表的であるかを判断するのは困難でした。[引用が必要]要因設計方法論は、サンプル内およびデータ収集手順内のランダムな変動を推定および修正する方法を示しました。
ベイズ統計

ベイズという用語は、未知の事象に確率的限界を設けることができることを証明したトーマス・ベイズ(1702–1761)を指す。しかし、現在ベイズの定理と呼ばれるものを(原理VIとして)導入し、それを天体力学、医療統計、信頼性、法学に適用したのはピエール=シモン・ラプラス(1749–1827)であった。[59] 情報に基づいた事前分布を指定するのに十分な知識がない場合は、ラプラスは「不十分な理由の原理」に従って一様事前分布を使用した。[ 59 ] [ 60 ]ラプラスは、哲学的な理由ではなく、数学的な単純さのために一様事前分布を仮定した。[59]ラプラスはまた、共役事前分布の原始的なバージョンと、最初は異なっていた事前分布に対応する事後分布が、観測数が増えるにつれて最終的に一致するというフォン・ミーゼスとベルンシュタインの定理を導入した[要出典]。[61]ラプラスの不十分な理由の原理に従って均一な事前分布を使用したこの初期のベイズ推論は、「逆確率」と呼ばれていました(観測値からパラメータへ、または効果から原因へ逆方向に推論するため[62])。
1920年代以降、逆確率はロナルド・A・フィッシャー、イェジ・ネイマン、エゴン・ピアソン が開発した一連の方法に 大きく取って代わられた[要出典] 。彼らの方法は頻度主義統計と呼ばれるようになった。[62]フィッシャーはベイズの見解を否定し、「逆確率の理論は誤りに基づいており、完全に否定されなければならない」と書いた。[63]しかし、フィッシャーは晩年、ベイズの論文に大きな敬意を表した。それは、フィッシャーが自身の確率に対する信頼的アプローチを予見していたと信じていたからである。フィッシャーは依然として、確率に関するラプラスの見解は「誤った戯言」であると主張していた。[63]ネイマンは「準ベイズ主義者」として出発したが、その後、 「ベイズ主義や事前分布を参照せずに最初から構築した方が理論全体がより見栄えが良くなる」という理由で、信頼区間(頻度主義統計の重要な方法)を開発した。[64]ベイズ統計学という 言葉は1950年頃に登場し、1960年代には頻度主義統計学の限界に不満を持つ人々の間で好まれる用語となった。[62] [65]
20世紀には、ラプラスの考えは2つの異なる方向にさらに発展し、ベイズの実践において客観的な流れと主観的な流れが生まれました。客観主義の流れでは、統計分析は想定されたモデルと分析されたデータのみに依存します。[66]主観的な決定は必要ありません。対照的に、「主観主義」の統計学者は、一般的なケースで完全に客観的な分析を行う可能性を否定します。
ラプラスの考えがさらに発展していく中で、主観的な考えは客観主義の立場に先立って存在していた。「確率」は「命題に対する主観的な信念の度合い」として解釈されるべきだという考え方は、例えば1920年代初頭にジョン・メイナード・ケインズによって提唱された。 [要出典]この考え方は、イタリアのブルーノ・デ・フィネッティ(Fondamenti Logici del Ragionamento Probabilistico、1930年)とケンブリッジのフランク・ラムゼイ(The Foundations of Mathematics、1931年)によってさらに発展した。[67]このアプローチは、確率の頻度主義的定義の問題だけでなく、ラプラスの初期の客観主義的アプローチの問題も解決するために考案された。 [66]主観的ベイズ法は、1950年代にLJサベージによってさらに発展し、普及した。[要出典]
客観的ベイズ推論は、ケンブリッジ大学のハロルド・ジェフリーズによってさらに発展させられました。彼の著書「確率論」は1939年に初めて出版され、ベイズ的確率観の復活に重要な役割を果たしました。[68] [69] 1957年、エドウィン・ジェインズは、事前確率を構築するための最大エントロピーの概念を推進しました。これは、主に離散問題に対する客観的手法の定式化における重要な原則です。1965年、デニス・リンドリーの2巻からなる著書「ベイズの観点から見た確率と統計入門」により、ベイズ法が幅広い読者に紹介されました。1979年、ホセ・ミゲル・ベルナルドは、客観的分析に一般的に適用可能なフレームワークを提供する参照分析を紹介しました。 [66] [70]ベイズ確率論の他の著名な支持者としては、IJグッド、BOクープマン、ハワード・ライファ、ロバート・シュライファー、アラン・チューリングなどがいます。
1980年代には、ベイズ法の研究と応用が劇的に増加しましたが、これは主に、計算上の多くの問題を解消したマルコフ連鎖モンテカルロ法の発見と、非標準的で複雑な応用に対する関心の高まりによるものです。[71]ベイズ研究の成長にもかかわらず、ほとんどの学部教育は依然として頻度主義統計に基づいています。[72]それにもかかわらず、ベイズ法は、たとえば機械学習の分野などで広く受け入れられ、使用されています。[73]
統計に重要な貢献をする人々
参考文献
- ^ ボール、フィリップ(2004)。クリティカルマス。ファラー、ストラウス&ジルー。p.53。ISBN 978-0-374-53041-9。
- ^ トゥキュディデス(1985年)『ペロポネソス戦争史』ニューヨーク:ペンギンブックス社、204ページ。
- ^ Villani, Giovanni. Encyclopædia Britannica. Encyclopædia Britannica 2006 Ultimate Reference Suite DVD . 2008-03-04 に取得。
- ^ Bakker, Arthur; Gravemeijer, Koeno PE (2006-06-01). 「平均と中央値の歴史的現象学」.数学教育研究. 62 (2): 149–168. doi :10.1007/s10649-006-7099-8. ISSN 1573-0816.
- ^ オスタシェヴィチ、ワレンティ (2014). 「統計科学の出現」。シロンスキ・プシェグランド・スタチスティチヌイ。12 (18): 76–77。土井:10.15611/sps.2014.12.04。
- ^ ブルーノー、クエンティン(2022年)。「国家と資本の支配者:主権貸付の古さと新しさ」コロンビア大学出版局。ISBN 978-0231555647。
- ^ Brian, Éric; Jaisson, Marie (2007). 「物理神学と数学 (1710–1794)」.出生時の人間の性比の減少. Springer Science & Business Media. pp. 1–25. ISBN 978-1-4020-6036-6。
- ^ジョン ・アーバスノット (1710)。「男女の出産に見られる一定の規則性から導かれた神の摂理の議論」( PDF)。ロンドン王立協会哲学論文集。27 (325–336): 186–190。doi : 10.1098 /rstl.1710.0011。S2CID 186209819 。
- ^ ab Conover, WJ (1999)、「第3.4章: 符号検定」、実用ノンパラメトリック統計(第3版)、Wiley、pp. 157–176、ISBN 978-0-471-16068-7
- ^ Sprent, P. (1989)、応用ノンパラメトリック統計手法(第2版)、Chapman & Hall、ISBN 978-0-412-44980-2
- ^ スティグラー、スティーブン・M(1986年)。統計の歴史:1900年以前の不確実性の測定。ハーバード大学出版局。pp. 225–226。ISBN 978-0-67440341-3。
- ^ Bellhouse, P. (2001)、「John Arbuthnot」、CC Heyde ; E. Seneta (編)、Statisticians of the Centuries、Springer、pp. 39–42、ISBN 978-0-387-95329-8
- ^ Hald, Anders (1998)、「第 4 章 偶然か計画か: 有意性の検定」、1750 年から 1930 年までの数理統計学の歴史、Wiley、p. 65
- ^ ド・モアブル、A. (1738) 偶然性の教義。ウッドフォール
- ^ ラプラス、PS (1774)。 「出来事の原因に関する記憶」。科学王立科学アカデミーの回想録。6 : 621–656。
- ^ ウィルソン、エドウィン・ビッドウェル (1923)「誤差の第一法則と第二法則」アメリカ統計学会誌、18 (143)、841-851 JSTOR 2965467
- ^ Havil J (2003)ガンマ:オイラー定数の探究プリンストン、ニュージャージー:プリンストン大学出版局、p. 157
- ^ CS ピアース (1873) 観測誤差の理論。米国沿岸測量局長報告書、ワシントン、政府印刷局。付録 21: 200-224
- ^ Cochran WG (1978)「ラプラス比推定量」pp 3-10。David HA (編)「調査サンプリングと応用統計への貢献: HO Hartley を称える論文」Academic Press、ニューヨーク ISBN 978-1483237930
- ^ ケインズ、JM (1921) 確率論第2部第17章§5 (p 201)
- ^ Galton F (1881) 人体測定委員会報告書 pp 245-260。英国科学振興協会第51回会議報告書
- ^ スティグラー(1986年、第5章:ケトレの2つの試み)
- ^ ヘレン・メアリー・ウォーカー(1975年)。統計手法の歴史研究。アルノ・プレス。ISBN 9780405066283。
- ^ (スティグラー 1986、第 9 章: 次世代: エッジワース)
- ^ Bellhouse DR (1988) ランダムサンプリング法の簡単な歴史。統計ハンドブック。第 6 巻、pp 1-14 Elsevier
- ^ Bowley, AL (1906). 「英国科学振興協会の経済科学および統計部門への演説」JR Stat Soc . 69 : 548–557. doi :10.2307/2339344. JSTOR 2339344.
- ^ Galton, F (1877). 「遺伝の典型的な法則」. Nature . 15 (388): 492–553. Bibcode :1877Natur..15..492.. doi : 10.1038/015492a0 .
- ^ Galton, F (1907). 「一票一価値」. Nature . 75 (1948): 414. Bibcode :1907Natur..75Q.414G. doi : 10.1038/075414a0 . S2CID 4053860.
- ^ スティグラー(1986年、第10章:ピアソンとユール)
- ^ Varberg, Dale E. (1963). 「現代統計学の発展」.数学教師. 56 (4): 252–257. doi :10.5951/MT.56.4.0252. JSTOR 27956805.
- ^ Stigler, SM (1989). 「フランシス・ゴルトンの相関関係の発明に関する説明」.統計科学. 4 (2): 73–79. doi : 10.1214/ss/1177012580 .
- ^ abc ピアソン、K. (1900)。「相関変数システムの場合の確率からの偏差の所定のシステムは、ランダムサンプリングから生じたと合理的に想定できるものであるという基準について」。哲学雑誌。シリーズ5。50(302):157–175。doi : 10.1080 / 14786440009463897。
- ^ピアソン、K . (1901)。「点の体系に最も近い線と平面は空間である」。哲学雑誌。シリーズ6。2(11):559–572。doi :10.1080 / 14786440109462720。
- ^ Jolliffe, IT (2002).主成分分析、第2版。ニューヨーク:Springer-Verlag。
- ^ ボックス、RAフィッシャー、pp 93–166
- ^ Agresti, Alan; David B. Hichcock (2005). 「カテゴリデータ分析のためのベイズ推論」(PDF) .統計手法と応用. 14 (3): 298. doi :10.1007/s10260-005-0121-y. S2CID 18896230.
- ^ フィッシャー RA (1925) 研究者のための統計手法、エディンバラ: オリバー&ボイド
- ^ ネイマン、J (1934) 代表的方法の2つの異なる側面について: 層別サンプリング法と目的選択法。王立統計学会誌97 (4) 557-625 JSTOR 2342192
- ^ Dunn, Peter (1997年1月). 「エディンバラのジェームズ・リンド(1716-94)と壊血病の治療」.小児疾患アーカイブ:胎児および新生児版. 76 (1): 64–65. doi :10.1136/fn.76.1.F64. PMC 1720613. PMID 9059193 .
- ^ クラウス・ヒンケルマン (2012)。実験の設計と分析、特別な設計と応用。ジョン・ワイリー・アンド・サンズ。p. xvii。ISBN 9780470530689。
- ^ ab チャールズ・サンダース・パースとジョセフ・ジャストロウ( 1885)。「感覚の小さな違いについて」。米国科学アカデミー紀要。3 : 73–83。
- ^ ab Hacking, Ian (1988 年 9 月). 「テレパシー: 実験デザインにおけるランダム化の起源」. Isis . 79 (人工物と実験に関する特別号、第 3 号): 427–451. doi :10.1086/354775. JSTOR 234674. MR 1013489. S2CID 52201011.
- ^ ab Stephen M. Stigler (1992年11月). 「心理学と教育研究における統計概念の歴史的見方」. American Journal of Education . 101 (1): 60–70. doi :10.1086/444032. S2CID 143685203.
- ^ ab Trudy Dehue (1997 年 12 月). 「欺瞞、効率、およびランダム グループ: 心理学とランダム グループ設計の段階的発生」(PDF) . Isis . 88 (4): 653–673. doi :10.1086/383850. PMID 9519574. S2CID 23526321.
- ^ Peirce, CS (1876). 「研究経済理論に関するノート」Coast Survey Report : 197–201.、実際には1879年に出版、NOAA PDF Eprint。Collected Papers 7、段落139~157、Writings 4、pp. 72~78、およびPeirce, CS (1967年7 ~
8月)に再掲載。「研究の経済理論に関する注記」。オペレーションズ・リサーチ。15 (4):643~648。doi : 10.1287 /opre.15.4.643。JSTOR 168276。 2011年7月26日時点のオリジナルよりアーカイブ。 2010年11月18日閲覧。 - ^ スミス、カースティン (1918)。「観測された多項式関数とその定数の調整値と補間値の標準偏差と、観測分布の適切な選択に向けたガイダンスについて」。バイオメトリカ。12 ( 1/2) : 1–85。doi :10.2307 / 2331929。JSTOR 2331929。
- ^ ジョンソン、NL (1961)。「逐次分析:調査」王立統計学会誌、シリーズA。第124巻(3)、372-411ページ。(375-376ページ)
- ^ Wald, A. (1945)「統計的仮説の逐次検定」、Annals of Mathematical Statistics、16 (2)、117–186。
- ^ チェルノフ、H. ( 1972)シーケンシャル分析と最適設計、SIAMモノグラフ。ISBN 978-0898710069
- ^ Zacks, S. (1996)「パラメトリック モデルの適応型設計」。Ghosh, S. および Rao, CR、(編) (1996)。「実験の設計と分析」、統計ハンドブック、第 13 巻。ノースホランド。ISBN 0-444-82061-2。(151 ~ 180 ページ)
- ^ Robbins, H. (1952). 「実験の逐次設計のいくつかの側面」.アメリカ数学会報. 58 (5): 527–535. CiteSeerX 10.1.1.335.3232 . doi :10.1090/S0002-9904-1952-09620-8.
- ^ Hald, Anders (1998)数理統計学の歴史ニューヨーク: Wiley. [ページが必要]
- ^ボックス、ジョーン・フィッシャー ( 1978)RAフィッシャー:科学者の人生、ワイリー。ISBN 0-471-09300-9(pp 93–166)
- ^ Edwards, AWF (2005). 「RA Fisher, Statistical Methods for Research Workers, 1925」. Grattan-Guinness, Ivor (ed.). Landmark writings in Western mathematical 1640-1940 . アムステルダム ボストン: Elsevier. ISBN 9780444508713。
- ^ Stanley, JC (1966). 「フィッシャーの『実験計画法』が30年後の教育研究に与えた影響」アメリカ教育研究ジャーナル. 3 (3): 223–229. doi :10.3102/00028312003003223. S2CID 145725524.
- ^ Box, JF (1980年2月). 「RAフィッシャーと実験計画法、1922-1926」.アメリカ統計学者. 34 (1): 1–7. doi :10.2307/2682986. JSTOR 2682986.
- ^ イェーツ、フランク(1964年6月) 。 「サー・ロナルド・フィッシャーと実験計画法」バイオメトリクス。20 (2):307–321。doi :10.2307/2528399。JSTOR 2528399。
- ^ スタンレー、ジュリアン C. (1966)。「フィッシャーの『実験計画法』が30年後の教育研究に与えた影響」 アメリカ教育研究ジャーナル。3 ( 3): 223–229。doi : 10.3102 /00028312003003223。JSTOR 1161806。S2CID 145725524。
- ^ abc スティグラー(1986年、第3章:逆確率)
- ^ Hald (1998) [ページが必要]
- ^ Lucien Le Cam (1986)統計的意思決定理論における漸近的手法:336 ページおよび 618 ~ 621 ページ(von Mises および Bernstein)。
- ^ abc Stephen. E. Fienberg、(2006) ベイズ推論はいつ「ベイズ的」になったのか? Archived 2014-09-10 at the Wayback Machine ベイズ分析、1 (1)、1–40。5ページを参照。
- ^ ab Aldrich, A (2008). 「RAフィッシャーによるベイズとベイズの定理」ベイズ分析3 (1): 161–170. doi : 10.1214 /08-ba306 .
- ^ Neyman, J. (1977). 「頻度主義的確率と頻度主義的統計」. Synthese . 36 (1): 97–131. doi :10.1007/BF00485695. S2CID 46968744.
- ^ ジェフ・ミラー、「数学用語の最も古い使用例 (B)」 「ベイジアンという用語は、1950 年頃に広まりました。RA フィッシャーは、彼の著書『数理統計学への貢献』(1950 年) の論文に添えたメモの中でこの用語を使用しました。フィッシャーは、ベイズの議論はほぼ絶滅したと考えていました。ベイズの議論を真剣に取り上げた最近の研究は、ハロルド・ジェフリーズの『確率の理論』(1939 年) のみだったからです。1951 年、LJ サベージは、ウォルドの『統計的決定関数』をレビューし、「現代の、または非ベイジアンの統計理論」に言及しました (「統計的決定の理論」、アメリカ統計協会誌、46、58 ページ)。しかし、その後すぐに、サベージは非ベイジアンからベイジアンに転向しました。
- ^ abc Bernardo J (2005). 「参照分析」ベイジアン思考 - モデリングと計算統計ハンドブック 第25巻 pp. 17–90. doi :10.1016/S0169-7161(05)25002-2. ISBN 9780444515391。
- ^ ギリーズ、D.(2000)、確率の哲学的理論。ラウトレッジ。ISBN 0-415-18276 -X pp 50–1
- ^ ET Jaynes.確率論:科学の論理Cambridge University Press、 ( 2003)。ISBN 0-521-59271-2
- ^ オコナー、ジョン・J.、ロバートソン、エドマンド・F.、「統計の歴史」、マクチューター数学史アーカイブ、セント・アンドリュース大学
- ^ Bernardo, JM および Smith, AFM (1994)。「ベイズ理論」。チチェスター: Wiley。
- ^ Wolpert, RL (2004). 「James O. Bergerとの会話」.統計科学. 9 : 205–218. doi : 10.1214/088342304000000053 . MR 2082155.
- ^ Bernardo, JM (2006). 「ベイズ数理統計入門」(PDF) .第 7 回国際統計教育会議議事録 [CDROM] . ブラジル、サルバドール (バイーア州): 国際統計教育協会。
- ^ ビショップ、CM (2007)パターン認識と機械学習。シュプリンガーISBN 978-0387310732
文献
- フリードマン、D . (1999)。「関連から因果関係へ:統計の歴史に関するいくつかのコメント」。統計科学。14 (3): 243–258。doi : 10.1214/ ss /1009212409。(改訂版、2002年)
- ハルド、アンダース(2003年)。確率と統計の歴史と1750年以前のその応用。ホーボーケン、ニュージャージー:ワイリー。ISBN 978-0-471-47129-5。
- ハルド、アンダース(1998年)。1750年から1930年までの数理統計学の歴史。ニューヨーク:ワイリー。ISBN 978-0-471-17912-2。
- Kotz, S., Johnson, NL (1992,1992,1997)。統計学のブレークスルー、第 I 巻、第 II 巻、第 III 巻。Springer ISBN 0-387-94037-5、ISBN 0-387-94039-1、ISBN 0-387-94989-5
- ピアソン、エゴン(1978)。知的、科学的、宗教的思想の変化を背景とした 17 世紀と 18 世紀の統計の歴史 (1921 年から 1933 年にかけてロンドン大学ユニバーシティ カレッジで行われたカール ピアソンの講義)。ニューヨーク: マクミラン パブリッシング カンパニー、744 ページ。ISBN 978-0-02-850120-8。
- サルスバーグ、デイビッド(2001年)。 『紅茶を味わう女性:統計学はいかにして20世紀の科学に革命をもたらしたか』。ISBN 0-7167-4106-7
- スティグラー、スティーブン・M(1986年)。統計の歴史:1900年以前の不確実性の測定。ベルナップ・プレス/ハーバード大学出版局。ISBN 978-0-674-40341-3。
- スティグラー、スティーブン・M(1999)「表の統計:統計概念と方法の歴史」ハーバード大学出版局。ISBN 0-674-83601-4
- David, HA (1995). 「数理統計における共通用語の最初の(?)出現」.アメリカ統計学者. 49 (2): 121–133. doi :10.2307/2684625. JSTOR 2684625.
外部リンク
- JEHPS: 確率と統計の歴史に関する最近の出版物
- 確率と統計の歴史の電子ジャーナル/Journ@l Electronique d'Histoire des Probabilités et de la Statistique
- 確率と統計の歴史からの図(サウサンプトン大学)
- 統計学の歴史に関する資料(ヨーク大学)
- 最も古い使用ページの確率と統計 (サウサンプトン大学)
- 確率と統計における記号の最も古い使用 さまざまな数学記号の最も古い使用について
