統計学の基礎は、統計的手法の数学的および哲学的基盤です。これらの基盤は、統計的推論、推定、仮説検定、不確実性定量化、および統計的結論の解釈の方法を根拠づけ、正当化する理論的枠組みです。さらに、基礎は統計的パラドックスを説明したり、統計法則の説明を提供したり、[ 1 ]統計学を現実世界の問題に適用する際の指針として使用できます。
異なる統計的基礎は、データの分析と解釈に関して異なる対照的な視点を提供する可能性があり、これらの対照のいくつかは数世紀にわたる議論の対象となってきました。[ 2 ]例としては、ベイズ推論と頻度論的推論、フィッシャーの有意性検定とネイマン・ピアソン仮説検定の区別、尤度原理が成り立つかどうかなどが挙げられます。
特定の用途には、複雑な生態モデルを適合させるためのベイズ法の使用など、特定のフレームワークが好まれる場合がある。[ 3 ]
Bandyopadhyay & Forster [ 4 ]は、古典的統計(誤差統計)、ベイズ統計、尤度に基づく統計、赤池情報量規準を用いた情報に基づく統計という 4 つの統計パラダイムを特定しています。最近では、Judea Pearl が、著書「Causality」で論じられているように、ベイズ法と Neyman-Pearson 法の両方の根本的な限界に対処する統計システムに因果関係を帰属させることで、形式的な数学を再導入しました。
20世紀には、古典統計学の発展により、帰納的統計検定のための2つの競合する基礎が出現した。[ 5 ] [ 6 ]これらのモデルの利点については、広範な議論が交わされた。[ 7 ] 2つの方法のハイブリッドが広く教えられ、使用されているが、議論の中で提起された哲学的問題は解決されていない。
フィッシャーは、1925 年に出版された『研究者のための統計的方法』と1935 年に出版された『実験計画法』で有意性検定を普及させた。 [ 8 ]フィッシャーは、事前の意見の明示的な影響を受けずに科学的な実験結果を得ることに動機づけられていた。有意性検定は、演繹的推論の古典的な形式であるmodus tollensの確率的バージョンである。有意性検定は、簡単に言えば「証拠が仮説と十分に矛盾している場合は、仮説を棄却する」と述べることができる。適用においては、実験データから統計量が計算され、デフォルトまたは「帰無」モデルの下でその統計量を超える確率が閾値と比較される。閾値(「十分に矛盾している」の数値バージョン)は任意である(通常は慣例によって決定される)。この方法の一般的な適用は、比較実験に基づいて治療が報告可能な効果を持っているかどうかを判断することである。帰無仮説は、治療効果のないモデルに対応し、治療群と対照群が同じ母集団から来ていることを意味する。統計的有意性は確率の尺度であり、実質的な重要性を示すものではありません。これは、統計的信号/ノイズに課せられる要件と考えることができます。この検定は仮説(治療効果がないという仮説)を証明するものではなく、その仮説に反する証拠を多かれ少なかれ示すに過ぎないことに注意してください。この方法は、帰無仮説に対応する仮想的な無限母集団(すなわち、特定の統計モデル)の定式化に基づいています。
フィッシャーの有意性検定は仮説が1つだけであるが、検定統計量の選択には、仮説モデルからの逸脱の方向性をある程度把握しておく必要がある。歴史的には、検定結果は仮説を棄却するかしないかのどちらかであったが、今日では、仮説を仮定した場合に検定結果が観測される確率をコンピュータを用いて計算できるようになった。これはフィッシャーの時代には不可能だった。この確率はp値と呼ばれ、結果の有意性をより正確に評価することを可能にする。
ネイマンとピアソンは、実験的証拠のみに基づいて競合する仮説を選択するという、異なるが関連する問題で共同研究を行った。彼らの共同論文の中で最も引用されているのは1933年のものである。[ 9 ]その論文の有名な成果はネイマン・ピアソン補題である。この補題は、確率の比率が仮説を選択するための優れた基準であることを示している(比較の閾値は任意である)。この論文は、スチューデントのt検定(有意性検定の1つ)の最適性を証明した。ネイマンは、仮説検定は有意性検定の一般化であり、改良であるとの見解を示した。彼らの方法の根拠は、彼らの共同論文に見られる。[ 10 ]
仮説検定には複数の仮説が必要です。仮説は常に選択され、複数選択となります。証拠の欠如はすぐに考慮されるものではありません。この方法は、同じ母集団から繰り返しサンプリングするという仮定(古典的な頻度主義の仮定)に基づいています。ただし、フィッシャーはこの仮定を批判しました(Rubin、2020)。[ 11 ]
紛争が長期に及んだことで、統計学の基礎となる幅広い問題について議論することができた。
同一集団の繰り返しサンプリング
第II種エラー
帰納的行動
フィッシャーによる帰納的行動への攻撃は、彼が戦場を選んだことで概ね成功を収めた。作戦上の意思決定は(コストなど)さまざまな基準に基づいて日常的に行われるが、実験から得られる科学的結論は通常、確率のみに基づいて導き出される。フィッシャーの信頼に基づく推論理論には欠陥がある。
純粋に確率論的な検定理論には、対立仮説が必要である。フィッシャーによる第二種過誤への批判は、時とともに薄れていった。その間、統計学は探索的検定と検証的検定を区別してきた。現在の状況では、第二種過誤の概念は、検証的仮説検定のサンプルサイズ決定のための検出力計算に用いられている。
フィッシャーの頻度主義的確率に基づく攻撃は失敗に終わったが、成果がなかったわけではない。彼は、2つのテスト方法が異なる結果に達した特定のケース(2×2表)を特定した。このケースは、依然として問題となっているいくつかのケースの1つである。評論家は、「正しい」答えは文脈に依存すると考えている。[ 14 ]信頼確率は支持者がほとんどいないため、あまりうまくいっていないが、頻度主義的確率は主流の解釈として残っている。
フィッシャーによる帰納的行動への批判が概ね成功を収めたのは、彼が議論の場を的確に選んだからである。「作戦上の意思決定」は(コストなど)様々な基準に基づいて日常的に行われるのに対し、実験から得られる「科学的結論」は通常、確率のみに基づいて導き出される。
このやり取りの中で、フィッシャーは帰納的推論の要件についても議論し、特に誤った判断を罰するコスト関数を批判した。ネイマンは、ガウスとラプラスがそれらを用いたと反論した。この議論の応酬は、教科書で統計的検定のハイブリッド理論が教えられ始めてから15 年後に起こった。
フィッシャーとネイマンは統計学の基礎について意見が異なっていた(ただし、ベイズ的見解[ 14 ]には猛烈に反対していた)。
フィッシャーとネイマンは、考え方や言語の面で隔たりがあった。フィッシャーは科学者であり、直観的な数学者だった。帰納的推論は彼にとって自然なことだった。ネイマンは厳密な数学者だった。彼は実験に基づく確率計算よりも演繹的推論によって納得した。 [ 5 ]このように、応用と理論(科学と数学)の間には根本的な衝突があった。
フィッシャーと同じイギリスの建物にいたネイマンは、1938年にアメリカ合衆国の西海岸の職に就いた。彼の移住は事実上、ピアソンとの共同研究と仮説検定の開発を終わらせた。[ 5 ]その後の開発は他の人々によって続けられた。
教科書には、1940 年までに有意性検定と仮説検定のハイブリッド版が掲載された。[ 16 ]今日の入門統計学で教えられているハイブリッド版のさらなる発展に、校長たちが個人的に関与していたことは知られていない。[ 6 ]
統計学はその後、意思決定理論(そしておそらくゲーム理論)、ベイズ統計学、探索的データ分析、ロバスト統計学、ノンパラメトリック統計学など、さまざまな方向に発展した。ネイマン・ピアソン仮説検定は意思決定理論に大きく貢献し、意思決定理論は(例えば統計的品質管理において)非常に広く用いられている。仮説検定は容易に事前確率を受け入れるように一般化され、ベイズ的な性質を帯びるようになった。
ネイマン・ピアソン仮説検定は大学院統計学で教えられる抽象的な数学的主題となっているが[ 17 ]、学部生に教えられ仮説検定の名の下に使われるもののほとんどはフィッシャーによるものである。
2 つの競合するテスト手法のハイブリッドは、異なる見方をすることができる。数学的に補完的な 2 つのアイデアの不完全な結合[ 14 ]または、哲学的に相容れないアイデアの根本的に欠陥のある結合[ 18 ]である。フィッシャーは哲学的な利点を享受したが、ネイマンとピアソンはより厳密な数学を採用した。仮説検定は一部のユーザーの間で議論の的となっているが、最も一般的な代替手段 (信頼区間) は同じ数学に基づいている。
開発の歴史は、一般的な統計的実践を反映したハイブリッド理論に関する引用可能な権威ある情報源を一つも持たないままテストを残しました。統合された用語もやや一貫性がありません。入門統計学の授業の卒業生(および講師)が仮説検定の意味を十分に理解していないという強力な実証的証拠があります。[ 19 ]
確率の解釈には、客観的証拠に基づくものと主観的な信念に基づくものの2つの異なる解釈が長らく存在してきた。ガウスとラプラスは200年以上前に代替案について議論したかもしれない。その結果、2つの競合する統計学派が発展した。古典的な推論統計学は主に20 世紀の第2四半期に発展したが、[ 6 ]その多くは、事前確率を確立するために議論の的となっている無関心の原理を利用した当時の(ベイズ)確率に対する反動であった。ベイズ推論の復活は、頻度主義的確率の限界に対する反動であった。その後も反動が続いた。哲学的解釈は古いが、統計用語はそうではない。現在の統計用語「ベイズ」と「頻度主義」は20世紀後半に定着した。[ 20 ] (哲学、数学、科学、統計)用語は混乱を招く。確率の「古典的」解釈はベイズ的であり、「古典的」統計学は頻度主義である。 「頻度主義」にも様々な解釈があり、哲学と物理学ではその解釈が異なる。
哲学的確率解釈のニュアンスについては、別の箇所で論じられている。統計学においては、異なるモデルに基づいた異なる手法を用いて様々なデータを分析し、わずかに異なる目標を達成することが可能となる。競合する学派間の統計的比較においては、哲学的な基準だけでなく、実用的な基準も考慮される。
頻度主義的(古典的)方法への主要な貢献者は、フィッシャーとネイマンの2 人である。[ 5 ]フィッシャーの確率の解釈は独特であった(しかし、強く非ベイズ的であった)。ネイマンの見解は厳密に頻度主義的であった。20 世紀のベイズ統計哲学、数学、方法への主要な貢献者は、デ・フィネッティ[ 21 ] 、ジェフリーズ[ 22 ]、サベージ[ 23 ]の 3 人である。サベージは、英語圏でデ・フィネッティの考えを普及させ、ベイズ数学を厳密なものにした。1965 年、デニス・リンドレーの 2 巻の著作「ベイズ的観点からの確率と統計入門」により、ベイズ法が幅広い読者に知られるようになった。統計学は過去 3 世代にわたって進歩してきた。初期の貢献者の「権威ある」見解はすべてが現在も通用するとは限らない。
頻度論的推論は、上記(フィッシャーの「有意性検定」とネイマン・ピアソンの「仮説検定」)で簡潔に説明されています。頻度論的推論は、いくつかの異なる見解を組み合わせたものです。その結果、科学的結論を裏付けたり、運用上の意思決定を行ったり、信頼区間の有無にかかわらずパラメータを推定したりすることが可能になります。頻度論的推論は、(1つの)証拠のみに基づいています。
古典的な度数分布はデータの確率を表します。ベイズの定理を用いることで、より抽象的な概念、すなわちデータが与えられた場合の仮説(理論に対応)の確率を導き出すことができます。この概念はかつて「逆確率」として知られていました。ベイズ推論は、新たな証拠が得られるにつれて、仮説の確率推定値を更新します。ベイズ推論は、証拠と事前の意見に明確に基づいており、複数の証拠セットに基づいて推論を行うことが可能です。
頻度主義者とベイズ主義者は、異なる確率モデルを使用します。頻度主義者は、パラメータを固定されているが未知であると考えることが多いのに対し、ベイズ主義者は同様のパラメータに確率分布を割り当てます。したがって、ベイズ主義者は頻度主義者には存在しない確率について語ります。ベイズ主義者は理論の確率について語りますが、真の頻度主義者は証拠と理論の整合性についてのみ語ることができます。例:頻度主義者は、パラメータの真の値が信頼区間内にある確率が95%であるとは言わず、信頼区間の95%が真の値を含むと言います。
どちらの学派も数学的批判から免れることはなく、どちらも抵抗なくそれを受け入れることはない。例えば、スタインのパラドックスは、高次元で「平坦」または「無情報」の事前確率分布を見つけることが微妙であることを示した。 [ 2 ]ベイズ主義者はそれを自分たちの哲学の中核から外れたものとみなし、頻度主義には矛盾、パラドックス、そして悪い数学的振る舞いが満ちていると考えている。頻度主義者はほとんどのことを説明できる。悪い例のいくつかは、1頭の象の体重を測定して群れの象の体重を推定する(「バスの象」)などの極端な状況であり、体重の変動の統計的推定はできない。尤度原理は論争の的となっている。
両学派は、現実世界の問題を解決する上で目覚ましい成果を上げてきました。古典統計学は、機械式計算機や特殊な統計関数の印刷された表を用いて数多くの結果が得られたため、実質的に長い歴史を持っています。ベイズ法は、自然に逐次的にサンプリングされる情報(レーダーやソナー)の分析において非常に成功を収めてきました。多くのベイズ法と最近の頻度論的方法(ブートストラップなど)は、ここ数十年でようやく広く利用可能になった計算能力を必要とします。ベイズ法と頻度論的方法を組み合わせることについて活発な議論が行われていますが、[ 27 ] [ 25 ]結果の意味やアプローチの多様性の低下について懸念が表明されています。
ベイズ主義者は頻度主義の限界に反対することで一致しているが、哲学的にはさまざまな陣営(経験的、階層的、客観的、個人的、主観的)に分かれており、それぞれ重点が異なる。ある(頻度主義の)統計学の哲学者は、過去2世代にわたって統計学の分野から哲学的確率解釈へと後退していることを指摘している。 [ 28 ]ベイズ法の応用における成功は、それを支える哲学を正当化するものではないという認識がある。[ 29 ]ベイズ法は、従来の推論には使用されず、哲学にほとんど負っていない有用なモデルをしばしば作成する。[ 30 ]確率の哲学的解釈(頻度主義またはベイズ)のいずれも、堅牢ではないように見える。頻度主義の見解は厳格すぎて制限的である一方、ベイズ法の見解は客観的かつ主観的である可能性がある、など。
一般的に、尤度は確率の同義語として使われます。しかし、統計学ではそうではありません。確率は固定された仮説に対する可変データを指すのに対し、尤度は固定されたデータセットに対する可変仮説を指します。定規で一定の長さを繰り返し測定すると、一連の観測値が得られます。それぞれの固定された観測条件は確率分布に関連付けられており、それぞれの観測値はその分布からのサンプルとして解釈できます。これは確率の頻度論的見解です。あるいは、観測値のセットは、複数の分布(それぞれが一連の観測条件から生じる)のいずれかをサンプリングすることによって得られる場合もあります。固定されたサンプルと可変分布(可変仮説から生じる)との間の確率的関係は尤度と呼ばれ、これは確率のベイズ的見解です。長さの測定値のセットは、注意深く、冷静で、休息が十分にとられ、意欲的な観察者が良好な照明の下で行った測定値を意味する可能性があります。
尤度は、確率の限定的な頻度主義的定義のために存在する、別の名前の確率(またはそうでない確率)です。尤度は、フィッシャーが40年以上にわたって導入し、発展させてきた概念です (ただし、この概念への以前の言及は存在し、フィッシャーの支持は中途半端でした)。[ 35 ]この概念はジェフリーズによって受け入れられ、大幅に変更されました。[ 36 ] 1962年、バーンバウムは、ほとんどの統計学者が受け入れる前提から尤度原理を「証明」しました。[ 37 ]彼の「証明」は、統計学者と哲学者によって議論されています。重要なことに、1970年までにバーンバウムはこれらの前提の1つ(条件付き原理)を否定し、尤度原理も否定しました。なぜなら、それらは両方とも頻度主義的な「統計的証拠の信頼概念」と相容れないからです。[ 38 ] [ 39 ]尤度原理によれば、標本中のすべての情報は尤度関数に含まれており、これはベイズ主義者によって有効な確率分布として受け入れられている(ただし頻度主義者は受け入れていない)。
(頻度主義的な)有意性検定の中には、尤度原理と矛盾するものがある。ベイズ主義者は、自分たちの哲学と一致するこの原理を受け入れている(おそらく頻度主義者の困惑によって促されたのだろう)。「尤度アプローチは、ベイズの定理により、パラメータの事後ベイズ分布が事前分布に尤度関数を掛けることによって求められるという意味で、ベイズ統計的推論と互換性がある。」[ 35 ]頻度主義者は、この原理を証拠の信頼性について何の懸念もないという意味で、ベイズ主義に不利に解釈している。「ベイズ統計学の尤度原理は、証拠が収集された実験計画に関する情報がデータの統計分析に関与しないことを意味する。」[ 40 ]多くのベイズ主義者(例えばサベージ)は、この含意を脆弱性として認識している。
尤度原理の最も熱心な支持者は、尤度原理が他の2つの学派よりも統計学のより良い基礎を提供すると主張している。「尤度は、これらの[ベイズ主義と頻度主義の]代替案と比較すると、実に優れているように見える。」[ 41 ]これらの支持者には、統計学者と科学哲学者が含まれる。[ 42 ]ベイズ主義者は、計算における尤度の重要性を認めているが、事後確率分布が推論の適切な基礎であると考えている。[ 43 ]
推論統計学は統計モデルに基づいています。たとえば、古典的な仮説検定の多くは、データの正規性を仮定していました。頑健なノンパラメトリック統計学は、この仮定への依存を減らすために開発されました。ベイズ統計学は、過去と現在の間にモデル化された連続性があると仮定して、事前の知識の観点から新しい観測を解釈します。実験計画法は、制御、変化、ランダム化、および観測される要因に関する何らかの知識を前提としています。統計学者は、因果関係を証明することの難しさ(数学的な限界というよりはモデリング上の限界)をよく理解しており、「相関関係は因果関係を意味しない」と述べています。
より複雑な統計学では、より複雑なモデルが用いられ、多くの場合、一連の変数の根底にある潜在的な構造を見つけ出すことを目的としています。モデルとデータセットが複雑化するにつれて、[ a ] [ b ]モデルの正当性やそこから導き出される推論の妥当性について、根本的な疑問が提起されてきました。モデリングに関して表明された相反する意見の範囲は広範です。
統計モデリングに関する強力な哲学的合意に基づく検討が行われていない現状において、多くの統計学者は、統計学者ジョージ・ボックスの「すべてのモデルは間違っているが、中には有用なものもある」という警告を受け入れている。
統計学の基礎に関する簡単な入門書としては、Stuart, A.; Ord, JK (1994). "Ch. 8 – Probability and statistical inference". Kendall's Advanced Theory of Statistics . Vol. I: Distribution Theory (6th ed.). Edward Arnold.を参照のこと。
ロバート・P・アベルソンは著書『統計学を原理的議論として捉える』の中で、統計学は、そうでなければ各自の立場の正当性を際限なく主張し続けるであろう科学者間の論争を解決するための標準化された手段として機能するという立場を明確に述べている。この観点からすると、統計学は修辞の一形態であり、あらゆる論争解決手段と同様に、統計的手法は、すべての関係者が使用するアプローチに同意している限りにおいてのみ成功する。[ 50 ]
原理に基づいた修辞法を用いて、定量的な証拠から有用な議論を構築することである。
主成分分析は経験的なアプローチであるのに対し、因子分析や構造方程式モデリングは理論的なアプローチである傾向がある。(27
ページ)