パラメトリック統計学は、観測データが抽出された基礎となる分布が有限個の(未知の)パラメータで記述できると仮定して、データの分析と推論を行う統計学の一分野です。[ 1 ] [ 2 ]対照的に、ノンパラメトリック統計学は、データをモデル化する際に、分布の明示的な(有限パラメータ)数学的形式を仮定しません。ただし、連続性や対称性、あるいは明示的な数学的形状など、その分布について何らかの仮定を行う場合がありますが、分布パラメータのモデル自体は有限パラメータではありません。
最もよく知られている統計的手法はパラメトリックである。[ 3 ]ノンパラメトリック(およびセミパラメトリック)モデルに関して、サー・デイビッド・コックスは、「これらは通常、構造と分布形式に関する仮定が少ないが、独立性に関する強い仮定を含むことが多い」と述べている。[ 4 ]
統計的推論の主な目的は、データを体系的に分析し、データが抽出された確率分布の特性を推論するための方法を提供することである。パラメトリック統計学の根底にある基本的な仮定は、データ分布が、有限個のパラメータによってパラメータ化できる、より一般的な分布族に属するというものである。未知の分布です。このような分布の族はパラメトリックモデルと呼ばれます。この設定での典型的な質問は次のとおりです。[ 2 ]
パラメータ推定の典型的な設定では、選択されたパラメトリック分布族は、密度関数または密度質量関数のいずれかを持つ。パラメータに依存する尤度と呼ばれる、独立かつ同一の分布に従うデータの有限サンプルが与えられている。目標は推定することである。(またはそれに基づく関数)観測データに基づく。
頻度論的アプローチでは、データは次のように分布していると仮定される。ある「真」のパラメータに対して目標は回復することです観測データから。[ 5 ]パラメータ推定の最も一般的な方法は以下のとおりです。
ベイズアプローチでは、データは分布によって生成されるとは想定されない。真実のいくつかのその代わりに、考えられる(または妥当な)モデルパラメータの集合は、まず事前分布で重み付けされる。これは統計学者の事前の信念を反映している。観測データに基づいて、ベイズの定理によってパラメータ分布が更新され、事後分布が得られる。それは可能性に比例する以前の倍したがって、ベイズ推定量は統計学者の信念に基づいて最良の推定値を与える。[ 5 ]
一様最小分散不偏推定量(UMVUE)は、最良不偏推定量とも呼ばれ[ 7 ] 、すべての不偏推定量の中で最小の分散を持つ推定量です。バイアス・分散分解により、すべての不偏推定量の中で平均二乗誤差を最小化するという意味で最適です。
モデルパラメータの関数を仮定してみましょう推定する必要がある(例:平均、分散、中央値、またはそれ自体) 最も一般的には、UMVU推定量が有限分散が存在する場合、 Rao–Blackwellの定理[ 8 ]により一意でなければならない。完全十分統計量が存在する場合選択された統計モデル(多くの場合、ネイマン・フィッシャーの定理を用いて容易に決定できる)において、レーマン・シェッフェの定理が成り立つ。すなわち、次の形式の推定量は、つまり、不偏推定量は自動的に UMVU になります。そのような推定量がすべての に対して有限の分散を持つ場合それならば、それはまた独自のUMVUEでもある。
最良線形不偏推定量(BLUE)は、すべての不偏推定量の中で最小の分散を持つ。データに対して線形である、つまり、いくつかの係数についてある意味では、BLUEは線形であるという追加の制約を持つUMVU推定器である。[ 9 ]
回帰分析の枠組みにおいて、ガウス・マルコフの定理は、最小二乗推定量が唯一のBLUE(最良平均)であることを述べています。この定理はまた、(定数回帰という特殊なケースを考慮すると)経験平均が平均を推定するためのBLUEであることを示しています。
通常の統計モデルでは、不偏推定量の分散は任意に小さくすることはできないことが示されます。任意の不偏推定量量の普遍境界[ 10 ]によって下から制限されるどこは統計モデルのフィッシャー情報行列です。右辺は、いわゆるクラメール・ラオ限界です。
分散がクラメール・ラオ限界に等しい推定量は効率的と呼ばれ、ほぼUMVUである。なぜなら、それらはすべての正則不偏推定量の中で分散を最小化するからである(分散が小さい非正則推定量が存在する可能性はある)。逆に、すべてのUMVUEが効率的であるとは限らない。実際、推定量は統計モデルが指数型分布族であり、かつ (ii)である場合に限り、効率的である。は自然十分統計量である。[ 11 ]
モデルの選択、すなわち、密度推定問題においてデータが抽出されると想定される確率分布、またはデータペア間の想定される関数的依存関係の選択そして回帰/分類問題において、パラメトリック手法の中核を成すのがパラメトリックモデルです。以下に、実務でよく用いられるモデルの一覧を示します。
正規分布族はすべて同じ一般的な形状を持ち、平均と標準偏差によってパラメータ化されます。つまり、平均と標準偏差が既知であり、分布が正規分布であれば、将来の観測値が特定の範囲内に収まる確率がわかります。
平均が100、標準偏差が1である99個のテストスコアのサンプルがあるとします。99個のテストスコアすべてが正規分布からのランダムな観測値であると仮定すると、100番目のテストスコアが他のスコアと同じ分布から得られたと仮定した場合、100番目のテストスコアが102.33(つまり、平均+2.33標準偏差)よりも高くなる確率は1%であると予測されます。上記の2.33という値は、同じ正規分布からの99個の独立した観測値に基づいて、パラメトリック統計手法を用いて計算されます。
同じことのノンパラメトリック推定値は、最初の99個のスコアの最大値です。テストを実施する前に、最高得点が最初の100個のいずれかのスコアになる可能性が等しかったと推論するのに、テストスコアの分布について何も仮定する必要はありません。したがって、100番目のスコアがそれ以前の99個のスコアのどれよりも高くなる確率は1%です。
パラメトリック統計学は、 1925年にR.A.フィッシャーが著した『研究者のための統計的方法』の中で言及されており、これが現代統計学の基礎を築いた。