統計学において、経験分布関数(別名、経験累積分布関数、eCDF)は、標本の経験的尺度に関連付けられた分布関数です。[ 1 ]この累積分布関数は、 n 個のデータポイントのそれぞれで1/ nずつ増加する階段関数です。測定変数の任意の特定の値におけるその値は、測定変数の観測値のうち、その特定の値以下であるものの割合です。
経験分布関数は、サンプル内の点を生成した累積分布関数の推定値です。グリベンコ・カンテリの定理によれば、経験分布関数は確率 1 でその基礎となる分布に収束します。経験分布関数が基礎となる累積分布関数に収束する速度を定量化するための結果がいくつか存在します。単純な経験的推定値は、頻度分布です。
( X 1 , …, X n )を共通の累積分布関数F ( t )を持つ独立同分布の実確率変数とする。このとき、経験分布関数は次のように定義される[ 2 ] どこは事象Aの指標です。固定されたtに対して、指標ははパラメータp = F ( t )を持つベルヌーイ確率変数である。したがっては平均nF ( t )と分散nF ( t )(1 − F ( t ))の二項確率変数である。これは、はF ( t )の不偏推定量である。
一部の教科書では、経験分布関数は次のように定義されています[ 3 ] [ 4 ]しかし、 nが無限大に近づくにつれて 比率( n +1)/ nは1に近づくため、2つの定義の漸近的な性質は同じである。
大数の強法則により、推定値はtの任意の値に対して、n → ∞のときほぼ確実にF ( t )に収束する: [ 2 ] したがって推定器は一貫しています。この表現は、経験分布関数が真の累積分布関数に点ごとに収束することを主張しています。グリベンコ・カンテリの定理と呼ばれるより強力な結果があり、収束は実際にはtにわたって一様に起こると述べています。[ 5 ] この式におけるsupノルムは、経験分布と適合度検定のためのコルモゴロフ・スミルノフ統計量と呼ばれます。そして、仮定された真の累積分布関数F。ここでは、sup ノルムの代わりに他のノルム関数を使用することもできます。たとえば、 L 2ノルムはCramér–von Mises 統計量をもたらします。
漸近分布は、いくつかの異なる方法でさらに特徴付けることができます。まず、 中心極限定理は、点ごとに、漸近的に標準正規分布に従う収束速度: [ 2 ] この結果はドンスカーの定理によって拡張され、経験的プロセスは関数としてインデックス付けされていると見なすはスコロホッド空間で分布収束する平均ゼロのガウス過程へここで、Bは標準ブラウンブリッジである。[ 5 ]このガウス過程の共分散構造は ドンスカーの定理における均一な収束率は、ハンガリー埋め込み として知られる結果によって定量化できる。[ 6 ]
あるいは、収束速度この式のsupノルムの漸近挙動によって定量化することもできます。この分野では多くの結果が存在し、例えばドヴォレツキー・キーファー・ウォルフォウィッツの不等式は、裾確率の上限を提供します。: [ 6 ] 実際、コルモゴロフは、累積分布関数Fが連続であれば、次の式が成り立つことを示した。分布は収束し、これは、Fの形式に依存しないコルモゴロフ分布を持つ。



ドヴォレツキー・キーファー・ウォルフォウィッツの不等式によれば、真の累積分布関数を含む区間は、確率次のように指定されています
上記の制約条件に従って、いずれかの統計的実装を使用することで、さまざまな分布の経験的累積分布関数、累積分布関数、および信頼区間をプロットできます。
経験分布関数のソフトウェア実装例をいくつか挙げると、以下のようになります(ただし、これらに限定されません)。
{{cite book}}: CS1 メンテナンス: その他 (リンク)