
統計学と確率論において、分位数とは、確率分布の範囲を等しい確率を持つ連続した区間に分割する、あるいは標本中の観測値を同様に分割する区切り点のことです。一般的な分位数には、四分位数(4つのグループ)、十分位数(10のグループ)、百分位数(100のグループ)など、特別な名称があります。作成されたグループは、半分、3分の1、4分の1などと呼ばれますが、分位数を表す用語は、区切り点ではなく、作成されたグループに対して用いられることが多いです。
q分位数は、有限個の値をq 個のほぼ等しいサイズのサブセットに分割する値です。q分位数にはq − 1個のサブセット、 0 < k < qを満たす各整数kに対して 1 つずつ存在します。偶数サイズの集合上の均一確率分布の中央値(2 分位数)の場合のように、分位数の値が一意に決定されない場合もあります。分位数は連続分布にも適用でき、順位統計を連続変数に一般化する方法を提供します(パーセンタイル順位を参照)。確率変数の累積分布関数が既知の場合、 q分位数は、値{1/ q、 2/ q、 …、 ( q − 1)/ q } に分位関数(累積分布関数の逆関数) を適用したものです。
例えば標準偏差の計算と同様に、分位点の推定は、統計的母集団を扱っているか、そこから抽出された標本を扱っているかによって異なります。離散値または連続的な母集団密度の母集団の場合、k番目のq分位点は、累積分布関数がk / qと交差するデータ値です。つまり、変数Xのk番目のq分位点は、次の条件を満たす場合です。
そして
ここでPrは確率関数です。最小値から最大値まで1, …, Nのインデックスが付けられた、N 個の等確率値の有限母集団の場合、この母集団のk番目のq分位数は、 I p = N k / qの値によって等価に計算できます。I p が整数でない場合は、適切なインデックスを取得するために次の整数に切り上げます。対応するデータ値がk番目のq分位数です。 一方、I pが整数の場合は、そのインデックスのデータ値から次のインデックスのデータ値までの任意の数値を分位数として取ることができ、慣例として (任意ではありますが)、これら 2 つの値の平均を取るのが一般的です (サンプルからの分位数の推定を参照)。
整数kとq の代わりに、 0 < p < 1を満たす実数pに基づく「p分位数」を用いる場合、上記の式ではk / q の代わりにpが用いられます。このより広い用語は、分位数を用いて連続確率分布をパラメータ化する場合に使用されます。さらに、一部のソフトウェアプログラム(Microsoft Excelを含む)では、最小値と最大値をそれぞれ 0 パーセンタイルと 100 パーセンタイルとみなします。ただし、このより広い用語は、従来の統計の定義を超えた拡張です。
以下の2つの例では、四捨五入を用いた最近傍順位による分位数の定義を使用しています。この定義の説明については、「パーセンタイル」を参照してください。
10個のデータ値[3, 6, 7, 8, 8, 10, 13, 15, 16, 20]が順序付けられた母集団であるとします。このデータセットの4分位数(「四分位数」)は何ですか?
したがって、データセット [3, 6, 7, 8, 8, 10, 13, 15, 16, 20] の第 1、第 2、第 3 四分位数 (「四分位数」) は [7, 9, 15] です。必要に応じて、第 0 四分位数は 3、第 4 四分位数は 20 となります。
11個のデータ値[3, 6, 7, 8, 8, 9, 10, 13, 15, 16, 20]が順序付けられた母集団であるとします。このデータセットの4分位数(「四分位数」)は何ですか?
したがって、データセット [3, 6, 7, 8, 8, 9, 10, 13, 15, 16, 20] の第 1、第 2、第 3 四分位数 (「四分位数」) は [7, 9, 15] です。必要に応じて、第 0 四分位数は 3、第 4 四分位数は 20 です。
有限個の値を持つ任意の母集団確率分布、および一般に平均と分散を持つ任意の確率分布については、次のことが成り立つ。 ここで、Q(p)は0 < p < 1のp分位値(または同等に p = k / qのk番目のq分位値) であり、μは分布の算術平均、σは分布の標準偏差です。[ 1 ] 特に、中央値( p = k / q = 1/2)は平均から 1 標準偏差を超えることはありません。
上記の式は、 μ + zσ の値を分位数で制限するために使用できます。z ≥ 0の場合、平均からz標準偏差上の値には下限があります。 例えば、平均値から標準偏差1つ分上のz値は、常に中央値であるQ(p =0.5)以上であり、平均値から標準偏差2つ分上のz値は、常に第4五分位であるQ(p =0.8)以上である。
z ≤ 0の場合、代わりに上限が存在する。 例えば、z = −3の場合のμ + zσの値は、最初の十分位数であるQ ( p = 0.1)を超えることは決してありません。
頻繁に発生する問題の 1 つは、サイズNの有限サンプルに基づいて、(非常に大きいまたは無限の)母集団の分位数を推定することです。
現代の統計ソフトウェアは、分位数を推定するために様々な手法を用いている。
ハインドマンとファンは、さまざまなソフトウェアパッケージで使用される9 つのアルゴリズムの分類をまとめました[ 2 ] 。すべての方法は、実数値のインデックスhを計算することによって、サイズNのサンプルから p 分位点 (p = k / q の場合の k 番目の q 分位点)の推定値Q pを計算します。hが整数の場合、N個の値x hのうちh番目に小さい値が分位点の推定値になります。それ以外の場合は、 h、x ⌊ h ⌋、およびx ⌈ h ⌉から分位点の推定値を計算するには、丸めまたは補間スキームが使用されます。(表記については、床関数と天井関数を参照してください)。
最初の3つは区分的に定数であり、各データポイントで急激に変化する一方、最後の6つはデータポイント間の線形補間を使用し、区分的線形補間曲線に沿ってポイントを選択するために使用されるインデックスhの選択方法のみが異なります。
Mathematica [ 3 ] Matlab [ 4 ] R [ 5 ]およびGNU Octave [ 6 ]プログラミング言語は、9 つのサンプル分位法すべてをサポートしています。SASには5つのサンプル分位法が含まれ、SciPy [ 7 ]とMaple [ 8 ]はどちらも 8 つ、EViews [ 9 ]とJulia [ 10 ]は 6 つの区分的線形関数を含み、Stata [ 11 ] は 2 つ、Python [ 12 ]は 2 つ、Microsoft Excel は2 つが含まれています。Mathematica、SciPy、および Julia は、他の非標準の方法を可能にするメソッドの任意のパラメータをサポートしています。Google Guava Java ライブラリは、Quantiles クラスでタイプ 7 スキームを提供します。
使用される推定タイプと補間スキームは以下のとおりです。
注:
これらの手法のうち、ハインドマンとファンはR-8を推奨しているが、ほとんどの統計ソフトウェアパッケージはR-6またはR-7をデフォルトとして選択している。[ 13 ]
分位点推定の標準誤差は一般にブートストラップ法によって推定できる。Maritz–Jarrett法も使用できる。[ 14 ]
標本中央値は、分位数の中で最もよく研究されているものであり、分布の期待値が存在しない場合、つまり標本平均が母集団特性の有意義な推定値とならない場合、位置パラメータを推定する代替手段として用いられます。さらに、標本中央値は標本平均よりも頑健な推定値です。
標本中央値の特異性の一つは漸近分布である。標本が連続分布から得られた場合、標本中央値は予想される正規漸近分布に従う。
これは他の分位数にも当てはまります。
ここで、f ( x p )はp番目の母集団分位点における分布密度の値です() [ 15 ]
しかし、分布が離散的である場合、標本中央値と他の分位点の分布は正規分布になりません(例については、https://stats.stackexchange.com/a/86638/28746を参照)。
この問題の解決策は、「中間分布」関数の概念を通して標本分位数の別の定義を使用することであり、それは次のように定義される。
中間分布関数の概念による標本分位数の定義は、連続分布を特殊なケースとして包含できる一般化と見なすことができます。離散分布の場合、この概念によって定義される標本中央値は漸近的に正規分布になります。詳細は、Ma, Y., Genton, MG, & Parzen, E. (2011). Asymptotic properties of sample quantiles of discrete distributions. Annals of the Institute of Statistical Mathematics, 63(2), 227–243 を参照してください。
ストリームから到着するデータから近似分位数を計算することは、圧縮データ構造を使用して効率的に行うことができます。最も一般的な方法は、t-digest [ 16 ]と KLL [ 17 ]です。これらの方法は、値のストリームを連続的に読み込み、いつでも指定された分位数の近似値について問い合わせることができます。
どちらのアルゴリズムも、値ストリームを重み付きで同一または類似の値を要約して圧縮するという同様のアイデアに基づいています。ストリームが v1 100 回と v2 100 回を繰り返したもので構成されている場合、200 個の要素のソート済みリストを保持する理由はなく、2 つの要素と 2 つのカウントを保持すれば分位数を復元できます。値が増えると、これらのアルゴリズムは、格納される一意の値の数と結果として得られる分位数の精度との間でトレードオフを維持します。一部の値はストリームから破棄され、分位数の結果をあまり変更することなく、近くの値の重みに寄与する可能性があります。t-digest は、k -means クラスタリングに触発されたアプローチを使用して類似の値をグループ化し、サイズの制限されたデータ構造を維持します。KLL アルゴリズムは、より洗練された「コンパクタ」メソッドを使用して、エラーがpに対して制限される必要がある場合に無制限のサイズが必要になるという代償を伴うものの、エラー範囲をより適切に制御します。
どちらの方法も、ストリーミングアルゴリズムのサブセットであるデータスケッチのファミリーに属し、有用な特性を備えています。t-digestスケッチとKLLスケッチは組み合わせることができます。非常に大きな値のベクトルに対するスケッチの計算は、簡単に並列化できるプロセスに分割でき、ベクトルのパーティションごとにスケッチを並列に計算し、後でマージします。
これまで説明したアルゴリズムは、データに関する特別な仮定なしに経験的分位数を直接近似します。本質的に、データは単なる数値、より一般的には順序付け可能な項目の集合です。これらのアルゴリズムは、コンピュータサイエンス由来の手法です。データがランダムプロセスの実現であると仮定する別のクラスのアルゴリズムも存在します。これらは統計学由来の手法であり、特に逐次ノンパラメトリック推定アルゴリズムです。確率近似に基づくもの[ 18 ] [ 19 ]やエルミート級数推定器に基づくもの[ 20 ]など、そのようなアルゴリズムが多数存在します。
これらの統計ベースのアルゴリズムは、通常、更新時間と空間の計算量が一定ですが、コンピュータサイエンスタイプのメソッドと比較してエラー境界の保証が異なり、より多くの仮定を置きます。ただし、統計ベースのアルゴリズムは、特に非定常ストリーミング設定、つまり時変データにおいて、いくつかの利点があります。両方のクラスのアルゴリズムと、それぞれの利点と欠点については、最近調査されています。[ 21 ]
標準化テストの結果は、例えば「80パーセンタイル」という形で報告されるのが一般的です。これは、パーセンタイルという言葉の別の意味、つまり(この場合)80パーセンタイルと81パーセンタイルの間の区間という意味で使われています。 [ 22 ]このパーセンタイルの別の意味は、査読付きの科学研究論文でも使われています。[ 23 ]使われている意味は、文脈から推測できます。
分布が対称であれば、中央値は平均値と等しくなります(平均値が存在する場合)。しかし、一般的には、中央値と平均値は異なる場合があります。例えば、指数分布に従う確率変数の場合、この確率変数の任意のサンプルが平均値より小さくなる確率は約63%です。これは、指数分布が正の値に対して長い裾を持ち、負の値に対してはゼロとなるためです。
分位数は、平均値に比べて裾の長い分布や外れ値によって生じる問題の影響を受けにくいため、有用な指標です。経験的に、分析対象のデータが想定された分布に従って分布していない場合、あるいは平均値から大きく離れた外れ値の原因となる可能性のある他の要因が存在する場合、分位数は平均値やその他のモーメント関連の統計量よりも有用な記述統計量となる可能性があります。
密接に関連しているのが、最小絶対偏差法です。これは、最小二乗法よりも外れ値に対して頑健な回帰手法であり、二乗誤差の代わりに観測誤差の絶対値の合計を用います。その関連性は、平均値が期待二乗誤差を最小化する分布の唯一の推定値であるのに対し、中央値は期待絶対誤差を最小化するという点にあります。最小絶対偏差法は、外れ値の大きな偏差に対して比較的鈍感であるという点で共通していますが、さらに優れた頑健な回帰手法も存在します。
確率変数の分位数は、増加変換の下で保持されます。つまり、たとえば、m が確率変数Xの中央値である場合、2 mは2 Xの中央値になります。ただし、特定の分位数を指定するために値の範囲から任意に選択された場合は除きます。(このような補間の例については、上記の分位数推定を参照してください。)分位数は、順序データのみが利用可能な場合にも使用できます。
ソートされたデータを4つ以外の等しいサブセットに分割する値は、それぞれ異なる名前を持つ。
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)