
統計と確率において、分位数は、確率分布の範囲を等しい確率で連続した区間に分割するカット ポイント、またはサンプル内の観測値を同じ方法で分割するカット ポイントです。作成されたグループの数よりも 1 つ少ない分位数になります。一般的な分位数には、四分位数(4 つのグループ)、十分位数(10 のグループ)、パーセンタイル数(100 のグループ) などの特別な名前が付けられています。作成されたグループは、半分、3 分の 1、4 分の 1 などと呼ばれますが、カット ポイントではなく、作成されたグループに対して分位数という用語が使用されることもあります。
q分位数は、有限の値の集合を(ほぼ)等しいサイズの q 個のサブセットに分割する値です。 q 分位数には、 0 < k < q を満たす各整数 k に対して 1 つずつ、 q − 1 個の分割があります。場合によっては、分位数の値が一意に決定されないことがあります。これは、偶数サイズの集合における一様確率分布の中央値(2 分位数)の場合に当てはまります。 分位数は連続分布にも適用でき、ランク統計を連続変数に一般化する方法を提供します(パーセンタイルランクを参照)。ランダム変数の累積分布関数がわかっている場合、 q分位数は、分位関数(累積分布関数の逆関数)を値{1/ q、 2/ q、…、 ( q − 1)/ q } に適用したものです。
人口の分位数
例えば標準偏差の計算と同様に、分位数の推定は、統計的母集団を対象としているのか、それともそこから抽出した標本を対象としているのかによって異なります。離散値の母集団または連続的な母集団密度の場合、k番目のq分位数は、累積分布関数がk / qと交差するデータ値です。つまり、変数Xのk番目のq分位数は、次の場合です。
- Pr[ X < x ] ≤ k / qまたは、同等に、Pr[ X ≥ x ] ≥ 1 − k / q
そして
- Pr [ X≤x ] ≥k / q。
最小から最大まで1, …, Nとインデックス付けされたN 個の等確率値の有限母集団の場合、この母集団のk番目のq分位数は、 I p = N k / qの値を介して同等に計算できます。I p が整数でない場合は、適切なインデックスを取得するために次の整数に切り上げます。対応するデータ値はk番目のq分位数です。 一方、I pが整数の場合は、そのインデックスのデータ値から次のインデックスのデータ値までの任意の数値を分位数として取得でき、これら 2 つの値の平均を取得するのが一般的です (任意ではありますが) (サンプルからの分位数の推定を参照)。
整数kとq を使用する代わりに、「p分位数」が0 < p < 1の実数 pに基づく場合、上記の数式のk / q はp に置き換えられます。このより広い用語は、分位数が連続確率分布をパラメータ化するために使用されている場合に使用されます。さらに、一部のソフトウェア プログラム ( Microsoft Excelを含む) では、最小値と最大値がそれぞれ 0 パーセンタイルと 100 パーセンタイルと見なされます。ただし、このより広い用語は、従来の統計定義を超えた拡張です。
例
次の 2 つの例では、四捨五入による分位値の Nearest Rank 定義を使用しています。この定義の説明については、「パーセンタイル」を参照してください。
均等な人口
10 個のデータ値 [3、6、7、8、8、10、13、15、16、20] の順序付けられた集団を考えてみましょう。このデータセットの 4 つの分位数 (「四分位数」) は何でしょうか。
したがって、データセット [3、6、7、8、8、10、13、15、16、20] の 1 番目、2 番目、3 番目の 4 分位数 (「四分位数」) は [7、9、15] です。必要に応じて、0 番目の四分位数は 3、4 番目の四分位数は 20 です。
奇妙な人口規模
11 個のデータ値 [3、6、7、8、8、9、10、13、15、16、20] の順序付けられた集団を考えてみましょう。このデータセットの 4 つの分位数 (「四分位数」) は何でしょうか。
したがって、データセット [3、6、7、8、8、9、10、13、15、16、20] の 1 番目、2 番目、3 番目の 4 分位数 (「四分位数」) は [7、9、15] です。必要に応じて、0 番目の四分位数は 3、4 番目の四分位数は 20 です。
平均値との関係
有限個の値を持つ任意の母集団確率分布、および一般に平均と分散を持つ任意の確率分布では、次の式が成り立ちます。ここ で、Q(p) は0 < p < 1の場合のp分位値(または p = k / qの場合のk番目のq分位値)であり、μは分布の算術平均、σ は分布の標準偏差です。[1] 特に、中央値(p = k / q = 1/2)は、平均からの標準偏差の 1 つを超えることはありません。
上記の式は、分位数に関して値μ + zσを境界付けるために使用できます。 z ≥ 0の場合、平均値よりz標準偏差だけ上の値には下限があります。 たとえば、平均値よりz = 1標準偏差だけ上の値は常に中央値Q ( p = 0.5)以上であり、平均値よりz = 2標準偏差だけ上の値は常に第 4 五分位数Q ( p = 0.8)以上です。
z ≤ 0の場合、代わりに上限が存在します。 たとえば、z = −3の場合のμ + zσの値は、最初の十分位数である Q ( p = 0.1)を超えることはありません。
サンプルから四分位数を推定する
頻繁に発生する問題の 1 つは、サイズNの有限サンプルに基づいて (非常に大きいまたは無限の) 母集団の分位数を推定することです。
現代の統計パッケージは、分位数を推定するためにさまざまな手法に依存しています。
HyndmanとFanは、さまざまなソフトウェアパッケージで使用される9つのアルゴリズム[2]の分類をまとめました。すべての方法では、実数値のインデックスhを計算することにより、サイズNのサンプルからp分位数(k番目のq分位数、p = k / q )の推定値Q pを計算します。 hが整数の場合、 N個の値のうちh番目に小さい値x hが分位数推定値です。それ以外の場合は、丸めまたは補間方式を使用して、h、x ⌊ h ⌋、およびx ⌈ h ⌉から分位数推定値を計算します。(表記については、floor関数とceiling関数を参照してください)。
最初の 3 つは区分的に一定で、各データ ポイントで急激に変化しますが、最後の 6 つはデータ ポイント間の線形補間を使用し、区分的線形補間曲線に沿ったポイントを選択するために使用されるインデックスh の選択方法のみが異なります。
Mathematica [3]、 Matlab [ 4]、 R [ 5]、GNU Octave [6]プログラミング言語は、9つのサンプル分位法すべてをサポートしています。SASには5つのサンプル分位法が含まれ、SciPy [7]とMaple [8]には両方とも8つの方法が含まれており、EViews [9]とJulia [10]には6つの区分線形関数が含まれており、Stata [11] には2つ、Python [12]には2つ、Microsoft Excelには2つ含まれています。Mathematica、SciPy、Juliaは、他の非標準の方法を可能にする方法の任意のパラメータをサポートしています。
使用される推定タイプと補間方式は次のとおりです。
注:
- R-1 から R-3 は不連続性を伴い、区分的に一定です。
- R-4 以降は不連続性のない区分線形ですが、hの計算方法が異なります。
- R-3とR-4は、 p = 1/2のときにh = ( N + 1) / 2を与えない点で対称ではありません。
- Excel の PERCENTILE.EXC と Python のデフォルトの「排他的」メソッドは、R-6 と同等です。
- Excel の PERCENTILE と PERCENTILE.INC、および Python のオプションの「包括的」メソッドは、R-7 と同等です。これは、R と Julia のデフォルトのメソッドです。
- パッケージは、サンプル内の最低値と最高値、つまりp < 1/ Nとp > ( N − 1)/ Nを超える分位数を推定する方法が異なります。選択肢には、エラー値を返す、線形外挿を計算する、または定数値を想定することが含まれます。
これらの手法のうち、HyndmanとFanはR-8を推奨していますが、ほとんどの統計ソフトウェアパッケージはR-6またはR-7をデフォルトとして選択しています。[13]
四分位推定値の標準誤差は、一般にブートストラップ法で推定できる。また、マリッツ・ジャレット法も使用できる。[14]
標本中央値の漸近分布
標本中央値は、分布の期待値が存在しない場合に位置パラメータを推定する代替手段として、分位数の中で最もよく調べられるものであり、したがって標本平均は母集団特性の有意義な推定値ではない。さらに、標本中央値は標本平均よりも堅牢な推定値である。
標本中央値の特徴の1つは漸近分布である。標本が連続分布から得られる場合、標本中央値は予想される正規漸近分布に従う。
これは他の分位数にも当てはまります。
ここでf ( xp )はp番目の人口分位点( )における分布密度の値である。[15]
しかし、分布が離散的である場合、サンプルの中央値と他の分位数の分布は正規分布になりません (https://stats.stackexchange.com/a/86638/28746 の例を参照)。
この問題の解決策は、次のように定義される「中間分布」関数の概念を通じてサンプル分位数の別の定義を使用することです。
中間分布関数の概念による標本分位数の定義は、連続分布を特殊なケースとしてカバーできる一般化と見ることができます。離散分布の場合、この概念によって定義される標本中央値は漸近的に正規分布になります。Ma, Y.、Genton, MG、Parzen, E. (2011)「離散分布の標本分位数の漸近的特性」Annals of the Institute of Statistical Mathematics、63(2)、227–243 を参照してください。
ストリームからの近似分位数
ストリームから到着するデータから近似分位数を計算することは、圧縮データ構造を使用することで効率的に行うことができます。最も一般的な方法は、t-digest [16]と KLL [17]です。これらの方法は、値のストリームを連続的に読み取り、いつでも指定された分位数の近似値を照会することができます。
どちらのアルゴリズムも、同じまたは類似の値を重みでまとめることで値のストリームを圧縮するという同様のアイデアに基づいています。ストリームが v1 の 100 回と v2 の 100 回の繰り返しで構成されている場合、200 要素のソート済みリストを保持する理由はありません。2 つの要素と 2 つのカウントを保持すれば、分位数を回復できます。値が増えると、これらのアルゴリズムは、保存される一意の値の数と結果の分位数の精度との間でトレードオフを維持します。一部の値はストリームから破棄され、分位数の結果を大きく変更することなく、近くの値の重みに寄与する場合があります。t-digest は、類似の値をグループ化するためにk平均クラスタリングに動機付けられたアプローチを使用して、制限されたサイズのデータ構造を維持します。KLL アルゴリズムは、より洗練された「コンパクター」メソッドを使用して、エラーをpに対して制限する必要がある場合に無制限のサイズが必要になるという代償を払って、エラーの制限をより適切に制御します。
どちらの方法も、ストリーミング アルゴリズムのサブセットであるデータ スケッチのファミリーに属しており、便利な特性を備えています。t-digest または KLL スケッチを組み合わせることができます。非常に大きな値のベクトルのスケッチの計算は、ベクトルのパーティションのスケッチを並列に計算し、後でマージする、単純な並列プロセスに分割できます。
これまで説明したアルゴリズムは、データに関する特別な仮定をせずに経験的分位数を直接近似するものであり、本質的にはデータは単なる数字、またはより一般的には順序付け可能な項目の集合である。これらのアルゴリズムはコンピュータサイエンスから派生した手法である。データがランダムプロセスの実現であると仮定する別のクラスのアルゴリズムも存在する。これらは統計から派生した手法であり、特に逐次ノンパラメトリック推定アルゴリズムである。このようなアルゴリズムは、確率的近似[18] [19]やエルミート級数推定量に基づくものなど、数多く存在する。[20]
これらの統計ベースのアルゴリズムは、通常、更新時間と空間の複雑さが一定ですが、コンピュータサイエンスタイプの方法と比較してエラー境界の保証が異なり、より多くの仮定が立てられます。ただし、統計ベースのアルゴリズムには、特に非定常ストリーミング設定、つまり時間変動データでは、一定の利点があります。両方のクラスのアルゴリズムと、それぞれの利点と欠点が最近調査されました。[21]
議論
標準化されたテストの結果は、一般的に、例えば、ある学生が「80パーセンタイル」のスコアを獲得したという形で報告されます。これは、パーセンタイルという言葉の別の意味を、(この場合は)80番目と81番目のスカラーパーセンタイルの間の間隔として使っています。 [22 ]このパーセンタイルの別の意味は、査読を受けた科学研究論文でも使われています。[23]使用される意味は、その文脈から導き出すことができます。
分布が対称である場合、中央値は平均です(後者が存在する限り)。ただし、一般的には、中央値と平均は異なる場合があります。たとえば、指数分布を持つランダム変数の場合、このランダム変数の特定のサンプルが平均より小さくなる確率は約 63% になります。これは、指数分布が正の値に対して長い裾を持ちますが、負の数に対してはゼロになるためです。
分位数は、平均値よりもロングテール分布や外れ値の影響を受けにくいため、有用な尺度です。経験的に、分析対象のデータが想定された分布に従って実際に分布していない場合、または平均値から大きく離れた外れ値の潜在的な発生源が他にある場合、分位数は平均値やその他のモーメント関連の統計よりも有用な記述統計になる可能性があります。
これに密接に関連しているのが、最小絶対偏差という主題です。これは、最小二乗法よりも外れ値に対してより堅牢な回帰法で、二乗誤差の代わりに観測誤差の絶対値の合計が使用されます。平均値は、期待二乗誤差を最小化する分布の単一の推定値であり、中央値は期待絶対誤差を最小化するという点で関係があります。最小絶対偏差は、外れ値の観測値の大きな偏差に対して比較的鈍感であるという共通点がありますが、さらに優れた堅牢な回帰法も利用可能です。
ランダム変数の分位数は、増加変換の下で保存されます。つまり、たとえば、m がランダム変数Xの中央値である場合、特定の分位数を指定するために値の範囲から任意の選択が行われていない限り、 2 mは2 Xの中央値です。(このような補間の例については、上記の分位数推定を参照してください。)順序データのみが利用可能な場合にも、分位数を使用できます。
その他の定量化
ソートされたデータを 4 つ以外の等しいサブセットに分割する値には、異なる名前が付けられます。
- 唯一の2分位数は中央値と呼ばれる
- 3つの分位数は三分位数または三分位数と呼ばれる → T
- 4 つの分位数は四分位数→ Q と呼ばれます。上位四分位数と下位四分位数の差は四分位範囲、中間範囲、または中間の 50とも呼ばれます→ IQR = Q 3 − Q 1。
- 5つの分位数は五分位数または五分位数と呼ばれる → QU
- 6分位数は六分位数と呼ばれる → S
- 7分位数は7分位数と呼ばれる → SP
- 8つの四分位数は八分位数と呼ばれる → O
- 10の四分位数は十分位数と呼ばれる→ D
- 12 の四分位数は、2 十分位数または 12 十分位数と呼ばれます → DD
- 16 四分位数は 1616 四分位数と呼ばれる → H
- 20 分位数は、ベンタイル、ビギンタイル、またはデミ十分位と呼ばれます → V
- 100 四分位数はパーセンタイルまたは百分位数と呼ばれます → P
- 1000四分位数はパーミルまたはミリルと呼ばれてきましたが、これらはまれであり、ほとんど使われていません[24]
参照
参考文献
- ^ Bagui, S.; Bhaumik, D. (2004). 「確率と統計における不等式の一面」(PDF) . International Journal of Statistical Sciences . 3 : 9–15. ISSN 1683-5603. 2021-08-12に オリジナル(PDF)からアーカイブ。 2021-08-12に取得。
- ^ Hyndman, Rob J. ; Fan, Yanan (1996 年11月)。「統計パッケージのサンプル クォンタイル」。American Statistician。50 (4)。アメリカ統計協会: 361–365。doi : 10.2307 /2684934。JSTOR 2684934。
- ^ Mathematica ドキュメント「詳細」セクションを参照
- ^ 「分位点計算」uk.mathworks.com。
- ^ フローネ、イヴァン;ハインドマン、ロブ J. (2009)。サンプル クォンタイル。R プロジェクト。ISBN 978-3-900051-07-5。
- ^ 「関数リファレンス: quantile – Octave-Forge – SourceForge」 。2013年9 月 6 日閲覧。
- ^ 「scipy.stats.mstats.mquantiles — SciPy v1.4.1 リファレンス ガイド」. docs.scipy.org .
- ^ 「統計 – Maple プログラミング ヘルプ」www.maplesoft.com。
- ^ 「EViews 9 ヘルプ」。2016年4月16日時点のオリジナルよりアーカイブ。2016年4月4日閲覧。
- ^ 「統計 – Julia ドキュメント」。2023年6 月 17 日閲覧。
- ^ pctile コマンドと xtile コマンドについては、Stata ドキュメントの「方法と数式」セクションを参照してください。
- ^ 「統計 — 数理統計関数 — Python 3.8.3rc1 ドキュメント」。docs.python.org。
- ^ Hyndman, Rob J. (2016年3月28日). 「20年後のサンプル分位数」. Hyndsigntブログ. 2020年11月30日閲覧。
- ^ Wilcox, Rand R. (2010).ロバスト推定と仮説検定入門. アカデミック プレス. ISBN 978-0-12-751542-7。
- ^ スチュアート、アラン、オルド、キース(1994)。ケンドールの統計学の上級理論。ロンドン:アーノルド。ISBN 0340614307。
- ^ Dunning, Ted; Ertl, Otmar (2019年2月)。「t-Digestsを使用した極めて正確な分位数の計算」arXiv : 1902.04023 [stat.CO]。
- ^ Zohar Karnin、Kevin Lang、Edo Liberty (2016)。 「ストリームにおける最適な分位点近似」。arXiv : 1603.05346 [cs.DS]。
- ^ Tierney, Luke (1983). 「未知の分布の分位数を推定するための空間効率の良い再帰的手順」SIAM Journal on Scientific and Statistical Computing . 4 (4): 706-711. doi :10.1137/0904048.
- ^ Chen, Fei; Lambert, Diane; Pinheiro, Jose (2000)。「大規模追跡のための増分分位推定」。知識発見とデータマイニングに関する第 6 回 ACM SIGKDD 国際会議の議事録。p. 516-522。doi : 10.1145 / 347090.347195。ISBN 1-58113-233-6。
- ^ Stephanou, Michael; Varughese, Melvin; Macdonald, Iain (2017). 「エルミート級数密度推定による連続分位数」. Electronic Journal of Statistics . 11 (1): 570-607. arXiv : 1507.05073 . doi :10.1214/17-EJS1245.
- ^ Stephanou, M. および Varughese, M (2023). 「Hermiter: 逐次ノンパラメトリック推定のための R パッケージ」.計算統計. 39 (3): 1127–1163. arXiv : 2111.14091 . doi :10.1007/s00180-023-01382-0. S2CID 244715035.
{{cite journal}}: CS1 maint: multiple names: authors list (link) - ^ 「パーセンタイル」。オックスフォード・リファレンス。 2020年8月17日閲覧。
- ^ Kruger, J.; Dunning, D. (1999 年 12 月)。「無能でそれに気づいていない: 自分の無能さを認識することの難しさが、自己評価の過大評価につながる」。Journal of Personality and Social Psychology。77 (6): 1121–1134。doi :10.1037 / 0022-3514.77.6.1121。ISSN 0022-3514。PMID 10626367。S2CID 2109278 。
- ^ ウォーカー、ヘレン・メアリー; レブ、ジョセフ (1969)。初等統計手法。ホルト、ライナーハート、ウィンストン。ISBN 978-0-03-081130-2。
- ^ Stephen B. Vardeman (1992). 「その他の間隔についてはどうか?」. The American Statistician . 46 (3): 193–197. doi :10.2307/2685212. JSTOR 2685212.
さらに読む
- サーフリング、RJ (1980)。数理統計学の近似定理。ジョン・ワイリー・アンド・サンズ。ISBN 0-471-02403-1。
