5数要約は、データセットに関する情報を提供する記述統計量のセットです。これは、最も重要な5つの標本パーセンタイルで構成されます。
単一のデータセットの中央値に加えて、上位四分位数と下位四分位数と呼ばれる2つの関連する統計量があります。データが順序付けられている場合、下位四分位数はデータの下位半分の中心に位置し、上位四分位数はデータの上位半分の中心に位置します。これらの四分位数は、データのばらつきを説明し、データポイントが外れ値であるかどうかを判断するのに役立つ四分位範囲を計算するために使用されます。
これらの統計が存在するためには、観測値は順序尺度、間隔尺度、または比率尺度で測定可能な単変量変数から得られたものでなければならない。
5数要約は、観測値の分布を簡潔にまとめたものです。5つの数値を報告することで、最も適切な要約統計量を決定する必要がなくなります。5数要約は、観測値の位置(中央値)、ばらつき(四分位数)、範囲(標本最小値と最大値)に関する情報を提供します。5数要約は順序統計量(例えば平均値ではなく)を報告するため、順序尺度だけでなく、間隔尺度や比率尺度にも適しています。
複数の観測値セットを素早く比較するには、それらの5数要約を比較し、それを箱ひげ図を用いてグラフで表すことができる。
点自体に加えて、5数要約から四分位範囲、中間値、範囲、中間値、三平均値など、多くのL推定値を計算できます。
5数要約は、次の表のように表されることがあります。
この例では、次の観測値セット(0、0、1、2、63、61、27、13)の5数要約を計算します。これらは、2010年1月時点での太陽系内の各惑星の既知の衛星の数です。。
観測値を昇順に並べると、0、0、1、2、13、27、61、63 となります。観測値は 8 つあるので、中央値は中央の 2 つの数値の平均、(2 + 13)/2 = 7.5 です。観測値を中央値の両側に分割すると、4 つの観測値からなる 2 つのグループが得られます。最初のグループの中央値は下位または第 1 四分位数で、(0 + 1)/2 = 0.5 です。2 番目のグループの中央値は上位または第 3 四分位数で、(27 + 61)/2 = 44 です。最小値と最大値は 0 と 63 です。
したがって、5つの数値による要約は、0、0.5、7.5、44、63となります。
R プログラミング言語では、関数を使用して5 数要約を計算することができますfivenum。このsummary関数をベクトルに適用すると、5 数要約と平均値 (平均値自体は 5 数要約の一部ではありません) が表示されます。この関数は、関数fivenumとは異なる方法でパーセンタイルを計算しますsummary。
>月<- c ( 0 , 0 , 1 , 2 , 63 , 61 , 27 , 13 ) > Fivenum (月) [ 1] 0.0 0.5 7.5 44.0 63.0 >概要(月) 1Q.中央値平均第 3 Qu。最大。 0.00 0.75 7.50 20.88 35.50 63.00このPythonの例では、percentile数値計算ライブラリの関数を使用しておりnumpy、Python 2と3で動作します。
import numpy as npdef fivenum ( data ): "" " 5数要約""" return np.percentile ( data , [ 0 , 25 , 50 , 75 , 100 ], method = "midpoint " )>>> moons = [ 0 , 0 , 1 , 2 , 63 , 61 , 27 , 13 ] >>> print ( fivenum ( moons )) [ 0. 0.5 7.5 44. 63. ]SASPROC UNIVARIATEでは、以下の方法で5数要約を取得できます。
data fivenum; input x @@; datalines; 1 2 3 4 20 202 392 4 38 20 ; run; ods select Quantiles ; proc univariate data = fivenum; output out = fivenums min = min Q1 = Q1 Q2 = median Q3 = Q3 max = max ; run;proc print data = fivenums ; run;
入力バイト y 0 0 1 2 63 61 27 13リスト終了tabstat y、統計 (最小q最大)