
記述統計学では、四分位範囲( IQR ) は統計的分散の尺度であり、データのばらつきを表します。[ 1 ] IQR は、中央値、中央 50%、第 4 位、またはH スプレッドとも呼ばれます。これは、データの75 パーセンタイルと 25パーセンタイルの差として定義されます。 [ 2 ] [ 3 ] [ 4 ] IQR を計算するには、データセットを四分位、つまり線形補間によって 4 つの順位付けされた均等な部分に分割します。 [ 1 ]これらの四分位は、 Q1 (下位四分位とも呼ばれる)、Q2 (中央値)、およびQ3 (上位四分位とも呼ばれる)で表されます。下位四分位は 25 パーセンタイルに対応し、上位四分位は75パーセンタイルに対応するため、IQR = Q3 − Q1となります。[ 1 ]
IQRは、25%トリミング範囲として定義されるトリミング推定量の一例であり、寄与度の低い外れ値を削除することでデータセット統計の精度を高めます。[ 5 ]また、頑健な尺度としても使用されます。[ 5 ]ボックスプロットのボックスで明確に視覚化できます。[ 1 ]
全範囲とは異なり、四分位範囲には25%のブレークポイントがあり[ 6 ]、そのため全範囲よりも好まれることが多い。
IQRは、確率分布の単純なグラフ表現である箱ひげ図を作成するために使用されます。
IQRは、企業において収益率の指標として用いられる。
対称分布(中央値が第1四分位数と第3四分位数の平均である中央値に等しい場合)では、IQRの半分が中央絶対偏差(MAD)に等しくなります。
IQRは外れ値を特定するために使用できます(下記参照)。IQRはデータセットの歪度を示す場合もあります。 [ 1 ]
四分位偏差または半四分位範囲は、IQRの半分として定義されます。[ 7 ]
一連の値の IQR は、上位四分位数 Q 3と下位四分位数 Q 1の差として計算されます。各四分位数は、次のように計算される中央値です[ 8 ] 。
偶数個の2nまたは奇数個の2n+1個の値が与えられた場合
第2四分位数Q2は通常の中央値と同じです。[ 8 ]
以下の表は13行からなり、奇数個のエントリに関する規則に従っています。
この表のデータの場合、四分位範囲は IQR = Q 3 − Q 1 = 119 - 31 = 88 です。
+−−−−−+−+ * |−−−−−−−−−−−| | |−−−−−−−−−−−| +−−−−−+−+ +−−−+−−−+−−−+−−−+−−−+−−−+−−−+−−−+−−−+−−−+−−−+ 数直線 0 1 2 3 4 5 6 7 8 9 10 11 12
この箱ひげ図のデータセットについて:
これは、1.5*IQR のひげの長さが不均一になる可能性があることを意味します。中央値、最小値、最大値、第 1 四分位数、第 3 四分位数は、 5 数要約を構成します。[ 9 ]
連続分布の四分位範囲は、確率密度関数を積分することによって計算できます(これにより累積分布関数が得られます。CDF を計算する他の方法も有効です)。下位四分位Q 1は、-∞ からQ 1までの PDF の積分が0.25 になるような数値であり、上位四分位Q 3は、-∞ からQ 3までの積分が 0.75 になるような数値です。CDF の観点から、四分位は次のように定義できます。
ここで、CDF −1は分位関数です。
以下に、いくつかの一般的な分布の四分位範囲と中央値を示します。
母集団PのIQR、平均、および標準偏差は、P が正規分布(ガウス分布)であるかどうかの簡単な検定に使用できます。Pが正規分布である場合、第 1 四分位数の標準スコアz 1は -0.67、第 3 四分位数の標準スコアz 3は +0.67 です。平均= Pの標準 偏差 は σであり、 Pが正規分布している場合、第 1 四分位数は
そして第3四分位
第1四分位数または第3四分位数の実際の値が計算値と大きく異なる場合、Pは正規分布に従っていません。ただし、正規分布は、第1四分位数と第2四分位数の標準偏差をそれぞれ0.67と-0.67に維持するように簡単に変形させることができ、その場合でも正規分布に従っていません(したがって、上記の検定では偽陽性となります)。このような場合は、Q-Qプロットなどのより適切な正規性検定が推奨されます。

四分位範囲は、データの外れ値を見つけるためによく用いられます。ここでいう外れ値とは、Q1 − 1.5 IQR より小さい値、または Q3 + 1.5 IQR より大きい値のことです。箱ひげ図では、この範囲内で出現する最大値と最小値は箱ひげ(多くの場合、ひげの端に棒が追加されます)で示され、外れ値は個別の点として表されます。