統計学 において、四分位数は、データ点の数をほぼ等しい大きさの4つの部分(四分位)に分割する分位数の一種です。四分位数を計算するには、データを小さい順に並べる必要があります。そのため、四分位数は順序統計量の一種と言えます。4つのデータ分割をもたらす3つの四分位数は次のとおりです。

データの最小値と最大値(これらも四分位数です)に加えて、上記の3つの四分位数は、データの5つの数値による要約を提供します。この要約は、データの中心とばらつきの両方に関する情報を提供するため、統計学において重要です。下位四分位数と上位四分位数を知ることで、ばらつきの大きさとデータセットが片側に偏っているかどうかに関する情報が得られます。四分位数はデータポイントの数を均等に分割するため、隣接する四分位数間の範囲は一般的に同じではありません(つまり、通常は(Q3 - Q2 ) ≠(Q2 - Q1))。四分位範囲(IQR)は、 75パーセンタイルと25パーセンタイルの差、つまりQ3 - Q1として定義されます。最大値と最小値もデータのばらつきを示しますが、上位四分位数と下位四分位数は、特定のデータポイントの位置、データ内の外れ値の存在、データの中央50%と外側のデータポイント間のばらつきの違いについて、より詳細な情報を提供できます。[ 3 ]

離散分布の場合、四分位値の選択については普遍的な合意はありません。[ 4 ]
順序付けられたデータセットがある場合そうすれば、データポイント間を補間して、経験的分位数は分位数。数値の整数部分を表す場合によるすると、経験的分位関数は次のように与えられる。
、
は四分位数pの最後のデータポイントであり、これは、第 p + 1四分位の最初のデータ ポイントです。
四分位数がそして。 もし= 0 の場合、四分位数はちょうど。 もし= 0.5 の場合、四分位数はちょうど中間になります。そして。
、
どこそして[ 2 ]
データセットの第1、第2、第3四分位数を求めるには、、、 そしてそれぞれ。
この方法を説明する別の方法は、データ内の順位を見つけ、それを使って第1、第2、または第3四分位数の値を決定するということです。四分位数は、
ランク。
の四分位とは、データセット(小さい順に並べた場合)の中で、その位置がランク番号に等しい値です。たとえば、ランクが 1 の場合は、1.5 はデータセットの中で最小値です。順位が整数でない場合は、データポイントの間を補間します。したがって、順位が 1.5 の場合は、第 1 四分位数は、最初のデータポイントと 2 番目のデータポイントの中間の値です。
順序付けられたデータセット(奇数個のデータポイント):6、7、15、36、39、40、41、42、43、47、49 。
太字で示された数字(40)は、データセットをデータポイント数が等しい2つの半分に分割する中央値です。
順序付けられたデータセット(偶数個のデータポイント):7、15、36、39、40、41 。
太字で示された数字(36、39)は、それらの平均値として中央値を計算するために使用されます。データポイントの数が偶数であるため、最初の3つの方法はすべて同じ結果になります。(方法3は、中央値を新しいデータポイントとして選択せず、方法1を開始するように実行されます。)

連続確率分布を次のように定義します。どこは実数値の確率変数であり、その累積分布関数(CDF)は次のように与えられる。
[ 2 ]
CDFは、確率変数が値以下したがって、第1四分位数は次の値です。いつ第2四分位数はいつ、第3四分位数はいつ[ 6 ]値は分位関数で求めることができますどこ第1四分位については、第2四分位については、第3四分位数の場合。累積分布関数が単調増加である場合、分位関数は累積分布関数の逆関数になります。これは、累積分布関数の入力と出力の間に1対1の対応関係が成り立つためです。
統計学および統計分析の分野では、外れ値をチェックする方法があります。外れ値は、対象となるプロセスの位置(平均)またはスケール(変動性)のずれの結果である可能性があります。 [ 7 ]外れ値は、非正規分布を持つサンプル母集団、または汚染された母集団データセットの証拠である可能性もあります。したがって、記述統計学の基本的な考え方として、外れ値に遭遇した場合は、外れ値の原因または起源をさらに分析することによって、この値を説明する必要があります。頻繁に発生する極端な観測値の場合、典型的な値を分析する必要があります。四分位範囲(IQR)は、上位四分位数と下位四分位数(四分位範囲は、データに偏りをもたらす極端な値が存在する場合に、データの特徴を表すために使用できます。四分位範囲は、範囲や標準偏差に比べて比較的頑健な統計量(「耐性」とも呼ばれる)です。外れ値をチェックし、外れ値をチェックするための上限と下限である「境界」を決定するための数学的方法もあります。
第1四分位数(下位)と第3四分位数(上位)を決定した後、そしてそれぞれ)および四分位範囲()上記のように、フェンスは次の式を使用して計算されます。

下側のフェンスはデータの「下限」、上側のフェンスはデータの「上限」であり、これらの定義された境界外にあるデータは外れ値とみなされます。フェンスは外れ値を定義するためのガイドラインを提供し、外れ値は他の方法で定義される場合もあります。フェンスは外れ値が存在する「範囲」を定義します。これを視覚的に表現する方法は、フェンスの境界です。下側のフェンスと上側のフェンス、および外れ値は、箱ひげ図で表されるのが一般的です。右図の箱ひげ図では、垂直方向の高さのみが視覚化されたデータセットに対応し、箱の水平方向の幅は関係ありません。箱ひげ図でフェンスの外側にある外れ値は、「x」や「o」など、任意の記号でマークできます。フェンスは「ひげ」と呼ばれることもあり、グラフ全体は「箱ひげ図」と呼ばれます。
四分位範囲と箱ひげ図の特徴を計算してデータセット内の外れ値を見つけると、母集団が非正規分布である、またはサンプルが汚染されている証拠だと誤解しやすいかもしれません。しかし、この方法は母集団の正規性を判断するための仮説検定の代わりにはなりません。外れ値の有意性はサンプルサイズによって異なります。サンプルが小さい場合、代表的でないほど小さな四分位範囲が得られる可能性が高く、境界が狭くなります。したがって、外れ値としてマークされたデータが見つかる可能性が高くなります。[ 8 ]
Excel 関数QUARTILE.INC(array, quart)は、上記の方法 3 を使用して、指定されたデータ配列の目的の四分位値を提供します。QUARTILE関数は Excel 2007 以前のレガシー関数で、 QUARTILE.INC関数と同じ出力を生成します。この関数では、array は分析対象の数値データセットであり、quart は計算する四分位に応じて次の 5 つの値のいずれかになります。[ 9 ]
Matlabで四分位数を計算するには、関数quantile ( A , p )を使用できます。ここで、Aは分析対象のデータベクトルであり、pは以下に示すように四分位数に関連するパーセンテージです。[ 10 ]