
数値の集合の中央値は、データサンプル、母集団、または確率分布の上位半分と下位半分を分ける値です。データセットの場合、中央値は「真ん中」の値と考えることができます。平均値(単に「平均」と呼ばれることが多い)と比較した場合、中央値がデータを記述する際の基本的な特徴は、少数の極端な値によって歪められることがなく、したがって中心をより適切に表すということです。たとえば、中央所得は、所得分布の中心を記述するより良い方法かもしれません。なぜなら、最高所得の増加だけでは中央値に影響がないからです。このため、中央値はロバスト統計において中心的な重要性を持っています。中央値は2分位数です。つまり、集合を2つの等しい部分に分割する値です。
有限個の数値のリストの中央値とは、数値を小さい順から大きい順に並べたときの中央にある数値のことです。
データセットに奇数個の観測値がある場合、(昇順に並べた後)中央の観測値が選択されます。たとえば、次の 7 つの数値のリストでは、
中央値は6で、これは4番目の値です。
データセットの観測値が偶数の場合、明確な中央値は存在せず、中央値は通常、中央の2つの値の算術平均として定義されます。 [ 1 ] [ 2 ]例えば、この8つの数値のデータセットは
中央値は4.5です。(より専門的な用語で言えば、これは中央値を完全にトリミングした中間値として解釈する。)
一般的に、この慣例では、中央値は次のように定義できます。データセットの場合の要素を小さい順に並べると、
厳密に言えば、母集団の中央値とは、母集団の少なくとも半分がその中央値以下であり、かつ少なくとも半分がその中央値以上であるような値のことです。上記のように、中央値は一意ではない場合があります。各集合に母集団の半分以上が含まれている場合、母集団の一部は一意の中央値と完全に一致することになります。
中央値は、順序付けられた(一次元)データであればどれでも明確に定義され、距離尺度に依存しません。そのため、中央値は、数値ではなく順位付けされた学生の成績(例えば、学生のテストの点数がFからAまで評価されている場合の中央値)にも適用できます。学生数が偶数の場合は、結果は各成績の中間値になります。学生数が奇数の場合は、特定の成績が中央値として決定されます。
一方、幾何中央値は任意の次元で定義されます。関連する概念として、結果が標本のいずれかのメンバーに対応するように強制されるメドイドがあります。
中央値には広く受け入れられている標準的な表記法はありませんが、一部の著者は変数xの中央値をmed( x )、x͂ [ 3 ]、μ 1/2 [ 1 ]、またはM . [ 3 ] [ 4 ]と表しています。これらのいずれの場合も、中央値にこれらの記号やその他の記号を使用する場合は、導入時に明示的に定義する必要があります。
中央値は、統計分布に関連する典型的な値を要約する他の方法の特殊なケースです。中央値は、第2四分位数、第5十分位数、および第50パーセンタイルです。
中央値は、分布が歪んでいる場合、極端な値が不明な場合、または外れ値が信頼できない場合(測定誤差や転記誤差である可能性がある場合など)に、極端な値の重要性を低く評価する場合に、位置の尺度として使用できます。
例えば、多重集合を考えてみましょう。
この場合、中央値は2であり、最頻値も同様です。中央値は、1つを除くすべての値よりも大きい算術平均4よりも、中心を示すより良い指標と見なされるかもしれません。しかし、平均値は中央値よりも分布の「裾野側にずれている」という広く引用されている経験的関係は、一般的には正しくありません。せいぜい言えることは、2つの統計量が「あまり離れすぎていない」ということです。§平均値と中央値に関する不平等については、以下を参照してください。[ 5 ]
中央値はデータセットの中央のデータに基づいて算出されるため、計算に極端な結果の値を知る必要はありません。例えば、問題解決に必要な時間を調査する心理テストでは、与えられた時間内に問題を全く解けなかった人が少数であっても、中央値を計算することができます。[ 6 ]
中央値は理解しやすく計算も容易であり、平均値の確実な近似値でもあるため、記述統計学においてよく用いられる要約統計量です。このような状況において、ばらつきの尺度としては、範囲、四分位範囲、平均絶対偏差、中央絶対偏差など、いくつかの選択肢があります。
実用上、位置と分散のさまざまな尺度は、対応する母集団の値をデータのサンプルからどれだけ正確に推定できるかに基づいて比較されることが多い。標本中央値を使用して推定される中央値は、この点で優れた特性を持っている。特定の母集団分布を仮定すると通常は最適ではないが、その特性は常に十分に良好である。たとえば、候補推定量の効率を比較すると、標本平均は、裾の重い分布または分布の混合からのデータによってデータが汚染されていない場合に限り、統計的に効率的であることがわかる。 それでも、中央値は最小分散平均(大きな正規標本の場合)と比較して64%の効率であり、つまり中央値の分散は平均の分散よりも約50%大きくなる。[ 7 ] [ 8 ]
実数値確率変数のメディアン実数満たす または、同様に補完的なイベントでは、 そのような常に存在するが、一意に決定される必要はない。同等の表現として累積分布関数を用いる。の (任意の実数値確率変数の期待値の定義における図を参照)。

この定義では、X が絶対連続分布(確率密度関数fを持つ)を持つことも、離散分布を持つことも必要としないことに注意してください。前者の場合、不等式は等式にアップグレードできます。中央値は次の式を満たします 。 そして
実数集合上の任意の確率分布少なくとも1つの中央値を持つが、病的なケースでは中央値が複数存在する可能性がある。Fが区間上で定数1/2である場合(つまり、その区間ではf = 0である場合)、その区間の任意の値は中央値となる。
特定の種類の分布の中央値は、そのパラメータから簡単に計算できます。さらに、コーシー分布のように明確な平均値を持たない分布であっても、中央値は存在します。
実変数mと確率変数Xとの間の平均絶対誤差は X の確率分布が上記の期待値が存在するようなものであるならば、mがXの中央値であるのは、m がXに関する平均絶対誤差を最小化する場合に限る。[ 11 ]特に、m が標本中央値である場合、絶対偏差の算術平均を最小化する。[ 12 ]ただし、標本に偶数個の要素が含まれる場合、この最小化値は一意ではないことに注意する。
この最適化に基づく中央値の定義は、統計的データ分析、例えばk-中央値クラスタリングにおいて有用である。

分布の分散が有限である場合、中央値とそして平均1標準偏差の範囲内に収まる。
この境界は、1979年にBookとSherによって離散サンプルについて証明され[ 13 ]、より一般的には1982年にPageとMurtyによって証明された[ 14 ] 。O'Cinneideによるその後の証明[ 15 ] に対するコメントの中で、 Mallowsは1991年にJensenの不等式を2回使用する簡潔な証明[ 16 ]を以下のように提示した。絶対値に|·|を用いると、次のようになる。
最初の不等式と3番目の不等式は、絶対値関数と二乗関数にジェンセンの不等式を適用することによって得られ、これらはそれぞれ凸関数である。2番目の不等式は、中央値が絶対偏差関数を最小化するという事実から得られる。。
マロウズの証明は、絶対値をノルムに置き換えるだけで、不等式の多変数バージョン[ 17 ]を得るように一般化できる。
ここで、mは空間中央値、すなわち関数の最小値である。空間中央値は、データセットの次元が2以上の場合に一意になります。[ 18 ] [ 19 ]
別の証明では、片側チェビシェフの不等式を使用します。これは、位置とスケールパラメータに関する不等式に現れます。この式は、カンテリの不等式からも直接導かれます。[ 20 ]
単峰分布の場合、中央値と平均値の間の距離についてより厳密な境界を得ることができます。[ 21 ]
中央値と最頻値の間にも同様の関係が成り立つ。

一般的な経験則として、正に歪んだ分布は平均 > 中央値を持つというものがあります。これはピアソン分布族のすべてのメンバーに当てはまります。しかし、これは常に正しいとは限りません。例えば、ワイブル分布族には平均が正であるにもかかわらず、平均 < 中央値となるメンバーがあります。この規則の違反は、離散分布で特に多く見られます。例えば、ポアソン分布は正の歪みを持ちますが、平均 < 中央値となるのは、[ 22 ]証明の概略については[ 23 ]を参照。
分布の確率密度が単調減少する場合、図に示すように、中央値は平均値よりも小さくなります。
イェンセンの不等式は、有限の期待値E [ X ] を持つ任意の確率変数Xと任意の凸関数fに対して、
この不等式は中央値にも一般化されます。関数f : R → RがC 関数であるとは、任意のtに対して、
は閉区間 である(一点または空集合の退化ケースを許容する)。すべての凸関数は C 関数であるが、逆は成り立たない。fがC 関数である場合、
中央値が一意でない場合、対応する上限値についても同様の記述が成り立つ。[ 24 ]
n個の項目を比較ソートするに はΩ ( n log n )回の操作が必要ですが、選択アルゴリズムはn個の項目のうちk番目に小さい項目をΘ( n )回の操作だけで計算できます。これには中央値も含まれます。中央値はn/2番目の順序統計量です(またはサンプル数が偶数の場合は、中央の2つの順序統計量の算術平均です)。 [ 25 ]
選択アルゴリズムには、 Ω( n ) のメモリを必要とするという欠点があります。つまり、メモリにサンプル全体(またはその線形サイズの部分)を保持する必要があります。このことと線形時間要件は、処理が困難になる可能性があるため、中央値の推定手順がいくつか開発されています。単純なものとしては、3 要素のサブサンプルの中央値として中央値を推定する「3 の中央値ルール」があります。これは、入力の中央値の推定値を使用するクイックソートアルゴリズムのサブルーチンとしてよく使用されます。より堅牢な推定器は、限定的な再帰で適用される「3 の中央値ルール」であるTukeyのnintherです。 [ 26 ] A が配列として配置されたサンプルである場合、
それから
レメディアンは、線形時間を必要とするが準線形メモリで動作し、サンプルを1回通過するだけで中央値を推定する手法である。[ 27 ]
標本平均と標本中央値の分布は、ラプラスの公式によって決定された。[ 28 ]密度関数を持つ母集団からの標本中央値の分布漸近的に平均が正規分布に従うおよび分散[ 29 ]
どこは中央値ですそしてサンプルサイズは:
以下に現代的な証明を示す。ラプラスの結果は現在、任意の分位数の漸近分布の特殊な場合として理解されている。
通常のサンプルでは、密度はしたがって、サンプルサイズが大きい場合、中央値の分散は[ 7 ] (「効率性」の。)
サンプルサイズは奇数とする変数は連続であると仮定します。離散変数の場合の式は、§ 経験的局所密度で後述します。サンプルは「中央値以下」、「中央値」、「中央値以上」に要約でき、これは確率を持つ三項分布に対応します。 、そして 連続変数の場合、複数のサンプル値が中央値と完全に一致する確率は0なので、その点における密度を計算できます。三項分布から直接得られるもの:
ここでベータ関数を紹介します。整数引数の場合そしてこれは次のように表現できます。また、次のことも思い出してください。これらの関係性を利用して両方を設定するそして等しい 最後の式は次のように書ける
したがって、中央値の密度関数は、対称ベータ分布を前方に押し出すものである。予想通り、平均は0.5で、分散は 連鎖律により、標本中央値の対応する分散は
追加の 2 は極限では無視できる。
実際には、関数はそして上記は、多くの場合、既知または仮定されていません。しかし、観測された頻度分布から推定することができます。このセクションでは、例を示します。次の表は、3,800個の(離散値)観測値のサンプルを表しています。
観測値は離散値であるため、中央値の正確な分布を構築することは、上記の式をそのまま翻訳したものではありません。サンプルには中央値が複数存在する可能性があり(そして通常は複数存在する)、そのため、これらの可能性すべてについて合計する必要がある。
ここで、iは中央値より厳密に小さい点の数、k は中央値より厳密に大きい点の数である。
これらの予備知識を用いることで、標本サイズが平均値と中央値の標準誤差に及ぼす影響を調べることができます。観測された平均値は3.16、観測された生の中央値は3、観測された補間された中央値は3.174です。以下の表は、いくつかの比較統計量を示しています。
標本サイズが増加するにつれて、中央値の期待値はわずかに低下する一方、予想通り、中央値と平均値の標準誤差は標本サイズの平方根の逆数に比例する。漸近近似は、標準誤差を過大評価することで、慎重な方向に偏っている。
価値—漸近値どこは母集団の中央値であり、複数の著者によって研究されてきた。標準的な「1つ削除」ジャックナイフ法では一貫性のない結果が得られる。[ 30 ]代替案として「kを削除」法があり、サンプルサイズとともに増加する漸近的に一致性があることが示されている。[ 31 ]この方法は、大規模なデータセットでは計算コストが高くなる可能性がある。ブートストラップ推定は一致性があることが知られているが、[ 32 ]収束が非常に遅い(オーダー)[ 33 ]他の方法も提案されているが、サンプルサイズが大きい場合と小さい場合では挙動が異なる可能性がある。[ 34 ]
標本中央値の効率(平均値の分散と中央値の分散の比として測定)は、標本サイズと基礎となる母集団分布に依存します。標本サイズが の場合、正規分布から、Nが大きい場合の効率は
効率はとして無限大に近づく。
言い換えれば、中央値の相対分散は、または平均の分散より 57% 大きい場合、中央値の相対標準誤差はまたは平均の標準誤差より25%大きい、(上記の「標本分布」の項も参照してください。)[ 35 ]
1 つの中央値に関して対称な単変量分布の場合、ホッジス・レーマン推定量は母集団中央値の頑健で非常に効率的な推定量である。 [ 36 ]
データが特定の確率分布族を指定する統計モデルで表される場合、その確率分布族をデータに当てはめ、当てはめた分布の理論上の中央値を計算することで、中央値の推定値を得ることができます。パレート補間は、母集団がパレート分布に従うと仮定される場合のこの手法の応用例です。
以前、この記事では、サンプルまたは母集団が 1 次元の場合の単変量中央値について説明しました。次元が 2 以上の場合、単変量中央値の定義を拡張する複数の概念があります。このような多変量中央値はそれぞれ、次元がちょうど 1 の場合の単変量中央値と一致します。[ 36 ] [ 37 ] [ 38 ] [ 39 ]
周辺中央値は、固定された座標セットに関して定義されたベクトルに対して定義されます。周辺中央値は、その成分が単変量中央値であるベクトルとして定義されます。周辺中央値は簡単に計算でき、その特性は Puri と Sen によって研究されました。[ 36 ] [ 40 ]
離散的なサンプル点の幾何中央値ユークリッド空間では、サンプル点までの距離の合計を最小にする点が[ a ]です。
すべての座標系の周辺中央値が一致する場合、それらの共通位置は「全方向の中央値」と呼ばれることがあります。[ 42 ]この概念は、中央値投票者定理により投票理論に関連しています。存在する場合、全方向の中央値は幾何中央値と一致します(少なくとも離散分布の場合)。
条件付き中央値は、確率変数を推定しようとする状況で発生します。ランダム変数からこれは、この設定における条件付き中央値は次式で与えられる。
どこは、条件付き累積分布関数(すなわち、条件付き分位関数)の逆数である。例えば、人気のあるモデルはどこ標準正規は条件付き中央値は最適なベイズ法である推定器:
モデルについては、どこ標準正規は推定器が線形であるのは、ガウス分布である。[ 43 ]
離散変数を扱う場合、観測値を基礎となる連続区間の中間点とみなすことが有用な場合があります。その例として、リッカート尺度があります。これは、意見や好みを、あらかじめ決められた数の回答選択肢を持つ尺度で表現するものです。尺度が正の整数で構成されている場合、観測値3は2.50から3.50までの区間を表していると考えることができます。基礎となる変数の中央値を推定することも可能です。例えば、観測値の22%が2以下の値で、55.0%が3以下の値である場合(つまり、33%が3の値である場合)、中央値は中央値は最小値なので 3 ですそのためには半分より大きい。しかし、補間された中央値は2.50から3.50の間にある。まず、区間幅の半分を加える。中央値に 50% を超える部分の割合に等しい区間幅の割合を減算します。つまり、観測値の数に比例して区間幅を分割します。この場合、33% は中央値より下の 28% と上の 5% に分割されるため、区間幅の 5/33 を上限 3.50 から減算して、補間された中央値 3.35 を得ます。より厳密には、値がが既知であれば、補間された中央値は以下から計算できます。
あるいは、観測されたサンプルに中央値を超えるスコアのカテゴリー、スコアとそれ以下のスコアの場合、補間された中央値は次のように与えられます。
1 つの中央値に関して対称な単変量分布の場合、Hodges–Lehmann 推定量は母集団中央値の頑健で非常に効率的な推定量です。非対称分布の場合、Hodges–Lehmann 推定量は母集団擬似中央値の頑健で非常に効率的な推定量です。擬似中央値は対称化された分布の中央値であり、母集団中央値に近い値です。[ 44 ] Hodges–Lehmann 推定量は多変量分布にも一般化されています。[ 45 ]
メディアンフィルタは画像処理における重要なツールであり、グレースケール画像から塩コショウ状のノイズを効果的に除去することができる。
クラスター分析において、k-メディアンクラスタリングアルゴリズムはクラスターを定義する方法を提供する。このアルゴリズムでは、k-平均クラスタリングで使用されるクラスター平均間の距離を最大化するという基準が、クラスター中央値間の距離を最大化するという基準に置き換えられる。
これはロバスト回帰の手法です。このアイデアは1940年にウォルドが提唱したもので、彼は独立変数の値に応じて二変量データを2つに分割することを提案しました。:中央値より小さい値を持つ左半分と、中央値より大きい値を持つ右半分。[ 47 ]彼は従属変数の平均値を取ることを提案した。そして独立左半分と右半分の変数を算出し、これら2点を結ぶ直線の傾きを推定する。そして、その直線をデータセット内の大部分の点に適合するように調整する。
1942年にNairとShrivastavaは同様のアイデアを提案したが、代わりにサンプルを3つの等しい部分に分割してからサブサンプルの平均を計算することを提唱した。[ 48 ] 1951年にBrownとMoodは、平均ではなく2つのサブサンプルの中央値を使用するというアイデアを提案した。[ 49 ] Tukeyはこれらのアイデアを組み合わせて、サンプルを3つの等しいサイズのサブサンプルに分割し、サブサンプルの中央値に基づいて線を推定することを推奨した。[ 50 ]
ガウスが指摘したように、平均値不偏推定量は二乗誤差損失関数に関してリスク(期待損失)を最小化します。ラプラスが指摘したように、中央値不偏推定量は絶対偏差損失関数に関してリスクを最小化します。統計理論、特にロバスト統計学では、他の損失関数も用いられます。
中央値不偏推定量の理論は、1947年にジョージ・W・ブラウンによって復活した。[ 51 ]
1次元パラメータθの推定値は、θが固定されている場合、推定値の分布の中央値がθの値にある場合、中央値不偏であると言われます。つまり、推定値が過小評価する頻度と過大評価する頻度が同じである場合です。この要件は、ほとんどの場合、平均値不偏の要件と同等の性能を発揮し、さらに1対1変換に対して不変であるという性質も持ち合わせています。
— 584ページ
中央値不偏推定量のさらなる特性が報告されている。[ 52 ] [ 53 ] [ 54 ] [ 55 ]
中央値不偏推定量を構築する方法があり、それは最適である(平均不偏推定量の最小分散特性に類似した意味で)。このような構築は、単調尤度関数を持つ確率分布に対して存在する。[ 56 ] [ 57 ]そのような手順の1つは、平均不偏推定量に対するRao-Blackwell手順の類似物である。この手順は、Rao-Blackwell手順よりも小さいクラスの確率分布に対して有効であるが、損失関数のクラスはより大きい。[ 58 ]
古代近東の科学研究者は、要約統計を全く使用せず、代わりに、多様な現象を統合したより広範な理論と最大限の整合性を提供する値を選択していたようである。[ 59 ] 地中海(そして後にヨーロッパ)の学術コミュニティでは、平均値などの統計は基本的に中世および近世初期の発展である。(ヨーロッパ以外の地域における中央値とその前身の歴史は、比較的未研究のままである。)
中央値の概念は、異なる評価を公平に分析するために、 6 世紀のタルムードに現れた。[ 60 ] [ 61 ] しかし、この概念はより広い科学コミュニティには広まらなかった。
現代のメディアンの最も近い祖先は、アル・ビールーニーによって考案されたミッドレンジである[ 62 ]: 31 [ 63 ]。 彼の研究が後世の学者にどのように伝わったかは不明である。彼はこの手法を貨幣金属の分析に応用したが、彼の研究が発表された後も、ほとんどの分析者は不正行為と見なされないように、結果から最も不利な値を採用した[ 62 ]: 35-8 [ 64 ]。しかし、大航海時代に海上航海が増加したことで、船の航海士は敵対的な海岸線に対して悪天候の中で緯度を決定しようと試みる必要が増え、要約統計への関心が再び高まった。再発見されたか独自に考案されたかはともかく、ミッドレンジはハリオットの「1595年ギアナへのローリー航海のための指示」の中で航海士に推奨されている[ 62 ]: 45-8
中央値の概念は、エドワード・ライトの1599年の著書『航海における特定の誤差』の羅針盤航法に関する章で初めて登場した可能性がある。 [ 65 ]ライトは測定値を捨てることに抵抗があり、中央値(データセットの中間値よりも大きな割合を包含する)の方が正しい可能性が高いと感じていたのかもしれない。しかし、ライトは自身の手法の使用例を示していないため、彼が現代の中央値の概念を記述したことを検証するのは難しい。[ 59 ] [ 63 ] [ b ] 中央値(確率の文脈において)は確かにクリスティアーン・ホイヘンスの書簡に登場したが、保険数理の実践には不適切な統計の例としてであった。[ 59 ]
中央値に関する最も初期の推奨は、ロジャー・ジョセフ・ボスコビッチがL1ノルム、ひいては暗黙のうちに中央値に基づく回帰法を開発した1757年に遡ります。[59] [ 66 ] 1774年、ラプラスはこの要望を 明示し、事後確率密度関数の値の標準推定値として中央値を使用することを提案しました。具体的な基準は、誤差の期待値の大きさを最小化することでした。どこ推定値とは真の値です。この目的のために、ラプラスは1800年代初頭に標本平均と標本中央値の両方の分布を決定しました。[ 28 ] [ 67 ] しかし、10年後、ガウスとルジャンドルは、を最小化する最小二乗法を開発しました。平均値を求めるため、正規分布に基づく最尤推定を参照することでこの推定量の正当性が強く証明されたため、ラプラスの元の提案はほぼ置き換えられた。[ 68 ]
アントワーヌ・オーギュスタン・クールノーは1843年に、確率分布を2つの等しい半分に分割する値として、メディアン(valeur médiane )という用語を初めて使用しました[ 69 ] 。グスタフ・テオドール・フェヒナーは、社会学や心理学の現象でメディアン(Centralwerth )を使用しました[ 70 ]。それ以前は、天文学や関連分野でのみ使用されていました。グスタフ・フェヒナーは、メディアンをデータの正式な分析に普及させましたが、それ以前にはラプラスによって使用されており[ 70 ]、メディアンはFYエッジワースの教科書に登場しました[ 71 ]。フランシス・ゴルトンは1881年にメディアンという用語を使用しましたが[ 72 ] [ 73 ] 、それ以前には1869年にミドル・モスト・バリュー、1880年にメディアンという用語を使用していました[ 74 ] [ 75 ]。
{{cite journal}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)この記事は、 PlanetMathの Median of a distribution の資料を組み込んでおり、Creative Commons Attribution-Share-Alike Licenseの下でライセンスされています。