
統計学では、サンプルの加重中央値は、50%加重パーセンタイルです。[1] [2] [3]これは、 1888年にF.Y.エッジワースによって初めて提案されました。[4] [5]中央値と同様に、中心傾向の推定値として役立ち、外れ値に対して堅牢です。これにより、たとえばサンプル内のさまざまな精度測定に関連する非均一な統計的重みが考慮されます。
意味
一般的なケース
となる正の重みを持つ異なる順序付き要素に対して、加重中央値は、
- そして
特別なケース
2 つの要素が一般的なケースを満たす要素のセットを考えてみましょう。これは、両方の要素のそれぞれの重みが重みのセットの中点に接しているが、それをカプセル化していない場合に発生します。むしろ、各要素は に等しいパーティションを定義します。これらの要素は、下限加重中央値と上限加重中央値と呼ばれます。これらの条件は次のように満たされます。
下限加重中央値
- そして
加重中央値上限
- そして
理想的には、新しい要素は、上側と下側の加重中央値の平均を使用して作成され、重み 0 が割り当てられます。この方法は、偶数セットの中央値を見つけるのに似ています。このパーティション ポイントの両側の重みの合計が等しいため、新しい要素は真の中央値になります。
アプリケーションによっては、新しいデータを作成することが不可能または賢明でない場合があります。この場合、どの要素がパーティションを最も均等に保つかに基づいて加重中央値を選択する必要があります。これは常に、重みが最も低い加重中央値になります。
上側と下側の加重中央値が等しい場合は、Edgeworth によって最初に提案されたように、下側の加重中央値が一般的に受け入れられます。[6]
プロパティ
2 つのパーティションのそれぞれの重みの合計は、可能な限り等しくする必要があります。
セット内のすべての数値の重みが等しい場合、加重中央値は中央値まで減少します。
例
簡単にするために、各数値にそれぞれ重みが付けられた数値セットを考えてみましょう。中央値は 3 で、重み 0.3 に対応する要素は 4 です。ピボットの各側の重みを合計すると 0.45 と 0.25 になり、各側が可能な限り均等であるという一般条件を満たします。他の重みでは、ピボットの各側の間に大きな差が生じます。
各数字がそれぞれ均一な重みを持つ数値セットについて考えてみましょう。重みが等しいと、加重中央値は中央値に等しくなります。偶数セットなので、この中央値は 2.5 です。下限加重中央値は 2 で、パーティションの合計は 0.25 と 0.5 です。上限加重中央値は 3 で、パーティションの合計は 0.5 と 0.25 です。これらのパーティションはそれぞれ、それぞれの特殊条件と一般条件を満たしています。上限加重中央値と下限加重中央値が存在する場合は、その平均を取って新しいピボットを導入するのが理想的です。これにより、数値セットは、各数字がそれぞれ重みを持つようになります。これにより、合計が両方とも 0.5 になるパーティションが作成されます。重みが等しい任意のサイズのセットで、加重中央値と中央値が同じであることが簡単にわかります。
同様に、各数値にそれぞれ重みがある数値セットについて考えます。下限の加重中央値は 2 で、パーティションの合計は 0.49 と 0.5 です。上限の加重中央値は 3 で、パーティションの合計は 0.5 と 0.25 です。整数または非区間測定を使用する場合は、下限の加重中央値が受け入れられます。これは、下限の加重中央値がペアの重みが低いため、パーティションが最も均等に保たれるためです。ただし、代わりに意味がある場合は、これらの加重中央値の平均を取る方が理想的です。偶然にも、加重中央値と中央値はどちらも 2.5 に等しくなりますが、重みの分布によっては、より大きなセットでは常に当てはまるとは限りません。
アルゴリズム
加重中央値は、数値セットをソートし、合計が総重量の半分になる最小の数値セットを見つけることによって計算できます。このアルゴリズムには時間がかかります。修正された選択アルゴリズムを使用して加重中央値を見つけるより良い方法があります。[1]
// メインの呼び出しは WeightedMedian(a, 1, n) です
// 低い方の中央値を返します
WeightedMedian ( a [ 1 .. n ] , p , r ) // 要素が 1 つの場合の基本ケースif r = p then return a [ p ] // 要素が 2 つの場合の基本ケース// 2 つの候補の重みが等しい場合に平均を返すようにしますif r - p = 1 then if a [ p ] . w == a [ r ] . w return ( a [ p ] + a [ r ]) / 2 if a [ p ] . w > a [ r ] . w return a [ p ] else return a [ r ] // ピボット r の周囲に分割q = partition ( a , p , r ) wl , wg = partの重みの合計( p , q - 1 ) , ( q + 1 , r ) // パーティションがバランスが取れている場合は完了if wlとwg が両方とも< 1 / 2 then return a [ q ] else // 削除したパーティションの量だけピボットの重みを増やすif wl > wg then a [ q ] . w += wg // ピボットを包括的に再帰WeightedMedian ( a , p , q ) else a [ q ] . w += wl WeightedMedian ( a , q , r )
ソフトウェア/ソースコード
- 高速加重中央値アルゴリズムは、Robustats Python パッケージの Python の C 拡張機能に実装されています。
- Rに
matrixStats::weightedMedian()は、、、spatstat::weighted.median()など多くの実装があります。 [7]
参照
参考文献
- ^ ab コーメン、トーマス H.;チャールズ・E・ライザーソン;ロナルド・L・リベスト、スタイン、クリフォード (2001)。アルゴリズムの紹介。 MITプレス。ISBN 9780262032933。
- ^ Horowitz, Ellis; Sahni, Sartaj; Rajasekaran, Sanguthevar (1996-12-15). コンピュータアルゴリズム C++: C++ および疑似コードバージョン。Macmillan. ISBN 9780716783152。
- ^ Bovik, Alan C (2010-07-21). 画像およびビデオ処理ハンドブック. Academic Press. ISBN 9780080533612。
- ^エッジワース、FY (1888)。「いくつ かの量に関する観察を減らす新しい方法について」。哲学雑誌。25 ( 154 ): 184– 191。doi :10.1080/14786448808628170。
- ^ エッジワース、FY (1887)。「いくつかの量に関する観察について」。ヘルマセナ。6 ( 13 )。トリニティ・カレッジ・ダブリン:279–285。JSTOR 23036355 。
- ^ ランゲ、ケネス(2010年6月15日)。統計学者のための数値解析(第2版)。シュプリンガー。p.313。ISBN 978-1-4419-5944-7。
- ^ weighted.median() 関数はありますか?
