統計学において、ランキングとは、データを並べ替える際に数値または順序値を順位に置き換える データ変換のことです。
たとえば、数値データ 3.4、5.1、2.6、7.3 が観測された場合、これらのデータ項目のランクはそれぞれ 2、3、1、4 になります。
別の例として、順序データ hot、cold、warm は 3、1、2 に置き換えられます。これらの例では、ランクは昇順で値に割り当てられますが、降順のランクも使用できます。
ランクは、昇順に並べ替えられた元のデータセットで構成される 順序統計のインデックス付きリストに関連しています。
テストに使用する
いくつかの種類の統計テストでは、順位に基づいた計算を採用しています。例は次のとおりです。
ランクの降順での値の分布は、値のスケールが大きく異なる場合によく関心の対象になります。これは、都市の規模や単語の頻度などのランクサイズ分布(またはランク頻度分布) です。これらは、多くの場合、べき乗法則に従います。
一部のランクでは、同点データ値に対して非整数値を持つ場合があります。たとえば、同じデータ値のコピーが偶数個ある場合、同点データの 小数統計ランクは½ で終わります。パーセンタイル ランクは、別のタイプの統計ランクです。
計算
Microsoft Excel には、競争順位 ("1224") を割り当てるRank.EQ関数と、小数順位 ("1 2.5 2.5 4") を割り当てるRank.AVG関数の 2 つのランキング関数が用意されています。これらの関数には順序引数[1]があり、これは既定で降順に設定されています。つまり、最大の数字が 1 位になります。統計では、ランキングは通常昇順で、最小の数字が 1 位になるので、これは一般的ではありません。
ランキングの比較
順位相関は、同じオブジェクト セットの 2 つのランキングを比較するために使用できます。たとえば、スピアマンの順位相関係数は、 2 つのトーナメントでのアスリートのランキング間の統計的依存関係を測定するのに役立ちます。また、ケンドールの順位相関係数も別のアプローチです。あるいは、交差/オーバーラップ ベースのアプローチでは、柔軟性が高まります。1 つの例は、「ランク - ランク ハイパー幾何オーバーラップ」アプローチです。[2]これは、異なる発現遺伝子の 2 つの順序付きリストの「トップ」にある遺伝子のランキングを比較するように設計されています。同様のアプローチは、「ランク バイアス オーバーラップ (RBO)」でも採用されています。[3]も、調整可能な確率 p を実装して、ランキングの目的の深さで割り当てられる重みをカスタマイズします。これらのアプローチには、分離したセット、異なるサイズのセット、およびトップの重み付け (標準的な重み付けのない順位相関アプローチでは無視される可能性がある絶対的なランキング位置を考慮) に対応できるという利点があります。
意味
をランダム変数の集合とする。それらを順序付けすることで、順序統計を定義する[4]
すべての値が一意である場合、変数番号のランクは方程式 の一意の解です。同点がある場合は、となるすべてのインデックスの平均として定義されるミッドランク(上記の「分数ランク」に対応)を使用するか、 によって定義されるアップランク(「修正された競争ランキング」に対応)を使用します。
参考文献
- ^ 「Excel RANK.AVG ヘルプ」。Officeサポート。Microsoft。2021年1 月 21 日閲覧。
- ^ Plaisier, Seema B.; Taschereau, Richard; Wong, Justin A.; Graeber, Thomas G. (2010 年 9 月). 「Rank-rank 超幾何的重複: 遺伝子発現シグネチャ間の統計的に有意な重複の特定」. Nucleic Acids Research . 38 (17): e169. doi :10.1093/nar/gkq636. PMC 2943622. PMID 20660011 .
- ^ Webber, William; Moffat, Alistair; Zobel, Justin (2010 年11 月)。「不定ランキングの類似度測定」。ACM Transactions on Information Systems。28 ( 4): 1–38。doi : 10.1145 /1852102.1852106。S2CID 16050561 。
- ^ Vaart、AW van der (1998)。漸近統計。ケンブリッジ、英国: Cambridge University Press。ISBN 9780521784504。
