順位を比較する統計
統計学 において 、 順位相関は 、順序関係 、つまり異なる 順序変数の 順位 または同じ変数の異なる順位の関係を 測定するいくつかの統計のいずれかです 。ここで、「順位」とは、特定の変数の異なる観測値に「1 位」、「2 位」、「3 位」などの順序ラベルを割り当てることです。 順位相関係数は、 2 つの順位間の類似度を測定し、それらの関係の 重要性 を評価するために使用できます。たとえば、順位相関を使用する 2 つの一般的な ノンパラメトリック 有意性検定法は、 マン ホイットニー U 検定 と ウィルコクソンの符号順位検定 です。
コンテクスト
たとえば、ある変数が大学バスケットボール プログラムの ID であり、別の変数が大学フットボール プログラムの ID である場合、2 種類のプログラムの投票ランキング間の関係をテストできます。つまり、バスケットボール プログラムのランキングが高い大学は、フットボール プログラムのランキングも高い傾向があるということです。順位相関係数でその関係を測定でき、順位相関係数の有意性の尺度で、測定された関係が偶然である可能性が高いほど小さいかどうかを示すことができます。
変数が 1 つだけ、つまり大学フットボール プログラムのアイデンティティしかないが、それが 2 つの異なる世論調査ランキング (たとえば、1 つはコーチによるランキング、もう 1 つはスポーツ記者によるランキング) の対象になっている場合、2 つの異なる世論調査のランキングの類似性は順位相関係数で測定できます。
別の例として、行変数に 低所得 、 中所得 、 高所得 、列変数に教育水準( 高校 、 高等学校 、 大学など ) を含む 分割表では、 [1] 順位相関は所得と教育水準の関係を測定します。
相関係数
よく使われる順位 相関 統計には次のようなものがある。
スピアマンの ρ
ケンドールの τ
グッドマンとクラスカルの γ
サマーズの D
順位相関係 数の 増加は、順位間の一致の増加を意味します。係数は区間 [-1, 1] 内にあり、次の値をとります。
1 2 つのランキングが完全に一致する場合、2 つのランキングは同じです。
ランキングが完全に独立している場合は 0 です。
2 つのランキングの不一致が完全にある場合、つまり、一方のランキングが他方のランキングの逆である場合は -1 です。
Diaconis (1988) によれば、ランキングは 一連 のオブジェクトの 順列として考えることができます。したがって、観測されたランキングは、標本空間が 対称群 (と同一視される) であるときに取得されるデータとして考えることができます。次に、 メトリック を導入して、対称群を メトリック空間 にすることができます 。異なるメトリックは、異なる順位相関に対応します。
一般相関係数
ケンドール1970 [2]は、 彼の相関係数(タウ)とスピアマンの相関係数 (ロー)が一般相関係数の特殊なケースである
ことを示した。
τ
{\displaystyle \tau}
ρ
{\displaystyle \rho}
と で表される 2 つのプロパティに関連して考慮されているオブジェクト の集合があり 、値の集合 と を形成しているとします 。任意の個体のペア、たとえば -番目と -番目に、 で表される -スコア と で表される -スコア を割り当てます。これらの関数の唯一の要件は、反対称 で あること、つまり およびであることです (特に の 場合はであることに注意してください )。一般化相関係数は次の ように定義されます
。
ん
{\displaystyle n}
x
{\displaystyle x}
ええ
{\displaystyle y}
{
x
私
}
私
≤
ん
{\displaystyle \{x_{i}\}_{i\leq n}}
{
ええ
私
}
私
≤
ん
{\displaystyle \{y_{i}\}_{i\leq n}}
私
{\displaystyle i}
じゅう
{\displaystyle j}
x
{\displaystyle x}
1つの
私
じゅう
{\displaystyle a_{ij}}
ええ
{\displaystyle y}
b
私
じゅう
{\displaystyle b_{ij}}
1つの
私
じゅう
=
−
1つの
じゅう
私
{\displaystyle a_{ij}=-a_{ji}}
b
私
じゅう
=
−
b
じゅう
私
{\displaystyle b_{ij}=-b_{ji}}
1つの
私
じゅう
=
b
私
じゅう
=
0
{\displaystyle a_{ij}=b_{ij}=0}
私
=
じゅう
{\displaystyle i=j}
Γ
{\displaystyle \ガンマ}
Γ
=
∑
私
、
じゅう
=
1
ん
1つの
私
じゅう
b
私
じゅう
∑
私
、
じゅう
=
1
ん
1つの
私
じゅう
2
∑
私
、
じゅう
=
1
ん
b
私
じゅう
2
{\displaystyle \Gamma ={\frac {\sum _{i,j=1}^{n}a_{ij}b_{ij}}{\sqrt {\sum _{i,j=1}^{n }a_{ij}^{2}\sum _{i,j=1}^{n}b_{ij}^{2}}}}}
同様に、すべての係数が行列 と に集められ 、 と で ある場合 、
あ
=
(
1つの
私
じゅう
)
{\displaystyle A=(a_{ij})}
B
=
(
b
私
じゅう
)
{\displaystyle B=(b_{ij})}
あ
T
=
−
あ
{\displaystyle A^{\textsf {T}}=-A}
B
T
=
−
B
{\displaystyle B^{\textsf {T}}=-B}
Γ
=
⟨
A
,
B
⟩
F
‖
A
‖
F
‖
B
‖
F
{\displaystyle \Gamma ={\frac {\langle A,B\rangle _{\rm {F}}}{\|A\|_{\rm {F}}\|B\|_{\rm {F}}}}}
ここで、 は フロベニウスの内積 、 は フロベニウス のノルム です。特に、一般相関係数は、行列 と の間の角度の余弦です 。
⟨
A
,
B
⟩
F
{\displaystyle \langle A,B\rangle _{\rm {F}}}
‖
A
‖
F
=
⟨
A
,
A
⟩
F
{\displaystyle \|A\|_{\rm {F}}={\sqrt {\langle A,A\rangle _{\rm {F}}}}}
A
{\displaystyle A}
B
{\displaystyle B}
ケンドールのτの特別なケース
、がそれぞれ -質と-質 に応じた -メンバー の順位である 場合 、次のように定義できます。
r
i
{\displaystyle r_{i}}
s
i
{\displaystyle s_{i}}
i
{\displaystyle i}
x
{\displaystyle x}
y
{\displaystyle y}
a
i
j
=
sgn
(
r
j
−
r
i
)
,
b
i
j
=
sgn
(
s
j
−
s
i
)
.
{\displaystyle a_{ij}=\operatorname {sgn}(r_{j}-r_{i}),\quad b_{ij}=\operatorname {sgn}(s_{j}-s_{i}).}
合計は、 一致するペアの数と一致しないペアの数を引いたものです( ケンドールのタウ順位相関係数 を参照)。合計は 、 項の数 、つまり です 。したがって、この場合、
∑
a
i
j
b
i
j
{\displaystyle \sum a_{ij}b_{ij}}
∑
a
i
j
2
{\displaystyle \sum a_{ij}^{2}}
n
(
n
−
1
)
/
2
{\displaystyle n(n-1)/2}
a
i
j
{\displaystyle a_{ij}}
∑
b
i
j
2
{\displaystyle \sum b_{ij}^{2}}
Γ
=
2
(
(
number of concordant pairs
)
−
(
number of discordant pairs
)
)
n
(
n
−
1
)
=
Kendall's
τ
{\displaystyle \Gamma ={\frac {2\,(({\text{number of concordant pairs}})-({\text{number of discordant pairs}}))}{n(n-1)}}={\text{Kendall's }}\tau }
スピアマンのρの特別なケース
、がそれぞれ 、および品質 に応じた -メンバー のランクである 場合、 次のように定義される
行列を考えることができる。
r
i
{\displaystyle r_{i}}
s
i
{\displaystyle s_{i}}
i
{\displaystyle i}
x
{\displaystyle x}
y
{\displaystyle y}
a
,
b
∈
M
(
n
×
n
;
R
)
{\displaystyle a,b\in M(n\times n;\mathbb {R} )}
a
i
j
:=
r
j
−
r
i
{\displaystyle a_{ij}:=r_{j}-r_{i}}
b
i
j
:=
s
j
−
s
i
{\displaystyle b_{ij}:=s_{j}-s_{i}}
と の和 は等しい。なぜなら、 と は両方 とも から まで の範囲だからである 。したがって、
∑
a
i
j
2
{\displaystyle \sum a_{ij}^{2}}
∑
b
i
j
2
{\displaystyle \sum b_{ij}^{2}}
r
i
{\displaystyle r_{i}}
s
i
{\displaystyle s_{i}}
1
{\displaystyle 1}
n
{\displaystyle n}
Γ
=
∑
(
r
j
−
r
i
)
(
s
j
−
s
i
)
∑
(
r
j
−
r
i
)
2
{\displaystyle \Gamma ={\frac {\sum (r_{j}-r_{i})(s_{j}-s_{i})}{\sum (r_{j}-r_{i})^{2}}}}
この式を簡略化するために、 が 各 の順位の差を表すものとします 。さらに、が 上の一様分布の離散ランダム変数であるとします。 順位は の単なる順列であるため 、どちらも のように分布するランダム変数と見なすことができます。離散数学の 基本的な 合計結果 を使用すると、一様分布のランダム変数 について、および となり
、
したがって となる
ことが簡単にわかります 。ここで、対称性を観察することで、 の部分を
次のように計算できます。
d
i
:=
r
i
−
s
i
{\displaystyle d_{i}:=r_{i}-s_{i}}
i
{\displaystyle i}
U
{\displaystyle U}
{
1
,
2
,
…
,
n
}
{\displaystyle \{1,2,\ldots ,n\}}
r
,
s
{\displaystyle r,s}
1
,
2
,
…
,
n
{\displaystyle 1,2,\ldots ,n}
U
{\displaystyle U}
U
{\displaystyle U}
E
[
U
]
=
n
+
1
2
{\displaystyle \mathbb {E} [U]=\textstyle {\frac {n+1}{2}}}
E
[
U
2
]
=
(
n
+
1
)
(
2
n
+
1
)
6
{\displaystyle \mathbb {E} [U^{2}]=\textstyle {\frac {(n+1)(2n+1)}{6}}}
V
a
r
(
U
)
=
(
n
+
1
)
(
2
n
+
1
)
6
−
(
n
+
1
)
(
n
+
1
)
4
=
n
2
−
1
12
{\displaystyle \mathrm {Var} (U)=\textstyle {\frac {(n+1)(2n+1)}{6}}-\textstyle {\frac {(n+1)(n+1)}{4}}=\textstyle {\frac {n^{2}-1}{12}}}
Γ
{\displaystyle \Gamma }
1
n
2
∑
i
,
j
=
1
n
(
r
j
−
r
i
)
(
s
j
−
s
i
)
=
2
(
1
n
2
⋅
n
∑
i
=
1
n
r
i
s
i
−
(
1
n
∑
i
=
1
n
r
i
)
(
1
n
∑
j
=
1
n
s
j
)
)
=
1
n
∑
i
=
1
n
(
r
i
2
+
s
i
2
−
d
i
2
)
−
2
(
E
[
U
]
)
2
=
1
n
∑
i
=
1
n
r
i
2
+
1
n
∑
i
=
1
n
s
i
2
−
1
n
∑
i
=
1
n
d
i
2
−
2
(
E
[
U
]
)
2
=
2
(
E
[
U
2
]
−
(
E
[
U
]
)
2
)
−
1
n
∑
i
=
1
n
d
i
2
{\displaystyle {\begin{aligned}{\frac {1}{n^{2}}}\sum _{i,j=1}^{n}(r_{j}-r_{i})(s_{j}-s_{i})&=2\left({\frac {1}{n^{2}}}\cdot n\sum _{i=1}^{n}r_{i}s_{i}-({\frac {1}{n}}\sum _{i=1}^{n}r_{i})({\frac {1}{n}}\sum _{j=1}^{n}s_{j})\right)\\&={\frac {1}{n}}\sum _{i=1}^{n}(r_{i}^{2}+s_{i}^{2}-d_{i}^{2})-2(\mathbb {E} [U])^{2}\\&={\frac {1}{n}}\sum _{i=1}^{n}r_{i}^{2}+{\frac {1}{n}}\sum _{i=1}^{n}s_{i}^{2}-{\frac {1}{n}}\sum _{i=1}^{n}d_{i}^{2}-2(\mathbb {E} [U])^{2}\\&=2(\mathbb {E} [U^{2}]-(\mathbb {E} [U])^{2})-{\frac {1}{n}}\sum _{i=1}^{n}d_{i}^{2}\\\end{aligned}}}
そして
1
n
2
∑
i
,
j
=
1
n
(
r
j
−
r
i
)
2
=
1
n
2
⋅
n
∑
i
,
j
=
1
n
(
r
i
2
+
r
j
2
−
2
r
i
r
j
)
=
2
1
n
∑
i
=
1
n
r
i
2
−
2
(
1
n
∑
i
=
1
n
r
i
)
(
1
n
∑
j
=
1
n
r
j
)
=
2
(
E
[
U
2
]
−
(
E
[
U
]
)
2
)
{\displaystyle {\begin{aligned}{\frac {1}{n^{2}}}\sum _{i,j=1}^{n}(r_{j}-r_{i})^{2}&={\frac {1}{n^{2}}}\cdot n\sum _{i,j=1}^{n}(r_{i}^{2}+r_{j}^{2}-2r_{i}r_{j})\\&=2{\frac {1}{n}}\sum _{i=1}^{n}r_{i}^{2}-2({\frac {1}{n}}\sum _{i=1}^{n}r_{i})({\frac {1}{n}}\sum _{j=1}^{n}r_{j})\\&=2(\mathbb {E} [U^{2}]-(\mathbb {E} [U])^{2})\\\end{aligned}}}
したがって
Γ
=
1
−
∑
i
=
1
n
d
i
2
2
n
V
a
r
(
U
)
=
1
−
6
∑
i
=
1
n
d
i
2
n
(
n
2
−
1
)
{\displaystyle \Gamma =1-{\frac {\sum _{i=1}^{n}d_{i}^{2}}{2n\mathrm {Var} (U)}}=1-{\frac {6\sum _{i=1}^{n}d_{i}^{2}}{n(n^{2}-1)}}}
ここで、順位間の差は、まさに スピアマンの順位相関係数 です 。
d
i
=
r
i
−
s
i
{\displaystyle d_{i}=r_{i}-s_{i}}
ρ
{\displaystyle \rho }
順位双列相関
ジーン・グラス (1965) は、順位双列相関はスピアマンの から導出できると述べています 。「二値変数 X と順位変数 Yで定義される係数を導出することができ、これは、双列相関 r が 2 つの正規変数間のピアソンの r を推定するのと同じ方法で、X と Y 間のスピアマンの rho を推定します 」(p. 91)。順位双列相関は、順位が 2 つのグループにある場合の順位相関の尺度として、9 年前にエドワード・キュアトン (1956) によって導入されていました。
ρ
{\displaystyle \rho }
Dave Kerby (2014) は、ランク相関を学生に紹介するための尺度としてランクバイセリアルを推奨しました。これは、一般的なロジックが入門レベルで説明できるためです。ランクバイセリアルは、 マン・ホイットニー U 検定 で使用される相関であり、大学の統計入門コースでよく取り上げられる方法です。この検定のデータは 2 つのグループで構成され、グループの各メンバーについて、研究全体の結果がランク付けされます。
カービーは、この順位相関は、述べられた仮説を支持するデータの割合と、それを支持しないデータの割合という 2 つの概念で表現できることを示しました。カービーの単純差分式では、順位相関は、好ましい証拠の割合 ( f ) から好ましくない証拠の割合 ( u ) を引いた差として表現できるとされています。
r
=
f
−
u
{\displaystyle r=f-u}
例と解釈
計算を説明すると、コーチが長距離ランナーを 2 つの方法で 1 か月間トレーニングするとします。グループ A には 5 人のランナーがいて、グループ B には 4 人のランナーがいます。述べられている仮説は、方法 A の方が速いランナーを育成するというものです。結果を評価する競争の結果、グループ A のランナーは確かに速く走り、順位は 1、2、3、4、6 であることがわかりました。したがって、グループ B の遅いランナーの順位は 5、7、8、9 です。
分析は、あるグループのメンバーと他のグループのメンバーを比較して定義されるペアで行われます。たとえば、この調査で最も速いランナーは、(1,5)、(1,7)、(1,8)、(1,9) の 4 つのペアのメンバーです。これらの 4 つのペアはすべて仮説を支持します。これは、各ペアでグループ A のランナーがグループ B のランナーよりも速いためです。ペアは全部で 20 あり、19 ペアが仮説を支持しています。仮説を支持しないペアは、ランク 5 と 6 の 2 人のランナーだけです。このペアでは、グループ B のランナーの方が速いタイムを記録したためです。Kerby の単純差分式により、データの 95% (20 ペアのうち 19 ペア) が仮説を支持し、5% (20 ペアのうち 1 ペア) が仮説を支持しないため、順位相関は r = .95 − .05 = .90 となります。
相関の最大値は r = 1 で、これはペアの 100% が仮説を支持していることを意味します。相関 r = 0 は、ペアの半分が仮説を支持し、残りの半分は支持していないことを示します。言い換えると、サンプル グループの順位に差がないため、2 つの異なる母集団から来ているという証拠はありません。効果サイズ r = 0 は、グループ メンバーシップとメンバーの順位の間に関係がないことを示すと言えます。
参考文献
さらに読む
キュアトン、エドワード E. (1956)。「ランク-バイセリアル相関」 。Psychometrika . 21 (3): 287–290. doi :10.1007/BF02289138. S2CID 122500836。
エヴェリット、BS(2002)、 ケンブリッジ統計辞典 、ケンブリッジ:ケンブリッジ大学出版局、 ISBN 0-521-81099-X
Diaconis, P. (1988)、 「確率と統計における群表現」 、講義ノート・モノグラフシリーズ、ヘイワード、カリフォルニア州:数理統計研究所、 ISBN 0-940600-14-5
グラス、ジーン V. (1965)。「双列相関の順位変数類似体:ショートカット項目分析への影響」。 教育 測定ジャーナル 。2 (1): 91–95。doi : 10.1111 /j.1745-3984.1965.tb00396.x。
ケンドール、MG(1970)、 順位相関法 、ロンドン:グリフィン、 ISBN 0-85264-199-0
カービー、デイブS.(2014)。「単純な差分式:ノンパラメトリック相関の 指導 へのアプローチ」。 包括的心理学 。3 (1):11.IT.3.1。doi : 10.2466 / 11.IT.3.1 。
外部リンク
実験心理学者 Karl L. Weunsch による簡単なガイド - ノンパラメトリック効果サイズ (Copyright 2015 by Karl L. Weunsch)