仮説検定 ケンドール順位係数は、2つの変数が統計的に依存しているかどうかを判断するための統計的仮説検定 において、検定統計量としてよく使用されます。この検定は、 X またはYの分布、あるいは( X , Y )の分布に関するいかなる仮定にも依存しないため、ノンパラメトリックです。
X とY が独立であるという帰無仮説 の下では、τ の標本分布の 期待値 はゼロになります。正確な分布は一般的な分布では特徴づけられませんが、小さな標本の場合は正確に計算できます。大きな標本の場合は、平均がゼロで分散が の正規分布 の近似を使用するのが一般的です。2 ( 2 n + 5 ) / 9 n ( n − 1 ) {\textstyle 2(2n+5)/9n(n-1)} [ 4 ]
定理。 サンプルが独立である場合、分散はτ A \textstyle \tau _{A}} はV 1 r [ τ A ] = 2 ( 2 n + 5 ) / 9 n ( n − 1 ) {\textstyle Var[\tau _{A}]=2(2n+5)/9n(n-1)} 。
漸近正規 性— n → ∞ {\textstyle n\to \infty } 制限、z A = τ A V 1 r [ τ A ] = n C − n D n ( n − 1 ) ( 2 n + 5 ) / 18 {\textstyle z_{A}={\frac {\tau _{A}}{\sqrt {Var[\tau _{A}]}}}={n_{C}-n_{D} \over {\sqrt {n(n-1)(2n+5)/18}}}} 分布は標準正規分布に収束する。
証拠 漸近的に正規分布を持つ統計量のクラス に関する Hoeffding (1948) の結果を使用する。[ 7 ]
標準正規分布の場合 もし( x 1 、 y 1 ) 、 ( x 2 、 y 2 ) 、 。 。 。 、 ( x n 、 y n ) {\textstyle (x_{1},y_{1}),(x_{2},y_{2}),...,(x_{n},y_{n})} これらは、既知のピアソン相関係数 を持つ同一の同時正規分布からの独立かつ同一の分布のサンプルである。r {\textstyle r} すると、ケンドール順位相関の期待値は閉形式の公式を持つ。[ 8 ]
この名前は、 PAP Moran [ 10 ] によると、Richard Greiner (1909) [ 9 ] に由来するとされている。
証拠
証明[ 11 ] 以下の量を定義する。
A + := { ( Δ x 、 Δ y ) : Δ x Δ y > 0 } {\textstyle A^{+}:=\{(\Delta x,\Delta y):\Delta x\Delta y>0\}} Δ 私 、 j := ( x 私 − x j 、 y 私 − y j ) {\textstyle \Delta _{i,j}:=(x_{i}-x_{j},y_{i}-y_{j})} はポイントですR 2 {\textstyle \mathbb {R} ^{2}} 。表記では、一致するペアの数、n C {\textstyle n_{C}} 、は、Δ 私 、 j {\textstyle \Delta _{i,j}} サブセットに含まれるものA + {\textstyle A^{+}} つまり、n C = ∑ 1 ≤ 私 < j ≤ n 1 Δ 私 、 j ∈ A + {\textstyle n_{C}=\sum _{1\leq i<j\leq n}1_{\Delta _{i,j}\in A^{+}}} 。
したがって、E [ τ A ] = 4 n ( n − 1 ) E [ n C ] − 1 = 4 n ( n − 1 ) ∑ 1 ≤ 私 < j ≤ n P r ( Δ 私 、 j ∈ A + ) − 1 {\displaystyle E[\tau _{A}]={\frac {4}{n(n-1)}}E[n_{C}]-1={\frac {4}{n(n-1)}}\sum _{1\leq i<j\leq n}Pr(\Delta _{i,j}\in A^{+})-1}
それぞれが( x 私 、 y 私 ) {\textstyle (x_{i},y_{i})} は独立同分布の同時正規分布のサンプルであり、ペアリングは関係ないので、総和の各項は完全に同じなので、E [ τ A ] = 2 P r ( Δ 1 、 2 ∈ A + ) − 1 {\displaystyle E[\tau _{A}]=2Pr(\Delta _{1,2}\in A^{+})-1} あとは確率を計算するだけです。これはアフィン変換を繰り返し行うことで行います。
まず正規化するX 、 Y {\textstyle X,Y} 平均値を引いて標準偏差で割ることによって、τ A {\textstyle \tau _{A}} これにより、[ x y ] = [ 1 r r 1 ] 1 / 2 [ z w ] {\displaystyle {\begin{bmatrix}x\\y\end{bmatrix}}={\begin{bmatrix}1&r\\r&1\end{bmatrix}}^{1/2}{\begin{bmatrix}z\\w\end{bmatrix}}} どこ( Z 、 W ) {\textstyle (Z,W)} は標準正規分布からサンプリングされる。R 2 {\textstyle \mathbb {R} ^{2}} 。
したがって、Δ 1 、 2 = 2 [ 1 r r 1 ] 1 / 2 [ ( z 1 − z 2 ) / 2 ( w 1 − w 2 ) / 2 ] {\displaystyle \Delta _{1,2}={\sqrt {2}}{\begin{bmatrix}1&r\\r&1\end{bmatrix}}^{1/2}{\begin{bmatrix}(z_{1}-z_{2})/{\sqrt {2}}\\(w_{1}-w_{2})/{\sqrt {2}}\end{bmatrix}}} ベクトル[ ( z 1 − z 2 ) / 2 ( w 1 − w 2 ) / 2 ] {\textstyle {\begin{bmatrix}(z_{1}-z_{2})/{\sqrt {2}}\\(w_{1}-w_{2})/{\sqrt {2}}\end{bmatrix}}} は依然として標準正規分布に従って分布している。R 2 {\textstyle \mathbb {R} ^{2}} 残りは、退屈で面白みのない行列のべき乗計算と三角関数計算ですが、これらは省略できます。
したがって、Δ 1 、 2 ∈ A + {\textstyle \Delta _{1,2}\in A^{+}} もし[ ( z 1 − z 2 ) / 2 ( w 1 − w 2 ) / 2 ] ∈ 1 2 [ 1 r r 1 ] − 1 / 2 A + = 1 2 2 [ 1 1 + r + 1 1 − r 1 1 + r − 1 1 − r 1 1 + r − 1 1 − r 1 1 + r + 1 1 − r ] A + {\displaystyle {\begin{bmatrix}(z_{1}-z_{2})/{\sqrt {2}}\\(w_{1}-w_{2})/{\sqrt {2}}\end{bmatrix}}\in {\frac {1}{\sqrt {2}}}{\begin{bmatrix}1&r\\r&1\end{bmatrix}}^{-1/2}A^{+}={\frac {1}{2{\sqrt {2}}}}{\begin{bmatrix}{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}}&{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}}\\{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}}&{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}}\end{bmatrix}}A^{+}} 右側の部分集合は、2つの象限を「圧縮」したものです。標準正規分布は回転対称であるため、圧縮された各象限がなす角度を計算するだけで済みます。
第1象限は、2つの光線によって囲まれた扇形である。( 1 、 0 ) 、 ( 0 、 1 ) {\textstyle (1,0),(0,1)} 2本の光線で囲まれた扇形に変換される。( 1 1 + r + 1 1 − r 、 1 1 + r − 1 1 − r ) {\textstyle ({\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}},{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}})} そして( 1 1 + r − 1 1 − r 、 1 1 + r + 1 1 − r ) {\textstyle ({\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}},{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}})} それぞれが角度をなすθ {\textstyle \theta } 水平軸と垂直軸で、θ = アークタン 1 1 + r − 1 1 − r 1 1 + r + 1 1 − r {\displaystyle \theta =\arctan {\frac {{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}}}{{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}}}}}
変換された 2 つの象限を合わせると、π + 4 θ {\textstyle \pi +4\theta } 、 それでP r ( Δ 1 、 2 ∈ A + ) = π + 4 θ 2 π {\displaystyle Pr(\Delta _{1,2}\in A^{+})={\frac {\pi +4\theta }{2\pi }}} そのため 罪 ( π 2 E [ τ A ] ) = 罪 ( 2 θ ) = r {\displaystyle \sin {\left({\frac {\pi }{2}}E[\tau _{A}]\right)}=\sin(2\theta )=r}
同点の場合の会計処理 ペア{ ( x 私 、 y 私 ) 、 ( x j 、 y j ) } {\displaystyle \{(x_{i},y_{i}),(x_{j},y_{j})\}} は、以下の場合に限り同点 であると言われます。x 私 = x j {\displaystyle x_{i}=x_{j}} またはy 私 = y j {\displaystyle y_{i}=y_{j}} ; 同点ペアは一致も不一致もしません。データに同点ペアが発生した場合、係数を[−1, 1]の範囲内に収めるために、いくつかの方法で係数を修正することができます。
タウア 1938年にケンドールによって定義されたタウ統計量[ 1 ] は、後にタウαと改名されました。これは、同順位を考慮しない2つの量的変数または順序 変数の正または負の相関の強さを表します。定義は次のとおりです。
τ A = n c − n d n 0 {\displaystyle \tau _{A}={\frac {n_{c}-n_{d}}{n_{0}}}} ここで、n c 、n d 、n 0 は次のセクションで定義される。
同点の場合、n c + n d < n 0 {\displaystyle n_{c}+n_{d}<n_{0}} また、係数は+1または-1になることは決してありません。2つの変数が完全に等しい場合(X=Y)でも、Tau-aは1未満になります。
タウb Tau-b統計量は、Tau-aとは異なり、同順位を考慮した調整を行います。このTau-bは、1945年にKendallによってTau-w [ 12 ] という名前で初めて記述され、同順位を支持する元のTau統計量の拡張として用いられました。Tau-bの値は、-1(100%の負の相関、つまり完全な不一致)から+1(100%の正の相関、つまり完全な一致)までです。相関がない場合、Tau-bはゼロになります。
ケンドールのタウb係数は次のように定義されます 。
τ B = n c − n d ( n 0 − n 1 ) ( n 0 − n 2 ) {\displaystyle \tau _{B}={\frac {n_{c}-n_{d}}{\sqrt {(n_{0}-n_{1})(n_{0}-n_{2})}}}} どこ
n 0 = n ( n − 1 ) / 2 n 1 = ∑ 私 t 私 ( t 私 − 1 ) / 2 n 2 = ∑ j u j ( u j − 1 ) / 2 n c = 一致するペアの数、つまり、 0 < 私 < j < n どこ x 私 < x j そして y 私 < y j または x 私 > x j そして y 私 > y j n d = 不一致ペアの数、つまり、 0 < 私 < j < n どこ x 私 < x j そして y 私 > y j または x 私 > x j そして y 私 < y j t 私 = 同点値の数 私 th Xの経験的分布における同点群 u j = 同点値の数 j th Yの経験的分布における同点群 {\displaystyle {\begin{aligned}n_{0}&=n(n-1)/2\\n_{1}&=\sum _{i}t_{i}(t_{i}-1)/2\\n_{2}&=\sum _{j}u_{j}(u_{j}-1)/2\\n_{c}&={\text{Number of concordant pairs, i.e. pairs with }}0<i<j<n{\text{ where }}x_{i}<x_{j}{\text{ and }}y_{i}<y_{j}{\text{ or }}x_{i}>x_{j}{\text{ and }}y_{i}>y_{j}\\n_{d}&={\text{Number of discordant pairs, i.e. pairs where }}0<i<j<n{\text{ where }}x_{i}<x_{j}{\text{ and }}y_{i}>y_{j}{\text{ or }}x_{i}>x_{j}{\text{ and }}y_{i}<y_{j}\\t_{i}&={\text{Number of tied values in the }}i^{\text{th}}{\text{ group of ties for the empirical distribution of X}}\\u_{j}&={\text{Number of tied values in the }}j^{\text{th}}{\text{ group of ties for the empirical distribution of Y}}\end{aligned}}} BASICで開発された単純なアルゴリズムは、別の式を使用してタウb係数を計算します。[ 13 ]
SPSSなどの一部の統計パッケージでは、計算効率のために、通常の2倍の数の一致ペアと不一致ペアを使用する代替式が使用されていることに注意してください。[ 14 ]
タウC Tau-c(Stuart-Kendall Tau-cとも呼ばれる)[ 15 ] は、1953年にStuartによって初めて定義されました。[ 16 ] Tau-bとは異なり、Tau-cは非正方形(つまり長方形)分割表 の場合、 +1または-1に等しくなります。[ 15 ] [ 16 ] つまり、両方の変数の基礎となる尺度が異なる数の可能な値を持つ場合です。たとえば、変数Xが0から100の間で連続一様分布を持ち、YがX ≥ 50の場合は1、X < 50の場合は0となる二値変数である場合、XとYのTau-c統計量は1に等しく、Tau-bは0.707に等しくなります。 Tau-c が 1 に等しい場合、周辺分布を条件とした最良の正の相関として解釈できます。一方、Tau-b が 1 に等しい場合、Y を条件とした X の分布の分散がゼロであり、X を条件とした Y の分布の分散もゼロであるため、f(X)=Y となる全単射関数 f が存在する、完全な正の単調相関として解釈できます。
スチュアート・ケンドールのタウc係数は次のように定義されます。[ 16 ]
τ C = 2 ( n c − n d ) n 2 ( m − 1 ) m = τ A n − 1 n m m − 1 {\displaystyle \tau _{C}={\frac {2(n_{c}-n_{d})}{n^{2}{\frac {(m-1)}{m}}}}=\tau _{A}{\frac {n-1}{n}}{\frac {m}{m-1}}} どこ
n c = 一致するペアの数 n d = 不一致ペアの数 r = 分割表の行数(つまり、異なる x 私 ) c = 分割表の列数(つまり、異なる y 私 ) m = ミニ ( r 、 c ) {\displaystyle {\begin{aligned}n_{c}&={\text{Number of concordant pairs}}\\n_{d}&={\text{Number of discordant pairs}}\\r&={\text{Number of rows of the contingency table (i.e. number of distinct }}x_{i}{\text{)}}\\c&={\text{Number of columns of the contingency table (i.e. number of distinct }}y_{i}{\text{)}}\\m&=\min(r,c)\end{aligned}}}
ストリームからケンドールの順位相関係数を近似する 標準推定量に従ってケンドール順位相関係数を計算するための効率的なアルゴリズムは、O ( n ⋅ ログ n ) {\displaystyle O(n\cdot \log {n})} 時間計算量。しかし、これらのアルゴリズムは観測ランクを決定するためにすべてのデータが利用可能であることを必要とするため、観測が段階的に明らかになる逐次データ設定では課題となる。幸いなことに、逐次設定でケンドールの順位相関係数を推定するアルゴリズムが存在する。[ 19 ] [ 20 ] これらのアルゴリズムはO ( 1 ) {\displaystyle O(1)} 更新時間と空間の複雑さは、観測数に応じて効率的にスケーリングされます。したがって、バッチを処理する場合、n {\displaystyle n} 観測結果によると、時間計算量はO ( n ) {\displaystyle O(n)} 空間計算量は一定のままであるO ( 1 ) {\displaystyle O(1)} 。
最初のアルゴリズム[ 19 ] は、確率変数の同時分布を粗くすることに基づくケンドール順位相関係数の近似値を示しています。非定常データは、移動ウィンドウ方式で処理されます。このアルゴリズム[ 19 ] はシンプルで、離散確率変数と連続確率変数を修正せずに処理できます。
2 番目のアルゴリズム[ 20 ] はエルミート級数推定器に基づいており、正確なケンドール順位相関係数、すなわち二変量観測値のペアの一致確率から不一致確率を引いた値の代替推定器を利用します。この代替推定器は、標準推定器の近似としても機能します。このアルゴリズム[ 20 ]は連続確率変数にのみ適用可能ですが、最初に説明したアルゴリズム [ 19 ] と比較して優れた精度と潜在的な速度向上を示しており、スライディングウィンドウに頼らずに非定常データを処理できる機能も備えています。エルミート級数に基づくアプローチの効率的な実装は、R パッケージhermiterパッケージに含まれています。[ 20 ]
ソフトウェア実装 R はテストを実装していますτ B {\displaystyle \tau _{B}} cor.test(x, y, method = "kendall")その「stats」パッケージで(これもcor(x, y, method = "kendall")機能しますが、後者はp値を返しません)。係数の3つのバージョンすべてが信頼区間とともに「DescTools」パッケージで利用可能ですKendallTauA(x,y,conf.level=0.95)。τ A {\displaystyle \tau _{A}} 、KendallTauB(x,y,conf.level=0.95)のためにτ B {\displaystyle \tau _{B}} 、StuartTauC(x,y,conf.level=0.95)のためにτ C {\displaystyle \tau _{C}} ケンドール順位相関係数の高速バッチ推定と逐次推定は、hermiterパッケージで提供されています。[ 20 ] Python の場合、SciPy ライブラリは、τ B {\displaystyle \tau _{B}} でscipy.stats.kendalltauStata では、として実装されています。ktau varlist
参考文献 1 2 Kendall, MG (1938). "順位相関の新しい尺度". Biometrika . 30 ( 1–2 ): 81–89 . doi : 10.1093/biomet/30.1-2.81 . JSTOR 2332226 . ↑ Kruskal, WH (1958). "順序尺度による関連性". Journal of the American Statistical Association . 53 (284): 814– 861. doi : 10.2307/2281954 . JSTOR 2281954 . MR 0100941 . ↑ Nelsen, RB (2001) [1994]、 「ケンドールのタウ計量」 、 数学百科事典 、 EMS Press ↑ プロホロフ、AV(2001)[1994]、 「ケンドールの順位相関係数」 、 数学百科事典 、 EMS Press ↑ Valz, Paul D.; McLeod, A. Ian (1990 年 2 月) 「ケンドールの順位相関係数の分散の簡略化された導出」 . The American Statistician . 44 (1): 39– 40. doi : 10.1080/00031305.1990.10475691 . ISSN 0003-1305 . ↑ Valz, Paul D.; McLeod, A. Ian; Thompson, Mary E. (1995 年 2 月). "同順位のケンドールのスコアに対する累積生成関数と裾確率近似" . The Annals of Statistics . 23 (1): 144– 160. doi : 10.1214/aos/1176324460 . ISSN 0090-5364 . ↑ Hoeffding, Wassily (1992), "漸近的に正規分布に従う統計量のクラス" , Kotz, Samuel; Johnson, Norman L. (編), Breakthroughs in Statistics: Foundations and Basic Theory , Springer Series in Statistics, New York, NY: Springer, pp. 308–334 , doi : 10.1007/978-1-4612-0919-5_20 , ISBN 978-1-4612-0919-5 2024年1月19日 取得↑ Kendall, MG (1949). "順位と積率相関" . Biometrika . 36 (1/2): 177– 193. doi : 10.2307/2332540 . ISSN 0006-3444 . JSTOR 2332540 . PMID 18132091 . ↑ Richard Greiner、(1909)、 Ueber das Fehlersystem der Kollektiv-maßlehre 、Zeitschrift für Mathematik und Physik、Band 57、BG Teubner、ライプツィヒ、121-158、225-260、337-373。 ↑ Moran, PAP (1948). "順位相関と積率相関" . Biometrika . 35 (1/2): 203– 206. doi : 10.2307/2332641 . ISSN 0006-3444 . JSTOR 2332641 . PMID 18867425 . ↑ Berger, Daniel (2016). "A Proof of Greiner's Equality" . SSRN Electronic Journal . doi : 10.2139/ssrn.2830471 . ISSN 1556-5068 . ↑ Kendall, MG (1945). "ランキング問題における同順位の処理 1" . Biometrika . 33 (3): 239– 251. doi : 10.2307/2332303 . PMID 21006841 . 2024年 11月12日 取得 . ↑ Alfred Brophy (1986). "ケンドールの順位相関係数を計算するためのアルゴリズムとプログラム" (PDF) . Behavior Research Methods, Instruments, & Computers . 18 : 45– 46. doi : 10.3758/BF03200993 . S2CID 62601552 . ↑ IBM (2016). IBM SPSS Statistics 24 アルゴリズム . IBM. p. 168. 2017年 8月31日 取得 。 1 2 Berry, KJ; Johnston, JE; Zahran, S.; Mielke, PW (2009). "順序変数に対する効果量のスチュアートのタウ尺度:いくつかの方法論的考察" . Behavior Research Methods . 41 (4): 1144– 1148. doi : 10.3758/brm.41.4.1144 . PMID 19897822 . 1 2 3 Stuart, A. (1953). "分割表における関連性の強さの推定と比較". Biometrika . 40 ( 1–2 ): 105–110 . doi : 10.2307/2333101 . JSTOR 2333101 . ↑ Valz, Paul D.; McLeod, A. Ian; Thompson, Mary E. (1995 年 2 月). "同順位のケンドールのスコアに対する累積生成関数と裾確率近似" . The Annals of Statistics . 23 (1): 144– 160. doi : 10.1214/aos/1176324460 . ISSN 0090-5364 . ↑ Knight, W. (1966). "グループ化されていないデータでケンドールのタウを計算するためのコンピュータ法". Journal of the American Statistical Association . 61 (314): 436– 439. doi : 10.2307/2282833 . JSTOR 2282833 . 1 2 3 4 Xiao, W. (2019). "センサーデータ分析への応用を伴うノンパラメトリック相関のための新規オンラインアルゴリズム". 2019 IEEE International Conference on Big Data (Big Data) . pp. 404–412 . doi : 10.1109/BigData47090.2019.9006483 . ISBN 978-1-7281-0858-2 . S2CID 211298570 . 1 2 3 4 5 Stephanou, M. および Varughese, M (2023). "Hermiter: 逐次ノンパラメトリック推定のための R パッケージ". Computational Statistics . arXiv : 2111.14091 . doi : 10.1007/s00180-023-01382-0 . S2CID 244715035 . {{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)
さらに読む Abdi, H. (2007). 「ケンドール順位相関係数」(PDF) . Salkind, NJ (編) 『測定と統計の百科事典』 . Thousand Oaks (CA): Sage. Daniel, Wayne W. (1990). 「ケンドールのタウ」 .応用ノンパラメトリック統計学 (第2 版). ボストン:PWS-Kent. pp. 365–377 . ISBN 978-0-534-91976-4 。 ケンドール、モーリス;ギボンズ、ジーン・ディキンソン (1990)[初版1948年]。『順位相関法 』チャールズ・グリフィン・ブック・シリーズ(第5 版)。オックスフォード:オックスフォード大学出版局。ISBN 978-0195208375 。 ボネット、ダグラス G.、ライト、トーマスA. (2000)「ピアソン、ケンドール、スピアマン相関を推定するためのサンプルサイズ要件」Psychometrika.65 ( 1 ) : 23–28.doi : 10.1007 / BF02294183.S2CID 120558581 .
外部リンク 同順位の計算 非常に大規模なデータセットに対してケンドールのタウを計算するためのソフトウェア オンラインソフトウェア:ケンドールのタウ順位相関係数を計算します