


統計学において、スピアマンの順位相関係数またはスピアマンρは、チャールズ・スピアマン[1]にちなんで名付けられ、ギリシャ文字のロー(rho)またはと表記されることが多く、順位相関( 2つの変数の順位間の統計的依存関係)を測るノンパラメトリックな指標です。単調関数を使用して、2つの変数の関係をどの程度適切に記述できるかを評価します。
2 つの変数間のスピアマン相関は、その 2 つの変数の順位値間のピアソン相関と同じです。ピアソンの相関は線形関係を評価しますが、スピアマンの相関は単調関係 (線形かどうかに関係なく) を評価します。重複するデータ値がない場合、各変数が他の変数の完全な単調関数である場合、完全なスピアマン相関は +1 または -1 になります。
直感的には、2 つの変数間のスピアマン相関は、2 つの変数間で観測値の順位(つまり、変数内の観測値の相対的な位置ラベル:1 番目、2 番目、3 番目など)が類似している(または相関が 1 の場合は同一)場合は高くなります。また、2 つの変数間で観測値の順位が類似していない(または相関が -1 の場合は完全に反対)場合は低くなります。
スピアマンの係数は連続変数と離散順序変数の両方に適しています。[2] [3]スピアマンとケンドールの相関係数はどちらも、より一般的な相関係数の特殊なケースとして定式化できます。
アプリケーション
この係数は、テキスト文書の類似性を判断するときのように、データがモデルにどの程度適合しているかを判断するために使用できます。[ 4 ] [5]
定義と計算
スピアマン相関係数は、順位変数間のピアソン相関係数として定義される。[6]
サンプルサイズに対して、生のスコアのペアは順位に変換され、次のように計算されます。
どこ
- は従来のピアソン相関係数演算子を表すが、順位変数に適用すると、
- 順位変数の共分散である。
- およびはランク変数の標準偏差です。
すべての順位が異なる整数(同点なし)の場合のみ、一般的な公式を使用して計算できます。
どこ
- 各観測値の2つの順位の差である。
- 観測数です。
対応する順位ペアを持つ2変量サンプルを考えてみましょう。 この場合、スピアマン相関係数は
いつものように、
そして
各サンプル内に同点がないと仮定すれば、 は純粋に で表現できること を示します。
この仮定の下では 、は一様分布する離散確率変数のように分布する確率変数として見ることができる 。 したがって 、
そしてこうして
(これらの合計は、三角数と四角錐数の公式、または暗算の基本的な合計結果を使用して計算できます。)
観察してみましょう
これらをまとめると、
同一の値には通常[7]昇順での位置の平均に等しい 分数順位が割り当てられ、これはすべての可能な順列を平均することと同等です。
データ セットに同点がある場合、上記の簡略化された式では誤った結果が生成されます。両方の変数のすべてのランクが異なる場合にのみ、(偏りのある分散に従って計算されます) となります。最初の式 (標準偏差による正規化) は、変換と線形スケーリングの両方の影響を受けないため、ランクが [0, 1] (「相対ランク」) に正規化されている場合でも使用できます。
簡略化された方法は、データセットが切り捨てられている場合にも使用すべきではない。つまり、上位X件のレコード(変更前順位、変更後順位、またはその両方)のスピアマン相関係数が必要な場合、ユーザーは上記のピアソン相関係数式を使用するべきである。[8]
関連数量
観測値のペア間の統計的依存性の程度を定量化する数値的尺度は他にもいくつかあります。最も一般的なのはピアソンの積率相関係数です。これはスピアマンの順位に似た相関方法で、順位間ではなく生の数値間の「線形」関係を測定します。
スピアマン順位相関の別名は「グレード相関」である。[9]この場合、観測値の「ランク」は「グレード」に置き換えられる。連続分布では、観測値のグレードは慣例により常にランクの半分以下であり、したがってこの場合グレード相関とランク相関は同じである。より一般的には、観測値の「グレード」は、観測値で半分の観測調整を行った、与えられた値未満の母集団の割合の推定値に比例する。したがって、これは同順位の扱いの1つに相当する。珍しいが、「グレード相関」という用語は今でも使用されている。[10]
解釈
スピアマン相関の符号は、X (独立変数) とY (従属変数) の関連の方向を示します。X が増加すると Y が増加する傾向がある場合 、スピアマン相関係数は正になります。Xが増加するとYが減少する傾向がある場合、スピアマン相関係数は負になります。スピアマン相関が 0 の場合は、 Xが増加してもYが増加または減少する傾向がないことを示します。スピアマン相関は、XとY が互いの完全な単調関数に近づくにつれて大きくなります。XとY が完全に単調な関係にある場合、スピアマン相関係数は 1 になります。完全な単調増加関係は、データ値 X i 、Y i と X j 、Y j の任意の 2 組について、 X i − X j と Y i − Y j が常に同じ符号を持つことを意味します。完全な単調減少関係は、これらの差が常に反対の符号を持つことを意味します。
スピアマン相関係数は、しばしば「ノンパラメトリック」であると説明されます。これには 2 つの意味があります。まず、XとY が単調関数によって関連付けられている場合、完全なスピアマン相関が生まれます。これに対し、ピアソン相関は、XとY が線形関数によって関連付けられている場合にのみ完全な値を与えます。スピアマン相関がノンパラメトリックであるもう 1 つの意味は、 XとYの結合確率分布の知識 (つまり、パラメータの知識) を必要とせずに、正確な標本分布を取得できることです。
例
この例では、下の表の任意の生データを使用して、ある人のIQと 1 週間にテレビの前で過ごす時間数(架空の値が使用されています) との相関関係を計算します。
まず、 を評価します。そのためには、以下の表に示す手順を使用します。
- 最初の列 ( ) でデータを並べ替えます。新しい列を作成し、ランク付けされた値 1、2、3、...、nを割り当てます。
- 次に、拡張された()データを 2 番目の列()で並べ替えます。4 番目の列を作成し、同様にランク付けされた値 1、2、3、...、nを割り当てます。
- 2 つのランク列 (および)の差を保持するための5 番目の列を作成します。
- 列の二乗の値を保持する最後の列を 1 つ作成します。
見つかったら、それらをfindに追加します。nの値は10です。これらの値は方程式に代入することができます。
与える
これはρ = −29/165 = −0.175757575...と評価され、 p値= 0.627188となります( t分布を使用)。

値がゼロに近いということは、IQ とテレビ視聴時間の間の相関が非常に低いことを示していますが、負の値は、テレビ視聴時間が長いほど IQ が低くなることを示唆しています。元の値が同点の場合は、この式を使用せず、代わりに順位に基づいてピアソン相関係数を計算する必要があります (同点の場合は、上記のように順位が付けられます)。
信頼区間
スピアマンのρの信頼区間は、デ・カルヴァリョとマルケス(2012)のジャックナイフユークリッド尤度法を使って簡単に得ることができる。[11]レベルによる信頼区間は後者の論文で示されたウィルクスの定理に基づいており、次のように与えられる。
ここで、 は自由度 1 のカイ二乗分布の分位数であり、 はジャックナイフ疑似値です。このアプローチは、R パッケージ spearmanCI に実装されています。
重要性の判断
観測されたρの値がゼロと有意に異なるかどうか(r は常に−1 ≤ r ≤ 1 を維持する)をテストする 1 つの方法は、順列検定を使用して、帰無仮説を与えられた場合に観測されたr以上になる確率を計算することです。この方法の利点は、サンプル内の同点データ値の数と、順位相関を計算する際にそれらのデータ値を処理する方法が自動的に考慮されることです。
もう一つのアプローチは、ピアソンの積率相関係数の場合のフィッシャー変換の使用に似ています。つまり、フィッシャー変換を使用して、母集団値ρに関連する信頼区間と仮説検定を実行できます。
F ( r ) がrのフィッシャー変換、サンプルスピアマン順位相関係数、nがサンプルサイズである場合 、
はrのzスコアであり、統計的独立性の帰無仮説(ρ = 0 )の下では標準正規分布にほぼ従う。[12] [13]
有意性検定には、
これは帰無仮説の下では自由度n −2のスチューデントのt分布に近似的に分布する。[14]この結果の正当性は順列の議論に依存している。[15]
スピアマン係数の一般化は、3つ以上の条件があり、それぞれの条件で多数の被験者が観察され、観察結果が特定の順序を持つことが予測される状況で役立ちます。たとえば、多数の被験者にそれぞれ同じタスクで3回の試行が与えられ、試行ごとにパフォーマンスが向上することが予測されます。この状況での条件間の傾向の有意性の検定は、EB Page [16]によって開発され、通常、順序付き代替案のPageの傾向検定と呼ばれています。
スピアマンの対応分析に基づくρ
従来の対応分析は、2 つの名目変数のすべての値にスコアを付ける統計手法です。この方法で、それらの間のピアソン相関係数が最大化されます。
この方法と同等のものとしてグレード対応分析があり、スピアマンのρやケンドールのτを最大化する。[17]
スピアマンの近似値ρ小川から
ストリーミングデータからスピアマンの順位相関係数を近似する方法は、2つあります。[18] [19]最初の方法[18]では、 の結合分布を粗くします。連続値の場合、カットポイントはそれぞれおよびに対して選択され、これらのランダム変数を離散化します。デフォルトのカットポイントは、およびに追加されます。次に、で示されるサイズ のカウント行列が構築され、 は、でインデックス付けされた2次元セルに含まれる観測値の数を格納します。ストリーミングデータの場合、新しい観測値が到着すると、適切な要素が増分されます。次に、線形代数演算を使用して、カウント行列 に基づいてスピアマンの順位相関を計算できます(アルゴリズム 2 [18] )。離散ランダム変数の場合、離散化手順は不要であることに注意してください。この方法は、定常ストリーミングデータと大規模なデータセットに適用できます。スピアマンの順位相関係数が時間の経過とともに変化する可能性がある非定常ストリーミング データの場合、同じ手順を観測の移動ウィンドウに適用できます。移動ウィンドウを使用する場合、メモリ要件は選択したウィンドウ サイズに応じて直線的に増加します。
ストリーミングデータからスピアマンの順位相関係数を近似する2番目のアプローチは、エルミート級数ベースの推定量を使用することです。[19]エルミート多項式に基づくこれらの推定量により、単変量および二変量の場合に確率密度関数と累積分布関数の逐次推定が可能になります。二変量エルミート級数密度推定量と単変量エルミート級数ベースの累積分布関数推定量は、スピアマンの順位相関係数推定量の大規模サンプルバージョンに挿入され、逐次スピアマンの相関推定量を生成します。この推定量は、計算効率を高めるために線形代数演算で表現されます(式(8)とアルゴリズム1および2 [19])。これらのアルゴリズムは連続ランダム変数データにのみ適用できますが、この設定ではカウントマトリックスアプローチよりもいくつかの利点があります。最初の利点は、多数の観測に適用した場合の精度が向上することです。 2 つ目の利点は、移動ウィンドウに依存せずに、非定常ストリームでスピアマンの順位相関係数を計算できることです。代わりに、エルミート級数ベースの推定器は、指数重み付け方式を使用して、ストリーミング データから時間とともに変化するスピアマンの順位相関を追跡します。この方式では、「有効な」移動ウィンドウ サイズに関して一定のメモリ要件があります。これらのエルミート級数ベースのアルゴリズムのソフトウェア実装は[20]存在し、ソフトウェア実装で説明されています。
ソフトウェア実装
- Rの統計基本パッケージは、その "stats" パッケージでテスト cor.test(x, y, method = "spearman") を実装しています (これも
cor(x, y, method = "spearman")機能します。パッケージ spearmanCI は信頼区間を計算します。パッケージ hermiter [20]は、スピアマン相関の高速バッチ推定値と順次推定値 (つまり、新しい観測が組み込まれるとオンライン/増分方式で更新される推定値) を計算します。 - Stata実装: varlist内のすべての変数のすべてのペアワイズ相関係数を計算します。
spearman varlist - MATLAB実装:
[r,p] = corr(x,y,'Type','Spearman')ここでr、はスピアマンの順位相関係数、pはp値、xおよびはyベクトルです。[21] - Python には、スピアマン相関統計のさまざまな実装があります。モジュールの spearmanr 関数
scipy.stats、DataFrame.corr(method='spearman')pandas ライブラリのメソッド、corr(x, y, method='spearman')統計パッケージ pingouin の関数を使用して計算できます。
参照
- ケンドールタウ順位相関係数
- チェビシェフの和不等式、並べ替え不等式(これら 2 つの記事は、スピアマンのρの数学的特性を明らかにする可能性があります 。)
- 距離相関
- ポリコリック相関
参考文献
- ^ Spearman, C. (1904年1月). 「2つの物事の関連性の証明と測定」(PDF) .アメリカ心理学ジャーナル. 15 (1): 72–101. doi :10.2307/1412159. JSTOR 1412159.
- ^ スケールの種類。
- ^ Lehman, Ann (2005). JMP による基本的な単変量および多変量統計: ステップバイステップガイド。Cary, NC: SAS Press。p. 123。ISBN 978-1-59047-576-8。
- ^ 王立地理協会。「スピアマンのランクガイド」(PDF)。
- ^ Nino Arsov、Milan Dukovski、Milan Dukovski、Blagoja Evkoski(2019年11月)。「スピアマンの順位相関係数を用いたテキストデータの類似性の尺度」
- ^ マイヤーズ、ジェローム L.、ウェル、アーノルド D. (2003)。研究デザインと統計分析(第 2 版)。ローレンス エルバウム。pp. 508。ISBN 978-0-8058-4037-7。
- ^ ドッジ、ヤドラ編。 (2010年)。統計の簡潔な百科事典。ニューヨーク州ニューヨーク州: Springer-Verlag。 p. 502.ISBN 978-0-387-31742-7。
- ^ al Jaber、Ahmed Odeh、Elayyan、Haifaa Omar(2018)。高等教育における品質保証と卓越性に向けて。River Publishers。p. 284。ISBN 978-87-93609-54-9。
- ^ Yule, GU; Kendall, MG (1968) [1950].統計理論入門(第14版). Charles Griffin & Co. p. 268.
- ^ Piantadosi, J.; Howlett, P.; Boland, J. (2007). 「最大無秩序コピュラを使用したグレード相関係数のマッチング」Journal of Industrial and Management Optimization . 3 (2): 305–312. doi : 10.3934/jimo.2007.3.305 .
- ^ de Carvalho, M.; Marques, F. (2012). 「スピアマンのローに対するジャックナイフユークリッド尤度ベースの推論」(PDF) . North American Actuarial Journal . 16 (4): 487‒492. doi :10.1080/10920277.2012.10597644. S2CID 55046385.
- ^ Choi, SC (1977). 「従属相関係数の等価性の検定」Biometrika . 64 (3): 645–647. doi :10.1093/biomet/64.3.645.
- ^ Fieller, EC; Hartley, HO; Pearson, ES (1957). 「順位相関係数の検定。I」。Biometrika . 44 ( 3–4): 470–481. CiteSeerX 10.1.1.474.9634 . doi :10.1093/biomet/44.3-4.470.
- ^ Press; Vettering; Teukolsky; Flannery (1992)。C言語による数値計算法: 科学計算の技法(第 2 版)。ケンブリッジ大学出版局。640 ページ。ISBN 9780521437202。
- ^ Kendall, MG; Stuart, A. (1973). 「セクション 31.19、31.21」。統計の高度な理論、第 2 巻: 推論と関係。 グリフィン。ISBN 978-0-85264-215-3。
- ^ Page, EB (1963). 「多重処理に対する順序付けられた仮説: 線形順位の有意性検定」.アメリカ統計学会誌. 58 (301): 216–230. doi :10.2307/2282965. JSTOR 2282965.
- ^ Kowalczyk, T.; Pleszczyńska, E.; Ruland, F., eds. (2004).グレードモデルとデータ分析法、およびデータ母集団の分析への応用。あいまいさとソフトコンピューティングの研究。第 151 巻。ベルリン ハイデルベルク ニューヨーク: Springer Verlag。ISBN 978-3-540-21120-4。
- ^ abc Xiao, W. (2019). 「センサーデータの分析への応用を伴うノンパラメトリック相関の新しいオンラインアルゴリズム」2019 IEEE 国際ビッグデータ会議 (ビッグデータ)。pp. 404–412。doi : 10.1109 / BigData47090.2019.9006483。ISBN 978-1-7281-0858-2. S2CID 211298570。
- ^ abc Stephanou, Michael; Varughese, Melvin (2021年7月). 「エルミート級数推定量を用いたスピアマン順位相関の逐次推定」. Journal of Multivariate Analysis . 186 :104783 . arXiv : 2012.06287 . doi :10.1016/j.jmva.2021.104783. S2CID 235742634.
- ^ ab Stephanou, M. および Varughese, M (2023). 「Hermiter: 逐次ノンパラメトリック推定のための R パッケージ」.計算統計. arXiv : 2111.14091 . doi :10.1007/s00180-023-01382-0. S2CID 244715035.
{{cite journal}}: CS1 maint: multiple names: authors list (link) - ^ 「線形相関または順位相関 - MATLAB corr」。www.mathworks.com。
さらに読む
- Corder, G. W. & Foreman, D. I. (2014). ノンパラメトリック統計: ステップバイステップのアプローチ、Wiley。ISBN 978-1118840313。
- ダニエル、ウェイン W. (1990)。「スピアマン順位相関係数」。応用ノンパラメトリック統計(第 2 版)。ボストン: PWS-Kent。pp. 358–365。ISBN 978-0-534-91976-4。
- スピアマン C. (1904)。「2つの物事の関連性の証明と測定」。アメリカ心理学会誌。15 (1): 72–101。doi :10.2307/1412159。JSTOR 1412159。
- Bonett DG、Wright、TA (2000)。「ピアソン、ケンドール、スピアマン相関のサンプルサイズ要件」Psychometrika . 65 :23–28. doi :10.1007/bf02294183. S2CID 120558581。
{{cite journal}}: CS1 maint: multiple names: authors list (link) - Kendall MG (1970)。順位相関法(第4版)。ロンドン:グリフィン。ISBN 978-0-852-6419-96. OCLC 136868.
- Hollander M.、Wolfe DA (1973)。ノンパラメトリック統計手法。ニューヨーク:Wiley。ISBN 978-0-471-40635-8. OCLC 520735.
- Caruso JC、Cliff N. (1997)。「スピアマンのローの信頼区間の実証的サイズ、カバレッジ、および検出力」。教育および心理測定。57 (4): 637–654。doi : 10.1177 /0013164497057004009。S2CID 120481551 。
外部リンク
- 小規模サンプルにおける有意性のρの臨界値の表
- スピアマンの順位相関係数 - Excel ガイド:王立地理学会が開発した Excel のサンプル データと数式。
