ウィルコクソン符号順位検定は、統計的仮説検定のためのノンパラメトリック順位検定であり、データのサンプルに基づいて母集団の位置を検定するか、2 つの対応のあるサンプルを使用して 2 つの母集団の位置を比較するために使用されます。 [ 1 ] 1 サンプル版は、1 サンプルスチューデントのt検定と同様の目的を果たします。[ 2 ] 2 つの対応のあるサンプルについては、対応のあるスチューデントの t 検定(「対応のあるペアの t 検定」または「従属サンプルの t 検定」とも呼ばれます)のような対応のある差の検定です。ウィルコクソン検定は、対応のある個体間の差の正規分布を仮定できない場合に、t 検定の良い代替手段となります 。代わりに、この差の分布が中心値を中心に対称であるという弱い仮説を仮定し、この中心値がゼロと有意に異なるかどうかを検定することを目的としています。ウィルコクソン検定は、差の大きさを考慮するため、符号検定よりも強力な代替手段ですが、対称性という中程度の強い仮定を必要とします。
この検定は、 2 つの独立したサンプルに対するこの検定と順位和検定の両方を 1 つの論文で提案したFrank Wilcoxon (1892–1965) にちなんで名付けられました。 [ 3 ]この検定は、Sidney Siegel (1956) がノンパラメトリック統計に関する影響力のある教科書で普及させました。 [ 4 ] Siegel は検定統計量にTという記号を使用したため、この検定はWilcoxon T検定と呼ばれることもあります。
符号順位検定には2つのバリエーションがあります。理論的には、1標本検定の方がより基本的です。なぜなら、対応のある標本検定は、データを1標本検定の状況に変換することによって実行されるからです。しかし、符号順位検定の実際の応用例のほとんどは、対応のあるデータから生じます。
ペアサンプル検定の場合、データはサンプルで構成されますサンプル内の各データポイントは、一対の測定値です。最も単純なケースでは、測定値は間隔尺度です。その場合、測定値は実数に変換でき、各数値のペアを置き換えることで、対応のあるサンプル検定は1サンプル検定に変換されます。その違いによって[ 5 ]一般的に、ペア間の差を順位付けできる必要があります。そのためには、データが順序尺度である必要があり、これは順序尺度よりも多くの情報を含みますが、間隔尺度よりは少ない情報を含む可能性のある尺度の一種です。[ 6 ]
1標本検定のデータとは、各観測値が実数である標本のことである。簡単にするために、サンプル内の観測値は絶対値がすべて異なり、観測値がゼロになることはないものとします。(ゼロや同値があると、いくつかの問題が生じます。下記を参照してください。)テストは次のように実行されます。[ 7 ] [ 8 ]
ランクは次のように定義されます。は、そのためにさらに、 :\{1,\dots ,n\}\to \{1,\dots ,n\}} は、、 それからすべての人々のために。
符号付きランク和は他の2つの検定統計量と密接に関連している。正の順位和負のランク和[ 9 ]で定義される なぜならすべてのランクの合計に等しく、これら3つの統計は次のように関連しています。[ 9 ] なぜなら、、 そして同じ情報を含んでいるため、それらのいずれも検定統計量として使用できます。
正のランク和と負のランク和には、検定の理論に役立つ別の解釈があります。ウォルシュ平均を定義してください。である. 次に: [ 10 ]
1標本ウィルコクソン符号順位検定は、データが特定の中心(中央値、平均値、擬似中央値に対応)を持つ対称母集団から得られたものであるかどうかを検定するために使用できます。[ 11 ]母集団の中心がわかっている場合は、データがその中心に関して対称であるかどうかを検定するために使用できます。[ 12 ]
帰無仮説と対立仮説を正式に説明するために、データは分布からの独立かつ同一の分布に従うサンプルで構成されていると仮定する。。 もし対称であると仮定すると、帰無仮説と対立仮説は次のようになります。[ 13 ]
さらに、 それからは中央値ですこの中央値が一意である場合、ウィルコクソン符号順位和検定は中央値の位置の検定になります。[ 14 ]平均がが定義されると、平均は、そしてこの検定は平均値の位置の検定でもある。[ 7 ]
データが独立同分布であるという仮説は弱めることができる。すべての分布が連続的で共通点に関して対称であると仮定する限り、各データポイントは異なる分布から取得される可能性がある。各観測値の条件付き分布が対称である限り、データポイントは独立である必要はありません。[ 15 ]
ペアデータ検定はペア差を取ることから生じるため、その帰無仮説と対立仮説は1標本検定の仮説から導き出すことができる。いずれの場合も、それらは差の挙動に関する主張となる。。
させてペアの同時累積分布とする. もし、そのため対称である帰無仮説と対立仮説は次のとおりです。[ 16 ] [ 17 ]
これらは元のペアの観点からより直接的に表現することもできます: [ 18 ]
交換可能性の帰無仮説は、治療群と対照群を用いたマッチドペア実験から生じる。各ペア内で治療と対照をランダム化することで、観測値は交換可能になる。交換可能な分布の場合、同じ分布を持つしたがって、帰無仮説の下では、分布はゼロに関して対称である。[ 18 ]
実際のデータでは、次のような観測結果が発生することがあります。サンプルでは、ゼロまたはペアに等しいとまた、同点の観測値が存在することもあります。これは、一部の観測値については、、 我々は持っています(1標本の場合)または(ペアサンプルの場合)。これは特に離散データでよく見られます。このような場合、データの順位を一意に決定する方法がないため、上記で定義した検定手順は通常未定義となります。(唯一の例外は、観測値が1つしかない場合です。)(ゼロであり、他のゼロや同点はありません。)このため、検定統計量を修正する必要があります。
ウィルコクソンの原著論文では、ゼロに等しい観測値(または、ペアサンプルの場合は差分)の問題は扱われていませんでした。しかし、後の調査では、サンプルからゼロを取り除くことを推奨しました。[ 19 ]その後、同順位がない限り、結果として得られたデータに標準的な符号付き順位検定を適用できます。これは現在、縮小サンプル手順と呼ばれています。
Pratt [ 20 ]は、縮小サンプル手順が逆説的な挙動につながる可能性があることを指摘した。彼は次の例を挙げている。1 つのサンプル状況で、次の 13 個の観測値があると仮定する。
縮小サンプル手順では、ゼロを除去します。残りのデータには、符号付きランクが割り当てられます。
これは片側p値でしたがって、このサンプルはどの有意水準においても有意に陽性ではない。プラットは、観測値を減らすことでデータがより肯定的に見えるようになることは決してないはずだと主張する。しかし、ゼロの観測値を2未満減らした場合、またはすべての観測値を1未満減らした場合、符号付きランクは次のようになる。
これは片側p値でしたがって、このサンプルはどの有意水準においても有意に陽性と判断されるだろう。パラドックスは、もしの間にあるそしてそして、重要でないサンプルを減らすと、有意に陽性に見えるようになる。
そこでプラットは符号付きランクゼロ手順を提案した。この手順では、標本中の観測値をランク付けする際にゼロが含まれる。しかし、検定統計量からはゼロを除外する、あるいは同等に定義する。プラットは、符号付きランクゼロ手順には縮小サンプル手順にはない望ましい動作がいくつかあることを証明した。[ 21 ]
プラットは、符号付きランクゼロ手順を同順位を解決するための平均ランク手順と組み合わせると、結果として得られる検定は、すべての、そして少なくとも固定定数だけ異なるそして[ 22 ]
符号付きランクゼロ法には、ゼロが発生した場合に検定統計量の帰無分布が変化するため、p値の表が使用できなくなるという欠点がある。
データが等間隔のカテゴリを持つリッカート尺度である場合、符号付きランクゼロ手順は、縮小サンプル手順よりもタイプIエラー率を維持する可能性が高い。[ 23 ]
統計的効率性の観点から、ゼロを扱うための完璧なルールはありません。コノバーは、ウィルコクソン法とプラット法のどちらも一様に優れているわけではないことを示す帰無仮説と対立仮説の例を見つけました。離散的な一様分布と、確率が左から右に線形に増加する分布を比較する場合、プラット法はウィルコクソン法よりも優れています。各ベルヌーイ試行のパラメータがゼロを中心とする二項分布がウィルコクソン法はプラット法よりも優れている。[ 24 ]
データに同順位がない場合、順位は検定統計量を計算するために使用されます。同順位がある場合、順位は定義されません。これを解決するには、主に2つの方法があります。
同順位の処理で最も一般的な手順であり、ウィルコクソンが最初に推奨した手順は、平均順位または中間順位手順と呼ばれます。この手順では、観測値に 1 からnまでの数値を割り当て、2 つの観測値が同じ絶対値を持つ場合に限り、同じ数値が割り当てられます。これらの数値は、これらの数値の集合が等しくないにもかかわらず、慣習的に順位と呼ばれます。(同順位がない場合を除く)。観測値に割り当てられる順位は、同順位を考えられるすべての方法で解消した場合に得られる可能性のある順位の平均です。順位が割り当てられたら、検定統計量は通常と同じ方法で計算されます。[ 25 ] [ 26 ]
例えば、観測値が以下を満たすと仮定します。 この場合、ランク1が割り当てられ、そしてランクが割り当てられる、ランク4が割り当てられ、、、 そしてランクが割り当てられる正式には、絶対値がすべて同じである観測値の集合があると仮定します。、 それ観測値の絶対値は以下そして、観測値の絶対値は以下です絶対値を持つ観測値間の同順位の場合破られた場合、これらの観察結果は順位を占めるだろうを通して平均順位法では、それらに順位が割り当てられます。。
平均順位法では、同順位が存在する場合、帰無分布は異なります。[ 27 ] [ 28 ]平均順位法には、ゼロに対する縮小サンプル法と同様の欠点もあります。平均順位法ではサンプルが有意に正と判断される可能性がありますが、同順位を解消するためにいくつかの値を増やしたり、何らかの方法で同順位を解消したりすると、検定では有意ではないと判断されるサンプルになります。[ 29 ] [ 30 ]ただし、すべての観測値を同じ量だけ増やしても、有意に正の結果を有意でない結果に変えたり、有意でない結果を有意に負の結果に変えたりすることはできません。さらに、観測値が対称的に分布している場合、テストで棄却されない区間を形成する。[ 31 ] [ 32 ]
同順位の処理におけるもう一つの一般的な方法は、タイブレーク手順です。タイブレーク手順では、観測値にセット内で異なる順位が割り当てられます。観測値に割り当てられる順位は、その絶対値とタイブレーク規則によって決まります。標準の順位和検定と同様に、絶対値が小さい観測値には常に低い順位が与えられます。タイブレーク規則は、絶対値が同じ観測値に順位を割り当てるために使用されます。タイブレーク規則の利点の1つは、p値の計算に標準表を使用できることです。[ 33 ]
ランダムなタイブレークは、タイをランダムに解消します。ランダムなタイブレークでは、帰無分布はタイがない場合と同じですが、検定結果はデータだけでなく、追加のランダムな選択にも依存します。可能なランダムな選択にわたって順位を平均すると、平均順位法になります。[ 29 ]また、すべてのランダムな選択にわたって棄却確率を報告することもできます。[ 34 ]ランダムなタイブレークの利点は、いくつかの観測値が増加しても、サンプルが有意に陽性と判断される確率が低下しないことです。[ 35 ]保守的なタイブレークは、帰無仮説を支持する方向にタイを解消します。負の値が片側検定を実行する場合、より重要な傾向があり、同順位の場合は、否定的な観測値には低いランクを、肯定的な観測値には高いランクを割り当てることで決着します。テストで正の値を取ると、重要な場合、同点の場合は逆の方法で決着がつき、絶対値が大きい場合はが重要な場合、タイは解消され、できるだけ小さくする。プラットは、同点が起こりやすい場合、保守的な同点解消手順は「帰無仮説を支持する形で全ての同点を解消することになるので、おそらく検出力は低い」と指摘している。[ 36 ]
平均順位法は、同順位解消法と矛盾する可能性がある。プラットは次の例を挙げている。[ 29 ]観測値が次のようになっていると仮定する。
平均ランク手順では、これらに符号付きランクが割り当てられます。
このサンプルは片側検定で有意に陽性である。一方、同点の場合の決着ルールでは順位が決定されます。
同じ一方的なレベルでこれは重要ではない。
同点の場合の処理方法としては、同点解消の結果を平均化するという方法がもう 2 つあります。平均統計量法では、検定統計量は、同点解消のあらゆる可能な方法について計算され、最終的な統計値は同点解消統計値の平均です。平均確率法では、p値は同点解消のあらゆる可能な方法について計算され、最終的なp値は同点解消p値の平均です。[ 37 ]
p値を計算するには、分布を知る必要があります。帰無仮説の下では、この分布には閉じた公式はありません。[ 38 ]ただし、の値が小さい場合、分布は正確に計算できる。データがゼロに関して対称であるという帰無仮説の下では、各は正である可能性も負である可能性もまったく同じです。したがって、帰無仮説の下では、 は、 を生成する符号の組み合わせの数に等しい。可能な記号の組み合わせの数で割った値これは、正確な分布を計算するために使用できます。帰無仮説の下で。[ 39 ]
分布を計算するすべての可能性を考慮するには計算が必要です合計は、最小のものを除いては扱いが困難ですしかし、分布には効率的な再帰があります。[ 40 ] [ 41 ]定義符号の組み合わせの数これは、 の部分集合の数に等しい。合計すると再帰の基本ケースは次のとおりです。、すべての人々のために、 そしてすべての人々のためにまたは再帰式は この式は、すべての部分集合が真であるためです。つまり、どちらも含まない、その場合、それは の部分集合でもあるまたは、その場合は削除しますサブセットからサブセットを生成するつまり、帰無仮説の下では、確率質量関数は満たす. 機能整数分割関数と密接に関連している。[ 42 ]
もし確率は帰無仮説の下では、サンプル内の観測値、次に同様の再帰を満たす:[ 42 ] 同様の境界条件を持つ。累積分布関数には漸化式もある。[ 42 ]
非常に大きい上記の再帰でさえ遅すぎる。この場合、帰無分布を近似することができる。帰無分布は、、 そして漸近的に平均と分散が正規分布に従う:[ 43 ]
エッジワース展開を使用すると、より良い近似が得られます。4 次エッジワース展開を使用すると、次のことがわかります。[ 44 ] [ 45 ] どこ これらの展開の技術的な基礎はかなり複雑で、従来のエッジワース展開は IID 連続確率変数の和に適用されるのに対し、は、分布が異なる離散確率変数の和です。しかし、最終的な結果として、上記の展開には誤差が生じます。従来の4次エッジワース展開と同様である。[ 44 ]
モーメント生成関数正確な式は次のとおりです。[ 46 ]
ゼロが存在し、符号付きランクゼロ手順が使用される場合、または同順位が存在し、平均ランク手順が使用される場合、帰無分布は変更。キュアトンはこの状況に対する正規近似を導出した。[ 47 ] [ 48 ]元の観測数がそしてゼロの数は. タイ補正は ここで、合計はすべてのサイズにわたるものです。同点観測値の各グループについて。期待値はは依然としてゼロですが、期待値はは もし それから
ウィルコクソン[ 49 ]は、ウィルコクソン順位和統計量を次のように定義した。シーゲル[ 6 ]などの初期の著者はウィルコクソンに従いました。これは両側仮説検定には適していますが、片側検定には使用できません。
1 からnまでのランクを割り当てる代わりに、0 から n までのランクを割り当てることも可能です。これらは修正ランクと呼ばれます。[ 50 ]修正符号付きランク和修正された正ランク和修正負ランク和は、以下のように定義される。、、 そしてただし、通常のランクの代わりに修正されたランクを使用します。2 つの独立した-分布するランダム変数は正であり、次のように推定できます。[ 51 ]連続分布に限定して考える場合、これは最小分散不偏推定量である。[ 52 ]
次の表には、次のペアのデータが含まれています。 :
この表には、差分の値も示されています。、つまり、差分の符号どこは符号関数であり、差の絶対値、すなわちどこは絶対値です。
次に、絶対差の昇順でデータを並べ替えると、次の表が得られます。
コラムは順位を示します。ペア3と9は絶対値が同点であることに注目してください。これらは1位と2位にランク付けされるため、それぞれがこれらの順位の平均値である1.5を得ます。
符号付き順位検定の効果量を計算するには、順位双列相関係数を使用できます。
検定統計量Tが報告されている場合、順位相関 r は、検定統計量Tを合計順位和Sで割った値、つまりr = T / Sとなります。 [ 53 ]上記の例を使用すると、検定統計量はT = 9 です。サンプルサイズ 9 の合計順位和はS = (1 + 2 + 3 + 4 + 5 + 6 + 7 + 8 + 9) = 45 です。したがって、順位相関は 9/45 なので、r = 0.20 となります。
検定統計量Tが報告されている場合、順位相関を計算する同等の方法は、2 つの順位合計の割合の差を使用することです。これは Kerby (2014) の単純差分式です。[ 53 ]現在の例を続けると、サンプルサイズは 9 なので、合計順位合計は 45 です。Tは2 つの順位合計のうち小さい方なので、Tは 3 + 4 + 5 + 6 = 18 です。この情報だけで、残りの順位合計を計算できます。これは合計SからTを引いたもので、この場合は 45 − 18 = 27 です。次に、2 つの順位合計の割合は 27/45 = 60% と 18/45 = 40% です。最後に、順位相関は 2 つの割合の差 (.60 マイナス .40) なので、r = .20 です。
wilcox.test(x,y,paired=TRUE)wilcoxon_test。[p,h] = signrank(x,y)検定結果を示す論理値を返します。結果h = 1は帰無仮説の棄却を示し、h = 0は5%の有意水準で帰無仮説を棄却できなかったことを示します。value(SignedRankTest(x, y))。