順序データは、変数が自然な順序付きカテゴリを持ち、カテゴリ間の距離が不明なカテゴリ統計データタイプです。 [ 1 ] : 2これらのデータは、1946 年にSS Stevensによって記述された4 つの測定レベルの 1 つは順序尺度です。順序尺度は、順位付けがある点で名義尺度と区別されます。[ 2 ]また、基礎となる属性の等間隔の増分を表すカテゴリ幅がない点で、間隔尺度や比率尺度とも異なります。[ 3 ]
順序尺度のよく知られた例として、リッカート尺度があります。リッカート尺度の例は次のとおりです。[ 4 ]: 685
順序尺度のデータの例としては、アンケートによく見られます。たとえば、「あなたの健康状態は悪いですか、普通ですか、良いですか、それとも非常に良いですか?」というアンケートの質問に対して、回答をそれぞれ 1、2、3、4 とコード化することができます。間隔尺度や比率尺度のデータが順序尺度にグループ化されることもあります。たとえば、収入がわかっている個人を $0~$19,999、$20,000~$39,999、$40,000~$59,999、... の収入カテゴリーにグループ化し、それぞれを 1、2、3、4、... とコード化することができます。順序尺度のデータのその他の例としては、社会経済的地位、軍の階級、授業の成績などがあります。[ 5 ]
順序データの分析には、他の質的変数とは異なる分析方法が必要です。これらの方法は、検出力の低下を避けるために、変数の自然な順序を考慮します。[ 1 ]: 88順序データのサンプルの平均を計算することは推奨されません。中央値や最頻値など、他の中心傾向の尺度の方が一般的に適切です。[ 6 ]
スティーブンス(1946)は、順序データではカテゴリ間の距離が等しいという仮定が成り立たないため、順序分布の記述や、平均値と標準偏差に基づく推測統計に平均値と標準偏差を用いることは適切ではないと主張した。代わりに、名義データに適した記述統計(ケース数、最頻値、連関係)に加えて、中央値やパーセンタイルなどの位置尺度を用いるべきであるとした。[ 3 ]: 678ノンパラメトリック法は、特に順位付けされた測定値の分析のために開発されたものなど、順序データを含む推測統計に最も適切な手法として提案されている(例:ケンドールのW、スピアマンの順位相関係数など)。[ 5 ]: 25-28ただし、利用可能な統計的手法の範囲が広いため、いくつかの注意点を守れば、順序データにパラメトリック統計を用いることも許容される可能性がある。[ 7 ] [ 8 ] [ 4 ]: 90
順序データに適した単変量統計量としては、平均値や標準偏差の代わりに、中央値[ 9 ]: 59-61、その他のパーセンタイル(四分位数や十分位数など)[ 9 ]: 71、および四分位偏差[9]:77などが挙げられる。順序データに対する1標本検定には、コルモゴロフ・スミルノフ1標本検定[ 5 ]: 51-55、1標本ラン検定[ 5 ] : 58-64、および変化点検定[ 5 ]: 64-71などがある。
t検定で平均値の差を検定する代わりに、2 つの独立したサンプルからの順序データの分布の差は、マン・ホイットニー検定[ 9 ] : 259–264 、スミルノフ検定[ 9 ] : 253–259、符号順位検定[ 9 ] : 266–269、符号順位検定[ 9 ] : 269–273 を使用して検定できます。関連するまたは一致する 2 つのサンプルの検定には、符号検定[ 5 ] : 80–87およびウィルコクソン符号順位検定[ 5 ] : 87–95が含まれます。独立サンプルANOVAの代わりに、順序データを使用して、順位による分散分析[ 9 ] : 367–369および順序付き代替案の Jonckheere 検定[ 5 ] : 216–222 を実施できます。 2つ以上の関連サンプルに対する検定には、順位によるフリードマンの2要因分散分析[ 5 ] : 174–183と、順序付き対立仮説に対するページ検定[ 5 ] : 184–188が含まれます。2つの順序尺度変数に適した相関尺度には、ケンドールのタウ[ 9 ] : 436–439、ガンマ[ 9 ] : 442–443、rs [ 9 ] : 434–436 、およびd yx /d xy [ 9 ] : 443が含まれます。
順序データは量的変数とみなすことができます。ロジスティック回帰では、方程式は次のようになります。
はモデルであり、c はカテゴリ尺度の割り当てられたレベルを取ります。[ 1 ] : 189回帰分析では、順序変数である結果 (従属変数) は、順序ロジットや順序プロビットなどの順序回帰の変種を使用して予測できます。
多重回帰分析/相関分析では、順序データはべき多項式を使用したり、スコアと順位を正規化したりすることで対応できます。[ 10 ]
線形トレンドは、順序データと他のカテゴリ変数との関連性を見つけるためにも使用され、通常は分割表で表されます。変数間の相関係数rは、 -1から1の間にあります。トレンドを検定するには、次の検定統計量を使用します。
nはサンプルサイズである。 [ 1 ]: 87
R は次のようにして見つけることができます行スコアとを列スコアとする。行スコアの平均である一方。 それからは周辺行確率であり、は周辺列確率です。Rは次のように計算されます。
順序データに対しても分類方法が開発されている。データは、各観測値が互いに類似するように異なるカテゴリに分割される。各グループで分散が測定され、最小化されて分類結果が最大化される。分散関数は情報理論で使用される。[ 11 ]
順序データの構造を記述するために使用できるモデルはいくつかあります。[ 12 ]以下では、4つの主要なモデルクラスについて説明します。各クラスは確率変数に対して定義されています。レベルは、。
以下のモデル定義では、そして同じデータセットに対するすべてのモデルで同じになるわけではありませんが、この表記法は異なるモデルの構造を比較するために使用されます。
順序データに最も一般的に使用されるモデルは比例オッズモデルであり、次のように定義されます。
パラメータ順序データの基本分布を記述する。は共変量であり、これらは共変量の影響を表す係数です。
このモデルは、以下の方法で定義することで一般化できます。の代わりにこれにより、このモデルは名義尺度データ(カテゴリ間に自然な順序がないデータ)だけでなく、順序尺度データにも適したものとなる。しかし、このような一般化は、モデルをデータに適合させることをはるかに困難にする可能性がある。
ベースラインカテゴリモデルは次のように定義されます。
このモデルはカテゴリに順序付けを課さないため、名義データにも順序データにも適用できる。
順序付けられたステレオタイプモデルは次のように定義される。
ここで、スコアパラメータは次のように制約される。。
これは、ベースラインのカテゴリロジットモデルよりも簡潔で、より専門的なモデルです。に似ていると考えることができる。
順序付けされていないステレオタイプモデルは、順序付けされたステレオタイプモデルと同じ形式ですが、順序付けが課されていません。このモデルは名義データに適用できます。
適合スコアに注意してください。異なるレベルを区別するのがいかに簡単かを示します。 もしつまり、共変量の現在のデータセットはレベルを区別するための情報はあまり提供されていないそしてしかし、それは必ずしも実際の値を意味するものではないそしてそれらは大きく離れています。また、共変量の値が変化すると、その新しいデータに対する適合スコアはそしてそうなると、かなり離れているかもしれない。
隣接カテゴリモデルは次のように定義されます。
最も一般的な形式は、Agresti (2010) [ 12 ]で「比例オッズ形式」と呼ばれ、次のように定義される。
このモデルは順序データにのみ適用可能です。なぜなら、あるカテゴリから次のカテゴリへの移行確率をモデル化するということは、それらのカテゴリ間に順序が存在することを前提としているからです。
隣接カテゴリロジットモデルは、ベースラインカテゴリロジットモデルの特殊なケースと考えることができます。隣接カテゴリロジットモデルは、順序付きステレオタイプモデルの特殊なケースと考えることもできます。つまり、データに基づいて推定するのではなく、事前に定義される。
比例オッズモデルは、他の3つのモデルとは構造が大きく異なり、また根底にある意味も異なります。比例オッズモデルにおける参照カテゴリのサイズは、、 以来と比較される一方、他のモデルでは参照カテゴリのサイズは固定されたままで、と比較されるまたは。
すべてのモデルには、プロビットリンク関数や相補対数対数リンク関数など、異なるリンク関数を使用するバリエーションが存在する。
順序尺度データの違いは、順位検定を用いて検定することができる。
順序データは、さまざまな方法で視覚化できます。一般的な視覚化方法としては、棒グラフや円グラフがあります。表も、順序データと頻度を表示するのに役立ちます。モザイクプロットは、順序変数と名義変数または順序変数の関係を示すために使用できます。[ 13 ]バンプチャート(ある時点から次の時点までの項目の相対的な順位を示す折れ線グラフ)も、順序データに適しています。[ 14 ]
色の濃淡やグレースケールのグラデーションは、データの順序性を表すために使用できます。所得範囲などの一方向の尺度は、棒グラフで表すことができ、単一の色の彩度や明度の増加(または減少)は、所得が高い(または低い)ことを示します。リッカート尺度などの双方向尺度で測定された変数の順序分布も、積み上げ棒グラフで色を使って示すことができます。中間点(ゼロまたは中立)には中立色(白または灰色)を使用し、中間点から反対方向には対照的な色を使用し、色の彩度や暗さの増加は、中間点からの距離が大きくなるカテゴリを示すことができます。[ 15 ]コロプレスマップも、順序データを表示するために色やグレースケールの陰影を使用します。[ 16 ]
順序尺度データの使用は、カテゴリカルデータが生成されるほとんどの研究分野で見られます。順序尺度データが頻繁に収集される場面としては、社会科学や行動科学、政府機関や企業などがあり、これらの分野では観察、テスト、アンケートなどによって個人から測定値が収集されます。順序尺度データの収集における一般的な文脈としては、調査研究[ 17 ] [ 18 ] 、知能、適性、性格検査、意思決定[ 2 ] [ 4 ] : 89-90などが挙げられます。
順序データを用いた「効果量」(クリフのデルタd)の計算は、統計的優位性の尺度として推奨されている。[ 19 ]
{{cite book}}: CS1メンテナンス: 場所 (リンク)