測定レベルまたは測定尺度は、変数に割り当てられた値内の情報の性質を説明する分類です。[ 1 ]心理学者のスタンリー・スミス・スティーブンスは、名義尺度、順序尺度、間隔尺度、比率尺度の 4 つの測定レベルまたは尺度による最もよく知られた分類を開発しました。[ 1 ] [ 2 ]この測定レベルを区別する枠組みは心理学で始まり、その後、一部の分野や学者によって採用および拡張され、他の分野や学者によって批判または拒否されるなど、複雑な歴史をたどってきました。[ 3 ]他の分類には、モステラーとテューキーによるもの[ 4 ]、およびクリスマンによるもの[ 5 ]があります。
スティーブンスは、1946年のサイエンス誌の記事「測定尺度の理論について」で自身の類型論を提唱した。[ 2 ]その記事の中で、スティーブンスは、科学におけるすべての測定は、「名義尺度」、「順序尺度」、「間隔尺度」、「比率尺度」と呼ばれる4種類の尺度を用いて行われ、「質的」(彼の「名義尺度」で説明される)と「量的」(程度は異なるが、彼の他のすべての尺度)の両方を統合していると主張した。尺度タイプの概念は、後に数学心理学者のセオドア・アルパー(1985、1987)、ルイス・ナレンズ(1981a、b)、R・ダンカン・ルース(1986、1987、2001)の研究によって、当初欠けていた数学的な厳密さを獲得した。ルース(1997、p.395 )は次のように書いている。
SS スティーブンス (1946、1951、1975) は、重要なのは間隔尺度または比率尺度を持つことであると主張した。その後の研究はこの主張に意味を与えたが、彼が尺度タイプのアイデアを持ち出そうとしたことを考えると、彼自身がそれを理解していたかどうかは疑わしい ...私が知る測定理論家は誰もスティーブンスの測定の広い定義を受け入れていない... [強調追加] 私たちの見解では、「規則」の唯一妥当な意味は、属性に関する経験的に検証可能な法則である。
名義尺度は、[猫、犬、ウサギ] のように、いくつかの異なるクラスまたはカテゴリのみで構成されます。他の尺度とは異なり、クラス間の関係性は考慮されません。したがって、名義尺度で測定することは、分類することと同じです。
名義尺度では、項目や対象を、その名称や(メタ)カテゴリー、その他の質的分類のみに基づいて区別する。そのため、二分法データでさえ構成主義的認識論に基づいていると主張されてきた。この場合、分類の例外の発見は進歩とみなすことができる。
変数を表すために数値を使用することはできますが、数値には数値的な値や関係はありません。たとえば、グローバルに一意な識別子などです。
これらの分類の例としては、性別、国籍、民族、言語、ジャンル、スタイル、生物種、形態などが挙げられる。[ 6 ] [ 7 ]大学では、寮や学部への所属も例として挙げられる。その他の具体的な例としては、
名義尺度はしばしば質的尺度と呼ばれ、質的尺度で測定されたデータは質的データと呼ばれていました。しかし、質的研究の台頭により、この用法は混乱を招いています。名義尺度で数値がラベルとして割り当てられる場合、それらの数値には特定の数値的価値や意味はありません。名義尺度に対しては、いかなる算術演算(加算、 減算、 乗算 など)も行うことはできません。
等号、および不等号や集合のメンバーシップなど、等号に基づいて定義できるその他の演算は、名義型オブジェクトに一般的に適用される唯一の非自明な演算である。
順序型では、データを並べ替えるための順位(1位、2位、3位など)を設定できますが、データ間の相対的な差異を表すことはできません。例としては、一方では、健康状態を測定する際の「病気」対「健康」、裁判所での判決を下す際の「有罪」対「無罪」、真偽値を測定する際の「間違い/虚偽」対「正しい/真実」といった二値(または二値化された)値を持つ二値データがあり、他方では、意見を測定する際の「完全に同意」、「ほぼ同意」、「ほぼ不同意」、「完全に不同意」といった値のスペクトルで構成される非二値データがあります。
順序尺度は事象を順序付けますが、尺度の間隔を何らかの規則に基づいて等しくしようとする試みはありません。順位は順序尺度を表し、質的現象に関する研究で頻繁に使用されます。卒業クラスにおける学生の順位は、順序尺度の使用を伴います。順序尺度に基づくスコアについて発言する際には、非常に注意が必要です。たとえば、デヴィのクラスでの順位が10位で、ガンガの順位が40位の場合、デヴィの順位がガンガの順位の4倍良いとは言えません。順序尺度は、項目を最高から最低まで順位付けすることしかできません。順序尺度には絶対値がなく、隣接する順位間の実際の差は等しくない場合があります。言えることは、ある人が別の人よりも尺度上で高いか低いかということだけであり、より正確な比較はできません。したがって、順序尺度を用いると、「より大きい」または「より小さい」(等号も可)という表現はできますが、どれだけ大きいか、あるいは小さいかを具体的に示すことはできません。例えば、順位1と2の実際の差は、順位5と6の差よりも大きい場合もあれば、小さい場合もあります。
スティーブンスによれば、順序尺度データの場合、適切な中心傾向の尺度は中央値(最頻値も許容されるが、平均値は許容されない)、適切なばらつきの尺度はパーセンタイルまたは四分位数(標準偏差は許容されない)である。これらの制約は、相関関係は順位法を用いてのみ評価でき、統計的有意性はノンパラメトリック法を用いてのみ評価できることを意味する(RM Kothari、2004)。しかし、これらの制約は統計学者の間で一般的に支持されているわけではない。
1946年、スティーブンスは、意見の測定などの心理学的測定は通常順序尺度で行われるため、平均値と標準偏差は彼の規則に従って妥当性を持たないが、質問票で使用される変数の操作化を改善する方法についてのアイデアを得るために使用できると指摘した。実際、認知能力やその他の能力を測定する心理測定機器やテストによって収集されるほとんどの心理学的データは順序尺度である(Cliff、1996年、Cliff & Keats、2003年、Michell、2008年)。[ 9 ]特に、[ 10 ] IQスコアは順序尺度を反映しており、すべてのスコアは比較のためだけに意味を持つ。[ 11 ] [ 12 ] [ 13 ]知能の欠如を表すゼロポイントはなく、10ポイントの差は尺度の異なるポイントで異なる意味を持つ可能性がある。[ 14 ] [ 15 ]
間隔型では、測定値間の差の度合いを定義できますが、測定値間の比率を定義することはできません。例としては、摂氏温度スケール、任意のエポック(西暦など)から測定した日付、デカルト座標系における位置、真北または磁北からの角度で測定した方向など があります。20 °C は 10 °C の「2 倍暑い」とは言えず 、また任意の 2 つの日付間で直接乗算/除算を行うことはできないため、比率は意味を持ちません。ただし、差の比率は表現できます。たとえば、ある差が別の差の 2 倍になる場合、たとえば、15 °C と 25 °C の間の 10 度の差は、17 °C と 22 °C の間の 5 度の差の 2 倍になります。
スティーブンスによれば、区間変数の中心傾向を測定するために最頻値、中央値、算術平均が許容される一方、統計的ばらつきの尺度には範囲と標準偏差が含まれる。差分でしか割ることができないため、変動係数などの比率を必要とする尺度を定義することはできない。より微妙な点として、原点に関するモーメントを定義することはできるが、原点の選択は任意であるため、中心モーメントのみが意味を持つ。差分の比率は意味を持つため、標準化モーメントを定義することはできるが、平均は原点に関するモーメントであり、中心モーメント(の平方根)である標準偏差とは異なり、変動係数を定義することはできない。
比率尺度は、測定が連続量の大きさと同一種類の測定単位の比率の推定であるという事実からその名が付けられています (Michell、1997、1999)。物理科学および工学におけるほとんどの測定は、比率尺度で行われます。例としては、質量、長さ、期間、平面角、エネルギー、電荷などがあります。間隔尺度とは対照的に、比率は除算を使用して比較できます。比率尺度は、オーダー (温度)における温度のように、オーダーを表すためによく使用されます。
スティーブンスによれば、中心傾向の測定には、最頻値、中央値、算術平均に加えて、幾何平均と調和平均も使用できる。統計的ばらつきの測定には、スチューデント化範囲と変動係数も使用できる。比率尺度では必要な数学演算がすべて定義されているため、すべての統計的尺度が使用可能である。
スティーブンスの類型論は広く採用されているが、特に名義型と順序型の場合には、他の理論家から依然として異議を唱えられている(Michell、1986)。[ 16 ]例えば、ダンカン(1986)は名義型に関連して「測定」という言葉を使うことに異議を唱え、ルース(1997)はスティーブンスの測定の定義に反対した。
一方、スティーブンス(1975)は、自身の測定の定義について、「割り当ては、一貫した規則であれば何でもよい。唯一許されない規則はランダム割り当てであり、ランダム性は事実上規則ではない」と述べている。ハンドは、「基本的な心理学の教科書は、しばしばスティーブンスの枠組みから始まり、その考え方は至る所に見られる。実際、彼の階層の本質的な妥当性は、経験的システムから実数連続体へのマッピングの不変性を決定する数学者によって、表現測定に関して確立されている。確かに、その考え方は修正、拡張、精緻化されてきたが、注目すべきは、彼が利用できた形式的な装置が比較的限られていたこと、そして彼がそれらを提唱してから何十年も経っていることを考えると、彼の洞察力である」と述べている。[ 17 ]
スティーブンスの類型論を受け入れる人々の間でも、順序尺度の中心傾向の指標として平均値を用いることの是非は依然として議論の的となっている。とはいえ、多くの行動科学者は順序データに対して平均値を用いている。これは、行動科学における順序尺度は、真の順序尺度と間隔尺度の中間に位置するという根拠に基づいて正当化されることが多い。2つの順序順位間の間隔差は一定ではないものの、多くの場合、同じ桁数となるからである。
例えば、教育現場における測定モデルの応用例では、評価範囲全体にわたって、合計スコアと測定値の間にはほぼ線形の関係があることがしばしば示されています。そのため、順序尺度順位間の未知の間隔差があまり変動しない限り、平均値などの間隔尺度統計は順序尺度変数に意味のある形で適用できると主張する人もいます。SPSSなどの統計分析ソフトウェアでは、各変数に対して適切な測定クラスを選択する必要があります。これにより、後続のユーザーエラーによって意図せず無意味な分析(例えば、名義尺度の変数を用いた相関分析)が実行されることが防止されます。
L.L.サーストンは、比較判断の法則に基づいて、間隔尺度を得るための正当化の根拠を確立する上で進歩を遂げた。この法則の一般的な応用例として、階層分析法がある。さらに、ゲオルク・ラッシュ(1960年)は、評価の合計点数などの観測値のカウントから間隔尺度レベルの測定値を得るための理論的根拠と正当化を提供する確率的ラッシュモデルを開発し、進歩を遂げた。
スティーブンスの類型論以外にも、類型論が提案されている。例えば、MostellerとTukey(1977)およびNelder(1990)[ 18 ]は、連続カウント、連続比率、カウント比率、およびカテゴリカルなデータモードについて説明している。Chrisman(1998)、van den Berg(1991)も参照のこと。[ 19 ]
モステラーとテューキー[ 4 ]は、4つのレベルでは網羅的ではないと指摘し、代わりに7つのレベルを提案した。
例えば、パーセンテージ(モステラー・テューキーの枠組みにおける分数の変形)はスティーブンスの枠組みにはうまく適合しない。完全に許容できる変換はない。[ 16 ]
ニコラス・R・クリスマン[ 5 ]は、従来の測定レベルの概念に必ずしも当てはまらない様々な測定に対応するため、測定レベルの拡張リストを導入した。範囲が限定され、繰り返し行われる測定(円の角度、時計の時間など)、段階的なメンバーシップのカテゴリー、その他のタイプの測定は、スティーブンスの元の研究には当てはまらないため、新たに6つの測定レベルが導入され、合計10レベルとなった。
拡張された測定レベルは学術地理学以外ではほとんど使用されていないと主張する人もいるが、[ 20 ]段階的メンバーシップはファジィ集合理論の中心であり、絶対測定には確率とデンプスター・シェーファー理論の妥当性と無知が含まれる。周期的な比率測定には角度と時間が含まれる。カウントは比率測定のように見えるが、スケールは任意ではなく、小数カウントは一般的に意味がない。対数間隔測定は株式市場のグラフでよく表示される。これらのタイプの測定はすべて学術地理学以外で一般的に使用されており、スティーブンスの元の研究にはうまく適合しない。
尺度タイプの理論は、スティーブンスの「測定の操作理論」の知的補助者であり、ミッチェルが自然科学における測定とは全く相容れないと特徴づけたにもかかわらず(Michell、1999)、心理学および行動科学において決定的なものとなった。本質的に、測定の操作理論は、心理学および行動科学における真の科学的測定の可能性を調査するために英国科学振興協会が1932年に設立した委員会の結論に対する反応であった。ファーガソン委員会として知られるようになったこの委員会は、最終報告書(Ferguson、et al.、1940、p. 245)を発表し、その中でスティーブンスのsone尺度(Stevens & Davis、1938)が批判の対象となった。
感覚の強さと刺激の強さの間の量的関係を表現しようとするいかなる法則も、感覚に適用される加算の概念に意味が与えられるまでは、単に誤りであるだけでなく、実際には無意味である。
つまり、スティーブンスの感覚尺度が聴覚感覚の強度を真に測定するものであれば、そのような感覚が量的属性であるという証拠を提示する必要があった。必要な証拠は加法構造の存在であり、これはドイツの数学者オットー・ヘルダー(ヘルダー、1901)によって包括的に扱われた概念である。物理学者で測定理論家のノーマン・ロバート・キャンベルがファーガソン委員会の審議を支配していたことを考えると、委員会は連結演算の欠如のために社会科学における測定は不可能であると結論付けた。この結論は後に、ドブルー(1960)とルース&テューキー(1964)による結合測定理論の発見によって誤りであることが証明された。しかし、スティーブンスの反応は、感覚における加法構造の存在を検証する実験を行うことではなく、代わりに新しい測定理論を提案することによってファーガソン委員会の結論を無効にすることであった。
NRキャンベル(最終報告書、340ページ)を言い換えると、測定とは、最も広い意味では、規則に従って対象や出来事に数値を割り当てることであると言えるでしょう(スティーブンス、1946年、677ページ)。
スティーブンスは、ハーバード大学の別の学者であるノーベル賞受賞物理学者パーシー・ブリッジマン(1927年)の考えに大きく影響を受けており、測定を定義するためにブリッジマンの操作主義の教義を用いた。[21] スティーブンスの定義では、例えば、巻尺の使用によって長さ(測定対象)が測定可能(したがって暗黙のうちに定量的)であると定義される。操作主義の批判者は、それが2つの対象または事象間の関係を、対象または事象のいずれかの性質と混同していると異議を唱えている(Moyer、1981a、b; Rogers、1989)。[ 22 ] [ 23 ]
カナダの計測理論家ウィリアム・ロゼブームは、スティーブンスの尺度タイプの理論に対する初期の鋭い批判者であった。[ 24 ]
もう1つの問題は、同じ変数でも、測定方法や分析の目的によって尺度タイプが異なる場合があることです。たとえば、髪の色は明らかな順序がないため、通常は名義変数と考えられています。[ 25 ]しかし、色相などさまざまな方法で色(髪の色を含む)を順序付けることが可能です。これは測色法として知られています。色相は間隔尺度変数です。
次の表は、さまざまな単純データ型、関連する分布、許容される演算などを分類したものです。論理的に可能な値に関係なく、これらのデータ型はすべて一般的に実数を使用してコード化されます。これは、確率変数の理論では、それらが実数を保持することを明示的に仮定することが多いためです。
指定は、測定手順に関連する理論とモデルによって暗示される場合にのみ理論的に意味を持つ。
IQや心理テストで測定されるその他のほとんどの人間の特性(不安、内向性、自尊心など)は間隔尺度として扱われますが、多くの研究者は、それらは順序尺度として分類する方がより適切だと主張します。こうした主張は、尺度上の異なる点における等しい数値差が比較可能であることを証明できないため、これらの尺度は実際には間隔尺度の要件を満たしていないという事実に基づいています。
IQは本質的に順位付けであり、知的能力を測る真の「単位」は存在しない。
IQスコアは等間隔スコアではないことは、WISC-IIIマニュアルの表A.4を見れば明らかです。
するように、さらに低いレベルの測定、つまり順序尺度が存在することがわかります。これは、個人に割り当てる数値は、その個人を順位付けするためだけに用いられることを意味します。数値は、その個人が順位の中でどの位置にいるかを示すだけで、それ以外のことは何も示しません。
測定尺度は真のゼロ点と等間隔の目盛りを持つべきである。しかし、硬さの尺度にはこうした利点がなく、IQも同様である。絶対的なゼロ点が存在せず、10ポイントの差が尺度の異なる点で異なる意味を持つ可能性がある。
IQは順序尺度であり、単に人々を順位付けしているにすぎません。…IQスコア110と100の10ポイントの差が、IQ160と150の10ポイントの差と同じであると主張することさえ適切ではありません。