統計学では、カテゴリ変数(質的変数とも呼ばれる)は、限られた、通常は固定された数の可能な値のいずれかを取ることができる変数であり、何らかの質的特性に基づいて、各個人またはその他の観測単位を特定のグループまたは名義カテゴリに割り当てます。[ 1 ]コンピュータサイエンスや数学の一部の分野では、カテゴリ変数は列挙または列挙型と呼ばれます。一般的に(この記事ではそうではありませんが)、カテゴリ変数の可能な値はすべてレベルと呼ばれます。ランダムなカテゴリ変数に関連付けられた確率分布は、カテゴリ分布と呼ばれます。
カテゴリデータとは、カテゴリ変数、またはグループ化データのようにカテゴリ変数に変換されたデータで構成される統計データタイプです。より具体的には、カテゴリデータは、カウントやクロス集計として要約された質的データの観測、または特定の区間内でグループ化された量的データの観測から得られる場合があります。多くの場合、純粋なカテゴリデータは分割表の形式で要約されます。ただし、特にデータ分析を検討する際には、「カテゴリデータ」という用語は、カテゴリ変数を含む一方で非カテゴリ変数も含むデータセットに適用するのが一般的です。順序変数には意味のある順序がありますが、名義変数には意味のある順序がありません。
2 つの値しか取れないカテゴリ変数は、バイナリ変数または二値変数と呼ばれます。重要な特殊なケースとして、ベルヌーイ変数があります。2 つ以上の値を取ることができるカテゴリ変数は、多値変数と呼ばれます。カテゴリ変数は、特に指定がない限り、多値であると仮定されることがよくあります。離散化とは、連続データをカテゴリ変数であるかのように扱うことです。二値化とは、連続データまたは多値変数をバイナリ変数であるかのように扱うことです。回帰分析では、カテゴリの所属を 1 つ以上の量的ダミー変数で扱うことがよくあります。
カテゴリ変数で表現される可能性のある値の例:
統計処理を容易にするため、カテゴリ変数には数値インデックスが割り当てられることがあります。例えば、 K次元カテゴリ変数(つまり、 K個の可能な値を表現できる変数)には1 からKまでのインデックスが割り当てられます。しかし、一般的に、これらの数値は任意であり、特定の値に便利なラベルを提供する以上の意味はありません。言い換えれば、カテゴリ変数の値は名義尺度上に存在します。つまり、それぞれの値は論理的に独立した概念を表し、必ずしも意味のある順序付けができるわけではなく、数値のように操作することもできません。その代わりに、有効な操作は、等価性、集合への所属、およびその他の集合関連の操作です。
その結果、カテゴリ変数の集合の中心傾向は最頻値によって決まり、平均値も中央値も定義できません。例として、ある人々の集合が与えられた場合、その人々の姓に対応するカテゴリ変数の集合を考えてみましょう。等価性(2人が同じ姓を持っているかどうか)、集合への所属(ある人が特定のリストに名前を持っているかどうか)、カウント(特定の姓を持つ人の数)、最頻値(どの名前が最も頻繁に出現するか)などの操作を考えることができます。しかし、Smith + Johnson の「合計」を計算したり、Smith が Johnson より「小さい」か「大きい」かを問うたりすることは意味がありません。その結果、名前の集合の中で「平均的な名前」(平均値)や「真ん中の名前」(中央値)は何かと問うことも意味がありません。
これは、名前自体に内在する性質ではなく、ラベルの構築方法に起因するアルファベット順の概念を無視しています。たとえば、名前をキリル文字で書き、キリル文字の文字順序を考慮すると、名前を標準ラテン文字で書いた場合とは異なる「Smith < Johnson」の評価結果になる可能性があります。また、名前を漢字で書いた場合、そのような文字には一貫した順序が定義されていないため、「Smith < Johnson」を意味のある形で評価することはできません。しかし、名前をラテン文字などで書かれたものとして考慮し、標準アルファベット順に対応する順序を定義すると、それらを順序尺度で定義された順序変数に効果的に変換したことになります。
カテゴリカルな確率変数は、通常、カテゴリカル分布によって統計的に記述されます。カテゴリカル分布では、任意のK個のカテゴリカル変数を、 K個の可能な結果それぞれに対して個別の確率を指定して表現できます。このような複数カテゴリのカテゴリカル変数は、多くの場合、多項分布を用いて分析されます。多項分布は、さまざまなカテゴリの発生回数の可能な組み合わせの頻度をカウントします。カテゴリカルな結果に対する回帰分析は、多項ロジスティック回帰、多項プロビット、または関連するタイプの離散選択モデルによって行われます。
結果が2つしかないカテゴリ変数(例:「はい」対「いいえ」、または「成功」対「失敗」)は、二値変数(またはベルヌーイ変数)と呼ばれます。これらの変数は重要であるため、多くの場合、独立したカテゴリとして扱われ、独立した分布(ベルヌーイ分布)と独立した回帰モデル(ロジスティック回帰、プロビット回帰など)が適用されます。そのため、「カテゴリ変数」という用語は、結果が3つ以上ある場合、つまり二値変数とは対照的に多次元変数と呼ばれる場合に用いられることがよくあります。
カテゴリ数が事前に固定されていないカテゴリ変数も考慮することができます。たとえば、特定の単語を表すカテゴリ変数の場合、語彙のサイズを事前に把握できない場合があり、まだ見たことのない単語に遭遇する可能性を考慮したい場合があります。カテゴリ分布や多項ロジスティック回帰などの標準的な統計モデルでは、カテゴリ数が事前にわかっていることを前提としており、カテゴリ数をその場で変更するのは困難です。このような場合は、より高度な手法を使用する必要があります。例として、ノンパラメトリック統計の領域に属するディリクレ過程が挙げられます。この場合、論理的には無限の数のカテゴリが存在すると想定されますが、どの時点においても、それらのほとんど(実際には有限個を除くすべて)はまだ見たことがありません。すべての数式は、存在する可能性のあるカテゴリの総数(無限)ではなく、実際にこれまでに確認されたカテゴリの数に基づいて表現されており、「新しい」カテゴリの追加を含め、統計分布を段階的に更新するための方法が作成されています。
カテゴリ変数は、データのスコアリングの定性的な方法(つまり、カテゴリまたはグループメンバーシップを表す)を表します。これらは、回帰分析の独立変数として、またはロジスティック回帰やプロビット回帰の従属変数として含めることができますが、データを分析できるようにするには、定量的データに変換する必要があります。これは、コーディングシステムを使用して行います。分析は、g - 1 ( gはグループ数) のみをコード化するように行われます。これにより、冗長性を最小限に抑えつつ、完全なデータセットを表すことができます。なぜなら、合計gグループをコード化しても追加の情報は得られないからです。たとえば、性別 ( g = 2: 男性と女性) をコード化する場合、女性のみをコード化すると、残りの全員が必然的に男性になります。一般に、コード化しないグループは、最も関心の低いグループです。[ 2 ]
回帰分析におけるカテゴリ変数の分析では、通常、ダミーコーディング、効果コーディング、コントラストコーディングの 3 つの主要なコーディング システムが使用されます。回帰方程式はY = bX + aの形式をとります。ここで、bは傾きであり、説明変数に経験的に割り当てられる重みを示します。Xは説明変数、aはY切片であり、これらの値は使用するコーディング システムに基づいて異なる意味を持ちます。コーディング システムの選択はF統計量やR 2統計量には影響しません。ただし、 b値の解釈が異なるため、比較対象に基づいてコーディング システムを選択します。 [ 2 ]
ダミーコーディングは、対照群または比較群を念頭に置いている場合に使用されます。したがって、比較群との関連で一方のグループのデータを分析します。aは対照群の平均を表し、bは実験群の平均と対照群の平均の差を表します。適切な対照群を指定するには、次の 3 つの基準を満たす必要があるとされています。そのグループは十分に確立されたグループであるべきであり (たとえば、「その他」のカテゴリであってはならない)、このグループを比較対象として選択する論理的な理由があるべきであり (たとえば、従属変数で最高得点を取ると予想されるグループである)、最後に、そのグループのサンプルサイズは他のグループと比較して実質的であり、小さくないべきである。[ 3 ]
ダミーコーディングでは、参照グループには各コード変数に対して0の値が割り当てられ、参照グループと比較する対象グループには指定されたコード変数に対して1の値が割り当てられ、その他のすべてのグループにはその特定のコード変数に対して0の値が割り当てられます。[ 2 ]
b値は、実験群と対照群を比較するものとして解釈する必要があります。したがって、b値が負の値になった場合は、実験群が従属変数において対照群よりも低いスコアを示したことを意味します。これを説明するために、複数の国籍の人々の楽観主義を測定し、フランス人を対照群として用いることにしたとします。フランス人とイタリア人を比較し、b値が負の値になった場合、イタリア人は平均して楽観主義のスコアが低いことを示唆することになります。
以下の表は、フランス語を対照群とし、C1、C2、C3をそれぞれイタリア語、ドイツ語、その他(フランス語、イタリア語、ドイツ語のいずれでもない)のコードとしたダミーコーディングの例です。
効果コーディングシステムでは、あるグループを他のすべてのグループと比較することによってデータが分析されます。ダミーコーディングとは異なり、コントロールグループはありません。むしろ、すべてのグループを合わせた平均値(aは全体の平均値)で比較が行われます。したがって、他のグループに関連するデータを探すのではなく、全体の平均値に関連するデータを探すことになります。[ 2 ]
効果コーディングは、重み付けありと重み付けなしの2種類があります。重み付けありの効果コーディングは、単純に重み付けありの総平均を計算することで、各変数のサンプルサイズを考慮に入れます。これは、サンプルが対象となる母集団を代表している場合に最も適しています。重み付けなしの効果コーディングは、サンプルサイズの違いが偶発的な要因によるものである場合に最も適しています。b の解釈はそれぞれ異なります。重み付けなしの効果コーディングでは、bは実験群の平均と総平均の差ですが、重み付けありの場合は、実験群の平均から重み付けありの総平均を引いた値になります。[ 2 ]
効果コーディングでは、ダミーコーディングと同様に、対象となるグループに1を割り当てます。主な違いは、最も関心の低いグループには-1を割り当てる点です。g-1コーディング方式を継続して使用するため、実際には-1でコーディングされたグループがデータを提供しないことになります。つまり、このグループに最も関心がないということになります。その他のすべてのグループには0が割り当てられます。
b値は、実験群が全群を合わせた平均値(加重効果コーディングの場合は加重平均)と比較されているものとして解釈されるべきである。したがって、負のb値が得られるということは、コード化された群が従属変数において全群の平均よりも低いスコアを獲得したことを意味する。先に示した国籍別の楽観度スコアの例を用いると、対象グループがイタリア人の場合、負のb値はイタリア人の楽観度スコアが低いことを示唆する。
以下の表は、最も関心の低いグループとして「その他」を指定した効果コーディングの例です。
対比コーディングシステムでは、研究者が具体的な質問を直接行うことができます。コーディングシステムが比較対象を規定するのではなく(ダミーコーディングのように対照群との比較、または効果コーディングのように全群との比較など)、研究者は自身の特定の研究課題に合わせた独自の比較を設計できます。このカスタマイズされた仮説は、一般的にこれまでの理論や研究に基づいています。提案される仮説は、一般的に次のとおりです。まず、2つのグループ間に大きな差があると仮定する中心的な仮説があります。2番目の仮説は、各グループ内ではグループ間の差が小さいことを示唆しています。対比コーディングは、事前に焦点を絞った仮説を用いることで、方向性の定まらない従来のコーディングシステムと比較して、統計的検定の検出力を高めることができます。[ 2 ]
分散分析(ANOVA)と回帰分析における事前係数を比較すると、いくつかの違いが明らかになります。ANOVAでは、研究者が直交係数または非直交係数のどちらを選択するかは自由ですが、回帰分析では、対比符号化で割り当てる係数値は直交していることが不可欠です。さらに、回帰分析では、係数値は分数または小数でなければならず、区間値をとることはできません。
対比コードの構築は、次の3つの規則によって制限される。
ルール2に違反すると、正確なR2値とF値が得られ、有意差があるかどうかについて同じ結論に達することがわかります。ただし、b値を平均差として解釈することはできなくなります。
対比コードの構築を説明するために、次の表を検討してください。係数は、事前の仮説を説明するために選択されました。仮説 1: フランス人とイタリア人はドイツ人よりも楽観主義のスコアが高い (フランス人 = +0.33、イタリア人 = +0.33、ドイツ人 = -0.66)。これは、フランス人とイタリア人のカテゴリに同じ係数を割り当て、ドイツ人に異なる係数を割り当てることによって示されます。割り当てられた符号は関係の方向を示します (したがって、ドイツ人に負の符号を与えることは、彼らの仮説上の楽観主義スコアが低いことを示しています)。仮説 2: フランス人とイタリア人は楽観主義スコアで異なると予想されます (フランス人 = +0.50、イタリア人 = -0.50、ドイツ人 = 0)。ここで、ドイツ人にゼロ値を割り当てることは、この仮説の分析にドイツ人が含まれないことを示しています。ここでも、割り当てられた符号は提案された関係を示しています。
ナンセンスコーディングとは、従来のコーディングシステムで用いられていた「0」、「1」、「-1」の代わりに任意の値を用いるコーディングのことです。ナンセンスコーディングは変数に対して正しい平均値を生成しますが、解釈不能な統計結果につながるため、使用は推奨されません。[ 2 ]
埋め込みとは、カテゴリ値を低次元の実数値(場合によっては複素数値)ベクトル空間に符号化したもので、通常は「類似した」値には「類似した」ベクトルが割り当てられるか、あるいはベクトルがそれぞれの用途に役立つような何らかの基準に基づいて割り当てられます。よくある特殊なケースとして単語埋め込みがあり、カテゴリ変数の取りうる値は言語内の単語であり、意味が似ている単語には類似したベクトルが割り当てられます。
3つ以上の変数間の関係を考慮する際に相互作用が生じる可能性があり、これは2つの変数が3つ目の変数に同時に及ぼす影響が加算的ではない状況を表します。カテゴリ変数における相互作用は、カテゴリ変数同士の相互作用、またはカテゴリ変数と連続変数の相互作用という2つの方法で生じる可能性があります。
この種の相互作用は、2 つのカテゴリ変数がある場合に発生します。この種の相互作用を調べるには、研究者の仮説に最も適切に対応できるシステムを使用してコーディングします。コードの積が相互作用を示します。次に、b値を計算して、相互作用が有意かどうかを判断します。[ 2 ]
単純傾斜分析は、回帰分析でよく用いられる事後検定であり、ANOVA の単純効果分析に似ており、相互作用の分析に用いられます。この検定では、一方の独立変数の特定の値におけるもう一方の独立変数の単純傾斜を調べます。このような検定は連続変数に限定されず、独立変数がカテゴリ変数である場合にも適用できます。データの名義性のため、連続変数の場合のように単純に値を選択して相互作用を調べることはできません(つまり、連続変数の場合、平均より 1 標準偏差上、平均、平均より 1 標準偏差下をそれぞれ割り当てて、高、中、低のレベルでデータを分析できます)。カテゴリ変数の場合、各グループに対して単純回帰方程式を用いて単純傾斜を調べます。単純傾斜分析では、データをより解釈しやすくするために変数を標準化または中心化するのが一般的ですが、カテゴリ変数は標準化または中心化すべきではありません。この検定は、すべてのコーディングシステムで使用できます。[ 2 ]