統計学において、分割表(クロス集計表またはクロスタブとも呼ばれる)は、変数の多変量頻度分布を表示する行列形式の表の一種です。これらは、調査研究、ビジネスインテリジェンス、工学、科学研究で広く使用されています。これらは、2 つの変数間の相互関係の基本的な図を提供し、それらの間の相互作用を見つけるのに役立ちます。分割表という用語は、カール・ピアソンが1904 年に出版されたDrapers' Company Research Memoirs Biometric Series Iの一部である「On the Theory of Contingency and Its Relation to Association and Normal Correlation」[ 1 ]で初めて使用しました。
多変量統計学における重要な課題の一つは、高次元分割表に含まれる変数間の(直接的な)依存構造を見つけることである。条件付き独立性の一部が明らかになれば、データの保存方法もより効率的に行うことができる(Lauritzen (2002)を参照)。そのためには、情報理論の概念を用いることができる。情報理論では、確率分布からのみ情報を得ることができ、これは分割表の相対頻度によって容易に表現できる。
ピボットテーブルとは、表計算ソフトを使って分割表を作成する方法の一つです。
性別(男性または女性)と利き手(右利きまたは左利き)という2つの変数があるとします。さらに、利き手の性差に関する研究の一環として、非常に大きな母集団から100人を無作為に抽出したとします。男性の右利きと左利き、女性の右利きと左利きの人数を示す分割表を作成できます。そのような分割表を以下に示します。
男性、女性、右利き、左利きの人数は、周辺合計と呼ばれます。総計(分割表に示されている個人の総数)は、右下隅の数字です。
この表では、右利きの男性の割合と右利きの女性の割合はほぼ同じであることが一目でわかりますが、両者の割合は完全に一致するわけではありません。関連性の強さはオッズ比で測定でき、母集団オッズ比は標本オッズ比で推定できます。2つの割合の差の有意性は、ピアソンのカイ二乗検定、G検定、フィッシャーの正確確率検定、ボシュルー検定、バーナード検定など、さまざまな統計検定で評価できます。ただし、表のエントリは、結論を導き出す母集団から無作為に抽出された個人を表している必要があります。異なる列の個人の割合が行間で有意に異なる場合(またはその逆の場合)、 2つの変数間に連鎖があると言われます。言い換えれば、2つの変数は独立していません。連鎖がない場合、2つの変数は独立していると言われます。
上記の例は、最も単純な分割表であり、各変数が2つのレベルのみを持つ表です。これは2 × 2分割表と呼ばれます。原則として、行と列の数は任意です。また、2つ以上の変数を持つこともできますが、高次の分割表は視覚的に表現するのが困難です。順序変数間の関係、または順序変数とカテゴリ変数間の関係も分割表で表現できますが、そのような方法はまれです。2つの順序変数間の関係に分割表を使用する方法の詳細については、グッドマンとクラスカルのガンマを参照してください。
2つの変数間の関連性の度合いは、いくつかの係数によって評価できます。以下のサブセクションでは、そのうちのいくつかについて説明します。各係数の使用方法に関するより詳細な説明については、各サブセクションの見出しの下にリンクされているメイン記事を参照してください。
2 × 2 分割表における関連性の最も単純な尺度はオッズ比です。2 つの事象 A と B が与えられた場合、オッズ比は、B が存在する場合の A のオッズと、B が存在しない場合の A のオッズの比、または (対称性により) 同等に、A が存在する場合の B のオッズと、A が存在しない場合の B のオッズの比として定義されます。2 つの事象が独立であるのは、オッズ比が 1 の場合のみです。オッズ比が 1 より大きい場合、事象は正の相関関係にあります。オッズ比が 1 より小さい場合、事象は負の相関関係にあります。
オッズ比は確率の観点から単純な式で表すことができ、結合確率分布が与えられれば次のようになります。
オッズ比は次のとおりです。
2 × 2 分割表の場合にのみ適用可能な単純な尺度は、次のように定義されるファイ係数(φ)である。
ここで、χ 2はピアソンのカイ二乗検定と同様に計算され、Nは観測値の総計です。φ は、2 × 2 表で表される頻度データに基づいている場合、0 (変数間の関連がないことに相当) から 1 または −1 (完全な関連または完全な逆相関) まで変化します。その場合、その符号は、表の主対角要素の積から非対角要素の積を引いたものの符号に等しくなります。φ は、すべての周辺比率が 0.5 に等しい場合 (かつ 2 つの対角セルが空の場合)に限り、最小値− 1.0 または最大値 +1.0 をとります。 [ 2 ]
2つの代替案は、連関係係数CとクラメールのVである。
C係数とV係数の計算式は以下のとおりです。
kは行数または列数のうち、いずれか少ない方である。
C には、最大値が 1.0 に達しないという欠点があります。特に、2 × 2 の表では、最大値は 0.707 です。カテゴリ数が多い分割表では、1.0 に近い値に達することができます。たとえば、4 × 4 の表では、最大値は 0.870 になります。したがって、カテゴリ数が異なる表間の関連性を比較するために C を使用すべきではありません。[ 3 ]
C は、行と列の数に関係なく、テーブルに完全な関連付けがある場合に最大 1.0 に達するように調整できます。ここでkは行数または列数であり、表が正方形の場合、またはここで、rは行数、cは列数である。[ 4 ]
別の選択肢として四分相関係数がありますが、これは2 × 2の表にしか適用できません。多分相関係数は、2つ以上の水準を持つ変数を含む表に四分相関係数を拡張したものです。
四分相関は、各二値尺度の基礎となる変数が正規分布に従うことを前提としている。[ 5 ]この係数は、「段階的な測定値が2つのカテゴリに縮小された場合の、[ピアソン積率]相関の便利な尺度」を提供する。[ 6 ]
四分相関係数は、例えば各変数の2つのレベルを表すために0.0と1.0の値を割り当てることによって計算されるピアソン相関係数(数学的にはφ係数と同等)と混同してはならない。
ラムダ係数は、変数を名義尺度で測定した場合のクロス集計における関連性の強さを示す指標です。値の範囲は0.0(関連性なし)から1.0(最大の関連性)までです。
非対称ラムダは、従属変数の予測精度における改善率をパーセンテージで表します。対称ラムダは、予測を双方向で行った場合の改善率をパーセンテージで表します。
不確実性係数、またはテイルのUは、名義尺度における変数のもう一つの指標です。その値は-1.0(100%負の相関、または完全な反転)から+1.0(100%正の相関、または完全な一致)までです。0.0は相関がないことを示します。
また、不確実性係数は条件付きであり、非対称な関連性の尺度であり、次のように表現できます。
この非対称性により、対称的な関連性の尺度では明らかにならない洞察が得られる可能性がある。[ 7 ]
ガンマ、タウb、タウcは、両方の変数のカテゴリまたはレベルに自然な順序がある場合に使用されます。