統計学において、分割表(クロス集計表またはクロスタブとも呼ばれる)は、変数の多変量頻度分布を表示するマトリックス形式の表の一種です。これらは、調査研究、ビジネスインテリジェンス、エンジニアリング、科学研究で頻繁に使用されます。これらは、2つの変数間の相互関係の基本的な図を提供し、それらの相互作用を見つけるのに役立ちます。分割表という用語は、1904年に出版されたDrapers' Company Research Memoirs Biometric Series Iの一部である「On the Theory of Contingency and Its Relation to Association and Normal Correlation」[1]で、 Karl Pearsonによって初めて使用されました。
多変量統計の重要な問題は、高次元分割表に含まれる変数の根底にある (直接的な) 従属構造を見つけることです。条件付き独立性の一部が明らかになれば、データの保存もよりスマートな方法で行うことができます (Lauritzen (2002) を参照)。これを行うには、情報理論の概念を使用できます。この概念では、確率分布からのみ情報を取得します。この確率分布は、分割表から相対頻度によって簡単に表現できます。
ピボットテーブルは、スプレッドシート ソフトウェアを使用して分割表を作成する方法です。
例
性別 (男性または女性) と利き手(右利きまたは左利き)という 2 つの変数があるとします。さらに、利き手の性差の研究の一環として、非常に大規模な集団から 100 人の個人がランダムに抽出されるとします。男性の右利きと左利き、女性の右利きと左利きの個人の数を表示する分割表を作成できます。このような分割表を以下に示します。
男性、女性、右利き、左利きの人の数を限界合計と呼びます。総計(分割表に表される人の合計数)は右下隅の数字です。
この表により、右利きの男性の割合は右利きの女性の割合とほぼ同じであるが、割合は同一ではないことが一目でわかる。関連の強さはオッズ比で測定でき、母集団オッズ比は標本オッズ比で推定できる。2つの割合の差の有意性は、表の項目が結論を導き出す母集団から無作為に抽出された個人を表している限り、ピアソンのカイ 2 乗検定、G検定、フィッシャーの正確検定、ボシュロー検定、バーナード検定など、さまざまな統計検定で評価できる。異なる列の個人の割合が行間で大幅に異なる場合 (またはその逆)、 2 つの変数の間に偶然性があると言われる。つまり、2 つの変数は独立していない。偶然性がない場合、2 つの変数は独立していると言われる。
上記の例は、最も単純な種類の分割表で、各変数が 2 つのレベルのみを持つ表です。これは 2 × 2 分割表と呼ばれます。原則として、任意の数の行と列を使用できます。変数が 3 つ以上ある場合もありますが、高次の分割表は視覚的に表現するのが困難です。順序変数間の関係、または順序変数とカテゴリ変数間の関係も分割表で表現できますが、このような方法はあまりありません。2 つの順序変数間の関係に分割表を使用する方法の詳細については、Goodman と Kruskal のガンマを参照してください。
分割表の標準的な内容
- 複数の列 (歴史的には、印刷されたページの空白スペースをすべて使用するように設計されていました)。各行が人口の特定のサブグループ (この場合は男性または女性) を指す場合、列はバナー ポイントまたはカットと呼ばれることがあります(行はスタブと呼ばれることもあります)。
- 有意性検定。通常は、列間の差異を検定し、その結果を文字で表示する列比較、または色や矢印を使用して、何らかの方法で目立つ表内のセルを識別するセル比較のいずれかです。
- 小計であるネットまたはネット。
- パーセンテージ、行パーセンテージ、列パーセンテージ、インデックス、平均のうち 1 つ以上。
- 加重されていないサンプル サイズ (カウント)。
関連性の尺度
2 つの変数の関連の度合いは、いくつかの係数によって評価できます。次のサブセクションでは、そのうちのいくつかについて説明します。それらの使用法に関するより詳しい説明については、各サブセクションの見出しの下にリンクされているメインの記事を参照してください。
オッズ比
2 × 2 分割表の関連性を測る最も単純な指標はオッズ比です。2 つのイベント A と B がある場合、オッズ比は、B がある場合の A のオッズと B がない場合の A のオッズの比、または (対称性のため) A がある場合の B のオッズと A がない場合の B のオッズの比として定義されます。オッズ比が 1 の場合にのみ、2 つのイベントは独立しています。オッズ比が 1 より大きい場合、イベントは正に関連し、オッズ比が 1 より小さい場合、イベントは負に関連しています。
オッズ比は確率の観点からは簡単な表現で表すことができます。結合確率分布が与えられている場合、次のようになります。
オッズ比は:
ファイ係数
2×2分割表の場合にのみ適用可能な単純な尺度は、次のように定義されるファイ係数(φ) である。
ここで、χ 2 はピアソンのカイ二乗検定で計算され、N は観測値の総計です。 φ は、2 × 2 表で表される頻度データに基づく場合、0 (変数間に関連がない場合) から 1 または -1 (完全な関連または完全な逆の関連) まで変化します。その場合、その符号は、表の主対角要素の積から非対角要素の積を引いた符号に等しくなります。 φ は、すべての周辺比率が 0.5 に等しい場合 (および 2 つの対角セルが空の場合) に限り、最小値 -1.0 または最大値 +1.0 になります。[2]
クラメール五そして偶発係数C
2 つの選択肢は、偶発係数 CとCramér の Vです。
C 係数とV係数の式は次のとおりです。
- そして
kは行数または列数のうち、いずれか少ない方です。
C は最大値 1.0 に達しないという欠点があり、特に 2 × 2 表では最高値が 0.707 です。より多くのカテゴリを持つ分割表では、1.0 に近い値に達することができます。たとえば、4 × 4 表では最大値 0.870 に達することがあります。したがって、カテゴリ数が異なる異なる表の関連性を比較するためには使用しないでください。[3]
Cは、任意の数の行と列の表に完全な関連付けがある場合に、表が正方形のときはCをk (行数または列数)で割ることによって最大値1.0に達するように調整できます[要出典]。または、r(行数)とc(列数)で割ることによって調整できます。 [4]
四重相関係数
もう 1 つの選択肢はテトラコリック相関係数ですが、これは 2 × 2 テーブルにのみ適用できます。ポリコリック相関は、テトラコリック相関を 2 つ以上のレベルを持つ変数を含むテーブルに拡張したものです。
四分相関は、各二分尺度の基礎となる変数が正規分布していると仮定します。[5]この係数は、「段階的な測定が2つのカテゴリに縮小された場合の[ピアソン積率]相関の便利な尺度」を提供します。[6]
テトラコリック相関係数は、各変数の 2 つのレベルを表すために、たとえば 0.0 と 1.0 の値を割り当てることによって計算されるピアソン相関係数(数学的には φ 係数と同等) と混同しないでください。
ラムダ係数
ラムダ係数は、変数が名目レベルで測定された場合のクロス集計の関連の強さの尺度です。値の範囲は 0.0 (関連なし) から 1.0 (最大の関連) です。
非対称ラムダは、従属変数の予測における改善率を測定します。対称ラムダは、両方向で予測が行われた場合の改善率を測定します。
不確実係数
不確実性係数、または Theil の U は、名目レベルの変数のもう 1 つの尺度です。その値の範囲は、-1.0 (100% の負の関連性、つまり完全な逆転) から +1.0 (100% の正の関連性、つまり完全な一致) です。値 0.0 は関連性がないことを示します。
また、不確実性係数は条件付きで非対称的な関連性の尺度であり、次のように表される。
- 。
この非対称な特性は、対称的な関連性の尺度では明らかではない洞察につながる可能性がある。[7]
その他
参照
- 混同行列
- スプレッドシート ソフトウェアのピボット テーブルは、カウント (分割表) や合計を使用してサンプリング データをクロス集計します。
- TPL Tables は、クロス集計を生成して印刷するためのツールです。
- 反復比例フィッティング手順は、基本的に分割表を操作して、変更された結合分布または限界合計を一致させます。
- 特殊な多変量離散確率分布における多変量統計。このコンテキストで使用される一部の手順は、分割表の処理に使用できます。
- OLAP キューブ、分割表の最新の多次元計算形式
- パネルデータ、時間の経過に伴う多次元データ
参考文献
- ^ カール・ピアソン、FRS (1904)。進化論への数学的貢献。Dulau and Co.
- ^ Ferguson, GA (1966).心理学と教育における統計分析. ニューヨーク: McGraw–Hill.
- ^ スミス、SC、アルバウム、GS (2004)マーケティングリサーチの基礎 セージ:サウザンドオークス、カリフォルニア州、p. 631
- ^ Blaikie, N. (2003)定量的データの分析セージ:サウザンドオークス、カリフォルニア州 p. 100
- ^ ファーガソン[全文引用が必要]
- ^ ファーガソン、1966年、244ページ
- ^ 「カテゴリー相関の探索」。2019年12月26日。
さらに読む
- Andersen, Erling B. 1980.社会科学への応用を伴う離散統計モデルノースホランド、1980 年。
- ビショップ、YMM ;フィンバーグ、SE ; ホランド、PW (1975)。離散多変量解析:理論と実践。MIT プレス。ISBN 978-0-262-02113-5MR 0381130 。
- Christensen, Ronald (1997)。対数線形モデルとロジスティック回帰。Springer Texts in Statistics (第2版)。ニューヨーク: Springer-Verlag。pp. xvi+ 483。ISBN 0-387-98247-7. MR 1633357。
- Lauritzen, Steffen L. (1979). Lectures on Contingency Tables (オールボー大学) (PDF) (第 4 版 (最初の電子版)、2002 年版)。
- Gokhale, DV; Kullback , Solomon (1978)。分割表の情報。Marcel Dekker。ISBN 0-824-76698-9。
外部リンク
- 分割表のオンライン分析: 例付きの計算機
- インタラクティブなクロス集計、カイ二乗独立検定、チュートリアル
- フィッシャーとカイ二乗の 2 × 2 分割表の計算機
- 相関係数の詳細
- 名目上の関連性: ファイ、偶発係数、チュプロウの T、クレイマーの V、ラムダ、不確実性係数、2008 年 3 月 24 日、G. デビッド ガーソン、ノースカロライナ州立大学
- CustomInsight.com クロス集計
- POWERMUTT プロジェクト: IV. カテゴリデータの表示
- StATS: スティーブの統計学の教え方 オッズ比と相対リスク (2001 年 1 月 9 日)
- Epi Info コミュニティ健康評価チュートリアル レッスン 5 分析: 統計の作成
