統計学において、多重対応分析(MCA)は名義カテゴリデータのデータ分析手法であり、データセット内の潜在的な構造を検出および表現するために使用されます。これは、データを低次元ユークリッド空間内の点として表現することによって行われます。したがって、この手順はカテゴリデータに対する主成分分析の対応物であると考えられます。MCAは、多数のカテゴリ変数に適用できるという点で、単純対応分析(CA)の拡張と見なすことができます。
MCA は、これらの変数から形成された指標行列 (完全分離表- CDT とも呼ばれる) またはバート表に CA アルゴリズムを適用することによって実行されます。指標行列は、行が個人を表し、列が変数のカテゴリを表すダミー変数である、個人×変数の行列です。 [ 1 ]指標行列を分析すると、個人を幾何学的空間の点として直接表現できます。バート表は、カテゴリ変数間のすべての 2 方向クロス集計の対称行列であり、連続変数の共分散行列に類似しています。バート表の分析は、単純な対応分析のより自然な一般化であり、個人または個人のグループの平均を補足点としてグラフィカル表示に追加できます。
指標行列アプローチでは、変数間の関連性は、変数の異なるカテゴリ間および個人(または回答者)間のカイ二乗距離を計算することによって明らかにされます。これらの関連性は、データの構造の解釈を容易にする「マップ」としてグラフィカルに表現されます。次に、行と列の対立を最大化して、データの中心的対立を最もよく説明できる潜在的な次元を明らかにします。因子分析や主成分分析と同様に、説明される分散の量に関して、第1軸が最も重要な次元、第2軸が2番目に重要な次元、といった具合になります。分析のために保持する軸の数は、修正固有値を計算することによって決定されます。
MCAはカテゴリ変数(多肢選択式質問など)から統計的な結論を導き出すように設計されているため、まず最初に行うべきことは、量的データ(年齢、サイズ、体重、時間帯など)をカテゴリに変換することです(例えば、統計的分位数を使用します)。
データセットが完全にカテゴリ変数として表現されている場合、対応するいわゆる完全分離表を作成することができます。この表を と表記します。。 もし人々はアンケートに回答し、それぞれ4つの選択肢がある多肢選択問題、持つことになる行と列。
より理論的には、[ 2 ]はは、観察カテゴリ変数。また、-番目の変数は異なるレベル(カテゴリ)とセットテーブルするとすべての係数がまたは. すべてのエントリの合計を設定しますであるそして紹介するMCAには、2つの特別なベクトルもあります。1つ目は行に沿った合計を含む、 そして列に沿った合計が含まれています。 注記そして対角行列にはそしてそれぞれ対角成分として表されます。これらの表記法を用いると、MCAの計算は基本的に行列の特異値分解から成ります。
分解あなたに、そしてそのためP、Qは2つのユニタリ行列であり、は特異値の一般化対角行列(形状は同じ)) の正の係数は、。
MCA の関心は、観測値 (行) と変数 (列) の扱い方から来ています。分解することができる。この分解は因子分解と呼ばれる。因子空間における観測値の座標は次のように与えられる。
のの 番目の行表現する因子空間における 番目の観測値。同様に、変数の座標(観測値と同じ因子空間内!)は次のように与えられる。
近年、ジャン=ポール・ベンゼクリの教え子数名がMCAを改良し、幾何学的データ分析として知られるより一般的なデータ分析の枠組みに組み込んだ。これには、単純対応分析、主成分分析、MCAと、ユークリッド分類として知られるクラスター分析の一形態との間の直接的なつながりの開発が含まれる。[ 3 ]
2つの拡張機能は非常に実用的です。
社会科学において、MCAはピエール・ブルデューによる応用で最もよく知られていると言えるだろう[ 4 ]。特に彼の著書『ディスタンクシオン』、『ホモ・アカデミクス』、『国家貴族』においてその応用が顕著である。ブルデューは、空間的かつ関係的な社会という彼のビジョン(「場」という概念によって捉えられる)とMCAの幾何学的特性との間には内在的なつながりがあると主張した[ 5 ] 。ブルデューの研究に倣う社会学者は、バート表ではなく指標行列の分析を選択することが多いが、これは主に「個人の雲」の分析に中心的な重要性が与えられているためである[ 6 ] 。
MCAは、完全分離表に適用されたPCAと見なすこともできます。これを行うには、CDTを次のように変換する必要があります。CDTの総称を表す。個人が 1 の場合、1 に等しい以下のカテゴリーに属するそうでない場合は 0 とする。カテゴリーに属する個人の割合変換された CDT (TCDT) は、一般用語として次のようになります。
TCDTに適用された非標準化PCA、列重さがある、MCAの結果につながります。
この等価性は、ジェローム・パジェスの著書で詳しく説明されています。[ 7 ]これは、量的変数と質的変数を同時に扱う道を開くため、重要な理論的役割を果たします。これら2種類の変数を同時に分析する2つの方法があります。混合データの因子分析と、アクティブ変数が複数のグループに分割されている場合の多重因子分析です。
この等価性は、MCAがPCAの特殊なケースであることを意味するものではなく、またMCAがCAの特殊なケースではないことを意味するものでもありません。これは単に、これらの手法が同じファミリー、つまり因子分析法に属しているため、互いに密接に関連していることを意味するだけです。
STATAやSPSSなど、MCAを含むデータ分析ソフトウェアは数多く存在する。RパッケージのFactoMineRもMCA機能を備えている。このソフトウェアは、MCAを実行するための基本的な方法を説明した書籍に関連している。[ 8 ]また、Pythonパッケージもある。これはNumPy配列行列に対応していますが、Sparkデータフレームへの対応はまだ実装されていません。