対応分析( CA ) は、ハーマン・オットー・ハートレー(ヒルシュフェルト) [ 2 ]によって提案され[ 1 ]、後にジャン=ポール・ベンゼクリ[ 3 ]によって発展した多変量統計手法です。概念的には主成分分析に似ていますが、連続データではなくカテゴリデータに適用されます。主成分分析と同様に、データセットを2次元のグラフ形式で表示または要約する手段を提供します。その目的は、データテーブルの多変量設定に隠された構造をバイプロットで表示することです。そのため、多変量順序付けの分野の手法です。ここで説明する CA の変種は、行または列のどちらにも焦点を当てて適用できるため、実際には単純 (対称) 対応分析と呼ぶべきです。[ 4 ]
これは従来、各セルにカウントまたはゼロ値のいずれかが含まれる名義変数のペアの分割表に適用されてきました。2 つ以上のカテゴリ変数を要約する場合は、代わりに多重対応分析と呼ばれるバリアントを選択する必要があります。存在/非存在コーディングが単純化されたカウントデータを表すため、CA はバイナリデータにも適用できます。つまり、1 は正のカウントを表し、0 はゼロのカウントを表します。使用されるスコアに応じて、CA はテーブルの行または列間のカイ二乗距離[ 5 ] [ 6 ]を維持します。CA は記述的手法であるため、有意なカイ二乗検定に関係なくテーブルに適用できます。[ 7 ] [ 8 ]推論統計で使用される統計量とカイ二乗距離は計算上関連していますが、混同してはいけません。後者はCAで多変量統計距離尺度として機能するのに対し、統計量は実際にはスカラーであり、メトリックではない。[ 9 ]
主成分分析と同様に、対応分析は直交成分(または軸)を作成し、表の各項目、つまり各行に対して、一連のスコア(因子スコアと呼ばれることもあります。因子分析を参照)を作成します。対応分析は、 m × nサイズの行列Cとして考えられるデータ テーブルに対して実行されます。ここで、 mは行数、nは列数です。この方法の次の数学的説明では、イタリック体の大文字は行列を、イタリック体の文字はベクトルを表します。次の計算を理解するには、行列代数の知識が必要です。
アルゴリズムの中心的な計算ステップに進む前に、行列Cの値を変換する必要があります。[ 10 ]まず、列と行の重み(質量と呼ばれることもあります)のセットを計算します。 [ 7 ] [ 11 ]ここで、行と列の重みは、それぞれ行ベクトルと列ベクトルによって与えられます。
ここは行列Cのすべてのセル値の合計、または略してCの合計であり、は、適切な次元を持つ、要素がすべて1の列ベクトルです。
簡単に言うと、は、要素がCの行の合計をCの合計で割ったベクトルであり、は、要素がCの列の合計をCの合計で割ったものであるベクトルです。
重みは対角行列に変換される
そして
対角要素はそしてはすなわち、ベクトル要素は質量の平方根の逆数である。非対角要素はすべて0である。
次に、行列を計算します。分割することによってその合計によって
簡単に言うと、マトリックスこれは、データ行列(分割表または二値表)を部分に変換したもので、つまり各セルの値は、表全体の合計のセル部分です。
最後に、行列を計算します。(標準化残差行列とも呼ばれる)[ 10 ]は、行列乗算によって次のように表される。
ベクトルに注目してくださいそして 外側の積で結合され、同じ次元の行列が生成されます。言葉で表すと、式は次のようになります。行列行列から減算されますそして、結果として得られる行列は、対角行列によってスケーリング(重み付け)されます。そして結果として得られる行列に対角行列を掛けることは、その行列の i 番目の行(または列)に、対角行列の i 番目の要素を掛けることと同等である。またはそれぞれ[ 12 ]。
ベクトルそしては、それぞれ行と列の質量、または行と列の周辺確率です。行列を減算します。行列からこれは、データの二重中心化の行列代数版です。この差を対角重み行列で乗算すると、ベクトル空間の原点からの重み付き偏差を含む行列が得られます。この原点は行列によって定義されます。。
実際、マトリックスは、カイ二乗検定における期待度数行列と同一である。したがってこれは、そのテストで使用された独立性モデルと計算上関連している。しかし、CAは推論手法ではないため、ここでは独立性モデルという用語は不適切である。
テーブルは特異値分解によって次のように分解される[ 10 ]。
どこそして は、の左特異ベクトルと右特異ベクトルです。そしては特異値を持つ正方対角行列であるの斜めに。寸法は したがってはm×pの次元であり、n×pの正規直交ベクトルです。そして 満たす
言い換えれば、また、現在は2つの(座標)行列に分布しているそして 対角(スケーリング)行列それらによって定義されるベクトル空間の次元数はpであり、これは行数と列数のうち小さい方の値から1を引いた値である。
主成分分析は(共)分散を分解すると言われ、その成功の尺度は最初のいくつかのPCA軸によってカバーされる(共)分散の量(固有値で測定)であるのに対し、CAは慣性と呼ばれる重み付き(共)分散で動作します。[ 13 ]二乗特異値の合計が総慣性です。データテーブルの計算結果
全慣性データテーブルの値は、直接計算することもできます。として
i 番目の特異ベクトルセットによってカバーされる慣性量は主慣性。最初のいくつかの特異ベクトルによってカバーされる慣性の割合が高いほど、つまり、総慣性に対する主慣性の合計が大きいほど、セルオートマトン(CA)はより成功していると言えます。[ 13 ]したがって、すべての主慣性値は割合として表されます。全慣性の
and are presented in the form of a scree plot. In fact a scree plot is just a bar plot of all principal inertia portions .
To transform the singular vectors to coordinates which preserve the chi-square distances between rows or columns an additional weighting step is necessary. The resulting coordinates are called principal coordinates[10] in CA text books. If principal coordinates are used for rows their visualization is called a row isometric[14] scaling in econometrics and scaling 1[15] in ecology. Since the weighting includes the singular values of the matrix of standardized residuals these coordinates are sometimes referred to as singular value scaled singular vectors, or, a little bit misleading, as eigenvalue scaled eigenvectors. In fact the non-trivial eigenvectors of are the left singular vectors of and those of are the right singular vectors of while the eigenvalues of either of these matrices are the squares of the singular values . But since all modern algorithms for CA are based on a singular value decomposition this terminology should be avoided. In the French tradition of CA the coordinates are sometimes called (factor) scores.
Factor scores or principal coordinates for the rows of matrix C are computed by
i.e. the left singular vectors are scaled by the inverse of the square roots of the row masses and by the singular values. Because principal coordinates are computed using singular values they contain the information about the spread between the rows (or columns) in the original table. Computing the euclidean distances between the entities in principal coordinates results in values that equal their chi-square distances which is the reason why CA is said to "preserve chi-square distances".
Compute principal coordinates for the columns by
CA の結果を適切なバイプロットで表現するには、主座標、つまりカイ二乗距離を保持する座標にプロットされていないカテゴリは、いわゆる標準座標にプロットする必要があります。[ 10 ]標準座標と呼ばれるのは、標準座標の各ベクトルが平均 0、分散 1 を示すように標準化されているためです。 [ 16 ]標準座標を計算する際には、特異値は省略されます。これは、 2 つの特異ベクトル行列のうちの 1 つを、特異値を 0 乗した値、つまり 1 倍した値でスケーリングし、もう 1 つの特異ベクトルが特異値でスケーリングされている場合は、特異値を省略して計算するというバイプロット ルールを適用した結果です。これにより、 2 つの座標セット間の内積の存在が保証され、バイプロットにおけるそれらの空間関係の意味のある解釈につながります。
実際には、標準座標は、主座標(すなわちそれぞれの点)の集合が「存在する」ベクトル空間の頂点と考えることができる。 [ 17 ] 行の標準座標は次のとおりである。
そして列のものは
生態学におけるスケーリング 1 [ 15 ]バイプロットは、行が主座標、列が標準座標であることを意味し、スケーリング 2は、行が標準座標、列が主座標であることを意味することに注意してください。つまり、スケーリング 1 は、と共に2 のスケーリングは、と共に。
CAの結果の可視化は、常に主慣性値のスクリープロットを表示することから始まり、最初のいくつかの特異ベクトルによる拡散の要約の成功度を評価します。
実際の順序付けはグラフで示されており、一見すると複雑な散布図と混同される可能性があります。実際には、行と列にそれぞれ点のセットを持つ2つの散布図が重ねて印刷されています。しかし、バイプロットであるため、使用される2つの座標行列には明確な解釈規則が存在します。
通常、セルオートマトン解の最初の2次元がプロットされます。これは、2次元で表示できるデータテーブルに関する情報の最大量を包含しているためです。ただし、他の次元の組み合わせについてもバイプロットで調査することができます。バイプロットは実際には、元のテーブルに含まれる情報の一部を低次元にマッピングしたものです。
一般的に、他のセットによって測定される構成に関して分析されるべきセット(行または列)は主座標で表示され、他のセットは標準座標で表示されます。例えば、投票区を行に、政党を列に表示し、各セルに集計された票数を含む表では、投票区を類似の投票に基づいて順序付けることに重点を置く場合、投票区(行)を主座標で表示することができます。
従来、CA のフランスの伝統に由来する[ 18 ]初期の CA バイプロットでは、両方のエンティティを同じ座標バージョン、通常は主座標にマッピングしていましたが、この種の表示は誤解を招く可能性があります。Rパッケージ MASS のメンテナーであるBrian Ripley氏が正しく指摘しているように、「これはバイプロットと呼ばれていますが、行と列のスコアの間に有用な内積関係はありません」。[ 19 ]今日では、一般の人々は 2 つの点セット間の関係が欠如していることに気づかないため、この種の表示は避けるべきです。
スケーリング1 [ 15 ]バイプロット (行は主座標、列は標準座標) は次のように解釈されます: [ 20 ]
対応分析(CA)には、デトレンド対応分析(DCA)や正準対応分析(CCA)など、いくつかのバリエーションがあります。後者(CCA)は、調査対象のエンティティ間の類似性の原因に関する情報がある場合に使用されます。対応分析を多数のカテゴリ変数に拡張したものを多重対応分析と呼びます。質的変数に基づく判別問題(つまり、質的データに対する判別分析)への対応分析の応用は、判別対応分析または重心判別分析と呼ばれます。
社会科学において、対応分析、特にその拡張である多重対応分析は、フランスの社会学者ピエール・ブルデューの応用によってフランス国外に知られるようになった。 [ 21 ]
ade4::dudi.coa()初心者にとって最も簡単なアプローチは、ca::ca()パッケージに付属する包括的なテキストブック[ 22 ]があるためです。ExPosition::epCA()FactoMineR::CA()MASS::corresp()vegan::cca()ca::ca()