統計学において、正準相関分析(CCA)、または正準変数分析と呼ばれるものは、相互共分散行列から情報を推測する方法です。2 つの確率変数のベクトルX = ( X 1 , ..., X n ) とY = ( Y 1 , ..., Y m ) があり、変数間に相関がある場合、正準相関分析は、互いに最大の相関を持つXとYの線形結合を見つけます。 [ 1 ] TR Knapp は、「一般的に遭遇するパラメトリック有意性検定のほぼすべては、2 つの変数セット間の関係を調査する一般的な手順である正準相関分析の特殊なケースとして扱うことができる」と述べています。[ 2 ]この方法は、 1936 年にHarold Hotellingによって初めて導入されましたが、[ 3 ]平面間の角度の文脈では、この数学的概念は1875 年にCamille Jordanによって発表されました。[ 4 ]
CCA は現在、多変量統計とマルチビュー学習の基盤となっており、確率的 CCA、スパース CCA、マルチビュー CCA、ディープ CCA [ 5 ] 、DeepGeoCCA [ 6 ]など、数多くの解釈と拡張が提案されています。残念ながら、おそらくその人気ゆえに、文献の表記法に一貫性がない場合があります。本稿では、読者が既存の文献や利用可能な技術を最大限に活用できるよう、こうした不一致点を強調することを試みます。
姉妹手法であるPCAと同様に、CCA は母集団形式 (ランダムベクトルとその共分散行列に対応) またはサンプル形式 (データセットとそのサンプル共分散行列に対応)で見ることができます。これら 2 つの形式は互いにほぼ完全に類似しているため、その違いはしばしば見落とされますが、高次元設定では非常に異なる動作をする可能性があります。[ 7 ]次に、母集団問題の明示的な数学的定義を示し、いわゆる正準分解の異なるオブジェクトを強調します。これらのオブジェクト間の違いを理解することは、この手法の解釈にとって重要です。
2つの列ベクトルが与えられた場合そして有限の2次モーメントを持つ確率変数の場合、相互共分散を定義することができる。になる行列のエントリは共分散です実際には、サンプリングされたデータに基づいて共分散行列を推定します。そして(つまり、一対のデータ行列から)。
正準相関分析はベクトルのシーケンスを求める () そして()確率変数そして相関を最大化する(スカラー)確率変数そしては最初の正準変数のペアです。次に、最初の正準変数のペアと無相関であるという制約の下で、同じ相関を最大化するベクトルを探します。これにより、2番目の正準変数のペアが得られます。この手順は まで続けることができます。回。
ベクトルの集合これらは正準方向、重みベクトル、または単に重みと呼ばれます。ベクトルの「双対」セットこれらは正準負荷ベクトルまたは単に負荷と呼ばれ、重みよりも解釈が容易な場合が多い。[ 8 ]
させては、任意の(ベクトル形状の)確率変数のペアに対する相互共分散行列である。そして最大化すべき目標関数は
最初のステップは、基準の変更を定義し、
どこそして固有値分解(または対角化)によって得られる。
そして
したがって
コーシー・シュワルツの不等式により、
ベクトルが等しい場合、そして共線である。さらに、相関の最大値は、は、行列の最大固有値を持つ固有ベクトルです。(レイリー商を参照)。次のペアは、大きさが減少する固有値を用いて求められます。相関行列の対称性により直交性が保証されます。
この計算を別の角度から見ると、そしてこれらは、XとYの相関行列の、最も高い特異値に対応する左特異ベクトルと右特異ベクトルです。
したがって、解決策は次のとおりです。
逆に、次のようなことも言える。
座標変換を逆にすると、次のようになる。
正準変数は次のように定義されます。
CCAは相関行列の特異値分解を用いて計算できます。 [ 9 ]これは[ 10 ]の関数として利用可能です。
相関行列に対する特異値分解を用いたCCA計算は、平面間の角度のコサインに関連している。コサイン関数は小さな角度に対して条件が悪く、有限精度コンピュータ演算では相関の高い主ベクトルの計算が非常に不正確になる。この問題を解決するために、代替アルゴリズム[ 12 ]が利用可能である。
各行は、次の方法で有意性を検定できます。相関関係はソートされているため、行はがゼロであるということは、それ以降のすべての相関もゼロであることを意味します。サンプル内の独立した観測とは、推定相関値です。.のために行目における検定統計量は次のとおりです。
これは漸近的にカイ二乗分布に従う。大きな自由度[ 13 ]すべての 相関関係からに論理的にゼロ(そしてそのように推定される)であるため、この後の項の積は関係ありません。
小さなサンプルサイズの限界では、そうすればトップが保証される相関係数はすべて1になるため、この検定は無意味である。[ 14 ]
実験的文脈における正準相関の典型的な使用法は、2 つの変数セットを取り、それらのセットに共通するものを調べることです。[ 15 ]例えば、心理検査では、ミネソタ多面人格目録(MMPI-2) やNEOのような、定評のある 2 つの多次元人格検査を実施することができます。MMPI-2 の因子が NEO の因子とどのように関連しているかを調べることで、検査間で共通する次元と、共有される分散の量についての洞察を得ることができます。例えば、外向性や神経症傾向の次元が、2 つの検査間で共有される分散のかなりの部分を占めていることがわかるかもしれません。
正準相関分析を用いて、例えばパフォーマンス指標のセットと説明変数のセット、あるいは出力のセットと入力のセットなど、2つの変数セットの関係を表すモデル方程式を作成することもできます。このようなモデルには、理論的な要件や直感的に明らかな条件を反映するように制約条件を課すことができます。このタイプのモデルは、最大相関モデルとして知られています。[ 16 ]
正準相関の結果の視覚化は、通常、有意な相関を示す正準変数ペアの2つの変数セットの係数の棒グラフによって行われます。一部の著者は、それらをヘリオグラフとしてプロットするのが最適であると提案しています。ヘリオグラフは、光線のような棒を持つ円形の形式で、各半分が2つの変数セットを表します。[ 17 ]
させて期待値がゼロの場合、つまり、。
どちらの場合もこれは、正準相関分析が相関のある変数と負の相関のある変数を同様に扱うことを示している。
と仮定するとそして期待値がゼロである、つまり、それらの共分散 行列そしては、のエントリの 内積のグラム行列として見ることができる。そして同様に。この解釈では、確率変数、エントリの そしての共分散によって与えられる内積を持つベクトル空間の要素として扱われる。共分散#内積との関係を参照してください。
正準変数の定義そしてこれは、のエントリによって張られる部分空間のペアの 主ベクトルの定義と同等である。そしてこの内積に関して 。正準相関主角のコサインに等しい。
CCAは、ランダムベクトルがそして白色化されたベクトル間の相互相関がそしては対角線である。[ 18 ] 正準相関は、回帰係数として解釈され、そしてまた、負の値になる場合もあります。CCAの回帰的視点では、共有および非共有の変動性を表す無相関の隠れ変数を持つ、CCAの潜在変数確率生成モデルを構築する方法も提供されます。[ 19 ]