中心が(1, 3)で、標準偏差が約(0.866, 0.5)方向で3 、直交方向で1の多変量ガウス分布 の主成分分析(PCA)。表示されているベクトルは、共分散行列 の固有ベクトル を対応する固有値の平方根でスケーリングし、裾が平均値に来るようにシフトしたものです。 主成分分析 (PCA )は、探索的データ分析 、可視化、データ前処理 に応用される線形 次元削減 手法です。
データは新しい座標系に 線形変換され 、データの中で最も大きな変動を捉える方向(主成分)を容易に特定できるようになる。
実座標空間 における点の集合の主成分は 、次のシーケンスである。p {\displaystyle p} 単位ベクトル 、ここで私 {\displaystyle i} 第 1 番目のベクトルは、最初のベクトルに直交し つつ、データに最もよく適合する直線の方向です。私 − 1 {\displaystyle i-1} ベクトル。ここで、最適近似直線は、点から直線までの 垂直 距離の二乗平均値を最小化する直線として定義されます。これらの方向(すなわち主成分)は、データの異なる個々の次元が線形的に無相関である 正規直交基底 を構成します。多くの研究では、データを2次元でプロットし、密接に関連するデータ点のクラスターを視覚的に識別するために、最初の2つの主成分を使用します。[ 1 ]
主成分分析は、集団遺伝学 、マイクロバイオーム 研究、大気科学 など、多くの分野で応用されている。[ 2 ]
概要 PCAを実行する際、一連の主成分の最初の主成分はp {\displaystyle p} 変数は、元の変数の線形結合として形成された派生変数であり、最も多くの分散を説明します。第 2 主成分は、第 1 主成分の影響を除去した後の残りの部分の分散を最も多く説明し、p {\displaystyle p} すべての分散が説明されるまで反復します。PCAは、多くの変数が互いに高い相関関係にあり、それらの数を独立したセット に減らすことが望ましい場合に最も一般的に使用されます。最初の主成分は、投影されたデータの分散を最大化する方向として定義することもできます。私 {\displaystyle i} 第 1 番目の主成分は、第 1 番目の主成分に直交する方向とみなすことができる。私 − 1 {\displaystyle i-1} 予測データの分散を最大化する主成分。
どちらの目的においても、主成分はデータの共分散行列の 固有ベクトル であることが示せる。したがって、主成分は、データ共分散行列の固有値分解またはデータ行列の 特異値分解 によって計算されることが多い。PCA は真の固有ベクトルに基づく多変量解析の中で最も単純なものであり、因子分析 と密接に関連している。因子分析は通常、基礎となる構造に関するよりドメイン固有の仮定を取り入れ、わずかに異なる行列の固有ベクトルを解く。PCA は正準相関分析 (CCA)とも関連している。CCA は 2 つのデータセット間の 相互共分散を 最適に記述する座標系を定義するが、PCA は単一のデータセットの分散を最適に記述する新しい直交座標系を定義する。 [ 3 ] [ 4 ] [ 5 ] [ 6 ] 標準 PCA の堅牢 でL1 ノルム に基づく変種も提案されている。[ 7 ] [ 8 ] [ 9 ] [ 6 ]
直感 スクリープロットは、主成分分析(PCA)の結果を解釈し、保持する成分数を決定するのに役立つ図です。直線の屈曲点(変曲点または「膝」)は、保持する成分数を示します。したがって、この例では、3つの因子を保持する必要があります。 主成分分析(PCA)は、データにp 次元楕円体 を当てはめるものと考えることができます。この楕円体の各軸は主成分を表します。楕円体のいずれかの軸が小さい場合、その軸に沿った分散も小さくなります。
楕円体の軸を求めるには、まずデータセット内の各変数の値を、それぞれの観測値の平均を減算することで、0 を中心とする必要があります。変換された値は、各変数の元の観測値の代わりに使用されます。次に、データの共分散行列を計算し、この共分散行列の固有値と対応する固有ベクトルを計算します。その後、各直交固有ベクトルを 正規化して 単位ベクトルに変換する必要があります。これが完了すると、互いに直交する各単位固有ベクトルは、データに適合した楕円体の軸として解釈できます。この基底の選択により、共分散行列は対角化された形式に変換され、対角要素は各軸の分散を表します。各固有ベクトルが表す分散の割合は、その固有ベクトルに対応する固有値をすべての固有値の合計で割ることによって計算できます。
主成分分析の結果を解釈するために、バイプロット とスクリープロット( 説明される分散 の度合い)が使用されます。
詳細 PCAは、実内積空間上の 直交 線形変換 として定義され、データを新しい座標系 に変換することで、データの何らかのスカラー投影による最大の分散が最初の座標(第1主成分と呼ばれる)上に、2番目に大きな分散が2番目の座標上に、といった具合に分布するようにします。[ 13 ]
を考えてn × p {\displaystyle n\times p} データ行列 X は 、列ごとの経験平均 がゼロ(各列の標本平均がゼロにシフトされている)であり、n 行はそれぞれ実験の異なる繰り返しを表し、p 列はそれぞれ特定の種類の特徴(例えば、特定のセンサーからの結果)を示します。
数学的には、変換はサイズの集合によって定義されるl {\displaystyle l} (どこl {\displaystyle l} 通常は厳密に以下になるように選択されます。p {\displaystyle p} 次元を削減するためにp {\displaystyle p} 重みまたは係数の次元ベクトルw ( k ) = ( w 1 、 … 、 w p ) ( k ) {\displaystyle \mathbf {w} _{(k)}=(w_{1},\dots ,w_{p})_{(k)}} 各行ベクトルをマッピングするx ( 私 ) = ( x 1 、 … 、 x p ) ( 私 ) {\displaystyle \mathbf {x} _{(i)}=(x_{1},\dots ,x_{p})_{(i)}} X を主成分スコアの新しいベクトルに変換する t ( 私 ) = ( t 1 、 … 、 t l ) ( 私 ) \displaystyle \mathbf {t} _{(i)}=(t_{1},\dots ,t_{l})_{(i)}} によって与えられた
t k ( 私 ) = x ( 私 ) ⋅ w ( k ) f o r 私 = 1 、 … 、 n k = 1 、 … 、 l \displaystyle t_{k}}_{(i)}=\mathbf {x} _{(i)}\cdot \mathbf {w} _{(k)}\qquad \mathrm {for} \qquad i=1,\dots ,n\qquad k=1,\dots ,l} 個々の変数がt 1 、 … 、 t l t_1, t_l データセット全体にわたって考慮されるt は、 X から可能な限り最大の分散を継承し、各係数ベクトルwは 単位ベクトル となるように制約されます。
上記は、行列形式で次のように表すこともできます。
T = X W {\displaystyle \mathbf {T} =\mathbf {X} \mathbf {W} } どこ T 私 k = t k ( 私 ) {\displaystyle {\mathbf {T} }_{ik}={t_{k}}_{(i)}} 、 X 私 j = x j ( 私 ) {\displaystyle {\mathbf {X} }_{ij}={x_{j}}_{(i)}} 、 そして W j k = w j ( k ) {\displaystyle {\mathbf {W} }_{jk}={w_{j}}_{(k)}} 。
最初のコンポーネント 分散を最大化するために、最初の重みベクトルw (1) は 以下を満たす必要がある。
w ( 1 ) = 引数 最大 ‖ w ‖ = 1 { ∑ 私 ( t 1 ) ( 私 ) 2 } = 引数 最大 ‖ w ‖ = 1 { ∑ 私 ( x ( 私 ) ⋅ w ) 2 } {\displaystyle \mathbf {w} _{(1)}=\arg \max _{\Vert \mathbf {w} \Vert =1}\,\left\{\sum _{i}(t_{1})_{(i)}^{2}\right\}=\arg \max _{\Vert \mathbf {w} \Vert =1}\,\left\{\sum _{i}\left(\mathbf {x} _{(i)}\cdot \mathbf {w} \right)^{2}\right\}} 同様に、これを行列形式で書くと次のようになる。
w ( 1 ) = 引数 最大 ‖ w ‖ = 1 { ‖ X w ‖ 2 } = 引数 最大 ‖ w ‖ = 1 { w T X T X w } {\displaystyle \mathbf {w} _{(1)}=\arg \max _{\left\|\mathbf {w} \right\|=1}\left\{\left\|\mathbf {Xw} \right\|^{2}\right\}=\arg \max _{\left\|\mathbf {w} \right\|=1}\left\{\mathbf {w} ^{\mathsf {T}}\mathbf {X} ^{\mathsf {T}}\mathbf {Xw} \right\}} w (1) は単位ベクトルとして定義されているので、等価的に次の条件も満たします。
w ( 1 ) = 引数 最大 { w T X T X w w T w } {\displaystyle \mathbf {w} _{(1)}=\arg \max \left\{{\frac {\mathbf {w} ^{\mathsf {T}}\mathbf {X} ^{\mathsf {T}}\mathbf {Xw} }{\mathbf {w} ^{\mathsf {T}}\mathbf {w} }}\right\}} 最大化すべき量はレイリー商 として認識できます。X T X のような正定値半行列の標準的 な 結果として、商の最大値は行列の最大固有値であり、これは w が対応する固有ベクトル である場合に発生します。
w (1) が見つかると、データベクトルx ( i ) の最初の主成分は、変換された座標でスコアt 1( i ) = x ( i ) ⋅ w (1) として、または元の変数での対応するベクトル { x ( i ) ⋅ w (1) } w (1) として与えられます。
その他の構成要素 k 番目の成分は、 X から最初のk − 1 個の主成分を差し引くことによって求められます。
X ^ k = X − ∑ s = 1 k − 1 X w ( s ) w ( s ) T {\displaystyle \mathbf {\hat {X}} _{k}=\mathbf {X} -\sum _{s=1}^{k-1}\mathbf {X} \mathbf {w} _{(s)}\mathbf {w} _{(s)}^{\mathsf {T}}} そして、この新しいデータ行列から最大の分散を抽出する重みベクトルを見つける。
w ( k ) = 1 r g m 1 x ‖ w ‖ = 1 { ‖ X ^ k w ‖ 2 } = 引数 最大 { w T X ^ k T X ^ k w w T w } {\displaystyle \mathbf {w} _{(k)}=\mathop {\operatorname {arg\,max} } _{\left\|\mathbf {w} \right\|=1}\left\{\left\|\mathbf {\hat {X}} _{k}\mathbf {w} \right\|^{2}\right\}=\arg \max \left\{{\tfrac {\mathbf {w} ^{\mathsf {T}}\mathbf {\hat {X}} _{k}^{\mathsf {T}}\mathbf {\hat {X}} _{k}\mathbf {w} }{\mathbf {w} ^{T}\mathbf {w} }}\right\}} 結果として、これはX T X の残りの固有ベクトルを与え、括弧内の量の最大値は対応する固有値によって与えられます。したがって、重みベクトルはX T X の固有ベクトルです。
したがって、データベクトルx ( i )の k 番目の主成分は、変換された座標におけるスコアt k ( i ) = x ( i ) ⋅ w ( k )として、または元の変数空間における対応するベクトル { x ( i ) ⋅ w ( k ) } w ( k ) として与えることができます。ここで、w ( k )は X T X のk 番目の固有ベクトルです。
したがって、 X の完全な主成分分解は次のように表すことができます。
T = X W {\displaystyle \mathbf {T} =\mathbf {X} \mathbf {W} } ここで、Wは p × p の重み行列であり、その列 は X T X の固有ベクトルです。W の転置は、ホワイトニング変換または球面化変換 と呼ばれることもあります。W の列に、対応する固有値の平方根を掛けたもの、つまり分散でスケーリングされた固有ベクトルは、 PCA または因子分析ではローディング と呼ばれます。
共分散 X T X 自体は、データセットXの経験的標本 共分散行列 に比例すると認識できる。[ 13 ] : 30–31
データセット全体における2つの異なる主成分間の標本共分散Qは、次のように表されます。
Q ( P C ( j ) 、 P C ( k ) ) ∝ ( X w ( j ) ) T ( X w ( k ) ) = w ( j ) T X T X w ( k ) = w ( j ) T λ ( k ) w ( k ) = λ ( k ) w ( j ) T w ( k ) {\displaystyle {\begin{aligned}Q(\mathrm {PC} _{(j)},\mathrm {PC} _{(k)})&\propto (\mathbf {X} \mathbf {w} _{(j)})^{\mathsf {T}}(\mathbf {X} \mathbf {w} _{(k)})\\&=\mathbf {w} _{(j)}^{\mathsf {T}}\mathbf {X} ^{\mathsf {T}}\mathbf {X} \mathbf {w} _{(k)}\\&=\mathbf {w} _{(j)}^{\mathsf {T}}\lambda _{(k)}\mathbf {w} _{(k)}\\&=\lambda _{(k)}\mathbf {w} _{(j)}^{\mathsf {T}}\mathbf {w} _{(k)}\end{aligned}}} ここで、 w ( k ) の固有値特性を利用して、2 行目から 3 行目へ移動しました。ただし、対称行列の固有値に対応する固有ベクトルw ( j ) とw ( k ) は、(固有値が異なる場合)直交するか、(ベクトルが同じ繰り返し値を共有する場合)直交化できます。したがって、最終行の積はゼロになります。データセット全体で、異なる主成分間にサンプル共分散はありません。
したがって、主成分変換を特徴づけるもう一つの方法は、経験的サンプル共分散行列を対角化する座標への変換として捉えることである。
行列形式では、元の変数の経験的共分散行列は次のように記述できます。
Q ∝ X T X = W Λ W T {\displaystyle \mathbf {Q} \propto \mathbf {X} ^{\mathsf {T}}\mathbf {X} =\mathbf {W} \mathbf {\Lambda } \mathbf {W} ^{\mathsf {T}}} 主成分間の経験的共分散行列は次のようになる。
W T Q W ∝ W T W Λ W T W = Λ {\displaystyle \mathbf {W} ^{\mathsf {T}}\mathbf {Q} \mathbf {W} \propto \mathbf {W} ^{\mathsf {T}}\mathbf {W} \,\mathbf {\Lambda } \,\mathbf {W} ^{\mathsf {T}}\mathbf {W} =\mathbf {\Lambda } } ここで、Λは X T X の固有値λ ( k ) の対角行列です。λ ( k )は 、各コンポーネント k に関連付けられたデータセットの二乗の合計に等しく、つまり、λ ( k ) = Σ i t k 2 ( i ) = Σ i ( x ( i ) ⋅ w ( k ) ) 2 です 。
特異値分解 主成分変換は、別の行列分解であるXの 特異値分解 (SVD)と関連付けることもできます。
X = U Σ W T {\displaystyle \mathbf {X} =\mathbf {U} \mathbf {\Sigma } \mathbf {W} ^{T}} ここで、Σは、 X の特異値と呼ばれる正の数σ ( k )の n × p の 長方形対角行列 です。U は、列が 長さnの直交単位ベクトルである n × n 行列で、 X の左特異ベクトルと呼ばれます。Wは、列が長さ p の直交単位ベクトルであるp × p 行列で、 X の右特異ベクトルと呼ばれます。
この因数分解の観点から、行列X T X は 次のように書くことができる。
X T X = W Σ T U T U Σ W T = W Σ T Σ W T = W Σ ^ 2 W T {\displaystyle {\begin{aligned}\mathbf {X} ^{T}\mathbf {X} &=\mathbf {W} \mathbf {\Sigma } ^{\mathsf {T}}\mathbf {U} ^{\mathsf {T}}\mathbf {U} \mathbf {\Sigma } \mathbf {W} ^{\mathsf {T}}\\&=\mathbf {W} \mathbf {\Sigma } ^{\mathsf {T}}\mathbf {\Sigma } \mathbf {W} ^{\mathsf {T}}\\&=\mathbf {W} \mathbf {\hat {\Sigma }} ^{2}\mathbf {W} ^{\mathsf {T}}\end{aligned}}} どこΣ ^ {\displaystyle \mathbf {\hat {\Sigma }} } X の特異値と余分なゼロが切り捨てられた正方対角行列は、次の式を満たす。Σ ^ 2 = Σ T Σ {\displaystyle \mathbf {{\hat {\Sigma }}^{2}} =\mathbf {\Sigma } ^{\mathsf {T}}\mathbf {\Sigma } } X T X の固有ベクトル分解との比較により、X の右特異ベクトルWは X T X の固有ベクトルと等価であることが確立され、一方、特異値σ ( k ) はX {\displaystyle \mathbf {X} } は、 X T X の固有値λ ( k ) の平方根に等しい。
特異値分解を用いると、スコア行列T は次のように書ける。
T = X W = U Σ W T W = U Σ {\displaystyle {\begin{aligned}\mathbf {T} &=\mathbf {X} \mathbf {W} \\&=\mathbf {U} \mathbf {\Sigma } \mathbf {W} ^{\mathsf {T}}\mathbf {W} \\&=\mathbf {U} \mathbf {\Sigma } \end{aligned}}} したがって、 T の各列は、X の左特異ベクトルのいずれかに、対応する特異値を乗じたもので与えられます。この形式は、T の極分解 でもあります。
行列X T Xを形成することなく X の SVD を計算する効率的なアルゴリズムが存在するため、ごく少数の成分しか必要としない場合を除き、SVD を計算することがデータ行列から主成分分析を計算する標準的な方法となっています[ 16 ] 。
固有値分解と同様に、最初の L 個の最大の特異値とその特異ベクトルのみを考慮することで、切り捨てられたn × L スコア行列T Lを得ることができます。
T L = U L Σ L = X W L {\displaystyle \mathbf {T} _{L}=\mathbf {U} _{L}\mathbf {\Sigma } _{L}=\mathbf {X} \mathbf {W} _{L}} このように特異値分解を切り捨てて行列M またはTを切り捨てると、切り捨てられた行列は、2 つの行列の差が最小の フロベニウス ノルム を持つという意味で、元の行列に最も近いランク Lの行列になります。これは、 エッカート-ヤングの定理 [1936]として知られる結果です。
定理(最適なk次元適合)。P を列が平均中心化およびスケーリングされたn×mデータ行列とし、 P = U Σ V T {\displaystyle P=U\,\Sigma \,V^{T}} その特異値分解を とする。すると、最小二乗法(フロベニウスノルム)の意味で P に対する最良のランク k 近似は、 P k = U k Σ k V k T {\displaystyle P_{k}=U_{k}\,\Sigma _{k}\,V_{k}^{T}} ここで、V k は V の最初の k 列から構成される。さらに、相対残差分散は R ( k ) = ∑ j = k + 1 m σ j 2 ∑ j = 1 m σ j 2 {\displaystyle R(k)={\frac {\sum _{j=k+1}^{m}\sigma _{j}^{2}}{\sum _{j=1}^{m}\sigma _{j}^{2}}}} 。
[ 14 ]
さらなる検討事項 特異値 ( Σ 内) は、行列X T Xの 固有値 の平方根です。各固有値は、各固有ベクトルに関連付けられた「分散」(より正確には、点の多次元平均からの二乗距離の合計) の割合に比例します。すべての固有値の合計は、点の多次元平均からの二乗距離の合計に等しくなります。PCA は基本的に、点の集合をその平均を中心に回転させて主成分に合わせます。これにより、可能な限り多くの分散 (直交変換を使用) が最初の数次元に移動します。したがって、残りの次元の値は小さくなる傾向があり、最小限の情報損失で削除できます (下記参照) 。PCA は、 次元削減 のためにこの方法でよく使用されます。PCA は、最大の「分散」(上記で定義) を持つ部分空間を保持するための最適な直交変換であるという特徴があります。しかしながら、この利点は、例えば離散コサイン変換 、特に「DCT」として知られているDCT-IIと比較した場合、計算負荷が大きくなるという代償を伴います。非線形次元削減 手法は、PCAよりも計算負荷が高い傾向があります。
PCAは変数のスケーリングに敏感である。数学的には、この感度は、リスケーリングによってPCAが対角化するサンプル共分散行列が変化する方法に起因する。[ 14 ]
させてX c {\displaystyle \mathbf {X} _{\text{c}}} *中心化された*データ行列(n 行、p 列)とし、共分散を定義します。 Σ = 1 n X c T X c 。 {\displaystyle \Sigma ={\frac {1}{n}}\,\mathbf {X} _{\text{c}}^{\mathsf {T}}\mathbf {X} _{\text{c}}.} もしj {\displaystyle j} 第 1 番目の変数に係数を掛けますα j {\displaystyle \alpha _{j}} 我々は得る X c ( α ) = X c D 、 D = 診断 ( α 1 、 … 、 α p ) 。 {\displaystyle \mathbf {X} _{\text{c}}^{(\alpha )}=\mathbf {X} _{\text{c}}D,\qquad D=\operatorname {diag} (\alpha _{1},\ldots ,\alpha _{p}).} したがって、新しい共分散は Σ ( α ) = D T Σ D 。 {\displaystyle \Sigma ^{(\alpha )}=D^{\mathsf {T}}\,\Sigma \,D.}
固有値と固有ベクトルはΣ ( α ) {\displaystyle \Sigma ^{(\alpha )}} はΣ {\displaystyle \Sigma } スケーリングD {\displaystyle D} 主軸は、分散が膨張した列の方向に回転します。これは、以下の 2 次元の例で正確に示されています。
変数が 2 つだけで、標本分散が 同じで完全に相関している場合、PCA では 45° の回転が必要となり、主成分に対する 2 つの変数の「重み」(回転のコサイン)は等しくなります。しかし、最初の変数のすべての値を 100 倍すると、最初の主成分はその変数とほぼ同じになり、他の変数からの寄与は小さくなりますが、2 番目の主成分は元の 2 番目の変数とほぼ一致します。つまり、異なる変数の単位が異なる場合 (温度と質量など)、PCA はやや恣意的な分析方法となります。(たとえば、摂氏ではなく華氏を使用した場合、異なる結果が得られます。) ピアソンの元の論文のタイトルは「空間内の点のシステムへの最もよく適合する線と平面について」でした。「空間内」とは、このような懸念が生じない物理的なユークリッド空間を意味します。主成分分析(PCA)の恣意性を低減する一つの方法は、データを標準化して単位分散となるように変数をスケーリングし、自己共分散行列の代わりに自己相関行列をPCAの基礎として使用することである。しかし、この方法では信号空間のすべての次元における変動が単位分散に圧縮(または拡大)されることになる。
古典的なPCAは、点群がすでに平行移動されて重心が原点にあることを前提としている。[ 14 ]
各観察結果を次のように記述します。 q 私 = μ + z 私 、 μ = 1 n ∑ 私 = 1 n q 私 。 {\displaystyle \mathbf {q} _{i}={\boldsymbol {\mu }}+\mathbf {z} _{i},\qquad {\boldsymbol {\mu }}={\tfrac {1}{n}}\sum _{i=1}^{n}\mathbf {q} _{i}.}
差し引かずにμ {\displaystyle {\boldsymbol {\mu }}} 我々は事実上対角線を描いている
Σ unc = n μ μ T + 1 n Z T Z 、 {\displaystyle \Sigma _{\text{unc}}\;=\;n\,{\boldsymbol {\mu }}{\boldsymbol {\mu }}^{\mathsf {T}}\;+\;{\tfrac {1}{n}}\,\mathbf {Z} ^{\mathsf {T}}\mathbf {Z} ,}
どこZ {\displaystyle \mathbf {Z} } は中心化された行列です。ランク1の項n μ μ T {\displaystyle n\,{\boldsymbol {\mu }}{\boldsymbol {\mu }}^{\mathsf {T}}} 多くの場合、支配的となり、主要な固有ベクトルをほぼ正確に平均値に向けさせ、中心部分の構造を完全に消し去ってしまう。Z {\displaystyle \mathbf {Z} } 平均値を差し引くと、その項は消滅し、主軸は最大分散の真の方向と一致する。
相関行列に対して主成分分析を実行する場合、相関を計算した後データは既に中心化されているため、平均中心化は不要です。相関は、2 つの標準スコア (Z スコア) または統計モーメントのクロス積から導出されます (そのため、ピアソン積率相関係数という名前が付けられています)。また、Kromrey と Foster-Johnson (1998) による 「調整回帰における平均中心化: 大騒ぎするほどのことではない」 という記事も参照してください。共分散は正規化された変数 ( Z スコアまたは標準スコア) の相関であるため、 X の相関行列に基づく PCA は、 X の標準化バージョンである Z の共分散行列に基づく PCA と等しく なります。
PCAはパターン認識 における一般的な主要手法です。しかし、クラス分離性には最適化されていません。[ 17 ] ただし、主成分空間における各クラスの重心を計算し、2つ以上のクラスの重心間のユークリッド距離を報告することで、2つ以上のクラス間の距離を定量化するために使用されてきました。[ 18 ] 線形判別分析は 、クラス分離性に最適化された代替手法です。
特性と制限
制限事項 前述のように、PCAの結果は変数のスケーリングに依存します。これは、各特徴量をその標準偏差でスケーリングすることで解決でき、最終的に単位分散を持つ無次元の特徴量が得られます。[ 19 ]
上述のように、PCAの適用範囲は、その導出時になされた特定の(暗黙の)仮定[ 20 ] によって制限されます。特に、PCAは特徴間の線形相関を捉えることができますが、この仮定が破られると失敗します(参考文献の図6aを参照)。場合によっては、座標変換によって線形性の仮定を回復し、PCAを適用することができます(カーネルPCAを 参照)。
もう一つの制限は、PCA の共分散行列を構築する前の平均値除去プロセスです。天文学などの分野では、すべての信号が非負であり、平均値除去プロセスによって一部の天体物理学的露出の平均がゼロになり、結果として非物理的な負のフラックスが生成されます[ 21 ]。 信号の真の大きさを回復するには、順方向モデリングを実行する必要があります。[ 22 ] 代替方法として、行列内の非負の要素のみに焦点を当てた非負行列因子分解は 、天体物理学的観測に適しています。[ 23 ] [ 24 ] [ 25 ] PCA と非負行列因子分解の関係 については、こちらをご覧ください。
PCAは、アルゴリズムを適用する前にデータが標準化されていない場合、不利になります。PCAは元のデータをそのデータの主成分に関連するデータに変換するため、新しいデータ変数は元のデータ変数と同じ方法で解釈することはできません。これらは元の変数の線形解釈です。また、PCAが適切に実行されない場合、情報損失の可能性が高くなります。[ 26 ]
PCAは線形モデルに依存しています。データセットに非線形なパターンが隠れている場合、PCAは実際には分析を全く逆の方向に進めてしまう可能性があります。[ 27 ] カンザス州立大学の研究者は、実験におけるサンプリング誤差がPCAの結果のバイアスに影響を与えることを発見しました。「被験者数またはブロック数が30未満の場合、および/または研究者が最初のPC以降のPCに関心がある場合は、PCAを実行する前に、まず自己相関を補正した方が良いかもしれません。」[ 28 ] カンザス州立大学の研究者はまた、PCAは「データの自己相関構造が正しく処理されない場合、深刻なバイアスを受ける可能性がある」ことも発見しました。[ 28 ]
共分散法を用いた計算 以下は、相関法[ 34 ] とは対照的に、共分散法[ 33 ]を用いたPCAの詳細な説明である。
目標は、次元p のデータセットX を 、 より小さな次元L のデータセットYに変換することです。言い換えれば、行列 X のカルーネン・レーヴェ 変換 (KLT) である行列Y を求めようとしています。
Y = K L T { X } {\displaystyle \mathbf {Y} =\mathbb {KLT} \{\mathbf {X} \}}
データセットを整理する
p 個の変数からなる観測値の集合データがあるとします。そして、各観測値をL個 の変数(L < p )だけで記述できるようにデータを削減したいとします。さらに、データはn個の データベクトルの集合として構成されているとします。x 1 … x n {\displaystyle \mathbf {x} _{1}\ldots \mathbf {x} _{n}} それぞれx 私 {\displaystyle \mathbf {x} _{i}} p 個の変数をグループ化した単一の観測値を表す。
書くx 1 … x n {\displaystyle \mathbf {x} _{1}\ldots \mathbf {x} _{n}} 行ベクトルとして、それぞれp 個の要素を持つ。 行ベクトルをn × p 次元の単一行列X に格納します。経験平均を計算する 各列j = 1, ..., p に沿って経験平均を求めます。 計算された平均値を、 p × 1次元の経験的平均ベクトルu に格納します。u j = 1 n ∑ 私 = 1 n X 私 j {\displaystyle u_{j}={\frac {1}{n}}\sum _{i=1}^{n}X_{ij}} 平均からの偏差を計算する
平均値の減算は、データの近似における平均二乗誤差を最小化する主成分基底を見つけるための解決策の不可欠な部分である。[ 35 ] したがって、次のようにデータを中心化して進めます。
経験平均ベクトルを減算するu T {\displaystyle \mathbf {u} ^{T}} データ行列X の各行から。 平均値を差し引いたデータをn × p 行列B に格納します。B = X − h u T {\displaystyle \mathbf {B} =\mathbf {X} -\mathbf {h} \mathbf {u} ^{T}} ここで、h はすべて1からなるn ×1 の列ベクトルである 。h 私 = 1 のために 私 = 1 、 … 、 n {\displaystyle h_{i}=1\,\qquad \qquad {\text{for }}i=1,\ldots ,n} 一部のアプリケーションでは、各変数(B の列)の分散が 1 に等しくなるようにスケーリングされる場合もあります(Z スコアを 参照)。[ 36 ] この手順は計算された主成分に影響を与えますが、異なる変数を測定するために使用される単位とは独立します。
共分散行列を求めます 行列B からp × p の経験的共分散行列 C を求めよ。C = 1 n − 1 B * B {\displaystyle \mathbf {C} ={1 \over {n-1}}\mathbf {B} ^{*}\mathbf {B} } どこ* {\displaystyle *} は共役転置 演算子です。Bがすべて実数で構成されている場合(多くのアプリケーションでこのケースに該当します)、共役転置は通常の 転置 と同じです。共分散を計算する際にn の代わりにn − 1 を使用する理由は、ベッセルの補正によるもの です。 共分散行列の固有ベクトルと固有値を求めよ。 共分散行列C を 対角化する 固有ベクトル行列Vを計算します 。V − 1 C V = D {\displaystyle \mathbf {V} ^{-1}\mathbf {C} \mathbf {V} =\mathbf {D} } ここで、Dは C の固有値 の対角行列 です。このステップでは、通常、 固有ベクトルと固有値を計算する ためのコンピュータベースのアルゴリズムを使用します。これらのアルゴリズムは、 SAS 、[ 37 ] R 、MATLAB 、[ 38 ] [ 39 ] Mathematica 、[ 40 ] SciPy 、IDL ( Interactive Data Language )、GNU Octave 、OpenCV など、ほとんどの行列代数システムのサブコンポーネントとしてすぐに利用できます。 行列Dは p × p 対角行列の形をとります。D k ℓ = λ k のために k = ℓ {\displaystyle D_{k\ell }=\lambda _{k}\qquad {\text{for }}k=\ell } は共分散行列Cの j 番目の固有値であり、D k ℓ = 0 のために k ≠ ℓ 。 {\displaystyle D_{k\ell }=0\qquad {\text{for }}k\neq \ell .} 行列Vも p × p の次元であり、それぞれ長さpの p 個の列ベクトルを含み、これらは共分散行列Cの p 個 の固有ベクトルを表します。 固有値と固有ベクトルは順序付けられ、ペアになっています。j番目の固有値は、j 番目 の固有ベクトルに対応します。 行列Vは、 右 固有ベクトル行列(左 固有ベクトル行列とは対照的に)を表します。一般に、右固有ベクトル行列は、左固有ベクトル行列の(共役)転置行列である必要はありません。 固有ベクトルと固有値を並べ替える 固有ベクトル行列V と固有値行列Dの列を、固有値の 降順 に並べ替えます。 各行列の列間の正しい組み合わせを維持するようにしてください。 各固有ベクトルの累積エネルギー含有量を計算する 固有値は、ソースデータのエネルギーが 各固有ベクトルに分配された状態を表し、固有ベクトルはデータの基底 を形成します。j 番目の固有ベクトルの累積エネルギー含有量gは、 1から j までのすべての固有値のエネルギー含有量の合計を、すべての固有値のエネルギー含有量の合計で割った値です (ステップ 8 に示されています)。g j = ∑ k = 1 j D k k のために j = 1 、 … 、 p {\displaystyle g_{j}=\sum _{k=1}^{j}D_{kk}\qquad {\text{for }}j=1,\dots ,p} 固有ベクトルのサブセットを基底ベクトルとして選択する V の最初のL列を p × L 行列W として保存します。W k l = V k ℓ のために k = 1 、 … 、 p ℓ = 1 、 … 、 L {\displaystyle W_{kl}=V_{k\ell }\qquad {\text{for }}k=1,\dots ,p\qquad \ell =1,\dots ,L} どこ1 ≤ L ≤ p 。 {\displaystyle 1\leq L\leq p.} ベクトルg を参考にして、 L の適切な値を選択します。目標は、パーセンテージベースでgの値が妥当な高さになるように、 L の値をできるだけ小さくすることです。たとえば、累積エネルギーg が90 パーセントなどの特定の閾値を超えるように L を 選択したい場合があります。この場合、L の最小値を選択します。g L g p ≥ 0.9 {\displaystyle {\frac {g_{L}}{g_{p}}}\geq 0.9} データを新しい基底に投影する 投影されたデータポイントは行列の行ですT = B ⋅ W {\displaystyle \mathbf {T} =\mathbf {B} \cdot \mathbf {W} } つまり、最初の列はT {\displaystyle \mathbf {T} } 1列目はデータポイントを第1主成分に投影したもので、2列目は第2主成分に投影したもの、といった具合です。
共分散法を用いた導出 Xを列ベクトルとして表される d 次元の確率ベクトルとする。一般性を失うことなく、Xの 平均はゼロであると仮定する。
私たちは見つけたいと思っています( * ) {\displaystyle (\ast )} d × d の 正規 直交変換行列 P により、PX は 対角共分散行列を持つ(つまり、PX は すべての異なる成分が互いに無相関であるランダムベクトルである)。
簡単な計算を仮定するとP {\displaystyle P} 収率は100%でした。
カバー ( P X ) = E [ P X ( P X ) * ] = E [ P X X * P * ] = P E [ X X * ] P * = P カバー ( X ) P − 1 {\displaystyle {\begin{aligned}\operatorname {cov} (PX)&=\operatorname {E} [PX~(PX)^{*}]\\&=\operatorname {E} [PX~X^{*}P^{*}]\\&=P\operatorname {E} [XX^{*}]P^{*}\\&=P\operatorname {cov} (X)P^{-1}\\\end{aligned}}} したがって( * ) {\displaystyle (\ast )} 成り立つのは、カバー ( X ) {\displaystyle \operatorname {cov} (X)} は対角化可能であったP {\displaystyle P} 。
これは非常に建設的です。なぜなら、cov( X ) は非負定値行列であることが保証されており、したがって何らかのユニタリ行列によって対角化できることが保証されているからです。
共分散のない計算 実際の実装、特に高次元データ (大きなp )の場合、共分散行列を明示的に決定するための計算コストとメモリコストが高いため、単純な共分散法は効率的ではないため、ほとんど使用されません。共分散フリーのアプローチでは、共分散行列X T X を明示的に計算して保存するnp 2 回の演算を回避し、代わりに、例えば、積 X T (X r) を評価する関数に基づく行列フリーの方法のいずれかを 2 np 回 の演算で利用します。
反復計算 共分散行列を計算することなく、平均がゼロのデータ行列X に対して、第一主成分を効率的に計算する方法の 1 つを次の擬似コードに示します[ 41 ] 。
r = 長さp のランダムベクトルr = r / norm( r )c 回 繰り返す: s = 0 (長さp のベクトル) X の 各行xについて s = s + ( x ⋅ r ) x λ = r T s // λ は固有値 error = |λ ⋅ r − s | r = s / norm( s ) error < tolerance の場合は終了する return λ, r このべき乗反復 アルゴリズムは、ベクトルX T (X r) を計算し、正規化して、結果をr に戻します。固有値は、共分散行列X T X の単位ベクトルr のレイリー商 であるr T (X T X) r で近似されます。最大の特異値が次に大きい特異値から十分に離れている場合、ベクトルr は、 p に比べて小さい反復回数c以内に X の最初の主成分に近づき、総コストは2cnp になります。ランチョスアルゴリズム や局所最適ブロック前処理共役勾配法 (LOBPCG ) などのより高度な行列フリー法を使用すると、 反復 ごとの小さなコストを著しく犠牲にすることなく、べき乗反復の 収束を加速できます。
後続の主成分は、デフレーションによって 1 つずつ計算することも、ブロックとして同時に計算することもできます。前者のアプローチでは、既に計算された近似主成分の不正確さが、後続の主成分の精度に加算的に影響を与え、新しい計算ごとに誤差が増加します。後者のアプローチであるブロックべき乗法では、単一ベクトル r と s をブロックベクトル、行列 R と S に置き換えます。R の 各列 は、 主要な 主成分の 1 つを近似し、すべての列が同時に反復されます。主な計算は、積X T (XR) の評価です。たとえばLOBPCG で実装されている効率的なブロッキングは、誤差の蓄積を排除し、高レベルのBLAS 行列積関数の使用を可能にし、通常、単一ベクトルを 1 つずつ計算する手法と比較して、より高速な収束につながります。
NIPALS法 非線形反復部分最小二乗法 (NIPALS)は、主成分分析または 部分最小二乗 分析の最初のいくつかの成分を計算するために実装された、減算による行列縮小を伴う古典的なべき乗反復法 の変種です。オミクス科学 (例えば、ゲノミクス 、メタボロミクス ) で生成されるような非常に高次元のデータセットの場合、通常は最初のいくつかの PC を計算するだけで十分です。非線形反復部分最小二乗 法 (NIPALS) アルゴリズムは、各反復で左と右にX を乗じるべき乗反復法 によって、主要なスコアとローディングt 1 とr 1 Tの反復近似を更新します。つまり、共分散行列の計算は回避されます。これは、積 X T (X r) = ((X r) T X) T を評価する関数に基づいて、X T X へのべき乗反復法の行列フリー実装と同様です。
行列の減算による縮小は、外積t 1 r 1 T を X から減算することによって実行され、縮小された残差行列が残され、後続の主成分を計算するために使用されます。[ 42 ] 大規模なデータ行列、または列の共線性が高い行列の場合、NIPALS は、各反復で蓄積される機械精度の丸め誤差 と減算による行列の縮小により、主成分の直交性を失います。[ 43 ] この直交性の喪失を解消するために、各反復ステップでスコアと負荷の両方にグラム-シュミット 再直交化アルゴリズムが適用されます。[ 44 ] NIPALSは単一ベクトル乗算に依存しているため、高レベルのBLASを活用できず、クラスター化された先頭特異値の収束が遅くなるという問題があります。これらの欠点は、局所最適ブロック前処理共役勾配法( LOBPCG )などのより洗練された行列フリーブロックソルバーで解決されます。
オンライン/逐次推定データが単一のバッチに保存されるのではなく、断片的に到着する「オンライン」または「ストリーミング」状況では、順次更新できるPCA投影の推定を行うことが有用です。これは効率的に行うことができますが、異なるアルゴリズムが必要です。[ 45 ]
アプリケーション
知能 因子分析の初期の応用は、人間の知能の構成要素を特定し測定することであった。知能には空間知能、言語知能、帰納、演繹など、相関のないさまざまな構成要素があり、これらのスコアはさまざまなテストの結果から因子分析によって導き出され、知能指数 (IQ)として知られる単一の指標が得られると考えられていた。統計心理学の先駆者であるスピアマンは、 1904年に知能の 2因子理論 のために因子分析を開発し、心理測定 学に正式な手法を加えた。1924年、サーストンは 知能の56の因子を探し、精神年齢の概念を発展させた。今日の標準的なIQテストは、この初期の研究に基づいている。[ 53 ]
居住地の分化 1949年、シェフキーとウィリアムズは因子生態学 の理論を導入し、これは1950年代から1970年代にかけて居住地の分化の研究を支配した。[ 54 ] 都市内の近隣地域は、因子分析によって3つに集約できるさまざまな特徴によって認識または区別できる。これらは「社会的地位」(職業的地位の指標)、「家族主義」または家族規模、「民族性」として知られていた。クラスター分析を適用して、3つの主要な因子変数の値に従って都市をクラスターまたは地区に分割することができた。都市地理学では因子生態学に関する膨大な文献が発展したが、このアプローチは方法論的に原始的でポストモダン地理学のパラダイムにはほとんど居場所がないとして、1980年以降は流行遅れとなった。
因子分析の問題の一つは、さまざまな人工因子に説得力のある名前を見つけることでした。2000年に、Floodは因子生態学のアプローチを復活させ、主成分分析が因子回転に頼ることなく直接意味のある答えを与えることを示しました。主成分は実際には、都市で人々を近づけたり遠ざけたりする「力」の二重変数またはシャドウプライスでした。最初の成分は「アクセス性」で、古典的な都市経済学の基礎となっている、移動の需要と空間の需要の間の古典的なトレードオフです。次の2つの成分は、「不利」で、これは(計画によって媒介される)同様の地位の人々を別々の近隣地域に留め、民族性で、同様の民族的背景を持つ人々が一緒に住もうとします。[ 55 ]
ほぼ同時期に、オーストラリア統計局は、重要と思われる主要変数の集合の第一主成分を取って、有利と不利の明確な指標を定義しました。これらのSEIFA指標は、さまざまな管轄区域について定期的に公表されており、空間分析で頻繁に使用されています。[ 56 ]
開発指標 PCAは指標開発のための正式な方法として使用できます。代替として、指標の開発と評価のための確認的複合分析 が提案されています。[ 57 ]
都市開発指数は、1996年に世界の254都市を対象に実施された調査で得られた約200の都市成果指標に基づき、主成分分析(PCA)によって開発されました。第一主成分は反復回帰分析の対象となり、元の変数を一つずつ追加していき、変動の約90%が説明されるまで分析が続けられました。最終的に指数は約15の指標を使用しましたが、実際にはさらに多くの変数を予測する上で有効でした。その比較値は、各都市の状態に関する主観的な評価と非常によく一致しました。インフラ関連項目の係数は、基礎となるサービスの提供にかかる平均コストにほぼ比例しており、この指数が実際には都市への効果的な物理的・社会的投資の尺度であることを示唆しています。
1990年から発表され、開発研究で広く使用されている国連開発計画( UNDP )の国レベルの人間開発指数(HDI) [ 58 ] は、類似の指標に対して非常に類似した係数を示しており、元々は主成分分析(PCA)を使用して構築されたことを強く示唆している。
集団遺伝学 1978年、カヴァッリ=スフォルツァ らは、ヒトの遺伝子頻度の地域差に関するデータを要約するために、主成分分析(PCA)を初めて用いた。得られた成分は、勾配や正弦波など、特徴的なパターンを示した。彼らはこれらのパターンを、特定の古代の移住イベントに起因するものと解釈した。
それ以来、PCAは集団遺伝学で広く使われるようになり、何千もの論文でPCAが表示メカニズムとして使用されています。遺伝は近接性によって大きく変化するため、最初の2つの主成分は実際に空間分布を示し、異なる集団の相対的な地理的位置をマッピングするために使用でき、それによって元の場所から迷い出た個体を示すことができます。[ 59 ]
遺伝学におけるPCAは、離散的な非正規変数や二値対立遺伝子マーカーに対してこの手法が実行されてきたため、技術的に議論の的となってきた。PCAにおける標準誤差の測定法がないことも、より一貫した使用を妨げる要因となっている。2022年8月、分子生物学者のEran Elhaikは 、12のPCAアプリケーションを分析した理論論文をScientific Reports に発表した。彼は、この手法は操作しやすく、その結果は「誤り、矛盾、不条理」であると結論付けた。具体的には、集団遺伝学で得られた結果は、都合の良いデータだけを選び出すことと循環論法 によって特徴づけられると彼は主張した。[ 60 ]
市場調査と態度指標 市場調査では、PCAが広く利用されてきました。PCAは、製品の顧客満足度や顧客ロイヤルティスコアを開発するために使用され、クラスタリングと組み合わせることで、因子生態学が類似した特性を持つ地理的領域を特定するのとほぼ同じように、広告キャンペーンのターゲットとなる市場セグメントを開発します。[ 61 ]
PCAは大量のデータを、より迅速かつ容易に分析できる、より小さく理解しやすい変数に素早く変換します。消費者アンケートでは、消費者の態度を引き出すように設計された一連の質問があり、主成分分析はこれらの態度の根底にある潜在変数を探します。たとえば、2013年のオックスフォードインターネット調査では、2000人に態度と信念について質問し、アナリストはこれらから4つの主成分次元を抽出し、それらを「逃避」、「ソーシャルネットワーキング」、「効率性」、「問題作成」と特定しました。[ 62 ]
2008年のジョー・フラッドの別の例では、オーストラリアの2697世帯を対象とした全国調査の28の態度に関する質問から、住宅に対する態度指数を抽出した。第一主成分は、不動産と住宅所有に対する一般的な態度を表していた。この指数、あるいはこの指数に含まれる態度に関する質問は、居住形態選択の一般線形モデルに入力することができた。民間賃貸住宅の最も強力な決定要因は、収入、婚姻状況、世帯タイプではなく、態度指数であった。[ 63 ]
神経科学 神経科学 では、主成分分析の変種が、ニューロン が活動電位 を生成する確率を高める刺激の特定の特性を特定するために使用されています。[ 71 ] [ 72 ] この手法は、スパイクトリガー共分散分析 として知られています。典型的なアプリケーションでは、実験者は刺激としてホワイトノイズ プロセスを提示し(通常は被験者への感覚入力として、またはニューロンに直接注入される電流 として)、その結果としてニューロンによって生成された一連の活動電位、つまりスパイクを記録します。おそらく、刺激の特定の特性がニューロンのスパイク発生の可能性を高めます。これらの特性を抽出するために、実験者は、スパイクの直前に発生したすべての刺激(通常は100ミリ秒程度の有限の時間ウィンドウで定義および離散化される)のセットであるスパイクトリガー アンサンブルの共分散行列 を計算します。スパイク誘発共分散行列と先行刺激群 (同じ時間窓で定義されたすべての刺激の集合)の共分散行列との差の固有ベクトルは、刺激空間において、スパイク誘発群の分散が先行刺激群の分散と最も大きく異なる方向を示します。具体 的 には、正の固有値が最大の固有ベクトルは、スパイク誘発群の分散が先行刺激群の分散と比較して最も大きな正の変化を示した方向に対応します。これらの方向は刺激の変化によってスパイクが発生した方向であるため、多くの場合、求められる関連刺激特性の良い近似値となります。
神経科学において、PCAは活動電位の形状からニューロンを識別するためにも用いられる。スパイクソーティングは、 細胞外 記録法では複数のニューロンからの信号が同時に検出されることが多いため、重要な手順である。スパイクソーティングでは、まずPCAを用いて活動電位波形の空間の次元を削減し、次にクラスタリング分析を 実行して特定の活動電位を個々のニューロンに関連付ける。
次元削減手法としてのPCAは、大規模な神経細胞集団の協調活動を検出するのに特に適しています。これは、脳の相転移 中の集団変数、すなわち秩序パラメーターを決定するために使用されてきました。 [ 73 ]
他の方法との関連性
因子分析 上の図は、PCAと因子分析の違いを示す例です。上の図では、「因子」(例:キャリアパス)が3つの観測変数(例:医師、弁護士、教師)を表していますが、下の図では、観測変数(例:幼稚園教諭、中学校教諭、高校教諭)が関心のある成分(例:教師)に集約されています。 主成分分析は、元の変数の線形結合である変数を作成します。新しい変数は、すべての変数が直交するという性質を持ちます。PCA変換は、クラスタリング前の前処理ステップとして役立ちます。PCAは分散に焦点を当てたアプローチであり、変数全体の分散を再現することを目指します。このアプローチでは、成分が変数の共通分散と固有分散の両方を反映します。PCAは一般的にデータ削減(つまり、変数空間を最適な因子空間に変換すること)の目的で好まれますが、潜在的な構成概念や因子を検出することが目的の場合は好まれません。
因子分析は 、変数の線形結合も含むという点で主成分分析と似ています。PCAとは異なり、因子分析は変数間の相互相関を再現しようとする相関重視のアプローチであり、因子は「固有分散を除いた変数の共通分散を表す」ものです。[ 77 ] 相関行列の観点から言えば、これは非対角項(つまり、共有共分散)の説明に焦点を当てることに対応し、PCAは対角にある項の説明に焦点を当てます。しかし、副次的な結果として、対角項を再現しようとすると、PCAは非対角相関にも比較的よく適合する傾向があります。[ 13 ] : 158 PCAと因子分析によって得られる結果はほとんどの場合非常に似ていますが、常にそうであるとは限らず、結果が大きく異なる問題もいくつかあります。因子分析は一般的に、研究目的がデータ構造(つまり、潜在構成概念または因子)の検出または因果モデリング である場合に使用されます。因子モデルが誤って定式化されている場合、または前提条件が満たされていない場合、因子分析は誤った結果をもたらします。[ 78 ]
非負行列因子分解 PCAとNMFの分数残差分散(FRV)プロット。[ 25 ] PCAの場合、理論値は残差固有値からの寄与です。比較すると、PCAのFRV曲線は信号が効果的に捕捉されない平坦なプラトーに達しますが、NMFのFRV曲線は継続的に低下し、信号を捕捉する能力が優れていることを示しています。NMFのFRV曲線はPCAよりも高いレベルに収束し、NMFの過学習特性が少ないことを示しています。 非負行列因子分解 (NMF)は、行列内の非負要素のみを使用する次元削減法であり、天体物理学的信号が非負であるという意味で、天文学において有望な方法である[ 23 ] [ 24 ] [ 25 ] 。PCAの成分は互いに直交しているが、NMFの成分はすべて非負であるため、非直交基底を構築する。
PCAでは、各成分の寄与は対応する固有値の大きさに基づいてランク付けされ、これは経験的データの分析における分数残差分散(FRV)に相当します。[ 21 ] NMFでは、その成分は経験的FRV曲線のみに基づいてランク付けされます。[ 25 ] 残差分数固有値プロット、すなわち、1 − ∑ 私 = 1 k λ 私 / ∑ j = 1 n λ j {\displaystyle 1-\sum _{i=1}^{k}\lambda _{i}{\Big /}\sum _{j=1}^{n}\lambda _{j}} 部品番号の関数としてk {\displaystyle k} 合計n {\displaystyle n} PCA の成分は平坦なプラトーを持ち、準静的ノイズを除去するためのデータが取得されないため、曲線は過学習 (ランダムノイズ) の兆候として急速に低下します。[ 21 ] NMF の FRV 曲線は、NMF 成分が順次構築されるときに連続的に減少します[25]。これは、準静的ノイズの連続的な取得を示しています。その後、PCA よりも高いレベルに収束し [25] 、 NMFの 過学習 特性 が少ないこと を 示し て います。
相関関係の図像学 データに様々な由来の変数が多数含まれている場合、あるいは一部の変数が質的変数である場合、主成分分析の解釈はしばしば困難になります。そのため、PCAの利用者はいくつかの変数を慎重に削除する必要があります。観測値や変数が軸の方向に過度な影響を与える場合は、それらを削除し、補助要素として投影する必要があります。さらに、因子平面の中心に近い点間の近接性を解釈することは避けるべきです。
相関関係の図解 ― 海洋エアロゾルの地球化学 一方、相関関係の図像表現は 、軸系への投影ではないため、これらの欠点はありません。したがって、すべての変数を保持することができます。
この図の原理は、相関行列における「顕著な」相関関係を、実線(正の相関)または点線(負の相関)で強調することである。
強い相関関係であっても、それが直接的なものではなく、第三の変数の影響によるものであれば、「注目に値する」とは言えません。逆に、弱い相関関係でも「注目に値する」場合があります。例えば、変数Yが複数の独立変数に依存している場合、Yとそれぞれの独立変数との相関は弱いものの、「注目に値する」と言えます。
一般化
スパースPCA PCAの特に大きな欠点は、主成分が通常、すべての入力変数の線形結合であることです。スパースPCAは、 少数の入力変数のみを含む線形結合を見つけることで、この欠点を克服します。これは、入力変数にスパース性制約を追加することで、データの次元削減のための古典的な主成分分析(PCA)手法を拡張したものです。いくつかの手法が提案されていますが、
スパースPCAの方法論的および理論的発展、ならびに科学研究におけるその応用については、最近の調査論文で概説されている。[ 89 ]
非線形PCA 乳がん マイクロアレイ データの可視化 における線形PCAと非線形主多様体[ 90 ] の比較:a) 3D PCA線形多様体におけるノードと2D主面の構成。データセットは湾曲しており、2D主平面上に適切にマッピングすることはできません。b) 内部2D非線形主面座標(ELMap2D)における分布と点の密度の推定値。c) b)と同様ですが、線形2D PCA多様体(PCA2D)の場合です。「基底」乳がんサブタイプはELMap2Dでより適切に可視化され、分布のいくつかの特徴はPCA2Dと比較してよりよく解像されます。主多様体は弾性マップ アルゴリズムによって生成されます。データは公開コンペティションで利用可能です。[ 91 ] ソフトウェアは非商用利用で無料で利用できます。[ 92 ] 非線形次元削減 の現代的な手法のほとんどは、PCA または K-means に理論的およびアルゴリズム的なルーツがあります。ピアソンの元のアイデアは、データ点の集合に「最もよく適合する」直線(または平面)を取ることでした。トレバー・ハスティは この概念を拡張し、PCA の幾何学的解釈の自然な拡張として主曲線 [ 93 ] を提案しました。これは、データ近似 のための多様体を明示的に構築し、その上に点を投影します 。弾性マップ アルゴリズムと主測地線解析 も参照してください。[ 94 ] もう 1 つの一般的な一般化はカーネル PCA で、これは正定値カーネルに関連付けられた再生カーネル ヒルベルト空間で実行される PCA に対応します。
多重線形部分空間学習 では、[ 95 ] [ 96 ] [ 97 ] PCA は、テンソル表現から直接特徴を抽出する多重線形 PCA (MPCA) に一般化されます。MPCA は、テンソルの各モードで PCA を反復的に実行することによって解決されます。MPCA は、顔認識、歩行認識などに適用されています。MPCA はさらに、無相関 MPCA、非負 MPCA、およびロバスト MPCA に拡張されます。
N 次元主成分分析は、タッカー分解 、PARAFAC 、多因子分析、共慣性分析、STATIS、DISTATISなどのモデルを用いて実行できます。
同様の手法
独立成分分析 独立成分分析 (ICA)は、主成分分析と同様の問題を対象としていますが、逐次近似ではなく、加法的に分離可能な成分を見つけ出します。
主成分の判別分析 主成分判別分析 (DAPC) は、遺伝的に関連する個体のクラスターを識別および記述するために使用される多変量法です。遺伝的変異は、グループ間およびグループ内の変異の 2 つのコンポーネントに分割され、前者を最大化します。線形判別子は、クラスターを最もよく分離する対立遺伝子の線形結合です。したがって、この判別に最も寄与する対立遺伝子は、グループ間で最も顕著に異なるものです。DAPC によって識別されたグループへの対立遺伝子の寄与により、グループ間の遺伝的分岐を促進するゲノム領域を特定できます[ 104 ] DAPC では、まず主成分分析 (PCA) を使用してデータを変換し、次に判別分析 (DA) を使用してクラスターを識別します。
DAPCは、R上でAdegenetパッケージを使用して実現できます。(詳細については、Adegenetのウェブサイトをご覧ください)
方向性成分分析 方向成分分析 (DCA) は、大気科学において多変量データセットを分析するために用いられる手法です。[ 105 ] PCA と同様に、次元削減、視覚化の改善、大規模データセットの解釈性の向上を可能にします。また、PCA と同様に、入力データセットから導出された共分散行列に基づいています。PCA と DCA の違いは、DCA ではさらに影響と呼ばれるベクトル方向の入力が必要となる点です。PCA は説明される分散を最大化するのに対し、DCA は影響を考慮した確率密度を最大化します。DCA の目的は、確率密度を用いて測定して可能性が高く、かつ影響を用いて測定して重要である多変量データセットの成分を見つけることです。DCA は、気象予測アンサンブルにおける最も可能性が高く深刻な熱波パターン[ 106 ] や、気候変動による降雨量の最も可能性が高く影響の大きい変化[ 107 ]を見つけるために用いられてきました。
ソフトウェア/ソースコードALGLIB – PCAおよび切り捨てPCAを実装するC++およびC#ライブラリAnalytica – 組み込みのEigenDecomp関数は主成分を計算します。ELKIに は、投影のためのPCA(PCAの堅牢なバリアントを含む)と、PCAベースのクラスタリングアルゴリズムが 含まれています。Gretl – 主成分分析は、pcaコマンドまたはprincomp()関数を介して実行できます。Julia – pcaMultivariateStatsパッケージの関数を使用してPCAをサポートします。KNIME – 分析用のJavaベースのノード配置ソフトウェアで、PCA、PCA compute、PCA apply、PCA inverseと呼ばれるノードにより簡単に分析を行うことができます。Maple(ソフトウェア) – PCAコマンドは、データセットに対して主成分分析を実行するために使用されます。Mathematica – PrincipalComponentsコマンドを使用して、共分散法と相関法の両方を用いた主成分分析を実装します。MathPHP – PCAをサポートするPHP数学ライブラリ。 MATLAB – SVD関数は基本システムの一部です。統計ツールボックスでは、関数princompとpca(R2012b)が主成分を出力し、関数はpcares低ランクPCA近似の残差と再構成行列を出力します。Matplotlib は、.mlabモジュールにPCAパッケージを含むPythonライブラリです。 mlpack – C++ で主成分分析の実装を提供します。mrmath – Delphi およびFreePascal 用の高性能数学ライブラリで、堅牢なバリアントを含むPCAを実行できます。 NAGライブラリ – 主成分分析は、g03aaルーチン(ライブラリのFortranバージョン両方で利用可能)を介して実装されます。NMath – .NET Framework 用の PCA を含む独自の数値ライブラリ。GNU Octave – MATLABとほぼ互換性のあるフリーソフトウェアの計算環境で、関数はprincomp主成分を返します。OpenCV Oracle Database 12c –DBMS_DATA_MINING.SVDS_SCORING_MODE設定値を指定することで実装されますSVDS_SCORING_PCA。Orange(ソフトウェア) は、ビジュアルプログラミング環境にPCA(主成分分析)機能を統合しています。PCAはスクリープロット(説明される分散の度合い)を表示し、ユーザーは対話的に主成分の数を選択できます。Origin – Pro版にはPCAが含まれています。Qlucore – 主成分分析(PCA)を用いて多変量データを即座に解析できる商用ソフトウェア。R –無料の 統計パッケージで、関数princompとを使用してprcomp主成分分析を行うことができます。は特異値分解 prcompを使用しており、一般的に数値精度が向上します。R で PCA を実装するパッケージには、、、、、、などがありますが、これらに限定されません。ade4veganExPositiondimRedFactoMineRSAS – 独自開発ソフトウェア。例えば、[ 108 ]を参照。 scikit-learnは 、PCA、確率的PCA、カーネルPCA、スパースPCAなどの手法を分解モジュールに含む、機械学習のためのPythonライブラリです。Scilab – 無料でオープンソースのクロスプラットフォーム数値計算パッケージ。この関数はprincomp主成分分析を計算し、この関数はpca標準化変数を使用して主成分分析を計算します。SPSS – 社会科学者が主成分分析、因子分析、および関連するクラスター分析に最も一般的に使用する独自開発ソフトウェア。Wekaは 、主成分を計算するためのモジュールを含む、機械学習用のJavaライブラリです。
参考文献 ↑ ゲワーズ、フェリペ L.;フェレイラ、グスタボ R.アルーダ、エンリケ F. デ;シルバ、フィリピ N.カミン、セザール H.アマンシオ、ディエゴ R.コスタ、ルチアーノ・ダ・F(2021年5月24日)。「主成分分析: データ探索への自然なアプローチ」。ACM コンピューティング。生き残る 。54 (4): 70:1–70:34。arXiv : 1804.02502 。土井 :10.1145/3447755。 ↑ Jolliffe, Ian T.; Cadima, Jorge (2016-04-13). "主成分分析: レビューと最近の発展" . Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 374 (2065) 20150202. Bibcode : 2016RSPTA.37450202J . doi : 10.1098/rsta.2015.0202 . PMC 4792409 . PMID 26953178 . ↑ Barnett, TP & R. Preisendorfer. (1987). "Origins and levels of monthly and seasonal forecast skill for United States surface air temperatures determined by canonical correlation analysis" . Monthly Weather Review . 115 (9): 1825. Bibcode : 1987MWRv..115.1825B . doi : 10.1175/1520-0493(1987)115 < 1825:oaloma > 2.0.co ; 2 . ↑ Hsu, Daniel ; Kakade, Sham M.; Zhang, Tong (2008).隠れマルコフ モデル を 学習するためのスペクトルアルゴリズム 。arXiv : 0811.4413。Bibcode : 2008arXiv0811.4413H 。 1 2 Markopoulos, Panos P.; Kundu, Sandipan; Chamadia, Shubham; Pados, Dimitris A. (2017年8月15日). "ビット反転による効率的なL1ノルム主成分分析". IEEE Transactions on Signal Processing . 65 (16): 4252–4264 . arXiv : 1610.01959 . Bibcode : 2017ITSP...65.4252M . doi : 10.1109/TSP.2017.2708023 . S2CID 7931130 . 1 2 Chachlakis, Dimitris G.; Prater-Bennette, Ashley; Markopoulos, Panos P. (2019年11月22日). "L1ノルムタッカーテンソル分解" . IEEE Access . 7 : 178454– 178465. arXiv : 1904.06455 . Bibcode : 2019IEEEA...7q8454C . doi : 10.1109/ACCESS.2019.2955134 . 1 2 Markopoulos, Panos P.; Karystinos, George N.; Pados , Dimitris A. (2014 年 10 月). "L1 部分空間信号処理のための最適アルゴリズム". IEEE Transactions on Signal Processing . 62 (19): 5046–5058 . arXiv : 1405.6785 . Bibcode : 2014ITSP...62.5046M . doi : 10.1109/TSP.2014.2338077 . S2CID 1494171 . ↑ Zhan, J.; Vaswani, N. (2015). "部分部分空間知識を用いたロバストなPCA". IEEE Transactions on Signal Processing . 63 (13): 3332– 3347. arXiv : 1403.1591 . Bibcode : 2015ITSP...63.3332Z . doi : 10.1109/tsp.2015.2421485 . S2CID 1516440 . ↑ Kanade, T.; Ke, Qifa (2005年6月). 「外れ値と欠損データが存在する場合の代替凸計画法によるロバストなL₁ノルム分解」. 2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR'05) . Vol. 1. IEEE. pp. 739–746 . CiteSeerX 10.1.1.63.4605 . doi : 10.1109/CVPR.2005.309 . ISBN 978-0-7695-2372-9 . S2CID 17144854 . ↑ Pearson, K. (1901). "On Lines and Planes of Closest Fit to Systems of Points in Space" . Philosophical Magazine . 2 (11): 559–572 . doi : 10.1080/14786440109462720 . S2CID 125037489 . ↑ Hotelling, H. (1933). Analysis of a complex of statistical variables into principal components. Journal of Educational Psychology , 24 , 417–441, and 498–520. Hotelling, H (1936). "Relations between two sets of variates". Biometrika . 28 (3/4): 321– 377. doi : 10.2307/2333955 . JSTOR 2333955 . ↑ Stewart, GW (1993). "特異値分解の初期の歴史について" . SIAM Review . 35 (4): 551– 566. Bibcode : 1993SIAMR..35..551S . doi : 10.1137/1035134 . hdl : 1903/566 . 1 2 3 4 5 Jolliffe, IT (2002). 主成分分析 . Springer Series in Statistics. New York: Springer-Verlag. doi : 10.1007/b98835 . ISBN 978-0-387-95442-4 。1 2 3 4 Holmes, Mark H. (2023). 科学計算とデータ分析入門 . 計算科学と工学のテキスト(第2 版). Springer. pp. 475–490 . ISBN 978-3-031-22429-4 。↑ Forkman J., Josse, J., Piepho, HP (2019). "変数が標準化されている場合の主成分分析の仮説検定" . Journal of Agricultural, Biological, and Environmental Statistics . 24 (2): 289– 308. Bibcode : 2019JABES..24..289F . doi : 10.1007/s13253-019-00355-5 . {{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)↑ Boyd, Stephen; Vandenberghe, Lieven (2004-03-08). Convex Optimization . Cambridge University Press. doi : 10.1017/cbo9780511804441 . ISBN 978-0-521-83378-3 。↑ 福永啓之助 (1990). 統計的パターン認識入門 . エルゼビア. ISBN 978-0-12-269851-4 。↑ Alizadeh, Elaheh; Lyons, Samanthe M; Castle, Jordan M; Prasad, Ashok (2016). "Measuring systematic changes in invasive cancer cell shape using Zernike moments" . Integrative Biology . 8 (11): 1183– 1193. doi : 10.1039/C6IB00100A . PMID 27735002 . ↑ Leznik, M; Tofallis, C. 2005対角回帰を用いた不変主成分の推定。 ↑ ジョナサン・シュレンズ著、「主成分分析のチュートリアル」。 1 2 3 Soummer, Rémi; Pueyo, Laurent; Larkin, James (2012). "カルーネン・レーヴェ固有画像への投影を用いた系外惑星と円盤の検出と特性評価". The Astrophysical Journal Letters . 755 (2): L28. arXiv : 1207.4197 . Bibcode : 2012ApJ...755L..28S . doi : 10.1088/2041-8205/755/2/L28 . S2CID 51088743 . ↑ Pueyo, Laurent (2016). "カルーネン・レーヴェ固有画像への投影を用いた系外惑星の検出と特性評価:順方向モデリング" . The Astrophysical Journal . 824 (2): 117. arXiv : 1604.06097 . Bibcode : 2016ApJ...824..117P . doi : 10.3847/0004-637X/824/2/117 . S2CID 118349503 . 1 2 Blanton, Michael R.; Roweis, Sam (2007). "紫外線、可視光、近赤外線におけるK補正とフィルター変換". The Astronomical Journal . 133 (2): 734–754 . arXiv : astro-ph/0606170 . Bibcode : 2007AJ....133..734B . doi : 10.1086/510127 . S2CID 18561804 . 1 2 3 Zhu, Guangtun B. (2016-12-19). "異分散不確実性と欠損データを伴う非負行列因子分解 (NMF)". arXiv : 1612.06037 [ astro-ph.IM ]. 1 2 3 4 5 6 Ren, Bin; Pueyo, Laurent; Zhu, Guangtun B.; Duchêne, Gaspard (2018). "非負行列因子分解: 拡張構造の堅牢な抽出" . The Astrophysical Journal . 852 (2): 104. arXiv : 1712.10317 . Bibcode : 2018ApJ...852..104R . doi : 10.3847/1538-4357/aaa1f2 . S2CID 3966513 . ↑ 「PCAの長所と短所は何ですか?」 。 i2tutorials 。2019年9月1日。 2021年 6月4日 取得 。 ↑ アボット、ディーン(2014年5月)。 応用予測分析 。ワイリー 。ISBN 978-1-118-72796-6 。1 2 Jiang, Hong; Eskridge, Kent M. (2000). "相関のある観測値による主成分分析のバイアス" . 農業における応用統計学に関する会議 . doi : 10.4148/2475-7772.1247 . ISSN 2475-7772 . ↑ Linsker, Ralph (1988年3月). 「知覚ネットワークにおける自己組織化」. IEEE Computer . 21 (3): 105–117 . Bibcode : 1988Compr..21c.105L . doi : 10.1109/2.36 . S2CID 1527671 . ↑ Deco & Obradovic (1996). An Information-Theoretic Approach to Neural Computing . New York, NY: Springer. ISBN 978-1-4612-4016-7 。↑ Plumbley, Mark (1991). 情報理論と教師なしニューラルネットワーク 。 技術ノート↑ Geiger, Bernhard; Kubin, Gernot (2013 年 1 月) 「関連情報損失の最小化としての信号強調」。Proc . ITG Conf. On Systems, Communication and Coding 。arXiv : 1205.6935 。Bibcode : 2012arXiv1205.6935G 。 ↑ こちらの チュートリアルも参照してください ↑ 「工学統計ハンドブック セクション 6.5.5.2」 。 2015年 1月19日 取得 。 ↑ AA Miranda、Y.-A. Le Borgne、G. Bontempi。「最小近似誤差から主成分への新しい経路」、第27巻、第3号 / 2008年6月、Neural Processing Letters、Springer ↑ Abdi. H. & Williams, LJ (2010). "主成分分析". Wiley Interdisciplinary Reviews: Computational Statistics . 2 (4): 433– 459. arXiv : 1108.4372 . doi : 10.1002/wics.101 . S2CID 122379222 . ↑ 「SAS/STAT(R) 9.3 ユーザーガイド」 。 ↑ eig関数のMatlabドキュメント ↑ 「PCAベースの顔認識システム」 。www.mathworks.com 。 2023年6月19日。 ↑ 固有値関数に関するMathematicaのドキュメント ↑ Roweis, Sam.「PCAとSPCAのためのEMアルゴリズム」ニューラル情報処理システムの進歩。Michael I. Jordan、Michael J. Kearns、 Sara A. Solla 編、MIT Press、1998年。 ↑ Geladi, Paul; Kowalski, Bruce (1986). "Partial Least Squares Regression:A Tutorial". Analytica Chimica Acta . 185 : 1– 17. Bibcode : 1986AcAC..185....1G . doi : 10.1016/0003-2670(86)80028-9 . ↑ クレイマー、R. (1998). 定量分析のためのケモメトリックス技術 . ニューヨーク: CRC Press. ISBN 978-0-203-90980-5 。↑ Andrecut, M. ( 2009). " 反復PCAアルゴリズムの並列GPU実装". Journal of Computational Biology . 16 (11): 1593–1599 . arXiv : 0811.1081 . doi : 10.1089/cmb.2008.0221 . PMID 19772385. S2CID 1362603 . ↑ Warmuth, MK; Kuzmin, D. (2008). "次元に関して対数的な後悔境界を持つランダム化オンラインPCAアルゴリズム" (PDF) . Journal of Machine Learning Research . 9 : 2287– 2320. ↑ ハッソン、フランソワ。ル、セバスチャン。パジェス、ジェローム (2017-04-25)。 R を使用した例による探索的多変量解析 (第 0 版)。チャップマンとホール/CRC。 土井 : 10.1201/b21874 。 ISBN 978-0-429-22543-7 。↑ Abdi, Hervé; Williams, Lynne J. (2010-07-15). "主成分分析" . WIREs Computational Statistics . 2 (4): 433– 459. doi : 10.1002/wics.101 . ISSN 1939-5108 . ↑ Atkinson, Will (2023-04-28). "Charting fields and spaces quantitatively: from multiple correspondence analysis to categorical principal components analysis" . Quality & Quantity . 58 (1): 829– 848. doi : 10.1007/s11135-023-01669-w . hdl : 1983/7cbbf631-d50e-477e-8904-4e30f85b4bed . ISSN 0033-5177 . ↑ ハッソン、フランソワ。ジョシー、ジュリー。サポルタ、ギルバート (2016-09-12)。 「ジャン・ド・レーウとフランス・データ分析学校」 。 統計ソフトウェアのジャーナル 。 73 : 1–18 . 土井 : 10.18637/jss.v073.i06 。 ISSN 1548-7660 。 ↑ Lebart, Ludovic; Morineau, Alain; Warwick, Kenneth M. (1984). Multivariate Descriptive Statistical Analysis: Correspondence Analysis and Related Techniques for Large Matrices . Wiley. ISBN 978-0-471-86743-2 。↑ レバート、ルドヴィック。モリノー、アラン。ピロン、マリー (1995)。 多次元の統計調査 。パリ:デュノー。 ISBN 978-2-10-002886-3 。↑ レ、セバスチャン。ジョシー、ジュリー。ユソン、フランソワ (2008-03-18)。 「FactoMineR: 多変量解析のための R パッケージ」 。 統計ソフトウェアのジャーナル 。 25 : 1–18 . 土井 : 10.18637/jss.v025.i01 。 ISSN 1548-7660 。 ↑ Kaplan, RM、& Saccuzzo, DP (2010).心理検査:原理、応用、および問題。 (第8版)。ベルモント、カリフォルニア州:Wadsworth、Cengage Learning。 ↑ シェフキー、エシュレフ、ウィリアムズ、マリリン (1949)。 ロサンゼルスの社会地域:分析と類型論 。カリフォルニア大学出版局。 ↑ Flood, J (2000). シドニーの分断:要因生態学の再考。2000年11月にメルボルンで開催されたAPA会議、および2000年12月にホバートで開催された第24回ANZRSAI会議での発表論文。 ↑ 「地域別社会経済指標」 オーストラリア 統計局 2011年2 月22日5月5日 閲覧 。 ↑ タマラ・シャンベルガー。フロリアン・シューベルト。ヘンセラー、イェルク (2023)。 「人間開発研究における確認的複合分析」。 行動発達の国際ジャーナル 。 47 (1): 88–100 。 土井 : 10.1177/01650254221117506 。 hdl : 10362/143639 。 ↑ 人間開発報告書。 「人間開発指数」 。 国連開発計画 。 2022年5月6日 取得。 ↑ Novembre, John; Stephens, Matthew (2008). "空間的集団遺伝的変異の主成分分析の解釈" . Nat Genet . 40 (5): 646–49 . doi : 10.1038/ng.139 . PMC 3989108. PMID 18425127 . ↑ Elhaik, Eran (2022). "集団遺伝学的研究における主成分分析(PCA)に基づく知見は非常に偏っており、再評価する必要がある" . Scientific Reports . 12 (1) 14683. Bibcode : 2022NatSR..1214683E . doi : 10.1038/s41598-022-14395-4 . PMC 9424212 . PMID 36038559 . S2CID 251932226 . ↑ DeSarbo, Wayne; Hausmann, Robert; Kukitz, Jeffrey (2007). "マーケティングリサーチのための制限付き主成分分析" . Journal of Marketing in Management . 2 : 305– 328 – via ResearchGate. ↑ ダットン、ウィリアム H; ブランク、グラント (2013). インターネットの文化: イギリスのインターネット (PDF) . オックスフォード インターネット研究所. p. 6. ↑ Flood, Joe (2008). 「住宅キャリア調査のための多項分析」 。 ダブリンで開催された欧州住宅研究ネットワーク会議への論文。 2022年 5月6日 取得 。 1 2 Michael B. Miller (2013)『金融リスク管理のための数学と統計学』 第2版、Wiley ISBNの第9章を参照。 978-1-118-75029-2 1 2 §9.7 John Hull (2018). Risk Management and Financial Institutions, 5th Edition. Wiley. ISBN 1119448115 ↑ §III.A.3.7.2、Carol Alexanderおよび Elizabeth Sheedy 編 (2004)『プロフェッショナル・リスク・マネージャーズ・ハンドブック 』 PRMIA。ISBN 978-0976609704 ↑ 例分解、ジョン・ハル ↑ Libin Yang.株式ポートフォリオ管理への主成分分析の応用 .カンタベリー大学 経済金融学部、2015年1月。 ↑ Giorgia Pasini (2017);株式ポートフォリオ管理のための主成分分析. International Journal of Pure and Applied Mathematics . Volume 115 No. 1 2017, 153–167 1 2 Li Ong (2014)著『 IMFストレステスト手法とモデルガイド』 第25章「主成分分析を用いたシナリオテスト」を参照。国際通貨基金 ↑ Chapin, John; Nicolelis, Miguel (1999). "神経細胞集団活動の主成分分析により多次元体性感覚表現が明らかになる". Journal of Neuroscience Methods . 94 (1): 121– 140. doi : 10.1016/S0165-0270(99)00130-2 . PMID 10638820 . S2CID 17786731 . ↑ Brenner, N.、Bialek, W.、および de Ruyter van Steveninck, RR (2000)。 ↑ Jirsa, Victor; Friedrich, R; Haken, Herman; Kelso, Scott (1994). "人間の脳における相転移の理論モデル". Biological Cybernetics . 71 (1): 27–35 . doi : 10.1007/bf00198909 . PMID 8054384. S2CID 5155075 . ↑ ベンゼクリ、J.-P. (1973年)。 ドネの分析。第二巻。通信の分析 。フランス、パリ:デュノー。 ↑ グリーンエーカー、マイケル(1983)。 『対応分析の理論と応用 』ロンドン:アカデミック・プレス 。ISBN 978-0-12-299050-2 。↑ ル・ルー、ブリジット、ヘンリー・ルアネ(2004)。 『幾何学的データ分析:対応分析から構造化データ分析へ 』 ドルトレヒト:クルーワー。ISBN 978-1-4020-2235-7 。↑ ティモシー・A・ブラウン著『社会科学における応用研究方法論のための確認的因子分析』ギルフォード出版、2006年 ↑ Meglen, RR (1991). "大規模データベースの調査: 主成分分析を用いたケモメトリックスアプローチ". Journal of Chemometrics . 5 (3): 163– 179. doi : 10.1002/cem.1180050305 . S2CID 120886184 . ↑ H. Zha; C. Ding; M. Gu; X. He; HD Simon (2001年12月) 「K平均クラスタリングのためのスペクトル緩和」 (PDF) . ニューラル情報処理システム第14巻(NIPS 2001) : 1057–1064 . ↑ Chris Ding; Xiaofeng He (2004年7月) 「主成分分析によるK平均クラスタリング」 (PDF) . Proc. Of Int'l Conf. Machine Learning (ICML 2004) : 225–232 . ↑ Drineas, P.; A. Frieze; R. Kannan; S. Vempala; V. Vinay (2004). "Clustering large graphs via the singular value decomposition" (PDF) . Machine Learning . 56 ( 1– 3): 9– 33. Bibcode : 2004MLear..56....9D . doi : 10.1023/b:mach.0000033113.59016.96 . S2CID 5892850 . 2012-08-02 に取得. ↑ Cohen, M.; S. Elder; C. Musco; C. Musco; M. Persu (2014). Dimensionality reduction for k-means clustering and low rank approximation (Appendix B) . arXiv : 1410.6801 . Bibcode : 2014arXiv1410.6801C . ↑ Hui Zou; Trevor Hastie; Robert Tibshirani (2006). "スパース主成分分析" (PDF) . Journal of Computational and Graphical Statistics . 15 (2): 262– 286. CiteSeerX 10.1.1.62.580 . doi : 10.1198/106186006x113430 . S2CID 5730904 . ↑ Alexandre d'Aspremont; Laurent El Ghaoui; Michael I. Jordan; Gert RG Lanckriet (2007). "A Direct Formulation for Sparse PCA Using Semidefinite Programming" (PDF) . SIAM Review . 49 (3): 434– 448. arXiv : cs/0406021 . Bibcode : 2007SIAMR..49..434D . doi : 10.1137/050645506 . S2CID 5490061 . ↑ Michel Journee; Yurii Nesterov; Peter Richtarik; Rodolphe Sepulchre (2010). "Generalized Power Method for Sparse Principal Component Analysis" (PDF) . Journal of Machine Learning Research . 11 : 517– 553. arXiv : 0811.4724 . Bibcode : 2008arXiv0811.4724J . CORE Discussion Paper 2008/70. ↑ Peter Richtarik; Martin Takac; S. Damla Ahipasaoglu (2012). "Alternating Maximization: Unifying Framework for 8 Sparse PCA Formulations and Efficient Parallel Codes". arXiv : 1212.4137 [ stat.ML ]. ↑ Baback Moghaddam; Yair Weiss; Shai Avidan (2005). "Spectral Bounds for Sparse PCA: Exact and Greedy Algorithms" (PDF) . Advances in Neural Information Processing Systems . Vol. 18. MIT Press. ↑ Yue Guan; Jennifer Dy (2009). "スパース確率的主成分分析" (PDF) . Journal of Machine Learning Research Workshop and Conference Proceedings . 5 : 185. ↑ Hui Zou; Lingzhou Xue (2018). "A Selective Overview of Sparse Principal Component Analysis" . Proceedings of the IEEE . 106 (8): 1311– 1320. doi : 10.1109/JPROC.2018.2846588 . ↑ AN Gorban 、AY Zinovyev、「主グラフと多様体」、In: Handbook of Research on Machine Learning Applications and Trends: Algorithms, Methods and Techniques 、Olivas ES 他編、Information Science Reference、IGI Global: Hershey、PA、USA、2009年、28–59頁。↑ 王、Y.;クライン、JG;チャン、Y.シューヴェルツ、AM;見てください、国会議員。ヤン、F.タラントフ、D.ティマーマンズ、M.メイン州マイヤー・ヴァン・ゲルダー。ユウ、J。他 。 (2005)。 「リンパ節陰性原発性乳癌の遠隔転移を予測するための遺伝子発現プロファイル」。 ランセット 。 365 (9460): 671–679 。 土井 : 10.1016/S0140-6736(05)17947-1 。 PMID 15721472 。 S2CID 16358549 。 データオンライン↑ Zinovyev, A. 「ViDaExpert – 多次元データ可視化ツール」 。 キュリー研究所 。パリ。 (非商用利用は無料)↑ Hastie, T. ; Stuetzle, W. (1989年6月). "主曲線" (PDF) . Journal of the American Statistical Association . 84 (406): 502– 506. Bibcode : 1989JASA...84..502H . doi : 10.1080/01621459.1989.10478797 . ↑ AN Gorban、B. Kegl、DC Wunsch、A. Zinovyev (編)、『データ可視化と次元削減のための主多様体』、LNCSE 58、Springer、ベルリン – ハイデルベルク – ニューヨーク、2007年。ISBN 978-3-540-73749-0 ↑ Vasilescu, MAO; Terzopoulos, D. (2003). 画像アンサンブルの多重線形部分空間解析 (PDF) . IEEE コンピュータビジョンおよびパターン認識会議 (CVPR'03) 議事録。マディソン、ウィスコンシン州。 ↑ Vasilescu, MAO; Terzopoulos, D. (2002). Multilinear Analysis of Image Ensembles: TensorFaces (PDF) . Lecture Notes in Computer Science 2350; (Presented at Proc. 7th European Conference on Computer Vision (ECCV'02), Copenhagen, Denmark). Springer, Berlin, Heidelberg. doi : 10.1007/3-540-47969-4_30 . ISBN 978-3-540-43745-1 。↑ Vasilescu, MAO; Terzopoulos, D. (2005年6月). 多重線形独立成分分析 (PDF) . IEEEコンピュータビジョンおよびパターン認識会議 (CVPR'05) 議事録. 第 1巻. サンディエゴ、カリフォルニア州. pp. 547–553 . ↑ Kirill Simonov、Fedor V. Fomin、Petr A. Golovach、Fahad Panolan (2019 年 6 月 9 ~ 15 日)。 「外れ値を含む PCA の改良された複雑性」 。Kamalika Chaudhuri、Ruslan Salakhutdinov (編)。 第 36 回国際機械学習会議 (ICML 2019) 議事録 。第 97 巻。米国カリフォルニア州ロングビーチ: PMLR。pp. 5818~ 5826。 {{cite conference}}: CS1 maint: 複数の名前: 著者リスト (リンク)↑ Kriegel, HP; Kröger, P.; Schubert, E.; Zimek, A. (2008). "A General Framework for Increasing the Robustness of PCA-Based Correlation Clustering Algorithms". Scientific and Statistical Database Management . Lecture Notes in Computer Science. Vol. 5069. pp. 418–435 . CiteSeerX 10.1.1.144.4864 . doi : 10.1007/978-3-540-69497-7_27 . ISBN 978-3-540-69476-2 。↑ Emmanuel J. Candes; Xiaodong Li; Yi Ma; John Wright (2011). "ロバストな主成分分析?". Journal of the ACM . 58 (3): 11. arXiv : 0912.3599 . doi : 10.1145/1970392.1970395 . S2CID 7128002 . ↑ T. Bouwmans; E. Zahzah (2014). "Robust PCA via Principal Component Pursuit: A Review for a Comparative Evaluation in Video Surveillance". Computer Vision and Image Understanding . 122 : 22–34 . Bibcode : 2014CVIU..122...22B . doi : 10.1016/j.cviu.2013.11.009 . ↑ T. Bouwmans; A. Sobral; S. Javed; S. Jung; E. Zahzah (2015). "背景/前景分離のための低ランクプラス加法行列への分解: 大規模データセットとの比較評価に関するレビュー". Computer Science Review . 23 : 1–71 . arXiv : 1511.01245 . Bibcode : 2015arXiv151101245B . doi : 10.1016/j.cosrev.2016.11.001 . S2CID 10420698 . ↑ Liao, JC; Boscolo, R.; Yang, Y.-L.; Tran, LM; Sabatti, C. ; Roychowdhury, VP (2003). " Network component analysis: Reconstruction of regulatory signals in biological systems" . Proceedings of the National Academy of Sciences . 100 (26): 15522– 15527. Bibcode : 2003PNAS..10015522L . doi : 10.1073/pnas.2136632100 . PMC 307600. PMID 14673099 . ↑ Liao, T.; Jombart, S.; Devillard, F.; Balloux (2010). "主成分判別分析:遺伝的に構造化された集団の分析のための新しい方法" . BMC Genetics . 11 : 11:94. doi : 10.1186/1471-2156-11-94 . PMC 2973851 . PMID 20950446 . ↑ Jewson, S. (2020). "気候変動と極端現象の主要パターンを推定するためのPCAの代替手法、米国と中国の季節降雨量への応用" . Atmosphere . 11 (4): 354. Bibcode : 2020Atmos..11..354J . doi : 10.3390/atmos11040354 . ↑ Scher, S.; Jewson, S.; Messori, G. (2021). "アンサンブル予測による堅牢な最悪シナリオ" . Weather and Forecasting . 36 (4): 1357– 1373. Bibcode : 2021WtFor..36.1357S . doi : 10.1175/WAF-D-20-0219.1 . S2CID 236300040 . ↑ Jewson, S.; Messori, G.; Barbato, G.; Mercogliano, P.; Mysiak, J.; Sassi, M. (2022). "気候予測アンサンブルからの代表的な影響シナリオの開発、UKCP18 および EURO-CORDEX 降水量への適用" . Journal of Advances in Modeling Earth Systems . 15 (1) e2022MS003038. doi : 10.1029/2022MS003038 . S2CID 254965361 . ↑ 「主成分分析」 . デジタル研究教育研究所 . UCLA . 2018年 5月29日 取得 。
さらに読む Jackson, JE (1991).主成分分析のユーザーガイド (Wiley). Jolliffe, IT (1986).主成分分析 . Springer Series in Statistics. Springer-Verlag. pp. 487. CiteSeerX 10.1.1.149.8828 . doi : 10.1007/b98835 . ISBN 978-0-387-95442-4 。 Jolliffe, IT (2002).主成分分析 . Springer Series in Statistics. ニューヨーク: Springer-Verlag. doi : 10.1007/b98835 . ISBN 978-0-387-95442-4 。 ユッソン・フランソワ、レ・セバスチャン、パジェス・ジェローム (2009)。R を使用した例による探索的多変量解析 。チャップマン&ホール/CRC The Rシリーズ、ロンドン。 224p。ISBN 978-2-7535-0938-2 Pagès Jérôme (2014). Multiple Factor Analysis by Example Using R. Chapman & Hall/CRC The R Series London 272 p
外部リンク コペンハーゲン大学のRasmus Broによる YouTube 動画 Andrew Ng によるスタンフォード大学のビデオ ( YouTube) 主成分分析に関するチュートリアル YouTube にある 、主成分分析を一般向けに解説した 動画(100秒未満)。StatQuest: StatQuest: 主成分分析 (PCA) のステップバイステップ解説 ( YouTube) Stack Overflow に掲載された、主成分分析、固有ベクトル、固有値に関する素人向けの解説記事ソフトウェア実装 の一覧も参照してください。