統計的手法
統計学において、主成分回帰(PCR)は主成分分析(PCA)に基づいた回帰分析手法です。PCRは縮小順位回帰の一種です。[1]より具体的には、PCRは標準的な線形回帰モデルにおける未知の回帰係数を推定するために使用されます。
PCR では、従属変数を説明変数に直接回帰するのではなく、説明変数の主成分が回帰変数として使用されます。通常、回帰にはすべての主成分のサブセットのみを使用するため、PCR は一種の正規化手順であり、収縮推定量の一種でもあります。
多くの場合、分散の大きい主成分(説明変数のサンプル分散共分散行列のより高い固有値に対応する固有ベクトルに基づく主成分)が回帰変数として選択されます。ただし、結果を予測する目的では、分散の小さい主成分も重要であり、場合によってはさらに重要になることもあります。[2]
PCRの主な用途の1つは、 2つ以上の説明変数がほぼ共線性である場合に生じる多重共線性の問題を克服することである。[3] PCRは、回帰ステップで低分散の主成分の一部を除外することにより、このような状況に適切に対処することができる。さらに、通常はすべての主成分のサブセットのみに回帰することにより、PCRは、基礎となるモデルを特徴付けるパラメータの有効数を大幅に減らすことで次元削減をもたらすことができる。これは、高次元の共変量を持つ設定で特に有用である可能性がある。また、回帰に使用する主成分を適切に選択することにより、PCRは、想定されるモデルに基づいて結果を
効率的に予測することができる。
原則
PCR 法は、大きく分けて 3 つの主要なステップに分けられます。
- 1. 説明変数の観測データ マトリックスに対してPCA を実行して主成分を取得し、その後、適切な基準に基づいて、取得した主成分のサブセットを (通常は) 選択してさらに使用します。

- 2.次に、 通常の最小二乗回帰(線形回帰)を使用して、選択した主成分を共変量として観測された結果のベクトルを回帰し、推定回帰係数のベクトル(選択した主成分の数に等しい次元)を取得します。

- 3. 次に、選択したPCA ローディング(選択した主成分に対応する固有ベクトル)を使用してこのベクトルを実際の共変量のスケールに変換し、元のモデルを特徴付ける回帰係数を推定するための最終的な PCR 推定値(共変量の合計数に等しい次元を持つ) を取得します。

方法の詳細
データ表現:は観測結果のベクトルを表し、 は観測共変量の対応するデータ行列を表します。ここで、および はそれぞれ観測サンプルのサイズと共変量の数を表します。の各行は次元共変量の観測値の 1 セットを表し、 の各エントリは対応する観測結果を表します。








データの前処理:および の各列がすでに中心化されていて、すべての経験的平均値がゼロであると仮定します。PCRでは に対する PCA が使用され、PCA はデータの
中央化の影響を受けやすいため、この中心化の手順は重要です (少なくとも の列の場合)。




基礎モデル:中心化に続いて、 の標準的なガウス・マルコフ 線形回帰モデルは次のように表すことができます。ここで、 は回帰係数の未知のパラメータベクトルを表し、 は未知の分散パラメータに対するランダム誤差のベクトルを表します。






目的:主な目標は、データに基づいてパラメータ の効率的な推定値を取得することです。このためによく使用される方法の 1 つは、 が フル列ランクであると仮定して の不偏推定値を与える通常の最小二乗回帰です。PCR は、 を推定する同じ目的で使用できる別の手法です。






PCA ステップ: PCR は、中心化データ行列 に対して PCA を実行することから始まります。このため、はの特異値分解を表します。ここで、 はの非負の特異値を表します。一方、 との列はどちらもベクトルの正規直交集合であり、それぞれの左特異ベクトルと右特異ベクトルを表します。



![{\displaystyle \Delta _{p\times p}=\operatorname {diag} \left[\delta _{1},\ldots ,\delta _{p}\right]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/0c63599347127832b6ab05965662d8211a2838d9)


![{\displaystyle U_{n\times p}=[\mathbf {u} _{1},\ldots ,\mathbf {u} _{p}]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/b5bc275a96ebf11334d7278d8f5a363b4a04ff61)
![{\displaystyle V_{p\times p}=[\mathbf {v} _{1},\ldots ,\mathbf {v} _{p}]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/21b0b51a2f2eee388b69598694dbaba659ccd85c)

主成分: はのスペクトル分解を与えます。ここで、 はの非負の固有値 (主値とも呼ばれる)を表し、 の列は対応する固有ベクトルの正規直交セットを表します。次に、およびはそれぞれ、各 の最大主値に対応する主成分と主成分方向(またはPCA 負荷)を表します。


![{\displaystyle \Lambda _{p\times p}=\operatorname {diag} \left[\lambda _{1},\ldots ,\lambda _{p}\right]=\operatorname {diag} \left[\delta _{1}^{2},\ldots ,\delta _{p}^{2}\right]=\Delta ^{2}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/28f6bd2ef09f8c06599a5af1c35d3ed745c70f92)







導出された共変量:任意の について、の最初の列からなる正規直交列を持つ行列を で表します。列として最初の主成分を持つ行列を で表します。 は、元の共変量 の代わりに変換された共変量を使用して取得されたデータ行列として見ることができます。





![{\displaystyle =[\mathbf {X} \mathbf {v} _{1},\ldots ,\mathbf {X} \mathbf {v} _{k}]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/942b0bf6e7a3b0c9f1ca0219718fff1e0515214a)





PCR 推定量:応答ベクトルをデータ行列 に対して通常の最小二乗回帰によって求めた推定回帰係数のベクトルを とします。すると、任意の に対して、第 1 主成分を使用したの最終的な PCR 推定量は次のように求められます。







PCR推定量の基本特性と応用
2つの基本的な特性
PCR 推定値を取得するためのフィッティング プロセスでは、主成分が互いに直交しているため、任意の直交列を持つ派生データ マトリックスに応答ベクトルを回帰します。したがって、回帰ステップでは、共変量として選択された主成分に対して多重線形回帰を共同で実行することは、共変量として選択された各主成分に対して個別に独立した単純線形回帰(または単変量回帰)を実行することと同じです。





すべての主成分が回帰のために選択され、 となる場合、PCR 推定量は通常の最小二乗推定量と同等になります。したがって、 となります。これは、 であり であるという事実から簡単にわかります。また、は直交行列であることも観察されます。




差異の削減
任意の に対して、 の分散は次のように与えられる。



特に:

したがって、私たちが持っているものすべてについて:


したがって、私たちが持っているものすべてについて:


ここで、は正方対称行列が非負定値であることを示します。その結果、PCR 推定量の任意の線形形式は、通常の最小二乗推定量の
同じ線形形式と比較して分散が低くなります。

多重共線性への対処
多重共線性の下では、2 つ以上の共変量に高い相関があるため、1 つを他の共変量から非自明な精度で線形予測できます。その結果、これらの共変量の観測値に対応するデータ マトリックスの列は線形従属になる傾向があり、そのため、完全な列ランク構造を失ってランク落ちになる傾向があります。より定量的に言えば、このような状況では、 の 1 つ以上の小さな固有値がに非常に近づくか、 とまったく等しくなります。上記の分散式は、これらの小さな固有値が最小二乗推定量の分散に最大のインフレーション効果をもたらし、に近い場合に推定量を大幅に不安定にすることを示しています。この問題は、これらの小さな固有値に対応する主成分を除外することによって取得される PCR 推定量を使用することで効果的に対処できます。





次元削減
PCR は次元削減を実行するためにも使用できます。これを確認するには、任意の に対して正規直交列を持つ任意の行列を で表します。ここで、あるに対して、ランク線形変換によって共変量観測値のそれぞれを近似するとします。





すると、

は、第1主成分の方向を列として持つ行列と、それに対応する次元導出共変量で最小化されます。したがって、次元主成分は、観測されたデータ行列のランクの最良の線形近似を提供します。







対応する再構築エラーは次のように与えられます。

したがって、 の固有値の累積和に適切な閾値を設定することにより、使用する主成分の数 を選択することにより、潜在的な次元削減を実現できます。より小さい固有値は累積和に大きく寄与しないため、目的の閾値制限を超えない限り、対応する主成分は引き続き削除できます。同じ基準は、多重共線性の問題に対処するためにも使用できます。つまり、閾値制限が維持される限り、より小さい固有値に対応する主成分を無視できます。


正規化効果
PCR 推定量は通常、回帰にすべての主成分のサブセットのみを使用するため、ある種の正規化された手順として見ることができます。より具体的には、任意の に対して、PCR 推定量は次の制約付き最小化問題の正規化された解を表します。



この制約は次のように記述することもできます。

どこ:
![{\displaystyle V_{(pk)}=\left[\mathbf {v} _{k+1},\ldots ,\mathbf {v} _{p}\right]_{p\times (pk)}.}](https://wikimedia.org/api/rest_v1/media/math/render/svg/5fc1491586b4d3f4de9bb21381bd1dbb3e2c3766)
したがって、すべての主成分の適切なサブセットのみが回帰のために選択される場合、そのようにして得られる PCR 推定値は、結果として得られる解を選択された主成分の方向の列空間に制約し、その結果として除外された方向に対して直交するように制限する厳密な形式の正則化に基づいています。
正規化推定量のクラスにおけるPCRの最適性
上記で定義された制約付き最小化問題を前提として、次の一般化されたバージョンを検討します。

ここで、 は、の位数を持つ任意の列ランク行列を表します。



対応する解を とします。
したがって

すると、対応する推定値が最小の予測誤差を達成する制限行列の最適な選択は次のように与えられる: [4]

どこ

明らかに、結果として得られる最適な推定値は、第 1主成分
に基づくPCR 推定値によって単純に与えられます。


効率
通常の最小二乗推定量はに対して不偏なので、


ここで、MSEは平均二乗誤差を表します。ある に対して、さらに が成り立つ場合、対応するもに対して不偏となり、したがって





すでに見てきたように

これは次のことを意味します:

特定の に対して となります。したがって、その場合、平均二乗誤差をパフォーマンス基準として使用すると、 と比較してに対応するがより効率的な の推定値になります。さらに、に対応する の任意の線形形式は、の同じ線形形式と比較して、平均二乗誤差が低くなります。






ここで、与えられた に対して であると仮定します。すると、対応する はに対してバイアスされます。しかし、




特に が、除外された主成分がより小さな固有値に対応するようなものである場合、バイアスが低くなる可能性がある。


PCR を の推定量として効率的に推定および予測できるようにするために、Park (1981) [4] は、回帰に使用する主成分を選択するための次のガイドラインを提案しています。主成分を削除するのは、次の場合のみです。このガイドラインを実際に実装するには、もちろん、未知のモデルパラメータとの推定値が必要です。 一般に、それらは元の完全モデルから得られた無制限の最小二乗推定値を使用して推定できます。 ただし、Park (1981) は、この目的に適した、わずかに修正された推定値のセットを提供しています。[4]



多重共線性の問題に対処し、次元削減を実行するのにより適していると思われる の固有値の累積和に基づく基準とは異なり、上記の基準は、回帰ステップで使用する主成分を選択するプロセスに結果と共変量の両方を含めることで、PCR 推定量の予測と推定の効率を改善しようとしています。同様の目標を持つ代替アプローチには、クロス検証またはMallow の C p基準に基づく主成分の選択があります。多くの場合、主成分は結果との
関連度に基づいても選択されます。
PCRの収縮効果
一般に、PCR は本質的に収縮推定量であり、通常は高分散主成分 ( の高固有値に対応) をモデルの共変量として保持し、残りの低分散成分 ( の低固有値に対応) を破棄します。したがって、低分散成分に対して離散的な収縮効果を発揮し、元のモデルにおけるその寄与を完全に無効にします。対照的に、リッジ回帰推定量は、その構築に本質的に含まれる正則化パラメーター(または調整パラメーター)を通じて滑らかな収縮効果を発揮します。いずれの成分も完全に破棄することはありませんが、すべての成分に対して連続的に収縮効果を発揮し、収縮の程度は低分散成分に対して高く、高分散成分に対しては低くなります。フランクとフリードマン(1993)[5]は、予測自体の目的においては、滑らかな収縮効果を持つリッジ推定量の方が、離散的な収縮効果を持つPCR推定量よりもおそらくより良い選択であると結論付けています。


さらに、主成分は、説明変数のみの観測値を含むの固有分解から得られます。したがって、これらの主成分を共変量として使用して得られた PCR 推定値は、必ずしも結果に対して満足のいく予測性能を持つ必要はありません。この問題をその構造自体によって解決しようとする、いくぶん類似した推定値が、部分最小二乗法(PLS) 推定値です。PCR と同様に、PLS も低次元の導出共変量を使用します。ただし、PCR とは異なり、PLS の導出共変量は、結果と共変量の両方を使用することに基づいて得られます。PCR は共変量の空間内で高分散方向を探しますが、PLS は共変量空間内で結果の予測に最も役立つ方向を探します。

2006 年に、古典的な PCR の変形である教師ありPCRが提案されました。[6] PLS と同様の考え方で、これは、結果と共変量の両方を含む基準に基づいて、より低い次元の導出共変量を取得しようとします。この方法では、結果ベクトルが各共変量に 1 つずつ個別に回帰される一連の単純線形回帰(または単変量回帰) を実行することから始まります。次に、いくつかの について、結果と最も相関していることが判明した最初の共変量 (対応する推定回帰係数の有意度に基づく) が、さらに使用するために選択されます。次に、前述の従来の PCR が実行されますが、今度は、選択された共変量の観測値に対応するデータ マトリックスのみに基づいています。使用される共変量の数:と、その後に使用される主成分の数:は、通常、クロス バリデーションによって選択されます。






カーネル設定への一般化
上で説明した古典的な PCR 法は、古典的な PCAに基づいており、共変量に基づいて結果を予測するための線形回帰モデルを考慮します。ただし、これはカーネル マシン設定に簡単に一般化できます。カーネル マシン設定では、回帰関数は共変量に対して必ずしも線形である必要はなく、任意の (非線形の場合もある)対称正定値カーネルに関連付けられた再生カーネル ヒルベルト空間に属することができます。カーネル関数として線形カーネルを選択した場合、線形回帰モデルはこの設定の特殊なケースになります。
一般に、カーネルマシン設定では、共変量のベクトルは、まず、選択されたカーネル関数によって特徴付けられる高次元(潜在的に無限次元)の特徴空間にマッピングされます。このようにして得られたマッピングは特徴マップと呼ばれ、その各座標(特徴要素とも呼ばれる)は、共変量の 1 つの特徴(線形または非線形)に対応します。次に、回帰関数は、これらの特徴要素の線形結合であると想定されます。したがって、カーネルマシン設定の基礎となる回帰モデルは、元の共変量セットの代わりに、特徴マップを使用して実際の共変量を変換することによって取得された特徴要素のベクトル(潜在的に無限次元)によって予測子が与えられるという理解のもと、本質的には線形回帰モデルです。
しかし、カーネルトリックを使用すると、実際に特徴マップを明示的に計算することなく、特徴空間で操作することができます。観測された共変量ベクトルの特徴マップ間のペアワイズ内積を計算するだけで十分であり、これらの内積は、共変量ベクトルの対応するペアで評価されたカーネル関数の値によって単純に与えられます。このようにして得られたペアワイズ内積は、カーネル行列とも呼ばれる対称非負定値行列の形式で表すことができます。

カーネルマシン設定での PCR は、まずこのカーネル行列(K など) を特徴空間に対して適切に中心化し、次に中心化されたカーネル行列(K' など)に対してカーネル PCA を実行して K' の固有分解を取得することによって実装できるようになりました。次に、カーネル PCR は (通常) そのようにして得られたすべての固有ベクトルのサブセットを選択し、次にこれらの選択された固有ベクトルに対して結果ベクトルの標準的な線形回帰を実行します。回帰に使用する固有ベクトルは、通常、交差検証を使用して選択されます。推定された回帰係数 (選択された固有ベクトルの数と同じ次元を持つ) と対応する選択された固有ベクトルは、将来の観測の結果を予測するために使用されます。機械学習では、この手法はスペクトル回帰とも呼ばれます。
明らかに、カーネル PCR は K' の固有ベクトルに離散的な縮小効果をもたらします。これは、前述のように、従来の PCR が主成分に及ぼす離散的な縮小効果と非常によく似ています。ただし、選択されたカーネルに関連付けられた特徴マップは潜在的に無限次元である可能性があり、したがって、対応する主成分と主成分の方向も無限次元である可能性があります。したがって、これらの量は、カーネル マシン設定では実際には扱いにくいことがよくあります。カーネル PCR は、基本的に、関連するカーネル マトリックスのスペクトル分解を使用することに基づく同等のデュアル定式化を検討することで、この問題を回避します。線形回帰モデル (カーネル関数を線形カーネルとして選択することに対応) では、これは、対応するカーネル マトリックスのスペクトル分解を考慮し、得られた の固有ベクトルの選択されたサブセットに結果ベクトルを回帰することになります。これは、従来の PCR のコンテキストで定義されているように、対応する主成分 (この場合は有限次元) に結果ベクトルを回帰することと同じであることが簡単に示されます。したがって、線形カーネルの場合、デュアル定式化に基づくカーネル PCR は、プライマル定式化に基づく従来の PCR とまったく同じです。ただし、任意の (場合によっては非線形の) カーネルの場合、関連する特徴マップの無限次元のため、このプライマル定式化は扱いにくくなる可能性があります。したがって、その場合、従来の PCR は実質的に実行不可能になりますが、デュアル定式化に基づくカーネル PCR は依然として有効であり、計算上スケーラブルです。



参照
参考文献
- ^ Schmidli, Heinz (2013年3月13日). 縮小ランク回帰: 定量的構造活性相関への応用. Springer. ISBN 978-3-642-50015-2。
- ^ Jolliffe, Ian T. (1982). 「回帰分析における主成分分析の使用に関する注記」. Journal of the Royal Statistical Society, Series C. 31 ( 3): 300–303. doi :10.2307/2348005. JSTOR 2348005.
- ^ドッジ、Y . (2003)オックスフォード統計用語辞典、OUP。ISBN 0-19-920613-9
- ^ abc Sung H. Park (1981). 「応答を推定するための回帰パラメータの共線性と最適制約」Technometrics . 23 (3): 289–295. doi :10.2307/1267793. JSTOR 1267793.
- ^ Lldiko E. Frank & Jerome H. Friedman (1993). 「いくつかのケモメトリクス回帰ツールの統計的見解」. Technometrics . 35 (2): 109–135. doi :10.1080/00401706.1993.10485033.
- ^ Eric Bair、 Trevor Hastie、Debashis Paul、Robert Tibshirani ( 2006)。「教師あり主成分分析による予測」。アメリカ統計学会誌。101 (473): 119–137。CiteSeerX 10.1.1.516.2313。doi :10.1198/016214505000000628 。
さらに読む