統計学において、投影追跡回帰 (PPR)は、加法モデルを拡張したJerome H. Friedmanと Werner Stuetzleによって開発された統計モデルです。このモデルは、説明変数のデータ マトリックスを最適な方向に投影してから、これらの説明変数に平滑化関数を適用するという点で加法モデルを適応させています。
モデルの概要
このモデルはリッジ関数の線形結合、つまり説明変数の線形結合の非線形変換から構成される。基本モデルは次の形式をとる。
ここで、x iは、 iなどの説明変数を含む計画行列の1 × p行、y iは 1 × 1 予測、 { β j } は、未知のパラメータを含むrベクトル(それぞれ長さpの単位ベクトル)のコレクション、 { f j } は、 からマップされるr 個の最初は未知の滑らかな関数のコレクション、 はハイパーパラメータです。rの適切な値は、交差検証またはモデルの適合を大幅に改善できない場合に停止する段階的な前向き戦略を通じて決定できます。 r が無限大に近づき、適切な関数セット { f j } を使用すると、 PPR モデルは内の任意の連続関数を近似できるため、普遍的な推定量になります。
モデル推定
与えられたデータセットに対して、誤差関数を最小化することが目標である。
関数とベクトルについて。一度にすべての変数を解く方法は存在しませんが、交互最適化によって解くことができます。まず、各ペアを個別に検討します。他のすべてのパラメータを固定し、他のパラメータによって説明されない出力の分散である「残差」を求めます。これは次のように表されます。
誤差関数を最小化するという課題は、次の式を解くことに帰着する。
各jに対して順番に実行されます。通常、新しいペアは段階的にモデルに追加されます。
補足:バックフィッティングと呼ばれるアルゴリズムによって新しいフィットペアが決定された後、以前にフィッティングされたペアを再調整できます。バックフィッティングでは、以前のペアを再検討し、他のペアがどのように変化したかを考慮して残差を再計算し、その新しい情報を考慮して再フィッティングし、パラメータが収束するまですべてのフィットペアをこのように循環させます。このプロセスにより、通常、フィットペアが少ないほどパフォーマンスが向上するモデルが生成されますが、トレーニングには時間がかかります。また、バックフィッティングをスキップしてモデルに適合を追加するだけで ( r を増やす)、同じパフォーマンスを実現できることがよくあります。
簡略化された誤差関数を解いてペアを決定することは、交互最適化で行うことができます。交互最適化では、まずランダムを使用して を1D 空間に投影し、次に、お気に入りの散布図回帰法を使用して、その投影と残差の関係を説明する最適な値を見つけます。次に、が一定に保たれ、が一度微分可能であると仮定すると、ガウス・ニュートン法(ヘッセ行列の 2 次導関数を含む部分が破棄される準ニュートン法) を使用して、更新された最適な重みを見つけることができます。これを導出するには、まず をテイラー展開し、次に展開を簡略化された誤差関数に戻し、代数操作を行って次の形式にします。
これは重み付き最小二乗問題です。すべての重みを解いて対角行列に入れ、すべての新しいターゲットをベクトルに積み重ね、単一の例ではなく完全なデータ行列を使用すると、最適値は閉じた形式で与えられます。
この更新を使用しての新しい投影を見つけ、新しい散布図に再適合します。次に、その新しいものを使用して上記を解決し、が収束するまでこの交互のプロセスを続けます。
収束率、バイアス、分散は、 およびの推定によって影響を受けることが示されています。
議論
PPR モデルは、基本的な加法モデルの形をとりますが、追加のコンポーネントが加わるため、各 は、生の入力自体を使用するのではなく、トレーニング中に残差 (説明できない分散) に対する の散布図を当てはめます。これにより、各 を見つける問題が低次元に制限され、共通最小二乗法またはスプライン フィッティング法で解決できるようになり、トレーニング中に次元の呪いを回避できます。は の射影から取られるため、結果は射影次元に直交する「尾根」のように見えるため、「尾根関数」と呼ばれることがよくあります。方向は、対応する尾根関数の適合を最適化するように選択されます。
PPR はデータの投影を適合させようとするため、各入力変数が複雑かつ多面的な方法で考慮されているため、適合されたモデル全体を解釈することが難しい場合があることに注意してください。これにより、モデルはデータの理解よりも予測に役立つ可能性がありますが、個々のリッジ関数を視覚化し、モデルがどの投影を検出しているかを考慮すると、ある程度の洞察が得られます。
PPR推定の利点
- 多変量回帰関数の代わりに単変量回帰関数を使用するため、次元の呪いを効果的に処理できる。
- 単変量回帰は単純かつ効率的な推定を可能にする
- 一般化加法モデルと比較して、PPRはより豊富な関数のクラスを推定できる。
- ローカル平均化法( k近傍法など)とは異なり、PPR では説明力の低い変数を無視できます。
PPR推定の欠点
- PPRでは、を推定するためにM次元パラメータ空間を調べる必要があります。
- のスムージングパラメータを選択する必要があります。
- モデルは解釈が難しいことが多い
PPR の拡張
- ラジアル関数、調和関数、加法関数などの代替スムージングが提案されており、それらのパフォーマンスは使用されるデータ セットによって異なります。
- 標準絶対偏差や平均絶対偏差などの代替最適化基準も使用されています。
- データに強い非線形性がない場合が多いため、通常の最小二乗法を使用して計算を簡素化できます。
- PPR の方向ベクトルを選択するために、スライス逆回帰 (SIR) が使用されています。
- 一般化 PPR は、通常の PPR と反復再加重最小二乗法 (IRLS) およびリンク関数を組み合わせてバイナリ データを推定します。
PPR 対 ニューラル ネットワーク (NN)
射影追跡回帰と、単一の隠れ層を持つ完全接続ニューラル ネットワークは、どちらも入力ベクトルを 1 次元の超平面に射影し、入力変数の非線形変換を適用して線形に追加します。したがって、どちらも次元の呪いを克服するために同じ手順に従います。主な違いは、 PPR でフィッティングされる関数は入力変数の組み合わせごとに異なる可能性があり、一度に 1 つずつ推定されてから重みで更新されるのに対し、NN ではこれらはすべて事前に指定され、同時に推定されることです。
したがって、PPR 推定では PPR 内の変数の変換はデータ駆動型ですが、単層ニューラル ネットワークではこれらの変換は固定されています。
参照
参考文献
- Friedman, JH および Stuetzle, W. (1981) Projection Pursuit Regression. アメリカ統計学会誌、76、817-823。
- Hand, D.、Mannila, H.、Smyth, P、(2001) データマイニングの原理。MIT プレス。ISBN 0-262-08290 -X
- Hall, P. (1988) データ セットが最も興味深い方向を推定する、Probab. Theory Related Fields、80、51–77。
- Hastie, TJ、Tibshirani, RJ、Friedman, JH (2009)。統計学習の要素: データマイニング、推論、予測。Springer。ISBN 978-0-387-84857-0
- Klinke, S. および Grassmann, J. (2000)「Projection Pursuit Regression」、Smoothing and Regression: Approaches, Computation and Application。Ed. Schimek, MG。Wiley Interscience。
- Lingjarde, OC および Liestol, K. (1998) 一般化射影追跡回帰。SIAM Journal of Scientific Computing、20、844–857。
