スペクトル正則化は、機械学習においてノイズの影響を制御し、過学習を防ぐために用いられる正則化手法の一種です。スペクトル正則化は、画像のぼやけ除去から、メールをスパムフォルダと非スパムフォルダに分類することまで、幅広い用途で活用できます。例えば、メール分類の例では、ラベル付けされたメールセットを用いて機械学習システムを訓練し、スパムメールと非スパムメールを区別する方法を学習させる際に、スペクトル正則化を用いることでノイズの影響を軽減し、過学習を防ぐことができます。
スペクトル正則化アルゴリズムは、条件数が悪いか逆行列が有界でない可能性のある線形演算子または行列の逆行列に焦点を当てた、もともと不適切逆問題の理論で定義および研究された手法に依存しています(たとえば、[ 1 ]を参照) 。この文脈では、正則化は、元の演算子を、正則化パラメータによって制御される条件数を持つ「正則化演算子」と呼ばれる有界演算子に置き換えることに相当します[ 2 ]古典的な例としては、ティホノフ正則化があります。安定性を確保するために、この正則化パラメータはノイズのレベルに基づいて調整されます[ 2 ]スペクトル正則化の背後にある主なアイデアは、各正則化演算子は、問題を定義する演算子の固有値に対する適切なフィルタとしてスペクトル計算を使用して記述でき、フィルタの役割は「小さな固有値に対応する振動挙動を抑制する」ことです。[ 2 ]したがって、スペクトル正則化アルゴリズムのクラス内の各アルゴリズムは、適切なフィルタ関数によって定義されます(これは、その特定のアルゴリズム用に導出する必要があります)。スペクトルフィルタリングがよく研究されている最も一般的に使用される正則化アルゴリズムの 3 つは、ティホノフ正則化、ランドウェバー反復、および切り捨て特異値分解(TSVD) です。正則化パラメータの選択に関しては、このパラメータを計算するための候補方法の例には、不一致原理、一般化交差検証、および L 曲線基準などがあります。[ 3 ]
機械学習の文脈で研究されているスペクトルフィルタリングの概念は、信号処理における関数近似に関する文献と関連している。
トレーニングセットは次のように定義されます。、 どこは入力行列とは出力ベクトルです。該当する場合、カーネル関数は で表されます。、そしてカーネル行列は次のように表される。エントリがありますそしては、核を持つ再生核ヒルベルト空間(RKHS)を表す。正則化パラメータは、で表されます。。
のためにそして、 とそしてヒルベルト空間であり、線形連続演算子が与えられた場合と仮定するとが成り立つ。この設定では、直接の問題は、を解くことである。与えられたそして逆問題は、与えられた解が存在し、一意かつ安定している場合、逆問題(つまり、を解く問題)) は適切に定式化されている。そうでなければ、それは不適切に定式化されている。
正則化最小二乗法(RLS)推定問題(チホノフ正則化設定)と不適切逆問題の理論との関連性は、スペクトル正則化アルゴリズムが不適切逆問題の理論とどのように関連しているかを示す一例である。
RLS推定量は、 そしてRKHSでは、このRLS推定量を次のように表現できます。どこと[ 4 ]ペナルティ項は、平滑性を制御し、過学習を防止するために使用されます。経験的リスク最小化の解は、次のように書くことができますそのためペナルティ関数を追加すると、解決する必要のあるシステムに次の変更が生じます。[ 5 ]
この学習設定では、カーネル行列は次のように分解できます。、 と そしては対応する固有ベクトルである。したがって、初期学習設定では、以下が成り立つ。
したがって、固有値が小さい場合、データのわずかな摂動でも解に大きな変化が生じる可能性があります。そのため、この問題は条件が悪く、このRLS問題を解くことは、条件が悪い可能性のある行列逆問題を安定化させることに相当します。これは、不適切逆問題の理論で研究されている問題です。どちらの問題においても、数値安定性の問題に対処することが主な課題となります。
スペクトル正則化アルゴリズムのクラスに属する各アルゴリズムは、適切なフィルタ関数によって定義され、ここでは次のように表される。カーネル行列を次のように表すとします。、 それからより小さい固有値の大きさを制御する必要があるフィルタリング設定では、推定器を見つけることが目標です。どこそのためには、スカラーフィルタ関数は、カーネル行列の固有値分解を用いて定義される。 これにより
一般的に、適切なフィルタ関数は次の特性を備えている必要があります。[ 5 ]
上記の項目は、すべてのスペクトル正則化アルゴリズムにおけるフィルタ関数の一般的な特性を大まかに特徴づけるものですが、フィルタ関数の導出(したがってその正確な形式)は、スペクトルフィルタリングが適用される特定の正則化方法によって異なります。
Tikhonov正則化設定では、RLSのフィルタ関数は以下のように記述されます。[ 4 ]に示されているように、この設定では、。 したがって、
不要な成分は、正則化を用いて除去されます。
したがって、ティホノフ正則化のフィルタ関数は次のように定義されます。[ 5 ]
ランドウェバー反復法の背後にある考え方は勾配降下法です: [ 5 ]
c 0 := 0 for i = 1, ..., t − 1 c i := c i −1 + η ( Y − Kc i −1 ) end
この状況では、もしより大きいの最大固有値を選択することで、上記の反復は収束します。ステップサイズとして。[ 5 ]上記の反復は、を最小化することと同等である。(すなわち経験的リスク)勾配降下法による。帰納法を用いると、第 1 回目の反復では、解は [ 5 ]で与えられる。
したがって、適切なフィルタ関数は次のように定義されます。
このフィルタ関数は、以下の式を切り捨てたべき乗展開に対応することが示せる。[ 5 ]これを確認するには、次の関係に注目してください。は、は行列に置き換えられます。したがって、(カーネル行列)あるいはむしろとみなされる場合、以下のことが成り立つ。
この設定では、反復回数が正則化パラメータになります。大まかに言うと、[ 5 ]もしが大きい場合、過学習が懸念される可能性があります。が小さい場合、過剰な平滑化が懸念される可能性があります。したがって、反復処理を早期に停止する適切なタイミングを選択することで、正則化効果が得られます。
TSVD設定では、固有値分解が与えられている。規定の閾値を使用する正則化された逆行列は、この閾値より小さいすべての固有値を破棄することによってカーネル行列に対して形成できる。[ 5 ] したがって、TSVDのフィルタ関数は次のように定義できる。
TSVDはカーネル主成分分析を用いたデータの(教師なし)射影と等価であり、正則化なしで射影されたデータの経験的リスクを最小化することとも等価であることが示されています。[ 5 ]ここで自由パラメータとなるのは、射影のために保持される成分の数だけです。