カーネル正則化のベイズ的解釈では、 機械学習 におけるカーネル法を 、確率を用いて不確実性をモデル化するフレームワークであるベイズ統計 の観点からどのように理解できるかを考察します。カーネル法は、構造化された空間内の入力間の類似性という概念に基づいています。サポートベクターマシン (SVM)やその正則化 (モデルの汎化性と転移性を高める手法)といった手法は、元々はベイズ原理に基づいて定式化されたものではありませんが、ベイズの 観点から分析することで貴重な洞察が得られます。
ベイズフレームワークでは、カーネル法はガウス過程 の基本的な構成要素として機能し、カーネル関数は入力間の関係を定義する共分散関数として作用します。従来、これらの方法は、入力がベクトルとして、出力がスカラーとして表現される 教師あり学習 問題に適用されてきました。最近の発展により、カーネル法はマルチタスク学習 に見られるように、複数の出力 を扱うように拡張されています。[ 1 ]
カーネル法の数学的枠組みは、一般的に再生核ヒルベルト空間 (RKHS)を伴います。すべてのカーネルが内積空間を形成するわけではありません。なぜなら、カーネルは必ずしも正定値半正定値(非負の類似度尺度を保証する性質)ではないからです。しかし、カーネルはより一般的なRKHSの範囲内で動作します。正則化アプローチとベイズ法の間には、特に再生核ヒルベルト空間が有限次元である場合に、数学的な等価性を確立することができます。この等価性は、両方の視点が本質的に同じ推定値 に収束することを示し、一見異なるこれらのアプローチ間の根本的なつながりを明らかにします。
教師あり学習の問題 古典的な教師あり学習 問題では、新しい入力点に対する出力を推定する必要がある。x ′ {\displaystyle \mathbf {x} '} スカラー値推定器を学習することによってf ^ ( x ′ ) {\displaystyle {\hat {f}}(\mathbf {x} ')} トレーニングセットに基づいてS {\displaystyle S} から構成されるn {\displaystyle n} 入力出力ペア、S = ( X 、 Y ) = ( x 1 、 y 1 ) 、 … 、 ( x n 、 y n ) {\displaystyle S=(\mathbf {X} ,\mathbf {Y} )=(\mathbf {x} _{1},y_{1}),\ldots ,(\mathbf {x} _{n},y_{n})} [ 2 ] 対称かつ正の二変数関数が与えられた場合k ( ⋅ 、 ⋅ ) {\displaystyle k(\cdot ,\cdot )} カーネル と呼ばれる、機械学習で最も人気のある推定器の1つは、次のように表されます。
どこK ≡ k ( X 、 X ) {\displaystyle \mathbf {K} \equiv k(\mathbf {X} ,\mathbf {X} )} はエントリを持つカーネル行列 ですK 私 j = k ( x 私 、 x j ) {\displaystyle \mathbf {K} _{ij}=k(\mathbf {x} _{i},\mathbf {x} _{j})} 、k = [ k ( x 1 、 x ′ ) 、 … 、 k ( x n 、 x ′ ) ] ⊤ \displaystyle \mathbf {k} =[k(\mathbf {x} _{1},\mathbf {x} '),\ldots ,k(\mathbf {x} _{n},\mathbf {x} ')]^{\top }} 、 そしてY = [ y 1 、 … 、 y n ] ⊤ {\displaystyle \mathbf {Y} =[y_{1},\ldots ,y_{n}]^{\top }} この推定量が正則化とベイズの両方の観点からどのように導出されるかを見ていきます。
正則化の観点から 正則化の観点からの主な仮定は、関数の集合がF \displaystyle {\mathcal {F}}} 再生核ヒルベルト空間に属するものと想定されるH k {\displaystyle {\mathcal {H}}_{k}} [ 2 ] [ 3 ] [ 4 ] [ 5 ]
再生核ヒルベルト空間 再生核ヒルベルト空間 (RKHS)H k {\displaystyle {\mathcal {H}}_{k}} は、対称かつ 正定値関数 によって定義される関数のヒルベルト空間 である。k : X × X → R {\displaystyle k:{\mathcal {X}}\times {\mathcal {X}}\rightarrow \mathbb {R} } 再生核 と呼ばれる関数k ( x 、 ⋅ ) {\displaystyle k(\mathbf {x} ,\cdot )} に属するH k {\displaystyle {\mathcal {H}}_{k}} すべての人々のためにx ∈ X {\displaystyle \mathbf {x} \in {\mathcal {X}}} [ 6 ] [ 7 ] [ 8 ] RKHSを魅力的なものにする主な特性は3つあります。
1. RKHS の名称の由来となった再生特性、
f ( x ) = ⟨ f 、 k ( x 、 ⋅ ) ⟩ k 、 ∀ f ∈ H k 、 {\displaystyle f(\mathbf {x} )=\langle f,k(\mathbf {x} ,\cdot )\rangle _{k},\quad \forall \ f\in {\mathcal {H}}_{k},} どこ⟨ ⋅ 、 ⋅ ⟩ k {\displaystyle \langle \cdot ,\cdot \rangle _{k}} 内積はH k {\displaystyle {\mathcal {H}}_{k}} 。
2. RKHS 内の関数は、与えられた点における核の線形結合の閉包に属します。
f ( x ) = ∑ 私 k ( x 私 、 x ) c 私 {\displaystyle f(\mathbf {x} )=\sum _{i}k(\mathbf {x} _{i},\mathbf {x} )c_{i}} 。これにより、線形モデルと一般化線形モデルの両方を統一的な枠組みの中で構築することが可能になる。
3. RKHSにおける二乗ノルムは次のように表すことができます。
‖ f ‖ k 2 = ∑ 私 、 j k ( x 私 、 x j ) c 私 c j {\displaystyle \|f\|_{k}^{2}=\sum _{i,j}k(\mathbf {x} _{i},\mathbf {x} _{j})c_{i}c_{j}} そして、それは関数の複雑さを 測る指標と見なすことができる。
推定量の導出 式 ( 1 )の推定量の明示的な形式は、2 つのステップで導出されます。まず、表現定理[ 9 ] [ 10 ] [ 11 ] によれば、関数 ( 2 ) の最小化は、常にトレーニング セットの点を中心とするカーネルの線形結合として記述できます。
一部の人にとってc ∈ R n \displaystyle \mathbf {c} \in \mathbb {R} ^{n}} 係数の明示的な形式c = [ c 1 、 … 、 c n ] ⊤ \displaystyle \mathbf {c} =[c_{1},\ldots ,c_{n}]^{\top }} を代入することで見つけることができますf ( ⋅ ) {\displaystyle f(\cdot )} 関数(2 )において、式( 3 )の形の関数については、次のようになる。
‖ f ‖ k 2 = ⟨ f 、 f ⟩ k 、 = ⟨ ∑ 私 = 1 N c 私 k ( x 私 、 ⋅ ) 、 ∑ j = 1 N c j k ( x j 、 ⋅ ) ⟩ k 、 = ∑ 私 = 1 N ∑ j = 1 N c 私 c j ⟨ k ( x 私 、 ⋅ ) 、 k ( x j 、 ⋅ ) ⟩ k 、 = ∑ 私 = 1 N ∑ j = 1 N c 私 c j k ( x 私 、 x j ) 、 = c ⊤ K c 。 {\displaystyle {\begin{aligned}\|f\|_{k}^{2}&=\langle f,f\rangle _{k},\\&=\left\langle \sum _{i=1}^{N}c_{i}k(\mathbf {x} _{i},\cdot ),\sum _{j=1}^{N}c_{j}k(\mathbf {x} _{j},\cdot )\right\rangle _{k},\\&=\sum _{i=1}^{N}\sum _{j=1}^{N}c_{i}c_{j}\langle k(\mathbf {x} _{i},\cdot ),k(\mathbf {x} _{j},\cdot )\rangle _{k},\\&=\sum _{i=1}^{N}\sum _{j=1}^{N}c_{i}c_{j}k(\mathbf {x} _{i},\mathbf {x} _{j}),\\&=\mathbf {c} ^{\top }\mathbf {K} \mathbf {c} .\end{aligned}}} 関数(2 )は次のように書き換えることができます。
1 n ‖ y − K c ‖ 2 + λ c ⊤ K c 。 {\displaystyle {\frac {1}{n}}\|\mathbf {y} -\mathbf {K} \mathbf {c} \|^{2}+\lambda \mathbf {c} ^{\top }\mathbf {K} \mathbf {c} .} この関数は凸であるc {\displaystyle \mathbf {c} } したがって、勾配 を に設定することでその最小値を求めることができます。c {\displaystyle \mathbf {c} } ゼロに、
− 1 n K ( Y − K c ) + λ K c = 0 、 ( K + λ n 私 ) c = Y 、 c = ( K + λ n 私 ) − 1 Y 。 {\displaystyle {\begin{aligned}-{\frac {1}{n}}\mathbf {K} (\mathbf {Y} -\mathbf {K} \mathbf {c} )+\lambda \mathbf {K} \mathbf {c} &=0,\\(\mathbf {K} +\lambda n\mathbf {I} )\mathbf {c} &=\mathbf {Y} ,\\\mathbf {c} &=(\mathbf {K} +\lambda n\mathbf {I} )^{-1}\mathbf {Y} .\end{aligned}}} この式を式( 3 )の係数に代入すると、式( 1 )で先に述べた推定値が得られます。
f ^ ( x ′ ) = k ⊤ ( K + λ n 私 ) − 1 Y 。 {\displaystyle {\hat {f}}(\mathbf {x} ')=\mathbf {k} ^{\top }(\mathbf {K} +\lambda n\mathbf {I} )^{-1}\mathbf {Y} .}
ベイズ的視点 カーネルの概念は、ガウス過程 と呼ばれる確率過程 の共分散関数として、ベイズ確率において重要な役割を果たします。
推定量の導出 回帰分析の文脈では、尤度関数は通常ガウス分布であり、観測値は独立同分布(iid)であると仮定されます。
p ( y | f 、 x 、 σ 2 ) = N ( f ( x ) 、 σ 2 ) 。 {\displaystyle p(y|f,\mathbf {x} ,\sigma ^{2})={\mathcal {N}}(f(\mathbf {x} ),\sigma ^{2}).} この仮定は、観測値が分散を持つ平均ゼロのガウスノイズによって汚染されていることに対応します。σ 2 {\displaystyle \sigma ^{2}} 独立同分布(iid)の仮定により、入力セットが与えられた場合、データポイント上の尤度関数を因数分解することが可能になります。X {\displaystyle \mathbf {X} } そしてノイズの分散σ 2 {\displaystyle \sigma ^{2}} したがって、事後分布は解析的に計算できる。テスト入力ベクトルについては、x ′ {\displaystyle \mathbf {x} '} トレーニングデータが与えられた場合S = { X 、 Y } {\displaystyle S=\{\mathbf {X} ,\mathbf {Y} \}} 事後分布は次のように与えられる。
p ( f ( x ′ ) | S 、 x ′ 、 ϕ ) = N ( m ( x ′ ) 、 σ 2 ( x ′ ) ) 、 {\displaystyle p(f(\mathbf {x} ')|S,\mathbf {x} ',{\boldsymbol {\phi }})={\mathcal {N}}(m(\mathbf {x} '),\sigma ^{2}(\mathbf {x} ')),} どこϕ {\displaystyle {\boldsymbol {\phi }}} は、ノイズの分散を含むパラメータのセットを表します。σ 2 {\displaystyle \sigma ^{2}} 共分散関数からのパラメータk {\displaystyle k} そしてどこで
m ( x ′ ) = k ⊤ ( K + σ 2 私 ) − 1 Y 、 σ 2 ( x ′ ) = k ( x ′ 、 x ′ ) − k ⊤ ( K + σ 2 私 ) − 1 k 。 {\displaystyle {\begin{aligned}m(\mathbf {x} ')&=\mathbf {k} ^{\top }(\mathbf {K} +\sigma ^{2}\mathbf {I} )^{-1}\mathbf {Y} ,\\\sigma ^{2}(\mathbf {x} ')&=k(\mathbf {x} ',\mathbf {x} ')-\mathbf {k} ^{\top }(\mathbf {K} +\sigma ^{2}\mathbf {I} )^{-1}\mathbf {k} .\end{aligned}}}
正則化とベイズの関係 正則化理論とベイズ理論の関連性は、有限次元RKHS の場合にのみ実現できます。この仮定の下では、正則化理論とベイズ理論はガウス過程予測を介して関連付けられます。[ 3 ] [ 12 ] [ 13 ]
有限次元の場合、すべてのRKHSは特徴マップで記述できる。Φ : X → R p {\displaystyle \Phi :{\mathcal {X}}\rightarrow \mathbb {R} ^{p}} ただし[ 2 ]
k ( x 、 x ′ ) = ∑ 私 = 1 p Φ 私 ( x ) Φ 私 ( x ′ ) 。 {\displaystyle k(\mathbf {x} ,\mathbf {x} ')=\sum _{i=1}^{p}\Phi ^{i}(\mathbf {x} )\Phi ^{i}(\mathbf {x} ').} カーネルを持つRKHSの関数K {\displaystyle \mathbf {K} } すると次のように書ける
f w ( x ) = ∑ 私 = 1 p w 私 Φ 私 ( x ) = ⟨ w 、 Φ ( x ) ⟩ 、 {\displaystyle f_{\mathbf {w} }(\mathbf {x} )=\sum _{i=1}^{p}\mathbf {w} ^{i}\Phi ^{i}(\mathbf {x} )=\langle \mathbf {w} ,\Phi (\mathbf {x} )\rangle ,} そして、私たちにはそれもあります
‖ f w ‖ k = ‖ w ‖ 。 {\displaystyle \|f_{\mathbf {w} }\|_{k}=\|\mathbf {w} \|.} ここで、ガウス過程を仮定して構築することができます。w = [ w 1 、 … 、 w p ] ⊤ {\displaystyle \mathbf {w} =[w^{1},\ldots ,w^{p}]^{\top }} 平均ゼロ、単位共分散行列を持つ多変量ガウス分布に従って分布する。
w ~ N ( 0 、 私 ) ∝ exp ( − ‖ w ‖ 2 ) 。 {\displaystyle \mathbf {w} \sim {\mathcal {N}}(0,\mathbf {I} )\propto \exp(-\|\mathbf {w} \|^{2}).} ガウス尤度を仮定すると、
P ( Y | X 、 f ) = N ( f ( X ) 、 σ 2 私 ) ∝ exp ( − 1 σ 2 ‖ f w ( X ) − Y ‖ 2 ) 、 {\displaystyle P(\mathbf {Y} |\mathbf {X} ,f)={\mathcal {N}}(f(\mathbf {X} ),\sigma ^{2}\mathbf {I} )\propto \exp \left(-{\frac {1}{\sigma ^{2}}}\|f_{\mathbf {w} }(\mathbf {X} )-\mathbf {Y} \|^{2}\right),} どこf w ( X ) = ( ⟨ w 、 Φ ( x 1 ) ⟩ 、 … 、 ⟨ w 、 Φ ( x n ⟩ ) {\displaystyle f_{\mathbf {w} }(\mathbf {X} )=(\langle \mathbf {w} ,\Phi (\mathbf {x} _{1})\rangle ,\ldots ,\langle \mathbf {w} ,\Phi (\mathbf {x} _{n}\rangle )} 結果として得られる事後分布は次のように表される。
P ( f | X 、 Y ) ∝ exp ( − 1 σ 2 ‖ f w ( X ) − Y ‖ n 2 + ‖ w ‖ 2 ) {\displaystyle P(f|\mathbf {X} ,\mathbf {Y} )\propto \exp \left(-{\frac {1}{\sigma ^{2}}}\|f_{\mathbf {w} }(\mathbf {X} )-\mathbf {Y} \|_{n}^{2}+\|\mathbf {w} \|^{2}\right)} 最大事後確率(MAP)推定は、 ティホノフ正則化 を定義する最小化問題と同等であることがわかります。ベイズの場合、正則化パラメータはノイズ分散に関連しています。
哲学的観点から見ると、正則化設定における損失関数は 、ベイズ設定における尤度関数とは異なる役割を果たします。損失関数は予測時に発生する誤差を測定しますが、f ( x ) {\displaystyle f(\mathbf {x} )} の代わりにy {\displaystyle y} 尤度関数は、生成過程で真であると仮定されたモデルから観測値がどの程度尤もらしいかを測定する。しかし、数学的な観点から見ると、正則化とベイズフレームワークの定式化では、損失関数と尤度関数は、関数の推論を促進するという同じ数学的役割を担うことになる。f {\displaystyle f} ラベルを近似するy {\displaystyle y} できる限り。
参考文献 ↑ Álvarez, Mauricio A.; Rosasco, Lorenzo; Lawrence, Neil D. (2011年6月). "ベクトル値関数のカーネル: レビュー". arXiv : 1106.6251 [ stat.ML ]. 1 2 3 4 ヴァプニク、ウラジミール(1998)。 統計的学習理論 。ワイリー 。ISBN 9780471030034 。1 2 3 Wahba, Grace (1990). 観測データのためのスプラインモデル 。SIAM。Bibcode : 1990smod.conf .....W 。 ↑ Schölkopf, Bernhard; Smola, Alexander J. (2002). Learning with Kernels: Support Vector Machines, Regularization, Optimization, and Beyond . MIT Press. ISBN 9780262194754 。1 2 Girosi, F.; Poggio, T. (1990). "Networks and the best approximation property" (PDF) . Biological Cybernetics . 63 (3). Springer: 169– 176. doi : 10.1007/bf00195855 . hdl : 1721.1/6017 . S2CID 18824241 . ↑ Aronszajn, N (1950 年 5 月). 「再生核の理論」 . アメリカ数学会紀要 . 68 (3): 337–404 . doi : 10.2307/1990404 . JSTOR 1990404 . ↑ シュワルツ、ローラン (1964)。 「Sous-espaces hilbertiens d'espaces vectoriels topologiques et noyaux associés (noyaux reproduisants)」。 Journal d'Analyse Mathématique 。 13 (1).スプリンガー: 115–256 。 土井 : 10.1007/bf02786620 。 S2CID 117202393 。 ↑ Cucker, Felipe; Smale, Steve (2001年10月5日) 「学習の数学的基礎について」 . アメリカ数学会報 . 39 (1): 1– 49. doi : 10.1090/s0273-0979-01-00923-5 . ↑ キメルドルフ、ジョージ S.、ワバ、グレース (1970)。 「確率過程 における ベイズ推定とスプラインによる平滑化の間の対応関係」 。 数理 統計学年報 。41 (2): 495–502。doi : 10.1214/aoms/1177697089 。 ↑ Schölkopf, Bernhard; Herbrich, Ralf; Smola, Alex J. (2001). "A Generalized Representer Theorem". Computational Learning Theory . Lecture Notes in Computer Science. Vol. 2111/2001. pp. 416–426 . doi : 10.1007/3-540-44581-1_27 . ISBN 978-3-540-42343-0 。↑ De Vito, Ernesto; Rosasco, Lorenzo; Caponnetto, Andrea; Piana, Michele; Verri, Alessandro (2004 年 10 月). "正則化カーネル法のいくつかの特性". Journal of Machine Learning Research . 5 : 1363– 1390. 1 2 Rasmussen, Carl Edward; Williams, Christopher KI (2006). Gaussian Processes for Machine Learning . The MIT Press. ISBN 0-262-18253-X 。↑ Huang, Yunfei.; et al. (2019). "細胞比較のための最適化された正則化と自動ベイズパラメータ選択による牽引力顕微鏡法" . Scientific Reports . 9 (1) 539: 537. arXiv : 1810.05848 . Bibcode : 2019NatSR...9..539H . doi : 10.1038/s41598-018-36896-x . PMC 6345967 . PMID 30679578 .