サポートベクターマシンから最小二乗サポートベクターマシンへ
トレーニングセットが与えられた場合
入力データ付き
および対応するバイナリクラスラベル
ヴァプニックの元の定式化によれば、SVM [ 2 ]分類器は次の条件を満たす。
螺旋状のデータ:
青色のデータポイントの場合、
赤いデータポイントの場合
これは以下と同等です
![{\displaystyle y_{i}\left[{w^{T}\phi (x_{i})+b}\right]\geq 1,\quad i=1,\ldots ,N,}](https://wikimedia.org/api/rest_v1/media/math/render/svg/dc1b06b334f9607ee46ceff12d96804510ded3c8)
どこ
これは、元の空間から高次元または無限次元の空間への非線形写像である。
切り離せないデータ
このような分離超平面が存在しない場合、いわゆるスラック変数を導入する。
そのため
![{\displaystyle {\begin{cases}y_{i}\left[{w^{T}\phi (x_{i})+b}\right]\geq 1-\xi _{i},&i=1,\ldots ,N,\\\xi _{i}\geq 0,&i=1,\ldots ,N.\end{cases}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/02acdfbeafc9488823d5ca30484c5c0896559a23)
SVM分類器の結果構造的リスク最小化原理によれば、リスク境界は以下の最小化問題によって最小化される。

![{\displaystyle {\text{制約条件 }}{\begin{cases}y_{i}\left[{w^{T}\phi (x_{i})+b}\right]\geq 1-\xi _{i},&i=1,\ldots ,N,\\\xi _{i}\geq 0,&i=1,\ldots ,N,\end{cases}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/a50b58c5015d9e0fc0e119cb500a10c80f1b02bb)
この問題を解決するために、ラグランジュ関数を構築することができます。
![{\displaystyle L_{1}(w,b,\xi ,\alpha ,\beta )={\frac {1}{2}}w^{T}w+c\sum \limits _{i=1}^{N}{\xi _{i}}-\sum \limits _{i=1}^{N}\alpha _{i}\left\{y_{i}\left[{w^{T}\phi (x_{i})+b}\right]-1+\xi _{i}\right\}-\sum \limits _{i=1}^{N}\beta _{i}\xi _{i},}](https://wikimedia.org/api/rest_v1/media/math/render/svg/25cd5c6aada9cee46dc83578e97fb331f6be0e9c)
どこ
はラグランジュ乗数です。最適点はラグランジュ関数の鞍点にあり、その後、次の式が得られます。
置換により
適切な目的関数と制約条件から構成されるラグランジアンにおける表現により、以下の二次計画問題が得られます。

どこ
はカーネル関数と呼ばれます。この QP 問題を ( 1 )の制約の下で解くと、高次元空間の超平面が得られ、それによって元の空間の分類器が得られます。
SVM分類器の最小二乗バージョンは、最小化問題を次のように再定式化することによって得られます。

等式制約に従う
![{\displaystyle y_{i}\left[{w^{T}\phi (x_{i})+b}\right]=1-e_{i},\quad i=1,\ldots ,N.}](https://wikimedia.org/api/rest_v1/media/math/render/svg/db9a32a7111eab20ff9ead0bc082cb6f031b95d0)
上記の最小二乗SVM(LS-SVM)分類器の定式化は、暗黙のうちに二値ターゲットを用いた回帰解釈に対応している。
。
使用
、 我々は持っています

と
なお、この誤差は最小二乗法によるデータフィッティングにおいても妥当なものであり、回帰分析の場合も同様の最終結果が得られることに注意してください。
したがって、LS-SVM分類器の定式化は以下と同等である。

と
そして
LS-SVM分類器の結果両方
そして
これらは、正則化の量と二乗誤差の合計を調整するためのハイパーパラメータとして考慮されるべきである。解は比率のみに依存する。
したがって、元の処方では
チューニングパラメータとして。
そして
LS-SVMにベイズ解釈を与えるためのパラメータとして。
LS-SVM回帰器の解は、ラグランジュ関数を構築した後に得られます。
![{\displaystyle {\begin{cases}L_{2}(w,b,e,\alpha )\;=J_{2}(w,e)-\sum \limits _{i=1}^{N}\alpha _{i}\left\{{\left[{w^{T}\phi (x_{i})+b}\right]+e_{i}-y_{i}}\right\},\\\quad \quad \quad \quad \quad \;={\frac {1}{2}}w^{T}w+{\frac {\gamma }{2}}\sum \limits _{i=1}^{N}e_{i}^{2}-\sum \limits _{i=1}^{N}\alpha _{i}\left\{\left[w^{T}\phi (x_{i})+b\right]+e_{i}-y_{i}\right\},\end{cases}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/7d3a4f783ed3c7942d4286830edfbb94344a6c4b)
どこ
ラグランジュ乗数は、最適性の条件は

排除
そして
二次計画問題ではなく、線形システムが得られる。
![{\displaystyle \left[{\begin{matrix}0&1_{N}^{T}\\1_{N}&\Omega +\gamma ^{-1}I_{N}\end{matrix}}\right]\left[{\begin{matrix}b\\\alpha \end{matrix}}\right]=\left[{\begin{matrix}0\\Y\end{matrix}}\right],}](https://wikimedia.org/api/rest_v1/media/math/render/svg/cb332b7bff20208e76ef7d19964ebdd5b940549b)
と
、
そして
。 ここ、
は
単位行列、および
カーネル行列は次のように定義されます。
。
カーネル関数K
カーネル関数K (•, •) については、通常、以下の選択肢があります。
- 線形カーネル :

- 次数が多項式の核
:
- 放射基底関数(RBF)カーネル :

- MLPカーネル :

どこ
、
、
、
そして
は定数です。マーサー条件はすべてのに対して成り立つことに注意してください。
そして
多項式およびRBFの場合の値ですが、すべての可能な選択肢に対してではありません。
そして
MLPの場合。スケールパラメータ
、
そして
多項式、RBF、およびMLPカーネル関数における入力のスケーリングを決定します。このスケーリングは統計学におけるカーネルの帯域幅に関連しており、帯域幅はカーネル法の汎化特性の重要なパラメータであることが示されています。
LS-SVMのベイズ解釈
SVMのベイズ解釈はSmolaらによって提案された。彼らは、SVMにおける異なるカーネルの使用は、関数空間上の異なる事前確率分布を定義することとみなせることを示した。
。 ここ
は定数であり、
は、選択されたカーネルに対応する正則化演算子です。
一般的なベイズ証拠フレームワークはMacKayによって開発され、[ 3 ] [ 4 ] [ 5 ] MacKayはそれを回帰、順方向ニューラルネットワーク、分類ネットワークの問題に適用した。提供されたデータセット
モデル
パラメータベクトル付き
そして、いわゆるハイパーパラメータまたは正則化パラメータ
ベイズ推論は、3つのレベルの推論で構成されています。
- レベル 1 では、特定の値に対して
推論の第1レベルでは、事後分布を推論します。
ベイズルールにより

- 推論の第2レベルでは、
最大化することで

- 証拠フレームワークにおける第3レベルの推論では、事後確率を調べることによって異なるモデルをランク付けします。

ベイズ証拠フレームワークは、モデル学習とモデル選択のための統一理論であることがわかります。Kwokは、ベイズ証拠フレームワークを用いてSVMの定式化とモデル選択を解釈しました。また、サポートベクター回帰にもベイズ証拠フレームワークを適用しました。
さて、データポイントが与えられた
そしてハイパーパラメータ
そして
モデル
モデルパラメータ
そして
事後確率を最大化することによって推定される
ベイズの定理を適用すると、次のようになります。

どこ
は、すべての可能な範囲にわたる積分のような正規化定数です。
そして
は 1 に等しいと仮定します。
そして
ハイパーパラメータに依存しない
、およびは条件付き独立である、つまり、

いつ
分布
は一様分布に近似する。さらに、我々は
そして
はガウス分布であるため、事前分布は次のようになります。
そして
と
である

ここ
は特徴空間の次元であり、
。
確率
のみに依存すると想定される
そして
データポイントは独立同分布(iid)であると仮定します。

最小二乗コスト関数を求めるために、データ点の確率は以下に比例すると仮定する。

誤差にはガウス分布が用いられる。
として:

と想定されるのは
そして
クラスの中心が
そして
それぞれターゲット-1と+1にマッピングされる。
クラス要素の
多変量ガウス分布に従い、分散は
。
前述の式を組み合わせ、すべての定数を無視すると、ベイズの定理は次のようになる。

最大事後密度推定値
そして
式(26)の負の対数を最小化することで式(10)が得られる。
参考文献
- ↑ Suykens, J. A. K.; Vandewalle, J. (1999) "最小二乗サポートベクターマシン分類器", Neural Processing Letters , 9 (3), 293–300.
- ↑ Vapnik, V. 統計的学習理論の本質。Springer-Verlag、ニューヨーク、1995年。
- ↑ MacKay, D. J. C. ベイズ補間。ニューラル計算、4(3): 415–447、1992年5月。
- ↑ MacKay, D. J. C. バックプロパゲーションネットワークのための実用的なベイズフレームワーク。Neural Computation、4(3): 448–472、1992年5月。
- ↑ MacKay, D. J. C. 分類ネットワークに適用されたエビデンスフレームワーク。Neural Computation、4(5): 720–736、1992年9月。
参考文献
- JAK Suykens、T. Van Gestel、J. De Brabanter、B. De Moor、J. Vandewalle、最小二乗サポート ベクター マシン、World Scientific Pub. Co.、シンガポール、2002 年。ISBN 981-238-151-1
- Suykens J. A. K.、Vandewalle J.、「最小二乗サポートベクターマシン分類器」、Neural Processing Letters、第9巻、第3号、1999年6月、pp. 293–300。
- ウラジミール・ヴァプニク著『統計的学習理論の本質』シュプリンガー・フェルラーク、1995年。ISBN 0-387-98780-0
- MacKay, DJC、「可能性のあるネットワークともっともらしい予測 ― 教師ありニューラルネットワークのための実用的なベイズ法のレビュー」、Network: Computation in Neural Systems、第6巻、1995年、469~505ページ 。
外部リンク
- www.esat.kuleuven.be/sista/lssvmlab/「最小二乗サポートベクターマシンラボ(LS-SVMlab)ツールボックスには、多数のLS-SVMアルゴリズムのMatlab/C実装が含まれています。」
- www.kernel-machines.org「サポートベクターマシンとカーネルベースの手法(Smola & Schölkopf)」
- www.gaussianprocess.org「ガウス過程:回帰と分類のための関数に対するガウス過程事前分布を用いたデータモデリング(マッケイ、ウィリアムズ)」
- www.support-vector.net「サポートベクターマシンとカーネルベースの手法(クリスティアニーニ)」
- dlib:大規模データセット向けの最小二乗SVM実装が含まれています。