アプリケーション SVMは、さまざまな現実世界の問題を解決するために使用できます。
SVMはテキストおよびハイパーテキストの分類 に役立ちます。その適用により、標準的な帰納的および転導的 設定の両方でラベル付きトレーニングインスタンスの必要性を大幅に削減できます。 [ 11 ] 浅い意味解析 のためのいくつかの方法はサポートベクターマシンに基づいています。[ 12 ] 画像の分類は SVMを使用しても実行できます。実験結果によると、SVMは関連性フィードバックを3~4回行うだけで、従来のクエリ絞り込み方式よりも大幅に高い検索精度を達成します。これは、 Vapnikが提案した特権アプローチを使用する修正版SVMを使用するものを含む画像セグメンテーション システムにも当てはまります。[ 13 ] [ 14 ] 教師ありSVMを用いたSAR データなどの衛星データの分類。 [ 15 ] 手書き文字はSVMを使用して認識 できます。[ 16 ] [ 17 ] SVMアルゴリズムは、生物学やその他の科学分野で広く応用されています。タンパク質の分類に使用され、化合物の最大90%が正しく分類されています。SVM重みに基づく順列検定は 、SVMモデルの解釈メカニズムとして提案されています。[ 18 ] [ 19 ] サポートベクターマシンの重みは、過去にSVMモデルの解釈にも使用されました。[ 20 ] モデルが予測を行うために使用する特徴を特定するためのサポートベクターマシンモデルの事後解釈は、生物科学において特に重要な比較的新しい研究分野です。
線形SVM 2つのクラスのサンプルを用いて学習させたSVMにおける、最大マージン超平面とマージン。マージン上のサンプルはサポートベクターと呼ばれます。 トレーニングデータセットが与えられますn {\displaystyle n} 形式のポイント ( x 1 、 y 1 ) 、 … 、 ( x n 、 y n ) 、 {\displaystyle (\mathbf {x} _{1},y_{1}),\ldots ,(\mathbf {x} _{n},y_{n}),} どこでy 私 \displaystyle y_{i}} は 1 または -1 のいずれかであり、それぞれが点が属するクラスを示しますx 私 {\displaystyle \mathbf {x} _{i}} それぞれが属する。x 私 {\displaystyle \mathbf {x} _{i}} はp {\displaystyle p} n次元実 ベクトル。点群を分割する「最大マージン超平面」を見つけたい。x 私 {\displaystyle \mathbf {x} _{i}} そのためにy 私 = 1 {\displaystyle y_{i}=1} 点群からy 私 = − 1 \displaystyle y_{i}=-1} これは、超平面と最も近い点との間の距離として定義されます。x 私 {\displaystyle \mathbf {x} _{i}} どちらのグループからも最大化される。
任意の超平面は 点の集合として表すことができるx {\displaystyle \mathbf {x} } 満足 w T x − b = 0 、 {\displaystyle \mathbf {w} ^{\mathsf {T}}\mathbf {x} -b=0,} どこw {\displaystyle \mathbf {w} } は、(必ずしも正規化されていない)超平面への法線ベクトルです。これは ヘッセ標準形 によく似ていますが、w {\displaystyle \mathbf {w} } は必ずしも単位ベクトルではありません。パラメータb ‖ w ‖ {\displaystyle {\tfrac {b}{\|\mathbf {w} \|}}} 超平面の原点からのオフセットを法線ベクトルに沿って決定するw {\displaystyle \mathbf {w} } 。
バイアスは次のように定義することもできます。 w T x + b = 0. {\displaystyle \mathbf {w} ^{\mathsf {T}}\mathbf {x} +b=0.}
ソフトマージン データが線形分離可能でないケースにSVMを拡張するには、ヒンジ損失 関数が役立ちます。 最大 ( 0 、 1 − y 私 ( w T x 私 − b ) ) 。 {\displaystyle \max \left(0,1-y_{i}(\mathbf {w} ^{\mathsf {T}}\mathbf {x} _{i}-b)\right).}
ご了承くださいy 私 \displaystyle y_{i}} はi 番目のターゲット(つまり、この場合は 1 または -1)であり、w T x 私 − b {\displaystyle \mathbf {w} ^{\mathsf {T}}\mathbf {x} _{i}-b} これはi 番目の出力です。
この関数は、 (1) の制約が満たされる場合、つまり、x 私 {\displaystyle \mathbf {x} _{i}} データは余白の正しい側に位置する。余白の間違った側に位置するデータの場合、関数の値は余白からの距離に比例する。
最適化の目標は、以下を最小化することです。
‖ w ‖ 2 + C [ 1 n ∑ 私 = 1 n 最大 ( 0 、 1 − y 私 ( w T x 私 − b ) ) ] 、 {\displaystyle \lVert \mathbf {w} \rVert ^{2}+C\left[{\frac {1}{n}}\sum _{i=1}^{n}\max \left(0,1-y_{i}(\mathbf {w} ^{\mathsf {T}}\mathbf {x} _{i}-b)\right)\right],}
パラメータC > 0 {\displaystyle C>0} マージンサイズを増やすことと、x 私 {\displaystyle \mathbf {x} _{i}} 余白の正しい側に位置する(上記の式ではどちらの項にも重みを追加できることに注意してください)。ヒンジ損失を分解することで、この最適化問題は次のように定式化できます。
最小限に抑える w 、 b 、 ζ ‖ w ‖ 2 2 + C ∑ 私 = 1 n ζ 私 対象 y 私 ( w ⊤ x 私 − b ) ≥ 1 − ζ 私 、 ζ 私 ≥ 0 ∀ 私 ∈ { 1 、 … 、 n } {\displaystyle {\begin{aligned}&{\underset {\mathbf {w} ,\;b,\;\mathbf {\zeta } }{\operatorname {minimize} }}&&\|\mathbf {w} \|_{2}^{2}+C\sum _{i=1}^{n}\zeta _{i}\\&{\text{subject to}}&&y_{i}(\mathbf {w} ^{\top }\mathbf {x} _{i}-b)\geq 1-\zeta _{i},\quad \zeta _{i}\geq 0\quad \forall i\in \{1,\dots ,n\}\end{aligned}}}
したがって、大きな値の場合C {\displaystyle C} 入力データが線形に分類可能であれば、ハードマージンSVMと同様の動作をしますが、分類ルールが有効かどうかを学習します。
SVM分類器の計算 (ソフトマージン)SVM分類器を計算することは、次の形式の式を最小化することに相当します。
我々はソフトマージン分類器に注目する。なぜなら、上記のように、十分に小さな値を選択することでλ {\displaystyle \lambda } 線形分類可能な入力データに対して、ハードマージン分類器が得られます。(2) を二次計画 問題に還元する古典的なアプローチについては、以下で詳しく説明します。次に、劣勾配降下法や座標降下法などのより新しいアプローチについて説明します。
プライマル (2) を最小化する問題は、微分可能な目的関数を持つ制約付き最適化問題として次のように書き換えることができる。
各私 ∈ { 1 、 … 、 n } {\displaystyle i\in \{1,\,\ldots ,\,n\}} 変数を導入しますζ 私 = 最大 ( 0 、 1 − y 私 ( w T x 私 − b ) ) {\displaystyle \zeta _{i}=\max \left(0,1-y_{i}(\mathbf {w} ^{\mathsf {T}}\mathbf {x} _{i}-b)\right)} 。 ご了承くださいζ 私 {\displaystyle \zeta _{i}} を満たす最小の非負数y 私 ( w T x 私 − b ) ≥ 1 − ζ 私 。 {\displaystyle y_{i}(\mathbf {w} ^{\mathsf {T}}\mathbf {x} _{i}-b)\geq 1-\zeta _{i}.}
したがって、最適化問題を次のように書き換えることができます。
最小限に抑える 1 n ∑ 私 = 1 n ζ 私 + λ ‖ w ‖ 2 対象 y 私 ( w T x 私 − b ) ≥ 1 − ζ 私 そして ζ 私 ≥ 0 、 すべての人々のために 私 。 {\displaystyle {\begin{aligned}&{\text{minimize }}{\frac {1}{n}}\sum _{i=1}^{n}\zeta _{i}+\lambda \|\mathbf {w} \|^{2}\\[0.5ex]&{\text{subject to }}y_{i}\left(\mathbf {w} ^{\mathsf {T}}\mathbf {x} _{i}-b\right)\geq 1-\zeta _{i}\,{\text{ and }}\,\zeta _{i}\geq 0,\,{\text{for all }}i.\end{aligned}}}
これは原始 問題と呼ばれる。
カーネルトリック カーネルがφ(( a , b )) = ( a , b , a 2 + b 2 )で与えられるSVMのトレーニング例ここで、変換されたデータポイントに対する線形分類ルールに対応する非線形分類ルールを学習したいと仮定します。φ ( x 私 ) 。 {\displaystyle \varphi (\mathbf {x} _{i}).} さらに、カーネル関数が与えられている。k {\displaystyle k} これは以下を満たすk ( x 私 、 x j ) = φ ( x 私 ) ⋅ φ ( x j ) {\displaystyle k(\mathbf {x} _{i},\mathbf {x} _{j})=\varphi (\mathbf {x} _{i})\cdot \varphi (\mathbf {x} _{j})} 。
分類ベクトルはわかっていますw {\displaystyle \mathbf {w} } 変換された空間では、
w = ∑ 私 = 1 n c 私 y 私 φ ( x 私 ) 、 {\displaystyle \mathbf {w} =\sum _{i=1}^{n}c_{i}y_{i}\varphi (\mathbf {x} _{i}),}
そこで、c 私 {\displaystyle c_{i}} 最適化問題を解くことによって得られる
最大化 f ( c 1 … c n ) = ∑ 私 = 1 n c 私 − 1 2 ∑ 私 = 1 n ∑ j = 1 n y 私 c 私 ( φ ( x 私 ) ⋅ φ ( x j ) ) y j c j = ∑ 私 = 1 n c 私 − 1 2 ∑ 私 = 1 n ∑ j = 1 n y 私 c 私 k ( x 私 、 x j ) y j c j 対象 ∑ 私 = 1 n c 私 y 私 = 0 、 そして 0 ≤ c 私 ≤ 1 2 n λ すべての人々のために 私 。 {\displaystyle {\begin{aligned}{\text{maximize}}\,\,f(c_{1}\ldots c_{n})&=\sum _{i=1}^{n}c_{i}-{\frac {1}{2}}\sum _{i=1}^{n}\sum _{j=1}^{n}y_{i}c_{i}(\varphi (\mathbf {x} _{i})\cdot \varphi (\mathbf {x} _{j}))y_{j}c_{j}\\&=\sum _{i=1}^{n}c_{i}-{\frac {1}{2}}\sum _{i=1}^{n}\sum _{j=1}^{n}y_{i}c_{i}k(\mathbf {x} _{i},\mathbf {x} _{j})y_{j}c_{j}\\{\text{subject to }}\sum _{i=1}^{n}c_{i}y_{i}&=0,\,{\text{and }}0\leq c_{i}\leq {\frac {1}{2n\lambda }}\;{\text{for all }}i.\end{aligned}}}
係数c 私 {\displaystyle c_{i}} 以前と同様に、二次計画法を用いて解くことができます。ここでも、いくつかのインデックスを見つけることができます。私 {\displaystyle i} そのため0 < c 私 < ( 2 n λ ) − 1 {\displaystyle 0<c_{i}<(2n\lambda )^{-1}} 、 となることによってφ ( x 私 ) {\displaystyle \varphi (\mathbf {x} _{i})} 変換された空間の境界上に位置し、そして解決する
b = w T φ ( x 私 ) − y 私 = [ ∑ j = 1 n c j y j φ ( x j ) ⋅ φ ( x 私 ) ] − y 私 = [ ∑ j = 1 n c j y j k ( x j 、 x 私 ) ] − y 私 。 {\displaystyle {\begin{aligned}b=\mathbf {w} ^{\mathsf {T}}\varphi (\mathbf {x} _{i})-y_{i}&=\left[\sum _{j=1}^{n}c_{j}y_{j}\varphi (\mathbf {x} _{j})\cdot \varphi (\mathbf {x} _{i})\right]-y_{i}\\&=\left[\sum _{j=1}^{n}c_{j}y_{j}k(\mathbf {x} _{j},\mathbf {x} _{i})\right]-y_{i}.\end{aligned}}}
ついに、
z ↦ サイン ( w T φ ( z ) − b ) = サイン ( [ ∑ 私 = 1 n c 私 y 私 k ( x 私 、 z ) ] − b ) 。 {\displaystyle \mathbf {z} \mapsto \operatorname {sgn}(\mathbf {w} ^{\mathsf {T}}\varphi (\mathbf {z} )-b)=\operatorname {sgn} \left(\left[\sum _{i=1}^{n}c_{i}y_{i}k(\mathbf {x} _{i},\mathbf {z} )\right]-b\right).}
現代的な方法 SVM分類器を見つけるための最近のアルゴリズムには、劣勾配降下法と座標降下法があります。これらの手法はどちらも、大規模で疎なデータセットを扱う際に、従来の手法に比べて大きな利点があることが証明されています。劣勾配法は訓練例が多い場合に特に効率的であり、座標降下法は特徴空間の次元が高い場合に有効です。
準勾配降下 SVM のサブ勾配降下アルゴリズムは、式を直接扱います。
f ( w 、 b ) = [ 1 n ∑ 私 = 1 n 最大 ( 0 、 1 − y 私 ( w T x 私 − b ) ) ] + λ ‖ w ‖ 2 。 {\displaystyle f(\mathbf {w} ,b)=\left[{\frac {1}{n}}\sum _{i=1}^{n}\max \left(0,1-y_{i}(\mathbf {w} ^{\mathsf {T}}\mathbf {x} _{i}-b)\right)\right]+\lambda \|\mathbf {w} \|^{2}.}
ご了承くださいf {\displaystyle f} は凸関数 であるw {\displaystyle \mathbf {w} } そしてb {\displaystyle b} そのため、従来の勾配降下 法(SGD )を適用することができ、関数の勾配の方向にステップを踏む代わりに、関数のサブ勾配 から選択されたベクトルの方向にステップを踏みます。このアプローチの利点は、特定の実装では反復回数がスケーリングしないことです。n {\displaystyle n} データポイントの数。[ 24 ]
座標降下 SVMの座標降下アルゴリズムは双対問題から成り立っています
最大化 f ( c 1 … c n ) = ∑ 私 = 1 n c 私 − 1 2 ∑ 私 = 1 n ∑ j = 1 n y 私 c 私 ( x 私 ⋅ x j ) y j c j 、 対象 ∑ 私 = 1 n c 私 y 私 = 0 、 そして 0 ≤ c 私 ≤ 1 2 n λ すべての人々のために 私 。 {\displaystyle {\begin{aligned}&{\text{maximize}}\,\,f(c_{1}\ldots c_{n})=\sum _{i=1}^{n}c_{i}-{\frac {1}{2}}\sum _{i=1}^{n}\sum _{j=1}^{n}y_{i}c_{i}(x_{i}\cdot x_{j})y_{j}c_{j},\\&{\text{subject to }}\sum _{i=1}^{n}c_{i}y_{i}=0,\,{\text{and }}0\leq c_{i}\leq {\frac {1}{2n\lambda }}\;{\text{for all }}i.\end{aligned}}}
各私 ∈ { 1 、 … 、 n } {\displaystyle i\in \{1,\,\ldots ,\,n\}} 繰り返し、係数c 私 {\displaystyle c_{i}} の方向に調整されます∂ f / ∂ c 私 {\displaystyle \partial f/\partial c_{i}} すると、結果として得られる係数ベクトルは( c 1 ′ 、 … 、 c n ′ ) {\displaystyle (c_{1}',\,\ldots ,\,c_{n}')} 与えられた制約を満たす最も近い係数ベクトルに投影されます。(通常はユークリッド距離が使用されます。)その後、ほぼ最適な係数ベクトルが得られるまでこのプロセスが繰り返されます。結果として得られるアルゴリズムは、実際には非常に高速ですが、性能保証はほとんど証明されていません。[ 25 ]
経験的リスク最小化 上述のソフトマージンサポートベクターマシンは、ヒンジ損失 に対する経験的リスク最小化 (ERM)アルゴリズムの一例である。このように考えると、サポートベクターマシンは統計的推論のための自然なアルゴリズム群に属し、その多くの特徴はヒンジ損失の挙動に起因する。この視点から、SVMがどのように、そしてなぜ機能するのかについてより深い洞察が得られ、その統計的特性をより適切に分析できるようになる。
SVMとヒンジ損失 (ソフトマージン)SVM分類器を思い出してくださいw ^ 、 b : x ↦ サイン ( w ^ T x − b ) {\displaystyle {\hat {\mathbf {w} }},b:\mathbf {x} \mapsto \operatorname {sgn}({\hat {\mathbf {w} }}^{\mathsf {T}}\mathbf {x} -b)} 次の式を最小化するように選択されます。
[ 1 n ∑ 私 = 1 n 最大 ( 0 、 1 − y 私 ( w T x − b ) ) ] + λ ‖ w ‖ 2 。 {\displaystyle \left[{\frac {1}{n}}\sum _{i=1}^{n}\max \left(0,1-y_{i}(\mathbf {w} ^{\mathsf {T}}\mathbf {x} -b)\right)\right]+\lambda \|\mathbf {w} \|^{2}.}
上記の議論を踏まえると、SVM手法は、チホノフ正則化を用いた経験的リスク最小化と同等であり、この場合、損失関数はヒンジ損失となることがわかる。
ℓ ( y 、 z ) = 最大 ( 0 、 1 − y z ) 。 {\displaystyle \ell (y,z)=\max \left(0,1-yz\right).}
この観点から、SVMは正則化最小二乗法 やロジスティック回帰 などの他の基本的な分類アルゴリズムと密接に関連している。3つの違いは損失関数の選択にある。正則化最小二乗法は 二乗損失 による経験的リスク最小化に相当する。 ℓ s q ( y 、 z ) = ( y − z ) 2 {\displaystyle \ell _{sq}(y,z)=(y-z)^{2}} ; ロジスティック回帰では対数損失 を採用します。
ℓ ログ ( y 、 z ) = ln ( 1 + e − y z ) 。 {\displaystyle \ell _{\log }(y,z)=\ln(1+e^{-yz}).}
物件 SVMは一般化線形分類器 のファミリーに属し、パーセプトロン の拡張として解釈できます。[ 27 ] また、チホノフ正則化 の特殊なケースと考えることもできます。特別な特性として、経験的分類誤差 を最小化し、幾何学的マージンを最大化します。そのため、 最大マージン分類器 としても知られています。
SVMと他の分類器との比較は、Meyer、Leisch、Hornikによって行われている。[ 28 ]
問題 SVMの潜在的な欠点としては、以下の点が挙げられます。
入力データの完全なラベル付けが必要です 未較正のクラス帰属確率 ― SVMは、有限データ上で確率を推定することを避けるVapnikの理論に由来する。 SVMは2クラス分類タスクにのみ直接適用可能です。そのため、多クラス分類タスクを複数の二値分類問題に分解するアルゴリズムを適用する必要があります。詳細については、多クラスSVMの セクションを参照してください。 解かれたモデルのパラメータは解釈が難しい。
拡張機能
マルチクラスSVM 多クラスSVMは、サポートベクターマシンを用いてインスタンスにラベルを割り当てることを目的としており、ラベルは有限個の要素の集合から抽出されます。
そのための主流のアプローチは、単一の多クラス問題を複数の 二値分類 問題に縮小することです。[ 30 ] このような縮小の一般的な方法には、次のものがあります。[ 30 ] [ 31 ]
ラベルの 1 つと残りのラベルを区別する ( 1 対 全員 ) またはクラスのすべてのペアを区別する ( 1 対 1 ) バイナリ分類器を構築します。1 対 全員の場合、新しいインスタンスの分類は勝者総取り戦略によって行われ、出力関数が最も高い分類器がクラスを割り当てます (出力関数が同等のスコアを生成するように調整されていることが重要です)。1 対 1 アプローチの場合、分類は最大勝利投票戦略によって行われ、各分類器がインスタンスを 2 つのクラスのいずれかに割り当て、割り当てられたクラスの投票が 1 つ増加し、最終的に最も多くの票を獲得したクラスがインスタンスの分類を決定します。 有向非巡回グラフ SVM(DAGSVM)[ 32 ] エラー訂正出力コード [ 33 ] CrammerとSingerは、多クラス分類 問題を複数の二値分類問題に分解するのではなく、単一の最適化問題に変換する多クラスSVM手法を提案した。[ 34 ] Lee、Lin、Wahba [ 35 ] [ 36 ] およびVan den BurgとGroenen [ 37 ] も参照のこと。
トランスダクティブサポートベクターマシン トランスダクティブサポートベクターマシンは、トランスダクション の原理に従うことで、半教師あり学習 において部分的にラベル付けされたデータも扱うことができるという点で、SVMを拡張したものです。ここでは、トレーニングセットに加えて、D {\displaystyle {\mathcal {D}}} 学習者には、セットも与えられます
D ⋆ = { x 私 ⋆ ∣ x 私 ⋆ ∈ R p } 私 = 1 k {\displaystyle {\mathcal {D}}^{\star }=\{\mathbf {x} _{i}^{\star }\mid \mathbf {x} _{i}^{\star }\in \mathbb {R} ^{p}\}_{i=1}^{k}}
分類されるテスト例の数。形式的には、トランスダクティブサポートベクターマシンは、次の主最適化問題によって定義されます。[ 38 ]
最小化する(w 、 b 、 y ⋆ {\displaystyle \mathbf {w} ,b,\mathbf {y} ^{\star }} )
1 2 ‖ w ‖ 2 {\displaystyle {\frac {1}{2}}\|\mathbf {w} \|^{2}}
(いかなる場合でも)私 = 1 、 … 、 n {\displaystyle i=1,\dots ,n} そしてどんなj = 1 、 … 、 k {\displaystyle j=1,\dots ,k} )
y 私 ( w ⋅ x 私 − b ) ≥ 1 、 y j ⋆ ( w ⋅ x j ⋆ − b ) ≥ 1 、 {\displaystyle {\begin{aligned}&y_{i}(\mathbf {w} \cdot \mathbf {x} _{i}-b)\geq 1,\\&y_{j}^{\star }(\mathbf {w} \cdot \mathbf {x} _{j}^{\star }-b)\geq 1,\end{aligned}}}
そして
y j ⋆ ∈ { − 1 、 1 } 。 {\displaystyle y_{j}^{\star }\in \{-1,1\}.}
トランスダクティブサポートベクターマシンは、1998年にウラジミール・N・ヴァプニクによって導入された。
構造化SVM 構造化サポートベクターマシンは、従来のSVMモデルの拡張です。SVMモデルは主に二値分類、多クラス分類、回帰タスク向けに設計されていますが、構造化SVMは、構文解析ツリー、分類体系による分類、配列アライメントなど、一般的な構造化出力ラベルを扱うようにその適用範囲を広げています。[ 39 ]
実装 最大マージン超平面のパラメータは、最適化問題を解くことによって求められます。SVMから生じる二次計画 問題(QP)を迅速に解くための専用アルゴリズムがいくつか存在し、そのほとんどは、問題をより小さく扱いやすい部分に分割するためのヒューリスティックに依存しています。
別のアプローチとしては、ニュートン法 に似た反復法を用いて主問題と双対問題のカルーシュ・クーン・タッカー条件 の解を求める内点法 を用いる方法がある。 [ 46 ] このアプローチでは、一連の細分化された問題を解く代わりに、問題全体を直接解く。大きなカーネル行列を含む線形システムを解くことを避けるために、カーネルトリックでは行列の低ランク近似がよく用いられる。
もう1つの一般的な方法は、Plattの逐次最小最適化 (SMO)アルゴリズムです。これは問題を2次元のサブ問題に分解し、解析的に解くことで、数値最適化アルゴリズムと行列の保存の必要性を排除します。このアルゴリズムは概念的に単純で、実装が容易で、一般的に高速であり、難しいSVM問題に対して優れたスケーリング特性を持っています。[ 47 ]
The special case of linear support vector machines can be solved more efficiently by the same kind of algorithms used to optimize its close cousin, logistic regression ; this class of algorithms includes sub-gradient descent (e.g., PEGASOS[ 48] ) and coordinate descent (e.g., LIBLINEAR[ 49] ). LIBLINEAR has some attractive training-time properties. Each convergence iteration takes time linear in the time taken to read the train data, and the iterations also have a Q-linear convergence property, making the algorithm extremely fast.
The general kernel SVMs can also be solved more efficiently using sub-gradient descent (e.g. P-packSVM[ 50] ), especially when parallelization is allowed.
Kernel SVMs are available in many machine-learning toolkits, including LIBSVM , MATLAB , SAS, SVMlight, kernlab, scikit-learn , Shogun , Weka , Shark, JKernelMachines, OpenCV and others.
Preprocessing of data (standardization) is highly recommended to enhance accuracy of classification.[ 51] There are a few methods of standardization, such as min-max, normalization by decimal scaling, Z-score.[ 52] Subtraction of mean and division by variance of each feature is usually used for SVM.[ 53]
References 1 2 3 Cortes, Corinna ; Vapnik, Vladimir (1995). "Support-vector networks"(PDF) . Machine Learning . 20 (3): 273– 297. CiteSeerX 10.1.1.15.9362 . doi :10.1007/BF00994018 . S2CID 206787478.↑ Vapnik, Vladimir N. (1997). "サポートベクター法" . Gerstner, Wulfram; Germond, Alain; Hasler, Martin; Nicoud, Jean-Daniel (編). Artificial Neural Networks — ICANN'97 . Lecture Notes in Computer Science. Vol. 1327. Berlin, Heidelberg: Springer. pp. 261–271 . doi : 10.1007/BFb0020166 . ISBN 978-3-540-69620-9 。↑ Awad, Mariette; Khanna, Rahul (2015). "Support Vector Machines for Classification". Efficient Learning Machines . Apress. pp. 39–66 . doi : 10.1007/978-1-4302-5990-9_3 . ISBN 978-1-4302-5990-9 。↑ ベン・ハー、アサ。ホーン、デイビッド。ジーゲルマン、ハバ;ヴァプニク、ウラジミール N.」 「サポートベクタークラスタリング」(2001)。機械学習研究ジャーナル 。2 : 125–137 。↑ Huang, HH; Xu, T.; Yang, J. (2014). "高血圧予測におけるロジスティック回帰、サポートベクターマシン、および永久分類法の比較" . BMC Proceedings . 8 (Suppl 1): S96. doi : 10.1186/1753-6561-8-S1-S96 . PMC 4143639 . PMID 25519351 . ↑ Opper, M; Kinzel, W; Kleinz, J; Nehl, R (1990). "最適パーセプトロンの一般化能力について" . Journal of Physics A: Mathematical and General . 23 (11): L581. Bibcode : 1990JPhA...23L.581O . doi : 10.1088/0305-4470/23/11/012 . ↑ "1.4. サポートベクターマシン — scikit-learn 0.20.2 ドキュメント" 。 2017年11月8日にオリジナルから アーカイブされました 。 2017年11月8日 に取得。 ↑ Hastie, Trevor ; Tibshirani, Robert ; Friedman, Jerome (2008). The Elements of Statistical Learning : Data Mining, Inference, and Prediction (Second ed.). New York: Springer. p. 134. 1 2 3 Boser, Bernhard E.; Guyon, Isabelle M.; Vapnik, Vladimir N. (1992). "最適マージン分類器の学習アルゴリズム" . Proceedings of the fifth annual workshop on Computational learning theory – COLT '92 . p. 144. CiteSeerX 10.1.1.21.3818 . doi : 10.1145/130385.130401 . ISBN 978-0897914970 . S2CID 207165665 . ↑ Press, William H.; Teukolsky, Saul A.; Vetterling, William T.; Flannery, Brian P. (2007). "Section 16.5. Support Vector Machines" . Numerical Recipes: The Art of Scientific Computing (3rd ed.). New York: Cambridge University Press. ISBN 978-0-521-88068-8 2011年8月11日にオリジナルからアーカイブされました。↑ Joachims, Thorsten (1998). "Text categorization with Support Vector Machines: Learning with many relevant features". Machine Learning: ECML-98 . Lecture Notes in Computer Science. Vol. 1398. Springer. pp. 137–142 . doi : 10.1007/BFb0026683 . ISBN 978-3-540-64417-0 。↑ Pradhan, Sameer S.; et al. (2004年5月2日). サポートベクターマシンを用いた浅層意味解析 . 北米計算言語学会人間言語技術会議(HLT-NAACL 2004)議事録. 計算言語学会. pp. 233–240 . ↑ ヴァプニク、ウラジミール・N.:招待講演者。IPMU情報処理・管理2014)。 ↑ Barghout, Lauren (2015). "画像セグメンテーションのための反復ファジー意思決定で使用される空間分類情報粒度」 (PDF) . Granular Computing and Decision-Making . Studies in Big Data. Vol. 10. pp. 285–318. doi : 10.1007 /978-3-319-16829-6_12 . ISBN 978-3-319-16828-9 . S2CID 4154772 . 2018年1月8日にオリジナル(PDF)からアーカイブされました 。 2018年1月8日 に取得。 ↑ A. Maity (2016). "RADARSAT-2偏波データの教師あり分類による様々な地形の特徴の分類". arXiv : 1608.00501 [ cs.CV ]. ↑ DeCoste, Dennis (2002). "Training Invariant Support Vector Machines" (PDF) . Machine Learning . 46 ( 1– 3): 161– 190. Bibcode : 2002MLear..46..161D . doi : 10.1023/A:1012454411458 . S2CID 85843 . ↑ Maitra, DS; Bhattacharya, U.; Parui, SK (2015年8月)「複数の文字体系の手書き文字認識のためのCNNベースの共通アプローチ」 2015年第13回国際文書解析認識会議(ICDAR) pp. 1021–1025 . doi : 10.1109/ICDAR.2015.7333916 . ISBN 978-1-4799-1805-8 . S2CID 25739012 . ↑ Gaonkar, B.; Davatzikos, C. (2013). "サポートベクターマシンに基づく多変量画像解析と分類のための統計的有意性マップの解析的推定" . NeuroImage . 78 : 270–283 . doi : 10.1016 /j.neuroimage.2013.03.066 . PMC 3767485. PMID 23583748 . ↑ Cuingnet, Rémi; Rosso, Charlotte; Chupin, Marie; Lehéricy, Stéphane; Dormont, Didier; Benali, Habib; Samson, Yves; Colliot, Olivier (2011). "脳卒中転帰に関連する拡散変化の検出のためのSVMの空間的正則化" (PDF) . Medical Image Analysis . 15 (5): 729– 737. doi : 10.1016/j.media.2011.05.007 . PMID 21752695 . 2018-12-22に オリジナル (PDF) からアーカイブ済み。2018-01-08 に 取得 。 ↑ Statnikov, Alexander; Hardin, Douglas; & Aliferis, Constantin; (2006); "SVM重みベースの手法を用いて因果関係のある変数と因果関係のない変数を識別する" , Sign , 1, 4. ↑ 「SVMマージンが等しいのはなぜですか 2 ‖ w ‖ {\displaystyle {\frac {2}{\|\mathbf {w} \|}}} 「 . Mathematics Stack Exchange . 2015年5月30日」↑ Aizerman, Mark A.; Braverman, Emmanuel M. & Rozonoer, Lev I. (1964). "パターン認識学習におけるポテンシャル関数法の理論的基礎". Automation and Remote Control . 25 : 821–837 . ↑ Jin, Chi; Wang, Liwei (2012). Dimensionality dependent PAC-Bayes margin bound . Advances in Neural Information Processing Systems. CiteSeerX 10.1.1.420.3487 . 2015年4月2日にオリジナルから アーカイブされました。 ↑ Shalev-Shwartz, Shai; Singer, Yoram; Srebro, Nathan; Cotter, Andrew (2010-10-16). "Pegasos: SVM の主推定サブ勾配ソルバー". Mathematical Programming . 127 (1): 3– 30. CiteSeerX 10.1.1.161.9629 . doi : 10.1007/s10107-010-0420-4 . ISSN 0025-5610 . S2CID 53306004 . ↑ Hsieh, Cho-Jui; Chang, Kai-Wei; Lin, Chih-Jen; Keerthi, S. Sathiya; Sundararajan, S. (2008-01-01). "大規模線形SVMのためのデュアル座標降下法". 第25回国際機械学習会議 - ICML '08 議事録 . ニューヨーク州ニューヨーク、米国: ACM. pp. 408–415 . CiteSeerX 10.1.1.149.5594 . doi : 10.1145/1390156.1390208 . ISBN 978-1-60558-205-4 . S2CID 7880266 . ↑ ロザスコ、ロレンツォ。デ・ヴィート、エルネスト。カポネット、アンドレア。ピアナ、ミケーレ。ヴェッリ、アレッサンドロ (2004-05-01)。 「損失関数はすべて同じですか?」 。 ニューラル計算 。 16 (5): 1063–1076 。 CiteSeerX 10.1.1.109.6786 。 土井 : 10.1162/089976604773135104 。 hdl : 11380/4590 。 ISSN 0899-7667 。 PMID 15070510 。 S2CID 11845688 。 ↑ R. Collobert および S. Bengio (2004). パーセプトロン、MLP、SVM 間のリンク。国際機械学習会議 (ICML) 議事録。 ↑ Meyer, David; Leisch, Friedrich; Hornik, Kurt (2003 年 9 月). 「テスト中のサポートベクターマシン」. Neurocomputing . 55 ( 1– 2): 169– 186. doi : 10.1016/S0925-2312(03)00431-4 . ↑ Hsu, Chih-Wei; Chang, Chih-Chung & Lin, Chih-Jen (2003). サポートベクター分類の実践ガイド (PDF) (技術報告書). 国立台湾大学コンピュータ科学情報工学科. 2013年6月25日にオリジナルから アーカイブ (PDF) 。 1 2 Duan, Kai-Bo; Keerthi, S. Sathiya (2005). "Which Is the Best Multiclass SVM Method? An Empirical Study" (PDF) . Multiple Classifier Systems . LNCS . Vol. 3541. pp. 278– 285. CiteSeerX 10.1.1.110.6789 . doi : 10.1007/11494683_28 . ISBN 978-3-540-26306-7 2013年5月3日にオリジナル(PDF) からアーカイブされました。2019年7月18日 に取得 。↑ Hsu, Chih-Wei & Lin, Chih-Jen (2002). "A Comparison of Methods for Multiclass Support Vector Machines" (PDF) . IEEE Transactions on Neural Networks . 13 (2): 415– 25. Bibcode : 2002ITNN...13..415H . doi : 10.1109/72.991427 . PMID 18244442 . 2013-05-03 の オリジナル (PDF)からアーカイブ済み。2018-01-08 に 取得 。 ↑ Platt, John; Cristianini, Nello ; Shawe-Taylor, John (2000). "Large margin DAGs for multiclass classification" (PDF) . In Solla, Sara A. ; Leen, Todd K.; Müller, Klaus-Robert (eds.). Advances in Neural Information Processing Systems . MIT Press. pp. 547– 553. 2012年6月16日のオリジナルから アーカイブ (PDF) 。 ↑ Dietterich, Thomas G.; Bakiri, Ghulum (1995). "Solving Multiclass Learning Problems via Error-Correcting Output Codes" (PDF) . Journal of Artificial Intelligence Research . 2 : 263– 286. arXiv : cs/9501101 . Bibcode : 1995cs........1101D . doi : 10.1613/jair.105 . S2CID 47109072 . 2013年5月9日にオリジナルから アーカイブ (PDF) 。 ↑ Crammer, Koby & Singer, Yoram (2001). "On the Algorithmic Implementation of Multiclass Kernel-based Vector Machines" (PDF) . Journal of Machine Learning Research . 2 : 265– 292. 2015年8月29日にオリジナルから アーカイブされた (PDF) 。 ↑ Lee, Yoonkyung; Lin, Yi & Wahba, Grace (2001). "Multicategory Support Vector Machines" (PDF) . Computing Science and Statistics . 33 . 2013年6月17日にオリジナルからアーカイブ済み。 ↑ Lee, Yoonkyung; Lin, Yi; Wahba, Grace (2004). "Multicategory Support Vector Machines". Journal of the American Statistical Association . 99 (465): 67– 81. CiteSeerX 10.1.1.22.1879 . doi : 10.1198/016214504000000098 . S2CID 7066611 . ↑ ヴァン デン バーグ、ゲリット JJ & グローネン、パトリック JF (2016)。 「GenSVM: 汎用マルチクラス サポート ベクター マシン」 (PDF) 。 機械学習研究ジャーナル 。 17 (224): 1–42 。 ↑ Joachims, Thorsten. サポートベクターマシンを用いたテキスト分類のためのトランスダクティブ推論 (PDF) . 1999年国際機械学習会議 (ICML 1999) 議事録. pp. 200–209 . ↑ 「相互依存的で構造化された出力空間のためのサポートベクターマシン学習」 (PDF) . www.cs.cornell.edu . ↑ Drucker, Harris; Burges, Christ. C.; Kaufman, Linda; Smola, Alexander J.; および Vapnik, Vladimir N. (1997); "サポートベクター回帰マシン", Advances in Neural Information Processing Systems 9, NIPS 1996 , 155–161, MIT Press. ↑ Suykens, Johan AK; Vandewalle, Joos PL; "最小二乗サポートベクターマシン分類器", Neural Processing Letters 、第9巻、第3号、1999年6月、pp. 293–300。 ↑ Smola, Alex J.; Schölkopf, Bernhard (2004). "サポートベクター回帰のチュートリアル" (PDF) . Statistics and Computing . 14 (3): 199– 222. Bibcode : 2004StCom..14..199S . CiteSeerX 10.1.1.41.1452 . doi : 10.1023/B:STCO.0000035301.49549.88 . S2CID 15475 . 2012年1月31日にオリジナルから アーカイブ (PDF) 。 ↑ Polson, Nicholas G.; Scott, Steven L. (2011). "サポートベクターマシンのためのデータ拡張" . ベイズ分析 . 6 (1): 1– 23. doi : 10.1214/11-BA601 . ↑ Wenzel, Florian; Galy-Fajou, Theo; Deutsch, Matthäus; Kloft, Marius (2017). "ビッグデータのためのベイズ非線形サポートベクターマシン". Machine Learning and Knowledge Discovery in Databases . Lecture Notes in Computer Science. Vol. 10534. pp. 307–322 . arXiv : 1707.05532 . Bibcode : 2017arXiv170705532W . doi : 10.1007/978-3-319-71249-9_19 . ISBN 978-3-319-71248-2 . S2CID 4018290 . ↑ Florian Wenzel; Matthäus Deutsch; Théo Galy-Fajou; Marius Kloft;「ベイズ非線形サポートベクターマシンのためのスケーラブルな近似推論」 ↑ Ferris, Michael C.; Munson, Todd S. (2002). "Interior-Point Methods for Massive Support Vector Machines" (PDF) . SIAM Journal on Optimization . 13 (3): 783– 804. CiteSeerX 10.1.1.216.6893 . doi : 10.1137/S1052623400374379 . S2CID 13563302 . 2008-12-04 のオリジナルから アーカイブ (PDF) 。 ↑ Platt, John C. (1998). Sequential Minimal Optimization: A Fast Algorithm for Training Support Vector Machines (PDF) . NIPS. 2015-07-02 のオリジナルから アーカイブ (PDF) 。 ↑ Shalev-Shwartz, Shai; Singer, Yoram; Srebro, Nathan (2007). Pegasos: Primal Estimated sub-GrAdient SOlver for SVM (PDF) . ICML. 2013年12月15日にオリジナルから アーカイブ済み (PDF) 。 ↑ Fan, Rong-En; Chang, Kai-Wei; Hsieh, Cho-Jui; Wang, Xiang-Rui; Lin, Chih-Jen (2008). "LIBLINEAR: 大規模線形分類のためのライブラリ" (PDF) . Journal of Machine Learning Research . 9 : 1871– 1874. ↑ Allen Zhu, Zeyuan; Chen, Weizhu; Wang, Gang; Zhu, Chenguang; Chen, Zheng (2009). P-packSVM: Parallel Primal grAdient desCent Kernel SVM (PDF) . ICDM. 2014-04-07 のオリジナルから アーカイブ (PDF) 。 ↑ Fan, Rong-En; Chang, Kai-Wei; Hsieh, Cho-Jui; Wang, Xiang-Rui; Lin, Chih-Jen (2008). "LIBLINEAR: 大規模線形分類のためのライブラリ". Journal of Machine Learning Research . 9 (Aug): 1871– 1874. ↑ Mohamad, Ismail; Usman, Dauda (2013-09-01). "標準化とK平均クラスタリングアルゴリズムへの影響" . Research Journal of Applied Sciences, Engineering and Technology . 6 (17): 3299– 3303. doi : 10.19026/rjaset.6.3638 . ↑ Fennell, Peter; Zuo, Zhiya; Lerman, Kristina (2019-12-01). "構造化特徴空間分解による行動データの予測と説明" . EPJ Data Science . 8 23. arXiv : 1810.09841 . doi : 10.1140/epjds/s13688-019-0201-0 .
さらに読む Bennett, Kristin P.; Campbell, Colin (2000). "Support Vector Machines: Hype or Hallelujah?" (PDF) . SIGKDD Explorations . 2 (2): 1– 13. doi : 10.1145/380995.380999 . S2CID 207753020 . クリスティアニーニ、ネロ;ショー=テイラー、ジョン(2000)。サポートベクターマシンとその他のカーネルベース学習法入門 。ケンブリッジ大学出版局。ISBN 0-521-78019-5 。 Fradkin, Dmitriy; Muchnik, Ilya (2006). "Support Vector Machines for Classification" (PDF) . In Abello, J.; Carmode, G. (eds.). Discrete Methods in Epidemiology . DIMACS Series in Discrete Mathematics and Theoretical Computer Science. Vol. 70. pp. 13– 20. Joachims, Thorsten (1998). 「サポートベクターマシンによるテキスト分類:多数の関連特徴量を用いた学習」。Nédellec, Claire、Rouveirol, Céline (編)『機械 学習:ECML-98』 所収。Lecture Notes in Computer Science、第1398巻。ベルリン、 ハイデルベルク:Springer。pp. 137–142。doi : 10.1007 / BFb0026683。ISBN 978-3-540-64417-0 . S2CID 2427083 . Ivanciuc, Ovidiu (2007). 「化学におけるサポートベクターマシンの応用」(PDF) . Reviews in Computational Chemistry . Vol. 23. pp. 291–400 . doi : 10.1002/9780470116449.ch6 . ISBN 9780470116449 。 James, Gareth; Witten, Daniela; Hastie, Trevor; Tibshirani, Robert (2013). 「サポートベクターマシン」(PDF) . 『統計的学習入門 :Rによる応用』 . ニューヨーク:Springer. pp. 337–372 . ISBN 978-1-4614-7137-0 。 シェルコップフ、ベルンハルト。スモラ、アレクサンダー J. (2002)。カーネルで学ぶ 。マサチューセッツ州ケンブリッジ:MITプレス。ISBN 0-262-19475-9 。 スタインワート、インゴ。クリストマン、アンドレアス (2008)。サポートベクターマシン 。ニューヨーク:スプリンガー。ISBN 978-0-387-77241-7 。 テオドリディス、セルギオス;クトゥルンバス、コンスタンティノス(2009)。パターン認識 (第4 版)。アカデミック・プレス。ISBN 978-1-59749-272-0 。
外部リンク libsvm、LIBSVM はSVM学習器の一般的なライブラリです。 liblinearは、SVMを含む大規模な線形分類のためのライブラリです。 SVM lightは、SVMを用いた学習と分類のためのソフトウェアツールの集合体です。 SVMJS ライブデモ ( 2013年5月5日にWayback Machine に アーカイブ) は、 JavaScript による SVM 実装の GUI デモです。