機械学習カーネル関数
機械学習において、ラジアル基底関数カーネル(RBFカーネル)は、さまざまなカーネル化学習アルゴリズムで使用される一般的なカーネル関数です。特に、サポートベクターマシン分類でよく使用されます。[1]
2つのサンプルと上のRBFカーネルは、入力空間上の特徴ベクトルとして表され、 [2]のように定義される。

は、2つの特徴ベクトル間のユークリッド距離の2乗として認識される。は自由パラメータである。同等の定義にはパラメータが含まれる:



RBFカーネルの値は距離とともに減少し、ゼロ(無限距離の極限)から1(x = x'のとき)の範囲をとるため、類似度尺度として簡単に解釈できます。[2]カーネルの
特徴空間は無限次元を持ちます。 の場合、多項式定理を使用した展開は次のようになります。[3]
![{\displaystyle {\begin{alignedat}{2}\exp \left(-{\frac {1}{2}}\|\mathbf {x} -\mathbf {x'} \|^{2}\right)&=\exp({\frac {2}{2}}\mathbf {x} ^{\top }\mathbf {x'} -{\frac {1}{2}}\|\mathbf {x} \|^{2}-{\frac {1}{2}}\|\mathbf {x'} \|^{2})\\[5pt]&=\exp(\mathbf {x} ^{\top }\mathbf {x'} )\exp(-{\frac {1}{2}}\|\mathbf {x} \|^{2})\exp(-{\frac {1}{2}}\|\mathbf {x'} \|^{2})\\[5pt]&=\sum _{j=0}^{\infty }{\frac {(\mathbf {x} ^{\top }\mathbf {x'} )^{j}}{j!}}\exp \left(-{\frac {1}{2}}\|\mathbf {x} \|^{2}\right)\exp \left(-{\frac {1}{2}}\|\mathbf {x'} \|^{2}\right)\\[5pt]&=\sum _{j=0}^{\infty }\quad \sum _{n_{1}+n_{2}+\dots +n_{k}=j}\exp \left(-{\frac {1}{2}}\|\mathbf {x} \|^{2}\right){\frac {x_{1}^{n_{1}}\cdots x_{k}^{n_{k}}}{\sqrt {n_{1}!\cdots n_{k}!}}}\exp \left(-{\frac {1}{2}}\|\mathbf {x'} \|^{2}\right){\frac {{x'}_{1}^{n_{1}}\cdots {x'}_{k}^{n_{k}}}{\sqrt {n_{1}!\cdots n_{k}!}}}\\[5pt]&=\langle \varphi (\mathbf {x} ),\varphi (\mathbf {x'} )\rangle \end{alignedat}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/42635ae6248d951f264fcbe473bef7130b2cb111)

どこ、


近似値
サポートベクターマシンやカーネルトリックを採用した他のモデルは、多数のトレーニングサンプルや入力空間内の多数の特徴にうまく対応できないため、RBFカーネル(および同様のカーネル)の近似値がいくつか導入されています。[4]
通常、これらは関数zの形をとり、単一のベクトルを高次元のベクトルにマッピングしてカーネルを近似します。

ここで、は RBF カーネルに埋め込まれた暗黙的なマッピングです。

フーリエランダム特徴
このようなzを
構築する1つの方法は、カーネルのフーリエ変換[5]からランダムにサンプルを採取することです。ここで、カーネルは正規分布からの独立したサンプルです。
![{\displaystyle \varphi (x)={\frac {1}{\sqrt {D}}}[\cos \langle w_{1},x\rangle ,\sin \langle w_{1},x\rangle , \ldots ,\cos \langle w_{D},x\rangle ,\sin \langle w_{D},x\rangle ]^{T}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/1ebebe5193c52efc25a749492cf0269cd44e7f0d)


定理:
証明:の場合を証明すれば十分です。三角関数の恒等式、ガウス分布の球対称性を用いて、積分を評価します。



定理: . (付録A.2 [6] ).
![{\displaystyle \operatorname {Var} [\langle \varphi (x),\varphi (y)\rangle ]=O(D^{-1})}](https://wikimedia.org/api/rest_v1/media/math/render/svg/e8ab3082dbba4fa920eee2c462249655c7908dc0)
ニストローム法
別のアプローチでは、ニストローム法を使用して、トレーニングセットのランダムサンプルのみを使用して、グラム行列Kの固有値分解を近似します。[7]
参照
参考文献
- ^ Chang, Yin-Wen; Hsieh, Cho-Jui; Chang, Kai-Wei; Ringgaard, Michael; Lin, Chih-Jen (2010). 「線形 SVM による低次多項式データ マッピングのトレーニングとテスト」。Journal of Machine Learning Research。11 : 1471–1490。
- ^ ab ジャン=フィリップ・ヴェール、津田幸治、ベルンハルト・シェルコップ (2004)。 「カーネルメソッドの入門書」。計算生物学におけるカーネルメソッド。
- ^ Shashua, Amnon (2009). 「機械学習入門: 授業ノート 67577」. arXiv : 0904.3664v1 [cs.LG].
- ^ Andreas Müller (2012). 効率的な SVM (およびその他の特徴抽出方法) のためのカーネル近似。
- ^ Rahimi, Ali; Recht, Benjamin (2007). 「大規模カーネルマシンのランダム特徴」.ニューラル情報処理システムの進歩. 20 . Curran Associates, Inc.
- ^ 彭、ハオ;パパス、ニコラオス。ヨガタマ、ダニ。シュワルツ、ロイ。スミス、ノア A.コン、リンペン(2021-03-19)。 「ランダム機能アテンション」。arXiv : 2103.02143 [cs.CL]。
- ^ CKI Williams; M. Seeger (2001). 「Nyström法を使用したカーネルマシンの高速化」.ニューラル情報処理システムの進歩. 13 .