多重カーネル学習とは、あらかじめ定義されたカーネルセットを使用し、アルゴリズムの一部としてカーネルの最適な線形または非線形結合を学習する機械学習手法の集合を指します。多重カーネル学習を使用する理由としては、a) より多くのカーネルセットから最適なカーネルとパラメータを選択できるため、カーネル選択によるバイアスを軽減しつつ、より自動化された機械学習手法が可能になること、b) 類似性の概念が異なるため異なるカーネルを必要とする、異なるソース(例えば、ビデオの音声と画像)からのデータを組み合わせることなどが挙げられます。新しいカーネルを作成する代わりに、多重カーネルアルゴリズムを使用して、各データソースに対して既に確立されているカーネルを組み合わせることができます。
複数のカーネル学習アプローチは、ビデオにおけるイベント認識[ 1 ] 、画像における物体認識[ 2 ]、および生体医療データの融合[ 3 ]など、多くのアプリケーションで使用されています。
複数のカーネル学習アルゴリズムは、教師あり学習、半教師あり学習、および教師なし学習のために開発されてきました。ほとんどの研究はカーネルの線形結合を用いた教師あり学習のケースで行われてきましたが、多くのアルゴリズムが開発されています。複数のカーネル学習アルゴリズムの基本的な考え方は、学習アルゴリズムの最小化問題に余分なパラメータを追加することです。例として、一連のカーネルの線形結合の教師あり学習のケースを考えてみましょう。カーネル新しいカーネルを導入します、 どこは各カーネルの係数のベクトルです。カーネルは加法的であるため(再生核ヒルベルト空間の性質による)、この新しい関数も依然としてカーネルです。データセットの場合ラベル付きすると、最小化問題は次のように書ける。
どこは誤差関数であり、は正則化項です。は一般的に二乗損失関数(チホノフ正則化)またはヒンジ損失関数(SVMアルゴリズムの場合)であり、通常はノルムまたはノルムの組み合わせ(つまり、エラスティックネット正則化)です。この最適化問題は、標準的な最適化手法で解くことができます。逐次最小最適化などの既存の手法の適応も、複数のカーネルSVMベースの手法向けに開発されています。[ 4 ]
教師あり学習には、カーネルの形状を学習するためにさまざまな方法を使用するアルゴリズムが他にも多数あります。GonenとAlpaydın(2011)[ 5 ]は、次の分類を提案しました。
上述の線形結合アルゴリズムのような固定ルールアプローチでは、ルールを用いてカーネルの組み合わせを設定します。これらはパラメータ化を必要とせず、加算や乗算などのルールを用いてカーネルを結合します。重みはアルゴリズム内で学習されます。固定ルールの他の例としては、次の形式のペアワイズカーネルがあります。
これらのペアワイズアプローチは、タンパク質間相互作用の予測に用いられてきた。[ 6 ]
これらのアルゴリズムは、パラメータ化された組み合わせ関数を使用します。パラメータは一般的に、単一カーネルのパフォーマンスまたはカーネル行列からの何らかの計算に基づいて、個々のカーネルごとに定義されます。これらの例としては、Tenabe et al. (2008) のカーネルが挙げられます。[ 7 ]のみを使用して得られる精度、そして単一カーネル精度の最小値よりも小さい閾値として定義できます。
他のアプローチでは、カーネル類似性の定義を使用します。
この尺度を用いて、QuiとLane(2009)[ 8 ]は、以下のヒューリスティックを用いて定義した。
これらのアプローチは、カーネル結合関数のパラメータを決定するための最適化問題を解決します。これは、類似度尺度と構造的リスク最小化アプローチで行われてきました。上記で定義されたような類似度尺度の場合、問題は次のように定式化できます。[ 9 ]
どここれはトレーニングセットのカーネルです。
構造的リスク最小化アプローチとして用いられてきたものには、Lanckriet ら (2002) が用いたような線形アプローチが含まれる。[ 10 ]カーネルの非現実性を定義することができる。これは、標準的なSVM問題を解いた後の目的関数の値です。次に、以下の最小化問題を解くことができます。
どこは正の定数です。同じ考え方に基づく他の多くのバリエーションが存在し、個々のカーネルに非負の重みを使用したり、カーネルの非線形結合を使用したりして、問題を洗練して解決するためのさまざまな方法が用いられています。
ベイズアプローチでは、カーネルパラメータに事前分布を設定し、事前分布と基本アルゴリズムからパラメータ値を学習します。例えば、決定関数は次のように記述できます。
ディリクレ事前分布でモデル化でき、これは、平均ゼロのガウス分布と逆ガンマ分散事前分布を用いてモデル化できます。このモデルは、ギブスサンプラーを用いたカスタマイズされた多項プロビットアプローチを使用して最適化されます。
[ 11 ] これらの方法は、タンパク質フォールド認識やタンパク質相同性問題などのアプリケーションで成功裏に使用されています[ 12 ] [ 13 ]
ブースティング手法では、パフォーマンスの関数である停止基準に達するまで、新しいカーネルを繰り返し追加します。その例として、Bennett ら (2002) によって開発された MARK モデルがあります[ 14 ]。
パラメータそして座標ベースで勾配降下法によって学習されます。このようにして、降下アルゴリズムの各反復で、各反復で選択する最適なカーネル列が特定され、それが結合カーネルに追加されます。その後、モデルが再実行され、最適な重みが生成されます。そして。
多重カーネル学習への半教師あり学習アプローチは、教師あり学習アプローチの他の拡張と類似しています。画像分類のために、ラベルなしデータに対して対数尤度経験損失と条件付き期待値コンセンサスを用いたグループLASSO正則化を使用する帰納的手順が開発されました。問題を次のように定義できます。ラベル付きデータとし、をラベルなしデータの集合とする。すると、決定関数は次のように記述できる。
問題は次のように書ける。
どこは損失関数(この場合は重み付き負の対数尤度)であり、は正則化パラメータ(この場合はグループLASSO )であり、は、ラベルなしデータに対する条件付き期待値コンセンサス(CEC)ペナルティです。CECペナルティは次のように定義されます。すべてのデータに対する周辺カーネル密度を とします。
どこ(ラベル付きデータとすべてのラベル付きデータおよびラベルなしデータとの間のカーネル距離)は、2ノルムが1の非負のランダムベクトルです。は各カーネルが投影される回数です。次に、MKD に対して期待値正則化が実行され、参照期待値が得られます。そしてモデルの予測。次に、定義します。
どこはカルバック・ライブラー情報量です。結合された最小化問題は、修正ブロック勾配降下法アルゴリズムを使用して最適化されます。詳細については、Wang ら[ 15 ]を参照してください。
教師なし多重カーネル学習アルゴリズムもZhuangらによって提案されている。問題は次のように定義される。ラベルなしデータのセットとする。カーネルの定義は線形結合カーネルである。この問題では、カーネル距離に基づいてデータをグループに「クラスタリング」する必要があります。次のようなグループまたはクラスターであるはメンバーです。損失関数を次のように定義します。さらに、歪みを最小限に抑えるために、最後に、過学習を防ぐために正則化項を追加します。これらの項を組み合わせると、最小化問題は次のように表すことができます。
ここで、。この定式化の一つは次のように定義される。行列とする。つまりそして隣人同士です。それから、これらのグループも学習する必要があることに注意してください。Zhuang らは、交互最小化法によってこの問題を解決します。そしてグループ詳細については、Zhuang et al. [ 16 ]を参照してください。
利用可能なMKLライブラリには以下が含まれます。