カーネル メソッドは、入力データと関数の対応する出力の関係を分析するための確立されたツールです。カーネルは、計算効率の高い方法で関数のプロパティをカプセル化し、アルゴリズムがさまざまな複雑さの関数を簡単に交換できるようにします。
典型的な機械学習アルゴリズムでは、これらの関数はスカラー出力を生成します。ベクトル値出力を持つ関数のカーネル法の最近の開発は、少なくとも部分的には、関連する問題を同時に解決することへの関心によるものです。問題間の関係性を捉えるカーネルにより、カーネルは互いの強みを借りることができます。このタイプのアルゴリズムには、マルチタスク学習(マルチ出力学習またはベクトル値学習とも呼ばれます)、転移学習、およびコクリギングが含まれます。マルチラベル分類は、入力をクラスの数に等しい長さの(バイナリ)コーディングベクトルにマッピングすることとして解釈できます。
ガウス過程において、カーネルは共分散関数と呼ばれます。複数出力関数は、複数の過程を考慮することに対応します。2つの観点の関係については、
正規化のベイズ解釈を参照してください。
歴史
ベクトル値関数の学習の歴史は、転移学習と密接に関係しています。転移学習とは、ある問題を解決しながら得られた知識を保存し、それを別の関連する問題に適用することです。機械学習の分野における転移学習の基本的な動機は、以前に学習した知識を保持して再利用する生涯にわたる機械学習方法の必要性に焦点を当てた「学習するための学習」に関する NIPS-95 ワークショップで議論されました。転移学習に関する研究は、1995 年以来、学習するための学習、生涯学習、知識移転、帰納的移転、マルチタスク学習、知識統合、文脈依存学習、知識ベース帰納的バイアス、メタ学習、増分/累積学習など、さまざまな名前で大きな注目を集めています。[1]ベクトル値関数の学習への関心は、複数の異なるタスクを同時に学習しようとするフレームワークであるマルチタスク学習によって特に刺激されました。
機械学習コミュニティにおけるマルチタスク学習の初期研究の多くはアルゴリズム的な性質のものであり、1990 年代にニューラル ネットワーク、決定木、 k近傍法などの方法に適用されました。 [2]確率モデルとガウス過程の使用は、ベクトル値の出力データに対する予測がコクリギングとして知られている地統計学の文脈で開拓され、主に開発されました。[3] [4] [5]多変量モデリングに対する地統計学的アプローチは、主に共地域化の線形モデル (LMC) を中心に定式化されています。これは、有効な共分散関数を開発するための生成アプローチであり、多変量回帰や、高価な多変量コンピュータ コードのコンピュータ エミュレーションの統計に使用されています。ベクトル値関数の正則化とカーネル理論の文献は、2000 年代に続きました。[6] [7]ベイズと正則化の観点は独立して開発されましたが、実際には密接に関連しています。[8]
表記
この文脈では、教師あり学習の問題は、与えられた入力(データ)に対してベクトル値の出力を最もよく予測する関数を学習することです。



のために
、入力スペース(例)

一般に、( )の各成分は、異なる基数( )を持つ異なる入力データ( ) 、さらには異なる入力空間( )を持つ可能性があります。[8]地質統計学の文献では、このケースを異所性と
呼び、出力ベクトルの各成分が同じ入力セットを持つことを示すために同位体を使用します。[9]


ここでは、表記を簡単にするために、各出力のデータの数とサンプル空間は同じであると仮定します。
正規化の観点[8][10][11]
正規化の観点から見ると、問題はベクトル値関数 ( ) の再生核ヒルベルト空間に属することを学習することです。これは、表記にいくつかの特別な注意を払った、
ティホノフ正規化のスカラーの場合に似ています。

簡単ではないが、ベクトル値設定におけるティホノフ正則化に対しても代表定理が成り立つことを示すことは可能である。[8]
行列値カーネルは、空間上のスカラーカーネルによって定義することもできることに注意してください。これら 2 つのカーネルに関連付けられたヒルベルト空間の間には
等長変換が存在します。



ガウス過程の観点
ベクトル値正則化フレームワークの推定量は、有限次元再生核ヒルベルト空間の場合、ガウス過程法を使用してベイズの観点からも導出できます。導出は、スカラー値の場合の正則化のベイズ解釈に似ています。出力で構成されるベクトル値関数は、ガウス過程に従うと想定されます。




ここで、は出力の平均関数のベクトルであり、は出力と間の共分散に対応する要素を持つ正定値行列値関数です。






入力 のセットに対して、ベクトル 上の事前分布は で与えられます。ここで、は出力に関連付けられた平均ベクトルを連結したベクトルであり、はブロック分割された行列です。出力の分布はガウス分布であるとみなされます。






ここで、は各出力のノイズを指定する要素を持つ対角行列です。この形式を尤度に使用すると、新しいベクトルの予測分布は次のようになります。




ここで、はトレーニング データであり、 はおよびのハイパーパラメータのセットです。




およびの方程式は次のようになります。




ここで、には、および のエントリがあります。予測子は、正則化フレームワークで導出された予測子と同一であることに注意してください。非ガウス尤度の場合、推定値を近似するには、ラプラス近似や変分法などの異なる方法が必要です。





カーネルの例
分離可能
シンプルだが広く適用可能なマルチ出力カーネルのクラスは、入力空間上のカーネルと出力間の相関関係を表すカーネルの積に分けることができる。[8]

: スカラーカーネルオン
: スカラーカーネルオン
行列形式の場合:
は対称かつ半正定値行列です。単位行列に設定すると、出力は無関係として扱われ、スカラー出力問題を個別に解くことと同じになることに注意してください。




もう少し一般的な形式では、これらのカーネルをいくつか追加すると、分離可能なカーネルの合計(SoS カーネル) が生成されます。
正規化に関する文献より[8][10][12][13][14]
正規化子から派生
取得する 1 つの方法は、の複雑さを望ましい方法で制限する正則化子を指定してから、対応するカーネルを導出することです。特定の正則化子の場合、このカーネルは分離可能であることがわかります。


混合効果レギュラライザー

どこ:




ここで、すべてのエントリが 1 に等しい行列。

この正則化は、推定量 ( ) の各コンポーネントの複雑さを制限し、推定量の各コンポーネントをすべてのコンポーネントの平均に近づけることを組み合わせたものです。設定では、すべてのコンポーネントが独立したものとして扱われ、スカラー問題を個別に解決することと同じです。設定では、すべてのコンポーネントが同じ関数によって説明されると想定されています。



クラスターベースの正規化

どこ:
クラスタに属するコンポーネントのインデックスセットです 
クラスターの濃度は

と両方がクラスターに属する場合 (そうでない場合




どこ
この正規化子は、コンポーネントをクラスターに分割し、各クラスター内のコンポーネントが類似するように強制します。

グラフ正規化

ここで、成分間の類似性を符号化する重み行列


どこ、 
注:はグラフラプラシアンです。グラフ カーネルも参照してください。

データから学んだこと
データから学習するためのいくつかのアプローチが提案されている。[8]これらには、トレーニングデータから推定するための予備的な推論ステップを実行すること、[9]クラスター正則化に基づいて学習して一緒に学習するという提案、 [15]いくつかの特徴のみが必要であると仮定するスパース性ベースのアプローチなどがある。[16] [17]


ベイズ文献より
共地域化の線形モデル (LMC)
LMC では、出力は独立したランダム関数の線形結合として表現され、結果として得られる共分散関数 (すべての入力と出力にわたって) は有効な半正定値関数になります。出力が であると仮定すると、それぞれは次のように表現されます。





ここで、はスカラー係数であり、独立関数は の場合平均が 0、共分散が covで、それ以外の場合は 0 になります。任意の 2 つの関数と間の相互共分散は次のように表すことができます。


![{\displaystyle [u_{q}({\textbf {x}}),u_{q'}({\textbf {x}}')]=k_{q}({\textbf {x}},{\ textbf {x}}')}](https://wikimedia.org/api/rest_v1/media/math/render/svg/94c2d624382fa181caf040165060219391391b54)



![{\displaystyle \operatorname {cov} [f_{d}({\textbf {x}}),f_{d'}({\textbf {x}}')]=\sum _{q=1}^{Q}{\sum _{i=1}^{R_{q}}{a_{d,q}^{i}a_{d',q}^{i}k_{q}({\textbf {x}},{\textbf {x}}')}}=\sum _{q=1}^{Q}{b_{d,d'}^{q}k_{q}({\textbf {x}},{\textbf {x}}')}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/4b989d28ca039bc00ee39df54066b58ef6f32c69)
ここで、関数、 、 は平均がゼロで共分散 cov がおよび の場合に成り立ちます。しかしは で与えられます。したがって、カーネルは次のように表すことができます
。


![{\displaystyle [u_{q}^{i}({\textbf {x}}),u_{q'}^{i'}({\textbf {x}})']=k_{q}({ \textbf {x}},{\textbf {x}}')}](https://wikimedia.org/api/rest_v1/media/math/render/svg/dfc5752c51aed2805749825256cde77bf9312716)


![{\displaystyle \operatorname {cov} [f_{d}({\textbf {x}}),f_{d'}({\textbf {x}}')]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/f300368de0c371b6741e4115c61a2f20c47d7a74)



ここで、それぞれは共領域化行列と呼ばれます。したがって、LMC から導出されるカーネルは、2 つの共分散関数の積の合計です。1 つは入力ベクトルとは無関係に出力間の依存関係をモデル化する共分散関数(共領域化行列) で、もう 1 つは入力の依存関係を無関係にモデル化する共分散関数(共分散関数) です。





内在的共地域化モデル (ICM)
ICM は LMC の簡略版で、 です。ICM では、共領域化行列の要素は、適切な係数 に対してと表せるものと想定しています。 のこの形式では、






![{\displaystyle \operatorname {cov} \left[f_{d}(\mathbf {x} ),f_{d'}(\mathbf {x} ')\right]=\sum _{q=1}^{ Q}{v_{d,d'}b_{q}k_{q}(\mathbf {x} ,\mathbf {x} ')}=v_{d,d'}\sum _{q=1}^{Q}{b_{q}k_{q}(\mathbf {x} ,\mathbf {x} ')}=v_{d,d'}k(\mathbf {x} , \mathbf {x} ')}](https://wikimedia.org/api/rest_v1/media/math/render/svg/d7186b241efbc726649fac71acfaa5e35449f73d)
どこ

この場合、係数は

複数の出力のカーネル行列は になります。ICM は、各基本共分散が出力の自己共分散と相互共分散の構築に等しく寄与すると仮定するため、LMC よりもはるかに制限が厳しくなります。ただし、推論に必要な計算は大幅に簡素化されます。


セミパラメトリック潜在因子モデル (SLFM)
LMC のもう 1 つの簡略化されたバージョンは、セミパラメトリック潜在因子モデル (SLFM) です。これは、設定( ICM ではなく) に対応します。したがって、各潜在関数には独自の共分散があります。



分離不可能
分離可能なカーネルの構造は単純ですが、一部の問題では制限が厳しすぎる場合があります。
正規化の文献における非分離カーネルの注目すべき例には以下のものがあります。
- 発散フリーまたは回転フリーのベクトル場(または2つの凸結合)を推定するために設計された行列値指数二次(EQ)カーネル[8] [18]
- 変換によって定義されるカーネル[8] [19]
ベイジアンの観点では、ある点で評価される出力関数は、その点における潜在関数の値にのみ依存するため、LMC は分離可能なカーネルを生成します。潜在関数を混合する簡単な方法は、基本プロセスを平滑化カーネルで畳み込むことです。基本プロセスがガウス過程である場合、畳み込み過程もガウス過程です。したがって、畳み込みを利用して共分散関数を構築できます。[20]分離不可能なカーネルを生成するこの方法は、プロセス畳み込みとして知られています。プロセス畳み込みは、機械学習コミュニティで複数の出力に対して「従属ガウス過程」として導入されました。[21]
実装
上記のカーネルのいずれかを使用してアルゴリズムを実装する場合は、パラメータの調整と合理的な計算時間の確保に関する実際的な考慮事項を考慮する必要があります。
正規化の観点
正則化の観点からアプローチすると、パラメータの調整はスカラー値の場合と同様であり、一般にクロス検証で実行できます。必要な線形システムを解くには、通常、メモリと時間がかかります。カーネルが分離可能な場合は、座標変換によってブロック対角行列に変換できるため、D 個の独立したサブ問題 (およびの固有値分解) を解くことで計算負荷が大幅に軽減されます。特に、最小二乗損失関数 (Tikhonov 正則化) の場合、 の閉じた形式の解が存在します。[8] [14]


ベイジアンの視点
ガウス過程のパラメータ推定に関連する研究は数多くあります。周辺尤度の最大化(証拠近似、タイプ II 最大尤度、経験ベイズとも呼ばれる)や最小二乗法などの方法では、パラメータ ベクトルの点推定値が得られます。また、事前分布を割り当て、サンプリング手順で事後分布を計算することで、完全なベイズ推論を採用した研究もあります。非ガウス尤度の場合、事後分布や周辺尤度に閉じた形式の解はありません。ただし、周辺尤度は、複数の出力分類に対するラプラス、変分ベイズ、または期待値伝播 (EP) 近似フレームワークで近似でき、ハイパーパラメータの推定値を見つけるために使用できます。


ベイズ的観点における主な計算上の問題は、行列の逆行列を求める正則化理論に現れる問題と同じである。

このステップは、周辺尤度と予測分布を計算するために必要です。計算量を削減するために提案されているほとんどの近似法では、得られる計算効率は、多出力共分散行列を計算するために使用される特定の方法(LMC、プロセス畳み込みなど)に依存しません。多出力ガウス過程の計算量を削減するためのさまざまな方法の概要は、[8]に示されています。
参考文献
- ^ SJ Pan および Q. Yang、「転移学習に関する調査」、IEEE Transactions on Knowledge and Data Engineering、22、2010 年
- ^ リッチ・カルアナ、「マルチタスク学習」、機械学習、41–76、1997
- ^ J. Ver Hoef と R. Barry、「共クリギングと多変量空間予測のためのモデルの構築とフィッティング[リンク切れ ]」、Journal of Statistical Planning and Inference、69:275–294、1998
- ^ P. Goovaerts、「天然資源評価のための地質統計学」、オックスフォード大学出版局、米国、1997年
- ^ N. クレッシー「空間データのための統計」、ジョン・ワイリー・アンド・サンズ社(改訂版)、米国、1993年
- ^ CA Micchelli と M. Pontil、「ベクトル値関数の学習について」、Neural Computation、17:177–204、2005 年
- ^ C. Carmeli 他「積分可能関数のベクトル値再生核ヒルベルト空間とマーサー定理」Anal. Appl. (Singap.)、4
- ^ abcdefghijk Mauricio A. Álvarez、Lorenzo Rosasco、Neil D. Lawrence、「ベクトル値関数のカーネル: レビュー」、機械学習の基礎と傾向 4、no. 3 (2012): 195–266。土井: 10.1561/2200000036 arXiv:1106.6251
- ^ ab ハンス・ヴァッカーナーゲル。多変量地球統計学。 Springer-Verlag ハイデルベルク、ニューヨーク、2003 年。
- ^ ab CA Micchelli および M. Pontil。ベクトル値関数の学習について。Neural Computation、17:177–204、2005 年。
- ^ C.Carmeli、E.DeVito、A.Toigo。積分可能関数のベクトル値再生核ヒルベルト空間とマーサー定理。Anal. Appl. (Singap.)、4(4):377–408、2006年。
- ^ CA Micchelli および M. Pontil。マルチタスク学習のためのカーネル。Advances in Neural Information Processing Systems (NIPS)。MIT Press、2004 年。
- ^ T.Evgeniou、CAMicchelli、M.Pontil。カーネル法による複数タスクの学習。機械学習研究ジャーナル、6:615–637、2005年。
- ^ ab L. Baldassarre、L. Rosasco、A. Barla、A. Verri。スペクトルフィルタリングによるマルチ出力学習。技術レポート、マサチューセッツ工科大学、2011年。MIT-CSAIL-TR-2011-004、CBCL-296。
- ^ Laurent Jacob、Francis Bach、Jean-Philippe Vert。「クラスター化されたマルチタスク学習:凸定式化」NIPS 21、745~752ページ、2008年。
- ^ Andreas Argyriou、Theodoros Evgeniou、Massimiliano Pontil。凸型マルチタスク特徴学習。機械学習、73(3):243–272、2008年。
- ^ Andreas Argyriou、Andreas Maurer、Massimiliano Pontil。異機種環境における転移学習アルゴリズム。ECML/PKDD (1)、71~85ページ、2008年。
- ^ I. マセドと R. カストロ。行列値カーネルを使用した発散フリーおよびカールフリーのベクトル場を学習します。技術レポート、国立マテマティカ大学、2008 年。
- ^ A. Caponnetto、CA Micchelli、M. Pontil、およびY. Ying。マルチタスク学習のためのユニバーサルカーネル。Journal of Machine Learning Research、9:1615–1646、2008年。
- ^ D. ヒグドン、「プロセス畳み込みを使用した空間および空間時間モデリング、現在の環境問題に対する定量的手法、37–56、2002
- ^ P. Boyle および M. Frean、「従属ガウス過程」、Advances in Neural Information Processing Systems、17:217–224、MIT Press、2005 年