機械学習において、分布のカーネル埋め込み(カーネル平均または平均マップとも呼ばれる)は、確率分布を再生核ヒルベルト空間 (RKHS)の要素として表現するノンパラメトリック手法の一種である。 [ 1 ]古典的なカーネル法 で行われる個々のデータポイントの特徴マッピングを一般化した分布の無限次元特徴空間への埋め込みは、任意の分布のすべての統計的特徴を保持しつつ、内積、距離、射影、線形変換、スペクトル解析などのヒルベルト空間演算を用いて分布を比較・操作することを可能にする。[ 2 ] この学習フレームワークは非常に汎用的であり、任意の空間上の分布に適用できる。要素間の類似性を測定する合理的なカーネル関数)が定義される可能性があります。たとえば、次のようなデータから学習するためのさまざまなカーネルが提案されています。離散クラス/カテゴリ、文字列、グラフ/ネットワーク、画像、時系列、多様体、力学系、その他の構造化オブジェクト。[ 3 ] [ 4 ] 分布のカーネル埋め込みの理論は、主に Alex Smola、Le Song、Arthur Gretton、Bernhard Schölkopfによって開発されました。分布のカーネル埋め込みに関する最近の研究のレビューは、 [ 5 ]にあります。
分布の分析は機械学習と統計学において基本的であり、これらの分野の多くのアルゴリズムはエントロピー、相互情報量、カルバック・ライブラー情報量などの情報理論的アプローチに依存しています。しかし、これらの量を推定するには、まず密度推定を実行するか、高度な空間分割/バイアス補正戦略を採用する必要がありますが、これらは通常、高次元データでは実行不可能です。[ 6 ] 一般的に、複雑な分布をモデル化する手法は、根拠がなかったり計算が困難であったりする可能性のあるパラメトリック仮定に依存しています(例:ガウス混合モデル)。一方、カーネル密度推定(注:この文脈における平滑化カーネルは、ここで議論されているカーネルとは異なる解釈を持ちます)や特性関数表現(分布のフーリエ変換による)などのノンパラメトリック手法は、高次元設定では破綻します。[ 2 ]
分布のカーネル埋め込みに基づく手法はこれらの問題を回避し、さらに次のような利点も備えています。[ 6 ]
このように、分布のカーネル埋め込みによる学習は、情報理論的アプローチの原理に基づいた代替手段となり、機械学習や統計学における多くの一般的な手法を特殊なケースとして包含するだけでなく、全く新しい学習アルゴリズムにつながる可能性も秘めたフレームワークである。
させて定義域を持つ確率変数を表すおよび流通対称で正定値のカーネルが与えられた場合ムーア・アロンシャインの定理は、一意のRKHSの存在を主張する。の上(関数のヒルベルト空間)内部製品を搭載そして規範) そのためには再生核であり、すなわち、要素再生特性を満たす
あるいは、次のように考えることもできる暗黙的な特徴マッピングとして :\Omega \rightarrow {\mathcal {H}}} (したがって、これは特徴空間とも呼ばれる)、点間の類似性の尺度と見なすことができる類似度尺度は特徴空間では線形であるが、カーネルの選択によっては元の空間では非常に非線形になる可能性がある。
分布のカーネル埋め込みで(カーネル平均または平均マップとも呼ばれる)は次のように与えられる:[ 1 ]
もし二乗可積分密度を可能にする、 それから、 どこはヒルベルト・シュミット積分演算子である。カーネルは、平均埋め込みが :\{{\text{Omega 上の分布の族}\to {\mathcal {H}}} は単射である。 [ 7 ]したがって、各分布は RKHS で一意に表現でき、特性カーネルが使用される場合、分布のすべての統計的特徴はカーネル埋め込みによって保持される。
与えられたトレーニング例独立同分布(iid)で抽出されたカーネル埋め込み経験的に推定できる
もしは別の確率変数を表します(簡略化のため、 の共定義域を仮定します)また同じカーネルを使用これは以下を満たす)、そして同時分布テンソル積特徴空間にマッピングできる[ 2 ]経由
テンソルと線形写像の等価性により、この結合埋め込みは非中心化相互共分散演算子として解釈できる。関数の相互共分散[ 8 ]のように計算できる。
与えられたトレーニング例のペアから抽出されたiidまた、以下の方法で結合分布カーネル埋め込みを経験的に推定することもできます。
条件付き分布が与えられた場合対応するRKHS埋め込みは次のように定義できる[ 2 ]
埋め込みに注意これにより、RKHS 内の値によってインデックス付けされた点の族が定義されます。条件付け変数によって取得される修正することで特定の値にすると、単一の要素が得られます。したがって、演算子を定義するのは自然なことである
特徴マッピングが与えられた場合条件付き埋め込みを出力する与えられたすべての[ 8 ]が示せる。
この仮定は特性核を持つ有限領域では常に成り立つが、連続領域では必ずしも成り立つとは限らない。[ 2 ]それにもかかわらず、仮定が成り立たない場合でも、条件付きカーネル埋め込みを近似するために引き続き使用できる実際には、逆演算子はそれ自身の正則化バージョンに置き換えられる。(どこ(単位行列を表す)。
トレーニング例が与えられた場合経験的カーネル条件付き埋め込み演算子は次のように推定できます[ 2 ]
どこ暗黙的に形成された特徴行列、はサンプルのグラム行列です、 そしては、過学習を避けるために必要な正則化パラメータです。
したがって、カーネル条件付き埋め込みの経験的推定値は、サンプルの重み付き和によって与えられます。機能面において:
どこそして
このセクションでは、基本的な確率規則がカーネル埋め込みフレームワークにおける(多重)線形代数演算としてどのように再定式化されるかを示しており、主にSongらの研究に基づいています[ 2 ] [ 8 ] 。以下の表記法を採用します。
実際には、すべての埋め込みはデータから経験的に推定される。そして、一連のサンプルが事前分布のカーネル埋め込みを推定するために使用できる。。
確率論では、周辺分布は積分することで計算できます結合密度から(事前分布を含む))
カーネル埋め込みフレームワークにおけるこの規則の類似点は、次のように述べている。RKHS埋め込みは、以下によって計算できます。
どこはカーネル埋め込みです実際の実装では、カーネル和ルールは次の形式をとります。
どこ
は事前分布の経験的カーネル埋め込みであり、、 そしては、エントリを持つグラム行列です。それぞれ。
確率論では、同時分布は条件付き分布と周辺分布の積に因数分解できる。
カーネル埋め込みフレームワークにおけるこの規則の類似点は、次のように述べている。共同埋め込みは、条件付き埋め込み演算子と、それに関連付けられた自己共分散演算子の合成として因数分解できます。
どこ
実際の実装では、カーネル連鎖ルールは次の形式をとります。
確率論では、事後分布は事前分布と尤度関数を用いて次のように表現できる。
カーネル埋め込みフレームワークにおけるこの規則の類似物は、条件付き分布のカーネル埋め込みを、事前分布によって修正される条件付き埋め込み演算子を用いて表現する。
連鎖律からすると:
実際の実装では、カーネルベイズのルールは次の形式をとります。
どこ
このフレームワークでは、2つの正則化パラメータが使用されます。推定のためにそして最終条件付き埋め込み演算子の推定
後者の正則化は、なぜなら正定値ではない可能性があります。
最大平均不一致(MMD)は分布間の距離尺度である。そしてこれはRKHS [ 6 ]におけるそれらの埋め込み間の距離として定義される。
広く用いられているカルバック・ライブラー情報量などの分布間の距離尺度のほとんどは、密度推定(パラメトリックまたはノンパラメトリック)または空間分割/バイアス補正戦略を必要とするが、[ 6 ] MMDは、MMDの真の値の周りに集中する経験的平均として容易に推定できる。この距離を最大平均不一致と特徴づけるのは、MMDを計算することが、2つの確率分布間の期待値の差を最大化するRKHS関数を見つけることと同等であるという事実に基づいている。
積分確率計の一形態。
n個のトレーニング例が与えられた場合そしてm個のサンプルからMMDの経験的推定値に基づいて検定統計量を定式化することができる。
2標本検定[ 15 ]を行うために、両方の標本が同じ分布から得られたという帰無仮説(すなわち、)広範な代替案に対してMMDに基づく検定は、2標本仮説検定において漸近的に最適であることが示された最初の検定であった。 [ 16 ]
カーネル埋め込みフレームワークにおける学習アルゴリズムは中間的な密度推定の必要性を回避するものの、それでもなお、経験的埋め込みを用いて、基となる分布から抽出されたn個のサンプルに基づいて密度推定を行うことができる。これは、次の最適化問題を解くことによって実現できます[ 6 ] [ 17 ]
最大化は分布空間全体にわたって行われるここ、は、提案された密度のカーネル埋め込みである。そしてはエントロピーのような量です(例:エントロピー、KLダイバージェンス、ブレグマンダイバージェンス)。この最適化を解決する分布は、サンプルの経験的カーネル平均によく適合することと、確率空間のすべての領域(その多くはトレーニング例に表現されていない可能性があります)に確率質量の相当部分を割り当てることとの間の妥協として解釈できます。実際には、候補密度の空間を、正則化された混合比率を持つM個の候補分布の混合に制限することで、困難な最適化の良い近似解を見つけることができます。カーネルに関連付けられた特徴マッピングを一般化された(おそらく無限次元の)指数族の十分統計量と見なす場合、この方法で条件付き確率分布を推定することで、ガウス過程と条件付き確率場の根底にある考え方の間のつながりを引き出すことができます。[ 6 ]
確率変数間の統計的依存性の尺度そして(適切なカーネルを定義できる任意の領域から)は、ヒルベルト・シュミット独立性基準[ 18 ]に基づいて定式化できる。
HSICは、相互情報量、ピアソン相関係数、または学習アルゴリズムで使用されるその他の依存性尺度の原理に基づいた代替として使用できます。特に、HSICは任意の依存性を検出できます(埋め込みに特性カーネルを使用する場合、変数が独立である場合に限りHSICはゼロになります)。また、異なるタイプのデータ(画像とテキストキャプションなど)間の依存性を測定するために使用できます。各確率変数のn個のiidサンプルが与えられた場合、真の値の周りに集中するHSICの単純なパラメータフリーの不偏推定量は、次のように計算できます。時間、[ 6 ]ここで、2つのデータセットのグラム行列は、とHSICの望ましい特性により、特徴選択(BAHSIC [ 19 ])、クラスタリング(CLUHSIC [ 20 ])、次元削減(MUHSIC [ 21 ])など、さまざまな一般的な機械学習タスクにこの依存性尺度を利用する多数のアルゴリズムが考案されました。
HSICは、複数の確率変数の依存性を測定するように拡張できます。この場合、HSICが独立性を捉えるのはどのような場合かという問題は、最近研究されています。[ 22 ] 2つ以上の変数の場合
信念伝播は、条件付き期待値の評価に対応するメッセージをノードが繰り返し送受信するグラフィカルモデルにおける推論のための基本的なアルゴリズムです。カーネル埋め込みフレームワークでは、メッセージはRKHS関数として表現でき、条件付き分布埋め込みを適用することでメッセージの更新を効率的に計算できます。マルコフ確率場のノードによって表現されるn個の確率変数のサンプルが与えられた場合、ノードuからノードtへの受信メッセージは次のように表現できます。
それがRKHS内にあると仮定した場合、tからノードsへのカーネル信念伝播更新メッセージは[ 2 ]で与えられる。
どこ要素ごとのベクトル積を表します。は、ノードsを除く、 tに接続されているノードの集合です。、は変数からのサンプルのグラム行列ですそれぞれ、は、サンプルからの特徴行列です。。
したがって、ノードtへの受信メッセージが、特徴マップされたサンプルの線形結合である場合すると、このノードからの送信メッセージも、特徴マップされたサンプルの線形結合になります。したがって、このRKHS関数表現によるメッセージ伝達更新は、ポテンシャルがデータから推論されるノンパラメトリック関数である効率的な信念伝播アルゴリズムを生み出し、任意の統計的関係をモデル化することができる。[ 2 ]
隠れマルコフモデル(HMM)において、注目すべき重要な量は、隠れ状態間の遷移確率である。放出確率観測値については、カーネル条件付き分布埋め込みフレームワークを使用すると、これらの量をHMMからのサンプルで表現できます。この分野の埋め込み方法の重大な制限は、隠れ状態を含むトレーニングサンプルが必要であることです。そうでないと、HMM内の任意の分布による推論は不可能です。
HMMの一般的な用途の一つはフィルタリングであり、その目的は隠れ状態に関する事後分布を推定することである。時刻tにおいて、過去の観測履歴が与えられた場合システムから。フィルタリングでは、信念状態予測ステップ(更新)によって再帰的に維持されますは、前の隠れ状態を周辺化することによって計算され、その後条件付けステップ(更新が行われる)が続きますは、新しい観測に基づいて条件付けするためにベイズの定理を適用することによって計算されます。[ 2 ]時刻t+1における信念状態の RKHS 埋め込みは、次のように再帰的に表現できます。
カーネル和則による予測ステップの埋め込みとカーネルベイズ則による条件付けステップの埋め込みを計算することによって。トレーニングサンプルを仮定するが与えられれば、実際には推定することができる
したがって、カーネル埋め込みによるフィルタリングは、重みに対する以下の更新を使用して再帰的に実装されます。[ 2 ]
どこグラム行列を表すそしてそれぞれ、は、次のように定義される転送グラム行列である。そして
サポート尺度マシン(SMM)は、サポートベクターマシン(SVM)の一般化であり、訓練データはラベルとペアになった確率分布である。[ 23 ] SMMは、以下の期待カーネルを使用して標準的なSVM双対最適化問題を解きます。
これは、多くの一般的な特定分布に対して閉形式で計算可能である。(ガウス分布など)と一般的な埋め込みカーネルを組み合わせたもの(例えばガウスカーネルや多項式カーネルなど)、または独立同分布のサンプルから正確に経験的に推定できる。経由
埋め込みカーネルの特定の選択の下でトレーニング例に適用されたSMMサンプルでトレーニングされたSVMに相当しますしたがって、SMMは、異なるデータ依存カーネル(分布の想定される形式によって指定される)を持つ柔軟なSVMと見なすことができる。)は各トレーニングポイントに配置される可能性がある。[ 23 ]
ドメイン適応の目標は、訓練データとテストデータの分布が異なる場合でもうまく汎化できる学習アルゴリズムを定式化することです。訓練例が与えられた場合そしてテストセットどこでトレーニング例の分布には、一般的に3種類の差異があると想定されているが、そしてテスト分布: [ 24 ] [ 25 ]
周辺分布と条件付き分布のカーネル埋め込みを利用することで、トレーニング領域とテスト領域間のこのような差異に対処するための実際的なアプローチを策定できます。共変量のシフトは、比率の推定値によるサンプルの再重み付けによって考慮することができます。周辺分布のカーネル埋め込みから直接得られた各ドメインにおいて、分布の明示的な推定は不要です。[ 25 ]ターゲットシフトは、サンプルがないため同様に処理できません。テストドメインで利用可能なものは、ベクトルを使用してトレーニング例に重み付けすることで考慮されます。これは、次の最適化問題を解決します(実際には、経験的近似を使用する必要があります)[ 24 ]
位置スケール条件シフトに対処するには、トレーニングポイントに対してLS変換を実行して、新しい変換済みトレーニングデータを取得すればよい。(どこは要素ごとのベクトル積を表します。新しい変換されたトレーニングサンプルとテストデータの間で同様の分布を保証するために、は、以下の経験的カーネル埋め込み距離を最小化することによって推定されます[ 24 ]
一般的に、LS条件シフトとターゲットシフトに対処するためのカーネル埋め込み法を組み合わせることで、テスト分布を模倣するトレーニングデータの重み付け変換を見つけることができ、これらの方法は、位置スケール変化以外の条件シフトが存在する場合でも良好なパフォーマンスを発揮する可能性があります。[ 24 ]
分布から独立同分布でサンプリングされたN個の訓練例のセットが与えられた場合ドメイン汎化の目標は、これまで見たことのないドメインからサンプリングされたテスト例に対して優れた性能を発揮する学習アルゴリズムを定式化することです。トレーニング時にテストドメインのデータが利用できない場合。条件付き分布の場合すべてのドメインで比較的類似していると仮定すると、ドメイン汎化が可能な学習器は、周辺分布の変化に対して頑健な変数間の関数関係を推定する必要がある。これらの分布のカーネル埋め込みに基づいて、ドメイン不変成分分析(DICA)は、すべてのトレーニングドメイン間で共有される共通の条件付き分布を維持しながら、周辺分布間の差を最小化するトレーニングデータの変換を決定する方法です。[ 26 ] DICAは、ドメイン間で転送される特徴である不変量を抽出し、カーネル主成分分析、転送成分分析、共分散演算子逆回帰などの多くの一般的な次元削減方法の一般化と見なすことができます。[ 26 ]
確率分布の定義RKHSにてと
DICAは、分布分散によってドメイン間の類似性を測定し、それは次のように計算されます。
どこ
それではトレーニングデータがサンプリングされる分布のグラム行列。分布の分散を最小化する低次元部分空間B (特徴空間内)への直交変換を見つけることで、DICA は同時に、 B が中心部分空間Cの基底と一致することを保証します。独立する与えられたすべての領域にわたって。目標値がない場合DICAの教師なしバージョンを定式化すると、分布分散を最小化しつつ分散を最大化する低次元部分空間が見つかる。(特徴空間において)すべてのドメインにわたって(中心部分空間を保持するのではなく)。[ 26 ]
分布回帰では、確率分布から実数(またはベクトル)への回帰が目標となります。多くの重要な機械学習および統計タスクがこのフレームワークに適合し、マルチインスタンス学習や解析解のない点推定問題(ハイパーパラメータ推定やエントロピー推定など)が含まれます。実際には、サンプリングされた分布からのサンプルのみが観測可能であり、推定値は点の集合間で計算された類似性に依存する必要があります。分布回帰は、たとえば教師ありエントロピー学習や、マルチスペクトル衛星画像を使用したエアロゾル予測にうまく適用されています。[ 27 ]
与えられたトレーニングデータでは、袋には確率分布からのサンプルが入っているそして出力ラベルは分布の埋め込みを取得し、その埋め込みから出力への回帰器を学習することで、分布回帰タスクに取り組むことができます。言い換えれば、次のカーネルリッジ回帰問題を検討することができます。
どこ
と共にカーネルは、-s、は埋め込みディストリビューションのカーネルであり、RKHSは、.例線形カーネルを含めるガウスカーネル指数カーネルコーシー核一般化t分布カーネルまたは逆多重二次関数カーネル。
新しい分布に関する予測単純で分析的な形式をとる
どこ、、、緩やかな正則条件の下では、この推定量は一致性を持つことが示され、1段階サンプリング(真の値にアクセスできる場合と同様)を達成できる。-s)ミニマックス最適レート。[ 27 ]目的関数-s は実数です。結果は次の場合にも拡張できます。-s は次元ベクトル、またはより一般的には演算子値を用いた分離可能なヒルベルト空間の要素種子。
Song et al. [ 2 ]から引用したこの簡単な例では、は、集合内の値をとる離散確率変数であると仮定される。そしてカーネルはクロネッカーデルタ関数として選択され、このカーネルに対応する特徴マップは標準基底ベクトルです。。このような分布のカーネル埋め込みは周辺確率のベクトルであり、この設定における同時分布の埋め込みは結合確率表を指定する行列、そしてこれらの埋め込みの明示的な形式は
いつすべての条件付き分布埋め込み演算子、
この設定では条件付き確率表は
そして
したがって、固定値の下での条件付き分布の埋め込みは次のように計算できます。
クロネッカーデルタカーネルを用いたこの離散値設定では、カーネル和則は次のようになる。
この場合のカーネル連鎖規則は次のように表される。