構造化スパース性正則化は、統計的学習理論における研究分野であり、スパース性正則化学習手法を拡張・一般化する手法群である。[ 1 ]スパース性正則化手法と構造化スパース性正則化手法はどちらも、出力変数が(つまり、応答または従属変数)学習対象は、入力空間内の変数の数を減らして記述することができる。(つまり、特徴または説明変数のドメイン、空間)。スパース性正則化手法は、出力を最もよく説明する入力変数を選択することに焦点を当てています。構造化スパース性正則化手法は、入力変数のグループやネットワークなどの構造に対する最適な選択を可能にすることで、スパース性正則化手法を一般化および拡張します。[ 2 ] [ 3 ]
構造化スパース性手法を使用する一般的な動機は、モデルの解釈可能性、高次元学習(次元が観測数よりも多い可能性がある)および計算複雑性の低減。[ 4 ]さらに、構造化スパース性手法では、重複グループ、[ 2 ]重複しないグループ、非巡回グラフなど、入力変数の構造に関する事前仮定を組み込むことができます。[ 3 ]構造化スパース性手法の使用例としては、顔認識、[ 5 ]磁気共鳴画像(MRI)処理、[ 6 ]自然言語処理における社会言語学的分析、[ 7 ]および乳がんにおける遺伝子発現の分析などがあります。[ 8 ]
損失関数を持つ線形カーネル正則化経験的リスク最小化問題を考える そして正則化ペナルティとしての「ノルム」:
どこ、 そしてはベクトルの非ゼロ要素の数として定義される「ノルム」。は疎で あると言われます。つまり、出力は入力変数の小さなサブセットによって記述できる。
より一般的には、辞書を仮定します。と 目的関数が与えられている学習問題に関する記述は次のように表すことができます。
の規範 非ゼロ成分の数としては次のように定義される。
は疎であると言われます。。
しかし、正則化のノルムは疎な解を好むが、計算が難しく、さらに凸ではない。疎な解を好む計算上より実行可能なノルムは、ノルム。これは、より疎な解を依然として優先することが示されており、さらに凸である。[ 4 ]
構造化スパース性正則化は、スパース性正則化の特徴である変数選択問題を拡張し、一般化したものである。[ 2 ] [ 3 ]上記の正則化された経験的リスク最小化問題を、一般的なカーネルとそれに関連する特徴マップを用いて考えてみよう。と。
正則化項それぞれに罰を与えるコンポーネントごとに独立して、つまり、アルゴリズムは入力変数を互いに独立して抑制します。
状況によっては、正則化プロセスにさらに構造を持たせたい場合があります。例えば、入力変数をあらかじめ定義されたグループに従って抑制するといったことが可能です。構造化スパース性正則化手法を用いることで、正則化項を定義するノルムに構造を追加し、このような構造を導入することができます。
重複しないグループのケースは、構造的スパース性の最も基本的な例です。この場合、係数ベクトルの事前分割が行われます。で重複しないグループを仮定する。グループ内の係数のベクトルとする正則化項とその群ノルムを次のように定義できます。
どこグループ規範、 グループです、 そしてはグループのj 番目の成分です。
上記のノルムはグループLassoとも呼ばれます。[ 2 ]この正則化は、個々の係数ではなく、係数グループ全体をゼロに強制します。グループは重複しないため、ゼロでない係数のセットは、ゼロに設定されなかったグループの和集合として得られ、ゼロ係数のセットについてはその逆になります。
重複するグループとは、変数が複数のグループに属することができる構造スパース性のケースである。このケースは、重複しないグループよりも一般的な変数間の関係を表すことができるため、ツリー構造や他のタイプのグラフなど、興味深い場合が多い。[ 3 ] [ 8 ]
重複するグループスパース性正則化手法には2種類あり、それぞれ異なるタイプの入力変数間の関係をモデル化するために使用されます。
補集合の交差アプローチは、所属するすべてのグループで正の係数を持つ入力変数のみを選択したい場合に使用されます。正則化された経験的リスク最小化問題に対するグループLassoをもう一度考えてみましょう。
どこグループ標準、 グループです、 そしてはグループのj 番目の成分です。
重複しないグループの場合と同様に、グループLasso正則化器は係数のグループ全体をゼロに設定する可能性があります。選択された変数は、係数を持つものです。ただし、この場合、グループが重複する可能性があるため、ゼロに設定されていないグループの補集合の共通部分を取ります。
この補完選択基準の交差は、特定のグループ内のいくつかの係数を許容するというモデリング選択を意味する。ゼロに設定され、同じグループ内の他のメンバーは正の値のままとなる場合もある。言い換えれば、グループ内の各変数が属する複数のグループによって、グループ内の係数が異なる可能性がある。
別のアプローチとして、変数選択においてグループの結合を考慮する方法がある。このアプローチは、変数が少なくとも1つの正の係数を持つグループに属していれば選択できるというモデリング状況を捉えている。このモデリングの観点からすると、グループ構造を維持したいということになる。
グループ結合アプローチの定式化は潜在グループLassoとも呼ばれ、グループの変更が必要となる。上記で検討したノルムを導入し、次の正則化子を導入します[ 3 ]
どこ、 は群 g の係数のベクトルであり、は係数を持つベクトルですすべての変数について グループで 、 そして その他すべてにおいて、すなわち、もし グループで そしてさもないと。
この正則化項は、複数のグループに属する変数を効果的に複製し、グループ構造を維持するものと解釈できます。グループの結合アプローチの意図どおり、これは、すべての変数が属するすべてのグループにおけるすべての変数の重みを効果的に合計した重みベクトルwを生成します。
グループラッソを用いた目的関数は、一般的に凸関数である必要があるが必ずしも強凸関数である必要はない誤差関数とグループから構成される。正則化項。この目的関数の問題点は、凸関数ではあるが必ずしも強凸関数ではないため、一般的に一意解が得られないことである。[ 9 ]
この問題を解決する方法の一例として、2乗を導入することが挙げられます。重みベクトルのノルムを、追加の正則化項として保持しながら、グループラッソアプローチからの正則化項。[ 9 ]二乗の係数が ノルム項はより大きいすると、二乗 ノルム 項が強凸であれば、結果として得られる目的関数も強凸となる。[ 9 ]係数が十分に小さいが正である場合、結果として得られる目的関数を最小化する重みベクトルは、一般的に、グループを削除することによって得られる目的関数を最小化する重みベクトルに非常に近いものとなる。 正則化項は元の目的関数から完全に除外されます。後者のシナリオはグループLassoアプローチに対応します。[ 9 ]したがって、このアプローチはスパース性を維持しながら、より単純な最適化を可能にします。[ 9 ]
参照:劣モジュラ集合関数
上記で説明した規範に加えて、構造化スパース性手法で使用される他の規範には、階層規範とグリッド上で定義された規範があります。これらの規範は劣モジュラ関数から生じ、入力変数の構造に関する事前仮定を組み込むことができます。階層規範の文脈では、この構造は変数上の有向非巡回グラフとして表現できますが、グリッドベースの規範の文脈では、構造はグリッドを使用して表現できます。[ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ] [ 15 ]
参照:教師なし学習
潜在変数モデルのパラメータを学習するために、教師なし学習法がよく用いられます。潜在変数モデルとは、観測変数に加えて、観測されない一連の潜在変数も存在する統計モデルです。このようなモデルでは、システムの変数間に「階層構造」が存在すると想定されることが多く、この階層構造は有向非巡回グラフを用いて表現できます。
潜在変数の階層構造は、特にテキスト文書のモデリングなど、いくつかのアプリケーションで自然な構造として現れています。[ 11 ] ベイズ非パラメトリック法を用いた階層モデルは、トピックモデル[ 10 ]の学習に使用されています。トピックモデルは、文書のコレクションに現れる抽象的な「トピック」を発見するための統計モデルです。階層構造は、カーネル法の文脈でも検討されています。[ 13 ]階層規範は、バイオインフォマティクス[ 12 ] 、コンピュータビジョン、トピックモデル[ 14 ]に適用されています。
変数に想定される構造が 1D、2D、または 3D グリッドの形である場合、重なり合うグループに基づく劣モジュラ関数をノルムとみなすことができ、長方形または凸形状に等しい安定集合が得られます。[ 13 ]このような方法はコンピュータビジョンに応用されています[ 15 ] 。
入力変数の最適なサブセットを選択する問題は、ペナルティフレームワークの下で自然に次のように定式化できます。[ 4 ]
どこはベクトルの非ゼロ要素の数として定義される「ノルム」。
この定式化はモデリングの観点からは理にかなっているが、変数のすべての可能な部分集合を評価する網羅的探索に相当するため、計算上は実行不可能である。[ 4 ]
最適化問題を解決するための主なアプローチは、1)統計学における段階的回帰や信号処理におけるマッチング追跡などの貪欲法、および 2) 凸緩和定式化アプローチと近接勾配最適化法の 2 つです。
最良部分集合選択問題の自然な近似は、ノルム正則化: [ 4 ]
近接勾配法(前方後方分割法とも呼ばれる)は、凸関数で微分可能な部分と、凸関数で微分不可能な可能性のある部分を持つ関数を最小化するのに役立つ最適化手法である。
そのため、近接勾配法は、次の形式のスパース性および構造的スパース性正則化問題の解決に役立ちます[ 9 ] 。
構造化スパース性正則化は、多重カーネル学習の文脈で適用できます。[ 16 ]多重カーネル学習とは、事前に定義されたカーネルのセットを使用し、アルゴリズムの一部としてカーネルの最適な線形または非線形の組み合わせを学習する一連の機械学習手法を指します。
上記のアルゴリズムでは、空間全体が一度に考慮され、グループ、つまり部分空間に分割されました。補完的な観点として、異なる空間が結合されて新しい空間が得られる場合を考えてみましょう。この考え方を有限辞書で考えると便利です。線形独立な要素を持つ有限辞書(これらの要素は原子とも呼ばれます)は、線形独立な基底関数の有限集合を指し、それらの線形結合が仮説空間を定義します。有限辞書は、後述するように、特定のカーネルを定義するために使用できます。[ 16 ]この例では、1 つの辞書だけでなく、複数の有限辞書が考慮されると仮定します。
簡略化のため、辞書が2つしかない場合そしてどこそしては整数であり、考慮されます。原子も同様には線形独立であると仮定する。2つの辞書の和集合とする。関数の線形空間を考える。次の形式の線形結合で与えられる
いくつかの係数ベクトルについて、 どこ原子は線形独立性を維持する、あるいは同等に、マップは1対1です。空間内の関数は、空間内の 2 つの成分の合計として見なすことができる。原子の線形結合 そして1つは原子の線形結合。
この空間における規範の選択肢の一つは. 今は表示できることに注意してください関数空間として 、 これらは部分空間である。線形独立性の仮定を考慮すると、識別できるそしてとそれぞれ。上記の規範は、グループ規範と見なすことができる。 部分空間に関連付けられている 、 構造的スパース性正則化との関連性を提供する。
ここ、、 そして対応する特徴マップを持つ再生核ヒルベルト空間と見なすことができるによって与えられた、によって与えられた、 そして連結によって与えられる、 それぞれ。
このシナリオに対する構造化スパース性正則化アプローチでは、グループノルムが考慮する関連変数グループは部分空間に対応します。そしてこのアプローチでは、個々の係数だけでなく、これらの部分空間に対応する係数のグループをゼロに設定することを推奨し、スパースな多重カーネル学習を促進します。
上記の推論は、任意の有限個の辞書または特徴マップに直接一般化できる。また、無限次元仮説を誘導する特徴マップにも拡張できる。
空間。[ 16 ]
疎な多重カーネル学習を考慮することは、以下のようないくつかの状況で役立ちます。
一般的に、スパース多重カーネル学習は、カーネルの数が多く、モデル選択と解釈可能性が重要な場合に特に有用である。[ 16 ]
構造化スパース性正則化手法は、正則化プロセスに事前入力変数構造を課したい場合など、多くの場面で用いられてきました。そのような応用例をいくつか挙げます。