統計学習理論の分野では、行列正則化はベクトル正則化の概念を、学習対象が行列である場合に一般化します。正則化の目的は、安定した予測関数を生成できる条件(たとえば、スパース性や滑らかさ)を適用することです。たとえば、より一般的なベクトル フレームワークでは、Tikhonov 正則化はを最適化して、 回帰問題に対する安定した解となる ベクトルを見つけます。システムがベクトルではなく行列で記述される場合、この問題は と記述できます。 ここで、 に正則化ペナルティを適用するベクトル ノルムは、 の行列ノルムに拡張されています。
行列正則化は、行列補完、多変量回帰、マルチタスク学習に応用されています。特徴選択とグループ選択の考え方も行列に拡張でき、マルチカーネル学習のノンパラメトリックなケースに一般化できます。
基本的な定義
一連の例から学習する行列 を考えます。ここで、 はから まで、からまでになります。各入力行列 を とし、のサイズを とします。出力の一般的なモデルはと表すことができます 。 ここで、内積はフロベニウス内積です。異なるアプリケーションでは、行列は異なる形式になりますが、[1]これらのそれぞれについて、推論する最適化問題は と記述できます 。 ここで、は特定の についての経験的誤差を定義し、 は行列正則化ペナルティです。関数 は通常、凸になるように選択され、スパース性 ( -ノルムを使用) や滑らかさ (-ノルムを使用)を強化するように選択されることがよくあります。最後に、はフロベニウス内積 を持つ行列の空間内にあります。
一般的なアプリケーション
マトリックスの完成
行列完成の問題では、行列はの形をとります 。 ここで、と は、およびにおける標準基底です。この場合、フロベニウスの内積の役割は、行列 から個々の要素を選択することです。したがって、出力は、行列 からの要素のサンプリングです。
少数のサンプルから再構成する問題は、行列に特定の制約がある場合にのみ可能であり、これらの制約は正則化関数によって強制することができます。たとえば、 が低ランクであると仮定すると、正則化ペナルティは核ノルムの形を取ることができます。[2] ここで、から までのはの特異値です。
多変量回帰
多変量回帰で使用されるモデルは、係数行列によってパラメータ化されます。上記のフロベニウスの内積では、各行列は、 内積の出力が入力の1行と係数行列の1列のドット積となるような行列です 。このようなモデルの一般的な形式は次のとおりです。
単変数回帰で使用されるベクトルノルムの多くは、多変量の場合に拡張できます。1 つの例は、2 乗フロベニウスノルムです。これは、エントリごとに、または行列の特異値に作用する -ノルムとして見ることができます。
多変量の場合、フロベニウス ノルムで正規化することの効果はベクトルの場合と同じです。非常に複雑なモデルではノルムが大きくなり、したがってペナルティが大きくなります。
マルチタスク学習
マルチタスク学習の設定は、多変量回帰の設定とほぼ同じです。主な違いは、入力変数もタスク(列)でインデックス付けされていることです。フロベニウスの内積による表現は次のようになります。
この設定での行列正則化の役割は多変量回帰の場合と同じになりますが、行列ノルムはタスク間で学習問題を結合するためにも使用できます。特に、最適化問題では、 の各列に対応する解が分離されていることに注意してください。つまり、結合問題を解くか、各列に対して個別の回帰問題を解くことで、同じ解を見つけることができます。問題は、解の共分散に追加の正則化ペナルティを追加することで結合できます 。 ここで、はタスク間の関係をモデル化します。このスキームは、タスク間での解の類似性を強制するため、およびと の最適化を交互に行うことでタスクの類似性の特定の構造を学習するために使用できます。[3]タスク間の関係がグラフ上にあることがわかっている場合、グラフのラプラシアン行列を使用して学習問題を結合できます。
スペクトル正規化
スペクトル フィルタリングによる正則化は、不適切行列逆行列に対処することで、上記のような問題に対する安定した解を見つけるために使用されてきました (たとえば、 Tikhonov 正則化のフィルター関数を参照してください)。多くの場合、正則化関数は入力 (またはカーネル) に作用して、小さな特異値を排除することで有界逆行列を保証しますが、学習する行列に作用するスペクトル ノルムを持つことも役立ちます。
行列の特異値に作用する行列ノルムは数多くあります。よく使われる例としては、p = 1 または 2 のSchatten p ノルムがあります 。たとえば、Schatten 1 ノルム (核ノルムとも呼ばれます) を使用した行列正規化は、行列のスペクトルのスパース性を強制するために使用できます。これは、問題の行列が制限されたランクを持つと考えられる場合の行列補完のコンテキストで使用されています。[2]この場合、最適化問題は次のようになります。
スペクトル正則化は、多変量回帰における縮小ランク係数行列を強制するためにも使用されます。[4]この設定では、上位の特異値のみを保持することで縮小ランク係数行列を見つけることができますが、これを拡張して、縮小された特異値とベクトルのセットを保持することもできます。
構造化されたスパース性
スパース最適化は、少数の変数に依存する解を見つける方法として、多くの研究の焦点となっている(例えば、 Lasso法を参照)。原理的には、エントリワイズスパース性は、行列のエントリワイズ-ノルムにペナルティを課すことによって強制することができるが、 -ノルムは凸ではない。実際には、これは-ノルムへの凸緩和によって実装することができる。-ノルムによるエントリワイズ正則化は、少数の非ゼロ要素を持つ解を見つけるが、-ノルムを異なる変数グループに適用すると、解のスパース性に構造を強制することができる。[5]
構造化スパースの最もわかりやすい例は、およびのノルムを使用します。
例えば、ノルムはマルチタスク学習でタスク間の特徴をグループ化するために使用されます。これにより、係数行列の特定の行のすべての要素をグループとしてゼロにすることができます。[6]グループ化効果は、各行の -ノルムを取得し、合計ペナルティをこれらの行ごとのノルムの合計にすることで実現されます。この正則化により、行はすべてゼロ、つまり密になる傾向があります。同じタイプの正則化を使用して、各列の -ノルム を取得することで、列ごとにスパース性を強制することができます。
より一般的には、ノルムは任意の変数グループに適用できます。 ここで、インデックスは変数グループ全体にわたっており、グループの基数を示します。
これらのグループスパース性を解くアルゴリズムは、例えば重複グループを許可することで、よりよく知られているLasso法とグループLasso法を拡張し、マッチング追求法: [7]と近位勾配法[8]によって実装されています。近位勾配を与えられた係数、 に関して記述することにより、このノルムがグループ全体のソフトしきい値[1]を強制することがわかります。 ここで、 はグループノルムの指示関数です。
したがって、ノルムを使用すると、行方向、列方向、または任意のブロックでマトリックスのスパース性の構造を簡単に強制できます。たとえば、多変量回帰またはマルチタスク回帰のブロックにグループ ノルムを強制すると、入力変数と出力変数のグループを見つけることができ、出力変数の定義済みサブセット (マトリックスの列) が同じスパースな入力変数のセットに依存するようになります。
複数のカーネルの選択
構造化スパース性と特徴選択の考え方は、マルチカーネル学習のノンパラメトリックなケースに拡張できます。[9]これは、それぞれに適切なカーネルが異なる複数のタイプの入力データ(たとえば、色とテクスチャ)がある場合、または適切なカーネルが不明な場合に役立ちます。たとえば、特徴マップとを持つ 2 つのカーネルが、対応する再生カーネルヒルベルト空間にある場合、より大きな空間 を2 つの空間の合計として作成できます。 および が 線形独立であると仮定します。この場合、-ノルムは再びノルムの合計です。
したがって、このタイプのノルムとして行列正規化関数を選択することで、使用されるカーネルに関してはスパースであるが、使用される各カーネルの係数に関しては密であるソリューションを見つけることができます。マルチカーネル学習は、非線形変数選択の形式として、またはモデル集約手法として使用することもできます (たとえば、ノルムの二乗の合計を取り、スパース制約を緩和するなど)。たとえば、各カーネルを異なる幅のガウスカーネルにすることができます。
参照
参考文献
- ^ ab Rosasco, Lorenzo; Poggio, Tomaso (2014 年 12 月)。「機械学習の正規化ツアー」。MIT-9.520 講義ノート (原稿)。
- ^ ab Candès, Emmanuel J. ; Recht, Benjamin (2009). 「凸最適化による正確な行列完成」.計算数学の基礎. 9 (6): 717–772. doi : 10.1007/s10208-009-9045-5 .
- ^ Zhang; Yeung (2012). 「マルチタスク学習におけるタスク関係の学習のための凸定式化」。人工知能における不確実性に関する第26回会議議事録 (UAI2010 ) 。arXiv : 1203.3536。Bibcode : 2012arXiv1203.3536Z 。
- ^ Izenman, Alan J. (1975). 「多変量線形モデルのための縮小ランク回帰」.多変量解析ジャーナル. 5 (2): 248–264. doi : 10.1016/0047-259X(75)90042-1 .
- ^ Kakade、Shalev-Shwartz、Tewari (2012)。「行列を使った学習のための正規化手法」。機械学習研究ジャーナル。13 : 1865–1890。
- ^ Argyriou, A.; Evgeniou, T.; Pontil, M. (2008). 「凸型マルチタスク特徴学習」.機械学習. 73 (3): 243–272. doi : 10.1007/s10994-007-5040-8 .
- ^ Huang、Zhang、Metaxas (2011)。「構造化スパース性による学習」。機械学習研究ジャーナル。12 :3371–3412。
- ^ Chen, Xi; et al. (2012). 「一般構造化スパース回帰のための平滑化近似勾配法」Annals of Applied Statistics 6 ( 2): 719–752. arXiv : 1005.4717 . doi : 10.1214/11-AOAS514 .
- ^ Sonnenburg、Ratsch、Schafer、Scholkopf (2006)。「大規模なマルチカーネル学習」。機械学習研究ジャーナル。7 : 1531–1565。
