
数学、統計学、金融[ 1 ] 、コンピュータサイエンス、特に機械学習や逆問題において、正則化は問題の答えをより単純な問題に変換するプロセスです。これは、不適切問題の解決や過学習の防止によく使用されます。[ 2 ]正則化手法と、このような不適切問題を解決するためのベイズ的アプローチの間には強い関連性があります[ 3 ]。
正則化の手順は様々な方法で分類できますが、以下の区分が特に役立ちます。
明示的な正則化では、問題やモデルに関係なく、常に測定の尤度に対応するデータ項と、事前確率に対応する正則化項が存在します。ベイズ統計を用いてこれらを組み合わせることで、両方の情報源を含む事後確率を計算し、推定プロセスを安定させることができます。両方の目的をトレードオフすることで、データとの整合性を高めるか、正則化を強制するか(過学習を防ぐため)を選択できます。あらゆる正則化を扱う研究分野全体が存在します。実際には、通常、特定の正則化を試みて、その正則化に対応する確率密度を計算して選択を正当化します。また、常識や直感によって物理的に動機づけられる場合もあります。
機械学習において、データという用語はトレーニングデータに対応し、正則化はモデルの選択またはアルゴリズムの変更のいずれかです。常に汎化誤差、つまりトレーニングデータではなく評価セット(テストデータ)におけるトレーニング済みモデルのエラースコアを減らすことを目的としています。[ 4 ]
正則化の最も初期の用途の一つは、最小二乗法に関連するチホノフ正則化(リッジ回帰)である。
機械学習において重要な課題は、モデルが既知の訓練データだけでなく、未知のデータに対しても結果を正確に予測できるようにすることです。正則化は、モデルが訓練データの詳細を記憶するものの、新しいデータに一般化できない過学習に対処するために不可欠です。正則化の目標は、モデルがデータを記憶するのではなく、データ内のより広範なパターンを学習するように促すことです。早期停止、L1およびL2正則化、ドロップアウトなどの手法は、過学習と過小学習を防ぐように設計されており、それによってモデルが新しいデータに適応してうまく機能する能力を高め、モデルの汎化性能を向上させます。[ 5 ]
検証パフォーマンスが低下した時点でトレーニングを停止し、モデルがトレーニングデータを記憶する前に停止することで過学習を防ぎます。[ 5 ]
複雑なモデルを抑制するために、コスト関数にペナルティ項を追加します。
ニューラルネットワークの文脈では、ドロップアウト技術はトレーニング中にニューロンのランダムなサブセットを繰り返し無視することで、複数のニューラルネットワークアーキテクチャを同時にトレーニングすることをシミュレートし、汎化性能を向上させます。[ 5 ]
(有限データセットからの)分類器の経験的学習は、常に不確定問題である。なぜなら、それは任意の関数を推論しようとするからである。例のみが示されている。
正則化項(または正則化項)損失関数に追加されます。 どこは、予測のコストを表す基礎的な損失関数です。ラベルが例えば、二乗損失やヒンジ損失など。これは、正則化項の重要度を制御するパラメータです。は通常、複雑さにペナルティを課すために選択されます。使用される複雑性の具体的な概念には、滑らかさの制約やベクトル空間ノルムの境界などが含まれる。[ 6 ]
正則化の理論的根拠は、解にオッカムの剃刀を適用しようとすることである(上の図に示すように、より単純な緑色の関数が好ましい場合がある)。ベイズの観点から見ると、多くの正則化手法は、モデルパラメータに特定の事前分布を適用することに相当する。[ 7 ]
正則化は、より単純なモデルの学習、モデルの疎性化、学習問題へのグループ構造の導入など、複数の目的に役立つ。
同様の考え方は、科学の多くの分野で生まれてきました。積分方程式に適用される単純な正則化(チホノフ正則化)は、本質的にはデータへの適合性と解のノルムの低減との間のトレードオフです。近年では、全変動正則化を含む非線形正則化手法が普及しています。
正則化は、学習済みモデルの汎化性能を向上させるための手法として正当化される。
この学習問題の目標は、考えられるすべての入力とラベルに対して期待誤差を最小化する、結果(ラベル)に適合または予測する関数を見つけることです。関数の期待誤差とは、は: どこそして入力データのドメインはそしてそれらのラベルそれぞれ。
学習問題では、通常、入力データとラベルのサブセットのみが利用可能であり、ノイズが伴って測定されます。したがって、期待される誤差は測定不可能であり、利用可能な最良の代替手段は、経験的誤差です。入手可能なサンプル: 関数空間(正式には再生核ヒルベルト空間)の複雑さに制限がない場合、代理経験誤差で損失がゼロになるモデルが学習されます。測定値(例:ノイズを含む関数空間では、このモデルは過学習を起こし、期待誤差が悪化する可能性があります。正則化は、モデル構築に使用される関数空間の特定の領域を探索する際にペナルティを導入し、汎化性能を向上させることができます。
これらの手法は、積分方程式に正則化を適用し、その他多くの分野で重要な貢献をしたアンドレイ・ニコラエヴィチ・ティホノフにちなんで名付けられました。
線形関数を学習する際未知のベクトルによって特徴付けられるそのため追加できるのはベクトルのノルム損失式に対して、ノルムが小さい解を優先するように調整します。ティホノフ正則化は最も一般的な形式の一つです。リッジ回帰とも呼ばれます。以下のように表されます。 どここれは、トレーニングに使用されるサンプルを表します。
一般関数の場合、その再生核ヒルベルト空間における関数のノルムは次のようになります。
としてノルムは微分可能であり、勾配降下法によって学習を進めることができる。
最小二乗損失関数とティホノフ正則化を用いた学習問題は解析的に解くことができる。行列形式で記述すると、最適な損失関数の勾配が0です。 ここで、3番目の文は一階条件です。
最適化問題の構築により、他の値は損失関数に大きな値を与える。これは、 2階微分を調べることで確認できる。。
トレーニング中、このアルゴリズムは時間。これらの項は行列の逆行列計算に対応します。それぞれ。テストには時間。
早期停止は、時間的な正則化と捉えることができる。直感的に言えば、勾配降下法のような学習手順は、反復回数が増えるにつれて、より複雑な関数を学習する傾向がある。時間的な正則化を行うことで、モデルの複雑さを制御し、汎化性能を向上させることができる。
早期停止は、トレーニング用データセット1つ、統計的に独立した検証用データセット1つ、テスト用データセット1つを用いて実装されます。モデルは、検証セットでの性能が向上しなくなるまでトレーニングされ、その後テストセットに適用されます。
可逆行列Aのノイマン級数の有限近似を考える。:
これは、ノルムが1未満になるように γを導入すれば、非正則化最小二乗法の解析解を近似するために使用できる。
非正則化最小二乗学習問題の厳密解は経験誤差を最小化しますが、失敗する可能性があります。上記のアルゴリズムにおける唯一の自由パラメータであるTを制限することで、問題は時間に関して正則化され、汎化性能が向上する可能性があります。
上記のアルゴリズムは、経験的リスクに対する勾配降下法の反復回数を制限することと同等である。 勾配降下法の更新により:
基本ケースは自明である。帰納的ケースは次のように証明される。
辞書があると仮定します寸法付き関数空間内の関数が次のように表現されるように与えられます。

スパース性制約を強制するこれにより、よりシンプルで解釈しやすいモデルを構築できます。これは、計算生物学など、多くの実生活における応用分野で役立ちます。例えば、医療検査のコストを最小限に抑えつつ予測精度を最大化するために、疾患の単純な予測検査を開発することが挙げられます。
妥当なスパース性制約は規範は、非ゼロ要素の数として定義される。. 解決するしかし、正則化学習問題はNP困難であることが実証されている。[ 8 ]
のノルム(ノルムも参照)は最適値を近似するために使用できます凸緩和によるノルム。ノルムはスパース性を誘導する。最小二乗法の場合、この問題は統計学ではLASSO、信号処理では基底追跡法として知られている。

正則化は、時として一意でない解を生み出すことがあります。図には、可能な解の空間が45度の直線上にある場合の簡単な例が示されています。これは特定のアプリケーションでは問題となる可能性があり、組み合わせることで克服できます。とエラスティックネットの正則化における正則化は、次の形式をとります。
エラスティックネット正則化はグループ化効果をもたらす傾向があり、相関のある入力特徴量には等しい重みが割り当てられる。
エラスティックネット正則化は実務で広く用いられており、多くの機械学習ライブラリに実装されている。
一方でノルムはNP困難問題にはならない、ノルムは凸関数ですが、x = 0 で折れ曲がるため厳密には微分可能ではありません。劣微分に依存する劣勾配法を使用して解くことができます。正則化学習問題。ただし、近接法を用いることでより速い収束を実現できる。
問題に対してそのため凸関数であり、連続関数であり、微分可能であり、リプシッツ連続勾配を持ち(最小二乗損失関数など)、が凸関数、連続関数、かつ適切な関数である場合、問題を解くための近接法は次のようになります。まず、近接演算子を定義します。 そして反復する
近接法は、勾配降下を繰り返し実行し、その結果を、によって許可された空間に投影します。。
いつはL 1正則化子であり、近接演算子はソフト閾値演算子と同等である。
これにより、効率的な計算が可能になります。
特徴量のグループは、疎性制約によって正規化することができ、これは特定の事前知識を最適化問題として表現するのに役立つ。
重複しない既知のグループを持つ線形モデルの場合、正則化項を定義できます。 どこ
これは、正則化項を誘導するものと見なすことができる。各グループのメンバーに対する規範に続いて、集団よりも規範を優先する。
これは近接法によって解決でき、近接演算子はブロック単位のソフト閾値処理関数である。
重複のないグループの疎性について説明したアルゴリズムは、特定の状況下では、グループが重複する場合にも適用できます。その結果、すべての要素がゼロのグループと、非ゼロ要素とゼロ要素が混在するグループが生じる可能性があります。
グループ構造を維持したい場合は、新しい正則化項を定義できます。
各、は、制限されるベクトルとして定義されます。グループへ等しいおよびその他のすべてのエントリはゼロです。正則化は、の最適な分解を見つけます。部分に分割します。これは、複数のグループに存在するすべての要素を複製するものと見なすことができます。この正則化子を用いた学習問題は、複雑な近接法でも解決できます。近接演算子は閉じた形式で計算することはできませんが、近接法の反復の中に内部反復を誘導することで、効果的に反復的に解くことができます。
ラベルの収集コストが入力例の収集コストよりも高い場合、半教師あり学習が有用となる。正則化器は、学習アルゴリズムが教師なしトレーニングサンプルの構造を尊重するモデルを学習するように設計されている。対称重み行列の場合が与えられた場合、正則化項を定義できる。
もし点間の距離指標の結果をエンコードしますそして望ましいのはこの正則化項はこの直感を捉えており、以下と同等である。 どこは、によって誘導されるグラフのラプラシアン行列です。。
最適化問題制約条件が満たされれば解析的に解くことができるすべての教師ありサンプルに適用されます。ベクトルのラベル付き部分したがって、それは明らかです。ラベルのない部分はは次のように解決されます。 擬似逆行列は次のように取ることができます。範囲は同じです。
マルチタスク学習の場合、問題は同時に検討され、それぞれ何らかの形で関連している。目標は学ぶことである。関数は、理想的にはタスク間の関連性から強みを借りて、予測力を持つ。これは行列を学習することに相当する。。
この正則化項は、各列にL2ノルムを、全列にL1ノルムを定義します。これは近接法によって解くことができます。
この正則化項は、各タスクで学習される関数が、すべてのタスクにおける関数の全体平均と類似するように制約します。これは、各タスクが他のタスクと共有することが期待される事前情報を表現するのに役立ちます。例としては、1日の異なる時間帯に測定された血中鉄濃度を予測する場合が挙げられます。この場合、各タスクは個人を表します。
どこタスクの集合体です。
この正則化項は、平均値制約付き正則化項に似ていますが、同じクラスタ内のタスク間の類似性を強制します。これにより、より複雑な事前情報を捉えることができます。この手法は、Netflixのおすすめ予測に用いられてきました。クラスタとは、類似した嗜好を持つ人々のグループを指します。
上記よりも一般的に言えば、タスク間の類似性は関数によって定義できる。正則化項は、類似したタスクに対して類似した関数をモデルが学習するように促す。 与えられた対称類似度行列に対して。
ベイズ学習法は、事前確率を利用し、(通常)より複雑なモデルには低い確率を与えます。よく知られているモデル選択手法には、赤池情報量規準(AIC)、最小記述長(MDL)、ベイズ情報量規準(BIC)などがあります。正則化を用いない過学習制御の代替手法としては、交差検証などがあります。
線形モデルへのさまざまな正則化手法の適用例は以下のとおりです。
期間構造モデルは、裁定取引の機会を除去するために正則化することができます[ sic ? ]。
通常の最小二乗推定量は一意ではなく、データに過剰適合してしまう。したがって、何らかの複雑性正則化が必要となる。