モデルをより一般化および転送可能にする技術
緑関数と青関数はどちらも、与えられたデータ ポイントに対して損失はゼロです。学習したモデルは、 正規化項の重み を調整することで、基礎となる未知の分布から抽出されたより多くのポイントに一般化できる緑関数を優先するように誘導できます。
λ
{\displaystyle \lambda}
数学 、 統計学 、 金融 [1] 、 コンピュータサイエンス 、 特に 機械学習 や 逆問題 において 、 正則化は 問題の答え をより単純なものに変換するプロセスです。これは、 不適切問題を解く場合や 過剰適合を 防ぐために よく使用されます 。 [2]
正規化手順はさまざまな方法で分割できますが、次の説明が特に役立ちます。
明示的正則化 とは、最適化問題に明示的に項を追加する場合の正則化です。これらの項は、事前条件、ペナルティ、または制約です。明示的正則化は、不適切設定の最適化問題でよく使用されます。正則化項、またはペナルティは、最適なソリューションを一意にするために、最適化関数にコストを課します。
暗黙的正則化は 、他のすべての形式の正則化です。これには、たとえば、早期停止、堅牢な損失関数の使用、外れ値の破棄が含まれます。暗黙的正則化は、 ディープ ニューラル ネットワーク をトレーニングするための 確率的勾配降下法 や、 アンサンブル法( ランダム フォレスト や 勾配ブースティング ツリー など ) を含む、現代の機械学習アプローチで基本的に広く使用されています。
明示的な正則化では、問題やモデルに関係なく、測定の尤度に対応するデータ項と事前に対応する正則化項が常に存在します。ベイズ統計を使用して両方を組み合わせると、両方の情報ソースを含む事後分布を計算できるため、推定プロセスが安定します。両方の目的をトレードオフすることで、データにさらに合わせるか、正則化を強制するか (過剰適合を防ぐため) を選択します。すべての可能な正則化を扱う研究分野があります。実際には、通常、特定の正則化を試してから、その正則化に対応する確率密度を計算して選択を正当化します。常識や直感によって物理的に動機付けられる場合もあります。
機械学習 では 、データ項はトレーニングデータに対応し、正則化はモデルの選択またはアルゴリズムの修正のいずれかです。これは常に、 一般化誤差 、つまりトレーニングデータではなく評価セットでのトレーニング済みモデルの誤差スコアを減らすことを目的としています。 [3]
正規化の最も初期の使用法の 1 つは 、最小二乗法に関連する
Tikhonov 正規化(リッジ回帰) です。
機械学習における正則化
機械学習 における 重要な課題は、モデルが既知のトレーニングデータだけでなく、未知のデータでも結果を正確に予測できるようにすることです。正則化は、モデルがトレーニングデータの詳細を記憶しても新しいデータに一般化できない過剰適合に対処するために重要です 。 正則化の目的は、モデルがデータを記憶するのではなく、データ内のより広範なパターンを学習するように促すことです。 早期停止 、L1および L2正則化 、 ドロップアウト などの手法は、過剰適合と不足適合を防ぐように設計されており、それによってモデルが新しいデータに適応して適切に機能する能力が向上し、モデルの一般化が向上します。 [4]
早期終了
検証パフォーマンスが低下したときにトレーニングを停止し、モデルがトレーニングデータを記憶する前に停止することで過剰適合を防ぎます。 [4]
L1 および L2 正規化
複雑なモデルを回避するためにコスト関数にペナルティ項を追加します。
L1 正則化 ( LASSO とも呼ばれる) は、係数の絶対値に基づいてペナルティを追加することでスパース モデルを実現します。
L2正則化 ( リッジ回帰 とも呼ばれる)は、係数の二乗に基づいてペナルティを追加することで、より小さく、より均等に分散された重みを推奨します。 [4]
ドロップアウト
ニューラルネットワークの文脈では、ドロップアウト技術はトレーニング中にニューロンのランダムなサブセットを繰り返し無視し、複数のニューラルネットワークアーキテクチャのトレーニングを一度にシミュレートして一般化を向上させます。 [4]
分類
分類器の経験的学習(有限データセットから)は、 与えられた例 のみの関数を推論しようとするため、常に 未決定 問題です。
x
{\displaystyle x}
x
1
、
x
2
、
…
、
x
ん
{\displaystyle x_{1},x_{2},\dots ,x_{n}}
正則化項(またはレギュラライザー)は 損失関数 に追加されます 。
ここで は、 平方損失 や ヒンジ損失 などの、 ラベル が である場合 を予測するコストを記述する基礎損失関数です 。 は、 正則化項の重要性を制御するパラメーターです。 は通常、 の複雑性にペナルティを課すために選択されます。使用される複雑性の具体的な概念には、 滑らかさの制限と ベクトル空間ノルム の境界 が含まれます 。 [5] [ ページが必要 ]
R
(
ふ
)
{\displaystyle R(f)}
分
ふ
∑
私
=
1
ん
五
(
ふ
(
x
私
)
、
ええ
私
)
+
λ
R
(
ふ
)
{\displaystyle \min _{f}\sum _{i=1}^{n}V(f(x_{i}),y_{i})+\lambda R(f)}
五
{\displaystyle V}
ふ
(
x
)
{\displaystyle f(x)}
ええ
{\displaystyle y}
λ
{\displaystyle \lambda}
R
(
ふ
)
{\displaystyle R(f)}
ふ
{\displaystyle f}
正規化の理論的根拠は、オッカムの剃刀を 解に課そうとすることである (上の図に示されているように、より単純な緑色の関数が好まれる可能性がある)。 ベイズの観点から見ると、多くの正規化手法は、モデルパラメータに特定の 事前 分布を課すことに相当する 。 [6]
正規化は、より単純なモデルの学習、モデルのスパース化の誘導、学習問題への
グループ構造 [ 明確化が必要 ] の導入など、複数の目的に役立ちます。
同じ考え方が 科学の多くの分野で生まれました。 積分方程式 に適用される単純な形式の正則化 ( チホノフ正則化 ) は、本質的にはデータのフィッティングと解のノルムの削減との間のトレードオフです。最近では、 全変分正則化 などの非線形正則化手法が普及してきました。
一般化
正規化は、学習したモデルの一般化可能性を向上させる手法として考えられます。
この学習問題の目的は、すべての可能な入力とラベルに対して予想される誤差を最小化する結果 (ラベル) に適合または予測する関数を見つけることです。関数の予想される誤差は次のとおり です。
ここで 、 と はそれぞれ 入力データのドメイン とそのラベルです 。
ふ
ん
{\displaystyle f_{n}}
私
[
ふ
ん
]
=
∫
バツ
×
はい
五
(
ふ
ん
(
x
)
、
ええ
)
ρ
(
x
、
ええ
)
d
x
d
ええ
{\displaystyle I[f_{n}]=\int _{X\times Y}V(f_{n}(x),y)\rho (x,y)\,dx\,dy}
バツ
{\displaystyle X}
はい
{\displaystyle Y}
x
{\displaystyle x}
ええ
{\displaystyle y}
通常、学習の問題では、入力データとラベルのサブセットのみが利用可能であり、ノイズを伴って測定されます。したがって、期待される誤差は測定不可能であり、利用可能な最良の代替は、利用可能なサンプルの経験的誤差です 。
利用可能な
関数空間(正式には、 再生カーネルヒルベルト空間 )の複雑さに制限がなければ、代替経験的誤差で損失がゼロになるモデルが学習されます。測定( など )がノイズ付きで行われた場合、このモデルは 過剰適合 の影響を受け、期待される誤差が悪くなる可能性があります。正則化により、モデルの構築に使用される関数空間の特定の領域を探索するためのペナルティが導入され、一般化が向上する可能性があります。
いいえ
{\displaystyle N}
私
S
[
ふ
ん
]
=
1
ん
∑
私
=
1
いいえ
五
(
ふ
ん
(
x
^
私
)
、
ええ
^
私
)
{\displaystyle I_{S}[f_{n}]={\frac {1}{n}}\sum _{i=1}^{N}V(f_{n}({\hat {x}}_{i}),{\hat {y}}_{i})}
x
私
{\displaystyle x_{i}}
チホノフ正規化(リッジ回帰)
これらの手法は、積分方程式 に正則化を適用し、他の多くの分野で重要な貢献をした Andrey Nikolayevich Tikhonov にちなんで名付けられました 。
となる未知の ベクトル によって特徴付けられる 線形関数 を学習する場合、より小さいノルムを持つ解を優先するために、 ベクトルの -ノルムを損失式に 追加することができます 。 チホノフ正規化は、最も一般的な形式の 1 つです。 リッジ回帰とも呼ばれます。 次のように表されます。
ここで、 は トレーニングに使用されるサンプルを表します。
ふ
{\displaystyle f}
わ
{\displaystyle w}
ふ
(
x
)
=
わ
⋅
x
{\displaystyle f(x)=w\cdot x}
ら
2
{\displaystyle L_{2}}
わ
{\displaystyle w}
分
わ
∑
私
=
1
ん
五
(
x
^
私
⋅
わ
、
ええ
^
私
)
+
λ
‖
わ
‖
2
2
、
{\displaystyle \min _{w}\sum _{i=1}^{n}V({\hat {x}}_{i}\cdot w,{\hat {y}}_{i})+\lambda \left\|w\right\|_{2}^{2},}
(
x
^
私
、
ええ
^
私
)
、
1
≤
私
≤
ん
、
{\displaystyle ({\hat {x}}_{i},{\hat {y}}_{i}),\,1\leq i\leq n,}
一般関数の場合、その 再生核ヒルベルト空間 における関数のノルムは次のようになります。
分
ふ
∑
私
=
1
ん
五
(
ふ
(
x
^
私
)
、
ええ
^
私
)
+
λ
‖
ふ
‖
H
2
{\displaystyle \min _{f}\sum _{i=1}^{n}V(f({\hat {x}}_{i}),{\hat {y}}_{i})+\lambda \left\|f\right\|_{\mathcal {H}}^{2}}
ノルムは 微分可能 であるため、 勾配降下法 によって学習を進めることができます 。
L
2
{\displaystyle L_{2}}
チホノフ正規化最小二乗法
最小二乗 損失関数と Tikhonov 正則化による学習問題は 解析的に解くことができます。行列形式で記述すると、最適値 は に対する損失関数の勾配が 0 となる
値です。ここで、3 番目のステートメントは 1 次条件
です 。
w
{\displaystyle w}
w
{\displaystyle w}
min
w
1
n
(
X
^
w
−
Y
)
T
(
X
^
w
−
Y
)
+
λ
‖
w
‖
2
2
{\displaystyle \min _{w}{\frac {1}{n}}\left({\hat {X}}w-Y\right)^{\mathsf {T}}\left({\hat {X}}w-Y\right)+\lambda \left\|w\right\|_{2}^{2}}
∇
w
=
2
n
X
^
T
(
X
^
w
−
Y
)
+
2
λ
w
{\displaystyle \nabla _{w}={\frac {2}{n}}{\hat {X}}^{\mathsf {T}}\left({\hat {X}}w-Y\right)+2\lambda w}
0
=
X
^
T
(
X
^
w
−
Y
)
+
n
λ
w
{\displaystyle 0={\hat {X}}^{\mathsf {T}}\left({\hat {X}}w-Y\right)+n\lambda w}
w
=
(
X
^
T
X
^
+
λ
n
I
)
−
1
(
X
^
T
Y
)
{\displaystyle w=\left({\hat {X}}^{\mathsf {T}}{\hat {X}}+\lambda nI\right)^{-1}\left({\hat {X}}^{\mathsf {T}}Y\right)}
最適化問題の構築により、 の他の値は 損失関数に対してより大きな値を与えます。これは、 2 番目の導関数 を調べることによって確認できます。
w
{\displaystyle w}
∇
w
w
{\displaystyle \nabla _{ww}}
このアルゴリズムのトレーニングには 時間 がかかります。項はそれぞれ逆行列と計算に対応します 。テストには 時間がかかります。
O
(
d
3
+
n
d
2
)
{\displaystyle O(d^{3}+nd^{2})}
X
T
X
{\displaystyle X^{\mathsf {T}}X}
O
(
n
d
)
{\displaystyle O(nd)}
早期終了
早期停止は、時間に関する正規化と見なすことができます。直感的には、勾配降下法などのトレーニング手順は、反復回数が増えるにつれて、より複雑な関数を学習する傾向があります。時間に関する正規化によって、モデルの複雑さを制御でき、一般化が向上します。
早期停止は、トレーニング用に 1 つのデータ セット、検証用に 1 つの統計的に独立したデータ セット、およびテスト用に別のデータ セットを使用して実装されます。モデルは、検証セットのパフォーマンスが向上しなくなるまでトレーニングされ、その後テスト セットに適用されます。
最小二乗法の理論的動機
可逆行列 Aの ノイマン級数 の有限近似を考えます 。
ここで、
‖
I
−
A
‖
<
1
{\displaystyle \left\|I-A\right\|<1}
∑
i
=
0
T
−
1
(
I
−
A
)
i
≈
A
−
1
{\displaystyle \sum _{i=0}^{T-1}\left(I-A\right)^{i}\approx A^{-1}}
γ を導入してノルムが 1 未満になるようにすると、
これを使用して非正規化最小二乗法の解析解を近似できます。
w
T
=
γ
n
∑
i
=
0
T
−
1
(
I
−
γ
n
X
^
T
X
^
)
i
X
^
T
Y
^
{\displaystyle w_{T}={\frac {\gamma }{n}}\sum _{i=0}^{T-1}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}}
正規化されていない最小二乗学習問題に対する正確な解は、経験的誤差を最小限に抑えますが、失敗する可能性があります。上記のアルゴリズムで唯一の自由パラメータである T を 制限することにより、問題は時間に対して正規化され、一般化が向上する可能性があります。
上記のアルゴリズムは、勾配降下法の更新によって
経験的リスクの勾配降下法の反復回数を制限することと同等です
。
I
s
[
w
]
=
1
2
n
‖
X
^
w
−
Y
^
‖
R
n
2
{\displaystyle I_{s}[w]={\frac {1}{2n}}\left\|{\hat {X}}w-{\hat {Y}}\right\|_{\mathbb {R} ^{n}}^{2}}
w
0
=
0
w
t
+
1
=
(
I
−
γ
n
X
^
T
X
^
)
w
t
+
γ
n
X
^
T
Y
^
{\displaystyle {\begin{aligned}w_{0}&=0\\[1ex]w_{t+1}&=\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)w_{t}+{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\end{aligned}}}
基本ケースは簡単です。帰納的ケースは次のように証明されます。
w
T
=
(
I
−
γ
n
X
^
T
X
^
)
γ
n
∑
i
=
0
T
−
2
(
I
−
γ
n
X
^
T
X
^
)
i
X
^
T
Y
^
+
γ
n
X
^
T
Y
^
=
γ
n
∑
i
=
1
T
−
1
(
I
−
γ
n
X
^
T
X
^
)
i
X
^
T
Y
^
+
γ
n
X
^
T
Y
^
=
γ
n
∑
i
=
0
T
−
1
(
I
−
γ
n
X
^
T
X
^
)
i
X
^
T
Y
^
{\displaystyle {\begin{aligned}w_{T}&=\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right){\frac {\gamma }{n}}\sum _{i=0}^{T-2}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}+{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\\[1ex]&={\frac {\gamma }{n}}\sum _{i=1}^{T-1}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}+{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\\[1ex]&={\frac {\gamma }{n}}\sum _{i=0}^{T-1}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\end{aligned}}}
スパース性のための正規化子
次元を持つ 辞書 が与えられ、関数空間内の関数が次のように表現できると仮定します。
ϕ
j
{\displaystyle \phi _{j}}
p
{\displaystyle p}
f
(
x
)
=
∑
j
=
1
p
ϕ
j
(
x
)
w
j
{\displaystyle f(x)=\sum _{j=1}^{p}\phi _{j}(x)w_{j}}
2 次元の L1 ボールと L2 ボールを比較すると、L1 正則化によってスパース性がどのように実現されるかが直感的にわかります。
にスパース制約を適用すると、より単純で解釈しやすいモデルを作成できます。これは、 計算生物学 などの多くの実際のアプリケーションで役立ちます 。一例として、医療検査のコストを最小限に抑えながら予測力を最大化するために、病気の簡単な予測検査を開発することが挙げられます。
w
{\displaystyle w}
妥当なスパース制約は ノルム であり、これは 内の非ゼロ要素の数として定義されます 。しかし、正規化された学習問題を解くことは NP困難 であることが実証されています 。 [7]
L
0
{\displaystyle L_{0}}
‖
w
‖
0
{\displaystyle \|w\|_{0}}
w
{\displaystyle w}
L
0
{\displaystyle L_{0}}
ノルム( ノルム も参照) は 、凸緩和によって最適ノルムを近似するために使用できます 。ノルムによってスパース性が誘発されることが示されます 。最小二乗の場合、この問題は統計学では LASSO 、信号処理では 基底追求 として知られています。
L
1
{\displaystyle L_{1}}
L
0
{\displaystyle L_{0}}
L
1
{\displaystyle L_{1}}
min
w
∈
R
p
1
n
‖
X
^
w
−
Y
^
‖
2
+
λ
‖
w
‖
1
{\displaystyle \min _{w\in \mathbb {R} ^{p}}{\frac {1}{n}}\left\|{\hat {X}}w-{\hat {Y}}\right\|^{2}+\lambda \left\|w\right\|_{1}}
弾性ネット正規化
L
1
{\displaystyle L_{1}}
正則化によって、一意でない解が生成される場合があります。図には、可能な解の空間が 45 度の線上にある場合の簡単な例が示されています。これは、特定のアプリケーションでは問題になる可能性があり、次の形式をとる 弾性ネット正則化 で正則化 と組み合わせることで克服できます 。
L
1
{\displaystyle L_{1}}
L
2
{\displaystyle L_{2}}
min
w
∈
R
p
1
n
‖
X
^
w
−
Y
^
‖
2
+
λ
(
α
‖
w
‖
1
+
(
1
−
α
)
‖
w
‖
2
2
)
,
α
∈
[
0
,
1
]
{\displaystyle \min _{w\in \mathbb {R} ^{p}}{\frac {1}{n}}\left\|{\hat {X}}w-{\hat {Y}}\right\|^{2}+\lambda \left(\alpha \left\|w\right\|_{1}+(1-\alpha )\left\|w\right\|_{2}^{2}\right),\alpha \in [0,1]}
弾性ネット正則化はグループ化効果を持つ傾向があり、相関する入力機能には等しい重みが割り当てられます。
弾性ネット正則化は実際によく使用されており、多くの機械学習ライブラリに実装されています。
近似法
ノルムは NP 困難な問題にはなりません が、 ノルムは凸ですが、x = 0 でのキンクにより厳密に微分可能ではありません。 サブ微分 に依存する サブグラディエント法は、 正規化された学習問題を解決するために使用できます 。ただし、近似法を使用すると、より高速な収束を実現できます。
L
1
{\displaystyle L_{1}}
L
1
{\displaystyle L_{1}}
L
1
{\displaystyle L_{1}}
が凸、連続、微分可能で、リプシッツ連続勾配(最小二乗損失関数など)を持ち、が凸、連続、かつ適切な 問題の場合 、問題を解く近似法は次のようになります。まず 近似演算子 を定義し
、次に反復します
。
min
w
∈
H
F
(
w
)
+
R
(
w
)
{\displaystyle \min _{w\in H}F(w)+R(w)}
F
{\displaystyle F}
R
{\displaystyle R}
prox
R
(
v
)
=
argmin
w
∈
R
D
{
R
(
w
)
+
1
2
‖
w
−
v
‖
2
}
,
{\displaystyle \operatorname {prox} _{R}(v)=\mathop {\operatorname {argmin} } _{w\in \mathbb {R} ^{D}}\left\{R(w)+{\frac {1}{2}}\left\|w-v\right\|^{2}\right\},}
w
k
+
1
=
prox
γ
,
R
(
w
k
−
γ
∇
F
(
w
k
)
)
{\displaystyle w_{k+1}=\mathop {\operatorname {prox} } _{\gamma ,R}\left(w_{k}-\gamma \nabla F(w_{k})\right)}
近似法は、勾配降下法を反復的に実行し、その結果を によって許可された空間に投影し戻します 。
R
{\displaystyle R}
がL 1 正則化子である 場合 、近似演算子はソフト閾値演算子と同等であり、
R
{\displaystyle R}
S
λ
(
v
)
f
(
n
)
=
{
v
i
−
λ
,
if
v
i
>
λ
0
,
if
v
i
∈
[
−
λ
,
λ
]
v
i
+
λ
,
if
v
i
<
−
λ
{\displaystyle S_{\lambda }(v)f(n)={\begin{cases}v_{i}-\lambda ,&{\text{if }}v_{i}>\lambda \\0,&{\text{if }}v_{i}\in [-\lambda ,\lambda ]\\v_{i}+\lambda ,&{\text{if }}v_{i}<-\lambda \end{cases}}}
これにより、効率的な計算が可能になります。
重複のないグループのスパース性
特徴のグループはスパース制約によって正規化することができ、これは特定の事前知識を最適化問題に表現するのに役立ちます。
重複しない既知のグループを持つ線形モデルの場合、正規化子を
次のように定義できる。
R
(
w
)
=
∑
g
=
1
G
‖
w
g
‖
2
,
{\displaystyle R(w)=\sum _{g=1}^{G}\left\|w_{g}\right\|_{2},}
‖
w
g
‖
2
=
∑
j
=
1
|
G
g
|
(
w
g
j
)
2
{\displaystyle \|w_{g}\|_{2}={\sqrt {\sum _{j=1}^{|G_{g}|}\left(w_{g}^{j}\right)^{2}}}}
これは、各グループのメンバーの規範に対する正規化子を誘導し、 続いて グループの規範を誘導するものと見ることができます。
L
2
{\displaystyle L_{2}}
L
1
{\displaystyle L_{1}}
これは近似法によって解決できます。近似演算子はブロック単位のソフトしきい値関数です。
prox
λ
,
R
,
g
(
w
g
)
=
{
(
1
−
λ
‖
w
g
‖
2
)
w
g
,
if
‖
w
g
‖
2
>
λ
0
,
if
‖
w
g
‖
2
≤
λ
{\displaystyle \operatorname {prox} \limits _{\lambda ,R,g}(w_{g})={\begin{cases}\left(1-{\dfrac {\lambda }{\left\|w_{g}\right\|_{2}}}\right)w_{g},&{\text{if }}\left\|w_{g}\right\|_{2}>\lambda \\[1ex]0,&{\text{if }}\|w_{g}\|_{2}\leq \lambda \end{cases}}}
重複のあるグループのスパース性
重複のないグループのスパース性について説明したアルゴリズムは、特定の状況でグループが重複する場合にも適用できます。その結果、すべての要素がゼロのグループと、一部が非ゼロで一部がゼロのグループが発生する可能性があります。
グループ構造を保持したい場合は、新しい正規化子を定義できます。
R
(
w
)
=
inf
{
∑
g
=
1
G
‖
w
g
‖
2
:
w
=
∑
g
=
1
G
w
¯
g
}
{\displaystyle R(w)=\inf \left\{\sum _{g=1}^{G}\|w_{g}\|_{2}:w=\sum _{g=1}^{G}{\bar {w}}_{g}\right\}}
各 に対して 、 は、 のグループへ の制限が に 等しく 、 の他のすべての要素 がゼロで あるようなベクトルとして定義されます。正則化子は、 の部分への最適な分解を見つけます。これは、複数のグループに存在するすべての要素を複製するものと見なすことができます。この正則化子を使用した学習問題は、複雑な近似法を使用して解決することもできます。近似演算子は閉じた形式では計算できませんが、近似法の反復内で内部反復を誘導することで、効果的に反復的に解決できます。
w
g
{\displaystyle w_{g}}
w
¯
g
{\displaystyle {\bar {w}}_{g}}
w
¯
g
{\displaystyle {\bar {w}}_{g}}
g
{\displaystyle g}
w
g
{\displaystyle w_{g}}
w
¯
g
{\displaystyle {\bar {w}}_{g}}
w
{\displaystyle w}
半教師あり学習のための正規化子
ラベルの収集が入力例の収集よりもコストがかかる場合、半教師あり学習が役立ちます。正規化子は、教師なしトレーニング サンプルの構造を尊重するモデルを学習するように学習アルゴリズムを導くように設計されています。対称重み行列 が与えられている場合、正規化子を定義できます。
W
{\displaystyle W}
R
(
f
)
=
∑
i
,
j
w
i
j
(
f
(
x
i
)
−
f
(
x
j
)
)
2
{\displaystyle R(f)=\sum _{i,j}w_{ij}\left(f(x_{i})-f(x_{j})\right)^{2}}
が点および に対する何らかの距離メトリックの結果をエンコードする 場合 、 が望ましいです 。 この正則化子は、この直感を捉えており、次と同等です。
ここで、 は によって誘導されるグラフの ラプラシアン行列 です 。
W
i
j
{\displaystyle W_{ij}}
x
i
{\displaystyle x_{i}}
x
j
{\displaystyle x_{j}}
f
(
x
i
)
≈
f
(
x
j
)
{\displaystyle f(x_{i})\approx f(x_{j})}
R
(
f
)
=
f
¯
T
L
f
¯
{\displaystyle R(f)={\bar {f}}^{\mathsf {T}}L{\bar {f}}}
L
=
D
−
W
{\displaystyle L=D-W}
W
{\displaystyle W}
制約がすべての教師ありサンプルに適用されれば、最適化問題は 解析的に解くことができます 。したがって、ベクトルのラベル部分は 明らかです。 のラベルなし部分は 次のように解かれます。
は と同じ範囲を持つ
ため、擬似逆行列を取ることができます 。
min
f
∈
R
m
R
(
f
)
,
m
=
u
+
l
{\displaystyle \min _{f\in \mathbb {R} ^{m}}R(f),m=u+l}
f
(
x
i
)
=
y
i
{\displaystyle f(x_{i})=y_{i}}
f
{\displaystyle f}
f
{\displaystyle f}
min
f
u
∈
R
u
f
T
L
f
=
min
f
u
∈
R
u
{
f
u
T
L
u
u
f
u
+
f
l
T
L
l
u
f
u
+
f
u
T
L
u
l
f
l
}
{\displaystyle \min _{f_{u}\in \mathbb {R} ^{u}}f^{\mathsf {T}}Lf=\min _{f_{u}\in \mathbb {R} ^{u}}\left\{f_{u}^{\mathsf {T}}L_{uu}f_{u}+f_{l}^{\mathsf {T}}L_{lu}f_{u}+f_{u}^{\mathsf {T}}L_{ul}f_{l}\right\}}
∇
f
u
=
2
L
u
u
f
u
+
2
L
u
l
Y
{\displaystyle \nabla _{f_{u}}=2L_{uu}f_{u}+2L_{ul}Y}
f
u
=
L
u
u
†
(
L
u
l
Y
)
{\displaystyle f_{u}=L_{uu}^{\dagger }\left(L_{ul}Y\right)}
L
u
l
{\displaystyle L_{ul}}
L
u
u
{\displaystyle L_{uu}}
マルチタスク学習のための正規化子
マルチタスク学習の場合、 それぞれが何らかの形で関連している問題が同時に検討されます。目標は 、理想的にはタスクの関連性から強みを借りて、予測力のある関数を学習することです。これは、行列を学習することと同じです 。
T
{\displaystyle T}
T
{\displaystyle T}
W
:
T
×
D
{\displaystyle W:T\times D}
列のスパース正規化
R
(
w
)
=
∑
i
=
1
D
‖
W
‖
2
,
1
{\displaystyle R(w)=\sum _{i=1}^{D}\left\|W\right\|_{2,1}}
この正規化子は、各列に L2 ノルムを定義し、すべての列に L1 ノルムを定義します。これは近似法で解決できます。
核ノルム正規化
R
(
w
)
=
‖
σ
(
W
)
‖
1
{\displaystyle R(w)=\left\|\sigma (W)\right\|_{1}}
ここで、 は の 特異値分解 における 固有値 です 。
σ
(
W
)
{\displaystyle \sigma (W)}
W
{\displaystyle W}
平均制約付き正則化
R
(
f
1
⋯
f
T
)
=
∑
t
=
1
T
‖
f
t
−
1
T
∑
s
=
1
T
f
s
‖
H
k
2
{\displaystyle R(f_{1}\cdots f_{T})=\sum _{t=1}^{T}\left\|f_{t}-{\frac {1}{T}}\sum _{s=1}^{T}f_{s}\right\|_{H_{k}}^{2}}
この正規化子は、各タスクで学習した関数が、すべてのタスクの関数の全体的な平均に類似するように制約します。これは、各タスクが他のタスクと共有することが予想される事前情報を表現するのに便利です。例としては、各タスクが個人を表す、1 日のさまざまな時間に測定された血中鉄分濃度の予測が挙げられます。
クラスター化平均制約正規化
R
(
f
1
⋯
f
T
)
=
∑
r
=
1
C
∑
t
∈
I
(
r
)
‖
f
t
−
1
I
(
r
)
∑
s
∈
I
(
r
)
f
s
‖
H
k
2
{\displaystyle R(f_{1}\cdots f_{T})=\sum _{r=1}^{C}\sum _{t\in I(r)}\left\|f_{t}-{\frac {1}{I(r)}}\sum _{s\in I(r)}f_{s}\right\|_{H_{k}}^{2}}
タスクのクラスターです
。
I
(
r
)
{\displaystyle I(r)}
この正則化は平均制約正則化に似ていますが、同じクラスター内のタスク間の類似性を強制します。これにより、より複雑な事前情報を取得できます。この手法は、 Netflix の 推奨事項を予測するために使用されています。クラスターは、同様の好みを共有する人々のグループに対応します。
グラフベースの類似性
上記よりも一般的には、タスク間の類似性は関数によって定義できます。正規化子は、モデルが類似のタスクに対して類似の関数を学習するように促します。
指定された対称 類似性行列 に対して。
R
(
f
1
⋯
f
T
)
=
∑
t
,
s
=
1
,
t
≠
s
T
‖
f
t
−
f
s
‖
2
M
t
s
{\displaystyle R(f_{1}\cdots f_{T})=\sum _{t,s=1,t\neq s}^{\mathsf {T}}\left\|f_{t}-f_{s}\right\|^{2}M_{ts}}
M
{\displaystyle M}
統計学と機械学習における正則化のその他の用途
ベイズ学習 法では、(通常)より複雑なモデルに低い確率を与える 事前確率 を利用します。よく知られているモデル選択手法には、 赤池情報量基準 (AIC)、 最小記述長 (MDL)、 ベイズ情報量基準(BIC)などがあります。正規化を伴わない過剰適合を制御する代替方法としては 、クロス検証 があります 。
さまざまな正規化手法を 線形モデル に適用した例は次のとおりです。
参照
注記
^ Kratsios, Anastasis (2020). 「アービトラージ正規化データによる一般化HJMフレームワークでのディープアービトラージフリー学習」。リスク 。8 (2): [1] 。doi : 10.3390/risks8020040 . hdl : 20.500.11850/456375 . 期間構造モデルは、アービトラージの機会を排除するために正規化できます[ sic ? ]。
^ Bühlmann, Peter; Van De Geer, Sara (2011). 高次元データの統計 。Springer Series in Statistics。p. 9. doi :10.1007/978-3-642-20192-9. ISBN 978-3-642-20191-2 p > n の場合、 通常の最小二乗推定量は一意ではなく、データに過剰適合します。したがって、ある種の複雑性正規化が必要になります。
^ Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron. ディープラーニングブック. 2021年1月29日 閲覧 。
^ abcd Guo, Jingru. 「AIノート:ニューラルネットワークの正規化」。 deeplearning.ai 。 2024年2月4日 閲覧。
^ ab ビショップ、クリストファー M. (2007)。 パターン認識と機械学習 (Corr. printing. ed.)。ニューヨーク:シュプリンガー 。ISBN 978-0-387-31073-2 。
^ 最大事後推定 と リッジ回帰 の関係については 、 Weinberger, Kilian (2018 年 7 月 11 日) の「線形 / リッジ回帰」を参照してください。CS4780 機械学習講義 13。 コーネル大学。
^ Natarajan, B. (1995-04-01). 「線形システムに対するスパース近似解」. SIAM Journal on Computing . 24 (2): 227–234. doi :10.1137/S0097539792240406. ISSN 0097-5397. S2CID 2072045.
^ Duda, Richard O. (2004). パターン分類 + コンピュータマニュアル: ハードカバーセット (第2版). ニューヨーク [ua]: Wiley. ISBN 978-0-471-70350-1 。
^ Tibshirani, Robert (1996). 「Lassoによる回帰収縮と選択」 ( PostScript ) . Journal of the Royal Statistical Society、シリーズB. 58 ( 1): 267–288. doi :10.1111/j.2517-6161.1996.tb02080.x. MR 1379242. 2009年3月19日 閲覧 。
^ Arthur E. Hoerl; Robert W. Kennard (1970). 「リッジ回帰: 非直交問題に対するバイアス推定」 Technometrics . 12 (1): 55–67. doi :10.2307/1267351. JSTOR 1267351.
^ Li Wang、Michael D. Gordon、Ji Zhu (2006)。「正規化された最小絶対偏差回帰とパラメータ調整のための効率的なアルゴリズム」。第 6 回国際 データ マイニング会議 。pp. 690–700。doi : 10.1109 /ICDM.2006.134。ISBN 978-0-7695-2701-7 。
^ Candes, Emmanuel ; Tao, Terence (2007). 「Dantzigセレクター: pが n よりはるかに大きい場合の統計的推定 」 Annals of Statistics . 35 (6): 2313–2351. arXiv : math/0506081 . doi :10.1214/009053606000001523. MR 2382644. S2CID 88524200.
^ マウゴルザタ・ボグダン ;エウアウト・ファン・デン・ベルク。スー・ウェイジエ。エマニュエル J. カンデス (2013)。 「順序付けされた L1 ノルムによる統計的推定とテスト」。 arXiv : 1310.1969 [stat.ME]。
参考文献
Neumaier, A. (1998). 「悪条件および特異線形システムの解決: 正規化に関するチュートリアル」 (PDF) . SIAM Review . 40 (3): 636–666. Bibcode :1998SIAMR..40..636N. doi :10.1137/S0036144597321909.