構造的リスク最小化 (SRM)は、機械学習で使用される帰納的原理です。機械学習では、一般的に有限データセットから汎用モデルを選択する必要がありますが、その結果として過学習の問題が発生します。つまり、モデルがトレーニングセットの特殊性に強く適合しすぎて、新しいデータに対してうまく一般化できなくなるのです。SRM 原理は、モデルの複雑さとトレーニングデータへの適合の成功とのバランスを取ることで、この問題に対処します。この原理は、1974 年にウラジミール・ヴァプニクとアレクセイ・チェルヴォネンキスによって書かれた本[ 1 ]で初めて提示され、VC 次元を使用します。
実際には、構造的リスク最小化は、、 どこトレーニングエラー、関数これは正則化関数と呼ばれ、定数です。 パラメータが大きな値を取るように選択されますパラメータ空間の高容量部分集合に属するもの。最小化事実上、パラメータ空間のアクセス可能な部分集合の容量を制限し、それによって訓練誤差の最小化と訓練誤差とテスト誤差の間の期待されるギャップの最小化との間のトレードオフを制御します。[ 2 ]
SRM問題はデータの観点から定式化できる。データxとラベルyからなるn個のデータポイントが与えられた場合、目的関数は多くの場合、次のように表現されます。
最初の項は、学習されたモデルの値と、、そして与えられたラベルこの用語はトレーニング誤差です。先に説明したとおりです。第2項は、スパース性を優先し、より大きな重みにペナルティを与えるために、重みに事前分布を設定します。トレードオフ係数は、は、正則化項の重要度を増減させるハイパーパラメータです。より最適な MSE とより小さな値を犠牲にして、より疎な重みを奨励します正則化を緩和し、モデルがデータに適合するようにします。重みはゼロになり、一般的に、このモデルは過学習の問題を抱えている。