機械学習および統計的学習理論における教師あり学習アプリケーションでは、汎化誤差[ 1 ](サンプル外誤差[ 2 ]またはリスクとも呼ばれる)は、アルゴリズムがこれまで見たことのないデータに対して結果をどれだけ正確に予測できるかを示す尺度です。学習アルゴリズムは有限サンプルで評価されるため、学習アルゴリズムの評価はサンプリング誤差の影響を受けやすい場合があります。その結果、現在のデータに対する予測誤差の測定値は、新しい未知のデータに対するアルゴリズムの予測能力についてあまり情報を提供しない可能性があります。汎化誤差は、学習アルゴリズムにおける過学習を避けることで最小限に抑えることができます。機械学習アルゴリズムのパフォーマンスは、学習プロセス全体を通して汎化誤差の推定値を示す学習曲線プロットによって視覚化されるのが一般的です。
学習問題では、関数を開発することが目標です。出力値を予測する各入力データに対して下付き文字関数がは、データセットに基づいて開発されています。データポイント。一般化誤差、または予想損失またはリスク。特定の機能のすべての可能な値にわたってそして損失関数の期待値: [ 1 ]
どこは未知の同時確率分布である。そして。
同時確率分布を知らない場合計算することは不可能です代わりに、サンプルデータに基づいて誤差を計算することができます。これは経験誤差(または経験リスク)と呼ばれます。データポイント、候補関数の経験的誤差は:
アルゴリズムが汎化すると言われるのは、以下の条件を満たす場合である。
特に重要なのは一般化エラーである。データ依存関数のこれはサンプルに基づく学習アルゴリズムによって発見されます。繰り返しますが、未知の確率分布の場合、計算することはできません。その代わりに、統計的学習理論における多くの問題の目的は、確率における汎化誤差と経験誤差の差を制限または特徴づけることです。
つまり、目標は確率を特徴づけることである一般化誤差は経験誤差に何らかの誤差限界を加えた値よりも小さい。(一般的に依存するそして多くの種類のアルゴリズムにおいて、特定の安定性基準を満たせば、アルゴリズムには汎化限界があることが示されています。具体的には、アルゴリズムが対称的(入力の順序が結果に影響しない)、損失が有界であり、かつ2つの安定性条件を満たす場合、汎化します。最初の安定性条件であるリーブワンアウト交差検証の安定性とは、安定するためには、リーブワンアウト交差検証を使用した場合の各データポイントの予測誤差が、次の条件を満たすとゼロに収束しなければならないということです。2 番目の条件は、1 つを除外するエラーの安定性(仮説の安定性とも呼ばれる)です。ノルム)は、トレーニングデータセットから単一のデータポイントを削除しても、残りのデータポイントの予測が変化しない場合に満たされます。[ 3 ]
これらの条件は次のように定式化できる。
アルゴリズムもっている各存在するそしてすなわち、
そしてそしてゼロへ無限大に及ぶ。[ 3 ]
アルゴリズムもっている各存在するそしてすなわち、
とそしてゼロにするために。
リーブワンアウトの安定性については規範、これは仮説の安定性と同じです。
とゼロになる無限大に及ぶ。[ 3 ]
いくつかのアルゴリズムは安定性が証明されており、その結果、汎化誤差の上限が定められています。これらのアルゴリズムと、安定性を証明した論文の一覧は、こちらでご覧いただけます。

一般化誤差と過学習の概念は密接に関連している。過学習は、学習した関数がサンプルのノイズに敏感になる。結果として、この関数はトレーニングセットではうまく機能するが、結合確率分布からの他のデータではうまく機能しない。そしてしたがって、過学習が多ければ多いほど、汎化誤差は大きくなる。
過学習の程度は、サンプルをシミュレーションされたトレーニング サンプルとテスト サンプルに分割する交差検証法を使用してテストできます。次に、モデルはトレーニング サンプルでトレーニングされ、テスト サンプルで評価されます。テスト サンプルはアルゴリズムによって事前に認識されていないため、結合確率分布からのランダム サンプルを表します。そしてこのテストサンプルを用いることで、予想される誤差を近似することができ、結果として、汎化誤差の特定の形式を近似することができる。
過学習を防ぐためのアルゴリズムは数多く存在する。最小化アルゴリズムは、より複雑な関数に対してペナルティを課すことができる(チホノフ正則化として知られる)。あるいは、仮説空間を制約することもできる。制約は、関数の形式で明示的に指定するか、最小化関数に制約を追加する(イワノフ正則化)ことによって行うことができる。
過学習を起こさない関数を見つけるアプローチは、データの特定の特性を捉えるのに十分な複雑さを持つ関数を見つけるという目標とは相反する。これはバイアス・バリアンスのトレードオフとして知られている。過学習を避けるために関数を単純に保つと、結果として得られる予測にバイアスが生じる可能性がある一方、関数をより複雑にすると過学習が起こり、予測のバリアンスが大きくなる。両方を同時に最小化することは不可能である。