統計的学習理論は、統計学と関数解析の分野から着想を得た機械学習のフレームワークです。[ 1 ] [ 2 ] [ 3 ]統計的学習理論は、データに基づいて予測関数を見つける統計的推論問題を扱います。統計的学習理論は、コンピュータビジョン、音声認識、バイオインフォマティクスなどの分野で成功した応用につながっています。
学習の目標は理解と予測です。学習は、教師あり学習、教師なし学習、オンライン学習、強化学習など、多くのカテゴリに分類されます。統計的学習理論の観点からは、教師あり学習が最もよく理解されています。[ 4 ]教師あり学習では、訓練データセットから学習します。訓練の各ポイントは入力と出力のペアであり、入力が出力にマッピングされます。学習問題は、入力と出力の間のマッピング関数を推論することであり、学習された関数を使用して将来の入力から出力を予測できます。
出力の種類に応じて、教師あり学習の問題は回帰問題または分類問題のいずれかになります。出力が連続的な値の範囲をとる場合、それは回帰問題です。オームの法則を例にとると、電圧を入力、電流を出力として回帰を実行できます。回帰では、電圧と電流の間の関数関係は次のようになります。、したがって 分類問題とは、出力が離散的なラベルの集合から得られる要素となる問題のことです。分類は機械学習アプリケーションにおいて非常に一般的です。例えば、顔認識では、人物の顔写真が入力となり、出力ラベルはその人物の名前となります。入力は、画像内のピクセルを表す要素を持つ大きな多次元ベクトルで表現されます。
訓練データセットのデータに基づいて関数を学習した後、その関数は、訓練データセットには含まれていないテストデータセットのデータで検証されます。
取るすべての可能な入力のベクトル空間であり、すべての可能な出力のベクトル空間である。統計的学習理論は、積空間上に未知の確率分布が存在するという観点を取る。つまり、未知の何かが存在するトレーニングセットは以下で構成されています。この確率分布からサンプルを抽出し、表記します。 毎はトレーニングデータからの入力ベクトルであり、それに対応する出力がこれです。
この形式論では、推論問題は関数を見つけることから成ります。そのため。 させて関数の空間である仮説空間と呼ばれる。仮説空間とは、アルゴリズムが探索する関数の空間である。損失関数は、予測値と実際の値との差を表す指標である。そして実際の価値期待リスクは次のように定義される 。 目標関数、可能な限り最良の関数選択可能なものは、満たす
確率分布未知の場合、期待リスクの代理指標を用いる必要があります。この指標は、未知の確率分布から抽出されたサンプルであるトレーニングセットに基づいています。これは経験的リスクと呼ばれます。 関数を選択する学習アルゴリズム経験的リスクを最小化することを経験的リスク最小化と呼ぶ。
損失関数の選択は、関数の決定要因となる。学習アルゴリズムによって選択されるもの。損失関数はアルゴリズムの収束速度にも影響する。損失関数が凸関数であることが重要である。[ 5 ]
回帰問題か分類問題かによって、異なる損失関数が用いられる。
回帰分析で最も一般的な損失関数は、二乗損失関数(L2ノルムとも呼ばれる)です。このよく知られた損失関数は、最小二乗回帰で使用されます。その形式は次のとおりです。
絶対値損失(L1ノルムとも呼ばれる)も時折使用される。
ある意味では、0-1指標関数は分類のための最も自然な損失関数です。予測出力が実際の出力と同じ場合は0、予測出力が実際の出力と異なる場合は1の値をとります。バイナリ分類の場合、これは: どこはヘヴィサイド階段関数です。

機械学習の問題において、大きな問題の一つに過学習があります。学習は予測問題であるため、目標は(過去に観測された)データに最もよく適合する関数を見つけることではなく、将来の入力から出力を最も正確に予測できる関数を見つけることです。経験的リスク最小化は、過学習のリスクを伴います。つまり、データに完全に一致する関数を見つけてしまうものの、将来の出力をうまく予測できないというリスクです。
過学習は不安定な解の兆候です。訓練セットのデータに小さな摂動を加えると、学習された関数に大きな変動が生じます。解の安定性が保証されれば、汎化と一貫性も保証されることが示されています。[ 6 ] [ 7 ]正則化は過学習の問題を解決し、問題に安定性をもたらします。
正則化は仮説空間を制限することによって実現できる。一般的な例としては、線形関数への変換:これは、線形回帰の標準的な問題への還元と見なすことができます。また、次数が多項式に制限される可能性もある。、指数関数、またはL1上の有界関数。仮説空間を制限することで、潜在関数の形式が制限されるため、過学習を回避できます。したがって、経験的リスクを任意にゼロに近づける関数を選択することはできません。
正則化の一例として、ティホノフ正則化がある。これは、 どこは固定された正のパラメータであり、正則化パラメータです。ティホノフ正則化は、解の存在、一意性、および安定性を保証します。[ 8 ]
二値分類器を考えてみましょうホーフディングの不等式を適用することで、経験的リスクが真のリスクから逸脱する確率をサブガウス分布に制限することができます。 しかし一般的に、経験的リスク最小化を行う場合、分類器は与えられていないため、我々が選択する必要がある。したがって、より有用な結果は、クラス全体における差の最大値の確率を制限することである。 どこ衝撃的な数字であり、はデータセット内のサンプル数です。指数項はホフディングの式に由来しますが、クラス全体の最大値を取るという追加コストが発生します。これが破壊数です。