


数理モデリングにおいて、過学習とは、特定のデータセットに過度に適合する、あるいは完全に適合する分析結果を生み出すことであり、そのため追加のデータに適合しなかったり、将来の観測値を確実に予測できなかったりする可能性がある。[ 1 ]過学習モデルとは、データによって正当化できるよりも多くのパラメータを含む数理モデルのことである。 [ 2 ]多項式関数で構成されるモデルの特殊な場合、これらのパラメータは多項式の次数を表す。過学習の本質は、残差変動(すなわちノイズ)の一部を、あたかもその変動が基礎となるモデル構造を表しているかのように、無意識のうちに抽出してしまうことである。[ 3 ] : 45
過小適合は、数学モデルがデータの根底にある構造を適切に捉えられない場合に発生します。過小適合モデルとは、正しく指定されたモデルに現れるはずのパラメータや項が欠落しているモデルのことです。[ 2 ]例えば、線形モデルを非線形データに適合させると過小適合が発生します。このようなモデルは、予測性能が低い傾向があります。
モデルを選択する基準と、モデルの適合性を判断する基準が異なる場合、過学習が発生する可能性が生じます。例えば、ある訓練データセットにおける性能を最大化することでモデルが選択される一方で、その適合性は未知のデータに対する性能によって判断される場合などです。過学習は、モデルが傾向から一般化することを「学習」するのではなく、訓練データを「記憶」し始めることで発生します。
極端な例として、パラメータの数が観測数と同じかそれ以上の場合、モデルはデータ全体を記憶するだけで、訓練データを完全に予測できてしまう。(図 2を参照。)しかし、このようなモデルは、予測を行う際に深刻な失敗を犯すのが一般的である。
過学習は、選択されたモデルの複雑さと、トレーニング中に最適化される方法の両方に関係しています。データセットのサイズに対して適切な意味で大きすぎる関数クラスは、過学習を起こしやすいです。[ 4 ]適合したモデルのパラメータ数が過剰でない場合でも、適合した関係は、適合に使用したデータセットよりも新しいデータセットでうまく機能しないように見えることが予想されます(この現象は、収縮と呼ばれることもあります)。[ 2 ]特に、決定係数の値は、元のデータと比較して縮小します。
過学習の可能性や量を減らすために、いくつかの手法が利用可能です(例:モデル比較、交差検証、正則化、早期停止、枝刈り、ベイズ事前分布、ドロップアウト)。これらの手法の中には、(1)過度に複雑なモデルに明示的にペナルティを課す、または(2)トレーニングに使用されていないデータセットでモデルのパフォーマンスを評価することによって、モデルの汎化能力をテストするというものがあります。このデータセットは、モデルが遭遇する典型的な未知のデータを近似するものと想定されます。
統計学では、何らかの手順で選択された統計モデルから推論が導き出されます。バーナムとアンダーソンは、モデル選択に関する彼らのよく引用される著書の中で、過学習を避けるためには「簡潔性の原則」に従うべきだと主張しています。[ 3 ]また、著者らは次のように述べています。[ 3 ]: 32-33
過剰適合モデルは、パラメータ推定値にバイアスがないことが多いものの、推定された(そして実際の)標本分散が不必要に大きくなります(より簡潔なモデルで達成できたであろう精度に比べて、推定値の精度は劣ります)。過剰適合モデルでは、誤った治療効果が特定され、誤った変数が含まれる傾向があります。…最適な近似モデルは、過小適合と過剰適合の誤差を適切にバランスさせることによって得られます。
分析を導く理論がほとんどない場合、過学習は深刻な問題になりやすい。その理由の一つは、選択できるモデルが多数存在する傾向があるためである。書籍「モデル選択とモデル平均化」(2008年)では、次のように述べている。[ 5 ]
データセットが与えられれば、ボタン一つで何千ものモデルを適合させることができますが、どうやって最適なモデルを選べばいいのでしょうか?候補となるモデルが多すぎると、過学習という深刻な問題が生じます。ハムレットをタイプした猿は、本当に優れた作家なのでしょうか?
回帰分析では、過剰適合が頻繁に発生します。[ 6 ]極端な例として、p 個のデータポイントを持つ線形回帰にp 個の変数がある場合、適合した直線はすべてのポイントを完全に通過する可能性があります。[ 7 ]ロジスティック回帰または Cox比例ハザードモデルには、さまざまな経験則があります (たとえば、5〜9、[ 8 ] 10 [ 9 ]および 10〜15 [ 10 ] — 独立変数ごとに 10 個の観測値というガイドラインは、「10 分の 1 ルール」として知られています)。回帰モデルの選択プロセスでは、ランダム回帰関数の平均二乗誤差は、ランダムノイズ、近似バイアス、および回帰関数の推定値の分散に分割できます。バイアスと分散のトレードオフは、過剰適合モデルを克服するためによく使用されます。
予測対象の従属変数と実際には何の関係もない説明変数が多数存在する場合、一般的に、一部の変数は統計的に有意であると誤って判断され、研究者はそれらをモデルに残してしまう可能性があります。その結果、モデルが過剰適合してしまうのです。これはフリードマンのパラドックスとして知られています。

通常、学習アルゴリズムは、望ましい出力が既知である一連の「訓練データ」を用いて訓練されます。その目的は、訓練中に遭遇しなかった「検証データ」を与えられた場合でも、アルゴリズムが出力を良好に予測できるようにすることです。
過学習とは、オッカムの剃刀の原則に反するモデルや手順の使用を指します。例えば、最終的に最適となるよりも多くの調整可能なパラメータを含めたり、最終的に最適となるよりも複雑なアプローチを使用したりすることです。調整可能なパラメータが多すぎる例として、yのトレーニングデータが 2 つの独立変数の線形関数で適切に予測できるデータセットを考えてみましょう。このような関数は、3 つのパラメータ (切片と 2 つの傾き) しか必要としません。この単純な関数を、より複雑な新しい二次関数、または 2 つ以上の独立変数に関するより複雑な新しい線形関数に置き換えると、リスクが生じます。オッカムの剃刀の原則によれば、与えられた複雑な関数は、与えられた単純な関数よりも、事前には可能性が低いからです。単純な関数の代わりに新しいより複雑な関数が選択され、複雑さの増加を相殺するのに十分なトレーニングデータ適合の向上が見られない場合、新しい複雑な関数はデータに「過剰適合」し、複雑な過剰適合関数は、トレーニングデータセットでは単純な関数と同等、あるいはそれ以上の性能を発揮したとしても、トレーニングデータセット外の検証データではより悪い性能を発揮する可能性が高い。[ 11 ]
異なるタイプのモデルを比較する場合、複雑さは各モデルに存在するパラメータの数を数えるだけで測れるものではなく、各パラメータの表現力も考慮する必要があります。たとえば、m 個のパラメータを持つニューラルネットワーク (曲線関係を追跡できる) とn 個のパラメータを持つ回帰モデルの複雑さを直接比較することは容易ではありません。[ 11 ]
学習時間が長すぎたり、訓練例が少ない場合に過学習が発生しやすくなります。これは、学習器が目標関数とは因果関係のない、訓練データの非常に特殊なランダムな特徴に適応してしまうためです。この過学習の過程では、訓練例に対する性能は向上する一方で、未知のデータに対する性能は悪化します。
簡単な例として、購入した商品、購入者、購入日時を含む小売店での購入履歴データベースを考えてみましょう。購入日時を使って他の属性を予測することで、トレーニングセットに完全に適合するモデルを簡単に構築できますが、このモデルは新しいデータには全く適用できません。なぜなら、過去の購入日時は二度と発生しないからです。
一般的に、学習アルゴリズムは、既知のデータ(後知恵)への適合精度は高いものの、新しいデータ(先見性)の予測精度は低い場合、より単純なアルゴリズムと比較して過学習していると言われます。過去のすべての経験からの情報は、将来に関連する情報と、関連しない情報(「ノイズ」)の2つのグループに分けられるという事実から、過学習を直感的に理解できます。他の条件がすべて同じであれば、基準の予測が困難であればあるほど(つまり、不確実性が高いほど)、無視する必要のある過去の情報に含まれるノイズが多くなります。問題は、どの部分を無視するかを決定することです。ノイズに適合するリスクを低減できる学習アルゴリズムは、「ロバスト」と呼ばれます。
Anne Graham Lotz過学習の最も明白な結果は、検証データセットにおける性能の低下です。その他の悪影響としては、以下のようなものがあります。
最適な関数は通常、より大規模なデータセットまたは全く新しいデータセットで検証する必要があります。ただし、相関係数と時系列(ウィンドウ幅)間の依存関係を適用する最小全域木や相関の寿命などの手法があります。ウィンドウ幅が十分に大きい場合、相関係数は安定し、ウィンドウ幅のサイズに依存しなくなります。したがって、調査対象の変数間の相関係数を計算することで相関行列を作成できます。この行列は、変数間の直接的および間接的な影響を視覚化した複雑なネットワークとしてトポロジー的に表現できます。
ドロップアウト正則化(トレーニングセットデータのランダムな削除)は、層への入力を確率的に削除することで、堅牢性を向上させ、過学習を減らすことができます。プルーニングは、疎で最適なニューラルネットワーク構造を特定することで過学習を軽減し、汎化を強化するもう1つの手法であり、[ 14 ]同時にトレーニングと推論の両方の計算コストを削減します。


アンダーフィッティングはオーバーフィッティングの逆であり、統計モデルまたは機械学習アルゴリズムが単純すぎてデータのパターンを正確に捉えられないことを意味します。アンダーフィッティングの兆候は、現在使用されているモデルまたはアルゴリズムでバイアスが高く分散が低いことが検出されることです(オーバーフィッティングの逆:バイアスが低く分散が高い)。これは、バイアス誤差、分散誤差、および既約誤差についてモデルまたはアルゴリズムを分析する方法であるバイアス・分散トレードオフから取得できます。バイアスが高く分散が低い場合、モデルの結果としてデータポイントが不正確に表現され、将来のデータ結果を十分に予測できなくなります(汎化誤差を参照)。図 5 に示すように、直線は点の曲率に似ていないため、与えられたすべてのデータポイントを表すことはできません。図6および図1に示すような放物線状の線が期待される。図5を分析に用いると、図6を分析した場合の結果とは異なり、誤った予測結果が得られるだろう。
バーナム とアンダーソンは次のように述べている。[ 3 ]: 32
適合度の低いモデルは、データ内の重要な再現可能な(つまり、他のほとんどのサンプルで概念的に再現可能な)構造を無視するため、データによって実際に裏付けられている効果を特定できない。この場合、パラメータ推定値のバイアスはしばしば大きく、標本分散は過小評価され、これらの要因の両方が信頼区間のカバレッジの低下につながる。適合度の低いモデルは、実験環境における重要な治療効果を見落とす傾向がある。
適合不足に対処する方法は複数あります。
良性過学習とは、統計モデルがノイズの多い訓練データに完全に適合している(つまり、訓練セットで完璧な予測精度を得ている)場合でも、未知のデータによく一般化できるように見える現象を指します。この現象は、特に深層ニューラルネットワークで注目されていますが、線形回帰などのはるかに単純なモデルの文脈で理論的な観点から研究されています。特に、この設定では過剰パラメータ化が良性過学習に不可欠であることが示されています。言い換えれば、予測にとって重要でないパラメータ空間の方向の数は、サンプルサイズを大幅に超える必要があります。[ 17 ]