


数学的モデリングにおいて、オーバーフィッティングとは「特定のデータセットに近すぎる、または正確すぎる分析結果を生成することで、追加のデータに適合できなかったり、将来の観測を確実に予測できなかったりする可能性がある」ことを意味します。[1]オーバーフィッティングモデルとは、データによって正当化できる以上のパラメータを含む数学的モデルです。 [2]数学的な意味では、これらのパラメータは多項式の次数を表します。オーバーフィッティングの本質は、残差変動(つまりノイズ)の一部を無意識のうちに抽出し、その変動がモデル構造を表しているかのように見せかけることです。[3] : 45
アンダーフィッティングは、数学モデルがデータの基礎となる構造を適切に捉えられない場合に発生します。アンダーフィッティングモデルとは、正しく指定されたモデルに現れるはずのパラメータや項が一部欠けているモデルです。[2]アンダーフィッティングは、たとえば線形モデルを非線形データに当てはめるときに発生します。このようなモデルは予測性能が低い傾向があります。
モデルの選択に使用される基準が、モデルの適合性を判断するために使用される基準と同じではないため、過剰適合が発生する可能性があります。たとえば、モデルは、トレーニング データセットでのパフォーマンスを最大化することで選択される可能性がありますが、その適合性は、未知のデータで優れたパフォーマンスを発揮する能力によって決定される可能性があります。過剰適合は、モデルが傾向から一般化することを「学習」するのではなく、トレーニング データを「記憶」し始めるときに発生します。
極端な例として、パラメータの数が観測数と同じかそれより多い場合、モデルはデータ全体を記憶するだけでトレーニング データを完全に予測できます。(図については、図 2 を参照してください。) ただし、このようなモデルは予測を行う際に通常、重大な失敗を起こします。
オーバーフィッティングは、選択された関数クラスの近似誤差と最適化手順の最適化誤差に直接関係しています。データセットのサイズに対して適切な意味で大きすぎる関数クラスは、オーバーフィッティングになる可能性があります。[4]フィッティングされたモデルに過剰な数のパラメーターがない場合でも、フィッティングされた関係は、フィッティングに使用されたデータセットよりも新しいデータセットでパフォーマンスが低下することが予想されます(収縮と呼ばれる現象)。[2]特に、決定係数の値は元のデータに比べて縮小します。
過剰適合の可能性や量を減らすために、いくつかの手法が利用可能です(例:モデル比較、クロス検証、正則化、早期停止、剪定、ベイズ事前分布、ドロップアウト)。いくつかの手法の基本は、(1)過度に複雑なモデルに明示的にペナルティを課すか、(2)トレーニングに使用されていないデータセットでモデルのパフォーマンスを評価することによってモデルの一般化能力をテストすることです。このデータセットは、モデルが遭遇する典型的な未知のデータに近いと想定されます。
統計的推論
統計学では、何らかの手順で選択された統計モデルから推論が導き出される。バーナムとアンダーソンは、モデル選択に関するよく引用されるテキストの中で、過剰適合を避けるためには「節約の原則」に従うべきだと主張している。[3]著者らは次のようにも述べている。[3] : 32–33
過剰適合モデルは、多くの場合、パラメータ推定値に偏りがありませんが、推定された(および実際の)サンプリング分散が不必要に大きくなります(推定値の精度は、より簡素なモデルで達成できたものと比較して低くなります)。誤った治療効果が特定される傾向があり、誤った変数が過剰適合モデルに含まれます。... 最適近似モデルは、アンダーフィットとオーバーフィットの誤差を適切にバランスさせることによって実現されます。
分析を導く理論がほとんどない場合、過剰適合は深刻な問題となる可能性が高くなります。その理由の1つは、選択できるモデルが多数になる傾向があるためです。「モデル選択とモデル平均化」(2008年)という本では、このように説明しています。[5]
データ セットがあれば、ボタンを押すだけで何千ものモデルを適合させることができますが、最適なモデルをどのように選択すればよいのでしょうか。候補となるモデルが多数あると、過剰適合が大きな危険となります。ハムレットと入力した猿は、実際に優れた作家なのでしょうか。
回帰
回帰分析では、過剰適合が頻繁に発生します。[6]極端な例として、p 個のデータポイントを持つ線型回帰にp 個の変数がある場合、適合線はすべてのポイントを正確に通過できます。[7]ロジスティック回帰または Cox比例ハザードモデルの場合、さまざまな経験則があります (例: 5–9、[8] 10 [9]および 10–15 [10] — 独立変数あたり 10 個の観測値のガイドラインは、「10 分の 1 ルール」として知られています)。回帰モデルの選択プロセスでは、ランダム回帰関数の平均二乗誤差は、ランダムノイズ、近似バイアス、および回帰関数の推定値の分散に分割できます。バイアスと分散のトレードオフは、過剰適合モデルを克服するためによく使用されます。
予測される従属変数と実際には関係のない説明変数の大きなセットでは、一部の変数が統計的に有意であると誤って判断されることが一般的であり、研究者はそれらの変数をモデル内に保持し、その結果モデルを過剰適合させる可能性があります。これはフリードマンのパラドックスとして知られています。
機械学習

通常、学習アルゴリズムは、望ましい出力がわかっている典型的な状況である「トレーニング データ」のセットを使用してトレーニングされます。目標は、トレーニング中に遭遇しなかった「検証データ」を入力した場合にも、アルゴリズムが出力を予測するパフォーマンスが良好になることです。
過剰適合とは、オッカムの剃刀に違反するモデルまたは手順の使用であり、たとえば、最終的に最適なものよりも多くの調整可能なパラメータを含めたり、最終的に最適なものよりも複雑なアプローチを使用したりすることで違反します。調整可能なパラメータが多すぎる例として、 2 つの独立変数の線形関数によってyのトレーニング データを適切に予測できるデータセットを考えてみましょう。このような関数に必要なのは、3 つのパラメータ (切片と 2 つの傾き) だけです。この単純な関数を、新しい、より複雑な 2 次関数、または 3 つ以上の独立変数に対する新しい、より複雑な線形関数に置き換えると、リスクが伴います。オッカムの剃刀によれば、任意の複雑な関数は任意の単純な関数よりも事前に確率が低いことになります。単純な関数の代わりに新しい、より複雑な関数が選択され、トレーニングデータの適合において複雑さの増加を相殺するのに十分なゲインがなかった場合、新しい複雑な関数はデータを「過剰適合」し、複雑な関数がトレーニングデータセット上では同様に、あるいはおそらくはより良いパフォーマンスを発揮したとしても、トレーニングデータセット外の検証データでは複雑な過剰適合関数はより単純な関数よりもパフォーマンスが悪くなる可能性があります。[11]
異なるタイプのモデルを比較する場合、各モデルに存在するパラメータの数を数えるだけでは複雑さを測ることはできません。各パラメータの表現力も考慮する必要があります。たとえば、m個のパラメータを持つニューラルネット(曲線関係を追跡できる)の複雑さをn個のパラメータを持つ回帰モデルと直接比較することは簡単ではありません。[11]
過剰適合は、学習の実行時間が長すぎる場合やトレーニング例が少ない場合に特に起こりやすく、学習者は、ターゲット関数と因果関係のないトレーニング データの非常に特定のランダムな特徴に適応します。この過剰適合のプロセスでは、トレーニング例のパフォーマンスは向上しますが、未知のデータのパフォーマンスは低下します。
簡単な例として、購入した商品、購入者、購入日時を含む小売購入のデータベースを考えてみましょう。購入日時を使用して他の属性を予測することで、トレーニング セットに完全に適合するモデルを簡単に構築できますが、過去の出来事が再び発生することはないため、このモデルは新しいデータにはまったく一般化されません。
一般的に、学習アルゴリズムが単純なアルゴリズムに比べてオーバーフィットしていると言われるのは、既知のデータ (後知恵) のフィッティング精度が高く、新しいデータの予測精度が低い場合です (先知恵)。過去の経験から得たすべての情報は、将来に関連する情報と無関係な情報 (「ノイズ」) の 2 つのグループに分けられることから、オーバーフィットは直感的に理解できます。他の条件が同じであれば、基準を予測するのが難しいほど (つまり、不確実性が高いほど)、過去の情報には無視する必要があるノイズが多く存在します。問題は、どの部分を無視するかを決定することです。ノイズをフィッティングするリスクを軽減できる学習アルゴリズムは、「堅牢」と呼ばれます。
結果
過剰適合の最も明らかな結果は、検証データセットのパフォーマンスが低下することです。その他の悪影響としては、次のようなものがあります。
- 過剰適合された関数は、最適な関数よりも検証データセット内の各項目についてより多くの情報を要求する可能性が高く、この不要な追加データを収集することは、特に個々の情報を人間の観察と手動のデータ入力によって収集する必要がある場合、コストがかかったりエラーが発生しやすくなったりする可能性があります。[11]
- より複雑で過剰適合した関数は、単純な関数よりも移植性が低くなる可能性があります。極端な例では、1変数の線形回帰は移植性が非常に高いため、必要に応じて手作業で行うこともできます。もう一方の極端な例では、元のモデル作成者のセットアップ全体を正確に複製することによってのみ再現できるモデルがあり、再利用や科学的な再現が困難になります。[11]
- 過剰適合した機械学習モデルのトレーニングセットから、個々のトレーニングインスタンスの詳細を再構築できる可能性があります。たとえば、トレーニングデータに機密性の高い個人識別情報(PII)が含まれている場合、これは望ましくない可能性があります。この現象は人工知能と著作権の分野でも問題を引き起こしており、 Stable DiffusionやGitHub Copilotなどの生成型ディープラーニングモデルの開発者は、トレーニングデータから特定の著作権で保護されたアイテムを再現できることが判明したため、著作権侵害で訴えられています。[12] [13]
救済策
最適な関数は通常、より大きなデータセットやまったく新しいデータセットで検証する必要があります。ただし、相関係数と時系列 (ウィンドウ幅) 間の依存関係を適用する最小全域木や相関の存続期間などの方法があります。ウィンドウ幅が十分に大きい場合、相関係数は安定しており、ウィンドウ幅のサイズに依存しなくなります。したがって、調査対象の変数間の相関係数を計算することで、相関行列を作成できます。この行列は、変数間の直接的および間接的な影響が視覚化される複雑なネットワークとして位相的に表現できます。
ドロップアウト正規化 (トレーニング セット データのランダムな削除) によっても堅牢性が向上し、レイヤーへの入力が確率的に削除されるため、過剰適合が軽減されます。
アンダーフィッティング


アンダーフィッティングはオーバーフィッティングの逆で、統計モデルまたは機械学習アルゴリズムが単純すぎるため、データ内のパターンを正確に捉えることができないことを意味します。アンダーフィッティングの兆候は、現在使用されているモデルまたはアルゴリズムで高いバイアスと低い分散が検出されることです (オーバーフィッティングの逆: 低いバイアスと高い分散)。これは、バイアス エラー、分散エラー、および削減不可能なエラーについてモデルまたはアルゴリズムを分析する方法であるバイアスと分散のトレードオフから収集できます。バイアスが高く分散が低い場合、モデルの結果はデータ ポイントを不正確に表すため、将来のデータ結果を十分に予測できなくなります (一般化エラーを参照)。図 5 に示すように、直線はポイントの曲率に似ていないため、指定されたすべてのデータ ポイントを表すことはできません。図 6 と図 1 に示すように、放物線状の線が表示されることが予想されます。図 5 を分析に使用すると、図 6 を分析した結果とは反対の誤った予測結果が得られます。
バーナムとアンダーソンは次のように述べている。[3] : 32
... 適合度の低いモデルは、データ内の重要な再現可能な(つまり、他のほとんどのサンプルで概念的に再現可能な)構造を無視するため、データによって実際に裏付けられている効果を特定できません。この場合、パラメータ推定値の偏りが大きくなることが多く、サンプリング分散が過小評価され、両方の要因により信頼区間の範囲が狭くなります。適合度の低いモデルは、実験設定で重要な治療効果を見逃す傾向があります。
アンダーフィットの解決
アンダーフィッティングに対処する方法は複数あります。
- モデルの複雑さを増やす:モデルが単純すぎる場合は、より多くの機能を追加したり、パラメータの数を増やしたり、より柔軟なモデルを使用したりして、モデルの複雑さを増やす必要があるかもしれません。ただし、過剰適合を避けるために慎重に行う必要があります。[14]
- 別のアルゴリズムを使用する: 現在のアルゴリズムがデータ内のパターンを捉えられない場合は、別のアルゴリズムを試す必要があるかもしれません。たとえば、ニューラルネットワークは、データの種類によっては線形回帰モデルよりも効果的な場合があります。[14]
- トレーニングデータの量を増やす: データ不足によりモデルがアンダーフィッティングしている場合は、トレーニングデータの量を増やすと役立つ場合があります。これにより、モデルはデータ内の根本的なパターンをより適切に捉えることができるようになります。[14]
- 正則化:正則化は、損失関数にペナルティ項を追加して大きなパラメータ値を抑制することで、過剰適合を防ぐために使用される手法です。また、モデルの複雑さを制御することで、過小適合を防ぐためにも使用できます。[15]
- アンサンブル法: アンサンブル法は、複数のモデルを組み合わせてより正確な予測を作成します。これにより、複数のモデルが連携してデータ内の基本的なパターンを捉えることができるため、アンダーフィッティングを減らすことができます。
- 特徴エンジニアリング:特徴エンジニアリングでは、既存のモデル特徴から、現在の問題により関連のある新しいモデル特徴を作成します。これにより、モデルの精度が向上し、アンダーフィッティングを防ぐことができます。[14]
良性の過剰適合
良性過剰適合とは、ノイズの多いトレーニングデータに完璧に適合している(つまり、トレーニングセットで完璧な予測精度を得ている)場合でも、統計モデルが未知のデータにうまく一般化されるように見える現象を指します。この現象はディープニューラルネットワークで特に興味深いものですが、線形回帰などのはるかに単純なモデルのコンテキストで理論的観点から研究されています。特に、この設定では、過剰パラメータ化が良性過剰適合に不可欠であることが示されています。言い換えると、予測に重要でないパラメータ空間の方向の数がサンプルサイズを大幅に超えている必要があります。[16]
参照
- バイアスと分散のトレードオフ
- 曲線フィッティング
- データドレッジ
- 特徴選択
- 特徴エンジニアリング
- フリードマンのパラドックス
- 一般化エラー
- 適合性
- 相関関係の存続期間
- モデルの選択
- 研究者の自由度
- オッカムの剃刀
- プライマリモデル
- Vapnik–Chervonenkis次元– VC次元が大きいほど、過剰適合のリスクが大きくなる
注記
- ^ OxfordDictionaries.comの「overfitting」の定義: この定義は統計に特化しています。
- ^ abc Everitt BS、Skrondal A. (2010)、Cambridge Dictionary of Statistics、Cambridge University Press。
- ^ abcd Burnham, KP; Anderson, DR (2002)、モデル選択とマルチモデル推論(第2版)、Springer-Verlag。
- ^ Bottou, Léon; Bousquet, Olivier (2011-09-30)、「大規模学習のトレードオフ」、機械学習の最適化、MIT Press、pp. 351–368、doi :10.7551/mitpress/8996.003.0015、ISBN 978-0-262-29877-3、 2023-12-08取得
- ^ Claeskens, G. ; Hjort, NL (2008)、「モデル選択とモデル平均化」、ケンブリッジ大学出版局。
- ^ Harrell, FE Jr. (2001)、回帰モデリング戦略、Springer。
- ^ Martha K. Smith (2014-06-13). 「Overfitting」.テキサス大学オースティン校. 2016年7月31日閲覧。
- ^ Vittinghoff, E .; McCulloch, CE (2007). 「ロジスティック回帰とCox回帰における変数あたり10イベントルールの緩和」。アメリカ疫学ジャーナル。165 (6): 710–718。doi :10.1093/aje/kwk052。PMID 17182981 。
- ^ Draper, Norman R.; Smith, Harry (1998).応用回帰分析(第3版). Wiley . ISBN 978-0471170822。
- ^ Jim Frost (2015-09-03). 「回帰モデルの過剰適合の危険性」 。 2016年7月31日閲覧。
- ^ abcd Hawkins, Douglas M (2004). 「オーバーフィッティングの問題」. Journal of Chemical Information and Modeling . 44 (1): 1–12. doi :10.1021/ci0342472. PMID 14741005. S2CID 12440383.
- ^ ab Lee、Timothy B.(2023年4月3日)。「安定拡散著作権訴訟はAIにとって法的な激震となる可能性がある」Ars Technica。
- ^ Vincent, James (2022-11-08). 「AI著作権のルールを書き換える可能性のある訴訟」The Verge . 2022-12-07閲覧。
- ^ abcd 「ML | アンダーフィッティングとオーバーフィッティング」。GeeksforGeeks 。 2017年11月23日。 2023年2月27日閲覧。
- ^ Nusrat, Ismoilov; Jang, Sung-Bong (2018年11月). 「ディープニューラルネットワークにおける正規化手法の比較」. Symmetry . 10 (11): 648. Bibcode :2018Symm...10..648N. doi : 10.3390/sym10110648 . ISSN 2073-8994.
- ^ Bartlett, PL, Long, PM, Lugosi, G., & Tsigler, A. (2019). 線形回帰における良性過剰適合。米国科学アカデミー紀要、117、30063 - 30070。
参考文献
- Leinweber, DJ (2007)。「愚かなデータマイナーのトリック」。投資ジャーナル。16 :15–22。doi :10.3905/ joi.2007.681820。S2CID 108627390 。
- Tetko , IV; Livingstone, DJ; Luik, AI (1995). 「ニューラルネットワーク研究。1. オーバーフィッティングとオーバートレーニングの比較」(PDF)。化学情報およびモデリングジャーナル。35 (5): 826–833。doi :10.1021/ci00027a006。
- ヒント 7: 過剰適合を最小限に抑える. Chicco, D. (2017 年 12 月). 「計算生物学における機械学習の 10 の簡単なヒント」. BioData Mining . 10 (35): 35. doi : 10.1186/s13040-017-0155-3 . PMC 5721660 . PMID 29234465.
さらに読む
- クリスチャン、ブライアン、グリフィス、トム(2017年4月)、「第7章:オーバーフィッティング」、Algorithms To Live By:人間の意思決定のコンピュータサイエンス、ウィリアムコリンズ、pp. 149–168、ISBN 978-0-00-754799-9
外部リンク
- 過剰適合データの問題 –ストーニーブルック大学
- 「オーバーフィッティング」とは正確には何なのか? – Andrew Gelman のブログ
- CSE546: 線形回帰バイアス/分散トレードオフ –ワシントン大学
- アンダーフィッティングとは何か – IBM
