Loading article…
(教師あり)機械学習、特にデータから学習する場合、データ値をモデル化できない状況があります。これは、モデル化されていないランダムな変動や測定誤差がデータに含まれている場合に発生する可能性があり、これを確率的ノイズと呼ぶことができます。あるいは、モデル化(または学習)されている現象が複雑すぎるため、データにモデル化されていない追加の複雑さが含まれている場合にも発生します。データのこの追加の複雑さは、決定論的ノイズと呼ばれています。[ 1 ]これら 2 種類のノイズは原因が異なりますが、学習に対する悪影響は似ています。モデルが、モデル化できるデータの部分に適合するよりも、(確率的または決定論的な)ノイズ(モデル化できないデータの部分)に適合しようとするため、過学習が発生します。どちらのタイプのノイズが存在する場合でも、モデルがデータに過学習してパフォーマンスが低下するのを防ぐために、学習アルゴリズムを正則化することが通常推奨されます。正則化は通常、バイアスを犠牲にして分散の低いモデルをもたらします。
教師あり学習アルゴリズムをトレーニングする前に、ノイズの多いトレーニング例を検出して除去することで、ノイズの影響を軽減することもできます。ノイズの多いトレーニング例を識別するアルゴリズムはいくつかあり、トレーニング前に疑わしいノイズの多いトレーニング例を除去すると、通常はパフォーマンスが向上します。[ 2 ] [ 3 ]