
希釈とドロップアウト(DropConnect [1]とも呼ばれる)は、トレーニングデータに対する複雑な共適応を防ぐことで人工ニューラルネットワークの過剰適合を減らすための正則化手法です。これらは、ニューラルネットワークでモデルの平均化を実行する効率的な方法です。[2]希釈は重みを薄くすることを指し、[3]ドロップアウトは、ニューラルネットワークのトレーニングプロセス中にユニット(非表示と表示の両方)をランダムに「ドロップアウト」または省略することを指します。[4] [5] [2]どちらも同じタイプの正則化をトリガーします。
種類と用途
希釈は通常、弱い希釈と強い希釈に分けられます。弱い希釈は、削除される接続の有限の割合が小さいプロセスを表し、強い希釈はこの割合が大きい場合を指します。強い希釈と弱い希釈の限界がどこにあるかについては明確な区別はなく、多くの場合、その区別は特定のユースケースの前例に依存し、正確なソリューションを解決する方法に影響を及ぼします。
入力に減衰ノイズを追加するために、希釈が使用されることがあります。その場合、弱い希釈は少量の減衰ノイズを追加することを意味し、強い希釈は大量の減衰ノイズを追加することを意味します。どちらも重み希釈のバリエーションとして書き直すことができます。
これらの手法は、重みのランダム プルーニングとも呼ばれますが、これは通常、非反復的な一方向操作です。ネットワークはプルーニングされ、以前のモデルよりも改善されている場合は保持されます。希釈とドロップアウトはどちらも反復プロセスを指します。重みのプルーニングは通常、ネットワークが学習を続けることを意味するものではありませんが、希釈/ドロップアウトでは、手法が適用された後もネットワークは学習を続けます。
一般化線形ネットワーク
人工ニューラルネットワークの線形ノード層からの出力は次のように記述できる。
- – ノードからの出力
- – 希釈前の実重量、ヘブ接続強度とも呼ばれる
- – ノードからの入力
これはベクトル表記で次のように書ける。
- – 出力ベクトル
- – 重みマトリックス
- – 入力ベクトル
式(1)と式(2)は以降のセクションで使用されます。
弱い希釈
弱い希釈では、削除された接続(重み)の有限の割合が小さく、わずかな不確実性が生じます。このエッジケースは平均場理論で正確に解決できます。弱い希釈では、重みへの影響は次のように記述できます。
- – 希釈重量
- – 希釈前の実重量
- – の確率、重みを維持する確率
確率の解釈も、重みを保持することから重みを削減することへと変更することができます。
ベクトル表記では次のように書ける。
ここで、関数は前回の希釈を強制します。
弱い希釈では、重みのごく一部が希釈される。和の項の数が無限大(各ノードの重み)になったとしても、それは依然として無限大(割合は固定)であり、平均場理論を適用することができる。Hertzら[3]の表記法では、これは次のように記述される 。
- 平均場温度
- – 重量を維持する確率からの温度のスケーリング係数
- – 希釈前の実重量、ヘブ接続強度とも呼ばれる
- – 平均安定平衡状態
これにはいくつかの仮定が成り立つが、ここでは列挙されていない。[6] [7]
強い希釈
希釈度が強い場合、削除された接続の有限部分 (重み) が大きくなり、大きな不確実性が生じます。
ドロップアウト
ドロップアウトは、前述の重み方程式( 3 )の特別なケースであり、前述の方程式は、ベクトル行列の行全体を削除するように調整され、ランダムな重みだけでなく、
- –重み行列の行を保持する確率
- – ドロップアウト前の重み行列の実数行
- – 重み行列の希釈行
ドロップアウトはベクトル行列から行全体を削除するため、弱い希釈と平均場理論の使用に関する以前の(リストされていない)仮定は適用できません。
重みをゼロに設定するか、「ノードを削除する」か、またはその他の手段によってノードをゼロにするプロセスは、最終結果に影響を与えず、新しい固有のケースを作成しません。ニューラル ネットが高性能デジタル アレイ乗算器によって処理される場合、プロセス グラフの後半で値をゼロにする方が効果的である可能性があります。ネットが制約付きプロセッサ (おそらくアナログ ニューロモルフィック プロセッサ) によって処理される場合、プロセス グラフの早い段階で値をゼロにする方が電力効率の高いソリューションである可能性があります。
Googleの特許
ニューラルネットワークのニューロン間の接続をランダムに削除してモデルを改善する例はありますが、 [3]この手法は2012年にジェフリー・ヒントンらによってドロップアウトという名前で初めて導入されました。 [2]現在、 Googleがドロップアウト手法の特許を保有しています。[8] [注 1]
参照
注記
- ^ 先行技術のため、この特許はおそらく無効です。以前の出版物では、「ドロップアウト」は「希釈」として説明されています。これは、Hertz、Krogh、Palmer によってIntroduction to the Theory of Neural Computation (1991) ISBN 0-201-51560-1、pp. 45、Weak Dilutionで説明されています。このテキストは、Sompolinsky のThe Theory of Neural Networks: The Hebb Rules and Beyond in Heidelberg Colloquium on Glossy Dynamics (1987) と Canning and Gardner Partially Connected Models of Neural Networks in Journal of Physics (1988) を参照しています。さらに、強い希釈についても説明しています。これは Hinton の論文より前のものです。
参考文献
- ^ Wan, Li; Zeiler, Matthew; Zhang, Sixin; Le Cun, Yann; Fergus, Rob (2013). 「DropConnect を使用したニューラル ネットワークの正規化」。第30 回国際機械学習会議の議事録、PMLR。28 ( 3): 1058–1066 – PMLR 経由。
- ^ abc Hinton, Geoffrey E.; Srivastava, Nitish; Krizhevsky, Alex; Sutskever, Ilya; Salakhutdinov, Ruslan R. (2012). 「特徴検出器の共適応を防ぐことでニューラルネットワークを改善する」. arXiv : 1207.0580 [cs.NE].
- ^ abc ハーツ、ジョン、クロウ、アンダース、パーマー、リチャード (1991)。神経計算理論入門。カリフォルニア州レッドウッドシティ: アディソンウェズリー出版。pp. 45–46。ISBN 0-201-51560-1。
- ^ 「ドロップアウト: ニューラルネットワークの過剰適合を防ぐ簡単な方法」Jmlr.org 。 2015 年7 月 26 日閲覧。
- ^ Warde-Farley, David; Goodfellow, Ian J.; Courville, Aaron; Bengio, Yoshua (2013-12-20). 「区分線形ネットワークにおけるドロップアウトの実証分析」. arXiv : 1312.6197 [stat.ML].
- ^ Sompolinsky, H. (1987)、「ニューラルネットワークの理論: ヘブ則とその先」、ガラス状ダイナミクスに関するハイデルベルク講演会、物理学講義ノート、第 275 巻、ベルリン、ハイデルベルク: Springer Berlin Heidelberg、pp. 485–527、Bibcode :1987LNP...275..485S、doi :10.1007/bfb0057531、ISBN 978-3-540-17777-7
- ^ Canning, A; Gardner, E (1988-08-07). 「ニューラルネットワークの部分接続モデル」. Journal of Physics A: Mathematical and General . 21 (15): 3275–3284. Bibcode :1988JPhA...21.3275C. doi :10.1088/0305-4470/21/15/016. ISSN 0305-4470.
- ^ US 9406017B2、ヒントン、ジェフリー E.、「ニューラル ネットワークのオーバーフィッティングに対処するシステムおよび方法」、2016 年 8 月 2 日公開、2016 年 8 月 2 日発行
