ロジスティック活性化関数 人工ニューラルネットワーク では、ノードの活性化関数は、個々の入力とその重みに基づいてノードの出力を計算する関数です。活性化関数が 非線形 であれば、少数のノードだけで複雑な問題を解決できます。[ 1 ]
最新の活性化関数には、Hinton らによって開発された 2012 年の音声認識モデルで使用されたロジスティック (シグモイド ) 関数[ 2 ] 、 2012 年 の AlexNet コンピュータビジョンモデル [ 3 ][ 4 ] および 2015 年の ResNet モデルで使用されたReLU 、そして 2018 年 の BERT モデル で使用 され たReLU のスムーズバージョンであるGELU [ 5 ] などがあります。
活性化関数の比較 活性化関数は、経験的な性能とは別に、数学的にも異なる特性を持っています。
非線形 活性化関数が非線形の場合、2 層ニューラル ネットワークは普遍関数近似器であることが証明できます。[ 6 ] これは普遍近似定理 として知られています。恒等活性化関数はこの性質を満たしません。複数の層で恒等活性化関数を使用すると、ネットワーク全体が単層モデルと等価になります。 範囲 活性化関数の範囲が有限の場合、パターン提示が影響を与える重みが限られているため、勾配ベースの学習方法はより安定する傾向があります。範囲が無限の場合、パターン提示がほとんどの重みに大きな影響を与えるため、学習は一般的に効率的になります。後者の場合、通常はより小さな学習率 が必要となります。 連続的に微分可能 この特性は、勾配ベースの最適化手法を可能にする上で望ましいものです(ReLUは 連続的に微分可能ではなく、勾配ベースの最適化にはいくつかの問題がありますが、それでも可能です)。バイナリステップ活性化関数は0で微分可能ではなく、他のすべての値に対して0に微分されるため、勾配ベースの手法では進歩できません。[ 7 ] これらの特性はパフォーマンスに決定的な影響を与えるものではなく、また有用な数学的特性の唯一のものでもありません。例えば、ソフトプラスの厳密に正の範囲は、 変分オートエンコーダー の分散を予測するのに適しています。
数学的な詳細 最も一般的な活性化関数は、リッジ関数 、ラジアル関数 、フォールド関数 の3つのカテゴリに分類できます。
活性化関数f {\displaystyle f} 飽和状態で ある場合リム | v | → ∞ | ∇ f ( v ) | = 0 {\displaystyle \lim _{|v|\to \infty }|\nabla f(v)|=0} 非飽和で ある場合リム | v | → ∞ | ∇ f ( v ) | ≠ 0 {\displaystyle \lim _{|v|\to \infty }|\nabla f(v)|\neq 0} ReLU のような非飽和活性化関数は、飽和活性化関数よりも優れている可能性がある。なぜなら、それらは勾配消失問題 に悩まされる可能性が低いからである。[ 8 ]
リッジ活性化機能 リッジ関数は、入力変数の線形結合に作用する多変数関数です。よく使われる例としては、以下のようなものがあります。
線形 活性化:ϕ ( v ) = 1 + v ′ b {\displaystyle \phi (\mathbf {v} )=a+\mathbf {v} '\mathbf {b} } 、ReLU 活性化関数:ϕ ( v ) = 最大 ( 0 、 1 + v ′ b ) {\displaystyle \phi (\mathbf {v} )=\max(0,a+\mathbf {v} '\mathbf {b} )} 、ヘヴィサイド 活性化:ϕ ( v ) = 1 1 + v ′ b > 0 {\displaystyle \phi (\mathbf {v} )=1_{a+\mathbf {v} '\mathbf {b} >0}} 、物流の 活性化:ϕ ( v ) = ( 1 + exp ( − 1 − v ′ b ) ) − 1 {\displaystyle \phi (\mathbf {v} )=(1+\exp(-a-\mathbf {v} '\mathbf {b} ))^{-1}} 。生物学的着想に基づくニューラルネットワーク では、活性化関数は通常、細胞内の活動電位 の発火率を表す抽象化です。 [ 9 ] 最も単純な形式では、この関数はバイナリ です。つまり、ニューロンが発火しているかしていないかのどちらかです。[ 10 ]
ニューロンは一定の速度よりも速く発火することはできません。この生物学的な制約から、出力範囲が有限区間に限定されるシグモイド活性化関数が用いられます。
関数は次のようになります。ϕ ( v ) = U ( 1 + v ′ b ) {\displaystyle \phi (\mathbf {v} )=U(a+\mathbf {v} '\mathbf {b} )} 、 どこU {\displaystyle U} はヘヴィサイド階段関数 です。
一方、直線の傾きが正の場合、入力電流の増加に伴って発火率が増加することを示している可能性があります。このような関数は次の形式になります。 ϕ ( v ) = 1 + v ′ b {\displaystyle \phi (\mathbf {v} )=a+\mathbf {v} '\mathbf {b} } 。
整流線形ユニットおよびガウス誤差線形ユニットの活性化関数
活性化関数の表 以下の表は、前の層または複数の層からの1つのフォールド x の関数であるいくつかの活性化関数の特性を比較したものです。
以下の表は、前の層または複数の層からの単一のフォールド x の関数ではない活性化関数を示しています。
^ ここで、δ 私 j {\displaystyle \delta _{ij}} はクロネッカーデルタ です。^ 例えば、j {\displaystyle j} 前のニューラルネットワーク層のカーネルの数を反復処理しながら私 {\displaystyle i} 現在の層のカーネルの数だけ反復処理を行います。
参考文献 ↑ ヒンケルマン、クヌート。「ニューラルネットワーク、p. 7」(PDF) 。北西スイス応用科学大学 。2018年10月6日にオリジナル(PDF)からアーカイブ。 2018年 10月6日 に取得 。 ↑ Hinton, Geoffrey; Deng, Li; Deng, Li; Yu, Dong; Dahl, George; Mohamed, Abdel-rahman; Jaitly, Navdeep; Senior, Andrew; Vanhoucke, Vincent; Nguyen, Patrick; Sainath, Tara ; Kingsbury, Brian (2012). "Deep Neural Networks for Acoustic Modeling in Speech Recognition". IEEE Signal Processing Magazine . 29 (6): 82– 97. doi : 10.1109/MSP.2012.2205597 . S2CID 206485943 . ↑ Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (2017年5月24日). "ImageNet分類における深層畳み込みニューラルネットワークの利用" . Communications of the ACM . 60 (6): 84–90 . doi : 10.1145/3065386 . ISSN 0001-0782 . ↑ キング・アブドゥルアジーズ大学、アル・ジョハニア、ノラ、エルレファエイ、ラミア、ベンハ大学(2019年6月30日)。 「 畳み込みニューラルネットワークによる手の甲の静脈認識:特徴学習と転移学習のアプローチ」 (PDF) 。International Journal of Intelligent Engineering and Systems。12 ( 3): 178–191。doi : 10.22266 / ijies2019.0630.19 。 1 2 3 Hendrycks, Dan; Gimpel, Kevin (2016). "ガウス誤差線形ユニット (GELU)". arXiv : 1606.08415 [ cs.LG ]. ↑ Cybenko, G. (1989年12月). 「シグモイド関数の重ね合わせによる近似」 (PDF) . Mathematics of Control, Signals, and Systems . 2 (4): 303– 314. Bibcode : 1989MCSS....2..303C . doi : 10.1007/BF02551274 . ISSN 0932-4194 . S2CID 3958369 . ↑ Snyman, Jan (2005年3月3日). 実践的数学的最適化:基本最適化理論と古典的および新しい勾配ベースアルゴリズム入門 . Springer Science & Business Media. ISBN 978-0-387-24348-1 。↑ Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (2017年5月24日). "ImageNet分類における深層畳み込みニューラルネットワークの利用" . Communications of the ACM . 60 (6): 84–90 . doi : 10.1145/3065386 . ISSN 0001-0782 . S2CID 195908774 . ↑ Hodgkin, AL; Huxley, AF (1952年8月28日). 「膜電流の定量的記述と神経における伝導および興奮への応用」 . The Journal of Physiology . 117 (4): 500– 544. doi : 10.1113/jphysiol.1952.sp004764 . PMC 1392413 . PMID 12991237 . ↑ Gerstein, GL (1964). "神経細胞アンサンブルによる発火活動の表現". IEEE Transactions on Biomedical Engineering . 11 : 61–65 . doi : 10.1109/TBME.1964.4502244 . ↑ Sitzmann, Vincent; Martel, Julien; Bergman, Alexander; Lindell, David; Wetzstein, Gordon (2020). "周期的活性化関数による暗黙的ニューラル表現" . Advances in Neural Information Processing Systems . 33 . Curran Associates, Inc.: 7462– 7473. arXiv : 2006.09661 . ↑ Flake, Gary William (1998)、 「Square Unit Augmented Radially Extended Multilayer Perceptrons」 、Orr, Genevieve B.、Müller, Klaus-Robert (編)、 『Neural Networks: Tricks of the Trade』 、Lecture Notes in Computer Science、第 1524巻、ベルリン、ハイデルベルク:Springer、pp. 145–163 、 doi : 10.1007/3-540-49430-8_8 、 ISBN 978-3-540-49430-0 2024年10月5日 取得 ↑ Du, Simon; Lee, Jason (2018年7月3日). 「二次活性化関数を持つニューラルネットワークにおける過剰パラメータ化の力について」 . 第35回国際機械学習会議議事録 . PMLR: 1329–1338 . arXiv : 1803.01206 . ↑ Nair, Vinod; Hinton, Geoffrey E. (2010), "Rectified Linear Units Improve Restricted Boltzmann Machines" , 27th International Conference on Machine Learning , ICML'10, USA: Omnipress, pp. 807–814 , ISBN 9781605589077 ↑ Glorot, Xavier; Bordes, Antoine; Bengio, Yoshua (2011). "Deep sparse rectifier neural networks" (PDF) . International Conference on Artificial Intelligence and Statistics . ↑ クレベール、ジョルク=アルネ。ウンターティナー、トーマス。 Hochreiter、Sepp (2015 年 11 月 23 日)。 「指数線形ユニット (ELU) による高速かつ正確なディープ ネットワーク学習」。 arXiv : 1511.07289 [ cs.LG ]。 ↑ クランバウアー、ギュンター。ウンターティナー、トーマス。マイヤー、アンドレアス。 Hochreiter、Sepp (2017 年 6 月 8 日)。 「自己正規化ニューラル ネットワーク」。 神経情報処理システムの進歩 。 30 (2017)。 arXiv : 1706.02515 。 ↑ Maas, Andrew L.; Hannun, Awni Y.; Ng, Andrew Y. (2013年6月). "整流器の非線形性によりニューラルネットワーク音響モデルが改善される". Proc. ICML . 30 (1). S2CID 16489696 . ↑ He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2015年2月6日). "整流器の深掘り: ImageNet分類における人間レベルのパフォーマンスを超える". arXiv : 1502.01852 [ cs.CV ]. ↑ Atto, Abdourrahmane M.; Galichet, Sylvie; Pastor, Dominique; Méger, Nicolas (2023), "On joint parameterizations of linear and nonlinear functionals in neural networks" , Elsevier Pattern Recognition , vol. 160, pp. 12–21 , arXiv : 2101.09948 , doi : 10.1016/j.neunet.2022.12.019 , PMID 36592526 ↑ Atto, Abdourrahmane M.; Pastor, Dominique; Mercier, Grégoire (2008), "Smooth sigmoid wavelet shrinkage for non-parametric estimation" (PDF) , 2008 IEEE International Conference on Acoustics, Speech and Signal Processing , pp. 3265– 3268, doi : 10.1109/ICASSP.2008.4518347 , ISBN 978-1-4244-1483-3 S2CID 9959057 ↑ Elfwing, Stefan; Uchibe, Eiji; Doya, Kenji (2018). "強化学習におけるニューラルネットワーク関数近似のためのシグモイド重み付き線形ユニット". Neural Networks . 107 : 3–11 . arXiv : 1702.03118 . doi : 10.1016/j.neunet.2017.12.012 . PMID 29395652. S2CID 6940861 . ↑ Ramachandran, Prajit; Zoph, Barret; Le, Quoc V (2017). "Searching for Activation Functions". arXiv : 1710.05941 [ cs.NE ]. ↑ Basirat, Mina; Roth, Peter M. (2018年8月2日), The Quest for the Golden Activation Function , arXiv : 1808.00783 ↑ Goodfellow, Ian J.; Warde-Farley, David; Mirza, Mehdi; Courville, Aaron; Bengio, Yoshua (2013). "Maxout Networks". JMLR Workshop and Conference Proceedings . 28 (3): 1319– 1327. arXiv : 1302.4389 . ↑ Maronese, Marco; Destri, Claudio; Prati, Enrico (2022). "量子ニューラルネットワークのための量子活性化関数". Quantum Information Processing . 21 (4): 128. arXiv : 2201.03700 . Bibcode : 2022QuIP...21..128M . doi : 10.1007/s11128-022-03466-0 . ISSN 1570-0755 .
さらに読む Kunc, Vladimír; Kléma, Jiří (2024年2月14日)、「30年間の活性化関数:ニューラルネットワークのための400の活性化関数の包括的な調査」 、arXiv : 2402.09092 Nwankpa, Chigozie; Ijomah, Winifred; Gachagan, Anthony; Marshall, Stephen (2018年11月8日). "活性化関数: 深層学習における実践と研究の動向の比較". arXiv : 1811.03378 [ cs.LG ]. Dubey, Shiv Ram; Singh, Satish Kumar; Chaudhuri, Bidyut Baran (2022). "深層学習における活性化関数:包括的な調査とベンチマーク" . Neurocomputing . 503 . Elsevier BV: 92– 108. arXiv : 2109.14545 . doi : 10.1016/j.neucom.2022.06.111 . ISSN 0925-2312 .