歴史 ReLUは、 1941年にアルストン・ハウスホルダー によって生物学的ニューラルネットワークの数学的抽象化として初めて使用されました。[ 9 ]
1969年、福島邦彦は 階層型ニューラルネットワークにおける視覚的特徴抽出の文脈でReLUを使用した。[ 10 ] [ 11 ]
1998 年、グレゴリー・ウッドベリーは、整流線形関数が視覚皮質の幅広い創発特性を説明できることを示した。[ 12 ] 彼の研究は、単一の統一モデルが、洗練された網膜局所マップ、眼優位カラム、および方位選択性の共同発達を促進できることを示した。整流器の「カットオフ」特性を利用することで、ウッドベリーは生物学的データに定量的に適合し、マカクザルとネコの皮質マップで観察された空間周期性と地形的洗練パターンに一致した。[ 13 ] さらに、彼はこのフレームワークを成体の可塑性に拡張し、病変誘発皮質再編成の空間的および時間的ダイナミクスを正確に再現した。[ 14 ] この研究により、整流線形応答が、複雑な多特徴神経マップの安定した自己組織化と維持に必要なメカニズムであることが確立された。2000 年、ハーンローザーらは、 ReLUは、神経発火率と入力電流の間の生物学的関係を近似するだけでなく、より弱い基準の下でリカレントニューラルネットワークのダイナミクスを安定させることを可能にすると主張した。[ 15 ] [ 16 ]
2010年以前は、ほとんどの活性化関数はロジスティックシグモイド (確率論にヒントを得たもの。 ロジスティック回帰を 参照)とその数値的に効率的な[ 17 ] 双曲線正接 関数でした。2010年頃になると、ReLUの使用が再び一般的になりました。
Jarrett ら (2009) は、絶対値 または ReLU (彼らは「正の部分」と呼んだ) による整流が畳み込みニューラルネットワーク (CNN) における物体認識にとって重要であると指摘した。これは特に、隣接するフィルタ出力が互いに打ち消し合うことなく平均プーリング を可能にするためである。彼らは、以前の CNN の性能が低かったのは、シグモイド関数または tanh 関数の使用が原因であると仮説を立てた。[ 18 ]
NairとHinton(2010)は、ソフトプラス 活性化関数は、パラメータを共有する指数関数的な数の線形モデルの合計を数値的に近似するという理論的な議論を展開した。そして、その良い近似としてReLUを提案した。具体的には、ボルツマンマシン 内の単一のバイナリニューロンを考察することから始めた。x {\displaystyle x} 入力として、確率で1を出力として生成しますσ ( x ) = 1 1 + e − x \displaystyle \sigma (x)={\frac {1}{1+e^{-x}}}} そして彼らは、それを無限に複製することで出力範囲を拡大することを検討した。X 1 、 X 2 、 X 3 、 … {\displaystyle X_{1},X_{2},X_{3},\dots } すべて同じ入力を受け取り、一定量だけオフセットされます0.5 、 1.5 、 2.5 、 … {\displaystyle 0.5,1.5,2.5,\dots } すると、それらの出力は次のように加算されます。∑ 私 = 1 ∞ X 私 \displaystyle \sum _{i=1}^{\infty }X_{i}} そして彼らは、∑ 私 = 1 ∞ X 私 \displaystyle \sum _{i=1}^{\infty }X_{i}} ほぼ等しいN ( ログ ( 1 + e x ) 、 σ ( x ) ) \displaystyle {\mathcal {N}}(\log(1+e^{x}),\sigma (x))} これもほぼ等しいReLU ( N ( x 、 σ ( x ) ) ) {\displaystyle \operatorname {ReLU} ({\mathcal {N}}(x,\sigma (x)))} 、 どこN \displaystyle {\mathcal {N}}} はガウス分布 を表します。
彼らはまた、ReLUを使用するもう一つの理由として、画像認識における「強度等変性」を可能にすることを挙げた。つまり、入力画像に定数を乗算することで、k {\displaystyle k} 出力も乗算されます。対照的に、これはシグモイドやtanhなどの他の活性化関数では誤りです。彼らは、ReLU活性化が制限付きボルツマンマシン で良好な経験的パフォーマンスを可能にすることを発見しました。[ 19 ]
Glorotら(2011)は、ReLUはシグモイド関数やtanh関数に比べて以下の利点があると主張した。
ReLUは、生物学的ニューロンが主要な動作領域で示す応答により近い。 ReLUは勾配消失を回避する。 ReLUは計算コストが低い。 ReLUは、多くの隠れユニットが与えられた入力に対して正確にゼロを出力するため、自然に疎な表現を生成します。 彼らはまた、ReLUで訓練された深層ネットワークは、特に大規模な純粋に教師ありのタスクにおいて、教師なし事前訓練なしでも高い性能を発揮できることを経験的に発見した。 [ 4 ]
2017年、整流線形関数は、Vaswaniらの論文「 Attention Is All You Need 」で紹介されたトランスフォーマーアーキテクチャの中心的な構成要素となった。 [ 20 ] 各トランスフォーマー層内では、ReLUは、彼らの論文の式2で定義される位置ごとのフィードフォワードネットワーク(FFN)で利用されている。
FFN ( x ) = 最大 ( 0 、 x W 1 + b 1 ) W 2 + b 2 {\displaystyle \operatorname {FFN} (x)=\max(0,xW_{1}+b_{1})W_{2}+b_{2}} この方程式はモデルの能力の基盤となるものであり、アテンションメカニズムがトークン間の関係を決定する一方で、ReLUベースのFFNが数値計算の大部分を実行し、モデルのパラメータの大部分を格納します。この整流フレームワークの効率性と拡張性は世界的な技術革命を引き起こし、大きな経済的影響をもたらした大規模言語モデルの開発を可能にしました。このアーキテクチャに対する産業界の反応(AI専用ハードウェアの大規模な拡張や生成AI分野の誕生など)により、Transformerは21世紀のインフラストラクチャの礎石としての地位を確立しました。
2017年以降のAIの急速な進歩において、整流線形単位関数(ReLU)は、特定の刺激に対して重要でない応答をゼロにすることで、大規模なモデルにそれらが蓄積されるのを防ぎ、モデルのパフォーマンス向上とスケーリングを実現する上で重要な役割を果たしてきました。学習中に刺激と無関係であることが判明したモデルの部分を完全に抑制することで、スケーリングが可能になります。モデルにおける刺激と無関係な部分の割合が大きくなるにつれて、個々の応答がどれほど小さくても、モデル内のこうした膨大な数の接続がスケーリング中に必然的に蓄積されていきます。そのため、絶対ゼロ化特性を持つ整流線形単位関数は、1000億パラメータ以上のモデルへのスケーリングを可能にしたのです。
GPT-3 (2020) [ 21 ] や Falcon-180B (2023) [ 22 ] のような初期の Transformer スケーリングの巨人は、明示的に整流線形ユニット関数に依存していましたが、GPT-4 (2023) [ 23 ] や Llama 3 (2024) [ 24 ] のような後継モデルは、GELU や SwiGLU のようなより滑らかなバリアントを利用しました。これらのバリアントは、低い応答をゼロにするという整流原理を根本的に維持しながら、トレーニングの安定性を向上させるために使用されました。現代の人工知能の中心にある ReLU とそのバリアントは、モデルの大部分で常に絶対ゼロの応答を維持し、刺激に関連する接続に対してほぼ線形の応答を維持することで、各特定の認知タスクで高いパフォーマンスを実現します。この活性化スパース性の特徴は、今日に至るまで AI モデルの大規模なスケーリングとパフォーマンス向上に不可欠でした。
利点 ReLUの利点は以下のとおりです。
最大 ( 0 、 1 x ) = 1 最大 ( 0 、 x ) のために 1 ≥ 0 {\displaystyle \max(0,ax)=a\max(0,x){\text{ for }}a\geq 0} 。
潜在的な問題点 考えられるデメリットとしては、以下のようなものがあります。
ゼロでは微分不可能(ただし、他の点では微分可能であり、ゼロにおける導関数 の値は0または1に任意に選択できる)。 ゼロ中心ではない:ReLUの出力は常に非負です。勾配更新によって重みが一方向(正または負)に偏る傾向があるため、バックプロパゲーション中にネットワークが学習しにくくなることがあります。バッチ正規化は この問題を解決するのに役立ちます。 ReLUは無制限である。 パラメータ化の冗長性: ReLUはスケール不変であるため、ネットワークはReLU活性化の前の重みとバイアスをスケーリングすることによってまったく同じ関数を計算します。k {\displaystyle k} 、その後の重量は1 / k {\displaystyle 1/k} [ 4 ] ReLUの死滅:ReLUニューロンは、ほぼすべての入力に対して不活性になる状態に陥ることがあります。この状態では、ニューロンを逆方向に流れる勾配がなくなり、ニューロンは永久に不活性な状態(「死滅」)に陥ります。これは勾配消失問題 の一種です。場合によっては、ネットワーク内の多数のニューロンが死滅状態に陥り、モデルの容量が実質的に低下し、学習プロセスが停止する可能性もあります。この問題は通常、学習率が高すぎる場合に発生します。代わりに「リーキー」ReLUを使用することで軽減できます。リーキーReLUでは、入力に対して小さな正の傾きが割り当てられます。x < 0 {\displaystyle x<0} ただし、タスクによってはパフォーマンスが低下する場合があります。
バリエーション
区分的線形変種 Leaky ReLU (2014) は、ユニットが非アクティブなときに小さな正の勾配を許容し、[ 6 ] 勾配消失問題の緩和に役立ちます。この勾配はパラメータによって定義されます。α {\displaystyle \alpha } 通常は0.01~0.3に設定される。[ 25 ] [ 26 ]
f ( x ) = { x x > 0 、 α x x ≤ 0 、 f ′ ( x ) = { 1 x > 0 、 α x ≤ 0. {\displaystyle f(x)={\begin{cases}x&x>0,\\\alpha x&x\leq 0,\end{cases}}\qquad f'(x)={\begin{cases}1&x>0,\\\alpha &x\leq 0.\end{cases}}} 同じ関数は、区分的表記を用いずに次のように表現することもできます。
f ( x ) = 1 + α 2 x + 1 − α 2 | x | {\displaystyle f(x)={\frac {1+\alpha }{2}}x+{\frac {1-\alpha }{2}}|x|} Parametric ReLU (PReLU、2016) は、このアイデアをさらに発展させ、α {\displaystyle \alpha } 他のネットワークパラメータとともに学習可能なパラメータ。[ 27 ]
注意してください。α ≤ 1 {\displaystyle \alpha \leq 1} これは、
f ( x ) = 最大 ( x 、 α x ) {\displaystyle f(x)=\max(x,\alpha x)} したがって、「最大化」ネットワークと関係がある。[ 27 ]
連結ReLU(CReLU、2016)は、 2つの値を返すことで正負の位相情報を保持します。[ 28 ]
f ( x ) = [ ReLU ( x ) 、 ReLU ( − x ) ] 。 {\displaystyle f(x)=[\operatorname {ReLU} (x),\operatorname {ReLU} (-x)].}
滑らかなバリエーション
ソフトプラス ソフトプラス関数とランプ関数のグラフ 整流器の滑らかな近似は解析関数である。
f ( x ) = ln ( 1 + e x ) 、 f ′ ( x ) = e x 1 + e x = 1 1 + e − x {\displaystyle f(x)=\ln(1+e^{x}),\qquad f'(x)={\frac {e^{x}}{1+e^{x}}}={\frac {1}{1+e^{-x}}}} これはソフトプラス (2000)[ 29 ] [ 4 ] またはSmoothReLU関数 [ 30 ] と呼ばれています。大きな負の値の場合x {\displaystyle x} おおよそln 1 {\displaystyle \ln 1} 、0 よりわずかに上、一方、大きな正の値の場合x {\displaystyle x} おおよそln ( e x ) {\displaystyle \ln(e^{x})} ちょうどその上x {\displaystyle x} 。
この関数は次のように近似できます。
ln ( 1 + e x ) ≈ { ln 2 、 x = 0 、 x 1 − e − x / ln 2 、 x ≠ 0 {\displaystyle \ln \left(1+e^{x}\right)\approx {\begin{cases}\ln 2,&x=0,\\[6pt]{\frac {x}{1-e^{-x/\ln 2}}},&x\neq 0\end{cases}}} 変数変換を行うことによりx = y ln ( 2 ) {\displaystyle x=y\ln(2)} これは、
ログ 2 ( 1 + 2 y ) ≈ { 1 、 y = 0 、 y 1 − e − y 、 y ≠ 0 {\displaystyle \log _{2}(1+2^{y})\approx {\begin{cases}1,&y=0,\\[6pt]{\frac {y}{1-e^{-y}}},&y\neq 0\end{cases}}} 鮮明度パラメータk {\displaystyle k} 含まれる可能性があります:
f ( x ) = ln ( 1 + e k x ) k 、 f ′ ( x ) = e k x 1 + e k x = 1 1 + e − k x {\displaystyle f(x)={\frac {\ln(1+e^{kx})}{k}},\qquad f'(x)={\frac {e^{kx}}{1+e^{kx}}}={\frac {1}{1+e^{-kx}}}} ソフトプラスの導関数はロジスティック関数である。これは、整流器の導関数で あるヘヴィサイド階段関数 の滑らかな近似と見なすことができる。
単一変数ソフトプラスの多変数への一般化は、最初の引数をゼロに設定したLogSumExpです。
L S E 0 + ( x 1 、 … 、 x n ) := ロンドン・スクール・オブ・エコノミクス ( 0 、 x 1 、 … 、 x n ) = ln ( 1 + e x 1 + ⋯ + e x n ) {\displaystyle \operatorname {LSE_{0}} ^{+}(x_{1},\dots ,x_{n}):=\operatorname {LSE} (0,x_{1},\dots ,x_{n})=\ln(1+e^{x_{1}}+\cdots +e^{x_{n}})} LogSumExp関数は
ロンドン・スクール・オブ・エコノミクス ( x 1 、 … 、 x n ) = ln ( e x 1 + ⋯ + e x n ) {\displaystyle \operatorname {LSE} (x_{1},\dots ,x_{n})=\ln(e^{x_{1}}+\cdots +e^{x_{n}})} そしてその勾配はソフトマックス関数 です。最初の引数をゼロに設定したソフトマックス関数は、ロジスティック関数の多変数一般化です。LogSumExpとソフトマックス関数はどちらも機械学習で使用されます。
ELU 指数線形ユニット(2015)は負の値をスムーズに許容します。これは平均活性化をゼロに近づけることで学習を高速化しようとする試みです。ELUはReLUよりも高い分類精度が得られることが示されています。[ 31 ]
f ( x ) = { x x > 0 、 α ( e x − 1 ) x ≤ 0 f ′ ( x ) = { 1 x > 0 、 α e x x ≤ 0 {\displaystyle f(x)={\begin{cases}x&x>0,\\\alpha \left(e^{x}-1\right)&x\leq 0\end{cases}}\qquad f'(x)={\begin{cases}1&x>0,\\\alpha e^{x}&x\leq 0\end{cases}}} これらの式では、α {\displaystyle \alpha } 制約条件で調整されるハイパーパラメータ ですα ≥ 0 {\displaystyle \alpha \geq 0} 。
同じ解釈を前提としてα {\displaystyle \alpha } ELUは、シフトReLU(SReLU)の平滑化バージョンと見なすことができ、その形式は次のようになります。f ( x ) = 最大 ( − α 、 x ) {\displaystyle f(x)=\max(-\alpha ,x)} 。
ガウス誤差線形ユニット(GELU)GELU(2016)は整流器の滑らかな近似である。
f ( x ) = x Φ ( x ) = x ⋅ 1 2 [ 1 + erf ( x / 2 ) ] 、 {\displaystyle f(x)=x\Phi (x)=x\cdot {\frac {1}{2}}\left[1+\operatorname {erf} \left(x/{\sqrt {2}}\right)\right],} f ′ ( x ) = x Φ ′ ( x ) + Φ ( x ) {\displaystyle f'(x)=x\Phi '(x)+\Phi (x)} どこΦ ( x ) = P ( X ⩽ x ) {\displaystyle \Phi (x)=P(X\leqslant x)} は標準正規分布の 累積分布関数 であり、erf ( z ) {\displaystyle \operatorname {erf} (z)} は誤差関数 です。
この活性化関数は、この記事の冒頭の図に示されています。x < 0 の左側に負の導関数を持つ「隆起」があります。これは、 BERT などの多くのトランスフォーマーモデルのデフォルトの活性化関数として機能します。[ 32 ]
同じ論文では、GELU のより高速な近似もいくつか紹介されている。最初の近似は、次の近似から導かれる。Φ ( x ) {\displaystyle \Phi (x)} : [ 33 ]
f ( x ) ≈ 1 2 x ( 1 + タン [ 2 / π ( x + 0.044715 x 3 ) ] ) {\displaystyle f(x)\approx {\frac {1}{2}}x\left(1+\tanh \left[{\sqrt {2/\pi }}\left(x+0.044715x^{3}\right)\right]\right)} 2番目の精度の低い近似では、シグモイド(ロジスティック)関数 を次のように使用します。f ( x ) ≈ x ⋅ シグモイド ( 1.702 x ) {\displaystyle f(x)\approx x\cdot \operatorname {sigmoid} (1.702x)} 、その式はSiLUに似ている(下記参照)。[ 32 ]
SiLU スウィッシュ機能 SiLU(シグモイド線形ユニット)またはswish関数 [ 34 ] は、シグモイド(ロジスティック)関数 を使用する別の滑らかな近似であり、2016年のGELU論文[ 32 ]で初めて導入されました。
f ( x ) = x ⋅ シグモイド ( x ) 、 {\displaystyle f(x)=x\cdot \operatorname {sigmoid} (x),} f ′ ( x ) = x ⋅ シグモイド ′ ( x ) + シグモイド ( x ) {\displaystyle f'(x)=x\cdot \operatorname {sigmoid} '(x)+\operatorname {sigmoid} (x)} GELUよりも計算コストが低い。また、「ピーク」がある。
ミッシュ ミッシュ関数(2019)は、整流器の滑らかな近似としても使用できます。[ 34 ] これは次のように定義されます。
f ( x ) = x タン ( ソフトプラス ( x ) ) 、 {\displaystyle f(x)=x\tanh {\big (}\operatorname {softplus} (x){\big )},} どこタン ( x ) {\displaystyle \tanh(x)} は双曲線正接 であり、ソフトプラス ( x ) {\displaystyle \operatorname {softplus} (x)} はソフトプラス 関数です。
Mish は Swish に似た関数 (SiLU、上記参照) を実験して得られたものです。Swish と同様に非単調 (「バンプ」がある) です。主な新しい特徴は、1 階微分に含まれる項に起因する「自己正則化」挙動を示すことです。[ 34 ] [ 35 ]
参考文献 ↑ Brownlee, Jason (2019年1月8日). 「整流線形ユニット (ReLU) の入門」 . Machine Learning Mastery . 2021年 4月8日 取得 。 ↑ Liu, Danqing (2017年11月30日). "ReLUの実践ガイド" . Medium . 2021年 4月8日 取得 . ↑ Ramachandran, Prajit; Barret, Zoph; Quoc, V. Le (2017年10月16日). "活性化関数の探索". arXiv : 1710.05941 [ cs.NE ]. 1 2 3 4 5 Xavier Glorot; Antoine Bordes; Yoshua Bengio (2011). Deep sparse rectifier neural networks (PDF) . AISTATS. Rectifier および softplus 活性化関数。2 番目は、1 番目のスムーズ バージョンです。 ↑ László Tóth (2013). Phone Recognition with Deep Sparse Rectifier Neural Networks (PDF) . ICASSP . 1 2 Andrew L. Maas、Awni Y. Hannun、Andrew Y. Ng (2014)。整流器の非線形性によりニューラルネットワーク音響モデルが改善される。 ↑ Hansel, D.; van Vreeswijk, C. (2002). "How noise contributes to contrast invariance of orientation tuning in cat visual cortex" . J. Neurosci. 22 (12): 5118– 5128. doi : 10.1523/JNEUROSCI.22-12-05118.2002 . PMC 6757721 . PMID 12077207 . ↑ Kadmon, Jonathan; Sompolinsky, Haim (2015-11-19). "ランダムニューラルネットワークにおけるカオスへの遷移". Physical Review X . 5 (4) 041030. arXiv : 1508.06486 . Bibcode : 2015PhRvX...5d1030K . doi : 10.1103/PhysRevX.5.041030 . S2CID 7813832 . ↑ Householder, Alston S. (1941年6月). 「神経線維ネットワークにおける定常状態活動の理論:I. 定義と予備的補題」 . The Bulletin of Mathematical Biophysics . 3 (2): 63–69 . doi : 10.1007/BF02478220 . ISSN 0007-4985 . ↑ 福島、K. (1969). 「アナログ閾値要素の多層ネットワークによる視覚的特徴抽出」. IEEE Transactions on Systems Science and Cybernetics . 5 (4): 322– 333. Bibcode : 1969ITSSC...5..322F . doi : 10.1109/TSSC.1969.300225 . ↑ 福島、三宅、(1982)「ネオコグニトロン:視覚パターン認識機構のための自己組織化ニューラルネットワークモデル」 ニューラル ネットワークにおける競争と協力 。生物数学講義ノート、第45 巻 、 Springer、pp. 267–285。doi : 10.1007 /978-3-642-46466-9_18。ISBN 978-3-540-11574-8 。↑ ウッドベリー、グレッグ。(1998)。 網膜局所性と眼優位性の発達に関する相関モデル (優等学位論文)。シドニー大学。 ↑ Woodbury, G.; van der Zwan, R.; Gibson, WG (2002). "網膜局所マップと眼優位性列の共同発達に関する相関モデル". Vision Research . 42 (19): 2295– 2310. doi : 10.1016/s0042-6989(02)00190-6 . PMID 12220585 . ↑ Woodbury, G. (2004). 網膜局所性と眼優位性の活動依存的発達に関する相関モデル (博士論文)。シドニー大学。 ↑ Hahnloser, R.; Sarpeshkar, R.; Mahowald, MA; Douglas, RJ; Seung, HS (2000). "Digital selection and analogue amplification coexist in a cortex-inspired silicon circuit". Nature . 405 (6789): 947– 951. Bibcode : 2000Natur.405..947H . doi : 10.1038/35016072 . PMID 10879535 . S2CID 4399014 . ↑ Hahnloser, Richard; Seung, H. Sebastian (2000). "対称閾値線形ネットワークにおける許可セットと禁止セット" . Advances in Neural Information Processing Systems . 13 . MIT Press. ↑ Yann LeCun ; Leon Bottou ; Genevieve B. Orr; Klaus-Robert Müller (1998). "Efficient BackProp" (PDF) . In G. Orr; K. Müller (eds.). Neural Networks: Tricks of the Trade . Springer. 2018-08-31 の オリジナル (PDF)からアーカイブ済み。2012-12-07 に 取得 。 ↑ Jarrett, Kevin; Kavukcuoglu, Koray; Ranzato, Marc'Aurelio; LeCun, Yann ( 2009年9月)「物体認識に最適な多段階アーキテクチャとは何か?」 2009 IEEE 第12 回 国際コンピュータビジョン会議 。pp . 2146–2153。doi : 10.1109/ICCV.2009.5459469。ISBN 978-1-4244-4420-5 。1 2 Nair, Vinod、および Geoffrey E. Hinton。「整流線形ユニットは制限付きボルツマンマシンを改善する」。第 27 回国際機械学習会議 (ICML-10) 議事録 。2010 年。 ↑ Vaswani, A. (2017). "Attention Is All You Need". Advances in Neural Information Processing Systems . 30 . ↑ Brown, T. (2020). "言語モデルは少数ショット学習器である". Advances in Neural Information Processing Systems . 33 . ↑ テクノロジーイノベーション研究所(2023)。「Falcon 180B:世界最高性能のオープンAIモデル」。TII テクニカルレポート 。 ↑ OpenAI (2023). "GPT-4 技術レポート". arXiv : 2303.08774 [ cs.CL ]. ↑ Meta AI (2024). 「Meta Llama 3 の紹介:現在までに最も高性能なオープン利用可能な LLM」。 ↑ 「PyTorch Leaky ReLU ドキュメント」 。 ↑ 「TensorFlow Leaky ReLU ドキュメント」 。 1 2 He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2015). "Delving Deep into Rectifiers: Surpassing Human-Level Performance on Image Net Classification". arXiv : 1502.01852 [ cs.CV ]. ↑ Shang, Wenling; Sohn, Kihyuk; Almeida, Diogo; Lee, Honglak (2016-06-11). "Understanding and Improving Convolutional Neural Networks via Concatenated Rectified Linear Units" . Proceedings of the 33rd International Conference on Machine Learning . PMLR: 2217–2225 . arXiv : 1603.05201 . ↑ Dugas, Charles; Bengio, Yoshua; Bélisle, François; Nadeau, Claude; Garcia, René (2000-01-01). "Incorporating second-order functional knowledge for better option pricing" (PDF) . Proceedings of the 13th International Conference on Neural Information Processing Systems (NIPS'00) . MIT Press: 451– 457. シグモイド h は正の一次導関数を持つため、その原始関数 (softplus と呼ぶ) は凸関数である。 ↑ 「Smooth Rectifier Linear Unit (SmoothReLU) Forward Layer」 。Intel Data Analytics Acceleration Library の開発者ガイド 。2017 年。2018 年 12 月 4 日 に取得 。 ↑ クレベール、ジョルク=アルネ。ウンターティナー、トーマス。ホッホライター、ゼップ (2015)。 「指数線形ユニット (ELU) による高速かつ正確なディープ ネットワーク学習」。 arXiv : 1511.07289 [ cs.LG ]。 1 2 3 Hendrycks, Dan; Gimpel, Kevin (2016). "ガウス誤差線形ユニット (GELU)". arXiv : 1606.08415 [ cs.LG ]. ↑ Page, E. (1977). "ポケット電卓で使用するための累積正規関数とその逆関数の近似値". Journal of the Royal Statistical Society. Series C (Applied Statistics) . 26 (1): 75– 76. doi : 10.2307/2346872 . JSTOR 2346872 . 1 2 3 Diganta Misra (2019 年 8 月 23 日)、 Mish: A Self Regularized Non-Monotonic Activation Function (PDF) 、 arXiv : 1908.08681v1、2022 年 3 月 26 日 取得 。↑ Shaw, Sweta (2020-05-10). "活性化関数と実験の比較" . W&B . 2022-07-11 に取得. ↑ Barron, Jonathan T. (2021年12月22日). "Squareplus: Softplusに似た代数的整流器". arXiv : 2112.11687 [ cs.NE ]. ↑ Çatalbaş, Burak; Morgül, Ömer (2023年8月16日). "Deep learning with Extended Exponential Linear Unit (DELU)" . Neural Computing and Applications . 35 (30): 22705– 22724. doi : 10.1007/s00521-023-08932-z . 2025年 4月20日 取得 .