深層残差ネットワークにおける残差ブロック。ここでは、残差接続が2層をスキップしている。 残差ニューラルネットワーク( 残差ネットワーク またはResNet とも呼ばれる)[ 1 ] は、層が層入力を参照しながら残差関数を学習する深層学習 アーキテクチャです。これは2015年に画像認識 用に開発され、その年のImageNet 大規模視覚認識チャレンジ(ILSVRC )で優勝しました。 [ 2 ] [ 3 ]
用語上の点として、「残存接続」とは、特定の建築モチーフを指します。x ↦ f ( x ) + x {\displaystyle x\mapsto f(x)+x} 、 どこf {\displaystyle f} これは任意のニューラルネットワークモジュールです。このモチーフは以前にも使用されていました(詳細は§履歴 を参照)。しかし、ResNetの発表により、フィードフォワードネットワーク で広く普及し、ResNetとは一見無関係なニューラルネットワークにも登場するようになりました。
残差接続は、数百層からなる深層ニューラルネットワークの学習と収束を安定させるものであり、トランスフォーマー モデル(BERT やChatGPTなどの GPT モデル)、AlphaGo Zero システム、AlphaStar システム、AlphaFold システムなどの深層ニューラルネットワークにおける共通のモチーフである。
数学
信号伝搬 アイデンティティマッピングの導入により、順方向および逆方向の両方の経路での信号伝搬が促進される。[ 6 ]
順伝播 出力がℓ {\displaystyle \ell } 第 1 番目の残差ブロックは、( ℓ + 1 ) {\displaystyle (\ell +1)} 番目の残差ブロック(ブロック間に活性化関数がないと仮定)の場合、( ℓ + 1 ) {\displaystyle (\ell +1)} -番目の入力は次のとおりです。
x ℓ + 1 = F ( x ℓ ) + x ℓ {\displaystyle x_{\ell +1}=F(x_{\ell })+x_{\ell }}
この定式化を再帰的に適用すると、例えば次のようになります。
x ℓ + 2 = F ( x ℓ + 1 ) + x ℓ + 1 = F ( x ℓ + 1 ) + F ( x ℓ ) + x ℓ {\displaystyle {\begin{aligned}x_{\ell +2}&=F(x_{\ell +1})+x_{\ell +1}\\&=F(x_{\ell +1})+F(x_{\ell })+x_{\ell }\end{aligned}}}
一般的な関係式が得られる。
x L = x ℓ + ∑ 私 = ℓ L − 1 F ( x 私 ) {\displaystyle x_{L}=x_{\ell }+\sum _{i=\ell }^{L-1}F(x_{i})}
どこL {\textstyle L} は残余ブロックのインデックスであり、ℓ {\textstyle \ell } これは、より前のブロックのインデックスです。この定式化は、常に浅いブロックから直接送信される信号が存在することを示唆しています。ℓ {\textstyle \ell } より深いブロックへL {\textstyle L} 。
残余ブロックの変種 畳み込み残差ブロックの 2 つのバリアント。[ 1 ] 左 : 2 つの 3x3 畳み込み層を持つ基本ブロック。 右 :次元削減用の 1x1 畳み込み層、3x3 畳み込み層、および次元復元用のもう 1x1 畳み込み層を持つボトルネック ブロック 。
基本ブロック 基本ブロックは 、オリジナルの ResNet で研究された最も単純な構成要素です。[ 1 ] このブロックは、2 つの連続した 3x3畳み込み 層と残差接続で構成されています。両方の層の入力次元と出力次元は同じです。
ResNetのブロック図(2015年)。1x1畳み込みありとなしのResNetブロックを示しています。1x1畳み込み(ストライド付き)は、配列の形状を変更するために使用でき、これはアップサンプリング/ダウンサンプリング層を介した残差接続に必要です。
ボトルネックブロック ボトルネックブロック [ 1 ] は、3つの連続した畳み込み層と残差接続から構成されます。このブロックの最初の層は、次元削減(例えば、入力次元の1/2まで)のための1×1畳み込みです。2番目の層は3×3畳み込みを実行し、最後の層は次元復元のための別の1×1畳み込みです。ResNet-50、ResNet-101、およびResNet-152のモデルはすべてボトルネックブロックに基づいています。[ 1 ]
事前活性化ブロック 事前活性化残差ブロック [ 6 ] は、残差関数を適用する前に活性化関数を適用する。F {\displaystyle F} 形式的には、事前活性化残余ブロックの計算は次のように記述できます。
x ℓ + 1 = F ( ϕ ( x ℓ ) ) + x ℓ {\displaystyle x_{\ell +1}=F(\phi (x_{\ell }))+x_{\ell }}
どこϕ {\displaystyle \phi } は、任意の活性化(ReLU など)または正規化(LayerNorm など)演算にすることができます。この設計により、残差ブロック間の非恒等写像の数が減少し、入力から出力への恒等写像が直接可能になります。この設計は、200層から1000層を超えるモデルのトレーニングに使用され、残差パスが恒等関数ではないバリアントよりも一貫して優れたパフォーマンスを発揮することがわかりました。200層の事前活性化ResNetは、2016年に8つのGPU でImageNetのトレーニングに3週間かかりました。 [ 6 ]
GPT-2 以降、トランスフォーマー ブロックは主に事前活性化ブロックとして実装されてきました。これは、トランスフォーマーモデルの文献では「事前正規化」と呼ばれることがよくあります。[ 7 ]
オリジナルのResNet-18アーキテクチャ。オリジナルの論文では最大152層までトレーニングされました(「ResNet-152」として)。[ 8 ]
アプリケーション ResNetは元々コンピュータビジョン 用に設計されたものです。[ 1 ] [ 8 ] [ 9 ]
Transformerアーキテクチャには、残留接続が含まれています。 すべてのトランスフォーマーアーキテクチャには残余接続が含まれています。実際、非常に深いトランスフォーマーは残余接続なしでは学習できません。[ 10 ]
ResNetの元の論文では、生物システムに触発されたとは主張されていませんでした。しかし、その後の研究では、ResNetは生物学的に妥当なアルゴリズムと関連付けられています。[ 11 ] [ 12 ]
2023年にScience誌 に掲載された研究[ 13 ] では、昆虫の脳(具体的にはショウジョウバエの幼虫)の完全なコネクトーム が明らかにされました。この研究では、ResNetを含む人工ニューラルネットワークのスキップ接続に似た「多層ショートカット」が発見されました。
歴史
過去の作品 残存接続は、ロレンテ・デ・ノ (1938)などの神経解剖学において注目された。 [ 14 ] : 図3 マカロック とピッツ (1943)は人工ニューラルネットワークを提案し、残存接続を持つものを検討した。[ 15 ] : 図1.h
1961年、フランク・ローゼンブラットは スキップ接続を備えた3層多層パーセプトロン (MLP)モデルについて説明した。[ 16 ] : 313、 第15章 このモデルは「クロスカップリングシステム」と呼ばれ、スキップ接続はクロスカップリング接続の一種であった。
1980年代後半には、ニューラルネットワークで「スキップレイヤー」接続が使用されることがありました。例としては、[ 17 ] [ 18 ] LangとWitbrock(1988)[ 19 ] は、後のDenseNet(2016)のように、各レイヤーが後続のすべてのレイヤーにスキップ接続する全結合フィードフォワードネットワークを訓練しました。この研究では、残差接続は次の形式でした。x ↦ F ( x ) + P ( x ) {\displaystyle x\mapsto F(x)+P(x)} 、 どこP {\displaystyle P} これはランダムに初期化された投影接続です。彼らはこれを「ショートカット接続」と呼びました。初期のニューラル言語モデルは残差接続を使用し、それを「直接接続」と名付けました。[ 20 ]
長短期記憶(LSTM)セルはデータを順次処理し、隠れ状態を時間経過とともに保持することができます。c t {\displaystyle c_{t}} 一般化された残余結合として機能することができる。
その後の研究 Wide Residual Network (2016) は、元の ResNet よりもチャネル数を増やし、レイヤー数を減らすことでパフォーマンスと GPU 計算効率が向上すること、また 2 つの 3×3 畳み込みブロックが他の畳み込みブロック構成よりも優れていることを発見した。[ 28 ]
DenseNet (2016) [ 29 ] は、各層の出力を次の各層への入力に接続します。
x ℓ + 1 = F ( x 1 、 x 2 、 … 、 x ℓ − 1 、 x ℓ ) {\displaystyle x_{\ell +1}=F(x_{1},x_{2},\dots ,x_{\ell -1},x_{\ell })}
確率的深度 [ 30 ] は、層の一部をランダムにドロップし、恒等スキップ接続を介して信号を伝播させる正則化 手法です。DropPathとしても知られるこの手法は、 ビジョントランスフォーマー などの深層モデルのトレーニングを正則化します。[ 31 ]
ResNeXtのブロック図 ResNeXt (2017) はInception モジュール と ResNet を組み合わせたものです。[ 32 ] [ 8 ]
Squeeze-and-Excitation Networks (2018) は ResNet に squeeze-and-excitation (SE) モジュールを追加しました。[ 33 ] SE モジュールは畳み込みの後に適用され、形状のテンソルを受け取ります。R H × W × C {\displaystyle \mathbb {R} ^{H\times W\times C}} (高さ、幅、チャンネル)を入力として受け取ります。各チャンネルの平均化を行い、形状のベクトルを生成します。R C {\displaystyle \mathbb {R} ^{C}} これは、元のテンソルと乗算される前に、多層パーセプトロン( 線形-ReLU-線形-シグモイド などのアーキテクチャを持つ)を通過します。これは2017年のILSVRCで優勝しました。 [ 34 ]
参考文献 1 2 3 4 5 6 7 8 9 He, Kaiming ; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). Deep Residual Learning for Image Recognition (PDF) . Conference on Computer Vision and Pattern Recognition . arXiv : 1512.03385 . doi : 10.1109/CVPR.2016.90 .↑ "ILSVRC2015 結果" . image-net.org . ↑ 鄧、賈;ドン、ウェイ。ソーチャー、リチャード。リー、リージア。リー、カイ。 リー・フェイフェイ (2009)。 ImageNet: 大規模な階層型画像データベース 。 コンピュータビジョンとパターン認識に関するカンファレンス 。 土井 : 10.1109/CVPR.2009.5206848 。 1 2 ゼップ・ホッホライター ; ユルゲン・シュミットフーバー (1997)。 「長短期記憶」 。 ニューラル計算 。 9 (8): 1735 ~ 1780 年。 土井 : 10.1162/neco.1997.9.8.1735 。 PMID 9377276 。 S2CID 1915014 。 ↑ Hanin, Boris; Rolnick, David (2018). How to Start Training: The Effect of Initialization and Architecture (PDF) . Conference on Neural Information Processing Systems . Vol. 31. Curran Associates, Inc. arXiv : 1803.01719 . 1 2 3 4 5 彼、カイミン ;張項宇。仁、少慶。サン、ジアン(2016)。 Deep Residual Networks における ID マッピング (PDF) 。 コンピュータビジョンに関する欧州会議 。 arXiv : 1603.05027 。 土井 : 10.1007/978-3-319-46493-0_38 。 ↑ Radford, Alec; Wu, Jeffrey; Child, Rewon; Luan, David; Amodei, Dario; Sutskever, Ilya (2019年2月14日). "言語モデルは教師なしマルチタスク学習器である" (PDF) 。 2021年2月6日のオリジナルから アーカイブ済み (PDF) 。 2020年 12月19日 取得 。 1 2 3 Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "8.6. Residual Networks (ResNet) and ResNeXt" . Dive into deep learning . Cambridge New York Port Melbourne New Delhi Singapore: Cambridge University Press. ISBN 978-1-009-38943-3 。↑ Szegedy, Christian; Ioffe, Sergey; Vanhoucke, Vincent; Alemi, Alex (2017). Inception-v4、Inception-ResNet、および残差接続が学習に与える影響 (PDF) . AAAI 人工知能会議 . arXiv : 1602.07261 . doi : 10.1609/aaai.v31i1.11231 . ↑ Dong, Yihe; Cordonnier, Jean-Baptiste; Loukas, Andreas (2021). Attention is not all you need: pure attention loses rank doubly exponentially with depth (PDF) . International Conference on Machine Learning . PMLR. pp. 2793– 2803. arXiv : 2103.03404 . ↑ Liao, Qianli; Poggio, Tomaso (2016). "残差学習、リカレントニューラルネットワーク、視覚皮質間のギャップを埋める". arXiv : 1604.03640 [ cs.LG ]. ↑ Xiao, Will; Chen, Honglin; Liao, Qianli; Poggio, Tomaso (2019). 生物学的に妥当な学習アルゴリズムは大規模データセットに拡張可能 。 国際学習表現 会議 。arXiv : 1811.03567 。 ↑ Winding, Michael; Pedigo, Benjamin; Barnes, Christopher; Patsolic, Heather; Park, Youngser; Kazimiers, Tom; Fushiki, Akira; Andrade, Ingrid; Khandelwal, Avinash; Valdes-Aleman, Javier; Li, Feng; Randel, Nadine; Barsotti, Elizabeth; Correia, Ana; Fetter, Fetter; Hartenstein, Volker; Priebe, Carey; Vogelstein, Joshua; Cardona, Albert ; Zlatic, Marta (2023年3月10日). "昆虫の脳のコネクトーム" . Science . 379 (6636) eadd9330. bioRxiv 10.1101/2022.11.28.516756v1 . doi : 10.1126/science.add9330 . PMC 7614541 . PMID 36893230 . S2CID 254070919 . ↑ De N, Rafael Lorente (1938-05-01). "介在ニューロン連鎖の活動の分析" . Journal of Neurophysiology . 1 (3): 207– 244. doi : 10.1152/jn.1938.1.3.207 . ISSN 0022-3077 . ↑ McCulloch, Warren S.; Pitts, Walter (1943-12-01). "神経活動に内在する概念の論理的計算" . The Bulletin of Mathematical Biophysics . 5 (4): 115– 133. doi : 10.1007/BF02478259 . ISSN 1522-9602 . ↑ ローゼンブラット、フランク (1961)。 神経力学の原理。パーセプトロンと脳メカニズムの理論 (PDF) 。 ↑ Rumelhart, David E.、Geoffrey E. Hinton、および Ronald J. Williams。「誤差伝播による内部表現の学習」、並列分散処理 、第 1 巻、1986 年。 ↑ Venables, WN; Ripley, Brain D. (1994). Modern Applied Statistics with S-Plus . Springer. pp. 261–262 . ISBN 978-3-540-94350-1 。↑ Lang, Kevin; Witbrock, Michael (1988). 「2つの螺旋を見分ける方法を学ぶ」 (PDF) . 1988年コネクショニストモデルサマースクール議事録 : 52–59 . ↑ Bengio, Yoshua ; Ducharme, Réjean; Vincent, Pascal; Jauvin, Christian (2003). "A Neural Probabilistic Language Model" . Journal of Machine Learning Research . 3 (Feb): 1137–1155 . ISSN 1533-7928 . ↑ ゼップ・ホッホライター (1991)。 Untersuhungen zu dynamischen neuronalen Netzen (PDF) (卒業論文)。 ミュンヘン工科大学 、コンピューターサイエンス研究所、顧問: J. Schmidhuber。 ↑ Felix A. Gers; Jürgen Schmidhuber; Fred Cummins (2000). "Learning to Forget: Continual Prediction with LSTM". Neural Computation . 12 ( 10): 2451–2471 . CiteSeerX 10.1.1.55.5709 . doi : 10.1162/089976600300015015 . PMID 11032042. S2CID 11598600 . ↑ スリヴァスタヴァ、ルペシュ・クマール。グレフ、クラウス。シュミットフーバー、ユルゲン(2015年5月3日)。 「ハイウェイネットワーク」。 arXiv : 1505.00387 [ cs.LG ]。 ↑ Srivastava, Rupesh Kumar; Greff, Klaus; Schmidhuber, Jürgen (2015). 非常に深いネットワークのトレーニング (PDF) . ニューラル情報処理システムに関する会議 . arXiv : 1507.06228 . 1 2 Simonyan, Karen; Zisserman, Andrew (2015-04-10). "大規模画像認識のための非常に深い畳み込みネットワーク". arXiv : 1409.1556 [ cs.CV ]. ↑ He, Kaiming ; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2015). Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification (PDF) . International Conference on Computer Vision . arXiv : 1502.01852 . doi : 10.1109/ICCV.2015.123 . ↑ Linn, Allison (2015-12-10). "Microsoftの研究者がImageNetコンピュータビジョンチャレンジで優勝" . The AI Blog . 2018-01-29の オリジナルからアーカイブ済み . 2024-06-29 に取得. ↑ Zagoruyko, Sergey; Komodakis, Nikos (2016-05-23). "Wide Residual Networks". arXiv : 1605.07146 [ cs.CV ]. ↑ Huang, Gao; Liu, Zhuang; van der Maaten, Laurens; Weinberger, Kilian (2017). Densely Connected Convolutional Networks (PDF) . Conference on Computer Vision and Pattern Recognition . arXiv : 1608.06993 . doi : 10.1109/CVPR.2017.243 . ↑ Huang, Gao; Sun, Yu; Liu, Zhuang; Weinberger, Kilian (2016). Deep Networks with Stochastic Depth (PDF) . European Conference on Computer Vision . arXiv : 1603.09382 . doi : 10.1007/978-3-319-46493-0_39 . ↑ Lee, Youngwan; Kim, Jonghee; Willette, Jeffrey; Hwang, Sung Ju (2022). MPViT: Multi-Path Vision Transformer for Dense Prediction (PDF) . Conference on Computer Vision and Pattern Recognition . pp. 7287– 7296. arXiv : 2112.11010 . doi : 10.1109/CVPR52688.2022.00714 . ↑ Xie, Saining; Girshick, Ross; Dollar, Piotr; Tu, Zhuowen; He, Kaiming (2017). Aggregated Residual Transformations for Deep Neural Networks (PDF) . Conference on Computer Vision and Pattern Recognition . pp. 1492– 1500. arXiv : 1611.05431 . doi : 10.1109/CVPR.2017.634 . ↑ Hu, Jie; Shen, Li; Sun, Gang (2018). Squeeze-and-Excitation Networks (PDF) . Conference on Computer Vision and Pattern Recognition . pp. 7132– 7141. arXiv : 1709.01507 . doi : 10.1109/CVPR.2018.00745 . ↑ Jie, Hu (2017). Squeeze-and-Excitation Networks (PDF) . Beyond ImageNet Large Scale Visual Recognition Challenge、CVPR 2017 ワークショップ (プレゼンテーション)。