
VGGNetsは、オックスフォード大学のビジュアルジオメトリグループ(VGG)によって開発された一連の畳み込みニューラルネットワーク(CNN)です。
VGGファミリーには、さまざまな深さの構成があり、「VGG」という文字に重み層の数が続く形で表されます。最も一般的なものは、VGG-16(13個の畳み込み層 + 3個の全結合層、1億3800万個のパラメータ)とVGG-19(16 + 3、1億4400万個のパラメータ)です。[ 1 ]
VGGファミリーは、さまざまなコンピュータビジョン分野で広く応用されています。[ 2 ] VGGNetのアンサンブルモデルは、 2014年のImageNet大規模視覚認識チャレンジ(ILSVRC)で最先端の結果を達成しました。[ 1 ] [ 3 ]画像分類のResNet論文ではベースライン比較として使用され、[ 4 ]物体検出のFast Region-based CNNのネットワークとして、またニューラルスタイル転送のベースネットワークとして使用されました。[ 5 ]
このシリーズは、汎用モジュールを組み合わせて設計された初期の影響力のあるモデルとして歴史的に重要であり、一方AlexNet(2012)は「ゼロから」設計された。また、CNNの標準的な畳み込みカーネルを大きなもの(AlexNetでは最大11×11)からわずか3×3に変更する上で重要な役割を果たし、この決定はConvNext(2022)でようやく修正された。[ 6 ] [ 7 ]
VGGNetはInception、ResNet、DenseNetによって時代遅れになった。RepVGG(2021)は、そのアーキテクチャの更新版である。[ 8 ]

VGGモデルの主要なアーキテクチャ原則は、小さなネットワーク全体に畳み込みフィルタが使用されています。これは、以前のCNNアーキテクチャが使用していた、より大きなフィルタ(例:AlexNetにおいて。[ 7 ]
例えば、2つ畳み込みを重ねると、単一の畳み込みと同じ受容野ピクセルになります畳み込みだが、後者は前者はパラメータを使用するが、後者はパラメータ(はチャネル数です。元の論文では、ディープで狭いCNNは、浅くて広いCNNに比べて大幅に優れていることが示されました。[ 7 ]
VGGシリーズのモデルは、汎用モジュールで構成された深層ニューラルネットワークです。
VGGファミリーには、さまざまな深さの構成があり、文字「VGG」に重み層の数が続く形で表されます。最も一般的なのは、VGG-16(13個の畳み込み層 + 3個の全結合層)とVGG-19(16 + 3)で、元の論文では構成DとEとして示されています。[ 10 ]
例えば、VGG-19の16個の畳み込み層は、以下のように構成されています。矢印が3x3畳み込みを意味します入力チャネルと出力チャネルとストライド1、続いてReLU活性化。これは、ストライド2の2x2最大プーリングによるダウンサンプリング層を意味します。
オリジナルのVGGモデルは、マルチGPUトレーニングとデータ並列処理による評価用に修正されたC++ Caffeのバージョンで実装されました。4つのNVIDIA Titan Black GPUを搭載したシステムでは、単一のネットワークのトレーニングにはアーキテクチャに応じて2~3週間かかりました。[ 1 ]