Inception [ 1 ]は、コンピュータビジョン用の畳み込みニューラルネットワーク(CNN)のファミリーであり、2014 年に Google の研究者によって GoogLeNet (後に Inception v1 に改名) として発表されました。このシリーズは、ステム (データ取り込み)、ボディ (データ処理)、ヘッド (予測) を分離した初期の CNN として歴史的に重要であり、このアーキテクチャ設計はすべての現代の CNN に引き継がれています。[ 2 ]


2014年、GoogleのチームがGoogLeNetアーキテクチャを開発し、そのインスタンスがImageNet大規模視覚認識チャレンジ2014(ILSVRC14)で優勝した。[ 1 ] [ 3 ]
その名前は、LeNetとGoogLeNetの両方がCNNであることから、1998年のLeNetに由来しています。また、映画『インセプション』(2010年)のセリフである「もっと深く掘り下げる必要がある」というインターネットミームにちなんで「Inception」とも呼ばれています。 [ 1 ]その後、さらに多くのバージョンがリリースされたため、オリジナルのInceptionアーキテクチャは再び「Inception v1」と改名されました。
モデルとコードはGitHub上でApache 2.0ライセンスの下で公開されている。[ 4 ]


Inception v1 アーキテクチャは、22 層で構成されたディープ CNN です。これらの層のほとんどは「Inception モジュール」でした。元の論文では、Inception モジュールはNetwork in Network [ 5 ]および (Arora et al, 2014) [ 6 ]の「論理的な集大成」であると述べられています。
Inception v1はディープネットワークであるため、勾配消失問題に悩まされていました。チームは、ネットワークの深さ1/3と2/3の位置に2つの「補助分類器」、すなわち線形ソフトマックス分類器を挿入することでこの問題を解決し、損失関数はこれら3つの分類器の重み付き和としました。
これらはトレーニング完了後に削除されました。この問題は後にResNetアーキテクチャによって解決されました。
このアーキテクチャは、互いに積み重ねられた3つの部分で構成されています。[ 2 ]
この構造は、最新のCNNアーキテクチャのほとんどで使用されています。
Inception v2は2015年に発表され、バッチ正規化を提案したことでより有名になった論文で発表された。[ 7 ] [ 8 ]パラメータ数は1360万個だった。
Inception v1を改良し、バッチ正規化を追加し、バッチ正規化を使用すると不要になることが判明したドロップアウトとローカル応答正規化を削除しました。
Inception v3は2016年にリリースされました。[ 7 ] [ 9 ]ファクタリング畳み込みを使用することでInception v2を改良しています。
例えば、単一の 5×5 畳み込みは、3×3 の上に別の 3×3 を積み重ねたものに因数分解できます。どちらも受容野のサイズは 5×5 です。5×5 畳み込みカーネルには 25 個のパラメータがありますが、因数分解バージョンではわずか 18 個です。したがって、5×5 畳み込みは因数分解バージョンよりも明らかに強力です。しかし、この強力さは必ずしも必要ではありません。経験的に、研究チームは因数分解畳み込みが役立つことを発見しました。
また、畳み込み層とプーリング層の出力を連結することで次元削減の一種も利用しています。例として、サイズのテンソルストライド2の畳み込みにより縮小できます、プールサイズによる最大プーリングによってにこれらは連結されて。
これ以外にも、トレーニング中に最も低い補助分類器を削除しました。彼らは、補助ヘッドが一種の正則化として機能することを発見しました。
彼らは分類におけるラベル平滑化正則化も提案した。ラベル付き画像の場合確率分布を予測するモデルを作成する代わりに彼らはモデルを使って平滑化された分布を予測した。どこはクラスの総数です。
2017年に、チームはInception v4、Inception ResNet v1、およびInception ResNet v2をリリースした。[ 10 ]
Inception v4は、さらに多くの因数分解畳み込みと、ベンチマークを向上させることが経験的に判明したその他の複雑な処理を追加した、段階的なアップデートです。
Inception ResNet v1とv2はどちらもInception v4の改良版で、ResNetアーキテクチャに触発されて各Inceptionモジュールに残余接続が追加されています。[ 11 ]
Xception(「エクストリーム・インセプション」)は2017年に発表されました。[ 12 ]これは、残差接続を備えた深層分離畳み込み層の線形スタックです。この設計は、CNNでは特徴マップ内のクロスチャネル相関と空間相関を完全に分離できるという仮説に基づいて提案されました。
各ネットワークのトレーニングには、60個のK80 GPUで3日間かかり、約0.5ペタフロップ日でした。[ 13 ]