畳み込みニューラルネットワーク(CNN)は、フィルタ(またはカーネル)最適化によって特徴を自ら学習する、正規化されたタイプのフィードフォワードニューラルネットワークです。このタイプのディープラーニングネットワークは、テキスト、画像、音声など、さまざまな種類のデータを処理して予測を行うために適用されています。[1]畳み込みベースのネットワークは、コンピュータービジョンと画像処理に対するディープラーニングベースのアプローチの事実上の標準であり、ごく最近になって、トランスフォーマーなどの新しいディープラーニングアーキテクチャに置き換えられました。初期のニューラルネットワークでバックプロパゲーション中に見られた勾配消失と勾配爆発は、より少ない接続で正規化された重みを使用することで防止されます。[2] [3]たとえば、完全結合層の各ニューロンでは、100 × 100ピクセルのサイズの画像を処理するために10,000の重みが必要になります。しかし、カスケード畳み込み(または相互相関)カーネルを適用すると、[4] [5] 5x5サイズのタイルを処理するのに必要なニューロンは25個だけです。[6] [7]上位層の特徴は、下位層の特徴と比較して、より広いコンテキストウィンドウから抽出されます。
CNN の用途には次のようなものがあります。
- 画像・動画認識、[8]
- 推薦システム、[9]
- 画像分類、
- 画像セグメンテーション、
- 医療画像解析、
- 自然言語処理、[10]
- 脳コンピュータインターフェース[ 11]および
- 金融時系列[12 ]
CNNはシフト不変または空間不変の人工ニューラルネットワークとしても知られ、入力特徴に沿ってスライドし、特徴マップと呼ばれる平行移動と等価な応答を提供する畳み込みカーネルまたはフィルタの共有重みアーキテクチャに基づいています。 [13] [14]直感に反しますが、ほとんどの畳み込みニューラルネットワークは、入力に適用するダウンサンプリング操作のため、平行移動に対して不変ではありません。 [15]
フィードフォワードニューラルネットワークは通常、完全に接続されたネットワークです。つまり、1つの層の各ニューロンは次の層のすべてのニューロンに接続されています。これらのネットワークの「完全な接続」により、データの過剰適合が発生しやすくなります。正規化、つまり過剰適合を防ぐ一般的な方法には、トレーニング中にパラメータにペナルティを課す(重みの減衰など)または接続をトリミングする(スキップされた接続、ドロップアウトなど)などがあります。堅牢なデータセットは、CNNが、人口の少ないセットのバイアスではなく、特定のデータセットを特徴付ける一般化された原則を学習する可能性を高めます。[16]
畳み込みネットワークは、ニューロン間の接続パターンが動物の視覚皮質の構成に似ているという点で、生物学的プロセス[17] [18] [19] [20]にヒントを得ています。個々の皮質ニューロンは、受容野と呼ばれる視野の限られた領域でのみ刺激に反応します。異なるニューロンの受容野は部分的に重なり合って、視野全体をカバーします。
CNN は、他の画像分類アルゴリズムと比較して、比較的少ない前処理を使用します。つまり、ネットワークは自動学習を通じてフィルター(またはカーネル) を最適化することを学習しますが、従来のアルゴリズムではこれらのフィルターは手動で設計されます。特徴抽出における事前の知識や人間の介入に依存しないという点は、大きな利点です。[誰にとって? ]
建築

(AlexNet の画像サイズは 224×224×3 ではなく 227×227×3 であるべきで、そうすれば計算は正しくなります。元の論文では異なる数値が述べられていましたが、Tesla のコンピューター ビジョンの責任者である Andrej Karpathy 氏は、227×227×3 であるべきだと述べています (彼によると、Alex は 224×224×3 にした理由を説明していないとのことです)。次の畳み込みは、ストライド 4 で 11×11 であるべきで、55×55×96 (54×54×96 ではなく) です。これは、たとえば次のように計算されます: [(入力幅 227 - カーネル幅 11) / ストライド 4] + 1 = [(227 - 11) / 4] + 1 = 55。カーネル出力は幅と同じ長さなので、その面積は 55×55 です。)
畳み込みニューラルネットワークは、入力層、隠れ層、出力層から構成されます。畳み込みニューラルネットワークでは、隠れ層には畳み込みを実行する 1 つ以上の層が含まれます。通常、これには畳み込みカーネルと層の入力行列のドット積を実行する層が含まれます。この積は通常フロベニウスの内積であり、その活性化関数はReLU であるのが一般的です。畳み込みカーネルが層の入力行列に沿って移動すると、畳み込み演算によって特徴マップが生成され、それが次の層の入力に寄与します。その後に、プーリング層、完全結合層、正規化層などの他の層が続きます。ここで注目すべきは、畳み込みニューラルネットワークがマッチドフィルタにどれほど近いかということです。[21]
畳み込み層
CNN では、入力は次の形状のテンソルです。
(入力数) × (入力高さ) × (入力幅) × (入力チャンネル)
畳み込み層を通過すると、画像は次の形状の特徴マップ(アクティベーション マップとも呼ばれます)に抽象化されます。
(入力数) × (特徴マップの高さ) × (特徴マップの幅) × (特徴マップのチャンネル数)。
畳み込み層は入力を畳み込み、その結果を次の層に渡します。これは視覚野のニューロンが特定の刺激に反応するのと似ています。[22]各畳み込みニューロンは、その受容野のデータのみを処理します。

完全に接続されたフィードフォワードニューラルネットワークは特徴を学習し、データを分類するために使用できますが、このアーキテクチャは一般に、各ピクセルが関連する入力特徴であるため、膨大な数のニューロンを必要とする大きな入力(高解像度画像など)には実用的ではありません。サイズが 100 × 100 の画像の完全に接続された層では、2 番目の層の各ニューロンに 10,000 の重みがあります。畳み込みにより、自由パラメータの数が減り、ネットワークをより深くすることができます。[6]たとえば、それぞれが同じ共有重みを持つ 5 × 5 のタイリング領域を使用する場合、必要なニューロンは 25 個だけです。より少ないパラメータで正規化された重みを使用すると、以前のニューラルネットワークでのバックプロパゲーション中に見られる勾配消失と勾配爆発の問題を回避できます。[2] [3]
処理速度を上げるために、標準的な畳み込み層を深さ方向に分離可能な畳み込み層[23]に置き換えることができます。深さ方向の畳み込みとそれに続く点方向の畳み込みに基づいています。深さ方向の畳み込みは、入力テンソルの各チャネルに独立して適用される空間畳み込みですが、点方向の畳み込みはカーネル の使用に制限された標準的な畳み込みです。
プーリング層
畳み込みネットワークには、従来の畳み込み層に加えて、ローカル プーリング層やグローバル プーリング層が含まれる場合があります。プーリング層は、ある層のニューロン クラスターの出力を次の層の 1 つのニューロンに結合することで、データの次元を削減します。ローカル プーリングは小さなクラスターを結合し、2 × 2 などのタイリング サイズが一般的に使用されます。グローバル プーリングは、特徴マップのすべてのニューロンに作用します。[24] [25]よく使用されるプーリングには、最大プーリングと平均プーリングの 2 つの種類があります。最大プーリングは、特徴マップ内のニューロンの各ローカル クラスターの最大値を使用し、[26] [27]平均プーリングは平均値を使用します。
完全に接続されたレイヤー
完全接続層は、ある層のすべてのニューロンを別の層のすべてのニューロンに接続します。これは、従来の多層パーセプトロンニューラル ネットワーク (MLP)と同じです。平坦化されたマトリックスは、完全接続層を通過して画像を分類します。
受容野
ニューラル ネットワークでは、各ニューロンは前の層のいくつかの場所から入力を受け取ります。畳み込み層では、各ニューロンは前の層のニューロンの受容野と呼ばれる制限された領域からのみ入力を受け取ります。通常、その領域は正方形です (例: 5 x 5 ニューロン)。一方、完全結合層では、受容野は前の層全体です。したがって、各畳み込み層では、各ニューロンは前の層よりも広い領域から入力を受け取ります。これは、ピクセルの値だけでなく周囲のピクセルも考慮に入れて畳み込みを何度も適用するためです。膨張層を使用する場合、受容野のピクセル数は一定のままですが、複数の層の効果を組み合わせると、フィールドの次元が大きくなるにつれて、フィールドはよりまばらになります。
受容野サイズを必要に応じて操作するために、標準的な畳み込み層の代わりとなる方法がいくつかあります。例えば、アトラス畳み込み層または膨張畳み込み層[28] [29]は、可視領域と盲目領域を交互に配置することで、パラメータの数を増やすことなく受容野サイズを拡大します。さらに、単一の膨張畳み込み層は、複数の膨張率を持つフィルタで構成することができ、[30] 、可変の受容野サイズを持つことができます。
重量
ニューラル ネットワーク内の各ニューロンは、前の層の受容野から受け取った入力値に特定の関数を適用して出力値を計算します。入力値に適用される関数は、重みとバイアス (通常は実数) のベクトルによって決まります。学習は、これらのバイアスと重みを繰り返し調整することで行われます。
重みとバイアスのベクトルはフィルターと呼ばれ、入力の特定の特徴(特定の形状など)を表します。CNNの特徴は、多くのニューロンが同じフィルターを共有できることです。これにより、各受容野が独自のバイアスとベクトルの重みを持つのではなく、フィルターを共有するすべての受容野で単一のバイアスと単一の重みベクトルが使用されるため、メモリフットプリントが削減されます。 [31]
デコンボリューション
逆畳み込みニューラルネットワークは本質的にCNNの逆であり、逆畳み込み層とアンプーリング層で構成されています。[32]
逆畳み込み層は畳み込み層の転置です。具体的には、畳み込み層は行列との乗算として表すことができ、逆畳み込み層はその行列の転置との乗算です。[33]
アンプーリング層は層を拡張します。最大アンプーリング層は、各エントリを複数回コピーするだけなので、最も単純です。たとえば、2行2列の最大アンプーリング層は です。
デコンボリューションレイヤーは画像生成器で使用されます。デフォルトでは周期的なチェッカーボードアーティファクトが生成されますが、これはアップスケールしてからコンボリューションすることで修正できます。[34]
歴史
CNNは、生物の脳が視覚処理を行う方法とよく比較されます。[35]
視覚皮質の受容野
1950年代と1960年代のヒューベルとヴィーゼルの研究は、猫の視覚皮質には視野の小さな領域に個別に反応するニューロンが含まれていることを示した。目が動いていない場合、視覚刺激が単一のニューロンの発火に影響を与える視覚空間の領域は、その受容野として知られている。[36]隣接する細胞は類似した重なり合った受容野を持っている。受容野のサイズと位置は皮質全体で体系的に変化し、視覚空間の完全な地図を形成する。[引用が必要]各半球の皮質は、反対側の視野を表す。[引用が必要]
1968年の論文では、脳内の2つの基本的な視覚細胞の種類が特定されました。[18]
- 単純細胞。受容野内で特定の方向を持つ直線エッジによって出力が最大化される。
- 複雑な細胞はより大きな受容野を持ち、その出力は受容野内のエッジの正確な位置に影響を受けない。
ヒューベルとヴィーゼルは、パターン認識タスクに使用するために、これら2種類の細胞のカスケードモデルも提案した。[37] [36]
CNNアーキテクチャの起源であるネオコグニトロン
フクシマ・クニヒコは、ヒューベルとヴィーゼルの研究に触発され、1969年にReLU 活性化関数を使用するディープCNNを発表しました。[38]ほとんどの現代のネットワークとは異なり、このネットワークは手動で設計されたカーネルを使用しています。重みはすべて非負であったため、彼のネオコグニトロンでは使用されず、代わりに側方抑制が使用されました。整流器は、CNNやディープニューラルネットワーク全般で最も人気のある活性化関数になりました。[39]
「ネオコグニトロン」は1979年に福島邦彦によって導入されました。[40] [19] [17]カーネルは教師なし学習によって訓練されました。これは前述のヒューベルとヴィーゼルの研究に触発されました。ネオコグニトロンは2つの基本的なタイプのレイヤーを導入しました。
- 「S 層」: 共有重み受容野層 (後に畳み込み層と呼ばれる)。この層には、前の層のパッチをカバーする受容野を持つユニットが含まれます。共有重み受容野グループ (ネオコグニトロンの用語では「平面」) はフィルターと呼ばれることが多く、通常、1 つの層には複数のフィルターがあります。
- 「C 層」: 受容野が前の畳み込み層のパッチをカバーするユニットを含むダウンサンプリング層。このようなユニットは通常、パッチ内のユニットの活性化の加重平均を計算し、やや大きいパッチからプールされた抑制 (除算正規化) と、層内のさまざまなフィルターを適用し、飽和活性化関数を適用します。パッチの重みは非負であり、元のネオコグニトロンではトレーニングできません。ダウンサンプリングと競合抑制は、オブジェクトがシフトされている場合でも、視覚シーン内の特徴とオブジェクトを分類するのに役立ちます。
ネオコグニトロンの変種であるクレセプトロンでは、福島の抑制と飽和を伴う空間平均化を使用する代わりに、J. Wengらは1993年にマックスプーリングと呼ばれる手法を導入しました。これは、ダウンサンプリングユニットがそのパッチ内のユニットの活性化の最大値を計算するものです。 [41]マックスプーリングは現代のCNNでよく使用されます。[42]
ネオコグニトロンの重みを訓練するために、数十年にわたっていくつかの教師あり学習および教師なし学習アルゴリズムが提案されてきました。 [17]しかし、今日では、CNNアーキテクチャは通常、バックプロパゲーションを通じて訓練されます。
時間の畳み込み
ニューラルネットワークにおける「畳み込み」という用語は、1987年の第1回神経情報処理システム会議における本間俊輝、レス・アトラス、ロバート・マークス2世の論文で初めて登場する。彼らの論文では、時間的に乗算を畳み込みに置き換え、本質的にシフト不変性を実現している。これは、フィルタの信号処理概念に動機付けられ、より直接的に結びついており、音声認識タスクでそれを実証した。[7]彼らはまた、データ学習可能なシステムとして、畳み込みは重みの反転が最終的な学習関数に影響を与えないため、本質的に相関と同等であると指摘した(「便宜上、*を畳み込みではなく相関として表記する。a(t)とb(t)の畳み込みは、a(-t)とb(t)の相関と同等である点に注意すること。」)。[7]現代のCNN実装では通常、相関が行われ、便宜上、ここで行ったように畳み込みと呼ばれている。
時間遅延ニューラルネットワーク
時間遅延ニューラルネットワーク(TDNN)は、1987年にアレックス・ワイベルらによって音素認識のために導入され、シフト不変性を実現した最初の畳み込みネットワークの1つでした。 [43] TDNNは、データの時間軸に沿って畳み込みが実行される1次元畳み込みニューラルネットです。これは、バックプロパゲーションを使用した勾配降下法によるトレーニングと組み合わせて重み共有を活用した最初のCNNです。[44]したがって、ネオコグニトロンと同様にピラミッド構造を使用しながら、重みのローカル最適化ではなくグローバル最適化を実行しました。[43]
TDNNは、時間次元に沿って重みを共有する畳み込みネットワークです。[45]これにより、音声信号を時間不変に処理できます。1990年にハンプシャーとワイベルは、2次元畳み込みを実行する変種を発表しました。[46]これらのTDNNはスペクトログラムで動作するため、結果として得られる音素認識システムは、ネオコグニトロンによって処理された画像と同様に、時間と周波数の両方の変化に対して不変でした。
TDNNは遠距離音声認識の性能を向上させた。[47]
勾配降下法で訓練されたCNNによる画像認識
デンカーら(1989)は、手書きの郵便番号を認識する2次元CNNシステムを設計した。[48]しかし、畳み込みのカーネル係数を決定するための効率的なトレーニング方法がなかったため、すべての係数を手間をかけて手作業で設計する必要があった。[49]
Waibel ら (1987) による 1-D CNN のトレーニングの進歩に続いて、Yann LeCunら (1989) [49] は、手書きの数字の画像から直接畳み込みカーネル係数を学習するためにバックプロパゲーションを使用しました。学習は完全に自動化され、手動で係数を設計するよりもパフォーマンスが高く、より幅広い画像認識問題や画像タイプに適していました。Wei Zhang ら (1988) [13] [14] は、アルファベット認識用の CNN の畳み込みカーネルをバックプロパゲーションでトレーニングしました。このモデルは、1990 年代初頭に CNN という名前が付けられる前は、シフト不変パターン認識ニューラル ネットワークと呼ばれていました。Wei Zhang らは、最後の完全結合層を除いた同じ CNN を、医療用画像オブジェクトのセグメンテーション (1991) [50]やマンモグラムでの乳がん検出 (1994) にも適用しました。[51]
このアプローチは現代のコンピュータービジョンの基礎となりました。
最大プーリング
1990年に山口らは、特定の領域の最大値を計算して伝播する固定フィルタリング操作である最大プーリングの概念を導入しました。彼らは、TDNNと最大プーリングを組み合わせて、話者に依存しない孤立単語認識システムを実現しました。[26]彼らのシステムでは、単語ごとに複数のTDNN(各音節に1つ)を使用しました。入力信号に対する各TDNNの結果は最大プーリングを使用して結合され、プーリング層の出力は実際の単語分類を実行するネットワークに渡されました。
レネット5
LeCunらが1995年に発表した先駆的な7レベル畳み込みネットワークであるLeNet-5 [52]は、32×32ピクセルの画像にデジタル化された小切手(イギリス英語:cheques )上の手書きの数字を分類します。高解像度の画像を処理するには、より大きくより多くの層の畳み込みニューラルネットワークが必要になるため、この手法はコンピューティングリソースの可用性によって制約されます。
このシステムは、他の商用小切手読み取りシステムよりも優れていました(1995年時点)。このシステムはNCRの小切手読み取りシステムに統合され、1996年6月からアメリカのいくつかの銀行に導入され、1日あたり数百万枚の小切手を読み取りました。[53]
シフト不変ニューラルネットワーク
シフト不変ニューラルネットワークは、1988年にWei Zhangらによって画像文字認識用に提案されました。[13] [14]これは、画像特徴層と最後の完全結合層との間の畳み込み相互接続のみを維持することによって修正されたネオコグニトロンです。モデルはバックプロパゲーションでトレーニングされました。トレーニングアルゴリズムは1991年にさらに改良され[54]、一般化能力が向上しました。モデルアーキテクチャは最後の完全結合層を削除することによって修正され、医療画像セグメンテーション(1991)[50]やマンモグラムにおける乳がんの自動検出(1994)に適用されました。[51]
1988年には、畳み込みをベースとした異なる設計が提案され[55]、 1次元筋電図畳み込み信号の逆畳み込みによる分解に適用されました。この設計は1989年に他の逆畳み込みベースの設計に変更されました。[56] [57]
GPU実装
CNN は 1980 年代に発明されましたが、2000 年代のブレークスルーには、グラフィックス プロセッシング ユニット(GPU) での高速実装が必要でした。
2004年、KS OhとK. Jungは、標準的なニューラルネットワークがGPUで大幅に高速化できることを示しました。その実装はCPUでの同等の実装よりも20倍高速でした。[58] 2005年には、別の論文でも機械学習におけるGPGPUの価値が強調されました。[59]
CNNの最初のGPU実装は、2006年にK. Chellapillaらによって発表されました。彼らの実装は、CPUでの同等の実装よりも4倍高速でした。[60]同じ時期に、GPUはディープビリーフネットワークの教師なしトレーニングにも使用されました。[61] [62] [63] [64]
2010年、 IDSIAのDan Ciresanらは、GPU上でディープフィードフォワードネットワークをトレーニングしました。[65] 2011年に、彼らはこれをCNNに拡張し、CPUのトレーニングと比較して60倍の高速化を実現しました。[24] 2011年、ネットワークは画像認識コンテストで優勝し、初めて超人的なパフォーマンスを達成しました。[66]その後、彼らはさらに多くのコンテストで優勝し、いくつかのベンチマークで最先端のパフォーマンスを達成しました。[67] [42] [27]
その後、Alex Krizhevskyらによる同様のGPUベースのCNNであるAlexNetが、 ImageNet Large Scale Visual Recognition Challenge 2012で優勝しました。 [68]これはAIブームの初期の触媒的な出来事でした。
GPUを使用したCNNのトレーニングと比較して、CPUにはあまり注目が集まっていませんでした。(Viebke et al 2019)は、Intel Xeon Phiで利用可能なスレッドレベルおよびSIMDレベルの並列処理によってCNNを並列化します。[69] [70]
特徴
過去には、従来の多層パーセプトロン(MLP) モデルが画像認識に使用されていました。[例が必要]しかし、ノード間の完全な接続により次元の呪いが発生し、高解像度の画像では計算が困難でした。RGBカラーチャネルを持つ 1000×1000 ピクセルの画像では、完全に接続されたニューロンごとに 300 万の重みがあり、大規模に効率的に処理するには大きすぎます。

たとえば、CIFAR-10では、画像のサイズは 32×32×3 (幅 32、高さ 32、カラー チャネル 3) のみであるため、通常のニューラル ネットワークの最初の非表示層にある 1 つの完全接続ニューロンには、32*32*3 = 3,072 個の重みがあります。ただし、200×200 の画像では、ニューロンの重みは 200*200*3 = 120,000 個になります。
また、このようなネットワーク アーキテクチャはデータの空間構造を考慮せず、離れた入力ピクセルを近くのピクセルと同じように扱います。これにより、グリッド トポロジ (画像など) のデータにおける参照の局所性が計算的にも意味的にも無視されます。したがって、ニューロンの完全な接続は、空間的にローカルな入力パターンが支配的な画像認識などの目的には無駄です。
畳み込みニューラル ネットワークは、視覚皮質の動作をエミュレートするように設計された多層パーセプトロンのバリエーションです。これらのモデルは、自然画像に存在する強力な空間的局所相関を利用することで、MLP アーキテクチャによってもたらされる課題を軽減します。MLP とは対照的に、CNN には次の際立った特徴があります。
- ニューロンの3Dボリューム。CNNの層には、幅、高さ、深さの3次元に配置されたニューロンがあります。 [71]畳み込み層内の各ニューロンは、受容野と呼ばれる前の層の小さな領域にのみ接続されています。局所的に接続された層と完全に接続された層の両方を含む、異なるタイプの層が積み重ねられ、CNNアーキテクチャを形成します。
- ローカル接続: 受容野の概念に従い、CNN は隣接する層のニューロン間のローカル接続パターンを強制することで空間的局所性を活用します。このアーキテクチャにより、学習した「フィルター」が空間的にローカルな入力パターンに対して最も強い応答を生成することが保証されます。このような層を多数積み重ねると、非線形フィルターが次第にグローバル (つまり、ピクセル空間のより広い領域に応答する) になり、ネットワークは最初に入力の小さな部分の表現を作成し、次にそれらからより広い領域の表現を組み立てます。
- 共有重み: CNN では、各フィルターは視野全体に複製されます。これらの複製されたユニットは同じパラメータ (重みベクトルとバイアス) を共有し、特徴マップを形成します。これは、特定の畳み込み層内のすべてのニューロンが、特定の応答フィールド内の同じ特徴に応答することを意味します。このようにユニットを複製すると、結果として得られる活性化マップは、視野内の入力特徴の位置のシフトに対して等変になります。つまり、レイヤーのストライドが 1 である場合、並進等変が保証されます。 [72]
- プーリング:CNNのプーリング層では、特徴マップが長方形のサブ領域に分割され、各長方形内の特徴は、通常は平均値または最大値を取ることによって、独立して単一の値にダウンサンプリングされます。プーリング操作は、特徴マップのサイズを縮小するだけでなく、そこに含まれる特徴にある程度局所的な並進不変性を与え、CNNが位置の変化に対してより堅牢になるようにします。[15]
これらの特性を組み合わせることで、CNN は視覚の問題に対するより優れた一般化を実現できます。重みの共有により、学習する自由パラメータの数が大幅に削減されるため、ネットワークを実行するためのメモリ要件が低下し、より大規模で強力なネットワークのトレーニングが可能になります。
ビルディングブロック
CNN アーキテクチャは、微分可能な関数を通じて入力ボリュームを出力ボリューム (クラス スコアの保持など) に変換する個別のレイヤーのスタックによって形成されます。一般的に使用されるレイヤーにはいくつかの異なるタイプがあります。これらについては、以下でさらに詳しく説明します。

畳み込み層

畳み込み層はCNNのコアとなる構成要素です。この層のパラメータは学習可能なフィルタ(またはカーネル)のセットから構成され、受容野は小さいものの、入力ボリュームの深度全体に広がります。フォワードパスでは、各フィルタは入力ボリュームの幅と高さにわたって畳み込まれ、フィルタエントリと入力のドット積が計算され、そのフィルタの2次元アクティベーションマップが生成されます。その結果、ネットワークは入力内の特定の空間位置で特定の種類の特徴を検出したときにアクティブになるフィルタを学習します。 [73] [nb 1]
すべてのフィルターのアクティベーション マップを深度次元に沿って積み重ねると、畳み込み層の完全な出力ボリュームが形成されます。出力ボリュームの各エントリは、入力内の小さな領域を調べるニューロンの出力として解釈することもできます。アクティベーション マップの各エントリは、フィルターを定義するのと同じパラメーター セットを使用します。
自己教師学習は、高マスク比のスパースパッチとグローバル応答正規化層を使用することで、畳み込み層での使用に適応されています。[引用が必要]
ローカル接続

画像などの高次元入力を扱う場合、ニューロンを前のボリューム内のすべてのニューロンに接続することは非現実的です。このようなネットワーク アーキテクチャでは、データの空間構造が考慮されないためです。畳み込みネットワークは、隣接する層のニューロン間に疎なローカル接続パターンを適用することで、空間的にローカルな相関関係を活用します。各ニューロンは、入力ボリュームの小さな領域にのみ接続されます。
この接続の範囲は、ニューロンの受容野と呼ばれるハイパーパラメータです。接続は空間的にローカルですが(幅と高さに沿って)、常に入力ボリュームの深さ全体に沿って拡張されます。このようなアーキテクチャにより、学習された (イギリス英語: learnt ) フィルタが空間的にローカルな入力パターンに対して最も強力な応答を生成することが保証されます。
空間配置
畳み込み層の出力ボリュームのサイズは、深さ、ストライド、パディング サイズという 3 つのハイパーパラメータによって制御されます。
- 出力ボリュームの深度は、入力ボリュームの同じ領域に接続するレイヤー内のニューロンの数を制御します。これらのニューロンは、入力内のさまざまな特徴に対してアクティブになることを学習します。たとえば、最初の畳み込みレイヤーが生の画像を入力として受け取る場合、さまざまな方向のエッジや色の塊が存在すると、深度次元に沿ったさまざまなニューロンがアクティブになることがあります。
- ストライドは、幅と高さの周りの深さの列の割り当てを制御します。ストライドが 1 の場合、フィルターを 1 ピクセルずつ移動します。これにより、列間の受容野が大きく重なり、出力ボリュームが大きくなります。任意の整数に対して、ストライドS は、フィルターが出力ごとにS単位ずつ移動することを意味します。実際には、これはまれです。ストライドが大きいほど、受容野の重なりが小さくなり、出力ボリュームの空間次元が小さくなります。 [74]
- 場合によっては、入力ボリュームの境界にゼロ (または領域の平均などの他の値) をパディングすると便利なことがあります。このパディングのサイズは、3 番目のハイパーパラメータです。パディングにより、出力ボリュームの空間サイズを制御できます。特に、入力ボリュームの空間サイズを正確に保持することが望ましい場合があり、これは一般に「同じ」パディングと呼ばれます。

出力ボリュームの空間サイズは、入力ボリューム サイズ、畳み込み層ニューロンのカーネル フィールド サイズ、ストライド、および境界の ゼロ パディング量の関数です。特定のボリュームに「収まる」ニューロンの数は次のようになります。
この数値が整数でない場合、ストライドは正しくなく、ニューロンを入力ボリューム全体に対称的にタイリングすることはできません。一般に、ストライドが のときにパディングを 0 に設定すると、入力ボリュームと出力ボリュームが空間的に同じサイズになります。ただし、前のレイヤーのすべてのニューロンを使用する必要は必ずしもありません。たとえば、ニューラル ネットワークの設計者は、パディングの一部だけを使用することを決定する場合があります。
パラメータの共有
パラメータ共有スキームは、畳み込み層で自由パラメータの数を制御するために使用されます。これは、パッチ機能がある空間位置での計算に有用であれば、他の位置での計算にも有用であるはずだという仮定に基づいています。深度の単一の 2 次元スライスを深度スライスとして表すと、各深度スライスのニューロンは同じ重みとバイアスを使用するように制約されます。
単一の深度スライス内のすべてのニューロンは同じパラメータを共有するため、畳み込み層の各深度スライスのフォワードパスは、ニューロンの重みと入力ボリュームの畳み込みとして計算できます。 [nb 2]したがって、重みのセットをフィルター(またはカーネル)と呼ぶのが一般的であり、これは入力と畳み込まれます。この畳み込みの結果は活性化マップであり、異なるフィルターごとの活性化マップのセットは深度次元に沿って積み重ねられ、出力ボリュームを生成します。パラメータの共有は、CNNアーキテクチャの並進不変性に貢献します。 [15]
場合によっては、パラメータ共有の仮定が意味をなさないことがあります。これは特に、CNN への入力画像が特定の中心構造を持つ場合に当てはまります。この場合は、異なる空間位置で完全に異なる特徴が学習されることが予想されます。1 つの実用的な例は、入力が画像の中心に配置された顔である場合です。画像の異なる部分で、異なる目固有の特徴または髪固有の特徴が学習されることが予想されます。その場合、パラメータ共有スキームを緩和し、代わりにレイヤーを単に「ローカル接続レイヤー」と呼ぶのが一般的です。
プーリング層


CNN のもう 1 つの重要な概念はプーリングで、これは非線形ダウンサンプリングの一形態として使用されます。プーリングは、入力特徴マップの空間次元 (高さと幅) を縮小しながら最も重要な情報を保持するため、ダウンサンプリングを実現します。プーリングを実装するための非線形関数はいくつかありますが、最大プーリングと平均プーリングが最も一般的です。プーリングは、入力の小さな領域から情報を集約して入力特徴マップのパーティションを作成し、通常は固定サイズのウィンドウ (2x2 など) を使用し、ストライド (多くの場合 2) を適用して入力全体でウィンドウを移動します。[75] 1 より大きいストライドを使用しない場合、プーリングはダウンサンプリングを実行しないことに注意してください。プーリングは、プーリング ウィンドウを入力全体で 1 ステップずつ移動するだけであり、特徴マップのサイズは縮小されないためです。言い換えれば、ストライドは、プーリング ウィンドウが入力上でどれだけ移動するかを決定することで、実際にダウンサンプリングを引き起こすものです。
直感的には、特徴の正確な位置よりも、他の特徴に対する大まかな位置の方が重要です。これが、畳み込みニューラルネットワークでプーリングを使用する背景にある考え方です。プーリング層は、表現の空間サイズを徐々に縮小し、ネットワーク内のパラメータ数、メモリ使用量、計算量を削減し、したがって、オーバーフィッティングも制御します。これはダウンサンプリングとして知られています。CNNアーキテクチャでは、連続する畳み込み層(通常、各層の後にはReLU層などの活性化関数が続く)の間にプーリング層を定期的に挿入するのが一般的です。[73] : 460–461 プーリング層は局所的な変換不変性に貢献しますが、何らかのグローバルプーリングが使用されない限り、CNNでグローバルな変換不変性は提供しません。[15] [72]プーリング層は通常、入力のすべての深度またはスライスに対して独立して動作し、空間的にサイズを変更します。最大プーリングの非常に一般的な形式は、2×2 サイズのフィルターを持つレイヤーで、ストライド 2 で適用され、入力のすべての深度スライスを幅と高さの両方に沿って 2 ずつサブサンプリングし、アクティベーションの 75% を破棄します。 この場合、すべての最大操作は 4 つの数値を超えます。深度次元は変更されません (これは他の形式のプーリングにも当てはまります)。
最大プーリングに加えて、プーリングユニットは平均プーリングやℓ2ノルムプーリングなどの他の関数を使用することもできます。平均プーリングは歴史的によく使用されていましたが、最近では最大プーリングに比べて好まれなくなっています。最大プーリングは実際にはより良いパフォーマンスを発揮します。[76]
表現サイズの急速な空間縮小の影響により、[それは? ]最近ではより小さなフィルタを使用する傾向があり[77]、プーリング層を完全に破棄する傾向があります。[78]

チャネル最大プーリング
チャネル最大プーリング(CMP)操作層は、冗長な情報を除去する目的で、連続する特徴マップの対応する位置の間でチャネル側に沿ってMP操作を実行します。CMPは、重要な特徴をより少ないチャネル内に集めます。これは、より多くの識別特徴を必要とする細粒度画像分類にとって重要です。一方、CMP操作のもう1つの利点は、最初の完全接続(FC)層に接続する前に、特徴マップのチャネル数を少なくできることです。MP操作と同様に、CMP層の入力特徴マップと出力特徴マップをそれぞれF ∈ R(C×M×N)とC ∈ R(c×M×N)と表します。ここで、Cとcは入力および出力特徴マップのチャネル番号、MとNはそれぞれ特徴マップの幅と高さです。CMP操作は特徴マップのチャネル番号のみを変更することに注意してください。特徴マップの幅と高さは変更されません。これはMP操作とは異なります。[79]
プーリング法のレビューについては [80] [81]を参照。
ReLU 層
ReLUは、 Rectified Linear Unitの略称である。 1941年にAlston Householderによって提案され、 [82] 1969年に福島邦彦によってCNNで使用された。[38] ReLUは、非飽和活性化関数 を適用する。[68]負の値をゼロに設定することで、活性化マップから負の値を効果的に除去する。[83]畳み込み層の受容野に影響を与えることなく、決定関数とネットワーク全体に非線形性を導入する。2011年に、Xavier Glorot、Antoine Bordes、Yoshua Bengioは、 2011年以前に広く使用されていた活性化関数と比較して、ReLUによりより深いネットワークのトレーニングが向上することを発見した。 [84]
非線形性を高めるために、飽和双曲正接関数 、シグモイド関数などの他の関数を使用することもできます。ReLUは、一般化精度に大きなペナルティを与えることなくニューラルネットワークを数倍速くトレーニングできるため、他の関数よりも好まれることが多いです。[85]
完全接続層
いくつかの畳み込み層と最大プーリング層の後、最終分類は完全接続層によって行われます。完全接続層のニューロンは、通常の(非畳み込み)人工ニューラル ネットワークで見られるように、前の層のすべての活性化に接続されています。したがって、その活性化は、行列乗算とバイアス オフセット(学習されたバイアス項または固定バイアス項の ベクトル加算)を伴うアフィン変換として計算できます。
損失層
「損失レイヤー」または「損失関数」は、ネットワークの予測出力と実際のデータ ラベル (教師あり学習中)間の偏差に対してトレーニングでどのようにペナルティを課すかを指定します。特定のタスクに応じて、さまざまな損失関数を使用できます。
ソフトマックス損失関数は、 K個の相互に排他的なクラスのうちの1つのクラスを予測するために使用されます。 [nb 3] シグモイド クロスエントロピー損失は、 K個の独立した確率値を予測するために使用されます。ユークリッド損失は、実数値ラベルへの回帰に使用されます。
ハイパーパラメータ
ハイパーパラメータは、学習プロセスを制御するために使用されるさまざまな設定です。CNN は、標準的な多層パーセプトロン (MLP) よりも 多くのハイパーパラメータを使用します。
カーネルサイズ
カーネルは、一緒に処理されるピクセルの数です。通常は、カーネルの寸法 (2x2、3x3 など) で表されます。
パディング
パディングとは、画像の境界に (通常は) 0 値のピクセルを追加することです。これは、境界ピクセルが通常 1 つの受容野インスタンスにのみ参加するため、出力から過小評価 (失われる) されないようにするために行われます。適用されるパディングは、通常、対応するカーネル次元より 1 つ少ないです。たとえば、3x3 カーネルを使用する畳み込み層は、2 ピクセルのパディングを受け取ります。つまり、画像の各側に 1 ピクセルずつです。[引用が必要]
ストライド
ストライドは、分析ウィンドウが各反復で移動するピクセル数です。ストライドが 2 の場合、各カーネルは前のカーネルから 2 ピクセルオフセットされます。
フィルターの数
特徴マップのサイズは深さとともに小さくなるため、入力層に近い層ではフィルターの数が少なくなる傾向があり、高位層ではフィルターの数が多くなることがあります。各層での計算を均等にするために、特徴値v aとピクセル位置の積は、層間でほぼ一定に保たれます。入力に関するより多くの情報を保持するには、アクティブ化の合計数 (特徴マップの数とピクセル位置の数の積) を層ごとに減少させないようにする必要があります。
特徴マップの数は容量を直接制御し、利用可能な例の数とタスクの複雑さによって異なります。
フィルターサイズ
文献に記載されている一般的なフィルター サイズは大きく異なり、通常はデータ セットに基づいて選択されます。一般的なフィルター サイズは 1x1 から 7x7 の範囲です。有名な 2 つの例として、AlexNet では3x3、5x5、11x11 が使用されました。Inceptionv3では1x1、3x3、5x5 が使用されました。
課題は、特定のデータ セットを与えられた場合に、過剰適合することなく、適切なスケールで抽象化を作成するために、適切な粒度レベルを見つけることです。
プーリングの種類とサイズ
通常、最大プーリングが使用され、多くの場合、2x2 次元で使用されます。これは、入力が大幅にダウンサンプリングされ、処理コストが削減されることを意味します。
プーリングを大きくすると信号の次元が小さくなり、許容できない情報損失が発生する可能性があります。多くの場合、重複しないプーリングウィンドウが最良のパフォーマンスを発揮します。[76]
膨張
膨張では、カーネル内のピクセルを無視します。これにより、信号を大幅に失うことなく、処理メモリを削減できます。3x3 カーネルで膨張率 2 を設定すると、カーネルは 5x5 に拡張されますが、9 個の (等間隔の) ピクセルが処理されます。具体的には、膨張後に処理されるピクセルは、セル (1,1)、(1,3)、(1,5)、(3,1)、(3,3)、(3,5)、(5,1)、(5,3)、(5,5) です。ここで、(i,j) は、拡張された 5x5 カーネルの i 行目と j 列目のセルを表します。したがって、膨張率 4 では、カーネルは 7x7 に拡張されます。[要出典]
翻訳の等価性とエイリアシング
CNN は入力のシフトに対して不変であると一般に考えられています。CNN 内の畳み込み層またはプーリング層でストライドが 1 より大きくないものは、入力の変換に対して確かに等変です。[72]ただし、ストライドが 1 より大きい層は、ナイキスト-シャノンのサンプリング定理を無視し、入力信号のエイリアシングにつながる可能性があります。 [72]原理的には、CNN はアンチエイリアシングフィルターを実装できますが、実際にはこれが起こらないことが観察されており[86]、変換に対して等変でないモデルが生成されます。さらに、CNN が完全に接続された層を使用する場合、完全に接続された層は入力のシフトに対して不変でないため、変換の等変は変換不変性を意味しません。[87] [15]完全な変換不変性の 1 つの解決策は、ネットワーク全体でダウンサンプリングを回避し、最後の層でグローバル平均プーリングを適用することです。[72]さらに、ダウンサンプリング操作の前のアンチエイリアシング、[88]空間トランスフォーマーネットワーク、[89] データ拡張、プーリングと組み合わせたサブサンプリング、[15]カプセルニューラルネットワークなど、いくつかの部分的な解決策が提案されています。[90]
評価
最終的なモデルの精度は、最初に設定されたデータセットのサブセット(テストセットと呼ばれることが多い)に基づいています。また、k分割交差検証などの方法も適用されます。その他の戦略としては、等角予測の使用などがあります。[91] [92]
正規化手法
正則化とは、不適切設定問題を解決したり、過剰適合を防ぐために追加情報を導入するプロセスです。CNN はさまざまな種類の正則化を使用します。
経験的
ドロップアウト
完全に接続された層はパラメータのほとんどを占有するため、過剰適合になりがちです。過剰適合を減らす方法の1つが、2014年に導入されたドロップアウトです。 [93]各トレーニング段階で、個々のノードは確率でネットから「ドロップアウト」(無視)されるか、確率で保持されるため、縮小されたネットワークが残ります。ドロップアウトされたノードへの入力エッジと出力エッジも削除されます。その段階では、縮小されたネットワークのみがデータに対してトレーニングされます。削除されたノードは、元の重みでネットワークに再挿入されます。
トレーニング段階では通常 0.5 ですが、入力ノードの場合は、入力ノードが無視されると情報が直接失われるため、通常ははるかに高くなります。
トレーニング終了後のテスト時には、理想的には、ドロップアウトされる可能性のあるすべてのネットワークのサンプル平均を見つけたいところですが、残念ながらこれは の値が大きい場合には実現不可能です。ただし、各ノードの出力を の係数で重み付けした完全なネットワークを使用することで近似値を見つけることができるため、どのノードの出力の期待値もトレーニング段階と同じになります。これがドロップアウト法の最大のメリットです。ドロップアウト法はニューラルネットを効果的に生成し、モデルの組み合わせを可能にしますが、テスト時には 1 つのネットワークのみをテストすればよいのです。
ドロップアウトは、すべてのノードをすべてのトレーニング データでトレーニングすることを避けることで、オーバーフィッティングを減らします。この方法は、トレーニング速度も大幅に向上します。これにより、ディープ ニューラル ネットワークでもモデルの組み合わせが実用的になります。この手法は、ノードの相互作用を減らし、新しいデータに一般化しやすい、 より堅牢な機能を学習することにつながるようです[説明が必要] 。
ドロップコネクト
DropConnectはドロップアウトの一般化であり、各出力ユニットではなく各接続が確率でドロップされる。各ユニットは、前の層のユニットのランダムなサブセットから入力を受け取る。[94]
DropConnect は、モデル内に動的なスパース性を導入する点でドロップアウトに似ていますが、スパース性がレイヤーの出力ベクトルではなく重みにあるという点で異なります。言い換えると、DropConnect を使用した完全接続レイヤーは、トレーニング段階で接続がランダムに選択されるスパース接続レイヤーになります。
確率的プーリング
Dropout の主な欠点は、ニューロンが完全に接続されていない畳み込み層では同じ利点が得られないことです。
Dropout以前でも、2013年に確率的プーリング[95]と呼ばれる技術が開発され、従来の決定論的プーリング操作が確率的手順に置き換えられました。確率的手順では、各プーリング領域内の活性は、プーリング領域内の活性によって与えられる多項分布に従ってランダムに選択されます。このアプローチはハイパーパラメータを必要とせず、ドロップアウトやデータ拡張などの他の正規化アプローチと組み合わせることができます。
確率的プーリングの別の見方は、標準的な最大プーリングと同等であるが、入力画像のコピーが多数あり、それぞれが小さな局所的な変形を持っているというものです。これは、入力画像の明示的な弾性変形に似ており、[96] MNISTデータセットで優れたパフォーマンスを発揮します。[96]多層モデルで確率的プーリングを使用すると、上位層の選択が下位層の選択とは独立しているため、変形の数が指数関数的に増加します。
人工データ
モデルの過剰適合の度合いは、モデルのパワーと受けるトレーニングの量の両方によって決まるため、畳み込みネットワークにより多くのトレーニング例を提供することで、過剰適合を減らすことができます。トレーニングに利用できるデータが十分でないことが多いため、特に一部を後でテストするために残しておく必要があることを考えると、2つのアプローチがあります。新しいデータを最初から生成するか(可能であれば)、既存のデータを乱して新しいデータを作成するかです。後者は1990年代半ばから使用されています。[52]たとえば、入力画像を切り取ったり、回転したり、再スケーリングしたりして、元のトレーニングセットと同じラベルを持つ新しい例を作成できます。[97]
明示的
早期終了
ネットワークのオーバーフィッティングを防ぐ最も簡単な方法の 1 つは、オーバーフィッティングが発生する前にトレーニングを停止することです。ただし、学習プロセスが停止するという欠点があります。
パラメータの数
オーバーフィッティングを防ぐもう 1 つの簡単な方法は、パラメータの数を制限することです。通常は、各層の隠れユニットの数を制限するか、ネットワークの深さを制限します。畳み込みネットワークの場合、フィルタ サイズもパラメータの数に影響します。パラメータの数を制限すると、ネットワークの予測力が直接制限され、データに対して実行できる関数の複雑さが軽減されるため、オーバーフィッティングの量が制限されます。これは、「ゼロ ノルム」に相当します。
体重減少
追加された正則化の単純な形式は重み減衰です。重みベクトルの重みの合計 ( L1 ノルム) または大きさの二乗 ( L2 ノルム) に比例する追加の誤差を各ノードの誤差に単純に追加します。比例定数 (「アルファ」ハイパーパラメータ) を増やすことで、許容されるモデルの複雑さのレベルを下げることができます。これにより、大きな重みベクトルのペナルティが増加します。
L2 正則化は、最も一般的な正則化形式です。これは、目的関数内のすべてのパラメータの二乗値を直接ペナルティとして課すことで実装できます。L2 正則化は、ピークの重みベクトルに重いペナルティを課し、拡散重みベクトルを優先するという直感的な解釈があります。重みと入力の間の乗法的な相互作用により、ネットワークが一部の入力を多く使用するのではなく、すべての入力を少しずつ使用することを促すという便利な特性があります。
L1 正則化も一般的です。これにより、最適化中に重みベクトルがスパースになります。言い換えると、L1 正則化を持つニューロンは、最も重要な入力のスパース サブセットのみを使用することになり、ノイズの多い入力に対してほぼ不変になります。L1 と L2 正則化を組み合わせることができます。これは、弾性ネット正則化と呼ばれます。
最大ノルム制約
正則化の別の形式は、各ニューロンの重みベクトルの大きさに絶対的な上限を強制し、投影勾配降下法を使用して制約を強制することです。実際には、これは通常どおりパラメータ更新を実行し、各ニューロンの重みベクトルをクランプして を満たすように制約を強制することに相当します。 の典型的な値は3~4のオーダーです。いくつかの論文では、この形式の正則化を使用すると 改善が報告されています[98] 。
階層的座標フレーム
プーリングでは、高レベルのパーツ(顔画像の鼻と口など)間の正確な空間関係が失われます。これらの関係は、アイデンティティの認識に必要です。各特徴が複数のプールに出現するようにプールを重ねると、情報を保持しやすくなります。翻訳だけでは、異なる方向やスケールなど、まったく新しい視点に幾何学的関係の理解を外挿することはできません。一方、人間は外挿が非常に得意で、新しい形状を一度見たら、別の視点からそれを認識することができます。[99]
この問題に対処する従来の一般的な方法は、ネットワークがこれらの変化に対応できるように、さまざまな方向、スケール、照明などで変換されたデータでネットワークをトレーニングすることであった。これは、大規模なデータセットでは計算量が多くなる。代替案は、座標フレームの階層を使用し、ニューロンのグループを使用して、特徴の形状と網膜に対するその姿勢の結合を表すことである。網膜に対する姿勢は、網膜の座標フレームと固有の特徴の座標フレームとの関係である。[100]
したがって、何かを表現する方法の 1 つは、その中に座標フレームを埋め込むことです。これにより、各部分のポーズの一貫性を利用して大きな特徴を認識できます (たとえば、鼻と口のポーズは、顔全体のポーズを一貫して予測します)。このアプローチにより、下位レベル (たとえば、鼻と口) がポーズの予測に同意するときに、上位レベルのエンティティ (たとえば、顔) が存在することが保証されます。ポーズを表すニューロン活動のベクトル (「ポーズ ベクトル」) により、線形操作としてモデル化された空間変換が可能になり、ネットワークが視覚エンティティの階層を学習し、視点を超えて一般化することが容易になります。これは、人間の視覚システムが形状を表現するために座標フレームを課す方法に似ています。[101]
アプリケーション
画像認識
CNNは画像認識システムでよく使用されます。2012年には、MNISTデータベースでのエラー率が0.23%と報告されました。[27] CNNを画像分類に使用することに関する別の論文では、学習プロセスが「驚くほど高速」であると報告されています。同じ論文では、2011年時点での最高の結果はMNISTデータベースとNORBデータベースで達成されました。[24]その後、 AlexNet [102]と呼ばれる同様のCNNがImageNet Large Scale Visual Recognition Challenge 2012で優勝しました。
顔認識に適用した場合、CNNはエラー率の大幅な低下を達成しました。[103]別の論文では、「10人以上の被写体の5,600枚の静止画像」で97.6%の認識率が報告されています。[20] CNNは、手動トレーニング後に客観的な方法でビデオ品質を評価するために使用され、結果として得られたシステムの二乗平均平方根誤差は非常に低くなりました。[104]
ImageNet大規模視覚認識チャレンジは、何百万もの画像と何百ものオブジェクトクラスを使用した、オブジェクトの分類と検出のベンチマークです。大規模な視覚認識チャレンジであるILSVRC 2014 [105]では、ほぼすべての上位チームがCNNを基本フレームワークとして使用しました。優勝したGoogLeNet [106] ( DeepDreamの基礎)は、オブジェクト検出の平均精度を0.439329に向上させ、分類エラーを0.06656に削減し、これまでで最高の結果を達成しました。そのネットワークは30層以上を適用しました。ImageNetテストにおける畳み込みニューラルネットワークのそのパフォーマンスは、人間のパフォーマンスに近かった。[107]最高のアルゴリズムでも、花の茎にいる小さなアリや羽根ペンを手に持っている人など、小さいまたは薄いオブジェクトには依然として苦労しています。また、現代のデジタルカメラでますます一般的になっている現象である、フィルターで歪んだ画像にも苦労します。対照的に、そのような画像が人間を困らせることはほとんどありません。しかし、人間は他の問題でも問題を抱えがちです。例えば、特定の犬種や鳥の種類といった細かいカテゴリに物体を分類するのは苦手ですが、畳み込みニューラル ネットワークはこれを処理します。[引用が必要]
2015年、多層CNNは、上下逆さまの顔や部分的に隠れている顔など、さまざまな角度から顔を判別する能力を、競争力のあるパフォーマンスで実証しました。このネットワークは、さまざまな角度や向きの顔を含む20万枚の画像と、顔のない画像2000万枚のデータベースでトレーニングされました。彼らは5万回の反復で128枚の画像のバッチを使用しました。[108]
ビデオ分析
画像データ領域と比較すると、CNN をビデオ分類に適用する研究は比較的少ないです。ビデオは別の (時間) 次元を持っているため、画像よりも複雑です。ただし、ビデオ領域への CNN の拡張がいくつか検討されています。1 つのアプローチは、空間と時間を入力の同等の次元として扱い、時間と空間の両方で畳み込みを実行することです。[109] [110]別の方法は、空間ストリーム用と時間ストリーム用の 2 つの畳み込みニューラルネットワークの機能を融合することです。[111] [112] [113] フレーム間またはクリップ間の依存関係を考慮するために、通常、長短期記憶(LSTM)再帰ユニットが CNN の後に組み込まれます。 [114] [115]時空間特徴のトレーニング用の 教師なし学習スキームは、畳み込みゲート制限ボルツマンマシン[116]と独立部分空間分析に基づいて導入されています。[117]その応用はテキストからビデオへのモデルに見られる。[要出典]
自然言語処理
CNNは自然言語処理にも応用されてきました。CNNモデルは様々なNLP問題に有効であり、意味解析、[118]、検索クエリ検索、[119]、文モデリング、[120]、分類、[121] 、予測[122]、その他の従来のNLPタスクで優れた結果を達成しました。[123]再帰型ニューラルネットワーク などの従来の言語処理方法と比較して、CNNはシリーズシーケンスの仮定に依存しない言語のさまざまな文脈的現実を表現できますが、RNNは古典的な時系列モデリングが必要な場合に適しています。[124] [125] [126] [127]
異常検出
1次元畳み込みを持つCNNを、時間領域における異常を検出するために、教師なしモデルによって周波数領域(スペクトル残差)の時系列に使用した。[128]
創薬
CNNは創薬に利用されてきた。分子と生物学的タンパク質の相互作用を予測することで、潜在的な治療法を特定できる。2015年、Atomwiseは構造ベースの薬物設計のための初のディープラーニングニューラルネットワークであるAtomNetを発表した。[129]このシステムは、化学相互作用の3次元表現を直接トレーニングする。画像認識ネットワークが、より小さく空間的に近い特徴をより大きく複雑な構造に組み立てるのと同じように、[130] AtomNetは芳香族性、sp3炭素、水素結合などの化学的特徴を発見する。その後、AtomNetは複数の疾患標的、特にエボラウイルス[131]と多発性硬化症の治療法に対する新たな候補生体分子を予測するために使用された。[132]
チェッカーゲーム
CNN はチェッカーゲームで使用されています。1999 年から 2001 年にかけて、Fogelと Chellapilla は共進化を使用して畳み込みニューラル ネットワークがチェッカーのプレイを学習する方法を示した論文を発表しました。学習プロセスでは、以前の人間のプロのゲームは使用されず、チェッカーボードに含まれる最小限の情報、つまり駒の位置と種類、および両側の駒の数の差に重点が置かれました。最終的に、プログラム ( Blondie24 ) は 165 のプレイヤーとのゲームでテストされ、上位 0.4% にランクされました。[133] [134]また、このプログラムは、その「エキスパート」レベルのプレイでプログラムChinookに勝利しました。[135]
行く
CNNはコンピュータ囲碁でも使用されている。2014年12月、クラークとストーキーは、人間のプロのゲームのデータベースから教師あり学習によってトレーニングされたCNNがGNU Goよりも優れており、モンテカルロ木探索Fuego 1.1に対して、Fuegoのプレイ時間のほんの一部でいくつかのゲームに勝つことができることを示す論文を発表した。 [136]その後、大規模な12層の畳み込みニューラルネットワークが55%の局面でプロの手を正しく予測し、 6段の人間のプレイヤーの精度に匹敵したことが発表された。トレーニングされた畳み込みネットワークを、検索なしで直接囲碁のゲームをプレイするために使用した場合、97%のゲームで従来の検索プログラムGNU Goに勝ち、1手あたり1万回のプレイアウト(約100万の局面)をシミュレートするモンテカルロ木探索プログラムFuegoのパフォーマンスに匹敵した。 [137]
MCTSを駆動する、試すべき動きを選択するCNN(「ポリシーネットワーク」)とポジションを評価するCNN(「バリューネットワーク」)は、当時最高の人間プレイヤーに初めて勝利したAlphaGoによって使用されました。 [138]
時系列予測
再帰型ニューラルネットワークは、一般的に時系列予測(および一般的なシーケンスモデリング)に最適なニューラルネットワークアーキテクチャであると考えられていますが、最近の研究では、畳み込みネットワークが同等かそれ以上の性能を発揮できることが示されています。[139] [12]膨張畳み込み[140]により、1次元畳み込みニューラルネットワークは時系列の依存関係を効果的に学習できる可能性があります。[141]畳み込みは、RNNベースのソリューションよりも効率的に実装でき、勾配が消失(または爆発)する問題がありません。[142]畳み込みネットワークは、学習する類似した時系列が複数ある場合に、予測性能を向上させることができます。[143] CNNは、時系列分析のさらなるタスク(時系列分類[144]や分位予測[145]など) にも適用できます。
文化遺産と3Dデータセット
楔形文字が書かれた粘土板などの考古学的発見が3Dスキャナーを使用してますます多く取得されるにつれて、ベンチマークデータセットが利用可能になりつつあり、その中にはGigaMeshソフトウェアフレームワークで作成された約2000の正規化された2Dおよび3Dデータセットを提供するHeiCuBeDa [146]も含まれる。[147]そのため、曲率ベースの尺度は幾何学的ニューラルネットワーク(GNN)と組み合わせて使用され、例えば人類史上最古の文書の1つである粘土板の時代分類に使用されている。[148] [149]
微調整
多くのアプリケーションでは、トレーニングデータがあまり入手できません。畳み込みニューラルネットワークは通常、過剰適合を避けるために大量のトレーニングデータを必要とします。一般的な手法は、関連ドメインからのより大きなデータセットでネットワークをトレーニングすることです。ネットワークパラメータが収束すると、ドメイン内データを使用してネットワークの重みを微調整する追加のトレーニングステップが実行され、これは転移学習として知られています。さらに、この手法により、畳み込みネットワークアーキテクチャを小さなトレーニングセットの問題にうまく適用できます。[150]
人間が解釈できる説明
エンドツーエンドのトレーニングと予測は、コンピュータービジョンでは一般的な方法です。しかし、自動運転車などの重要なシステムでは、人間が解釈できる説明が必要です。[151]視覚的顕著性、空間的注意、時間的注意の最近の進歩により、CNN予測を正当化するために最も重要な空間領域/時間的瞬間を視覚化できるようになりました。[152] [153]
関連アーキテクチャ
ディープQネットワーク
ディープQネットワーク(DQN)は、ディープニューラルネットワークと強化学習の一種であるQ学習を組み合わせたディープラーニングモデルの一種です。従来の強化学習エージェントとは異なり、CNNを利用するDQNは強化学習を介して高次元の感覚入力から直接学習することができます。[154]
予備的な結果は2014年に発表され、付随する論文は2015年2月に発表された。 [155]この研究では、 Atari 2600ゲームへの応用について説明されている。他の深層強化学習モデルはこれに先行していた。[156]
深い信念ネットワーク
畳み込みディープビリーフネットワーク(CDBN)は、畳み込みニューラルネットワークと非常によく似た構造を持ち、ディープビリーフネットワークと同様にトレーニングされます。したがって、CNNのように画像の2D構造を活用し、ディープビリーフネットワークのように事前トレーニングを使用します。CDBNは、多くの画像および信号処理タスクで使用できる汎用的な構造を提供します。CIFAR [157]などの標準画像データセットのベンチマーク結果は、CDBNを使用して得られています。[158]

ニューラル抽象化ピラミッド
畳み込みニューラルネットワークのフィードフォワードアーキテクチャは、ニューラル抽象ピラミッド[159]で横方向およびフィードバック接続によって拡張されました。結果として得られる再帰型畳み込みネットワークは、コンテキスト情報を柔軟に組み込んで、局所的な曖昧さを反復的に解決することを可能にします。以前のモデルとは対照的に、セマンティックセグメンテーション、画像再構成、およびオブジェクトローカリゼーションタスクなどのために、最高解像度で画像のような出力が生成されました。
著名な図書館
- Caffe : 畳み込みニューラル ネットワーク用のライブラリ。Berkeley Vision and Learning Center (BVLC) によって作成されました。CPU と GPU の両方をサポートします。C ++で開発されており、PythonおよびMATLABラッパーがあります。
- Deeplearning4j :マルチ GPU 対応SparkでのJavaおよびScalaによるディープラーニング。C++ 科学計算エンジンで実行される JVM プロダクション スタック用の汎用ディープラーニング ライブラリ。カスタム レイヤーの作成が可能。Hadoop および Kafka と統合。
- Dlib : C++ で実際の機械学習およびデータ分析アプリケーションを作成するためのツールキット。
- Microsoft Cognitive Toolkit : Microsoft が作成したディープラーニング ツールキットで、複数のノードにわたるスケーラビリティを強化する独自の機能がいくつか備わっています。C++ および Python でのトレーニング用の本格的なインターフェイスをサポートし、 C#および Javaでのモデル推論もサポートしています。
- TensorFlow : CPU、GPU、Google独自のテンソルプロセッシングユニット(TPU)[160]、モバイルデバイスをサポートする、Apache 2.0ライセンスのTheanoライクなライブラリ。
- Theano : 人気のNumPyライブラリとほぼ互換性のある API を備えた Python のリファレンス ディープラーニング ライブラリ。ユーザーが記号的な数式を記述し、その導関数を自動的に生成できるため、勾配やバックプロパゲーションをコーディングする必要がありません。これらの記号式は、高速なGPU実装のためにCUDAコードに自動的にコンパイルされます。
- Torch : CとLuaで記述された、機械学習アルゴリズムを幅広くサポートする科学計算フレームワーク。
参照
注記
参考文献
- ^ LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015-05-28). 「ディープラーニング」. Nature . 521 (7553): 436–444. Bibcode :2015Natur.521..436L. doi :10.1038/nature14539. ISSN 1476-4687. PMID 26017442.
- ^ ab Venkatesan, Ragav; Li, Baoxin (2017-10-23)。ビジュアルコンピューティングにおける畳み込みニューラルネットワーク:簡潔なガイド。CRC Press。ISBN 978-1-351-65032-8. 2023年10月16日時点のオリジナルよりアーカイブ。2020年12月13日閲覧。
- ^ ab Balas, Valentina E.; Kumar, Raghvendra; Srivastava, Rajshree (2019-11-19). 人工知能とモノのインターネットの最近の動向と進歩。Springer Nature。ISBN 978-3-030-32644-9. 2023年10月16日時点のオリジナルよりアーカイブ。2020年12月13日閲覧。
- ^ Zhang, Yingjie; Soon, Hong Geok; Ye, Dongsen; Fuh, Jerry Ying Hsi; Zhu, Kunpeng (2020年9月). 「ハイブリッド畳み込みニューラルネットワークを使用したマシンビジョンによる粉末床溶融プロセスモニタリング」. IEEE Transactions on Industrial Informatics . 16 (9): 5769–5779. doi :10.1109/TII.2019.2956078. ISSN 1941-0050. S2CID 213010088. 2023-07-31にオリジナルからアーカイブ。2023-08-12に取得。
- ^ Chervyakov, NI; Lyakhov, PA; Deryabin, MA; Nagornov, NN; Valueva, MV; Valuev, GV (2020 年 9 月). 「Residue Number System ベースのソリューションによる畳み込みニューラル ネットワークのハードウェア コストの削減」. Neurocomputing . 407 : 439–453. doi :10.1016/j.neucom.2020.04.018. S2CID 219470398. 2023-06-29 にオリジナルからアーカイブ。2023-08-12に取得。畳み込み
ニューラル ネットワークは、コンピューター ビジョン、音声認識、マルウェア検出、金融における時系列分析など、現在幅広いアプリケーションで使用されているディープラーニング アーキテクチャです。
- ^ ab Habibi、Aghdam、Hamed (2017-05-30)。畳み込みニューラルネットワークガイド:交通標識の検出と分類への実用的なアプリケーション。Heravi、Elnaz Jahani。シャム、スイス。ISBN 9783319575490. OCLC 987790957.
{{cite book}}: CS1 maint: location missing publisher (link) CS1 maint: multiple names: authors list (link) - ^ abc 本間俊輝; Les Atlas; Robert Marks II (1987). 「時空間双極性パターンのための人工ニューラルネットワーク:音素分類への応用」(PDF) . Advances in Neural Information Processing Systems . 1 : 31–40. 2022-03-31 にオリジナルからアーカイブ(PDF)されました。2022-03-31に取得。
提示されたモデルで使用されている畳み込みまたは相関の概念は、エンジニアリング分野では一般的であり、フィルター、制御システムなどの設計に広く適用されています。
- ^ Valueva, MV; Nagornov, NN; Lyakhov, PA; Valuev, GV; Chervyakov, NI (2020). 「畳み込みニューラルネットワーク実装のハードウェアコストを削減するための剰余数システムの適用」.シミュレーションにおける数学とコンピューター. 177. Elsevier BV: 232–243. doi :10.1016/j.matcom.2020.04.031. ISSN 0378-4754. S2CID 218955622.
畳み込みニューラルネットワークは、パターン認識の問題を解決するための有望なツールです。
- ^ ファン・デン・オールド、アーロン;ディーレマン、サンダー。シュラウウェン、ベンジャミン (2013-01-01)。バージェス、CJC;ボットー、L.ウェリング、M.ガーラマニ、Z.ワインバーガー、KQ (編)。深いコンテンツベースの音楽レコメンデーション(PDF)。 Curran Associates, Inc.、2643 ~ 2651 ページ。2022-03-07 にオリジナルからアーカイブ(PDF)されました。2022-03-31に取得。
- ^ Collobert, Ronan; Weston, Jason (2008-01-01). 「自然言語処理のための統合アーキテクチャ」。第25 回国際機械学習会議 ICML '08 の議事録。米国ニューヨーク: ACM。pp. 160–167。doi : 10.1145 /1390156.1390177。ISBN 978-1-60558-205-4.S2CID 2617020 。
- ^ Avilov, Oleksii; Rimbert, Sebastien; Popov, Anton; Bougrain, Laurent (2020 年 7 月)。「脳波信号からの術中意識検出を改善するためのディープラーニング技術」。2020 年 42 回 IEEE 医学生物学会 (EMBC) 年次国際会議(PDF) 。第2020 巻。モントリオール、ケベック州、カナダ: IEEE。pp. 142–145。doi :10.1109/EMBC44109.2020.9176228。ISBN 978-1-7281-1990-8. PMID 33017950. S2CID 221386616. 2022年5月19日にオリジナルからアーカイブ(PDF)されました。2023年7月21日に取得。
- ^ ab Tsantekidis, Avraam; Passalis, Nikolaos; Tefas, Anastasios; Kanniainen, Juho; Gabbouj, Moncef; Iosifidis, Alexandros (2017 年 7 月)。「畳み込みニューラル ネットワークを使用した指値注文書からの株価予測」。2017 IEEE第 19 回ビジネス情報学会議 (CBI)。テッサロニキ、ギリシャ: IEEE。pp. 7–12。doi :10.1109 / CBI.2017.23。ISBN 978-1-5386-3035-8. S2CID 4950757。
- ^ abc Zhang, Wei (1988). 「シフト不変パターン認識ニューラルネットワークとその光学アーキテクチャ」。応用物理学会年次大会講演論文集。2020年6月23日時点のオリジナルよりアーカイブ。2020年6月22日閲覧。
- ^ abc Zhang, Wei (1990). 「局所的な空間不変相互接続とその光学アーキテクチャを備えた並列分散処理モデル」.応用光学. 29 (32): 4790–7. Bibcode :1990ApOpt..29.4790Z. doi :10.1364/AO.29.004790. PMID 20577468. 2017-02-06にオリジナルからアーカイブ。2016-09-22に取得。
- ^ abcdef Mouton, Coenraad; Myburgh, Johannes C.; Davel, Marelie H. (2020). 「CNN におけるストライドと変換不変性」。Gerber, Aurona (編) 著。人工知能研究。コンピューターと情報科学におけるコミュニケーション。第 1342 巻。Cham: Springer International Publishing。pp. 267–281。arXiv : 2103.10097。doi : 10.1007 / 978-3-030-66151-9_17。ISBN 978-3-030-66151-9. S2CID 232269854. 2021年6月27日時点のオリジナルよりアーカイブ。2021年3月26日閲覧。
- ^ Kurtzman, Thomas (2019年8月20日). 「DUD-Eデータセットの隠れたバイアスが、構造ベースの仮想スクリーニングにおけるディープラーニングの誤ったパフォーマンスにつながる」. PLOS ONE . 14 (8): e0220113. Bibcode :2019PLoSO..1420113C. doi : 10.1371/journal.pone.0220113 . PMC 6701836. PMID 31430292 .
- ^ abc 福島, K. (2007). 「ネオコグニトロン」. Scholarpedia . 2 (1): 1717. Bibcode :2007SchpJ...2.1717F. doi : 10.4249/scholarpedia.1717 .
- ^ ab Hubel, DH; Wiesel, TN (1968-03-01). 「サルの線条体皮質の受容野と機能的構造」. The Journal of Physiology . 195 (1): 215–243. doi :10.1113/jphysiol.1968.sp008455. ISSN 0022-3751. PMC 1557912. PMID 4966457 .
- ^ ab 福島 邦彦 (1980). 「ネオコグニトロン:位置のずれに影響されないパターン認識メカニズムのための自己組織化ニューラルネットワークモデル」(PDF) .生物サイバネティクス. 36 (4): 193–202. doi :10.1007/BF00344251. PMID 7370364. S2CID 206775608. 2014年6月3日時点のオリジナルよりアーカイブ(PDF) . 2013年11月16日閲覧。
- ^ ab 松次正和、森勝彦、三足裕介、金田裕二 (2003)。「畳み込みニューラルネットワークを用いた堅牢な顔検出による被験者非依存の表情認識」( PDF)。ニューラルネットワーク。16 (5): 555–559。doi : 10.1016 /S0893-6080(03)00115-1。PMID 12850007。 2013年12月13日時点のオリジナルより アーカイブ(PDF) 。 2013年11月17日閲覧。
- ^ 畳み込みニューラルネットワークの解明: マッチドフィルタリングの観点に基づくチュートリアル https://arxiv.org/abs/2108.11663v3
- ^ 「畳み込みニューラルネットワーク (LeNet) – DeepLearning 0.1 ドキュメント」。DeepLearning 0.1。LISA Lab。2017年12月28日時点のオリジナルよりアーカイブ。 2013年8月31日閲覧。
- ^ Chollet, François (2017-04-04). 「Xception: 深さ方向に分離可能な畳み込みによるディープラーニング」. arXiv : 1610.02357 [cs.CV].
- ^ abc Ciresan, Dan; Ueli Meier; Jonathan Masci; Luca M. Gambardella; Jurgen Schmidhuber (2011). 「画像分類のための柔軟で高性能な畳み込みニューラルネットワーク」(PDF)。第22回国際人工知能合同会議議事録 - 第2巻。2 : 1237–1242。2022年4月5日時点のオリジナルよりアーカイブ(PDF) 。 2013年11月17日閲覧。
- ^ Krizhevsky、Alex。「ImageNet Classification with Deep Convolutional Neural Networks」(PDF) 。 2021年4月25日時点のオリジナルよりアーカイブ(PDF) 。 2013年11月17日閲覧。
- ^ ab 山口 耕一; 坂本 健二; 赤羽 俊夫; 藤本 善司 (1990 年 11 月). 話者に依存しない孤立単語認識のためのニューラルネットワーク。第一回国際音声言語処理会議 (ICSLP 90). 神戸、日本。2021 年 3 月 7 日時点のオリジナルよりアーカイブ。2019 年 9 月 4 日閲覧。
- ^ abc Ciresan, Dan; Meier, Ueli; Schmidhuber, Jürgen (2012 年 6 月)。「画像分類のためのマルチカラム ディープ ニューラル ネットワーク」。2012 IEEEコンピュータービジョンおよびパターン認識会議。ニューヨーク、NY:電気電子技術者協会(IEEE )。pp. 3642–3649。arXiv : 1202.2745。CiteSeerX 10.1.1.300.3283。doi : 10.1109 / CVPR.2012.6248110。ISBN 978-1-4673-1226-4. OCLC 812295155. S2CID 2161592.
- ^ Yu, Fisher; Koltun, Vladlen (2016-04-30). 「Dilated Convolutions によるマルチスケールコンテキスト集約」. arXiv : 1511.07122 [cs.CV].
- ^ Chen, Liang-Chieh; Papandreou, George; Schroff, Florian; Adam, Hartwig (2017-12-05). 「セマンティック画像セグメンテーションのための Atrous 畳み込みの再考」. arXiv : 1706.05587 [cs.CV].
- ^ デュタ、イオナット・コズミン;ジョルジェスク、マリアナ・ユリアナ。イヨネスク、ラドゥ・チューダー(2021-08-16)。 「コンテキスト畳み込みニューラル ネットワーク」。arXiv : 2108.07387 [cs.CV]。
- ^ LeCun, Yann. 「LeNet-5、畳み込みニューラルネットワーク」。2021年2月24日時点のオリジナルよりアーカイブ。2013年11月16日閲覧。
- ^ Zeiler, Matthew D.; Taylor, Graham W.; Fergus, Rob (2011 年 11 月)。「中レベルおよび高レベル の特徴学習のための適応型デコンボリューション ネットワーク」。2011国際コンピュータ ビジョン会議。IEEE。pp. 2018–2025。doi :10.1109/ iccv.2011.6126474。ISBN 978-1-4577-1102-2。
- ^ デュムラン、ヴィンセント、ヴィシン、フランチェスコ (2018-01-11)、深層学習のための畳み込み演算ガイド、arXiv : 1603.07285
- ^ オデナ、アウグストゥス;デュムラン、ヴィンセント。オラ、クリス (2016-10-17)。 「デコンボリューションとチェッカーボード アーティファクト」。蒸留します。1 (10):e3.土井:10.23915/distill.00003。ISSN 2476-0757。
- ^ van Dyck, Leonard Elia; Kwitt, Roland; Denzler, Sebastian Jochen; Gruber, Walter Roland (2021). 「人間とディープ畳み込みニューラルネットワークにおける物体認識の比較—視線追跡研究」。Frontiers in Neuroscience . 15 : 750639. doi : 10.3389/fnins.2021.750639 . ISSN 1662-453X. PMC 8526843. PMID 34690686 .
- ^ ab Hubel, DH; Wiesel, TN (1959年10月). 「ネコの線条体皮質における単一ニューロンの受容野」. J. Physiol . 148 (3): 574–91. doi :10.1113/jphysiol.1959.sp006308. PMC 1363130. PMID 14403679 .
- ^ David H. Hubel と Torsten N. Wiesel (2005)。脳と視覚知覚: 25 年間の共同研究の物語。オックスフォード大学出版局、米国。p. 106。ISBN 978-0-19-517618-6. 2023年10月16日時点のオリジナルよりアーカイブ。2019年1月18日閲覧。
- ^ ab 福島, K. (1969). 「アナログ閾値要素の多層ネットワークによる視覚特徴抽出」. IEEE Transactions on Systems Science and Cybernetics . 5 (4): 322–333. doi :10.1109/TSSC.1969.300225.
- ^ Ramachandran, Prajit; Barret, Zoph; Quoc, V. Le (2017年10月16日). 「活性化関数の探索」. arXiv : 1710.05941 [cs.NE].
- ^ 福島邦彦 (1979年10月)。 「位置ずれに影響されないパターン認識機構の神経回路のモデル --- ネオコグニトロン ---」トランス。電子情報通信学会(日本語) J62-A (10): 658–665。
- ^ Weng, J; Ahuja, N; Huang, TS (1993). 「2D 画像からの 3D オブジェクトの認識とセグメンテーションの学習」1993 (第 4 回) 国際コンピュータ ビジョン会議IEEE. pp. 121–128. doi :10.1109/ICCV.1993.378228. ISBN 0-8186-3870-2. S2CID 8619176。
- ^ ab Schmidhuber, Jürgen (2015). 「ディープラーニング」. Scholarpedia . 10 (11): 1527–54. CiteSeerX 10.1.1.76.1541 . doi :10.1162/neco.2006.18.7.1527. PMID 16764513. S2CID 2309950. 2016-04-19にオリジナルからアーカイブ。2019-01-20に取得。
- ^ ab Waibel, Alex (1987 年 12 月). 時間遅延ニューラル ネットワークを使用した音素認識(PDF) . 電気情報通信学会 (IEICE) 学術講演会. 東京、日本。
- ^ Alexander Waibel他「時間遅延ニューラルネットワークを使用した音素認識」Wayback Machineに 2021-02-25 にアーカイブIEEE Transactions on Acoustics, Speech, and Signal Processing、第 37 巻、第 3 号、pp. 328 - 339、1989 年 3 月。
- ^ LeCun, Yann; Bengio, Yoshua (1995). 「画像、音声、時系列の畳み込みネットワーク」。Arbib, Michael A. (編) 『脳理論とニューラルネットワークのハンドブック(第2版)』。MIT出版。pp. 276–278。2020年7月28日時点のオリジナルよりアーカイブ。 2019年12月3日閲覧。
- ^ John B. Hampshire と Alexander Waibel、「Connectionist Architectures for Multi-Speaker Phoneme Recognition」、Wayback Machineに 2022-03-31 にアーカイブ、Advances in Neural Information Processing Systems、1990 年、Morgan Kaufmann。
- ^ Ko, Tom; Peddinti, Vijayaditya; Povey, Daniel; Seltzer, Michael L.; Khudanpur, Sanjeev (2018 年 3 月)。堅牢な音声認識のための残響音声のデータ拡張に関する研究(PDF) 。第 42 回 IEEE 国際音響・音声・信号処理会議 (ICASSP 2017)。ニューオーリンズ、ルイジアナ州、米国。2018年 7 月 8 日のオリジナルからアーカイブ(PDF) 。2019年 9 月 4 日に取得。
- ^ Denker, JS, Gardner, WR, Graf, H. P, Henderson, D, Howard, RE, Hubbard, W, Jackel, LD, BaIrd, HS, Guyon (1989) 手書きの郵便番号数字のニューラルネットワーク認識装置 Archived 2018-08-04 at the Wayback Machine、AT&T Bell Laboratories
- ^ ab Y. LeCun、B. Boser、JS Denker、D. Henderson、RE Howard、W. Hubbard、LD Jackel、「手書きの郵便番号認識へのバックプロパゲーションの適用」Wayback Machineに 2020-01-10 にアーカイブ; AT&T Bell Laboratories
- ^ ab Zhang, Wei (1991). 「学習ネットワークに基づくヒト角膜内皮の画像処理」.応用光学. 30 (29): 4211–7. Bibcode :1991ApOpt..30.4211Z. doi :10.1364/AO.30.004211. PMID 20706526. 2017-02-06にオリジナルからアーカイブ。 2016-09-22に取得。
- ^ ab Zhang, Wei (1994). 「シフト不変人工ニューラルネットワークを用いたデジタルマンモグラムにおけるクラスター化微小石灰化のコンピューター検出」。Medical Physics . 21 (4): 517–24. Bibcode :1994MedPh..21..517Z. doi :10.1118/1.597177. PMID 8058017. 2017-02-06にオリジナルからアーカイブ。2016-09-22に取得。
- ^ ab Lecun、Y.;ジャッケル、LD;ボットー、L.コルテス、C.デンカー、JS;ドラッカー、H.ギヨン、I。ミュラー、UA;サッカー、E.シマール、P. Vapnik、V. (1995 年 8 月)。分類のための学習アルゴリズム: 手書き数字認識の比較(PDF)。世界科学。 261–276ページ。土井:10.1142/2808。ISBN 978-981-02-2324-32023年5月2日時点のオリジナルよりアーカイブ(PDF) 。
- ^ Lecun , Y.; Bottou, L.; Bengio, Y .; Haffner, P. (1998 年 11 月)。「文書認識に適用される勾配ベース学習」。IEEE論文集。86 (11): 2278–2324。doi :10.1109/5.726791。
- ^ Zhang, Wei (1991). 「最小エントロピー重みによる誤差逆伝播: 2-D シフト不変ニューラルネットワークの一般化を向上させる手法」。ニューラルネットワークに関する国際合同会議の議事録。2017 年 2 月 6 日のオリジナルからアーカイブ。2016年 9 月 22 日に取得。
- ^ Daniel Graupe、Ruey Wen Liu、George S Moschytz、「ニューラルネットワークの医療信号処理への応用」 Wayback Machineで2020年7月28日にアーカイブ。Proc. 27th IEEE Decision and Control Conf.、pp. 343–347、1988年。
- ^ Daniel Graupe、Boris Vern、G. Gruener、Aaron Field、Qiu Huang。「ニューラルネットワークによる表面EMG信号の単一線維活動電位への分解」 Wayback Machineで2019年9月4日にアーカイブ。Proc. IEEE International Symp. on Circuits and Systems、pp. 1008–1011、1989年。
- ^ Qiu Huang、Daniel Graupe、Yi Fang Huang、Ruey Wen Liu、「神経信号の発火パターンの識別[リンク切れ ]。」 Proc. 28th IEEE Decision and Control Conf.、pp. 266–271、1989。https://ieeexplore.ieee.org/document/70115 2022-03-31 にWayback Machineでアーカイブ
- ^ Oh, KS; Jung, K (2004). 「ニューラルネットワークのGPU実装」.パターン認識. 37 (6): 1311–1314. Bibcode :2004PatRe..37.1311O. doi :10.1016/j.patcog.2004.01.013.
- ^ Dave Steinkraus、Patrice Simard、Ian Buck (2005)。「機械学習アルゴリズムへの GPU の使用」。第 12 回国際文書分析認識会議 (ICDAR 2005)。pp. 1115–1119。doi :10.1109/ICDAR.2005.251。2022 年 3 月 31 日時点のオリジナルよりアーカイブ。2022 年3月31 日閲覧。
- ^ Kumar Chellapilla、Sid Puri、Patrice Simard (2006)。「文書処理のための高性能畳み込みニューラルネットワーク」。Guy Lorette (編)。手書き認識の最前線に関する第10回国際ワークショップ。Suvisoft。2020年5月18日時点のオリジナルよりアーカイブ。 2016年3月14日閲覧。
- ^ Hinton, GE; Osindero, S; Teh, YW (2006 年 7 月). 「ディープビリーフネットの高速学習アルゴリズム」. Neural Computation . 18 (7): 1527–54. CiteSeerX 10.1.1.76.1541 . doi :10.1162/neco.2006.18.7.1527. PMID 16764513. S2CID 2309950.
- ^ Bengio, Yoshua; Lamblin, Pascal; Popovici, Dan; Larochelle, Hugo (2007). 「Greedy Layer-Wise Training of Deep Networks」(PDF)。Advances in Neural Information Processing Systems :153–160。 2022年6月2日時点のオリジナルよりアーカイブ(PDF) 。 2022年3月31日閲覧。
- ^ Ranzato, MarcAurelio; Poultney, Christopher; Chopra, Sumit; LeCun, Yann (2007). 「エネルギーベースモデルによるスパース表現の効率的な学習」(PDF)。Advances in Neural Information Processing Systems。2016-03-22 にオリジナルからアーカイブ(PDF) 。2014-06-26に取得。
- ^ Raina, R; Madhavan, A; Ng, Andrew (2009 年 6 月 14 日)。「グラフィックス プロセッサを使用した大規模なディープ アンスーパーバイズド ラーニング」( PDF)。第 26 回国際機械学習会議の議事録。ICML '09: 第 26 回国際機械学習会議の議事録。pp. 873–880。doi : 10.1145 /1553374.1553486。ISBN 9781605585161. S2CID 392458. 2020年12月8日時点のオリジナルよりアーカイブ(PDF) . 2023年12月22日閲覧。
- ^ Ciresan, Dan; Meier, Ueli; Gambardella, Luca; Schmidhuber, Jürgen (2010). 「手書き数字認識のためのディープビッグシンプルニューラルネット」. Neural Computation . 22 (12): 3207–3220. arXiv : 1003.0358 . doi :10.1162/NECO_a_00052. PMID 20858131. S2CID 1918673.
- ^ “IJCNN 2011 競技結果表”. OFFICIAL IJCNN2011 COMPETITION . 2010年. 2021年1月17日時点のオリジナルよりアーカイブ。2019年1月14日閲覧。
- ^ Schmidhuber, Jürgen (2017年3月17日). 「GPU上のディープCNNが優勝したコンピュータービジョンコンテスト史」。2018年12月19日時点のオリジナルよりアーカイブ。2019年1月14日閲覧。
- ^ ab Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (2017-05-24). 「ImageNet分類とディープ畳み込みニューラルネットワーク」(PDF) . Communications of the ACM . 60 (6): 84–90. doi :10.1145/3065386. ISSN 0001-0782. S2CID 195908774. 2017-05-16にオリジナルからアーカイブ(PDF) . 2018-12-04に取得。
- ^ Viebke, Andre; Memeti, Suejb; Pllana, Sabri; Abraham, Ajith (2019). 「CHAOS: Intel Xeon Phi 上で畳み込みニューラルネットワークをトレーニングするための並列化スキーム」. The Journal of Supercomputing . 75 (1): 197–227. arXiv : 1702.07908 . doi :10.1007/s11227-017-1994-x. S2CID 14135321.
- ^ Viebke, Andre; Pllana, Sabri (2015). 「Intel (R) Xeon Phi の教師ありディープラーニングへの可能性」。2015 IEEE 第 17 回国際高性能コンピューティングおよび通信会議、2015 IEEE 第 7 回国際サイバースペースの安全性とセキュリティに関するシンポジウム、および 2015 IEEE 第 12 回国際組み込みソフトウェアおよびシステム会議。IEEE Xplore。IEEE 2015。pp. 758–765。doi :10.1109/HPCC-CSS- ICESS.2015.45。ISBN 978-1-4799-8937-9. S2CID 15411954. 2023年3月6日にオリジナルからアーカイブ。2022年3月31日閲覧。
- ^ Hinton, Geoffrey (2012). 「ImageNet Classification with Deep Convolutional Neural Networks」。NIPS'12: Proceedings of the 25th International Conference on Neural Information Processing Systems - Volume 1 . 1 : 1097–1105. 2019-12-20時点のオリジナルよりアーカイブ。2021-03-26取得– ACM経由。
- ^ abcde Azulay, Aharon; Weiss, Yair (2019). 「なぜディープ畳み込みネットワークは小さな画像変換に対してそれほど不十分に一般化するのか?」。Journal of Machine Learning Research。20 ( 184): 1–25。ISSN 1533-7928。2022-03-31 にオリジナルからアーカイブ。2022-03-31に取得。
- ^ ab Géron, Aurélien (2019). Scikit-Learn、Keras、TensorFlow による実践機械学習。セバストポル、カリフォルニア州: O'Reilly Media。ISBN 978-1-492-03264-9。、448ページ
- ^ 「CS231n 視覚認識のための畳み込みニューラルネットワーク」。cs231n.github.io。2019年10月23日時点のオリジナルよりアーカイブ。 2017年4月25日閲覧。
- ^ Nirthika, Rajendran; Manivannan, Siyamalan; Ramanan, Amirthalingam; Wang, Ruixuan (2022-04-01). 「医療画像解析のための畳み込みニューラルネットワークのプーリング:調査と実証的研究」.ニューラルコンピューティングとアプリケーション. 34 (7): 5321–5347. doi :10.1007/s00521-022-06953-8. ISSN 1433-3058. PMC 8804673. PMID 35125669 .
- ^ ab Scherer, Dominik; Müller, Andreas C.; Behnke, Sven (2010). 「物体認識のための畳み込みアーキテクチャにおけるプーリング操作の評価」(PDF)。人工ニューラルネットワーク (ICANN)、第20回国際会議。ギリシャ、テッサロニキ: Springer。pp. 92–101。2018-04-03にオリジナルからアーカイブ(PDF) 。2016-12-28に取得。
- ^ Graham, Benjamin (2014-12-18). 「Fractional Max-Pooling」. arXiv : 1412.6071 [cs.CV].
- ^ Springenberg, Jost Tobias; Dosovitskiy, Alexey; Brox, Thomas; Riedmiller, Martin (2014-12-21). 「シンプルさへの努力: 全畳み込みネット」. arXiv : 1412.6806 [cs.LG].
- ^ Ma, Zhanyu; Chang, Dongliang; Xie, Jiyang; Ding, Yifeng; Wen, Shaoguo; Li, Xiaoxu; Si, Zhongwei; Guo, Jun (2019). 「チャネル最大プーリング修正CNNによる細粒度車両分類」。IEEE Transactions on Vehicular Technology。68 ( 4). 米国電気電子学会 (IEEE): 3224–3233. doi :10.1109/tvt.2019.2899972. ISSN 0018-9545. S2CID 86674074.
- ^ Zafar, Afia; Aamir, Muhammad; Mohd Nawi, Nazri; Arshad, Ali; Riaz, Saman; Alruban, Abdulrahman; Dutta, Ashit Kumar; Almotairi, Sultan (2022-08-29). 「畳み込みニューラルネットワークのプーリング手法の比較」.応用科学. 12 (17): 8643. doi : 10.3390/app12178643 . ISSN 2076-3417.
- ^ Gholamalinezhad, Hossein; Khosravi, Hossein (2020-09-16)、「ディープニューラルネットワークにおけるプーリング手法のレビュー」、arXiv : 2009.07485
- ^ Householder, Alston S. (1941年6月). 「神経線維ネットワークにおける定常活動の理論: I. 定義と予備的補題」.数理生物物理学紀要. 3 (2): 63–69. doi :10.1007/BF02478220. ISSN 0007-4985.
- ^ Romanuke, Vadim (2017). 「畳み込みニューラルネットワークにおけるReLU の適切な数と割り当て」NTUU「キエフ工科大学」研究速報。1 (1): 69–78。doi : 10.20535 /1810-0546.2017.1.88156。
- ^ Xavier Glorot、Antoine Bordes、Yoshua Bengio (2011)。ディープスパース整流器ニューラルネットワーク(PDF) 。AISTATS。 2016年12月13日のオリジナル(PDF)からアーカイブ。 2023年4月10日閲覧。
整流器とソフトプラス活性化関数。2番目は最初のもののスムーズバージョンです。
- ^ Krizhevsky, A.; Sutskever, I.; Hinton, GE (2012). 「Imagenet分類とディープ畳み込みニューラルネットワーク」(PDF) . Advances in Neural Information Processing Systems . 1 : 1097–1105. 2022-03-31 にオリジナルからアーカイブ(PDF)されました。 2022-03-31に取得。
- ^ Ribeiro, Antonio H.; Schön, Thomas B. (2021). 「畳み込みニューラルネットワークがエイリアシングに対処する方法」ICASSP 2021 - 2021 IEEE 国際音響・音声・信号処理会議 (ICASSP) . pp. 2755–2759. arXiv : 2102.07757 . doi :10.1109/ICASSP39728.2021.9414627. ISBN 978-1-7281-7605-5. S2CID 231925012。
- ^ Myburgh, Johannes C.; Mouton, Coenraad; Davel, Marelie H. (2020). 「CNNS における翻訳不変性の追跡」。Gerber, Aurona (編) 著。人工知能研究。コンピュータと情報科学における通信。第 1342 巻。Cham : Springer International Publishing。pp. 282–295。arXiv : 2104.05997。doi : 10.1007 /978-3-030-66151-9_18。ISBN 978-3-030-66151-9. S2CID 233219976. 2022年1月22日時点のオリジナルよりアーカイブ。2021年3月26日閲覧。
- ^ Richard, Zhang (2019-04-25). 「畳み込みネットワークを再びシフト不変にする」OCLC 1106340711.
- ^ Jadeberg、Simonyan、Zisserman、Kavukcuoglu、Max、Karen、Andrew、Koray (2015)。「空間トランスフォーマーネットワーク」(PDF)。ニューラル情報処理システムの進歩。28。2021年7月25日時点のオリジナルからのアーカイブ(PDF) 。 2021年3月26日取得– NIPS経由。
{{cite journal}}: CS1 maint: multiple names: authors list (link) - ^ E、Sabour、Sara Frosst、Nicholas Hinton、Geoffrey (2017-10-26)。カプセル間の動的ルーティング。OCLC 1106278545 。
{{cite book}}: CS1 maint: multiple names: authors list (link) - ^ Matiz, Sergio; Barner, Kenneth E. (2019-06-01). 「畳み込みニューラルネットワークの帰納的共形予測子:画像分類のための能動学習への応用」.パターン認識. 90 :172–182. Bibcode :2019PatRe..90..172M. doi :10.1016/j.patcog.2019.01.035. ISSN 0031-3203. S2CID 127253432. 2021-09-29にオリジナルからアーカイブ。2021-09-29に取得。
- ^ Wieslander, Håkan; Harrison, Philip J.; Skogberg, Gabriel; Jackson, Sonya; Fridén, Markus; Karlsson, Johan; Spjuth, Ola; Wählby, Carolina (2021年2月). 「大規模全スライド組織画像の階層的解析のための等角予測によるディープラーニング」. IEEE Journal of Biomedical and Health Informatics . 25 (2): 371–380. doi : 10.1109/JBHI.2020.2996300 . ISSN 2168-2208. PMID 32750907. S2CID 219885788.
- ^ Srivastava, Nitish; C. Geoffrey Hinton; Alex Krizhevsky; Ilya Sutskever; Ruslan Salakhutdinov (2014). 「Dropout: ニューラルネットワークのオーバーフィッティングを防ぐ簡単な方法」(PDF) . Journal of Machine Learning Research . 15 (1): 1929–1958. 2016-01-19にオリジナルからアーカイブ(PDF)されました。2015-01-03に取得。
- ^ 「DropConnect を使用したニューラル ネットワークの正規化 | ICML 2013 | JMLR W&CP」。jmlr.org : 1058–1066。2013 年 2 月 13 日。2017 年 8 月 12 日時点のオリジナルよりアーカイブ。2015年 12 月 17 日閲覧。
- ^ Zeiler, Matthew D.; Fergus, Rob (2013-01-15). 「Deep Convolutional Neural Networks の正規化のための確率的プーリング」arXiv : 1301.3557 [cs.LG].
- ^ ab Platt, John; Steinkraus, Dave; Simard, Patrice Y. (2003 年 8 月)。「ビジュアル ドキュメント分析に適用された畳み込みニューラル ネットワークのベスト プラクティス - Microsoft Research」。Microsoft Research。2017年 11 月 7 日時点のオリジナルよりアーカイブ。2015年 12 月 17 日閲覧。
- ^ Hinton, Geoffrey E.; Srivastava, Nitish; Krizhevsky, Alex; Sutskever, Ilya; Salakhutdinov, Ruslan R. (2012). 「特徴検出器の共適応を防ぐことでニューラルネットワークを改善する」arXiv : 1207.0580 [cs.NE].
- ^ 「ドロップアウト: ニューラルネットワークの過剰適合を防ぐ簡単な方法」jmlr.org。 2016 年 3 月 5 日時点のオリジナルよりアーカイブ。 2015 年 12 月 17 日閲覧。
- ^ヒントン、 ジェフリー(1979)。「心的イメージにおける構造的記述の効果のいくつかの実証」認知科学。3 (3):231-250。doi :10.1016/s0364-0213(79)80008-7。
- ^ ロック、アーヴィン。「基準枠」ソロモン・アッシュの遺産:認知と社会心理学のエッセイ(1990):243-268。
- ^ J. Hinton、Coursera のニューラル ネットワークに関する講義、2012 年、URL: https://www.coursera.org/learn/neural-networks 2016 年 12 月 31 日にWayback Machineにアーカイブ
- ^ Dave Gershgorn (2018年6月18日). 「AIがシリコンバレーを支配するほど優れた存在になった経緯の裏話」Quartz . 2019年12月12日時点のオリジナルよりアーカイブ。 2018年10月5日閲覧。
- ^ Lawrence, Steve; C. Lee Giles; Ah Chung Tsoi; Andrew D. Back (1997). 「顔認識: 畳み込みニューラルネットワークアプローチ」. IEEE Transactions on Neural Networks . 8 (1): 98–113. CiteSeerX 10.1.1.92.5813 . doi :10.1109/72.554195. PMID 18255614. S2CID 2883848.
- ^ Le Callet, Patrick; Christian Viard-Gaudin; Dominique Barba (2006). 「客観的なビデオ品質評価のための畳み込みニューラルネットワークアプローチ」(PDF) . IEEE Transactions on Neural Networks . 17 (5): 1316–1327. doi :10.1109/TNN.2006.879766. PMID 17001990. S2CID 221185563. 2021年2月24日時点のオリジナルよりアーカイブ(PDF) . 2013年11月17日閲覧。
- ^ “ImageNet Large Scale Visual Recognition Competition 2014 (ILSVRC2014)”。2016年2月5日時点のオリジナルよりアーカイブ。2016年1月30日閲覧。
- ^ Szegedy, Christian; Liu, Wei; Jia, Yangqing; Sermanet, Pierre; Reed, Scott E.; Anguelov, Dragomir; Erhan, Dumitru; Vanhoucke, Vincent; Rabinovich, Andrew (2015). 「畳み込みによる深化」IEEE コンピュータビジョンおよびパターン認識会議、CVPR 2015、米国マサチューセッツ州ボストン、2015 年 6 月 7 ~ 12 日。IEEEコンピュータ協会。pp. 1~ 9。arXiv : 1409.4842。doi :10.1109 / CVPR.2015.7298594。ISBN 978-1-4673-6964-0。
- ^ ルサコフスキー、オルガ;鄧、佳。スー、ハオ。クラウス、ジョナサン。サシーシュ、サンジーブ。マ、ショーン。黄志恒。アンドレイ・カルパシー;コスラ、アディティヤ。バーンスタイン、マイケル。バーグ、アレクサンダー C.フェイフェイ、リー (2014)。 「イメージネット大規模視覚認識チャレンジ」。arXiv : 1409.0575 [cs.CV]。
- ^ 「顔検出アルゴリズムが画像検索に革命を起こす」。テクノロジーレビュー。2015年2月16日。2020年9月20日時点のオリジナルよりアーカイブ。2017年10月27日閲覧。
- ^ Baccouche, Moez; Mamalet, Franck; Wolf, Christian; Garcia, Christophe; Baskurt, Atilla (2011-11-16). 「人間の行動認識のためのシーケンシャルディープラーニング」。 Salah, Albert Ali; Lepri, Bruno (編)。人間の行動理解。 コンピュータサイエンスの講義ノート。 Vol. 7065。 Springer Berlin Heidelberg。 pp. 29–39。CiteSeerX 10.1.1.385.4740。doi :10.1007/978-3-642-25446-8_4。ISBN 978-3-642-25445-1。
- ^ Ji, Shuiwang; Xu, Wei; Yang, Ming; Yu, Kai (2013-01-01). 「人間の行動認識のための 3D 畳み込みニューラル ネットワーク」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 35 (1): 221–231. CiteSeerX 10.1.1.169.4046 . doi :10.1109/TPAMI.2012.59. ISSN 0162-8828. PMID 22392705. S2CID 1923924.
- ^ 黄潔;周、文港。張、希林。李、後強。リー・ウェイピン(2018)。 「時間分割を行わないビデオベースの手話認識」。arXiv : 1801.10111 [cs.CV]。
- ^ Karpathy, Andrej, et al. 「畳み込みニューラルネットワークによる大規模ビデオ分類」Wayback Machineに 2019-08-06 にアーカイブされました。IEEE コンピュータービジョンおよびパターン認識会議 (CVPR)。2014 年。
- ^ Simonyan, Karen; Zisserman, Andrew (2014). 「ビデオ内の動作認識のための2ストリーム畳み込みネットワーク」arXiv : 1406.2199 [cs.CV].(2014年)。
- ^ Wang, Le; Duan, Xuhuan; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-05-22). 「Segment-Tube: フレームごとのセグメンテーションによるトリミングされていないビデオでの時空間アクションのローカリゼーション」(PDF) . Sensors . 18 (5): 1657. Bibcode :2018Senso..18.1657W. doi : 10.3390/s18051657 . ISSN 1424-8220. PMC 5982167 . PMID 29789447. 2021-03-01 にオリジナルから アーカイブ(PDF)されました。2018-09-14に取得。
- ^ ドゥアン、シュファン;王、楽。ザイ、チャンボ。鄭、南寧。張、希林。牛真興。フア、ガン(2018)。 「フレームごとのセグメンテーションを使用したトリミングされていないビデオにおける時空間アクションの共同位置特定」。2018 第 25 回 IEEE 画像処理国際会議 (ICIP)。第 25 回 IEEE 画像処理国際会議 (ICIP)。 918–922ページ。土井:10.1109/icip.2018.8451692。ISBN 978-1-4799-7061-2。
- ^ Taylor, Graham W.; Fergus, Rob; LeCun, Yann; Bregler, Christoph (2010-01-01)。時空間特徴の畳み込み学習。第 11 回ヨーロッパ コンピュータ ビジョン会議の議事録: パート VI。ECCV'10。ベルリン、ハイデルベルク: Springer-Verlag。pp. 140–153。ISBN 978-3-642-15566-6. 2022年3月31日時点のオリジナルよりアーカイブ。2022年3月31日閲覧。
- ^ Le, QV; Zou, WY; Yeung, SY; Ng, AY (2011-01-01). 「独立したサブスペース分析による動作認識のための階層的不変時空間特徴の学習」. CVPR 2011 . CVPR '11. ワシントン DC、米国: IEEE コンピュータ ソサエティ。pp. 3361–3368。CiteSeerX 10.1.1.294.5948 . doi : 10.1109 /CVPR.2011.5995496。ISBN 978-1-4577-0394-2. S2CID 6006618。
- ^ Grefenstette, Edward; Blunsom, Phil; de Freitas, Nando; Hermann, Karl Moritz (2014-04-29). 「セマンティック解析のためのディープアーキテクチャ」. arXiv : 1404.7296 [cs.CL].
- ^ Mesnil, Gregoire; Deng, Li; Gao, Jianfeng; He, Xiaodong; Shen, Yelong (2014 年 4 月)。「Web 検索用畳み込みニューラル ネットワークを使用した意味表現の学習 - Microsoft Research」。Microsoft Research。2017年 9 月 15 日時点のオリジナルよりアーカイブ。2015年 12 月 17 日閲覧。
- ^ Kalchbrenner, Nal; Grefenstette, Edward; Blunsom, Phil (2014-04-08). 「文をモデル化する畳み込みニューラルネットワーク」. arXiv : 1404.2188 [cs.CL].
- ^ Kim, Yoon (2014-08-25). 「文分類のための畳み込みニューラルネットワーク」. arXiv : 1408.5882 [cs.CL].
- ^ Collobert、Ronan、Jason Weston。「自然言語処理のための統合アーキテクチャ: マルチタスク学習を備えたディープニューラルネットワーク」Wayback Machineに 2019-09-04 にアーカイブ。「機械学習に関する第 25 回国際会議の議事録」ACM、2008 年。
- ^ Collobert, Ronan; Weston, Jason; Bottou, Leon; Karlen, Michael; Kavukcuoglu, Koray; Kuksa, Pavel (2011-03-02). 「(ほぼ) ゼロからの自然言語処理」. arXiv : 1103.0398 [cs.LG].
- ^ Yin, W; Kann, K; Yu, M; Schütze, H (2017-03-02). 「自然言語処理のための CNN と RNN の比較研究」. arXiv : 1702.01923 [cs.LG].
- ^ Bai, S.; Kolter, JS; Koltun, V. (2018). 「シーケンスモデリングのための汎用畳み込みおよび再帰ネットワークの実証的評価」. arXiv : 1803.01271 [cs.LG].
- ^ Gruber, N. (2021). 「リカレントニューラルネットワークによるテキスト内のアクションのダイナミクスの検出」。ニューラルコンピューティングとアプリケーション。33 (12): 15709–15718。doi : 10.1007 /S00521-021-06190-5。S2CID 236307579 。
- ^ Haotian, J.; Zhong, Li; Qianxiao, Li (2021). 「時系列モデリングのための畳み込みアーキテクチャの近似理論」。機械学習に関する国際会議。arXiv : 2107.09355。
- ^ レン、ハンシェン;徐碧雄。ワン・ユージン。イー、チャオ。黄、コンルイ。コウ、シャオユウ。シン、トニー。ヤン、マオ。トン、ジエ。張斉(2019)。Microsoft の時系列異常検出サービス |知識発見とデータ マイニングに関する第 25 回 ACM SIGKDD 国際会議の議事録。arXiv : 1906.03821。土井:10.1145/3292500.3330680。S2CID 182952311。
- ^ Wallach, Izhar; Dzamba, Michael; Heifets, Abraham (2015-10-09). 「AtomNet: 構造ベースの創薬における生物活性予測のためのディープ畳み込みニューラルネットワーク」. arXiv : 1510.02855 [cs.LG].
- ^ Yosinski, Jason; Clune, Jeff; Nguyen, Anh; Fuchs, Thomas; Lipson, Hod (2015-06-22). 「ディープビジュアライゼーションによるニューラルネットワークの理解」. arXiv : 1506.06579 [cs.CV].
- ^ 「トロントのスタートアップが効果的な医薬品をより早く発見する方法を開発」。The Globe and Mail。2015年10月20日時点のオリジナルよりアーカイブ。2015年11月9日閲覧。
- ^ 「スタートアップ企業がスーパーコンピューターを活用して治療法を模索」KQED Future of You 2015年5月27日。2018年12月6日時点のオリジナルよりアーカイブ。2015年11月9日閲覧。
- ^ Chellapilla, K; Fogel, DB (1999). 「専門知識に頼らずにチェッカーをプレイするニューラルネットワークの進化」IEEE Trans Neural Netw . 10 (6): 1382–91. doi :10.1109/72.809083. PMID 18252639.
- ^ Chellapilla, K.; Fogel, DB (2001). 「人間の専門知識を使わずにチェッカーのエキスパートプレイプログラムを進化させる」IEEE Transactions on Evolutionary Computation . 5 (4): 422–428. doi :10.1109/4235.942536.
- ^ フォゲル、デイビッド(2001)。ブロンディ24: AIの最先端で遊ぶ。サンフランシスコ、カリフォルニア州: モーガン・カウフマン。ISBN 978-1558607835。
- ^ Clark, Christopher; Storkey, Amos (2014). 「深層畳み込みニューラルネットワークに囲碁の遊び方を教える」arXiv : 1412.3409 [cs.AI].
- ^ Maddison, Chris J.; Huang, Aja; Sutskever, Ilya; Silver, David (2014). 「Deep Convolutional Neural Networks を使用した囲碁の動きの評価」. arXiv : 1412.6564 [cs.LG].
- ^ 「AlphaGo – Google DeepMind」。2016年1月30日時点のオリジナルよりアーカイブ。 2016年1月30日閲覧。
- ^ バイ、シャオジー;コルター、J. ジーコ。コルトゥン、ヴラドレン(2018-04-19)。 「シーケンスモデリングのための汎用畳み込みネットワークとリカレントネットワークの経験的評価」。arXiv : 1803.01271 [cs.LG]。
- ^ Yu, Fisher; Koltun, Vladlen (2016-04-30). 「Dilated Convolutions によるマルチスケールコンテキスト集約」. arXiv : 1511.07122 [cs.CV].
- ^ Borovykh, Anastasia; Bohte, Sander; Oosterlee, Cornelis W. (2018-09-17). 「畳み込みニューラルネットワークによる条件付き時系列予測」。arXiv : 1703.04691 [ stat.ML ]。
- ^ Mittelman, Roni (2015-08-03). 「非デシメーション完全畳み込みニューラルネットワークによる時系列モデリング」. arXiv : 1508.00317 [stat.ML].
- ^ チェン、イーティアン;カン・ヤンフェイ。チェン・イーシオン。王子卓(2019-06-11)。 「時間畳み込みニューラル ネットワークによる確率的予測」。arXiv : 1906.04397 [stat.ML]。
- ^ Zhao, Bendong; Lu, Huanzhang; Chen, Shangfeng; Liu, Junliang; Wu, Dongya (2017-02-01). 「時系列分類のための畳み込みニューラルネットワーク」.システム工学とエレクトロニクスのジャーナル. 28 (1): 162–169. doi :10.21629/JSEE.2017.01.18.
- ^ ペトネハージ、ガボール (2019-08-21). 「QCNN: 分位畳み込みニューラル ネットワーク」。arXiv : 1908.07978 [cs.LG]。
- ^ Hubert Mara (2019-06-07)、HeiCuBeDa Hilprecht – Heidelberg Cuneiform Benchmark Dataset for the Hilprecht Collection (ドイツ語)、heiDATA – ハイデルベルク大学の研究データの機関リポジトリ、doi :10.11588/data/IE8CCN
- ^ Hubert Mara と Bartosz Bogacz (2019)、「壊れたタブレットのコード解読: 正規化された 2D および 3D データセットにおける注釈付き楔形文字の学習課題」、第 15 回国際文書分析認識会議 (ICDAR) の議事録(ドイツ語)、シドニー、オーストラリア、pp. 148–153、doi :10.1109/ICDAR.2019.00032、ISBN 978-1-7281-3014-9、S2CID 211026941
- ^ Bogacz, Bartosz; Mara, Hubert (2020)、「幾何学的ニューラルネットワークによる 3D 楔形文字板の時代分類」、第 17 回国際手書き認識フロンティア会議 (ICFHR) の議事録、ドルトムント、ドイツ
- ^ 幾何学的ニューラルネットワークによる 3D 楔形文字板の時代分類に関する ICFHR 論文のYouTubeでのプレゼンテーション
- ^ Durjoy Sen Maitra、Ujjwal Bhattacharya、SK Parui、「CNN ベースの複数のスクリプトの手書き文字認識への共通アプローチ」Wayback Machineに 2023-10-16にアーカイブ、Document Analysis and Recognition (ICDAR)、2015 13th International Conference on、vol.、no.、pp.1021–1025、2015 年 8 月 23 日~26 日
- ^ "NIPS 2017". Interpretable ML Symposium . 2017-10-20. 2019-09-07時点のオリジナルよりアーカイブ。 2018-09-12に閲覧。
- ^ Zang, Jinliang; Wang, Le; Liu, Ziyi; Zhang, Qilin; Hua, Gang; Zheng, Nanning (2018). 「動作認識のための注意ベースの時間加重畳畳み込みニューラルネットワーク」。人工知能のアプリケーションとイノベーション。IFIP情報通信技術の進歩。第519巻。Cham:Springer International Publishing。pp. 97–108。arXiv :1803.07179。doi:10.1007 / 978-3-319-92007-8_9。ISBN 978-3-319-92006-1. ISSN 1868-4238. S2CID 4058889.
- ^ Wang, Le; Zang, Jinliang; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-06-21). 「Action Recognition by an Attention-Aware Temporal Weighted Convolutional Neural Network」(PDF) . Sensors . 18 (7): 1979. Bibcode :2018Senso..18.1979W. doi : 10.3390/s18071979 . ISSN 1424-8220. PMC 6069475 . PMID 29933555. 2018-09-13 にオリジナルから アーカイブ(PDF)されました。2018-09-14に取得。
- ^ Ong, Hao Yi; Chavez, Kevin; Hong, Augustus (2015-08-18). 「分散ディープQラーニング」. arXiv : 1508.04186v2 [cs.LG].
- ^ Mnih, Volodymyr; et al. (2015). 「深層強化学習による人間レベルの制御」. Nature . 518 (7540): 529–533. Bibcode :2015Natur.518..529M. doi :10.1038/nature14236. PMID 25719670. S2CID 205242740.
- ^ Sun, R.; Sessions, C. (2000 年 6 月). 「シーケンスの自己セグメンテーション: 連続動作の階層の自動形成」. IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics . 30 (3): 403–418. CiteSeerX 10.1.1.11.226 . doi :10.1109/3477.846230. ISSN 1083-4419. PMID 18252373.
- ^ 「CIFAR-10 上の畳み込みディープビリーフネットワーク」(PDF)。2017 年 8 月 30 日時点のオリジナルよりアーカイブ(PDF) 。2017 年 8 月 18 日閲覧。
- ^ Lee, Honglak; Grosse, Roger; Ranganath, Rajesh; Ng, Andrew Y. (2009 年 1 月 1 日)。「階層的表現のスケーラブルな教師なし学習のための畳み込みディープ ビリーフ ネットワーク」。機械学習に関する第 26 回国際会議の議事録。ACM。pp. 609–616。CiteSeerX 10.1.1.149.6800。doi : 10.1145 /1553374.1553453。ISBN 9781605585161. S2CID 12008458。
- ^ Behnke, Sven (2003). 画像解釈のための階層型ニューラルネットワーク(PDF) . コンピュータサイエンスの講義ノート. Vol. 2766. Springer. doi :10.1007/b11963. ISBN 978-3-540-40722-5. S2CID 1304548. 2017年8月10日にオリジナルからアーカイブ(PDF)されました。2016年12月28日閲覧。
- ^ Cade Metz (2016年5月18日). 「Google が AI ボットを動かすために独自のチップを製造」Wired . 2018年1月13日時点のオリジナルよりアーカイブ。2017年3月6日閲覧。
外部リンク
- CS231n: 視覚認識のための畳み込みニューラル ネットワーク — Andrej Karpathyによるスタンフォードコンピュータ サイエンスのコース「コンピュータ ビジョンにおける CNN」
- vdumoulin/conv_arithmetic: ディープラーニングのコンテキストにおける畳み込み演算に関する技術レポート。畳み込みのアニメーション。
