畳み込みニューラルネットワーク (CNN )は、フィルタ(またはカーネル )最適化によって特徴を 学習するフィードフォワードニューラルネットワーク の一種です。このタイプのディープラーニング ネットワークは、テキスト、画像、音声など、さまざまなタイプのデータを処理し、予測 するために適用されています。 [ 1 ] CNNは、コンピュータビジョン [ 2 ] や画像処理 におけるディープラーニングベースのアプローチの事実上の標準であり、ごく最近になって、場合によっては、トランスフォーマー などの新しいアーキテクチャに置き換えられました。
以前のニューラルネットワークのバックプロパゲーション中に見られた 勾配消失 と勾配爆発は、より少ない接続で共有重みを使用することによる正則化によって防止されます。 [ 3 ] [ 4 ] 例えば、全結合層の各 ニューロンでは、100×100ピクセルの画像を処理するために10,000個の重みが必要になります。しかし、カスケード畳み込み (または相互相関)カーネルを適用すると、[ 5 ] [ 6 ] 5x5サイズのタイルを処理するために各畳み込み層に必要な重みはわずか25個です。[ 7 ] [ 8 ] 上位層の特徴は、下位層の特徴と比較して、より広いコンテキストウィンドウから抽出されます。
CNNの応用例としては、以下のようなものがあります。
CNNは、入力特徴に沿ってスライドし、特徴マップとして知られる並進不変応答を提供する 畳み込み カーネルまたはフィルタの共有重みアーキテクチャに基づいて、シフト不変 または空間不変の人工ニューラルネットワークとしても知られています。 [ 14 ] [ 15 ] 直感に反して、ほとんどの畳み込みニューラルネットワークは、入力に適用するダウンサンプリング操作のために並進に対して不変ではありません。 [ 16 ]
フィードフォワードニューラルネットワークは 通常、全結合ネットワークであり、つまり、ある層 の各ニューロンは次の層 のすべてのニューロンに接続されています。これらのネットワークの「全結合」により、データの過学習 が発生しやすくなります。正則化、つまり過学習を防ぐための一般的な方法には、トレーニング中にパラメータにペナルティを課す(重み減衰など)か、接続をトリミングする(接続のスキップ、ドロップアウトなど)などがあります。堅牢なデータセットは、CNNが、データが少ないセットのバイアスではなく、特定のデータセットを特徴付ける一般化された原理を学習する可能性を高めます。[ 17 ]
畳み込みネットワークは、ニューロン 間の接続パターンが動物の視覚皮質 の構造に似ているという点で、生物学的 プロセスに触発されたものである [ 18 ] [ 19 ] [ 20 ] [ 21 ] 。個々の皮質ニューロンは、 受容野 として知られる視覚野 の限られた領域でのみ刺激に反応する。異なるニューロンの受容野は部分的に重なり合って、視覚野全体を覆っている。
CNNは、他の画像分類アルゴリズム と比較して、前処理が比較的少ない。つまり、ネットワークは自動学習によってフィルタ(またはカーネル)を最適化するように学習するのに対し、従来のアルゴリズムではこれらのフィルタは手作業で設計されていた 。これにより、プロセスが簡素化・自動化され、効率性と拡張性が向上し、人的介入によるボトルネックを克服できる。
建築 LeNet (1995)とAlexNet (2012)の畳み込み層、プーリング層、および全結合層の比較畳み込みニューラルネットワークは、入力層、隠れ層 、出力層から構成されます。畳み込みニューラルネットワークでは、隠れ層には畳み込みを実行する1つ以上の層が含まれます。通常、これには畳み込みカーネルと層の入力行列とのドット積を実行する層が含まれます。この積は通常 フロベニウス内積 であり、その活性化関数は一般的にReLU です。畳み込みカーネルが層の入力行列に沿ってスライドすると、畳み込み演算によって特徴マップが生成され、それが次の層の入力に寄与します。これに続いて、プーリング層 、全結合層、正規化層などの他の層が続きます。ここで、畳み込みニューラルネットワークがマッチドフィルタ にどれほど近いかに注目する必要があります。[ 22 ]
畳み込み層 CNNでは、入力は形状が次のテンソル です。
(入力数)×(入力高さ)×(入力幅)×(入力チャンネル数 )
畳み込み層を通過した後、画像は特徴マップ(活性化マップとも呼ばれる)に抽象化され、その形状は次のようになります。
(入力数) × (特徴マップの高さ) × (特徴マップの幅) × (特徴マップのチャネル数 )。
畳み込み層は入力を畳み込み、その結果を次の層に渡します。これは、視覚野のニューロンが特定の刺激に反応するのと似ています。[ 23 ] 各畳み込みニューロンは、受容野の データのみを処理します。
1次元畳み込みニューラルネットワークのフィードフォワードの例 全結合フィードフォワードニューラルネットワークは 特徴を学習しデータを分類するために使用できますが、このアーキテクチャは一般的に大きな入力(高解像度画像など)には実用的ではありません。各ピクセルが関連する入力特徴であるため、膨大な数のニューロンが必要になります。100 × 100 サイズの画像の全結合層では、第 2 層の各 ニューロンに 10,000 個の重みがあります。畳み込みは自由パラメータの数を減らし、ネットワークをより深くすることができます。[ 7 ] たとえば、同じ共有重みを持つ 5 × 5 のタイル領域を使用すると、必要なニューロンは 25 個だけです。共有重みを使用すると、パラメータの数が大幅に少なくなり、以前のニューラルネットワークのバックプロパゲーション 中に見られた勾配消失と勾配爆発の問題を回避するのに役立ちます。[ 3 ] [ 4 ]
処理速度を上げるために、標準的な畳み込み層は、深層畳み込みとそれに続く点畳み込みに基づく深層分離畳み込み層[ 24 ] に置き換えることができます。深層畳み込みは 、入力テンソルの各チャネルに独立して適用される空間畳み込みであり、点畳み込みは 、使用が制限された標準的な畳み込みです。1 × 1 {\displaystyle 1\times 1} 種子。
プーリング層 畳み込みネットワークには、従来の畳み込み層に加えて、ローカルおよび/またはグローバルプーリング層が含まれる場合があります。プーリング層は、ある層のニューロンクラスタの出力を次の層の単一のニューロンに結合することで、データの次元を削減します。ローカルプーリングは小さなクラスタを結合し、2 × 2 などのタイルサイズが一般的に使用されます。グローバルプーリングは、特徴マップのすべてのニューロンに作用します。[ 25 ] [ 26 ] 一般的に使用されているプーリングには、最大プーリングと平均プーリングの 2 つのタイプがあります。最大プーリングは 、特徴マップ内の各ローカルニューロンクラスタの最大値を使用し、[ 27 ] [ 28 ] 平均プーリングは 平均値を使用します。
受容野 ニューラルネットワークでは、各ニューロンは前の層のいくつかの位置から入力を受け取ります。畳み込み層では、各ニューロンは前の層の限られた領域(ニューロンの受容野 と呼ばれる)からのみ入力を受け取ります。通常、この領域は正方形(例えば5×5ニューロン)です。一方、全結合層では、受容野は前の層全体 です。したがって、各畳み込み層では、各ニューロンは前の層よりも広い入力領域から入力を受け取ります。これは、畳み込みを繰り返し適用することで、ピクセルの値だけでなく、その周囲のピクセルも考慮されるためです。拡張層を使用する場合、受容野のピクセル数は一定のままですが、複数の層の効果を組み合わせることで、受容野の寸法が大きくなるにつれて、フィールド内のピクセル密度は低くなります。
受容野のサイズを必要に応じて操作するには、標準的な畳み込み層に代わるいくつかの方法があります。たとえば、アトラス畳み込みまたは拡張畳み込み[ 29 ] [ 30 ] は、可視領域と盲領域を交互に配置することで、パラメータの数を増やすことなく受容野のサイズを拡大します。さらに、単一の拡張畳み込み層は、複数の拡張比を持つフィルタで構成できるため[ 31 ] 、可変の受容野サイズを持つことができます。
重量 ニューラルネットワークの各ニューロンは、前の層の受容野から受け取った入力値に特定の関数を適用することで出力値を計算します。入力値に適用される関数は、重みベクトルとバイアス(通常は実数)によって決定されます。学習とは、これらのバイアスと重みを繰り返し調整することです。
重みとバイアスのベクトルはフィルタ と呼ばれ、入力の特定の特徴 (例えば、特定の形状)を表します。CNNの特徴は、多くのニューロンが同じフィルタを共有できることです。これにより、各受容野が独自のバイアスとベクトル重みを持つのではなく、そのフィルタを共有するすべての受容野で単一のバイアスと単一の重みベクトルが使用されるため、メモリ使用量が削減されます。 [ 32 ]
逆畳み込み
逆畳み込みニューラルネットワークは、基本的にCNNの逆です。逆畳み込み層とアンプーリング層で構成されています。[ 33 ]
逆畳み込み層は畳み込み層の転置です。具体的には、畳み込み層は行列との乗算として表すことができ、逆畳み込み層はその行列の転置との乗算です。[ 34 ]
アンプーリング層は、層を拡張します。最大アンプーリング層は、各エントリを複数回コピーするだけなので、最も単純です。たとえば、2×2の最大アンプーリング層は[ x ] ↦ [ x x x x ] {\displaystyle [x]\mapsto {\begin{bmatrix}x&x\\x&x\end{bmatrix}}} 。
画像生成器では逆畳み込み層が使用されます。デフォルトでは周期的な市松模様のアーティファクトが生成されますが、これはアップスケールしてから畳み込みを行うことで修正できます。[ 35 ]
歴史 CNNは、生物 の脳が視覚処理を行う方法によく例えられる。[ 36 ]
視覚野の受容野 1950年代と1960年代のHubel とWiesel の研究により、ネコの視覚皮質には 、視野 の小さな領域に個別に反応するニューロンが含まれていることが示されました。眼が動いていない限り、視覚刺激が単一のニューロンの発火に影響を与える視覚空間の領域は、そのニューロンの受容野 として知られています。[ 37 ] 隣接する細胞は、類似した重複する受容野を持っています。受容野のサイズと位置は、皮質全体で系統的に変化し、視覚空間の完全な地図を形成します。各半球の皮質は、対側の視覚野 を表します。
彼らの1968年の論文では、脳内の2つの基本的な視覚細胞タイプが特定されました。[ 19 ]
単純細胞は 、受容野内の特定の方向を持つ直線状のエッジによって出力が最大化される。複雑な細胞は 受容野 が大きく、その出力は受容野の端の正確な位置に左右されない。HubelとWieselは、パターン認識タスクで使用するために、これら2種類の細胞のカスケードモデルも提案した。[ 38 ] [ 37 ]
福島の視覚モデルにおけるアナログ閾値要素1969年、福島邦彦は 、前述のHubelとWieselの研究に触発され、多層視覚特徴検出ネットワークを導入した。このネットワークでは、「1つの層内のすべての要素は同じ相互接続係数のセットを持ち、要素の配置とそれらの相互接続は、与えられた層全体で均一である」。これは畳み込みネットワークの本質的なコアであるが、重みは学習されなかった。福島は同じ論文で、ReLU (整流線形ユニット)活性化関数 も導入した。[ 39 ] [ 40 ]
ネオコグニトロン、学習可能なCNNアーキテクチャの起源「ネオコグニトロン 」[ 18 ] は1980年に福島によって導入された。[ 20 ] [ 28 ] [ 1 ] ネオコグニトロンは2つの基本的な層を導入した。
「S層」:受容野を共有する層で、後に畳み込み層として知られるようになる。この層には、前の層の特定の領域をカバーする受容野を持つユニットが含まれる。受容野を共有するグループ(ネオコグニトロンの用語では「平面」)はしばしばフィルタと呼ばれ、1つの層には通常、このようなフィルタが複数存在する。 「C層」:ダウンサンプリング層であり、受容野が前の畳み込み層のパッチをカバーするユニットが含まれています。このようなユニットは通常、そのパッチ内のユニットの活性化の加重平均を計算し、やや大きなパッチからプールされた抑制(除算正規化)を層内の異なるフィルタにわたって適用し、飽和活性化関数を適用します。パッチの重みは非負であり、元のネオコグニトロンでは学習できません。ダウンサンプリングと競合抑制により、対象物が移動した場合でも、視覚シーンの特徴や対象物を分類することができます。 数十年にわたり、ネオコグニトロンの重みを訓練するために、いくつかの教師あり学習 および教師なし学習アルゴリズムが提案されてきた。 [ 18 ] しかし今日では、CNNアーキテクチャは通常、バックプロパゲーション によって訓練される。
福島のReLU活性化関数は、すべての重みが非負であったため、彼のネオコグニトロンでは使用されませんでした。代わりに、側方抑制が使用されました。整流器は、CNNや一般的にディープニューラルネットワークで非常に人気のある活性化関数になっています。 [ 41 ]
時間における畳み込み 「畳み込み」という用語は、ニューラルネットワークにおいて、1987年の第1回ニューラル情報処理システム会議 で、本間俊輝、レス・アトラス、ロバート・マークス2世による論文で初めて登場しました。彼らの論文では、時間軸上で乗算を畳み込みに置き換え、本質的にシフト不変性を提供し、フィルタの信号処理概念 に触発され、より直接的に関連し、音声認識タスクで実証しました。[ 8 ] また、データ学習可能なシステムとして、畳み込みは本質的に相関と同等であり、重みの反転は最終的な学習関数に影響を与えないことも指摘しました(「便宜上、畳み込みの代わりに相関を*と表記します。a(t)とb(t)の畳み込みは、a(-t)とb(t)の相関と同等であることに注意してください。」)。[ 8 ] 現代のCNN実装では、便宜上、相関を行い、それを畳み込みと呼ぶのが一般的で、ここでもそうしています。
時間遅延ニューラルネットワーク 時間遅延ニューラルネットワーク(TDNN)は、1987年に アレックス・ワイベル らが音素認識のために導入したもので、シフト不変性を示す初期の畳み込みネットワークでした。 [ 42 ] TDNNは、畳み込みがデータの時間軸に沿って実行される1次元畳み込みニューラルネットワークです。これは、バックプロパゲーション を使用した勾配降下法によるトレーニングと重み共有を組み合わせた最初のCNNです。[ 43 ] したがって、ネオコグニトロンと同様にピラミッド構造を使用していますが、重みの局所的な最適化ではなく、グローバルな最適化を実行しました。[ 42 ]
TDNNは、時間次元に沿って重みを共有する畳み込みネットワークです。[ 44 ] これにより、音声信号を時間不変に処理できます。1990年にハンプシャーとワイベルは、2次元畳み込みを実行するバリアントを導入しました。[ 45 ] これらのTDNNはスペクトログラムで動作するため、結果として得られる音素認識システムは、ネオコグニトロンで処理された画像と同様に、時間と周波数シフトの両方に対して不変でした。
TDNNは遠距離音声認識の性能を向上させた。[ 46 ]
勾配降下法で学習させたCNNによる画像認識 Denker ら (1989) は手書きの郵便 番号を認識するための 2 次元 CNN システムを設計しました。[ 47 ] しかし、関連する畳み込みのカーネル 係数を決定するための効率的なトレーニング方法がなかったため、すべての係数を苦労して手作業で設計する必要がありました。[ 48 ]
Waibel ら (1987) による 1 次元 CNN のトレーニングの進歩に続いて、Yann LeCun ら (1989) [ 48 ] はバックプロパゲーションを使用して、手書き数字の画像から直接畳み込みカーネル係数を学習しました。学習は完全に自動化され、手動で係数を設計するよりも優れたパフォーマンスを発揮し、より幅広い画像認識問題と画像タイプに適していました。Wei Zhang ら (1988) [ 14 ] [ 15 ] はバックプロパゲーションを使用して、アルファベット認識用の CNN の畳み込みカーネルをトレーニングしました。このモデルは、1990 年代初頭に CNN という名前が付けられる前は、シフト不変パターン認識ニューラルネットワークと呼ばれていました。Wei Zhang らはまた、最後の全結合層を除いた同じ CNN を医療画像オブジェクトのセグメンテーション (1991) [ 49 ] およびマンモグラフィーにおける乳がん検出 (1994) [ 50 ]に適用しました。
このアプローチは、現代のコンピュータビジョン の基礎となった。
最大プーリング 1990年、山口らは、与えられた領域の最大値を計算して伝播する固定フィルタリング操作である最大プーリングの概念を導入した。彼らは、TDNNと最大プーリングを組み合わせることで、話者に依存しない単語認識システムを実現した。[ 27 ] 彼らのシステムでは、単語ごとに複数のTDNNを使用し、各音節 に1つずつ割り当てた。入力信号に対する各TDNNの結果は最大プーリングを使用して結合され、プーリング層の出力は実際の単語分類を実行するネットワークに渡された。
クレセプトロンと呼ばれるネオコグニ トロンの変種では、福島の抑制と飽和を伴う空間平均化の代わりに、J. Wengらは1993年に最大プーリングを使用しました。これは、ダウンサンプリングユニットがそのパッチ内のユニットの活性化の最大値を計算するもので、[ 51 ] この方法を視覚分野に導入しました。
最大プーリングは現代のCNNでよく使われる。[ 52 ]
LeNet-5 LeNet-5は、 1995年にLeCun らによって開発された先駆的な7層畳み込みネットワークであり[ 53 ] 、32×32ピクセルの画像にデジタル化された小切手 の手書き数字を分類します。より高解像度の画像を処理するには、より大きく、より多くの層の畳み込みニューラルネットワークが必要となるため、この技術は利用可能な計算リソースによって制約されます。
それは(1995年時点で)他の商用小切手読み取りシステムよりも優れていた。このシステムはNCR の小切手読み取りシステムに統合され、1996年6月以降、アメリカのいくつかの銀行で導入され、1日に数百万枚の小切手を読み取っていた。[ 54 ]
特徴 従来、画像認識には多層パーセプトロン (MLP)モデルが用いられてきた。しかし、ノード間の完全な接続性によって次元の呪いが生じ、高解像度画像では計算が困難であった。RGB カラー チャネルを持つ1000×1000ピクセルの画像では、完全接続されたニューロン1つあたり300万個の重みが存在し、これは大規模に効率的に処理するには多すぎる。
CNN層は3次元に配置されています。 例えば、CIFAR-10 では画像サイズは32×32×3(幅32、高さ32、カラーチャンネル3)なので、通常のニューラルネットワークの最初の隠れ層にある単一の全結合ニューロンは32×32×3=3,072個の重みを持つことになります。しかし、200×200の画像では、ニューロンの重みは200×200×3=120,000個になります。
また、このようなネットワークアーキテクチャはデータの空間構造を考慮しておらず、離れた位置にある入力ピクセルと近い位置にあるピクセルを同じように扱います。これは、グリッドトポロジーを持つデータ(画像など)における参照の局所性を、計算的にも意味的にも無視することになります。したがって、ニューロンの完全な接続性は、 空間的に局所的な 入力パターンが支配的な画像認識などの目的には無駄です。
畳み込みニューラルネットワークは、視覚野 の挙動を模倣するように設計された多層パーセプトロンの変種です。これらのモデルは、自然画像に存在する強い空間的局所相関を利用することで、MLPアーキテクチャが抱える課題を軽減します。MLPとは異なり、CNNには次のような特徴があります。
ニューロンの3Dボリューム。CNNの層には、幅、高さ、奥行きの3次元に配置されたニューロンがあります。 [ 72 ] 畳み込み層内の各ニューロンは、受容野と呼ばれる前の層の小さな領域にのみ接続されています。局所的に接続された層と完全に接続された層の両方を含む異なるタイプの層が積み重ねられ、CNNアーキテクチャを形成します。 局所的な接続性:受容野の概念に基づき、CNNは隣接する層のニューロン間に局所的な接続パターンを強制することで、空間的な局所性を活用します。このアーキテクチャにより、学習された「フィルタ」は、空間的に局所的な入力パターンに対して最も強い応答を生成します。このような層を多数積み重ねることで、非線形フィルタは次第にグローバル化(つまり、ピクセル空間のより広い領域に応答する)し、ネットワークはまず入力の小さな部分の表現を作成し、次にそれらからより広い領域の表現を組み立てます。 重みの共有: CNN では、各フィルタは視覚野全体に複製されます。これらの複製されたユニットは同じパラメータ化 (重みベクトルとバイアス) を共有し、特徴マップを形成します。これは、特定の畳み込み層内のすべてのニューロンが、それぞれの応答フィールド内の同じ特徴に反応することを意味します。このようにユニットを複製することで、結果として得られる活性化マップは、視覚野内の入力特徴の位置のシフトに対して等変に なります。つまり、層のストライドが 1 であれば、並進等変性が保証されます。 [ 73 ] プーリング: CNN のプーリング層 では、特徴マップが矩形のサブ領域に分割され、各矩形内の特徴は、一般的に平均値または最大値を取ることによって、独立して単一の値にダウンサンプリングされます。プーリング操作は、特徴マップのサイズを縮小するだけでなく、そこに含まれる特徴に局所的な並進不変性を ある程度付与し、CNN がそれらの位置の変動に対してより頑健になることを可能にします。[ 16 ] これらの特性が相まって、CNNは画像処理問題 においてより優れた汎化性能を発揮します。重み共有によって学習される自由パラメータ の数が大幅に削減されるため、ネットワークの実行に必要なメモリ容量が低減され、より大規模で高性能なネットワークの学習が可能になります。
構成要素 CNNアーキテクチャは、微分可能な関数を用いて入力ボリュームを出力ボリューム(例えば、クラススコア)に変換する、複数の異なるレイヤーの積み重ねによって構成されます。一般的に使用されるレイヤーにはいくつかの種類があり、これらについては以下で詳しく説明します。
畳み込み層のニューロン(青色)と、その受容野(赤色)の接続図
畳み込み層 畳み込みを実行する具体的な例を示します。畳み込みはストライド1、ゼロパディング、カーネルサイズ3×3です。畳み込みカーネルは離散ラプラシアン演算子 です。 畳み込み層は、CNN の中核となる構成要素です。この層のパラメータは、受容野は小さいものの、入力ボリュームの全深度にわたって広がる学習可能なフィルタ(またはカーネル )のセットで構成されています。順伝播中、各フィルタは入力ボリュームの幅と高さにわたって畳み込まれ、フィルタエントリと入力との ドット積 が計算され、そのフィルタの 2 次元の活性化マップ が生成されます。その結果、ネットワークは、入力内の特定の空間位置で特定のタイプのフィーチャ を検出したときに活性化するフィルタを学習します。[ 74 ] [ nb 1 ]
すべてのフィルタのアクティベーションマップを深度方向に積み重ねることで、畳み込み層の出力ボリューム全体が形成されます。出力ボリューム内の各エントリは、入力の小さな領域を参照するニューロンの出力として解釈することもできます。アクティベーションマップの各エントリは、フィルタを定義するのと同じパラメータセットを使用します。
自己教師あり学習は、 マスク比の高いスパースパッチとグローバル応答正規化層を使用することで、畳み込み層での利用に適応されている。
ローカル接続 典型的なCNNアーキテクチャ 画像などの高次元入力を扱う場合、ニューロンを前のボリュームのすべてのニューロンに接続するのは現実的ではありません。なぜなら、そのようなネットワークアーキテクチャではデータの空間構造が考慮されないからです。畳み込みネットワークは、隣接する層のニューロン間に疎な局所接続 パターンを適用することで、空間的に局所的な相関を利用します。つまり、各ニューロンは入力ボリュームのごく小さな領域にのみ接続されます。
この接続性の程度は、ニューロンの受容野 と呼ばれるハイパーパラメータです。接続は 空間的に局所的 (幅と高さ方向)ですが、入力ボリュームの深さ全体に常に広がっています。このようなアーキテクチャにより、学習されたフィルタは空間的に局所的な入力パターンに対して最も強い応答を生成します。[ 75 ]
パラメータ共有 畳み込み層では、自由パラメータの数を制御するためにパラメータ共有方式が用いられます。この方式は、ある空間位置でパッチ特徴を計算するのに有用であれば、他の位置でも計算に有用であるはずだという仮定に基づいています。単一の2次元深度スライスを深度スライス とすると、各深度スライス内のニューロンは同じ重みとバイアスを使用するように制約されます。
単一の深度スライス内のすべてのニューロンは同じパラメータを共有するため、畳み込み層の各深度スライスにおける順伝播は、ニューロンの重みと入力ボリュームの畳み込みとして計算できます。 [ nb 2 ] したがって、重みのセットをフィルタ(またはカーネル )と呼び、入力と畳み込むのが一般的です。この畳み込みの結果は活性化マップ であり、各フィルタの活性化マップのセットは深度方向に沿って積み重ねられ、出力ボリュームが生成されます。パラメータの共有は、CNNアーキテクチャの並進不変性 に貢献します。 [ 16 ]
パラメータ共有の仮定は、場合によっては意味をなさないことがあります。これは特に、CNNへの入力画像に特定の中心構造がある場合に当てはまります。このような場合、異なる空間位置でまったく異なる特徴が学習されることが期待されます。具体的な例としては、入力が画像の中央に配置された顔である場合が挙げられます。この場合、画像の異なる部分で、目特有の特徴や髪特有の特徴が学習されることが期待されます。このような場合、パラメータ共有のスキームを緩和し、代わりにその層を単に「局所的に接続された層」と呼ぶのが一般的です。この層では、畳み込みカーネルのパラメータは共有されません。代わりに、ネットワークは各空間位置に対して独立した重みとバイアスを学習します。これにより、各位置が独自の特徴学習能力を持つことができ、明確な中心構造や不規則な特徴を持つ画像を処理するのに適しています。
プーリング層 ストライド2の2x2最大プーリングの計算例 2x2フィルタとストライド=2を使用した最大プーリング CNN のもう 1 つの重要な概念はプーリングであり、これは非線形ダウンサンプリング の一種として使用されます。プーリングは、最も重要な情報を保持しながら入力特徴マップの空間次元 (高さと幅) を縮小するため、ダウンサンプリングを提供します。プーリングを実装するための非線形関数はいくつかあり、最大プーリング と平均プーリング が最も一般的です。プーリングは、入力の小さな領域から情報を集約して入力特徴マップのパーティションを作成します。通常は固定サイズのウィンドウ (2x2 など) を使用し、ストライド (多くの場合 2) を適用してウィンドウを入力全体に移動します。 [ 77 ] ストライドが 1 より大きい場合、プーリングはダウンサンプリングを実行しません。これは、特徴マップのサイズを縮小することなく、プーリング ウィンドウを一度に 1 ステップずつ入力全体に移動するだけだからです。言い換えれば、ストライドは、プーリング ウィンドウが入力全体にどれだけ移動するかを決定することで、実際にダウンサンプリングを引き起こします。
直感的に、特徴の正確な位置は、他の特徴に対するおおよその位置よりも重要ではありません。これが、畳み込みニューラルネットワークでプーリングを使用する背後にある考え方です。プーリング層は、表現の空間サイズを段階的に縮小し、ネットワークのパラメータ数、メモリ使用量、計算量を削減し、したがって過 学習 も制御します。これはダウンサンプリングとして知られています。CNN アーキテクチャでは、連続する畳み込み層 (通常はReLU 層 などの活性化関数が続く) の間にプーリング層を周期的に挿入するのが一般的です。[ 74 ] : 460–461 プーリング層は局所的な並進不変性に貢献しますが、グローバル プーリングの形式が使用されない限り、CNN でグローバルな並進不変性は提供しません。[ 16 ] [ 73 ] プーリング層は通常、入力の各深度またはスライスに対して独立して動作し、空間的にサイズ変更します。最大プーリングの非常に一般的な形式は、2×2サイズのフィルタを2のストライドで適用したレイヤーで、入力の各深度スライスを幅と高さの両方で2ずつサブサンプリングし、アクティベーションの75%を破棄します。f X 、 Y ( S ) = 最大 1 、 b = 0 1 S 2 X + 1 、 2 Y + b 。 {\displaystyle f_{X,Y}(S)=\max _{a,b=0}^{1}S_{2X+a,2Y+b}.} この場合、すべての最大値演算 は4つの数値に対して行われます。深さの次元は変わりません(これは他の形式のプーリングにも当てはまります)。
最大プーリングに加えて、プーリングユニットは平均プーリングやℓ2ノルム プーリング などの他 の関数を使用することもできます。平均プーリングは歴史的によく使用されていましたが、実際には一般的にパフォーマンスが優れている最大プーリングと比較して、最近では人気がなくなってきています。[ 78 ]
表現サイズの高速な空間縮小の影響により、最近ではより小さなフィルタを使用する傾向[ 79 ] 、またはプーリング層を完全に破棄する傾向 [ 80 ] が見られます。
RoIプーリングのサイズは2x2です。この例では、領域提案(入力パラメータ)のサイズは7x5です。
チャネル最大プーリング チャネル最大プーリング(CMP)演算レイヤーは、冗長な情報を除去する目的で、連続する特徴マップの対応する位置間でチャネル側に沿ってMP演算を実行します。CMPは、重要な特徴をより少ないチャネル内に集約します。これは、より多くの識別特徴を必要とするきめ細かい画像分類にとって重要です。一方、CMP演算のもう1つの利点は、最初の全結合(FC)レイヤーに接続する前に特徴マップのチャネル数を小さくすることです。MP演算と同様に、CMPレイヤーの入力特徴マップと出力特徴マップをそれぞれF ∈ R(C×M×N)とC ∈ R(c×M×N)と表記します。ここで、Cとcは入力特徴マップと出力特徴マップのチャネル数、MとNはそれぞれ特徴マップの幅と高さです。CMP演算は特徴マップのチャネル数のみを変更することに注意してください。特徴マップの幅と高さは変更されません。これはMP演算とは異なります。[ 81 ]
プーリング手法に関するレビューについては、[ 82 ] [ 83 ] を参照してください。
ReLU層 ReLUは整流線形ユニット の略称です。 1941年にアルストン・ハウスホルダー によって提案され[ 84 ] 、 1969年に福島邦彦 によってCNNで使用されました[ 39 ]。ReLU は非飽和活性化関数を適用します。 f ( x ) = 最大 ( 0 、 x ) {\textstyle f(x)=\max(0,x)} [ 69 ] 負の値をゼロに設定することで、活性化マップから負の値を効果的に除去します。[ 85 ]畳み込み 層の受容野に影響を与えることなく、決定関数 とネットワーク全体に非線形性 を導入します。2011 年、Xavier Glorot、Antoine Bordes、 Yoshua Bengio は、2011 年以前に広く使用されていた活性化関数と比較して、ReLU を使用するとより深いネットワークのトレーニングが改善されることを発見しました。[ 86 ]
非線形性を高めるために他の関数も使用できます。たとえば、飽和双曲線正接関数などです。 f ( x ) = タン ( x ) {\displaystyle f(x)=\tanh(x)} 、f ( x ) = | タン ( x ) | {\displaystyle f(x)=|\tanh(x)|} 、そしてシグモイド関数 σ ( x ) = ( 1 + e − x ) − 1 {\textstyle \sigma (x)=(1+e^{-x})^{-1}} ReLUは、汎化 精度に大きなペナルティを与えることなくニューラルネットワークを数倍速く学習できるため、他の関数よりも好まれることが多い。 [ 87 ]
ハイパーパラメータ ハイパーパラメータとは、学習プロセスを制御するために使用される様々な設定のことです。CNNは、標準的な多層パーセプトロン(MLP)よりも多くのハイパーパラメータを使用します。
パッド パディングとは、画像の境界に(通常は)0の値を持つピクセルを追加することです。これは、境界ピクセルが通常は単一の受容野インスタンスにしか関与しないため、出力から過小評価(消失)されないようにするためです。適用されるパディングは、通常、対応するカーネルの次元より1小さい値になります。たとえば、3x3カーネルを使用する畳み込み層には、2ピクセルのパディング、つまり画像の両側に1ピクセルずつ追加されます。
ストライド ストライドとは、解析ウィンドウが各反復処理で移動するピクセル数です。ストライドが2の場合、各カーネルは前のカーネルから2ピクセルずれた位置に配置されます。
フィルターの数 特徴マップのサイズは深度とともに減少するため、入力層に近い層ではフィルタの数が少なくなり、上位層ではフィルタの数が多くなる傾向があります。各層での計算を均一化するために、特徴値v a とピクセル位置の積は、層間でほぼ一定に保たれます。入力に関するより多くの情報を保持するには、活性化の総数(特徴マップの数とピクセル位置の数の積)を、層ごとに減少しないようにする必要があります。
特徴マップの数は処理能力を直接制御し、利用可能なサンプル数とタスクの複雑さに依存します。
フィルタ(またはカーネル)サイズ文献に見られる一般的なフィルタサイズは大きく異なり、通常はデータセットに基づいて選択されます。典型的なフィルタサイズは1x1から7x7までです。有名な例として、AlexNetは 3x3、5x5、11x11を使用しました。Inceptionv3は 1x1、3x3、5x5を使用しました。
課題は、特定のデータセットが与えられた場合に、過学習する ことなく適切なスケールで抽象化を作成するために、適切な粒度レベルを見つけることです。
拡張 膨張処理では、カーネル内のピクセルを無視します。これにより、信号損失を大幅に抑えつつ、処理メモリを削減できます。3x3 カーネルに対して 2 の膨張処理を行うと、カーネルは 5x5 に拡張されますが、処理されるピクセルは 9 個 (均等間隔) のままです。具体的には、膨張処理後に処理されるピクセルは、セル (1,1), (1,3), (1,5), (3,1), (3,3), (3,5), (5,1), (5,3), (5,5) です。ここで、(i,j) は拡張された 5x5 カーネルの i 行目、j 列目のセルを表します。同様に、4 の膨張処理を行うと、カーネルは 7x7 に拡張されます。
翻訳の等変性とエイリアシング CNNは入力のシフトに対して不変であると一般的に考えられています。CNN内の畳み込み層またはプーリング層のうち、ストライドが1より大きい層は、確かに入力の並進に対して等変です。 [ 73 ] しかし、ストライドが1より大きい層はナイキスト・シャノン標本化定理を 無視し、入力信号のエイリアシング を引き起こす可能性があります。[ 73 ] 原理的には、CNNはアンチエイリアシングフィルタを実装できますが、実際にはそうならないことが観察されており、[ 88 ] そのため、並進に対して等変ではないモデルが生成されます。
さらに、CNN が全結合層を使用する場合、全結合層は入力のシフトに対して不変ではないため、並進等変性は並進不変性を意味しません。[ 89 ] [ 16 ] 完全な並進不変性を実現する 1 つの解決策は、ネットワーク全体でダウンサンプリングを一切行わず、最後の層でグローバル平均プーリングを適用することです。[ 73 ] さらに、ダウンサンプリング操作の前にアンチエイリアシングを 行う、空間変換ネットワーク、データ 拡張 、プーリングと組み合わせたサブサンプリング、カプセルニューラルネットワーク など、いくつかの部分的な解決策が 提案 されています。[ 90 ] [ 91 ] [ 92 ]
正則化手法 正則化とは、 不適切な問題を解決したり、 過学習を 防ぐために、追加情報を導入するプロセスです。CNNは様々な種類の正則化を利用します。
経験的
ドロップアウト ネットワークはパラメータが非常に多いため、過学習を起こしやすい。過学習を軽減する手法の一つに、2014年に導入されたドロップアウトがある。 [ 95 ] 各トレーニング段階で、個々のノードは一定の確率でネットワークから「ドロップアウト」(無視)される。1 − p {\displaystyle 1-p} または確率的に保持されているp {\displaystyle p} これにより、縮小されたネットワークが残ります。ドロップアウトされたノードへの入力エッジと出力エッジも削除されます。この段階では、縮小されたネットワークのみがデータに基づいて学習されます。その後、削除されたノードは元の重みでネットワークに再挿入されます。
トレーニング段階では、p {\displaystyle p} 通常は0.5ですが、入力ノードの場合は、入力ノードが無視されると情報が直接失われるため、通常ははるかに高くなります。
トレーニング終了後のテスト時には、理想的にはすべての可能な値のサンプル平均を求めたい。2 n 2n ドロップアウトしたネットワーク。残念ながら、これは大きな値では実現不可能です。n {\displaystyle n} しかし、各ノードの出力に係数を掛けた完全なネットワークを使用することで近似値を求めることができます。p {\displaystyle p} したがって、どのノードの出力の期待値も トレーニング段階と同じです。これがドロップアウト法の最大の貢献です。2 n 2n ニューラルネットワークは、モデルの組み合わせを可能にするため、テスト時には単一のネットワークのみをテストすれば済みます。
ドロップアウトは、すべてのノードをすべてのトレーニングデータで学習させることを避けることで、過学習を抑制します。また、トレーニング速度も大幅に向上させます。これにより、ディープニューラルネットワーク であっても、モデルの組み合わせが実用的になります。この手法はノード間の相互作用を減らし、新しいデータに対してより汎化性能の高い、より堅牢な特徴を学習させるようです 。
DropConnect DropConnectはドロップアウトの一般化であり、各出力ユニットではなく、各接続が確率的にドロップされる。1 − p {\displaystyle 1-p} 。各ユニットは、前の層のユニットのランダムなサブセットから入力を受け取ります。[ 96 ]
DropConnectは、モデル内に動的なスパース性を導入するという点でドロップアウトに似ていますが、スパース性が層の出力ベクトルではなく重みに適用されるという点で異なります。つまり、DropConnectを適用した全結合層は、トレーニング段階で接続がランダムに選択される疎結合層になります。
確率的プーリング ドロップアウトの大きな欠点は、ニューロンが完全に接続されていない畳み込み層では、同じ効果が得られないことである。
ドロップアウトよりも前の2013年には、確率的プーリングと呼ばれる手法[ 97 ] によって、従来の決定論的な プーリング操作が確率的手順に置き換えられました。この手順では、各プーリング領域内の活性化は、プーリング領域内の活動によって与えられる多項分布 に従ってランダムに選択されます。このアプローチはハイパーパラメータがなく、ドロップアウトやデータ拡張 などの他の正則化アプローチと組み合わせることができます。
確率的プーリングの別の見方としては、標準的な最大プーリングと同等だが、入力画像の多くのコピーがあり、それぞれに小さな局所的な変形があるというものがある。これは入力画像の明示的な 弾性変形 に似ており、[ 98 ] MNISTデータセット で優れたパフォーマンスを発揮する。[ 98 ] 多層モデルで確率的プーリングを使用すると、上位層の選択が下位層の選択とは独立しているため、指数関数的な数の変形が得られる。
人工データ モデルの過学習の程度は、その能力と受けるトレーニング量によって決まるため、畳み込みネットワークにトレーニング例を増やすことで過学習を減らすことができます。特に、一部を後でのテストのために残しておく必要があることを考慮すると、トレーニングに利用できるデータが十分でないことが多いため、新しいデータをゼロから生成するか(可能な場合)、既存のデータを摂動させて新しいデータを作成するかの 2 つのアプローチがあります。後者は 1990 年代半ばから使用されています。[ 53 ] 例えば、入力画像を切り抜いたり、回転させたり、リサイズしたりして、元のトレーニング セットと同じラベルを持つ新しい例を作成できます。[ 99 ]
明示的
早期中止 ネットワークの過学習を防ぐ最も簡単な方法の一つは、過学習が発生する前に学習を停止することです。ただし、学習プロセスが中断されるという欠点があります。
パラメータの数 過学習を防ぐもう一つの簡単な方法は、パラメータ数を制限することです。これは通常、各層の隠れユニット数を制限したり、ネットワークの深さを制限したりすることで実現されます。畳み込みネットワークの場合、フィルタサイズもパラメータ数に影響します。パラメータ数を制限すると、ネットワークの予測能力が直接的に制限され、データに対して実行できる関数の複雑さが軽減されるため、過学習の量が抑制されます。これは「ゼロノルム 」に相当します。
体重減少 単純な正則化手法として、重み減衰があります。これは、各ノードの誤差に、重みの合計(L1ノルム )または重みベクトルの二乗(L2ノルム )に比例する追加の誤差を加えるものです。比例定数(ハイパーパラメータ「alpha」)を大きくすることで、許容可能なモデルの複雑さを軽減でき、結果として大きな重みベクトルに対するペナルティが大きくなります。
L2正則化は最も一般的な正則化手法です。これは、目的関数においてすべてのパラメータの二乗値に直接ペナルティを課すことで実現できます。L2正則化は、ピークの大きい重みベクトルに強いペナルティを課し、拡散した重みベクトルを好むという直感的な解釈が可能です。重みと入力の間には乗法的な相互作用があるため、ネットワークが特定の入力を多用するのではなく、すべての入力を少しずつ利用するように促すという有用な特性があります。
L1正則化もよく用いられます。これは最適化の際に重みベクトルを疎にします。つまり、L1正則化を用いたニューロンは、最も重要な入力の疎な部分集合のみを使用するようになり、ノイズの多い入力に対してほぼ不変になります。L1正則化とL2正則化を組み合わせることも可能で、これはエラスティックネット正則化 と呼ばれます。
最大ノルム制約 もう一つの正則化の方法は、各ニューロンの重みベクトルの大きさに絶対的な上限を設け、射影勾配降下法 を用いてその制約を強制することです。実際には、これはパラメータ更新を通常通り実行し、その後、重みベクトルをクランプすることで制約を強制することに相当します。w → {\displaystyle {\vec {w}}} すべてのニューロンが満たす‖ w → ‖ 2 < c {\displaystyle \|{\vec {w}}\|_{2}<c} . 典型的な値c {\displaystyle c} 3〜4 のオーダーである。この形式の正則化を使用すると改善が見られるという論文もある[ 100 ] 。
階層的な座標系 プーリングでは、高レベルのパーツ(顔画像の鼻と口など)間の正確な空間的関係が失われます。これらの関係は、本人認識に必要です。各特徴が複数のプールに存在するようにプールを重ね合わせることで、情報を保持しやすくなります。変換だけでは、異なる向きやスケールなど、根本的に新しい視点への幾何学的関係の理解を外挿することはできません。一方、人間は外挿が非常に得意で、新しい形状を一度見れば、異なる視点からでもそれを認識できます。[ 101 ]
この問題に対処する従来の一般的な方法は、ネットワークをさまざまな方向、スケール、照明などの変換されたデータでトレーニングし、ネットワークがこれらの変化に対応できるようにすることです。これは、大規模なデータセットでは計算負荷が高くなります。代替案は、座標フレームの階層を使用し、特徴の形状と網膜 に対する姿勢の結合を表すためにニューロンのグループを使用することです。網膜に対する姿勢は、網膜の座標フレームと固有特徴の座標フレームの関係です。[ 102 ]
したがって、何かを表現する一つの方法は、その中に座標系を埋め込むことです。これにより、各部分の姿勢の一貫性を利用して大きな特徴を認識できます(例えば、鼻と口の姿勢は顔全体の姿勢を一貫して予測します)。このアプローチにより、下位レベル(例えば、鼻と口)が姿勢の予測に同意する場合、上位レベル(例えば、顔)の存在が保証されます。姿勢を表す神経活動のベクトル(「姿勢ベクトル」)は、線形演算としてモデル化された空間変換を可能にし、ネットワークが視覚的実体の階層を学習し、視点を超えて一般化することを容易にします。これは、人間の視覚系が 形状を表現するために座標系を課す方法と似ています。[ 103 ]
アプリケーション
画像認識 CNNは画像認識 システムでよく使用されます。2012年には、 MNISTデータベース で0.23%のエラー率 が報告されました。[ 28 ] CNNを画像分類に使用する別の論文では、学習プロセスが「驚くほど高速」であると報告されています。同じ論文では、2011年時点でMNISTデータベースとNORBデータベースで最良の結果が達成されました。[ 25 ] その後、 AlexNet [ 104 ] と呼ばれる同様のCNNがImageNet大規模視覚認識チャレンジ 2012で優勝しました。
顔認識 に適用した場合、CNNはエラー率の大幅な低下を達成しました。[ 105 ] 別の論文では、「10人以上の被写体の5,600枚の静止画像」で97.6%の認識率が報告されています。[ 21 ] CNNは手動トレーニング後にビデオ品質を 客観的に評価するために使用され、結果として得られたシステムは非常に低い二乗平均平方根誤差 を示しました。[ 106 ]
ImageNet大規模視覚認識チャレンジは 、数百万枚の画像と数百のオブジェクトクラスを含む、オブジェクト分類と検出のベンチマークです。大規模視覚認識チャレンジであるILSVRC 2014 [ 107 ] では、上位にランクインしたほぼすべてのチームが基本フレームワークとしてCNNを使用しました。優勝したGoogLeNet [ 108 ] ( DeepDream の基盤)は、オブジェクト検出の平均精度 を0.439329に向上させ、分類エラーを0.06656に削減し、現在までで最高の結果となりました。そのネットワークは30層以上を適用しました。ImageNetテストでの畳み込みニューラルネットワークのこのパフォーマンスは、人間のパフォーマンスに近かったのです。[ 109 ] 最高のアルゴリズムでも、花の茎の上の小さなアリや手に羽根ペンを持っている人など、小さくて細いオブジェクトには依然として苦労しています。また、現代のデジタルカメラでますます一般的になっているフィルターで歪んだ画像にも苦労しています。対照的に、そういった種類の画像は人間にとってほとんど問題にならない。しかし、人間は他の問題には苦労する傾向がある。例えば、犬の種類や鳥の種類といった細かいカテゴリーに物体を分類するのは苦手だが、畳み込みニューラルネットワークはこうした分類を得意としている。
2015年、多層CNNは、逆さまや部分的に遮蔽された場合でも、さまざまな角度から顔を検出する能力を実証し、競争力のある性能を発揮しました。このネットワークは、さまざまな角度と向きの顔を含む20万枚の画像と、顔のない2000万枚の画像のデータベースでトレーニングされました。彼らは5万回の反復で128枚の画像のバッチを使用しました。[ 110 ]
動物の行動検出 CNNは、生態学および行動学の研究において、視覚データから動物の行動を自動的に検出および定量化するために応用されており、[ 130 ] [ 131 ] 動物の識別、[ 132 ] [ 133 ] 個体の追跡、[ 134 ] 姿勢の推定、[ 135 ] [ 136 ] [ 137 ] 摂食などの特定のアクションの分類、[ 138 ]および社会的相互作用 [ 131 ] [ 138 ] を可能にしています。マルチオブジェクト追跡および時間モデリングと組み合わせることで、これらのシステムは、長時間の記録から行動シーケンスを抽出でき、手動による注釈への依存を減らし、個体差、ソーシャルネットワーク、および集団ダイナミクスの研究のスループットを向上させます。
異常検知 1次元畳み込みを用いたCNNが、教師なしモデルによって周波数領域(スペクトル残差)の時系列データに適用され、時間領域における異常を検出した。[ 139 ]
行く CNNはコンピュータ囲碁 で使用されています。2014年12月、ClarkとStorkeyは 、人間のプロ棋士の対局データベースから教師あり学習で訓練されたCNNがGNU Goを 上回り、モンテカルロ木探索 Fuego 1.1に対してFuegoがプレイするのにかかる時間のほんの一部で勝利できることを示す論文を発表しました。[ 147 ] その後、大規模な12層の畳み込みニューラルネットワークが、局面の55%でプロの手を正しく予測し、6段の 人間の棋士の精度に匹敵することが発表されました。訓練された畳み込みネットワークを探索なしで囲碁の対局に直接使用した場合、従来の探索プログラムGNU Goを97%の対局で上回り、1手あたり1万回のプレイアウト(約100万局面)をシミュレートするモンテカルロ木 探索プログラムFuegoのパフォーマンスに匹敵しました。[ 148 ]
MCTS を駆動する、試行する手を選択するための CNN (「ポリシー ネットワーク」) と局面を評価するための CNN (「バリュー ネットワーク」) の 2 つが、当時最高の人間プレイヤーを初めて破ったAlphaGoで使用されました。 [ 149 ]
ディープQネットワーク ディープQネットワーク(DQN)は、深層ニューラルネットワークと強化学習の一種である Q学習 を組み合わせた深層学習モデルの一種です。従来の強化学習エージェントとは異なり、CNNを利用するDQNは、強化学習によって高次元の感覚入力から直接学習することができます。[ 165 ]
予備的な結果は2014年に発表され、2015年2月に付随する論文が発表された。[ 166 ] この研究では、Atari 2600 ゲームへの応用について説明している。他の深層強化学習モデルはこれに先行していた。[ 167 ]
ディープビリーフネットワーク 畳み込みディープビリーフネットワーク (CDBN)は、畳み込みニューラルネットワークと非常によく似た構造を持ち、ディープビリーフネットワークと同様にトレーニングされます。そのため、CNNと同様に画像の2D構造を活用し、ディープビリーフネットワーク と同様に事前トレーニングを利用します。多くの画像処理および信号処理タスクで使用できる汎用的な構造を提供します。CDBNを使用して、CIFAR [ 168 ] などの標準的な画像データセットでベンチマーク結果が得られています。[ 169 ]
ニューラル抽象化ピラミッド
ニューラル抽象化ピラミッド 畳み込みニューラルネットワークのフィードフォワードアーキテクチャは、ニューラル抽象化ピラミッド[ 170 ] において、側方接続とフィードバック接続によって拡張されました。結果として得られるリカレント畳み込みネットワークは、コンテキスト情報を柔軟に組み込むことで、局所的な曖昧さを反復的に解消することを可能にします。従来のモデルとは対照的に、セマンティックセグメンテーション、画像再構成、オブジェクト位置特定などのタスクにおいて、最高解像度の画像のような出力が生成されました。
注記 ↑ 画像データ以外の種類のデータ、例えば音声データに適用する場合、「空間位置」は時間領域 、周波数領域 、またはその他の数学的空間 のさまざまな点に対応する可能性があります。 ↑ そのため「畳み込み層」という名前が付けられました ↑ いわゆるカテゴリデータ 。
参考文献 1 2 LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015-05-28). "ディープラーニング" . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . ISSN 1476-4687 . PMID 26017442 . ↑ LeCun, Y.; Boser, B.; Denker, JS; Henderson, D.; Howard, RE; Hubbard, W.; Jackel, LD (1989 年 12 月). "手書き郵便番号認識へのバックプロパゲーションの適用" . Neural Computation . 1 (4): 541– 551. doi : 10.1162/neco.1989.1.4.541 . ISSN 0899-7667 . 1 2 Venkatesan, Ragav; Li, Baoxin (2017-10-23). Convolutional Neural Networks in Visual Computing: A Concise Guide . CRC Press. ISBN 978-1-351-65032-8 2023年10月16日にオリジナルからアーカイブされました。2020年12月13日 に取得 。1 2 Balas, Valentina E.; Kumar, Raghvendra; Srivastava, Rajshree (2019-11-19). Recent Trends and Advances in Artificial Intelligence and Internet of Things . Springer Nature. ISBN 978-3-030-32644-9 2023年10月16日にオリジナルからアーカイブされました。2020年12月13日 に取得 。↑ Zhang, Yingjie; Soon, Hong Geok; Ye, Dongsen; Fuh, Jerry Ying Hsi; Zhu, Kunpeng (2020年9月). "ハイブリッド畳み込みニューラルネットワークを用いたマシンビジョンによる粉末床溶融プロセス監視". IEEE Transactions on Industrial Informatics . 16 (9): 5769–5779 . Bibcode : 2020ITII...16.5769Z . doi : 10.1109/TII.2019.2956078 . ISSN 1941-0050 . S2CID 213010088 . ↑ Chervyakov, NI; Lyakhov, PA; Deryabin, MA; Nagornov, NN; Valueva, MV; Valuev, GV (2020 年 9 月) 「畳み込みニューラルネットワークのハードウェア コストを削減するための剰余数システムに基づくソリューション」 Neurocomputing . 407 : 439– 453. doi : 10.1016/j.neucom.2020.04.018 . S2CID 219470398 . 2023 年 6 月 29 日にオリジナルから アーカイブ済み. 2023 年 8 月 12 日 に取得 .畳み込みニューラルネットワークは 、 コンピュータ ビジョン、音声認識、マルウェア検出、金融における時系列分析など、幅広いアプリケーションで現在使用されているディープ ラーニング アーキテクチャです。 1 2 Aghdam, Hamed Habibi; Heravi, Elnaz Jahani (2017-05-30). 畳み込みニューラルネットワークガイド:交通標識の検出と分類への実践的応用 . スイス、チャム:Springer. ISBN 978-3-319-57549-0 OCLC 987790957。 1 2 3 Homma, Toshiteru; Les Atlas; Robert Marks II (1987). "An Artificial Neural Network for Spatio-Temporal Bipolar Patterns: Application to Phoneme Classification" (PDF) . Advances in Neural Information Processing Systems . 1 : 31– 40. Archived (PDF) from the original on 2022-03-31 . Retrieved 2022-03-31 . 提示されたモデルで使用されている畳み込みまたは相関の概念は、工学分野で人気があり、フィルタ、制御システムなどの設計に広く適用されています。 ↑ Valueva, MV; Nagornov, NN; Lyakhov, PA; Valuev, GV; Chervyakov, NI (2020). "畳み込みニューラルネットワーク実装のハードウェアコスト削減のための剰余数システムの適用". Mathematics and Computers in Simulation . 177 . Elsevier BV: 232– 243. doi : 10.1016/j.matcom.2020.04.031 . ISSN 0378-4754 . S2CID 218955622 . 畳み込みニューラルネットワークは、パターン認識の問題を解決するための有望なツールです。 ↑ ファン・デン・オールド、アーロン。ディーレマン、サンダー。シュラウウェン、ベンジャミン (2013-01-01)。バージェス、CJC;ボットー、L.ウェリング、M.ガーラマニ、Z.ワインバーガー、KQ (編)。 深いコンテンツベースの音楽レコメンデーション (PDF) 。 Curran Associates, Inc. pp. 2643–2651。2022 年 3月 7 日にオリジナルから アーカイブ (PDF) 。 2022-03-31 に取得 。 ↑ Collobert, Ronan; Weston, Jason (2008-01-01). "自然言語処理のための統一アーキテクチャ". 第25回国際機械学習会議 - ICML '08 議事録 . ニューヨーク州ニューヨーク: ACM. pp. 160–167 . doi : 10.1145 /1390156.1390177 . ISBN 978-1-60558-205-4 . S2CID 2617020 . ↑ Avilov, Oleksii; Rimbert, Sebastien; Popov, Anton; Bougrain, Laurent (2020年7月) 「脳波信号からの術中覚醒検出を改善するための深層学習技術」 2020 年 第42回IEEE医用生体工学会国際会議(EMBC) ( PDF) 第2020巻。 カナダ、ケベック州モントリオール:IEEE。pp. 142–145。doi : 10.1109 / EMBC44109.2020.9176228。ISBN 978-1-7281-1990-8 PMID 33017950。S2CID 221386616。 2022年5月 19日にオリジナルからアーカイブ(PDF) 。2023年7月21日 に取得 。 1 2 Tsantekidis, Avraam; Passalis, Nikolaos; Tefas, Anastasios; Kanniainen, Juho; Gabbouj, Moncef; Iosifidis, Alexandros (2017年7月)「畳み込みニューラルネットワークを用いた指値注文板からの株価予測」 2017 IEEE 19th Conference on Business Informatics (CBI) . ギリシャ、テッサロニキ: IEEE. pp. 7–12 . doi : 10.1109/CBI.2017.23 . ISBN 978-1-5386-3035-8 . S2CID 4950757 . 1 2 3 Zhang, Wei (1988). 「シフト不変パターン認識ニューラルネットワークとその光学的アーキテクチャ」 . 日本応用物理学会年次大会論文集 . 2020年6月23日のオリジナルから アーカイブ済み. 2020年6月22日 取得 . 1 2 3 Zhang, Wei (1990). "ローカル空間不変相互接続を備えた並列分散処理モデルとその光アーキテクチャ" . Applied Optics . 29 (32): 4790– 7. Bibcode : 1990ApOpt..29.4790Z . doi : 10.1364/AO.29.004790 . PMID 20577468 . 2017-02-06 のオリジナルから アーカイブ済み . 2016-09-22 に取得. 1 2 3 4 5 6 Mouton, Coenraad; Myburgh, Johannes C.; Davel, Marelie H. (2020). "CNNにおけるストライドと並進不変性" . Gerber, Aurona (編). 人工知能研究 . Communications in Computer and Information Science. Vol. 1342. Cham: Springer International Publishing. pp. 267–281 . arXiv : 2103.10097 . doi : 10.1007/978-3-030-66151-9_17 . ISBN 978-3-030-66151-9 . S2CID 232269854 . 2021年6月27日にオリジナルからアーカイブされました。 2021年3月26日 に取得。 ↑ Kurtzman, Thomas (2019年8月20日). 「DUD-Eデータセットの隠れたバイアスが、構造ベースの仮想スクリーニングにおける深層学習の誤ったパフォーマンスにつながる」 . PLOS ONE . 14 (8) e0220113. Bibcode : 2019PLoSO..1420113C . doi : 10.1371/ journal.pone.0220113 . PMC 6701836. PMID 31430292 . 1 2 3 福島、K. (2007). "ネオコグニトロン" . Scholarpedia . 2 (1): 1717. Bibcode : 2007SchpJ...2.1717F . doi : 10.4249/scholarpedia.1717 . 1 2 Hubel, DH; Wiesel, TN (1968-03-01). "サル線条皮質の受容野と機能的構造" . The Journal of Physiology . 195 (1): 215– 243. doi : 10.1113/jphysiol.1968.sp008455 . ISSN 0022-3751 . PMC 1557912 . PMID 4966457 . 1 2 福島邦彦 (1980). "Neocognitron: 位置のずれに影響されないパターン認識メカニズムのための自己組織化ニューラルネットワークモデル" (PDF) . Biological Cybernetics . 36 (4): 193– 202. doi : 10.1007/BF00344251 . PMID 7370364 . S2CID 206775608 . 2014 年 6 月 3 日のオリジナルから アーカイブ (PDF) . 2013 年 11 月 16 日 取得 . 1 2 松直正和、森勝彦、御谷祐介、金田裕二 (2003)。 「畳み込みニューラルネットワークを用いた頑健な顔検出による被験者非依存の顔表情認識」 (PDF) . ニューラルネットワーク . 16 (5): 555– 559. Bibcode : 2003NN.....16..555M . doi : 10.1016/S0893-6080(03)00115-1 . PMID 12850007 . 2013年12月13日のオリジナルから アーカイブ (PDF) . 2013年 11月17日 取得 . ↑ 畳み込みニューラルネットワークの解明:マッチドフィルタリングの観点からのチュートリアルhttps://arxiv.org/abs/2108.11663v3 ↑ 「畳み込みニューラルネットワーク(LeNet) – DeepLearning 0.1 ドキュメント」 。DeepLearning 0.1。LISA Lab。 2017年12月28日の オリジナルからアーカイブ。 2013年 8月31日 取得 。 ↑ Chollet, François (2017-04-04). "Xception: Deep Learning with Depthwise Separable Convolutions". arXiv : 1610.02357 [ cs.CV ]. 1 2 3 Ciresan, Dan; Ueli Meier; Jonathan Masci; Luca M. Gambardella; Jurgen Schmidhuber (2011). "Flexible, High Performance Convolutional Neural Networks for Image Classification" (PDF) . Proceedings of the Twenty-Second International Joint Conference on Artificial Intelligence-Volume Volume Two . 2 : 1237– 1242. Archived (PDF) from the original on 5 April 2022 . Retrieved 17 November 2013 . ↑ Krizhevsky 、Alex。 「深層畳み込みニューラルネットワークによるImageNet分類」 (PDF) 。 2021年4月25日のオリジナルから アーカイブ (PDF) 。 2013年 11月17日 取得 。 1 2 山口浩一、坂本健二、赤羽敏夫、藤本義二(1990年11月)。 話者独立型単語認識のためのニューラルネットワーク 。第1回音声言語処理国際会議(ICSLP 90)。神戸、日本。 2021年3月7日の オリジナル からアーカイブ。 2019年9月4日 取得 。 1 2 3 4 Ciresan, Dan; Meier, Ueli; Schmidhuber, Jürgen (2012年6月). 「画像分類のためのマルチカラム深層ニューラルネットワーク」. 2012 IEEE Conference on Computer Vision and Pattern Recognition . ニューヨーク州ニューヨーク: Institute of Electrical and Electronics Engineers (IEEE). pp. 3642–3649 . arXiv : 1202.2745 . CiteSeerX 10.1.1.300.3283 . doi : 10.1109/CVPR.2012.6248110 . ISBN 978-1-4673-1226-4 . OCLC 812295155 . S2CID 2161592 . ↑ Yu, Fisher; Koltun, Vladlen (2016-04-30). "Multi-Scale Context Aggregation by Dilated Convolutions". arXiv : 1511.07122 [ cs.CV ]. ↑ Chen, Liang-Chieh; Papandreou, George; Schroff, Florian; Adam, Hartwig (2017-12-05). "Rethinking Atrous Convolution for Semantic Image Segmentation". arXiv : 1706.05587 [ cs.CV ]. ↑ デュタ、イオナット・コズミン。ジョルジュスク、マリアナ・ユリアナ。イヨネスク、ラドゥ・チューダー(2021-08-16)。 「コンテキスト畳み込みニューラル ネットワーク」。 arXiv : 2108.07387 [ cs.CV ]。 ↑ LeCun, Yann. "LeNet-5、畳み込みニューラルネットワーク" . 2021年2月24日時点のオリジナルより アーカイブ 。 2013年 11月16日 取得。 ↑ Zeiler, Matthew D.; Taylor, Graham W.; Fergus, Rob (2011年11月). 「中レベルおよび高レベル特徴学習のための適応型逆畳み込みネットワーク」 . 2011 International Conference on Computer Vision . IEEE. pp. 2018–2025 . doi : 10.1109/iccv.2011.6126474 . ISBN 978-1-4577-1102-2 。↑ Dumoulin, Vincent; Visin, Francesco (2018-01-11), A guide to convolution arithmetic for deep learning , arXiv : 1603.07285 ↑ オデナ、アウグストゥス。デュムラン、ヴィンセント。オラ、クリス (2016-10-17)。 「デコンボリューションとチェッカーボード アーティファクト」 。 蒸留します 。 1 (10)e3. 土井 : 10.23915/distill.00003 。 ISSN 2476-0757 。 ↑ van Dyck, Leonard Elia; Kwitt, Roland; Denzler, Sebastian Jochen; Gruber, Walter Roland (2021). "Comparing Object Recognition in Humans and Deep Convolutional Neural Networks—An Eye Tracking Study" . Frontiers in Neuroscience . 15 750639. doi : 10.3389/fnins.2021.750639 . ISSN 1662-453X . PMC 8526843. PMID 34690686 . 1 2 Hubel, DH; Wiesel, TN (1959 年 10 月). "ネコの線条皮質における単一ニューロンの受容野" . J. Physiol . 148 (3): 574–91 . doi : 10.1113/jphysiol.1959.sp006308 . PMC 1363130 . PMID 14403679 . ↑ David H. Hubel および Torsten N. Wiesel (2005). Brain and visual perception: the story of a 25-year collaboration . Oxford University Press US. p. 106. ISBN 978-0-19-517618-6 2023年10月16日にオリジナルからアーカイブされました。2019年1月18日 に取得 。1 2 福島、K. (1969). 「アナログ閾値要素の多層ネットワークによる視覚的特徴抽出」. IEEE Transactions on Systems Science and Cybernetics . 5 (4): 322– 333. Bibcode : 1969ITSSC...5..322F . doi : 10.1109/TSSC.1969.300225 . ↑ Schmidhuber, Juergen (2022). "Annotated History of Modern AI and Deep Learning". arXiv : 2212.11279 [ cs.NE ]. ↑ Ramachandran, Prajit; Barret, Zoph; Quoc, V. Le (2017年10月16日). "活性化関数の探索". arXiv : 1710.05941 [ cs.NE ]. 1 2 Waibel, Alex (1987年12月18日). 時間遅延ニューラルネットワークを用いた音素認識 (PDF) . 電気情報通信学会 (IEICE) 講演会. 東京, 日本. ↑ Alexander Waibel 他、「時間遅延ニューラルネットワークを使用した音素認識」、 2021 年 2 月 25 日にWayback Machine に アーカイブ済み 、IEEE Transactions on Acoustics, Speech, and Signal Processing、第 37 巻、第 3 号、pp. 328 - 339、1989 年 3 月。↑ LeCun, Yann; Bengio, Yoshua (1995). "Convolutional networks for images, speech, and time series" . In Arbib, Michael A. (ed.). The handbook of brain theory and neural networks (Second ed.). The MIT press. pp. 276–278 . 2020-07-28 のオリジナルから アーカイブ済み 。2019-12-03 に取得 。 ↑ John B. Hampshire および Alexander Waibel、「 Connectionist Architectures for Multi-Speaker Phoneme Recognition ( 2022 年 3 月 31 日にWayback Machine に アーカイブ)」 、Advances in Neural Information Processing Systems、1990 年、Morgan Kaufmann。 ↑ Ko, Tom; Peddinti, Vijayaditya; Povey, Daniel; Seltzer, Michael L.; Khudanpur, Sanjeev (2018 年 3 月). 残響音声のデータ拡張による堅牢な音声認識に関する研究 (PDF) . 第 42 回 IEEE 国際音響・音声・信号処理会議 (ICASSP 2017). 米国ルイジアナ州ニューオーリンズ。2018 年 7 月 8 日のオリジナルから アーカイブ (PDF) 。2019 年 9 月 4 日 取得 。 ↑ Denker, JS、Gardner, WR、Graf, H. P、Henderson, D、Howard, RE、Hubbard, W、Jackel, LD、BaIrd, HS、およびGuyon (1989)手書き郵便番号数字のニューラルネットワーク認識器、 2018年8月4日にWayback Machine に アーカイブ済み、AT&Tベル研究所 1 2 Y. LeCun、B. Boser、JS Denker、D. Henderson、RE Howard、W. Hubbard、LD Jackel、「手書き郵便番号認識へのバックプロパゲーションの適用」 2020年1月10日にWayback Machine に アーカイブ済み; AT&Tベル研究所 1 2 Zhang, Wei (1991). "学習ネットワークに基づくヒト角膜内皮の画像処理" . Applied Optics . 30 (29): 4211– 7. Bibcode : 1991ApOpt..30.4211Z . doi : 10.1364/AO.30.004211 . PMID 20706526 . 2017-02-06 のオリジナルから アーカイブ済み. 2016-09-22 に取得 . 1 2 Zhang, Wei (1994). "シフト不変人工ニューラルネットワークを用いたデジタルマンモグラフィにおけるクラスター状微小石灰化のコンピュータによる検出" . Medical Physics . 21 (4): 517–24 . Bibcode : 1994MedPh..21..517Z . doi : 10.1118/1.597177 . PMID 8058017. 2017-02-06 のオリジナルから アーカイブ済み 。2016-09-22 に取得 。 ↑ Weng, J; Ahuja, N; Huang, TS (1993). "2次元画像からの3次元オブジェクトの認識とセグメンテーションの学習". 1993 (4th) International Conference on Computer Vision . IEEE. pp. 121–128 . doi : 10.1109/ICCV.1993.378228 . ISBN 0-8186-3870-2 . S2CID 8619176 . 1 2 Schmidhuber, Jürgen (2015). "Deep Learning" . Scholarpedia . 10 (11): 1527– 54. CiteSeerX 10.1.1.76.1541 . doi : 10.1162/neco.2006.18.7.1527 . PMID 16764513 . S2CID 2309950 . 2016-04-19 のオリジナルから アーカイブ済み. 2019-01-20 に取得 . 1 2 レカン、Y.ジャッケル、LD;ボットー、L.コルテス、C.デンカー、JS。ドラッカー、H.ギヨン、I。ミュラー、UA;サッカー、E.シマール、P. Vapnik、V. (1995 年 8 月)。 分類のための学習アルゴリズム: 手書き数字認識の比較 (PDF) 。世界科学。 pp. 261–276 。 土井 : 10.1142/2808 。 ISBN 978-981-02-2324-3 2023年5月2日にオリジナルからアーカイブ(PDF) 。↑ Lecun, Y.; Bottou, L.; Bengio, Y.; Haffner, P. (1998年11月). "文書認識に適用された勾配ベース学習" (PDF) . Proceedings of the IEEE . 86 (11): 2278– 2324. Bibcode : 1998IEEEP..86.2278L . doi : 10.1109/5.726791 . ↑ Zhang, Wei (1991). "最小エントロピー重みによる誤差逆伝播:2次元シフト不変ニューラルネットワークのより良い一般化のための手法" . 国際ニューラルネットワーク合同会議議事録 . 2017年2月6日のオリジナルから アーカイブ済み. 2016年9月22日 取得 . ↑ Daniel Graupe、Ruey Wen Liu、George S Moschytz。「医療信号処理へのニューラルネットワークの応用」。2020年7月28日にWayback Machine に アーカイブされました。第27回IEEE意思決定および制御会議議事録、pp. 343–347、1988年。 ↑ Daniel Graupe、Boris Vern、G. Gruener、Aaron Field、および Qiu Huang。「ニューラルネットワークによる表面EMG信号の単一線維活動電位への分解(Wayback Machine に2019年9月4日に アーカイブ)」。IEEE国際回路システムシンポジウム議事録、pp. 1008–1011、1989年。 ↑ Qiu Huang、Daniel Graupe、Yi Fang Huang、Ruey Wen Liu.」神経信号の発火パターンの特定 「第28回IEEE意思決定・制御会議議事録、pp. 266–271、1989年」。https ://ieeexplore.ieee.org/document/70115 2022年3月31日にWayback Machine に アーカイブ済み ↑ Oh, KS; Jung, K (2004). "GPUによるニューラルネットワークの実装". Pattern Recognition . 37 (6): 1311– 1314. Bibcode : 2004PatRe..37.1311O . doi : 10.1016/j.patcog.2004.01.013 . ↑ Dave Steinkraus; Patrice Simard; Ian Buck (2005). "Using GPUs for Machine Learning Algorithms" . 第12回国際文書解析認識会議 (ICDAR 2005) . pp. 1115–1119 . doi : 10.1109/ICDAR.2005.251 . 2022年3月31日にオリジナルから アーカイブ済み。 2022年3月31日 に取得 。 ↑ Kumar Chellapilla; Sid Puri; Patrice Simard (2006). "High Performance Convolutional Neural Networks for Document Processing" . In Lorette, Guy (ed.). Tenth International Workshop on Frontiers in Handwriting Recognition . Suvisoft. 2020年5月18日のオリジナルから アーカイブ済み。 2016年3月14日 取得 。 ↑ Hinton, GE; Osindero, S; Teh, YW (2006年7月)「ディープビリーフネットのための高速学習アルゴリズム」 Neural Computation . 18 (7): 1527–54 . CiteSeerX 10.1.1.76.1541 . doi : 10.1162 / neco.2006.18.7.1527 . PMID 16764513. S2CID 2309950 . ↑ Bengio, Yoshua; Lamblin, Pascal; Popovici, Dan; Larochelle, Hugo (2007). "Greedy Layer-Wise Training of Deep Networks" (PDF) . Advances in Neural Information Processing Systems : 153– 160. 2022年6月2日のオリジナルから アーカイブ (PDF) 。 2022年3月31日 取得 。 ↑ Ranzato, MarcAurelio; Poultney, Christopher; Chopra, Sumit; LeCun, Yann (2007). "Efficient Learning of Sparse Representations with an Energy-Based Model" (PDF) . Advances in Neural Information Processing Systems . 2016-03-22 のオリジナルから アーカイブ (PDF) . 2014-06-26 に取得 . ↑ Raina, R; Madhavan, A; Ng, Andrew (2009年6月14日). 「グラフィックスプロセッサを用いた大規模深層教師なし学習」 (PDF) . 第26回国際機械学習会議議事録 . ICML '09: 第26回国際機械学習会議議事録. pp. 873–880 . doi : 10.1145/1553374.1553486 . ISBN 978-1-60558-516-1 . S2CID 392458 . 2020年12月8日にオリジナルからアーカイブ(PDF)されました 。 2023年 12月22日 に取得。 ↑ Ciresan, Dan; Meier, Ueli; Gambardella, Luca; Schmidhuber, Jürgen (2010). "手書き数字認識のためのディープビッグシンプルニューラルネットワーク". Neural Computation . 22 (12): 3207–3220 . arXiv : 1003.0358 . Bibcode : 2010NeCom..22.3207C . doi : 10.1162/NECO_a_00052 . PMID 20858131. S2CID 1918673 . ↑ 「IJCNN 2011競技結果表」 。 公式IJCNN2011競技会 。2010年。 2021年1月17日にオリジナルから アーカイブ 。 2019年1月14日 に取得。 ↑ Schmidhuber, Jürgen (2017年3月17日). 「GPU上のディープCNNが勝利したコンピュータビジョンコンテストの歴史」 . 2018年12月19日のオリジナルから アーカイブ済み 。 2019年 1月14日 取得。 1 2 Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (2017-05-24). "ImageNet classification with deep convolutional neural networks" (PDF) . Communications of the ACM . 60 (6): 84– 90. doi : 10.1145/3065386 . ISSN 0001-0782 . S2CID 195908774 . 2017-05-16 のオリジナルから アーカイブ (PDF) . 2018-12-04 に取得 . ↑ Viebke, Andre; Memeti, Suejb; Pllana, Sabri; Abraham, Ajith (2019). "CHAOS: Intel Xeon Phi 上で畳み込みニューラルネットワークをトレーニングするための並列化スキーム". The Journal of Supercomputing . 75 (1): 197–227 . arXiv : 1702.07908 . doi : 10.1007/s11227-017-1994-x . S2CID 14135321 . ↑ Viebke, Andre; Pllana, Sabri (2015). "The Potential of the Intel (R) Xeon Phi for Supervised Deep Learning" . 2015 IEEE 17th International Conference on High Performance Computing and Communications, 2015 IEEE 7th International Symposium on Cyberspace Safety and Security, and 2015 IEEE 12th International Conference on Embedded Software and Systems . IEEE Xplore . IEEE 2015. pp. 758–765 . doi : 10.1109 /HPCC-CSS-ICESS.2015.45 . ISBN 978-1-4799-8937-9 . S2CID 15411954 . 2023年3月6日にオリジナルからアーカイブされました。 2022年3月31日 に取得。 ↑ Hinton, Geoffrey (2012). "ImageNet Classification with Deep Convolutional Neural Networks" . NIPS'12: Proceedings of the 25th International Conference on Neural Information Processing Systems - Volume 1. 1 : 1097–1105 . 2019年12月 20 日にオリジナルから アーカイブ。 2021年3月26日 にACM経由で 取得 。 1 2 3 4 5 Azulay, Aharon; Weiss, Yair (2019). "なぜ深層畳み込みネットワークは小さな画像変換に対して汎化性能が低いのか?" . Journal of Machine Learning Research . 20 (184): 1– 25. ISSN 1533-7928 . 2022年3月31日にオリジナルから アーカイブ済み。 2022年3月31日 に取得 。 1 2 ジェロン、オーレリアン (2019). Scikit-Learn、Keras、TensorFlow を使用した実践的な機械学習 . セバストポル、カリフォルニア州: O'Reilly Media. ISBN 978-1-492-03264-9 。 448ページ↑ Li, Zewen; Liu, Fan; Yang, Wenjie; Peng, Shouheng; Zhou, Jun (2022 年 12 月). "畳み込みニューラルネットワークの概観: 分析、応用、展望". IEEE Transactions on Neural Networks and Learning Systems . 33 (12): 6999–7019 . arXiv : 2004.02806 . Bibcode : 2022ITNNL..33.6999L . doi : 10.1109/TNNLS.2021.3084827 . hdl : 10072/405164 . PMID 34111009 . ↑ "CS231n 視覚認識のための畳み込みニューラルネットワーク" . cs231n.github.io . 2019年10月23日にオリジナルから アーカイブ済み. 2017年4月25日 取得 . ↑ Nirthika, Rajendran; Manivannan, Siyamalan; Ramanan, Amirthalingam; Wang, Ruixuan (2022-04-01). "医療画像解析のための畳み込みニューラルネットワークにおけるプーリング:調査と実証研究" . Neural Computing and Applications . 34 (7): 5321– 5347. doi : 10.1007/s00521-022-06953-8 . ISSN 1433-3058 . PMC 8804673 . PMID 35125669 . 1 2 Scherer, Dominik; Müller, Andreas C.; Behnke, Sven (2010). "物体認識のための畳み込みアーキテクチャにおけるプーリング操作の評価" (PDF) . 人工ニューラルネットワーク (ICANN)、第 20 回国際会議 . ギリシャ、テッサロニキ: Springer. pp. 92– 101. 2018-04-03 のオリジナルから アーカイブ (PDF) . 2016-12-28 に取得 . ↑ Graham, Benjamin (2014-12-18). "Fractional Max-Pooling". arXiv : 1412.6071 [ cs.CV ]. ↑ Springenberg, Jost Tobias; Dosovitskiy, Alexey; Brox, Thomas; Riedmiller, Martin (2014-12-21). "Striving for Simplicity: The All Convolutional Net". arXiv : 1412.6806 [ cs.LG ]. ↑ Ma, Zhanyu; Chang, Dongliang; Xie, Jiyang; Ding, Yifeng; Wen, Shaoguo; Li, Xiaoxu; Si, Zhongwei; Guo, Jun (2019). "Fine-Grained Vehicle Classification With Channel Max Pooling Modified CNNs". IEEE Transactions on Vehicular Technology . 68 (4). Institute of Electrical and Electronics Engineers (IEEE): 3224– 3233. Bibcode : 2019ITVT...68.3224M . doi : 10.1109/tvt.2019.2899972 . ISSN 0018-9545 . S2CID 86674074 . ↑ Zafar, Afia; Aamir, Muhammad; Mohd Nawi, Nazri; Arshad, Ali; Riaz, Saman; Alruban, Abdulrahman; Dutta, Ashit Kumar; Almotairi, Sultan (2022-08-29). "畳み込みニューラルネットワークのプーリング手法の比較" . Applied Sciences . 12 (17): 8643. Bibcode : 2022ApSci..12.8643Z . doi : 10.3390/app12178643 . ISSN 2076-3417 . ↑ Gholamalinezhad, Hossein; Khosravi, Hossein (2020-09-16), Pooling Methods in Deep Neural Networks, a Review , arXiv : 2009.07485 ↑ Householder, Alston S. (1941年6月). 「神経線維ネットワークにおける定常状態活動の理論:I. 定義と予備的補題」 . The Bulletin of Mathematical Biophysics . 3 (2): 63–69 . doi : 10.1007/BF02478220 . ISSN 0007-4985 . ↑ Romanuke, Vadim (2017). "畳み込みニューラルネットワークにおけるReLUの適切な数と割り当て" . NTUU「キエフ工科大学」研究速報 . 1 (1): 69– 78. doi : 10.20535/1810-0546.2017.1.88156 . ↑ Xavier Glorot; Antoine Bordes; Yoshua Bengio (2011). Deep sparse rectifier neural networks (PDF) . AISTATS. 2016-12-13 の オリジナル (PDF)からアーカイブ済み。2023-04-10 に 取得 。Rectifier および softplus 活性化関数。2 番目は、1 番目のスムーズ バージョンです。 ↑ Krizhevsky, A.; Sutskever, I.; Hinton, GE (2012). "Imagenet classification with deep convolutional neural networks" (PDF) . Advances in Neural Information Processing Systems . 1 : 1097– 1105. 2022年3月31日にオリジナルから アーカイブ (PDF) 。 2022年3月31日 に取得 。 ↑ Ribeiro, Antonio H.; Schön, Thomas B. (2021). "How Convolutional Neural Networks Deal with Aliasing". ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) . pp. 2755– 2759. arXiv : 2102.07757 . doi : 10.1109/ICASSP39728.2021.9414627 . ISBN 978-1-7281-7605-5 . S2CID 231925012 . ↑ Myburgh, Johannes C.; Mouton, Coenraad; Davel, Marelie H. (2020). "CNNSにおける並進不変性の追跡" . Gerber, Aurona (編). 人工知能研究 . Communications in Computer and Information Science. Vol. 1342. Cham: Springer International Publishing. pp. 282–295 . arXiv : 2104.05997 . doi : 10.1007/978-3-030-66151-9_18 . ISBN 978-3-030-66151-9 . S2CID 233219976 . 2022年1月22日にオリジナルからアーカイブされました。 2021年3月26日 に取得。 ↑ Richard, Zhang (2019-04-25). Making Convolutional Networks Shift-Invariant Again . OCLC 1106340711 . ↑ Jadeberg, Max; Simonyan, Karen; Zisserman, Andrew; Kavukcuoglu, Koray (2015). "Spatial Transformer Networks" (PDF) . Advances in Neural Information Processing Systems . 28 . 2021-07-25 のオリジナルから アーカイブ (PDF) . 2021-03-26 に NIPS経由で 取得 。 ↑ Sabour, Sara; Frosst, Nicholas; Hinton, Geoffrey E. (2017-10-26). Dynamic Routing Between Capsules . OCLC 1106278545 . ↑ Matiz, Sergio; Barner, Kenneth E. (2019-06-01). "畳み込みニューラルネットワークのための帰納的共形予測器: 画像分類のためのアクティブラーニングへの応用" . Pattern Recognition . 90 : 172– 182. Bibcode : 2019PatRe..90..172M . doi : 10.1016/j.patcog.2019.01.035 . ISSN 0031-3203 . S2CID 127253432 . 2021-09-29 のオリジナルから アーカイブ済み. 2021-09-29 に取得 . ↑ Wieslander, Håkan; Harrison, Philip J.; Skogberg, Gabriel; Jackson, Sonya; Fridén, Markus; Karlsson, Johan; Spjuth, Ola; Wählby, Carolina (2021 年 2 月). "Deep Learning With Conformal Prediction for Hierarchical Analysis of Large-Scale Whole-Slide Tissue Images" . IEEE Journal of Biomedical and Health Informatics . 25 (2): 371– 380. Bibcode : 2021IJBHI..25..371W . doi : 10.1109/JBHI.2020.2996300 . ISSN 2168-2208 . PMID 32750907. S2CID 219885788 . ↑ Srivastava, Nitish; C. Geoffrey Hinton; Alex Krizhevsky; Ilya Sutskever; Ruslan Salakhutdinov (2014). "Dropout: ニューラルネットワークの過学習を防ぐ簡単な方法" (PDF) . Journal of Machine Learning Research . 15 (1): 1929– 1958. 2016-01-19 のオリジナルから アーカイブ (PDF) 。2015-01-03 に 取得 。 ↑ "DropConnect を使用したニューラルネットワークの正則化 | ICML 2013 | JMLR W&CP" . jmlr.org : 1058– 1066. 2013-02-13. 2017-08-12 のオリジナルから アーカイブ済み 。2015-12-17 に取得 。 ↑ Zeiler, Matthew D.; Fergus, Rob (2013-01-15). "深層畳み込みニューラルネットワークの正則化のための確率的プーリング". arXiv : 1301.3557 [ cs.LG ]. 1 2 Platt, John; Steinkraus, Dave; Simard, Patrice Y. (2003 年 8 月) 「視覚文書分析に適用される畳み込みニューラルネットワークのベストプラクティス - Microsoft Research」 . Microsoft Research . 2017 年 11 月 7 日のオリジナルから アーカイブ済み. 2015 年 12 月 17 日 取得 . ↑ Hinton, Geoffrey E.; Srivastava, Nitish; Krizhevsky, Alex; Sutskever, Ilya; Salakhutdinov, Ruslan R. (2012). "特徴検出器の共適応を防ぐことによるニューラルネットワークの改善". arXiv : 1207.0580 [ cs.NE ]. ↑ 「ドロップアウト:ニューラルネットワークの過学習を防ぐ簡単な方法」 。jmlr.org 。 2016年3月 5 日のオリジナルから アーカイブ済み。 2015年12月17日 取得 。 ↑ ヒントン、ジェフリー( 1979)。 「心的イメージにおける構造的記述の効果に関するいくつかの実証」 。 認知 科学 。3 ( 3): 231–250。doi : 10.1016/s0364-0213(79)80008-7 。 ↑ ロック、アーヴィン。「参照枠」。ソロモン・アッシュの遺産:認知と社会心理学に関するエッセイ(1990):243-268。 ↑ J. Hinton、「Courseraのニューラルネットワークに関する講義」、2012年、URL: https://www.coursera.org/learn/neural-networks 2016年12月31日にWayback Machine に アーカイブ済み ↑ Dave Gershgorn (2018年6月18日) 「AIがシリコンバレーを支配するほど優秀になった内幕」 Quartz 。 2019 年12月12日のオリジナルから アーカイブ。 2018年 10月5日 閲覧 。 ↑ Lawrence, Steve; C. Lee Giles; Ah Chung Tsoi; Andrew D. Back (1997). "顔認識: 畳み込みニューラルネットワークアプローチ". IEEE Transactions on Neural Networks . 8 (1): 98–113 . CiteSeerX 10.1.1.92.5813 . doi : 10.1109/72.554195 . PMID 18255614. S2CID 2883848 . ↑ Le Callet, Patrick; Christian Viard-Gaudin; Dominique Barba (2006). "A Convolutional Neural Network Approach for Objective Video Quality Assessment" (PDF) . IEEE Transactions on Neural Networks . 17 (5): 1316– 1327. Bibcode : 2006ITNN...17.1316L . doi : 10.1109/TNN.2006.879766 . PMID 17001990 . S2CID 221185563 . 2021年2月24日にオリジナルから アーカイブ (PDF) 。 2013年 11月17日 に取得 。 ↑ 「ImageNet大規模画像認識コンペティション2014(ILSVRC2014)」 。 2016年2月5日にオリジナルから アーカイブ済み 。 2016年 1月30日 に取得。 ↑ Szegedy, Christian; Liu, Wei; Jia, Yangqing; Sermanet, Pierre; Reed, Scott E.; Anguelov, Dragomir; Erhan, Dumitru; Vanhoucke, Vincent; Rabinovich, Andrew (2015). "Going deeper with convolutions". IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2015, Boston, MA, USA, June 7–12, 2015. IEEE Computer Society. pp. 1–9 . arXiv : 1409.4842 . doi : 10.1109/CVPR.2015.7298594 . ISBN 978-1-4673-6964-0 。↑ ルサコフスキー、オルガ ;鄧、佳。スー、ハオ。クラウス、ジョナサン。サシーシュ、サンジーブ。マ、ショーン。黄志恒。 アンドレイ・カルパシー ;コスラ、アディティヤ。バーンスタイン、マイケル。バーグ、アレクサンダー C.フェイフェイ、リー (2014)。 「イメージ ネット 大規模視覚認識チャレンジ」。 arXiv : 1409.0575 [ cs.CV ]。 ↑ 「顔検出アルゴリズムが画像検索に革命を起こす」 . テクノロジーレビュー . 2015年2月16日。 2020年9月20日にオリジナルから アーカイブ済み 。 2017年 10月27日 に取得。 ↑ Baccouche, Moez; Mamalet, Franck; Wolf, Christian; Garcia, Christophe; Baskurt, Atilla (2011-11-16). "Sequential Deep Learning for Human Action Recognition". In Salah, Albert Ali; Lepri, Bruno (eds.). Human Behavior Understanding . Lecture Notes in Computer Science. Vol. 7065. Springer Berlin Heidelberg. pp. 29–39 . CiteSeerX 10.1.1.385.4740 . doi : 10.1007/978-3-642-25446-8_4 . ISBN 978-3-642-25445-1 。↑ Ji, Shuiwang; Xu, Wei; Yang, Ming; Yu, Kai (2013-01-01). "3D Convolutional Neural Networks for Human Action Recognition". IEEE Transactions on Pattern Analysis and Machine Intelligence . 35 (1): 221– 231. Bibcode : 2013ITPAM..35..221J . CiteSeerX 10.1.1.169.4046 . doi : 10.1109/TPAMI.2012.59 . ISSN 0162-8828 . PMID 22392705. S2CID 1923924 . ↑ 黄潔;周、文港。張、希林。李、後強。リー・ウェイピン(2018)。 「時間分割を行わないビデオベースの手話認識」。 arXiv : 1801.10111 [ cs.CV ]。 ↑ Karpathy, Andrej, et al. "畳み込みニューラルネットワークによる大規模ビデオ分類 ( Wayback Machine に 2019-08-06 に アーカイブ)." IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 2014. ↑ Simonyan, Karen; Zisserman, Andrew (2014). "動画における動作認識のための2ストリーム畳み込みネットワーク". arXiv : 1406.2199 [ cs.CV ]. (2014年)↑ Wang, Le; Duan, Xuhuan; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-05-22). "Segment-Tube: Spatio-Temporal Action Localization in Untrimmed Videos with Per-Frame Segmentation" (PDF) . Sensors . 18 (5): 1657. Bibcode : 2018Senso..18.1657W . doi : 10.3390/s18051657 . ISSN 1424-8220 . PMC 5982167 . PMID 29789447 . 2021-03-01 のオリジナルから アーカイブ (PDF) . 2018-09-14 に取得 . ↑ ドゥアン、徐環。王、楽。ザイ、チャンボ。鄭、南寧。張、希林。牛真興。フア、ガン(2018)。 「フレームごとのセグメンテーションを使用したトリミングされていないビデオにおける時空間アクションの共同位置特定」。 2018 第 25 回 IEEE 画像処理国際会議 (ICIP) 。第 25 回 IEEE 画像処理国際会議 (ICIP)。 pp. 918–922 . doi : 10.1109/icip.2018.8451692 。 ISBN 978-1-4799-7061-2 。↑ Taylor, Graham W.; Fergus, Rob; LeCun, Yann; Bregler, Christoph (2010-01-01). Convolutional Learning of Spatio-temporal Features . Proceedings of the 11th European Conference on Computer Vision: Part VI. ECCV'10. Berlin, Heidelberg: Springer-Verlag. pp. 140–153 . ISBN 978-3-642-15566-6 2022年3月31日にオリジナルからアーカイブされました。2022年3月31日 に取得されました 。↑ Le, QV; Zou, WY; Yeung, SY; Ng, AY (2011-01-01). "Learning hierarchical invariant spatio-temporal features for action recognition with independent subspace analysis" (PDF) . CVPR 2011 . CVPR '11. Washington, DC, US: IEEE Computer Society. pp. 3361– 3368. CiteSeerX 10.1.1.294.5948 . doi : 10.1109/CVPR.2011.5995496 . ISBN 978-1-4577-0394-2 . S2CID 6006618 . ↑ Grefenstette, Edward; Blunsom, Phil; de Freitas, Nando; Hermann, Karl Moritz (2014-04-29). "A Deep Architecture for Semantic Parsing". arXiv : 1404.7296 [ cs.CL ]. ↑ Mesnil, Gregoire; Deng, Li; Gao, Jianfeng; He, Xiaodong; Shen, Yelong (2014年4月)。 「Web検索のための畳み込みニューラルネットワークを使用した意味表現の学習 – Microsoft Research」 。Microsoft Research 。 2017年9月15日のオリジナルから アーカイブ。 2015年12月17日 取得 。 ↑ Kalchbrenner, Nal; Grefenstette, Edward; Blunsom, Phil (2014-04-08). "A Convolutional Neural Network for Modelling Sentences". arXiv : 1404.2188 [ cs.CL ]. ↑ Kim, Yoon (2014-08-25). "Convolutional Neural Networks for Sentence Classification". arXiv : 1408.5882 [ cs.CL ]. ↑ Collobert, Ronan、および Jason Weston。「自然言語処理のための統一アーキテクチャ:マルチタスク学習を備えた深層ニューラルネットワーク」Wayback Machine に 2019 年 9 月 4 日に アーカイブ済み。「第 25 回国際機械学習会議の議事録」。ACM、2008 年。 ↑ Collobert, Ronan; Weston, Jason; Bottou, Leon; Karlen, Michael; Kavukcuoglu, Koray; Kuksa, Pavel (2011-03-02). "Natural Language Processing (almost) from Scratch". arXiv : 1103.0398 [ cs.LG ]. ↑ Yin, W; Kann, K; Yu, M; Schütze, H (2017-03-02). "自然言語処理におけるCNNとRNNの比較研究". arXiv : 1702.01923 [ cs.LG ]. ↑ Bai, S.; Kolter, JS; Koltun, V. (2018). "シーケンスモデリングのための汎用畳み込みネットワークとリカレントネットワークの経験的評価". arXiv : 1803.01271 [ cs.LG ]. ↑ Gruber, N. (2021). "リカレントニューラルネットワークによるテキスト内の動作ダイナミクスの検出". Neural Computing and Applications . 33 (12): 15709– 15718. doi : 10.1007/S00521-021-06190-5 . S2CID 236307579 . ↑ Haotian, J.; Zhong, Li; Qianxiao, Li (2021). "時系列モデリングのための畳み込みアーキテクチャの近似理論". 国際機械学習会議 . arXiv : 2107.09355 . ↑ Bohnslav, James P; Wimalasena, Nivanthika K; Clausing, Kelsey J; Dai, Yu Y; Yarmolinsky, David A; Cruz, Tomás; Kashlan, Adam D; Chiappe, M Eugenia; Orefice, Lauren L; Woolf, Clifford J; Harvey, Christopher D (2021-09-02). "DeepEthogram、生のピクセルから教師あり行動分類を行う機械学習パイプライン" . eLife . 10 e63377. doi : 10.7554/eLife.63377 . ISSN 2050-084X . PMC 8455138 . PMID 34473051 . 1 2 Gernat, Tim; Jagla, Tobias; Jones, Beryl M.; Middendorf, Martin; Robinson, Gene E. (2023-01-27). "バーコードと人工知能によるミツバチの自動モニタリングにより、単一の親和行動から2つの異なる社会ネットワークが明らかになった" . Scientific Reports . 13 (1) 1541. Bibcode : 2023NatSR..13.1541G . doi : 10.1038/s41598-022-26825-4 . ISSN 2045-2322 . PMC 9883485 . PMID 36707534 . ↑ Norouzzadeh, Mohammad Sadegh; Nguyen, Anh; Kosmala, Margaret; Swanson, Alexandra; Palmer, Meredith S.; Packer, Craig; Clune, Jeff (2018-06-19). "ディープラーニングによるカメラトラップ画像中の野生動物の自動識別、計数、および記述" . Proceedings of the National Academy of Sciences . 115 (25): E5716– E5725. Bibcode : 2018PNAS..115E5716N . doi : 10.1073/pnas.1719367115 . ISSN 0027-8424 . PMC 6016780 . PMID 29871948 . ↑ アスガー、スヴェニング。ムジョ、ギョーム。アリソン、ジェイミー。シュバリエ、ダフネ。モリーナ、ニサ・ルイーゼ・チャベス。オン・ソンクアン。ビェルゲ、キム。カリーロ、ジュリ。ホーイ、トーク・トーマス (2025-04-14)。 「画像内の陸生節足動物の検出とセグメンテーションのための一般的な方法」。 bioRxiv 10.1101/2025.04.08.647223 。 ↑ Torrents, Jordi; Costa, Tiago; De Polavieja, Gonzalo G. (2025-06-02). "New idtracker.ai: rethinking multi-animal tracking as a representation learning problem to increase accuracy and reduce tracking times". bioRxiv 10.1101/2025.05.30.657023 . ↑ Mathis, Alexander; Mamidanna, Pranav; Cury, Kevin M.; Abe, Taiga; Murthy, Venkatesh N.; Mathis, Mackenzie Weygandt; Bethge, Matthias (2018 年 9 月). "DeepLabCut: 深層学習によるユーザー定義の身体部位のマーカーレス姿勢推定" . Nature Neuroscience . 21 (9): 1281– 1289. doi : 10.1038/s41593-018-0209-y . ISSN 1097-6256 . PMID 30127430 . ↑ Graving, Jacob M; Chae, Daniel; Naik, Hemal; Li, Liang; Koger, Benjamin; Costelloe, Blair R; Couzin, Iain D (2019-10-01). "DeepPoseKit、ディープラーニングを用いた高速かつ堅牢な動物の姿勢推定のためのソフトウェアツールキット" . eLife . 8 e47994. Bibcode : 2019eLife...847994G . doi : 10.7554/eLife.47994 . ISSN 2050-084X . PMC 6897514 . PMID 31570119 . ↑ ペレイラ、タルモ D.タブリス、ナサニエル。マッツリア、アリー。ターナー、デビッド M.リー・ジュンユ。ラビンドラナート、シュルティ。パパドヤニス、エレニ S.ノーマンド、エドナ。ドイチュ、デヴィッド S.ワン、Z.ヤン。マッケンジー・スミス、グレース・C.ミテルート、カタリン C.カストロ、マリエリサ・ディエス。ドゥヴァ、ジョン。キスリン、ミハイル(2022年5月)。 「出版社の訂正: SLEAP: 複数の動物の姿勢追跡のための深層学習システム」 。 ネイチャーメソッド 。 19 (5): 628. 土井 : 10.1038/s41592-022-01495-2 。 ISSN 1548-7091 。 PMC 9119847 。 PMID 35468969 。 1 2 Arac, Ahmet; Zhao, Pingping; Dobkin, Bruce H.; Carmichael, S. Thomas; Golshani, Peyman (2019-05-07). "DeepBehavior: 動物および人間の行動画像データの自動分析のための深層学習ツールボックス" . Frontiers in Systems Neuroscience . 13 20. doi : 10.3389/fnsys.2019.00020 . ISSN 1662-5137 . PMC 6513883 . PMID 31133826 . ↑ レン、ハンシェン。徐碧雄。ワン・ユージン。イー、チャオ。黄、コンルイ。コウ、シャオユウ。シン、トニー。ヤン、マオ。トン、ジエ。張斉(2019)。 Microsoft の時系列異常検出サービス |知識発見とデータ マイニングに関する第 25 回 ACM SIGKDD 国際会議の議事録 。 arXiv : 1906.03821 。 土井 : 10.1145/3292500.3330680 。 S2CID 182952311 。 ↑ Wallach, Izhar; Dzamba, Michael; Heifets, Abraham (2015-10-09). "AtomNet: 構造ベースの創薬における生物活性予測のための深層畳み込みニューラルネットワーク". arXiv : 1510.02855 [ cs.LG ]. ↑ Yosinski, Jason; Clune, Jeff; Nguyen, Anh; Fuchs, Thomas; Lipson, Hod (2015-06-22). "Understanding Neural Networks Through Deep Visualization". arXiv : 1506.06579 [ cs.CV ]. ↑ 「トロントのスタートアップ企業が効果的な医薬品をより迅速に発見する方法を開発」 。 グローブ・アンド・メール紙 。 2015年10月20日のオリジナルから アーカイブ。 2015年11月9日 閲覧 。 ↑ 「スタートアップ企業がスーパーコンピューターを活用して治療法を模索」 。KQED Future of You 。2015年5月27日。 2018年12月6日のオリジナルから アーカイブ。 2015年11月9日 閲覧 。 ↑ Chellapilla, K; Fogel, DB (1999). "専門家の知識に頼らずにチェッカーをプレイするニューラルネットワークの進化". IEEE Trans Neural Netw . 10 (6): 1382–91 . Bibcode : 1999ITNN...10.1382C . doi : 10.1109/72.809083 . PMID 18252639 . ↑ Chellapilla, K.; Fogel, DB (2001). "人間の専門知識を用いずにエキスパートチェッカープレイプログラムを進化させる". IEEE Transactions on Evolutionary Computation . 5 (4): 422– 428. Bibcode : 2001ITEC....5..422C . doi : 10.1109/4235.942536 . ↑ フォゲル、デイビッド (2001)。Blondie24 :AIの最先端で遊ぶ 。サンフランシスコ、カリフォルニア州:モーガン・カウフマン 。ISBN 978-1-55860-783-5 。↑ Clark, Christopher; Storkey, Amos (2014). "Teaching Deep Convolutional Neural Networks to Play Go". arXiv : 1412.3409 [ cs.AI ]. ↑ Maddison, Chris J.; Huang, Aja; Sutskever, Ilya; Silver, David (2014). "深層畳み込みニューラルネットワークを用いた囲碁における手の評価". arXiv : 1412.6564 [ cs.LG ]. ↑ 「AlphaGo – Google DeepMind」 。 2016年1月30日時点の オリジナルからアーカイブ済み 。 2016年 1月30日 に取得。 ↑ バイ、シャオジエ。コルター、J. ジーコ。コルトゥン、ヴラドレン(2018-04-19)。 「シーケンスモデリングのための汎用畳み込みネットワークとリカレントネットワークの経験的評価」。 arXiv : 1803.01271 [ cs.LG ]。 ↑ Yu, Fisher; Koltun, Vladlen (2016-04-30). "Multi-Scale Context Aggregation by Dilated Convolutions". arXiv : 1511.07122 [ cs.CV ]. ↑ Borovykh, Anastasia; Bohte, Sander; Oosterlee, Cornelis W. (2018-09-17). "Conditional Time Series Forecasting with Convolutional Neural Networks". arXiv : 1703.04691 [ stat.ML ]. ↑ Mittelman, Roni (2015-08-03). "非間引き完全畳み込みニューラルネットワークによる時系列モデリング". arXiv : 1508.00317 [ stat.ML ]. ↑ チェン、イーティアン。カン・ヤンフェイ。チェン・イーシオン。王子卓(2019-06-11)。 「時間畳み込みニューラル ネットワークによる確率的予測」。 arXiv : 1906.04397 [ stat.ML ]。 ↑ Zhao, Bendong; Lu, Huanzhang; Chen, Shangfeng; Liu, Junliang; Wu, Dongya (2017-02-01). "Convolutional neural networks for time series classi". Journal of Systems Engineering and Electronics . 28 (1): 162– 169. doi : 10.21629/JSEE.2017.01.18 . ↑ ペトネハージ、ガボール(2019-08-21)。 「QCNN: 分位畳み込みニューラル ネットワーク」。 arXiv : 1908.07978 [ cs.LG ]。 ↑ Hubert Mara (2019-06-07), HeiCuBeDa Hilprecht – ヒルプレヒト・コレクションのためのハイデルベルク楔形文字ベンチマークデータセット (ドイツ語)、heiDATA – ハイデルベルク大学の研究データ機関リポジトリ、 doi : 10.11588/data/IE8CCN ↑ Hubert Mara および Bartosz Bogacz (2019)、「壊れたタブレットのコードを解読する:正規化された 2D および 3D データセットにおける注釈付き楔形文字の学習課題」、 第 15 回国際文書解析認識会議 (ICDAR) 議事録 (ドイツ語)、シドニー、オーストラリア、pp. 148–153 、 doi : 10.1109/ICDAR.2019.00032 、 ISBN 978-1-7281-3014-9 S2CID 211026941 {{citation}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)↑ Bogacz, Bartosz; Mara, Hubert (2020)、「幾何学的ニューラルネットワークを用いた3D楔形文字タブレットの時代分類」、 第17回手書き認識の最先端に関する国際会議(ICFHR)議事録 、ドイツ、ドルトムント ↑ ICFHRによる「幾何学的ニューラルネットワークを用いた3D楔形文字粘土板の時代分類」に関する論文のプレゼンテーション ( YouTube) ↑ Durjoy Sen Maitra; Ujjwal Bhattacharya; SK Parui、「複数のスクリプトの手書き文字認識のためのCNNベースの共通アプローチ」、Wayback Machine に2023年10月16日に アーカイブ済み、Document Analysis and Recognition (ICDAR)、2015年第13回国際会議、vol.、no.、pp.1021–1025、2015年8月23~26日 ↑ "NIPS 2017" . Interpretable ML Symposium . 2017-10-20. 2019-09-07 の オリジナルからアーカイブ済み。2018-09-12 に 取得 。 ↑ Zang, Jinliang; Wang, Le; Liu, Ziyi; Zhang, Qilin; Hua, Gang; Zheng, Nanning (2018). "Attention-Based Temporal Weighted Convolutional Neural Network for Action Recognition". Artificial Intelligence Applications and Innovations . IFIP Advances in Information and Communication Technology. Vol. 519. Cham: Springer International Publishing. pp. 97– 108. arXiv : 1803.07179 . doi : 10.1007/978-3-319-92007-8_9 . ISBN 978-3-319-92006-1 ISSN 1868-4238 . S2CID 4058889 . ↑ Wang, Le; Zang, Jinliang; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-06-21). "Action Recognition by an Attention-Aware Temporal Weighted Convolutional Neural Network" (PDF) . Sensors . 18 (7): 1979. Bibcode : 2018Senso..18.1979W . doi : 10.3390/s18071979 . ISSN 1424-8220 . PMC 6069475 . PMID 29933555 . 2018-09-13 のオリジナルから アーカイブ (PDF) . 2018-09-14 に取得 . ↑ Ong, Hao Yi; Chavez, Kevin; Hong, Augustus (2015-08-18). "分散型深層Q学習". arXiv : 1508.04186v2 [ cs.LG ]. ↑ Mnih, Volodymyr; et al. (2015). "深層強化学習による人間レベルの制御" . Nature . 518 ( 7540): 529–533 . Bibcode : 2015Natur.518..529M . doi : 10.1038/nature14236 . PMID 25719670. S2CID 205242740 . ↑ Sun, R.; Sessions, C. (2000年6月). "シーケンスの自己分割: 連続動作の階層の自動形成". IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics . 30 (3): 403–418 . Bibcode : 2000ITSMB..30..403S . CiteSeerX 10.1.1.11.226 . doi : 10.1109/3477.846230 . ISSN 1083-4419 . PMID 18252373 . ↑ 「CIFAR-10 における畳み込みディープビリーフネットワーク」 (PDF) 。2017-08-30 のオリジナルから アーカイブ (PDF) 。2017-08-18 に 取得 。 ↑ Lee, Honglak; Grosse, Roger; Ranganath, Rajesh; Ng, Andrew Y. (2009年1月1日). 「階層的表現のスケーラブルな教師なし学習のための畳み込み深層信念ネットワーク」. 第26回国際機械学習会議議事録 . ACM. pp. 609–616 . CiteSeerX 10.1.1.149.6800 . doi : 10.1145/1553374.1553453 . ISBN 978-1-60558-516-1 . S2CID 12008458 . ↑ Behnke, Sven (2003). 画像解釈のための階層型ニューラルネットワーク (PDF) . Lecture Notes in Computer Science. Vol. 2766. Springer. doi : 10.1007/b11963 . ISBN 978-3-540-40722-5 . S2CID 1304548 . 2017年8月10日にオリジナルからアーカイブ(PDF)されました 。 2016年12月28日 に取得。 ↑ Choi, Rene Y.; Coyner, Aaron S.; Kalpathy-Cramer, Jayashree; Chiang, Michael F.; Campbell, J. Peter (2020年2月)。 「機械学習、ニューラルネットワーク、ディープラーニング入門」 。Wired 。 2018年1月13日のオリジナルから アーカイブ 。 2017年 3月6日 取得 。
外部リンク CS231n:視覚認識のための畳み込みニューラルネットワーク—アンドレイ・カルパシー によるスタンフォード大学 コンピュータサイエンスのコンピュータビジョンにおけるCNNに関する講義 vdumoulin/conv_arithmetic: ディープラーニングのコンテキストにおける畳み込み演算に関する技術レポート。畳み込みのアニメーション。