
LeNetは、1988年から1998年の間にAT&Tベル研究所の研究グループ(ヤン・ルカンを中心とする)によって開発された一連の畳み込みニューラルネットワークアーキテクチャです。手書きの数字や文字の小さなグレースケール画像を読み取るために設計され、ATMで使用されました。小切手を読むためのs 。
畳み込みニューラルネットワークは、フィードフォワードニューラルネットワークの一種で、人工ニューロンがカバー範囲内の周囲の細胞の一部に反応することができ、大規模な画像処理で優れた性能を発揮します。LeNet-5は初期の畳み込みニューラルネットワークの1つであり、ディープラーニングの開発において歴史的に重要な役割を果たしました。[ 1 ]
一般的に、LeNet が番号なしで言及される場合、それは 1998 年版[ 2 ] LeNet-5を指し、これは最もよく知られているバージョンです。

1988年10月、ルカンはローレンス・D・ジャッケルが率いるニュージャージー州ホルムデルのAT&Tベル研究所 の適応システム研究部門に加わった。 [ 3 ] [ 4 ] [ 5 ]

1988年11月下旬[ 6 ] [ 7 ]、John S. Denker [ a ]らは手書き郵便番号を認識するためのニューラルネットワーク設計を発表した。しかし、その最初の数層の接続は手動で調整されていた。[ 10 ]
1989年、ベル研究所のヤン・ルカンらは、バックプロパゲーションアルゴリズムを初めて実用的なアプリケーションに適用し、タスクのドメインからの制約を与えることで、ネットワークの汎化学習能力が大幅に向上すると考えました。彼は、バックプロパゲーションアルゴリズムで訓練された畳み込みニューラルネットワークを、手書きの数字を読み取るために組み合わせ、米国郵政公社から提供された手書きの郵便番号の識別に成功裏に適用しました。これが、後にLeNet-1と呼ばれるようになったもののプロトタイプでした。[ 11 ]同年、ルカンは別の論文で小さな手書き数字認識問題について説明し、この問題は線形分離可能であるにもかかわらず、単層ネットワークでは汎化能力が低いことを示しました。多層の制約付きネットワークでシフト不変特徴検出器を使用すると、モデルは非常にうまく機能しました。彼は、これらの結果が、ニューラルネットワークの自由パラメータの数を最小限に抑えることで、ニューラルネットワークの汎化能力を向上させることができることを証明していると考えました。[ 12 ]
1989年、LeNet-1を紹介する論文で、手書き数字認識におけるバックプロパゲーションネットワークの応用について再び説明しました。データに対して最小限の前処理しか行わず、モデルはタスクに合わせて慎重に設計され、非常に制約が厳しかったです。入力データは、それぞれ数字を含む画像で構成され、米国郵政公社から提供された郵便番号のデジタルデータに対するテスト結果では、モデルのエラー率はわずか1%、拒否率は約9%でした。[ 13 ] [ 14 ]
彼らの研究はその後4年間続き、1994年にMNISTデータベースが開発されたが、LeNet-1では小さすぎたため、新しいLeNet-4がそれに基づいて訓練された。[ 15 ]
1年後、AT&Tベル研究所の研究者たちは、標準的な手書き数字をベンチマークタスクとして使用し、紙の手書き文字認識に関するさまざまな手法を検討した。これらのモデルを比較した結果、最新のネットワークが他のモデルよりも優れていることが示された。[ 16 ]
1998年までに、ヤン・ルカン、レオン・ボットー、ヨシュア・ベンジオ、パトリック・ハフナーは、オンラインで手書き文字を認識する2つのシステムや、1日に数百万枚の小切手を読み取ることができるモデルなど、ニューラルネットワークの実用的な応用例を提供することができた。これにはLeNet-5の説明も含まれている。[ 2 ]
この研究は大きな成功を収め、ニューラルネットワークの研究に対する学者たちの関心を喚起した。現在最も高性能なニューラルネットワークのアーキテクチャはLeNetとは異なるものの、LeNetは数多くのニューラルネットワークアーキテクチャの出発点となり、この分野にインスピレーションを与えた。

LeNetは、畳み込み層、プーリング層、全結合層など、現代の畳み込みニューラルネットワークに共通するいくつかのモチーフを備えています。 [ 11 ]
1989年、LeCunらは「Net-1」から「Net-5」までを含む報告書を発表した。[ 12 ]その後、1998年まで多くの改良が加えられ、命名規則は一貫していない。[ 2 ]一般的に、「LeNet」というと、1998年のLeNet、別名「LeNet-5」を指す。
LeNet-1、4、5は[ 2 ] [ 15 ]で言及されているが、LeNet-2、LeNet-3が何を指すのかは不明である。
LeCun研究グループが発表した最初のニューラルネットワークは1988年のものでした。[ 10 ]これはハイブリッドアプローチでした。最初の段階では、入力画像を拡大縮小、傾き補正、骨格化しました。2番目の段階は、18個の手動で設計されたカーネルを持つ畳み込み層でした。3番目の段階は、1つの隠れ層を持つ全結合ネットワークでした。
このデータセットは、実際の米国郵便から抽出された手書き数字画像のコレクションであり、有名な1989年のレポートで使用されたものと同じデータセットです。[ 11 ]
Net-1からNet-5は1989年のレポートで発表された。[ 12 ]それらすべての最後の層は完全に接続されている。元の論文ではパディング戦略は説明されていない。畳み込み層の出力セルを含め、すべてのセルは独立したバイアスを持っている。
このデータセットには、それぞれ16×16ピクセルのバイナリ画像が480枚含まれていました。元々は、各数字の12例をマウスを使って16×13のビットマップ上に手描きし、120枚の画像を作成しました。次に、各画像を水平方向に4つずつずらして16×16のバージョンを作成し、480枚の画像を得ました。
これらの画像から、320枚(1桁あたり32枚)をランダムに選択して学習に用い、残りの160枚(1桁あたり16枚)をテストに用いた。学習セットにおける性能は全てのネットワークで100%であったが、テストセットにおける性能はネットワークによって異なった。
1989年に発表されたLeNetは、3つの隠れ層(H1~H3)と出力層を持っています。[ 11 ]ユニット数は1256、接続数は64660、独立したパラメータ数は9760です。
H1とH2間の接続パターンは[ 18 ]の表1に記載されています。計算コストが高すぎると判断されたため、独立したプーリング層はありませんでした。[ 19 ]
このデータセットは「米国郵便公社データベース」と呼ばれ、ニューヨーク州バッファローの郵便局を通過する米国の郵便物に手書きで書かれた郵便番号からデジタル化された、解像度16×16のグレースケール画像9298枚で構成されていました。[ 11 ]トレーニングセットには7291のデータポイントがあり、テストセットには2007のデータポイントがありました。トレーニングセットとテストセットの両方に、曖昧で分類不能なデータと誤分類されたデータが含まれていました。このタスクはかなり困難です。テストセットでは、2人の人間(ジェーン・ブロムリーとエドゥアルト・ゼッキンガー)が平均2.5%の割合でエラーを犯しました。[ 20 ] [ 21 ]
トレーニングはSun-4/260上で3日間かけて行われ、ニュートン法の対角ヘッセ行列近似法が用いられました。SNニューラルネットワークシミュレータ上で実装され、トレーニングセット全体で23エポックを要しました。
1988年の以前のアーキテクチャと比較すると、スケルトン化は行われておらず、畳み込みカーネルはバックプロパゲーションによって自動的に学習された。
1989年版LeNetの後のバージョンは、4つの隠れ層(H1~H4)と出力層を備えています。入力として28x28ピクセルの画像を受け取りますが、境界効果を避けるためにアクティブ領域は16x16です。[ 22 ]
このネットワークは、4635個のユニット、98442個の接続、および2578個の学習可能なパラメータで構成されています。そのアーキテクチャは、1989年のLeNetをベースに設計され、Optimal Brain Damageによってパラメータ数を4分の1に削減しました。[ 23 ] 1回の順伝播には、約14万回の乗算加算演算が必要です。メモリサイズは50kBです。LeNet-1とも呼ばれていました。SPARCstation 10では、学習に0.5週間、1枚の画像を分類するのに0.015秒かかりました。[ 15 ]
1994 LeNet は、より大規模な MNIST データベースに適合するように設計された 1989 LeNet の大型版です。LeNet-4 とも呼ばれます。畳み込み層に特徴マップが多く、最後の畳み込み層と出力ユニットの両方に完全に接続された隠れユニットの層が追加されています。2 つの畳み込み、2 つの平均プーリング、および 2 つの全結合層があります。約 17000 個の学習可能なパラメータがあります。[ 15 ]
1回の順伝播には約26万回の乗算加算が必要です。メモリサイズは60kBです。SPARCstation 10では、トレーニングに2週間かかり、1枚の画像を分類するのに0.03秒かかりました。[ 15 ]


1998 LeNet は 1994 LeNet と似ていますが、全結合層が多くなっています。そのアーキテクチャは右の画像に示されています。2 つの畳み込み層、2 つのサブサンプリング層、および 3 つの全結合層があります。通常は LeNet-5 と呼ばれます。約 60000 個の学習可能なパラメータがあります。[ 2 ]
具体的には、以下の層から構成されています。
各「サブサンプリング」層は厳密には平均プーリングではなく、学習可能なパラメータを持つ。具体的には、S2 の単一セルを考えてみよう。これは C1 の 4 つのセルを入力として受け取る。これらのセルには値があるとしよう。すると、S2 のセルには次の値があります。、 どこは学習可能なパラメータであり、これはシグモイド活性化関数であり、「ルカンのtanh」と呼ばれることもあります。これは双曲線正接活性化関数のスケーリング版です。区間をマッピングするように設計されているそれ自体に、したがって「通常の動作条件」では全体的な利得が約 1 になることを保証し、最大となるのはこれにより、トレーニング終了時の収束性が向上します。[ 12 ] [ 24 ]
以下の表では、各列は、S2の6つの特徴マップのうち、C3の15の特徴マップのそれぞれのユニットによって組み合わされているものを示しています。
C5には出力形状がありますがこれは完全結合層ではありません。なぜなら、このネットワークは、入力形状が任意の高さと幅を持ち、ネットワークがトレーニングされているデータよりも、C5 の出力形状は大きくなります。同様に、F6 の出力も大きくなります。実際、現代の言葉で言えば、レイヤーF6は次のように表現するのが適切である。畳み込み。[ 25 ]
ネットワークの畳み込み部分の出力には84個のニューロンがありますが、これは偶然ではありません。84 = 7×12となるように設計されており、ネットワークの出力は7×12の小さなグレースケール画像として見ることができるからです。
出力層はRBFユニットで構成されており、RBFネットワークと同様です。10個のユニットそれぞれに84個のパラメータがあり、これらは手動で設計して固定することも、学習させることも可能です。手動で設計する場合、7×12のグレースケール画像として表示したときに、認識対象の数字のように見えるように設計されます。
1998年、LeNetはヘッセ行列の対角近似を用いた確率的レーベンバーグ・マルカート法で学習されました。MNISTデータセットで約20エポック学習されました。Silicon Graphics Origin 2000サーバー上で、 200MHzのR10000プロセッサ1基を使用して、CPU時間を2~3日要しました。 [ 2 ]
2005年に「LeNet7」というモデルが言及されました。NYU Object Recognition Benchmark (NORB) でベンチマークテストを行ったところ、SVMよりも優れていることが示されました。90,857個の学習可能なパラメータと466万個の接続を持ち、1回の順伝播には3,896,920回の乗算加算が必要でした。1998年のLeNetと同じ方法で、約25万回のパラメータ更新で学習されました。[ 26 ] [ 27 ]
単純な数字画像の認識は、LeNet がそのために作られたため、LeNet の最も古典的なアプリケーションです。[ 11 ] 1989 年に LeNet が開発された後、リアルタイム アプリケーションのデモンストレーションとして、[ 19 ]ニューラル ネットワークを AT&T DSP-32Cデジタル信号プロセッサ[ 28 ]にロードし、毎秒1250 万回の乗算加算演算のピーク性能を実現しました。毎秒 10 桁の正規化と分類、または毎秒 30 桁の正規化済み数字の分類が可能でした。[ 11 ]その後まもなく、研究グループはNCR (1991 年に AT&T に買収)の開発グループと製品グループと協力し始めました。その結果、DSP-32C にロードされた LeNet を使用して小切手の数値金額を読み取ることができる ATM マシンが開発されました。
その後、NCRは1996年6月から銀行のバックオフィスにある大型小切手読み取り機に同様のシステムを導入し、2001年時点では1日に2000万枚の小切手、つまり米国の小切手全体の10%を読み取っていたと推定されている。 [ 29 ]これは「グラフ変換器」であり、1998年に報告されたLeNetが主な構成要素で、約60000個の学習可能なパラメータを持っていた。[ 2 ]草稿レポートによると、このシステムはHCAR50(Holmdel Courtesy Amount Reader)と呼ばれていた。[ b ]以前のバージョンはHCAR30とHCAR40の2つあった。[ 30 ] [ 31 ]
LeNet-5はCNNの出現を意味し、 CNNの基本コンポーネントを定義しています。[ 2 ]しかし、当時はハードウェア、特にGPUが不足していたこと、またSVMなどの他のアルゴリズムが同様の効果を達成したり、LeNetを凌駕したりできたため、普及しませんでした。
2012年のAlexNetの成功以来、 CNNはコンピュータビジョンアプリケーションにとって最適な選択肢となり、R- CNNシリーズなど、さまざまなタイプのCNNが開発されてきました。現在、CNNモデルはLeNetとはかなり異なっていますが、すべてLeNetをベースに開発されています。
LeNet-5を模倣した3層ツリーアーキテクチャで、畳み込み層が1つだけ構成されているものが、CIFAR-10データセットで同様の成功率を達成した。[ 32 ]
LeNetアーキテクチャのフィルタ数を増やすと、エラー率がべき乗則に従って減少します。これらの結果は、浅いネットワークでも深層学習アーキテクチャと同じ性能を達成できることを示しています。[ 33 ]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)