ニューラルネットワーク(NN)には、さまざまな手法があります。最も単純なタイプは、ユニット数、層数、ユニットの重み、トポロジーなどの静的な要素を持ちます。動的なNNは、学習によって進化します。一部のタイプは、オペレーターによる「監視」学習を可能にするか、または必要としますが、他のタイプは独立して動作します。一部のタイプは完全にハードウェア上で動作しますが、他のタイプは完全にソフトウェアで、汎用コンピュータ上で動作します。
主な種類は以下のとおりです。
フィードフォワードニューラルネットワークでは、情報は各層で入力から出力へ直接伝達されます。入力を順序付けるために、隠れ層(サイクル/ループの有無を問わず)を設けることができます。フィードフォワードネットワークは、バイナリのマカロック・ピッツニューロンなど、さまざまなタイプのユニットで構築できます。最も単純なのはパーセプトロンです。連続ニューロンは、多くの場合シグモイド活性化関数を用いて、バックプロパゲーションの文脈で使用されます。
グループデータ処理法(GMDH)[ 5 ]は、構造とパラメトリックモデルの完全自動最適化を特徴としています。ノード活性化関数は、加算と乗算を可能にするコルモゴロフ・ガボール多項式です。8層のディープ多層パーセプトロンを使用します。 [ 6 ]これは、各層が回帰分析によってトレーニングされる、層ごとに成長する教師あり学習ネットワークです。不要な項目は検証セットを使用して検出され、正則化によって剪定されます。結果として得られるネットワークのサイズと深さは、タスクによって異なります。[ 7 ]
オートエンコーダー、オートアソシエーター、またはディアボロネットワーク[ 8 ] : 19は、入力層、出力層、およびそれらを接続する1つ以上の隠れ層を持つ多層パーセプトロン(MLP)に似ています。ただし、出力層は入力層と同じ数のユニットを持ちます。その目的は、(目標値を出力するのではなく)自身の入力を再構築することです。したがって、オートエンコーダーは教師なし学習モデルです。オートエンコーダーは、効率的なコーディングの教師なし学習[ 9 ] [ 10 ]、通常は次元削減の目的、およびデータの生成モデルの学習に使用されます。[ 11 ] [ 12 ]
確率的ニューラルネットワーク (PNN) は、4 層のフィードフォワード ニューラルネットワークです。層は、入力、隠れパターン、隠れ加算、出力です。PNN アルゴリズムでは、各クラスの親確率分布関数 (PDF) は、パーゼン ウィンドウと非パラメトリック関数によって近似されます。次に、各クラスの PDF を使用して、新しい入力のクラス確率が推定され、ベイズのルールを使用して、最も高い事後確率を持つクラスに割り当てられます。[ 13 ]これは、ベイジアン ネットワーク[ 14 ]とカーネル フィッシャー判別分析と呼ばれる統計アルゴリズムから派生したものです。[ 15 ]これは、分類とパターン認識に使用されます。
時間遅延ニューラルネットワーク(TDNN)は、シーケンスデータに対して、シーケンスの位置に依存しない特徴を認識するフィードフォワードアーキテクチャです。時間シフト不変性を実現するために、入力に遅延が加えられ、複数のデータポイント(時間上のポイント)が同時に分析されます。
これは通常、より大きなパターン認識システムの一部を構成する。接続重みがバックプロパゲーション(教師あり学習)で訓練されたパーセプトロンネットワークを使用して実装されている。 [ 16 ]
畳み込みニューラルネットワーク(CNN、またはConvNet、シフト不変、または空間不変)は、1つ以上の畳み込み層と、その上に全結合層(一般的なANNのものと一致する)で構成されるディープネットワークの一種です。 [ 17 ] [ 18 ]重みとプーリング層を使用します。特に、最大プーリングです。[ 19 ]福島の畳み込みアーキテクチャを介して構造化されることがよくあります。[ 20 ]これらは、最小限の前処理を使用する多層パーセプトロンのバリエーションです。[ 21 ]このアーキテクチャにより、CNNは入力データの2D構造を活用できます。
そのユニットの接続パターンは、視覚野の組織にヒントを得ています。ユニットは、受容野と呼ばれる限られた空間領域内の刺激に反応します。受容野は部分的に重なり合い、視覚野全体を覆います。ユニットの反応は、畳み込み演算によって数学的に近似できます。[ 22 ]
CNNは、視覚データやその他の2次元データの処理に適しています。[ 1 ] [ 23 ]画像と音声アプリケーションの両方で優れた結果を示しています。標準的なバックプロパゲーションでトレーニングできます。CNNは、他の通常のディープフィードフォワードニューラルネットワークよりもトレーニングが容易で、推定するパラメータがはるかに少なくなっています。[ 24 ]
カプセルニューラルネットワーク(CapsNet)は、CNNにカプセルと呼ばれる構造を追加し、複数のカプセルからの出力を再利用して、より安定した(さまざまな摂動に対して)表現を形成します。[ 25 ]
コンピュータビジョンの応用例としては、DeepDream [ 26 ]やロボットナビゲーション[ 27 ]などがある。これらは画像認識や動画認識、レコメンデーションシステム[ 28 ]、自然言語処理[ 29 ]など幅広い分野で応用されている。
ディープスタッキングネットワーク(DSN)[ 30 ](ディープ凸ネットワーク)は、簡略化されたニューラルネットワークモジュールのブロックの階層に基づいています。これは、2011年にDengとYuによって導入されました。[ 31 ]これは、閉形式の解を持つ凸最適化問題として学習を定式化し、メカニズムがスタック汎化と類似していることを強調しています。[ 32 ]各DSNブロックは、ブロック全体に対してバックプロパゲーションを行わずに、教師あり学習で簡単に個別にトレーニングできる単純なモジュールです。 [ 8 ]
各ブロックは、単一の隠れ層を持つ簡略化された多層パーセプトロン(MLP)で構成されています。隠れ層hはロジスティックシグモイドユニットを持ち、出力層は線形ユニットを持ちます。これらの層間の接続は重み行列Uで表され、入力から隠れ層への接続は重み行列Wを持ちます。ターゲットベクトルtは行列Tの列を形成し、入力データベクトルxは行列Xの列を形成します。隠れユニットの行列はモジュールは順番に学習されるため、各段階で下位層の重みWが既知となります。この関数は要素ごとのロジスティックシグモイド演算を実行します。各ブロックは同じ最終ラベルクラスyを推定し、その推定値は元の入力Xと連結されて次のブロックへの拡張入力となります。したがって、最初のブロックへの入力には元のデータのみが含まれますが、下流のブロックへの入力には先行するブロックの出力が追加されます。ネットワーク内の他の重みが与えられた場合、上位層の重み行列U の学習は凸最適化問題として定式化できます。
閉形式解が存在する。[ 30 ]
DBNなどの他の深層アーキテクチャとは異なり、DSNの目標は変換された特徴表現を発見することではありません。この種のアーキテクチャの階層構造により、バッチモードの最適化問題として並列学習が容易になります。純粋に識別的なタスクにおいては、DSNは従来のDBNよりも優れた性能を発揮します。
このアーキテクチャは DSN の拡張です。重要な改善点が 2 つあります。共分散統計からの高次の情報を使用することと、下位層の非凸問題を上位層の凸部分問題に変換することです。 [ 33 ] TDSN は、同じ層の 2 つの異なる隠れユニットのセットそれぞれから予測への双線形マッピングで共分散統計を使用し、3 次テンソルを介しています。
従来のDNNでは並列化とスケーラビリティは真剣に考慮されていませんが、[ 34 ] [ 35 ] [ 36 ] DSNとTDSNのすべての学習はバッチモードで実行され、並列化が可能になります。[ 31 ] [ 30 ]並列化により、設計をより大規模な (より深い) アーキテクチャとデータセットに拡張できます。
基本的なアーキテクチャは、分類や回帰など、多様なタスクに適しています。
このようなニューラルネットワークは、微分方程式、積分方程式、遅延方程式、分数方程式などの数式を数値的に解くために設計されています。PINN [ 37 ]は入力パラメータとして変数(空間変数、時間変数など)を受け取り、ネットワークブロックを通して送信します。出力では、初期条件と境界条件を考慮して近似解を生成し、それを数式モデルに代入します。解が要求される精度を満たさない場合は、バックプロパゲーションを使用して解を修正します。
PINN以外にも、科学計算タスクの代理モデルを生成するために他のアーキテクチャが開発されている。例としては、DeepONet [ 38 ] 、積分ニューラル演算子(FNOなど)[ 39 ]、ニューラルフィールド(CORALなど)[ 40 ]などがある。
調節フィードバックネットワークは、脳の認識処理領域全体に見られるフィードバックを説明する。ニューラルネットワークのように認識推論がフィードフォワード(入力から出力へ)であるのとは異なり、調節フィードバックは、推論が入力と出力を繰り返し比較し、ニューロンが自身の入力を抑制し、各入力が次の反復にとってどれほど重要でユニークであるかを集合的に評価することを想定している。これにより、最終的にニューロンの活性化が相互の入力の重複を最小限に抑え、認識中の分布を推定し、複雑なニューラルネットワークのトレーニングとリハーサルの必要性を軽減する。[ 41 ]
調節フィードバック処理は、脳のシナプス前ニューロンとシナプス後ニューロンの間に遍在するフィードバックが、リアルタイム認識処理において重要な役割を担っていることを示唆しており、このフィードバックは恒常性可塑性によって綿密に維持されています。恒常性可塑性は、多くの場合冗長な複数のメカニズムによってバランスが保たれていることがわかっています。また、調節フィードバックは、興奮抑制バランス、ネットワーク全体のバースト発火とその後の静穏化、複数の入力が存在する場合の類似性に対する困難やポップアウトといった人間の認知探索現象など、神経科学的な現象を、追加のパラメータなしで本質的に示しています。
制御フィードバックネットワークは、負のフィードバックを使用して推論を行います。[ 42 ] フィードバックは、ユニットの最適な活性化を見つけるために使用されます。これは非パラメトリック法に最も似ていますが、フィードフォワードネットワークを数学的に模倣するという点で、K近傍法とは異なります。
放射基底関数は、中心からの距離基準を持つ関数です。放射基底関数は、多層パーセプトロンのシグモイド隠れ層転送特性の代替として適用されてきました。RBF ネットワークは 2 つの層を持ちます。最初の層では、入力が「隠れ」層の各 RBF にマッピングされます。選択される RBF は通常ガウス関数です。回帰問題では、出力層は平均予測出力を表す隠れ層値の線形結合です。この出力層値の解釈は、統計学における回帰モデルと同じです。分類問題では、出力層は通常、事後確率を表す隠れ層値の線形結合のシグモイド関数です。どちらの場合も、古典的な統計学でリッジ回帰として知られる収縮手法によってパフォーマンスが向上することがよくあります。これは、ベイズフレームワークにおける小さなパラメータ値(したがって滑らかな出力関数)に対する事前信念に対応します。
RBFネットワークは、多層パーセプトロンと同様に、局所最適解を回避できるという利点があります。これは、学習プロセスで調整されるパラメータが、隠れ層から出力層への線形マッピングのみであるためです。線形性により、誤差曲面は二次関数となり、容易に見つけられる単一の最小値を持つことになります。回帰問題では、これは1回の行列演算で見つけることができます。分類問題では、シグモイド出力関数によって導入される固定の非線形性は、反復的に重み付けされた最小二乗法を用いることで最も効率的に処理できます。
RBFネットワークの欠点は、入力空間を放射基底関数で十分にカバーする必要があることです。RBFの中心は入力データの分布に基づいて決定されますが、予測タスクとは関係ありません。そのため、タスクとは無関係な入力空間の領域に表現リソースが浪費される可能性があります。一般的な解決策は、各データポイントをそれぞれの中心に関連付けることですが、これにより最終層で解くべき線形システムが拡大し、過学習を避けるために収縮手法が必要になります。
各入力データをRBFに関連付けることで、サポートベクターマシン(SVM)やガウス過程などのカーネル法が自然に生まれます(RBFはカーネル関数です)。これら3つのアプローチはすべて、非線形カーネル関数を使用して入力データを線形モデルで学習問題を解決できる空間に投影します。ガウス過程と同様に、SVMとは異なり、RBFネットワークは通常、確率を最大化(誤差を最小化)することで最尤法の枠組みで学習されます。SVMは代わりにマージンを最大化することで過学習を回避します。ほとんどの分類アプリケーションでは、SVMはRBFネットワークよりも優れた性能を発揮します。回帰アプリケーションでは、入力空間の次元が比較的小さい場合に、SVMはRBFネットワークと同等の性能を発揮します。
RBFニューラルネットワークは、概念的にはK近傍法(k-NN)モデルと類似している。基本的な考え方は、類似した入力からは類似した出力が得られるというものである。
トレーニングセットの各ケースには、予測変数 x と y の 2 つがあり、目的変数には、正と負の 2 つのカテゴリがあるとします。予測変数 x=6、y=5.1 の新しいケースが与えられた場合、目的変数はどのように計算されますか?
この例で実行される最近傍分類は、考慮される近傍点の数によって異なります。1-NNを使用し、最も近い点が負の値である場合、新しい点は負の値として分類されるべきです。一方、9-NN分類を使用し、最も近い9つの点を考慮する場合、周囲の8つの正の値の影響が、最も近い9番目の(負の)点の影響を上回る可能性があります。
RBFネットワークは、予測変数(この例ではx、y)で記述される空間にニューロンを配置します。この空間は、予測変数と同じ次元数を持ちます。新しい点から各ニューロンの中心までのユークリッド距離が計算され、その距離に放射基底関数(RBF、カーネル関数とも呼ばれる)を適用して、各ニューロンの重み(影響力)が計算されます。放射基底関数という名前は、半径距離が関数の引数となることに由来します。
新しい点の値は、RBF関数の出力値に各ニューロンについて計算された重みを乗じたものを合計することによって求められます。
ニューロンの放射基底関数は、中心と半径(広がりとも呼ばれる)を持ちます。半径はニューロンごとに異なる場合があり、DTREGによって生成されるRBFネットワークでは、各次元で半径が異なる場合があります。
拡散範囲が広くなるほど、ある一点から離れた場所にあるニューロンの影響力は大きくなる。
RBFネットワークは3つの層から構成されています。
以下のパラメータは、トレーニングプロセスによって決定されます。
RBFネットワークの学習には様々な手法が用いられてきた。一つのアプローチは、まずK平均クラスタリングを用いてクラスタ中心を見つけ、それをRBF関数の中心として用いるというものである。しかし、K平均クラスタリングは計算負荷が高く、最適な数の中心を生成できない場合が多い。もう一つのアプローチは、学習データからランダムに抽出したサブセットを中心として用いるというものである。
DTREGは、進化的手法を用いて各ニューロンの最適な中心点と広がりを決定する学習アルゴリズムを採用しています。推定されるリーブワンアウト(LOO)誤差を監視し、過学習によってLOO誤差が増加し始めた時点でネットワークへのニューロンの追加を停止します。
隠れ層と加算層のニューロン間の最適な重みの計算は、リッジ回帰を用いて行われます。反復手順により、一般化交差検証(GCV)誤差を最小化する最適な正則化ラムダパラメータが計算されます。
GRNNは、確率的ニューラルネットワークに似た連想記憶ニューラルネットワークですが、分類ではなく回帰や近似に使用されます。

ディープビリーフネットワーク(DBN)は、複数の隠れ層から構成される確率的生成モデルです。これは、単純な学習モジュールの集合体と考えることができます。 [ 43 ]
DBNは、学習済みのDBN重みを初期DNN重みとして使用することで、深層ニューラルネットワーク(DNN)を生成的に事前学習するために使用できます。さまざまな識別アルゴリズムでこれらの重みを調整できます。これは、トレーニングデータが限られている場合に特に役立ちます。なぜなら、初期化が不適切な重みは学習を著しく阻害する可能性があるからです。これらの事前学習された重みは、ランダムな選択よりも最適な重みに近い重み空間の領域に収束します。これにより、モデリングの改善と最終的な収束の高速化の両方が可能になります。[ 44 ]
リカレントニューラルネットワーク(RNN)は、データを順方向に伝播させるだけでなく、後続の処理段階から前続の処理段階へと逆方向にも伝播させます。RNNは汎用的なシーケンスプロセッサとして使用できます。
このアーキテクチャは1980年代に開発されました。そのネットワークは、すべてのユニット間に有向接続を形成します。各ユニットは、時間とともに変化する実数値(0または1以外の値)の活性化(出力)を持ちます。各接続には、変更可能な実数値の重みがあります。ノードの一部はラベル付きノード、一部は出力ノード、残りは隠れノードと呼ばれます。
離散時間設定での教師あり学習では、実数値の入力ベクトルのトレーニングシーケンスは、入力ノードの活性化のシーケンスとなり、入力ベクトルは一度に1つずつ処理されます。各タイムステップで、各非入力ユニットは、接続を受けているすべてのユニットの活性化の重み付き和の非線形関数として、現在の活性化を計算します。システムは、特定のタイムステップで、一部の出力ユニットを(入力信号とは独立して)明示的に活性化することができます。たとえば、入力シーケンスが音声化された数字に対応する音声信号である場合、シーケンスの最後にある最終的なターゲット出力は、その数字を分類するラベルとなる可能性があります。各シーケンスのエラーは、ネットワークによって計算されたすべての活性化と対応するターゲット信号との偏差の合計です。多数のシーケンスからなるトレーニングセットの場合、総エラーは、個々のシーケンスすべてのエラーの合計となります。
全体の誤差を最小限に抑えるには、非線形活性化関数が微分可能である限り、各重みを誤差に関する導関数に比例して変更するために勾配降下法を使用できます。標準的な方法は「時間によるバックプロパゲーション」または BPTT と呼ばれ、フィードフォワードネットワークのバックプロパゲーションの一般化です。[ 45 ] [ 46 ]計算コストの高いオンラインバリアントは「リアルタイム再帰学習」または RTRL と呼ばれます。[ 47 ] [ 48 ] BPTT とは異なり、このアルゴリズムは時間的には局所的ですが、空間的には局所的ではありません。[ 49 ] [ 50 ]中間的な複雑さを持つ BPTT と RTRL のオンラインハイブリッドが存在し、[ 51 ] [ 52 ]連続時間用のバリアントもあります。[ 53 ]標準的な RNN アーキテクチャの勾配降下法の大きな問題は、重要なイベント間の時間遅延の大きさに伴って誤差勾配が指数関数的に急速に消滅することです。[ 54 ] [ 55 ]長短期記憶アーキテクチャはこれらの問題を克服します。[ 56 ]
強化学習の設定では、教師は目標信号を提供しません。代わりに、適合度関数、報酬関数、または効用関数がパフォーマンスを評価するために時折使用され、それが環境に影響を与えるアクチュエータに接続された出力ユニットを介して入力ストリームに影響を与えます。重み行列を最適化するために、進化計算の変種がよく使用されます。
ホップフィールドネットワークは(同様のアトラクターベースのネットワークと同様に)歴史的に興味深いものですが、パターンシーケンスを処理するように設計されていないため、一般的なRNNではありません。代わりに、静的な入力が必要です。これは、すべての接続が対称であるRNNです。収束が保証されています。接続をヘッブ学習を使用してトレーニングすると、ホップフィールドネットワークは、接続の変更に耐性のある堅牢なコンテンツアドレス可能メモリとして機能します。
ボルツマンマシンは、ノイズのあるホップフィールドネットワークと考えることができます。これは、潜在変数(隠れユニット)の学習を実証した最初のニューラルネットワークの1つです。ボルツマン機械学習は当初シミュレーションに時間がかかりましたが、コントラスティブダイバージェンスアルゴリズムによって、ボルツマンマシンとエキスパートプロダクトのトレーニングが高速化されました。
自己組織化マップ(SOM)は、教師なし学習を利用します。一連のニューロンが、入力空間の点を出力空間の座標にマッピングすることを学習します。入力空間は出力空間とは異なる次元やトポロジーを持つことがありますが、SOMはこれらを維持しようとします。
学習ベクトル量子化(LVQ)は、ニューラルネットワークのアーキテクチャとして解釈できます。クラスの代表的な要素は、適切な距離尺度とともに、距離ベースの分類スキームにおいてパラメータ化されます。
単純なリカレントネットワークは、入力層に「コンテキストユニット」のセットを追加した3つの層で構成されています。これらのユニットは、固定重み1で隠れ層または出力層から接続されます。[ 57 ]各タイムステップで、入力は標準的なフィードフォワード方式で伝播され、その後、バックプロパゲーションのような学習ルールが適用されます(勾配降下は実行されません)。固定バック接続により、コンテキストユニットには隠れユニットの以前の値のコピーが残ります(学習ルールが適用される前に接続を介して伝播されるため)。
リザーバーコンピューティングは、ニューラルネットワークの拡張と見なせる計算フレームワークです。[ 58 ]通常、入力信号は、リザーバーと呼ばれる固定(ランダム)動的システムに入力され、そのダイナミクスによって入力がより高次元にマッピングされます。読み出しメカニズムは、リザーバーを目的の出力にマッピングするようにトレーニングされます。トレーニングは読み出し段階でのみ実行されます。液体状態マシン[ 59 ]は、リザーバーコンピューティングの一種です。[ 60 ]
エコー状態ネットワーク(ESN)は、疎に接続されたランダムな隠れ層を採用しています。出力ニューロンの重みは、ネットワークの中で唯一学習される部分です。ESNは特定の時系列を再現するのに優れています。[ 61 ]
長短期記憶(LSTM)[ 56 ]は勾配消失問題を回避します。入力間の遅延が長い場合でも機能し、低周波成分と高周波成分が混在する信号を処理できます。LSTM RNNは、言語学習[ 62 ]や連結手書き文字認識[ 63 ]などのアプリケーションにおいて、他のRNNやHMMなどの他のシーケンス学習手法よりも優れた性能を発揮しました。
双方向RNN、またはBRNNは、有限シーケンスを使用して、シーケンスの各要素の過去と未来のコンテキストに基づいて、各要素を予測またはラベル付けします。[ 64 ]これは、2つのRNNの出力を加算することによって行われます。1つはシーケンスを左から右に処理し、もう1つは右から左に処理します。結合された出力は、教師から与えられたターゲット信号の予測です。この手法は、LSTMと組み合わせると特に有用であることが証明されています。[ 65 ]
階層型RNNは、さまざまな方法で要素を接続し、階層的な動作を有用なサブプログラムに分解します。[ 66 ] [ 67 ]
従来のニューラルネットワークとは異なり、確率的人工ニューラルネットワークはランダム関数の近似として使用される。
RNN(多くの場合LSTM)では、系列が複数のスケールに分解され、各スケールは連続する2点間の基本的な長さを表します。1次スケールは通常のRNNで構成され、2次スケールは2つのインデックスで区切られたすべての点で構成され、以下同様です。N次RNNは最初と最後のノードを接続します。さまざまなスケールからの出力は機械委員会として扱われ、関連するスコアは次の反復で遺伝的に使用されます。
機械委員会(CoM)とは、複数の異なるニューラルネットワークが集まって、与えられた事例に対して共同で「投票」を行う仕組みです。これは一般的に、個々のネットワークを用いるよりもはるかに優れた結果をもたらします。ニューラルネットワークは局所最適解に陥りやすいため、同じアーキテクチャと学習方法を用いても、ランダムに異なる初期重みを用いると、結果が大きく異なることがよくあります。CoMは、このような結果を安定させる傾向があります。
CoMは一般的な機械学習のバギング手法と似ていますが、委員会に必要な多様なマシンは、トレーニングデータの異なるランダムに選択されたサブセットでトレーニングするのではなく、異なる開始重みからトレーニングすることによって得られます。
連想ニューラルネットワーク (ASNN) は、複数のフィードフォワードニューラルネットワークと k 近傍法を組み合わせた、マシン委員会の拡張です。これは、kNN の分析対象ケース間の距離の尺度として、アンサンブル応答間の相関を使用します。これにより、ニューラルネットワークアンサンブルのバイアスが補正されます。連想ニューラルネットワークは、トレーニングセットと一致するメモリを持ちます。新しいデータが利用可能になると、ネットワークは再トレーニングなしで予測能力を即座に向上させ、データ近似 (自己学習) を提供します。ASNN のもう 1 つの重要な特徴は、モデル空間におけるデータケース間の相関の分析によってニューラルネットワークの結果を解釈できることです。[ 68 ]
物理ニューラルネットワークは、人工シナプスをシミュレートするために電気的に調整可能な抵抗材料を含みます。例としては、メムリスタベースのニューラルネットワークであるADALINE があります。[ 69 ]光ニューラルネットワークは、光学部品を使用した人工ニューラルネットワークの物理的な実装です。
静的ニューラルネットワークとは異なり、動的ニューラルネットワークは推論中にその構造やパラメータを入力に適応させ[ 70 ]、過渡現象や遅延効果などの時間依存的な挙動を示します。パラメータが時間とともに変化する可能性のある動的ニューラルネットワークは、1つのニューラルネットワークが別のニューラルネットワークの重みを出力する高速重みアーキテクチャ(1987)[ 71 ]に関連しています。
カスケード相関は、アーキテクチャと教師あり学習アルゴリズムです。固定トポロジーのネットワークで重みを調整するだけではなく、[ 72 ]カスケード相関は最小限のネットワークから始まり、新しい隠れユニットを1つずつ自動的にトレーニングして追加し、多層構造を作成します。新しい隠れユニットがネットワークに追加されると、その入力側の重みは固定されます。このユニットは、出力を生成したり、他のより複雑な特徴検出器を作成したりするために使用できる、ネットワーク内の永続的な特徴検出器になります。カスケード相関アーキテクチャには、学習が速く、独自のサイズとトポロジーを決定し、トレーニングセットが変更されても構築した構造を保持し、バックプロパゲーションを必要としないなど、いくつかの利点があります。
ニューロファジーネットワークは、人工ニューラルネットワーク(ANN)の本体に組み込まれたファジー推論システムです。FISの種類に応じて、複数の層がファジー化、推論、集約、非ファジー化といったファジー推論に関わるプロセスをシミュレートします。一般的なANN構造にFISを組み込むことで、既存のANN学習手法を用いてファジーシステムのパラメータを求めることができるという利点があります。
構成パターン生成ネットワーク(CPPN)は、活性化関数のセットとその適用方法が異なる人工ニューラルネットワークの一種です。一般的な人工ニューラルネットワークはシグモイド関数(場合によってはガウス関数)のみを含むことが多いのに対し、CPPNは両方のタイプの関数を含むことができ、さらに他の多くの関数も使用できます。また、一般的な人工ニューラルネットワークとは異なり、CPPNは可能な入力空間全体に適用されるため、完全な画像を表現できます。CPPNは関数の合成であるため、実質的に無限の解像度で画像をエンコードし、特定の表示に対して最適な解像度でサンプリングすることができます。
メモリネットワーク[ 73 ] [ 74 ]は長期記憶を組み込んでいる。長期記憶は読み書きが可能で、予測に利用することを目的としている。これらのモデルは質問応答(QA)の文脈で適用されており、長期記憶は(動的な)知識ベースとして機能し、出力はテキスト形式の応答となる。[ 75 ]
疎な分散メモリや階層的な時間メモリでは、ニューラルネットワークによってエンコードされたパターンがコンテンツアドレス可能なメモリのアドレスとして使用され、「ニューロン」は基本的にアドレスエンコーダおよびデコーダとして機能します。しかし、このようなメモリの初期コントローラは微分可能ではありませんでした。[ 76 ]
このタイプのネットワークは、再学習なしで新しいパターンを追加できます。これは、隣接して接続された階層配列を使用して各新しいパターンを直交平面に割り当てる特定のメモリ構造を作成することによって行われます。[ 77 ]このネットワークは、リアルタイムのパターン認識と高いスケーラビリティを提供します。これには並列処理が必要であり、ワイヤレスセンサーネットワーク、グリッドコンピューティング、GPGPUなどのプラットフォームに最適です。
階層的時間記憶(HTM)は、新皮質の構造的およびアルゴリズム的特性の一部をモデル化したものです。HTMは、記憶予測理論に基づいた生体模倣モデルです。HTMは、観測された入力パターンやシーケンスの高レベルの原因を発見し推論するための手法であり、それによって世界に関するますます複雑なモデルを構築していきます。
HTMは、大脳新皮質を模倣するという既存のアイデアと、多くの機能を提供するシンプルな設計を組み合わせました。HTMは、ベイジアンネットワーク、空間クラスタリングアルゴリズム、時間クラスタリングアルゴリズムで使用されるアプローチを組み合わせ、拡張するとともに、ニューラルネットワークで一般的なツリー状のノード階層を使用しています。
ホログラフィック連想記憶(HAM)は、アナログで相関ベースの連想刺激応答システムです。情報は複素数の位相方向上にマッピングされます。この記憶は、連想記憶タスク、一般化、および可変注意によるパターン認識に効果的です。動的な探索位置特定は、生物学的記憶の中心です。視覚知覚において、人間はパターン内の特定のオブジェクトに焦点を合わせます。人間は学習することなく、オブジェクトからオブジェクトへと焦点を移すことができます。HAMは、焦点の明示的な表現を作成することで、この能力を模倣できます。パターンの二峰性表現とホログラムのような複素球状重み状態空間を使用します。HAMは、基となる超球状計算を光学計算で実装できるため、光学的実現に役立ちます。[ 78 ]
長短期記憶(LSTM)以外にも、リカレント関数に微分可能な記憶を追加するアプローチがあります。例えば、次のようになります。
ニューラルチューリングマシン(NTM)[ 86 ]は、LSTMネットワークを外部メモリリソースに結合し、注意プロセスによって相互作用できるようにします。この結合システムはチューリングマシンに似ていますが、エンドツーエンドで微分可能であるため、勾配降下法によって効率的に学習できます。予備的な結果では、ニューラルチューリングマシンは、入力と出力の例からコピー、ソート、連想想起などの単純なアルゴリズムを推論できることが示されています。
微分可能なニューラルコンピュータ(DNC)はNTMの拡張です。シーケンス処理タスクにおいて、ニューラルチューリングマシン、長短期記憶システム、およびメモリネットワークを凌駕しました。 [ 87 ] [ 88 ] [ 89 ] [ 90 ] [ 91 ]
過去の経験を直接表現し、類似の経験を使用してローカル モデルを形成するアプローチは、最近傍法またはk-最近傍法と呼ばれることが多い。[ 92 ]ディープラーニングは、セマンティック ハッシング[ 93 ]で有用であり、そこでは、大規模なドキュメント セットから得られた単語カウント ベクトル[ 94 ]をディープグラフィカル モデル化します。ドキュメントは、意味的に類似したドキュメントが近くのアドレスに配置されるようにメモリ アドレスにマッピングされます。クエリ ドキュメントに類似したドキュメントは、クエリ ドキュメントのアドレスからわずか数ビットだけ異なるすべてのアドレスにアクセスすることによって見つけることができます。1000ビット アドレスで動作するスパース分散メモリとは異なり、セマンティック ハッシングは、従来のコンピュータ アーキテクチャで見られる 32 ビットまたは 64 ビット アドレスで動作します。
深層ニューラルネットワークは、学習可能性を維持しながら、深層化とパラメータ削減によって潜在的に改善できます。非常に深い(たとえば100万層)ニューラルネットワークの学習は実用的ではないかもしれませんが、ポインタネットワーク[ 95 ]やニューラルランダムアクセスマシン[ 96 ]などのCPUライクなアーキテクチャは、外部ランダムアクセスメモリや、レジスタ、ALU、ポインタなど、コンピュータアーキテクチャに通常含まれるその他のコンポーネントを使用することで、この制限を克服します。このようなシステムは、メモリセルとレジスタに格納された確率分布ベクトル上で動作します。したがって、モデルは完全に微分可能であり、エンドツーエンドで学習します。これらのモデルの重要な特徴は、その深さ、短期記憶のサイズ、およびパラメータの数を独立して変更できることです。
エンコーダー・デコーダーフレームワークは、高度に構造化された入力を高度に構造化された出力にマッピングするニューラルネットワークに基づいています。このアプローチは、機械翻訳の文脈で生まれました。[ 97 ] [ 98 ] [ 99 ]機械翻訳では、入力と出力は2つの自然言語で書かれた文です。その研究では、LSTM RNNまたはCNNがエンコーダーとして使用され、ソース文を要約し、条件付きRNN言語モデルを使用して要約をデコードして翻訳を生成しました。[ 100 ]これらのシステムは、ゲート付きRNNとCNN、および訓練されたアテンションメカニズムという共通の構成要素を持っています。
瞬時学習型ニューラルネットワーク(ITNN)は、瞬時に起こるように見える短期学習の現象に着想を得て開発されました。これらのネットワークでは、隠れ層と出力層の重みが学習ベクトルデータから直接マッピングされます。通常はバイナリデータに対応していますが、わずかな追加処理で連続データに対応できるバージョンも存在します。
スパイクニューラルネットワーク(SNN)は、入力のタイミングを明示的に考慮します。ネットワークの入力と出力は通常、一連のスパイク(デルタ関数またはより複雑な形状)として表現されます。SNNは時間領域(時間とともに変化する信号)の情報処理が可能です。SNNはリカレントネットワークとして実装されることがよくあります。SNNはパルスコンピュータの一種でもあります。[ 101 ]
軸索伝導遅延を伴うスパイクニューラルネットワークはポリクロニゼーションを示し、したがって非常に大きな記憶容量を持つ可能性がある。[ 102 ]
SNN(スパイクニューラルネットワーク)や、そのようなネットワークにおける神経集合体の時間的相関は、視覚系における図と地の分離や領域の連結をモデル化するために用いられてきた。
空間ニューラルネットワーク (SNN) は、地理的現象の表現と予測のためにカスタマイズされたニューラルネットワーク (NN)の上位カテゴリを構成します。これらは、地理空間データセットを扱う場合、非空間/古典的な NN の統計的精度と信頼性を一般的に向上させ、また、地理空間データセットの変数が非線形関係を表す場合、他の空間(統計) モデル(空間回帰モデルなど)の統計的精度と信頼性も向上させます。[ 103 ] [ 104 ] [ 105 ] SNN の例としては、OSFA 空間ニューラルネットワーク、SVANN、GWNN などがあります。
ネオコグニトロンは、視覚野をモデルにした階層的な多層ネットワークです。パターン認識タスクで使用するカスケードモデルとして、複数のタイプのユニット(元々は単純細胞と複雑細胞と呼ばれる2種類)を使用します。 [ 106 ] [ 107 ] [ 108 ]局所的特徴はS細胞によって抽出され、その変形はC細胞によって許容されます。入力の局所的特徴は徐々に統合され、より高次の層で分類されます。[ 109 ]さまざまな種類のネオコグニトロンの中には、バックプロパゲーションを使用して選択的注意を実現することで、同じ入力内の複数のパターンを検出できるシステムがあります。 [ 110 ]これはパターン認識タスクに使用され、畳み込みニューラルネットワークに影響を与えました。[ 112 ]
複合階層型ディープモデルは、ノンパラメトリックベイズモデルを用いたディープネットワークを構成します。特徴は、 DBN [ 113 ] 、ディープボルツマンマシン(DBM) [ 114 ] 、ディープオートエンコーダー[ 115 ] 、畳み込みバリアント[ 116 ] [ 117 ] 、ssRBM [ 118 ] 、ディープコーディングネットワーク[ 119 ] 、スパース特徴学習付きDBN [ 120 ]、RNN [ 121 ] 、条件付きDBN [ 122 ]、ノイズ除去オートエンコーダー[ 123 ]などのディープアーキテクチャを使用して学習できます。これにより、より優れた表現が得られ、学習が速くなり、高次元データでの分類精度が向上します。ただし、これらのアーキテクチャは、入力の表現にすべてのネットワークユニットが関与するため、例が少ない新しいクラスの学習には適していません (分散表現)であり、一緒に調整する必要があります(自由度が)。自由度を制限すると、学習するパラメータの数が減り、少数の例から新しいクラスの学習が容易になります。階層ベイズ(HB)モデルはコンピュータビジョン、統計、認知科学の場合[ 124 ] [ 125 ] [ 126 ] [ 127 ] [ 128 ]のように、少数の例から学習することを可能にします。
複合HDアーキテクチャは、HBとディープネットワークの両方の特性を統合することを目的としています。複合HDP-DBMアーキテクチャは、階層モデルとしての階層的ディリクレ過程(HDP)であり、DBMアーキテクチャを組み込んでいます。これは、モデル層を流れる抽象概念から一般化された完全な生成モデルであり、「合理的に」自然に見える新しいクラスの新しい例を合成することができます。すべてのレベルは、共同対数確率スコアを最大化することによって共同で学習されます。[ 129 ]
3つの隠れ層を持つDBMにおいて、可視入力「ν」の確率は次のようになります。
どこは隠れユニットの集合であり、はモデルパラメータであり、可視-隠蔽および隠蔽-隠蔽の対称的な相互作用項を表します。
学習済みDBMモデルは、結合分布を定義する無向モデルです。学習内容を表現する一つの方法は、条件付きモデルを用いることである。そして以前の任期。
ここは条件付き DBM モデルを表し、2 層 DBM と見なすことができますが、バイアス項は状態によって与えられます。:
深層予測符号化ネットワーク(DPCN)は、深層で局所的に接続された生成モデルを用いて、トップダウン情報からボトムアップ推論手順に必要な事前分布を経験的に調整する予測符号化方式です。これは、線形動的モデルを用いて時変観測から疎な特徴を抽出することで機能します。次に、プーリング戦略を用いて不変特徴表現を学習します。これらのユニットが組み合わさって深層アーキテクチャを形成し、貪欲な層ごとの教師なし学習によって訓練されます。各層は一種のマルコフ連鎖を構成し、任意の層の状態は前後の層のみに依存します。
DPCNは、上位層の情報と以前の状態からの時間的依存関係を使用したトップダウンアプローチを使用して、層の表現を予測します。[ 130 ]
DPCNは畳み込みネットワークを形成するように拡張できます。[ 130 ]
多層カーネルマシン(MKM)は、弱非線形カーネルを繰り返し適用することで高度に非線形な関数を学習する方法です。MKMは、深層学習の教師なし貪欲層ごとの事前学習ステップの方法として、カーネル主成分分析(KPCA)[ 131 ]を使用します。 [ 132 ]
層前の層の表現を学習する抽出する投影層の主成分(PC)カーネルによって誘導される特徴領域における出力。各層における更新された表現の次元を削減するために、教師あり戦略によって、 KPCAによって抽出された特徴の中から最も情報量の多い特徴が選択されます。そのプロセスは次のとおりです。
MKMに対するKPCA法にはいくつかの欠点がある。
音声言語理解のために、カーネルマシンをディープラーニングに利用するより直接的な方法が開発されました。[ 133 ]主なアイデアは、カーネルマシンを使用して無限個の隠れユニットを持つ浅いニューラルネットワークを近似し、次にディープスタッキングネットワークを使用してカーネルマシンの出力と生の入力を接合して、カーネルマシンの次の高レベルを構築することです。ディープ凸ネットワークのレベル数は、クロスバリデーションによって決定されるシステム全体のハイパーパラメータです。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)