
人工知能において、微分可能ニューラルコンピュータ(DNC)は、メモリ拡張ニューラルネットワークアーキテクチャ(MANN)であり、その実装では典型的には(定義上はそうではないが)再帰的である。このモデルは、2016年にDeepMindのAlex Gravesらによって発表された。[1]
アプリケーション
DNC は間接的にフォン・ノイマン・アーキテクチャからインスピレーションを得ており、決定境界を見つけることで学習することができない根本的にアルゴリズム的なタスクにおいて、従来のアーキテクチャよりも優れたパフォーマンスを発揮する可能性があります。
これまでのところ、DNC は、従来のプログラミングを使用して解決できる比較的単純なタスクのみを処理することが実証されています。しかし、DNC は問題ごとにプログラムする必要はなく、トレーニングすることができます。この注意持続時間により、ユーザーはグラフなどの複雑なデータ構造を順番に入力し、後で使用するために呼び出すことができます。さらに、記号推論の側面を学習し、それを作業記憶に適用することができます。この方法を発表した研究者は、DNC をトレーニングして複雑で構造化されたタスク[1] [2]を実行し、ビデオ解説の生成や意味テキスト分析など、何らかの推論を必要とするビッグデータ アプリケーションに対応できると期待しています。[3] [4]
DNCは高速交通システムをナビゲートするようにトレーニングでき、そのネットワークを別のシステムに適用できます。メモリのないニューラルネットワークは通常、各交通システムについてゼロから学習する必要があります。教師あり学習によるグラフトラバーサルおよびシーケンス処理タスクでは、DNCは長期短期記憶やニューラルチューリングマシンなどの代替手段よりも優れたパフォーマンスを発揮しました。 [5] SHRDLUに触発されたブロックパズル問題への強化学習アプローチにより、DNCはカリキュラム学習を通じてトレーニングされ、計画を立てることを学習しました。従来のリカレントニューラルネットワークよりも優れたパフォーマンスを発揮しました。[ 5]
建築

DNC ネットワークは、ニューラル チューリング マシン(NTM)の拡張として導入され、メモリの保存場所を制御するメモリ アテンション メカニズムと、イベントの順序を記録する時間アテンションが追加されました。この構造により、DNC は NTM よりも堅牢で抽象的でありながら、Long Short Term Memory ( LSTM ) などの先行モデルよりも長期的な依存関係を持つタスクを実行できます。単純な行列であるメモリは動的に割り当てられ、無制限にアクセスできます。DNC はエンドツーエンドで微分可能です (モデルの各サブコンポーネントは微分可能であるため、モデル全体も微分可能です)。これにより、勾配降下法を使用して効率的に最適化できます。[3] [6] [7]
DNCモデルはフォン・ノイマン・アーキテクチャに似ており、メモリのサイズ変更が可能であるためチューリング完全である。[8]
伝統的な民主党全国大会
DNC、初版[1]
拡張機能
改良点にはスパースメモリアドレッシングが含まれ、これにより時間と空間の複雑さが数千分の1に削減されます。これは、Locality-sensitive hashingなどの近似最近傍アルゴリズム、またはUBCのFast Library for approximate Nearest Neighborsなどのランダムkdツリーを使用することで実現できます。[9] Adaptive Computation Time (ACT)を追加すると、問題の長さと問題の難易度が常に同じではないという事実を利用して、計算時間とデータ時間を分離します。[10]合成勾配を使用したトレーニングは、時間によるバックプロパゲーション(BPTT)よりも大幅に優れたパフォーマンスを発揮します。 [11]レイヤー正規化とバイパスドロップアウトを正則化として使用することで、堅牢性を向上させることができます。[12]
参照
参考文献
- ^ abc Graves, Alex; Wayne, Greg; Reynolds, Malcolm; Harley, Tim; Danihelka, Ivo; Grabska-Barwińska, Agnieszka; Colmenarejo, Sergio Gómez; Grefenstette, Edward; Ramalho, Tiago (2016-10-12). 「動的外部メモリを備えたニューラルネットワークを使用したハイブリッドコンピューティング」. Nature . 538 (7626): 471–476. Bibcode :2016Natur.538..471G. doi :10.1038/nature20101. ISSN 1476-4687. PMID 27732574. S2CID 205251479.
- ^ 「微分可能なニューラルコンピューター | DeepMind」。DeepMind 。 2016年10月12日。 2016年10月19日閲覧。
- ^ ab バージェス、マット。「DeepMind の AI は人間のような理性と記憶力でロンドン地下鉄の乗り方を学習」。WIRED UK。2016年 10 月 19 日閲覧。
- ^ Jaeger, Herbert (2016-10-12). 「人工知能: ディープニューラル推論」. Nature . 538 (7626): 467–468. Bibcode :2016Natur.538..467J. doi : 10.1038/nature19477 . ISSN 1476-4687. PMID 27732576.
- ^ ab ジェームズ、マイク。「DeepMind の微分可能ニューラル ネットワークは深く考える」。www.i-programmer.info。2016年 10 月 20 日閲覧。
- ^ 「DeepMind AI、ロンドン地下鉄の乗り方を「学習」」PCMAG . 2016年10月19日閲覧。
- ^ Mannes, John (2016年10月13日). 「DeepMindの微分可能ニューラルコンピューターは、そのメモリで地下鉄のナビゲートを手助けします」. TechCrunch . 2016年10月19日閲覧。
- ^ 「RNNシンポジウム2016:アレックス・グレイブス - 微分可能ニューラルコンピュータ」。YouTube 。 2017年3月22日。
- ^ Jack W Rae; Jonathan J Hunt; Harley, Tim; Danihelka, Ivo; Senior, Andrew; Wayne, Greg; Graves, Alex; Timothy P Lillicrap (2016). 「スパース読み取りおよび書き込みによるメモリ拡張ニューラルネットワークのスケーリング」。arXiv : 1610.09027 [ cs.LG]。
- ^ Graves, Alex (2016). 「リカレントニューラルネットワークの適応計算時間」arXiv : 1603.08983 [cs.NE].
- ^ Jaderberg, Max; Wojciech Marian Czarnecki; Osindero, Simon; Vinyals, Oriol; Graves, Alex; Silver, David; Kavukcuoglu, Koray (2016). 「合成勾配を用いた分離型ニューラルインターフェース」. arXiv : 1608.05343 [cs.LG].
- ^ Franke, Jörg; Niehues, Jan; Waibel, Alex (2018). 「質問応答のための堅牢でスケーラブルな微分可能ニューラルコンピュータ」. arXiv : 1807.02658 [cs.CL].
外部リンク
- 微分可能なニューラルコンピュータを支配する方程式のビットごとのガイド
- DeepMindの微分可能ニューラルネットワークは深く考える
