
注意とは、シーケンス内の各コンポーネントの相対的な重要度を、そのシーケンス内の他のコンポーネントと比較して決定する機械学習手法です。自然言語処理では、重要度は文中の各単語に割り当てられた「ソフト」な重みによって表されます。より一般的には、注意は、数十から数百万のトークンのサイズに及ぶ 固定幅シーケンスにわたって、トークン 埋め込みと呼ばれるベクトルをエンコードします。
後方トレーニング パス中に計算される「ハード」ウェイトとは異なり、「ソフト」ウェイトは前方パスにのみ存在するため、入力の各ステップで変化します。以前の設計では、シリアルリカレント ニューラル ネットワーク言語翻訳システムでアテンション メカニズムを実装していましたが、最近の設計、つまりトランスフォーマーでは、低速のシーケンシャル RNN が削除され、より高速な並列アテンション スキームに大きく依存するようになりました。
人間の注意に関するアイデアに触発され、注意メカニズムは、再帰型ニューラル ネットワークの隠れた層からの情報を活用することの弱点に対処するために開発されました。再帰型ニューラル ネットワークは、文末の単語に含まれるより最近の情報を優先し、文の前の方の情報は減衰する傾向があります。注意により、トークンは、前の状態を経由するのではなく、文の任意の部分に直接平等にアクセスできます。
歴史
注意メカニズムの歴史に関する学術的なレビューは、Niu et al. [1]およびSoydaner. [2]に掲載されています。
先人たち
人間の選択的注意は神経科学と認知心理学でよく研究されてきた。[3] 1953年、コリン・チェリーは、カクテルパーティー効果として知られる聴覚における選択的注意を研究した。[4]
1958年、ドナルド・ブロードベントは注意のフィルターモデルを提唱した。[5]視覚の選択的注意は、1960年代にジョージ・スパーリングの部分報告パラダイムによって研究された。また、眼球が顕著性の高い領域に優先的に移動する限り、眼球運動制御は認知プロセスによって調整されることも注目された。眼球の中心窩は小さいため、眼球は視野全体を一度に鮮明に捉えることができない。眼球運動制御を使用すると、眼球はシーンの重要な特徴を素早くスキャンすることができる。[6]
これらの研究開発は、ネオコグニトロンやその派生型などのアルゴリズムに影響を与えました。[7] [8]一方、ニューラルネットワークの発展は、生物学的視覚注意の回路モデルに影響を与えました。[9] [2]たとえば、1998年のよく引用されるネットワークの1つは、低レベルの霊長類の視覚システムに触発されました。これは、手作りの(学習されていない)特徴を使用して画像の顕著性マップを作成し、次に、顕著性が低下する順に画像のパッチを処理する2番目のニューラルネットワークを誘導するために使用されました。[10]
注意機構の重要な側面は、次のように(図式的に)記述できます。ここで、山括弧はドット積を表します。これは、乗法演算が含まれていることを示しています。人工ニューラル ネットワーク内の乗法演算は、グループ データ処理法(1965)[11] [12](コルモゴロフ ガボール多項式が乗法ユニットまたは「ゲート」を実装します[13])、高次ニューラル ネットワーク、[14]乗算ユニット、[15]シグマ パイ ユニット、[16]高速重みコントローラ、[17]ハイパー ネットワークという名前で研究されてきました。[18]
高速重みコントローラ(Schmidhuber 、1992)では、2つのネットワークのうちの1つに「高速重み」または「動的リンク」(1981)があります。[19] [20] [21]低速ニューラルネットワークは、クエリに対する回答を計算する高速ニューラルネットワークの重みの変更を計算するためのキーと値を生成するために、勾配降下法で学習します。[17]これは後に、正規化されていない線形トランスフォーマーと同等であることが示されました。[22]フォローアップ論文では、アクティブな重み変更を備えた同様のシステムが開発されました。[23]
繰り返しの注意
ディープラーニングの時代には、エンコードとデコードにおける同様の問題を解決するためにアテンションメカニズムが開発されました。[1]
機械翻訳では、2014年に提案されたseq2seqモデル[24]は、入力テキストを固定長ベクトルにエンコードし、それを出力テキストにデコードします。入力テキストが長い場合、固定長ベクトルでは正確なデコードに十分な情報を伝達できません。この問題を解決するために、アテンションメカニズムが提案されました。
2015年に、seq2seqモデル[25]からヒントを得て、画像キャプションモデルが提案されました。これは、入力画像を固定長のベクトルにエンコードするものです。(Xu et al 2015)、[26]は(Bahdanau et al 2014)を引用し、[27]はseq2seqモデルで使用される注意メカニズムを画像キャプションに適用しました。
トランス
seq2seqモデルの問題点の1つは、エンコーダとデコーダの両方がトークンごとにシーケンスを処理する必要があるため並列化できないリカレントニューラルネットワークを使用していることです。分解可能注意[28]は、入力シーケンスを並列処理してから「ソフトアライメントマトリックス」(アライメントはBahdanauら[27]が使用した用語です)を計算して並列処理を可能にすることで、 この問題を解決しようとしました。
この時期には、エンコーダー-デコーダー(クロスアテンション)の代わりに、自己注意のための注意メカニズムを使用するというアイデアも提案されており、例えば微分可能ニューラルコンピュータ[29]やニューラルチューリングマシン[30]などがその例です。これは、LSTMが入力シーケンスをエンコードする際にメモリネットワークで拡張される イントラアテンション[31]と呼ばれていました。
これらの開発の流れは、2017 年に「Attention Is All You Need 」論文で公開されたTransformer アーキテクチャに統合されました。
シーケンス2シーケンス
2010 年代初頭に開発された seq2seq 法では、2 つのニューラル ネットワークを使用します。エンコーダー ネットワークは入力文を数値ベクトルに変換し、デコーダー ネットワークはそれらのベクトルをターゲット言語の文に変換します。Attention メカニズムは 2014 年にこの構造に移植され、その後 Transformer 設計に改良されました。
問題の説明

seq2seq 言語の英語からフランス語への翻訳タスクを考えてみましょう。具体的には、「the zone of international control <end>」の翻訳を考えてみましょう。これは「la zone de contrôle international <end>」と翻訳される必要があります。ここでは、エンコーダとデコーダの両方の入力の終了を区切るために、 特別な <end> トークンを制御文字として使用します。
入力されたテキストシーケンスは、ニューラル ネットワーク (LSTM、Transformer エンコーダー、またはその他のネットワーク) によって実数値ベクトルのシーケンスに処理されます。ここで、 は「隠しベクトル」を表します。
エンコーダーが処理を終えると、デコーダーは隠れベクトルに対して演算を開始し、自己回帰的に出力シーケンスを生成します。つまり、デコーダーは、エンコーダーによって生成された隠れベクトルと、デコーダー自体が以前に生成したものの両方を常に入力として受け取り、次の出力ワードを生成します。
- ( , "<開始>") → "la"
- ( , "<開始> ラ") → "ラゾーン"
- ( , "<開始> ラゾーン") → "ラゾーンで"
- ...
- ( , "<開始> インターナショナル ゾーン ド コントロール") → "インターナショナル ゾーン コントロール <終了>"
ここでは、デコーダーの入力の開始を区切るための 制御文字として、特別な <start> トークンを使用します。デコーダーの出力に "<end>" が現れるとすぐにデコードは終了します。
単語の配置
言語間の翻訳において、アライメントとは、原文の単語を翻訳文の単語と一致させるプロセスです。[32]上記の「I love you」の例では、2番目の単語loveが3番目の単語aimeとアライメントされています。je 、t'、aimeのソフト行ベクトルを積み重ねると、アライメント行列が生成されます。

場合によっては、アライメントは複数対複数になることがあります。たとえば、英語のフレーズlook it upはcherchez-leに対応します。したがって、「ソフト」アテンション ウェイトは、「ハード」アテンション ウェイト (1 つのアテンション ウェイトを 1 に設定し、その他を 0 に設定) よりも適切に機能します。これは、最適な隠しベクトルが存在しない可能性があるため、「最適なもの」ではなく、隠しベクトルの加重合計で構成されるコンテキスト ベクトルをモデルで作成する必要があるためです。
注意の重みをこのように見ると、ニューラル ネットワークの説明可能性の問題の一部が解決されます。語順に関係なく逐語的に翻訳するネットワークは、マトリックスの (支配的な) 対角線に沿って最高のスコアを示します。対角線外の優位性は、注意のメカニズムがより微妙であることを示しています。デコーダーの最初のパスでは、注意の重みの 94% が最初の英語の単語Iにかかっているため、ネットワークは単語jeを提供します。デコーダーの 2 番目のパスでは、注意の重みの 88% が 3 番目の英語の単語youにかかっているため、t'を提供します。最後のパスでは、注意の重みの 95% が 2 番目の英語の単語loveにかかっているため、aime を提供します。
注目度の重み

重みを手動で作成すると機械学習の目的にそぐわないため、モデルは独自に注目の重みを計算する必要があります。データベース クエリの言語から類推して、モデルがキー、クエリ、値という 3 つのベクトルを構築するようにします。大まかな考え方は、キーと値のペアのリストの形式で「データベース」があるというものです。デコーダーはクエリを送信し、値の加重合計の形式で応答を取得します。ここで、重みはクエリが各キーにどれだけ似ているかに比例します。
デコーダーは最初に「<start>」入力を部分的に処理して、デコーダーの 0 番目の隠しベクトルである中間ベクトルを取得します。次に、中間ベクトルは線形マップによってクエリ ベクトルに変換されます。一方、エンコーダーによって出力された隠しベクトルは、別の線形マップによってキーベクトルに変換されます。線形マップは、モデルに十分な自由度を与え、データを表す最適な方法を見つけるのに役立ちます。
ここで、クエリとキーはドット積を取ることによって比較されます。理想的には、モデルは、が大きく、が小さく、残りが非常に小さいようなキーと値を計算することを学習している必要があります。これは、アテンションの重みは、エンコーダーの 0 番目の隠しベクトルに主に、1 番目の隠しベクトルに少し、残りには基本的にまったく適用されないと解釈できます。
適切に重み付けされた合計を作成するには、このドット積のリストを 上の確率分布に変換する必要があります。これはソフトマックス関数によって実行でき、これにより注意の重みが得られます。次に、これを使用してコンテキスト ベクトルを計算します。
ここで、 は値ベクトルであり、別の行列によって線形変換され、モデルが値を表す最適な方法を見つける自由を提供します。行列がなければ、モデルはキーと値の両方に同じ隠しベクトルを使用するよう強制されますが、これら 2 つのタスクは同じではないため、これは適切ではない可能性があります。

これはドット アテンション メカニズムです。このセクションで説明する特定のバージョンは「デコーダー クロス アテンション」です。出力コンテキスト ベクトルはデコーダーによって使用され、入力キーと値はエンコーダーから取得されますが、クエリはデコーダーから取得されるため、「クロス アテンション」となります。
もっと簡潔に言うと、 と書くことができます。ここで、行列 は行が である行列です。クエリ ベクトル は、キー値ベクトル と必ずしも同じではないことに注意してください。実際には、クエリ、キー、値のベクトルがすべて異なることは理論的には可能ですが、実際にはめったに行われません。
概要
- この例では、単語「that」の注目度に焦点を当てています。実際には、計算を高速化するために、各単語の注目度は並列で計算されます。小文字の「x」ベクトルを大文字の「X」マトリックスに変更するだけで、この式が得られます。
- ソフトマックススケーリングqW k T / √ 100は、離散ハードマックスの場合のように、単一の単語がソフトマックスを過度に支配し、結果として 1 つの単語のみに注意が向けられるようなqW k Tの大きな分散を防ぎます。
- 表記法: 上記の一般的に記述される行方向のソフトマックス式は、ベクトルが行であると仮定しており、これは列ベクトルの標準的な数学表記法とは逆です。より正確には、コンテキストベクトルの転置を取り、列方向のソフトマックスを使用する必要があり、より正確な形式は次のようになります。

用語
この注意スキームは、リレーショナル データベースのクエリ キーのアナロジーと比較されています。この比較は、クエリ ベクトルとキー ベクトルの非対称な役割を示唆しています。つまり、 1 つの関心項目 (クエリ ベクトル "that")が、すべての可能性のある項目 (文中の各単語のキー ベクトル) と照合されます。ただし、注意の並列計算では、文中のすべての単語がそれ自体と照合されるため、これらのベクトルの役割は対称的です。おそらく、単純なデータベースのアナロジーに欠陥があるため、文脈内学習、[35]、マスク言語タスク、[36]、ストリップダウン トランスフォーマー、[37]、バイグラム統計、[38]、 N グラム統計、[39]、ペアワイズ畳み込み、[40]、算術因数分解などの焦点を絞った設定での役割を研究することで、注意をさらに理解するための多くの努力が払われてきました。[41]
バリエーション
多くのアテンションのバリエーションはソフトウェイトを実装しており、例えば
- 高速重みプログラマー、または高速重みコントローラ(1992)。[17]「低速」ニューラルネットワークは、外積を介して別のニューラルネットワークの「高速」重みを出力します。低速ネットワークは勾配降下法によって学習します。これは後に「線形化自己注意」と改名されました。[22]
- バダナウ型注意[32]は、加法的な注意とも呼ばれ、
- ルオン型注意[42]は乗法的注意として知られ、
- 2016年に分解可能な注意[31]として導入され、 1年後にトランスフォーマーで成功裏に使用された、高度に並列化された自己注意。
- 位置的注意と因子化位置的注意[43 ]
畳み込みニューラルネットワークの場合、注意メカニズムは、それが動作する次元によって区別することができ、空間注意、[44]チャネル注意、[45]またはその組み合わせである。[46] [47]
注意をさらに理解するために、文脈学習、[35]マスク言語タスク、[36]ストリップダウントランスフォーマー、[37 ]バイグラム統計、[38] Nグラム統計、[39]ペアワイズ畳み込み、[40]算術因数分解など、集中した設定での役割を研究する努力が払われてきました。[41]
これらのバリアントは、エンコーダ側の入力を再結合して、それらの効果を各ターゲット出力に再分配します。多くの場合、ドット積の相関スタイルのマトリックスが再重み付け係数を提供します。以下の図では、W はコンテキスト アテンション重みのマトリックスであり、上記のコア計算セクションの式に似ています。
自己注意


自己注意は、クエリ、キー、値のベクトルがすべて同じモデルから取得されることを除いて、基本的にクロス注意と同じです。エンコーダーとデコーダーの両方で自己注意を使用できますが、微妙な違いがあります。
エンコーダの自己注意については、固定ルックアップ テーブルによって各入力ワードをベクトルに変換するだけの「埋め込み層」などの自己注意のない単純なエンコーダから始めることができます。これにより、一連の隠しベクトル が得られます。次に、これらをドット積注意メカニズムに適用して、またはより簡潔に言うと を取得できます。これを繰り返し適用して、多層エンコーダを取得できます。これが「エンコーダの自己注意」であり、すべての位置のベクトルが他のすべてのベクトルに注意を向けることができるため、「全対全注意」と呼ばれることもあります。
マスキング

デコーダの自己注意の場合、自己回帰デコード処理中にデコーダがまだデコードされていない将来の出力に注意を向けることができないため、全対全の注意は不適切です。これは、 「因果マスキング」と呼ばれる、すべての注意の重みを強制することで解決できます。この注意メカニズムは、「因果的にマスクされた自己注意」です。
最適化
フラッシュアテンション
注意行列のサイズは、入力トークンの数の2乗に比例します。したがって、入力が長い場合、注意行列の計算には大量のGPUメモリが必要になります。フラッシュ注意は、精度を犠牲にすることなくメモリの必要性を減らし、効率を高める実装です。これは、注意計算をGPUのより高速なオンチップメモリに収まる小さなブロックに分割することで実現され、大きな中間行列を保存する必要性が減り、メモリ使用量が減り、計算効率が向上します。[52]
数学的表現
標準スケールのドット積アテンション
行列 および の場合、スケールされたドット積、つまりQKV アテンションは次のように定義されます。 ここで は転置を表し、ソフトマックス関数はその引数のすべての行に個別に適用されます。行列にはクエリが含まれ、行列には順序付けられていないキーと値のペアのセットが共同で含まれます。行列 内の値ベクトルは、ソフトマックス演算の結果の重みを使用して重み付けされるため、- 行 - 列の出力行列の行は、 の行によって指定された内の点の凸包に限定されます。
QKVアテンションの順列不変性と順列同変性の性質を理解するために、 [53]とを順列行列、および任意の行列とします。ソフトマックス関数は次の意味で 順列同変性です。
順列行列の転置は逆行列でもあることに注意すると、次のようになります。
これは、QKV アテンションがクエリ (の行) の並べ替えに関して同変であり、内のキーと値のペアの並べ替えに対して不変であることを示しています。これらのプロパティは、QKV アテンション ブロックの入力と出力に線形変換を適用するときに継承されます。たとえば、次のように定義される単純な自己アテンション関数:
は、出力のすべての行が入力のすべての行の関数であるため、入力行列の行を非自明な方法で並べ替えることに関して順列同変です。同様の特性は、以下で定義されるマルチヘッドアテンションにも当てはまります。
マスクされた注目
QKV アテンションが自己回帰デコーダーの構成要素として使用され、トレーニング時にすべての入力行列と出力行列に行がある場合、マスクされたアテンションのバリアントが使用されます。 ここで、マスクは厳密に上三角行列で、対角線上と下、および対角線より上のすべての要素にゼロがあります。 のソフトマックス出力 も下三角で、対角線より上のすべての要素にゼロがあります。マスクにより、すべての について、アテンション出力の行が3 つの入力行列のいずれの行からも独立していることが保証されます。標準の QKV アテンションの順列不変性と同値性の特性は、マスクされたバリアントには当てはまりません。
マルチヘッドアテンション

マルチヘッド アテンション では、各ヘッドは QKV アテンションで次のように計算されます。 および、およびはパラメーター マトリックスです。
(標準、マスクなし)QKVアテンションの順列特性はここでも適用されます。順列行列の場合、次のようになります。
ここから、マルチヘッド自己注意についても分かります。
入力行列の行の並べ替えに関して同変です。
バダナウ(添加剤)注意
ここで、およびは学習可能な重み行列である。[32]
ルオン注意(一般)
ここで学習可能な重み行列である。[42]
参照
参考文献
- ^ ab Niu, Zhaoyang; Zhong, Guoqiang; Yu, Hui (2021-09-10). 「ディープラーニングの注意メカニズムに関するレビュー」。Neurocomputing . 452 : 48–62. doi :10.1016/j.neucom.2021.03.091. ISSN 0925-2312.
- ^ ab Soydaner, Derya (2022年8月). 「ニューラルネットワークにおける注意メカニズム:それがどこから来て、どこへ行くのか」.ニューラルコンピューティングとアプリケーション. 34 (16): 13371–13385. doi :10.1007/s00521-022-07366-3. ISSN 0941-0643.
- ^ Kramer, Arthur F.; Wiegmann, Douglas A.; Kirlik, Alex (2006-12-28). 「1 注意: 歴史から応用へ」。注意: 理論から 実践へ。オックスフォード大学出版局。doi :10.1093/acprof:oso/ 9780195305722.003.0001。ISBN 978-0-19-530572-2。
- ^ Cherry EC (1953). 「片耳と両耳による音声認識に関するいくつかの実験」(PDF) .アメリカ音響学会誌. 25 (5): 975–79. Bibcode :1953ASAJ...25..975C. doi :10.1121/1.1907229. hdl : 11858/00-001M-0000-002A-F750-3 . ISSN 0001-4966.
- ^ Broadbent, D (1958).知覚とコミュニケーションロンドン: Pergamon Press.
- ^ Kowler, Eileen; Anderson, Eric; Dosher, Barbara; Blaser, Erik (1995-07-01). 「サッカードのプログラミングにおける注意の役割」. Vision Research . 35 (13): 1897–1916. doi :10.1016/0042-6989(94)00279-U. ISSN 0042-6989. PMID 7660596.
- ^ 福島 邦彦 (1987-12-01). 「視覚パターン認識と連想想起における選択的注意のためのニューラルネットワークモデル」.応用光学. 26 (23): 4985–4992. Bibcode :1987ApOpt..26.4985F. doi :10.1364/AO.26.004985. ISSN 0003-6935. PMID 20523477.
- ^ Ba, Jimmy; Mnih, Volodymyr; Kavukcuoglu, Koray (2015-04-23). 「視覚的注意による複数物体認識」. arXiv : 1412.7755 [cs.LG].
- ^ コッホ、クリストフ、ウルマン、シモン (1987)。「選択的視覚注意のシフト: 基礎となる神経回路に向けて」。ヴァイナ、ルシア M. (編)。知能の問題: 認知神経科学の概念構造。ドルドレヒト:シュプリンガーオランダ。pp. 115–141。doi :10.1007/978-94-009-3833-5_5。ISBN 978-94-009-3833-5. 2024年8月6日閲覧。
- ^ Itti, L.; Koch, C.; Niebur, E. (1998 年 11 月)。「迅速なシーン分析のための顕著性に基づく視覚的注意のモデル」IEEE Transactions on Pattern Analysis and Machine Intelligence 20 ( 11): 1254–1259. doi :10.1109/34.730558。
- ^ Ivakhnenko, AG (1973). サイバネティック予測装置. CCM Information Corporation.
- ^ Ivakhnenko, AG ; Grigorʹevich Lapa, Valentin (1967)。サイバネティクスと予測技術。American Elsevier Pub. Co.
- ^ Schmidhuber, Jürgen (2022). 「現代AIとディープラーニングの注釈付き歴史」. arXiv : 2212.11279 [cs.NE].
- ^ Giles, C. Lee; Maxwell, Tom (1987-12-01). 「高次ニューラルネットワークにおける学習、不変性、一般化」.応用光学. 26 (23): 4972–4978. doi :10.1364/AO.26.004972. ISSN 0003-6935. PMID 20523475.
- ^ Feldman, JA; Ballard, DH (1982-07-01). 「コネクショニストモデルとその特性」.認知科学. 6 (3): 205–254. doi :10.1016/S0364-0213(82)80001-3. ISSN 0364-0213.
- ^ Rumelhart, David E.; Hinton, GE; Mcclelland, James L. (1987-07-29)。「並列分散処理の一般的なフレームワーク」(PDF)。Rumelhart, David E.、Hinton, GE、PDP Research Group (編)。並列分散処理、第 1 巻: 認知の微細構造の探究: 基礎。マサチューセッツ州ケンブリッジ: MIT プレス。ISBN 978-0-262-68053-0。
- ^ abc Schmidhuber, Jürgen (1992). 「高速重みメモリの制御学習: リカレントネットの代替」.ニューラルコンピューティング. 4 (1): 131–139. doi :10.1162/neco.1992.4.1.131. S2CID 16683347.
- ^ ああ、デイビッド。ダイ、アンドリュー。ル、クオック V. (2016-12-01)。 「ハイパーネットワーク」。arXiv : 1609.09106 [cs.LG]。
- ^ Christoph von der Malsburg: 脳機能の相関理論。内部レポート 81-2、MPI 生物物理化学、1981 年。http://cogprints.org/1380/1/vdM_correlation.pdf Models of Neural Networks II、第 2 章、95-119 ページの再版を参照。Springer、ベルリン、1994 年。
- ^ Jerome A. Feldman、「ニューラルネットワークにおける動的接続」、Biological Cybernetics、第46巻、第1号、pp. 27-39、1982年12月。
- ^ Hinton, Geoffrey E.; Plaut, David C. (1987). 「高速重みを使用して古い記憶をぼかす」。認知科学協会年次会議の議事録。9 。
- ^ ab シュラーク、イマノール;入江一樹;シュミットフーバー、ユルゲン(2021)。 「リニアトランスはひそかに高速な重量プログラマです。」ICML 2021。スプリンガー。 9355–9366ページ。
- ^ Schmidhuber, Jürgen (1993). 「完全再帰型ネットにおける学習の複雑さと時間変動変数の数の比率の削減」ICANN 1993 . Springer. pp. 460–463.
- ^ Sutskever, Ilya; Vinyals, Oriol; Le, Quoc Viet (2014). 「ニューラルネットワークによるシーケンスツーシーケンス学習」. arXiv : 1409.3215 [cs.CL].
- ^ Vinyals, Oriol; Toshev, Alexander; Bengio, Samy; Erhan, Dumitru (2015). 「Show and Tell: ニューラル画像キャプションジェネレーター」 pp. 3156–3164.
- ^ Xu, Kelvin; Ba, Jimmy; Kiros, Ryan; Cho, Kyunghyun; Courville, Aaron; Salakhudinov, Ruslan; Zemel, Rich; Bengio, Yoshua (2015-06-01). 「見せる、注目する、伝える: 視覚的注意によるニューラル画像キャプション生成」。第 32 回国際機械学習会議の議事録。PMLR: 2048–2057。
- ^ ab Bahdanau, Dzmitry; Cho, Kyunghyun; Bengio, Yoshua (2016 年 5 月 19 日)。 「アラインメントと翻訳の共同学習によるニューラル機械翻訳」。arXiv : 1409.0473 [cs.CL]。(原文日付 2014 年 9 月 1 日)
- ^ Parikh, Ankur; Täckström, Oscar; Das, Dipanjan; Uszkoreit, Jakob (2016). 「自然言語推論のための分解可能な注意モデル」。2016年自然言語処理における経験的手法に関する会議の議事録。米国ペンシルバニア州ストウズバーグ: 計算言語学協会。pp. 2249–2255。arXiv : 1606.01933。doi : 10.18653/v1/d16-1244。
- ^ Graves, Alex; Wayne, Greg; Reynolds, Malcolm; Harley, Tim; Danihelka, Ivo; Grabska-Barwińska, Agnieszka; Colmenarejo, Sergio Gómez; Grefenstette, Edward; Ramalho, Tiago; Agapiou, John; Badia, Adrià Puigdomènech; Hermann, Karl Moritz; Zwols, Yori; Ostrovski, Georg; Cain, Adam; King, Helen; Summerfield, Christopher; Blunsom, Phil; Kavukcuoglu, Koray; Hassabis, Demis (2016-10-12). 「動的外部メモリを備えたニューラルネットワークを使用したハイブリッドコンピューティング」。Nature . 538 ( 7626): 471–476. Bibcode :2016Natur.538..471G. doi :10.1038/nature20101. ISSN 1476-4687. PMID 27732574. S2CID 205251479.
- ^ グレイブス、アレックス;ウェイン、グレッグ。ダニヘルカ、イヴォ (2014-12-10)。 「ニューラルチューリングマシン」。arXiv : 1410.5401 [cs.NE]。
- ^ ab Cheng, Jianpeng; Dong, Li; Lapata, Mirella (2016-09-20). 「機械読み取りのための長短期記憶ネットワーク」. arXiv : 1601.06733 [cs.CL].
- ^ abc Bahdanau, Dzmitry; Cho, Kyunghyun; Bengio, Yoshua (2014). 「アラインメントと翻訳の共同学習によるニューラル機械翻訳」. arXiv : 1409.0473 [cs.CL].
- ^ Britz, Denny; Goldie, Anna; Luong, Minh-Thanh; Le, Quoc (2017-03-21). 「ニューラル機械翻訳アーキテクチャの大規模な調査」. arXiv : 1703.03906 [cs.CV].
- ^ 「Pytorch.org seq2seqチュートリアル」。2021年12月2日閲覧。
- ^ ab Zhang, Ruiqi (2024). 「訓練されたトランスフォーマーはコンテキスト内で線形モデルを学習する」(PDF) . Journal of Machine Learning Research 1-55 . 25 . arXiv : 2306.09927 .
- ^ ab Rende, Riccardo (2024). 「一般化ポッツモデルへの注意メカニズムのマッピング」. Physical Review Research . 6 (2): 023057. arXiv : 2304.07235 . Bibcode :2024PhRvR...6b3057R. doi :10.1103/PhysRevResearch.6.023057.
- ^ ab He, Bobby (2023). 「トランスフォーマーブロックの簡素化」. arXiv : 2311.01906 [cs.LG].
- ^ ab Nguyen, Timothy (2024). 「Nグラム統計によるトランスフォーマーの理解」. arXiv : 2407.12034 [cs.CL].
- ^ ab 「トランス回路」。transformer -circuits.pub。
- ^ ab Transformer Neural Network Derived From Scratch. 2023. イベントは 05:30 に発生します。2024-04-07に取得。
- ^ ab Charton, François (2023). 「最大公約数の学習: Transformer 予測の説明」. arXiv : 2308.15594 [cs.LG].
- ^ abc Luong, Minh-Thang (2015-09-20). 「注意に基づくニューラル機械翻訳への効果的なアプローチ」. arXiv : 1508.04025v5 [cs.CL].
- ^ 「順次推奨のための位置注意の学習」catalyzex.com。
- ^ Zhu, Xizhou; Cheng, Dazhi; Zhang, Zheng; Lin, Stephen; Dai, Jifeng (2019). 「ディープネットワークにおける空間的注意メカニズムの実証的研究」。2019 IEEE/CVF 国際コンピュータビジョン会議 (ICCV) 。pp . 6687–6696。arXiv : 1904.05873。doi : 10.1109 / ICCV.2019.00679。ISBN 978-1-7281-4803-8. S2CID 118673006。
- ^ Hu, Jie; Shen, Li; Sun, Gang ( 2018). 「スクイーズアンドエキサイテーションネットワーク」。2018 IEEE /CVF コンピュータービジョンおよびパターン認識会議。pp. 7132–7141。arXiv : 1709.01507。doi : 10.1109 / CVPR.2018.00745。ISBN 978-1-5386-6420-9. S2CID 206597034。
- ^ ウー、サンヒョン;パク・ジョンチャン。イ・ジュニョン。クォン、インソ(2018-07-18)。 「CBAM: 畳み込みブロック アテンション モジュール」。arXiv : 1807.06521 [cs.CV]。
- ^ ジョルジェスク、マリアナ・ユリアナ;イヨネスク、ラドゥ・チューダー。ミロン、アンドレア・ユリアナ。サヴェンク、オリビアン。リステア、ニコラエ=カタリン。ヴェルガ、ニコラエ。カーン、ファハド・シャバズ(2022-10-12)。 「医用画像の超解像度のためのさまざまなカーネル サイズを使用したマルチモーダル マルチヘッド畳み込み注意」。arXiv : 2204.04218 [eess.IV]。
- ^ Neil Rhodes (2021). CS 152 NN—27: 注意: キー、クエリ、値。イベントは 06:30 に発生します。2021年 12 月 22 日閲覧。
- ^ Alfredo Canziani & Yann Lecun (2021). NYU Deep Learning コース、2020 年春。イベントは 05:30 に発生します。2021年 12 月 22 日閲覧。
- ^ Alfredo Canziani & Yann Lecun (2021). NYU Deep Learning コース、2020 年春。イベントは 20:15 に発生します。2021年 12 月 22 日閲覧。
- ^ Robertson, Sean. 「NLP From Scratch: Translation With a Sequence To Sequence Network and Attention」. pytorch.org . 2021年12月22日閲覧。
- ^ Mittal, Aayush (2024-07-17). 「Flash Attention: 変圧器の効率を革新する」Unite.AI . 2024年11月16日閲覧。
- ^ Lee, Juho; Lee, Yoonho; Kim, Jungtaek; Kosiorek, Adam R; Choi, Seungjin; Teh, Yee Whye (2018). 「Set Transformer: Attention-based Permutation-Invariant Neural Networks のフレームワーク」. arXiv : 1810.00825 [cs.LG].
外部リンク
- Olah, Chris; Carter, Shan (2016 年 9 月 8 日)。「Attention and Augmented Recurrent Neural Networks」。Distill . 1 ( 9)。Distill Working Group。doi :10.23915/distill.00001。
- Dan Jurafskyおよび James H. Martin (2022) 音声言語処理 (第 3 版ドラフト、2022 年 1 月)、第 10.4 章「注意」および第 9.7 章「自己注意ネットワーク: トランスフォーマー」
- Alex Graves (2020年5月4日)、ディープラーニングにおける注意と記憶 (ビデオ講義)、DeepMind / UCL、YouTube経由
