概要 ビジョントランスフォーマーのアーキテクチャ。内部にはエンコーダー専用のトランスフォーマーブロックが配置されている。 2020年の原著論文[ 1 ] で使用されている基本的なアーキテクチャは以下のとおりです。要約すると、 BERT のようなエンコーダのみのTransformerです。
入力画像はタイプR H × W × C \displaystyle \mathbb {R} ^{H\times W\times C}} 、 どこH 、 W 、 C {\displaystyle H,W,C} 高さ、幅、チャンネル(RGB )です。次に、正方形のパッチに分割されます。R P × P × C \displaystyle \mathbb {R} ^{P\times P\times C}} 。
各パッチについて、パッチは線形演算子を通してベクトル(「パッチ埋め込み」)を取得します。パッチの位置も「位置エンコーディング」によってベクトルに変換されます(この論文では、埋め込みなし、1D埋め込み、2D埋め込み、相対埋め込みを試しましたが、1Dが採用されました)。[ a ] [ 1 ] : §D.4 2つのベクトルが加算され、複数のTransformerエンコーダを通して処理されます。
ViTにおけるアテンション機構は、画像パッチの表現ベクトルを繰り返し変換し、画像内の画像パッチ間の意味的関係をますます多く取り込んでいきます。これは、自然言語処理において、表現ベクトルがトランスフォーマーを通過する際に、構文から意味へと、単語間の意味的関係をますます多く取り込んでいくのと類似しています。
上記のアーキテクチャは、画像をベクトル表現のシーケンスに変換します。これらのベクトル表現を下流のアプリケーションで使用するには、それらを解釈するための追加のヘッドをトレーニングする必要があります。
例えば、分類に使用する場合、その上に浅いMLPを追加して、クラスに対する確率分布を出力することができます。元の論文では、線形GeLU- 線形ソフトマックスネットワークを使用しています。[ 1 ]
バリエーション
オリジナル ViT ViTのアニメーション。0番目のトークンは特別なものです<CLS>。他の9つのパッチは、入力トークン1から9としてTransformerエンコーダーに送られる前に、線形レイヤーによって投影されます。 オリジナルの ViT はエンコーダのみの Transformer で、画像のパッチから画像ラベルを予測するように教師あり学習されています。BERT の場合と同様に、 入力側で特別なトークンを使用し<CLS>、対応する出力ベクトルが最終出力 MLP ヘッドの唯一の入力として使用されます。特別なトークンは、モデルが画像ラベルの予測に関連するすべての情報を 1 つのベクトルに圧縮できるようにするためのアーキテクチャ上の工夫です。[ 1 ]
トランスフォーマーは、 BERT やGPT-3 などの言語モデルに見られるように、 自然言語処理 タスクで最初に応用されました。対照的に、一般的な画像処理システムでは畳み込みニューラルネットワーク (CNN)が使用されます。よく知られているプロジェクトには、Xception、ResNet 、EfficientNet [ 15 ] 、DenseNet [ 16 ] 、Inception [ 17 ] などがあります。
トランスフォーマーは、入力トークンのペア(テキスト文字列の場合は単語)間の関係を測定します。これはアテンション と呼ばれます。コストはトークンの数の2乗に比例します。画像の場合、分析の基本単位はピクセル です。ただし、典型的な画像のすべてのピクセルペアの関係を計算することは、メモリと計算の観点から非現実的です。代わりに、ViTは、画像のさまざまな小さなセクション(たとえば、16x16ピクセル)のピクセル間の関係を、大幅にコストを削減して計算します。セクション(位置埋め込み付き)はシーケンスに配置されます。埋め込みは学習可能なベクトルです。各セクションは線形シーケンスに配置され、埋め込み行列で乗算されます。位置埋め込み付きの結果は、トランスフォーマーに入力されます。[ 17 ]
建築上の改善
プーリング ViTは画像を処理すると、いくつかの埋め込みベクトルを生成します。これらは、何らかのネットワークによって単一クラスの確率予測に変換する必要があります。オリジナルのViTとMasked Autoencoderでは、BERT [CLS]言語モデルを模倣してダミートークンを使用していました。出力は分類トークンであり、これはLayerNorm フィードフォワードソフトマックスモジュールによって確率分布に処理されます。[CLS]
グローバル平均プーリング(GAP) はダミートークンを使用せず、すべての出力トークンの平均を分類トークンとして単純に取得します。オリジナルのViTでは、同等に優れていると述べられていました。[ 1 ]
マルチヘッドアテンションプーリング(MAP)は、プーリングに マルチヘッドアテンションブロック を適用します。具体的には、入力としてベクトルのリストを受け取ります。x 1 、 x 2 、 … 、 x n {\displaystyle x_{1},x_{2},\dots ,x_{n}} これは、ViT のレイヤーの出力ベクトルと考えることができます。MAP からの出力はM u l t 私 h e 1 d e d A t t e n t 私 o n ( Q 、 V 、 V ) {\displaystyle \mathrm {マルチヘッドアテンション} (Q,V,V)} 、 どこq {\displaystyle q} は学習可能なクエリベクトルであり、V {\displaystyle V} 行を持つ行列はx 1 、 x 2 、 … 、 x n {\displaystyle x_{1},x_{2},\dots ,x_{n}} [ 18 ]これは 、 Set Transformer アーキテクチャで最初に提案されました。[ 19 ]
後の論文では、GAPとMAPの両方がBERTのようなプーリングよりも優れた性能を発揮することが実証されました。[ 18 ] [ 20 ] MAPの変種としてクラスアテンション が提案され、これはMAPを適用し、次にフィードフォワードを適用し、次に再びMAPを適用します。[ 21 ]
再注意は 、深層ViTのトレーニングを可能にするために提案されました。これは、マルチヘッド注意モジュールを変更します。[ 22 ]
マスク付きオートエンコーダー マスクされたオートエンコーダのアーキテクチャ マスクドオートエンコーダー [ 23 ] は、ノイズ除去オートエンコーダー とコンテキストエンコーダー[ 24 ] から着想を得ています。2つのViTがエンドツーエンドで接続されています。1つ目(「エンコーダー」)は位置エンコーディングされた画像パッチを入力として受け取り、各パッチを表すベクトルを出力します。2つ目(エンコーダーのみのTransformerであるにもかかわらず「デコーダー」と呼ばれています)は位置エンコーディングされたベクトルを入力として受け取り、再び画像パッチを出力します。
トレーニング トレーニング中、入力画像 (元の実装では 224 ピクセル x 224 ピクセル) は、各軸で指定された数の線に沿って分割され、画像パッチが生成されます。[ 25 ] パッチの一定割合がマスク トークンによってマスクされるように選択され、残りのすべては画像に保持されます。ネットワークは、残りのマスクされていないパッチから画像を再構築するように指示されます。元の実装のマスク トークンは、学習可能なベクトル量 です。[ 25 ] 次に、位置埋め込みによる線形射影が 、マスクされていないパッチのベクトルに適用されます。ImageNet -1K データセットでトレーニングされたネットワークでマスク比率を変化させた実験では、75% のマスク比率[ 25 ] がエンコーダの潜在空間 のファインチューニングと線形プロービングの両方で高いパフォーマンスを達成しました。MAE はトレーニング中にマスクされていないパッチのみを処理するため、エンコーダでのデータ処理の効率が向上し、トランスフォーマー のメモリ使用量が減少します。[ 25 ]
MAEのオリジナル実装では、デコーダに計算負荷の少ないViTが使用されています。マスクされたパッチはマスクトークンとしてエンコーダブロックの出力に追加され、両方ともデコーダに入力されます。ネットワーク性能を評価するために、マスクされたパッチに対して再構成損失が計算されます。
予測 予測においては、デコーダーのアーキテクチャは完全に破棄されます。入力画像は、トレーニング時と同じアルゴリズムでパッチに分割されますが、パッチのマスク処理は行われません。各パッチに対して位置埋め込みを用いた線形射影が適用され、得られた各パッチの埋め込みベクトル表現がエンコーダーに入力されます。
用途および派生物 オリジナルの MAE の派生形がいくつか検討されてきました。MAE は、胸部 X 線解釈を含む医療分野での自己教師あり事前学習に適用されています。[ 26 ] この文脈では、MAE の派生形が医療分野での事前学習としてより良く機能するように適用されています。
医療監督下のMAE [ 27 ] Medically Supervised MAE は、医療病変データセットに適用した場合の MAE の高いマスク比率の適用に対処することを目的としており、どのパッチがマスクされるかを制約するために、医療画像のローカル アテンション マップを作成するために教師ありトレーニングセットを使用します。Medically Supervised MAE は、Messidor-2、BTMD、HAM10000、DeepLesion、および ChestXRay2017 データセットでの医療病変の分類において、2025 年 1 月時点で最先端のパフォーマンスを達成しました [ 28 ] 。 グレースケール共起行列MAE (GLCM-MAE)[ 29 ] GCLM-MAEは、テクスチャ情報を保持するために、GCLMを使用して画像からテクスチャ情報を抽出します。これは、従来のMAEが画像を過度に平滑化し、医療の文脈で重要となる可能性のある細かい詳細が失われるという問題に対処します。GLCM-MAEは、2025年7月現在、胆嚢癌、超音波画像から撮影された乳癌、X線画像から撮影された肺炎、およびコンピュータ断層撮影から撮影されたCOVID-19の識別において最先端の性能を達成しています。地域対応 MAE、[ 30 ] R-MAE R-MAEは、元のMAEにおけるパッチ生成ステップを、画像内の関心領域に個々のピクセルを割り当てるアルゴリズムに置き換え、それらの領域をまとめてマスク処理します。領域符号化アーキテクチャは単独で使用できますが、MAEと組み合わせて領域再構成を行うことも可能です。 シャムMAE(SiamMAE)[ 31 ] SiamMAEは、MAEをビデオデータに適用するために設計されたネットワークです。ビデオから2つのフレームをサンプリングし(元のMAEでは1つのフレーム)、それらを「過去」と「未来」とラベル付けします。ネットワークは未来フレームのパッチの大部分(約95%)をマスクし、過去フレームはそのままにして、両方をMAEエンコーダーブロックに通します。デコーダーアーキテクチャは、過去フレームのパッチを未来フレームにマッピングして再構築するアテンションブロックに置き換えられています。SiamMAEは、ビデオのセグメンテーションと伝播において、より大規模なモデルと同等の性能を発揮します。 同様のアーキテクチャとして、BERT ViT (BEiT) が同時期に発表された。[ 32 ]
Swin Transformer (「シフト ウィンドウ 」)[ 14 ] は、標準的なCNNから着想を得ています。
トークンのシーケンス全体(各パッチごとに1つ)に対して自己注意機構を実行する代わりに、「シフトウィンドウベース」の自己注意機構を実行します。これは、正方形のパッチブロックに対してのみ注意機構を実行することを意味します。1つのパッチブロックは、1つの畳み込みの受容野に相当します。 数個のアテンションブロックごとに「マージ層」があり、隣接する2x2トークンを1つのトークンにマージします。これはプーリング (ストライド2の2x2畳み込みカーネルによる)に相当します。マージとは、連結の後に行列との乗算を行うことを意味します。 これは、異なる注意機構[ 14 ] によってViTを修正するSwin Transformer V2 [ 39 ] によって改善されています。 図1 :
TimeSformer [ 40 ] は 動画理解タスク向けに設計されており、Inception CNN アーキテクチャ[ 41 ] に見られる因子化畳み込みカーネルと同様の因子化自己注意機構を適用しています。概略的に、動画をフレームに分割し、各フレームをパッチの正方形グリッドに分割します (ViT と同じ)。各パッチの座標を で表します。x 、 y 、 t {\displaystyle x,y,t} は、水平方向、垂直方向、および時間を表します。
空間アテンション層は自己アテンション層であり、各クエリパッチはq x 、 y 、 t {\displaystyle q_{x,y,t}} キーと値のパッチのみに注意を向けますk x ′ 、 y ′ 、 t ′ 、 v x ′ 、 y ′ 、 t ′ {\displaystyle k_{x',y',t'},v_{x',y',t'}} そのためt = t ′ {\displaystyle t=t'} 。 時間注意層では、要件はx ′ = x 、 y ′ = y {\displaystyle x'=x,y'=y} その代わり。 TimeSformerは、要件がx ′ = x 、 t ′ = t {\displaystyle x'=x,t'=t} しかし、彼らは経験的に、最適な設計は空間アテンション層と時間アテンション層を交互に配置することであることを発見した。
ViT-VQGAN ViT-VQGAN [ 42 ]に は、2 つの ViT エンコーダとディスクリミネータがあります。1 つは画像の 8x8 パッチを、各パッチに対応するベクトルのリストにエンコードします。ベクトルは、ベクトル量子化 と同様に、離散的な「コードブック」のセットからのみ取得できます。もう 1 つは、量子化されたベクトルを画像パッチにエンコードします。トレーニングの目的は、再構成画像 (出力画像) を入力画像に忠実にすることです。ディスクリミネータ (通常は畳み込みネットワークですが、他のネットワークも使用可能) は、画像が元の実画像か、ViT によって再構成された画像かを判定します。
このアイデアは、基本的にベクトル量子化変分オートエンコーダー(VQVAE)と敵対的生成ネットワーク (GAN)を組み合わせたものと同じです。
このような ViT-VQGAN をトレーニングすると、任意の画像をシンボルのリストにエンコードしたり、任意のシンボルのリストを画像にエンコードしたりすることができます。シンボルのリストは、標準的な自己回帰トランスフォーマー (GPT など) のトレーニングに使用して、画像を自己回帰的に生成することができます。さらに、キャプションと画像のペアのリストを取得し、画像をシンボルの文字列に変換して、標準的な GPT スタイルのトランスフォーマーをトレーニングすることもできます。そして、テスト時には、画像のキャプションを与えるだけで、画像を自己回帰的に生成させることができます。これが Google Parti の構造です。[ 43 ]
その他 その他の例としては、ビジュアルトランスフォーマー[ 44 ] 、 CoAtNet [ 45 ] 、CvT [ 46 ] 、データ効率の高いViT(DeiT)[ 47 ] などがある。
Transformer in Transformer アーキテクチャでは、各レイヤーが各画像パッチ埋め込みにビジョン Transformer レイヤーを適用し、結果として得られたトークンを埋め込みに追加し、その後別のビジョン Transformer レイヤーを適用します。[ 48 ]
注記 ↑ Dosovitskiy et al. (2021)のすべての位置埋め込みは、埋め込みなしの場合よりも優れたパフォーマンスを示しました。それらは互いに大きな違いはありませんでしたが、1D がスコアでわずかに優位でした。
参考文献 1 2 3 4 5 6 7 ドソヴィツキー、アレクセイ。バイエル、ルーカス。コレスニコフ、アレクサンダー。ヴァイセンボルン、ディルク。ザイ、シャオファ。ウンターティナー、トーマス。デガニ、モスタファ。ミンデラー、マティアス。ハイゴールド、ゲオルク。ジェリー、シルヴァン。ウシュコレイト、ヤコブ(2021-06-03)。 「画像は 16x16 ワードの価値があります: 大規模な画像認識のためのトランスフォーマー」。arXiv : 2010.11929 [ cs.CV ]。 1 2 Raghu, Maithra; Unterthiner, Thomas; Kornblith, Simon; Zhang, Chiyuan; Dosovitskiy, Alexey (2021-08-19). "Do Vision Transformers See Like Convolutional Neural Networks?". arXiv : 2108.08810 [ cs.CV ]. ↑ デガニ、モスタファ。ジョロンガ、ジョシップ。ムスタファ、バジル。パドレフスキ、ピョートル。やあ、ジョナサン。ギルマー、ジャスティン。シュタイナー、アンドレアス。カロン、マチルド。ロバート・ゲイホス (2023-02-10)、 ビジョン・トランスフォーマーを 220 億のパラメーターに拡張 、 arXiv : 2302.05442 ↑ 「ビジョントランスフォーマーを220億パラメータにスケーリングする」 . research.google . 2024年8月7日 取得 。 ↑ コレシュ、エラ。グロス、ロニット D.メイア、ユヴァル。ツァック、ヤーデン。ハレヴィ、タル。カンター、イド (2025)。 「統合された CNN と学習メカニズムの基礎となるトランスフォーマーは、マルチヘッド アテンションの生存方法を明らかにします 。 」 物理学 A: 統計力学とその応用 。 666 130529.arXiv : 2501.12900 。 Bibcode : 2025PhyA..66630529K 。 土井 : 10.1016/j.physa.2025.130529 。 ISSN 0378-4371 。 1 2 ハン、カイ。ワン・ユンヘ。チェン、ハンティン。チェン・シンハオ。郭建元。劉振華。タン、イェフイ。シャオ、アン。徐春京。徐、宜興。楊、趙輝。張、イーマン。タオ、大成 (2023-01-01)。 「ビジョントランスフォーマーに関する調査」。 パターン分析とマシン インテリジェンスに関する IEEE トランザクション 。 45 (1 ) : 87–110。arXiv : 2012.12556 。 Bibcode : 2023ITPAM..45...87H 。 土井 : 10.1109/TPAMI.2022.3152247 。 ISSN 0162-8828 。 PMID 35180075 。 1 2 カーン、サルマン。ナセル、ムザンマル。ハヤット、ムナワル。ザミール、サイード・ワカス。カーン、ファハド・シャバズ。シャー、ムバラク (2022-09-13)。 「トランスフォーマー・イン・ビジョン:調査」。 ACM コンピューティング。生き残る 。 54 (10 秒): 200:1 ~ 200:41。 arXiv : 2101.01169 。 土井 : 10.1145/3505244 。 ISSN 0360-0300 。 ↑ バスワニ、アシシ ;シャジーア、ノーム。パルマー、ニキ。ウシュコレイト、ヤコブ。ジョーンズ、リオン。 エイダン・N・ゴメス ;カイザー、ウカシュ。ポロスキン、イリア (2017)。 「必要なのは注意だけです」 (PDF) 。 神経情報処理システムの進歩 。 30 .カランアソシエイツ株式会社 ↑ Ramachandran, Prajit; Parmar, Niki; Vaswani, Ashish; Bello, Irwan; Levskaya, Anselm; Shlens, Jon (2019). "Stand-Alone Self-Attention in Vision Models" . Advances in Neural Information Processing Systems . 32 . Curran Associates, Inc. arXiv : 1906.05909 . ↑ Liu, Zhuang; Mao, Hanzi; Wu, Chao-Yuan; Feichtenhofer, Christoph; Darrell, Trevor; Xie, Saining (2022). "A ConvNet for the 2020s" : 11976– 11986. arXiv : 2201.03545 . ↑ Woo, Sanghyun; Debnath, Shoubhik; Hu, Ronghang; Chen, Xinlei; Liu, Zhuang; Kweon, In So; Xie, Saining (2023). "ConvNeXt V2: Co-Designing and Scaling ConvNets With Masked Autoencoders" : 16133– 16142. arXiv : 2301.00808 . ↑ ウー、ビチェン。徐、陳峰。ダイ、シャオリアン。ワン、アルビン。張佩兆。ヤン・ジチェン。富塚正義;ゴンザレス、ジョセフ。クルト・コイツァー。ヴァイダ、ピーター(2020)。 「ビジュアル トランスフォーマー: コンピューター ビジョンのためのトークンベースの画像表現と処理」。 arXiv : 2006.03677 [ cs.CV ]。 1 2 Xiao, Tete; Singh, Mannat; Mintun, Eric; Darrell, Trevor; Dollár, Piotr; Girshick, Ross (2021-06-28). "Early Convolutions Help Transformers See Better". arXiv : 2106.14881 [ cs.CV ]. 1 2 3 劉、澤;リン・ユートン。曹、岳。胡、漢。ウェイ、イーシュアン。張、鄭;リン、スティーブン。郭、白寧(2021-03-25)。 「Swin Transformer: シフト ウィンドウを使用した階層型ビジョン トランスフォーマー」。 arXiv : 2103.14030 [ cs.CV ]。 ↑ Tan, Mingxing; Le, Quoc (2021年6月23日). "EfficientNetV2: より小さなモデルとより速いトレーニング" (PDF) . 第38回国際機械学習会議 (PMLR) 論文集 . 139 : 10096– 10106. arXiv : 2104.00298 . 2023年 10月31日 取得 。 ↑ Huang, Gao; Liu, Zhuang; van der Maaten, Laurens; Q. Weinberger, Kilian (2018年1月28日). "Densely Connected Convolutional Networks". arXiv : 1608.06993 [ cs.CV ]. 1 2 Sarkar, Arjun (2021-05-20). "画像認識において、TransformersはCNNよりも優れているのか?" . Medium . 2022-05-11の オリジナルからアーカイブ済み。2021-07-11 に 取得 。 1 2 Zhai, Xiaohua; Kolesnikov, Alexander; Houlsby, Neil; Beyer, Lucas (2022年6月). "Scaling Vision Transformers" . 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) . IEEE. pp. 1204–1213 . arXiv : 2106.04560 . doi : 10.1109/cvpr52688.2022.01179 . ISBN 978-1-6654-6946-3 。↑ Lee, Juho; Lee, Yoonho; Kim, Jungtaek; Kosiorek, Adam; Choi, Seungjin; Teh, Yee Whye (2019-05-24). "Set Transformer: A Framework for Attention-based Permutation-Invariant Neural Networks" . Proceedings of the 36th International Conference on Machine Learning . PMLR: 3744–37 53. arXiv : 1810.00825 . ↑ Karamcheti, Siddharth; Nair, Suraj; Chen, Annie S.; Kollar, Thomas; Finn, Chelsea; Sadigh, Dorsa; Liang, Percy (2023-02-24), Language-Driven Representation Learning for Robotics , arXiv : 2302.12766 ↑ トゥーヴロン、ユーゴー。コード、マシュー。アレクサンドル・サブレロール。シンナイブ、ガブリエル。ジェグー、エルヴェ (2021)。 「イメージトランスフォーマーでさらに深くなる」 : 32–42 . arXiv : 2103.17239 。 ↑ 周、大泉。カン・ビンギ。ジン、シャオジエ。ヤン、リンジエ。リアン・シャオチェン。ジャン、ジハン。ホウ、キビン。 Feng、Jiashi (2021-04-19)、 DeepViT: Towards Deeper Vision Transformer 、 arXiv : 2103.11886 ↑ He, Kaiming; Chen, Xinlei; Xie, Saining; Li, Yanghao; Dollár, Piotr; Girshick, Ross (2021). "Masked Autoencoders Are Scalable Vision Learners". arXiv : 2111.06377 [ cs.CV ]. ↑ Pathak, Deepak; Krahenbuhl, Philipp; Donahue, Jeff; Darrell, Trevor; Efros, Alexei A. (2016年6月). "Context Encoders: Feature Learning by Inpainting". 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . IEEE. pp. 2536–2544 . arXiv : 1604.07379 . doi : 10.1109/CVPR.2016.278 . ISBN 978-1-4673-8851-1 。1 2 3 4 劉、ゼ。リン・ユートン。曹、岳。胡、漢。ウェイ、イーシュアン。張、鄭;リン、スティーブン。郭白寧(2021)。 「Swin Transformer: シフト ウィンドウを使用した階層型ビジョン トランスフォーマー」。 arXiv : 2111.06377 [ cs.CV ]。 ↑ Zhou, Lei; Liu, Huidong; Bae, Joseph; He, Junjun; Samaras, Dimitris; Prasanna, Prateek (2022). "Self Pre-Training with Masked Autoencoders for Medical Image Classification and Segmentation". arXiv : 2203.05573 [ eess.IV ]. ↑ Chen, Rui; Yang, Xiaotong; Li, Yue; Peng, Guocheng; Zhu, Qiuyue; Zhang, Zhenyu; Jiang, Hong (2024). "赤外線画像からのマイボーム腺機能不全の自動検出と評価のための深層学習ベースモデル". Applied Soft Computing . 164 112905. doi : 10.1016/j.asoc.2024.112905 (2025年10月17日非アクティブ)。 {{cite journal}}: CS1メンテナンス: DOIは2025年10月現在非アクティブです(リンク)↑ チェン、ルイ。ヤン、シャオトン。リー、ユエ。彭、国成。朱、秋月。張振宇。ジャン・ホン(2024)。 「赤外線画像からのマイボーム腺機能不全の自動検出と格付けのための深層学習ベースのモデル」。 応用ソフトコンピューティング 。 164 112905.arXiv : 2507.10869 。 ↑ マダン、チェタン。サティア、アールジャブ。ばす、そうめん。グプタ、パンカジ。ダッタ、ウシャ。アローラ、チェタン(2025)。 「テクスチャに焦点を当てる: 医療画像分類のためのマスクされたオートエンコーダの事前トレーニングを再考する」。 arXiv : 2507.10869 [ eess.IV ]。 ↑ Nguyen, Duy Kien; Li, Yanghao; Aggarwal, Vaibhav; Oswald, Martin R.; Kirillov, Alexander; Snoek, Cees GM; Chen, Xinlei (2024). "R-MAE: Regions Meet Masked Autoencoders" (PDF) . OpenReview.net . International Conference on Learning Representations. ↑ Gupta, Agrim; Wu, Jiajun; Deng, Jia; Fei-Fei, Li (2023). "Siamese Masked Autoencoders". arXiv : 2305.14344 [ cs.CV ]. ↑ Bao, Hangbo; Dong, Li; Piao, Songhao; Wei, Furu (2021-10-06). "BEiT: BERT Pre-Training of Image Transformers" . International Conference on Learning Representations . arXiv : 2106.08254 . 1 2 カロン、マチルド。トゥヴロン、ヒューゴ。ミスラ、イシャン。ジェグー、エルヴェ。マイラル、ジュリアン。ボヤノフスキー、ピョートル。ジュラン、アルマン(2021年10月)。 「自己監視型ビジョントランスフォーマーの新たな特性」 。 2021 IEEE/CVF コンピューター ビジョン国際会議 (ICCV) 。 IEEE。ページ 9630–9640。arXiv : 2104.14294 。 土井 : 10.1109/iccv48922.2021.00951 。 ISBN 978-1-6654-2812-5 。↑ He, Kaiming; Fan, Haoqi; Wu, Yuxin; Xie, Saining; Girshick, Ross (2020). "Momentum Contrast for Unsupervised Visual Representation Learning" : 9729– 9738. arXiv : 1911.05722 . ↑ Grill, Jean-Bastien; Strub, Florian; Altché, Florent; Tallec, Corentin; Richemond, Pierre; Buchatskaya, Elena; Doersch, Carl; Avila Pires, Bernardo; Guo, Zhaohan; Gheshlaghi Azar, Mohammad; Piot, Bilal; kavukcuoglu, koray; Munos, Remi; Valko, Michal (2020). "Bootstrap Your Own Latent - A New Approach to Self-Supervised Learning" . Advances in Neural Information Processing Systems . 33 . Curran Associates, Inc.: 21271– 21284. ↑ オカブ、マキシム。ダーセ、ティモシー。ムータカンニ、テオ。ヴォー、ホイ。マーク・ザフラニエツ。ハリドフ、ヴァシル。フェルナンデス、ピエール。ハジザ、ダニエル。マッサ、フランシスコ(2023-04-14)。 「DINOv2: 監督なしで堅牢なビジュアル機能を学習」。 arXiv : 2304.07193 [ cs.CV ]。 ↑ "DINOv3: 前例のない規模の視覚のための自己教師あり学習" . ai.meta.com . 2025年8月14日のオリジナルから アーカイブ済み. 2025年8月16日 取得 . ↑ シメオニ、オリアンヌ。ヴォー、ホイ・V。ザイツァー、マクシミリアン。バルダッサーレ、フェデリコ。オカブ、マキシム。ホセ、シホ。ハリドフ、ヴァシル。マーク・ザフラニエツ。イ・スンウン。ラマモンジソア、マイケル。マッサ、フランシスコ。ハジザ、ダニエル。ヴェールシュテット、ルカ。王建源。ダーセ、ティモシー。ムータカンニ、テオ。センタナ、レオネル。ロバーツ、クレア。ヴェダルディ、アンドレア。トラン、ジェイミー。ブラント、ジョン。クープリ、カミーユ。マイラル、ジュリアン。ジェグー、エルヴェ。パトリック・ラバトゥット。ボヤノフスキー、ピョートル (2025)。 「DINOv3」。 arXiv : 2508.10104 [ cs.CV ]。 ↑ 劉、澤;胡、漢。リン・ユートン。ヤオ、珠梁。謝、ジェンダ。ウェイ、イーシュアン。ニン、ジア。曹、岳。張、鄭;ドン、リー。ウェイ、フル。郭白寧(2022)。 「Swin Transformer V2: 容量と解像度のスケールアップ」 。コンピューター ビジョンとパターン認識に関する IEEE/CVF 会議の議事録。ページ 12009–12019 。 ↑ Bertasius, Gedas; Wang, Heng; Torresani, Lorenzo (2021-02-09). "Is Space-Time Attention All You Need for Video Understanding?". arXiv : 2102.05095 [ cs.CV ]. ↑ Szegedy, Christian; Vanhoucke, Vincent; Ioffe, Sergey; Shlens, Jon; Wojna, Zbigniew (2016). "Rethinking the Inception Architecture for Computer Vision" : 2818– 2826. arXiv : 1512.00567 . ↑ ユウ、ジアフイ。リー、シン。コー・ジンユ。張、漢。パン、ルオミン。秦、ジェームズ。クー、アレクサンダー。徐元中。ボールドリッジ、ジェイソン。呉永輝(2021)。 「改良された VQGAN によるベクトル量子化画像モデリング」。 arXiv : 2110.04627 [ cs.CV ]。 ↑ 「Parti: Pathways Autoregressive Text-to-Image Model」 . sites.research.google . 2023年11月3日 取得。 ↑ ウー、ビチェン。徐、陳峰。ダイ、シャオリアン。ワン、アルビン。張佩兆。ヤン・ジチェン。富塚正義;ゴンザレス、ジョセフ。 Keutzer, Kurt (2020-11-19)、 Visual Transformers: Token-based Image Representation and Processing for Computer Vision 、 arXiv : 2006.03677 ↑ Dai, Zihang; Liu, Hanxiao; Le, Quoc V.; Tan, Mingxing (2021-06-09). "CoAtNet: Marrying Convolution and Attention for All Data Sizes". arXiv : 2106.04803 [ cs.CV ]. ↑ 呉、海平。シャオ・ビン。コデラ、ノエル。劉孟晨。ダイ、西陽。ユアン、ルー。張、雷(2021-03-29)。 「CvT: ビジョン トランスフォーマーへの畳み込みの導入」。 arXiv : 2103.15808 [ cs.CV ]。 ↑ トゥーヴロン、ユーゴー。コード、マシュー。ジェグー、エルヴェ (2022)。 『DeiT III:リベンジ・オブ・ザ・ViT』。アビダンではシャイ。ブロストウ、ガブリエル。シセ、ムスタファ。ファリネッラ、ジョバンニ・マリア。ハスナー、タル (編)。 コンピューター ビジョン – ECCV 2022 。コンピューターサイエンスの講義ノート。 Vol. 13684. チャム: Springer Nature スイス。 516 ~ 533 ページ 。arXiv : 2204.07118 。 土井 : 10.1007/978-3-031-20053-3_30 。 ISBN 978-3-031-20053-3 。↑ ハン、カイ。シャオ、アン。呉、恩華。郭建元。徐春京。王雲和(2021)。 「トランスフォーマーの中のトランスフォーマー」 。 神経情報処理システムの進歩 。 34 .カラン・アソシエイツ株式会社: 15908 – 15919。 ↑ グロス、ロニット D.ハレヴィ、タル。コレシュ、エラ。ツァック、ヤーデン。カンター、イド (2025)。 「大規模なマルチヘッド アテンションによる低遅延ビジョン トランスフォーマー」 。 物理学 A: 統計力学とその応用 。 675 130835.arXiv : 2506.23832 。 Bibcode : 2025PhyA..67530835G 。 土井 : 10.1016/j.physa.2025.130835 。 ISSN 0378-4371 。 ↑ ナシール、ムザンマル。ラナシンハ、カンチャナ。カーン、サルマン。ハヤット、ムナワル。カーン、ファハド・シャバズ。 ヤン・ミンシュアン (2021-05-21)。 「ビジョントランスフォーマーの興味深い特性」。 arXiv : 2105.10497 [ cs.CV ]。 ↑ Coccomini, Davide; Messina, Nicola; Gennaro, Claudio; Falchi, Fabrizio (2022). "Combining Efficient Net and Vision Transformers for Video Deepfake Detection". Image Analysis and Processing – ICIAP 2022. Lecture Notes in Computer Science. Vol. 13233. pp. 219–229 . arXiv : 2107.02612 . doi : 10.1007/978-3-031-06433-3_19 . ISBN 978-3-031-06432-6 . S2CID 235742764 . ↑ キリロフ、アレクサンダー。ミントゥン、エリック。ラヴィ、ニキーラ。マオ、ハンジ。ローランド、クロエ。グスタフソン、ローラ。シャオ、テテ。ホワイトヘッド、スペンサー。バーグ、アレクサンダー C.やあ、ワン・イェン。ドル、ピョートル。ガーシック、ロス (2023)。 「何でもセグメント」 : 4015 – 4026。 ↑ Jiang, Yifan; Chang, Shiyu; Wang, Zhangyang (2021). "TransGAN: Two Pure Transformers Can Make One Strong GAN, and That Can Scale Up" . Advances in Neural Information Processing Systems . 34 . Curran Associates, Inc.: 14745– 14758. arXiv : 2102.07074 . ↑ Peebles, William; Xie, Saining (2023年3月). "Scalable Diffusion Models with Transformers". arXiv : 2212.09748v2 [ cs.CV ]. ↑ Doron, Michael; Moutakanni, Théo; Chen, Zitong S.; Moshkov, Nikita; Caron, Mathilde; Touvron, Hugo; Bojanowski, Piotr; Pernice, Wolfgang M.; Caicedo, Juan C. (2023-06-18). "Unbiased single-cell morphology with self-supervised vision transformers". bioRxiv 10.1101/2023.06.16.545359 . ↑ Wang, Xiao; Liu, Siyan; Tsaris, Aristeidis; Choi, Jong-Youl; Aji, Ashwin; Fan, Ming; Zhang, Wei; Yin, Junqi; Ashfaq, Moetasim; Lu, Dan; Balaprakash, Prasanna (2024). "ORBIT: Oak Ridge Base Foundation Model for Earth System Predictability". arXiv : 2404.14712 [ physics.ao-ph ].
さらに読む Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "11.8. Transformers for Vision" . Dive into deep learning . Cambridge New York Port Melbourne New Delhi Singapore: Cambridge University Press. ISBN 978-1-009-38943-3 。 Steiner, Andreas; Kolesnikov, Alexander; Zhai, Xiaohua; Wightman, Ross; Uszkoreit, Jakob; Beyer, Lucas (2021年6月18日). 「ViTをトレーニングするには?Vision Transformersにおけるデータ、拡張、および正則化」. arXiv : 2106.10270 [ cs.CV ].