モチベーション
データは通常、異なる情報を伝える様々なモダリティで提供されます。例えば、画像自体には含まれていない情報を伝えるために、画像にキャプションを付けることはよくあります。同様に、テキストからは分かりにくい情報を説明するには、画像を使う方が分かりやすい場合もあります。その結果、似たような画像に異なる単語が使われている場合、それらの単語は同じものを表している可能性が高いと言えます。逆に、一見似ていない画像に同じ単語が使われている場合、それらの画像は同じ対象を表している可能性があります。したがって、マルチモーダルデータを扱う場合、異なるモダリティからの情報を統合的に表現できるモデルを使用することが重要です。
マルチモダリティとは、複数のモダリティを持つことを意味し、「モダリティ」とは、ビデオ、画像、音声、テキスト、固有受容感覚などの入力または出力のタイプを指します。[ 7 ]例えば、Google PaLMモデルはマルチモーダル モデルにファインチューニングされ、ロボット制御に適用されました。[ 8 ] LLaMAモデルもトークン化方法を使用してマルチモーダル化され、画像入力[ 9 ]やビデオ入力[ 10 ]が可能になりました。GPT -4o は、テキスト、音声、画像を処理および生成できます。[ 11 ]
LLMからマルチモーダルモデルを作成する一般的な方法は、学習済みエンコーダの出力を「トークン化」することです。具体的には、学習済みLLMと学習済み画像エンコーダを準備し、次のようにして画像を理解できるLLMを構築できます。
小さな多層パーセプトロンを作成する
、したがって任意の画像に対して
後処理されたベクトル
エンコードされたトークンと同じ次元を持つ。それが「画像トークン」である。次に、テキストトークンと画像トークンをインターリーブすることができる。その後、複合モデルは画像テキストデータセットで微調整される。この基本的な構成は、モデルを改善するために、より高度な方法で適用することができる。画像エンコーダは、安定性を向上させるために固定されることがある。 [ 12 ]複数のモダリティからの埋め込みが融合され、予測器が結合された埋め込みでトレーニングされるこの種の方法は、早期融合と呼ばれる。
中間融合と呼ばれる別の方法では、まず各モダリティを個別に処理してモダリティ固有の表現を取得し、次にこれらの中間表現を融合します。[ 13 ]一般的に、クロスアテンションは異なるモダリティからの情報を統合するために使用されます。たとえば、Flamingo モデルはクロスアテンション層を使用して、視覚情報を事前学習済みの言語モデルに注入します。[ 14 ]
トランスフォーマーは、テキスト以外のモダリティ(入力または出力)にも使用/適応させることができ、通常はモダリティを「トークン化」する方法を見つけることによって実現されます。
マルチモーダルモデルは、ゼロからトレーニングすることも、ファインチューニングによってトレーニングすることもできます。2022年の研究では、自然言語のみで事前トレーニングされたトランスフォーマーは、パラメータのわずか0.03%をファインチューニングするだけで、さまざまな論理タスクや視覚タスクでLSTMと競合できることがわかりました。これは転移学習を示しています。[ 15 ] LLaVAは、言語モデル(Vicuna-13B)[ 16 ]と視覚モデル(ViT -L/14)が線形層で接続された視覚言語モデルでした。線形層のみがファインチューニングされます。[ 17 ]
ビジョントランスフォーマー[ 18 ]は、入力画像をパッチの連続として分解し、ベクトルに変換し、標準トランスフォーマーのトークンの埋め込みベクトルとして扱うことで、トランスフォーマーをコンピュータビジョンに適合させます。
Conformer [ 19 ]と後のWhisper [ 20 ]は、音声認識において同じパターンに従っており、まず音声信号をスペクトログラムに変換し、それを画像のように扱います。つまり、一連のパッチに分解し、ベクトルに変換し、標準トランスフォーマーのトークンの埋め込みベクトルのように扱います。
知覚器[ 21 ] [ 22 ]は、マルチモダリティ用に設計されたトランスフォーマーの一種です。
画像生成の注目すべきアーキテクチャとしては、DALL-E 1 (2021)、Parti (2022)、[ 23 ] Phenaki (2023)、[ 24 ] 、 Muse (2023) がある。[ 25 ]後期のモデルとは異なり、DALL-E は拡散モデルではない。代わりに、自己回帰的にテキストを生成するデコーダのみのトランスフォーマーを使用し、続いて画像のトークン表現を生成し、それを変分オートエンコーダによって画像に変換する。[ 26 ] Parti はエンコーダとデコーダのトランスフォーマーであり、エンコーダがテキストプロンプトを処理し、デコーダが画像のトークン表現を生成する。[ 27 ] Muse はエンコーダのみのトランスフォーマーであり、マスクされていない画像トークンからマスクされた画像トークンを予測するようにトレーニングされている。生成中、すべての入力トークンがマスクされ、すべてのトークンが予測されるまで、最も信頼度の高い予測が次の反復に含まれる。[ 25 ] Phenaki はテキストからビデオへのモデルです。これは、事前に計算されたテキスト トークンに基づいて条件付けられた双方向マスク トランスフォーマーです。生成されたトークンは、ビデオにデコードされます。[ 24 ]
CLIP (Contrastive Language–Image Pretraining)などのモデルは、対照的な目的を最適化することで画像とテキストの共同表現を学習し、モデルが画像とそれに対応するテキストの説明を一致させることができるようにします。[ 28 ]
アプリケーション
マルチモーダル機械学習は、さまざまな分野で数多くの応用例がある。
- クロスモーダル検索:クロスモーダル検索により、ユーザーはさまざまなモダリティにわたってデータを検索できます(たとえば、テキストの説明に基づいて画像を検索するなど)。これにより、マルチメディア検索エンジンとコンテンツ推薦システムが改善されます。 [ 32 ]
- 分類と欠損データの取得:マルチモーダルディープボルツマンマシンは、分類タスクにおいてサポートベクターマシンや潜在ディリクレ配分などの従来のモデルよりも優れた性能を発揮し、画像やテキストなどのマルチモーダルデータセットにおける欠損データを予測することができます。
- 医療診断:マルチモーダルモデルは、医療画像、ゲノムデータ、患者記録を統合して、特にがん検診において、診断精度と早期疾患検出を向上させます。[ 33 ] [ 34 ] [ 35 ]
- コンテンツ生成:DALL·Eのようなモデルはテキスト記述から画像を生成し、クリエイティブ産業に恩恵をもたらす一方、クロスモーダル検索は動的なマルチメディア検索を可能にする。[ 36 ]
- ロボット工学と人間とコンピュータのインタラクション:マルチモーダル学習は、音声、視覚、触覚などの感覚入力を統合することで、ロボット工学とAIにおけるインタラクションを改善し、自律システムと人間とコンピュータのインタラクションを支援します。
- 感情認識:視覚、音声、テキストデータを組み合わせたマルチモーダルシステムは、感情分析と感情認識を強化し、顧客サービス、ソーシャルメディア、マーケティングに応用されています。
参考文献
- ↑ヘンドリクセン、マリヤ。ブリーカー、マウリッツ。ヴァクレンコ、スヴィトラーナ。ヴァン・ノールト、ナンヌ。カイパー、エルンスト。デ・ライケ、マールテン(2021)。 「電子商取引におけるカテゴリーから画像の検索のための CLIP の拡張」。arXiv : 2112.11294 [ cs.CV ]。
- ↑ 「GitHub 上の安定版拡散リポジトリ」。CompVis - 機械視覚と学習研究グループ、ミュンヘン大学。2022 年 9 月 17 日。2023年 1 月 18 日のオリジナルからアーカイブ。2022年9 月 17 日取得。
- ↑ LAION-AI/aesthetic-predictor、LAION AI、2024年9月6日、 2024年9月8日取得
- ↑ Mokady, Ron; Hertz, Amir; Bermano, Amit H. (2021). "ClipCap: 画像キャプションのための CLIP プレフィックス". arXiv : 2111.09734 [ cs.CV ].
- ↑ Ngiam, Jiquan; Khosla, Aditya; Kim, Mingyu; Nam, Juhan; Lee, Honglak; Ng, Andrew Y. (2011-06-28). "マルチモーダル深層学習" .第28回国際機械学習会議議事録. ICML'11. マディソン、ウィスコンシン州、アメリカ合衆国: Omnipress: 689–696 . ISBN 978-1-4503-0619-5。
- ↑ Zia, Tehseen (2024年1月8日). 「大規模マルチモーダルモデルの公開:2024年の言語モデルの展望を形作る」 Unite.ai . 2024年6月1日取得。
- ↑ Kiros, Ryan; Salakhutdinov, Ruslan; Zemel, Rich (2014年6月18日). "Multimodal Neural Language Models" . Proceedings of the 31st International Conference on Machine Learning . PMLR: 595– 603. 2023年7月2日にオリジナルからアーカイブ済み。 2023年7月2日に取得。
- ↑ドリース、ダニー。シア、フェイ。サジャディ、メディSM。リンチ、コーリー。チャウドリー、アーカンクシャ。イクター、ブライアン。ワヒド、アイザーン。トンプソン、ジョナサン。ヴオン、クアン。ゆう、天河。黄、文龍。チェボタル、エフゲン。ピエール・セルマネ。ダックワース、ダニエル。セルゲイ・レバイン(2023年3月1日)。「PaLM-E: 身体化されたマルチモーダル言語モデル」。ICML。202 : 8469 – 8488。
- ↑リュウ、ハオティエン。李春源。呉、青陽。イ・ヨンジェ(2023年4月1日)。 「ビジュアル指示チューニング」。NeurIPS。
- ↑ Zhang, Hang; Li, Xin; Bing, Lidong (2023年6月1日). "Video-LLaMA: 動画理解のための指示調整型オーディオビジュアル言語モデル". EMNLP . arXiv : 2306.02858 .
- ↑ 「OpenAIによると、ネイティブにマルチモーダルなGPT-4oはテキスト、画像、音声を読み込み、同じものを出力する」。The Register。2024年5月13日。
- ↑ Li, Junnan; Li, Dongxu; Savarese, Silvio; Hoi, Steven (2023年1月1日). "BLIP-2: 凍結画像エンコーダと大規模言語モデルによる言語画像事前学習のブートストラップ" . ICML . 202 : 19730– 19742.
- ↑ Kumar, Puneet; Khokher, Vedanti; Gupta, Yukti; Raman, Balasubramanian (2021). Hybrid Fusion Based Approach for Multimodal Emotion Recognition with Insufficient Labeled Data . pp. 314–318 . Bibcode : 2021icip.conf...74K . doi : 10.1109/ICIP42928.2021.9506714 . ISBN 978-1-6654-4115-5。
- ↑ Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; Lenc, Karel; Mensch, Arthur; Millican, Katherine; Reynolds, Malcolm; Ring, Roman; Rutherford, Eliza; Cabi, Serkan; Han, Tengda; Gong, Zhitao (2022年12月6日). "Flamingo: 少数ショット学習のための視覚言語モデル" . Advances in Neural Information Processing Systems . 35 (12): 23716– 23736. arXiv : 2204.14198 . doi : 10.1093/nsr/nwae403 . PMC 11645129 . PMID 39679213 . 2023年7月2日にオリジナルからアーカイブされました。2023年7月2日に取得されました。
- ↑ Lu, Kevin; Grover, Aditya; Abbeel, Pieter; Mordatch, Igor (2022-06-28). "Frozen Pretrained Transformers as Universal Computation Engines" . Proceedings of the AAAI Conference on Artificial Intelligence . 36 (7): 7628– 7636. doi : 10.1609/aaai.v36i7.20729 . ISSN 2374-3468 . 2024-12-02 のオリジナルからアーカイブ済み. 2024-08-11に取得.
- ↑ "Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90%* ChatGPT Quality | LMSYS Org" . lmsys.org . 2023年3月30日。2024年8月12日のオリジナルからアーカイブ済み。 2024年8月11日取得。
- ↑リュウ、ハオティエン。李春源。呉、青陽。イ・ヨンジェ(2023-12-15)。「ビジュアル指示チューニング」。神経情報処理システムの進歩。 Vol. 36. pp. 34892–34916 .土井: 10.52202/075280-1516。ISBN 978-1-7138-9911-22024年9月26日にオリジナルからアーカイブされました。2024年8月11日に取得。
- ↑ドソヴィツキー、アレクセイ。バイエル、ルーカス。コレスニコフ、アレクサンダー。ヴァイセンボルン、ディルク。ザイ、シャオファ。ウンターティナー、トーマス。デガニ、モスタファ。ミンデラー、マティアス。ハイゴールド、ゲオルク。ジェリー、シルヴァン。ウシュコレイト、ヤコブ(2021-06-03)。 「画像は 16x16 ワードの価値があります: 大規模な画像認識のためのトランスフォーマー」。arXiv : 2010.11929 [ cs.CV ]。
- ↑アンモール、グラティ。秦、ジェームズ。チウ、チュンチェン。パルマー、ニキ。張、裕。ユウ、ジアフイ。ハン、ウェイ。王、紫博。張正東。ウー、ヨンフイ。龐明、龐明(2020)。 「Conformer: 音声認識用の畳み込み拡張トランスフォーマー」。arXiv : 2005.08100 [ eess.AS ]。
- ↑ Radford, Alec; Kim, Jong Wook; Xu, Tao; Brockman, Greg; McLeavey, Christine; Sutskever, Ilya (2022). "大規模弱教師ありによる堅牢な音声認識". arXiv : 2212.04356 [ eess.AS ].
- ↑ Jaegle, Andrew; Gimeno, Felix; Brock, Andrew; Zisserman, Andrew; Vinyals, Oriol; Carreira, Joao (2021-06-22). "Perceiver: 反復的注意による一般知覚". arXiv : 2103.03206 [ cs.CV ].
- ↑ジェイグル、アンドリュー。ボルジョー、セバスチャン。アライラック、ジャン=バティスト。カール・ドーシュ。イヨネスク、カタリン州。ディン、デイビッド。コップラ、スカンダ。ゾラン、ダニエル。ブロック、アンドリュー。シェルハマー、エヴァン。エナフ、オリヴィエ (2021-08-02)。 「パーシーバー IO: 構造化された入力と出力のための一般的なアーキテクチャ」。arXiv : 2107.14795 [ cs.LG ]。
- ↑ "Parti: Pathways Autoregressive Text-to-Image Model" . sites.research.google . 2024-08-10 のオリジナルからアーカイブ済み. 2024-08-09に取得.
- 1 2ビジェガス、ルーベン。ババエイザデ、モハマド。キンダーマンズ、ピーター=ヤン。モラルド、ヘルナン。張、漢。サファール、モハマド・タギ。カストロ、サンティアゴ;クンツェ、ユリウス。エルハン、ドゥミトル(2022-09-29)。 「Phenaki: オープンドメインのテキスト記述からの可変長ビデオ生成」。arXiv : 2210.02399 [ cs.CV ]。
- 1 2 Chang, Huiwen; Zhang, Han; Barber, Jarred; Maschinot, AJ; Lezama, Jose; Jiang, Lu; Yang, Ming-Hsuan ; Murphy, Kevin; Freeman, William T. (2023-01-02). "Muse: マスク付き生成トランスフォーマーによるテキストから画像への生成". arXiv : 2301.00704 [ cs.CV ].
- ↑ Ramesh, Aditya; Pavlov, Mikhail; Goh, Gabriel; Gray, Scott; Voss, Chelsea; Radford, Alec; Chen, Mark; Sutskever, Ilya (2021-02-26). "Zero-Shot Text-to-Image Generation". arXiv : 2102.12092 [ cs.CV ].
- ↑ユウ、ジアフイ。徐元中。コー・ジンユ。ルオン、タン;バイド、グンジャン。ワン・ジルイ。ヴァスデヴァン、ビジェイ。クー、アレクサンダー。ヤン、インフェイ(2022-06-21)。 「コンテンツリッチなテキストから画像への生成のための自己回帰モデルのスケーリング」。arXiv : 2206.10789 [ cs.CV ]。
- ↑ Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela; Clark, Jack; Krueger, Gretchen; Sutskever, Ilya (2021). "Learning Transferable Visual Models From Natural Language Supervision". arXiv : 2103.00020 [ cs.CV ].
- ↑デイ、ビクター (2021-09-03)。「ボルツマンマシン入門ガイド」。Analytics India Magazine。2024-03-02に取得。
- ↑ Patel, Shuvam; Chen, Liang; Canoza, Peter; Salahuddin, Sayeef (2020). "Ising model optimization problems on a FPGA accelerated restricted Boltzmann machine". arXiv : 2008.04436 [ cs.ET ].
- ↑ 「深層ボルツマンマシンによるマルチモーダル学習」(PDF)。2014年。2015年6月21日にオリジナルからアーカイブ(PDF) 。 2015年6月14日取得。
- ↑ヘンドリクセン、マリヤ。ヴァクレンコ、スヴィトラーナ。カイパー、エルンスト。デ・ライケ、マールテン (2023)。 「シーン中心とオブジェクト中心の画像とテキストのクロスモーダル検索: 再現性の研究」。arXiv : 2301.05174 [ cs.CV ]。
- ↑ Quach, Katyanna. 「ハーバード大学の研究者たちが癌を予測するマルチモーダルAIシステムを構築」 The Register . 2022年9月20日のオリジナルからアーカイブ済み。 2022年9月16日閲覧。
- ↑ Chen, Richard J.; Lu, Ming Y.; Williamson, Drew FK; Chen, Tiffany Y.; Lipkova, Jana; Noor, Zahra; Shaban, Muhammad; Shady, Maha; Williams, Mane; Joo, Bumjin; Mahmood, Faisal (2022年8月8日). "多モード深層学習による全がん統合組織ゲノム解析" . Cancer Cell . 40 (8): 865–878.e6. doi : 10.1016/j.ccell.2022.07.004 . ISSN 1535-6108 . PMC 10397370 . PMID 35944502 . S2CID 251456162 .
- 教育病院のプレスリリース:「新しいAI技術が複数のデータタイプを統合してがんの予後を予測」。ブリガム・アンド・ウィメンズ病院(medicalxpress.com経由)。2022年9月20日のオリジナルからアーカイブ済み。 2022年9月18日取得。
- ↑ Shi, Yuge; Siddharth, N.; Paige, Brooks; Torr, Philip HS (2019). "Variational Mixture-of-Experts Autoencoders for Multi-Modal Deep Generative Models". arXiv : 1911.03393 [ cs.LG ].
- ↑ Shi, Yuge; Siddharth, N.; Paige, Brooks; Torr, Philip HS (2019). "Variational Mixture-of-Experts Autoencoders for Multi-Modal Deep Generative Models". arXiv : 1911.03393 [ cs.LG ].