.webp/500px-Astronaut_Riding_a_Horse_Hiroshige_(SD3.5).webp.png)
テキストから画像へのモデルは、入力された自然言語の説明を受け取り、その説明に一致する画像を生成する 機械学習モデルです。
テキストから画像への変換モデルは、ディープニューラルネットワークの進歩の結果として、AIブームの始まりの2010年代半ばに開発され始めました。2022年には、OpenAIのDALL-E 2、Google BrainのImagen、Stability AIのStable Diffusion、Midjourneyなどの最先端のテキストから画像への変換モデルの出力が、実際の写真や人間が描いたアートの品質に近づいていると考えられるようになりました。
テキストから画像へのモデルは、一般的に潜在拡散モデルであり、入力テキストを潜在表現に変換する言語モデルと、その表現に基づいて画像を生成する生成画像モデルを組み合わせたものです。最も効果的なモデルは、一般的にWebから収集された大量の画像とテキストデータでトレーニングされています。[1]
歴史
ディープラーニングが登場する前は、[いつ? ]テキストから画像へのモデルを構築する試みは、クリップアートのデータベースなどから既存のコンポーネント画像を配置することによるコラージュに限られていました。[2] [3]
逆のタスクである画像キャプション作成はより扱いやすく、最初のテキストから画像へのモデルよりも先に、画像キャプション作成のディープラーニングモデルが数多く登場しました。[4]
最初の現代的なテキストから画像へのモデルであるalignDRAWは、2015年にトロント大学の研究者によって導入されました。alignDRAWは、以前に導入されたDRAWアーキテクチャ(注意メカニズムを備えた再帰 変分オートエンコーダを使用)を拡張して、テキストシーケンスに条件付けされました。[4] alignDRAWによって生成された画像は解像度が小さく(32×32ピクセル、サイズ変更から取得)、多様性が低いと考えられていました。このモデルは、トレーニングデータに表されていないオブジェクト(赤いスクールバスなど)に一般化でき、「一時停止の標識が青空に飛んでいる」などの新しいプロンプトを適切に処理し、トレーニングセットのデータを単に「記憶」しているのではないことを出力で示しました。[4] [5]

2016年、リード、アカタ、ヤンらは、テキストから画像へのタスクに生成的敵対的ネットワークを使用した最初の研究者となった。 [5] [7]狭いドメイン固有のデータセットでトレーニングされたモデルにより、彼らは「はっきりとした太くて丸い嘴を持つ真っ黒な鳥」のようなテキストキャプションから「視覚的にもっともらしい」鳥や花の画像を生成することができた。より多様なCOCO (Common Objects in Context)データセットでトレーニングされたモデルは、「遠くから見ると... 心強い」画像を生成したが、細部に一貫性がなかった。[5]その後のシステムには、VQGAN-CLIP、[8] XMC-GAN、GauGAN2などがある。[9]
広く世間の注目を集めた最初のテキストから画像へのモデルの一つは、2021年1月に発表されたOpenAIのトランスフォーマーシステムであるDALL-Eでした。 [10]より複雑でリアルな画像を生成できる後継機であるDALL-E 2は2022年4月に発表され、[11]続いて2022年8月にStable Diffusionが一般公開されました。[12] 2022年8月、テキストから画像へのパーソナライゼーションにより、テキストから画像への基礎モデルのトレーニングセットに含まれていなかった新しいオブジェクトの小さな画像セットを使用して、モデルに新しい概念を教えることができるようになりました。これは、テキストの反転、つまりこれらの画像に対応する新しいテキスト用語を見つけることによって実現されます。
他のテキスト画像変換モデルに続いて、 Runway、Make-A-Video、 [13] Imagen Video、[14] Midjourney、[15] Phenaki [16]などの言語モデルを活用したテキスト動画変換プラットフォームは、テキストやテキスト/画像のプロンプトから動画を生成することができます。[17]
アーキテクチャとトレーニング

テキストから画像へのモデルは、さまざまなアーキテクチャを使用して構築されてきました。テキストのエンコード手順は、 LSTM (長短期記憶) ネットワークなどのリカレント ニューラル ネットワークを使用して実行できますが、トランスフォーマーモデルがその後、より一般的なオプションになりました。画像生成手順では、条件付き生成敵対ネットワーク(GAN) が一般的に使用されてきましたが、近年では拡散モデルも一般的なオプションになっています。テキスト埋め込みを条件とする高解像度の画像を出力するようにモデルを直接トレーニングするのではなく、低解像度の画像を生成するようにモデルをトレーニングし、1 つ以上の補助的なディープラーニング モデルを使用して画像をアップスケールし、より細かい詳細を埋め込むという手法が一般的です。
テキストから画像へのモデルは、多くの場合ウェブから収集された(テキスト、画像)ペアの大規模なデータセットでトレーニングされます。Google Brainは、2022年のImagenモデルで、テキストのみのコーパスで個別にトレーニングされた大規模な言語モデル(その後重みが固定)を使用することで肯定的な結果が得られたと報告しました。これは、これまでの標準的なアプローチからの逸脱です。[18]
データセット

テキストから画像への変換モデルをトレーニングするには、テキストキャプションとペアになった画像のデータセットが必要です。この目的でよく使用されるデータセットの 1 つが COCO データセットです。2014 年に Microsoft によってリリースされた COCO は、人間の注釈者によって生成された、さまざまなオブジェクトを描いた約 123,000 枚の画像と 1 枚あたり 5 つのキャプションで構成されています。Oxford-120 Flowers と CUB-200 Birds は、それぞれ約 10,000 枚の画像からなる小規模なデータセットで、それぞれ花と鳥に限定されています。これらのデータセットは対象範囲が狭いため、高品質のテキストから画像への変換モデルをトレーニングすることはそれほど難しくないと考えられています。[7]
品質評価
テキストから画像へのモデルの品質を評価し比較することは、複数の望ましい特性を評価する問題です。テキストから画像へのモデルに特有の要件は、生成された画像が、その生成に使用されたテキストキャプションと意味的に一致することです。これらの品質を評価するためのいくつかの方式が考案されており、自動化されたものもあれば、人間の判断に基づくものもあります。[7]
画像の品質と多様性を評価するための一般的なアルゴリズム指標は、インセプションスコア(IS)です。これは、テキストから画像へのモデルによって生成された画像のサンプルに適用された、事前トレーニング済みのInceptionv3 画像分類モデルによって予測されたラベルの分布に基づいています。画像分類モデルが単一のラベルを高い確率で予測するとスコアが増加します。これは、「明確な」生成された画像を優先することを目的としています。もう1つの一般的な指標は、関連するフレシェインセプション距離です。これは、事前トレーニング済みの画像分類モデルの最終層の1つによって抽出された特徴に従って、生成された画像と実際のトレーニング画像の分布を比較します。[7]
影響と応用
注目すべきテキスト画像変換モデルのリスト
説明ノート
- ^ このライセンスは、年間収益が100万ドル以下の個人および組織で使用できます。年間収益が100万ドルを超える組織の場合は、Stability AI Enterpriseライセンスが必要です。すべての出力は、収益に関係なくユーザーが保持します。
- ^ schnell モデルの場合、開発モデルは非商用ライセンスを使用していますが、プロモデルは独自のライセンスを使用しています ( APIとしてのみ利用可能)
参照
参考文献
- ^ ヴィンセント、ジェームズ(2022年5月24日)。「これらすべての画像は、Googleの最新のテキスト画像変換AIによって生成されました」。The Verge。Vox Media 。 2022年5月28日閲覧。
- ^ Agnese, Jorge; Herrera, Jonathan; Tao, Haicheng; Zhu, Xingquan (2019 年 10 月)、「テキストから画像への合成のための敵対的ニューラル ネットワークの調査と分類」、arXiv : 1910.09399
- ^ Zhu, Xiaojin; Goldberg, Andrew B.; Eldawy, Mohamed; Dyer, Charles R.; Strock, Bradley (2007). 「コミュニケーションを強化するためのテキストから画像への合成システム」(PDF) . AAAI . 7 : 1590–1595.
- ^ abc Mansimov, Elman; Parisotto, Emilio; Lei Ba, Jimmy; Salakhutdinov, Ruslan (2015年11月). 「注意を払ってキャプションから画像を生成する」. ICLR . arXiv : 1511.02793 .
- ^ abc Reed, Scott; Akata, Zeynep; Logeswaran, Lajanugen; Schiele, Bernt; Lee, Honglak (2016 年 6 月). 「Generative Adversarial Text to Image Synthesis」(PDF) .国際機械学習会議. arXiv : 1605.05396 .
- ^ Mansimov, Elman; Parisotto, Emilio ; Ba, Jimmy Lei; Salakhutdinov, Ruslan (2016 年 2 月 29 日)。「注意を払ってキャプションから画像を生成する」。国際表現学習会議。arXiv : 1511.02793。
- ^ abcd Frolov, Stanislav; Hinz, Tobias; Raue, Federico; Hees, Jörn; Dengel, Andreas (2021年12月). 「敵対的テキストから画像への合成:レビュー」.ニューラルネットワーク. 144 :187–209. arXiv : 2101.09983 . doi : 10.1016/j.neunet.2021.07.019 . PMID 34500257. S2CID 231698782.
- ^ Rodriguez, Jesus (2022年9月27日). 「🌅 Edge#229: VQGAN + CLIP」. thesequeence.substack.com . 2022年10月10日閲覧。
- ^ Rodriguez, Jesus (2022年10月4日). 「🎆🌆 Edge#231: GAN によるテキストから画像への合成」. thesequeence.substack.com . 2022年10月10日閲覧。
- ^ Coldewey、Devin(2021年1月5日)。「OpenAIのDALL-Eは、文字通り何でも要求されたとおりのもっともらしい画像を作成します」。TechCrunch。
- ^ Coldewey、Devin(2022年4月6日)。「OpenAIの新しいDALL-Eモデルは、あらゆるものを描画しますが、以前よりも大きく、より良く、より高速です」。TechCrunch。
- ^ 「Stable Diffusion Public Release」. Stability.Ai . 2022年10月27日閲覧。
- ^ Kumar, Ashish (2022年10月3日). 「Meta AIが『Make-A-Video』を発表:テキストから動画を生成する人工知能システム」MarkTechPost . 2022年10月3日閲覧。
- ^ Edwards, Benj (2022年10月5日). 「Googleの最新AIジェネレーターがテキストプロンプトからHDビデオを作成」Ars Technica . 2022年10月25日閲覧。
- ^ ロドリゲス、ジーザス (2022年10月25日). 「🎨 Edge#237: Midjourneyとは何か?」. theseqence.substack.com . 2022年10月26日閲覧。
- ^ “Phenaki”. phenaki.video . 2022年10月3日閲覧。
- ^ Edwards, Benj (2022年9月9日). 「Runway、AIによるテキストから動画への編集を手書きプロンプトで提供」 Ars Technica . 2022年9月12日閲覧。
- ^ チトワン州サハリア;チャン、ウィリアム。サクセナ、サウラブ。リー、ララ。ワン、ジェイ。デントン、エミリー。カムヤール・セイド・ガセミプール、セイド。カラゴル・アヤン、ブルク。サラ・マハダヴィ、S.ゴンティホ・ロペス、ラファ。サリマンズ、ティム。やあ、ジョナサン。 J・フリート、デヴィッド;ノルージ、モハマド(2022年5月23日)。 「深い言語理解によるフォトリアリスティックなテキストから画像への拡散モデル」。arXiv : 2205.11487 [cs.CV]。
- ^ abc Elgan, Mike (2022年11月1日). 「『合成メディア』がビジネスを永遠に変える方法」. Computerworld . 2022年11月9日閲覧。
- ^ ルース、ケビン(2022年10月21日)。「AI生成アートはすでにクリエイティブワークを変えている」ニューヨークタイムズ。 2022年11月16日閲覧。
- ^ ab Leswing, Kif. 「なぜシリコンバレーは人工知能によるぎこちない絵に興奮しているのか」CNBC 。 2022年11月16日閲覧。
- ^ 「Imagen 2 on Vertex AI が一般提供開始」。Google Cloud ブログ。2024年1 月 2 日閲覧。
