
DreamBoothは、既存のテキスト画像変換モデルを微調整してパーソナライズするために使用されるディープラーニング生成モデルです。2022年にGoogle Researchとボストン大学の研究者によって開発されました。もともとGoogle独自のImagenテキスト画像変換モデルを使用して開発されたDreamBooth実装は、他のテキスト画像変換モデルにも適用でき、被写体の3〜5枚の画像でトレーニングした後、モデルがより微調整されパーソナライズされた出力を生成できるようになります。[1] [2] [3]
テクノロジー
事前学習済みのテキストから画像への拡散モデルは、多様な画像出力タイプを提供できることが多いが、あまり知られていない被写体の画像を生成するために必要な特異性がなく、既知の被写体をさまざまな状況やコンテキストでレンダリングする能力が限られている。[1] DreamBooth の実装を実行するために使用される方法論では、特定の被写体を描写した少数の画像 (通常 3~5 枚) を使用して、拡散モデルの完全な UNet コンポーネントを微調整する。画像は、被写体が属するクラスの名前と一意の識別子を含むテキスト プロンプトとペアになっている。たとえば、a photograph of a [Nissan R34 GTR] car、 はcarクラス) の場合、クラス固有の事前保存損失が適用され、モデルが元のクラスに対して既に学習されている内容に基づいて、被写体の多様なインスタンスを生成するようにモデルが促される。[1]入力画像セットから取得された低解像度画像と高解像度画像のペアを使用して、超解像度コンポーネントを微調整し、被写体の微細な詳細を維持できるようにする。[1]
使用法
DreamBoothは、 Stable Diffusionなどのモデルを微調整するために使用でき、特定の個人の画像を適切に生成できないというStable Diffusionの一般的な欠点を軽減できる可能性があります。[4]ただし、このような使用例ではVRAMを大量に消費するため、趣味のユーザーにはコストがかかりすぎます。 [4]特にDreamBoothのStable Diffusion適応は、2022年にRuizらが発表した元の論文で概説された技術に基づいて、無料のオープンソースプロジェクトとしてリリースされています。 [5]悪意のある人物がDreamBoothを利用して悪意のある目的で誤解を招く画像を生成できること、およびオープンソースであるため誰でもこの技術を利用したり、改良したりできることについて懸念が提起されています。[6]さらに、アーティストは、人間のアーティストに関連する特定のアートスタイルを模倣することを特に目的としたモデルチェックポイントをDreamBoothを使用してトレーニングすることの倫理性について懸念を表明しています。そのような批評家の一人は、ディズニーとペンギンランダムハウスのイラストレーターであるホリー・メンガートです。彼女は、DreamBoothを通じてチェックポイントモデルに彼女のアートスタイルを訓練させ、彼女の同意なしにオンラインで共有しました。[7] [8]
参考文献
- ^ abcd Ruiz, Nataniel; Li, Yuanzhen; Jampani, Varun; Pritch, Yael; Rubinstein, Michael; Aberman, Kfir (2022年8月25日). 「DreamBooth: 主題主導型生成のためのテキストから画像への拡散モデルの微調整」. arXiv : 2208.12242 [cs.CV].
- ^ 山下裕貴 (2022年9月1日). 「愛犬の合成画像を生成できるAI文章で指示するだけでコスプレ米Googleが開発」。アイティメディア株式会社2022年8月31日のオリジナルからアーカイブ。
米Google Researchと米ボストン大学の研究チームが開発した...数枚の主題画像とテキスト入力を使って、与えられた主題が溶け込んだ新たな合成画像を
[...Google Research とボストン大学の研究チームによって開発された、主題とテキスト プロンプトの複数の画像を取得する主題駆動型 Text-to-Image モデルです。
被写体をフィーチャーした新しく生成された画像を作成します。] - ^ Brendan Murphy (2022年10月13日). 「AIによる画像生成は驚異的なスピードで進歩している。それでも、写真が偽物かどうか見分けられるのか?」The Conversation . 2022年10月30日時点のオリジナルよりアーカイブ。
最近、GoogleはDream Boothをリリースした。これは、特定の人物、オブジェクト、さらにはアートスタイルをテキストから画像に変換するAIシステムに注入するための、より洗練された代替手法である。
- ^ ab 清水涼 (2022年10月26日). 「覚悟の「世界変革」──この2カ月で画像生成AIに起きたか?」ヤフー!ニュースジャパン(日本語) 2022年10月26日のオリジナルよりアーカイブ。
安定した拡散は、一般に個人の写真や特定の人物を出すのが苦手ですが、自分のペットや友人の写真をわずかな枚数から学習させる「Dreambooth」という技術が開発され、これも話題を呼んだ
。一般的に個人的な写真や特定の個人を生成することは不十分ですが、「Dreambooth」の開発により、ペットや友人が写った少数の写真からトレーニングできるようになり、大きな話題を呼びました。ただし、欠点は、Dreambooth には大量の GPU メモリが必要なため、個人ユーザーが趣味の価格帯で購入できる GPU で実行するのは事実上不可能であることです。 - ^ Benj Edwards (2022年12月9日). 「AI画像生成技術により、人生を破壊するディープフェイクを簡単に作成できるようになりました」。Ars Technica。2022年12月12日時点のオリジナルよりアーカイブ。
しかし、発表から間もなく、誰かがDreamboothの技術をStable Diffusionで動作するように適応させ、オープンソースプロジェクトとしてコードを自由にリリースしました。
- ^ Kevin Jiang (2022年12月1日). 「これらのAI画像は私にそっくりです。ディープフェイクの将来にとってそれは何を意味するのでしょうか?」. Toronto Star . 2022年12月8日時点のオリジナルよりアーカイブ。
たとえば、DreamBoothは、署名や公式標識をコピーして偽造文書を作成したり、政治家の誤解を招く写真やビデオを作成したり、個人のリベンジポルノを製造したりするために使用できます...DreamBoothとStable Diffusionの特定の問題は、オープンソースであることです、とGupta氏は続けました。画像作成に規制や障壁を課す可能性のある中央集権型のAI生成モデルとは異なり、DreamBoothのような分散型モデルでは、誰でもテクノロジーにアクセスして改善することができます。
- ^ イザベル・バーウィック、ソフィア・スミス(2022年12月14日)。「AIは人間の労働者に取って代わるのか?」フィナンシャル・タイムズ。
イラストレーターのホリー・メンガートは、自身の作品が許可なくAIモデルのトレーニングに使用されたが、アーティストの作品を許可なくAIモデルにトレーニングさせる行為に公に反対した。
- ^ "Генеративные нейросети и этика: появилась модель, копирующая стиль конкретного художника". DTF (ロシア語)。 2022 年 11 月 9 日。2022 年 11 月 9 日のオリジナルからアーカイブ
。 своеобразным датасетом для новой нейросети (не давая на то согласия)... «В первую очередь мне показалось бестактным то、что моё имя Єигурировало в этом инструменте。 Я ничего о нём не знала и меня об этом не спразивали. А если бы меня спросили, можно ли это сделать, я бы не согласилась».
[それで、つい最近、アーティスト兼イラストレーターのホリー・メンガートが新しいニューラルネットワークのデータソースになりました(彼女の同意なしに)...「私の最初の反応は、このツールに私の名前が載っているのは侵入的だと感じたことでした。私はそれについて何も知らなかったし、それについて尋ねられたこともなかった。もし彼らがこれをできるかどうか尋ねられたら、私はイエスとは言わなかっただろう。」
