Stable Diffusionは、拡散技術に基づいた深層学習型のテキスト画像変換モデルで、2022年にリリースされました。この生成型人工知能技術は、 Stability AIの代表的な製品であり、現在進行中のAIブームの一翼を担うものと考えられています。
主にテキストの説明に基づいて詳細な画像を生成するために使用されますが、テキストプロンプトによって誘導されるインペインティング、アウトペインティング、画像間の変換の生成などの他のタスクにも適用できます。[ 3 ]その開発には、ミュンヘン大学CompVis グループとRunwayの研究者が参加し、Stability からの計算リソースの提供と非営利団体からのトレーニング データが提供されました。[ 4 ] [ 5 ] [ 6 ] [ 7 ]
Stable Diffusion は潜在拡散モデルであり、一種の深層生成型人工ニューラルネットワークです。そのコードとモデルの重みは公開されており、 [ 8 ]最適化されたバージョンは、わずか 2.4 GB VRAMの控えめなGPUを搭載したほとんどの消費者向けハードウェアで実行できます。[ 9 ]これは、クラウド サービス経由でのみアクセス可能だったDALL-EやMidjourneyなどの以前の独自のテキストから画像へのモデルからの脱却を示しています。[ 10 ] [ 11 ]
Stable Diffusion はLatent Diffusionと呼ばれるプロジェクトから派生したもので、ミュンヘンのLMU ミュンヘンとハイデルベルク大学の研究者によってドイツで開発されました。 [ 12 ]オリジナルの 5 人の著者のうち 4 人 (Robin Rombach、Andreas Blattmann、Patrick Esser、Dominik Lorenz) は後に Stability AI に加わり、Stable Diffusion の後継バージョンをリリースしました。[ 13 ]
このモデルの技術ライセンスは、ミュンヘン大学(LMU)のCompVisグループによって公開されました。[ 11 ]開発は、Stable Diffusionで使用されている潜在拡散モデルアーキテクチャを以前に発明した研究者の一人であるRunwayのPatrick EsserとCompVisのRobin Rombachによって主導されました。 [ 7 ] Stability AIは、 EleutherAIとLAION(Stable Diffusionのトレーニングに使用されたデータセットを収集したドイツの非営利団体)もプロジェクトの支援者として挙げています。 [ 7 ]


2015年に導入された拡散モデルは、トレーニング画像にガウスノイズを連続的に適用して除去することを目的としてトレーニングされます。これは、ノイズ除去オートエンコーダのシーケンスと考えることができます。拡散という名前は、熱力学から着想を得て最初に開発されたことから、熱力学的拡散に由来しています。[ 14 ] [ 15 ]
SD 3 より前の Stable Diffusion シリーズのすべてのモデルは、ミュンヘン大学 (LMU)のCompVis (Computer Vision & Learning) [ 16 ]グループによって 2021 年に開発された潜在拡散モデル (LDM)と呼ばれる拡散モデルの変種を使用していた。[ 17 ] [ 8 ]
Stable Diffusion は、変分オートエンコーダ(VAE)、U-Net、およびオプションのテキストエンコーダの 3 つの部分で構成されています。 [ 18 ] VAE エンコーダは、画像をピクセル空間からより小さな次元の潜在空間に圧縮し、画像のより基本的な意味を捉えます。[ 17 ]ガウスノイズは、順方向拡散中に圧縮された潜在表現に繰り返し適用されます。[ 18 ] ResNetバックボーンで構成される U-Net ブロックは、順方向拡散からの出力を逆方向にノイズ除去して潜在表現を取得します。最後に、VAE デコーダは、表現をピクセル空間に戻すことで最終画像を生成します。[ 18 ]
ノイズ除去ステップは、テキスト文字列、画像、または他のモダリティに基づいて柔軟に条件付けできます。エンコードされた条件付けデータは、クロスアテンションメカニズムを介してノイズ除去U-Netに公開されます。[ 18 ]テキストによる条件付けの場合、固定の事前学習済みCLIP ViT-L/14テキストエンコーダを使用して、テキストプロンプトを埋め込み空間に変換します。[ 8 ]研究者らは、LDMの利点として、トレーニングと生成の計算効率の向上を指摘しています。[ 7 ] [ 17 ]
U-Net のパラメータが 8億6000 万、テキストエンコーダのパラメータが 1億2300 万であるStable Diffusion は、2022 年の基準からすると比較的軽量であると考えられており、他の拡散モデルとは異なり、コンシューマーGPU [ 19 ] で実行でき、Stable Diffusion のOpenVINOバージョンを使用する場合はCPUのみでも実行できます。[ 20 ]
XLバージョンは、以前のバージョンと同じLDMアーキテクチャを使用していますが、[ 21 ]規模が大きくなっています。UNetバックボーンが大きく、クロスアテンションコンテキストが大きく、テキストエンコーダーが1つではなく2つあり、複数のアスペクト比でトレーニングされています(以前のバージョンのように正方形のアスペクト比だけではありません)。
同時にリリースされたSD XL Refinerは、SD XLと同じアーキテクチャを採用していますが、テキスト条件付きimg2imgを介して既存の画像に細かいディテールを追加するようにトレーニングされています。
バージョン3.0 [ 22 ]ではバックボーンが完全に変更されています。UNetではなく、Transformerを使用して整流フロー法[ 23 ] [ 24 ]を実装する整流フロートランスフォーマーです。
SD 3.0で使用されるTransformerアーキテクチャは、元のテキストエンコーディング、変換後のテキストエンコーディング、および画像エンコーディング(潜在空間)の3つの「トラック」を備えています。変換後のテキストエンコーディングと画像エンコーディングは、各Transformerブロック内で混合されます。
このアーキテクチャは「マルチモーダル拡散変換器(MMDiT)」と呼ばれ、「マルチモーダル」とは、その処理内でテキストと画像のエンコーディングを混在させることを意味します。これは、テキストエンコーディングが画像エンコーディングに影響を与えるものの、その逆は起こらない従来のDiTとは異なります。
Stable Diffusion は、Web からスクレイピングされたCommon Crawlデータから派生した公開データセットである LAION-5B から取得した画像とキャプションのペアでトレーニングされました。このデータセットでは、50 億個の画像とテキストのペアが言語に基づいて分類され、解像度、透かしが含まれていると予測される可能性、および予測される「美的」スコア (主観的な視覚的品質など) によって個別のデータセットにフィルタリングされています。[ 25 ]このデータセットは、Stability AI から資金提供を受けているドイツの非営利団体LAIONによって作成されました。 [ 25 ] [ 26 ] Stable Diffusion モデルは、LAION-5B の 3 つのサブセット (laion2B-en、laion-high-resolution、および laion-aesthetics v2 5+) でトレーニングされました。[ 25 ]モデルのトレーニングデータの第三者による分析では、 元のより広いデータセットから抽出された 1200 万枚の画像の小さなサブセットのうち、画像のサンプルサイズの約 47% が 100 の異なるドメインから来ており、Pinterest がサブセットの 8.5% を占め、 WordPress、Blogspot、Flickr、DeviantArt、Wikimedia Commonsなどの Web サイトがそれに続いていることが判明しました。 バイエリッシャー放送による調査では、Hugging Face でホストされている LAION のデータセットには大量のプライベートで機密性の高いデータが含まれていることが示されました。[ 27 ]
このモデルは当初、laion2B-en および laion-high-resolution サブセットでトレーニングされ、最後の数回のトレーニングは LAION-Aesthetics v2 5+ で行われました。LAION-Aesthetics v2 5+ は、 LAION-Aesthetics Predictor V2 が、人間が平均して、それらの好みを評価するように求められたときに 10 点満点中 5 点以上を与えるだろうと予測した 6 億枚のキャプション付き画像のサブセットです。[ 28 ] [ 25 ] [ 29 ] LAION-Aesthetics v2 5+ サブセットでは、低解像度の画像と、LAION-5B-WatermarkDetection が80% 以上の確率で透かしが入っていると識別した画像も除外されました。 [ 25 ]さらに、トレーニングの最終ラウンドでは、Classifier-Free Diffusion Guidance を改善するために、テキスト条件付けの 10% を削除しました。 [ 30 ]
このモデルは、 Amazon Web Services上の 256 個のNvidia A100 GPU を使用して、合計 150,000 GPU 時間、600,000 ドルの費用でトレーニングされました。 [ 31 ] [ 32 ] [ 33 ]
Stable Diffusion には、特定のシナリオで劣化や不正確さの問題があります。モデルの初期リリースは、512×512 解像度の画像で構成されるデータセットでトレーニングされたため、ユーザーの仕様が「想定される」 512×512 解像度から逸脱すると、生成される画像の品質が著しく低下します。[ 34 ] Stable Diffusion モデルのバージョン 2.0 アップデートでは、768×768 解像度で画像をネイティブに生成する機能が導入されました。[ 35 ]もう 1 つの課題は、LAION データベースの四肢のデータ品質が低いため、人間の四肢を生成することです。[ 36 ]このモデルは、データベースに代表的な特徴がないため、人間の四肢や顔を再現するように十分にトレーニングされておらず、このようなタイプの画像を生成するようにモデルに促すと、モデルが混乱する可能性があります。[ 37 ]人間の四肢に加えて、Stable Diffusion は判読可能なアンビグラムやその他のテキストやタイポグラフィの形式を生成することができません。2023 年 7 月にリリースされた Stable Diffusion XL (SDXL) バージョン 1.0 では、ネイティブ 1024x1024 解像度が導入され、四肢とテキストの生成が改善されました。[ 38 ] [ 39 ]
個々の開発者にとってのアクセス性も問題となる可能性がある。データセットに含まれていない新しいユースケース(アニメキャラクターの生成(「waifu diffusion」)など)に合わせてモデルをカスタマイズするには、 [ 40 ]新しいデータとさらなるトレーニングが必要となる。追加の再トレーニングによって作成されたStable Diffusionの微調整された適応は、医療画像処理[ 41 ]からアルゴリズムで生成された音楽[ 42 ]まで、さまざまなユースケースで使用されている。しかし、この微調整プロセスは新しいデータの品質に敏感である。低解像度の画像や元のデータとは異なる解像度の画像は、新しいタスクを学習できないだけでなく、モデル全体のパフォーマンスを低下させる可能性がある。モデルがさらに高品質の画像でトレーニングされたとしても、個人が民生用電子機器でモデルを実行することは難しい。例えば、waifu-diffusionのトレーニングプロセスには最低30GB のVRAMが必要であり[ 43 ]、これはNvidiaのGeForce 30シリーズなどの一般消費者向けGPUで通常提供されるリソース(約12GB )を超えている[ 44 ] 。
Stable Diffusion の開発者は、モデルが主に英語の説明が付いた画像でトレーニングされたため、アルゴリズムの偏りの可能性を認めています。 [ 32 ]その結果、生成された画像は社会的偏見を強化し、西洋の視点からのものとなります。開発者は、モデルに他のコミュニティや文化からのデータが不足していることを指摘しています。このモデルは、他の言語で書かれたプロンプトと比較して、英語で書かれたプロンプトに対してより正確な結果を示し、西洋または白人文化がデフォルトの表現となることがよくあります。[ 32 ]
モデルの初期トレーニングの限界に対処するため、エンドユーザーは、生成出力をより具体的なユースケースに合わせて微調整するための追加トレーニングを実施することを選択できます。このプロセスはパーソナライゼーションとも呼ばれます。ユーザーがアクセスできる微調整を安定拡散モデルのチェックポイントに適用する方法は、次の3つです。
安定拡散モデルは、出力に含める要素または除外する要素を記述したテキストプロンプトを使用して、ゼロから新しい画像を生成する機能をサポートしています。[ 8 ]既存の画像は、拡散ノイズ除去メカニズムを介して、テキストプロンプトで記述された新しい要素を組み込むようにモデルによって再描画できます(「ガイド付き画像合成」[ 49 ]として知られるプロセス)。[ 8 ]さらに、このモデルは、適切なユーザーインターフェイス(このような機能をサポートする多数の異なるオープンソース実装が存在する)と併用することで、プロンプトを使用してインペインティングとアウトペインティングを介して既存の画像を部分的に変更することもできます。[ 50 ]
Stable Diffusionは10GB以上のVRAMで実行することを推奨しますが、VRAMが少ないユーザーは、モデルのパフォーマンスとVRAM使用量のトレードオフとして、デフォルトのfloat32ではなくfloat16 精度で重みをロードすることを選択できます。[ 34 ]
Stable Diffusion 内のテキストから画像へのサンプリング スクリプト (「txt2img」として知られています) は、テキスト プロンプトに加えて、サンプリング タイプ、出力画像のサイズ、シード値など、さまざまなオプション パラメータを受け取ります。スクリプトは、モデルによるプロンプトの解釈に基づいて画像ファイルを出力します。[ 8 ]生成された画像には、ユーザーが Stable Diffusion によって生成された画像を識別できるように、目に見えないデジタル ウォーターマークが付けられます。 [ 8 ]ただし、このウォーターマークは、画像がサイズ変更または回転されると有効性を失います。[ 51 ]
txt2img の各生成では、出力画像に影響を与える特定のシード値が使用されます。ユーザーは、生成されたさまざまな出力を探索するためにシードをランダム化することも、以前に生成された画像と同じ画像出力を得るために同じシードを使用することもできます。 [ 34 ]ユーザーは、サンプラーの推論ステップ数を調整することもできます。値が大きいほど時間がかかりますが、値が小さいと視覚的な欠陥が発生する可能性があります。[ 34 ]設定可能なもう 1 つのオプションである分類器フリーガイダンススケール値を使用すると、出力画像がプロンプトにどれだけ近いかを調整できます。[ 30 ]より実験的な使用例ではスケール値を低く設定し、より具体的な出力を目指す使用例ではスケール値を高く設定することができます。[ 34 ]
追加の text2img 機能は Stable Diffusion のフロントエンド実装によって提供され、ユーザーはテキストプロンプトの特定の部分に割り当てられる重みを変更できます。強調マーカーを使用すると、キーワードを括弧で囲むことで、キーワードの強調を追加または軽減できます。[ 52 ]プロンプトの一部に重みを調整する別の方法は「ネガティブプロンプト」です。ネガティブプロンプトは、Stability AI 独自の DreamStudio クラウドサービスを含む一部のフロントエンド実装に含まれる機能で、モデルが画像生成中に避けるべきプロンプトをユーザーが指定できます。指定されたプロンプトは、ユーザーが提供したポジティブプロンプト、またはモデルが最初にトレーニングされた方法により、画像出力に含まれてしまう望ましくない画像の特徴である可能性があり、人間の手がひどく損傷しているのが一般的な例です。[ 50 ] [ 53 ]
Stable Diffusionには、テキストプロンプト、既存の画像へのパス、および0.0から1.0までの強度値を受け取る別のサンプリングスクリプト「img2img」も含まれています。このスクリプトは、テキストプロンプトで指定された要素も含む元の画像に基づいて新しい画像を出力します。強度値は、出力画像に追加されるノイズの量を示します。強度値が高いほど画像内のバリエーションは大きくなりますが、指定されたプロンプトと意味的に一致しない画像が生成される場合があります。[ 8 ]
img2imgを実行するにはさまざまな方法があります。主な方法はSDEdit [ 54 ]で、まず画像にノイズを追加し、次にtext2imgで通常どおりノイズを除去します。
img2img は元の画像にノイズを追加できるため、画像データの視覚的特徴を変更して匿名化するデータ匿名化やデータ拡張に役立つ可能性があります。 [ 55 ]同じプロセスは、画像の解像度を上げて画像に詳細を追加する画像アップスケーリングにも役立つ可能性があります。[ 55 ]さらに、 Stable Diffusion は画像圧縮ツールとして実験されています。JPEGやWebPと比較すると、Stable Diffusion で画像圧縮に使用される最近の手法は、小さなテキストや顔を保持することに制限があります。[ 56 ]
img2img を介した画像変更の追加ユースケースは、Stable Diffusion モデルの多数のフロントエンド実装によって提供されています。インペインティングでは、ユーザーが指定したレイヤーマスクで区切られた既存画像の一部を選択的に変更し、マスクされた領域を、指定されたプロンプトに基づいて新たに生成されたコンテンツで埋めます。[ 50 ]インペインティングのユースケースに特化して微調整された専用モデルは、Stable Diffusion 2.0 のリリースと同時に Stability AI によって作成されました。[ 35 ]一方、アウトペインティングでは、画像を元の寸法を超えて拡張し、以前は空いていた領域を、指定されたプロンプトに基づいて生成されたコンテンツで埋めます。[ 50 ]
2022年11月24日にリリースされたStable Diffusion 2.0では、「depth2img」という深度誘導型モデルが導入されました。このモデルは、提供された入力画像の深度を推測し、テキストプロンプトと深度情報の両方に基づいて新しい出力画像を生成します。これにより、生成された出力画像で元の入力画像の一貫性と深度が維持されます。[ 35 ]
ControlNet [ 57 ]は、追加の条件を組み込むことで拡散モデルを管理するように設計されたニューラルネットワークアーキテクチャです。ニューラルネットワークブロックの重みを「ロックされた」コピーと「トレーニング可能な」コピーに複製します。「トレーニング可能な」コピーは目的の条件を学習し、「ロックされた」コピーは元のモデルを保持します。このアプローチにより、画像ペアの小さなデータセットでトレーニングしても、本番環境に対応した拡散モデルの整合性が損なわれないことが保証されます。「ゼロ畳み込み」は、重みとバイアスの両方がゼロに初期化された 1×1 畳み込みです。トレーニング前に、すべてのゼロ畳み込みはゼロ出力を生成するため、ControlNet によって引き起こされる歪みが防止されます。どのレイヤーも最初からトレーニングされるわけではなく、プロセスはまだ微調整中で、元のモデルが安全です。この方法により、小規模または個人用デバイスでのトレーニングが可能になります。
ControlNetは、最終画像に求められる特性をマッピングする入力画像に基づいて画像の生成を変更するためによく使用されます。一般的なマッピング画像の種類には、深度マップ、エッジ、または1つ以上の骨格ポーズなどがあります。これらの入力は直接生成される場合もありますが、ニューラルネットワークやエッジ検出などのプロセスを使用して、他の画像から生成されることもよくあります。
Stability は、 DreamStudioと呼ばれるオンライン画像生成サービスを提供しています。[ 58 ] [ 59 ]同社はまた、 StableStudioと呼ばれるDreamStudioのオープンソース版もリリースしました。[ 60 ] [ 61 ] Stability のインターフェースに加えて、多くのサードパーティのオープンソース インターフェースが存在します。たとえば、最も人気があり追加機能を提供するAUTOMATIC1111 Stable Diffusion Web UI 、 [ 62 ]ユーザーが必要とするプロンプトの量を減らすことを目的としたFooocus 、 [ 63 ]および、多くの3D モデリングアプリケーションに似た視覚プログラミング言語であるノードベースのユーザー インターフェースを備えたComfyUI。[ 64 ] [ 65 ] [ 66 ]
主要論文
研修費用
Stable Diffusion 3.5 Large は、 Amazon Web ServicesのAmazon Bedrock上でエンタープライズ用途向けに提供されました。[ 81 ]
Stable Diffusionは生成された画像に対するいかなる権利も主張せず、画像の内容が違法または個人に有害でない限り、モデルから生成された画像の使用権をユーザーに自由に付与します。[ 82 ]
Stable Diffusionの学習に使用された画像は人間の介入なしにフィルタリングされており、その結果、有害な画像や大量のプライベート情報や機密情報が学習データに含まれてしまった。[ 27 ]
より伝統的な視覚芸術家は、Stable Diffusion などの画像合成ソフトウェアの普及により、最終的には人間の芸術家が写真家、モデル、映画監督、俳優とともに、AI ベースの競合相手に対して徐々に商業的な存続可能性を失うことになるのではないかと懸念を表明している。[ 83 ]
Stable Diffusionは、生成AIに基づく他の商用製品と比較して、暴力的な画像や性的に露骨な画像など、ユーザーが生成できるコンテンツの種類に関して著しく寛容です。[ 84 ]このモデルが悪用される可能性があるという懸念に対し、Stability AIのCEOであるEmad Mostaque氏は、「この技術をどのように運用するかは、倫理的、道徳的、合法的であるかどうかは人々の責任である」と主張し[ 11 ] 、 Stable Diffusionの機能を一般の人々の手に委ねることで、潜在的な悪影響にもかかわらず、この技術は純利益をもたらすことになると述べています。[ 11 ]さらに、Mostaque氏は、Stable Diffusionをオープンに提供する意図は、これまで画像合成のためのクローズドなAIシステムしか開発してこなかった企業による、このような技術に対する支配と統制を終わらせることにあると主張しています。[ 11 ] [ 84 ]これは、ソースコードが入手可能なため、Stability AI がユーザーが生成するコンテンツに課す制限は簡単に回避できるという事実に反映されています。[ 85 ]
Stable Diffusionが生成した未成年キャラクターの写実的な性的描写をめぐる論争が、 Pixivなどのウェブサイトで共有されたことから持ち上がっている。[ 86 ]
2024年6月、 Stable DiffusionのユーザーインターフェースであるComfyUIの拡張機能に対するハッキングが発生し、ハッカーたちはAIアート生成、アートの盗用、暗号通貨の宣伝など、「我々の罪」を犯したユーザーを標的にしたと主張した。[ 87 ]
2023年1月、サラ・アンダーセン、ケリー・マッカーナン、カーラ・オルティスの3人のアーティストは、 Stability AI、Midjourney、DeviantArtに対して著作権侵害訴訟を起こし、これらの企業が、元のアーティストの同意なしにウェブから収集した50億枚の画像でAIツールを訓練することにより、何百万ものアーティストの権利を侵害したと主張した。[ 88 ]
2023年7月、米国地方裁判所判事ウィリアム・オリックは、アンダーセン、マッカーナン、オルティスが提起した訴訟の大部分を却下する意向を示したが、新たな訴状を提出することを許可し、彼らに主張を再構成する機会を与えた。[ 89 ]
2023年1月、ゲッティイメージズは、知的財産権の重大な侵害を主張し、英国高等法院でStability AIに対する訴訟を起こした。ゲッティイメージズは、Stability AIがゲッティのウェブサイトから同意なしに数百万枚の画像を「スクレイピング」し、これらの画像を使用して深層学習のStable Diffusionモデルを訓練および開発したと主張している。[ 90 ] [ 91 ]
訴訟の主な論点は以下のとおりです。
2025年11月4日現在、ゲッティイメージズはAI画像生成器をめぐる訴訟でStability AIに大敗し、ゲッティと一部の弁護士は英国における著作権所有者の保護強化を求めた。[ 94 ]
DALL-Eのようなモデルとは異なり、Stable Diffusionはソースコードを公開し、モデル(事前学習済み重み)も公開しています。[ 95 ] [ 8 ] Stable Diffusion 3より前は、責任あるAIライセンス(RAIL)の一種であるCreative ML OpenRAIL-Mライセンスをモデル(M)に適用していました。 [ 96 ]このライセンスでは、犯罪、名誉毀損、嫌がらせ、個人情報の暴露、「未成年者の搾取」、医療アドバイスの提供、法的義務の自動生成、法的証拠の作成、および「社会的行動や個人的または人格的特性、または法的に保護された特性やカテゴリに基づいて個人またはグループを差別または危害すること」など、特定の使用例を禁止しています。[ 97 ] [ 98 ]ユーザーは生成された出力画像の権利を所有し、商用利用も自由です。[ 99 ]
Stable Diffusion 3.5 は寛容な Stability AI Community License を適用しますが、収益が 100 万ドルを超える商用企業は Stability AI Enterprise License が必要です。[ 100 ] OpenRAIL-M ライセンスと同様に、ユーザーは生成された出力画像の権利を保持し、商用利用も自由です。[ 1 ]
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1 maint: url-status (リンク){{cite arXiv}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)キャンペーン団体であるCCDHは、Midjourney、OpenAIのChatGPT Plus、Stability.aiのDreamStudio、MicrosoftのImage Creatorという、一般向けAIプラットフォームの4つをテストした。