機械学習において、拡散モデル(拡散ベース生成モデルまたはスコアベース生成モデルとも呼ばれる)は、潜在変数生成モデルの一種です。拡散モデルは、順方向拡散プロセスと逆方向サンプリングプロセスの 2 つの主要なコンポーネントで構成されています。拡散モデルの目標は、与えられたデータセットに対して拡散プロセスを学習し、そのプロセスが元のデータセットと同様に分布する新しい要素を生成できるようにすることです。拡散モデルは、拡散プロセスによって生成されたデータをモデル化します。このプロセスでは、新しいデータが、すべての可能なデータの空間をドリフトを伴うランダムウォークを実行します。 [ 1 ]学習済みの拡散モデルは、さまざまな効率と品質で、さまざまな方法でサンプリングできます。
マルコフ連鎖、ノイズ除去拡散確率モデル、ノイズ条件付きスコアネットワーク、確率微分方程式など、さまざまな同等の形式があります。 [ 2 ]これらは通常、変分推論を使用してトレーニングされます。[ 3 ]ノイズ除去を担当するモデルは、通常「バックボーン」と呼ばれます。バックボーンはどのような種類でも構いませんが、通常はU-netまたはトランスフォーマーです。
2024年現在拡散モデルは、主にコンピュータビジョンタスク、画像ノイズ除去、インペインティング、超解像、画像生成、ビデオ生成などに使用されます。これらのタスクでは、通常、ガウスノイズでぼやけた画像を順次ノイズ除去するようにニューラルネットワークをトレーニングします。[ 1 ] [ 4 ]このモデルは、画像にノイズを追加するプロセスを逆にするようにトレーニングされます。トレーニングが収束した後、ランダムノイズで構成された画像から始めて、ネットワークを反復的に適用して画像をノイズ除去することで、画像生成に使用できます。
拡散ベースの画像生成器は、 Stable DiffusionやDALL-Eなど、商業的に広く関心を集めています。これらのモデルは通常、拡散モデルをテキストエンコーダーやクロスアテンションモジュールなどの他のモデルと組み合わせることで、テキスト条件付き生成を可能にします。[ 5 ]
コンピュータビジョン以外にも、拡散モデルは自然言語処理[ 6 ] 、テキスト生成[ 7 ]や要約[ 8 ]、音声生成[ 9 ]、強化学習[ 10 ] [ 11 ]などの分野で応用されている。
拡散モデルは、非常に複雑な確率分布からサンプリングできるモデルをトレーニングする方法として2015年に導入されました。これらは、非平衡熱力学、特に拡散の技術を使用しています。[ 12 ]
例えば、自然界に存在するすべての写真の分布をどのようにモデル化できるかを考えてみましょう。各画像はすべての画像空間における点であり、自然界に存在する写真の分布は空間内の「雲」です。この雲は、画像に繰り返しノイズを加えることで画像空間全体に拡散し、最終的にはガウス分布とほとんど区別がつかなくなります。拡散を近似的に元に戻すことができるモデルを用いることで、元の分布からサンプリングを行うことができる。これは、最終的な分布とは異なり、開始時の分布が平衡状態にないため、「非平衡」熱力学において研究される。
平衡分布はガウス分布である。PDF付きこれは、ポテンシャル井戸内の粒子のマクスウェル・ボルツマン分布に他なりません。温度1において、初期分布は平衡状態から大きく外れているため、平衡分布に向かって拡散し、純粋なランダム性(ブラウン運動のような)とポテンシャル井戸への勾配降下を合わせた偏ったランダムなステップを踏みます。ランダム性は不可欠です。粒子が勾配降下のみを受ける場合、すべての粒子が原点に落下し、分布が崩壊してしまうからです。
2020年の論文では、変分推論によって従来の手法を改良したノイズ除去拡散確率モデル(DDPM)が提案された。[ 3 ] [ 13 ]
モデルを提示するには、いくつかの表記法が必要となる。
順方向拡散プロセスは、ある出発点から始まります。、 どこは学習する確率分布であり、次に、にノイズを繰り返し加える。どこIID(独立同分布の確率変数)サンプルは係数そして確実にと仮定すると. 値は、任意の初期分布に対して、2次モーメントが有限であれば、収束して。
拡散プロセス全体は、またはどこは正規化定数であり、しばしば省略される。特に、次の点に注意する。はガウス過程であり、再パラメータ化においてかなりの自由度を与えてくれます。例えば、ガウス過程の標準的な操作により、特に、大きい場合、変数収束してつまり、十分な拡散過程を経て、最終的にいくつかのそれは非常に近いオリジナルの痕跡がすべて残っている去った。
例えば、サンプルを採取できますすべての中間段階を経ずに、直接「1ステップ」で。
私たちは知っていますはガウス分布であり、は別のガウス分布です。また、これらは互いに独立であることもわかっています。したがって、再パラメータ化を実行できます。どここれらは独立同分布のガウス分布である。
変数は5つありますそして2つの線形方程式。ランダム性の2つの源はこれは、IIDガウス分布が回転対称であるため、回転によって再パラメータ化することができる。
方程式を代入することで、最初の再パラメータ化を求めることができます。どこは平均がゼロ、分散が1のガウス分布に従う。
2つ目の値を求めるには、回転行列を完成させます。
回転行列はすべて次の形式です行列は回転行列の逆行列はその転置行列であるため、
元に戻して、簡略化すると、
DDPMの重要なアイデアは、ニューラルネットワークをパラメータ化して使用することです。ネットワークは2つの引数を受け取ります、そしてベクトルを出力しますそして行列順方向拡散過程の各ステップは、近似的に元に戻すことができる。これにより、逆拡散プロセスが得られます。定義される今の目標はパラメータを学ぶことですそのために最も近い可能な限り正確に行う。そのためには、変分推論を用いた最尤推定法を用いる。
ELBO不等式は次のように述べている。さらに期待値を1つ取ると、右辺の量を最大化することで、観測データの尤度の下限値が得られることがわかります。これにより、変分推論を実行できます。
損失関数を定義するそして今、目標は確率的勾配降下法によって損失を最小化することです。式は次のように簡略化できます[ 14 ]どこパラメータに依存しないため、無視できます。また、パラメータにも依存しない、項も無視できます。これで残るのはと最小限に抑えるべきである。
以来これは、私たちが使用すべきであることを示唆していますただし、ネットワークはアクセスできませんなので、代わりにそれを推定する必要がある。我々はこう書くかもしれない、 どこは未知のガウスノイズです。推定することと同等。
したがって、ネットワークがノイズベクトルを出力するようにする予測させて設計は残るDDPM論文では、それを学習しないこと(「不安定なトレーニングとサンプル品質の低下」につながるため)を提案し、何らかの値に固定することを提案した。どちらか同様の性能を示した。
これにより、損失は次のように単純化されます。これは確率的勾配降下法によって最小化できる可能性がある。論文では、さらに単純な損失関数が経験的にその結果、より優れたモデルが得られた。
ノイズ予測ネットワークの学習が完了したら、以下のようにループ処理で元の分布のデータポイントを生成するために使用できます。
スコアベースの生成モデルは、拡散モデリングの別の定式化です。これらは、ノイズ条件付きスコアネットワーク(NCSN)またはランジュバンダイナミクスによるスコアマッチング(SMLD)とも呼ばれます。[ 15 ] [ 16 ] [ 17 ] [ 18 ]
画像生成の問題を考えてみましょう。画像を表し、すべての可能な画像に対する確率分布をとします。それ自体が分かれば、特定の画像がどれくらいの確率で存在するかを確実に判断できる。しかし、これは一般的には解決困難な問題である。
多くの場合、私たちは特定の画像が出現する絶対的な確率を知ることには興味がありません。むしろ、特定の画像が周囲の画像と比べてどれくらい出現しやすいかを知ることにのみ興味があります。例えば、猫の画像は、その小さなバリエーションと比べてどれくらい出現しやすいでしょうか?画像にヒゲが2本含まれている場合、3本含まれている場合、あるいはガウスノイズが加えられている場合、出現しやすくなるでしょうか?
したがって、私たちは実際にはそれ自体ではなく、むしろ、これには主に2つの影響があります。
スコア関数を次のように定義する。;次に、私たちができることを検討します。
結局、サンプリングを可能にする熱力学を用いる。具体的には、ポテンシャルエネルギー関数がある場合。そして、ポテンシャル井戸内に多数の粒子が存在する場合、熱力学的平衡状態における分布はボルツマン分布となる。温度ボルツマン分布は正確に。
したがって、モデル化するためにまず、任意の都合の良い分布(例えば標準ガウス分布)でサンプリングされた粒子から始め、ランジュバン方程式に従って粒子の前方運動をシミュレートします。 そしてボルツマン分布は、フォッカー・プランク方程式により、唯一の熱力学的平衡状態である。したがって、どのような分布であっても分布は分布は収束し、として。
密度が与えられた場合スコア関数の近似を学びたいこれはスコアマッチングである。[ 19 ]一般的に、スコアマッチングはフィッシャー発散関数を最小化するものとして定式化される。積分を展開し、部分積分を実行すると、これにより、確率的勾配降下法によって最小化できる損失関数(ヒュヴァリネンスコアリングルールとも呼ばれる)が得られます。
画像の分布をモデル化する必要があると仮定し、ホワイトノイズ画像。ほとんどのホワイトノイズ画像は実際の画像とは似ていないので、広範囲にわたってこれはスコア関数の学習において問題となります。なぜなら、ある点の周囲にサンプルがない場合、その点のスコア関数を学習できないからです。スコア関数がわからない場合その時点では、粒子に時間発展方程式を課すことはできない。この問題に対処するために、焼きなましを行います。がホワイトノイズ分布と大きく異なる場合は、ホワイトノイズ分布と区別がつかなくなるまで徐々にノイズを追加していきます。つまり、順拡散を実行し、スコア関数を学習し、そのスコア関数を使用して逆拡散を実行します。
再び順方向拡散過程を考えてみましょう。ただし今回は連続時間で考えます。取ることで極限をとると、確率微分方程式の形で連続拡散過程が得られる。どここれはウィーナー過程(多次元ブラウン運動)である。
さて、この方程式は、過減衰ランジュバン方程式の特殊な場合である。どこは拡散テンソルです。温度であり、は位置エネルギー場です。すると、上記の式が得られます。これが、拡散モデルにおいて「ランジュバン動力学」という表現が用いられることがある理由です。
上記の式は、単一粒子の確率的運動に関するものです。粒子群が以下のように分布していると仮定します。その時そして長い時間が経つと、粒子の雲は安定した分布に落ち着くだろう。。 させて時刻における粒子雲の密度をすると、そして目標は、何らかの方法でそのプロセスを逆転させ、終わりから始めて、再び始まりへと拡散させることです。
フォッカー・プランク方程式によれば、雲の密度は次のように変化する。どこは空間の次元であり、はラプラス演算子である。同様に、
解決済み時間のためにそうすれば、雲の進化を正確に逆転させることができます。密度を持つ別の粒子雲から始めるとしましょう。雲の中の粒子は、
そして、フォッカー・プランク方程式に代入すると、次のようになる。したがって、この点群は、逆方向に進化する元の点群である。[ 20 ]
連続極限では、 など 特に、連続拡散過程の任意の点から中間段階を経ずに直接サンプリングできることがわかります。すると、つまり、素早くサンプリングできるいかなる場合でも。
ここで、ある確率分布を定義する。以上すると、スコアマッチング損失関数は、期待フィッシャーダイバージェンスとして定義される。 トレーニング後、したがって、まずサンプリングすることによって逆拡散プロセスを実行できます。次に、SDEを積分します。に: これは、オイラー・丸山法 などの任意の確率微分方程式の積分法によって行うことができます。
「ノイズ条件付きスコアネットワーク」という名称は、次のように説明されます。
DDPMとスコアベースの生成モデルは同等です。[ 16 ] [ 1 ] [ 21 ]これは、DDPMを使用してトレーニングされたネットワークをNCSNとして使用でき、その逆も同様であることを意味します。
私たちは知っているしたがって、トゥイーディーの公式によれば、 前述のように、DDPM損失関数はと どこ変数変換により、 そして内部の項は最小二乗回帰となるので、ネットワークが実際に損失のグローバル最小値に達すると、次のようになります。
したがって、スコアベースのネットワークが優れている場合、その予測スコアはノイズの優れた予測値となります(スケーリング後)。)、したがってノイズ除去に使用できます。
逆に、連続極限逆方程式の これは、スコアベースの拡散と全く同じ方程式を与えてくれる。 したがって、DDPMの微小ステップにおいて、ノイズ除去ネットワークはスコアベースの拡散を実行する。

DDPMでは、数字のシーケンスこれは(離散時間)ノイズスケジュールと呼ばれます。一般に、厳密に単調増加する関数を考えます。タイプの例えばシグモイド関数など。この場合、ノイズスケジュールは実数のシーケンスとなる。すると、一連のノイズが定義される。そこから他の量が導き出される。
任意のノイズスケジュールを使用するために、ノイズ予測モデルをトレーニングする代わりに1つの列車。
同様に、ノイズ条件付きスコアネットワークの場合、トレーニングの代わりに1つの列車。
画像を生成するオリジナルのDDPM法は、順方向拡散プロセスに通常時間がかかるため、遅い。分配を行うガウス分布に近いように見える。しかし、これは逆拡散プロセスも 1000 ステップかかることを意味する。順拡散プロセスとは異なり、すべてのガウス分布逆拡散プロセスではステップをスキップすることはできません。たとえば、サンプリングするにはモデルが最初にサンプリングする必要がある直接サンプリングを試みる我々が排除することを必要とするだろうこれは一般的に解決困難な問題である。
DDIM [ 22 ]は、DDPM 損失で学習された任意のモデルを取得し、調整可能な量の品質を犠牲にして、いくつかのステップをスキップしてサンプリングする手法です。DDPM のマルコフ連鎖ケースを非マルコフケースに生成する場合、DDIM は逆プロセスの分散が 0 に等しいケースに対応します。言い換えれば、逆プロセス (および順プロセス) は決定論的です。サンプリングステップが少ない場合、DDIM は DDPM を上回ります。
詳細には、DDIMサンプリング方法は以下のとおりです。まず、順方向拡散プロセスから始めます。。そして、逆方向ノイズ除去処理中に、元のデータは次のように推定されます。すると、逆拡散プロセスは任意のステップにジャンプできる、次のノイズ除去サンプルはどこは範囲内の任意の実数です。、 そしては新たにサンプリングされたガウスノイズです。[ 14 ]すべてがすると、逆算プロセスが決定論的になり、このDDIMの特殊なケースも「DDIM」と呼ばれます。元の論文では、プロセスが決定論的である場合、わずか20ステップで生成されたサンプルが、高レベルでは1000ステップで生成されたサンプルと非常に似ていると指摘されています。
元の論文では、単一の「イータ値」を定義することを推奨していた。、したがって。 いつこれはオリジナルのDDPMです。これは完全に決定論的なDDIMです。中間値については、プロセスはそれらの間を補間します。
等価性により、DDIMアルゴリズムはスコアベースの拡散モデルにも適用できる。
拡散モデルは確率分布をモデル化するための一般的な方法であるため、画像上の分布をモデル化したい場合は、まずエンコーダを使用して画像を低次元空間にエンコードし、次に拡散モデルを使用してエンコードされた画像上の分布をモデル化することができます。その後、画像を生成するには、拡散モデルからサンプリングし、デコーダを使用してそれを画像にデコードすることができます。[ 23 ]
エンコーダーとデコーダーのペアは、多くの場合、変分オートエンコーダー(VAE)である。
[ 24 ]は様々なアーキテクチャの改善を提案した。例えば、逆サンプリング中にログ空間補間を提案した。彼らは、学習されたパラメータの場合。
v予測形式では、ノイズ式は角度によって再パラメータ化されるそのためそして、次のように定義される「速度」ネットワークは速度を予測するように訓練されていますノイズ除去は[ 25 ]このパラメータ化により、モデルを全ノイズ(すなわち)に到達するようにトレーニングできるため、パフォーマンスが向上することがわかりました。)そしてそれを逆にするが、標準的なパラメータ化では完全なノイズに達することはない。常に真実である。[ 26 ]
2021年に、分類器を使用してクラス条件付き生成を改善するために分類器ガイダンスが提案されました。元の論文では、テキスト条件付き画像生成を改善するためにCLIPテキストエンコーダが使用されました。[ 27 ]
画像全体の分布からではなく、画像の説明に基づいて条件付きでサンプリングしたいとします。一般的な画像をサンプリングするのではなく、「赤い目の黒猫」という説明に合う画像をサンプリングしたいのです。一般的に、分布からサンプリングしたいのです。、 どこ画像の範囲と、画像のクラスを網羅する(「赤い目の黒猫」という説明は非常に詳細なクラスであり、「猫」というクラスは非常に漠然とした説明である)。
ノイズチャネルモデルの観点から見ると、プロセスは次のように理解できます。画像を生成するには説明に応じて条件付き私たちは、依頼者が実際にイメージしていたものを想像しますしかし、画像はノイズの多いチャネルを通過するため、歪んで出力されます。画像生成とは、依頼者が念頭に置いていたもの。
言い換えれば、条件付き画像生成は単に「テキスト言語から画像言語への翻訳」です。そして、ノイズチャネルモデルと同様に、ベイズの定理を使用して、 言い換えれば、すべての画像の空間の良いモデルと、画像からクラスへの良い変換器があれば、クラスから画像への変換器が「無料で」手に入る。逆拡散の式では、スコアはに置き換えることができます どこは、前述のように学習されたスコア関数であり、微分可能な画像分類器を使用することで発見される。
拡散過程においては、時間に基づいて条件付けを行う必要がある。ただし、通常、分類器モデルは時間に依存しないため、。
分類器ガイダンスはスコア関数の勾配に対して定義されるため、スコアベースの拡散ネットワークに対して定義されますが、前述のように、スコアベースの拡散モデルはノイズ除去モデルと同等です。同様に、したがって、分類器ガイダンスは、修正されたノイズ予測を使用して、拡散ノイズ除去にも機能します。[ 27 ]
分類器誘導拡散モデルは、これは、事後確率の最大値付近に集中している。モデルを最尤推定値に近づけたい場合は、我々は、 どこ逆温度として解釈できる。拡散モデルの文脈では、通常、ガイダンススケールと呼ばれる。モデルは、分布が集中している場所からサンプリングするように強制される。これにより、生成される画像の品質が向上する場合がある。[ 27 ]
これは、前の式に修正を加えたものです。ノイズ除去モデルの場合、[ 28 ]に対応します。
分類器がない場合、それでも画像モデル自体から1つを抽出することができます: [ 28 ] このようなモデルは通常、両方の情報を提示してトレーニングされます。そして両方をモデル化できるようにするそして。
CFGの場合、拡散モデルはデータ分布全体の生成モデルだけでは不十分であることに注意してください。条件付き生成モデルでなければならない例えば、安定拡散では、拡散バックボーンはノイズモデルを入力として受け取ります。、ある時、条件ベクトル(テキストプロンプトをエンコードしたベクトルなど)ノイズ予測を生成します。
ノイズ除去モデルの場合、それは以下に対応します。DDIMによってサンプリングされたアルゴリズムは、次のように記述できます[ 29 ]同様の手法は言語モデルのサンプリングにも適用されます。また、無条件生成の場合に置き換えられますすると、ネガティブな刺激が生じ、世代を遠ざけることになる。状態。[ 30 ] [ 31 ]
拡散モデルが与えられた場合、それを連続プロセスとみなして確率微分方程式を積分することでサンプリングすることも、離散プロセスとみなして離散ステップを反復することでサンプリングすることもできます。「ノイズスケジュール」の選択サンプル品質にも影響を与える可能性があります。ノイズスケジュールとは、ノイズレベルに自然数を送る関数です。騒音規制スケジュールは、多くの場合、地図によって指定されます。2つの定義は同等である。。
DDPM の観点からは、DDPM 自体 (ノイズあり) または DDIM (ノイズの量を調整可能) を使用できます。ノイズを追加するケースは、祖先サンプリングと呼ばれることもあります。[ 32 ]ノイズありとノイズなしの間を補間できます。ノイズの量は次のように表されます。DDIM論文の「イータ値」では、ノイズがないことを示し(決定論的DDIMと同様)、(DDPMのように)完全なノイズを表す。
SDEの観点からは、オイラー・丸山法、ヒューン法、線形多段階法など、任意の数値積分法を使用できます。離散の場合と同様に、積分中に調整可能な量のノイズを追加できます。[ 33 ]
画像生成の文脈におけるサンプラーの調査と比較が行われた。[ 34 ]
注目すべき変種としては、[ 35 ]ポアソン流生成モデル、[ 36 ]一貫性モデル、[ 37 ]臨界減衰ランジュバン拡散、[ 38 ] GenPhys、[ 39 ]冷拡散、[ 40 ]などがある。
抽象的に言えば、拡散モデルの考え方は、未知の確率分布(自然な画像分布)を取り上げ、それらを絶対的に連続した確率経路で結ぶことにより、それを既知の確率分布(標準ガウス分布)へと段階的に変換していくというものです。この確率経路は、実際にはスコア関数によって暗黙的に定義されます。。
ノイズ除去拡散モデルでは、順方向プロセスでノイズを追加し、逆方向プロセスでノイズを除去します。順方向プロセスと逆方向プロセスはどちらも確率微分方程式(SDE)ですが、順方向プロセスは閉形式で積分可能であるため、計算コストなしで実行できます。逆方向プロセスは閉形式で積分できないため、標準的なSDEソルバーで段階的に積分する必要があり、非常にコストがかかる場合があります。拡散モデルにおける確率経路は伊藤プロセスによって定義され、確率ODEフロー定式化を使用して決定論的プロセスを取得できます。[ 1 ]
フローベースの拡散モデルでは、順方向プロセスは時間依存ベクトル場に沿った決定論的な流れであり、逆方向プロセスも同じベクトル場に沿った決定論的な流れですが、逆方向に進みます。どちらのプロセスも常微分方程式(ODE)の解です。ベクトル場が良好な性質を持つ場合、ODEも良好な性質を持ちます。
2つの分布が与えられた場合そして流れベースのモデルは時間依存の速度場であるで点をサンプリングすることから始めると、そして、速度場に従って動かす。 結論として解決策上記の常微分方程式は確率経路を定義するプッシュフォワード測定演算子によって。特に、。
確率経路と速度場も、確率分布の意味で 連続方程式を満たす。 確率パスを構築するには、まず条件付き確率パスを構築することから始めます。および対応する条件付き速度場ある条件付き分布について自然な選択肢としては、ガウス条件付き確率経路が挙げられます。 条件付きガウス経路間の測地線経路に対応する条件付き速度場は 確率経路と速度場は周辺化によって計算される
最適輸送フロー[ 41 ]の考え方は、ワッサースタイン距離を最小化する確率経路を構築することである。条件付けを行う分布は、最適輸送計画の近似値である。そして:そして、 どこは最適な輸送計画であり、ミニバッチ最適輸送によって近似することができます。バッチサイズが大きくない場合、計算される輸送計画は真の最適輸送計画から大きくかけ離れる可能性があります。
整流流[ 42 ] [ 43 ]の考え方は、各流路に沿って速度がほぼ一定となるような流れモデルを学習することです。このようなベクトル場に沿って非常に少ないステップで積分できるため、これは有益です。たとえば、常微分方程式完全にまっすぐな経路をたどると、それは単純化され、これにより、1回のステップで正確な解を得ることができます。実際には、そのような完璧さを達成することはできませんが、流れ場がそれに近い状態であれば、多くの小さなステップではなく、いくつかの大きなステップで解を求めることができます。
基本的な考え方は、2つの分布から始めることです。そして次に、流れ場を構築する。そこから、繰り返し「リフロー」操作を適用して連続するフローフィールドを取得する。流れ場は、前の流れ場よりも直線的になります。流れ場が用途に適した直線性になったら、停止します。
一般的に、任意の時間微分可能なプロセスに対して、を解くことで推定できます。
整流流では、中間軌道が直線であるという強い事前情報を注入することで、最適な輸送に関する理論的な妥当性と計算効率の両方を実現できます。直線経路を持つ常微分方程式は、時間離散化なしで正確にシミュレーションできるためです。

具体的には、整流フローは、分布からの点間の線形補間の周辺分布と常微分方程式を一致させることを目指します。そして与えられた観察結果そして、正準線形補間自明なケースが得られるこれは、これに対処するために、は、方向に関して最小二乗損失を最小化することにより、因果的にシミュレート可能な常微分方程式の空間に「投影」される。:
データペア任意の組み合わせが可能そして通常は独立(つまり、)は、以下の観測値をランダムに組み合わせることによって得られた。そしてこのプロセスにより、軌跡が密度マップを忠実に反映することが保証されます。経路はそのままだが、交差点では経路を変更して因果関係を確保する。

整流フローの特徴的な側面は、「リフロー」機能であり、これにより常微分方程式の経路の軌跡が直線化される。整流フローを次のように表す。誘発されたとしてこれを再帰的に適用する演算子は一連の整流フローを生成するこの「リフロー」プロセスは、輸送コストを削減するだけでなく、整流された流れの経路を直線化し、増加するにつれて経路はより直線的になる。
整流された流れには、線形補間による非線形拡張が含まれます。は、接続する任意の時間微分可能な曲線に置き換えられます。そしてによって与えられたこのフレームワークは、DDIMと確率フローODEを特殊なケースとして含み、特定の選択肢はそしてしかし、経路が直線でない場合、リフロープロセスは凸状の輸送コストの削減を保証せず、また、[ 42 ]
これらの線形フロー定式化は、教師あり逆問題に対して異なる視点から独立して発見され、応用されました。たとえば、直接反復による反転 (InDI) は、平均への回帰を回避するために、劣化した入力と高品質のターゲット間の線形補間を反復的に反転する残差フロー ODE を学習することによって画像復元を定式化します。InDI は、さまざまな画像復元タスクに効果的です。[ 44 ]


DDPMで画像を生成するには、時間のかかるニューラルネットワークが必要です。そしてノイズの多い画像ノイズを予測するノイズを予測することはノイズ除去後の画像を予測することと同じなので、それを差し引くと、ノイズ除去アーキテクチャは、概してうまく機能する傾向があります。たとえば、画像のノイズ除去に適していることがわかっているU-Net は、画像を生成する拡散モデルのノイズ除去によく使用されます。[ 45 ]
DDPM の場合、基盤となるアーキテクチャ (「バックボーン」) は U-Net である必要はありません。何らかの方法でノイズを予測するだけでよいのです。たとえば、拡散トランスフォーマー (DiT) は、テキスト条件付けと部分的にノイズ除去された画像が与えられた場合に、 Transformerを使用してノイズの平均と対角共分散を予測します。これは、U-Net を Transformer に置き換えた標準的な U-Net ベースのノイズ除去拡散モデルと同じです。[ 46 ]エキスパートの混合- Transformer も適用できます。[ 47 ]
DDPMは、自然な見た目の画像だけでなく、一般的なデータ分布のモデリングにも使用できます。たとえば、Human Motion Diffusion [ 48 ]は、DDPMを使用して人間の動作軌跡をモデル化します。各人間の動作軌跡は、関節の回転または位置のいずれかで表される一連のポーズです。これは、Transformerネットワークを使用して、ノイズの多い軌跡からノイズの少ない軌跡を生成します。
基本拡散モデルは、分布全体から無条件にしか画像を生成できません。例えば、ImageNetで学習した拡散モデルは、ImageNetからランダムに抽出した画像に似た画像を生成します。特定のカテゴリからのみ画像を生成するには、条件を設定し、条件付き分布からサンプリングする必要があります。どのような条件を設定するにしても、まず条件付けを浮動小数点数のベクトルに変換し、それを基盤となる拡散モデルのニューラルネットワークに入力する必要があります。ただし、条件付けをベクトルに変換する方法は自由に選択できます。
例えば、Stable Diffusion では、クロスアテンション メカニズムの形で条件付けが課せられます。ここでクエリは U-Net 内の画像の中間表現であり、キーと値の両方が条件付けベクトルです。条件付けは画像の一部にのみ選択的に適用でき、ControlNet で使用されているように、ベース モデル上で新しい種類の条件付けを微調整できます。[ 49 ]
特に単純な例として、画像修復を考えてみましょう。条件は次のとおりです。参照画像、およびインペインティングマスク。条件付けは、まずサンプリングすることによって、逆拡散プロセスの各ステップで課されます。騒々しいバージョン交換と、 どこは要素ごとの乗算を意味します。[ 50 ]クロスアテンションメカニズムのもう1つの応用例は、プロンプト間の画像編集です。[ 51 ]
条件付けは、特定のカテゴリから画像を生成することや、特定のキャプションに従って画像を生成すること(テキストから画像への変換など)に限定されません。たとえば、[ 48 ]では、人間の歩行の音声クリップ(サウンドトラックに合わせて動きを同期させることが可能)、人間の走行のビデオ、人間の動きのテキスト説明などを条件として、人間の動きを生成することが実証されています。条件付き拡散モデルが数学的にどのように定式化されるかについては、 [ 52 ]の方法論の概要を参照してください。
画像の生成には時間がかかるため、基本拡散モデルで小さな画像を生成し、他のモデルでそれを拡大するという方法を試すことができます。拡大はGAN、[ 53 ] Transformer、[ 54 ] 、またはLanczosリサンプリングなどの信号処理方法によって行うことができます。
拡散モデル自体を使用してアップスケーリングを実行できます。カスケード拡散モデルは、プログレッシブGANのスタイルで、複数の拡散モデルを順番に積み重ねます。最下層は、32x32の画像を生成する標準的な拡散モデルであり、次に、アップスケーリング用に特別にトレーニングされた拡散モデルによって画像がアップスケールされ、このプロセスが繰り返されます。[ 45 ]
より詳細には、拡散アップスケーラーは次のようにトレーニングされます。[ 45 ]
このセクションでは、注目すべき拡散モデルをいくつか集め、その構造について簡単に説明します。
OpenAIのDALL-Eシリーズは、テキスト条件付き画像拡散モデルです。
DALL-Eの最初のバージョン(2021年)は、実際には拡散モデルではありません。代わりに、自己回帰的にトークンのシーケンスを生成するTransformerアーキテクチャを使用し、それを離散VAEのデコーダによって画像に変換します。DALL-Eと同時にリリースされたCLIP分類器は、生成された画像がテキストにどれだけ近いかに応じて画像をランク付けするためにDALL-Eで使用されました。
GLIDE (2022–03) [ 55 ]は 35 億の拡散モデルであり、小規模版が公開されました。[ 5 ]その後すぐに、DALL-E 2 (2022–04) がリリースされました。[ 56 ] DALL-E 2 は、テキストから画像を生成する 35 億のカスケード拡散モデルであり、「CLIP 画像エンコーダを反転」する手法で、彼らはこれを「unCLIP」と呼んでいます。
unCLIPメソッドは、CLIP画像エンコーダ、CLIPテキストエンコーダ、画像デコーダ、および「事前」モデル(拡散モデルまたは自己回帰モデル)の4つのモデルで構成されています。トレーニング中、事前モデルはCLIP画像エンコーディングをCLIPテキストエンコーディングに変換するように学習されます。画像デコーダは、CLIP画像エンコーディングを画像に戻すように学習されます。推論中、テキストはCLIPテキストエンコーダによってベクトルに変換され、次に事前モデルによって画像エンコーディングに変換され、最後に画像デコーダによって画像に変換されます。
Sora (2024–02) は拡散トランスフォーマーモデル (DiT) です。
LTX は、 Lightricksが開発したオープンソースの人工知能ビデオ基盤モデルのファミリーで、2024 年 11 月に初めてリリースされました。[ 57 ]最新モデルの LTX-2 は、テキスト、画像、ビデオ、またはオーディオに基づいてユーザーのプロンプトに基づいてビデオを作成し、オーディオとビジュアルを統一的に生成することができます。[ 58 ] [ 59 ]これらに先立って、同社初のテキストからビデオへのモデルとして 2024 年にリリースされた LTX Video があります。
Stability AI がリリースしたStable Diffusion (2022–08) は、ノイズ除去潜在拡散モデル (8億6000万個のパラメータ)、VAE、およびテキストエンコーダで構成されています。ノイズ除去ネットワークは U-Net であり、条件付き画像生成を可能にするクロスアテンションブロックを備えています。[ 60 ] [ 23 ]
Stable Diffusion 3 (2024–03) [ 61 ]は潜在拡散モデルを UNet から Transformer モデルに変更したため、DiT です。整流フローを使用します。
Stable Video 4D (2024–07) [ 62 ]は、3D オブジェクトのビデオのための潜在拡散モデルです。
Imagen (2022) [ 63 ] [ 64 ]は、 T5-XXL 言語モデルを使用して入力テキストを埋め込みベクトルにエンコードします。これは、3 つのサブモデルを持つカスケード拡散モデルです。最初のステップでは、テキストの埋め込みベクトルを条件として、ホワイトノイズを 64×64 画像にノイズ除去します。このモデルには 2B 個のパラメータがあります。2 番目のステップでは、埋め込みを条件として、画像を 64×64→256×256 にアップスケールします。このモデルには 650M 個のパラメータがあります。3 番目のステップも同様で、256×256→1024×1024 にアップスケールします。このモデルには 400M 個のパラメータがあります。3 つのノイズ除去ネットワークはすべて U-Net です。
Muse (2023–01) [ 65 ]は拡散モデルではなく、マスクされていない画像トークンからマスクされた画像トークンを予測するようにトレーニングされたエンコーダーのみのTransformerです。
Imagen 2 (2023–12) も拡散ベースです。画像とテキストを組み合わせたプロンプトに基づいて画像を生成できます。これ以上の情報は入手できません。[ 66 ] Imagen 3 (2024–05) も同様です。これ以上の情報は入手できません。[ 67 ]
Veo (2024) は潜在拡散によって動画を生成する。拡散はテキストプロンプトと画像プロンプトの両方をエンコードするベクトルに基づいて行われる。[ 68 ]
Make-A-Video (2022) はテキストからビデオへの拡散モデルです。[ 69 ] [ 70 ]
CM3leon (2023) は拡散モデルではなく、自己回帰因果マスク型トランスフォーマーであり、 LLaMa -2とほぼ同じアーキテクチャを持つ。[ 71 ] [ 72 ]

Transfusion (2024) は、自己回帰テキスト生成とノイズ除去拡散を組み合わせた Transformer です。具体的には、テキストを自己回帰的に生成し (因果マスキングを使用)、画像トークンに対して複数回ノイズ除去を行うことで画像を生成します (全対全アテンションを使用)。[ 73 ]
Movie Gen (2024) は、潜在空間とフローマッチングによって動作する一連の拡散トランスフォーマーです。[ 74 ]
{{citation}}:|last1=一般的な名前を持っています (ヘルプ)