
生成敵対ネットワーク(GAN )は、機械学習フレームワークの一種であり、生成型人工知能へのアプローチにおける主要なフレームワークです。この概念は、2014年6月にイアン・グッドフェローとその同僚によって最初に開発されました。[ 1 ] GANでは、2つのニューラルネットワークがゼロサムゲームの形で互いに競合し、一方のエージェントの利益はもう一方のエージェントの損失となります。
訓練セットが与えられると、この手法は訓練セットと同じ統計を持つ新しいデータを生成することを学習します。たとえば、写真で訓練されたGANは、人間の観察者にとって少なくとも表面上は本物に見える、多くの現実的な特徴を持つ新しい写真を生成できます。GANは、もともと教師なし学習のための生成モデルの一種として提案されましたが、半教師あり学習[ 2 ]、完全教師あり学習[ 3 ]、および強化学習[ 4 ]にも役立つことが証明されています。
GANの核心的なアイデアは、入力がどれほど「現実的」に見えるかを判断できる別のニューラルネットワークである識別器を介した「間接的な」トレーニングに基づいています。識別器自体も動的に更新されます。[ 5 ]これは、生成器が特定の画像との距離を最小化するようにトレーニングされるのではなく、識別器をだますようにトレーニングされることを意味します。これにより、モデルは教師なし学習を行うことができます。
オリジナルのGANは、次のゲームとして定義されます。[ 1 ]
各確率空間GANゲームを定義します。
プレイヤーはジェネレーターとディスクリミネーターの2人です。
ジェネレーターの戦略セットは確率測度の集合の上。
識別器の戦略セットはマルコフカーネルの集合である。、 どこは確率測度の集合である。
GANゲームは、目的関数がゼロサムゲームである。 ジェネレーターは目的関数を最小化することを目的とし、ディスクリミネーターは目的関数を最大化することを目的とする。
ジェネレーターのタスクは、つまり、自身の出力分布を基準分布にできるだけ近づけることです。識別器の役割は、入力が基準分布からのものであると思われる場合は1に近い値を出力し、入力が生成器分布からのものであると思われる場合は0に近い値を出力することです。
生成ネットワークは候補を生成し、識別ネットワークはそれらを評価する。[ 1 ]これにより、データ分布に基づく競争が生まれ、生成器は潜在空間から真のデータ分布へのマッピングを学習し、識別器が実際のデータと区別できない候補を生成することを目指す。識別器の目標はこれらの候補を正しく識別することだが、生成器の性能が向上するにつれて、そのタスクはより困難になり、識別器のエラー率が高くなる。[ 1 ] [ 6 ]
既知のデータセットは、識別器の初期トレーニング データとして機能します。トレーニングでは、識別器が許容できる精度に達するまで、トレーニング データセットからのサンプルを提示します。ジェネレーターは、識別器をだますことに成功したかどうかに基づいてトレーニングされます。通常、ジェネレーターは、事前定義された潜在空間(たとえば、多変量正規分布) からサンプリングされたランダムな入力でシードされます。その後、ジェネレーターによって合成された候補は、識別器によって評価されます。ジェネレーターがより良いサンプルを生成し、識別器が合成サンプルを識別するスキルが向上するように、両方のネットワークに独立したバックプロパゲーション手順が適用されます。 [ 7 ]画像生成に使用される場合、ジェネレーターは通常、逆畳み込みニューラル ネットワークであり、識別器は畳み込みニューラル ネットワークです。
GANは暗黙的な生成モデルであり、[ 8 ]これは、フローベースの生成モデルなどの代替モデルとは異なり、尤度関数を明示的にモデル化したり、特定のサンプルに対応する潜在変数を見つける手段を提供したりしないことを意味します。

WaveNetやPixelRNNのような完全に可視化された信念ネットワークや、一般的な自己回帰モデルと比較して、GANはネットワークを複数回通過させるのではなく、1回の通過で1つの完全なサンプルを生成できます。
ボルツマンマシンや線形ICAと比較して、ネットワークが使用する関数の種類に制限はありません。
ニューラルネットワークは普遍近似器であるため、GANは漸近的に一貫性があります。2026年現在、変分オートエンコーダーは普遍近似器であることが証明されています[ 10 ]。
このセクションでは、これらの手法の背後にある数学的理論の一部を説明します。
測度論に基づく現代の確率論 では、確率空間にはσ代数も必要となる。その結果、GANゲームのより厳密な定義では、以下の変更が生じる。
各確率空間GANゲームを定義します。
ジェネレーターの戦略セットは確率測度の集合測度空間において。
識別器の戦略セットはマルコフカーネル の集合である。、 どこボレルσ代数は。
測定可能性の問題は実際には発生しないため、これについてはこれ以上検討しない。
上記で説明したGANゲームの最も一般的なバージョンでは、識別器の戦略セットにはすべてのマルコフカーネルが含まれます。ジェネレーターの戦略セットには、任意の確率分布が含まれる。の上。
しかし、以下に示すように、あらゆるに対する最適な識別戦略は決定論的であるため、識別器の戦略を決定論的関数に限定しても一般性は失われない。ほとんどのアプリケーションでは、これは深層ニューラルネットワーク関数です。
発電機に関しては、理論的には任意の計算可能な確率分布になり得るが、実際には通常はプッシュフォワードとして実装される。つまり、ランダム変数から始める、 どこは計算が容易な確率分布(一様分布やガウス分布など)であり、次に関数を定義します。すると分布の分布は。
したがって、ジェネレーターの戦略は通常次のように定義されます。去る暗黙的。この形式論では、GANゲームの目的は
GANアーキテクチャには2つの主要な構成要素があります。1つは最適化をゲームに落とし込むことです。これは、通常の最適化とは異なり、もう一つは、の中へこれは、パラメータの再設定というトリックとして理解できる。
その重要性を理解するには、GANを、最大尤度推定や関連戦略で発生する「扱いにくい確率的計算」に悩まされていた従来の生成モデル学習手法と比較する必要がある。[ 1 ]
同時に、KingmaとWelling [ 11 ]およびRezendeら[ 12 ]は、再パラメータ化の同じアイデアを一般的な確率的バックプロパゲーション法に発展させた。その最初の応用例の一つが変分オートエンコーダーである。
原著論文およびその後のほとんどの論文では、通常、生成器が先に動き、識別器が後に動くと仮定されており、その結果、以下のミニマックスゲームが得られます。
生成器と識別器の戦略集合が有限個の戦略によって張られる場合、ミニマックス定理により、つまり、手番の順番は関係ない。
しかし、戦略集合はどちらも有限に張られていないため、ミニマックス定理は適用されず、「均衡」という概念は微妙なものとなる。すなわち、均衡には以下のような異なる概念が存在する。
一般的なゲームでは、これらの均衡は一致する必要はなく、存在することさえありません。オリジナルのGANゲームでは、これらの均衡はすべて存在し、すべて等しいです。しかし、より一般的なGANゲームでは、これらは必ずしも存在したり、一致したりするとは限りません。[ 13 ]
オリジナルのGAN論文では、密度ベースの最適識別器の公式とグローバルミニマックス最適解が証明されました。[ 1 ]測度論的処理では、ラドン-ニコディム微分を使用して同じバイナリ敵対的計算が得られます。[ 14 ]
定理(最適判別器はジェンセン・シャノン発散を計算する)—任意の固定生成器戦略に対して 、 させて最適な決定論的判別器となる。
ここで、導関数はラドン・ニコディム導関数であり、はジェンセン・シャノンダイバージェンスである。[ 15 ]
イェンセンの不等式によれば、
そして、もう一方の項についても同様である。端点のケースは、ジェンセンの不等式を適用することによって得られる。そしてそしてカーネル平均は測定可能なので、置き換える決定論的カーネルの平均値によって、識別器の利得を減少させることはできない。[ 15 ] [ 16 ]したがって、最適な応答は次のように記述できる。測定可能な関数の場合その場合
適切な密度関数を定義するために、基本尺度を定義します。 :=\mu _{\text{ref}}+\mu _{G}} となり、ラドン-ニコディム微分を取ることができます。
とほぼどこにでも。
次に
被積分関数は、パラメータを持つ 2 つのベルヌーイ確率変数間の負の交差エントロピーです。そして. これを次のように書くことができます。、 どこはバイナリエントロピー関数なので、
これは、識別器の最適な戦略が-ほぼどこにでも、
定型計算後。
解釈:任意の固定発電機戦略の場合最適な判別器は、参照分布と生成分布の間の尤度比を追跡します。そして、 の上、; の上、いずれの場合もほぼどこにでも。表示される比率は、-ほぼどこでも。両方の密度が正の場合、 どこはロジスティック関数です。 等事前混合モデルでは、は、観測値が参照分布から得られた事後確率の一種です。-ほぼどこにでもある。[ 15 ]
定理(均衡点)—上記で定義した制約なしGANゲームには、ペアが存在する。 これは鞍点とナッシュ均衡の両方である: [ 1 ] [ 13 ]
つまり、ジェネレータは参照信号を完全に模倣し、ディスクリミネータはそれを出力します。すべての入力に対して決定論的に。
GANゲームでは、生成器と識別器の両方が戦略セット全体にアクセスできる場合、一意のグローバル均衡点が存在するが、戦略セットが制限されている場合は均衡は保証されない。[ 13 ]
実際には、ジェネレーターは形式の尺度にしかアクセスできません、 どこは、パラメータを持つニューラルネットワークによって計算される関数です。、 そしては、一様分布や正規分布など、容易にサンプリングできる分布です。同様に、識別器は、形式の関数のみにアクセスできます。パラメータを持つニューラルネットワークによって計算される関数これらの制限された戦略セットは、戦略セット全体のごくわずかな割合を占めるにすぎない。 [ 17 ]
さらに、均衡がまだ存在するとしても、それはすべての可能なニューラルネットワーク関数の高次元空間を探索することによってのみ見つけることができます。均衡を見つけるために勾配降下法を使用する標準的な戦略は、GANではうまく機能しないことが多く、多くの場合、ゲームはいくつかの失敗モードのいずれかに「崩壊」します。収束の安定性を向上させるために、一部のトレーニング戦略では、低解像度の画像[ 18 ]や単純な画像(均一な背景を持つ1つのオブジェクト)[ 19 ]を生成するなど、より簡単なタスクから開始し、トレーニング中にタスクの難易度を徐々に上げていきます。これは基本的に、カリキュラム学習スキームを適用することに相当します。[ 20 ]
GANは、入力データからモード全体を見落とし、適切に汎化できないモード崩壊に陥ることがよくあります。たとえば、各数字のサンプルが多数含まれるMNISTデータセットでトレーニングされたGANは、数字0の画像しか生成しない可能性があります。これは「ヘルベチカシナリオ」と呼ばれています。[ 1 ]
モード崩壊の典型的なメカニズムは、ジェネレーターが可能性のある値のうち1つまたは少数しか生成しない、あるいはターゲット分布のごく一部しか生成しないことです。ディスクリミネーターは本物のサンプルと偽のサンプルを区別するようにのみ訓練されているため、生成されたサンプルを本物として正しく識別しますが、ターゲット分布の全範囲を表すデータを生成するGANの能力にはペナルティが課されません。
例えば、パラメータが不足しているものや、生成器に比べて学習速度が遅すぎるものなど、識別能力の弱いものは、分布のサポート全体にわたって完全に識別することができず、ターゲット分布のごく一部しか正しく識別できなくなる可能性がある。
一部の研究者は、根本的な問題は、省略のパターンを認識できない弱い識別ネットワークにあると考えている一方、目的関数の選択が不適切であることが原因だと考える研究者もいる。多くの解決策が提案されているが、これはまだ未解決の問題である。[ 21 ] [ 22 ]
最先端のアーキテクチャであるBigGAN(2019)でさえ、モード崩壊を避けることはできませんでした。著者らは、「モデルが十分に訓練されて良好な結果が得られるようになるトレーニングの後期段階で崩壊が発生することを許容する」という手段に頼りました。[ 23 ]
2つの時間スケール更新ルール(TTUR)は、ジェネレータの学習率をディスクリミネータの学習率よりも低くすることで、GANの収束をより安定させるために提案されています。彼らは、このように学習させた場合、GANは「緩やかな仮定の下で、定常的な局所ナッシュ均衡に収束する」ことを証明しています。[ 24 ]さらに、この特性は、確率的勾配降下で一般的に使用されるAdamオプティマイザの使用にも拡張されることを示しています。
局所的なナッシュ均衡は、モード崩壊がないことを決して意味するものではありません。例えば、MNISTで学習したGANが1桁の数字を生成するように崩壊した場合、論文の仮説を満たしつつも、モード崩壊を示している可能性があります。
逆に、識別器が生成器に比べて速く学習しすぎると、識別器はほぼ完全に区別できてしまう。。そのような場合、発電機はどちらの方向に変化しても非常に大きな損失を抱えることになるつまり、勾配がゼロに近くなるだろう。そのような場合、ジェネレーターは学習できず、勾配消失問題が発生する。[ 17 ]
直感的に言えば、識別器は優秀すぎるため、生成器は報酬を改善するために小さなステップ(勾配降下法では小さなステップしか考慮されない)を取ることができないので、そもそも改善しようとさえしない。
この問題を解決するための重要な方法の一つが、ワッサースタインGANです。
GANは通常、 Inception Score (IS)によって評価されます。ISは、ジェネレータの出力がどれだけ多様であるか(通常はInception-v3などの画像分類器によって分類される)を測定する指標です。または、Fréchet inception distance (FID) によって評価されます。FIDは、ジェネレータの出力が参照セットにどれだけ類似しているか(最終層を除いたInception-v3などの学習済み画像特徴量分類器によって分類される)を測定する指標です。画像生成のための新しいGANアーキテクチャを提案する多くの論文では、そのアーキテクチャがFIDまたはISにおいて最先端の性能をどのように向上させたかを報告しています。
別の評価方法として、学習済み知覚画像パッチ類似度(LPIPS)があり、これは学習済みの画像特徴量化器から始まります。、そして、一連のデータに対する教師あり学習によって微調整します。、 どこ画像です。これはその摂動バージョンであり、これは、被験者が報告した、両者の違いの度合いです。モデルは、それを近似できるように微調整されています。この微調整されたモデルは、定義するために使用されます。[ 25 ]
その他の評価方法については、[ 26 ]で検討されている。
GANには実に多くのバリエーションが存在する。[ 27 ]その中でも特に有名なものをいくつか挙げると以下の通りである。
条件付きGANは、追加情報に基づいて条件付きでサンプルを生成できる点を除けば、標準的なGANと似ています。例えば、犬の画像から猫の顔を生成したい場合、条件付きGANを使用できます。
GANゲームのジェネレーターは確率空間上の確率分布これは条件付きGANのアイデアにつながり、1つの確率分布を生成する代わりに、ジェネレーターは異なる確率分布を生成するの上指定された各クラスラベルについて。
例えば、ImageNetのような画像を生成する場合、ジェネレーターは「cat」というクラスラベルを与えられたときに、猫の画像を生成できる必要があります。
元の論文[ 1 ]では、GANは生成器と識別器の両方にラベルを与えることで条件付きGANに簡単に拡張できることが指摘されている。
具体的には、条件付きGANゲームとは、クラスラベルが付与されたGANゲームのことです。どこクラスに対する確率分布、は、クラスの実画像の確率分布です。、 そしてクラスラベルが与えられた場合にジェネレーターによって生成される画像の確率分布。
GANゲームは汎用的なフレームワークであり、ジェネレーターの任意の妥当なパラメータ設定で実行できます。および識別器原著論文では、著者らは多層パーセプトロンネットワークと畳み込みニューラルネットワークを用いてそれを実証した。その後、多くの代替アーキテクチャが試みられてきた。
深層畳み込みGAN(DCGAN):[ 29 ]ジェネレータとディスクリミネーターの両方で、畳み込み-逆畳み込み層のみで構成される深層ネットワーク、つまり完全畳み込みネットワークのみを使用します。[ 30 ]
自己注意GAN(SAGAN):[ 31 ] DCGANから始まり、ジェネレータとディスクリミネーターに残差接続された標準自己注意モジュールを追加します。
変分オートエンコーダーGAN(VAEGAN):[ 32 ]ジェネレーターに変分オートエンコーダー(VAE)を使用します。
Transformer GAN (TransGAN): [ 33 ]生成器と識別器の両方に純粋なトランスフォーマーアーキテクチャを使用し、畳み込み層と逆畳み込み層は一切使用しません。
Flow-GAN: [ 34 ]生成器にフローベースの生成モデルを使用し、尤度関数の効率的な計算を可能にします。
GANの多くのバリエーションは、ジェネレーターとディスクリミネーターの損失関数を変更するだけで得られる。
オリジナルGAN:
元のGANの目的関数を、比較しやすい形式に書き換えました。
オリジナルのGAN、非飽和損失:
このジェネレーターの目的は、収束を速めるために元の論文で推奨されたものです。[ 1 ]この目的の使用による効果は、Arjovsky ら[ 35 ]のセクション 2.2.2 で分析されています。
オリジナルGAN、最尤法:
どこはロジスティック関数です。識別器が最適な場合、GAN は最尤推定自体を実行できませんが、生成器の勾配は最尤推定の場合と同じです。[ 36 ] [ 37 ]
Wasserstein GANは、GANゲームを2つの点で変更しています。
その目的の一つは、モード崩壊の問題を解決することである(上記参照)。[ 17 ]著者らは「WGANアルゴリズムでは、どの実験でもモード崩壊の証拠は見られなかった」と主張している。
敵対的オートエンコーダー(AAE)[ 40 ]はGANよりもオートエンコーダーに近い。基本的なオートエンコーダーから始めて、潜在ベクトルを基準分布(多くの場合、正規分布)から識別する識別器を訓練するという考え方である。
条件付きGANでは、ジェネレーターはノイズベクトルを受け取ります。そしてラベル、そして画像を生成する識別器は画像とラベルのペアを受け取ります。、計算します。
トレーニングデータセットにラベルがない場合、条件付きGANは直接機能しません。
InfoGANの考え方は、潜在空間内のすべての潜在ベクトルは次のように分解できると宣言することです。: 非圧縮性ノイズ部分情報ラベル部分そして、発電事業者が法令を遵守するよう促し、最大限に活用するよう促す。相互情報量そして相互情報に関して何の要求もせずに間。
残念ながら、一般的に扱いが困難である。InfoGAN の重要なアイデアは変分相互情報最大化である: [ 41 ]下限を最大化することによって間接的に最大化するどこ型のすべてのマルコフカーネルの範囲。
InfoGANゲームは次のように定義されます。[ 42 ]
InfoGANゲームは、3つの確率空間によって定義されます。
- 参照画像の空間。
- 固定ランダムノイズ発生器。
- 固定乱数情報生成器。
2つのチームに分かれた3人のプレイヤー(ジェネレーター、Q、ディスクリミネーター)がいる。ジェネレーターとQは一方のチームに、ディスクリミネーターはもう一方のチームに所属する。
目的関数はどこはオリジナルのGANゲームの目的であり、
ジェネレーターQチームは目的関数を最小化することを目指し、ディスクリミネーターは目的関数を最大化することを目指します。
標準GANジェネレーターは、次のタイプの関数です。つまり、それは潜在空間からのマッピングである。画像空間へこれは「デコード」プロセスと理解でき、すべての潜在ベクトルが画像のコードですそして、ジェネレーターがデコードを実行します。これは自然に、「エンコード」を実行する別のネットワークをトレーニングするというアイデアにつながり、エンコーダーとジェネレーターのペアからオートエンコーダーを作成します。
既に原著論文[ 1 ]において、著者らは「補助ネットワークを訓練して予測することで、学習による近似推論を実行できる」と述べている。与えられた双方向GANアーキテクチャはまさにこれを実現します。[ 43 ]
BiGANは以下のように定義されます。
BiGANゲームは2つの確率空間によって定義される。
- 参照画像の空間。
- 潜在空間。
2つのチームに分かれた3人のプレイヤー(ジェネレーター、エンコーダー、ディスクリミネーター)がいる。ジェネレーターとエンコーダーは一方のチームに、ディスクリミネーターはもう一方のチームに所属する。
ジェネレーターの戦略は関数ですエンコーダの戦略は関数である識別器の戦略は関数である。
目的関数は
ジェネレーター・エンコーダーチームは目的関数を最小化することを目指し、ディスクリミネーターは目的関数を最大化することを目指す。
論文の中で、彼らは目的をより抽象的に次のように定義した。どこ確率分布は押して得られた転送、 そして確率分布は押して得られた転送。
双方向モデルの応用例としては、半教師あり学習[ 44 ] 、解釈可能な機械学習[ 45 ]、ニューラル機械翻訳[ 46 ]などがある。
CycleGANは、馬の写真とシマウマの写真、あるいは夜の街の写真と昼間の街の写真など、2つのドメイン間で変換を行うためのアーキテクチャです。
CycleGANゲームは次のように定義されます。[ 47 ]
確率空間は2つあるこれは、前後方向の翻訳に必要な2つのドメインに対応しています。
2チームに4人のプレイヤーがいます:ジェネレーター、そして差別者。
目的関数は
どこは正の調整可能なパラメータです。GANゲームの目的は、サイクル一貫性損失とは:ジェネレーターは目的関数を最小化することを目的とし、ディスクリプターは目的関数を最大化することを目的とする。
pix2pix [ 48 ]のような従来の研究とは異なり、cycleGAN はペアのトレーニングデータを必要としません。たとえば、pix2pix モデルをトレーニングして夏の風景写真を冬の風景写真に変換し、また元に戻すには、データセットには同じ場所で夏と冬に同じ角度で撮影されたペアの写真が含まれている必要があります。cycleGAN は、夏の風景写真のセットと、それとは無関係な冬の風景写真のセットだけを必要とします。
BigGANは基本的に、大規模(最大8000万パラメータ)にトレーニングされた自己注意GANであり、ImageNetの大きな画像(最大512 x 512解像度)を生成するために、収束させるための多くのエンジニアリングの工夫が施されています。[ 23 ] [ 49 ]
トレーニングデータが不十分な場合、参照分布訓練データセットによって与えられる経験分布では、十分に近似できない。このような場合、データ拡張を適用することで、より小さなデータセットでGANを訓練することが可能になる。しかし、単純なデータ拡張には問題点がある。
オリジナルのGANゲームを、以下のように若干修正したものを考えてみましょう。ここでは、意味を保持する変換をランダムにサンプリングすることによってデータ拡張を行います。そして、それらをデータセットに適用して、再定式化されたGANゲームを取得します。これは、分布が異なるGANゲームに相当する。サンプリング元、 と例えば、ImageNetにおける画像の分布は、サンプルは確率0.5で恒等変換され、確率0.5で水平反射され、これは、ImageNetと水平反転ImageNetにおける画像の分布を組み合わせたものです。
このようなトレーニングの結果、次のようなジェネレーターが生成される。例えば、データ拡張でランダムな切り抜き処理を用いる場合、ランダムに切り抜かれたように見える画像が生成される。
解決策は、生成された画像と実際の画像の両方にデータ拡張を適用することです。著者らは、わずか100枚の画像からなるデータセットを用いて高品質な生成を実現した。[ 50 ]
StyleGAN-2-ADA 論文では、データ拡張に関するもう 1 つの点が指摘されています。それは、可逆でなければならないということです。[ 51 ] ImageNet 画像を生成する例を続けて見てみましょう。データ拡張が「画像を 0、90、180、270 度ずつ等しい確率でランダムに回転させる」場合、ジェネレーターはどれが真の向きであるかを知る方法がありません。2 つのジェネレーターを考えてみましょう。任意の潜在的生成された画像90度回転両者の予想損失額は全く同じであるため、どちらも他方より優れているとは言えません。
解決策は、可逆的なデータ拡張のみを使用することです。「画像を0度、90度、180度、270度それぞれ等しい確率でランダムに回転させる」代わりに、「画像を90度、180度、270度それぞれ0.1の確率でランダムに回転させ、0.7の確率で画像をそのままにする」ようにします。こうすることで、ジェネレーターは、拡張されていないImageNet画像と同じ向きの画像を維持するように報酬を得ることができます。
抽象的に言えば、ランダムサンプリング変換の効果分布からマルコフカーネルを定義するそして、データ拡張GANゲームはジェネレーターにいくつかのものを見つけるように促します。、したがってどこはマルコフカーネル畳み込みです。データ拡張法は、そのマルコフカーネルが可逆である場合に可逆であると定義されます。満たす定義からすぐにわかるように、複数の可逆データ拡張手法を組み合わせると、また別の可逆手法が得られます。また定義から、データ拡張手法が可逆であれば、それをGANゲームで使用しても最適な戦略は変わりません。発電機はまだ。
可逆マルコフ核の典型的な例が2つあります。
離散ケース:可逆確率行列の場合有限である。
例えば、これは4つの方向を指す矢印の4つの画像のセットであり、データ拡張は「確率で画像を90度、180度、270度ランダムに回転させる」ことです。確率的に画像をそのままにしておく、そしてマルコフカーネル確率行列として表現できる。そして可逆カーネルであるのは、は可逆行列である、つまり、。
連続ケース:ガウスカーネルは、一部の人にとって。
例えば、は256x256ピクセルの画像空間であり、データ拡張方法は「ガウスノイズを生成する」である。追加画像へ」、そしてこれは密度関数による畳み込みですこれは可逆です。なぜなら、ガウス関数による畳み込みは熱カーネルによる畳み込みに等しいからです。したがって、任意の畳み込み分布加熱することで得られる正確にはそして、時間を待つそれによって回復できる熱方程式を時間的に逆方向に実行することで。
可逆データ拡張のその他の例は、論文中に記載されている。[ 51 ]
SinGANは、単一の画像のみを学習データとして使用し、その画像に対してデータ拡張を行うことで、データ拡張の限界を押し広げています。GANアーキテクチャは、マルチスケールパイプラインを使用することで、この学習方法に適応しています。
発電機生成器のピラミッドに分解される最も低いものが画像を生成する最低解像度で生成された画像は、そして次のレベルに送られ、画像が生成される。より高い解像度で、など。識別器もピラミッドに分解されます。[ 52 ]
StyleGANファミリーは、 NVIDIAの研究部門が発表した一連のアーキテクチャです。
Progressive GAN [ 18 ]は、GAN ジェネレータをピラミッド状に小規模から大規模へと成長させることで、大規模画像生成のための GAN を安定的にトレーニングする方法です。SinGAN と同様に、ジェネレータを次のように分解します。、そして識別器として。
トレーニング中は、最初はGANゲームで4x4画像を生成するために使用されます。GANゲームの第2段階に到達して8x8画像を生成するために追加され、1024x1024画像を生成するGANゲームに到達するまで続きます。
GANゲームのステージ間のショックを避けるため、各新しいレイヤーは「ブレンド」されます(論文[ 18 ]の図2 )。たとえば、第2ステージのGANゲームは次のように始まります。

StyleGAN-1は、プログレッシブGANとニューラルスタイル転送を組み合わせたものとして設計されています。[ 53 ]
StyleGAN-1の重要なアーキテクチャ上の選択は、Progressive GANと同様の漸進的成長メカニズムです。生成される各画像は定数から始まります。配列は、スタイルブロックを介して繰り返し渡されます。各スタイルブロックは、ニューラルスタイル転送がグラミアン行列を使用するのと同様に、アフィン変換(「適応型インスタンス正規化」)を介して「スタイル潜在ベクトル」を適用します。次に、ノイズを追加し、正規化(平均を減算し、分散で割る)します。
トレーニング時には、通常、生成される画像ごとに1つのスタイル潜在ベクトルのみが使用されますが、各スタイルブロックが他のスタイルブロックからの助けを期待せずに(まったく異なるスタイル潜在ベクトルを受け取る可能性があるため)、独立してスタイル化を実行するように促すために、2つ使用される場合もあります(「混合正則化」)。
学習後、複数のスタイル潜在ベクトルを各スタイルブロックに入力できます。下位層に入力されたベクトルは大規模なスタイルを制御し、上位層に入力されたベクトルは細かいディテールのスタイルを制御します。
2つの画像間でスタイルをミックスするも同様に実行できます。まず、勾配降下法を実行して、そのためこれは「イメージをスタイル潜在空間に投影する」と呼ばれます。次に、下位スタイルのブロックに供給することができ、より上位のスタイルブロックに、大規模なスタイルを持つ合成画像を生成する、そして細部までこだわったスタイル複数の画像をこの方法で合成することも可能です。
StyleGAN-2は、スタイル潜在ベクトルを使用して畳み込み層の重みを変換することでStyleGAN-1を改良し、「ブロブ」問題を解決しています。[ 54 ]
これは、上記のように可逆的なデータ拡張を使用する StyleGAN-2-ADA (「ADA」は「adaptive」の略) [ 51 ]によって更新されました。また、適用されるデータ拡張の量をゼロから始めて徐々に増やし、「過学習ヒューリスティック」が目標レベルに達するまで調整するため、「adaptive」という名前が付けられています。
StyleGAN-3 [ 55 ]は、公式ビデオ[ 56 ]で見られる「テクスチャの付着」問題を解決することで、StyleGAN-2 を改良しています。彼らはナイキスト・シャノン標本化定理によってこの問題を分析し、ジェネレーターのレイヤーが、操作対象のピクセルの高周波信号を利用することを学習したと主張しました。
この問題を解決するため、各ジェネレーターのレイヤー間に厳密なローパスフィルターを課すことを提案した。これにより、ジェネレーターはピクセルを単なる離散信号として扱うのではなく、それらが表す連続信号に忠実な方法でピクセルを処理するように強制される。さらに、より多くの信号フィルターを使用することで、回転および並進不変性を課した。その結果、StyleGAN-3はテクスチャの付着問題を解決し、滑らかに回転および並進する画像を生成できるようになった。
GANは、データの生成モデルや識別モデル以外にも、様々な用途で利用されている。
GANは、深層強化学習のように、潜在特徴空間のアライメントを強制するための転移学習に使用されてきました。[ 57 ]これは、ソースタスクとターゲットタスクの埋め込みを識別器に入力し、識別器がコンテキストを推測することで機能します。結果として得られた損失は、エンコーダーを通して(逆方向に)バックプロパゲーションされます。
医療画像における主要な懸念事項の1つは、患者のプライバシーを保護することです。これらの理由から、研究者は研究目的のために医療画像を取得する際に困難に直面することがよくあります。GANは、この課題に対処するために、 MRIやPET画像などの合成医療画像を生成するために使用されてきました。[ 76 ]
GANは緑内障画像を検出するために使用でき、早期診断に役立ち、部分的または完全な視力喪失を回避するために不可欠です。[ 77 ]
GANは、亡くなった歴史上の人物の法医学的な顔の復元を作成するために使用されてきました。[ 78 ]


GANベースの人間の画像合成が、偽の、場合によっては罪を問われるような写真やビデオを作成するなど、悪意のある目的で使用される可能性について懸念が提起されている。[ 79 ] GANは、存在しない人物のユニークでリアルなプロフィール写真を生成するために使用でき、偽のソーシャルメディアプロフィールの作成を自動化することができる。[ 80 ]
2019年、カリフォルニア州は、人物の同意なしに偽のポルノを作成するために人間の画像合成技術を使用することを禁止する法案AB-602と、選挙の60日以内に政治候補者の加工されたビデオを配布することを禁止する法案AB-730を検討し、2019年10月3日に可決した[81]。両法案は、州議会議員マーク・バーマンによって起草され、ギャビン・ニューサム知事によって署名された。これらの法律は2020年に施行された[ 82 ] 。
DARPAのメディアフォレンジックプログラムは、GANを使用して生成された偽メディアを含む、偽メディアに対抗する方法を研究しています。[ 83 ]
GANはアート作品の生成にも使用できます。The Vergeは2019年3月に「GANによって生成された画像は、現代AIアートの決定的な外観となっている」と書いています。[ 84 ] GANはまた、
GANを「創造的敵対ネットワーク」として芸術的創造性に利用して研究した人もいる。[ 90 ] [ 91 ] 14世紀から19世紀にかけてのWikiArtの15,000枚の肖像画のセットで訓練されたGANは、2018年にエドモン・ド・ベラミーの絵画を作成し、 432,500米ドルで売却された。[ 92 ]
GANは、ビデオゲームの改造コミュニティによって、古いビデオゲームの低解像度2Dテクスチャを画像トレーニングによって4K以上の解像度で再作成し、その後ゲームのネイティブ解像度に合うようにダウンサンプリングすることで、高解像度化するために使用されました(スーパーサンプリングアンチエイリアシングに似ています)。[ 93 ]
2020年、Artbreederは心理ウェブホラーシリーズ「Ben Drowned」の続編で主要な敵役を作成するために使用されました。著者は後に、予算と人員が不足している独立系アーティストのためにアセットを生成する能力を持つGANアプリケーションを称賛しました。[ 94 ] [ 95 ]
2020年5月、Nvidiaの研究者たちは、パックマンのプレイを見るだけでゲームを再現するようにAIシステム(「GameGAN」と呼ばれる)を訓練した。 [ 96 ] [ 97 ]
2019年8月、歌詞とメロディーのペアを含む12,197曲のMIDIソングからなる大規模なデータセットが、条件付きGAN-LSTMを使用して歌詞からニューラルメロディーを生成するために作成されました(GitHub AI Melody Generation from Lyricsのソースを参照)。[ 98 ]
GANは、
1991年、ユルゲン・シュミットフーバーは「人工好奇心」、ゼロサムゲームにおけるニューラルネットワークを発表した。[ 110 ]最初のネットワークは、出力パターンの確率分布をモデル化する生成モデルである。2番目のネットワークは、勾配降下法によって、これらのパターンに対する環境の反応を予測することを学習する。GANは、最初のネットワークの出力が特定のセットに含まれているかどうかに応じて、環境の反応が1または0になるケースと見なすことができる。[ 111 ]
他の人も同様のアイデアを持っていたが、同じようには発展させなかった。敵対的ネットワークに関するアイデアは、Olli Niemitalo が 2010 年にブログ記事で発表した。[ 112 ]このアイデアは実装されることはなく、ジェネレーターに確率性が含まれていなかったため、生成モデルではなかった。GAN に似たアイデアは、Wei Li、Melvin Gauci、Roderich Gross が 2013 年に動物の行動をモデル化するために使用した。[ 113 ]
GANのもう一つの着想源はノイズコントラスト推定[ 114 ]で、これはGANと同じ損失関数を使用し、グッドフェローは2010年から2014年の博士課程でこれを研究した。
敵対的機械学習は生成モデル以外にも用途があり、ニューラルネットワーク以外のモデルにも適用できます。制御理論では、ニューラルネットワークに基づく敵対的学習が2006年に、最小化ポリシー(コントローラ)と最大化ポリシー(外乱)の反復を交互に行うことで、ゲーム理論的な意味でロバストコントローラを訓練するために使用されました。[ 115 ] [ 116 ]
2017年にGANがピクセル精度よりもリアルなテクスチャに焦点を当てた画像強調に使用され、高倍率でより高い画像品質が生成された。[ 117 ] 2017年に最初の顔が生成された。[ 118 ]これらは2018年2月にグラン・パレで展示された。[ 119 ] [ 120 ] 2019年にStyleGAN [ 121 ]によって生成された顔はディープフェイクと比較された。[ 122 ] [ 123 ] [ 124 ]
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite web}}: CS1 maint: 数値名: 著者リスト (リンク)