
人間の画像合成は、動いているか静止しているかを問わず、人間のような姿を信憑性のある、さらには写真のようにリアルに再現するために応用できる技術です[ 1 ] [ 2 ] 。この技術は2000年代初頭から実在しています。コンピュータ生成画像を使用した多くの映画では、実際の映像素材やその他のシミュレーションされた映像素材にデジタル合成された、人間のようなキャラクターの合成画像が使用されています。2010年代後半には、ディープラーニング人工知能が、トレーニング段階が完了すれば人間の助けを必要とせずに、人間のように見える画像やビデオを合成するために応用されました。一方、従来の7D方式では膨大な量の人間の作業が必要でした。

1999年、南カリフォルニア大学のポール・デベベックらは、極めてシンプルなライトステージを用いて、人間の顔の反射率を初めて捉えることに成功した。彼らはSIGGRAPH 2000でその手法と結果を発表した。[ 5 ]

科学的なブレークスルーには、油と空気の層から反射された光は偏光を保持し、油面下の光は偏光を失うという知識を利用して見つけることができる、水面下の光成分(シミュレーションモデルは内部からわずかに光っている)を見つける必要がありました。そのため、可動式の光源、可動式のビデオカメラ、2つの偏光子、そして非常に単純な計算を行うコンピュータプログラムだけを備え、フォトリアリズムを実現するために必要な最後のピースが手に入りました。[ 5 ]
信憑性のある結果を得るためには、皮膚から反射された光(BRDF)と皮膚内部の光(BTDFの特殊なケース)の両方を捉えてシミュレーションする必要があります。これらを合わせてBSDFが構成されます。
デジタル上のそっくりさん、つまり人間の写真と見間違えるほどリアルで生き生きとしたキャラクターを作成するプロセス全体は、人間の外見の柔らかな身体の動きをフォトリアリスティックにモデリング、アニメーション化、クロスマッピング、レンダリングする必要があるため、非常に複雑な作業です。
俳優と適切なアルゴリズムを用いた合成は、高性能コンピュータを使用して行われます。合成における俳優の役割は、静止画合成における人間の表情の模倣と、動画合成における人間の動きの模倣です。アルゴリズムは、物理法則と生理学法則をシミュレートし、モデルとその外観、動き、相互作用を適切にマッピングするために必要です。
合成部分では、物理/生理学に基づくモデリング(スケルトンアニメーションなど)と画像に基づくモデリングおよびレンダリングの両方がよく用いられます。両方の手法を組み合わせたハイブリッドモデルは、リアリズムと使いやすさの両面で最良の結果を示しています。モーフターゲットアニメーションは、より高度な制御を可能にすることで作業負荷を軽減します。異なる表情はモデルの変形として定義され、表情を直感的に調整できます。モーフターゲットアニメーションは、人間の介入をほとんど必要とせずに、定義された異なる表情や体のポーズ間でモデルをモーフィングさせることができます。
変位マッピングを使用することで、毛穴やしわなど、 100μm程度の微細な肌のディテールまでリアルに表現できる結果を得ることができます。
2010年代後半、NVIDIAは機械学習、より正確には敵対的生成ネットワーク(GAN)を使用して、ランダムでありながらフォトリアリスティックな人間のような肖像画を生成しました。StyleGANと名付けられたこのシステムは、画像リポジトリWebサイトFlickrの70,000枚の画像データベースでトレーニングされました。ソースコードは2019年にGitHubで公開されました。 [ 32 ]ランダムな入力からのジェネレーターネットワークの出力は、いくつかのWebサイトで公開されています。[ 33 ] [ 34 ]
同様に、2018年以降、ディープフェイク技術によりGANは俳優の顔を入れ替えることが可能になり、声を偽造する能力と組み合わせることで、GANは説得力のある偽のビデオを生成できるようになりました。[ 35 ]
主な用途は、ストックフォト、合成データセット、バーチャルシネマトグラフィー、コンピュータゲームやビデオゲーム、秘密裏の偽情報攻撃の領域に及ぶ。[ 36 ] [ 34 ]一部の顔認識AIは、トレーニング用の合成データとして他のAIによって生成された画像を使用する。[ 37 ]
さらに、いくつかの研究では、アバターが治療効果をもたらす可能性があることが示唆されています。「心理学者やカウンセラーも、恐怖症、トラウマ歴、依存症、アスペルガー症候群、または社会不安を抱えるクライアントにセラピーを提供するためにアバターを使用し始めています。」[ 38 ]自分にそっくりなデジタルアバターを見ることによって生じる強い記憶の刻印と脳の活性化効果は、ドッペルゲンガー効果と呼ばれています。[ 38 ]ドッペルゲンガー効果は、隠れた偽情報攻撃が攻撃の標的にそのように暴露されたときに癒やされる可能性があります。
音声合成は、Adobe Creative Suiteの一部となる予定のプロトタイプであるAdobe Vocoや、Google のプロトタイプであるDeepMind WaveNetが 2016 年に登場して以来、実際の人間の声の録音と完全に区別がつかなくなってきている。[ 39 ] 他人の声を盗んで操作できる能力は、明らかに倫理的な懸念を引き起こす。 [ 40 ]
2018年のニューラル情報処理システム会議(NeurIPS)で、Googleの研究者らは「話者照合からマルチ話者テキスト音声合成への転移学習」という研究を発表しました。これは、話者照合の学習をテキスト音声合成に転移させるもので、わずか5秒の音声サンプルからほぼ誰の声にも聞こえるようにすることができます(聞く)。[ 41 ]
AIトレーニング用の画像ソースは、トレーニングに使用された人々が同意していないため、プライバシーの問題を引き起こします。[ 42 ]
デジタル音声類似技術は犯罪者の手に渡り、2019年にはシマンテックの研究者が、この技術が犯罪に使用された3つの事例を把握しました。[ 43 ] [ 44 ]
これに加えて、(2016年時点で)既存の2Dビデオで顔の表情をほぼリアルタイムで偽造できる技術が説得力をもって実証されているという事実が、偽情報状況への緊張を高めている。[ 15 ]
2018年9月、Googleは「非自発的な合成ポルノ画像」を禁止リストに追加した。
この条項において、「ディープフェイク動画」とは、欺瞞の意図をもって作成され、現実には起こらなかった行為を実在の人物が行っているように見せかける動画を意味する。