
人間画像合成は、動いているか静止しているかにかかわらず、人間に似せた真実味のある、さらには写真のようにリアルな表現[1] [2]を作成するために適用できる技術です。この技術は、2000 年代初頭から事実上存在していました。コンピューター生成画像を使用する多くの映画では、実際の映画素材やその他のシミュレーションされた映画素材にデジタル合成された、人間のようなキャラクターの合成画像が使われてきました。2010 年代の終わり頃には、ディープラーニング 人工知能が適用され、トレーニング フェーズが完了すると、人間の助けを必要とせずに、人間のように見える画像やビデオを合成できるようになりました。一方、旧式の 7D ルートでは、膨大な量の人間の作業が必要でした。
人間の画像合成のタイムライン
- 1971年、 アンリ・グローは初めてCG ジオメトリ をキャプチャし、人間の顔を表現しました。モデリングは彼の妻シルヴィ・グローが担当しました。3Dモデルはシンプルなワイヤーフレームモデルで、彼は最もよく知られているグローシェーダーを適用し、コンピューター上で初めて人間らしさを表現しました(画像を参照)。[3]
- エドウィン・キャットマルとフレッド・パークによる1972 年の短編映画「A Computer Animated Hand」は、動く人間の姿をシミュレートするためにコンピューター生成画像が映画で使用された初めての作品です。この映画では、コンピューターでシミュレートされた手と顔が登場します (ここで映画を視聴できます)。
- 1976 年の映画「フューチャーワールド」では、「コンピューターアニメーションハンド」の一部が大画面で再利用されました。
- ドイツのバンド、クラフトヴェルクの曲「Musique Non-Stop」の1983年の ミュージックビデオは1986年に放送されました。アーティストのレベッカ・アレンによって制作されたこのビデオは、非現実的ではあるものの、バンドのメンバーをはっきりと認識できるコンピューターシミュレーションを特徴としています。
- 1994年の映画『ザ・クロウ』は、ボディダブルを使って撮影したシーンにコンピューターシミュレーションによる顔のデジタル合成を採用した最初の映画作品でした。主人公を演じた俳優ブランドン・リーが舞台上で事故死するという悲劇的な出来事があったため、必要に迫られて制作されました。
- 1999年 にUSCのポール・デベベックらは、ライトステージの最初のバージョンで人間の顔の反射フィールドを撮影しました。彼らはその方法をSIGGRAPH 2000で発表しました[4]
- 2003 年 、映画「マトリックス リローデッド」で、最大 100 人のエージェント スミスがネオと戦う激しい乱闘シーンや、「マトリックス レボリューションズ」で、デジタルのそっくりさんが初めて観客に登場しました。最後の対決の冒頭で、エージェント スミスの頬骨がネオに殴られ、デジタルのそっくりさんが不自然に無傷のままになるシーンです。マトリックス レボリューションズのボーナス DVD では、このプロセスの詳細と、顔のモーション キャプチャや輪部モーション キャプチャ、モデルへの投影など、使用されたテクニックが記録され、説明されています。
- 2003年、 スクウェア・ピクチャーズが制作した『アニマトリックス ファイナル・フライト』は、最先端の人間そっくりの人形だが、観客を騙すには十分ではなかった。
- 2003年、ソニー・ピクチャーズ・イメージワークスにより映画『スパイダーマン2』と『スパイダーマン3』のためにトビー・マグワイアのデジタル肖像が制作された。[5]
- 2005年に、Face of the Futureプロジェクトが設立されました。[6]セントアンドリュース大学とPerception Labが、 EPSRCの資金提供を受けました。[7]このウェブサイトには「Face Transformer」が含まれており、ユーザーは自分の顔をあらゆる民族や年齢に変換できるほか、自分の顔を絵画(サンドロ・ボッティチェリまたはアメデオ・モディリアーニのスタイル)に変換することもできます。[8]このプロセスは、ユーザーの写真と平均的な顔を組み合わせることで実現されます。[7]
- 2009年にデベベックらは、Image Metrics社製の新しいデジタル肖像画を発表しました。今回は、USCライトステージ5で反射をキャプチャした女優エミリー・オブライエンです。[9]アニメーターがフォトリアリズムを意図していたとすれば、2003年当時の最先端技術であった『アニマトリックス ファイナルフライト』のぎこちない動きと比べると、動きはかなり説得力があります。
- 2009年、映画「ターミネーター4」のために、若い頃のアーノルド・シュワルツェネッガーのデジタルそっくりさんが作られたが、最終結果は説得力に欠けると批判された。顔の形状は、1984年のシュワルツェネッガーの型から取得された。
- 2010年 、ウォルト・ディズニー・ピクチャーズは、俳優ジェフ・ブリッジスのデジタルリメイク版そっくりさんが敵役のCLUを演じた『トロン:レガシー』というタイトルのSF続編を公開した。
- SIGGGRAPH 2013 で、ActivisionとUSCは、USCのICT研究科学者であるAri Shapiroのデジタル顔そっくりのリアルタイム「Digital Ira」を発表しました[10] 。これは、反射フィールドとモーションキャプチャの両方にGhoshらによるUSCライトステージXを使用しています[11] 。最終結果は、ここに示されている最新のゲームGPUを使用して事前計算とリアルタイムレンダリングの両方が行われ、かなりリアルに見えます。
- 2014年にUSCクリエイティブテクノロジー研究所がスミソニアン協会と共同で制作した大統領肖像画は、USCの最新の移動式照明ステージを使用して制作され、その中でバラク・オバマ大統領の形状、質感、反射が捉えられました。[12]
- 2014年 にイアン・グッドフェローらが敵対的生成ネットワークの原理を発表しました。GANは2018年初頭のディープフェイク論争で注目を集めました。
- 2015年の映画『ワイルド・スピード SKY MISSION』では、撮影中に事故で亡くなった俳優ポール・ウォーカーのデジタルそっくりさんが、映画を完成させるためにWETAデジタルによって制作された。 [13]
- 2016年には、既存の2Dビデオ内の顔の表情をほぼリアルタイムで 偽造できる技術が信憑性をもって実証されました。[14]
- 2016年、映画『ローグ・ワン』のためにピーター・カッシングのデジタルそっくりさんが作られ、その外見は1977年のオリジナル映画『スター・ウォーズ』の撮影時の俳優と同じ年齢に見えるようになった。
- SIGGRAPH 2017では、ワシントン大学の研究者らが、バラク・オバマ上半身の音声駆動型デジタルそっくりさんを発表しました。(画像) 音声付き2D動画からなるトレーニング素材からリップシンクとより広範な顔情報を取得するトレーニング段階が完了した後、アニメーションのソースデータとして音声トラックのみで駆動されました。 [15]
- 2017年後半[16]から2018年初頭にかけて、ディープフェイク論争が表面化した。ディープフェイクでは、ポルノビデオがディープラーニングを使用して改ざんされ、女優の顔が、同じポーズと照明で別の人物の顔がどのように見えるかについてのソフトウェアの意見に置き換えられた。
- 2018年の ゲーム開発者会議 で、Epic GamesとTencent Gamesは、女優の江冰傑のデジタルそっくりさん「Siren」を披露した。これは、CubicMotionのコンピュータービジョンシステム、3Lateralのフェイシャルリギングシステム、Viconのモーションキャプチャーシステムという技術によって実現された。このデモは、 Unreal Engine 4で毎秒60フレームのほぼリアルタイムで実行された。[17]
- 2018年に烏鎮で開催された世界インターネット会議で、新華社は、同社の本物のニュースキャスターである邱昊(中国語)[18]と張照(英語)に似せて作られた2人のデジタルそっくりさんを発表しました。デジタルそっくりさんは捜狗[19]と共同で作られました。使用された音声合成もデジタルそっくりさんキャスターの身振りも、視聴者をテレビカメラで撮影された本物の人間と間違えるほどには優れていませんでした。
- 2018年9月、Googleは「不本意な合成ポルノ画像」を禁止リストに追加し、誰でも検索エンジンに「ヌードまたは性的に露骨な状況」であると誤って描写する結果をブロックするよう要求できるようになりました。[20]
- 2019年 2月、Nvidiaは 新しい生成的敵対的ネットワークであるStyleGANをオープンソース化しました 。[21]その直後、Phillip WangはStyleGANを使用してThisPersonDoesNotExist.comというウェブサイトを作成し、GANを使用して、無名の人物の顔写真を無制限に自動的に作成できることを実証しました。 [22] NvidiaのStyleGANは、2018年後半にまだ査読されていない論文で発表されました。 [22 ]
- 2019 年 6 月のCVPRで、 MIT CSAIL は「Speech2Face: 声の裏にある顔を学習」というタイトルのシステムを発表しました。これは、音声の録音だけに基づいて、可能性のある顔を 合成するものです。このシステムは、人々が話している大量のビデオでトレーニングされました。
- 2019年7月1日以降[23]、 バージニア州は許可されていない合成ポルノの販売および頒布を 犯罪としていますが、製造は犯罪としていません。[24] §18.2–386.2の「他人の画像の違法な頒布または販売。罰則」がバージニア州法の一部となったためです。法律の条文には、「強制、嫌がらせ、または脅迫の意図を持って、いかなる手段によっても作成された、完全に裸の、または性器、陰部、臀部、または女性の乳房を露出するような衣服を脱いだ状態の他人を描写したビデオグラフィックまたは静止画像を悪意を持って頒布または販売する者は、そのようなビデオグラフィックまたは静止画像を頒布または販売するライセンスまたは許可を受けていないことを知っている、または知る理由がある場合、クラス1の軽罪で有罪となります。 」と記載されています。 [24]同一の法案は、 2019年1月14日にマーカス・サイモン議員が バージニア州下院に提出した下院法案2678号であり、3日後にはアダム・エビン上院議員が同一の上院法案1736号をバージニア州上院に提出した。
- 2019年 9月1日以降、テキサス州上院法案SB751による選挙法の改正が発効し、選挙の候補者には30日間の選挙保護期間が与えられ、その期間中に候補者のデジタル類似画像や合成偽画像の作成および配布は違法となる。法律文では、この法律の対象を「欺く目的で作成された、現実には起こっていない行動を実際の人物が行っているように見える動画」と定義している[25]。
- 2019年 9月、フィンランドの公共放送局Yleは、進化する偽情報技術とそこから生じる問題を強調する目的で、実験的なジャーナリズムの成果として、現職のサウリ・ニーニスト大統領のディープフェイクを主要ニュース番組で放送した。
- 2020年1月1日[26]カリフォルニア州では、被写体の同意を得ずに合成ポルノを製造・配布することを禁止する州法AB-602が施行された。AB-602は合成ポルノの被害者に差止命令による救済を与え、同意を得ずに合成ポルノを製造・配布した犯罪者には法定損害賠償と懲罰的損害賠償の法的脅威を与える。法案AB-602はカリフォルニア州知事ギャビン・ニューサムによって2019年10月3日に署名され、カリフォルニア州議会議員マーク・バーマンが起草した。[27]
- 2020年1月1日、合成フェイク映像には偽物であることを明記しなければならないという中国の法律が施行された。中国サイバースペース管理局はウェブサイトで、これに従わない場合は犯罪とみなされる可能性があると述べている。中国は2019年11月にこの新法を発表した。[28]中国政府は、ルールを遵守しないユーザーとオンライン動画プラットフォームの両方を起訴する権利を留保しているようだ。 [29] 11月12日 [ディープフェイク]
フォトリアリズムへの重要なブレークスルー:反射率のキャプチャ

1999年にUSCのポール・デベベックらは、非常にシンプルな照明ステージを使って、人間の顔の反射率を初めて撮影しました。彼らはその方法と結果をSIGGRAPH 2000で発表しました。[4]

科学的なブレークスルーには、油層から反射された光は偏光を維持し、地表下の光は偏光を失うという知識を使って見つけることができる地表下の光成分(シミュレーションモデルはわずかに内部から輝いている)を見つけることが必要だった。そのため、可動式の光源、可動式のビデオカメラ、2つの偏光子、および非常に単純な計算を行うコンピュータプログラムのみを備え、フォトリアリズムに到達するために必要な最後のピースが得られた。[4]
信頼できる結果を得るには、BSDF を構成する皮膚からの反射光 ( BRDF ) と皮膚内の光 ( BTDFの特殊なケース ) の両方をキャプチャしてシミュレートする必要があります。
キャプチャ
- 3Dジオメトリとテクスチャは、 Arius3d やCyberwareなどの RGB XYZ スキャナーを使用した 3D スキャンによるターゲットのサンプリング (写真からのテクスチャ、純粋な RGB XYZ スキャナーでは ありません)、同期された写真からのステレオ写真測量法、または十分に繰り返された非同時写真からのステレオ写真測量法などの3D 再構築方法によって 3D モデルにキャプチャされます。デジタル スカルプティングを使用すると、衣服で覆われた体の部分など、データを取得できない体の部分のモデルを作成できます。
- 信頼できる結果を得るには、反射率フィールドをキャプチャするか、ライブラリから近似値を選択して、ターゲットの 7D 反射率モデルを形成する必要があります。
合成
デジタルのそっくりさん、つまり、人間の絵と見間違うほどに生き生きとリアルなキャラクターを作成するプロセス全体は、人間の外見のソフトボディダイナミクスをフォトリアリスティックにモデリング、アニメーション化、クロスマッピング、レンダリングする必要があるため、非常に複雑な作業です。
俳優と適切なアルゴリズムによる合成は、強力なコンピューターを使用して適用されます。合成における俳優の役割は、静止画合成では人間の表情を、動画合成では人間の動きを模倣することです。アルゴリズムは、物理法則と生理学の法則をシミュレートし、それに応じてモデルとその外観、動き、相互作用をマッピングするため に必要です。
多くの場合、合成部分では、物理/生理学ベース (つまり、スケルトン アニメーション) と画像ベースのモデリングとレンダリングの両方が採用されています。両方のアプローチを採用したハイブリッド モデルは、リアリズムと使いやすさの点で最良の結果を示しています。モーフ ターゲット アニメーションは、より高度な制御を提供することで作業負荷を軽減します。ここでは、さまざまな顔の表情がモデルの変形として定義され、その顔によって表情を直感的に調整できます。その後、モーフ ターゲット アニメーションは、人間の介入をほとんど必要とせずに、定義されたさまざまな顔の表情や体のポーズの間でモデルをモーフィングできます。
ディスプレイスメント マッピングを使用すると、100 μmほどの小さな毛穴やしわなどの肌の細部までリアルに表現できます。
機械学習アプローチ
2010年代後半、機械学習、より正確には生成的敵対的ネットワーク(GAN)は、ランダムでありながら写実的な人間のような肖像画を生成するためにNVIDIAによって使用されました。StyleGANと名付けられたこのシステムは、画像保管ウェブサイトFlickrの70,000枚の画像のデータベースでトレーニングされました。ソースコードは2019年にGitHubで公開されました。 [30]ランダム入力からのジェネレーターネットワークの出力は、いくつかのウェブサイトで公開されました。[31] [32]
同様に、2018年以降、ディープフェイク技術によりGANは俳優の顔を交換できるようになり、声を偽造する機能と組み合わせることで、説得力のある偽の動画を生成できるようになりました。[33]
アプリケーション
主な用途は、ストックフォト、合成データセット、仮想映画撮影、コンピュータゲームやビデオゲーム、秘密の 偽情報 攻撃の領域にあります。[34] [32]一部の顔認識AIは、他のAIによって生成された画像をトレーニング用の合成データとして使用します。 [35]
さらに、ある研究では、アバターには治療効果があると示唆されており、「心理学者やカウンセラーも、恐怖症、トラウマ歴、依存症、アスペルガー症候群、社会不安障害のある患者にセラピーを提供するためにアバターを使い始めている」[36] 。自分自身に似たデジタルアバターを見ることで生じる強い記憶の刻印と脳の活性化効果は、ドッペルゲンガー効果と呼ばれている。[36]ドッペルゲンガー効果は、秘密裏に行われた偽情報攻撃が、攻撃対象者にそのままさらされると治癒する可能性がある。
関連する問題
音声合成は、2016年にAdobe Creative Suiteの一部となる予定の音声編集・生成ソフトウェアAdobe VocoとGoogleのプロトタイプDeepMind WaveNetが導入されて以来、実際の人間の声の録音と完全に区別がつかなくなってきている。[37] 他人の声を盗んだり操作したりする能力は、明らかに倫理的な懸念を引き起こす。 [38]
2018年の神経情報処理システム会議(NeurIPS)で、Googleの研究者は「話者検証からマルチスピーカーテキスト音声合成への学習の転移」という研究を発表しました。これは、話者検証から学習を転移してテキスト音声合成を実現するもので、わずか5秒間の音声サンプルからほぼ誰にでも聞こえるようにすることができます(聞いてください)。[39]
AIトレーニング用の画像の調達は、トレーニングに使用される人々が同意していないため、プライバシーの問題を引き起こします。[40]
デジタル類似音声技術は犯罪者の手に渡り、2019年にシマンテックの研究者は、この技術が犯罪に使用された事例を3件把握している。[41] [42]
これに加えて、(2016年現在)既存の2Dビデオで顔の表情をほぼリアルタイムで 偽造できる技術が信憑性を持って実証されているという事実も相まって、偽情報の状況に対するストレスが高まっています。[14]
参照
- モーションキャプチャー演技
- インターネット操作
- メディア合成
- プロパガンダの手法
- 3Dデータの取得とオブジェクトの再構築
- 複数の画像からの3D再構築
- 一般的な3D ポーズ推定と、特に人間の肖像を捉えることに関係する関節体のポーズ推定。
- 4D再構築
- 指の追跡
- ジェスチャー認識
- スタイルGAN
参考文献
- ^ IEEE Exploreの口の形状制御のための物理ベースの筋肉モデル(メンバーシップが必要)
- ^ IEEE Exploreの仮想空間テレビ会議におけるリアルな 3D 顔アニメーション(メンバーシップが必要)
- ^ "画像の合成 : グーローの眺めを注ぐ長い時間". 2008 年 9 月 14 日。
- ^ abc Debevec, Paul (2000). 「人間の顔の反射フィールドの取得」。第 27 回コンピュータ グラフィックスおよびインタラクティブ技術に関する年次会議 - SIGGRAPH '00 の議事録。ACM。pp. 145–156。doi :10.1145/ 344779.344855。ISBN 978-1581132083. S2CID 2860203 . 2017年5月24日閲覧。
- ^ Pighin, Frédéric. 「Siggraph 2005 Digital Face Cloning Course Notes」(PDF) . 2017年5月24日閲覧。
- ^ 「セント・アンドリュース・フェイス・トランスフォーマー」。Futility Closet 2005年1月30日。 2020年12月7日閲覧。
- ^ ab West, Marc (2007年12月4日). 「科学の顔を変える」. Plus Magazine . 2020年12月7日閲覧。
- ^ ゴダード、ジョン(2010年1月27日)。「人種研究のさまざまな側面」thestar.com 。 2020年12月7日閲覧。
- ^ このTEDトーク動画の00:04:59で2つのクリップを見ることができます。1つは本物のカメラで撮影された本物のエミリーで、もう1つはカメラのシミュレーションで撮影されたエミリーのデジタルそっくりさんです。どちらがどちらかは分かりません。ブルース・ローマンはUSCライトステージ6を使用して静止状態でスキャンされ、トレッドミルで走っているところも録画されました。TEDトーク動画の最後のシーケンスを見ると、ブルースのデジタルそっくりさんが何人も流暢に自然に走っているのが見られます。
- ^ ReForm – ハリウッドのデジタルクローンの作成 (youtube). クリエイタープロジェクト. 2017年5月24日.
- ^ Debevec, Paul. 「Digital Ira SIGGRAPH 2013 Real-Time Live」。2015年2月21日時点のオリジナルよりアーカイブ。2017年5月24日閲覧。
- ^ 「バラク・オバマ大統領の3D肖像画をスキャンして印刷」南カリフォルニア大学。2013年。2015年9月17日時点のオリジナルよりアーカイブ。2017年5月24日閲覧。
- ^ ジャルディーナ、キャロリン(2015年3月25日)。「『ワイルド・スピード SKY MISSION』とピーター・ジャクソンのWETAがデジタル・ポール・ウォーカーを制作した方法」ハリウッド・レポーター。 2017年5月24日閲覧。
- ^ ab Thies, Justus (2016). 「Face2Face: リアルタイムの顔キャプチャとRGBビデオの再現」 Proc. Computer Vision and Pattern Recognition (CVPR)、IEEE 。2017年5月24日閲覧。
- ^ Suwajanakorn, Supasorn; Seitz, Steven; Kemelmacher-Shlizerman, Ira (2017)、Synthesizing Obama: Learning Lip Sync from Audio、ワシントン大学、 2018年3月2日閲覧
- ^ Roettgers, Janko (2018年2月21日). 「ポルノプロデューサーがハリウッドのディープフェイク動画削除に協力を申し出る」バラエティ。 2018年2月28日閲覧。
- ^ Takahashi, Dean (2018年3月21日). 「Epic GamesがSirenデモで驚異的なリアルタイムデジタルヒューマンを披露」VentureBeat . 2018年9月10日閲覧。
- ^ Kuo, Lily (2018年11月9日). 「世界初のAIニュースキャスターが中国で発表」TheGuardian.com . 2018年11月9日閲覧。
- ^ Hamilton, Isobel Asher (2018年11月9日). 「中国が初のAIニュースキャスターを開発したと主張 — 動作中の映像はこちら」. Business Insider . 2018年11月9日閲覧。
- ^ ハーウェル、ドリュー(2018年12月30日)。「フェイクポルノ動画は女性への嫌がらせや屈辱を与えるために利用されている。『誰もが潜在的なターゲット』」ワシントンポスト。 2019年3月14日閲覧。
[2018年]9月、Googleは「不本意な合成ポルノ画像」を禁止リストに追加しました。
- ^ 「NVIDIA がハイパーリアルな顔生成ツール StyleGAN をオープンソース化」Medium.com 2019 年 2 月 9 日。2019年10 月 3 日閲覧。
- ^ ab Paez, Danny (2019年2月13日). 「This Person Does Not Exist は2019年のベストワンオフウェブサイトです」。Inverse 。 2018年3月5日閲覧。
- ^ 「新しい州法は7月1日に発効します」。2019年6月24日。
- ^ ab 「§ 18.2–386.2. 他人の画像の違法な配布または販売; 罰則」バージニア州。 2020年1月1日閲覧。
- ^ 「選挙結果に影響を与える目的で欺瞞的なビデオを捏造した犯罪行為の作成に関するもの」テキサス州。2019年6月14日。 2020年1月2日閲覧。
このセクションでは、「ディープフェイクビデオ」とは、欺く目的で作成されたビデオで、実在の人物が実際には起こっていない行動をしているように見えるビデオを指します。
- ^ Johnson, RJ (2019年12月30日). 「2020年に施行されるカリフォルニア州の新法はこちら」KFI . iHeartMedia . 2020年1月1日閲覧。
- ^ミハルシック、キャリー(2019年10月4日)。「カリフォルニア州法、政治やポルノにおける ディープフェイクの取り締まりを目指す」cnet.com。CNET。2019年10月14日閲覧。
- ^ 「中国、新たなオンラインコンテンツ規則でフェイクニュースとディープフェイクの根絶を目指す」Reuters.com .ロイター. 2019年11月29日. 2019年12月8日閲覧。
- ^ Statt, Nick (2019年11月29日). 「中国、ディープフェイクやフェイクニュースを開示せずに公開することは犯罪となる」The Verge . 2019年12月8日閲覧。
- ^ Synced (2019年2月9日). 「NVIDIAがハイパーリアルな顔ジェネレーターStyleGANをオープンソース化」. Synced . 2020年8月4日閲覧。
- ^ StyleGAN 公開ショーケース ウェブサイト
- ^ ab Porter, Jon (2019年9月20日). 「10万枚の無料AI生成ヘッドショットがストックフォト会社に警告」The Verge . 2020年8月7日閲覧。
- ^ 「ディープフェイクとは何か?」PCMAG.com 2020年3月2020年6月8日閲覧。
- ^ ハーウェル、ドリュー。「出会い系アプリには女性が必要。広告主には多様性が必要。AI企業が解決策を提案:偽の人物」ワシントンポスト。 2020年8月4日閲覧。
- ^ 「ニューラルネットワークは学習するためにデータを必要とする。たとえそれが偽物であっても」Quanta Magazine 2023年12月11日。 2023年6月18日閲覧。
- ^ ab マーフィー、サマンサ (2023). 「サイエンティフィック・アメリカン:あなたのアバター、あなたのガイド」(.pdf)。サイエンティフィック・アメリカン / スタンフォード大学。 2023年12月11日閲覧。
- ^ 「WaveNet: 生のオーディオを生成するモデル」Deepmind.com 2016年9月8日。2017年5月27日時点のオリジナルよりアーカイブ。2017年5月24日閲覧。
- ^ 「Adobe Voco '音声版Photoshop' が懸念される」BBC.com . BBC . 2016年11月7日. 2016年7月5日閲覧。
- ^ Jia, Ye; Zhang, Yu; Weiss, Ron J. (2018 年 6 月 12 日)、「話者検証からマルチスピーカー テキスト音声合成への転移学習」、Advances in Neural Information Processing Systems、31 : 4485–4495、arXiv : 1806.04558、Bibcode :2018arXiv180604558J
- ^ レイチェル・メッツ(2019年4月19日)。「あなたの画像がオンラインにある場合、それは顔認識AIのトレーニングになっている可能性があります」。CNN 。 2020年8月4日閲覧。
- ^ 「偽の音声がサイバー犯罪者の現金窃盗に役立つ」。bbc.com。BBC。2019年7月8日。 2020年4月16日閲覧。
- ^ ドリュー・ハーウェル(2020年4月16日)。「人工知能初:音声模倣ソフトウェアが大規模窃盗に使用されたと報じられる」ワシントンポスト。 2019年9月8日閲覧。
