カテゴリー 音声ディープフェイクは、以下の3つの異なるカテゴリに分類できます。
合成ベース 合成ベースのアプローチ図 音声合成 に基づくカテゴリは、ソフトウェアまたはハードウェアシステムプログラムを使用して人間の音声を人工的に生成することを指します。音声合成には、テキストをリアルタイムで許容可能で自然な音声に変換することを目的としたテキスト音声合成が含まれます。[ 13 ] テキストの言語記述の規則を使用して、音声をテキスト入力に一致させます。
この種の古典的なシステムは、テキスト分析モデル、音響モデル、ボコーダーの 3つのモジュールで構成されています。音声生成は通常、2つの重要なステップに従う必要があります。まず、元の音声文の書き起こしテキストとともに、クリーンで構造化された生の音声データを収集する必要があります。次に、これらのデータを使用してテキスト音声合成モデルをトレーニングし、合成音声生成モデルを構築する必要があります。
具体的には、対象話者の音声が書き起こされたテキストが生成モデルへの入力となります。テキスト分析モジュールは入力テキストを処理し、言語的特徴に変換します。次に、音響モジュールはテキスト分析モジュールによって生成された言語的特徴に基づいて、音声データから対象話者のパラメータを抽出します。[ 14 ] 最後に、ボコーダーは音響的特徴のパラメータに基づいて音声波形を生成することを学習します。最終的な音声ファイルが生成され、波形形式の合成シミュレーション音声が含まれ、トレーニングされていない話者も含め、多くの話者の声の音声が生成されます。
この点における最初のブレークスルーは、WaveNet [ 15 ] によって導入されました。これは、さまざまな話者の特性を模倣できる生の音声波形 を生成するニューラルネットワークです。このネットワークは、長年にわたって、誰もが利用できる非常にリアルな人工音声を合成する他のシステム [ 16 ] [ 17 ] [ 18 ] [ 19 ] [ 20 ] [ 21 ] に追い抜かれました。[ 22 ]
テキスト音声合成は、システムを実現するために使用される音声コーパスの品質に大きく依存しており、音声コーパス全体を作成するにはコストがかかります。また、音声合成システムはピリオドや特殊文字を認識しないという欠点もあります。さらに、同じように書かれた2つの単語が異なる意味を持つ可能性があるため、曖昧さの問題も依然として存在します。
模倣に基づく 模倣に基づくアプローチの図 模倣に基づくオーディオディープフェイクは、ある話者(オリジナル)の元の音声を、別の話者(ターゲット)が話しているように聞こえるように変換する方法です。[ 23 ] 模倣に基づくアルゴリズムは、音声信号を入力として受け取り、スタイル、イントネーション、またはプロソディを変更することによってそれを変更し、言語情報を変更せずにターゲットの声を模倣しようとします。[ 24 ] この技術は音声変換としても知られています。
この方法は、生成プロセスに関して2つのアプローチの間に明確な区別がないため、以前の合成ベースの方法と混同されることが多い。実際、どちらの方法も音声信号の音響スペクトル特性とスタイル特性を変更するが、模倣ベースの方法では通常、入力テキストと出力テキストは変更されない。これは、この文の話し方をターゲット話者の特徴に合わせることで実現される。[ 25 ]
音声は、元の話者と似た声を持つ人間を使って模倣するなど、いくつかの方法で模倣できます。近年、最も普及しているアプローチは、柔軟性と高品質な結果から、生成敵対ネットワーク(GAN)と呼ばれる特定のニューラルネットワークを使用することです。 [ 8 ] [ 23 ]
次に、元の音声信号を、新しい音声を生成する模倣生成方法を使用して、ターゲット音声のスピーチに変換します。この偽のスピーチが、偽のスピーチとして示されています。
検出方法 音声ディープフェイク検出タスクは、与えられた音声が本物か偽物かを判定する。
近年、これは法医学 研究コミュニティにおいて、偽造技術の急速な進化に対応しようとする動きの中で、大きな注目を集めているトピックとなっている。
一般的に、ディープフェイク検出手法は、検出タスクを実行するために利用する側面に基づいて、2つのカテゴリに分類できます。1つ目は、サンプルレベルでジェネレーターによって導入されたアーティファクトを探す低レベルの側面に焦点を当てます。一方、2つ目は、音声録音の意味内容など、より複雑な側面を表す高レベルの特徴に焦点を当てます。
汎用的な音声ディープフェイク検出フレームワーク 偽音声検出のために、さまざまな戦略を用いた機械学習 モデルが数多く開発されてきた。これらのアルゴリズムは、ほとんどの場合、次の3つのステップに従う。
各音声録音は、前処理を行い、適切な音声特徴量に変換する必要があります。 計算された特徴量は検出モデルに入力され、そこで訓練プロセスなどの必要な処理が実行され、本物の音声と偽の音声を区別するために不可欠な処理が行われます。 出力は最終モジュールに入力され、偽物 クラスか本物 クラスの予測確率が生成されます。ASVspoof [ 26 ] チャレンジの命名法に従い、偽物の音声は「Spoof」 という用語で示され、本物の音声は「Bonafide」と呼ばれます。 長年にわたり、多くの研究者が、使用する特徴量に関わらず、機械学習アプローチは深層学習手法よりも正確であることを示してきました。[ 14 ] しかし、特に多数の音声ファイルの場合、過剰なトレーニングと手動による特徴抽出のため、機械学習手法のスケーラビリティは確認されていません。その代わりに、深層学習アルゴリズムを使用する場合は、アルゴリズムが音声ファイルを処理できるように、音声ファイルに特定の変換が必要になります。
ほとんどの検出研究は英語のディープフェイクに焦点を当てています。中国語やスペイン語など、最も話されている言語に関する研究は限られています。ヒンディー語やアラビア語も研究が不十分です。主に英語でトレーニングされた検出モデルは、英語以外の音声でテストするとパフォーマンスが低下します。アクセントのバリエーションも検出精度に影響します。特定の地域や集団に関連する異なる発音は、モデルが合成音声をどれだけうまく識別できるかに影響します。[ 27 ]
さまざまな検出方法のオープンソース実装がいくつかあり、[ 28 ] [ 29 ] [ 30 ] 通常、多くの研究グループがGitHub のような公開ホスティングサービスでそれらを公開しています。
懸念事項と対策 音声ディープフェイク技術の普及に伴い、詐欺 や偽情報 キャンペーンでの使用が懸念されている。[ 3 ] [ 31 ] 人々はこれを論理アクセス 音声なりすまし 技術として利用することができ、[ 32 ] 宣伝、中傷、テロの ために世論を操作するために使用できる。インターネット上では毎日膨大な量の音声録音が送信されており、なりすましの検出は困難である。[ 10 ] 音声ディープフェイク攻撃者は、政治家や政府を含む個人や組織を標的にしている。[ 33 ]
2019年には、AI を使用した詐欺師がドイツのエネルギー会社の CEO の声を真似て、その英国子会社の CEO に 22 万 ユーロ を送金するように指示した。[ 34 ] 2020 年初頭には、同じ手法で会社の取締役を装い、支店長を騙して 3500 万ドルを送金させた。[ 35 ]
2023年のMcAfeeの グローバル調査によると、10人に1人がAI音声クローン詐欺の標的になったと報告しており、これらの標的の77%が詐欺で金銭を失ったと報告している。[ 36 ] [ 37 ] 音声ディープフェイクは、金融機関が現在使用している音声ID システムにも危険をもたらす可能性がある。 [ 38 ] [ 39 ] 2023年3月、米国連邦取引委員会は、 困窮している家族の声を偽装して金銭を要求するAIの使用について消費者に警告を発した。[ 40 ]
2023年10月、リバプールで開催された英国 労働党 大会の開始時に、労働党党首キア・スターマー の音声ディープフェイクが公開され、彼がスタッフを言葉で罵倒し、リバプールを批判しているように偽って描写された。[ 41 ] 同じ月、スロバキアの政治家ミハル・シメチカ の音声ディープフェイクが、彼が今後の選挙を不正操作する方法について話し合っていると偽って主張した。[ 42 ]
2024年のニューハンプシャー州民主党大統領予備選挙 のキャンペーン中、2万人以上の有権者が、AIがジョー・バイデン 大統領になりすました自動音声電話を受け、投票しないように促された。[ 43 ] [ 44 ] ニューハンプシャー州司法長官は、これは州の選挙法に違反しているとし、ライフ・コーポレーションとリンゴ・テレコムが関与していると主張した。[ 45 ] 2024年2月、米国連邦通信委員会 は、自動音声電話でAIを使って声を偽装することを禁止した。[ 46 ] [ 47 ] 同じ月、政治コンサルタントのスティーブ・クレイマーは、500ドルで電話を依頼したことを認めた。彼は、政治キャンペーンでのAIの使用を規制する規則の必要性に注目を集めたかったと述べた。[ 48 ] 5月、FCCは、クレイマーが地元の政治家の番号を偽装することで連邦法に違反したと述べ、600万ドルの罰金を提案した。ニューハンプシャー州の4つの郡は、クレイマーを重罪である有権者抑圧と軽犯罪である候補者なりすましの罪で起訴した。[ 49 ]
2024年、YouTuberの ジェフ・ギーリングは 、電子機器メーカーのElecrowによって自分の声が無断で複製されていることに気づき注目を集めた[ 50 ] [ 51 ] 。同社はその後謝罪し、問題のコンテンツを削除した[ 52 ] 。ギーリングの経験は、2025年にリリースされたYouTubeの類似性検出技術で対処されるべき事例として挙げられた[ 53 ] [ 54 ]。
2023年2月、調査会社Graphikaは、国家と連携する主体が政治的な偽情報のためにAI生成のニュースキャスターを使用した最初の既知の事例を記録した。中国のプロパガンダネットワークSpamouflageは、Synthesia AIソフトウェアを使用して「Alex」と「Anna」という2人の架空のニュースキャスターを作成した。ディープフェイクのキャスターは、2022年後半からFacebook、Twitter、YouTubeに投稿された動画に登場した。動画は親中国的な主張を宣伝し、米国を批判した。この作戦には、AIソフトウェアのサブスクリプションに月額約30ドルかかった。検出指標には、ロボットのような話し方、口パクのずれ、動画の字幕の文法ミスなどがあった。[ 55 ]
未解決の課題と今後の研究の方向性 音声ディープフェイクは、ごく最近になって研究が始まった分野です。そのため、開発や改良の可能性は数多く存在する一方で、この技術の導入が私たちの日常生活にもたらす可能性のある脅威も数多く存在します。以下に、最も重要な脅威を挙げます。
2023年の音声ディープフェイク検出に関する包括的な調査では、検出システムはさまざまな生成方法や音響条件にわたって一般化することに大きな課題を抱えていることがわかった。[ 27 ]
ディープフェイク世代 生成に関して最も重要な側面は、被害者の信憑性、つまり音声ディープフェイクの知覚品質である。
音声ディープフェイク生成の精度レベルを決定する指標はいくつかあり、最も広く使用されているのは平均意見スコア (MOS)で、これはユーザー評価の算術平均です。通常、評価対象となるテストには、異なる音声生成アルゴリズムによって作成された文の知覚評価が含まれます。この指標は、単一の話者でトレーニングされたアルゴリズムによって生成された音声のMOSが高いことを示しています。[ 25 ] [ 15 ] [ 56 ] [ 57 ] [ 20 ]
サンプリングレートも、音声ディープフェイクの検出と生成において重要な役割を果たします。現在利用可能なデータセットのサンプリングレート は約 16 kHz であり、音声品質を著しく低下させています。サンプリングレートを上げると、より高品質な生成につながる可能性があります。[ 18 ]
2020年3月、マサチューセッツ工科大学の研究者が、 15.aiという Webアプリケーション を通じてデータ効率の良い音声ディープフェイク生成を実証しました。これは、わずか15秒のトレーニングデータを使用して高品質の音声を生成できるもので、以前のシステムでは数十時間かかっていたのと比較すると非常に効率的です。[ 58 ] [ 59][60 ] この システム は 、スピーカー埋め込みによって複数の音声を同時にトレーニングできる統一されたマルチスピーカーモデルを実装しており、個々の音声に特定の感情的文脈の例がなくても、モデルが異なる音声間で共有されるパターンを学習できるようにしています。[ 61 ] このプラットフォームは、感情表現のためにDeepMoji による感情分析を統合し、 ARPABET 音声転写 による正確な発音制御をサポートしています。[ 62 ] 15秒のデータ効率ベンチマークは、後に2024年にOpenAIによって検証されました。 [ 63 ]
ディープフェイク検出 検出部分に焦点を当てると、最近のモデルに影響を与える主な弱点の1つは、採用されている言語である。
ほとんどの研究は英語の音声ディープフェイクの検出に焦点を当てており、中国語やスペイン語[ 64 ] 、ヒンディー語やアラビア語など、最も話されている言語にはあまり注意を払っていません。
また、特定の個人、場所、または国に厳密に関連付けられた発音方法を表すさまざまなアクセントに関連するより多くの要素を考慮することも不可欠です。話者認識 などの他のオーディオ分野では、アクセントがパフォーマンスに大きく影響することがわかっているため[ 65 ] 、この特徴は、この検出タスクでもモデルのパフォーマンスに影響を与える可能性があると予想されます。
さらに、音声データの過剰な前処理は、非常に高い、そしてしばしば持続不可能な計算コストにつながっています。このため、多くの研究者は、ラベルなしデータを処理して検出タスクで効果的に機能し、モデルのスケーラビリティを向上させると同時に計算コストを削減する自己教師あり学習アプローチを採用することを提案 し て い ます[66]。さらに、未知のなりすまし攻撃に対処する上で重要な要素は、モデルをより広範囲の音響的変動にさらし、未知の攻撃条件への汎化能力を高める効果的なデータ拡張戦略の使用にあります[ 67 ] 。
実際の音声データを用いたモデルの学習とテストは、まだ発展途上の分野である。実際、現実世界の背景雑音を含む音声を使用することで、偽音声検出モデルの堅牢性を高めることができる。
さらに、ほとんどの取り組みは合成音声ディープフェイクの検出に集中しており、模倣ベースのディープフェイクは生成プロセスが本質的に難しいため、分析している研究はほとんどありません。[ 10 ]
ディープフェイク対策 近年、音声ディープフェイクが引き起こす可能性のある悪意のある行為、例えば個人情報の窃盗や国家元首の演説の改ざんなどから身を守るための技術が増加している。
ディープフェイクを防ぐために、ブロックチェーンやその他の分散型台帳 技術(DLT)を使用してデータの出所を特定し、情報を追跡することを提案する人もいる。[ 14 ] [ 68 ] [ 69 ] [ 70 ]
デジタルコンテンツから知覚された感情に対応する情動の手がかりを抽出して比較することも、ディープフェイクに対抗するために提案されている。[ 71 ] [ 72 ] [ 73 ]
もう1つの重要な側面は、この問題の軽減に関するものです。独自の検出ツールは、ジャーナリストのファクトチェッカーなど、必要とする人だけに提供するのが望ましいという提案があります。[ 8 ] そうすれば、悪意のある目的で生成モデルを作成する人は、ディープフェイクの検出を容易にする特徴を正確に知ることができないため、[ 8 ] 攻撃者を思いとどまらせることができます。
代わりに検出を改善するために、研究者たちはプロセスを一般化しようとしており、[ 74 ] パフォーマンスを向上させる前処理技術を探したり、トレーニングに使用されるさまざまな損失関数をテストしたりしています。[ 32 ] [ 75 ]
2023年1月、中国はディープフェイクコンテンツに明確なラベル表示を義務付ける規制を施行した。この規則は、ディープ合成技術を使用して偽ニュースを作成または拡散することを禁じている。サービスプロバイダーはユーザーの身元を確認し、コンテンツログを保持しなければならない。この規制は、ディープフェイク技術を特に対象とした最初の包括的な政府枠組みの1つである。[ 76 ]
研究プログラム 世界中の数多くの研究グループが、メディア操作、すなわち音声ディープフェイクだけでなく、画像や動画のディープフェイクの検出に取り組んでいる。これらのプロジェクトは通常、公的または民間の資金援助を受けており、大学や研究機関と密接な連携を取っている。
この目的のために、国防高等研究計画局 (DARPA) はセマンティックフォレンジック (SemaFor) を運営しています。[ 77 ] [ 78 ] また、DARPA のメディアフォレンジック (MediFor) [ 79 ] [ 80 ] プログラムの研究の一部を活用し、これらのセマンティック検出アルゴリズムは、メディアオブジェクトが生成されたか操作されたかを判断し、メディアの出所分析を自動化し、さまざまなコンテンツの偽造の背後にある意図を明らかにする必要があります。[ 81 ] [ 77 ]
もう一つの研究プログラムは、イタリア教育・大学・研究省(MIUR)が資金提供し、イタリアの5つの大学が運営する人工知能時代のメディアの信頼性維持(PREMIER) [ 82 ] プログラムです。PREMIERは、より解釈しやすく安全なフォレンジック検出器を得るための新しいハイブリッドアプローチを追求します。[ 83 ]
DEEP-VOICE [ 84 ] は、検索ベース音声変換 (RVC) と呼ばれるプロセスを通じて、音声がニューラルネットワークによって生成されたかどうかを検出するシステムを開発するための研究目的で公開されているデータセットです。予備研究では、人間の音声に見られる特徴と人工知能アルゴリズムによって生成された音声の特徴との間に、統計的に有意な違いが多数あることが示されました。
公的な課題 ここ数年、音声ディープフェイク研究の分野をさらに発展させるために、数多くのコンテストが開催されてきた。
世界で最も有名なチャレンジは、ASVspoof [ 26 ] 、つまり自動話者検証スプーフィングと対策チャレンジです。このチャレンジは、スプーフィングの検討と対策の開発を促進することを目的とした、コミュニティ主導の隔年開催の取り組みです。[ 85 ]
最近のもう一つの課題は、ADD [ 86 ] —Audio Deepfake Detection—であり、これはより現実的なシナリオにおける偽の状況を考慮している。[ 87 ]
また、音声変換チャレンジ[ 88 ] は、同じ音声データを使用してさまざまな音声変換システムとアプローチを比較する必要性から作成された、2年に1回のチャレンジです。
参考文献 ↑ スミス、ハンナ、マンステッド、キャサリン(2020年4月1日)。兵器化されたディープフェイク:国家安全保障と民主主義 。第 28巻。オーストラリア戦略政策研究所。11 ~ 13ページ。ISSN 2209-9689。 ↑ Lyu, Siwei (2020). "ディープフェイク検出:現状の課題と今後の展望". 2020 IEEE International Conference on Multimedia & Expo Workshops (ICMEW) . pp. 1–6 . arXiv : 2003.09234 . doi : 10.1109/icmew46912.2020.9105991 . ISBN 978-1-7281-1485-9 . S2CID 214605906 . 1 2 Diakopoulos, Nicholas; Johnson, Deborah (2020年6月) 「選挙におけるディープフェイクの倫理的影響の予測と対処」 . New Media & Society . 23 (7) (2020年6月5日公開): 2072–2098 . doi : 10.1177/1461444820925811 . ISSN 1461-4448 . S2CID 226196422 . ↑ マーフィー、マルギ(2024年2月20日)。 「ディープフェイクオーディオブームが10億ドル規模のスタートアップのAIを悪用」 。ブルームバーグ。 ↑ Chadha, Anupama; Kumar, Vaibhav; Kashyap, Sonu; Gupta, Mayank (2021), "Deepfake: An Overview" , in Singh, Pradeep Kumar; Wierzchoń, Sławomir T.; Tanwar, Sudeep; Ganzha, Maria (eds.), Proceedings of Second International Conference on Computing, Communications, and Cyber-Security , Lecture Notes in Networks and Systems, vol. 203, Singapore: Springer Singapore, pp. 557–566 , doi : 10.1007/978-981-16-0733-2_39 , ISBN 978-981-16-0732-5 S2CID 236666289、取得日 :2022年6月29日 ↑ 「AIがヴァル・キルマーの声を取り戻した。しかし批評家たちは、この技術が悪用される可能性を懸念している」 。ワシントン・ポスト。ISSN 0190-8286 。 2022 年 6 月29日 閲覧 。 ↑ エティエンヌ、ヴァネッサ(2021年8月19日)。 「ヴァル・キルマー、喉頭がんとの闘病後、AI技術を使って声を取り戻す:その結果を聞いてみよう」 。PEOPLE.com 。 2022 年7月1日 閲覧 。 1 2 3 4 5 Khanjani, Zahra; Watson, Gabrielle; Janeja, Vandana P. (2021-11-28). "偽造はどれほど深いのか?音声ディープフェイクに焦点を当てて:調査". arXiv : 2111.14203 [ cs.SD ]. ↑ Pradhan, Swadhin; Sun, Wei; Baig, Ghufran; Qiu, Lili (2019-09-09). "音声アシスタントに対するリプレイ攻撃への対策" . Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies . 3 (3): 100:1–100:26. doi : 10.1145/3351258 . S2CID 202159551 . 1 2 3 バレステロス、ドーラ M.ロドリゲス=オルテガ、ヨハンナ。レンザ、ディエゴ。アルセ、ゴンサロ(2021-12-01)。 「Deep4SNet: 偽音声分類のための深層学習」 。 アプリケーションを備えたエキスパート システム 。 184 115465.doi : 10.1016/ j.eswa.2021.115465 。 ISSN 0957-4174 。 S2CID 237659479 。 ↑ Villalba, Jesus; Lleida, Eduardo (2011). 「話者認証システムに対するリプレイ攻撃の防止」. 2011 Carnahan Conference on Security Technology . pp. 1–8 . doi : 10.1109/CCST.2011.6095943 . ISBN 978-1-4577-0903-6 . S2CID 17048213 . ↑ Tom, Francis; Jain, Mohit; Dey, Prasenjit (2018-09-02). "End-To-End Audio Replay Attack Detection Using Deep Convolutional Networks with Attention" . Interspeech 2018. ISCA: 681–685 . doi : 10.21437/Interspeech.2018-2279 . S2CID 52187155 . ↑ Tan, Xu; Qin, Tao; Soong, Frank; Liu, Tie-Yan (2021-07-23). "A Survey on Neural Speech Synthesis". arXiv : 2106.15561 [ eess.AS ]. 1 2 3 Almutairi, Zaynab; Elgibreen, Hebah (2022-05-04). "最新の音声ディープフェイク検出方法のレビュー: 課題と今後の方向性" . Algorithms . 15 (5): 155. doi : 10.3390/a15050155 . ISSN 1999-4893 . 1 2 オード、アーロン・ヴァン・デン。ディーレマン、サンダー。禅、ヘイガ。シモニャン、カレン。ビニャール、オリオール。グレイブス、アレックス。カルクブレンナー、ナル。先輩、アンドリュー。コライ州カヴクチュオール (2016-09-19)。 「WaveNet: 生オーディオの生成モデル」。 arXiv : 1609.03499 [ cs.SD ]。 ↑ クチャイエフ、オレクシィ。リー、ジェイソン。グエン、フエン。フリンチュク、オレクシー。リアリー、ライアン。ギンズバーグ、ボリス。クリマン、サミュエル。ベリャエフ、スタニスラフ。ラヴルキン、ヴィタリー。クック、ジャック。キャストングアイ、パトリス (2019-09-13)。 「NeMo: ニューラル モジュールを使用して AI アプリケーションを構築するためのツールキット」。 arXiv : 1909.09577 [ cs.LG ]。 ↑ Wang, Yuxuan; Skerry-Ryan, RJ; Stanton, Daisy; Wu, Yonghui; Weiss, Ron J.; Jaitly, Navdeep; Yang, Zongheng; Xiao, Ying; Chen, Zhifeng; Bengio, Samy; Le, Quoc (2017-04-06). "Tacotron: Towards End-to-End Speech Synthesis". arXiv : 1703.10135 [ cs.CL ]. 1 2 Prenger, Ryan; Valle, Rafael; Catanzaro, Bryan (2018-10-30). "WaveGlow: 音声合成のためのフローベースの生成ネットワーク". arXiv : 1811.00002 [ cs.SD ]. ↑ Vasquez, Sean; Lewis, Mike (2019-06-04). "MelNet: 周波数領域における音声の生成モデル". arXiv : 1906.01083 [ eess.AS ]. 1 2 Ping, Wei; Peng, Kainan; Gibiansky, Andrew; Arik, Sercan O.; Kannan, Ajay; Narang, Sharan; Raiman, Jonathan; Miller, John (2018-02-22). "Deep Voice 3: Scaling Text-to-Speech with Convolutional Sequence Learning". arXiv : 1710.07654 [ cs.SD ]. ↑ レン、イー。ルアン、ヤンジュン。タン、シュウ。秦、タオ。趙、盛。趙、周。劉鉄燕(2019-11-20)。 「FastSpeech: 高速、堅牢、制御可能なテキスト読み上げ」。 arXiv : 1905.09263 [ cs.CL ]。 ↑ 寧、宜荘。彼、シェン。呉智勇。シン、チュンシャオ。張良傑(2019年1月)。 「深層学習ベースの音声合成のレビュー」 。 応用科学 。 9 (19): 4050. 土井 : 10.3390/app9194050 。 ISSN 2076-3417 。 1 2 Rodríguez-Ortega, Yohanna; Ballesteros, Dora María; Renza, Diego (2020). "偽音声検出のための機械学習モデル" . In Florez, Hector; Misra, Sanjay (eds.). Applied Informatics . Communications in Computer and Information Science. Vol. 1277. Cham: Springer International Publishing. pp. 3– 13. doi : 10.1007/978-3-030-61702-8_1 . ISBN 978-3-030-61702-8 . S2CID 226283369 . ↑ Zhang, Mingyang; Wang, Xin; Fang, Fuming; Li, Haizhou; Yamagishi, Junichi (2019-04-07). "マルチソースTacotronとWaveNetを使用したテキスト音声変換と音声変換のための共同トレーニングフレームワーク". arXiv : 1903.12389 [ eess.AS ]. 1 2 Sercan, Ö Arık; Jitong, Chen; Kainan, Peng; Wei, Ping; Yanqi, Zhou (2018). "Neural Voice Cloning with a Few Samples" . Advances in Neural Information Processing Systems (NeurIPS 2018) . 31 (published 12 October 2018): 10040– 10050. arXiv : 1802.06006 . 1 2 "| ASVspoof" . www.asvspoof.org . 2022-07-01 に取得. 1 2 イー、江堰。タオ、建華。バイ、イェ。田自強。ファン・チュアネン (2023)。 「音声ディープフェイクの検出: 調査」。 arXiv : 2308.14970 [ cs.SD ]。 ↑ resemble-ai/Resemblyzer 、Resemble AI、2022年6月30日、 2022年7月1日 取得 ↑ mendaxfz (2022-06-28), Synthetic-Voice-Detection 、 2022-07-01取得 ↑ HUA, Guang (2022-06-29), End-to-End Synthetic Speech Detection , 2022-07-01取得 ↑ Caramancion, Kevin Matthe (2022年6月). 「ポッドキャストで配信される音声形式の誤情報/偽情報の調査:Spotifyの事例研究」. 2022 IEEE International IOT, Electronics and Mechatronics Conference (IEMTRONICS) . pp. 1–6 . doi : 10.1109/IEMTRONICS55184.2022.9795760 . ISBN 978-1-6654-8684-2 . S2CID 249903722 . 1 2 Chen, Tianxiang; Kumar, Avrosh; Nagarsheth, Parav; Sivaraman, Ganesh; Khoury, Elie (2020-11-01). "音声ディープフェイク検出の一般化" . The Speaker and Language Recognition Workshop (Odyssey 2020) . ISCA: 132– 137. doi : 10.21437/Odyssey.2020-19 . S2CID 219492826 . ↑ Suwajanakorn, Supasorn; Seitz, Steven M.; Kemelmacher-Shlizerman, Ira (2017-07-20). "Synthesizing Obama: learning lip sync from audio" . ACM Transactions on Graphics . 36 (4): 95:1–95:13. doi : 10.1145/3072959.3073640 . ISSN 0730-0301 . S2CID 207586187 . ↑ Stupp, Catherine. 「詐欺師がAIを使ってCEOの声を模倣した異例のサイバー犯罪事件」 . WSJ . 2024年5月26日 閲覧 . ↑ ブリュースター、トーマス。 「詐欺師が3500万ドルの銀行強盗で会社役員の声をクローンしていたことが警察によって判明」 。 フォーブス。 2022年6月29日 閲覧 。 ↑ 「生成AIが音声詐欺をより信じやすくしている」 。Axios 。 2023年6月13日。 2023年 6月16日 取得 。 ↑ Bunn, Amy (2023年5月15日). 「人工的ななりすまし犯―サイバー犯罪者が新たな詐欺の手口としてAI音声クローンに目を向ける」 . McAfee ブログ. 2023年 6月16日 閲覧 . ↑ コックス、ジョセフ(2023年2月23日)。 「AI生成音声で銀行口座に侵入した方法」 。Vice 。 2023年 6月16日 閲覧 。 ↑ エヴァーシェッド、ニック、テイラー、ジョシュ(2023年3月16日)。 「AIはセンターリンクとオーストラリア税務署が本人確認に使用している音声認識を欺くことができる」 。 ガーディアン。 2023年 6月16日 取得 。 ↑ 「詐欺師がAIを使って家族緊急支援スキームを強化」 。 消費者アドバイス 。2023年3月17日。 2024年5月26日 取得 。 ↑ 「労働党大会初日にキア・スターマー卿のディープフェイク音声が公開 」 ↑ メイカー、モーガン。 「スロバキアの選挙ディープフェイクは 、 AIが民主主義にとって危険であることを示している」 。Wired 。 ↑ 「偽のバイデンAI自動音声電話の背後にいる政治コンサルタントがニューハンプシャー州で起訴される 」 ↑ 「バイデン氏のディープフェイク電話で有権者にスパムを送るためにマジシャンを雇ったとして告発された政治コンサルタント」 . Law & Crime . 2024-03-15 . 2024-05-23 閲覧 . ↑ デビッド・ライト、ブライアン・ファン、ブライアン・ファン(2024年2月6日)。 「偽のバイデン自動音声電話はテキサス州の企業と関連している、ニューハンプシャー州司法長官が発表 」 。CNN 。 ↑ Brian Fung (2024年2月8日) 「FCC、AI生成音声を使用した詐欺的な自動音声電話の禁止を決定」 CNN。 ↑ 「FCC 、 自動音声通話におけるAI生成音声を違法とする|連邦通信委員会」 www.fcc.gov 2024 年2月8日2024年 5月26日 閲覧 ↑ クレイマー、マーシャ (2024-02-26). 「スティーブ・クレイマー、ニューハンプシャーでバイデン大統領になりすますためにAIを使用した理由を説明 - CBSニューヨーク 」 www.cbsnews.com 2024-05-23 閲覧 。 ↑ 「政治コンサルタントがバイデン氏のディープフェイク自動音声電話の件で起訴され罰金を科される 」 ↑ Growcoot, Matt (2024年9月26日). 「YouTuberの声がAIクローン化され、同意なしに企業に利用される」 . Peta Pixel . 2026年 3月12日 閲覧 . ↑ 「AIで私の声を盗まれた(更新:Elecrowが回答)」 。 YouTube 。2024年9月21日。 2026年3月12日 取得 。 ↑ 「AI音声クローン技術の暗黒面」 。YouTube 。 2024年9月25日。 2026年3月12日 閲覧 。 ↑ Forristal, Lauren (2025年10月21日). 「YouTubeの類似性検出技術が正式に開始されました」 . Tech Crunch . 2026年 3月12日 閲覧 。 ↑ Desreumaux, Geoff (2025年10月21日). 「YouTubeがクリエイター向けに類似性検出技術を正式に展開」 . We are Social Media . 2026年 3月12日 取得 。 ↑ ディープフェイクで成功するまで (PDF) (レポート)。Graphika。2023年2月。 ↑ Kong, Jungil; Kim, Jaehyeon; Bae, Jaekyoung (2020-10-23). "HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis". arXiv : 2010.05646 [ cs.SD ]. ↑ クマル、クンダン。クマール、リテシュ。ド・ボワシエール、ティボー。ゲスティン、ルーカス。テオ、ウェイ・ジェン。ソテロ、ホセ。デ・ブレビッソン、アレクサンドル。ベンジオ、ヨシュア。クールヴィル、アーロン (2019-12-08)。 「MelGAN: 条件付き波形合成のための敵対的生成ネットワーク」。 arXiv : 1910.06711 [ eess.AS ]。 ↑ Ng, Andrew (2020年4月1日). 「大衆のための音声クローニング」 . DeepLearning.AI . 2024年12月28日のオリジナルから アーカイブ済み 。 2024年 12月22日 取得。 ↑ Chandraseta, Rionaldi (2021年1月21日). 「機械学習を使用してお気に入りのキャラクターのボイスラインを生成する」 . Towards Data Science . 2021年1月21日のオリジナルから アーカイブ済み。 2024年 12月18日 取得 。 ↑ 「エンドツーエンド音声合成におけるデータ効率向上のための半教師あり学習」からの音声サンプル " . 2018-08-30。2020-11-11のオリジナルからアーカイブ済み。2022-06-05 に取得 。↑ Temitope, Yusuf (2024年12月10日). 「15.aiのクリエイターがMITプロジェクトからインターネット現象に至るまでの道のりを明かす」 . The Guardian . ラゴス、ナイジェリア。 2024年12月28日のオリジナルから アーカイブ済み。 2024年 12月25日 取得 。 ↑ 黒沢由紀(2021年1月19日)。 「ゲームキャラ音声読み上げソフト「15.ai」公開中。『Undertale』や『Portal』のキャラに好きな声を言ってもらってください」 [ ゲーム キャラ音声読み上げソフト「15.ai」公開中。 Undertale と Portal のキャラクターを入手して 、 希望のセリフを言ってください 。 オートマトン (日本語)。 2021年1月19日のオリジナルから アーカイブ 。 2024 年 12 月 18 日 に取得 。 ↑ 「合成音声の課題と機会への対応」 。OpenAI 。 2024年3月9日。 2024年11月25日のオリジナルから アーカイブ。 2024年 12月18日 取得 。 ↑ Babbel.com; GmbH、レッスン9。 「世界で最も話されている10の言語」 。Babbel Magazine 。 2022年6月30日 取得 。 ↑ Najafian, Maryam; Russell, Martin (2020年9月) 「アクセントに強い自動音声認識のための分析ツールとしての自動アクセント識別」 Speech Communication 122 : 44–55 . doi : 10.1016 /j.specom.2020.05.003 . S2CID 225778214 . ↑ 劉暁。チャン、ファンジン。ホウ・ジェンユー。ミアン、リー。王趙雨。張、静。唐潔(2021)。 「自己教師あり学習: 生成的または対照的」。 知識およびデータエンジニアリングに関する IEEE トランザクション 。 35 (1): 857–876 . arXiv : 2006.08218 。 土井 : 10.1109/TKDE.2021.3090866 。 ISSN 1558-2191 。 S2CID 219687051 。 ↑ Rimon, Inbal; Gal, Oren; Permuter, Haim (2025). "ディープフェイクの正体解明:ディープフェイク音声検出のための拡張と特徴の変動性の活用". arXiv : 2501.05545 [ cs.SD ]. ↑ Rashid, Md Mamunur; Lee, Suk-Hwan; Kwon, Ki-Ryong (2021). "ディープフェイク対策と動画/画像の完全性保護のためのブロックチェーン技術" . Journal of Korea Multimedia Society . 24 (8): 1044– 1058. doi : 10.9717/kmms.2021.24.8.1044 . ISSN 1229-7771 . ↑ Fraga-Lamas, Paula; Fernández-Caramés, Tiago M. (2019-10-20). "フェイクニュース、偽情報、ディープフェイク:分散型台帳技術とブロックチェーンを活用してデジタル欺瞞と偽造現実と戦う". IT Professional . 22 (2): 53– 59. arXiv : 1904.05386 . doi : 10.1109/MITP.2020.2977589 . ↑ Ki Chan, Christopher Chun; Kumar, Vimal; Delaney, Steven; Gochoo, Munkhjargal (2020年9月)「ディープフェイク対策:デジタルメディアの真正性証明としてのマルチLSTMとブロックチェーン」 2020 IEEE / ITU 国際人工知能会議 (AI4G) . pp. 55–62 . doi : 10.1109/AI4G50087.2020.9311067 . ISBN 978-1-7281-7031-2 . S2CID 231618774 . ↑ Mittal, Trisha; Bhattacharya, Uttaran; Chandra, Rohan; Bera, Aniket; Manocha, Dinesh (2020-10-12)、 「感情は嘘をつかない:感情的手がかりを用いたオーディオビジュアルディープフェイク検出方法」 、 第28回ACM国際マルチメディア会議議事録 、ニューヨーク州ニューヨーク、米国:Association for Computing Machinery、pp. 2823–2832 、 doi : 10.1145/3394171.3413570 、 ISBN 978-1-4503-7988-5 S2CID 220935571、取得日 :2022年6月29日 ↑ Conti, Emanuele; Salvi, Davide; Borrelli, Clara; Hosler, Brian; Bestagini, Paolo; Antonacci, Fabio; Sarti, Augusto; Stamm, Matthew C.; Tubaro, Stefano (2022-05-23). "Deepfake Speech Detection Through Emotion Recognition: A Semantic Approach". ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) . Singapore, Singapore: IEEE. pp. 8962–8966 . doi : 10.1109/ICASSP43922.2022.9747186 . hdl : 11311/1220518 . ISBN 978-1-6654-0540-9 . S2CID 249436701 . ↑ Hosler, Brian; Salvi, Davide; Murray, Anthony; Antonacci, Fabio; Bestagini, Paolo; Tubaro, Stefano; Stamm, Matthew C. (2021年6月). 「ディープフェイクは感情を感じるのか?感情の不一致によるディープフェイク検出のための意味論的アプローチ」. 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) . ナッシュビル、テネシー州、米国: IEEE. pp. 1013–1022 . doi : 10.1109/CVPRW53098.2021.00112 . hdl : 11311/1183572 . ISBN 978-1-6654-4899-4 . S2CID 235679849 . ↑ ミュラー、ニコラス・M.チェンピン、パベル。ディークマン、フランツィスカ。フロギャー、アダム。ベッティンガー、コンスタンティン (2022-04-21)。 「音声ディープフェイク検出は一般化しますか?」 arXiv : 2203.16263 [ cs.SD ]。 ↑ Zhang, You; Jiang, Fei; Duan , Zhiyao (2021). "One-Class Learning Towards Synthetic Voice Spoofing Detection". IEEE Signal Processing Letters . 28 : 937–941 . arXiv : 2010.13995 . Bibcode : 2021ISPL...28..937Z . doi : 10.1109/LSP.2021.3076358 . ISSN 1558-2361 . S2CID 235077416 . ↑ 「中国国家インターネット情報弁公室深層統合規則」 2023年1月。 1 2 "SAM.gov" . sam.gov . 2022-06-29 に取得. ↑ 「SemaForプログラム」 。www.darpa.mil 。 2022年7月1 日 取得 。 ↑ 「DARPA MediForプログラム」 . govtribe.com . 2022年6月29日 取得 。 ↑ 「MediForプログラム」 。www.darpa.mil 。 2022年7月1 日 取得 。 ↑ 「DARPAがセマンティックフォレンジックプログラムに選ばれた研究チームを発表」 . www.darpa.mil . 2022年7月1日 取得 。 ↑ "PREMIER" . sites.google.com . 2022年7月1日 取得. ↑ "PREMIER - プロジェクト" . sites.google.com . 2022年6月29日 取得 . ↑ Bird, Jordan J.; Lotfi, Ahmad (2023). "Real-time Detection of AI-Generated Speech for DeepFake Voice Conversion". arXiv : 2308.12734 [ cs.SD ]. ↑ 山岸純一;王、新。トディスコ、マッシミリアーノ。メリーランド州サヒドラ。パティーノ、ホセ。ナウチュ、アンドレアス。劉雪晨;リー、コンエイク。キンヌネン、トミ。エヴァンス、ニコラス。デルガド、エクトル(2021-09-01)。 「ASVspoof 2021: スプーフィングおよびディープフェイク音声検出の進歩が加速」。 arXiv : 2109.00537 [ eess.AS ]。 ↑ 「オーディオディープフェイク検出:ICASSP 2022」 。IEEE 信号処理学会 。2021年12月17日。 2022年7月1日 取得 。 ↑ イー、江堰。フー、ルイボ。タオ、建華。ニー、シュアイ。マ、ハオシン。王成龍。王、タオ。ティアン、ジェンクン。バイ、イェ。ファン、チュンハン。梁、シャン (2022-02-26)。 「ADD 2022: 最初のオーディオディープシンセシス検出チャレンジ」。 arXiv : 2202.08433 [ cs.SD ]。 ↑ 「Blizzard ChallengeとVoice Conversion Challenge 2020の合同ワークショップ - SynSIG」 。www.synsig.org 。 2022年7月2日に オリジナル からアーカイブ済み 。 2022年7月1日 に取得。 ↑ " 「私の声を使うのをやめてください」―スコットレールの新アナウンサーは私のAIクローンです。BBCニュース 。2025年5月27日。 2025年5月28日 閲覧 。↑ 「ナレーターのゲイアン・ポッターがスコットレールに対し、新しいAIアナウンスから自分の声を削除するよう要請」 。 スカイニュース。 2025年5月28日 取得 。 ↑ English, David Leask | Paul (2025-05-27). "女優がスコットレールの新しいAI音声アナウンサーに「騙された」と感じている" . www.thetimes.com . 2025-05-28 に閲覧。 ↑ 「私は20年間スコットレールの列車のアナウンスを担当してきたが、何の予告もなくAIに置き換えられた」 。 ナショナル紙 。2025年5月30日。 2025年8月17日 閲覧 。 ↑ 「スコットレール、列車の物議を醸すAI音声を置き換える」 。BBC ニュース 。2025年8月25日。 2025年8月27日 閲覧 。