15.ai は、人気メディアの架空のキャラクターの音声をテキスト読み上げで生成するために人工知能を使用する、無料の非営利ウェブアプリケーションおよび研究プロジェクトでした。マサチューセッツ工科大学(MIT)の学部生時代にこの技術の開発を始めた、15という仮名で知られる人工知能研究者によって作成されたこのアプリケーションを使用すると、ユーザーはビデオゲーム、テレビ番組、映画のキャラクターに、感情の抑揚をつけてカスタムテキストを話させることができます。このプラットフォームは、最小限のトレーニングデータを使用して説得力のある音声出力を生成できます。「15.ai」という名前は、わずか 15 秒の音声で声をクローンできるという開発者の発言に由来しています。これは、AI ブームの初期段階における生成型人工知能の応用例の初期のものでした。
2020年3月にローンチされた15.aiは、2021年初頭に、それを利用したコンテンツがソーシャルメディアで爆発的に拡散し、My Little Pony: Friendship Is Magic、Team Fortress 2、SpongeBob SquarePantsなどのインターネットファンダムの間で急速に普及したことで、インターネット現象となった。このサービスは、絵文字による感情表現、正確な発音制御、マルチスピーカー機能を特徴としていた。批評家は15.aiのアクセシビリティと感情制御を称賛したが、韻律オプションと非英語言語サポートにおける技術的な制限を批判し、文字の複雑さによって結果はまちまちだった。15.aiは、ミームやコンテンツ作成においてAI音声クローンを普及させた最初のプラットフォームとして評価されている。[ a ]
声優や業界関係者は 15.ai の影響について議論し、雇用への影響、音声関連の詐欺、悪用の可能性について懸念を表明した。2022 年 1 月、Voiceverse という会社が15.ai を使用して音声ラインを無断で生成し、自社の技術の副産物として宣伝し、許可なく非代替性トークン(NFT) として販売していたことが判明した。報道機関は、この事件を同社が 15.ai から「盗んだ」と一様に表現した。[ b ]人工知能と著作権に関する法的問題のため、このサービスは 2022 年 9 月にオフラインになった。その閉鎖後、創業者がディープラーニング音声合成の分野における 15.ai の先駆的な影響を認めている商用代替サービスが登場した。2025 年 5 月 18 日、15 は15.ai の後継として15.devをリリースした。 2026年5月28日、15はArtist Alleyの設立に専念するため、このサイトを無期限に閉鎖すると発表した。
音声合成の分野は、深層学習アプローチの導入により大きな変革を遂げました。2016年にDeepMindがWaveNet論文を発表したことで、因果畳み込みニューラルネットワークによる高音質音声合成が可能になったニューラルネットワークベースの音声合成への転換が始まりました。以前は、人間の音声の録音済みセグメントをつなぎ合わせる連結合成が人工音声生成の主流でしたが、文の境界でロボットのような音声になることがよくありました。[ 37 ] 2018年、Google AIのTacotron 2は、ニューラルネットワークが非常に自然な音声合成を生成できることを示しましたが、許容できる品質を達成するには相当量のトレーニングデータ(通常は数十時間の音声)が必要でした。2時間のトレーニングデータでトレーニングした場合、出力品質は低下しましたが、それでも聞き取れる音声を維持することができました。24分のトレーニングデータでは、Tacotron 2は聞き取れる音声を生成できませんでした。[ 38 ]同年には、高忠実度の音声を生成しながら波形生成の効率を向上させた、生成敵対ネットワーク(GAN) ベースのボコーダーである HiFi-GAN が登場し、 [ 39 ]続いて、高速推論と音声スタイル転送機能の両方を可能にするフローベースのアプローチを導入した Glow-TTS が登場しました。 [ 40 ] BaiduやByteDanceなどの中国のテクノロジー企業も、技術をさらに進歩させる画期的な技術を開発することで、この分野に貢献しました。[ 41 ]

15.ai は、 MITの学部生研究機会プログラムの一環として、15という開発者(当時 18 歳[ 42 ] ) が 1 年生の時にディープラーニング音声合成の研究プロジェクトとして 2016 年に構想されました。[ 43 ] 15 は DeepMind の WaveNet 論文に触発され、翌年に Google AI が Tacotron 2 をリリースした後も、研究を続けていました。2019 年までに、彼らは MIT で、以前必要とされていたトレーニング データよりも 75% 少ないデータを使用して WaveNet と Tacotron 2 の結果を再現できることを実証しました。[ 41 ]「15.ai」という名前は、開発者が、わずか 15 秒のデータで音声をクローンできると述べたことに由来しています。[ 44 ]
15 は当初、学部時代の研究に基づいて博士号を取得する予定だったが、2019 年にスタートアップがY Combinatorアクセラレーターに採択された後、代わりにテクノロジー業界で働くことを選択した。2020 年初頭に退社した後、15 は音声合成の研究に戻り、それをウェブ アプリケーションとして実装し始めた。15 のXへの投稿によると、単純な単調な録音を含むLJSpeechのような従来の音声データセットを使用する代わりに、複雑な音声パターンや感情的なニュアンスを処理するモデルの能力を示すことができる、より難しい音声サンプルを探した。[ tweet 1 ]この段階で、15 は、4chanのMy Little Pony掲示板である/mlp/が始めた共同プロジェクトである Pony Preservation Project を発見した。[ 45 ]このプロジェクトの貢献者たちは、マイリトルポニー:フレンドシップ・イズ・マジックから数千の音声セリフを手作業でトリミング、ノイズ除去、書き起こし、感情タグ付けし、15.ai の理想的なトレーニング資料となるデータセットにまとめた。[ 46 ]
[...] このウェブサイトには複数の目的があります。それは、たとえプロジェクトのナレーションを依頼できる人を雇えなくても、誰でもコンテンツを作成できるプラットフォームの概念実証としての役割を果たします。
また、このモデルを使うことで、私の研究の進捗状況をより魅力的な形で示すことができます。実際にモデルを使うことで、私自身も知らなかったような発見(例えば、特定の音素の間にコンマを入れることで、キャラクターに息を呑むような音やうめき声を出させる方法など)ができるのです。
また、最良の結果だけを選び出して、うまく機能するものだけを見せびらかすこともできません。[...] フィルターなしでモデルとやり取りできるため、ユーザーは現在の作業がどれほど優れているかを額面通りに正確に判断できます。
15.ai は、2020 年 3 月 2 日に、ユーザー登録は不要だが、使用前に利用規約に同意する必要のある無料の非商用 Web アプリケーションとしてリリースされました[ 49 ] 。 [ 12 ]リリース当時、このプラットフォームで使用できるキャラクターは限られており、My Little Pony: Friendship Is MagicやTeam Fortress 2のキャラクターなどが含まれていました[ 50 ]。ユーザーは、2 つの条件の下で合成音声を使用してコンテンツを作成することが許可されていました。1 つは、生成された音声を使用する投稿、ビデオ、またはプロジェクトに「15.ai」を含めることで 15.ai を適切にクレジットする必要がありました[ 51 ] 。もう 1 つは、テクノロジーの機能を誤って表現しないように、同じ作品内で 15.ai の出力と他のテキスト読み上げ出力を混ぜることを禁止されていました[ 49 ] 。2020年 3 月 8 日、Valve News Networkの Tyler McVicker が15.ai を紹介するYouTube動画をアップロードしました。 [動画1 ]
その後数か月で、ウェブサイトにはさらに多くの音声が追加されました。2020年後半には、15が深層ニューラルネットワークにマルチスピーカー埋め込みを実装し、複数の音声を同時に学習できるようにしました。 [ 41 ]これにより、ウェブサイトのキャラクター数は8人から50人以上に増加しました。[ 42 ]さらに、この実装により、キャラクターの学習データに特定の感情が欠落している場合でも、深層学習モデルが異なるキャラクター間で共通の感情パターンを認識できるようになりました。[ 52 ]
2020 年 5 月までに、このサイトは 420 万を超える音声ファイルをユーザーに提供しました。[ 53 ] 2021 年初頭、15.ai を使用して作成された寸劇、ミーム、ファン コンテンツがTwitter、TikTok、Reddit、Twitch、Facebook、YouTubeで拡散したことで、このアプリケーションの人気が高まりました。[ 54 ]ピーク時には、このプラットフォームは、毎日数百万件の音声生成を処理するために必要なAWSインフラストラクチャから、月額12,000米ドルの運用コストを負担していました。 [ 55 ] 15.ai とその基盤となるテクノロジーを買収する企業からのオファーがあったにもかかわらず、この Web サイトは独立したままで、開発者の以前のスタートアップの個人的な収益から資金提供を受けていました。[ 41 ]

2022年1月14日、15は、 Voiceverseというブロックチェーンベースの企業が15.aiを使用して音声ラインを生成し、許可や帰属表示なしにTwitterで自社の音声技術のデモンストレーションとして偽って紹介し、NFTとして販売していたことを発見した。[ 56 ] [ 57 ]これは、15が2021年12月にNFTを自社の作業に組み込むことに興味がないと表明した直後のことだった。[ 58 ] 15が投稿したログファイルのスクリーンショットには、Voiceverseが15.aiを使用して「マイリトルポニー ~友情は魔法~ 」のキャラクターの音声を生成し、ピッチを上げて聞き取れないようにしていたことが示されていた。[ 59 ]これは、商用利用を明確に禁止し、適切な帰属表示を要求していた15.aiの利用規約に違反していた。[ 60 ]
証拠を突きつけられたVoiceverseは、デモを急いで作成する際に、マーケティングチームが適切な帰属表示なしに15.aiを使用したと述べた。[ 61 ]これに対し、15は「くたばれ」とツイートし[ 62 ]、このツイートは拡散し、開発者を支持する何十万ものリツイートといいねがTwitter上で集まった。[ 41 ]盗用された音声を紹介するツイートはその後削除された。[ 14 ]
私は@VoiceverseNFTと提携し、共に新しいクリエイターに新しいツールを提供し、新しいものを生み出す方法、そして誰もが自分が生み出した知的財産を所有し、投資する機会を得られる方法を模索しています。誰しも語るべき物語を持っている。憎むこともできる。あるいは、創造することもできる。
何にしますか?
2022年1月14日[ 63 ]
この論争は、批評家によると知的財産の窃盗や疑わしいビジネス慣行と頻繁に関連付けられているNFTプロジェクトに対する懸念を引き起こした。 [ 64 ]この事件は、AIインシデントデータベース(AIID)[ 23 ]とAI、アルゴリズム、自動化インシデントおよび論争(AIAAIC)リポジトリ[ 24 ]に記録され、モリー・ホワイトのWeb3 Is Going Just Greatウェブサイトでも取り上げられた。[ 17 ] Skillboxのパベル・ヒブチェンコはこの事件をNFTにおける詐欺の例として挙げた。[ 65 ]声優でYouTuberのヨン・イェは、声優業界への潜在的な影響について音声NFTを批判し[ 25 ]、YouTube動画で、Voiceverseが15.aiの優れた技術を意図的に盗用して音声NFTを偽って宣伝したと述べた。[動画2 ]: 15:54–16:13 Voiceverseの親会社であるLOVO, Inc.に対して2024年に提起された集団訴訟において、裁判所文書は同社による15.aiの技術の過去の盗用を訴訟の一部として挙げた。 [ 66 ]
盗用されたAI音声の宣伝と同時にVoiceverseとの提携を発表した声優のトロイ・ベイカーは、NFTプロジェクトを支持したことと、対立的な発表のトーンに対して批判が高まった。 [ 67 ]継続的な反発と盗作の暴露を受けて、ベイカーは最初のツイートが「敵対的」であったことを認め[ 68 ]、1月31日にVoiceverseとの提携を中止すると発表した。[ 69 ]
2022年9月、15.aiはオフラインになった。[ 70 ] Twitterへの投稿で、15は著作権の問題に最初からより適切に対処できる将来のバージョンを提案した。[ 41 ]この活動休止期間中、音声AIスタートアップは15.aiをこの分野への大きな影響として挙げ続けた。[ 71 ] Y CombinatorのスタートアップであるPlayHTは、15.aiのデビューを「テキスト音声合成(TTS)と音声合成の分野における画期的な出来事」と呼んだ。[ 72 ] Speechifyの創設者兼CEOであるクリフ・ワイツマンは、15.aiが「ファンダムの既存の人気キャラクターを初めてフィーチャーすることで、コンテンツ作成のためのAI音声クローンを普及させた」と評価した。[ 73 ] ElevenLabsの共同創設者兼CEOであるマティ・スタニシェフスキは、15.aiはAIテキスト音声合成の分野を変革したと書いた。[ 74 ]
2025年5月18日、15は15.aiの公式続編として15.devをリリースした。[ 75 ] [ツイート2 ] [ 76 ]ファンダムニュースサイトのEquestria Dailyは、このウェブサイトには「番組に登場するほぼすべての声付きポニー」が含まれており、「生成したいさまざまな感情のドロップダウンメニュー」があると報じた。[ 77 ]
2026年5月28日、15は高コストのためサイトを無期限閉鎖し、アーティスト向けのファンマーケットプレイスであるArtist Alleyの設立に注力すると発表した。[ 78 ]

15.ai は非営利で、広告はなく、収益も発生せず、ユーザー登録やアカウントも必要とせずに動作します。[ 79 ]ユーザーはテキストを入力してキャラクターの声を選択することで音声を生成でき、オプションのパラメーターで感情的な文脈化と音声転写を行うことができます。各リクエストは、異なる感情表現を持つ 3 つのオーディオバリエーションを生成します。[ 80 ]利用可能なキャラクターには、Team Fortress 2とMy Little Pony: Friendship Is Magicのメイン シックスとダーピー フーヴスを含む複数のキャラクター、PortalシリーズのGLaDOS、Wheatley、およびSentry Turret 、スポンジ ボブ、 HuniePopの Kyu Sugardust 、ペルソナ 4のRise Kujikawa、DariaのDaria MorgendorfferとJane Lane、Aqua Teen Hunger ForceのCarl Brutananadilewski、Steven UniverseのSteven Universe、UndertaleのSans、CelesteのMadelineと複数のキャラクターが含まれます。『ドクター・フー』の10代目ドクター、『スタンリー・パラブル』のナレーター、 『 2001年宇宙の旅』のHAL 9000。[ 81 ]チェルやゴードン・フリーマンのような無口なキャラクターも選択でき、テキストを入力すると無音の音声ファイルを出力した。[ 82 ]『アンダーテール』や『セレステ』のキャラクターは言葉を発せず、テキストを入力するとゲーム特有のビープ音を発した。[ 83 ]

2020年以降、15.aiは44.1kHzのサンプリングレートで音声を生成しています。これは、当時ほとんどの深層学習テキスト音声合成システムで使用されていた16kHzの標準よりも高い値です。この高い忠実度により、より詳細な音声スペクトログラムとより高い音声解像度が得られますが、合成の不完全さがより目立つというトレードオフがあります。[ 85 ] 15.aiは、カスタマイズされた深層ニューラルネットワークと特殊な音声合成アルゴリズムを使用して音声を処理します。[ 86 ]その基盤となる技術は、10秒未満の処理時間で10秒の音声を生成できますが(つまり、リアルタイムよりも高速)、サーバーが数千件の同時リクエストを処理するため、ユーザーエクスペリエンスでは、結果の提供に1分以上かかる場合もあり、より長い待ち時間が発生することがよくあります。[ 87 ]
15.ai は非決定論的な設計のため、音声出力にばらつきが生じます。15.ai は感情コンテキスト化の概念を導入し、ユーザーがガイドフレーズを通して生成される音声の感情的なトーンを指定できるようにしました。[ 88 ]感情コンテキスト化機能は、 MIT メディアラボで開発された感情分析ニューラルネットワークであるDeepMojiを利用し、12 億件の Twitter 投稿から絵文字埋め込みを処理して感情的な内容を分析しました。[ 51 ] 15.ai への入力に追加のコンテキスト (縦棒で指定) が含まれている場合、縦棒に続く追加コンテキストが感情コンテキスト化に使用されます。[ 89 ]例えば、入力が の場合、選択されたキャラクターは「今日は素晴らしい日だ!」という文を、「とても悲しい」という文を言う人が期待するような感情で話します。[ 90 ]Today is a great day!|I'm very sad.

15.ai は、Oxford Dictionaries API、Wiktionary、およびARPABET音声転写を使用するCMU Pronouncing Dictionaryの発音データを使用します。ユーザーは、音素文字列を中括弧で囲むことで ARPABET 転写を入力し、誤った発音を修正できます。[ 51 ] 15.ai のインターフェースは、発音の確実性を示すために色分けを使用し[ 51 ]、また、感情分析やボコーダーの自動改善を含む、技術的な指標、グラフ、包括的なモデル分析も表示します。[ 42 ]このプラットフォームはプロンプトを200 文字に制限しており、ユーザーは複数の世代を組み合わせてより長い音声シーケンスを作成できます。[ 91 ]
15.ai の後のバージョンでは、マルチスピーカー機能が導入されました。15.ai は、各音声ごとに個別のモデルをトレーニングするのではなく、スピーカー埋め込み(各キャラクターの固有の音声特性を捉える数値表現) を通じて複数の音声を同時に学習する統一モデルを使用します。[ 41 ] DeepMoji によって付与される感情的なコンテキストと相まって、これにより、キャラクターのトレーニング データに特定の感情の例がない場合でも、ディープラーニング モデルは、異なるキャラクターの感情表現や話し方の共通パターンを学習できます。[ 92 ]
批評家たちは、15.ai は使いやすく、概ね説得力のあるキャラクターの声を再現できるが、時折結果がまちまちであると評した。 [ 93 ] PC Gamerの Natalie Clayton は、スポンジ・ボブの声はうまく再現されているが、The Stanley Parableのナレーターを模倣する難しさについて、「アルゴリズムはKevan Brightingの気まぐれで滑稽なイントネーションを捉えることができない」と書いている。[ 94 ] Kotakuの Zack Zwiezenは、「彼のガールフレンドは、それが GLaDOS の声優による新しいボイスラインだと確信していた」と報告した。[ 95 ]台湾の新聞United Daily Newsも、15.ai の GLaDOS の機械的な声を再現する能力と、多様なキャラクターの声のオプションを強調した。[ 96 ] Yahoo! News Taiwanは、「PortalのGLaDOSはセリフをほぼ完璧に発音できる」と報じたが、「単語数の制限や声調制御など、まだ多くの不完全な点があり、いくつかの単語ではまだ少し奇妙だ」とも批判した。[ 97 ] BytesideのChris Buttonは、わずか15秒のデータで声をクローンできる機能を「奇妙だ」と評したが、その背後にある技術は「印象的だ」とも述べた。[ 98 ] ClubicのRobin Lamorletteは、この技術を「悪魔的に楽しい」と評し、TwitterやYouTubeには、このツールを試しているユーザーによる創造的なコンテンツがあふれていると書いた。[ 99 ]このプラットフォームの音声生成機能は、 Equestria Dailyで定期的に取り上げられ、ドキュメント化されたアップデート、ファンによる作成、新しいキャラクターの声の追加が行われた。15.aiに新しいキャラクターが追加されたことを紹介する投稿で、Equestria Dailyの創設者Shaun Scotellaroは、「サンプルが不足しているため、一部の[声]は素晴らしくないが、それでも多くは本当に印象的だ」と書いた。[ 100 ]中国のマイリトルポニーファンサイトEquestriaCNも15.aiの開発とアップデートを記録したが、バグや長い待ち時間について批判した。[ 101 ]
Anime Superhero Newsの Peter Paltridge 氏は、「音声合成は、より高価な取り組みでは実際の人間の話し声とほとんど区別がつかないほど進化している」と意見を述べたが、「ある意味では、SAMの方がまだ進んでいる。特殊文字を使用することで SAM の抑揚に影響を与えたり、ピッチを自由に変更したりすることができた。15.ai では、ランダムな抑揚に翻弄されるしかない」とも述べた。[ 102 ]一方、 Rock, Paper, Shotgunの Lauren Morton 氏は、「細かいところまで掘り下げる気があれば」発音制御の深さを称賛した。[ 103 ]同様に、 Qore.comの Eugenio Moto 氏は、「最も経験豊富なユーザーは、アクセントやトーンなどのパラメーターを変更できる」と書いた。[ 104 ]デンファミニコゲーマーの古島貴之氏は「滑らかな発音」を強調し、AUTOMATONの黒澤由紀氏は「豊かな感情表現」が主な特徴だと書いた。両日本人著者は日本語のサポートがないことに言及した。[ 105 ] ArkadeのRenan do Prado氏とLaPS4のJosé Villalobos氏は、それぞれポルトガル語とスペイン語で面白い結果を作ることができたが、英語での生成が最も効果的だったと指摘した。[ 106 ]中国のゲームニュースサイトGamerSkyは、このアプリを「面白い」と評したが、テキストの文字数制限と時折イントネーションが欠けていることを批判した。[ 107 ] GLITCHEDのMarco Cocomello氏は、200文字の制限にもかかわらず、GLaDOSの声でアプリをテストした結果に「驚かされた」と述べている。[ 108 ]スペインの作家アルバロ・イバニェスは、Microsiervos誌で、AIが生成した音声のリズムが興味深いと感じ、15.aiはテキストの意味に基づいて音声の配信を調整できると書いた。[ 109 ]
AI の研究者や実務家は、当時の他のテキスト読み上げ技術と比較して、15.ai の機能と限界についてより詳細な分析を提供しました。Google DeepMind の上級研究科学者 Alex Irpan 氏は、2020 年に 15.ai が発売されたとき、「おそらく世界で最高品質の音声生成モデル」であり、Google AIが開発したモデルよりも優れていると書いています。[ 110 ] Voiceverse は、15.ai から盗用した理由の説明で、「マーケティングチームが見つけることができた最高の音声は、自社のものではなく 15.ai のものだった」と書いています。[ 111 ] Towards Data Scienceの Rionaldi Chandraseta 氏は、より大きなデータセットでトレーニングされた音声モデルは、特に長いテキストの場合、より良い言い回しと自然な間合いで、より説得力のある出力を生成すると書いています。[ 86 ] AI Dailyの Parth Mahendra 氏は、このシステムは「ほとんどの基本的な単語を正確に再現するのに優れている」ものの、より複雑な用語には苦戦しており、文字が特定の単語の発音を「完全に台無しにする」と指摘した。[ 53 ] ダウンロード可能な音声 AI ツール xVASynth の作成者である Dan Ruta 氏は、それに比べて、 15.ai のようなクラウドベースのツールはどのデバイスでもアクセスできるという利点があると書いた。[ 112 ]経済学者で AI コメンテーターのTyler Cowen氏は、15.ai を AI と機械学習における過小評価されている才能の例として挙げた。[ 113 ]
中国のAI研究者もさまざまな技術的評価を提供した。機械学習教授の李永強氏は、15.aiは「話者のリズムと特徴を完璧に保持している」と述べ、執筆時点で5,000人が同時に音声を生成しているにもかかわらず、このアプリケーションはまだ無料であると指摘した。[ 114 ] QQニュースの新志源の白峰氏は、最小限のトレーニングデータを使用しているにもかかわらず、15.aiの高品質な出力の技術的成果を強調し、一般的な深層学習テキスト音声合成実装よりもはるかに高品質であると書いた。また、限られたトレーニングデータのために発音エラーがいくつか発生したが、現代の深層学習モデルは通常40時間以上の音声を必要とすることを考えると理解できると白峰氏は認めた。[ 115 ] NetEase NewsのJi Yunyo氏は、15.aiの技術を「驚くほど効率的」と評したが、感情表現の限界を批判し、感情表現は比較的「中立的」であり、「極端な」感情を適切に合成できないため、職場での不適切な用途には適さないと書いた。[ 116 ] Ji氏はまた、多くのディープフェイク動画では、非常に短い結果を得るために、制作者が何時間ものオリジナルコンテンツから素材を抽出して編集する必要があるのに対し、15.aiはキャラクターごとに数十分のトレーニングデータだけで、同等かそれ以上の効果を達成できると書いた。[ 117 ]

15.ai に登場したキャラクターの声を担当した声優の中には、このプラットフォームについて公に意見を述べている人もいます。2021 年 4 月のインタビューで、Team Fortress 2のスナイパーの声を担当しているジョン・パトリック・ロウリーは、インターン候補者がTeam Fortress 2 のキャラクターの AI 音声を使って作成した寸劇を見せてくれたときに 15.ai を知ったと述べています。[動画 3 ] : 0:51:50ロウリーは次のようにコメントしています。
「この技術が本当に人間だと信じるようになるまでにはまだ長い道のりがありますが、[15.ai]の能力には感銘を受けました。[...] シーンを分析した実際の人間から得られるような表現力は確かにありませんが、[...] ファン向けの情報源として、つまりMODなどを作成したい人にとっては、好きなキャラクターの声を使うのは楽しいことだと思います。」[動画3 ]: 0: 53:12
彼はシンセサイザー音楽に例え、次のように付け加えた。
「合唱団の音色も、オーケストラの音色も欲しいし、お金もあるなら、合唱団とオーケストラを雇えばいい。お金がないなら、それなりにいい音は出せるけど、合唱団とオーケストラの音色とは違う。」[動画3 ] : 1:01:10
2021年に自身のTwitchチャンネルで行われたライブ配信で、 Team Fortress 2のスカウトの声優であるネイサン・ベッターレインは、自身のキャラクターの声をAIが再現したものを聞き、「面白いね。悪くないよ。いい感じだ」とコメントした。[動画4 ]
他の声優たちは15.aiの機能に対して賛否両論の反応を示した。業界関係者の中には技術革新を認める者もいたが、この技術が自分たちの職業に及ぼす影響について懸念を表明する者もいた。[ 118 ]声優のトロイ・ベイカーが15.aiの技術を不正利用したVoiceverse NFTとの提携を発表した際、批評家たちは自動音声演技が声優の雇用機会を減少させる可能性、声真似のリスク、露骨なコンテンツでの悪用の可能性について懸念を表明した。[ 119 ] Kotaku Australiaのルビー・イネスは、「このやり方は、声優にプロジェクトで声優を起用して報酬を支払う代わりに、AI音声を使用すれば済むことを考えると、声優を失業させる可能性がある」と書いた。[ 12 ] Checkpoint Gamingのエディス・ウェイクリン=キングは、Voiceverse論争の報道の中で、「声優と直接仕事をする代わりにAI音声を使用する方が簡単で安価になれば、この種の技術は声優を失業させる可能性がある」と懸念を表明した。[ 29 ]
15.ai は架空のキャラクターに範囲を限定し、実在の人物や有名人の声を再現することはなかったが、[ 51 ]コンピュータ科学者のアンドリュー・ン氏は、同様の技術が悪意のある目的を含め、そうした目的にも使用できる可能性があるとコメントした。[ 50 ] 2020 年の 15.ai の評価で、ン氏は、ハリウッドでのバーチャル俳優の使用に革命を起こしたり、声優がより多くのアニメやオーディオブックの制作に参加できるようにしたり、コンテンツ制作者が合成された有名人の声を使用して脚本を朗読できるようにしたりするなど、音声クローンの潜在的な「非常に生産的な」用途を概説した。[ 50 ]しかし、彼はまた、同意なしに人間の声を合成することは倫理的な懸念や潜在的な法的問題を引き起こすと警告し、さらに、悪意を持って個人になりすますために悪用される可能性があると警告した。[ 50 ]
15.ai はオーディオ ディープフェイクの初期のパイオニアであり、その人気により、2020 年のAI ブームの初期段階で AI 音声合成ベースのミームが出現しました。15.ai は、特に高度な技術的専門知識を必要とせずにリアルタイムで説得力のあるキャラクターの声を生成できる能力により、インターネットミームやコンテンツ作成で AI 音声クローンを普及させた最初のプラットフォームとして評価されています。 [ a ] [ 121 ]このプラットフォームの影響は、マイ リトル ポニー: フレンドシップ イズ マジック、ポータル、チーム フォートレス 2、スポンジ ボブ スクエアパンツなどのファン コミュニティで特に大きく、ソーシャルメディアで何百万もの視聴回数を獲得するバイラル コンテンツの作成を可能にしました。 [ 122 ]チーム フォートレス 2 のコンテンツ クリエイターは、このプラットフォームを使用して、 Source Filmmakerを使用して、短い形式のミームと複雑な物語アニメーションの両方を制作しました。ファンの作品には、寸劇やファンアニメーション[ 123 ] 、クロスオーバーコンテンツ[ 124 ]、バイラルビデオの再現[ 125 ]、ファンフィクションの翻案[ 42 ]、ミュージックビデオ、楽曲[ 42 ]などがあった。ファンの作品の中には、主流メディアの注目を集めたものもあった。例えば、映画『ホーム・アローン2』でドナルド・トランプがカメオ出演したシーンをヘビーウェポンズガイのAI生成音声に置き換えたバイラルビデオは、2021年1月にCNNの昼間のコーナーで取り上げられた[ 120 ]。また、注目すべき作品としては、15.aiのキャラクターボイスを使用して制作された、ファンメイドの『マイリトルポニー~トモダチは魔法~ 』の17分間のエピソード「The Tax Breaks」がある[ 42 ] 。一部のユーザーは、15.aiを音声コマンドソフトウェアと統合して仮想アシスタントを作成した[ 126 ]。
15.ai はサービス開始以来、その影響力が広く認められており、サービス開始後にはElevenLabs [ c ]やSpeechifyなどの商用代替サービスが登場し、その空白を埋めている。 [ 128 ]現代の生成型音声 AI 企業の多くは、15.ai の先駆的な役割を認めている。[ 110 ]
15.ai は、AI 音声合成のその後の開発に影響を与える技術的先例を確立しました。感情分析のための DeepMoji の統合は、感情認識音声生成の実現可能性を示しました[ 129 ]。また、ARPABET 音声転写のサポートは、一般向け音声合成ツールの正確な発音制御の標準を確立しました[ 41 ] 。このプラットフォームのマルチスピーカーモデルは、多様なキャラクターの声を同時にトレーニングすることを可能にし、特定の感情が個々のキャラクターのトレーニングセットに存在しない場合でも、異なる声の間で感情パターンを認識できるようにしました[ 92 ]。15.ai はまた、音声合成のトレーニング データ要件の削減にも貢献しました。Tacotron 2 のような当時のモデルは、許容できる結果を生成するために数十時間のオーディオを必要とし、24 分未満のトレーニング データでは理解可能な音声を生成できませんでした[ 38 ] 。対照的に、15.ai は、大幅に少ないトレーニング データで音声を生成できることを示しました。 「15.ai」という名前は、わずか15秒のデータで音声をクローンできるという開発者の発言に由来しています。[ 41 ] 15秒というベンチマークは、その後の音声合成システムの基準点となりました。人間の声をクローンするにはわずか15秒のデータしか必要ないという当初の発言は、 2024年にOpenAIによって裏付けられました。[ 130 ]
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)これは[Voiceverse]が「うっかり!」と済ませられるようなことではない。[彼らは]他人の作品を盗用し、それを[自分たちの]製品の品質を偽って宣伝する手段として利用した。つまり、他人のより高品質な音声AIを使って[Voiceverse]を宣伝し、自分たちの利益につなげたのだ。
{{cite journal}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)