WaveNetは、生の音声を生成するための深層ニューラルネットワークです。ロンドンに拠点を置くAI企業DeepMindの研究者によって開発されました。2016年9月の論文[ 1 ]で概説されたこの技術は、実際の音声録音で訓練されたニューラルネットワーク手法を使用して波形を直接モデル化することにより、比較的リアルな人間の声のような音声を生成できます。米国英語と中国語でのテストでは、このシステムがGoogleの既存の最高のテキスト読み上げ(TTS)システムを上回ることが示されたと報告されていますが、2016年の時点では、テキスト読み上げ合成は実際の人間の音声よりも説得力に欠けていました。[ 2 ] WaveNetは生の波形を生成できるため、音楽を含むあらゆる種類の音声をモデル化できます。[ 3 ]
テキストから音声を生成することは、AppleのSiri、MicrosoftのCortana、Amazon Alexa、Googleアシスタントなどのソフトウェアの人気のおかげで、ますます一般的なタスクになっています。[ 4 ]
こうしたシステムのほとんどは、連結された音声断片を組み合わせて認識可能な音や単語を形成する技術のバリエーションを使用しています。[ 5 ]最も一般的なものは連結型TTSと呼ばれています。[ 6 ]これは、単一の話者から録音された音声断片の大規模なライブラリで構成されており、それらを連結して完全な単語や音を生成します。結果は不自然に聞こえ、奇妙な抑揚とトーンになります。[ 7 ]録音されたライブラリに依存しているため、音声を修正または変更することも困難です。[ 8 ]
パラメトリックTTSと呼ばれる別の手法[ 9 ]では、数学モデルを使用して音を再現し、それを単語や文章に組み立てます。音を生成するために必要な情報は、モデルのパラメータに格納されます。出力音声の特性はモデルへの入力によって制御され、音声は通常、ボコーダーと呼ばれる音声シンセサイザーを使用して生成されます。この方法でも、不自然な音声になることがあります。

WaveNetは、ディープ畳み込みニューラルネットワーク(CNN)として知られるフィードフォワードニューラルネットワークの一種です。WaveNetでは、CNNは生の信号を入力として受け取り、一度に1サンプルずつ出力を合成します。これは、μ法則圧縮変換を使用してエンコードされ、256個の可能な値に量子化された信号値のソフトマックス(つまりカテゴリカル)分布からサンプリングすることによって行われます。 [ 11 ]
DeepMindが2016年9月に発表した研究論文「WaveNet: A Generative Model for Raw Audio」[ 12 ]によると、このネットワークには英語と中国語の実際の音声波形が入力されました。これらの波形がネットワークを通過すると、ネットワークは音声波形が時間とともにどのように変化するかを記述する一連のルールを学習します。訓練されたネットワークは、1秒あたり16,000サンプルで音声のような新しい波形を生成するために使用できます。これらの波形にはリアルな呼吸音や唇を鳴らす音が含まれます が、どの言語にも準拠していません。[ 13 ]
WaveNetは、入力のアクセントやトーンが出力と相関するなど、さまざまな声を正確にモデル化することができます。たとえば、ドイツ語で学習させると、ドイツ語の音声を生成します。[ 14 ]この機能は、WaveNetに 音楽などの他の入力を与えると 、その出力が音楽になることを意味します。リリース当時、DeepMindはWaveNetがクラシック音楽のような波形を生成できることを示しました。[ 15 ]
2018 年 6 月の論文「Disentangled Sequential Autoencoder」[ 16 ]によると、DeepMind は WaveNet をオーディオと音声の「コンテンツ交換」にうまく利用しています。ネットワークは、元の録音のテキストやその他の特徴を維持しながら、オーディオ録音の音声を別の既存の音声と交換できます。「オーディオシーケンスデータでも実験を行いました。私たちの分離表現により、音声の内容に基づいて話者のアイデンティティを相互に変換できます。」(p. 5) 「オーディオの場合、これにより男性話者を女性話者に、またその逆も変換できます。 [...]」(p. 1) 論文によると、WaveNet が満足できる品質で音声を変換できるようになる前に、ソース音声とターゲット音声の両方の既存の音声録音を 2 桁の時間 (約 50 時間) 以上入力して、それぞれの特徴を学習する必要があります。著者らは、「このモデルの利点は、動的な特徴と静的な特徴を分離できることである」と強調している(8ページ )。つまり、WaveNetは、一方では音声テキストと配信モード(変調、速度、ピッチ、ムードなど)を区別して、ある音声から別の音声への変換中に維持することができ、他方では、切り替える必要のあるソース音声とターゲット音声の両方の基本的特徴を区別することができる。
2019 年 1 月に発表されたフォローアップ論文「WaveNet オートエンコーダを使用した教師なし音声表現学習」[ 17 ]では、既存の音声録音の音声の交換など、「コンテンツ交換」における動的特徴と静的特徴の適切な自動認識と識別を効果的に強化し、信頼性を高める方法が詳しく説明されています。また、2018 年 9 月 (最新改訂 2019 年 1 月) に発表された別のフォローアップ論文「サンプル効率の高い適応型テキスト音声変換」[ 18 ]では、DeepMind が WaveNet を介して既存の音声をサンプリングするために必要な実世界の録音の最小量を「わずか数分の音声データ」にまで削減しつつ、高品質な結果を維持することに成功したと述べています。
WaveNetの音声クローン技術は、生者と死者の声を模倣する能力に関して倫理的な懸念を引き起こしている。2016年のBBCの記事によると、同様の音声クローン技術に取り組んでいる企業( Adobe Vocoなど)は、偽造を防ぐために人間には聞こえない透かしを挿入する意向だが、例えばエンターテインメント業界の目的を満たす音声クローンは、法医学的証拠方法や電子IDデバイスを欺くために必要な方法よりもはるかに複雑ではなく、異なる方法を使用するため、自然な声とエンターテインメント業界向けにクローンされた声は、技術的な分析によって容易に区別できると主張している。[ 19 ]
DeepMindは、WaveNetのリリース当時、実世界のアプリケーションで使用するには計算処理能力が高すぎると述べていました。[ 20 ] 2017年10月現在、Googleは音声品質の向上とともに1,000倍のパフォーマンス向上を発表しました。その後、WaveNetはすべてのGoogleプラットフォームで米国英語と日本語のGoogleアシスタントの音声を生成するために使用されました。 [ 21 ] 2017年11月、DeepMindの研究者は、「リアルタイムの20倍以上の速さで高忠実度の音声サンプルを生成する」という提案手法を詳述した研究論文を発表しました。これは「確率密度蒸留」と呼ばれています。[ 22 ] 2018年5月の年次I/O開発者会議で、WaveNetによって可能になった新しいGoogleアシスタントの音声が利用可能になったことが発表されました。WaveNetは、声優サンプルの生の音声をモデル化することで、音声モデルを作成するために必要な音声録音の数を大幅に削減しました。[ 23 ]