深層学習による音声合成とは、深層学習モデル を用いて、書かれたテキスト(テキスト音声合成)またはスペクトル(ボコーダー)から自然な人間の音声を生成する技術を指します。深層ニューラルネットワークは、大量の録音音声データを用いて学習され、テキスト音声合成システムの場合は、関連するラベルや入力テキストも学習に用いられます。
入力テキストまたは言語単位のシーケンスが与えられた場合目標スピーチから導き出すことができる
どここれはモデルパラメータのセットです。
通常、入力テキストはまず音響特徴生成器に渡され、次に音響特徴がニューラルボコーダーに渡されます。音響特徴生成器の場合、損失関数は通常、L1損失(平均絶対誤差、MAE)またはL2損失(平均二乗誤差、MSE)です。これらの損失関数は、出力音響特徴分布がガウス分布またはラプラシアン分布でなければならないという制約を課します。実際には、人間の音声帯域は約300~ 4000Hzであるため、損失関数はこの範囲でより大きなペナルティを与えるように設計されます。
どこ人間の声帯からの損失であり、はスカラー値で、通常は0.5前後です。音響特徴量は通常、スペクトログラムまたはメルスケールです。これらの特徴量は音声信号の時間周波数関係を捉えるため、インテリジェントな出力を生成するのに十分です。音声認識タスクで使用されるメル周波数ケプストラム特徴量は、情報量を削減しすぎるため、音声合成には適していません。

2016年9月、DeepMindはWaveNetをリリースし、深層学習ベースのモデルが生の波形をモデル化し、スペクトログラムやメルスペクトログラムなどの音響特徴から音声を生成できることを実証しました。WaveNetは当初、計算コストが高く、当時の消費者向け製品で使用するには遅いと考えられていましたが、リリースから1年後、DeepMindはWaveNetの改良版である「Parallel WaveNet」を発表しました。これは、オリジナルよりも1,000倍高速な製品モデルです。[ 1 ]

これに続いて、Google AIが2018年に発表されたTacotron 2は、ニューラルネットワークが非常に自然な音声合成を生成できることを実証しましたが、許容できる品質を達成するには、通常数十時間の音声という膨大なトレーニングデータが必要でした。Tacotron 2は、アテンションメカニズムオートエンコーダーアーキテクチャ入力テキストをメルスペクトログラムに変換し、それを別のニューラルボコーダー。2時間の音声などのより小さなデータセットでトレーニングした場合、出力品質は劣化しましたが、それでも聞き取りやすい音声を維持することができました。また、わずか24分のトレーニングデータでは、Tacotron 2は聞き取りやすい音声を生成できませんでした。 [ 2 ]
2019年にマイクロソフトリサーチはFastSpeechは、 Tacotron 2のような自己回帰モデルの速度制限に対処しました。 [ 3 ] FastSpeechは、並列シーケンス生成を可能にする非自己回帰アーキテクチャを採用し、音声品質を維持しながら推論時間を大幅に短縮しました。フィードフォワードトランスフォーマーネットワークによりワンショットで予測する、従来のアプローチのボトルネックとなっていたシーケンス依存性を回避しました。 [ 3 ]同年には、HiFi-GANは、高忠実度音声を生成しながら波形生成の効率を向上させた、生成敵対ネットワーク(GAN)ベースのボコーダーです。 [ 4 ] 2020年にリリースされたGlow-TTSは、高速な推論と音声スタイルの転送機能を可能にするフローベースのを導入しました。 [ 5 ]
2020年3月、無料のテキスト読み上げウェブサイト15.aiが立ち上げられました。15.aiは、最小限のデータで人気メディアの架空のキャラクターの感情表現豊かな音声を合成できることから、2021年初頭に国際的に広く注目を集めました。[ 6 ] [ 7 ] [ 8 ] 15.aiの開発者(15という仮名で知られています)は、15秒のトレーニングデータで人の声を完全にクローンできると述べています(そのため、名前は「15.ai」です)。これは、従来知られていた数十時間分のデータ要件から大幅に削減されたものです。[ 9 ] 15.aiは、ミームやコンテンツ作成でAI音声クローンを普及させた最初のプラットフォームとして評価されています。[ 10 ] [ 11 ] [ 9 ] 15.aiは、複数の声と感情を同時にトレーニングできるマルチスピーカーモデルを使用し、DeepMojiを使用して感情分析を実装し、 ARPABETを介して正確な発音制御をサポートしました。[ 9 ] [ 6 ] 15秒のデータ効率ベンチマークは、後に2024年にOpenAIによって裏付けられました。 [ 12 ]
現在、自己教師あり学習はラベルなしデータのより良い利用により大きな注目を集めている。研究によると、自己教師あり損失の助けを借りて、ペアデータの必要性が減少することが示されている。[ 13 ] [ 14 ]
ゼロショット話者適応は、単一のモデルでさまざまな話者のスタイルと特徴を持つ音声を生成できるため有望です。2018 年 6 月、Google は、事前学習済みの話者検証モデルを話者エンコーダーとして使用して話者埋め込みを抽出することを提案しました。[ 15 ]話者エンコーダーはニューラルテキスト音声変換モデルの一部となり、出力音声のスタイルと特徴を決定できるようになります。この手順により、単一のモデルのみを使用して複数のスタイルの音声を生成できることがコミュニティに示されました。
深層学習に基づく音声合成において、ニューラルボコーダーは音響特徴から高品質な音声を生成する上で重要な役割を果たします。 2016年に提案されたWaveNetモデルは、音声品質において優れた性能を発揮します。WaveNetは波形の同時確率を因数分解します。条件付き確率の積として、以下のように表される。
どこは、多数の拡張畳み込み層を含むモデルパラメータです。したがって、各オーディオサンプルはこれは、すべての以前のタイムステップのサンプルに基づいて条件付けられます。しかし、WaveNet の自己回帰的な性質により、推論プロセスが著しく遅くなります。この問題を解決するために、Parallel WaveNet [ 16 ]が提案されました。Parallel WaveNet は、事前学習済みの教師 WaveNet モデルを使用した知識蒸留によってトレーニングされる逆自己回帰フローベースモデルです。このような逆自己回帰フローベースモデルは、推論を実行するときに自己回帰しないため、推論速度はリアルタイムよりも速くなります。一方、Nvidia は、リアルタイムよりも速く音声を生成できるフローベースの WaveGlow [ 17 ]モデルを提案しました。しかし、推論速度は高いものの、Parallel WaveNet には事前学習済みの WaveNet モデルが必要であるという制限があり、限られたコンピューティング デバイスでは WaveGlow が収束するまでに何週間もかかります。この問題は、マルチ解像度スペクトル損失と GAN 学習戦略によって音声を生成することを学習するParallel WaveGAN [ 18 ]によって解決されました。