音声合成とは、人間の音声を人工的に生成することです。この目的で使用されるコンピュータシステムは音声合成装置と呼ばれ、ソフトウェアまたはハードウェア製品で実装できます。テキスト音声合成(TTS )システムは、通常の言語テキストを音声に変換します。他のシステムは、音声転写などの記号的な言語表現を音声に変換します。 [ 1 ]逆のプロセスは音声認識です。
合成音声は、データベースに保存されている録音音声の断片を連結することによって作成できます。システムによって保存される音声単位のサイズが異なります。音素または二重音素を保存するシステムは最も広い出力範囲を提供しますが、明瞭さに欠ける場合があります。特定の用途領域では、単語全体または文全体を保存することで高品質の出力が可能になります。あるいは、シンセサイザーは声道モデルやその他の人間の声の特徴を組み込んで、完全に「合成」された音声出力を作成することもできます。[ 2 ]
音声合成器の品質は、人間の声との類似性と明瞭な聞き取りやすさによって判断されます。理解しやすいテキスト読み上げプログラムにより、視覚障害や読字障害のある人が自宅のコンピュータで書かれた言葉を聞くことができます。音声合成器を搭載した最初のコンピュータオペレーティングシステムは、1974 年のUnixで、Unix speakユーティリティを介して実現されました。[ 3 ] 2000 年、Microsoft Sam は、すべての Windows 2000 オペレーティングシステムと後継の Windows XP システムに付属するナレーターアクセシビリティ機能で使用されるデフォルトのテキスト読み上げ音声合成器でした。

テキスト音声合成システム(または「エンジン」)は、フロントエンドとバックエンドの 2 つの部分で構成されています。[ 4 ]フロントエンドには2 つの主要なタスクがあります。まず、数字や略語などの記号を含む生のテキストを、書き出された単語に相当するものに変換します。このプロセスは、テキスト正規化、前処理、またはトークン化と呼ばれることがよくあります。次に、フロントエンドは各単語に音声転写を割り当て、テキストを句、節、文などの韻律単位に分割してマークします。単語に音声転写を割り当てるプロセスは、テキストから音素への変換、または文字から音素への変換と呼ばれます。音声転写と韻律情報は、フロントエンドによって出力される記号言語表現を構成します。次に、バックエンド(シンセサイザーと呼ばれることが多い)が、記号言語表現を音に変換します。特定のシステムでは、この部分には目標プロソディ(ピッチ輪郭、音素持続時間)の計算が含まれており、 [ 5 ]それが出力音声に適用される。
電子信号処理が発明されるずっと以前から、人間の言葉を模倣する機械を作ろうとした人々がいた。[ 6 ]また、シルヴェスター2世教皇(西暦1003年没)、アルベルトゥス・マグヌス(1198年~1280年)、ロジャー・ベーコン(1214年~1294年)などに関する「青銅の頭」の存在についての伝説もあった。[ 7 ]
1779年、ドイツ系デンマーク人の科学者クリスティアン・ゴットリープ・クラッツェンシュタインは、ロシア帝国科学芸術アカデミーが発表したコンテストで、5つの長母音(国際音声記号表記:[aː]、[eː]、 [iː]、 [oː]、[ uː])を発音できる人間の声道の模型を製作し、1等賞を獲得した。[ 8 ]その後、ハンガリーのプレスブルク出身のヴォルフガング・フォン・ケンペレンが、1791年の論文で説明した、ふいごで動く「音響機械式発声機」を製作した。 [ 9 ]この機械は舌と唇の模型を追加し、母音だけでなく子音も発音できるようにした。1837年、チャールズ・ホイートストンはフォン・ケンペレンの設計に基づいた「発声機」を製作し、1846年にはジョセフ・ファーバーが「ユーフォニア」を展示した。 1923年、パジェットはホイートストンのデザインを復活させた。[ 10 ]
1930年代、ベル研究所は音声を基本音と共鳴音に自動的に分解するボコーダーを開発した。ホーマー・ダドリーはボコーダーの研究から、キーボード操作式の音声合成装置「ザ・ヴォーダー(音声デモンストレーター)」を開発し、 1939年のニューヨーク万国博覧会で展示した。
フランクリン・S・クーパーとハスキンズ研究所の同僚たちは、1940年代後半にパターン再生装置を開発し、1950年に完成させた。この装置にはいくつかの異なるバージョンが存在したが、現在残っているのは1つだけである。この装置は、音声の音響パターンをスペクトログラムの形で画像化し、それを音に変換する。アルビン・リバーマンらはこの装置を用いて、音素(子音と母音)の知覚に関わる音響的手がかりを発見した。

最初のコンピュータベースの音声合成システムは1950年代後半に誕生しました。 1968年、日本の電気技術研究所で、梅田典子らが最初の汎用英語テキスト音声合成システムを開発しました。 [ 11 ] 1961年、物理学者のジョン・ラリー・ケリー・ジュニアと彼の同僚のルイス・ガーストマン[ 12 ]は、 IBM 7090コンピュータを使用して音声を合成しました。これはベル研究所の歴史上最も注目すべき出来事の1つです。[ 13 ]ケリーのボイスレコーダーシンセサイザー(ボコーダー)は、マックス・マシューズの音楽伴奏で「デイジー・ベル」という曲を再現しました。偶然にも、アーサー・C・クラークはベル研究所のマレーヒル施設で友人であり同僚のジョン・ピアースを訪ねていました。クラークはそのデモンストレーションに非常に感銘を受け、小説『2001年宇宙の旅』の脚本のクライマックスシーンでそれを使用した[ 14 ] 。そのシーンでは、宇宙飛行士のデイブ・ボーマンがHAL 9000コンピューターを眠らせる際に、HAL 9000が同じ歌を歌う[ 15 ] 。純粋な電子音声合成の成功にもかかわらず、機械音声合成装置の研究は続いている[ 16 ] 。
音声符号化の一種である線形予測符号化(LPC)は、 1966年に名古屋大学の板倉文忠と日本電信電話(NTT)の齋藤修三の研究によって開発が始まった。LPC技術のさらなる発展は、1970年代にベル研究所のビシュヌ・S・アタルとマンフレッド・R・シュローダーによって行われた。[ 17 ] LPCは後に、1978年のSpeak & Spell玩具で使用されたテキサス・インスツルメンツのLPC音声チップなど、初期の音声合成チップの基礎となった。
1975年、板倉文忠はNTT在籍中に、高圧縮音声符号化のための線スペクトル対(LSP)方式を開発した。 [ 18 ] [ 19 ] [ 20 ] 1975年から1981年にかけて、板倉はLSP方式に基づく音声分析と合成の問題を研究した。[ 20 ] 1980年、彼のチームはLSPベースの音声合成チップを開発した。LSPは音声合成と符号化のための重要な技術であり、1990年代にはほぼすべての国際音声符号化規格に必須の構成要素として採用され、モバイルチャネルやインターネットを介したデジタル音声通信の強化に貢献した。[ 19 ]
1975年にMUSAがリリースされ、最初の音声合成システムの1つとなりました。これはスタンドアロンのコンピュータハードウェアと、イタリア語を読み上げるための専用ソフトウェアで構成されていました。1978年にリリースされた第2バージョンでは、イタリア語を「アカペラ」スタイルで歌うこともできました。[ 21 ]
1980年代と1990年代の主流システムは、MITのデニス・クラットの研究に大きく基づいたDECtalkシステムとベル研究所のシステムでした。[ 22 ]後者は、自然言語処理手法を幅広く利用した、最初の多言語非依存システムの1つでした。


音声合成機能を搭載した携帯型電子機器は1970年代に登場し始めた。その最初のものの1つは、 1976年にTelesensory Systems Inc. (TSI)が発売した視覚障害者向けの携帯型計算機Speech+である。 [ 23 ] [ 24 ]他のデバイスは主に教育目的で、1978年にテキサス・インスツルメンツが製造したおもちゃのSpeak & Spellなどがある。 [ 25 ]フィデリティは1979年に電子チェスコンピュータの音声バージョンを発売した。[ 26 ]音声合成機能を搭載した最初のビデオゲームは、1980年にサン・エレクトロニクスが発売したシューティングアーケードゲームStratovox(日本ではSpeak & Rescueとして知られる)である。[ 27 ] [ 28 ]音声合成機能を搭載した最初のパーソナルコンピュータゲームは、1980年にPET 2001向けにリリースされた万引き少女で、ゲーム開発者の鈴木浩氏は、合成音声波形を生成するために「ゼロクロス」プログラミング技術を開発しました。[ 29 ]もう1つの初期の例として、アーケード版のバーザークも1980年に登場しました。ミルトン・ブラッドリー社は、同年、音声合成機能を使用した最初のマルチプレイヤー電子ゲーム「ミルトン」を制作しました。
1976年、Computalker Consultants社はCT-1音声シンセサイザーを発売した。D. Lloyd RiceとJim Cooperによって設計されたこのシンセサイザーは、S-100バス規格を使用するマイクロコンピュータと連携するように構築されたアナログシンセサイザーだった。[ 30 ]
合成音声は、1990年にAT&Tベル研究所のアン・シルダルが女性の声を作り出すまで、一般的に男性の声に聞こえた。 [ 31 ]
レイ・カーツワイルは2005年に、コストパフォーマンス比によって音声合成装置がより安価で入手しやすくなるにつれて、テキスト読み上げプログラムの使用から恩恵を受ける人が増えるだろうと予測した。[ 32 ]
2016 年 9 月、DeepMind はWaveNetをリリースし、ディープラーニングモデルが生の波形をモデル化し、スペクトログラムやメル スペクトログラムなどの音響特徴から音声を生成できることを実証し、ディープラーニング音声合成の分野を始めました。WaveNet は当初、計算コストが高く、当時の消費者向け製品で使用するには遅いと考えられていましたが、リリースから 1 年後、DeepMind は WaveNet の改良版である「Parallel WaveNet」を発表しました。これは、オリジナルよりも 1,000 倍高速な製品モデルです。[ 33 ]これに続いて、 2018 年にGoogle AIの Tacotron 2 が登場し、ニューラル ネットワークが非常に自然な音声合成を生成できることを実証しましたが、許容できる品質を達成するには、通常数十時間の音声という相当なトレーニング データが必要でした。Tacotron 2 は、アテンション メカニズムを備えたオートエンコーダーアーキテクチャを使用して入力テキストをメル スペクトログラムに変換し、それを別のニューラルボコーダーを使用して波形に変換しました。 2時間分の音声などのより小さなデータセットでトレーニングした場合、出力品質は低下するものの、聞き取りやすい音声は維持でき、わずか24分のトレーニングデータでは、Tacotron 2は聞き取りやすい音声を生成できなかった。[ 34 ]
2019年、Microsoft ResearchはTacotron 2のような自己回帰モデルの速度制限に対処するFastSpeechを発表しました。[ 35 ]同年には、高忠実度の音声を生成しながら波形生成の効率を向上させるGANベースのボコーダーであるHiFi-GANがリリースされました。 [ 36 ] 2020年には、高速推論と音声スタイル転送機能の両方を可能にするフローベースのアプローチを導入したGlow-TTSがリリースされました。 [ 37 ]
2020年3月、無料のテキスト読み上げウェブサイト15.aiが立ち上げられました。15.aiは、最小限のデータで人気メディアの架空のキャラクターの感情表現豊かな音声を合成できることから、2021年初頭に国際的に広く注目を集めました。[ 38 ] [ 39 ] [ 40 ] 15.aiの開発者は、15秒のトレーニングデータで人の声を完璧にクローンできると述べています(そのため「15.ai」という名前が付けられました)。これは、従来知られていた数十時間分のデータ要件から大幅に削減されたものです。[ 41 ] 15.aiは、ミームやコンテンツ作成でAI音声クローンを普及させた最初のプラットフォームとして評価されています。[ 42 ] [ 43 ] [ 41 ] 2022年1月、 Voiceverseという暗号通貨会社が15.aiを使って音声を生成し、ピッチを上げて聞き取れないようにし、自社技術の副産物として宣伝し、許可なくNFTとして販売した際に、音声合成NFT詐欺の最初の事例が発生した。 [ 44 ] [ 45 ] [ 46 ] [ 47 ]
2023年1月、ElevenLabsはブラウザベースのテキスト読み上げプラットフォームをリリースしました。このプラットフォームは、高度なアルゴリズムを使用してテキストの文脈的側面を分析し、怒り、悲しみ、喜び、または警戒などの感情を検出します。[ 48 ] [ 49 ] [ 50 ]このプラットフォームは、言語的文脈に基づいてイントネーションとペースを調整して、人間のような抑揚のあるリアルな音声を生成することができ、多言語音声生成や長文コンテンツ作成などの機能を提供します。[ 51 ] [ 52 ]
2024年3月、OpenAIは人間の声をクローンするベンチマークを15秒で達成したことを確認した。[ 53 ]しかし、彼らはVoice Engineツールを一般公開するには「リスクが高すぎる」と判断し、プレビュー版のみを公開し、一般向けには公開しないと表明した。[ 54 ]
音声合成システムの最も重要な特性は、自然さと明瞭さです。[ 55 ]自然さとは、出力が人間の音声にどれだけ近いかを表し、明瞭さとは、出力がどれだけ容易に理解できるかを表します。理想的な音声合成装置は、自然さと明瞭さの両方を備えています。音声合成システムは通常、両方の特性を最大化しようとします。
合成音声波形を生成する主要な技術は、連結合成とフォルマント合成の2つです。それぞれの技術には長所と短所があり、合成システムの用途によってどちらの手法が採用されるかが決まります。
連結合成は、録音された音声のセグメントを連結(つなぎ合わせる)することに基づいています。一般的に、連結合成は最も自然な音声合成を実現します。しかし、音声の自然な変化と波形をセグメント化する自動技術の性質との違いにより、出力に聞き取れるノイズが発生する場合があります。連結合成には、主に3つのサブタイプがあります。
ユニット選択合成では、録音された音声の大規模なデータベースを使用します。データベースの作成中、録音された各発話は、個々の音素、二重音素、半音素、音節、形態素、単語、句、文など、一部またはすべてに分割されます。通常、セグメントへの分割は、波形やスペクトログラムなどの視覚的表現を使用して、後で手動で修正した後、「強制アライメント」モードに設定された特別に修正された音声認識器を使用して行われます。[ 56 ]次に、セグメンテーションと、基本周波数(ピッチ)、持続時間、音節内の位置、隣接する音素などの音響パラメータに基づいて、音声データベース内のユニットのインデックスが作成されます。実行時には、データベースから候補ユニットの最適な連鎖を決定することによって、目的のターゲット発話が作成されます(ユニット選択)。このプロセスは通常、特別に重み付けされた決定木を使用して実行されます。
ユニット選択は、録音された音声に少量のデジタル信号処理(DSP)しか適用しないため、最も自然な音声を実現します。DSPは録音された音声を不自然に聞こえるようにすることが多いですが、一部のシステムでは、波形を滑らかにするために連結の時点で少量の信号処理を使用しています。最高のユニット選択システムからの出力は、特にTTSシステムが調整されている状況では、実際の人間の声と区別がつかないことがよくあります。しかし、最大限の自然さを実現するには、通常、ユニット選択音声データベースが非常に大きく、システムによっては数十時間の音声を表すギガバイトの録音データに達することもあります。[ 57 ]また、ユニット選択アルゴリズムは、データベース内により良い選択肢が存在する場合でも、理想的とは言えない合成結果(たとえば、小さな単語が不明瞭になる)をもたらす場所からセグメントを選択することが知られています。[ 58 ]最近、研究者たちは、ユニット選択音声合成システムにおける不自然なセグメントを検出するためのさまざまな自動化手法を提案しています。[ 59 ]
二音素合成では、言語に存在するすべての二音素(音から音への遷移)を含む最小限の音声データベースを使用します。二音素の数は言語の音韻構造に依存します。たとえば、スペイン語には約 800 個の二音素があり、ドイツ語には約 2500 個の二音素があります。二音素合成では、音声データベースには各二音素の例が 1 つだけ含まれています。実行時には、線形予測符号化、PSOLA [ 60 ]、MBROLA [ 61 ]などのデジタル信号処理技術、または離散コサイン変換を使用したソース領域でのピッチ変更[ 62 ]などのより新しい技術によって、文の目標プロソディがこれらの最小単位に重ね合わされます。二音素合成は、連結合成の音響的グリッチとフォルマント合成のロボットのような音の性質に悩まされており、サイズが小さいこと以外にはどちらのアプローチの利点もほとんどありません。そのため、商用アプリケーションでの使用は減少傾向にあるが、無料で利用できるソフトウェア実装が多数存在するため、研究用途では引き続き使用されている。 ダイフォン合成の初期の例としては、マイケル・J・フリーマンが発明した教育ロボット、リーチムがある。[ 63 ]リーチムには、授業カリキュラムに関する情報と、教えるようにプログラムされた生徒に関する特定の経歴情報が含まれていた。[ 64 ]ニューヨーク州ブロンクスの4年生の教室でテストされた。[ 65 ] [ 66 ]
ドメイン固有の合成は、事前に録音された単語やフレーズを連結して完全な発話を作成します。これは、システムが出力するテキストの種類が特定のドメインに限定されているアプリケーションで使用されます。たとえば、交通機関の時刻表のアナウンスや天気予報などです。[ 67 ]この技術は実装が非常に簡単で、音声時計や電卓などのデバイスで長年商用利用されています。これらのシステムの自然さのレベルは、文の種類が限られており、元の録音の韻律やイントネーションに非常に近いため、非常に高くなります。
これらのシステムはデータベース内の単語やフレーズによって制限されているため、汎用性はなく、事前にプログラムされた単語やフレーズの組み合わせしか合成できません。しかし、自然言語における単語の混成は、多くのバリエーションを考慮しない限り、依然として問題を引き起こす可能性があります。たとえば、英語の非ローティック方言では、 「clear」/ˈklɪə/のような単語の「r」は、通常、次の単語の最初の文字が母音である場合にのみ発音されます(たとえば、「clear out」は/ˌklɪəɹˈʌʊt/と発音されます)。同様に、フランス語では、母音で始まる単語が後に続く場合、多くの語末子音が無音ではなくなります。これはリエゾンと呼ばれる現象です。このような交替は、単純な単語連結システムでは再現できず、文脈に応じてさらに複雑化する必要があります。
フォルマント合成では、実行時に人間の音声サンプルを使用しません。代わりに、合成音声出力は加算合成と音響モデル(物理モデリング合成)を使用して作成されます。[ 68 ]基本周波数、有声性、ノイズレベルなどのパラメータが時間とともに変化し、人工音声の波形が作成されます。この方法はルールベース合成と呼ばれることもありますが、多くの連結システムにもルールベースのコンポーネントがあります。フォルマント合成技術に基づく多くのシステムは、人間の音声と間違えることのない、ロボットのような人工音声を生成します。しかし、音声合成システムの目標は常に最大限の自然さではなく、フォルマント合成システムは連結システムよりも優れています。フォルマント合成音声は、連結システムによく見られる音響グリッチを回避し、非常に高速でも確実に聞き取ることができます。高速合成音声は、視覚障害者がスクリーンリーダーを使用してコンピュータを素早くナビゲートするために使用されます。フォルマントシンセサイザーは、音声サンプルデータベースを持たないため、連結型システムよりも一般的にプログラムサイズが小さくなります。そのため、メモリやマイクロプロセッサの処理能力が特に限られている組み込みシステムでの使用に適しています。フォルマントベースのシステムは出力音声のあらゆる側面を完全に制御できるため、多様な韻律やイントネーションを出力でき、質問や陳述だけでなく、さまざまな感情や声のトーンを伝えることができます。
フォルマント合成における非リアルタイムながら高精度なイントネーション制御の例としては、1970年代後半にテキサス・インスツルメンツの玩具「Speak & Spell」で行われた研究や、1980年代初頭にセガのアーケードゲーム機[ 69 ]、そしてアタリ社の多くのアーケードゲーム[ 70 ]でTMS5220 LPCチップを使用して行われた研究などが挙げられる。これらのプロジェクトで適切なイントネーションを作成するのは骨の折れる作業であり、その結果はリアルタイムのテキスト読み上げインターフェースではまだ実現されていない[ 71 ] 。
中国語や台湾語のような声調言語では、さまざまなレベルの声調変化が必要であり、音声合成装置の出力では声調変化の誤りが生じる場合がある。[ 72 ]
調音合成とは、人間の声道のモデルとそこで起こる調音過程に基づいて音声を合成する計算技術のことである。実験室での実験に定期的に使用された最初の調音合成装置は、1970年代半ばにハスキンズ研究所でフィリップ・ルービン、トム・ベア、ポール・メルメルスタインによって開発された。ASYとして知られるこの合成装置は、1960年代から1970年代にかけてベル研究所でポール・メルメルスタイン、セシル・コーカーらが開発した声道モデルに基づいていた。
最近まで、調音合成モデルは商用音声合成システムには組み込まれていませんでした。注目すべき例外は、カルガリー大学のスピンオフ企業であるTrillium Sound Researchが開発・販売したNeXTベースのシステムです。このシステムでは、当初の研究の多くが行われました。NeXTの様々な形態( 1980年代後半にスティーブ・ジョブズによって設立され、1997年にApple Computerと合併)が終焉を迎えた後、TrilliumのソフトウェアはGNU General Public Licenseの下で公開され、gnuspeechとして開発が続けられました。1994年に初めて販売されたこのシステムは、Carréの「弁別領域モデル」によって制御される人間の口腔および鼻腔の導波管または伝送線路アナログを使用して、完全な調音ベースのテキスト音声変換を提供します。
ホルヘ・C・ルセロとその同僚によって開発されたより新しいシンセサイザーは、声帯の生体力学、声門の空気力学、気管支、気管、鼻腔、口腔における音波伝播のモデルを組み込んでおり、物理ベースの音声シミュレーションの完全なシステムを構成している。[ 73 ] [ 74 ]
HMMベースの合成は、隠れマルコフモデルに基づく合成手法であり、統計的パラメトリック合成とも呼ばれます。このシステムでは、音声の周波数スペクトル(声道)、基本周波数(声源)、および持続時間(韻律)がHMMによって同時にモデル化されます。音声波形は、最尤基準に基づいてHMM自体から生成されます。[ 75 ]
正弦波合成は、フォルマント(主要なエネルギー帯域)を純音の笛で置き換えることによって音声を合成する技術である。 [ 76 ]
深層学習による音声合成は、深層ニューラルネットワーク(DNN)を用いて、テキスト(テキスト音声合成)またはスペクトル(ボコーダー)から人工音声を生成します。深層ニューラルネットワークは、大量の録音音声データを用いて学習され、テキスト音声合成システムの場合は、関連するラベルや入力テキストも学習に用いられます。
音声ディープフェイク技術は、音声クローニングまたはディープフェイクオーディオとも呼ばれ、特定の人物を説得力をもって模倣する音声を生成するように設計された人工知能の応用であり、多くの場合、その人物は一度も話したことのないフレーズや文章を合成します。[ 77 ] [ 78 ] [ 79 ] [ 80 ]
当初は人間の生活のさまざまな側面を向上させる目的で開発されたもので、オーディオブックの生成や、病状により声を失った人々の支援など、実用的な用途があります。[ 81 ] [ 82 ]さらに、パーソナライズされたデジタルアシスタントの作成、自然な音声のテキスト読み上げシステム、高度な音声翻訳サービスなど、商業的な用途もあります。[ 83 ]他の形式のディープフェイクと同様に、オーディオディープフェイクも詐欺、フィッシング、誤情報キャンペーンでの使用について批判を受けています。
2023年、VICEの記者ジョセフ・コックスは、自分が話している5分間の音声を録音し、ElevenLabsが開発したツールを使用して、銀行の音声認証システムを突破する音声ディープフェイクを作成したという調査結果を発表した。[ 84 ]
テキストの正規化プロセスは、決して単純なものではありません。テキストには、同音異義語、数字、略語などが多数含まれており、これらはすべて音声表現に展開する必要があります。英語には、文脈によって発音が異なる綴りが数多く存在します。例えば、「My latest project is to learn how to better project my voice」という文には、「project」という単語の2つの発音が含まれています。
ほとんどのテキスト音声合成(TTS)システムは、入力テキストの意味表現を生成しません。なぜなら、意味表現を生成するプロセスは信頼性が低く、十分に理解されておらず、計算効率も悪いためです。そのため、同形異義語の曖昧さを解消する適切な方法を推測するために、近隣の単語を調べたり、出現頻度に関する統計情報を使用したりするなど、さまざまなヒューリスティックな手法が用いられています。
近年、音声合成システムでは、同形異義語の曖昧性解消を支援するために、「品詞」を生成する際に、HMM(前述の通り)が用いられるようになってきています。この手法は、「read」を過去形を意味する「red」と発音すべきか、現在形を意味する「reed」と発音すべきかといった多くのケースで非常に有効です。このようにHMMを用いる場合の典型的なエラー率は5%未満です。これらの手法は、ほとんどのヨーロッパ言語にも有効ですが、これらの言語では必要な学習コーパスへのアクセスが困難な場合が多いのが現状です。
数字の変換方法を決定することも、TTS システムが対処しなければならないもう 1 つの問題です。数字を単語に変換することは (少なくとも英語では) プログラミング上の簡単な課題です。たとえば、「1325」は「one thousand three hundred twenty-five」になります。しかし、数字はさまざまな文脈で使用されます。「1325」は「one three two five」、「thirteen twenty-five」、「thirteen hundred and twenty five」とも読み上げられます。TTS システムは、周囲の単語、数字、句読点に基づいて数字の展開方法を推測できることが多く、曖昧な場合は、システムが文脈を指定する方法を提供することもあります。[ 85 ]ローマ数字も文脈によって読み方が異なります。たとえば、「Henry VIII」は「Henry the Eighth」と読み上げられ、「Chapter VIII」は「Chapter Eight」と読み上げられます。
同様に、略語も曖昧になることがあります。たとえば、「inches」の略語「in」は「in」という単語と区別する必要があり、住所「12 St John St.」では「Saint」と「Street」の両方に同じ略語が使われています。インテリジェントなフロントエンドを備えたTTSシステムは、曖昧な略語について適切な推測を行うことができますが、他のシステムはすべての場合で同じ結果を返すため、「Ulysses S. Grant」が「Ulysses South Grant」と表示されるなど、意味不明な(そして時には滑稽な)出力になることがあります。
音声合成システムは、単語の綴りに基づいて発音を決定するために、2つの基本的なアプローチを使用します。このプロセスは、テキストから音素への変換、または文字から音素への変換と呼ばれることがよくあります(音素とは、言語学者が言語内の特徴的な音を表すために使用する用語です)。テキストから音素への変換の最も単純なアプローチは、辞書ベースのアプローチです。このアプローチでは、言語のすべての単語とその正しい発音を含む大規模な辞書がプログラムに格納されます。各単語の正しい発音を決定するには、辞書で各単語を検索し、綴りを辞書に指定された発音に置き換える必要があります。もう1つのアプローチはルールベースのアプローチで、発音ルールを単語に適用して、綴りに基づいて発音を決定します。これは、読み方を学ぶための「音読」または合成フォニックスのアプローチに似ています。
それぞれの方式には長所と短所があります。辞書方式は高速かつ正確ですが、辞書に登録されていない単語が入力されると完全に失敗します。辞書のサイズが大きくなるにつれて、音声合成システムのメモリ容量も増加します。一方、ルール方式はあらゆる入力に対応できますが、不規則な綴りや発音を考慮すると、ルールの複雑さが大幅に増します。(例えば、「of」という単語は英語では非常に一般的ですが、「f」が[v]と発音される唯一の単語です。)そのため、ほとんどすべての音声合成システムは、これらの方式を組み合わせて使用しています。
音素表記法を持つ言語は、非常に規則的な表記体系を持ち、綴りから単語の発音を予測する精度が非常に高い。このような言語向けの音声合成システムは、ルールベースの手法を多用し、外国語名や借用語など、綴りから発音が明らかでないごく一部の単語にのみ辞書を用いる。一方、英語のように綴りが非常に不規則な言語向けの音声合成システムは、辞書に頼る傾向が強く、ルールベースの手法は、珍しい単語や辞書に載っていない単語にのみ用いられる。
音声合成システムの評価は、普遍的に合意された客観的な評価基準が欠如しているため、一貫性を保つことが難しい場合があります。組織によって使用される音声データは異なることが多く、音声合成システムの品質は、音声生成技術(アナログ録音またはデジタル録音を含む)の品質や、音声再生に使用される設備にも左右されます。そのため、音声合成システムの評価は、音声生成技術や再生設備の違いによってしばしば損なわれてきました。
しかし、2005年以降、一部の研究者は共通の音声データセットを使用して音声合成システムの評価を開始した。[ 86 ]
英国ポーツマス大学のエイミー・ドラホタ氏らがSpeech Communication誌に発表した研究では、音声録音を聞いたリスナーは、偶然よりも高い精度で、話者が微笑んでいるかどうかを判断できると報告されている。[ 87 ] [ 88 ] [ 89 ]感情的な内容を示す音声の特徴を識別することで、合成音声をより自然に聞こえるようにできる可能性があると示唆されている。関連する問題の一つは、肯定文、疑問文、感嘆文のいずれであるかに応じて、文のピッチ輪郭を変更することである。ピッチ変更の手法の一つ[ 62 ]は、ソース領域(線形予測残差)で離散コサイン変換を使用する。このようなピッチ同期ピッチ変更手法では、音声の有声領域の統合線形予測残差に適用される動的破裂指数を用いたエポック抽出などの手法を用いて、合成音声データベースの事前ピッチマーキングが必要となる。[ 90 ] 一般的に、プロソディは音声合成装置にとって依然として課題であり、活発な研究テーマとなっている。

音声合成機能を内蔵した人気システム。
1980年代初頭、TIは音声合成のパイオニアとして知られており、TI-99/4および4A向けに非常に人気の高いプラグイン音声合成モジュールが提供されていました。音声合成モジュールは、一部のカートリッジの購入特典として無料で提供され、TIが開発した多くのビデオゲームで使用されました(このプロモーションで音声機能が搭載されたゲームには、AlpinerやParsecなどがありました)。この合成モジュールは、線形予測符号化の変種を使用しており、内蔵語彙は小規模です。当初の計画では、合成モジュールに直接接続できる小型カートリッジを発売し、デバイスの内蔵語彙を増やす予定でした。しかし、Terminal Emulator IIカートリッジにおけるソフトウェアによるテキスト読み上げの成功により、この計画は中止されました。
マテル社の ゲーム機「インテレビジョン」は、1982年に「インテリボイス」音声合成モジュールを提供しました。このモジュールには、着脱式カートリッジに搭載されたSP0256ナレーター音声合成チップが含まれていました。ナレーターは2KBの読み出し専用メモリ(ROM)を備えており、インテレビジョンのゲーム内でフレーズを作成するために組み合わせることができる汎用単語のデータベースを保存するために使用されました。ナレーターチップは外部メモリから音声データを受け入れることもできたため、必要な追加の単語やフレーズはカートリッジ自体に保存することができました。データは、単純なデジタルサンプルではなく、チップの合成音声器官モデルの動作を変更するためのアナログフィルタ係数の文字列で構成されていました。
同じく 1982 年にリリースされたSoftware Automatic Mouthは、初の商用完全ソフトウェア音声合成プログラムでした。後にMacintalkのベースとして使用されました。このプログラムは、Macintosh 以外の Apple コンピュータ (Apple II や Lisa を含む)、さまざまな Atari モデル、および Commodore 64 で利用可能でした。Apple 版は DAC を含む追加のハードウェアを推奨しましたが、カードがない場合はコンピュータの 1 ビットオーディオ出力 (かなりの歪みが加わる) を使用することができました。Atari は組み込みの POKEY オーディオ チップを使用しました。Atari での音声再生は通常、割り込み要求を無効にし、音声出力中は ANTIC チップをシャットダウンします。画面がオンになっているときの可聴出力は、非常に歪んだ音声です。Commodore 64 は 64 の組み込み SID オーディオ チップを使用しました。
おそらく、オペレーティングシステムに統合された最初の音声システムは、1983年頃に発売されなかったAtari 1400XL/1450XLコンピュータでしょう。これらはVotrax SC01チップと有限状態機械を使用して、World English Spellingのテキスト音声合成を実現しました。[ 92 ]
Atari STコンピュータには、フロッピーディスクに「stspeech.tos」というファイルが同梱されて販売されていた。
量産されたオペレーティングシステムに統合された最初の音声システムは、Apple ComputerのMacInTalkでした。このソフトウェアは、サードパーティ開発者の Joseph Katz と Mark Barton (後に SoftVoice, Inc. となる) からライセンス供与され、1984 年の Macintosh コンピュータの発表時に紹介されました。この 1 月のデモには 512 キロバイトの RAM が必要でした。そのため、最初の Mac に実際に搭載されていた 128 キロバイトの RAM では動作しませんでした。[ 93 ]そのため、デモはプロトタイプの 512k Mac で実行されましたが、出席者にはこのことは知らされず、合成デモは Macintosh に大きな興奮をもたらしました。1990 年代初頭、Apple はシステム全体でテキスト読み上げをサポートする機能を提供し、その機能を拡張しました。より高速な PowerPC ベースのコンピュータの導入により、より高品質の音声サンプリングが組み込まれました。Apple はまた、システムに音声認識を導入し、スムーズなコマンド セットを提供しました。最近では、Apple はサンプルベースの音声を追加しました。好奇心から始まった Apple Macintoshの音声システムは、視覚障害のある人向けの完全なサポートプログラムであるPlainTalkへと進化しました。VoiceOverは、2005 年にMac OS X Tiger (10.4)で初めて搭載されました。10.4 (Tiger) と 10.5 ( Leopard ) の最初のリリースでは、Mac OS X に標準で付属する音声は 1 つだけでした。10.6 ( Snow Leopard )以降、ユーザーは複数の音声の幅広いリストから選択できるようになりました。VoiceOver の音声は、文と文の間にリアルな呼吸音を挟む機能があり、PlainTalk よりも高速で読み上げる際の明瞭度が向上しています。Mac OS X には、テキストを音声に変換するコマンドラインベースのアプリケーションである say も含まれています。AppleScript Standard Additionsにはsay 動詞が含まれており、スクリプトでインストールされている音声を使用したり、音声のピッチ、話速、変調を制御したりできます。
Alexaで使用され、AWSではサービスとしてのソフトウェアとして使用されています[ 94 ](2017年から)。

高度な音声合成機能を備えた2番目のオペレーティングシステムは、1985年に発表されたAmigaOSでした。音声合成は、オリジナルのMacinTalkテキスト読み上げシステムを開発したSoftVoice, Inc.からCommodore Internationalにライセンス供与されました。Amigaのオーディオチップセットによって可能になった、男性と女性の声と「アクセント」インジケーターマーカーを備えた、アメリカ英語の完全な音声エミュレーションシステムを備えていました。[ 95 ]合成システムは、制限のない英語のテキストを標準的な音声コードセットに変換する翻訳ライブラリと、音声生成のフォルマントモデルを実装するナレーターデバイスに分かれていました。AmigaOSには、コマンドラインユーザーがテキスト出力を音声にリダイレクトできる高レベルの「Speak Handler」も搭載されていました。音声合成は、特にワードプロセッサや教育ソフトウェアなどのサードパーティプログラムで時折使用されました。音声合成ソフトウェアは最初のAmigaOSリリースからほとんど変更されず、コモドールは最終的にAmigaOS 2.1以降で音声合成のサポートを削除した。
アメリカ英語の音素制限にもかかわらず、多言語音声合成機能を備えた非公式バージョンが開発されました。これは、各言語のルールセットに基づいて複数の言語を翻訳できる、拡張版の翻訳ライブラリを使用しました。[ 96 ]
最新のWindowsデスクトップ システムでは、 SAPI 4およびSAPI 5コンポーネントを使用して音声合成と音声認識をサポートできます。SAPI 4.0 は、Windows 95およびWindows 98のオプションのアドオンとして利用可能でした。Windows 2000 では、視覚障害のある人向けのテキスト読み上げユーティリティであるNarrator が追加されました。JAWS for Windows、Window-Eyes、Non-visual Desktop Access、Supernova、System Access などのサードパーティ プログラムでは、指定された Web サイト、電子メール アカウント、テキスト ドキュメント、Windows クリップ ボード、ユーザーのキーボード入力などからテキストを読み上げるなど、さまざまなテキスト読み上げタスクを実行できます。すべてのプログラムが音声合成を直接使用できるわけではありません。[ 97 ]一部のプログラムでは、プラグイン、拡張機能、またはアドオンを使用してテキストを読み上げることができます。システム クリップ ボードからテキストを読み取ることができるサードパーティ プログラムが利用可能です。
Microsoft Speech Serverは、音声合成と音声認識のためのサーバーベースのパッケージです。Webアプリケーションやコールセンターとのネットワーク接続での利用を想定して設計されています。
1971年から1996年にかけて、Votrax社は数多くの商用音声合成装置部品を製造した。Votrax社の合成装置は、初代Kurzweil盲人用読書機にも搭載されていた。
テキスト読み上げ(TTS)とは、コンピュータがテキストを音声で読み上げる機能のことです。TTSエンジンは、書かれたテキストを音素表現に変換し、次に音素表現を音として出力できる波形に変換します。さまざまな言語、方言、専門用語に対応したTTSエンジンは、サードパーティの出版社から入手できます。[ 98 ]
現在、電子メールクライアントからメッセージを、ウェブブラウザやGoogleツールバーからウェブページを直接読み上げることができるアプリケーション、プラグイン、ガジェットが数多く存在します。一部の専用ソフトウェアはRSSフィードを読み上げることができます。オンラインRSSナレーターは、ユーザーがお気に入りのニュースソースを音声で聞き、ポッドキャストに変換できるようにすることで、情報配信を簡素化します。また、オンラインRSSリーダーは、インターネットに接続されたほぼすべてのパーソナルコンピュータで利用可能です。ユーザーは、生成された音声ファイルをポッドキャスト受信機などを使ってポータブルデバイスにダウンロードし、ウォーキング、ジョギング、通勤中に聞くことができます。
インターネットベースのTTSで成長している分野は、ウェブベースの支援技術であり、例えば英国の企業による「Browsealoud」やReadspeakerなどがある。これは、ウェブブラウザにアクセスできる人であれば誰でも(アクセシビリティ、利便性、娯楽、情報などの理由で)TTS機能を提供できる。非営利プロジェクトのPediaphonは、Wikipediaに同様のウェブベースのTTSインターフェースを提供するために2006年に作成された。[ 100 ]
その他の取り組みは、W3Cオーディオインキュベーターグループを通じてW3Cの枠組みの中で行われており、BBCとGoogle Inc.が参加している。
以下のようなオープンソースのソフトウェアシステムがいくつか利用可能です。
2018年のニューラル情報処理システム会議(NeurIPS)で、Googleの研究者らは「話者照合からマルチ話者テキスト音声合成への転移学習」という研究を発表しました。これは、話者照合の学習を転移してテキスト音声合成を実現するもので、わずか5秒の音声サンプルからほぼ誰の声にも聞こえるようにすることができます。[ 103 ]
また、Baidu Researchの研究者も2018年のNeurIPS会議で同様の目的を持つ音声クローンシステムを発表したが[ 104 ] 、その結果はあまり説得力に欠ける。
2019年までに、デジタル音声類似技術は犯罪者の手に渡り、Symantecの研究者は、デジタル音声類似技術が犯罪に使用された3つの事例を把握している。[ 105 ] [ 106 ]
これは、偽情報状況に対するストレスを増大させる。
XML準拠形式でテキストを音声に変換するためのマークアップ言語が数多く開発されてきました。最も新しいものは、 2004年にW3C勧告となった音声合成マークアップ言語(SSML)です。それ以前の音声合成マークアップ言語としては、Java音声マークアップ言語(JSML)やSABLEなどがあります。これらはいずれも標準規格として提案されましたが、広く普及するには至っていません。
音声合成マークアップ言語は、対話マークアップ言語とは区別されます。例えば、 VoiceXMLには、テキスト読み上げマークアップに加えて、音声認識、対話管理、プッシュトーンダイヤルに関連するタグが含まれています。
音声合成は長年にわたり重要な支援技術ツールであり、この分野におけるその応用は重要かつ広範に及んでいます。これにより、さまざまな障害を持つ人々にとって環境的な障壁を取り除くことができます。最も長く使われてきたのは視覚障害者向けのスクリーンリーダーですが、テキスト読み上げシステムは現在、失読症やその他の読字障害を持つ人々や読み書きができない子供たちにも一般的に使われています。[ 109 ]また、専用の音声出力コミュニケーション補助装置を通して、重度の言語障害を持つ人々を支援するためにも頻繁に使用されています。[ 110 ]個人の性格や過去の声によりよく合うように合成音声をパーソナライズする取り組みも始まっています。[ 111 ] 音声合成の注目すべき応用例としては、ハスキンズ研究所の研究に基づくテキスト音声変換ソフトウェアとVotraxが構築したブラックボックスシンセサイザーを組み込んだ、盲人向けのKurzweil Reading Machineがあります。[ 112 ]

音声合成技術は、ゲームやアニメーションなどのエンターテイメント制作でも使用されています。2007年、アニモ株式会社は、エンターテイメント業界の顧客向けに特化して開発された、音声合成ソフトウェア FineSpeech をベースにしたソフトウェア アプリケーション パッケージの開発を発表しました。このパッケージは、ユーザーの仕様に基づいてナレーションやセリフを生成できます。[ 113 ]このアプリケーションは、NEC Biglobe が日本のアニメシリーズ「コードギアス 反逆のルルーシュ R2」のキャラクターの声からフレーズを作成できるウェブ サービスを発表した2008年に成熟しました。 [ 114 ] 15.ai は、「マイリトルポニー ~トモダチは魔法~」ファンダム、「チームフォートレス2」ファンダム、「ポータル」ファンダム、「スポンジボブ」ファンダムなど、さまざまなファンダムのコンテンツ作成に頻繁に使用されています。[ 115 ] [ 116 ] [ 117 ]
障害やコミュニケーション障害のある人向けのテキスト読み上げ補助機器が広く普及しています。テキスト読み上げは新たな用途も開拓しており、例えば、音声合成と音声認識を組み合わせることで、自然言語処理インターフェースを介してモバイルデバイスとの対話が可能になります。また、一部のユーザーは15.aiと外部音声制御ソフトウェアを使用してAI仮想アシスタントを作成しています。[ 38 ] [ 118 ]
テキスト読み上げは、第二言語習得にも活用されています。例えば、Oddcast社が開発した教育ツール「Voki」では、ユーザーは様々なアクセントを使って自分だけのしゃべるアバターを作成できます。作成したアバターは、メールで送信したり、ウェブサイトに埋め込んだり、ソーシャルメディアで共有したりできます。
コンテンツ制作者は、ポッドキャスト[ 119 ] [ 120 ]ナレーション[ 50 ]やコメディ番組[ 121 ] [ 122 ] [ 123 ]用に自分の声を再現するために音声クローンツールを使用してきました。出版社や著者も、オーディオブックやニュースレターのナレーションにこのようなソフトウェアを使用しています。[ 124 ] [ 125 ]もう一つの応用分野は、話すヘッドを使用した AI ビデオの作成です。Elai.io やSynthesiaのような Web アプリやビデオエディターを使用すると、テキスト読み上げ技術を使用して話すように作られた AI アバターを含むビデオコンテンツを作成できます。[ 126 ] [ 127 ]
音声合成は、音声障害の分析と評価に役立つ貴重な計算ツールです。ブラジリア大学のホルヘ・C・ルセロらが開発した音声品質シンセサイザーは、発声の物理をシミュレートし、声帯周波数のジッターと震え、気流ノイズ、喉頭の非対称性のモデルを含んでいます。[ 73 ]このシンセサイザーは、粗さ、息漏れ、緊張のレベルを制御して、発声障害のある話者の音色を模倣するために使用されてきました。 [ 74 ]