音声合成とは、人間の音声を人工的に生成することです。この目的で使用されるコンピュータシステムは音声合成装置と呼ばれ、ソフトウェアまたはハードウェア製品で実装できます。テキスト音声合成(TTS )システムは、通常の言語テキストを音声に変換します。他のシステムは、音声転写などの記号的な言語表現を音声に変換します。 [ 1 ]逆のプロセスは音声認識です。
合成音声は、データベースに保存されている録音音声の断片を連結することによって作成できます。システムによって保存される音声単位のサイズが異なります。音素または二重音素を保存するシステムは最も広い出力範囲を提供しますが、明瞭さに欠ける場合があります。特定の用途領域では、単語全体または文全体を保存することで高品質の出力が可能になります。あるいは、シンセサイザーは声道モデルやその他の人間の声の特徴を組み込んで、完全に「合成」された音声出力を作成することもできます。[ 2 ]
音声合成器の品質は、人間の声との類似性と明瞭な聞き取りやすさによって判断されます。理解しやすいテキスト読み上げプログラムにより、視覚障害や読字障害のある人が自宅のコンピュータで書かれた言葉を聞くことができます。音声合成器を搭載した最初のコンピュータオペレーティングシステムは、1974 年のUnixで、Unix speakユーティリティを介して実現されました。[ 3 ] 2000 年、Microsoft Sam は、すべての Windows 2000 オペレーティングシステムと後継の Windows XP システムに付属するナレーターアクセシビリティ機能で使用されるデフォルトのテキスト読み上げ音声合成器でした。

テキスト音声合成システム(または「エンジン」)は、フロントエンドとバックエンドの 2 つの部分で構成されています。[ 4 ]フロントエンドには2 つの主要なタスクがあります。まず、数字や略語などの記号を含む生のテキストを、書き出された単語に相当するものに変換します。このプロセスは、テキスト正規化、前処理、またはトークン化と呼ばれることがよくあります。次に、フロントエンドは各単語に音声転写を割り当て、テキストを句、節、文などの韻律単位に分割してマークします。単語に音声転写を割り当てるプロセスは、テキストから音素への変換、または文字から音素への変換と呼ばれます。音声転写と韻律情報は、フロントエンドによって出力される記号言語表現を構成します。次に、バックエンド(シンセサイザーと呼ばれることが多い)が、記号言語表現を音に変換します。特定のシステムでは、この部分には目標プロソディ(ピッチ輪郭、音素持続時間)の計算が含まれており、 [ 5 ]それが出力音声に適用される。
電子信号処理が発明されるずっと以前から、人間の言葉を模倣する機械を作ろうとした人々がいた。[ 6 ]また、シルヴェスター2世教皇(西暦1003年没)、アルベルトゥス・マグヌス(1198年~1280年)、ロジャー・ベーコン(1214年~1294年)などに関する「青銅の頭」の存在についての伝説もあった。[ 7 ]
1779年、ドイツ系デンマーク人の科学者クリスティアン・ゴットリープ・クラッツェンシュタインは、ロシア帝国科学芸術アカデミーが発表したコンテストで、5つの長母音(国際音声記号表記:[aː]、[eː]、 [iː]、 [oː]、[ uː])を発音できる人間の声道の模型を製作し、1等賞を獲得した。[ 8 ]その後、ハンガリーのプレスブルク出身のヴォルフガング・フォン・ケンペレンが、1791年の論文で説明した、ふいごで動く「音響機械式発声機」を製作した。 [ 9 ]この機械は舌と唇の模型を追加し、母音だけでなく子音も発音できるようにした。1837年、チャールズ・ホイートストンはフォン・ケンペレンの設計に基づいた「発声機」を製作し、1846年にはジョセフ・ファーバーが「ユーフォニア」を展示した。 1923年、パジェットはホイートストンのデザインを復活させた。[ 10 ]
1930年代、ベル研究所は音声を基本音と共鳴音に自動的に分解するボコーダーを開発した。ホーマー・ダドリーはボコーダーの研究から、キーボード操作式の音声合成装置「ザ・ヴォーダー(音声デモンストレーター)」を開発し、 1939年のニューヨーク万国博覧会で展示した。
フランクリン・S・クーパーとハスキンズ研究所の同僚たちは、1940年代後半にパターン再生装置を開発し、1950年に完成させた。この装置にはいくつかの異なるバージョンが存在したが、現在残っているのは1つだけである。この装置は、音声の音響パターンをスペクトログラムの形で画像化し、それを音に変換する。アルビン・リバーマンらはこの装置を用いて、音素(子音と母音)の知覚に関わる音響的手がかりを発見した。

最初のコンピュータベースの音声合成システムは1950年代後半に誕生しました。 1968年、日本の電気技術研究所で、梅田典子らが最初の汎用英語テキスト音声合成システムを開発しました。 [ 11 ] 1961年、物理学者のジョン・ラリー・ケリー・ジュニアと彼の同僚のルイス・ガーストマン[ 12 ]は、 IBM 7090コンピュータを使用して音声を合成しました。これはベル研究所の歴史上最も注目すべき出来事の1つです。[ 13 ]ケリーのボイスレコーダーシンセサイザー(ボコーダー)は、マックス・マシューズの音楽伴奏で「デイジー・ベル」という曲を再現しました。偶然にも、アーサー・C・クラークはベル研究所のマレーヒル施設で友人であり同僚のジョン・ピアースを訪ねていました。クラークはそのデモンストレーションに非常に感銘を受け、小説『2001年宇宙の旅』の脚本のクライマックスシーンでそれを使用した[ 14 ] 。そのシーンでは、宇宙飛行士のデイブ・ボーマンがHAL 9000コンピューターを眠らせる際に、HAL 9000が同じ歌を歌う[ 15 ] 。純粋な電子音声合成の成功にもかかわらず、機械音声合成装置の研究は続いている[ 16 ] 。
音声符号化の一種である線形予測符号化(LPC)は、 1966年に名古屋大学の板倉文忠と日本電信電話(NTT)の齋藤修三の研究によって開発が始まった。LPC技術のさらなる発展は、1970年代にベル研究所のビシュヌ・S・アタルとマンフレッド・R・シュローダーによって行われた。[ 17 ] LPCは後に、1978年のSpeak & Spell玩具で使用されたテキサス・インスツルメンツのLPC音声チップなど、初期の音声合成チップの基礎となった。
In 1975, Fumitada Itakura developed the line spectral pairs (LSP) method for high-compression speech coding, while at NTT.[18][19][20] From 1975 to 1981, Itakura studied problems in speech analysis and synthesis based on the LSP method.[20] In 1980, his team developed an LSP-based speech synthesizer chip. LSP is an important technology for speech synthesis and coding, and in the 1990s was adopted by almost all international speech coding standards as an essential component, contributing to the enhancement of digital speech communication over mobile channels and the internet.[19]
In 1975, MUSA was released, and was one of the first Speech Synthesis systems. It consisted of a stand-alone computer hardware and a specialized software that enabled it to read Italian. A second version, released in 1978, was also able to sing Italian in an "a cappella" style.[21]
Dominant systems in the 1980s and 1990s were the DECtalk system, based largely on the work of Dennis Klatt at MIT, and the Bell Labs system;[22] the latter was one of the first multilingual language-independent systems, making extensive use of natural language processing methods.


Handheld electronics featuring speech synthesis began emerging in the 1970s. One of the first was the Telesensory Systems Inc. (TSI) Speech+ portable calculator for the blind in 1976.[23][24] Other devices had primarily educational purposes, such as the Speak & Spell toy produced by Texas Instruments in 1978.[25] Fidelity released a speaking version of its electronic chess computer in 1979.[26] The first video game to feature speech synthesis was the 1980 shoot 'em uparcade game, Stratovox (known in Japan as Speak & Rescue), from Sun Electronics.[27][28] The first personal computer game with speech synthesis was Manbiki Shoujo (Shoplifting Girl), released in 1980 for the PET 2001, for which the game's developer, Hiroshi Suzuki, developed a "zero cross" programming technique to produce a synthesized speech waveform.[29] Another early example, the arcade version of Berzerk, also dates from 1980. The Milton Bradley Company produced the first multi-player electronic game using voice synthesis, Milton, in the same year.
In 1976, Computalker Consultants released their CT-1 Speech Synthesizer. Designed by D. Lloyd Rice and Jim Cooper, it was an analog synthesizer built to work with microcomputers using the S-100 bus standard.[30]
Synthesized voices typically sounded male until 1990, when Ann Syrdal, at AT&T Bell Laboratories, created a female voice.[31]
Ray Kurzweil predicted in 2005 that as the cost-performance ratio caused speech synthesizers to become cheaper and more accessible, more people would benefit from the use of text-to-speech programs.[32]
2016 年 9 月、DeepMind はWaveNetをリリースし、ディープラーニングモデルが生の波形をモデル化し、スペクトログラムやメル スペクトログラムなどの音響特徴から音声を生成できることを実証し、ディープラーニング音声合成の分野を始めました。WaveNet は当初、計算コストが高く、当時の消費者向け製品で使用するには遅いと考えられていましたが、リリースから 1 年後、DeepMind は WaveNet の改良版である「Parallel WaveNet」を発表しました。これは、オリジナルよりも 1,000 倍高速な製品モデルです。[ 33 ]これに続いて、 2018 年にGoogle AIの Tacotron 2 が登場し、ニューラル ネットワークが非常に自然な音声合成を生成できることを実証しましたが、許容できる品質を達成するには、通常数十時間の音声という相当なトレーニング データが必要でした。Tacotron 2 は、アテンション メカニズムを備えたオートエンコーダーアーキテクチャを使用して入力テキストをメル スペクトログラムに変換し、それを別のニューラルボコーダーを使用して波形に変換しました。 2時間分の音声などのより小さなデータセットでトレーニングした場合、出力品質は低下するものの、聞き取りやすい音声は維持でき、わずか24分のトレーニングデータでは、Tacotron 2は聞き取りやすい音声を生成できなかった。[ 34 ]
2019年、Microsoft ResearchはTacotron 2のような自己回帰モデルの速度制限に対処するFastSpeechを発表しました。[ 35 ]同年には、高忠実度の音声を生成しながら波形生成の効率を向上させるGANベースのボコーダーであるHiFi-GANがリリースされました。 [ 36 ] 2020年には、高速推論と音声スタイル転送機能の両方を可能にするフローベースのアプローチを導入したGlow-TTSがリリースされました。 [ 37 ]
2020年3月、無料のテキスト読み上げウェブサイト15.aiが立ち上げられました。15.aiは、最小限のデータで人気メディアの架空のキャラクターの感情表現豊かな音声を合成できることから、2021年初頭に国際的に広く注目を集めました。[ 38 ] [ 39 ] [ 40 ] 15.aiの開発者は、15秒のトレーニングデータで人の声を完璧にクローンできると述べています(そのため「15.ai」という名前が付けられました)。これは、従来知られていた数十時間分のデータ要件から大幅に削減されたものです。[ 41 ] 15.aiは、ミームやコンテンツ作成でAI音声クローンを普及させた最初のプラットフォームとして評価されています。[ 42 ] [ 43 ] [ 41 ] 2022年1月、 Voiceverseという暗号通貨会社が15.aiを使って音声を生成し、ピッチを上げて聞き取れないようにし、自社技術の副産物として宣伝し、許可なくNFTとして販売した際に、音声合成NFT詐欺の最初の事例が発生した。 [ 44 ] [ 45 ] [ 46 ] [ 47 ]
2023年1月、ElevenLabsはブラウザベースのテキスト読み上げプラットフォームをリリースしました。このプラットフォームは、高度なアルゴリズムを使用してテキストの文脈的側面を分析し、怒り、悲しみ、喜び、または警戒などの感情を検出します。[ 48 ] [ 49 ] [ 50 ]このプラットフォームは、言語的文脈に基づいてイントネーションとペースを調整して、人間のような抑揚のあるリアルな音声を生成することができ、多言語音声生成や長文コンテンツ作成などの機能を提供します。[ 51 ] [ 52 ]
2024年3月、OpenAIは人間の声をクローンするベンチマークを15秒で達成したことを確認した。[ 53 ]しかし、彼らはVoice Engineツールを一般公開するには「リスクが高すぎる」と判断し、プレビュー版のみを公開し、一般向けには公開しないと表明した。[ 54 ]
The most important qualities of a speech synthesis system are naturalness and intelligibility.[55] Naturalness describes how closely the output sounds like human speech, while intelligibility is the ease with which the output is understood. The ideal speech synthesizer is both natural and intelligible. Speech synthesis systems usually try to maximize both characteristics.
The two primary technologies generating synthetic speech waveforms are concatenative synthesis and formant synthesis. Each technology has strengths and weaknesses, and the intended uses of a synthesis system will typically determine which approach is used.
Concatenative synthesis is based on the concatenation (stringing together) of segments of recorded speech. Generally, concatenative synthesis produces the most natural-sounding synthesized speech. However, differences between natural variations in speech and the nature of the automated techniques for segmenting the waveforms sometimes result in audible glitches in the output. There are three main sub-types of concatenative synthesis.
Unit selection synthesis uses large databases of recorded speech. During database creation, each recorded utterance is segmented into some or all of the following: individual phones, diphones, half-phones, syllables, morphemes, words, phrases, and sentences. Typically, the division into segments is done using a specially modified speech recognizer set to a "forced alignment" mode with some manual correction afterward, using visual representations such as the waveform and spectrogram.[56] An index of the units in the speech database is then created based on the segmentation and acoustic parameters like the fundamental frequency (pitch), duration, position in the syllable, and neighboring phones. At run time, the desired target utterance is created by determining the best chain of candidate units from the database (unit selection). This process is typically achieved using a specially weighted decision tree.
ユニット選択は、録音された音声に少量のデジタル信号処理(DSP)しか適用しないため、最も自然な音声を実現します。DSPは録音された音声を不自然に聞こえるようにすることが多いですが、一部のシステムでは、波形を滑らかにするために連結の時点で少量の信号処理を使用しています。最高のユニット選択システムからの出力は、特にTTSシステムが調整されている状況では、実際の人間の声と区別がつかないことがよくあります。しかし、最大限の自然さを実現するには、通常、ユニット選択音声データベースが非常に大きく、システムによっては数十時間の音声を表すギガバイトの録音データに達することもあります。[ 57 ]また、ユニット選択アルゴリズムは、データベース内により良い選択肢が存在する場合でも、理想的とは言えない合成結果(たとえば、小さな単語が不明瞭になる)をもたらす場所からセグメントを選択することが知られています。[ 58 ]最近、研究者たちは、ユニット選択音声合成システムにおける不自然なセグメントを検出するためのさまざまな自動化手法を提案しています。[ 59 ]
二音素合成では、言語に存在するすべての二音素(音から音への遷移)を含む最小限の音声データベースを使用します。二音素の数は言語の音韻構造に依存します。たとえば、スペイン語には約 800 個の二音素があり、ドイツ語には約 2500 個の二音素があります。二音素合成では、音声データベースには各二音素の例が 1 つだけ含まれています。実行時には、線形予測符号化、PSOLA [ 60 ]、MBROLA [ 61 ]などのデジタル信号処理技術、または離散コサイン変換を使用したソース領域でのピッチ変更[ 62 ]などのより新しい技術によって、文の目標プロソディがこれらの最小単位に重ね合わされます。二音素合成は、連結合成の音響的グリッチとフォルマント合成のロボットのような音の性質に悩まされており、サイズが小さいこと以外にはどちらのアプローチの利点もほとんどありません。そのため、商用アプリケーションでの使用は減少傾向にあるが、無料で利用できるソフトウェア実装が多数存在するため、研究用途では引き続き使用されている。 ダイフォン合成の初期の例としては、マイケル・J・フリーマンが発明した教育ロボット、リーチムがある。[ 63 ]リーチムには、授業カリキュラムに関する情報と、教えるようにプログラムされた生徒に関する特定の経歴情報が含まれていた。[ 64 ]ニューヨーク州ブロンクスの4年生の教室でテストされた。[ 65 ] [ 66 ]
ドメイン固有の合成は、事前に録音された単語やフレーズを連結して完全な発話を作成します。これは、システムが出力するテキストの種類が特定のドメインに限定されているアプリケーションで使用されます。たとえば、交通機関の時刻表のアナウンスや天気予報などです。[ 67 ]この技術は実装が非常に簡単で、音声時計や電卓などのデバイスで長年商用利用されています。これらのシステムの自然さのレベルは、文の種類が限られており、元の録音の韻律やイントネーションに非常に近いため、非常に高くなります。
これらのシステムはデータベース内の単語やフレーズによって制限されているため、汎用性はなく、事前にプログラムされた単語やフレーズの組み合わせしか合成できません。しかし、自然言語における単語の混成は、多くのバリエーションを考慮しない限り、依然として問題を引き起こす可能性があります。たとえば、英語の非ローティック方言では、 「clear」/ˈklɪə/のような単語の「r」は、通常、次の単語の最初の文字が母音である場合にのみ発音されます(たとえば、「clear out」は/ˌklɪəɹˈʌʊt/と発音されます)。同様に、フランス語では、母音で始まる単語が後に続く場合、多くの語末子音が無音ではなくなります。これはリエゾンと呼ばれる現象です。このような交替は、単純な単語連結システムでは再現できず、文脈に応じてさらに複雑化する必要があります。
フォルマント合成では、実行時に人間の音声サンプルを使用しません。代わりに、合成音声出力は加算合成と音響モデル(物理モデリング合成)を使用して作成されます。[ 68 ]基本周波数、有声性、ノイズレベルなどのパラメータが時間とともに変化し、人工音声の波形が作成されます。この方法はルールベース合成と呼ばれることもありますが、多くの連結システムにもルールベースのコンポーネントがあります。フォルマント合成技術に基づく多くのシステムは、人間の音声と間違えることのない、ロボットのような人工音声を生成します。しかし、音声合成システムの目標は常に最大限の自然さではなく、フォルマント合成システムは連結システムよりも優れています。フォルマント合成音声は、連結システムによく見られる音響グリッチを回避し、非常に高速でも確実に聞き取ることができます。高速合成音声は、視覚障害者がスクリーンリーダーを使用してコンピュータを素早くナビゲートするために使用されます。フォルマントシンセサイザーは、音声サンプルデータベースを持たないため、連結型システムよりも一般的にプログラムサイズが小さくなります。そのため、メモリやマイクロプロセッサの処理能力が特に限られている組み込みシステムでの使用に適しています。フォルマントベースのシステムは出力音声のあらゆる側面を完全に制御できるため、多様な韻律やイントネーションを出力でき、質問や陳述だけでなく、さまざまな感情や声のトーンを伝えることができます。
フォルマント合成における非リアルタイムながら高精度なイントネーション制御の例としては、1970年代後半にテキサス・インスツルメンツの玩具「Speak & Spell」で行われた研究や、1980年代初頭にセガのアーケードゲーム機[ 69 ]、そしてアタリ社の多くのアーケードゲーム[ 70 ]でTMS5220 LPCチップを使用して行われた研究などが挙げられる。これらのプロジェクトで適切なイントネーションを作成するのは骨の折れる作業であり、その結果はリアルタイムのテキスト読み上げインターフェースではまだ実現されていない[ 71 ] 。
中国語や台湾語のような声調言語では、さまざまなレベルの声調変化が必要であり、音声合成装置の出力では声調変化の誤りが生じる場合がある。[ 72 ]
調音合成とは、人間の声道のモデルとそこで起こる調音過程に基づいて音声を合成する計算技術のことである。実験室での実験に定期的に使用された最初の調音合成装置は、1970年代半ばにハスキンズ研究所でフィリップ・ルービン、トム・ベア、ポール・メルメルスタインによって開発された。ASYとして知られるこの合成装置は、1960年代から1970年代にかけてベル研究所でポール・メルメルスタイン、セシル・コーカーらが開発した声道モデルに基づいていた。
最近まで、調音合成モデルは商用音声合成システムには組み込まれていませんでした。注目すべき例外は、カルガリー大学のスピンオフ企業であるTrillium Sound Researchが開発・販売したNeXTベースのシステムです。このシステムでは、当初の研究の多くが行われました。NeXTの様々な形態( 1980年代後半にスティーブ・ジョブズによって設立され、1997年にApple Computerと合併)が終焉を迎えた後、TrilliumのソフトウェアはGNU General Public Licenseの下で公開され、gnuspeechとして開発が続けられました。1994年に初めて販売されたこのシステムは、Carréの「弁別領域モデル」によって制御される人間の口腔および鼻腔の導波管または伝送線路アナログを使用して、完全な調音ベースのテキスト音声変換を提供します。
ホルヘ・C・ルセロとその同僚によって開発されたより新しいシンセサイザーは、声帯の生体力学、声門の空気力学、気管支、気管、鼻腔、口腔における音波伝播のモデルを組み込んでおり、物理ベースの音声シミュレーションの完全なシステムを構成している。[ 73 ] [ 74 ]
HMM-based synthesis is a synthesis method based on hidden Markov models, also called Statistical Parametric Synthesis. In this system, the frequency spectrum (vocal tract), fundamental frequency (voice source), and duration (prosody) of speech are modeled simultaneously by HMMs. Speech waveforms are generated from HMMs themselves based on the maximum likelihood criterion.[75]
Sinewave synthesis is a technique for synthesizing speech by replacing the formants (main bands of energy) with pure tone whistles.[76]
Deep learning speech synthesis uses deep neural networks (DNN) to produce artificial speech from text (text-to-speech) or spectrum (vocoder). The deep neural networks are trained using a large amount of recorded speech and, in the case of a text-to-speech system, the associated labels and/or input text.
Audio deepfake technology, also referred to as voice cloning or deepfake audio, is an application of artificial intelligence designed to generate speech that convincingly mimics specific individuals, often synthesizing phrases or sentences they have never spoken.[77][78][79][80]
Initially developed with the intent to enhance various aspects of human life, it has practical applications such as generating audiobooks and assisting individuals who have lost their voices due to medical conditions.[81][82] Additionally, it has commercial uses, including the creation of personalized digital assistants, natural-sounding text-to-speech systems, and advanced speech translation services.[83] As with other forms of deepfakes, audio deepfakes have faced criticism for their use in scams, phishing, and misinformation campaigns.
In 2023, VICE reporter Joseph Cox published findings that he had recorded five minutes of himself talking and then used a tool developed by ElevenLabs to create voice deepfakes that defeated a bank's voice-authentication system.[84]
The process of normalizing text is rarely straightforward. Texts are full of heteronyms, numbers, and abbreviations that all require expansion into a phonetic representation. There are many spellings in English which are pronounced differently based on context. For example, "My latest project is to learn how to better project my voice" contains two pronunciations of "project".
Most text-to-speech (TTS) systems do not generate semantic representations of their input texts, as processes for doing so are unreliable, poorly understood, and computationally ineffective. As a result, various heuristic techniques are used to guess the proper way to disambiguate homographs, like examining neighboring words and using statistics about frequency of occurrence.
Recently TTS systems have begun to use HMMs (discussed above) to generate "parts of speech" to aid in disambiguating homographs. This technique is quite successful for many cases such as whether "read" should be pronounced as "red" implying past tense, or as "reed" implying present tense. Typical error rates when using HMMs in this fashion are usually below five percent. These techniques also work well for most European languages, although access to required training corpora is frequently difficult in these languages.
Deciding how to convert numbers is another problem that TTS systems have to address. It is a simple programming challenge to convert a number into words (at least in English), like "1325" becoming "one thousand three hundred twenty-five". However, numbers occur in many different contexts; "1325" may also be read as "one three two five", "thirteen twenty-five" or "thirteen hundred and twenty five". A TTS system can often infer how to expand a number based on surrounding words, numbers, and punctuation, and sometimes the system provides a way to specify the context if it is ambiguous.[85] Roman numerals can also be read differently depending on context. For example, "Henry VIII" reads as "Henry the Eighth", while "Chapter VIII" reads as "Chapter Eight".
同様に、略語も曖昧になることがあります。たとえば、「inches」の略語「in」は「in」という単語と区別する必要があり、住所「12 St John St.」では「Saint」と「Street」の両方に同じ略語が使われています。インテリジェントなフロントエンドを備えたTTSシステムは、曖昧な略語について適切な推測を行うことができますが、他のシステムはすべての場合で同じ結果を返すため、「Ulysses S. Grant」が「Ulysses South Grant」と表示されるなど、意味不明な(そして時には滑稽な)出力になることがあります。
音声合成システムは、単語の綴りに基づいて発音を決定するために、2つの基本的なアプローチを使用します。このプロセスは、テキストから音素への変換、または文字から音素への変換と呼ばれることがよくあります(音素とは、言語学者が言語内の特徴的な音を表すために使用する用語です)。テキストから音素への変換の最も単純なアプローチは、辞書ベースのアプローチです。このアプローチでは、言語のすべての単語とその正しい発音を含む大規模な辞書がプログラムに格納されます。各単語の正しい発音を決定するには、辞書で各単語を検索し、綴りを辞書に指定された発音に置き換える必要があります。もう1つのアプローチはルールベースのアプローチで、発音ルールを単語に適用して、綴りに基づいて発音を決定します。これは、読み方を学ぶための「音読」または合成フォニックスのアプローチに似ています。
それぞれの方式には長所と短所があります。辞書方式は高速かつ正確ですが、辞書に登録されていない単語が入力されると完全に失敗します。辞書のサイズが大きくなるにつれて、音声合成システムのメモリ容量も増加します。一方、ルール方式はあらゆる入力に対応できますが、不規則な綴りや発音を考慮すると、ルールの複雑さが大幅に増します。(例えば、「of」という単語は英語では非常に一般的ですが、「f」が[v]と発音される唯一の単語です。)そのため、ほとんどすべての音声合成システムは、これらの方式を組み合わせて使用しています。
音素表記法を持つ言語は、非常に規則的な表記体系を持ち、綴りから単語の発音を予測する精度が非常に高い。このような言語向けの音声合成システムは、ルールベースの手法を多用し、外国語名や借用語など、綴りから発音が明らかでないごく一部の単語にのみ辞書を用いる。一方、英語のように綴りが非常に不規則な言語向けの音声合成システムは、辞書に頼る傾向が強く、ルールベースの手法は、珍しい単語や辞書に載っていない単語にのみ用いられる。
音声合成システムの評価は、普遍的に合意された客観的な評価基準が欠如しているため、一貫性を保つことが難しい場合があります。組織によって使用される音声データは異なることが多く、音声合成システムの品質は、音声生成技術(アナログ録音またはデジタル録音を含む)の品質や、音声再生に使用される設備にも左右されます。そのため、音声合成システムの評価は、音声生成技術や再生設備の違いによってしばしば損なわれてきました。
しかし、2005年以降、一部の研究者は共通の音声データセットを使用して音声合成システムの評価を開始した。[ 86 ]
英国ポーツマス大学のエイミー・ドラホタ氏らがSpeech Communication誌に発表した研究では、音声録音を聞いたリスナーは、偶然よりも高い精度で、話者が微笑んでいるかどうかを判断できると報告されている。[ 87 ] [ 88 ] [ 89 ]感情的な内容を示す音声の特徴を識別することで、合成音声をより自然に聞こえるようにできる可能性があると示唆されている。関連する問題の一つは、肯定文、疑問文、感嘆文のいずれであるかに応じて、文のピッチ輪郭を変更することである。ピッチ変更の手法の一つ[ 62 ]は、ソース領域(線形予測残差)で離散コサイン変換を使用する。このようなピッチ同期ピッチ変更手法では、音声の有声領域の統合線形予測残差に適用される動的破裂指数を用いたエポック抽出などの手法を用いて、合成音声データベースの事前ピッチマーキングが必要となる。[ 90 ] 一般的に、プロソディは音声合成装置にとって依然として課題であり、活発な研究テーマとなっている。

音声合成機能を内蔵した人気システム。
1980年代初頭、TIは音声合成のパイオニアとして知られており、TI-99/4および4A向けに非常に人気の高いプラグイン音声合成モジュールが提供されていました。音声合成モジュールは、一部のカートリッジの購入特典として無料で提供され、TIが開発した多くのビデオゲームで使用されました(このプロモーションで音声機能が搭載されたゲームには、AlpinerやParsecなどがありました)。この合成モジュールは、線形予測符号化の変種を使用しており、内蔵語彙は小規模です。当初の計画では、合成モジュールに直接接続できる小型カートリッジを発売し、デバイスの内蔵語彙を増やす予定でした。しかし、Terminal Emulator IIカートリッジにおけるソフトウェアによるテキスト読み上げの成功により、この計画は中止されました。
マテル社の ゲーム機「インテレビジョン」は、1982年に「インテリボイス」音声合成モジュールを提供しました。このモジュールには、着脱式カートリッジに搭載されたSP0256ナレーター音声合成チップが含まれていました。ナレーターは2KBの読み出し専用メモリ(ROM)を備えており、インテレビジョンのゲーム内でフレーズを作成するために組み合わせることができる汎用単語のデータベースを保存するために使用されました。ナレーターチップは外部メモリから音声データを受け入れることもできたため、必要な追加の単語やフレーズはカートリッジ自体に保存することができました。データは、単純なデジタルサンプルではなく、チップの合成音声器官モデルの動作を変更するためのアナログフィルタ係数の文字列で構成されていました。
同じく 1982 年にリリースされたSoftware Automatic Mouthは、初の商用完全ソフトウェア音声合成プログラムでした。後にMacintalkのベースとして使用されました。このプログラムは、Macintosh 以外の Apple コンピュータ (Apple II や Lisa を含む)、さまざまな Atari モデル、および Commodore 64 で利用可能でした。Apple 版は DAC を含む追加のハードウェアを推奨しましたが、カードがない場合はコンピュータの 1 ビットオーディオ出力 (かなりの歪みが加わる) を使用することができました。Atari は組み込みの POKEY オーディオ チップを使用しました。Atari での音声再生は通常、割り込み要求を無効にし、音声出力中は ANTIC チップをシャットダウンします。画面がオンになっているときの可聴出力は、非常に歪んだ音声です。Commodore 64 は 64 の組み込み SID オーディオ チップを使用しました。
おそらく、オペレーティングシステムに統合された最初の音声システムは、1983年頃に発売されなかったAtari 1400XL/1450XLコンピュータでしょう。これらはVotrax SC01チップと有限状態機械を使用して、World English Spellingのテキスト音声合成を実現しました。[ 92 ]
Atari STコンピュータには、フロッピーディスクに「stspeech.tos」というファイルが同梱されて販売されていた。
量産されたオペレーティングシステムに統合された最初の音声システムは、Apple ComputerのMacInTalkでした。このソフトウェアは、サードパーティ開発者の Joseph Katz と Mark Barton (後に SoftVoice, Inc. となる) からライセンス供与され、1984 年の Macintosh コンピュータの発表時に紹介されました。この 1 月のデモには 512 キロバイトの RAM が必要でした。そのため、最初の Mac に実際に搭載されていた 128 キロバイトの RAM では動作しませんでした。[ 93 ]そのため、デモはプロトタイプの 512k Mac で実行されましたが、出席者にはこのことは知らされず、合成デモは Macintosh に大きな興奮をもたらしました。1990 年代初頭、Apple はシステム全体でテキスト読み上げをサポートする機能を提供し、その機能を拡張しました。より高速な PowerPC ベースのコンピュータの導入により、より高品質の音声サンプリングが組み込まれました。Apple はまた、システムに音声認識を導入し、スムーズなコマンド セットを提供しました。最近では、Apple はサンプルベースの音声を追加しました。好奇心から始まった Apple Macintoshの音声システムは、視覚障害のある人向けの完全なサポートプログラムであるPlainTalkへと進化しました。VoiceOverは、2005 年にMac OS X Tiger (10.4)で初めて搭載されました。10.4 (Tiger) と 10.5 ( Leopard ) の最初のリリースでは、Mac OS X に標準で付属する音声は 1 つだけでした。10.6 ( Snow Leopard )以降、ユーザーは複数の音声の幅広いリストから選択できるようになりました。VoiceOver の音声は、文と文の間にリアルな呼吸音を挟む機能があり、PlainTalk よりも高速で読み上げる際の明瞭度が向上しています。Mac OS X には、テキストを音声に変換するコマンドラインベースのアプリケーションである say も含まれています。AppleScript Standard Additionsにはsay 動詞が含まれており、スクリプトでインストールされている音声を使用したり、音声のピッチ、話速、変調を制御したりできます。
Alexaで使用され、AWSではサービスとしてのソフトウェアとして使用されています[ 94 ](2017年から)。

高度な音声合成機能を備えた2番目のオペレーティングシステムは、1985年に発表されたAmigaOSでした。音声合成は、オリジナルのMacinTalkテキスト読み上げシステムを開発したSoftVoice, Inc.からCommodore Internationalにライセンス供与されました。Amigaのオーディオチップセットによって可能になった、男性と女性の声と「アクセント」インジケーターマーカーを備えた、アメリカ英語の完全な音声エミュレーションシステムを備えていました。[ 95 ]合成システムは、制限のない英語のテキストを標準的な音声コードセットに変換する翻訳ライブラリと、音声生成のフォルマントモデルを実装するナレーターデバイスに分かれていました。AmigaOSには、コマンドラインユーザーがテキスト出力を音声にリダイレクトできる高レベルの「Speak Handler」も搭載されていました。音声合成は、特にワードプロセッサや教育ソフトウェアなどのサードパーティプログラムで時折使用されました。音声合成ソフトウェアは最初のAmigaOSリリースからほとんど変更されず、コモドールは最終的にAmigaOS 2.1以降で音声合成のサポートを削除した。
アメリカ英語の音素制限にもかかわらず、多言語音声合成機能を備えた非公式バージョンが開発されました。これは、各言語のルールセットに基づいて複数の言語を翻訳できる、拡張版の翻訳ライブラリを使用しました。[ 96 ]
最新のWindowsデスクトップ システムでは、 SAPI 4およびSAPI 5コンポーネントを使用して音声合成と音声認識をサポートできます。SAPI 4.0 は、Windows 95およびWindows 98のオプションのアドオンとして利用可能でした。Windows 2000 では、視覚障害のある人向けのテキスト読み上げユーティリティであるNarrator が追加されました。JAWS for Windows、Window-Eyes、Non-visual Desktop Access、Supernova、System Access などのサードパーティ プログラムでは、指定された Web サイト、電子メール アカウント、テキスト ドキュメント、Windows クリップ ボード、ユーザーのキーボード入力などからテキストを読み上げるなど、さまざまなテキスト読み上げタスクを実行できます。すべてのプログラムが音声合成を直接使用できるわけではありません。[ 97 ]一部のプログラムでは、プラグイン、拡張機能、またはアドオンを使用してテキストを読み上げることができます。システム クリップ ボードからテキストを読み取ることができるサードパーティ プログラムが利用可能です。
Microsoft Speech Serverは、音声合成と音声認識のためのサーバーベースのパッケージです。Webアプリケーションやコールセンターとのネットワーク接続での利用を想定して設計されています。
1971年から1996年にかけて、Votrax社は数多くの商用音声合成装置部品を製造した。Votrax社の合成装置は、初代Kurzweil盲人用読書機にも搭載されていた。
テキスト読み上げ(TTS)とは、コンピュータがテキストを音声で読み上げる機能のことです。TTSエンジンは、書かれたテキストを音素表現に変換し、次に音素表現を音として出力できる波形に変換します。さまざまな言語、方言、専門用語に対応したTTSエンジンは、サードパーティの出版社から入手できます。[ 98 ]
現在、電子メールクライアントからメッセージを、ウェブブラウザやGoogleツールバーからウェブページを直接読み上げることができるアプリケーション、プラグイン、ガジェットが数多く存在します。一部の専用ソフトウェアはRSSフィードを読み上げることができます。オンラインRSSナレーターは、ユーザーがお気に入りのニュースソースを音声で聞き、ポッドキャストに変換できるようにすることで、情報配信を簡素化します。また、オンラインRSSリーダーは、インターネットに接続されたほぼすべてのパーソナルコンピュータで利用可能です。ユーザーは、生成された音声ファイルをポッドキャスト受信機などを使ってポータブルデバイスにダウンロードし、ウォーキング、ジョギング、通勤中に聞くことができます。
インターネットベースのTTSで成長している分野は、ウェブベースの支援技術であり、例えば英国の企業による「Browsealoud」やReadspeakerなどがある。これは、ウェブブラウザにアクセスできる人であれば誰でも(アクセシビリティ、利便性、娯楽、情報などの理由で)TTS機能を提供できる。非営利プロジェクトのPediaphonは、Wikipediaに同様のウェブベースのTTSインターフェースを提供するために2006年に作成された。[ 100 ]
その他の取り組みは、W3Cオーディオインキュベーターグループを通じてW3Cの枠組みの中で行われており、BBCとGoogle Inc.が参加している。
以下のようなオープンソースのソフトウェアシステムがいくつか利用可能です。
At the 2018 Conference on Neural Information Processing Systems (NeurIPS) researchers from Google presented the work 'Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis', which transfers learning from speaker verification to achieve text-to-speech synthesis, that can be made to sound almost like anybody from a speech sample of only 5 seconds.[103]
Also researchers from Baidu Research presented a voice cloning system with similar aims at the 2018 NeurIPS conference,[104] though the result is rather unconvincing.
By 2019 the digital sound-alikes found their way to the hands of criminals as Symantec researchers know of 3 cases where digital sound-alikes technology has been used for crime.[105][106]
This increases the stress on the disinformation situation coupled with the facts that
A number of markup languages have been established for the rendition of text as speech in an XML-compliant format. The most recent is Speech Synthesis Markup Language (SSML), which became a W3C recommendation in 2004. Older speech synthesis markup languages include Java Speech Markup Language (JSML) and SABLE. Although each of these was proposed as a standard, none of them have been widely adopted.
Speech synthesis markup languages are distinguished from dialogue markup languages. VoiceXML, for example, includes tags related to speech recognition, dialogue management and touchtone dialing, in addition to text-to-speech markup.
音声合成は長年にわたり重要な支援技術ツールであり、この分野におけるその応用は重要かつ広範に及んでいます。これにより、さまざまな障害を持つ人々にとって環境的な障壁を取り除くことができます。最も長く使われてきたのは視覚障害者向けのスクリーンリーダーですが、テキスト読み上げシステムは現在、失読症やその他の読字障害を持つ人々や読み書きができない子供たちにも一般的に使われています。[ 109 ]また、専用の音声出力コミュニケーション補助装置を通して、重度の言語障害を持つ人々を支援するためにも頻繁に使用されています。[ 110 ]個人の性格や過去の声によりよく合うように合成音声をパーソナライズする取り組みも始まっています。[ 111 ] 音声合成の注目すべき応用例としては、ハスキンズ研究所の研究に基づくテキスト音声変換ソフトウェアとVotraxが構築したブラックボックスシンセサイザーを組み込んだ、盲人向けのKurzweil Reading Machineがあります。[ 112 ]

音声合成技術は、ゲームやアニメーションなどのエンターテイメント制作でも使用されています。2007年、アニモ株式会社は、エンターテイメント業界の顧客向けに特化して開発された、音声合成ソフトウェア FineSpeech をベースにしたソフトウェア アプリケーション パッケージの開発を発表しました。このパッケージは、ユーザーの仕様に基づいてナレーションやセリフを生成できます。[ 113 ]このアプリケーションは、NEC Biglobe が日本のアニメシリーズ「コードギアス 反逆のルルーシュ R2」のキャラクターの声からフレーズを作成できるウェブ サービスを発表した2008年に成熟しました。 [ 114 ] 15.ai は、「マイリトルポニー ~トモダチは魔法~」ファンダム、「チームフォートレス2」ファンダム、「ポータル」ファンダム、「スポンジボブ」ファンダムなど、さまざまなファンダムのコンテンツ作成に頻繁に使用されています。[ 115 ] [ 116 ] [ 117 ]
障害やコミュニケーション障害のある人向けのテキスト読み上げ補助機器が広く普及しています。テキスト読み上げは新たな用途も開拓しており、例えば、音声合成と音声認識を組み合わせることで、自然言語処理インターフェースを介してモバイルデバイスとの対話が可能になります。また、一部のユーザーは15.aiと外部音声制御ソフトウェアを使用してAI仮想アシスタントを作成しています。[ 38 ] [ 118 ]
テキスト読み上げは、第二言語習得にも活用されています。例えば、Oddcast社が開発した教育ツール「Voki」では、ユーザーは様々なアクセントを使って自分だけのしゃべるアバターを作成できます。作成したアバターは、メールで送信したり、ウェブサイトに埋め込んだり、ソーシャルメディアで共有したりできます。
コンテンツ制作者は、ポッドキャスト[ 119 ] [ 120 ]ナレーション[ 50 ]やコメディ番組[ 121 ] [ 122 ] [ 123 ]用に自分の声を再現するために音声クローンツールを使用してきました。出版社や著者も、オーディオブックやニュースレターのナレーションにこのようなソフトウェアを使用しています。[ 124 ] [ 125 ]もう一つの応用分野は、話すヘッドを使用した AI ビデオの作成です。Elai.io やSynthesiaのような Web アプリやビデオエディターを使用すると、テキスト読み上げ技術を使用して話すように作られた AI アバターを含むビデオコンテンツを作成できます。[ 126 ] [ 127 ]
音声合成は、音声障害の分析と評価に役立つ貴重な計算ツールです。ブラジリア大学のホルヘ・C・ルセロらが開発した音声品質シンセサイザーは、発声の物理をシミュレートし、声帯周波数のジッターと震え、気流ノイズ、喉頭の非対称性のモデルを含んでいます。[ 73 ]このシンセサイザーは、粗さ、息漏れ、緊張のレベルを制御して、発声障害のある話者の音色を模倣するために使用されてきました。 [ 74 ]