調音合成とは、人間の声道とそこで起こる調音過程のモデルに基づいて音声を合成する計算技術を指します。声道の形状はさまざまな方法で制御できますが、通常は舌、顎、唇などの音声調音器官の位置を変更します。音声は、声道の表現を通じて空気の流れをデジタル的にシミュレートすることで作成されます。
機械のしゃべる頭
機械的な「トーキングヘッド」を作ろうとする試みには長い歴史があります。 [2] ゲルベルト(1003 年没)、アルベルトゥス・マグヌス(1198 年 - 1280 年)、ロジャー・ベーコン(1214 年 - 1294 年) はいずれもトーキングヘッドを作ったと言われています (ホイートストン1837 年)。しかし、歴史的に確認されている音声合成は、1791 年に研究報告書を発表したヴォルフガング・フォン・ケンペレン(1734 年 - 1804 年) から始まります (ダドリー & タルノッチ 1950 年も参照)。
電気的な声道類似体
最初の電気的な声道類似体は、Dunn (1950)、Ken Stevensと同僚 (1953)、Gunnar Fant (1960) らによるもののように静的なものでした。Rosen (1958) は動的な声道 (DAVO) を構築し、後に Dennis (1963) がこれをコンピューターで制御しようとしました。Dennis ら (1964)、Hiki ら (1968)、Baxter と Strong (1969) もハードウェアの声道類似体を説明しています。Kelly と Lochbaum (1962) は最初のコンピューター シミュレーションを行い、その後、Nakata と Mitsuoka (1965)、Matsui (1968)、Paul Mermelstein (1971) などによってデジタル コンピューター シミュレーションが行われました。Honda ら (1968) はアナログ コンピューターシミュレーションを行いました。
ハスキンズと前田モデル
研究室での実験に定期的に使用された最初のソフトウェア調音合成装置は、1970年代半ばにハスキンズ研究所でフィリップ・ルービン、トム・ベア、ポール・マーメルスタインによって開発されました。ASY [3]として知られるこの合成装置は、1960年代から1970年代にかけてベル研究所でポール・マーメルスタイン、セシル・コーカーらによって開発された声道モデルに基づいた音声生成の計算モデルでした。頻繁に使用されているもう1つの人気モデルは、舌の形状を制御するために因子ベースのアプローチを使用する前田真治のモデルです。
現代のモデル
音声生成イメージング、調音制御モデリング、舌の生体力学モデリングにおける近年の進歩により、調音合成の実行方法に変化が生じている [1] [ permanent dead link ]。例としては、Philip Rubin、Mark Tiede [2] Archived 2006-09-01 at the Wayback Machineが設計したHaskins CASY モデル (Configurable Articulatory Synthesis) [4 ] や、中矢状方向の声道を実際の磁気共鳴画像(MRI) データと照合し、MRI データを使用して声道の 3D モデルを構築する Louis Goldstein [3] などがある。完全な 3D 調音合成モデルは、Olov Engwall によって説明されている。幾何学に基づく 3D 調音音声合成装置は、Peter Birkholz (VocalTractLab [5] ) によって開発されている。 DIVA( Directions Into Velocities of Articulators)モデルは、発声の基礎となる神経計算を考慮したフィードフォワード制御アプローチであり、ボストン大学のFrank H. Guentherによって開発されました。[6]ブリティッシュコロンビア大学のSidney Fels [4]が率いるArtiSynthプロジェクトは、人間の声道と上気道の3Dバイオメカニクスモデリングツールキットです。舌などの調音器官のバイオメカニクスモデリングは、Reiner Wilhelms-Tricarico [5]、Yohan Payan [6]、Jean-Michel Gerard [7]、Jianwu Dang、Kiyoshi Honda [8]など、多くの科学者によって開拓されてきました。
商用モデル
数少ない商業用調音音声合成システムの 1 つが、元々は研究の多くが実施されたカルガリー大学のスピンオフ企業である Trillium Sound Research によって開発され販売された NeXT ベースのシステムです。NeXTのさまざまなバージョン ( 1980 年代後半にSteve Jobsによって開始され、1997 年にApple Computerと合併) の終焉後、Trillium ソフトウェアはGNU General Public Licenseの下で公開され、 gnuspeechとして作業が継続されました。1994 年に初めて販売されたこのシステムは、ルネ・カレの「特徴的領域モデル」によって制御される人間の口腔と鼻腔の導波管または伝送線路アナログを使用して、完全な調音ベースのテキストから音声への変換を提供します。[7]
参照
脚注
- ^ Birkholz, Peter (2013). 「調音音声合成のための子音-母音結合のモデリング」. PLOS ONE . 8 (4): e60603. Bibcode :2013PLoSO...860603B. doi : 10.1371 /journal.pone.0060603 . PMC 3628899. PMID 23613734.
- ^ 「トーキング・ヘッズ」。2006年12月7日時点のオリジナルよりアーカイブ。2006年12月6日閲覧。
- ^ アシィ
- ^ 「CASY」。2006年8月28日時点のオリジナルよりアーカイブ。2006年12月6日閲覧。
- ^ ボーカルトラクトラボ
- ^ アーティシンス
- ^ リアルタイム調音音声合成ルール
文献
- バクスター、ブレント、ウィリアム J. ストロング (1969)。WINDBAG—声道アナログ音声合成装置。アメリカ音響学会誌、45、309(A)。
- Birkholz P、Jackel D、Kröger BJ (2007) 時間変動音声システムにおける乱流による損失のシミュレーション。IEEE Transactions on Audio、Speech、および Language Processing 15: 1218-1225
- Birkholz P、Jackel D、Kröger BJ (2006) 3次元声道モデルの構築と制御。国際音響、音声、信号処理会議 (ICASSP 2006) (トゥールーズ、フランス) の議事録、pp. 873–876
- Coker. CH (1968). パラメトリック調音モデルによる音声合成。Proc . Speech. Symp.、京都、日本、論文 A-4。
- Coker, CH (1976). 「調音ダイナミクスと制御のモデル」. IEEE 論文集. 64 (4): 452–460. doi :10.1109/PROC.1976.10154. S2CID 1412611.
- Coker; Fujimura, O. (1966). 「声道面積関数の仕様モデル」アメリカ音響学会誌. 40 (5): 1271. Bibcode :1966ASAJ...40.1271C. doi : 10.1121/1.2143456 .
- デニス、ジャック B. (1963)。アナログ音声管のコンピュータ制御。アメリカ音響学会誌、35、1115(A)。
- Dudley, Homer; Tarnoczy, Thomas H. (1950). 「Wolfgang von Kempelen の音声機械」(PDF) . Journal of the Acoustical Society of America . 22 (2): 151–166. Bibcode :1950ASAJ...22..151D. doi :10.1121/1.1906583.
- Dunn, Hugh K. ( 1950)。「母音共鳴の計算と電気的発声器官」。アメリカ音響学会誌。22 (6): 740–53。Bibcode : 1950ASAJ ...22..740D。doi :10.1121/1.1906681。
- Engwall, O. (2003). 3次元舌モデルにおけるMRI、EMA、EPG測定の統合。Speech Communication、41、303–329。
- Fant, C. Gunnar M. (1960)。音声生成の音響理論。ハーグ、ムートン。
- ガリエル、M. (1879)。 「M. ファーバーの機械」。J. Physique Théorique et Appliquée。8 : 274–5。ドイ:10.1051/jphystap:018790080027401。
- Gerard, JM; Wilhelms-Tricarico, R.; Perrier, P.; Payan, Y. (2003). 「発話運動制御を研究するための 3D 動的生体力学的舌モデル」(PDF) .バイオメカニクスにおける最近の研究の発展. 1 : 49–64.
- Henke, WL (1966)。コンピュータシミュレーションを使用した音声生成の動的調音モデル。未発表の博士論文、MIT、マサチューセッツ州ケンブリッジ。
- 本田 隆、井上 誠一、小川 康雄 (1968)。「人間の声道シミュレータのハイブリッド制御システム」第 6 回国際音響会議報告、Y. Kohasi 編、pp. 175–8。東京、国際科学連合評議会。
- Kelly, John L.、および Carol Lochbaum。(1962)。音声合成。音声通信セミナー議事録、論文 F7。ストックホルム、音声伝送研究所、王立工科大学。
- ケンペレン、ヴォルフガング R. フォン。 (1791年)。 Maschine の詳細な制御機構。ウィーン、JB デゲン。
- 前田 誠(1988)「改良された調音モデル」アメリカ音響学会誌、84、Sup.1、S146。
- 前田 誠 (1990)。「発話中の代償的調音:調音モデルを用いた声道形状の分析と合成による証拠」WJ Hardcastle および A. Marchal (編)、音声生成と音声モデリング、Kluwer Academic、ドルドレヒト、131-149 ページ。
- 松井栄一 (1968)。コンピュータシミュレーションによる発声器官。第6回国際音響会議報告、Y.Kohasi編、pp.151-4。東京、国際科学連合評議会。
- マーメルシュタイン、ポール (1969)。音声生成における調音活動のコンピュータシミュレーション。人工知能に関する国際合同会議の議事録、ワシントン DC、1969 年、DE ウォーカーと LM ノートン編。ニューヨーク、ゴードン & ブリーチ。
- Mermelstein, P. (1973). 「音声生成の研究のための調音モデル」アメリカ音響学会誌53 ( 4): 1070–1082. Bibcode :1973ASAJ...53.1070M. doi :10.1121/1.1913427. PMID 4697807.
- 中田一夫、光岡孝太郎(1965)「連続音声合成における音韻変換と制御の側面」J. Radio Res. Labs . 12:171-86。
- Rahim, M.; Goodyear, C.; Kleijn, W.; Schroeter, J.; Sondhi, M. (1993). 「調音音声合成におけるニューラルネットワークの使用について」アメリカ音響学会誌. 93 (2): 1109–1121. Bibcode :1993ASAJ...93.1109R. doi :10.1121/1.405559. S2CID 120130348.
- ローゼン、ジョージ (1958)。「ダイナミックアナログ音声合成装置」。アメリカ音響学会誌。30 ( 3): 201–9。Bibcode : 1958ASAJ ...30..201R。doi : 10.1121/1.1909541。hdl : 1721.1/118106。
- Rubin, PE; Baer, T.; Mermelstein, P. (1981). 「知覚研究のための調音シンセサイザー」アメリカ音響学会誌70 (2): 321–328. Bibcode : 1981ASAJ...70..321R. doi :10.1121/1.386780.
- Rubin, P., Saltzman, E., Goldstein, L., McGowan, R., Tiede, M., & Browman, C. (1996). CASY とタスクダイナミックモデルの拡張。音声生成モデリングに関する第 1 回 ESCA チュートリアルおよび研究ワークショップの議事録 - 第 4 回音声生成セミナー、125–128 ページ。
- スティーブンス、ケネス N.; カソウスキー、S.; ファント、 C. グンナー M. (1953)。「声道の電気的類似体」アメリカ音響学会誌。25 ( 4): 734–42。Bibcode : 1953ASAJ ...25..734S。doi :10.1121/1.1907169。
外部リンク
- 「MRI と音響データから調音合成まで」。2007 年 8 月 14 日時点のオリジナルよりアーカイブ。
- 「スミソニアン音声合成歴史プロジェクト (SSSHP) 1986-2002」。2013年10月3日時点のオリジナルよりアーカイブ。
- 調音音声合成入門
- YouTubeで歌唱ロボット Pavarobotti による模擬歌唱、またはYouTubeでロボットがどのように歌を合成したかについてのBBCの説明。
- ピンクトロンボーンの素手音声合成オンラインツールとYouTubeのデモンストレーションビデオクリップ
