| 開発者 | トリリウムサウンドリサーチ |
|---|---|
| 初回リリース | 2002年 |
| 安定リリース | 0.9 [1]
/ 2015年10月14日 |
| リポジトリ |
|
| プラットフォーム | クロスプラットフォーム |
| タイプ | テキスト読み上げ |
| ライセンス | GNU 一般公衆利用許諾書 |
| Webサイト | www.gnu.org/software/gnuspeech/ |
Gnuspeechは、ルールによるリアルタイムの調音音声合成に基づいて人工音声出力を生成する、拡張可能なテキスト読み上げコンピュータソフトウェア パッケージです。つまり、発音辞書、文字から音へのルール、リズムとイントネーションのモデルを利用してテキスト文字列を音声記述に変換し、音声記述を低レベルの調音音声合成装置のパラメータに変換し、これらを使用して人間の声道の調音モデルを駆動し、さまざまなコンピュータオペレーティング システムで使用される通常のサウンド出力デバイスに適した出力を生成します。そして、これを成人の音声と同じかそれより速い速度で行います。
デザイン
このシンセサイザーは、チューブ共鳴または導波管モデルであり、音声スペクトルを間接的にモデル化するフォルマントシンセサイザーとは異なり、実際の声道の挙動を直接的に、かつかなり正確にモデル化します。 [2]制御問題は、ルネ・カレの固有領域モデル[3]を使用して解決されます。このモデルは、声道の 8 つの縦方向の区分の半径の変化を、音声スペクトル内の3 つの周波数フォルマントの対応する変化に関連付けます。この周波数フォルマントは、音声の多くの情報を伝達します。領域は、王立工科大学 ( KTH ) のストックホルム音声技術研究所[4]による「フォルマント感度分析」、つまり、フォルマント周波数が、声道の長さに沿ったさまざまな場所での半径の小さな変化によってどのように影響を受けるかに関する研究に基づいています。[5]
歴史
Gnuspeech は元々、現在は解散した Trillium Sound Research 社がNeXTコンピュータ向けにさまざまなグレードの「TextToSpeech」キットとして作成した商用ソフトウェアでした。Trillium Sound Research 社は、カナダのアルバータ州カルガリー大学で設立された技術移転のスピンオフ企業で、コンピュータサイエンス学部の音声を使用したコンピュータと人間の相互作用に関する長年の研究に基づいており、システムに関連する論文やマニュアルが保管されています。[6] 1992 年の最初のバージョンでは、フォルマントベースの音声合成装置を使用していました。NeXT 社がハードウェアの製造を中止したとき、合成装置ソフトウェアは完全に書き直され[7] 、スタンフォード大学の音楽と音響のコンピュータ研究センター ( CCRMA )の研究、特に Music Kit に基づいて、音響管モデリングへの導波管アプローチを使用して NSFIP (NextStep For Intel Processors) にも移植されました。合成アプローチについては、1995 年にアメリカ音声入出力協会で発表された論文で詳しく説明されています。[8]このシステムでは、NeXT コンピュータのオンボード 56001 デジタル信号プロセッサ (DSP) と、NSFIP バージョンで同じ DSP を搭載した Turtle Beach アドオン ボードを使用して、導波管 (チューブ モデルとも呼ばれます) を実行しました。速度制限のため、リアルタイムで音声に使用できる最短の声道長 (つまり、「話された」速度と同じかそれより速い速度で生成される) は約 15 センチメートルでした。これは、導波管計算のサンプル レートが声道長の減少とともに増加するためです。プロセッサ速度の高速化により、この制限は徐々に解消されつつあり、これはリアルタイムで子供の音声を生成するための重要な進歩です。
NeXTSTEPは廃止されており、NeXTコンピュータは希少であるため、元のコードを実行するための 1 つのオプションは 仮想マシンを使用することです。たとえば、 Previousエミュレーターは、Trillium ソフトウェアで使用できる NeXTコンピュータの DSP をエミュレートできます。
_in_Nextstep_3.3_running_inside_Previous.png/500px-Monet_(Gnuspeech)_in_Nextstep_3.3_running_inside_Previous.png)
Trillium は 1990 年代後半に取引を停止し、Gnuspeech プロジェクトは2002 年に公式のGNUソフトウェアとして、 GNU 一般公衆利用許諾書の条件に基づいてGNU Savannahリポジトリに初めて登録されました。
Gnuspeechは、コードのカスタマイズが可能な無料のオープンソースライセンスを採用しているため、学術研究に活用されてきました。 [9] [10]
参考文献
- ^ https://directory.fsf.org/wiki/gnuspeech。
{{cite web}}:欠落または空|title=(ヘルプ) - ^ COOK, PR (1989) 人間の声道の物理的にパラメータ化されたモデルを使用した歌声の合成。国際コンピュータ音楽会議、オハイオ州コロンバス
- ^ CARRE, R. (1992) 音響管内の特徴的な領域。音声生成モデリング。Journal d'Acoustique、5 141 ~ 159
- ^ 現在、言語・音楽・聴覚学部
- ^ FANT, G. & PAULI, S. (1974) 声道共鳴モデルの空間特性。ストックホルム音声コミュニケーションセミナー議事録、KTH、ストックホルム、スウェーデン
- ^ カルガリー大学の関連ウェブサイト
- ^ チューブ共鳴モデル音声合成装置
- ^ HILL, DR, MANZARA, L. & TAUBE-SCHOCK, CR. (1995) リアルタイム調音音声合成ルール。Proc. AVIOS '95 14th Annual International Voice Technologies Conf、サンノゼ、1995 年 9 月 12 ~ 14 日、27 ~ 44 ページ
- ^ D'Este, F. - 並列多目的遺伝的アルゴリズムによる調音音声合成。修士論文、ライデン先端コンピュータサイエンス研究所、2010 年。
- ^ Xiong, F.; Barker, J. - 構音ベース表現のディープラーニングと構音障害音声認識の改善への応用。ITG 音声コミュニケーション会議、ドイツ、2018 年。
外部リンク
- GNU Savannah の Gnuspeech
- Gnuspeech システムの概要

