ソフトウェアによる音声合成環境は、一般的に音声プログラミング言語(グラフィカルな場合もある)と、その言語を設計・実行するためのユーザー環境から構成されます。これらの環境の多くは、高品質な音声を生成する能力において同等ですが、それぞれの違いや特長が、ユーザーを特定のプラットフォームへと惹きつける要因となります。本稿では、注目すべき音声合成環境を比較し、それらの使用に伴う基本的な問題点を列挙します。
音声合成環境は、多種多様なソフトウェアおよびハードウェア構成から成り立っています。同じ環境であっても、バージョンによって大きく異なる場合もあります。このような多様性のため、異なるシステム間の違いを直接比較することはできません。さらに、比較対象となる要素の中には、客観的に定量化することが非常に困難なものや、個人の好みに大きく左右されるものもあります。
比較対象として一般的に考慮される主観的な属性には、以下のようなものがある。
これらの特性は、評価に用いられる課題によって大きく異なる可能性がある。
その他によく比較される例としては、以下のようなものがあります。
オーディオソフトウェアは、他のソフトウェアと比較すると、しばしばわずかに異なる「音」を持つことがあります。これは、正弦波、ピンクノイズ、FFTといった基本的な構成要素の実装方法が異なるため、結果として聴覚特性がわずかに異なるからです。もちろん、あるシステムの「音」を別のシステムよりも好む人もいるでしょうが、おそらく最適な出力は、高度なオーディオアナライザーとリスナーの耳を組み合わせることで決定できるでしょう。その目的は、多くの人が同意するであろう、可能な限り「純粋」な音に到達することです。
オーディオシステムのインターフェースは、ユーザーの創作活動に大きな影響を与えることが多い。その理由は、何が可能か(ここに挙げた安定した成熟したシステムは、音響的/作曲的な目的を幅広く達成できるだけの十分な機能を備えている)ではなく、何が容易になり、何が困難になるかにある。これもまた、簡潔な比較で説明するのは非常に難しい。一つの問題は、どのようなインターフェースのメタファーが使われているか(例えば、箱とケーブル、ドキュメント、フローグラフ、ハードウェアミキシングコンソールなど)である。
言語環境と他のソフトウェアまたはハードウェアとの間のインターフェース(ユーザーインターフェースではない)。