Common Voiceは、 Mozillaが開始した、自由でオープンな音声コーパスを作成するためのクラウドソーシングプロジェクトです。このプロジェクトは、マイクでサンプル文を録音し、他のユーザーの録音をレビューするボランティアによって支えられています。書き起こされた文は、パブリック ドメインライセンスCC0の下で利用可能な音声データベースに収集されます。[ 1 ]このライセンスにより、開発者は制限や費用なしに、音声テキスト変換およびテキスト音声変換アプリケーションにデータベースを使用できます。
Common Voiceは多様な音声サンプルを提供することを目指しています。MozillaのKatharina Borchert氏によると、既存のプロジェクトの多くは公共ラジオのデータセットを使用していたり、女性や強いアクセントを持つ人が十分に代表されていないデータセットを使用していたりしたとのことです。[ 2 ]
最初のデータセットは2017年11月に公開されました。世界中の2万人以上のユーザーが500時間分の英語の文章を録音しました。[ 3 ]
2019年2月、最初の言語群が利用可能になった。これには、英語、フランス語、ドイツ語、中国語(北京語)などの18言語に加え、ウェールズ語やカビル語などのあまり一般的ではない言語も含まれていた。合計で、42,000人以上の貢献者から提供された約1,400時間の録音音声データが含まれていた。[ 4 ]
2020年7月までに、データベースには54言語で7,226時間の音声録音が蓄積され、そのうち5,591時間はボランティアによって検証済みであった。[ 5 ]
2021年5月、キニヤルワンダ語を追加する作業に続いて、このプロジェクトはスワヒリ語を追加するための助成金を受け取った。[ 6 ]
2022年初頭、Bengali.AIはCommon Voiceと提携し、機械がベンガル語を理解できるようにすることを目的とした「ベンガル語音声認識」プロジェクトを開始しました。2000時間分の音声が収集されました。[ 7 ]
2022年9月、ガーナのトゥイ語がデータベースに追加された100番目の言語であることが発表された。 [ 8 ]
2025年12月現在Mozilla Common Voiceは250以上の言語の音声データを収集しており、最も多くの時間が英語、カタルーニャ語、キニャルワンダ語、ベラルーシ語、エスペラント語で収集されている。[ 9 ]