2000年代初頭の時点で、Linux向けには複数の音声認識(SR)ソフトウェアパッケージが存在していた。その中にはフリーソフトウェアやオープンソースソフトウェアもあれば、プロプライエタリソフトウェアもある。音声認識とは通常、人間の言語における数千もの単語を識別しようとするソフトウェアを指す。音声制御とは、コンピュータに操作コマンドを伝えるために使用されるソフトウェアを指す場合もある。
1990年代後半、IBMが開発したViaVoiceのLinux版が無償でユーザーに提供された。しかし、2002年に開発者によってこの無料ソフトウェア開発キット(SDK)は削除された。
2000年代初頭、高品質なLinuxネイティブ音声認識エンジンの開発が推進されました。その結果、Microsoft Cortanaに似たオープンソースのMycroftなど、Linux音声認識プログラムの作成に特化したいくつかのプロジェクトが開始されました。2022年には、 Open-AIが汎用音声認識モデルであるWhisperをMITライセンスの下でオープンソースとして公開しました。[ 1 ]
音声認識プロジェクト用の音響モデルを作成するには、音声コーパスを構築することが不可欠です。VoxForgeは、音声認識プロジェクトで使用するために書き起こされた音声データを収集する目的で構築された、無料の音声コーパスおよび音響モデルリポジトリです。VoxForgeは、クラウドソーシングによる音声サンプルと、認識された音声シーケンスの修正を受け付けています。ライセンスはGNU一般公衆利用許諾契約書(GPL)です。
最初のステップは、コンピューター上で音声ストリームの録音を開始することです。ユーザーには主に2つの処理オプションがあります。
かつてスマートフォンは、音声認識を端末内で処理するのに十分な性能、メモリ容量、ストレージ容量がなかったため、リモート認識を利用していました。これらの制約はほぼ克服されましたが、モバイル端末におけるサーバーベースの音声認識は依然として広く普及しています。
個別音声認識はウェブブラウザ内で実行でき、対応ブラウザであれば問題なく動作します。リモート音声認識は、主にサーバーベースのシステムであるため、デスクトップコンピュータやモバイルデバイスにソフトウェアをインストールする必要はありませんが、上記のようなセキュリティ上の問題が内在しています。
以下は、Linux上で音声認識を実装するためのプロジェクトと、主要なネイティブソリューションの一覧です。これらはエンドユーザー向けアプリケーションではなく、エンドユーザー向けアプリケーションの開発に利用できるプログラミングライブラリです。
音声認識とは、通常、人間の言語における数千もの単語を識別しようとするソフトウェアを指します。音声制御とは、コンピュータや機器に操作コマンドを送信するために使用されるソフトウェアを指す場合があります。音声制御は通常、必要な語彙がはるかに少ないため、実装がはるかに容易です。
シンプルなソフトウェアとキーボードショートカットを組み合わせることで、Linux上で実用的に正確な音声制御を実現する最も早い段階の可能性を秘めている。
Wineを使用すれば、Linux上でDragon NaturallySpeakingなどのプログラムを使用することが可能ですが、使用するバージョンによっては問題が発生する場合があります。[ 4 ]
Linux 上で Windows の音声認識ソフトウェアを使用することも可能だ。無料の仮想化ソフトウェアを使用すれば、Linux 上で Windows とNaturallySpeakingを実行できる。VMware ServerやVirtualBox は仮想マシンとの間でコピー&ペーストをサポートしているため、音声入力したテキストを仮想マシンとの間で簡単に転送できる。[ 5 ]
{{cite web}}: CS1 maint: 複数の名前: 著者リスト (リンク)