
音声コンピューティングは、音声入力を処理するハードウェアまたはソフトウェアを開発する分野です。[1]
これは、人間とコンピュータのインタラクション、会話型コンピューティング、言語学、自然言語処理、自動音声認識、音声合成、オーディオエンジニアリング、デジタル信号処理、クラウドコンピューティング、データサイエンス、倫理、法律、情報セキュリティなど、他の多くの分野にまたがっています。
音声コンピューティングは、特にAmazon EchoやGoogle Assistantなどのスマートスピーカーの登場、サーバーレスコンピューティングへの移行、音声認識やテキスト読み上げモデル の精度の向上により、現代においてますます重要になっています。
歴史
音声コンピューティングには豊かな歴史があります。[2]まず、ヴォルフガング・ケンペレンなどの科学者が、最も初期の合成音声を生成する音声マシンの構築を開始しました。これがきっかけで、トーマス・エジソンはディクテーションマシンで音声を録音し、企業内で再生する研究を進めました。1950年代から1960年代には、ベル研究所、IBMなどが自動音声認識システムを構築する原始的な試みを行いました。しかし、1980年代になって隠れマルコフモデルを使用して最大1,000語を認識するまで、音声認識システムは重要では ありませんでした。
2011年頃、Siriは消費者が利用できる最初の音声アシスタントとしてApple iPhoneに登場しました。このイノベーションは、音声ファーストのコンピューティングアーキテクチャの構築への劇的な転換をもたらしました。2013年にソニーが北米でPS4をリリースし(7,000万台以上のデバイス)、2014年にAmazonがAmazon Echoをリリースし(3,000万台以上のデバイス)、MicrosoftがCortanaをリリースし(2015年、Windows 10ユーザー4億人)、GoogleがGoogle Assistantをリリースし(2016年、Androidフォンの月間アクティブユーザー20億人)、AppleがHomePodをリリースしました(2018年、販売台数50万台、iOS/Siri搭載デバイス10億台)。これらの転換とクラウドインフラストラクチャ( Amazon Web Servicesなど)やコーデックの進歩により、音声コンピューティング分野が確立され、広く一般の人々にとって身近なものになりました。
ハードウェア
音声コンピュータは、音声入力を処理するためのハードウェアとソフトウェアが組み合わされています。
音声コンピュータは、従来のAmazon Echoのように必ずしも画面を必要としないことに留意してください。他の実施形態では、従来のラップトップ コンピュータまたは携帯電話を音声コンピュータとして使用できます。さらに、車内やテレビ内などの IoT対応デバイスの出現により、音声コンピュータ用のインターフェイスがますます増えています。
2018年9月現在、Amazon Alexaと互換性のあるデバイスは20,000種類以上あります。[3]
ソフトウェア
音声コンピューティング ソフトウェアは、音声ファイルの読み取り/書き込み、録音、クリーニング、暗号化/復号化、再生、トランスコード、転記、圧縮、公開、特徴付け、モデル化、視覚化を行うことができます。
音声コンピューティングに関連する一般的なソフトウェア パッケージをいくつか紹介します。
アプリケーション
音声コンピューティングのアプリケーションは、音声アシスタント、ヘルスケア、電子商取引、金融、サプライチェーン、農業、テキスト読み上げ、セキュリティ、マーケティング、顧客サポート、採用、クラウドコンピューティング、マイク、スピーカー、ポッドキャスティングなど、多くの業界に広がっています。音声技術は2025年までに19~25%のCAGRで成長すると予測されており、スタートアップ企業や投資家にとって魅力的な業界となっています。[14]
法的考慮事項
米国では、州によって電話通話録音に関する法律が異なります。一部の州では、一方の当事者の同意があれば会話を録音することが合法ですが、他の州ではすべての当事者の同意が必要です。
さらに、COPPAはインターネットを使用する未成年者を保護する重要な法律です。音声コンピューティングデバイス(Amazon Alexaなど)を操作する未成年者の増加に伴い、連邦取引委員会は2017年10月23日にCOPAA規則を緩和し、子供が音声検索やコマンドを発行できるようにしました。[15] [16]
最後に、GDPRは忘れられる権利やEU市民の多くの条項を規定する新しい欧州法です。GDPRでは、音声録音を行う場合、企業は同意を得るための明確な手段を概説し、これらの録音がどのように使用されるか(トレーニング目的など)の目的と範囲を定義する必要があることも明記されています。GDPRでは、有効な同意の基準が引き上げられました。同意は自由に与えられ、具体的で、情報に基づいた、明確なものでなければなりません。暗黙の同意ではもはや十分ではありません。[17]
研究会議
音声コンピューティングに関連する研究会議は数多くあります。その一部を以下に示します。
- 音響、音声、信号処理に関する国際会議
- インタースピーチ[18]
- アベック[19]
- IEEE国際会議自動顔・ジェスチャー認識[20]
- ACII2019 第8回国際感情コンピューティングとインテリジェントインタラクション会議[21]
開発者コミュニティ
Googleアシスタントには、2018年1月時点で約2,000のアクションがあります。[22]
2018年9月現在、世界中で50,000を超えるAlexaスキルが存在します。[23]
2017年6月、GoogleはYouTube動画から抽出した、人間がラベル付けした10秒間のサウンドクリップの大規模なコレクションであるAudioSet [24]をリリースしました。これには、人間の音声ファイルのビデオ1,010,480本、合計2,793.5時間が含まれています。[25]これはIEEE ICASSP 2017カンファレンスの一環としてリリースされました。[26]
2017年11月、Mozilla Foundationは、より大規模なオープンソースの機械学習コミュニティへの貢献を支援するための音声ファイルのコレクションであるCommon Voice Projectをリリースしました。[27] [28]このボイスバンクは現在12GBのサイズで、2017年6月のプロジェクト開始以来112か国から収集された500時間以上の英語の音声データが含まれています。[29]このデータセットはすでに、オープンソースの文字起こしモデルであるDeepSpeechモデルなどの創造的なプロジェクトを生み出しています。[30]
参照
参考文献
- ^ Schwoebel, J. (2018). Python による音声コンピューティング入門。ボストン、シアトル、アトランタ: NeuroLex Laboratories。https://neurolex.ai/voicebook
- ^ 音声認識のタイムライン。https://medium.com/swlh/the-past-present-and-future-of-speech-recognition-technology-cf13c179aaf
- ^ ボイスボット.AI。 https://voicebot.ai/2018/09/02/amazon-alexa-now-has-50000-skills-worldwide-is-on-20000-devices-used-by-3500-brands/
- ^ FFmpeg. https://www.ffmpeg.org/
- ^ オーダシティ。https://www.audacityteam.org/
- ^ SoX. http://sox.sourceforge.net/
- ^ NLTK. https://www.nltk.org/
- ^ リブローサ。 https://librosa.github.io/librosa/
- ^ OpenSMILE. https://www.audeering.com/technology/opensmile/
- ^ 「PocketSphinx は軽量の音声認識エンジンで、ハンドヘルドデバイスやモバイルデバイス向けに特別に調整されていますが、デスクトップでも同様に機能します: Cmusphinx/Pocketsphinx」。GitHub。2020年3 月 29 日。
- ^ ピッツx3. https://github.com/nateshmbhat/pyttsx3
- ^ Pycryptodome. https://pycryptodome.readthedocs.io/en/latest/
- ^ AudioFlux. https://github.com/libAudioFlux/audioFlux/
- ^ ビジネスワイヤ https://www.businesswire.com/news/home/20180417006122/en/Global-Speech-Voice-Recognition-Market-2018-Forecast
- ^ テッククランチ https://techcrunch.com/2017/10/24/ftc-relaxes-coppa-rule-so-kids-can-issue-voice-searches-and-commands/
- ^ 「連邦官報::アクセス要求」。
- ^ IAPP。 https://iapp.org/news/a/how-do-the-rules-on-audio-recording-change-under-the-gdpr/
- ^ インタースピーチ 2018。http://interspeech2018.org/
- ^ AVEC 2018. http://avec2018.org/
- ^ 2018 FG. https://fg2018.cse.sc.edu/
- ^ ASCII 2019. http://acii-conf.org/2019/
- ^ ボイスボット.ai。 https://voicebot.ai/2018/01/24/google-assistant-app-total-reaches-nearly-2400-thats-not-real-number-really-1719/
- ^ ボイスボット.ai。 https://voicebot.ai/2018/09/02/amazon-alexa-now-has-50000-skills-worldwide-is-on-20000-devices-used-by-3500-brands/。
- ^ Google オーディオセット。https://research.google.com/audioset/
- ^ オーディオセットデータ。 https://research.google.com/audioset/dataset/speech.html
- ^ Gemmeke, JF, Ellis, DP, Freedman, D., Jansen, A., Lawrence, W., Moore, & Ritter, M. (2017 年 3 月)。オーディオ セット: オーディオ イベントのオントロジーと人間がラベル付けしたデータセット。音響、音声、信号処理 (ICASSP)、2017 IEEE 国際会議 (pp. 776-780)。IEEE。
- ^ Common Voice プロジェクト。https://voice.mozilla.org/
- ^ Common Voice プロジェクト。https://blog.mozilla.org/blog/2017/11/29/announcing-the-initial-release-of-mozillas-open-source-speech-recognition-model-and-voice-dataset/
- ^ Mozilla の大規模な音声データリポジトリが機械学習の未来を形作るでしょう。https://opensource.com/article/18/4/common-voice
- ^ DeepSpeech. https://github.com/mozilla/DeepSpeech
