
音声ユーザーインターフェース(VUI)は、音声認識を用いて音声コマンドを理解し、質問に答えることで、人間とコンピュータとの音声による対話を可能にするもので、通常はテキスト読み上げ機能を用いて応答を再生します。音声コマンドデバイスとは、音声ユーザーインターフェースで制御されるデバイスのことです。
音声ユーザーインターフェースは、自動車、ホームオートメーションシステム、コンピュータのオペレーティングシステム、洗濯機や電子レンジなどの家電製品、テレビのリモコンなどに搭載されています。スマートフォンやスマートスピーカーの仮想アシスタントと対話する主な方法となっています。従来の自動応答システム(電話を適切な内線に転送する)や対話型音声応答システム(電話でより複雑な取引を行う)は、キーパッドのボタン操作にDTMFトーンで応答できますが、完全な音声ユーザーインターフェースを備えたシステムでは、発信者はボタンを押すことなく、音声で要求や応答を行うことができます。
最新の音声コマンドデバイスは話者に依存しないため、アクセントや方言の影響に関係なく、複数の声に反応できます。また、複数のコマンドに同時に反応し、音声メッセージを分離し、適切なフィードバックを提供することで、自然な会話を正確に模倣できます。[ 1 ]
VUIとは、あらゆる音声アプリケーションのインターフェースのことです。ほんの少し前までは、話しかけるだけで機械を操作できるなどということは、SFの世界でしか考えられませんでした。つい最近まで、この分野は人工知能(AI)の領域と考えられていました。しかし、テキスト読み上げ、音声認識、自然言語処理、クラウドサービスといった技術の進歩により、これらのインターフェースが広く普及するようになりました。VUIはより一般的になり、人々はハンズフリー、アイズフリーのインターフェースがもたらす様々な場面での価値を享受しています。
VUI(音声ユーザーインターフェース)は、入力を確実に処理する能力に依存しており、パフォーマンスが不安定だと、ユーザーエンゲージメントの低下や否定的なフィードバックにつながることがよくあります。優れたVUIを設計するには、コンピュータサイエンス、言語学、心理学などの人間工学といった学際的な才能が必要です。高度な開発ツールを使用しても、効果的なVUIを構築するには、実行されるタスクと、最終的なシステムを使用する対象ユーザーの両方を理解することが不可欠です。VUIがユーザーのタスクに関するメンタルモデルに合致すればするほど、ほとんど、あるいは全くトレーニングなしで簡単に使用できるようになり、結果として効率性とユーザー満足度の両方が向上します。
一般ユーザー向けに設計された音声ユーザーインターフェース(VUI)は、使いやすさを重視し、初めて利用するユーザーに対して多くのヘルプとガイダンスを提供する必要があります。一方、少数のパワーユーザー(現場サービス担当者を含む)向けに設計されたVUIは、ヘルプやガイダンスよりも生産性に重点を置くべきです。このようなアプリケーションは、通話フローを効率化し、プロンプトを最小限に抑え、不要な反復を排除し、発信者が複数の情報を1回の発話で任意の順序や組み合わせで入力できる、精巧な「混合イニシアチブダイアログ」を可能にする必要があります。つまり、音声アプリケーションは、自動化される特定の業務プロセスに合わせて慎重に設計されなければなりません。
すべての業務プロセスが音声自動化に適しているわけではありません。一般的に、問い合わせや取引が複雑になればなるほど、自動化は難しくなり、一般ユーザーにとって不都合が生じる可能性が高くなります。場合によっては、自動化が全く適用できないため、オペレーターによる対応が唯一の選択肢となることもあります。例えば、法律相談ホットラインの自動化は非常に困難です。一方で、音声は、作業指示書のステータス変更、時間や経費の入力、口座間の資金移動など、迅速かつ定型的な取引の処理に最適です。
VUIの初期の応用例としては、電話への音声ダイヤルがあり、これは直接ダイヤルする場合もあれば、(通常はBluetooth接続の)ヘッドセットや車載オーディオシステムを介してダイヤルする場合もある。
2007年、CNNのビジネス記事は、音声コマンドが10億ドルを超える産業であり、GoogleやAppleなどの企業が音声認識機能の開発に取り組んでいると報じた。[ 2 ] この記事が掲載されて以来、世界はさまざまな音声コマンドデバイスを目にしてきた。さらに、GoogleはPico TTSと呼ばれる音声認識エンジンを開発し、AppleはSiriをリリースした。音声コマンドデバイスはより広く普及し、人間の声を使用する革新的な方法が常に生み出されている。たとえば、Business Weekは、将来のリモコンは人間の声になるだろうと示唆している。現在、Xbox Liveはそのような機能をサポートしており、ジョブズは新しいApple TVでそのような機能があることを示唆した。[ 3 ]
Apple MacとWindows PCはどちらも、最新のオペレーティングシステムに音声認識機能を内蔵している。
マイクロソフトのオペレーティングシステムであるWindows 7とWindows Vistaには、音声認識機能が搭載されています。マイクロソフトは、マウスやキーボードの使用を制限しつつも、全体的な生産性を維持または向上させたいユーザーのために、音声コマンドをオペレーティングシステムに統合しました。[ 4 ]
Windows Vistaの音声コントロールを使用すると、ユーザーは主要なアプリケーションで文書やメールを音声入力したり、アプリケーションを起動して切り替えたり、オペレーティングシステムを制御したり、文書をフォーマットしたり、文書を保存したり、ファイルを編集したり、エラーを効率的に修正したり、Web上でフォームに入力したりできます。音声認識ソフトウェアは、ユーザーが使用するたびに自動的に学習し、音声認識は英語(米国)、英語(英国)、ドイツ語(ドイツ)、フランス語(フランス)、スペイン語(スペイン)、日本語、中国語(繁体字)、中国語(簡体字)で利用できます。さらに、このソフトウェアには、ユーザーと音声認識エンジンの両方をトレーニングするために使用できるインタラクティブなチュートリアルが付属しています。[ 5 ]
Windows Vista で提供されていたすべての機能に加えて、Windows 7 ではマイクの設定ウィザードと、その機能の使い方に関するチュートリアルが提供されています。[ 6 ]
すべてのMac OS Xコンピュータには、音声認識ソフトウェアがプリインストールされています。このソフトウェアはユーザーに依存せず、ユーザーは「メニューをナビゲートしたり、キーボードショートカットを入力したり、チェックボックス名、ラジオボタン名、リスト項目、ボタン名を音声で読み上げたり、アプリケーションを開いたり閉じたり、制御したり、切り替えたりすることができます。」[ 7 ]ただし、Apple の Web サイトでは、 Dictateという市販製品を購入することを推奨しています。[ 7 ]
ユーザーが内蔵の音声認識ソフトウェアに満足していない場合、またはユーザーのOSに内蔵の音声認識ソフトウェアがない場合、Windows PCの場合はBraina ProやDragonNaturallySpeakingなどの市販製品[ 8 ] 、Mac OSの場合は同じソフトウェアの名前であるDictate [ 9 ]を試してみることができます。
Android OS、Microsoft Windows Phone、iOS 9以降、またはBlackBerry OSを搭載したモバイルデバイスはすべて、音声コマンド機能を提供します。各携帯電話のオペレーティングシステムに内蔵されている音声認識ソフトウェアに加えて、ユーザーは各オペレーティングシステムのアプリケーションストア(Apple App Store、Google Play、Windows Phone Marketplace(当初はWindows Marketplace for Mobile)、またはBlackBerry App World )からサードパーティ製の音声コマンドアプリケーションをダウンロードできます。
Google はAndroidと呼ばれるオープンソースのオペレーティングシステムを開発しており、ユーザーはテキスト メッセージの送信、音楽の再生、道順の取得、企業への電話、連絡先への電話、メールの送信、地図の表示、ウェブサイトへのアクセス、メモの作成、Google の検索などの音声コマンドを実行できます。[ 10 ]音声認識ソフトウェアはAndroid 2.2 "Froyo" 以降すべてのデバイスで利用できますが、設定は英語に設定する必要があります。[ 10 ] Google ではユーザーが言語を変更でき、音声認識機能を初めて使用する際に、音声データを Google アカウントに紐付けるかどうかをユーザーに尋ねます。ユーザーがこのサービスにオプトインすると、Google はソフトウェアをユーザーの声に合わせてトレーニングできます。[ 11 ]
GoogleはAndroid 7.0「Nougat」でGoogleアシスタントを導入しました。これは以前のバージョンよりもはるかに高度な機能を備えています。
Amazon.comでは、Amazon独自のAndroidバージョンを使用して音声インターフェースを提供するEchoを販売している。
Windows Phone は、 Microsoftのモバイル デバイス用オペレーティングシステムです。Windows Phone 7.5 では、音声アプリはユーザーに依存しないため、連絡先リストから誰かに電話をかけたり、任意の電話番号に電話をかけたり、最後にかけた番号にリダイヤルしたり、テキスト メッセージを送信したり、ボイス メールを呼び出したり、アプリケーションを開いたり、予定を読み上げたり、電話の状態を照会したり、Web を検索したりするために使用できます。[ 12 ] [ 13 ] さらに、音声は通話中にも使用でき、通話中に次の操作が可能です。番号を押す、スピーカー フォンをオンにする、または誰かに電話をかける(現在の通話を保留にする)。[ 13 ]
Windows 10では、Windows Phoneで従来使用されていた音声コントロールに代わる音声コントロールシステム「Cortana」が導入されました。
Appleは、iPhone OS 3の新機能として、iOSデバイスファミリーに音声コントロールを追加しました。iPhone 4S、iPad 3、iPad mini 1G、iPad Air、iPad Pro 1G、iPod touch 5G以降には、Siriと呼ばれるより高度な音声アシスタントが搭載されています。音声コントロールは、新しいデバイスの設定メニューから有効にすることもできます。Siriは、ユーザーが音声コマンドを発行できる、ユーザーに依存しない組み込みの音声認識機能です。Siriを使用すると、テキストメッセージの送信、天気の確認、リマインダーの設定、情報の検索、会議のスケジュール設定、メールの送信、連絡先の検索、アラームの設定、道順の取得、株価の追跡、タイマーの設定、音声コマンドクエリの例の質問などのコマンドを発行できます。[ 14 ] さらに、SiriはBluetoothおよび有線ヘッドホンでも動作します。[ 15 ]
Apple は、2023 年 9 月 18 日にリリースされたiOS 17で、アクセシビリティ機能として Personal Voice を導入しました。 [ 16 ]この機能により、ユーザーはテキスト読み上げアプリケーションで使用するために、機械学習 (AI) によって生成されたパーソナライズされた音声を作成できます。特に音声障害のある人向けに設計されたPersonal Voice は、ユーザーの声の独特なサウンドを維持するのに役立ちます。よりパーソナライズされた包括的なユーザー エクスペリエンスを提供することで、 Siriやその他のアクセシビリティ ツールを強化します。Personal Voice は、アクセシビリティとイノベーションに対する Apple の継続的な取り組みを反映しています。[ 17 ] [ 18 ]
2014年、Amazonはスマートホームデバイス「Alexa」を発表しました。当初の主な目的は、消費者が音声でデバイスを操作できるスマートスピーカーでした。最終的には、音声で家電を操作できる斬新なデバイスへと進化しました。現在では、電球や温度など、ほぼすべての家電をAlexaで操作できます。音声制御を可能にすることで、Alexaはスマートホーム技術に接続し、ユーザーが家の鍵をかけたり、温度を制御したり、さまざまなデバイスを起動したりできるようになります。このAIでは、ユーザーが質問をするだけで、Alexaが答えを検索、見つけ、読み上げてくれます。[ 19 ]
自動車技術が向上するにつれて、車にはより多くの機能が追加され、これらの機能はドライバーの注意をそらす可能性があります。CNETによると、車の音声コマンドは、ドライバーが注意をそらすことなくコマンドを発行できるようにするはずです。CNETは、Nuanceが将来、Siriに似たソフトウェアを車用に作成することを提案していると述べています。[ 20 ] 2011年に市場に出回っていたほとんどの音声認識ソフトウェアには、約50~60個の音声コマンドしかありませんでしたが、Ford Syncには10,000個ありました。[ 20 ]しかし、CNETは、運転中にユーザーが実行したいタスクの複雑さと多様性を考えると、10,000個の音声コマンドでも十分ではないと示唆しました。[ 20 ]車の音声コマンドは、携帯電話やコンピューターの音声コマンドとは異なり、ドライバーはこの機能を使用して近くのレストラン、ガソリンスタンド、運転ルート、道路状況、最寄りのホテルの場所などを検索できます。[ 20 ]現在、テクノロジーにより、ドライバーはGarminのようなポータブルGPSと自動車メーカーのナビゲーションシステムの両方で音声コマンドを発行できます。 [ 21 ]
自動車メーカー各社が提供する音声コマンドシステムの一覧:
ほとんどの音声ユーザーインターフェースは人間の話し言葉による対話をサポートするように設計されていますが、最近では非言語的な人間の音を入力として受け取るインターフェースの設計も検討されています。[ 22 ] [ 23 ]これらのシステムでは、ユーザーはハミング、口笛、マイクへの息吹きなどの非言語的な音を発することでインターフェースを制御します。[ 24 ]
非言語音声ユーザーインターフェースの一例として、ケリー・ドブソンが制作したインタラクティブアートインスタレーション「Blendie」[ 25 ] [ 26 ]が挙げられます。この作品は、マイク入力に反応するように改造された1950年代の古典的なブレンダーで構成されています。ブレンダーを操作するには、ユーザーはブレンダーが通常出す機械的な回転音を真似る必要があります。ブレンダーは、ユーザーの低い唸り声に反応してゆっくりと回転し、ユーザーがより高い声を出すと回転速度が上がります。
もう1つの例として、VoiceDraw [ 27 ]があります。これは、運動能力が限られている人がデジタルで絵を描くことを可能にする研究システムです。VoiceDraw では、ブラシの方向にマッピングされた母音の音を調整することで、デジタルキャンバス上にストロークを「描く」ことができます。その他のパラ言語的特徴(例えば、声の大きさ)を調整することで、ブラシのストロークの太さなど、描画のさまざまな特徴を制御できます。
その他のアプローチとしては、非言語的な音を採用してタッチベースのインターフェース(例えば携帯電話)を拡張し、指の入力だけでは不可能な新しいタイプのジェスチャーをサポートすることが挙げられる。[ 24 ]
音声インターフェースは、ユーザビリティに関して多くの課題を抱えています。グラフィカルユーザーインターフェース(GUI)とは対照的に、音声インターフェース設計のベストプラクティスはまだ発展途上です。[ 28 ]
純粋に音声ベースのインタラクションでは、音声ユーザーインターフェイスは発見性が低い傾向があります。[ 28 ]ユーザーがシステムの機能の範囲を理解するのが難しいためです。システムが視覚表示なしで何が可能かを伝えるには、利用可能なオプションを列挙する必要がありますが、これは面倒になったり、実行不可能になったりする可能性があります。発見性が低いと、ユーザーは自分が「許可されている」発言内容について混乱したり、システムの理解範囲に関する期待がずれたりすることがよくあります。[ 29 ] [ 30 ]
近年、音声認識技術は著しく進歩しているものの、音声ユーザーインターフェースは依然として、ユーザーの発話が正しく解釈されない解析エラーや文字起こしエラーに悩まされている。 [ 31 ]これらのエラーは、音声コンテンツに専門用語(例えば医学用語)や、音楽アーティスト名や曲名などの非慣用的な綴りが含まれている場合に特に多く発生する傾向がある。[ 32 ]
会話理解を最大化するための効果的なシステム設計は、依然として研究の未解決領域である。会話状態を解釈および管理する音声ユーザーインターフェイスの設計は、共参照解決、固有表現認識、情報検索、対話管理などの複雑な自然言語処理タスクを統合することの本質的な難しさから困難である。[ 33 ]今日のほとんどの音声アシスタントは、単一のコマンドを非常にうまく実行できるが、狭いタスクや会話の数回のターンを超えて対話を管理する能力は限られている。[ 34 ]
音声コマンドが暗号化されていない形式で音声ユーザーインターフェースの提供者に利用可能であり、そのため第三者と共有され、不正または予期しない方法で処理される可能性があるという事実により、プライバシーの懸念が生じます。[ 35 ] [ 36 ]録音された音声の言語的内容に加えて、ユーザーの表現方法や声の特徴には、生体認証ID、性格特性、体型、身体的および精神的健康状態、性別、ジェンダー、気分や感情、社会経済的地位、地理的起源に関する情報が暗黙のうちに含まれている可能性があります。[ 37 ]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)