
バーチャルアシスタント(VA)とは、音声によるものも含め、ユーザーからのコマンドや質問などの入力に基づいて、ユーザーのためにさまざまなタスクやサービスを実行できるソフトウェアエージェントです。こうした技術には、タスクの実行を効率化するためにチャットボット機能が組み込まれていることがよくあります。対話はテキスト、グラフィカルインターフェース、音声で行われる場合があり、一部のバーチャルアシスタントは人間の音声を解釈し、合成音声で応答することができます。
多くの場合、ユーザーは音声コマンドで仮想アシスタントに質問したり、ホームオートメーション機器やメディア再生を制御したり、メール、ToDoリスト、カレンダーなどの基本的なタスクを管理したりできます。[ 1 ]近年、消費者向けに直接利用できる著名な仮想アシスタントには、Apple Siri、Amazon Alexa、Googleアシスタント(Gemini)、Microsoft Copilot、Samsung Bixbyなどがあります。[ 2 ]また、さまざまな業界の企業が、顧客サービスやサポートに何らかの仮想アシスタント技術を組み込むことがよくあります。[ 3 ]
2020年代に入ると、 ChatGPTなどの人工知能ベースのチャットボットの出現により、仮想アシスタント製品およびサービスの分野に機能と関心が高まった。[ 4 ] [ 5 ] [ 6 ]
ラジオレックスは、1916年に特許を取得し[ 7 ]、1922年に発売された最初の音声起動玩具でした[ 8 ]。犬の形をした木製の玩具で、名前を呼ばれると家から出てくる仕組みでした。
1952年、ベル研究所は自動数字認識機「オードリー」を発表した。高さ6フィートのリレーラックを占有し、相当な電力を消費し、多数のケーブルが張り巡らされ、複雑な真空管回路に伴う無数の保守上の問題を抱えていた。音声の基本単位である音素を認識することができた。指定された話者が発話した数字を正確に認識することに限定されていた。そのため、音声ダイヤルに使用できたが、ほとんどの場合、連続する数字を発話するよりもプッシュボタンダイヤルの方が安価で速かった。[ 9 ]
デジタル音声認識を可能にした初期のツールの一つに、IBMの音声起動式電卓「シューボックス」がある。これは1961年の発売後、1962年のシアトル万国博覧会で一般公開された。 1981年に最初のIBMパーソナルコンピュータが登場する約20年前に開発されたこの初期のコンピュータは、 16の単語と0から9までの数字を認識することができた。
最初の自然言語処理コンピュータプログラム、つまりチャットボットELIZAは、1960年代にMITのジョセフ・ワイゼンバウム教授によって開発されました。これは「人間と機械の間のコミュニケーションが表面的であることを示す」ために作成されました。 [ 10 ] ELIZAは、パターンマッチングと置換手法をスクリプト化された応答に使用して会話をシミュレートし、プログラムが理解しているという錯覚を与えました。
伝えられるところによると、ワイゼンバウムの秘書は、ワイゼンバウムに部屋を出るように頼み、彼女とELIZAが本当の会話をしたいと言ったという。ワイゼンバウムはこれに驚き、後にこう書いている。「比較的単純なコンピュータープログラムに極めて短時間触れるだけで、ごく普通の人に強力な妄想的思考を引き起こす可能性があるとは、私は気づいていなかった。」[ 11 ]
このことから、コンピュータの挙動を人間の挙動と無意識のうちに類似していると考える傾向、つまり擬人化という現象がELIZA効果と呼ばれるようになった。これは、人間と仮想アシスタントとのやり取りにおいて見られる現象である。
音声認識技術開発における次の大きな節目は、1970年代にペンシルベニア州ピッツバーグのカーネギーメロン大学で達成されました。米国国防総省とその傘下のDARPA(国防高等研究計画局)の多大な支援を受け、5年間にわたる音声理解研究プログラムが実施され、最低1,000語の語彙の獲得を目指しました。IBM、カーネギーメロン大学(CMU)、スタンフォード研究所などの企業や学術機関がこのプログラムに参加しました。
その結果生まれたのが「ハーピー」だ。約1000語、3歳児並みの語彙力を習得し、文章を理解することができた。あらかじめプログラムされた語彙、発音、文法構造に従って音声を処理し、意味を成す単語の並びを判断することで、音声認識エラーを減らすことができた。
1986年、タンゴラはシューボックスの改良版として、音声認識機能を備えたタイプライターとして登場しました。当時世界最速のタイピストにちなんで名付けられたこのタイプライターは、2万語の語彙を持ち、過去の発言に基づいて最も可能性の高い結果を予測する機能を備えていました。IBMのアプローチは、デジタル信号処理技術に統計学を取り入れた隠れマルコフモデルに基づいています。この手法により、特定の音素に続く可能性が最も高い音素を予測することが可能になりました。しかし、各話者は自分の声をタイプライターに認識させ、単語間に間を置くように個別にトレーニングする必要がありました。
1983年、ガス・サーシーは電子音声ホームコントローラーシステム「バトラー・イン・ア・ボックス」を発明した。 [ 12 ]
1990年代には、デジタル音声認識技術がパーソナルコンピュータの主要機能となり、IBM、フィリップス、レルノート&ハウスピーが顧客獲得競争を繰り広げた。その後、1994年に初のスマートフォンであるIBM Simonが市場に投入され、今日私たちが知るようなスマートな仮想アシスタントの基礎が築かれた。
1997年、Dragon社のNaturallySpeakingソフトウェアは、人間の自然な話し言葉を単語間に間隔を空けずに認識し、1分間に100語の速度で文書に書き起こすことができた。NaturallySpeakingのバージョンは現在もダウンロード可能で、例えば米国や英国の多くの医師が医療記録の作成に利用している。
2001年、ColloquisはAIMやMSN MessengerなどのプラットフォームでSmarterChildを一般公開した。SmarterChildは完全にテキストベースであったが、ゲームをプレイしたり、天気予報を確認したり、事実を調べたり、ある程度ユーザーと会話したりすることができた。[ 13 ]
スマートフォンに搭載された最初の現代的なデジタル仮想アシスタントはSiriで、 2011年10月4日にiPhone 4Sの機能として導入されました。[ 14 ] Apple Inc.は、DARPAと米国国防総省が出資する研究機関であるSRI Internationalのスピンオフ企業であるSiri Inc.を2010年に買収した後、Siriを開発しました。[ 15 ]その目的は、テキストメッセージの送信、電話の発信、天気の確認、アラームの設定などのタスクを支援することでした。時間の経過とともに、レストランのおすすめ、インターネット検索、運転ルート案内を提供するように発展しました。[ 16 ]
2014年11月、AmazonはEchoとともにAlexaを発表しました。[ 17 ] 2016年、SalesforceはSalesforceプラットフォームの基盤となる一連のテクノロジーから開発されたEinsteinを発表しました。[ 18 ] Einsteinは2024年9月にエージェント型AIであるAgentforceに置き換えられました。 [ 19 ]
2017年4月、Amazonはあらゆる種類の仮想アシスタントやインターフェース向けの対話型インターフェースを構築するためのサービスをリリースした。
2020年代には、ChatGPTのような人工知能(AI)システムが、テキストベースの会話に対して人間のような応答を生成できる能力で人気を集めました。2020年2月、マイクロソフトはチューリング自然言語生成(T-NLG)を発表しました。これは当時、「170億のパラメータを持つ、これまで公開された中で最大の言語モデル」でした。[ 20 ] 2022年11月30日、ChatGPTはプロトタイプとして公開され、多くの知識領域にわたる詳細な応答と明確な回答ですぐに注目を集めました。ChatGPTの登場と一般への普及により、この分野への関心と競争が高まりました。2023年2月、Googleは、Webから収集した情報に基づいて質問に対するテキスト応答を生成するLaMDAプログラムに基づく「Bard」と呼ばれる実験的なサービスを開始しました。
ChatGPTや最新の生成AIに基づくその他の汎用チャットボットは、仮想アシスタントに関連するさまざまなタスクを実行できますが、より特定の状況やニーズを対象とするように設計された、より専門的な形態のテクノロジーも存在します。[ 21 ] [ 4 ]

バーチャルアシスタントは以下の方法で機能します。
多くのバーチャルアシスタントは複数の方法でアクセス可能であり、チャット、音声コマンド、その他の統合技術など、ユーザーがそれらとやり取りする方法に多様性を提供している。
バーチャルアシスタントは、自然言語処理(NLP)を用いて、ユーザーのテキスト入力や音声入力を実行可能なコマンドと照合します。中には、機械学習やアンビエントインテリジェンスなどの人工知能技術を用いて継続的に学習するものもあります。
音声で仮想アシスタントを起動するには、ウェイクワードが使用されることがあります。これは、「Hey Siri」、「OK Google」、「Hey Google」、「Alexa」、「Hey Microsoft」などの単語または単語のグループです。[ 24 ]仮想アシスタントの人気が高まるにつれて、法的リスクも増大しています。[ 25 ] : 815

仮想アシスタントは、多くの種類のプラットフォームに統合される場合もあれば、Amazon Alexaのように複数のプラットフォームにまたがって統合される場合もある。
バーチャルアシスタントは、さまざまなサービスを提供できます。これには以下が含まれます。[ 33 ]
会話型コマースとは、音声アシスタント[ 36 ]を含むさまざまなメッセージング手段による電子商取引であり、電子商取引Webサイトでのライブチャット、 WeChat、Facebook Messenger、WhatsAppなどのメッセージングアプリケーションでのライブチャット[ 37 ] 、メッセージングアプリケーションやWebサイト上のチャットボットなども含まれます。
仮想アシスタントは、企業のカスタマーサポートチームと連携して、顧客に24時間365日のサポートを提供できます。迅速な応答により、顧客体験が向上します。サービス業界の企業は、特に営業時間外の対応として、予約や注文受付などの日常的な顧客対応を処理するために、AI音声アシスタントを導入しています。[ 38 ]これらの実装では、業界固有のトレーニングを使用してドメイン用語を理解し、既存のビジネスソフトウェアと統合することがよくあります。
Amazonは、Alexaの「スキル」とGoogleの「アクション」という、アシスタントプラットフォーム上で動作するアプリケーションを提供しています。
仮想アシスタントには、さまざまなプライバシー上の懸念が伴います。音声による起動などの機能は、デバイスが常に音声を聞き取る必要があるため、脅威となります。[ 39 ]仮想セキュリティボタンなどのプライバシーモードは、仮想アシスタントの多層認証を作成するために提案されています。[ 40 ]
Google アシスタントのプライバシーポリシーでは、ユーザーの許可なしに音声データを保存することはないが、エクスペリエンスをパーソナライズするために会話の書き起こしを保存する可能性があると記載されています。パーソナライズは設定でオフにできます。ユーザーが Google アシスタントに音声データを保存させたい場合は、音声と音声アクティビティ (VAA) に移動してこの機能をオンにすることができます。音声ファイルはクラウドに送信され、Google によって Google アシスタントのパフォーマンス向上に使用されますが、これは VAA 機能がオンになっている場合に限ります。[ 41 ]
Amazonの仮想アシスタントAlexaのプライバシーポリシーでは、ウェイクワード(Alexa、Amazon、Echoなど)が使用された場合にのみ会話を聞き取ると規定されています。ウェイクワードが呼び出されると会話の録音を開始し、8秒間無音状態が続くと録音を停止します。録音された会話はクラウドに送信されます。Alexaの「Alexaプライバシー」にアクセスすることで、クラウドから録音を削除できます。[ 42 ]
Appleは、Siriの改善のために音声を録音していないと述べています。代わりに、文字起こしデータを使用していると主張しています。文字起こしデータは、分析に重要と判断された場合にのみ送信されます。ユーザーは、Siriが文字起こしデータをクラウドに送信することを望まない場合は、いつでもオプトアウトできます。[ 43 ]
Cortanaは、単一認証のみの音声専用仮想アシスタントです。[ 44 ] [ 45 ] [ 46 ]この音声起動デバイスは、天気予報の確認や電話の発信などの一般的なタスクを実行するためにユーザーデータにアクセスしますが、二次認証がないためプライバシーの懸念が生じます。[ 47 ] [ 48 ]
バーチャルアシスタントの付加価値は、とりわけ以下のような点から生まれる。

2019年、フランスの社会学者アントニオ・A・カシッリは、人工知能、特にバーチャルアシスタントについて、次のように批判した。
まず第一に、消費者が、多くの場合無意識のうちに、仮想アシスタントのトレーニングや改善のために無償でデータを提供しているという事実は、倫理的に問題がある。
しかし、さらに倫理的に問題なのは、これらのAIがどのようにしてこのデータを使って訓練されているのかを知ることかもしれない。
この人工知能はニューラルネットワークを介してトレーニングされますが、そのためには膨大な量のラベル付きデータが必要です。しかし、このデータは人間のプロセスによってラベル付けされる必要があり、これが過去10年間のマイクロワークの増加を説明しています。つまり、世界中の人々がリモートで、仮想アシスタントの音声データを聞いて、話された内容を書き留めるなど、反復的で非常に単純なタスクを数セントで実行します。マイクロワークは、それが引き起こす雇用の不安定さと、規制の完全な欠如で批判されています。2010年の平均給与は1.38ドル/時でしたが[ 57 ] 、医療保険や退職金、病気休暇、最低賃金は提供されません。したがって、仮想アシスタントとその設計者は、雇用の不安定さを助長しているとして議論の的となっており、彼らが提案するAIは、何百万人もの人間の労働者のマイクロワークなしには不可能であるという点で、依然として人間的です。[ 53 ]
音声コマンドが暗号化されていない形式で仮想アシスタントの提供者に提供され、第三者と共有され、許可されていない、または予期しない方法で処理される可能性があるという事実から、プライバシーに関する懸念が生じています。[ 58 ]録音された音声の言語的内容に加えて、ユーザーの表現方法や声の特徴には、生体認証情報、性格特性、体型、身体的および精神的健康状態、性別、ジェンダー、気分や感情、社会経済的地位、地理的起源に関する情報が暗黙のうちに含まれている可能性があります。[ 59 ]
Siri、Cortana、Alexaなどのほとんどの仮想アシスタントは、デフォルトで女性の声とペルソナを特徴としており、秘書業務の労働政治の問題に注目が集まっています。これらの仮想アシスタントの声の女性化は、女性の仕事に根付いたジェンダーバイアスに関する懸念を引き起こし、ユーザーがそれらとやり取りする際に女性の従属的な考え方を強化します。仮想秘書として、これらのアシスタントは、秘書が女性的で、支援的で、脅威を与えないサービス業務というステレオタイプと結びついています。[ 60 ]
研究者たちは、仮想アシスタントの女性的な声に注目し、テクノロジーにおけるジェンダーに基づく問題を取り上げている。ジェンダーバイアスのあるテクノロジーは、女性の客体化やジェンダーステレオタイプを強め、ジェンダーギャップを拡大させる可能性があるため、これは興味深い問題である。さらに、無意識のバイアスが子供や大人に現れ、女性や命令を組み込むことで性差別的な物語を強制するという懸念もある。[ 61 ]
仮想アシスタント向けの注目すべき開発者プラットフォームには、以下のようなものがあります。
以前の世代のテキストチャットベースの仮想アシスタントでは、アシスタントはアバター(インタラクティブなオンラインキャラクターまたは自動化されたキャラクターとも呼ばれる)によって表現されることが多かった。これは具現化されたエージェントとして知られていた。
仮想アシスタントによって実現されるデジタル体験は、近年の主要な技術進歩と最も有望な消費者トレンドの一つと考えられています。専門家は、デジタル体験は「現実の」体験に匹敵するステータスを獲得し、さらに人気が高まり、価値が高まるだろうと主張しています。[ 66 ]この傾向は、仮想デジタルアシスタントの頻繁なユーザーの数と、世界におけるユーザー数の大幅な増加によって裏付けられています。2017年半ばには、デジタル仮想アシスタントの頻繁なユーザー数は世界中で約10億人と推定されています。[ 67 ]さらに、仮想デジタルアシスタント技術はもはやスマートフォンアプリケーションに限定されず、自動車、通信、小売、ヘルスケア、教育など、多くの産業分野に広がっていることが観察されています。[ 68 ] あらゆる分野の企業の多額の研究開発費とモバイルデバイスの導入の増加に対応して、音声認識技術の市場は、 2016年から2024年の期間に世界的に年平均成長率34.9%で成長し、2024年までに世界市場規模が75億米ドルを超えることが予測されています。 [ 68 ] Ovumの調査によると、「ネイティブデジタルアシスタントのインストールベース」は、75億台のアクティブな音声AI対応デバイスで、2021年までに世界の人口を超えることが予測されています。[ 69 ] Ovumによると、その時点で「Googleアシスタントが23.3%の市場シェアで音声AI対応デバイス市場を支配し、SamsungのBixby(14.5%)、AppleのSiri(13.1%)、AmazonのAlexa(3.9%)、MicrosoftのCortana(2.3%)がそれに続く」とのことです。[ 69 ]
市場リーダーの地域分布を考慮すると、 BYOD( Bring Your Own Device )とエンタープライズ モビリティ ビジネス モデルの大きな影響により、北米企業( Nuance Communications、IBM、eGainなど)が今後数年間業界を支配すると予想されます。さらに、スマートフォン アシスト プラットフォームの需要の増加により、北米のインテリジェント バーチャル アシスタント(IVA)業界の成長がさらに促進されると予想されます。北米市場と比較すると規模は小さいものの、インドと中国に主要プレーヤーを擁するアジア太平洋地域のインテリジェント バーチャル アシスタント業界は、2016~2024 年の間に年間 40% の成長率(世界平均を上回る)で成長すると予測されています。[ 68 ]
仮想アシスタントは個人向けのガジェットとしてのみ捉えるべきではなく、企業にとって真の経済的有用性を持つ可能性がある。たとえば、仮想アシスタントは百科事典的な知識を持つ常時利用可能なアシスタントの役割を果たすことができる。そして、会議の手配、在庫の確認、情報の検証を行うことができる。仮想アシスタントの重要性は、中小企業への導入がモノのインターネット(IoT)のより広範な適応と利用を通じて容易な第一歩となることが多いことから、ますます高まっている。実際、IoT技術は中小企業にとって最初は非常に重要な技術として認識されているが、複雑すぎたり、リスクが高すぎたり、コストがかかりすぎたりするため、使用できないと考えられている。[ 70 ]
2018 年 5 月、カリフォルニア大学バークレー校の研究者らは、人間の耳には聞き取れない音声コマンドを音楽や音声テキストに直接埋め込むことで、ユーザーが気づかないうちに仮想アシスタントを操作して特定の動作を実行させることができることを示す論文を発表した。[ 71 ]研究者らは音声ファイルに小さな変更を加え、音声認識システムが検出するはずの音のパターンを打ち消した。これらの音は、システムによって異なる解釈をされ、電話番号をダイヤルしたり、ウェブサイトを開いたり、送金したりするように指示する音に置き換えられた。[ 71 ]この可能性は 2016 年以来知られており、[ 71 ] Apple、Amazon、Google のデバイスに影響を及ぼしている。[ 72 ]
意図しない動作や音声録音に加えて、インテリジェント仮想アシスタントに関連するもう 1 つのセキュリティおよびプライバシーのリスクは、悪意のある音声コマンドです。攻撃者がユーザーになりすまし、悪意のある音声コマンドを発行して、たとえばスマートドアのロックを解除して家やガレージに不正に侵入したり、ユーザーの知らないうちにオンラインで商品を注文したりします。一部の IVA には、このようななりすましを防ぐための音声トレーニング機能がありますが、システムが似たような声を区別するのは難しい場合があります。したがって、IVA 対応デバイスにアクセスできる悪意のある人物は、システムを騙して自分が本当の所有者であると思わせ、犯罪行為やいたずら行為を実行できる可能性があります。[ 73 ]
タイトル: 航空会社情報システム、1989 年 – AT&T アーカイブ – 音声認識