
スマートスピーカーは、スピーカーと音声コマンドデバイスの一種で、仮想アシスタントが内蔵されており、1つ(または複数)の「ウェイクワード」によって対話的な操作やハンズフリーでの起動が可能です。一部のスマートスピーカーは、 Wi-Fi、Bluetooth、Threadなどのプロトコル規格を使用してスマートホームハブとしても機能し、オーディオ再生以外の用途にも拡張して、ローカルエリアネットワーク経由で接続されたホームオートメーションデバイスを制御できます。
初期の音声起動デバイスは、2013年にMITのJasperプロジェクト[ 1 ]から始まりました。これは、複数のマイクとクラウドソフトウェアを使用して、部屋の離れた場所からハンズフリーで操作できるようにしたものです。
初の商用スマートスピーカーは、Alexaと遠距離マイクのリングを搭載したAmazon Echoで、2014年に発売されました。Googleは2016年にGoogleアシスタントを搭載したHomeを発売し、これに続きました。2017年までに、Echo ShowやHome Hub(後にNest Hubと呼ばれる)などのデバイスがタッチスクリーンとビデオ機能を追加し、「スマートディスプレイ」というサブカテゴリが生まれました。2018年には、Appleが内蔵アシスタントSiriと高音質オーディオに重点を置いたHomePodを発売し、スマートスピーカーのトレンドに参入しました。
ASUSは2019年に人工知能を搭載した独自のスマートスピーカーXiao-Buを発売したが、2025年6月1日にクラウドサービスを終了するため、天気、ニュース、通貨換算などのすべてのリアルタイムサービスが影響を受ける[ 2 ]。[ 3 ] Sonosの最初のスマートスピーカーSonos Oneは2017年に発売され、Alexaを搭載していた。Harman KardonのInvokeは、 MicrosoftのインテリジェントパーソナルアシスタントCortanaを搭載していた。
2020年代初頭、スマートスピーカーは応答速度の向上とプライバシーの強化のためにデバイス上での音声処理機能を獲得した。MatterやThreadなどの新しい規格により、多数のスマートホームデバイス(全く異なるブランドのものでも)が連携して動作できるようになった。[ 4 ]
スマートスピーカーは、複数のマイクとノイズキャンセリングソフトウェアを使用して、音楽が再生されている場合やアシスタントが既に話している場合でも、部屋のどこからでもあなたの声を拾います。スピーカーはノイズ抑制とエコーキャンセリングも使用して、話している人に焦点を当て、周囲の雑音を無視します。ほとんどのスマートスピーカーモデルは、音声認識によって話している人を認識できるため、スピーカーはその人のカレンダー、好み、音楽プレイリストから情報を取得できます。
スピーカーで音楽を聴くとき、音質の良さがどれほど重要かが明らかになります。Home MiniやEcho Dotのようなエントリーレベル(安価な)スピーカーには、フルレンジドライバーが1つだけ搭載されています。これらの低価格帯スピーカーは、音質がかなり劣るため、音楽鑑賞にはあまり適していません。一方、Home MaxやEcho Studioのような上位機種には、高音質で音楽を聴くことを目的としたツイーターとウーファーが別々に搭載されています。
ほとんどのデバイスは Wi-Fi または Bluetooth で接続し、Thread や Matter などのハブ プロトコルをサポートしています。これにより、音楽をストリーミングして再生できるだけでなく、さまざまなブランドのスマート ライト、サーモスタット、ドア ロック、カメラなどを 1 つの制御ポイントから制御することもできます。それぞれに専用のインターフェースと内部機能があり、通常はアプリケーションまたはホーム オートメーションソフトウェアを介して起動または制御されます。[ 5 ]これらのデバイスは、メッシュ ネットワークを介したピア ツー ピア接続で相互に通信できます。これらのスピーカーと関連するスマート デバイスは、通常、 1 つのスマートフォンアプリケーションで制御されます。[ 6 ]
内蔵アシスタントは、タイマー、アラーム、リマインダー、ニュース速報、天気予報、他のスマートデバイスへのメッセージ送信、テキスト送信、通話、簡単な質問などを処理します。これらのアクションは、一般的にルーティンと呼ばれるもの(たとえば、「おはよう」と言うと、照明が点灯し、コーヒーが淹れられ、天気予報が読み上げられ、ニュースが読み上げられる)に組み合わせることができ、スキルまたはアクションと呼ばれる追加機能(食べ物の注文やクイズゲームのプレイなど)を追加することもできます。スマートスピーカーのこのようなハンズフリーの使用は、障害のある方を支援するのに役立ちます。他のほとんどのテクノロジーでは、ユーザーがデバイスと物理的にやり取りできる必要があります。スマートスピーカーはこれらの制限に縛られず、腕や脚が使えない方や視覚に問題のある方にとって優れたツールとして機能します。[ 7 ]
これらのタスクは電話やコンピューターでも実行できますが、スマートスピーカーは電話よりもはるかに広い範囲をカバーできることや、ほとんどのスマートフォンのように音声アシスタントを起動するためにスピーカーを物理的に操作する必要がないことなどの理由から、消費者はスマートスピーカーを好む傾向があります。電話の場合は、音声アシスタントを起動するために特定の部分を操作する必要がある場合があります。[ 8 ]

スマートスピーカーの中には、ユーザーに視覚的な応答を表示するスクリーンを備えているものもあります。タッチスクリーンを備えたスマートスピーカーはスマートディスプレイと呼ばれています。[ 9 ] [ 10 ]これらは、会話型ユーザーインターフェイスとディスプレイ画面を統合し、画像や動画で音声インタラクションを強化します。一般的な音声アシスタントのいずれかによって駆動され、スマートホームデバイスの追加コントロール、ストリーミングアプリ、コンテンツを選択するためのタッチコントロールを備えたウェブブラウザを提供します。最初のスマートディスプレイは、2017年にAmazon(Amazon Echo Show)とGoogle(Google/Nest Home Hub)によって発表されました。
ホテルチェーンのマリオット・インターナショナルは、2018年からアマゾンと提携して一部のホテルにEchoデバイスを設置している。[ 11 ]
台湾のスタートアップ企業であるAielloは、 2019年にアジアのホテル市場でAiello Voice Assistant(AVA)を発売し、マルチAIモデルシステムを搭載していると主張した。[ 12 ]
Amazon Echoに似たNomadixのAngie [ 13 ]は、2017年に北米のホテルをターゲットとした最初の製品を発売しました。2019年5月、Angie Hospitalityは、ホテル向けに独自の音声認識対応仮想アシスタント技術を開発していた競合企業Roxyの資産を買収しました。この買収により、2つの独自のNLPスタックが現在のNomadix製品に統合されました。[ 14 ]
最新のスピーカーは、デバイス上のAIまたはクラウドベースの生成モデルを使用して、スマートスピーカーがより自然な会話を続けたり、メールやレシピを作成したり、コンテキストに基づいてアイデアを提案したり、短い音楽やアート作品を作成したりすることを可能にします。このAIの進化により、これらのスピーカーは以前よりもはるかに多くのことができるようになります。[ 15 ]
2020年3月に発表された米国科学アカデミー紀要による研究によると、アマゾン、アップル、グーグル、ヤンデックス、IBM、マイクロソフトの6大テクノロジー開発企業は、 「白人」よりも「黒人」が話す言葉を誤認するケースが多い。テストされたシステムでは、エラーと判読不能性がそれぞれ19~35%、2~20%の不一致が見られた。[ 16 ]
北米計算言語学会(NAACL)も、男性と女性の声の差異を指摘している。同協会の研究によると、Googleの音声認識ソフトウェアは、女性よりも男性の方が13%精度が高い。Bing、AT &T、IBMが使用するシステムよりも性能が良い。 [ 17 ]
スマートスピーカーに内蔵されているマイクは、ウェイクワードとコマンドを常に聞き取っています。しかし、この常時リスニングマイクは、ユーザーの間でプライバシーに関する懸念も引き起こしています。[ 18 ]西ヨーロッパの1,007人を対象とした調査によると、プライバシーは消費者が「スマート」製品を購入するのを妨げる最大の懸念事項であることが明らかになっています。[ 19 ]これらの懸念には、何が録音されているか、データがどのように使用されるか、どのように保護されるか、侵襲的な広告に使用されるかどうかなどが含まれます。[ 20 ] [ 21 ]さらに、Amazon Echo Dotの分析では、「誤った音声録音の30~38%が人間の会話」であることが示されており、これらのデバイスがウェイクワードの検出以外の音声もキャプチャしていることが示唆されています。[ 22 ]
スマートスピーカーの常時マイクは盗聴の格好の標的となるという強い懸念がある。2017年、英国のセキュリティ研究者マーク・バーンズは、2017年以前のEchoには、侵害されたOSを起動できる露出したピンがあることを示した。[ 23 ]
セントルイスのワシントン大学の助教授であるウマル・イクバル氏によると、研究では、Alexaとの消費者のやり取りから得られたデータが、消費者に広告や製品をターゲティングするために使用されており、送信されたデータの40%以上が適切な暗号化を欠いているため、プライバシーの懸念が高まっていることが示されている。[ 24 ]さらに、スマートスピーカーは常に音声をキャプチャできるため、スマートスピーカーに与えられたコマンドとは関係のない消費者の外部の会話も拾い始めるというデータがある。家庭内の他のメンバー、電話中の消費者、さらにはテレビの音声なども、これらのスピーカーによって拾われ、企業が将来使用するために保存される可能性がある。[ 25 ]
音声アシスタントは貴重なサービスを提供しているが、公共の場や他のユーザーの周りなど、さまざまな社会的状況での使用にはためらいがある。[ 26 ]しかし、ユーザーがスマートフォンではなくスマートスピーカーを介して音声アシスタントとやり取りし始めたのはごく最近のことである。スマートフォンでは、ほとんどの音声アシスタントは、スマートスピーカーのウェイクワードによる操作だけでなく、物理ボタン(たとえば、ホームボタンを長押ししてSiriを起動する)で起動するオプションがある。この違いは、マイクがオンになるタイミングを制限することでプライバシーを高めるが、ユーザーは最初にボタンを押さなければならないことで音声操作の利便性が損なわれると感じた。[ 27 ]このトレードオフは音声アシスタントに限ったことではなく、ますます多くのデバイスがオンラインになるにつれて、利便性とプライバシーの間のトレードオフが大きくなっている。[ 28 ]
認証なしで設定した場合、スマートスピーカーは意図したユーザーや所有者以外の人物によって起動される可能性があります。たとえば、自宅やオフィスへの訪問者、または開いた窓、部分的な壁、またはセキュリティフェンスの外にある公共の場所にいる人物がスピーカーに音声を拾われる可能性があります。これにより、所有者の許可なしに、他の人が所有者の個人情報にアクセスできるようになる可能性があります。あるチームは、道路を挟んだ別の建物から、閉じた窓越しにレーザーを使用してスマートスピーカーやスマートフォンのマイクを刺激できることを実証しました。[ 29 ]
スマートスピーカーは、その利便性とシンプルさゆえに、ホームネットワークのセキュリティ上の懸念事項として見落とされがちです。しかし、現在では3件に1件の侵害がIoTデバイスに関係しています。[ 30 ]スマートスピーカーを介してハッキングされるリスクは、いくつかの簡単な手順に従うことで大幅に軽減できます。まず、スマートスピーカーを購入する際には、信頼できるブランドを選ぶ必要があります。ニーズや希望に合致し、かつ安全なブランドを見つけるために調査を行うことで、長期的にストレスを軽減できます。また、スマートデバイスを最新のファームウェアバージョンに更新することも非常に重要です。これらのアップデートには、既知の脆弱性に対するパッチが含まれているからです。デバイスが最新の状態になったら、設定を注意深く確認することで、不要な設定をオフにして、セキュリティリスクをさらに最小限に抑えることができます。[ 31 ]
2022年夏の時点で、 NPRとエジソン・リサーチの推計によると、9100万人のアメリカ人(18歳以上の人口の35%)がスマートスピーカーを所有している。[ 32 ]
{{cite magazine}}: CS1 maint: url-status (リンク){{cite web}}:|last=一般的な名前を持っています (ヘルプ){{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)