マルチモーダルインタラクションは、ユーザーにシステムとの対話のための複数の方法を提供する。マルチモーダルインターフェースは、データの入出力のための複数の異なるツールを提供する。
マルチモーダルなヒューマンコンピュータインタラクションは、仮想環境と物理環境との自然なコミュニケーションを伴います。これにより、ユーザーと自動化システム間の自由で自然なコミュニケーションが促進され、柔軟な入力(音声、手書き、ジェスチャー)と出力(音声合成、グラフィックス)が可能になります。マルチモーダル融合は、異なるモダリティからの入力を組み合わせ、曖昧さを解消します。
マルチモーダルインターフェースの主な2つのグループは、代替入力方法と入力/出力の組み合わせに焦点を当てています。複数の入力モダリティはユーザビリティを向上させ、障害のあるユーザーにメリットをもたらします。モバイルデバイスは、入力にXHTML+Voiceを使用することがよくあります。マルチモーダル生体認証システムは、複数の生体認証を使用して制限を克服します。マルチモーダル感情分析は、テキスト、音声、および視覚データを分析して感情を分類します。マルチモーダル言語モデルであるGPT-4は、さまざまなモダリティを統合して言語理解を向上させます。マルチモーダル出力システムは、触覚と嗅覚を使用して、視覚と聴覚の手がかりを通じて情報を提供します。マルチモーダル融合は、認識ベース、決定ベース、およびハイブリッドマルチレベル融合を使用して、異なるモダリティからの情報を統合します。
マルチモーダル入力における曖昧さは、予防法、事後解決法、および近似解決法によって対処される。
マルチモーダルな人間とコンピュータのインタラクションとは、「自然なコミュニケーション様式を介した仮想環境および物理環境とのインタラクション」を指します[ 1 ]。これは、マルチモーダルなインタラクションによって、より自由で自然なコミュニケーションが可能になり、入力と出力の両方でユーザーと自動化されたシステムがインターフェースできることを意味します[ 2 ] 。具体的には、マルチモーダルシステムは、音声、手書き、手のジェスチャー、視線などの入力様式を介してユーザーがインタラクションし、音声合成、スマートグラフィックス、その他の様式など、適切に組み合わせられた出力様式を介してシステムから情報を受け取ることができる、柔軟で効率的かつ使いやすい環境を提供できます。次に、マルチモーダルシステムは、解釈を可能にするために、異なる様式からの入力を認識し、時間的および文脈的制約に従ってそれらを組み合わせる必要があります[ 3 ]。このプロセスはマルチモーダル融合として知られており、1990年代から現在まで、多くの研究の対象となっています。[ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ]融合された入力はシステムによって解釈されます。自然さと柔軟性により、異なるモダリティ(チャネル)ごとに、またそれらの同時使用に対して複数の解釈が生じる可能性があり、その結果、一般的に不正確さ、ノイズ、またはその他の同様の要因により、マルチモーダルな曖昧さが生じる可能性があります[ 12 ]。曖昧さを解消するために、いくつかの方法が提案されています。[ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ] [ 18 ]最後に、システムは、一貫したフィードバック(分裂)に従って配置されたさまざまなモダリティチャネル(分離)を介して、ユーザー出力に戻ります。[ 19 ] モバイルデバイス、センサー、およびウェブ技術の普及により、マルチモーダルな相互作用に伴う複雑さを管理するための十分な計算リソースが提供される可能性があります。 「マルチモーダルな相互作用の複雑さを管理するために共有コンピューティングリソースを活用するクラウドの利用は、機会となる。実際、クラウドコンピューティングは、動的かつ自動的にプロビジョニングおよび解放できる、共有のスケーラブルで構成可能なコンピューティングリソースを提供することを可能にする。」[ 20]]
マルチモーダルインターフェースは、入力方法の代替と入出力の組み合わせという2つの主要なグループに統合されています。最初のグループのインターフェースは、従来のキーボードとマウスの入出力を超えて、音声、ペン、タッチ、手動ジェスチャー[ 21 ] 、視線、頭と体の動き[ 22 ]など、さまざまなユーザー入力モードを組み合わせています。このようなインターフェースで最も一般的なものは、視覚モダリティ(ディスプレイ、キーボード、マウスなど)と音声モダリティ(入力用の音声認識、出力用の音声合成と録音された音声)を組み合わせています。ただし、ペンベースの入力や触覚入出力などの他のモダリティも使用できます。マルチモーダルユーザーインターフェースは、ヒューマンコンピュータインタラクション(HCI)の研究分野です。
複数の入力方式の利点は、ユーザビリティの向上です。ある方式の弱点は、別の方式の強みによって補われます。小さなビジュアルインターフェースとキーパッドを備えたモバイルデバイスでは、単語を入力するのは非常に難しいかもしれませんが、発音するのは非常に簡単です(例:ポキプシー)。同じデバイスやセットトップボックスからデジタルメディアカタログにアクセスして検索する方法を考えてみてください。また、実際の例として、手術室環境では、手術チームのメンバーが患者情報を口頭で確認し、無菌環境を維持します。そして、理解度を最大限に高めるために、情報はほぼリアルタイムで音声と映像で提示されます。
マルチモーダル入力ユーザーインターフェースはアクセシビリティに影響を与えます。[ 23 ]適切に設計されたマルチモーダルアプリケーションは、さまざまな障害を持つ人々が使用できます。視覚障害のあるユーザーは、音声モダリティと一部のキーパッド入力に依存します。聴覚障害のあるユーザーは、視覚モダリティと一部の音声入力に依存します。その他のユーザーは「状況的に障害がある」(たとえば、非常に騒がしい環境で手袋を着用している、運転中、または公共の場所でクレジットカード番号を入力する必要があるなど)ため、必要に応じて適切なモダリティを使用するだけです。一方、すべてのモダリティを操作できることをユーザーに要求するマルチモーダルアプリケーションは、非常に設計が悪いと言えます。
市場で最も一般的な入力マルチモーダル形式は、IBM、Motorola、Opera Softwareによって開発されたオープン仕様であるXHTML+Voice(別名X+V)Webマークアップ言語を使用しています。X +Vは現在W3Cで検討されており、視覚マークアップ用のXHTML、音声マークアップ用のVoiceXML、XML言語 を統合するための標準であるXML Eventsなど、複数のW3C勧告を組み合わせています。X + Vをサポートするマルチモーダルブラウザには、 IBM WebSphere Everyplace Multimodal Environment、組み込みLinuxおよびWindows用のOpera、Windows Mobile用のACCESS Systems NetFrontなどがあります。マルチモーダルアプリケーションを開発するために、ソフトウェア開発者は、オープンソースのEclipseフレームワークをベースとしたIBM WebSphere Multimodal Toolkitなどのソフトウェア開発キットを使用できます。このキットには、 X+Vデバッガ、エディタ、シミュレータが含まれています。
マルチモーダル生体認証システムは、複数のセンサーまたは生体認証を使用して、単一モーダル生体認証システムの限界を克服します。[ 24 ]例えば、虹彩認識システムは加齢による虹彩の劣化により機能が低下する可能性があり[ 25 ]、電子指紋認識は摩耗または切断された指紋によって悪化する可能性があります。単一モーダル生体認証システムは識別子の完全性によって制限されますが、複数の単一モーダルシステムが同一の制限を受ける可能性は低いです。マルチモーダル生体認証システムは、同じマーカーから情報セットを取得できます(つまり、虹彩の複数の画像、または同じ指のスキャン)または、異なる生体認証からの情報を取得できます(指紋スキャンと、音声認識を使用した音声パスコードが必要です)。[ 26 ] [ 27 ]
マルチモーダル生体認証システムは、これらの単一モーダルシステムを順次、同時、それらの組み合わせ、または直列に融合することができ、それぞれ順次、並列、階層的、および直列統合モードを指します。生体認証情報の融合は、認識システムのさまざまな段階で発生する可能性があります。特徴レベルの融合の場合、データ自体または複数の生体認証から抽出された特徴が融合されます。マッチングスコアレベルの融合では、異なるモダリティに関連する複数の分類器によって生成されたスコアが統合されます。最後に、決定レベルの融合の場合、複数の分類器の最終結果が多数決などの手法によって結合されます。特徴レベルの融合は、特徴セットがマッチングスコアや分類器の出力決定よりも入力生体認証データに関するより豊富な情報を含んでいるため、他のレベルの融合よりも効果的であると考えられています。したがって、特徴レベルでの融合は、より良い認識結果をもたらすと期待されます。[ 24 ]
なりすまし攻撃は、偽の生体認証特性を生体認証システムに送信することであり、システムのセキュリティを低下させる重大な脅威です。マルチモーダル生体認証システムは、なりすまし攻撃に対して本質的に堅牢であると一般的に考えられていますが、最近の研究[ 28 ]では、単一の生体認証特性をなりすますだけでも回避できることが示されています。
Prasanalakshmi [ 29 ]による顔、指紋、手のひら静脈を含むマルチモーダル生体認証暗号システムの提案システムの 1 つである暗号システム統合では、生体認証と暗号化が組み合わされており、手のひら静脈は暗号鍵として機能し、手のひら静脈は固有で偽造が困難であるため、高いレベルのセキュリティを提供します。指紋には、特徴抽出 (終端と分岐) とマッチング技術が含まれます。手順には、画像強調、二値化、ROI抽出、特徴細線化が含まれます。顔システムは、クラスベースの散布行列を使用して認識のための特徴を計算し、手のひら静脈は破られない暗号鍵として機能し、正しいユーザーのみがシステムにアクセスできるようにします。キャンセル可能な生体認証の概念により、プライバシーを確保し盗難を防ぐために、生体認証特性をわずかに変更できます。侵害された場合、生体認証データの新しいバリエーションを発行できます。暗号化指紋テンプレートは、XOR演算を介して手のひら静脈鍵を使用して暗号化されます。この暗号化された指紋は、ステガノグラフィ技術を用いて顔画像内に隠されています。生体認証データ(指紋、手のひら静脈、顔)の登録と検証は、取得、暗号化され、顔画像に埋め込まれます。システムは生体認証データを抽出し、保存された値と比較して検証を行います。このシステムは指紋データベースでテストされ、等誤り率25%で75%の検証精度を達成し、登録処理時間は約50秒、検証処理時間は約22秒でした。手のひら静脈の暗号化による高いセキュリティ、生体認証のなりすましに対する有効性、そしてマルチモーダルアプローチにより、いずれかの生体認証が失敗した場合でも信頼性が確保されます。スマートカードやカード内システムとの統合により、個人識別システムのセキュリティが強化される可能性があります。
マルチモーダル感情分析は、音声や視覚データなどのモダリティを含む、従来のテキストベースの感情分析のための技術です。 [ 30 ] 2 つのモダリティのさまざまな組み合わせを含むバイモーダル、または 3 つのモダリティを組み込んだトリモーダルにすることができます。[ 31 ]動画や画像などさまざまな形式でオンラインで利用できるソーシャルメディアの膨大な量により、従来のテキストベースの感情分析は、マルチモーダル感情分析のより複雑なモデルに進化しました。[ 32 ] [ 33 ]これは、仮想アシスタントの開発 [ 34 ]、YouTube 映画レビューの分析[ 35 ] 、ニュースビデオの分析[ 36 ]、うつ病モニタリングなどの感情認識(感情検出とも呼ばれる)[ 37 ]などに適用できます。
従来の感情分析と同様に、マルチモーダル感情分析における最も基本的なタスクの 1 つは感情分類であり、これはさまざまな感情を肯定的、否定的、中立などのカテゴリに分類します。[ 38 ]このようなタスクを実行するためにテキスト、音声、および視覚的特徴を分析する複雑さにより、特徴レベル、決定レベル、ハイブリッド融合などのさまざまな融合技術の適用が必要になります。[ 32 ]これらの融合技術と適用される分類アルゴリズムのパフォーマンスは、分析で使用されるテキスト、音声、および視覚的特徴の種類によって影響を受けます。[ 39 ]
Generative Pre-trained Transformer 4 ( GPT-4 ) はOpenAIが開発した大規模な言語モデルであり、 GPT 基盤モデルシリーズの 4 番目のモデルです。[ 40 ]
GPT-4 はGPT-3.5に先行し、後継のGPT-5に続くものです。GPT-4V は、テキストに加えて画像も処理できる GPT-4 のバージョンです。[ 41 ] OpenAI は、モデルの正確なサイズなど、GPT-4 に関する技術的な詳細や統計情報を公開していません。[ 42 ]
GPT-4の初期バージョンは、 2023年2月にリリースされたBing ChatにMicrosoftによって統合されました。GPT-4は2023年3月にChatGPTでリリースされ[ 43 ]、2025年に削除されました[ 44 ] 。GPT -4は現在もOpenAIのAPIで利用可能です[ 45 ]。
2番目のマルチモーダルシステムは、主に視覚と聴覚のキューの形で、マルチメディアディスプレイとマルチモーダル出力をユーザーに提示します。インターフェース設計者は、触覚や嗅覚などの他のモダリティも利用し始めています。マルチモーダル出力システムの提案されている利点には、相乗効果と冗長性があります。複数のモダリティを介して提示される情報は統合され、同じプロセスのさまざまな側面を参照します。まったく同じ情報を処理するために複数のモダリティを使用することで、情報転送の帯域幅が増加します。[ 46 ] [ 47 ] [ 48 ]現在、マルチモーダル出力は主に、通信媒体とコンテンツ間のマッピングを改善し、オペレーターがかなりの視覚的注意要求に直面するデータ豊富な環境での注意管理をサポートするために使用されています。[ 49 ]
マルチモーダルインターフェース設計における重要なステップは、モダリティと情報およびタスク間の自然なマッピングを作成することです。聴覚チャネルは、いくつかの点で視覚とは異なります。全方向性で、一時的で、常に予約されています。[ 49 ]音声出力は、聴覚情報の1つの形式であり、かなりの注目を集めています。音声の使用に関するいくつかのガイドラインが開発されています。MichaelisとWiggins(1982)は、音声出力は後で参照されない単純な短いメッセージに使用するべきだと提案しました。また、音声は時間内に生成され、即時の応答を必要とするべきであるとも推奨されました。
触覚は、1950年代後半に初めてコミュニケーションの媒体として利用されました。[ 50 ]これは有望なだけでなく、ユニークなコミュニケーションチャネルでもあります。HCIで使用される従来の2つの感覚である視覚と聴覚とは対照的に、触覚は近接的であり、身体に接触している物体を感知し、環境に対する知覚と行動の両方をサポートするという点で双方向的です。
聴覚フィードバックの例としては、コンピュータのオペレーティングシステムでユーザーの操作(ファイルの削除、フォルダのオープン、エラーなど)を示す音声アイコン、車両のナビゲーションガイダンスを提示するための音声出力、現代の航空機のコックピットでパイロットに警告するための音声出力などがあります。触覚信号の例としては、死角にいる車をドライバーに警告するための方向指示器レバーの振動、ドライバーへの警告としての自動車シートの振動、失速が迫っていることをパイロットに警告する現代の航空機のスティックシェイカーなどがあります。 [ 49 ]
センサー技術を使用することで、目に見えないインターフェース空間が利用可能になった。赤外線、超音波、カメラはすべて現在一般的に使用されている。[ 51 ]意味のあるマッピングを介して即時かつ直接的なリンクを提供することで、コンテンツとのインターフェースの透明性が向上し、ユーザーは入力に対して直接的かつ即時的なフィードバックを得ることができ、コンテンツ応答はインターフェースのアフォーダンスとなる(ギブソン 1979)。
さまざまな入力モダリティからの情報を統合し、それらを完全なコマンドに結合するプロセスは、マルチモーダル融合と呼ばれます。[ 5 ]文献では、入力信号の融合を実行できる主要なアーキテクチャレベル(認識と決定)に応じて、融合プロセスに対する 3 つの主要なアプローチが提案されています。認識ベース、[ 9 ] [ 10 ] [ 52 ]決定ベース、[ 7 ] [ 8 ] [ 11 ] [ 53 ] [ 54 ] [ 55 ] [ 56 ]およびハイブリッドマルチレベル融合。[ 4 ] [ 6 ] [ 57 ] [ 58 ] [ 59 ] [ 60 ] [ 61 ] [ 62 ]
認識ベースの融合(早期融合とも呼ばれる)は、統計的統合技術、エージェント理論、隠れマルコフモデル、人工ニューラルネットワークなどの統合メカニズムを使用して、各モダリティ認識器の結果を統合することから成ります。認識ベースの融合戦略の例としては、アクションフレーム[ 52 ] 、入力ベクトル[ 9 ] 、スロット[ 10 ]などがあります。
決定ベースの融合(遅延融合とも呼ばれる)は、特定の対話駆動型融合手順を使用して抽出された意味情報を統合して、完全な解釈を生成します。決定ベースの融合戦略の例としては、型付き特徴構造[ 53 ] [ 58 ]、メルティングポット[ 55 ] [ 56 ]、意味フレーム[ 7 ] [ 11 ]、タイムスタンプ付きラティス[ 8 ]などがあります。
マルチモーダル融合の潜在的な応用分野には、学習環境、顧客関係、セキュリティ/監視、コンピュータアニメーションなどがある。個々のモードは簡単に定義できるが、それらを融合したものとして技術で扱うのは難しい。[ 63 ] アルゴリズムが次元性を考慮に入れるのは難しく、現在の計算能力の範囲外の変数が存在する。例えば、意味的意味:2つの文が同じ語彙的意味を持つが、感情的な情報は異なる可能性がある。[ 63 ]
ハイブリッドマルチレベル融合では、入力モダリティの統合は認識レベルと決定レベルに分散されます。ハイブリッドマルチレベル融合には、次の 3 つの手法が含まれます。有限状態トランスデューサ[ 58 ] 、マルチモーダル文法[ 6 ] [ 57 ] [ 59 ] [ 60 ] [ 61 ] [ 62 ] [ 64 ] 、および対話動作[ 65 ] 。
ユーザーのアクションやコマンドは、システムが解釈する必要のあるマルチモーダル入力(マルチモーダルメッセージ[ 3 ] )を生成します。マルチモーダルメッセージは、ユーザーとマルチモーダルシステム間の通信を可能にする媒体です。これは、複数のモダリティを介して伝達される情報を、複数のモダリティ間のさまざまなタイプの協力[ 66 ] 、関係するモダリティ間の時間的関係[ 67 ]、およびこれらのモダリティに関連付けられた情報のチャンク間の関係[ 68 ]を考慮して統合することによって得られます。
複数のインタラクション様式(視覚、聴覚、触覚)によって提供されるマルチモーダル入力と情報およびタスクとの間の自然なマッピングは、曖昧さなどの人間同士のコミュニケーションの典型的な問題を管理することを意味します。曖昧さは、入力の解釈が複数可能な場合に発生します。マルチモーダル曖昧さ[ 12 ] は、1つの様式によって提供される要素が複数の解釈を持つ場合(つまり、曖昧さがマルチモーダルレベルで伝播する場合)、および/または、各様式に関連付けられた要素が一意に解釈されるが、異なる様式を参照する情報が構文レベルまたは意味レベルで一貫性がない場合(つまり、異なる意味または異なる構文構造を持つマルチモーダル文)の両方で発生します。
「曖昧性の管理」[ 14 ]では、曖昧性を解決し、ユーザーの入力を正しく解釈するための方法は、予防、事後解決、近似解決方法の3つの主要なクラスに分類されています。[ 13 ] [ 15 ]
予防法は、インタラクションプロセスのさまざまな許容状態間の遷移のセットに従って、ユーザーに事前に定義されたインタラクション動作に従うことを強制します。予防法の例としては、手続き的方法[ 69 ] 、言語文法の表現力の低下[ 70 ] 、 言語文法の表現力の向上[ 71 ]などがあります。
曖昧さの事後解決には、仲介アプローチが用いられます。[ 16 ]仲介技術の例としては、反復(例えば、様式による反復)[ 16 ] 、修復の粒度[ 72 ]、取り消し[ 17 ] 、選択[ 18 ] などがあります。
近似解決法では、曖昧性解消プロセスにユーザーの関与は必要ありません。それらはすべて、ファジー論理、マルコフ確率場、ベイジアンネットワーク、隠れマルコフモデルなどの理論の使用を必要とする場合があります。[ 13 ] [ 15 ]