人間とコンピュータのインタラクションの文脈では、モダリティとは、コンピュータと人間の間の単一の独立した入出力チャネルの分類です。このようなチャネルは、感覚的な性質(例:視覚と聴覚) [ 1 ] 、または処理におけるその他の重要な違い(例:テキストと画像)[ 2 ]に基づいて異なる場合があります。 システムが実装されているモダリティが 1 つだけの場合、そのシステムは単一モダリティであると指定され、複数のモダリティがある場合、システムはマルチモダリティであると指定されます。[ 1 ]タスクまたはタスクの側面に対して複数のモダリティが利用可能な場合、システムは重複モダリティを持つと言われます。タスクに対して複数のモダリティが利用可能な場合、システムは冗長モダリティを持つと言われます。複数のモダリティを組み合わせて使用することで、冗長である可能性があるものの、情報をより効果的に伝える補完的な方法を提供できます。[ 3 ]モダリティは、一般的に、コンピュータと人間のモダリティと人間とコンピュータのモダリティの 2 つの形式で定義できます。
コンピュータは、人間とコミュニケーションを取り、情報を送信するために、幅広い技術を利用している。
人間の感覚はどれも、コンピュータと人間間のモダリティとして使用できます。しかし、視覚と聴覚は、それぞれ毎分250~300語[ 4 ]と毎分150~160語[ 5 ] という、他のモダリティよりも高速に情報を伝達できるため、最も一般的に使用されています。触覚は、コンピュータと人間間のモダリティとして一般的に実装されていませんが、リフレッシュ可能な点字ディスプレイを使用することで、平均毎分125語[ 6 ]を達成できます。触覚のより一般的な形態としては、スマートフォンやゲームコントローラーの振動があります。
コンピュータには、人間から情報を受け取るために、さまざまな種類の入力デバイスやセンサーを装備することができます。一般的な入力デバイスは、コンピュータとの通信方法が標準化されており、ユーザーに実用的な調整が可能であれば、多くの場合互換性があります。特定のモダリティは、状況に応じてより豊かなインタラクションを提供することができ、実装の選択肢があることで、より堅牢なシステムが可能になります。[ 7 ]
スマートフォンの普及に伴い、一般の人々もより複雑な操作方法に慣れてきている。動きや方向認識は、スマートフォンの地図アプリでよく利用されている。音声認識は、バーチャルアシスタントアプリで広く使われている。コンピュータビジョンは、文書やQRコードをスキャンするカメラアプリで一般的になっている。
システムに複数のモダリティを導入することで、ユーザーにとっての利便性が向上し、より堅牢なシステム構築に貢献できます。また、特定のモダリティをより効果的に活用できるユーザーにとって、アクセス性も向上します。複数のモダリティは、特定のコミュニケーション手段が利用できない場合のバックアップとしても活用できます。これは特に、2つ以上のモダリティを用いて同じ情報を伝達する冗長なモダリティの場合に当てはまります。モダリティの組み合わせによっては、コンピュータと人間、あるいは人間とコンピュータのインタラクションの表現力を高めることができます。これは、それぞれのモダリティが、他のモダリティよりも特定の情報形式や側面を表現するのに効果的である場合があるためです。
モダリティ間の協力には6つのタイプがあり、それらはモダリティの組み合わせや融合がどのように連携して情報をより効果的に伝えるかを定義するのに役立ちます。[ 8 ]
相補冗長システムとは、複数のセンサーを用いて一つの理解やデータセットを形成するシステムであり、データの重複なく情報をより効果的に組み合わせることができれば、モダリティ間の連携もより効果的になります。特にスマートフォンでは、複数の通信手段を用いることが一般的であり、多くの場合、それらの実装は同じ目標に向かって連携して動作します。例えば、ジャイロスコープと加速度計が連携して動きを追跡するなどです。[ 8 ]