ジェスチャー認識と画像処理の分野において、フィンガートラッキングは、ユーザーの指の三次元空間における位置を把握するために用いられる高解像度技術である。これは1969年に初めて開発された。
指追跡は、コンピュータの入力デバイスとして使用できる。
指追跡システムは、ユーザーとデータのインタラクションに焦点を当てており、ユーザーは指を通して表現したい3Dオブジェクトの体積を操作することで仮想データとインタラクションします。このシステムは、人間とコンピュータのインタラクションの問題に基づいて生まれました。目的は、両者間のコミュニケーションとジェスチャーや手の動きの使用をより直感的にすることです。指追跡システムが開発されました。これらのシステムは、各マーカーの指の向きの3Dおよび2Dの位置をリアルタイムで追跡し、直感的な手の動きとジェスチャーを使用してインタラクションします。
指追跡の実装には多くの選択肢があり、主にインターフェースを使用するものと使用しないものがある。
このシステムは主に慣性式および光学式モーションキャプチャシステムを使用しています。
慣性モーションキャプチャシステムは、3D空間における各指節の回転を読み取ることで、指の動きを捉えることができます。これらの回転を運動連鎖に適用することで、遮蔽物や無線接続を介さずに、人間の手全体をリアルタイムで追跡することが可能です。
Synertial社のモーションキャプチャグローブなど、手を使った慣性モーションキャプチャシステムは、各指節に配置された小型のIMU(慣性計測装置)ベースのセンサーを使用します。正確なキャプチャには、少なくとも16個のセンサーが必要です。センサー数が少ない(13個または7個)モーションキャプチャグローブモデルもあり、その場合は残りの指節(近位部)は補間、遠位部は外挿によって検出されます。センサーは通常、布製のグローブに埋め込まれているため、装着時の快適性が向上します。
慣性センサーは3方向すべての動きを捉えることができるため、指や親指の屈曲、伸展、外転を検出することが可能です。
慣性センサーは回転のみを追跡するため、適切な出力を得るには、回転をハンドスケルトンに適用する必要があります。正確な出力(例えば、指先に触れることができるように)を得るには、ハンドスケルトンを実際の手に合うように適切にスケーリングする必要があります。この目的のために、手動による手の計測、または自動計測抽出を使用できます。
指のトラッキングに加えて、多くのユーザーは空間における手全体の位置トラッキングを必要とします。この目的のために、複数の方法が利用可能です。
慣性センサーには、指の追跡に関して主に2つの欠点があります。
3D空間におけるマーカーとパターンの位置追跡が行われ、システムはそれらを識別し、ユーザーの指の位置に応じて各マーカーにラベルを付けます。これらのマーカーのラベルの3D座標は、他のアプリケーションによってリアルタイムで生成されます。
ViconやARTなどの光学システムの中には、マーカーを通して手の動きを捉えることができるものがあります。各手には、操作する指ごとにマーカーが1つずつ付いています。3台の高解像度カメラが各マーカーを捉え、その位置を測定します。これは、カメラがマーカーを認識できる場合にのみ生成されます。通常、リングやブレスレットと呼ばれる視覚マーカーは、3Dでユーザーのジェスチャーを認識するために使用されます。さらに、分類が示すように、これらのリングは2Dのインターフェースとしても機能します。
視覚的な遮蔽は、仮想情報を3次元でよりリアルに表現するための非常に直感的な方法です。インターフェースは、6進数よりも自然な3Dインタラクション技術を提供します。
マーカーは、通常すでに設定されている相互作用ポイントを介して動作し、領域に関する情報も得られます。そのため、各マーカーを常に追跡する必要はありません。マルチポインターは、動作ポインターが1つしかない場合と同様に扱うことができます。相互作用を介してこのようなポインターを検出するために、超音波赤外線センサーを有効にします。多数のポインターを1つとして扱うことができるため、問題は解決されます。照明不良、モーションブラー、マーカーの変形、遮蔽などの困難な条件下で動作する場合。
このシステムでは、一部のマーカーが見えない場合でも、対象物を追跡できます。すべてのマーカーの空間的な位置関係が既知であるため、既知のマーカーを使用して、見えないマーカーの位置を計算できます。マーカー検出には、境界マーカー法や推定マーカー法など、いくつかの方法があります。
キャプチャ中にマーカーが遮蔽されるため、指のトラッキングは光学式モーションキャプチャシステム(Vicon、Optitrack、ARTなど)にとって最も難しい部分です。
光学式モーションキャプチャシステムのユーザーによると、後処理作業の大部分は指のキャプチャによるものだという。慣性式モーションキャプチャシステムは(適切にキャリブレーションされていれば)ほとんど後処理を必要としないため、ハイエンドのモーションキャプチャシステムユーザーにとっての典型的な用途は、慣性式モーションキャプチャシステム(指)のデータと光学式モーションキャプチャシステム(身体+空間位置)のデータを融合することである。
モーションキャプチャデータの融合プロセスは、慣性モーションキャプチャシステムと光学式モーションキャプチャシステムの各フレームのタイムコードを一致させることに基づいています。これにより、サードパーティ製ソフトウェア(例えば、MotionBuilder、Blenderなど)は、使用するモーションキャプチャ方式に関係なく、2つのソースからの動きを適用できます。
伸縮センサー搭載モーションキャプチャシステムは、柔軟な平行平板コンデンサを使用して、センサーが伸びたり、曲がったり、せん断されたり、圧力がかかったりしたときの静電容量の差を検出します。伸縮センサーは一般的にシリコンベースであるため、磁気干渉、遮蔽、位置ずれ(慣性システムでよく見られる)の影響を受けません。これらのセンサーの堅牢性と柔軟性により、高精度の指のトラッキングが可能になり、StretchSense社製のモーションキャプチャグローブに採用されています。[ 2 ]
関節式ハンドトラッキングは、カメラが1台しか必要ないため、多くの方法よりもシンプルで安価です。ただし、このシンプルさゆえに精度は劣ります。しかし、モデリング、アニメーションの制御、リアリズムの向上において、新たなインタラクションの基盤を提供します。この方式では、指の位置に応じて色分けされたグローブを使用します。この色分けはコンピュータの視覚システムに限定され、色のキャプチャ機能と位置に基づいて手の位置が判明します。
視覚的な観点から見ると、脚と手は関節機構、つまり1つ以上の自由度を持つ関節で連結された剛体のシステムとしてモデル化できます。このモデルは、より縮小したスケールで手の動きを記述したり、より広いスケールで全身の動きを記述したりするために適用できます。例えば、特定の指の動きは、その通常の角度から認識でき、カメラに対する手の位置には依存しません。
多くのトラッキングシステムは、シーケンス推定の問題に焦点を当てたモデルに基づいています。シーケンス画像が与えられ、変化するモデルに基づいて、各写真の 3D 構成を推定します。可能なすべての手の構成は、手の位置と指の関節の角度をコード化した状態空間上のベクトルで表されます。各手の構成は、指の関節の遮蔽の境界を検出することによって一連の画像を生成します。各画像の推定は、測定された特性に最もよく適合する状態ベクトルを見つけることによって計算されます。指の関節には、手のひらの剛体運動よりも 21 状態多く追加されています。これは、推定の計算コストが増加することを意味します。この手法は、各指の関節リンクを円筒としてモデル化することで構成されています。各関節で軸を作成し、この軸の二等分線が関節の投影となります。したがって、動きの自由度が 3 つしかないため、3 DOF を使用します。
この場合も、このテーマに関する展開理論は多岐にわたるため、前述の類型と同様です。したがって、手順と処理方法は、この手法を使用する人の目的とニーズによって異なります。いずれにせよ、非常に一般的な方法として、ほとんどのシステムでは、以下の手順を実行する必要があります。
指のアクティブトラッキングも可能です。スマートレーザースキャナは、2003年から2004年にかけて東京大学で開発された改良型レーザースキャナ/プロジェクターを使用したマーカーレスの指トラッキングシステムです。画像処理を一切必要とせずにリアルタイムで3次元座標を取得できます(基本的には、視野全体を連続的にスキャンするのではなく、対象物のサイズに正確に一致する非常に狭いウィンドウにスキャン領域を制限するレンジファインダースキャナです)。このシステムでジェスチャー認識が実証されています。サンプリングレートは非常に高く(500 Hz)、カルマンフィルタなどのフィルタリングを必要とせずに滑らかな軌跡を取得できます。また、世界中で個別に開発されている安価なウェブカメラベースのHSV対応ジオメトリ簡潔トラッカーも、完全に決定論的であるため、幻覚を防ぎ、計算コストを削減します。
ハンドトラッキングは、仮想現実(VR)や拡張現実(AR)で利用できます。その応用範囲は、プロレベルの3Dモデリングにまで及んでいます。そのため、価格が高く複雑なことから、このようなシステムが一般消費者向けアプリケーションで使用されることは稀です。いずれにせよ、主な目的は、自然言語やジェスチャーによるコンピュータへのコマンド実行を容易にすることです。
指追跡技術の主な目的は、ジェスチャー操作によるコンピュータの操作性を向上させ、コンピュータをより使いやすくすることです。この技術は多くの可能性を秘めており、中でもコンピュータを用いたリアルタイムでの仮想彫刻、建築、3Dモデリングが最も重要です。