顔の動きを捉えるモーションキャプチャとは、カメラやレーザースキャナーを用いて、人の顔の動きを電子的にデジタルデータベースに変換するプロセスです。このデータベースは、映画やゲーム、リアルタイムアバターなどのコンピュータグラフィックス(CG)、コンピュータアニメーションの制作に利用できます。CGIキャラクターの動きは実在の人物の動きを基に作られるため、手作業でアニメーションを作成する場合よりも、よりリアルで繊細なコンピュータキャラクターアニメーションが実現します。
顔の動きキャプチャデータベースは、俳優の顔上の基準点の座標または相対位置を記述します。キャプチャは2次元で行われる場合があり、その場合、キャプチャプロセスは「表情トラッキング」と呼ばれることもあります。また、3次元で行われる場合もあります。2次元キャプチャは、単一のカメラとキャプチャソフトウェアを使用して実現できます。この方法では、トラッキングの精度が低く、頭の回転などの3次元の動きを完全にキャプチャすることはできません。3次元キャプチャは、マルチカメラリグまたはレーザーマーカーシステムを使用して実現されます。このようなシステムは通常、はるかに高価で、複雑で、使用に時間がかかります。主な技術は、マーカートラッキングシステムとマーカーレストラッキングシステムの2つです。
顔の動きのキャプチャは、体の動きのキャプチャと関連していますが、目や唇のわずかな動きから生じる微妙な表情を検出・追跡するために、より高い解像度が求められるため、より困難です。これらの動きは数ミリメートル未満であることが多く、全身のキャプチャで通常使用されるよりもさらに高い解像度と忠実度、そして異なるフィルタリング技術が必要となります。顔には特有の制約があるため、モデルやルールを活用する機会も増えます。
顔表情キャプチャは、顔の動きキャプチャと似ています。これは、人間の顔からの入力に基づいてコンピュータ生成キャラクターを操作したり、ユーザーの感情を認識したりするために、視覚的または機械的な手段を用いるプロセスです。
パフォーマンス主導型アニメーションについて論じた最初の論文の1つは、 1990年にランス・ウィリアムズによって発表された。そこで彼は、「実際の顔の表情を取得し、それをコンピュータで生成された顔に適用する方法」について述べている。[ 1 ]
従来のマーカーベースのシステムでは、俳優の顔に最大350個のマーカーを貼り付け、高解像度カメラでマーカーの動きを追跡します。これは、 『ポーラー・エクスプレス』や『ベオウルフ』などの映画で、トム・ハンクスのような俳優が複数の異なるキャラクターの表情を演じる際に使用されました。しかし、この方法は比較的煩雑で、スムージングやフィルタリング処理後に俳優の表情が不自然になってしまいます。CaptiveMotionなどの次世代システムは、従来のマーカーベースのシステムから派生した、より詳細なレベルのシステムを採用しています。
アクティブLEDマーカー技術は現在、リアルタイムで顔のアニメーションを駆動し、ユーザーにフィードバックを提供するために使用されている。
マーカーレス技術は、鼻孔、口角、目尻、しわなどの顔の特徴を利用して、それらを追跡します。この技術は、CMU [ 2 ] IBM [ 3 ]マンチェスター大学(この技術の多くは、Tim Cootes [ 4 ] Gareth Edwards と Chris Taylor によって開始されました)やその他の場所で議論され、実証されています。アクティブ アピアランス モデル、主成分分析、固有値追跡、変形可能な表面モデルなどの技術を使用して、フレームごとに目的の顔の特徴を追跡します。この技術ははるかに扱いやすく、俳優の表現力を高めます。
これらの視覚ベースのアプローチは、瞳孔の動き、まぶた、唇や舌による歯の噛み合わせなどを追跡する能力も備えており、これらはほとんどのコンピュータアニメーション作品で明らかな課題となっています。視覚ベースのアプローチの典型的な制限は解像度とフレームレートですが、高速・高解像度のCMOSカメラが複数のメーカーから入手可能になるにつれて、これらの問題は軽減されつつあります。
マーカーレス顔追跡の技術は顔認識システムの技術と関連しています。顔認識システムは、ビデオの各フレームに順次適用することで顔追跡を実現できる可能性があるからです。例えば、Neven Visionシステム[ 5 ](旧Eyematics、現在はGoogleが買収)は、個人固有のトレーニングなしでリアルタイム2D顔追跡を可能にしました。また、このシステムは、米国政府の2002年顔認識ベンダーテスト(FRVT)で最も優れた性能を発揮した顔認識システムの1つでした。一方、一部の認識システムは表情を明示的に追跡しないか、中立でない表情では失敗するため、追跡には適していません。逆に、変形可能な表面モデルなどのシステムは、時間情報をプールして曖昧さを解消し、より堅牢な結果を得るため、1枚の写真から適用することはできません。
マーカーレス顔追跡は、 Image Metricsなどの商用システムに発展し、映画「マトリックス」の続編[ 6 ]や「ベンジャミン・バトン 数奇な人生」などで使用されています。後者では、Movaシステムを使用して変形可能な顔モデルをキャプチャし、手動追跡と視覚追跡を組み合わせてアニメーション化しました[ 7 ] 。アバターも有名なモーションキャプチャ映画ですが、マーカーレスではなくペイントマーカーを使用しています。Dynamixyzは現在使用されている別の商用システムです。
マーカーレスシステムは、いくつかの区別基準に基づいて分類することができる。
現在までに、これらの基準すべてに関して理想的なシステムは存在しない。例えば、Neven Visionシステムは完全自動で、隠されたパターンや個人ごとのトレーニングは不要であったが、2Dであった。Face/Offシステム[ 8 ]は3Dで自動かつリアルタイムであるが、投影されたパターンを必要とする。
機械式システムは扱いにくく操作が難しい傾向があるため、デジタルビデオを用いた方法がますます好まれるようになっている。
デジタルカメラを使用して、入力されたユーザーの表情が処理され、頭部の姿勢が取得されます。これにより、ソフトウェアは目、鼻、口を検出できます。顔は最初にニュートラルな表情でキャリブレーションされます。次に、構造に応じて、眉、まぶた、頬、口がニュートラルな表情との差異として処理されます。これは、たとえば唇の端を探し、それを固有のオブジェクトとして認識することによって行われます。多くの場合、コントラストを強調するメイクやマーカーが使用されるか、処理を高速化するための他の方法が用いられます。音声認識と同様に、最良の技術でも90%の確率でしか正しく機能せず、手作業による微調整やエラーに対する寛容さが求められます。
コンピュータで生成されたキャラクターには実際には筋肉がないため、同じ結果を得るためにはさまざまな技術が用いられます。アニメーターによっては、キャプチャソフトウェアで制御されるボーンやオブジェクトを作成し、それに応じて動かすことで、キャラクターが正しくリギングされていれば、かなり近い動きを実現できます。顔は非常に伸縮性があるため、この技術は他の技術と組み合わせて用いられることが多く、肌の伸縮性やその他の要素に応じて、求める表情に合わせてウェイトを調整します。
いくつかの企業が、既に使用されているもののかなり高価な製品を開発している。
ソフトウェアが手頃な価格で入手可能になれば、これはコンピュータゲームの主要な入力デバイスになると予想されているが、過去15年間の研究でほぼ実用的な成果が得られているにもかかわらず、ハードウェアとソフトウェアはまだ存在しない。
最初に広く普及したアプリケーションはコミュニケーションです。当初はビデオ通話やマルチメディアメッセージングが主流でしたが、後に複合現実ヘッドセットによる3D化へと発展しました。
機械学習、コンピューティング能力、高度なセンサー、特に携帯電話の進歩により、顔の動きのキャプチャ技術が広く利用できるようになりました。注目すべき例として、Snapchatのレンズ機能とAppleのMemoji [ 9 ]があり、これらはアバターを使ってメッセージを録画したり、FaceTimeアプリでライブ配信したりするのに使用できます。これらのアプリケーション(およびその他多数)により、今日のほとんどの最新の携帯電話はリアルタイムの顔の動きのキャプチャを実行できます。最近では、リアルタイムの顔の動きのキャプチャとリアルな3Dアバターを組み合わせたものが、複合現実(MR)と仮想現実(VR)での没入型コミュニケーションを可能にするために導入されました。Metaは、MRヘッドセットMeta Quest Proを介して通信するCodec Avatarsを実証し、2人の遠隔参加者とポッドキャストを録音しました。[ 10 ] AppleのMRヘッドセットApple Vision Proも、 FaceTimeなどのアプリケーションで使用できるリアルタイムの顔の動きのキャプチャをサポートしています。リアルタイム通信アプリケーションは、自然な会話と使いやすさを促進するために低遅延を優先し、幅広いユーザーがこの技術にアクセスできるようにすることを目指しています。これらの考慮事項は、モーションキャプチャの精度を制限する可能性がある。