コンピュータ ビジョンにおいて、モーション フィールドは、カメラ画像に投影された3 次元空間(3D)内のモーションの理想的な表現です。簡略化されたカメラ モデルでは、画像内の各ポイントは 3D シーン内のあるポイントの投影ですが、空間内の固定ポイントの投影位置は時間とともに変化する可能性があります。モーション フィールドは、すべての画像ポイントが固定された 3D ポイントに対応している場合、画像位置の時間微分として正式に定義できます。つまり、モーション フィールドは、画像座標を 2 次元ベクトルにマッピングする関数として表すことができます。モーション フィールドは、正式に定義できるという意味で投影された 3D モーションの理想的な記述ですが、実際には、通常、画像データからモーション フィールドの近似値を決定することしかできません。

導入
ピンホール カメラ モデルで説明される 3D ポイントとそれに対応する画像ポイントの図。3D ポイントが空間内を移動すると、対応する画像ポイントも移動します。モーション フィールドは、画像内のすべてのポイントの画像内のモーション ベクトルで構成されます。
カメラ モデルは、いくつかのマッピング関数に従って、3D 空間の各ポイントを 2D 画像ポイントにマッピングします。




カメラが映し出すシーンが動的であると仮定すると、シーンは互いに相対的に動く物体、変形する物体で構成され、カメラもシーンに対して相対的に動く可能性があり、3D空間の固定点は画像内の変化する点にマッピングされます。前の式を時間に関して微分すると、次の式が得られます。
![{\displaystyle {\begin{pmatrix}{\frac {dy_{1}}{dt}}\\[2mm]{\frac {dy_{2}}{dt}}\end{pmatrix}}={\begin{pmatrix}{\frac {dm_{1}(x_{1},x_{2},x_{3})}{dt}}\\[2mm]{\frac {dm_{2}(x_{1},x_{2},x_{3})}{dt}}\end{pmatrix}}={\begin{pmatrix}{\frac {dm_{1}}{dx_{1}}}&{\frac {dm_{1}}{dx_{2}}}&{\frac {dm_{1}}{dx_{3}}}\\[2mm]{\frac {dm_{2}}{dx_{1}}}&{\frac {dm_{2}}{dx_{2}}}&{\frac {dm_{2}}{dx_{3}}}\end{pmatrix}}\、{\begin{pmatrix}{\frac {dx_{1}}{dt}}\\[2mm]{\frac {dx_{2}}{dt}}\\[2mm]{\frac {dx_{3}}{dt}}\end{pmatrix}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/91c3513016810bd0f90b826cf57b8b04e4bd66e7)
ここ
![{\displaystyle \mathbf {u} ={\begin{pmatrix}{\frac {dy_{1}}{dt}}\\[2mm]{\frac {dy_{2}}{dt}}\end{pmatrix}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/72c69c718274253141b365c36a26598f897b22ba)
は動き場であり、ベクトルuは画像の位置と時間tの両方に依存します。同様に、

![{\displaystyle \mathbf {x'} ={\begin{pmatrix}{\frac {dx_{1}}{dt}}\\[2mm]{\frac {dx_{2}}{dt}}\\[2mm]{\frac {dx_{3}}{dt}}\end{pmatrix}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/c862425082f5263addba59b3f41a22da25145659)
は対応する3D点の運動であり、運動場との関係は次のように表される。

画像位置依存行列は
どこにあるか

![{\displaystyle \mathbf {M} ={\begin{pmatrix}{\frac {dm_{1}}{dx_{1}}}&{\frac {dm_{1}}{dx_{2}}}&{\frac {dm_{1}}{dx_{3}}}\\[2mm]{\frac {dm_{2}}{dx_{1}}}&{\frac {dm_{2}}{dx_{2}}}&{\frac {dm_{2}}{dx_{3}}}\end{pmatrix}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/121e34e2f58c8222130625d654770db75c98fce8)
この関係は、特定の画像点におけるモーション フィールドが、のヌル空間にある 3D モーションに対して不変であることを意味します。たとえば、ピンホール カメラの場合、カメラの焦点に向かう、またはカメラの焦点から向かうすべての 3D モーション コンポーネントをモーション フィールドで検出することはできません。

特別なケース
モーション フィールドは次のように定義されます。


どこ
。
どこ
シーン内のポイントであり、Z はそのシーン ポイントまでの距離です。
カメラとシーンの相対的な動きです。
は運動の並進成分であり、
運動の角速度です。
オプティカルフローとの関係
モーション フィールドは、各画像ポイントの動きを決定できるという考えに基づく理想的な構成であり、この 2D モーションが 3D モーションとどのように関連しているかについては上で説明しました。ただし、実際には、真のモーション フィールドは、画像データの測定に基づいて近似することしかできません。問題は、ほとんどの場合、各画像ポイントには個別の動きがあるため、画像データの近傍操作によってローカルに測定する必要があることです。結果として、特定の種類の近傍に対して正しいモーション フィールドを決定できず、代わりに、オプティカル フローと呼ばれる近似を使用する必要があります。たとえば、一定の強度を持つ近傍は、ゼロ以外のモーション フィールドに対応する可能性がありますが、ローカルな画像の動きを測定できないため、オプティカル フローはゼロです。同様に、本質的に 1 次元である近傍 (たとえば、エッジまたは線) は、任意のモーション フィールドに対応できますが、オプティカル フローはモーション フィールドの法線成分しかキャプチャできません。また、画像ノイズ、3D オクルージョン、時間的エイリアシングなど、オプティカル フローを測定するあらゆる方法に固有の効果もあり、結果として得られるオプティカル フローが実際のモーション フィールドから逸脱する原因となります。
つまり、モーション フィールドはすべての画像ポイントに対して正確に測定できるわけではなく、オプティカル フローはモーション フィールドの近似値です。光学的な推定を行う方法のさまざまな基準に基づいて、オプティカル フローを計算する方法はいくつかあります。
参考文献
- Bernd Jähne と Horst Haußecker (2000)。『コンピュータビジョンとアプリケーション、学生と実践者のためのガイド』。Academic Press。ISBN 0-13-085198-1。
- Milan Sonka、Vaclav Hlavac、Roger Boyle (1999)。画像処理、分析、マシンビジョン。PWS Publishing。ISBN 0-534-95393-X。