ビジュアルサーボ制御(視覚ベースロボット制御とも呼ばれ、 VSと略される)は、視覚センサーから抽出されたフィードバック情報(視覚フィードバック[ 1 ] )を使用してロボットの動きを制御する技術です。ビジュアルサーボ制御について言及した初期の論文の1つは、1979年にSRIインターナショナルラボから発表されました。[ 2 ]
ロボットのエンドエフェクタ(手)とカメラには、2つの基本的な構成があります。[ 4 ]
ビジュアルサーボ制御技術は、大きく分けて以下の種類に分類されます。[ 5 ] [ 6 ]
IBVSはWeissとSandersonによって提案されました。[ 7 ] 制御法則は、画像平面上の現在と目標の特徴間の誤差に基づいており、ターゲットの姿勢の推定は含まれていません。特徴は、視覚的特徴の座標、線、または領域のモーメントである可能性があります。IBVSは、カメラ後退と呼ばれるようになった非常に大きな回転の動きに困難があります[ 8 ] 。 [ 9 ]
PBVSは、単一カメラを用いたモデルベースの手法です。これは、対象物の姿勢をカメラを基準として推定し、ロボットコントローラにコマンドを発行することでロボットを制御するためです。この場合、画像の特徴も抽出されますが、さらに3D情報(デカルト座標系における対象物の姿勢)の推定にも使用されるため、3Dサーボ制御となります。
ハイブリッド方式では、2Dサーボと3Dサーボの組み合わせが使用されます。ハイブリッドサーボにはいくつかの異なるアプローチがあります。
先行研究に関する以下の記述は、3つの部分に分かれている。
視覚サーボシステム(サーボとも呼ばれる)は1980年代初頭から存在していますが、[ 11 ]視覚サーボという用語自体は1987年に造語されたばかりです。[ 4 ] [ 5 ] [ 6 ] 視覚サーボとは、本質的にはカメラ(視覚センサ)を使用するロボット制御の手法です。サーボは主に2つの技術で構成されており、[ 6 ] 1つは画像からの情報を使用してロボットの自由度(DOF)を直接制御するもので、画像ベース視覚サーボ(IBVS)と呼ばれます。もう1つは、ターゲットの姿勢やカメラのパラメータを推定するなど、カメラから抽出された情報の幾何学的解釈を行うものです(ターゲットの基本的なモデルが既知であると仮定します)。サーボシステムの各コンポーネントのバリエーションに基づいて、他のサーボ分類も存在します。[ 5 ] 例えば、カメラの位置によって、アイ・イン・ハンドとハンド・アイの2種類があります。制御ループに基づいて、エンドポイント開ループとエンドポイント閉ループの 2 種類に分類されます。制御が関節 (または DOF) に直接適用されるか、ロボットコントローラへの位置コマンドとして適用されるかに基づいて、直接サーボ制御と動的ルックアンドムーブの 2 種類に分類されます。初期の研究の 1 つです[ 12 ] 著者らは、画像ベースのサーボ制御に適用される階層的なビジュアルサーボ方式を提案しました。この手法は、対象物 (エッジ、コーナー、重心など) から適切な特徴セットを抽出し、シーンとロボットのグローバルモデルとともに部分モデルとして使用できるという仮定に基づいています。この制御戦略は、2 自由度と 3 自由度のロボットアームのシミュレーションに適用されます。
Feddema ら[ 13 ] は、特徴速度に関してタスク軌道を生成するというアイデアを導入しました。これは、ロボットのどの動きに対してもセンサーが無効にならない(フィードバックが停止しない)ようにするためです。著者らは、オブジェクトは事前に既知(CAD モデルなど)であり、すべての特徴をオブジェクトから抽出できると想定しています。Espiau ら[ 14 ]の研究 では、ビジュアルサーボの基本的な問題のいくつかについて議論しています。議論は、相互作用行列、カメラ、視覚的特徴(点、線など)のモデリングに焦点を当てています。[ 15 ]では、 ルックアンドムーブサーボアーキテクチャを備えた適応型サーボシステムが提案されました。この手法では、信頼度メトリックを提供するために、オプティカルフローと SSD を使用し、制御スキームにはカルマンフィルタリングを備えた確率的コントローラを使用しました。このシステムは(例では)カメラの平面と特徴の平面が平行であると仮定しています。[ 16 ]では、ヤコビアン関係s˙ = Jv˙を使用した速度制御のアプローチについて説明しています。さらに、著者は、ターゲットの抽出された位置に固有の誤差(センサー誤差)があると仮定して、カルマンフィルタリングを使用しています。ターゲット速度のモデルが開発され、制御ループのフィードフォワード入力として使用されます。また、運動学的不一致、動的効果、再現性、整定時間の振動、応答の遅延を調べることの重要性についても言及しています。
Corke [ 17 ]は、ビジュアルサーボ制御に関する非常に重要な一連の質問を提起し、その意味を詳しく説明しようとしています。この論文は主にビジュアルサーボ制御のダイナミクスに焦点を当てています。著者は、遅延や安定性などの問題に対処しようとし、制御ループ内のフィードフォワードパスについても言及しています。また、この論文では、軌道生成、軸制御の方法論、およびパフォーマンス指標の開発の正当性を探求しようとしています。
Chaumette は[ 18 ]でIBVS の 2 つの主要な問題について優れた洞察を提供しています。1 つは局所最小値へのサーボ制御、もう 1 つはヤコビアン特異点への到達です。著者は、特異点の発生により、画像点だけでは良い特徴にならないことを示しています。この論文は、特異点を防ぐための追加のチェック、つまり ˆ J_s と J^T_s の零空間をチェックするための J_s と Jˆ+_s の条件数について議論することで続いています。著者が強調している主なポイントの 1 つは、局所最小値と実現不可能な画像特徴の動きとの関係です。
長年にわたり、多くのハイブリッド技術が開発されてきました。[ 4 ]これらは、複数のビューまたは複数のカメラを使用してエピポーラ幾何学から部分的/完全な姿勢を計算するものです。値は直接推定、学習、または統計的スキームによって取得されます。一方、他のものは、リアプノフ関数に基づいて画像ベースと位置ベースを切り替えるスイッチングアプローチを使用しています。[ 4 ] サーボ制御に画像ベースと姿勢ベース(2Dおよび3D情報)のアプローチを組み合わせた初期のハイブリッド技術では、姿勢情報を抽出するためにオブジェクトの完全または部分的なモデルが必要であり、画像からモーション情報を抽出するためにさまざまな技術が使用されていました。[ 19 ]は、粗い多面体CADモデルに加えて、画像モーションからのアフィンモーションモデルを使用して、カメラに対するオブジェクトの姿勢を抽出し、オブジェクトにサーボ制御できるようにしました(PBVSのラインに沿って)。
Malis ら[ 20 ]によって開発された 2-1/2-D ビジュアルサーボは、回転と並進を分離する組織的な方法でサーボに必要な情報を分解するよく知られた技術です。論文では、目的の姿勢が事前にわかっていることを前提としています。回転情報は、部分姿勢推定、ホモグラフィ (本質的には 3D 情報) から取得され、回転軸と角度 (ホモグラフィの固有値と固有ベクトルを計算することによって) が得られます。並進情報は、一連の特徴点を追跡することによって画像から直接取得されます。唯一の条件は、追跡される特徴点が視野から外れないことと、深度推定が何らかのオフライン技術によって事前に決定されていることです。2-1/2-D サーボは、それ以前の技術よりも安定していることが示されています。この定式化に関するもう 1 つの興味深い観察は、著者らが、ビジュアル ヤコビアンには動作中に特異点がないと主張していることです。 CorkeとHutchinsonによって開発されたハイブリッド手法[ 21 ] [ 22 ]は、一般に分割アプローチと呼ばれ、視覚(または画像)ヤコビアンを、X軸とY軸に関連する動き(回転と並進の両方)とZ軸に関連する動きに分割します。[ 22 ]では、Z軸の並進と回転に対応する視覚ヤコビアンの列(つまり、3番目と6番目の列)を分割する手法の概要が示されています。分割アプローチは、[ 23 ]で議論されているChaumetteの難問を処理することが示されています。この手法は、適切に機能するために、良好な深度推定を必要とします。 [ 24 ]では、サーボタスクをメインとセカンダリの2つに分割するハイブリッドアプローチの概要が示されています。メインタスクは、関心のある特徴を視野内に維持することです。セカンダリタスクは、固定点をマークし、それを基準として使用してカメラを目的の姿勢にすることです。この手法では、オフライン手順からの深度推定が必要です。この論文では、ロボットのオドメトリから深度推定値を取得し、すべての特徴が平面上にあると仮定する2つの例について論じている。二次タスクは視差の概念を使用して達成される。追跡される特徴は、最初のフレームで実行される初期化によって選択され、通常は点である。 [ 25 ]本稿では、ビジュアルサーボ制御の2つの側面、すなわち特徴モデリングとモデルベーストラッキングについて考察する。前提として、対象物の3Dモデルが利用可能であることを想定する。著者らは、運動の自由度を線形関係で分離できるような理想的な特徴を選択する必要があることを強調する。また、トラッキング性能を向上させるために、対象物の速度推定値を相互作用行列に導入する。結果は、遮蔽が発生した場合でも、よく知られたサーボ制御手法と比較される。
このセクションでは、ビジュアルサーボの分野で行われた研究について説明します。特徴の使用におけるさまざまな手法を追跡しようと試みます。ほとんどの研究では、画像点をビジュアル特徴として使用しています。[ 5 ]の相互作用行列の定式化では、画像内の点がターゲットを表すために使用されることを前提としています。点の使用から逸脱し、特徴領域、線、画像モーメント、モーメント不変量を使用する研究もいくつかあります。[ 26 ] [ 27 ] では、著者らはアフィンベースの画像特徴の追跡について議論しています。画像特徴は、特徴が受ける変形に基づく不一致尺度に基づいて選択されます。使用された特徴はテクスチャパッチでした。この論文の重要なポイントの 1 つは、ビジュアルサーボを改善するために特徴に着目する必要性を強調したことです。[ 28 ]では、著者らは画像特徴の選択について検討しています (同じ問題は追跡の文脈で[ 5 ]でも議論されました)。画像特徴の選択が制御法則に与える影響は、深度軸のみに関して議論されています。著者らは、特徴点間の距離とオブジェクトの面積を特徴とみなしている。これらの特徴は、パフォーマンスへの影響を強調するために、わずかに異なる形式で制御則に使用されている。サーボ誤差が深度軸の変化に比例する場合、パフォーマンスが向上することが指摘されている。 [ 29 ]は、モーメントの使用に関する初期の議論の1つを提供している。著者らは、複雑ではあるが、画像内のモーメントの速度を使用した相互作用行列の新しい定式化を提供している。モーメントが使用されているにもかかわらず、モーメントは、グリーンの定理を使用した輪郭点の位置の小さな変化である。この論文では、6 DOFロボット用の(平面上の)特徴のセットを決定しようとしている。[ 30 ]では、視覚ヤコビアンを定式化するために画像モーメントを使用することについて議論している。この定式化により、選択されたモーメントの種類に基づいてDOFを分離することができる。この定式化の単純なケースは、概念的には2-1/2-Dサーボに似ている。[ 30 ]モーメント (m˙ij) の時間変化は、2 つの画像間の動きとグリーンの定理を使用して決定されます。m˙ij と速度スクリュー (v) の関係は、m˙_ij = L_m_ij v で与えられます。この手法は、オブジェクトが平面であると仮定し、深度推定を使用することで、カメラのキャリブレーションを回避します。この手法は平面の場合にはうまく機能しますが、一般的な場合には複雑になる傾向があります。基本的なアイデアは [4] の研究に基づいています。モーメント不変量は[ 31 ]で使用されています。重要なアイデアは、動きのすべての自由度を分離する特徴ベクトルを見つけることです。いくつかの観察結果から、中心モーメントは 2D 並進に対して不変であることがわかっています。2D 回転には複雑な多項式形式が開発されています。この手法は、見せて教える方式に従うため、目的の深度とオブジェクトの面積の値が必要です (カメラとオブジェクトの平面が平行で、オブジェクトが平面であると仮定)。特徴ベクトルの他の部分は不変量 R3、R4 です。著者らは、オクルージョンを処理できると主張しています。 [ 32 ]と[ 33 ]は、 [ 29 ] [ 31 ] [ 32 ]で説明されている作業に基づいています。主な違いは、著者らが[ 16 ]と同様の手法を使用していることです。この手法では、タスクが 2 つに分割されます (特徴がカメラ平面と平行でない場合)。仮想回転を実行して、特徴をカメラ平面と平行にします。[ 34 ]は、著者らが画像モーメントに関して行った研究をまとめたものである。
Espiauは[ 35 ]で、純粋に実験的な研究から、画像ベースのビジュアルサーボ制御(IBVS)がキャリブレーション誤差に対してロバストであることを示した。著者は、明示的なキャリブレーションを行わないカメラと、点マッチング、姿勢推定なしのカメラを使用した。この論文では、実験的アプローチから、相互作用行列の項に対する誤差と不確実性の影響を調べた。使用されたターゲットは点であり、平面であると仮定された。
同様の研究は[ 36 ]で行われ、著者らは 90 年代に流行したいくつかの未較正のビジュアルサーボシステムの実験的評価を実施しました。主な成果は、ビジュアルサーボ制御が従来の制御方法よりも効果的であるという実験的証拠でした。Kyrki ら[ 37 ] は、位置ベースおよび 2-1/2 次元ビジュアルサーボのサーボ誤差を分析しています。この手法では、画像位置の抽出誤差を決定し、それを姿勢推定とサーボ制御に伝播します。画像からの点は、マッピング (基本的にホモグラフィですが、論文では明示的に述べられていません) を取得するために、事前に世界の点にマッピングされます。このマッピングは、純粋な回転と並進に分解されます。姿勢推定は、コンピュータビジョンの標準的な手法を使用して実行されます。ピクセル誤差は姿勢に変換されます。これらはコントローラに伝播されます。分析からの観察によると、画像平面の誤差は深度に比例し、深度軸の誤差は深度の 2 乗に比例します。ビジュアルサーボの測定誤差は広範囲にわたって調査されています。ほとんどの誤差関数は、ビジュアルサーボの 2 つの側面に関連しています。 1 つは定常状態誤差 (サーボ化された後) であり、もう 1 つは制御ループの安定性です。 関心を集めている他のサーボ誤差は、姿勢推定とカメラキャリブレーションから生じるものです。[ 38 ]では、著者は[ 39 ]の研究を拡張し、内在的および外在的なキャリブレーション誤差が存在する場合のグローバル安定性を考慮しています。[ 40 ]は、タスク関数の追跡誤差を制限するアプローチを提供しています。[ 41 ]では、著者はティーチング・バイ・ショーイングのビジュアルサーボ技術を使用しています。ここでは、目的の姿勢が事前にわかっており、ロボットは与えられた姿勢から移動します。この論文の主な目的は、凸最適化手法を使用して、画像ノイズによる位置決め誤差の上限を決定することです。 [ 42 ]は、深度推定の不確実性に関する安定性解析について議論しています。著者は、未知のターゲット形状の場合、誤差を制限するために、より正確な深度推定が必要であるという観察で論文を締めくくっています。多くのビジュアルサーボ技術[ 21 ] [ 22 ] [ 43 ]は、画像内にオブジェクトが1つだけ存在し、追跡に関連する特徴とオブジェクトの領域が利用可能であることを暗黙のうちに前提としています。ほとんどの技術では、現在の姿勢と目標姿勢の部分的な姿勢推定または正確な深度推定が必要です。