コンピュータビジョンにおいて、高速化された堅牢な特徴( SURF ) は、特許取得済みのアプリケーションを備えたローカル特徴検出器および記述子です。物体認識、画像登録、分類、3D 再構成などのタスクに使用できます。スケール不変特徴変換(SIFT) 記述子に部分的にヒントを得ています。SURF の標準バージョンは SIFT よりも数倍高速で、その作成者によると、さまざまな画像変換に対して SIFT よりも堅牢であると言われています。
関心点を検出するために、SURF はヘッセ 行列式の整数近似を使用します。これは、事前に計算された積分画像を使用して 3 つの整数演算で計算できます。その特徴記述子は、関心点の周りのHaar ウェーブレット応答の合計に基づいています。これらも積分画像を使用して計算できます。
SURF 記述子は、物体、人物、顔の位置特定と認識、3D シーンの再構築、物体の追跡、関心点の抽出に使用されてきました。
SURF は、 Herbert Bay、Tinne Tuytelaars、Luc Van Goolによって初めて公開され、2006 年のEuropean Conference on Computer Visionで発表されました。このアルゴリズムの応用は米国で特許を取得しています。[1] SURF の「直立」バージョン (U-SURF と呼ばれる) は画像の回転に対して不変ではないため、計算が高速で、カメラがほぼ水平に保たれるアプリケーションに適しています。
画像は、マルチ解像度ピラミッド技術を使用して座標に変換され、ピラミッドガウスまたはラプラシアンピラミッド形状で元の画像をコピーして、同じサイズで帯域幅が削減された画像を取得します。これにより、スケールスペースと呼ばれる元の画像に特別なぼかし効果が得られ、関心のあるポイントがスケール不変であることが保証されます。
アルゴリズムと機能
SURF アルゴリズムは SIFT と同じ原理と手順に基づいていますが、各手順の詳細は異なります。アルゴリズムには、関心点の検出、ローカル近傍の記述、およびマッチングという 3 つの主要な部分があります。
検出
SURF は、ガウス平滑化の近似として正方形のフィルターを使用します。(SIFT アプローチでは、スケール不変の特徴点を検出するためにカスケード フィルターを使用し、ガウスの差 (DoG) が再スケールされた画像で段階的に計算されます。)積分画像を使用すると、正方形で画像をフィルタリングする方がはるかに高速になります。
長方形内の元の画像の合計は、長方形の 4 つの角での評価を必要とする積分画像を使用してすばやく評価できます。
SURF は、関心のあるポイントを見つけるために、ヘッセ行列に基づくブロブ検出器を使用します。ヘッセ行列の行列式は、ポイントの周囲の局所的な変化の尺度として使用され、この行列式が最大になるポイントが選択されます。Mikolajczyk と Schmid によるヘッセラプラシアン検出器とは対照的に、SURF は、Lindeberg によっても行われているように、スケールの選択にヘッセ行列の行列式を使用します。画像 I のポイント p=(x, y) が与えられた場合、ポイント p とスケール σ でのヘッセ行列 H(p, σ) は次のようになります。
ここで、等はガウス分布の2次導関数と点における像の畳み込みです。
サイズ 9×9 のボックス フィルターは、σ = 1.2 のガウス分布の近似値であり、ブロブ応答マップの最低レベル (最高の空間解像度) を表します。
スケール空間表現と関心点の位置
関心ポイントはさまざまなスケールで見つかることがあります。これは、対応関係の検索には、異なるスケールで見られる比較画像が必要になることがよくあるためです。他の特徴検出アルゴリズムでは、スケール空間は通常、画像ピラミッドとして実現されます。画像はガウス フィルターで繰り返し平滑化され、次にサブサンプリングされてピラミッドの次のレベルが取得されます。したがって、マスクのさまざまな測定値を持つ複数のフロアまたは階段が計算されます。
スケール空間は複数のオクターブに分割されます。ここで、オクターブとは、スケールの 2 倍をカバーする一連の応答マップを指します。SURF では、スケール空間の最低レベルは、9×9 フィルターの出力から取得されます。
したがって、以前の方法とは異なり、SURF のスケール空間は、異なるサイズのボックス フィルターを適用することによって実装されます。したがって、スケール空間は、画像サイズを繰り返し縮小するのではなく、フィルター サイズを拡大することによって分析されます。上記の 9×9 フィルターの出力は、スケールs =1.2 ( σ = 1.2 のガウス導関数に相当 ) の初期スケール レイヤーと見なされます。次のレイヤーは、積分画像の離散的性質と特定のフィルター構造を考慮して、徐々に大きなマスクで画像をフィルター処理することによって取得されます。これにより、サイズが 9×9、15×15、21×21、27×27、... のフィルターが生成されます。3×3×3 近傍での非最大値抑制を適用して、画像内およびスケール上の関心点を特定します。次に、Brown らが提案した方法を使用して、ヘッセ行列の行列式の最大値をスケール空間と画像空間で補間します。この場合、各オクターブの最初のレイヤー間のスケールの差が比較的大きいため、スケール空間補間は特に重要です。
ディスクリプタ
記述子の目的は、例えば、関心点の近傍内のピクセルの強度分布を記述することによって、画像の特徴の一意かつ堅牢な記述を提供することです。ほとんどの記述子は局所的に計算されるため、以前に識別されたすべての関心点について記述が得られます。
記述子の次元は、計算の複雑さとポイントマッチングの堅牢性/精度の両方に直接影響します。記述子が短いと、外観の変化に対してより堅牢になる可能性がありますが、十分な識別力が得られず、誤検知が多くなる可能性があります。
最初のステップは、関心点の周囲の円形領域の情報に基づいて、再現可能な方向を固定することです。次に、選択した方向に合わせた正方形の領域を構築し、そこから SURF 記述子を抽出します。
オリエンテーションの割り当て
回転不変性を実現するには、関心点の方向を見つける必要があります。関心点の周囲の半径 の円形近傍内の x 方向と y 方向の両方の Haar ウェーブレット応答が計算されます。ここで、 は関心点が検出されたスケールです。取得された応答は、関心点を中心とするガウス関数によって重み付けされ、次に 2 次元空間内の点としてプロットされ、水平応答が横軸、垂直応答が縦軸になります。支配的な方向は、サイズ π/3 のスライド方向ウィンドウ内のすべての応答の合計を計算することによって推定されます。ウィンドウ内の水平応答と垂直応答が合計されます。合計された 2 つの応答から、ローカル方向ベクトルが生成されます。全体として最も長いベクトルが、関心点の方向を定義します。スライド ウィンドウのサイズは、堅牢性と角度分解能の間の望ましいバランスを実現するために慎重に選択する必要があるパラメーターです。
Haarウェーブレット応答の合計に基づく記述子
ポイントの周囲の領域を記述するために、関心ポイントを中心とし、上記で選択した方向に沿って配置された正方形の領域が抽出されます。このウィンドウのサイズは 20 秒です。
対象領域は、4x4 の小さな正方形のサブ領域に分割され、各サブ領域に対して、5x5 の等間隔のサンプル ポイントで Haar ウェーブレット応答が抽出されます。応答はガウスで重み付けされます (変形、ノイズ、変換に対する堅牢性を高めるため)。
マッチング
異なる画像から得られた記述子を比較することで、一致するペアを見つけることができます。
参照
- スケール不変特徴変換(SIFT)
- 勾配位置と方向ヒストグラム(GLOH)
- 局所エネルギーベースの形状ヒストグラム(LESH)
- ブロブ検出
- 特徴検出(コンピュータビジョン)
参考文献
- ^ US 2009238460、船山 竜二、柳原 弘道、Luc Van Gool、Tinne Tuytelaars、Herbert Bay、「ROBUST INTEREST POINT DETECTOR AND DESCRIPTOR」、2009 年 9 月 24 日公開
出典
- Herbert Bay、Andreas Ess、Tinne Tuytelaars、Luc Van Gool、「Speeded Up Robust features」、ETH Zurich、Katholieke Universiteit Leuven
- アンドレア・マリセラ・プラザ・コルデロ、ホルヘ・ルイス・ザンブラノ・マルティネス、「Estudio y Selección de las Técnicas SIFT、SURF y ASIFT de Reconocimiento de Imágenes para el Diseño de un Prototipo en Dispositivos Móviles」、15° Concurso de Trabajos Estudiantiles、EST 2012年
- AM Romero と M. Cazorla、「視覚的特徴と SLAM の検出器の比較」、エージェントの X ワークショップ、2009 年セティエンブレ、カセレス
- PM Panchal、SR Panchal、SK Shah、「SIFT と SURF の比較」、International Journal of Innovative Research in Computer and Communication Engineering 第 1 巻、第 2 号、2013 年 4 月
- Herbert Bay、Andreas Ess、Tinne Tuytelaars、Luc Van Gool「SURF: 高速化された堅牢な特徴」、Computer Vision and Image Understanding (CVIU)、第 110 巻、第 3 号、346 ~ 359 ページ、2008 年
- Christopher Evans「OpenSURF ライブラリに関するメモ」、MSc コンピュータ サイエンス、ブリストル大学、ソース コードとドキュメントはここにアーカイブされています。
- J an Knopp、Mukta Prasad、Gert Willems、Radu Timofte、Luc Van Gool、「堅牢な 3 次元分類のための Hough 変換と 3D SURF」、European Conference on Computer Vision (ECCV)、2010 年
外部リンク
- GitHub 上の SURF
- SURFのウェブサイト:高速化された強力な機能
- スピードアップした堅牢な機能の初版 (2006)
- SURF の改訂版 (2008)
