スケール不変特徴変換(SIFT)は、画像内の局所的な特徴を検出、記述、一致させるためのコンピュータビジョンアルゴリズムであり、 1999年にDavid Loweによって発明されました。 [1]アプリケーションには、物体認識、ロボットマッピングとナビゲーション、画像ステッチング、3Dモデリング、ジェスチャ認識、ビデオトラッキング、野生動物の個体識別、マッチムービングなどがあります。
オブジェクトの SIFT キーポイントは、最初に参照画像のセット[1]から抽出され、データベースに保存されます。新しい画像内のオブジェクトは、新しい画像の各特徴をこのデータベースと個別に比較し、特徴ベクトルのユークリッド距離に基づいて候補となるマッチング特徴を見つけることによって認識されます。完全な一致セットから、新しい画像内のオブジェクトとその位置、スケール、および方向に一致するキーポイントのサブセットが識別され、良好な一致が除外されます。一貫性のあるクラスターの決定は、一般化ハフ変換の効率的なハッシュテーブル実装を使用して迅速に実行されます。オブジェクトとそのポーズに一致する 3 つ以上の特徴の各クラスターは、さらに詳細なモデル検証の対象となり、その後外れ値は破棄されます。最後に、適合の精度と可能性のある誤った一致の数に基づいて、特定の特徴セットがオブジェクトの存在を示す確率が計算されます。これらすべてのテストに合格したオブジェクトの一致は、高い信頼度で正しいと識別できます。[2]
SIFTアルゴリズムは以前は特許で保護されていましたが、その特許は2020年に失効しました。[3]
概要
画像内の任意のオブジェクトについて、画像内の重要なポイントを抽出して、オブジェクトの「特徴の説明」を提供できます。トレーニング画像から抽出されたこの説明は、他のオブジェクトを含む新しい (以前には表示されていない) 画像内でオブジェクトを見つけるために使用できます。これを確実に行うには、画像が拡大縮小されていたり、ノイズや異なる照明があったりしても、特徴を検出できる必要があります。このようなポイントは通常、オブジェクトのエッジなど、画像の高コントラスト領域にあります。
これらの特徴のもう 1 つの重要な特性は、元のシーンにおけるそれらの相対的な位置が画像間で変化しないことです。たとえば、ドアの 4 つの角だけを特徴として使用した場合、ドアの位置に関係なく機能しますが、フレーム内の点も使用した場合、ドアが開いているか閉じているかによって認識が失敗します。同様に、関節のあるオブジェクトまたは柔軟なオブジェクトにある特徴は、処理中のセット内の 2 つの画像間で内部形状に変化が生じた場合、通常は機能しません。実際には、SIFT は画像からはるかに多くの特徴を検出して使用するため、すべての特徴マッチング エラーの平均エラーにおけるこれらのローカルな変動によって発生するエラーの影響が軽減されます。
SIFT [3]は、 SIFT特徴記述子が均一なスケーリング、方向、照明の変化に対して不変であり、アフィン歪みに対して部分的に不変であるため、乱雑な環境や部分的な遮蔽下でも物体を堅牢に識別できます。[1]このセクションでは、オリジナルのSIFTアルゴリズムを要約し、乱雑な環境や部分的な遮蔽下での物体認識に使用できるいくつかの競合技術について説明します。
SIFT記述子は受容野[4] [5] [6] [7]に関する画像測定に基づいており、受容野上で局所スケール不変参照フレーム[8] [9]が局所スケール選択によって確立される。[10] [11] [9]これに関する一般的な理論的説明は、SIFTに関するScholarpediaの記事に記載されている。[12]
機能の種類
局所的な画像特徴の検出と記述は、物体認識に役立ちます。SIFT 特徴は局所的であり、特定の関心点における物体の外観に基づいており、画像のスケールと回転に対して不変です。また、照明の変化、ノイズ、視点のわずかな変化に対しても堅牢です。これらの特性に加えて、SIFT 特徴は非常に特徴的で、比較的簡単に抽出でき、ミスマッチの可能性が低い状態で物体を正しく識別できます。局所特徴の (大規模な) データベースとの照合は比較的簡単ですが、高次元性が問題になる可能性があり、一般的にはkd ツリーとベスト ビン ファーストサーチなどの確率的アルゴリズムが使用されます。SIFT 特徴のセットによる物体の記述は、部分的なオクルージョンに対しても堅牢です。物体からわずか 3 つの SIFT 特徴があれば、その位置と姿勢を計算できます。少なくとも小規模なデータベースと最新のコンピュータ ハードウェアでは、ほぼリアルタイムで認識を実行できます。[引用が必要]
ステージ
スケール不変の特徴検出
Lowe の画像特徴生成法では、画像を特徴ベクトルの大きなコレクションに変換します。各特徴ベクトルは、画像の移動、拡大縮小、回転に対して不変で、照明の変化に対して部分的に不変で、局所的な幾何学的歪みに対して堅牢です。これらの特徴は、霊長類の視覚における物体検出のための基本的な形状、色、動きをエンコードする一次視覚野のニューロンと同様の特性を持っています。 [13]キー位置は、スケール空間で一連の平滑化および再サンプリングされた画像に適用されたガウス関数の差の結果の最大値と最小値として定義されます。エッジに沿った低コントラストの候補ポイントとエッジ応答ポイントは破棄されます。主要な方向は、局所的なキーポイントに割り当てられます。これらの手順により、キーポイントがマッチングと認識に対してより安定します。次に、キー位置の半径の周囲のピクセルを考慮し、ローカルな画像方向平面をぼかし、再サンプリングすることで、ローカルなアフィン歪みに対して堅牢な SIFT 記述子が得られます。
特徴のマッチングとインデックス作成
インデックス作成は、SIFT キーの保存と、新しい画像からの一致するキーの識別から構成されます。Lowe は、限られた量の計算のみを使用して、高確率で最近傍を識別できる、ベスト ビン ファースト検索法[14]と呼ばれるkd ツリーアルゴリズムの修正を使用しました。BBF アルゴリズムは、 kdツリーアルゴリズムの修正された検索順序を使用して、特徴空間内のビンがクエリ位置からの最も近い距離の順序で検索されるようにします。この検索順序では、検索順序を効率的に決定するために、ヒープベースの優先キューを使用する必要があります。トレーニング画像からキーポイントのデータベースで最近傍を識別することにより、各キーポイントの候補を取得します。最近傍は、指定された記述子ベクトルからのユークリッド距離が最小のキーポイントとして定義されます。 Lowe [2] が特定の候補を残すか「破棄」するかを決定する方法は、この特定の候補からの距離と、手元の候補と同じオブジェクト クラスではない最も近いキーポイントからの距離の比率を確認することです (候補の特徴ベクトル / 最も近い異なるクラスの特徴ベクトル)。その考え方は、異なるオブジェクト クラスの特徴/キーポイントが候補を「乱雑」にしない (必ずしも特徴空間で幾何学的に乱雑になるのではなく、実際の直線の右半分 (>0) に沿った乱雑になる) 候補のみを確実にできるというものです。これは、ユークリッド距離を最近傍の尺度として使用したことによる明らかな結果です。拒否の比率しきい値は、0.8 を超える場合です。この方法では、誤った一致の 90% が排除され、正しい一致の 5% 未満が破棄されました。best-bin-first アルゴリズムの効率をさらに向上させるために、最初の 200 の最近傍候補を確認した後、検索が打ち切られました。 100,000 個のキーポイントのデータベースの場合、これにより、正確な最近傍検索よりも約 2 桁高速化されますが、正しい一致の数は 5% 未満しか失われません。
ハフ変換投票によるクラスター識別
ハフ変換は、信頼できるモデル仮説をクラスター化して、特定のモデルポーズに一致するキーを検索するために使用されます。ハフ変換は、各特徴を使用して、その特徴と一致するすべてのオブジェクトポーズに投票することにより、一貫した解釈を持つ特徴のクラスターを識別します。特徴のクラスターがオブジェクトの同じポーズに投票することがわかった場合、解釈が正しい確率は、単一の特徴の場合よりもはるかに高くなります。一致仮説からモデルの位置、方向、スケールを予測するハッシュテーブルのエントリが作成されます。ハッシュテーブルを検索して、ビンに少なくとも 3 つのエントリがあるすべてのクラスターを識別し、ビンをサイズの降順で並べ替えます。
SIFT キーポイントはそれぞれ、2D の位置、スケール、および方向を指定し、データベース内の一致した各キーポイントには、それが見つかったトレーニング イメージに関連するパラメータの記録があります。これらの 4 つのパラメータによって暗示される相似変換は、3D オブジェクトの完全な 6 自由度のポーズ空間の近似値にすぎず、非剛体変形も考慮されていません。そのため、Lowe [2] は、方向に 30 度、スケールに係数 2、位置に最大投影トレーニング イメージ寸法 (予測スケールを使用) の 0.25 倍という広いビン サイズを使用しました。より大きなスケールで生成された SIFT キー サンプルには、より小さなスケールの 2 倍の重みが与えられます。つまり、より大きなスケールは、より小さなスケールでチェックするために、最も可能性の高い近傍をフィルター処理できることになります。これにより、ノイズの最も少ないスケールに重みが与えられるため、認識パフォーマンスも向上します。ビン割り当てにおける境界効果の問題を回避するために、各キーポイント マッチは各次元で最も近い 2 つのビンに投票し、各仮説に対して合計 16 個のエントリを提供し、ポーズ範囲をさらに広げます。
線形最小二乗法によるモデル検証
識別された各クラスターは、モデルと画像を関連付けるアフィン変換のパラメータに対して線形最小二乗解を実行する検証手順の対象となります。モデルポイント[xy] Tから画像ポイント[uv] Tへのアフィン変換は、以下のように記述できます。
ここで、モデル変換は [t x t y ] Tであり、アフィン回転、スケール、ストレッチはパラメータ m 1、 m 2、 m 3、 m 4で表されます。変換パラメータを解くには、上記の式を書き直して、未知数を列ベクトルにまとめます。
この式は1つの一致を示していますが、さらに任意の数の一致を追加することができ、各一致は最初の行列と最後の行列にさらに2行を追加します。解を得るには少なくとも3つの一致が必要です。この線形システムは次のように記述できます。
ここで、Aは既知のm行n 列の行列(通常m > n)、xは未知のn次元パラメータベクトル、bは既知のm次元測定ベクトルです。
したがって、最小化ベクトルは正規方程式の解である。
線形方程式系の解は、Aの擬似逆行列と呼ばれる行列を用いて次のように表される。
投影されたモデルの位置から対応する画像の位置までの距離の二乗の合計を最小化します。
外れ値検出
パラメータ解が与えられた場合、各画像特徴とモデル間の一致をチェックすることで、外れ値を削除できるようになりました。線形最小二乗解が与えられた場合、各一致は、ハフ変換ビンのパラメータに使用された誤差範囲の半分以内で一致する必要があります。外れ値が破棄されると、残りのポイントで線形最小二乗解が再度解決され、プロセスが繰り返されます。外れ値を破棄した後に残っているポイントが 3 点未満の場合、一致は拒否されます。さらに、トップダウン マッチング フェーズを使用して、類似性変換近似またはその他のエラーのためにハフ変換ビンから見逃された可能性のある、投影されたモデル位置と一致するさらなる一致を追加します。
モデル仮説を受け入れるか拒否するかの最終決定は、詳細な確率モデルに基づいています。[15]この方法では、まず、モデルの投影サイズ、領域内の特徴の数、および適合の精度に基づいて、モデルのポーズに対する誤った一致の予想数を計算します。次に、ベイズ確率分析により、一致する特徴の実際の数に基づいて、オブジェクトが存在する確率が示されます。正しい解釈の最終確率が 0.98 を超える場合、モデルは受け入れられます。Lowe の SIFT ベースのオブジェクト認識は、照明の大きな変化や非剛体変換を除いて、優れた結果をもたらします。
アルゴリズム
スケール空間極値検出
まず、SIFTフレームワークでキーポイントと呼ばれる関心点を検出します。画像は異なるスケールでガウスフィルタで畳み込まれ、その後、連続するガウスぼかし画像の差が取られます。キーポイントは、複数のスケールで発生するガウスの差(DoG)の最大値/最小値として取得されます。具体的には、DoG画像は次のように表されます。
- 、
- ここで、ガウスぼかしをスケール で適用した元の画像の畳み込み、すなわち、
したがって、スケールと間の DoG 画像は、スケールとでのガウスぼかし画像の差に過ぎません。SIFTアルゴリズムでスケール空間の極値を検出するために、まず画像は異なるスケールでのガウスぼかしで畳み込まれます。畳み込まれた画像はオクターブごとにグループ化され (1 オクターブは の値を 2 倍にすることに対応します)、 の値はオクターブあたり固定数の畳み込み画像が得られるように選択されます。次に、オクターブごとに隣接するガウスぼかし画像からガウス差画像が取得されます。
DoG 画像が取得されると、スケール全体にわたって DoG 画像の局所的最小値/最大値としてキーポイントが識別されます。これは、DoG 画像の各ピクセルを、同じスケールの 8 つの隣接ピクセルと、各隣接スケールの対応する 9 つの隣接ピクセルと比較することによって行われます。ピクセル値が比較されたすべてのピクセルの中で最大または最小値である場合、候補キーポイントとして選択されます。
このキーポイント検出ステップは、スケール正規化ラプラシアンのスケール空間極値を検出することによって Lindeberg が開発したブロブ検出方法の 1 つを変形したものです。 [10] [11]つまり、離散的なケースでは、離散化されたスケール空間ボリューム内の最も近い 26 個の近傍と比較することにより、空間とスケールの両方に関して局所的な極値であるポイントを検出します。ガウスの差演算子はラプラシアンの近似と見なすことができ、ピラミッド内の暗黙の正規化もスケール正規化ラプラシアンの離散近似を構成します。[12]ラプラシアン演算子のスケール空間極値の別のリアルタイム実装は、Lindeberg と Bretzner によって、ハイブリッド ピラミッド表現に基づいて発表されました。[16]これは、Bretzner ら (2002) のリアルタイム ジェスチャ認識による人間とコンピューターの相互作用に使用されました。[17]
キーポイントの位置特定

スケール空間極値検出では、キーポイント候補が多すぎますが、その一部は不安定です。アルゴリズムの次のステップでは、近くのデータに詳細に適合させて、正確な位置、スケール、主曲率の比率を調べます。この情報により、コントラストが低い (したがってノイズに敏感な) ポイントや、エッジに沿って位置が定まっていないポイントを除外できます。
正確な位置を得るために近傍データを補間する
まず、候補キーポイントごとに、近くのデータの補間を使用して位置を正確に決定します。最初のアプローチは、候補キーポイントの位置とスケールに各キーポイントを配置するだけでした。[1]新しいアプローチでは、極値の補間された位置を計算し、マッチングと安定性を大幅に向上させます。[2]補間は、候補キーポイントを原点として、ガウス差スケール空間関数の2次テイラー展開を使用して行われます。このテイラー展開は次のように表されます。
ここで、D とその導関数は候補キーポイントで評価され、はこの点からのオフセットです。極値の位置 は、この関数の に対する導関数を取り、それをゼロに設定することで決定されます。オフセットがどの次元でも より大きい場合、それは極値が別の候補キーポイントに近いことを示しています。この場合、候補キーポイントが変更され、代わりにその点について補間が実行されます。それ以外の場合は、オフセットが候補キーポイントに追加され、極値の位置の補間推定値が得られます。スケール空間の極値の位置の同様のサブピクセル決定は、Lindeberg と彼の同僚によって開発されたハイブリッドピラミッドに基づくリアルタイム実装で実行されます。[16]
低コントラストのキーポイントを破棄する
コントラストの低いキーポイントを破棄するために、2次テイラー展開の値がオフセット で計算されます。この値が より小さい場合、候補キーポイントは破棄されます。それ以外の場合は、最終的なスケール空間位置 で保持されます。ここで、 はキーポイントの元の位置です。
エッジ応答の排除
DoG 関数は、候補キーポイントが少量のノイズに対して堅牢でない場合でも、エッジに沿って強い応答を示します。したがって、安定性を高めるには、位置が正確に特定されていないがエッジ応答が高いキーポイントを排除する必要があります。
DoG関数のピークが明確に定義されていない場合、エッジを横切る主曲率はエッジに沿った主曲率よりもはるかに大きくなります。これらの主曲率を見つけることは、2次ヘッセ行列Hの固有値を解くことと同じです。
Hの固有値はDの主曲率に比例します。2 つの固有値の比、つまり大きい方を 、小さい方を とすると、比 は SIFT の目的には十分であることがわかります。H のトレース、つまり は2 つの固有値の合計を与え、その行列式、つまり は積を与えます。比はに等しいことが示され、これは固有値の比のみに依存し、個々の値には依存しません。R は、固有値が互いに等しいときに最小になります。したがって、 2 つの固有値の絶対差が大きいほど、つまり D の 2 つの主曲率の絶対差が大きいほど、R の値は高くなります。したがって、あるしきい値の固有値比 に対して、候補キーポイントの R が より大きい場合、そのキーポイントは適切にローカライズされていないため、拒否されます。新しいアプローチでは を使用します。[2]
エッジでの応答を抑制するためのこの処理ステップは、コーナー検出のためのハリス演算子の対応するアプローチを転用したものです。違いは、閾値設定の尺度が2次モーメント行列ではなくヘッセ行列から計算されることです。
オリエンテーションの割り当て
このステップでは、各キーポイントに、ローカル画像勾配方向に基づいて 1 つ以上の方向が割り当てられます。キーポイント記述子はこの方向を基準に表現できるため、画像の回転に対する不変性を実現でき、これが回転に対する不変性を実現する ための重要なステップとなります。
まず、キーポイントのスケールでガウス平滑化画像が取得され、すべての計算がスケール不変の方法で実行されます。スケールの画像サンプルの場合、勾配の大きさ、および方向、はピクセル差を使用して事前に計算されます。
勾配の大きさと方向の計算は、ガウスぼかし画像 L 内のキーポイントの周囲の隣接領域にあるすべてのピクセルに対して行われます。36 のビンを持つ方向ヒストグラムが形成され、各ビンは 10 度をカバーします。ヒストグラム ビンに追加された隣接ウィンドウの各サンプルは、勾配の大きさと、キーポイントのスケールの 1.5 倍のガウス重み付け円形ウィンドウによって重み付けされます。このヒストグラムのピークは、主要な方向に対応します。ヒストグラムが埋められると、最も高いピークと、最も高いピークの 80% 以内にあるローカル ピークに対応する方向がキーポイントに割り当てられます。複数の方向が割り当てられている場合は、追加の方向ごとに、元のキーポイントと同じ場所とスケールを持つ追加のキーポイントが作成されます。
キーポイント記述子
前の手順では、特定のスケールでキーポイントの位置を見つけ、それらに方向を割り当てました。これにより、画像の位置、スケール、回転に対する不変性が確保されました。次に、各キーポイントの記述子ベクトルを計算します。記述子は、非常に特徴的で、照明、3D 視点などの残りの変動に対して部分的に不変です。この手順は、キーポイントのスケールに最も近いスケールの画像に対して実行されます。
まず、それぞれ 8 つのビンを持つ 4×4 ピクセル近傍に一連の方向ヒストグラムが作成されます。これらのヒストグラムは、キーポイントの周囲の 16×16 領域内のサンプルの大きさと方向の値から計算され、各ヒストグラムには元の近傍領域の 4×4 サブ領域からのサンプルが含まれます。画像の勾配の大きさと方向は、キーポイントの位置の周囲でサンプリングされ、キーポイントのスケールを使用して画像のガウスぼかしのレベルが選択されます。方向の不変性を実現するために、記述子の座標と勾配方向は、キーポイントの方向に対して回転されます。大きさはさらに、記述子ウィンドウの幅の半分に等しいガウス関数によって重み付けされます。記述子は、これらのヒストグラムのすべての値のベクトルになります。それぞれ 8 つのビンを持つ 4 × 4 = 16 のヒストグラムがあるため、ベクトルには 128 の要素があります。このベクトルは、照明のアフィン変化に対する不変性を高めるために、単位長さに正規化されます。非線形照明の影響を減らすために、0.2 のしきい値が適用され、ベクトルが再び正規化されます。クランプとも呼ばれるしきい値設定プロセスは、非線形照明効果が存在しない場合でも、マッチング結果を改善できます。[18] 0.2 のしきい値は経験的に選択されたもので、固定しきい値を体系的に計算されたしきい値に置き換えることで、マッチング結果を改善できます。[18]
記述子の次元、すなわち 128 は高いように見えますが、これより低い次元の記述子は、さまざまなマッチング タスク[2]でそれほど優れたパフォーマンスを発揮せず、最近傍を見つけるために使用される近似 BBF (下記参照) 法のため、計算コストは低いままです。記述子が長くなるほどパフォーマンスは向上しますが、それほど大きな差はなく、歪みや遮蔽に対する感度が高くなるという追加の危険性があります。また、最大 50 度の視点の変更に対して、特徴のマッチング精度が 50% を超えることも示されています。したがって、SIFT 記述子は、小さなアフィン変化に対して不変です。SIFT 記述子の独自性をテストするために、テスト データベース内のさまざまな数のキーポイントに対してもマッチング精度が測定され、データベース サイズが非常に大きい場合でもマッチング精度がわずかに低下することが示され、SIFT の特徴が非常に独自性が高いことが示されています。
SIFT 特徴と他の局所特徴の比較
SIFTを含むさまざまな局所記述子の性能評価については、さまざまな検出器を使用して広範な研究が行われてきました。[19]主な結果を以下にまとめます。
- SIFT および SIFT のようなGLOH機能は、50 度のアフィン変換に対して最高のマッチング精度 (リコール率) を示します。この変換制限を超えると、結果は信頼できなくなり始めます。
- 記述子の特異性は、記述子の分散によって正規化された記述子の主成分分析によって得られた記述子の固有値を合計することによって測定されます。これは、さまざまな記述子によって捕捉された分散の量、つまりそれらの特異性に対応します。PCA-SIFT (SIFT 記述子に適用される主成分分析)、GLOH、および SIFT 機能は、最高の値を示します。
- SIFT ベースの記述子は、テクスチャ付きシーンと構造化シーンの両方で他の最新のローカル記述子よりも優れていますが、テクスチャ付きシーンではパフォーマンスの差が大きくなります。
- 2~2.5 の範囲のスケール変更と 30~45 度の範囲の画像回転の場合、SIFT および SIFT ベースの記述子は、テクスチャ付きおよび構造化されたシーン コンテンツの両方において、他の最新のローカル記述子よりも優れたパフォーマンスを発揮します。
- ぼかしの導入は、すべてのローカル記述子、特に形状コンテキストなどのエッジに基づく記述子に影響します。これは、強いぼかしの場合はエッジが消えるためです。しかし、GLOH、PCA-SIFT、SIFT は、依然として他のものよりも優れたパフォーマンスを発揮しました。これは、照明が変化する場合の評価にも当てはまります。
実施された評価では、領域ベースの SIFT ベースの記述子が最も堅牢かつ特徴的であり、したがって特徴マッチングに最適であることが強く示唆されています。ただし、SURFなどの最新の特徴記述子は、この研究では評価されていません。
SURFはその後、SIFTと同等の性能を持ちながら、はるかに高速であることが示されました。[20]他の研究では、速度が重要でない場合は、SIFTがSURFよりも優れていると結論付けています。[21] [22]具体的には、離散化の影響を無視すると、SIFTの純粋な画像記述子はSURFの純粋な画像記述子よりも大幅に優れていますが、SURFの純粋な関心点検出器の基礎となるヘッセ行列式のスケールスペース極値は、SIFTの関心点検出器が数値近似を構成するラプラシアンのスケールスペース極値と比較して、大幅に優れた関心点を構成します。[21]
SIFT記述子による画像マッチングの性能は、元のSIFTのガウス差演算子のスケール空間極値をヘッセ行列式のスケール空間極値に置き換えることによって、より高い効率スコアとより低い1精度スコアを達成するという意味で改善することができる。または、より一般的には、一般化されたスケール空間の関心点のより一般的な族を考慮する。[21]
最近、不規則なヒストグラムグリッドを採用した記述子のわずかなバリエーションが提案され、その性能が大幅に向上しました。[23]ヒストグラムビンの4×4グリッドを使用する代わりに、すべてのビンが特徴の中心まで拡張されます。これにより、スケールの変化に対する記述子の堅牢性が向上します。
SIFT-Rank [24]記述子は、アフィン特徴マッチングにおける標準SIFT記述子の性能を向上させることが示されています。SIFT-Rank記述子は、各ヒストグラムビンをソートされたビン配列内のそのランクに設定することにより、標準SIFT記述子から生成されます。SIFT-Rank記述子間のユークリッド距離は、ヒストグラムビン値の任意の単調な変化に対して不変であり、スピアマンの順位相関係数と関連しています。
アプリケーション
SIFT特徴を用いた物体認識
SIFT は、位置、スケール、回転に対して不変で、アフィン変換(スケール、回転、せん断、位置の変化) や照明の変化に対して堅牢な特徴的なキーポイントを見つけることができるため、物体認識に使用できます。手順は以下のとおりです。
- まず、上記のアルゴリズムを使用して入力画像から SIFT 特徴を取得します。
- これらの特徴は、トレーニング画像から取得された SIFT 特徴データベースと照合されます。この特徴照合は、ユークリッド距離に基づく最近傍アプローチによって行われます。堅牢性を高めるために、最近傍距離と 2 番目に近い近傍距離の比率が 0.8 より大きいキーポイントについては、照合が拒否されます。これにより、背景の乱雑さから生じる誤った照合の多くが破棄されます。最後に、ユークリッド距離に基づく最近傍を見つけるために必要なコストのかかる検索を回避するために、ベスト ビン ファースト アルゴリズムと呼ばれる近似アルゴリズムが使用されます。[14]これは、最近傍を高い確率で返す高速な方法で、最近傍 (対象) を 95% の時間で見つけながら 1000 倍のスピードアップを実現できます。
- 上で説明した距離比テストでは、背景の乱雑さから生じる誤った一致の多くが破棄されますが、異なるオブジェクトに属する一致はまだあります。したがって、オブジェクト識別の堅牢性を高めるには、同じオブジェクトに属する特徴をクラスタリングし、クラスタリング プロセスで除外された一致を拒否する必要があります。これは、ハフ変換を使用して行われます。これにより、同じオブジェクト ポーズに投票する特徴のクラスターが識別されます。特徴のクラスターがオブジェクトの同じポーズに投票していることが判明した場合、解釈が正しい可能性は、単一の特徴の場合よりもはるかに高くなります。各キーポイントは、キーポイントの位置、スケール、および方向と一致するオブジェクト ポーズのセットに投票します。少なくとも 3 票を蓄積したビンは、候補オブジェクト/ポーズ一致として識別されます。
- 各候補クラスターについて、トレーニング画像と入力画像を関連付ける最も推定されるアフィン投影パラメータの最小二乗解が得られます。これらのパラメータによるキーポイントの投影が、ハフ変換ビンのパラメータに使用されたエラー範囲の半分以内にある場合、キーポイントの一致は保持されます。ビンの外れ値を破棄した後に残っているポイントが 3 個未満の場合、オブジェクトの一致は拒否されます。最小二乗フィッティングは、拒否されなくなるまで繰り返されます。アフィン モデルは 3D オブジェクトに対して正確ではなくなるため、これは 3D オブジェクト認識よりも平面表面認識に適しています。
- このジャーナルでは、[25]の著者らがSIFT記述子を複数の物体検出の目的で使用する新しいアプローチを提案した。提案された複数の物体検出アプローチは航空写真と衛星画像でテストされている。
SIFT 機能は、基本的に、画像間の一致する場所の識別を必要とするあらゆるタスクに適用できます。2D 画像内の特定のオブジェクト カテゴリの認識、3D 再構成、モーション トラッキングとセグメンテーション、ロボットの位置特定、画像パノラマ ステッチング、エピポーラキャリブレーションなどのアプリケーションに関する研究が行われています。これらのいくつかについては、以下で詳しく説明します。
ロボットの位置特定とマッピング
このアプリケーションでは、[26]三眼ステレオシステムを使用して、キーポイントの位置の 3D 推定値を決定します。キーポイントは、3 つの画像すべてに一貫した視差で表示される場合にのみ使用され、外れ値は非常に少なくなります。ロボットが移動すると、既存の 3D マップに対する特徴の一致を使用して自己位置を特定し、次にカルマンフィルターを使用して 3D 位置を更新しながら、マップに特徴を段階的に追加します。これにより、未知の環境でのロボットの位置特定問題に対する堅牢で正確なソリューションが提供されます。最近の 3D ソルバーは、キーポイントの方向を使用して、3 つのキーポイントから三眼ジオメトリを解決し[27]、2 つのキーポイントのみから絶対姿勢を解決します。これは、SIFT で利用できる、しばしば無視されるが有用な測定値です[28]。これらの方向測定により、必要な対応の数が減り、堅牢性がさらに指数関数的に向上します。
パノラマステッチ
SIFT 特徴マッチングは、非パノラマ画像から完全に自動化されたパノラマ再構成のための画像ステッチングに使用できます。入力画像から抽出された SIFT 特徴は、各特徴についてk 個の最近傍を見つけるために互いにマッチングされます。次に、これらの対応関係を使用して、各画像についてm個の候補マッチング画像を見つけます。次に、 RANSACを使用して画像ペア間のホモグラフィを計算し、検証に確率モデルを使用します。入力画像に制限がないため、グラフ検索を適用して、各接続コンポーネントがパノラマに対応するように、画像マッチの接続コンポーネントを見つけます。最後に、各接続コンポーネントに対してバンドル調整を実行して結合カメラ パラメーターを解決し、マルチバンド ブレンディングを使用してパノラマをレンダリングします。パノラマ ステッチングに対する SIFT にヒントを得たオブジェクト認識アプローチのため、結果として得られるシステムは、画像の順序、方向、スケール、および照明の影響を受けません。入力画像には複数のパノラマ画像やノイズ画像(合成画像の一部ではないものもある)が含まれる場合があり、パノラマシーケンスが認識され、出力としてレンダリングされます。[29]
3Dシーンモデリング、認識、追跡
このアプリケーションは、正確なポーズを持つ合成オブジェクトが実際の画像に重ね合わされる、拡張現実のコンテキストでの3D オブジェクト認識と3D モデリングに SIFT 特徴を使用します。SIFT マッチングは、さまざまな角度から撮影されたシーンまたはオブジェクトの多数の 2D 画像に対して行われます。これは、必須マトリックスまたは三焦点テンソルから初期化されたバンドル調整とともに使用され、表示されたシーンのスパース 3D モデルを構築し、同時にカメラのポーズとキャリブレーションパラメーターを復元します。次に、仮想オブジェクトの位置、方向、およびサイズは、復元されたモデルの座標フレームを基準にして定義されます。オンラインマッチ移動の場合、SIFT 特徴は現在のビデオ フレームから再度抽出され、ワールド モデルに対して既に計算されている特徴とマッチングされ、2D から 3D への対応のセットが生成されます。これらの対応は、仮想投影と最終レンダリングの現在のカメラのポーズを計算するために使用されます。正規化手法を使用して、仮想投影のジッターを削減します。[30] SIFT方向の使用もこのプロセスの堅牢性を高めるために使用されています。[27] [28] SIFTの3D拡張も、真の3Dオブジェクトの認識と検索 のために評価されています。[31] [32]
人間の行動認識のための 3D SIFT のような記述子
ビデオシーケンスにおける人間の動作認識のコンテキストで、SIFT記述子を2+1次元の時空間データに拡張することが研究されてきた。[31] [33] [34] [35] 2D SIFTアルゴリズムにおける局所的な位置依存ヒストグラムの計算は、時空間ドメインにおけるSIFTの特徴を記述するために2次元から3次元に拡張されている。ビデオシーケンスにおける人間の動作認識への応用では、トレーニングビデオのサンプリングは、時空間の関心ポイントで、またはランダムに決定された場所、時間、スケールで実行される。次に、これらの関心ポイントの周囲の時空間領域は、3D SIFT記述子を使用して記述される。次に、これらの記述子はクラスター化されて時空間のBag of wordsモデルが形成される。次に、テストビデオから抽出された3D SIFT記述子がこれらの単語と照合され、人間の動作が分類される。
著者らは、単純な2D SIFT記述子やGradient Magnitudeなどの他のアプローチよりも、3D SIFT記述子アプローチの方がはるかに優れた結果を報告している。[36]
3D磁気共鳴画像による人間の脳の分析
特徴ベース形態計測(FBM)技術[37]は、ガウススケール空間の差の極値を使用して、人間の脳の3D磁気共鳴画像(MRI)を分析および分類します。FBMは、画像の形状とグループラベル(健康な被験者とアルツハイマー病(AD)の被験者など)を条件として、独立した特徴のコラージュとして画像を確率的にモデル化します。特徴は、最初にガウススケール空間の4D差から個々の画像で抽出され、次に画像セット全体の外観、形状、およびグループ共起統計の観点からモデル化されます。FBMは、人間の脳の約200の体積MRIセットを使用したADの分析で検証され、脳内のADの確立された指標を自動的に識別し、新しい画像で軽度のADを80%の割合で分類しました。[37]
競合方法
乱雑な環境や部分的な遮蔽環境下でスケール不変の物体認識を行うための代替方法としては、以下のものがあります。
RIFT [38]はSIFTの回転不変な一般化です。RIFT記述子は、等幅の同心円に分割された円形の正規化パッチを使用して構築され、各リング内で勾配方向ヒストグラムが計算されます。回転不変性を維持するために、中心から外側を指す方向を基準として各ポイントで方向が測定されます。
RootSIFT [39]は、記述子の正規化を修正した SIFT の変種である。SIFT 記述子はヒストグラムであるため(確率分布も同様)、ユークリッド距離ではそれらの類似性を正確に測定できない。より優れた類似性測定基準は、確率分布に合わせたもの、例えばBhattacharyya 係数(Hellinger カーネルとも呼ばれる)である。この目的のために、最初に -正規化された記述子を-正規化し、各要素の平方根を計算してから、-再正規化を行う。これらの代数操作の後、RootSIFT 記述子はユークリッド距離を使用して通常どおり比較することができ、これは元の SIFT 記述子に Hellinger カーネルを使用するのと同等である。「L1-sqrt」と呼ばれるこの正規化方式は、以前、長方形ブロック配置記述子変種(R-HOG)が概念的に SIFT 記述子に類似しているHOG特徴のブロック正規化のために導入された。
G-RIF: [40]一般化ロバスト不変特徴は、エッジの方向、エッジの密度、色相情報を、知覚情報と空間エンコーディングを組み合わせた統一された形式でエンコードする一般的なコンテキスト記述子です。オブジェクト認識スキームは、隣接するコンテキストに基づく投票を使用してオブジェクトモデルを推定します。
「SURF : [41]高速化された堅牢な特徴」は、スケールおよび回転不変の高性能な関心点検出器/記述子であり、再現性、識別性、堅牢性に関して、以前に提案された方式に近いか、さらにはそれを上回ると主張されています。SURF は、計算時間を短縮するために画像畳み込みに積分画像を使用し、主要な既存の検出器と記述子の長所を活用しています (検出器には高速ヘッセ行列ベースの尺度、分布ベースの記述子を使用)。関心点の近傍内のHaar ウェーブレット応答の分布を記述します。積分画像は速度のために使用され、64 次元のみが使用されるため、特徴の計算とマッチングにかかる時間が短縮されます。インデックス作成ステップはラプラシアンの符号に基づいており、マッチング速度と記述子の堅牢性が向上します。
PCA-SIFT [42]とGLOH [19]は SIFT のバリエーションです。PCA-SIFT 記述子は、サポート領域内で計算された x 方向と y 方向の画像勾配のベクトルです。勾配領域は 39×39 の場所でサンプリングされるため、ベクトルの次元は 3042 です。次元はPCAによって 36 に削減されます。勾配位置方向ヒストグラム ( GLOH ) は、SIFT 記述子の堅牢性と独自性を高めるために設計された拡張版です。SIFT 記述子は、半径方向に 3 つのビン (半径は 6、11、15 に設定)、角度方向に 8 つのビンを持つ対数極位置グリッドに対して計算され、結果として 17 の位置ビンになります。中央のビンは角度方向に分割されません。勾配方向は 16 のビンに量子化され、272 ビンのヒストグラムになります。PCAの共分散行列は、さまざまな画像から収集された画像パッチで推定されます。説明には、 最大 128 個の固有ベクトルが使用されます。
Gauss-SIFT [21]は、SIFT の純粋画像記述子の基礎となるすべての画像測定を、通常の SIFT で行われる画像ピラミッドの微分近似ではなく、ガウス微分応答によって実行することによって定義される純粋画像記述子です。このようにして、空間とスケールに対する離散化の影響を最小限に抑えることができ、潜在的に精度の高い画像記述子が可能になります。Lindeberg (2015) [21]では、このような純粋 Gauss-SIFT 画像記述子が、ガウス のラプラシアン、ヘッシアン の行列式、4 つの新しい符号なしまたは符号付きヘッシアン特徴強度測度、およびHarris-LaplaceとShi-and-Tomasiの関心点で構成される一般化スケール空間関心点のセットと組み合わせられました。 12 枚のポスターの複数のビューを最大 6 倍のスケーリング変換と最大 45 度の傾斜角の視線方向の変化で含むポスター データセットに対する広範な実験評価では、ガウス関心点のラプラシアンをヘッシアン関心点の行列式に置き換えることで、画像マッチングのパフォーマンスが大幅に向上 (効率スコアの向上と 1精度スコアの低下) することが示されました。ガウス差関心点はガウス差関心点のラプラシアンの数値近似を構成するため、SIFT のガウス差関心点をヘッシアン関心点の行列式に置き換えることで、マッチング パフォーマンスが大幅に向上する可能性があることがわかります。さらに、符号なしヘッシアン特徴強度尺度を考慮すると、パフォーマンスをさらに向上できます。 Gauss-SIFT 記述子と対応する Gauss-SURF 記述子の定量的な比較でも、多数の異なるスケール空間関心点検出器に対して、Gauss-SIFT が Gauss-SURF よりも一般に大幅に優れたパフォーマンスを発揮することが示されました。したがって、この研究では、離散化の影響を無視すると、SIFT の純粋な画像記述子は SURF の純粋な画像記述子よりも大幅に優れている一方で、ヘッセ行列式のスケール空間極値への数値近似と見なすことができる SURF の基礎となる関心点検出器は、SIFT の基礎となる関心点検出器よりも大幅に優れていることが示されています。
Wagnerらは、現在の携帯電話の限界を考慮して特別に設計された2つの物体認識アルゴリズムを開発した。[43]古典的なSIFTアプローチとは対照的に、Wagnerらは特徴検出にFASTコーナー検出器を使用している。このアルゴリズムは、異なるスケールレベルで特徴が作成されるオフライン準備フェーズと、携帯電話のカメラ画像の現在の固定スケールレベルでのみ特徴が作成されるオンラインフェーズも区別している。さらに、特徴は15×15ピクセルの固定パッチサイズから作成され、わずか36次元のSIFT記述子を形成します。このアプローチは、認識パイプラインにスケーラブル語彙ツリーを統合することでさらに拡張されています。[44]これにより、携帯電話でより多くの物体を効率的に認識できるようになります。このアプローチは、主に使用可能なRAMの量によって制限されます。
KAZEとA-KAZE (KAZE特徴とAccelerated-Kaze特徴)は、SIFTやSURFに比べて優れた性能を持つ新しい2D特徴検出および記述方法です。オープンソースコードのため、非常に人気があります。KAZEはもともとPablo F. Alcantarilla、Adrien Bartoli、Andrew J. Davisonによって作成されました。[45]
参照
参考文献
- ^ abcd Lowe, David G. (1999). 「局所スケール不変特徴からの物体認識」(PDF) .国際コンピュータビジョン会議議事録. 第 2 巻 . pp. 1150–1157. doi :10.1109/ICCV.1999.790410.
- ^ abcdef Lowe, David G. (2004). 「スケール不変キーポイントからの識別画像特徴」. International Journal of Computer Vision . 60 (2): 91–110. CiteSeerX 10.1.1.73.2924 . doi :10.1023/B:VISI.0000029664.99615.94. S2CID 221242327.
- ^ ab 米国特許 6,711,293、「画像内のスケール不変特徴を識別する方法および装置、ならびに画像内の物体の位置を特定するためのその使用」、David Lowe の SIFT アルゴリズムの特許、2004 年 3 月 23 日
- ^ Koenderink, Jan および van Doorn, Ans: 「視覚システムにおける局所幾何学の表現」、 Wayback Machineで 2019-08-02 にアーカイブ済み、Biological Cybernetics、vol 3、pp 383-396、1987
- ^ Koenderink、Jan および van Doorn、Ans:「Generic Neighborhood Operators」、パターン分析とマシン インテリジェンスに関する IEEE トランザクション、第 14 巻、597-605 ページ、1992
- ^ Lindeberg, Tony (2013年12月). 「視覚受容野の計算理論」.生物サイバネティクス. 107 (6): 589–635. doi : 10.1007/s00422-013-0569-z. PMC 3840297. PMID 24197240.
- ^ リンデバーグ、トニー (2013)。一般化された公理的スケールスペース理論。イメージングと電子物理学の進歩。第 178 巻。pp. 1–96。doi : 10.1016/ b978-0-12-407701-0.00001-7。ISBN 978-0-12-407701-0。
- ^ Lindeberg, Tony (2013年7月19日). 「受容野レベルでの視覚操作の不変性」. PLOS ONE . 8 (7): e66990. arXiv : 1210.0754 . Bibcode :2013PLoSO...866990L. doi : 10.1371/journal.pone.0066990 . PMC 3716821. PMID 23894283 .
- ^ ab T. Lindeberg (2014)「スケール選択」、Computer Vision: リファレンスガイド、(K. Ikeuchi 編)、Springer、701-713 ページ。
- ^ ab Lindeberg, T., コンピュータビジョンにおけるスケールスペース理論、Kluwer Academic Publishers、1994年、ISBN 0-7923-9418-6
- ^ ab Lindeberg, Tony (1998). 「自動スケール選択による特徴検出」. International Journal of Computer Vision . 30 (2): 79–116. doi :10.1023/A:1008045108935. S2CID 723210.
- ^ ab Lindeberg, Tony (2012). 「スケール不変特徴変換」. Scholarpedia . 7 (5): 10491. Bibcode :2012SchpJ...710491L. doi : 10.4249/scholarpedia.10491 .
- ^ Serre, T., Kouh, M., Cadieu, C., Knoblich, U., Kreiman, G., Poggio, T.、「物体認識の理論:霊長類視覚皮質の腹側視覚ストリームのフィードフォワードパスにおける計算と回路」、コンピュータサイエンスおよび人工知能研究所技術レポート、2005年12月19日 MIT-CSAIL-TR-2005-082。
- ^ ab Beis, J.; Lowe, David G. (1997). 「高次元空間での近似最近傍探索を使用した形状インデックス作成」(PDF)。コンピュータビジョンとパターン認識に関する会議、プエルトリコ: sn。pp. 1000–1006。doi : 10.1109/CVPR.1997.609451。
- ^ Lowe, DG、「3D オブジェクト認識のためのローカル特徴ビュー クラスタリング」、IEEE コンピュータ ビジョンおよびパターン認識会議、ハワイ州カウアイ島、2001 年、682-688 ページ。
- ^ ab Lindeberg, Tony; Bretzner, Lars (2003). 「ハイブリッド マルチスケール表現におけるリアルタイム スケール選択」。 コンピュータ ビジョンにおけるスケール スペース法。 コンピュータ サイエンスの講義ノート。 Vol. 2695。 pp. 148–163。doi :10.1007/3-540-44935-3_11。ISBN 978-3-540-40368-5。
- ^ Lars Bretzner、Ivan Laptev、Tony Lindeberg「マルチスケールカラー特徴、階層モデル、粒子フィルタリングを使用したハンドジェスチャ認識」、第 5 回 IEEE 国際自動顔・ジェスチャ認識会議議事録、ワシントン DC、米国、2002 年 5 月 21 日~21 日、423~428 ページ。ISBN 0-7695-1602-5、doi : 10.1109 /AFGR.2002.1004190
- ^ ab Kirchner、Matthew R.「SIFT記述子の自動しきい値設定」画像処理(ICIP)、2016 IEEE国際会議、pp. 291-295。IEEE、2016年。
- ^ ab Mikolajczyk, K.; Schmid, C. (2005). 「ローカル記述子のパフォーマンス評価」(PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 27 (10): 1615–1630. CiteSeerX 10.1.1.230.255 . doi :10.1109/TPAMI.2005.188. PMID 16237996. S2CID 2572455.
- ^ 「TU-chemnitz.de」(PDF) .
- ^ abcde Lindeberg, Tony (2015 年 5 月 1 日). 「一般化されたスケール空間関心点を使用した画像マッチング」. Journal of Mathematical Imaging and Vision . 52 (1): 3–36. Bibcode :2015JMIV...52....3L. doi : 10.1007/s10851-014-0541-0 . S2CID 254657377.
- ^ Edouard Oyallon、Julien Rabin、「SURF メソッドの分析と実装、および SIFT との比較」、Image Processing On Line
- ^ Cui, Y.; Hasler, N.; Thormaehlen, T.; Seidel, H.-P. (2009 年 7 月)。「不規則な方向のヒストグラム ビニングによるスケール不変特徴変換」(PDF)。国際画像分析認識会議 (ICIAR 2009) の議事録。ハリファックス、カナダ: Springer。2010年 9 月 23 日のオリジナル(PDF)からアーカイブ。2009年 4 月 8 日に取得。
- ^ Matthew Toews、William M. Wells III (2009)。「SIFT-Rank: 不変特徴対応の順序記述子」(PDF)。IEEE国際コンピュータビジョンおよびパターン認識会議。pp. 172–177。doi :10.1109/CVPR.2009.5206849 。
- ^ Beril Sirmacek & Cem Unsalan (2009). 「SIFT キーポイントとグラフ理論を使用した都市エリアと建物の検出」. IEEE Transactions on Geoscience and Remote Sensing . 47 (4): 1156–1167. Bibcode :2009ITGRS..47.1156S. doi :10.1109/TGRS.2008.2008440. S2CID 6629776.
- ^ Se, S.; Lowe, David G.; Little, J. (2001). 「スケール不変特徴を用いた視覚ベースの移動ロボットの位置特定とマッピング」IEEE 国際ロボット工学・オートメーション会議 (ICRA) の議事録。第 2 巻。p. 2051。doi : 10.1109/ROBOT.2001.932909。
- ^ ab ファッブリ、リカルド;ダフ、ティモシー。ファン、ホンイ。リーガン、マーガレット。デ・ピニョ、デイヴィッド。ツィガリダス、エリアス。チャールズ・ワンプラー。ハウエンシュタイン、ジョナサン。キミア、ベンジャミン。レイキン、アントン。パジドラ、トーマス(2019年3月23日)。 「点と点の線からの三焦点相対姿勢とその効率的な解決法」arXiv : 1903.09755 [cs.CV]。
- ^ ab Fabbri, Ricardo; Giblin, Peter; Kimia, Benjamin (2012). 「一次曲線微分幾何学を用いたカメラ姿勢推定」。コンピュータビジョン – ECCV 2012 (PDF)。コンピュータサイエンスの講義ノート。第 7575 巻。pp. 231–244。doi : 10.1007 / 978-3-642-33765-9_17。ISBN 978-3-642-33764-2. S2CID 15402824。
- ^ Brown, M.; Lowe, David G. (2003). 「パノラマの認識」(PDF) .第 9 回 IEEE 国際コンピュータビジョン会議の議事録。第 2 巻。pp. 1218–1225。doi : 10.1109 /ICCV.2003.1238630。
- ^ Iryna Gordon および David G. Lowe、「What and where: 正確なポーズによる 3D オブジェクト認識」、Toward Category-Level Object Recognition (Springer-Verlag、2006 年)、67-82 ページ
- ^ ab Flitton, G.; Breckon, T. ( 2010). 「複雑な CT ボリュームでの 3D SIFT を使用した物体認識」(PDF)。英国マシンビジョン会議の議事録。pp. 11.1–12。doi : 10.5244/C.24.11 (2024-11-21 非アクティブ)。
{{cite conference}}: CS1 maint: DOI inactive as of November 2024 (link) - ^ Flitton, GT, Breckon, TP, Megherbi, N. (2013). 「複雑なCT画像における空港手荷物オブジェクト検出への応用による3D関心点記述子の比較」.パターン認識. 46 (9): 2420–2436. Bibcode :2013PatRe..46.2420F. doi :10.1016/j.patcog.2013.02.008. hdl : 1826/15213 .
{{cite journal}}: CS1 maint: multiple names: authors list (link) - ^ Laptev, Ivan & Lindeberg, Tony (2004). 「時空間認識のための局所記述子」。ECCV'04視覚運動解析のための空間コヒーレンスに関するワークショップ、Springer Lecture Notes in Computer Science、第 3667 巻。pp. 91–103。CiteSeerX 10.1.1.78.400。doi : 10.1007 /11676959_8。
- ^ Ivan Laptev、Barbara Caputo、Christian Schuldt、Tony Lindeberg ( 2007)。「時空間認識のための局所速度適応モーションイベント」。コンピュータビジョンと画像理解。108 (3): 207–229。CiteSeerX 10.1.1.168.5780。doi :10.1016/ j.cviu.2006.11.023。
{{cite journal}}: CS1 maint: multiple names: authors list (link) - ^ Scovanner, Paul; Ali, S; Shah, M (2007). 「3次元ふるい分け記述子と動作認識へのその応用」。第15回国際マルチメディア会議の議事録。pp. 357–360。doi : 10.1145 /1291233.1291311。
- ^ Niebles, JC Wang, H. および Li, Fei-Fei (2006)。「空間的・時間的単語を用いた人間の行動カテゴリーの教師なし学習」。英国マシンビジョンカンファレンス (BMVC) の議事録。エディンバラ。2008 年 7 月 5 日のオリジナルからアーカイブ。2008年 8 月 20 日に取得。
{{cite conference}}: CS1 maint: multiple names: authors list (link) - ^ ab Matthew Toews; William M. Wells III; D. Louis Collins; Tal Arbel (2010). 「特徴ベースの形態測定:グループ関連の解剖学的パターンの発見」(PDF) . NeuroImage . 49 (3): 2318–2327. doi :10.1016/j.neuroimage.2009.10.032. PMC 4321966 . PMID 19853047.
- ^ Lazebnik, S.、Schmid, C.、および Ponce, J.、「物体認識のための半局所アフィン部分」、British Machine Vision Conference の議事録、2004 年。
- ^ Arandjelović, Relja; Zisserman, Andrew (2012). 「オブジェクト検索を改善するために誰もが知っておくべき 3 つのこと」。2012 IEEE コンピューター ビジョンおよびパターン認識会議。pp. 2911–2918。doi : 10.1109 /CVPR.2012.6248018。
- ^ Sungho Kim、Kuk-Jin Yoon、In So Kweon、「一般化された堅牢な不変特徴とゲシュタルトの近接性と類似性の法則を使用した物体認識」、コンピュータビジョンとパターン認識に関する会議ワークショップ (CVPRW'06)、2006 年
- ^ Bay, H.、Tuytelaars, T.、Van Gool, L.、「SURF: 高速化された堅牢な機能」、第 9 回ヨーロッパ コンピュータ ビジョン会議の議事録、2006 年 5 月。
- ^ Ke, Y.、および Sukthankar, R.、「PCA-SIFT: ローカル画像記述子のより特徴的な表現」、Computer Vision and Pattern Recognition、2004 年。
- ^ D. Wagner、G. Reitmayr、A. Mulloni、T. Drummond、および D. Schmalstieg、「携帯電話での自然な特徴からのポーズ追跡」、Wayback Machineに 2009-06-12 にアーカイブ済み、「混合および拡張現実に関する国際シンポジウムの議事録」、2008 年。
- ^ N. Henze、T. Schinke、および S. Boll、「What is That? 携帯電話での自然な特徴からの物体認識」現実世界とのモバイルインタラクションに関するワークショップの議事録、2009 年。
- ^ 「kaze」. www.robesafe.com .
外部リンク
関連研究:
- Wang, YuanBin; Bin, Zhang; Ge , Yu ( 2008). 「点集合の3Dから2Dへの投影の不変関係」。パターン認識研究ジャーナル。3 (1): 14–23。doi :10.13176/11.26 (2024年12月3日非アクティブ)。
{{cite journal}}: CS1 maint: DOI inactive as of December 2024 (link) - Lowe, David G. (2004年11月)。「スケール不変キーポイントからの独特な画像特徴」。International Journal of Computer Vision。60 ( 2): 91–110。doi :10.1023/B:VISI.0000029664.99615.94。
- Mikolajczyk, K.; Schmid, C. (2005 年 10 月)。「ローカル記述子のパフォーマンス評価」。IEEE Transactions on Pattern Analysis and Machine Intelligence。27 ( 10): 1615–1630。doi :10.1109/TPAMI.2005.188。PMID 16237996 。
- アンドレア・マリセラ・プラザ・コルデロ、ホルヘ・ルイス・ザンブラノ・マルティネス、「Estudio y Selección de las Técnicas SIFT、SURF y ASIFT de Reconocimiento de Imágenes para el Diseño de un Prototipo en Dispositivos Móviles」、15 度 Concurso de Trabajos Estudiantiles、EST 2012
- 「PCA-SIFT: ローカル画像記述子のより特徴的な表現」。2020年1月26日時点のオリジナルよりアーカイブ。
- Lazebnik, S.、Schmid, C.、および Ponce, J.、「物体認識のための半局所アフィンパーツ」、BMVC、2004 年。2017 年 10 月 11 日にWayback Machineにアーカイブされました。
チュートリアル:
- Scholarpedia のスケール不変特徴変換 (SIFT)
- SIFTの簡単なステップバイステップガイド
- 「複数オブジェクト検出のためのSIFT」。2015年4月3日時点のオリジナルよりアーカイブ。
- Image Processing On Line の「SIFT 法の解剖学」では、オープンソース実装とさまざまなパラメータを試すための Web デモを使用して、アルゴリズムの各ステップを詳細に説明しています。
実装:
- Rob Hess による SIFT の実装、2012 年 11 月 21 日にアクセス
- ASIFT (アフィンSIFT): SIFTによる大規模視点マッチング、ソースコードとオンラインデモ付き
- VLFeat、C言語のオープンソースコンピュータビジョンライブラリ(MATLABへのMEXインターフェース付き)、SIFTの実装を含む
- LIP-VIREO Archived 2017-05-11 at the Wayback Machine、キーポイント特徴抽出ツールキット(Windows、Linux、SunOS用バイナリ)、SIFTの実装を含む
- (並列) C# での SIFT、Emgu CV を使用した C# での SIFT アルゴリズム、およびアルゴリズムの修正された並列バージョン。
- DoH & LoG + アフィン、SIFT ツールボックスから適応した Blob 検出器
- ezSIFT: C/C++ で簡単に使用できるスタンドアロン SIFT 実装。他のライブラリを必要としない自己完結型のオープンソース SIFT 実装。
- 3D SIFT 実装: ボリューム画像での検出とマッチング。
