Loading article…
オブジェクト認識– 画像またはビデオシーケンス内のオブジェクトを見つけて識別するためのコンピュータービジョン分野のテクノロジー。人間は、オブジェクトの画像がさまざまな視点、さまざまなサイズとスケール、さらには平行移動や回転によって多少変化する可能性があるにもかかわらず、画像内の多数のオブジェクトをほとんど苦労せずに認識します。オブジェクトは、部分的に視界から遮られても認識できます。このタスクは、コンピュータービジョンシステムにとって依然として課題です。このタスクに対する多くのアプローチが、数十年にわたって実装されてきました。
CADのようなオブジェクトモデルに基づくアプローチ
- エッジ検出
- 原始的なスケッチ
- マール、モハン、ネヴァティア[1]
- ロウ
- オリヴィエ・フォジェラス
部位による認識
- 一般化されたシリンダー (トーマス・ビンフォード)
- ジオンズ(アーヴィング・ビーダーマン)
- ディキンソン、フォーサイス、ポンセ
外観に基づく方法
- 認識を実行するために、オブジェクトのサンプル画像(テンプレートまたはサンプルと呼ばれる)を使用する
- さまざまな条件下では、オブジェクトの外観が異なります。
- 照明や色の変化
- 視線方向の変化
- 大きさや形の変化
- 単一の例が確実に成功する可能性は低いです。ただし、オブジェクトのすべての外観を表現することは不可能です。
エッジマッチング
- Canny エッジ検出などのエッジ検出技術を使用してエッジを見つけます。
- 照明や色の変化は通常、画像のエッジにはあまり影響しません。
- 戦略:
- テンプレートと画像のエッジを検出する
- エッジ画像を比較してテンプレートを見つける
- 可能なテンプレート位置の範囲を考慮する必要がある
- 寸法:
- 良い – 重なり合うエッジの数を数える。形状の変化に対して堅牢ではない
- より良い方法 – 検索画像内のエッジから一定の距離にあるテンプレートエッジピクセルの数を数える
- ベスト – 検索画像内の最も近いエッジまでの距離の確率分布を決定します(テンプレートが正しい位置にある場合)。各テンプレート位置が画像を生成する可能性を推定します。
分割統治法による検索
- 戦略:
- すべてのポジションをセット(ポジション空間内のセル)として考える
- セル内の最適な位置でのスコアの下限を決定する
- 境界が大きすぎる場合はセルを整理する
- 境界が大きすぎない場合は、セルをサブセルに分割し、各サブセルを再帰的に試します。
- 細胞が「十分に小さくなる」とプロセスは停止します
- マルチ解像度検索とは異なり、この手法では、基準を満たすすべての一致が確実に見つかる(下限が正確であると仮定)
- 境界を見つける:
- 最高スコアの下限値を見つけるには、セルの中心で表されるテンプレートの位置のスコアを確認します。
- セル内の他の位置(セルの角で発生)の「中心」位置からの最大変化を減算します。
- 距離の境界を決定すると複雑さが生じる[要出典]
グレースケールマッチング
- エッジは(ほとんど)照明の変化に対して堅牢ですが、多くの情報を失ってしまいます。
- ピクセル位置とピクセル強度の両方の関数としてピクセル距離を計算する必要がある
- 色にも適用可能
グラデーションマッチング
- 情報をあまり失わずに照明の変化に強いもう一つの方法は、画像の勾配を比較することである。
- マッチングはグレースケール画像のマッチングと同様に実行されます
- シンプルな代替案: (正規化された)相関関係を使用する
受容野反応のヒストグラム
- 明示的な点の対応を避ける
- 受容野反応に暗黙的にコード化された異なる画像点間の関係
- スウェインとバラード(1991)、[2]シーレとクロウリー(2000)、[3]リンデとリンデバーグ(2004、2012)[4] [5]
大規模なモデルベース
- 特定の画像をデータベースから効率的に検索する1つの方法は、テンプレートの固有ベクトル(固有顔と呼ばれる)を使用することです。
- モデルベースは、認識されるべきオブジェクトの幾何学的モデルの集合である。
特徴ベースの方法
- 検索は、オブジェクトの特徴と画像の特徴の間の実現可能な一致を見つけるために使用されます。
- 主な制約は、オブジェクトの単一の位置がすべての可能な一致を説明する必要があることです。
- 認識するオブジェクトや検索する画像から
特徴を抽出する方法。
- 表面パッチ
- コーナー
- 直線エッジ
解釈ツリー
- 実行可能な一致を検索する方法は、ツリーを検索することです。
- ツリー内の各ノードは一致のセットを表します。
- ルートノードは空集合を表す
- 他の各ノードは、親ノード内の一致と 1 つの追加一致の結合です。
- ワイルドカードは一致しない特徴に使用されます
- 一致セットが実行不可能な場合、ノードは「剪定」されます。
- 剪定されたノードには子ノードがない
- 歴史的に重要であり、現在でも使用されているが、あまり一般的ではない
仮説を立ててテストする
- 一般的な考え方:
- 画像特徴の集合と物体特徴の集合との間の対応関係を仮定する
- 次にこれを使用して、オブジェクト座標フレームから画像フレームへの投影に関する仮説を生成します。
- この投影仮説を使用して、オブジェクトのレンダリングを生成します。このステップは通常、バックプロジェクションと呼ばれます。
- レンダリングと画像を比較し、両者が十分に類似している場合は仮説を受け入れる
- 仮説の取得:
- 仮説を生成する方法は多種多様です。
- カメラの固有パラメータがわかっている場合、仮説はオブジェクトの仮想的な位置と方向(ポーズ)に相当します。
- 幾何学的制約を活用する
- 適切なサイズの画像ポイントのサブセットごとに、オブジェクトの特徴の小さなセットの対応関係を構築します。(これらが仮説です)
- 3つの基本的なアプローチ:
- ポーズの一貫性による仮説の取得
- ポーズクラスタリングによる仮説の取得
- 不変量を用いた仮説の取得
- 経費検索も冗長だが、ランダム化やグループ化を使用して改善できる
- ランダム化
- 欠落している物体の可能性が低くなるまで、画像の特徴の小さなセットを調べる
- 画像特徴の各セットについて、モデル特徴の可能なすべての一致するセットを考慮する必要があります。
- 式:
- (1 – W c ) k = Z
- W = 「良好」な画像ポイントの割合(w ~ m/n)
- c = 必要な対応の数
- k = 試行回数
- Z = 1つ(またはそれ以上)の誤った対応を使用するすべての試行の確率
- グループ化
- 同じ物体から来ている可能性が高い点のグループを特定できれば、検証する必要がある仮説の数を減らすことができます。
- ランダム化
ポーズの一貫性
- オブジェクトが画像に揃えられるため、アライメントとも呼ばれます
- 画像特徴とモデル特徴の対応は独立していない - 幾何学的制約
- 少数の対応からオブジェクトの位置が判明する。他の対応はこれと一致していなければならない。
- 一般的な考え方:
- 十分に大きな画像特徴のグループと十分に大きなオブジェクト特徴のグループが一致すると仮定すると、この仮説から失われたカメラパラメータを回復できます(そしてオブジェクトの残りの部分をレンダリングします)。
- 戦略:
- 少数の対応関係(例:3D認識のための3つの点)を使用して仮説を生成する
- 他のモデルの特徴を画像に投影し(バックプロジェクション)、追加の対応関係を検証する
- 離散的な物体の姿勢を実現するために必要な最小限の対応関係を使用する
- 一般的な考え方:
- 各オブジェクトは、それぞれが(ほぼ)同じポーズを持つ多くの正しい対応セットにつながります。
- ポーズに投票します。各オブジェクトのポーズ空間を表すアキュムレータ配列を使用します。
- これは本質的にはハフ変換である
- 戦略:
- 各オブジェクトに対して、ポーズ空間を表す累積配列を設定します。累積配列の各要素は、ポーズ空間の「バケット」に対応します。
- 次に、各画像フレームグループを取り、各オブジェクト上の各フレームグループとそれとの対応関係を仮定します。
- これらの対応ごとに、ポーズ パラメータを決定し、ポーズ値で現在のオブジェクトの累積配列にエントリを作成します。
- いずれかのオブジェクトの累積配列に多数の投票がある場合、これはそのオブジェクトがそのポーズで存在している証拠として解釈できます。
- 証拠は検証方法を使用して確認できる
- この方法では、個々の対応ではなく、対応のセットを使用することに注意してください。
- 各セットでは、可能なオブジェクトポーズの数が少ないため、実装が簡単になります。
- 改善
- この方法のノイズ耐性は、投票が明らかに信頼できないポーズのオブジェクトの投票をカウントしないことで改善できる。
- § たとえば、オブジェクトがそのポーズにある場合、オブジェクト フレーム グループは表示されません。
- これらの改善は、実用的なシステムを生み出すのに十分である。
- カメラの変換に対して不変な幾何学的特性がある
- 平面物体の画像に対して最も簡単に開発できるが、他のケースにも適用できる。
- 幾何学的不変量を使用してオブジェクト仮説に投票するアルゴリズム
- ポーズクラスタリングに似ていますが、ポーズに投票する代わりに、ジオメトリに投票します。
- もともとは、幾何学的特徴(平面モデルの未較正アフィンビュー)をそのような特徴のデータベースと照合するために開発された技術である。
- パターンマッチング、CAD/CAM、医療画像処理に広く使用されています。
- バケツのサイズを選ぶのは難しい
- 「十分」がどの程度かは定かではありません。そのため、テーブルが詰まってしまう危険性があるかもしれません。
スケール不変特徴変換(シフト)
- オブジェクトのキーポイントはまず参照画像のセットから抽出され、データベースに保存されます。
- 新しい画像の各特徴をこのデータベースと個別に比較し、特徴ベクトルのユークリッド距離に基づいて一致する候補の特徴を見つけることによって、新しい画像内のオブジェクトが認識されます。
- ロウ(2004)[6] [7]
高速化された堅牢な機能(サーフィン)
- 堅牢な画像検出器と記述子
- 標準バージョンはSIFTよりも数倍高速であり、その作者はSIFTよりもさまざまな画像変換に対してより堅牢であると主張している。
- 近似された2D Haar ウェーブレット応答の合計に基づき、積分画像を効率的に使用しました。
- ベイら(2008)[8]
バッグオブワード表現
遺伝的アルゴリズム
遺伝的アルゴリズムは、与えられたデータセットに関する事前の知識がなくても動作し、人間の介入なしに認識手順を開発することができます。最近のプロジェクトでは、カリフォルニア工科大学のベンチマークバイク、顔、飛行機、車の画像データセットで100%の精度を達成し、魚種の画像データセットでは99.4%の精度を達成しました。[9] [10]
その他のアプローチ
- 3D物体認識と再構成[11]
- 生物学に着想を得た物体認識
- 人工ニューラルネットワークとディープラーニング、特に畳み込みニューラルネットワーク
- 文脈[12] [13]
- 明示的および暗黙的な3D オブジェクト モデル
- 高速インデックス作成[14]
- グローバルシーン表現[12]
- 勾配ヒストグラム
- 確率文法[15]
- クラス内転移学習
- 画像検索からのオブジェクト分類
- 反射率[16]
- シェーディングからの形状[17]
- テンプレートマッチング
- テクスチャ[18]
- トピックモデル[13]
- 教師なし学習
- ウィンドウベースの検出
- 変形可能な部品モデル
- ビンガム分布[19]
アプリケーション
オブジェクト認識方法には、次のような用途があります。
- 活動認識[20]
- 自動画像注釈[21] [22]
- 自動ターゲット認識
- アンドロイドアイズ - 物体認識[23]
- コンピュータ支援診断[24]
- 画像パノラマ[25]
- 画像透かし[26]
- ロボットのグローバル位置特定[27]
- 顔検出[28]
- 光学文字認識[29]
- 製造品質管理[30]
- コンテンツベースの画像検索[31]
- 物体のカウントとモニタリング[32]
- 自動駐車システム[33]
- 視覚的位置決めと追跡[34]
- ビデオ安定化[35]
- 歩行者検知
- インテリジェントスピードアシスタンス(車および他の車両)
調査
- ダニイリデスとエクランド、エデルマン。
- Roth, Peter M. & Winter, Martin (2008). 「SURVEYOFAPPEARANCE-BASED METHODS FOR OBJECT RECOGNITION」(PDF) .技術レポート. ICG-TR-01/08. 2015-09-21 にオリジナル(PDF)からアーカイブ。2016-02-26に取得。
参照
- 方向勾配のヒストグラム
- 畳み込みニューラルネットワーク
- オープンCV
- スケール不変特徴変換(SIFT)
- 物体検出
- スケール不変特徴変換と関連する物体認識方法に関する Scholarpedia の記事
- サーフィン
- テンプレートマッチング
- インテグラルチャネル機能
- リスト
注記
- ^ Rahesh Mohan & Rakamant Nevatia (1992). 「シーンのセグメンテーションと記述のための知覚組織化」(PDF) . IEEE Trans Pattern Anal Mach Intell .
- ^ Swain, Michael J.; Ballard, Dana H. (1991-11-01). 「カラーインデックス」. International Journal of Computer Vision . 7 (1): 11–32. doi :10.1007/BF00130487. ISSN 1573-1405. S2CID 8167136.
- ^ Schiele, Bernt; Crowley, James L. (2000-01-01). 「多次元受容野ヒストグラムを使用した対応のない認識」. International Journal of Computer Vision . 36 (1): 31–50. doi :10.1023/A:1008120406972. ISSN 1573-1405. S2CID 2551159.
- ^ O. Linde および T. Lindeberg「高次元の合成受容野ヒストグラムを使用した物体認識」、Proc. International Conference on Pattern Recognition (ICPR'04)、ケンブリッジ、英国 II:1-6、2004 年。
- ^ O. Linde; T. Lindeberg (2012). 「複合手がかりヒストグラムの合成: 物体認識のための受容野ベースの画像記述子の情報内容の調査」。コンピュータビジョンと画像理解。116 (4): 538–560. doi : 10.1016 /j.cviu.2011.12.003。
- ^ Lowe, DG、「スケール不変キーポイントからの識別画像特徴」、International Journal of Computer Vision、60、2、pp. 91-110、2004 年。
- ^ Lindeberg, Tony (2012). 「スケール不変特徴変換」. Scholarpedia . 7 (5): 10491. Bibcode :2012SchpJ...710491L. doi : 10.4249/scholarpedia.10491 .
- ^ Bay, Herbert; Ess, Andreas; Tuytelaars, Tinne; Van Gool, Luc (2008). 「Speeded-Up Robust Features (SURF)」.コンピュータビジョンと画像理解. 110 (3): 346–359. CiteSeerX 10.1.1.205.738 . doi :10.1016/j.cviu.2007.09.014. S2CID 14777911.
- ^ 「新しい物体認識アルゴリズムはオンザフライで学習する」Gizmag.com。2014年1月20日。 2014年1月21日閲覧。
- ^ Lillywhite, K.; Lee, DJ; Tippetts, B.; Archibald, J. (2013). 「一般的な物体認識のための特徴構築法」.パターン認識. 46 (12): 3300. Bibcode :2013PatRe..46.3300L. doi :10.1016/j.patcog.2013.06.002.
- ^ Brown, Matthew、および David G. Lowe。「順序付けられていないデータセットでの教師なし 3D オブジェクトの認識と再構築」3-D デジタル イメージングおよびモデリング、2005 年。3DIM 2005。第 5 回国際会議。IEEE、2005 年。
- ^ ab Oliva、Aude、および Antonio Torralba。「物体認識における文脈の役割」認知科学の動向 11.12 (2007): 520-527。
- ^ ab Niu、Zhenxing、他「シーン認識のためのコンテキスト認識トピックモデル」2012 IEEE コンピュータービジョンおよびパターン認識会議。IEEE、2012 年。
- ^ Stein、Fridtjof、Gérard Medioni。「構造インデックス: 効率的な 3D オブジェクト認識」IEEE Transactions on Pattern Analysis & Machine Intelligence 2 (1992): 125-145。
- ^ Zhu、Song-Chun、David Mumford。「画像の確率的文法」コンピュータグラフィックスとビジョンの基礎と動向 2.4 (2007): 259-362。
- ^ Nayar, Shree K.、および Ruud M. Bolle。「反射率に基づく物体認識」International journal of computer vision 17.3 (1996): 219-240。
- ^ ワージントン、フィリップ L.、エドウィン R. ハンコック。「シェーディングからの形状を使用した物体認識」IEEE Transactions on Pattern Analysis and Machine Intelligence 23.5 (2001): 535-542。
- ^ Shotton, Jamie、他「画像理解のための Textonboost: テクスチャ、レイアウト、コンテキストを共同でモデル化することによるマルチクラス オブジェクト認識およびセグメンテーション」International journal of computer vision 81.1 (2009): 2-23。
- ^ 「ロボットの視覚向上」KurzweilAI 2013年10月9日閲覧。
- ^ Donahue、Jeffrey、他「視覚認識と記述のための長期再帰畳み込みネットワーク」IEEE コンピュータービジョンおよびパターン認識会議議事録。2015 年。
- ^ Karpathy、Andrej、Li Fei-Fei。「画像の説明を生成するための深い視覚的意味的アラインメント」。コンピュータービジョンとパターン認識に関する IEEE 会議の議事録。2015 年。
- ^ P Duygulu、K Barnard、N de Fretias、D Forsyth (2002)。「機械翻訳としての物体認識: 固定画像語彙の語彙の学習」。欧州コンピュータビジョン会議の議事録。97~112 ページ。2005 年 3 月 5 日のオリジナルからアーカイブ。
- ^ 「Android Eyes コンピュータビジョン」。Martha J. Farah「視覚失認症」、Computer Vision Computing Cognitive Neuroscience、MIT Press、2011-05-01、760-781ページ、ISSN 1468-4233 [1] [リンク切れ ]
- ^ Esteva, Andre、et al.「ディープニューラルネットワークによる皮膚科医レベルの皮膚がんの分類」Nature 542.7639 (2017): 115。
- ^ Brown, M.、および Lowe, DG、「パノラマ認識」、Wayback Machineに 2014-12-25 アーカイブ、ICCV、p. 1218、第 9 回 IEEE 国際コンピュータ ビジョン会議 (ICCV'03) - 第 2 巻、ニース、フランス、2003 年
- ^ Li, L.、Guo, B.、および Shao, K.、「スケール不変特徴変換と Zernike モーメントを使用した幾何学的に堅牢な画像透かし」、Chinese Optics Letters、第 5 巻、第 6 号、pp. 332-335、2007 年。
- ^ Se,S.、Lowe,DG、およびLittle,JJ、「移動ロボットの視覚ベースのグローバルローカリゼーションとマッピング」、IEEE Transactions on Robotics、21、3 (2005)、pp.364-375。
- ^ Thomas Serre、Maximillian Riesenhuber、Jennifer Louie、Tomaso Poggio、「生物学的視覚における現実世界の物体認識における物体固有の特徴の役割について」。人工知能研究所、マサチューセッツ工科大学脳認知科学部、生物および計算学習センター、マクガバン脳研究所、ケンブリッジ、マサチューセッツ州、米国
- ^ パーマロフ、アン ;グラフトン、カール (1992)。「光学文字認識」。PS :政治学と政治。25 (3 ) : 523–531。doi :10.2307/419444。ISSN 1049-0965。JSTOR 419444。S2CID 64806776。
- ^ Christian Demant、Bernd Streicher-Abel、Peter Waszkewitz、「工業用画像処理:製造業における視覚的品質管理」Google ブックスのオブジェクト認識の概要
- ^ Nuno Vasconcelos「混合階層による画像インデックス作成」Wayback Machineに 2011-01-18 アーカイブCompaq Computer Corporation、Proc. IEEE Conference in Computer Vision and Pattern Recognition、カウアイ島、ハワイ、2001
- ^ Heikkilä, Janne; Silvén, Olli (2004). 「自転車と歩行者のリアルタイム監視システム」Image and Vision Computing . 22 (7): 563–570. doi :10.1016/j.imavis.2003.09.010.
- ^ Jung, Ho Gi; Kim, Dong Suk; Yoon, Pal Joo; Kim, Jaihie (2006). 「半自動駐車システムのための構造分析ベースの駐車スロットマーキング認識」 Yeung, Dit-Yan; Kwok, James T.; Fred, Ana; Roli, Fabio; de Ridder, Dick (編)。構造的、統語的、および統計的パターン認識。 コンピュータサイエンスの講義ノート。 Vol. 4109。 ベルリン、ハイデルベルク:Springer。 pp. 384–393。doi:10.1007/11815921_42。ISBN 978-3-540-37241-7。
- ^ SK Nayar、H. Murase、SA Nene、「視覚的外観の学習、位置決め、追跡」、IEEE 国際ロボット工学およびオートメーション会議、サンディエゴ、1994 年 5 月
- ^ Liu, F.; Gleicher, M.; Jin, H.; Agarwala, A. (2009). 「3D ビデオ安定化のためのコンテンツ保持ワープ」. ACM Transactions on Graphics . 28 (3): 1. CiteSeerX 10.1.1.678.3088 . doi :10.1145/1531326.1531350.
参考文献
- Elgammal, Ahmed「CS 534: コンピュータ ビジョン 3D モデルベースの認識」、ラトガース大学コンピュータ サイエンス学部;
- Hartley, Richard および Zisserman, Andrew「コンピューター ビジョンにおけるマルチビュー ジオメトリ」、Cambridge Press、2000 年、ISBN 0-521-62304-9。
- Roth, Peter M. および Winter, Martin「外観ベースの物体認識方法の調査」、技術レポート ICG-TR-01/08、コンピュータ グラフィックスおよびビジョン研究所、グラーツ工科大学、オーストリア、2008 年 1 月 15 日。
- コリンズ、ロバート「講義 31: 物体認識: SIFT キー」、CSE486、ペンシルベニア州立大学
- IPRG [盗用]画像処理 - オンラインオープンリサーチグループ
- Christian Szegedy Archived 2015-09-06 at the Wayback Machine、Alexander Toshev Archived 2015-10-04 at the Wayback Machineおよび Dumitru Erhan. Deep Neural Networks for Object Detection. Advances in Neural Information Processing Systems 26 Archived 2020-09-05 at the Wayback Machine、2013 年。2553 ~ 2561 ページ。
