コンピュータビジョンにおける画像検索からの物体分類の問題は、インターネット検索エンジンで自動的に取得された画像のみを使用して、物体のカテゴリを認識する分類器をトレーニングする問題です。理想的には、自動画像収集により、カテゴリ名のみを入力として分類器をトレーニングできます。この問題は、コンテンツベースの画像検索 (CBIR) の問題と密接に関連しています。コンテンツベースの画像検索の目的は、画像認識用に分類器をトレーニングすることではなく、より優れた画像検索結果を返すことです。
従来、分類器は手作業でラベル付けされた画像セットを使用してトレーニングされます。このような画像セットの収集は、多くの場合、非常に時間がかかり、面倒なプロセスです。インターネット検索エンジンを使用して、大量のラベル付き画像を取得するプロセスを自動化することは、コンピュータービジョンの研究を大幅に促進する可能性のある方法として説明されています。[1]
課題
無関係な画像
インターネット画像検索結果を分類器のトレーニング セットとして使用する場合の問題の 1 つは、結果内の無関係な画像の割合が高いことです。Google 画像などの検索エンジンにオブジェクト カテゴリの名前 (飛行機など) で検索すると、返される画像の最大 85% がそのカテゴリに関連しないと推定されています。[1]
クラス内変動
インターネット画像検索結果を分類器のトレーニング セットとして使用する際に生じるもう 1 つの課題は、Caltech 101やPascalなどの手動でラベル付けされたデータセットのカテゴリと比較すると、オブジェクト カテゴリ内の変動性が非常に高いことです。オブジェクトの画像は、スケール、ポーズ、照明、オブジェクトの数、遮蔽の量など、多くの重要な要素によって大きく異なる場合があります。
pLSAアプローチ
2005年のFergusらの論文[1]では、 pLSA(確率的潜在意味解析)とこのモデルの拡張が、画像検索からのオブジェクト分類の問題に適用されました。pLSAはもともと文書分類のために開発されましたが、その後コンピュータービジョンに適用されました。pLSAでは、画像はバッグオブワードモデルに適合する文書であると仮定しています。
モデル
テキスト文書が単語で構成され、各単語が文書内および文書間で繰り返されるのと同様に、画像はビジュアル ワードの組み合わせとしてモデル化できます。テキスト ワードのセット全体が辞書によって定義されるのと同様に、ビジュアル ワードのセット全体はコードワード辞書で定義されます。
pLSA はドキュメントをトピックにも分割します。記事のトピックがわかれば、そこに表示される単語の種類を推測できるのと同じように、画像内の単語の分布は、基になるトピックに依存します。pLSA モデルは、トピックの観点からカテゴリが与えられた場合に、各単語が表示される確率を示します。
このモデルで重要な仮定は、 が与えられた場合、 と は条件付きで独立しているということです。トピックが与えられた場合、特定の単語がそのトピックの一部として現れる確率は、画像の残りの部分とは無関係です。[2]
このモデルのトレーニングには、各ドキュメント内の観測単語の尤度を最大化するとを見つけることが含まれます。これを行うには、次の目的関数を持つ期待値最大化アルゴリズムが使用されます。
応用
ABS-pLSA
絶対位置 pLSA (ABS-pLSA) は、画像内の X 個のビンの 1 つに各ビジュアル ワードを位置指定することで、各ビジュアル ワードに位置情報を付加します。ここで、 はビジュアル ワードがどのビンに該当するかを表します。新しい方程式は次のようになります。
これは、 EMアルゴリズムを使用して、元のpLSA問題と同様の方法で解くことができる。
このモデルの問題は、変換やスケール不変ではないことです。ビジュアル ワードの位置は絶対的なので、画像内のオブジェクトのサイズを変更したり移動したりすると、異なるビンへのビジュアル ワードの空間分布に大きな影響を与えます。
TSI-pLSA
変換とスケール不変 pLSA (TSI-pLSA)。このモデルは、画像内のターゲット オブジェクトの空間位置を表す別の潜在変数を追加することで pLSA を拡張します。これで、ビジュアル ワードの位置は、画像内の絶対位置ではなく、このオブジェクトの位置に対して相対的に示されます。新しい方程式は次のとおりです。
ここでも、パラメータと はEM アルゴリズムを使用して解くことができます。は均一分布であると仮定できます。
実装
単語の選択
画像内の単語は4つの異なる特徴検出器を使用して選択された:[1]
- カディール・ブレイディ顕著性検出器
- マルチスケールハリス検出器
- ガウス分布の差
- 研究で説明されているエッジベースの演算子
これら 4 つの検出器を使用して、画像ごとに約 700 の特徴が検出されました。これらの特徴は、スケール不変の特徴変換記述子としてエンコードされ、コードブックに含まれる 350 語の 1 つと一致するようにベクトル量子化されました。コードブックは、多数のオブジェクト カテゴリにまたがる多数の画像から抽出された特徴から事前に計算されました。
可能性のあるオブジェクトの位置
TSI-pLSA モデルにおける重要な疑問の 1 つは、ランダム変数が取り得る値をどのように決定するかということです。これは 4 ベクトルであり、そのコンポーネントはオブジェクトの重心と、オブジェクトの周囲の境界ボックスを定義する x および y スケールを記述するため、取り得る値の空間は膨大です。オブジェクトの位置の可能性のある数を妥当な数に制限するために、まず画像セットに対して通常の pLSA を実行し、各トピックに対して、で重み付けされたビジュアル ワードにガウス混合モデルを適合させます。最大 のガウスが試行されます (1 つの画像にオブジェクトの複数のインスタンスが存在する場合に対応) 。 は定数です。
パフォーマンス
Fergus らの論文の著者は、厳選されたデータセットと Google 検索から返された画像で 3 つの pLSA アルゴリズム (pLSA、ABS-pLSA、TSI-pLSA) のパフォーマンスを比較しました。パフォーマンスは、テスト セット内の画像を画像を含むか背景のみを含むかに分類する際のエラー率として測定されました。
予想通り、Google データで直接トレーニングすると、準備されたデータでトレーニングするよりもエラー率が高くなります。[1]テストされたオブジェクト カテゴリの約半数で、ABS-pLSA と TSI-pLSA は通常の pLSA よりも大幅に優れたパフォーマンスを発揮し、7 つのカテゴリのうち 2 つのカテゴリでのみ、TSI-pLSA が他の 2 つのモデルよりも優れたパフォーマンスを発揮します。
オプティモル
OPTIMOL(増分モデル学習による自動オンライン画像収集)は、モデル学習と検索を同時に行うことで、オンライン画像検索からオブジェクトカテゴリを学習するという問題に取り組みます。OPTIMOLは、ターゲットオブジェクトカテゴリのモデルを更新しながら、より関連性の高い画像を同時に取得する反復モデルです。[3]
一般的な枠組み
OPTIMOL は、カテゴリ学習に使用される特定のモデルに依存しない一般的な反復フレームワークとして提示されました。アルゴリズムは次のとおりです。
- キーワードを検索してインターネットから大量の画像をダウンロードする
- シード画像でデータセットを初期化する
- データセットにはさらに多くの画像が必要です
:
- 最近追加されたデータセット画像を使用してモデルを学習する
- 更新されたモデルを使用してダウンロードした画像を分類する
- 承認された画像をデータセットに追加する
各学習ラウンドでは、最後に追加された画像のみが使用されることに注意してください。これにより、任意の数の入力画像に対してアルゴリズムを実行できます。
モデル
2 つのカテゴリ (対象物体と背景) は、階層的ディリクレ過程 (HDP) としてモデル化されます。pLSA アプローチと同様に、画像はbag of words モデルで記述できるものと想定されます。HDP は、カテゴリ内およびカテゴリ間の画像における不特定多数のトピックの分布をモデル化します。単一カテゴリ内の画像間のトピックの分布は、ディリクレ過程(非パラメトリック 確率分布の一種) としてモデル化されます。クラス間でトピックを共有できるようにするために、これらのディリクレ過程のそれぞれは、別のディリクレ過程のサンプルとしてモデル化されます。HDP は、2005 年に Teh らによって初めて説明されました。[4]
実装
初期化
データセットは、学習するオブジェクト カテゴリの適切な見本となる画像のオリジナル バッチで初期化またはシードする必要があります。これらは、検索エンジンによって返される最初のページ程度の画像 (後続の画像よりも優れている傾向があります) を使用して自動的に収集できます。または、最初の画像を手動で収集することもできます。
モデル学習
HDP のさまざまなパラメータを段階的に学習するために、潜在変数に対してギブスサンプリングが使用されます。これは、新しい画像セットがデータセットに組み込まれるたびに実行されます。ギブス サンプリングでは、ランダム変数のセットを繰り返しサンプリングして、その分布を近似します。サンプリングでは、問題のランダム変数の値が、そのランダム変数が依存する他のランダム変数の状態に基づいて生成されます。十分なサンプルがあれば、値の妥当な近似値を得ることができます。
分類
各反復で、およびは、前回のギブス サンプリング後に学習したモデルから取得できます。ここで、はトピック、はカテゴリ、は単一のビジュアル ワードです。したがって、画像が特定のクラスに属する可能性は次のようになります。
これは、反復ごとに新しい候補画像ごとに計算されます。画像は、最も可能性の高いカテゴリに属するものとして分類されます。
データセットと「キャッシュセット」への追加
ただし、データセットに組み込む資格を得るには、画像がより厳しい条件を満たす必要があります。
ここで、 と はそれぞれ前景 (オブジェクト) と背景のカテゴリであり、定数の比率は偽陽性と偽陰性を受け入れるリスクを表します。これらは反復ごとに自動的に調整され、偽陽性のコストは偽陰性のコストよりも高く設定されます。これにより、より優れたデータセットが収集されます。
ただし、上記の基準を満たして画像が受け入れられ、データセットに組み込まれると、その画像は「キャッシュ セット」、つまりトレーニングに使用する画像のセットに組み込まれる前に、別の基準を満たす必要があります。このセットは、受け入れられた画像のセットの多様なサブセットとなることを目的としています。モデルが受け入れられたすべての画像でトレーニングされると、モデルはより高度に専門化され、以前の画像と非常に類似した画像のみを受け入れるようになる可能性があります。
パフォーマンス
OPTIMOL メソッドのパフォーマンスは、次の 3 つの要素によって定義されます。
- 画像収集機能: OPTIMOL は、Web から大量の良質な画像を自動的に収集できることがわかりました。OPTIMOL で取得した画像セットのサイズは、Caltech 101にあるような、同じカテゴリの人間がラベル付けした大規模な画像セットのサイズを上回ります。
- 分類精度: 分類精度は、前述の pLSA 方法で生成された分類器によって表示される精度と比較されました。OPTIMOL は、7 つのオブジェクト カテゴリで 72.0% と比較して 74.8% の精度を達成し、わずかに高い精度を達成していることがわかりました。
- バッチ学習との比較: 重要な問題は、モデルに関する他のすべての条件が一定である場合、OPTIMOL の増分学習が従来のバッチ学習方法よりも優れているかどうかです。分類器が増分学習する場合、前の画像から学習した内容に基づいて次の画像を選択すると、次の 3 つの重要な結果が観察されます。
- 増分学習によりOPTIMOLはより良いデータセットを収集できる
- 増分学習により、OPTIMOL はより速く学習できます (無関係な画像を破棄することにより)
- 増分学習は分類器のROC曲線に悪影響を与えません。実際、増分学習は改善をもたらしました。
コンテンツベースの画像検索におけるオブジェクトの分類
通常、画像検索では、画像に関連付けられたテキストのみが使用されます。コンテンツベースの画像検索の問題は、画像自体に含まれる視覚情報を考慮して検索結果を改善することです。いくつかの CBIR 方法では、画像検索結果でトレーニングされた分類子を使用して、検索を絞り込みます。つまり、画像検索からのオブジェクトの分類は、システムの 1 つのコンポーネントです。たとえば、OPTIMOL では、以前の反復中に収集された画像でトレーニングされた分類子を使用して、返されたデータセットに追加の画像を選択します。
画像検索からオブジェクト カテゴリをモデル化する CBIR メソッドの例は次のとおりです。
- ファーガスら、2004 [5]
- バーグとフォーサイス、2006年[6]
- 柳井・バーナード、2006 [7]
参考文献
- ^ abcde Fergus, R.; Fei-Fei, L.; Perona, P.; Zisserman, A. (2005). 「Google イメージ検索からのオブジェクト カテゴリの学習」(PDF)。Proc . IEEE International Conference on Computer Vision。
- ^ Hofmann, Thomas (1999). 「確率的潜在意味解析」(PDF)。人工知能における不確実性。2007-07-10のオリジナル(PDF)からアーカイブ。
- ^ Li, Li-Jia; Wang, Gang; Fei-Fei, Li (2007). 「OPTIMOL: 増分モデル学習による自動オンライン画像収集」(PDF)。Proc . IEEE Conference on Computer Vision and Pattern Recognition。
- ^ Teh, Yw; Jordan, MI; Beal, MJ; Blei,David (2006). 「階層的ディリクレ過程」(PDF) . Journal of the American Statistical Association . 101 (476): 1566. CiteSeerX 10.1.1.5.9094 . doi :10.1198/016214506000000302. S2CID 7934949.
- ^ Fergus, R.; Perona, P.; Zisserman, A. (2004). 「Google イメージの視覚カテゴリ フィルター」(PDF) . Proc. 8th European Conf. on Computer Vision .
- ^ Berg, T.; Forsyth, D. (2006). 「ウェブ上の動物」. Proc. Computer Vision and Pattern Recognition . doi :10.1109/CVPR.2006.57.
- ^ Yanai, K; Barnard, K. (2005). 「確率的ウェブ画像収集」。マルチメディア情報検索に関する ACM SIGMM ワークショップ。
