コンピュータビジョンにおいて、視覚記述子または画像記述子は、画像、ビデオ、またはそのような記述を生成するアルゴリズムやアプリケーション内のコンテンツの視覚的特徴を記述したものです。これらは、形状、色、テクスチャ、動きなど の基本的な特性を記述します。
導入
新しい通信技術と社会におけるインターネットの大規模な利用の結果、デジタル形式で利用できるオーディオビジュアル情報の量は大幅に増加しています。そのため、さまざまな種類のマルチメディア情報のコンテンツを記述して検索および分類できる システムを設計する必要がありました。
オーディオビジュアル記述子は、コンテンツの説明を担当します。これらの記述子は、ビデオ、画像、またはオーディオに含まれるオブジェクトとイベントに関する優れた知識を持っており、オーディオビジュアル コンテンツを迅速かつ効率的に検索できます。
このシステムは、テキスト コンテンツの検索エンジンに似ています。コンピューターでテキストを検索するのは比較的簡単ですが、具体的なオーディオやビデオ部分を検索するのははるかに困難です。たとえば、誰かが幸せな人のシーンを検索しているとします。幸せは感情であり、画像ではその形、色、質感の説明は明らかではありません。
オーディオビジュアル コンテンツの記述は表面的な作業ではなく、このタイプのアーカイブを効果的に使用するために不可欠です。オーディオビジュアル記述子を扱う標準化システムは、MPEG-7 ( Motion Picture Expert Group - 7 ) です。
種類
記述子は、デジタル画像に含まれるピクセルと、人間が数分後に画像または画像群を観察した後で思い出すものと の間のつながりを見つけるための最初のステップです。
視覚的記述子は主に 2 つのグループに分けられます。
- 一般情報記述子: 色、形状、領域、テクスチャ、および動きについて説明する低レベルの記述子が含まれます。
- 特定ドメイン情報記述子: シーン内のオブジェクトとイベントに関する情報を提供します。具体的な例としては、顔認識が挙げられます。
一般情報記述子
一般情報記述子は、色、テクスチャ、形状、動き、位置などのさまざまな基本的かつ基本的な特徴をカバーする記述子のセットで構成されています。この記述は、信号処理によって自動的に生成されます。
色
これはビジュアルコンテンツの最も基本的な品質です。色を説明するために 5 つのツールが定義されています。最初の 3 つのツールは色の分布を表し、最後のツールは画像のシーケンスまたはグループ間の色の関係を説明します。
- 支配的な色記述子 (DCD)
- スケーラブルカラー記述子 (SCD)
- 色構造記述子 (CSD)
- カラーレイアウト記述子(CLD)
- フレームグループ (GoF)またはピクチャグループ (GoP)
テクスチャ
これは、画像を説明する上で重要な特性です。テクスチャ記述子は、画像のテクスチャまたは領域を特徴付けます。テクスチャ記述子は、領域の均一性とこれらの領域境界のヒストグラムを観察します。記述子のセットは、次の要素で構成されます。
- 均質テクスチャ記述子 (HTD)
- テクスチャブラウジング記述子(TBD)
- エッジヒストグラム記述子 (EHD)
形
人間は形状から物体を認識する能力があるため、重要な意味情報が含まれています。ただし、この情報は、人間の視覚システムが実装しているものと同様のセグメンテーションによってのみ抽出できます。現在、そのようなセグメンテーション システムはまだ利用できませんが、近似値として適切であると考えられる一連のアルゴリズムが存在します。これらの記述子は、2D画像および3Dボリュームの領域、輪郭、および形状を記述します。形状記述子は次のとおりです。
- 領域ベースの形状記述子 (RSD)
- 輪郭ベースの形状記述子 (CSD)
- 3-D 形状記述子 (3-D SD)
モーション
これは、ビデオシーケンス内の動きを記述する 4 つの異なる記述子によって定義されます。動きは、シーケンス内のオブジェクトの動きとカメラの動きに関連します。この最後の情報はキャプチャ デバイスによって提供され、残りの情報は画像処理によって実装されます。記述子セットは次のとおりです。
- 動作アクティビティ記述子 (MAD)
- カメラモーション記述子 (CMD)
- 動作軌跡記述子 (MTD)
- ワーピングとパラメトリックモーション記述子 (WMD と PMD)
位置
画像内の要素の位置は、空間領域内の要素を記述するために使用されます。さらに、要素は時間領域内に配置することもできます。
- 領域ロケータ記述子 (RLD)
- 時空間ロケータ記述子 (STLD)
特定のドメイン情報記述子
シーン内のオブジェクトやイベントに関する情報を提供するこれらの記述子は、抽出が自動的に行われる場合はなおさら簡単には抽出できません。ただし、手動で処理することは可能です。
前述したように、顔認識は、この情報を自動的に取得しようとするアプリケーションの具体的な例です。
記述子アプリケーション
すべてのアプリケーションの中で最も重要なものは次のとおりです。
- マルチメディアドキュメントの検索エンジンと分類器。
- デジタル ライブラリ: ビジュアル記述子を使用すると、さまざまな検索パラメータを使用して、あらゆるビデオや画像を非常に詳細かつ具体的に検索できます。たとえば、有名な俳優が登場する映画の検索、エベレスト山が映っているビデオの検索などです。
- パーソナライズされた電子ニュースサービス。
- たとえば、選手がゴールエリアに近づくと、サッカーの試合を放送しているテレビチャンネルに自動的に接続する可能性があります。
- 暴力的またはポルノ的な素材などの具体的なオーディオビジュアル コンテンツの制御とフィルタリング。また、一部のマルチメディアコンテンツの承認。
参照
参考文献
- BS Manjunath (編集者)、Philippe Salembier (編集者)、および Thomas Sikora (編集者):「MPEG-7 入門: マルチメディア コンテンツ記述インターフェイス」、Wiley & Sons、2002 年 4 月 - ISBN 0-471-48678-7
