
コンピュータビジョンにおいて、サリエンシーマップとは、人間の目が最初に焦点を合わせる領域、または機械学習モデルにとって最も関連性の高い領域を強調表示する画像です。[1]サリエンシーマップの目的は、人間の視覚システムや他の不透明な機械学習モデルに対するピクセルの重要度を反映することです。
たとえば、この画像では、人物はまず砦と薄い雲を見ているので、それらは顕著性マップ上で強調表示される必要があります。人工視覚またはコンピューター視覚で設計された顕著性マップは、通常、生物学的視覚または自然視覚によって構築された実際の顕著性マップと同じではありません。
応用
概要
サリエンシー マップはさまざまな問題に応用できます。一般的な応用例をいくつか挙げます。
人間の目
- 画像とビデオの圧縮: 人間の目はフレーム内の小さな関心領域にのみ焦点を合わせます。したがって、フレーム全体を均一な品質で圧縮する必要はありません。著者によると、サリエンシーマップを使用すると、同じ視覚的知覚でビデオの最終的なサイズが縮小されます。[2]
- 画像とビデオの品質評価:画像やビデオの品質指標の主な目的は、ユーザーの意見との高い相関関係を確認することです。目立つ領域の違いはより重要視され、品質スコアに大きく貢献します。[3]
- 画像リターゲティング:情報のない領域を拡大または縮小することで画像のサイズを変更することを目的としています。したがって、リターゲティングアルゴリズムは、すべての顕著な画像の詳細を正確に推定するサリエンシーマップの利用可能性に依存しています。[4]
- 物体検出と認識:計算的に複雑なアルゴリズムを画像全体に適用する代わりに、物体が含まれている可能性が最も高い画像の最も目立つ領域にそれを適用することができます。[5]
説明可能な人工知能
- ブラックボックスの機械学習モデルにおける説明可能な人工知能: サリエンシーマップはXAIの重要なツールであり、[6]機械学習モデル、特にディープニューラルネットワークの意思決定プロセスを視覚的に説明します。これらのマップは、入力画像、テキスト、またはその他の種類のデータ内でモデルの出力に最も影響を与える領域を強調表示し、予測を行う際にモデルが「見ている」場所を効果的に示します。入力のどの部分が重要であるかを示すことで、サリエンシーマップはブラックボックスモデルの内部動作を理解するのに役立ち、信頼性と透明性を促進します。たとえば、画像分類タスクでは、サリエンシーマップは特定のクラスの決定に最も貢献するピクセルまたは領域を識別できます。サリエンシーマップを作成する方法は複数あり、クラススコア出力の勾配を単純に取得する方法から、統合勾配、XRAI、Grad-CAM、SmoothGrad などのはるかに複雑なアルゴリズムまであります。[6]
セグメンテーション問題としての顕著性
顕著性推定は、画像セグメンテーションの一例と見なすことができます。コンピュータビジョンでは、画像セグメンテーションは、デジタル画像を複数のセグメント(ピクセルのセット、スーパーピクセルとも呼ばれる)に分割するプロセスです。セグメンテーションの目的は、画像の表現を簡素化したり、より意味があり分析しやすいものに変更することです。画像セグメンテーションは通常、画像内のオブジェクトや境界(線、曲線など)を見つけるために使用されます。より正確には、画像セグメンテーションは、画像内のすべてのピクセルにラベルを割り当て、同じラベルのピクセルが特定の特性を共有するようにするプロセスです。[7]
アルゴリズム
概要
OpenCVに実装されている古典的な顕著性推定アルゴリズムには 3 つの形式があります。
- 静的顕著性: 画像の特徴と統計情報を利用して、画像の関心領域を特定します。
- モーション サリエンシー:オプティカル フローによって検出されたビデオ内のモーションに依存します。移動するオブジェクトは顕著であるとみなされます。
- オブジェクト度: オブジェクト度は、画像ウィンドウがオブジェクトをどの程度カバーしているかを反映します。これらのアルゴリズムは、画像内でオブジェクトが存在する可能性のある場所を示す境界ボックスのセットを生成します。
古典的なアプローチに加えて、ニューラル ネットワーク ベースのアプローチも人気があります。動きの顕著性推定のためのニューラル ネットワークの例は次のとおりです。
- TASED-Net: 2 つの構成要素から構成されます。まず、エンコーダー ネットワークが低解像度の時空間特徴を抽出し、次に、後続の予測ネットワークが空間的にエンコードされた特徴をデコードしながら、すべての時間情報を集約します。
- STRA-Net: 2 つの重要な問題に重点を置いています。まず、外観とオプティカル フローの結合を介して統合された時空間の特徴、次に注意メカニズムを介して学習されたマルチスケールの顕著性です。
- STAViS: 時空間の視覚情報と聴覚情報を組み合わせます。このアプローチでは、音源の位置を特定し、2 つの顕著性を融合して最終的な顕著性マップを取得することを学習する単一のネットワークを使用します。
実装例
まず、同じフレーム内の各ピクセルから残りのピクセルまでの距離を計算する必要があります。
はピクセルの値で、[0,255]の範囲にあります。次の式はこの式の展開形です。
- SALS( I k ) = | I k - I 1 | + | I k - I 2 | + ... + | I k - I N |
ここで、N は現在のフレーム内のピクセルの総数です。次に、式をさらに再構成します。同じ I を持つ値をまとめます。
- SALS( I k ) = Σ F n × | I k - I n |
ここで、F n はI nの頻度です。n の値は [0,255] に属します。頻度はヒストグラムの形式で表され、ヒストグラムの計算時間は 時間計算量です。
時間計算量
このサリエンシーマップアルゴリズムには、 時間計算量があります。ヒストグラムの計算時間は 時間計算量であり、N はフレームのピクセル数です。また、この式のマイナス部分と乗算部分には 256 回の演算が必要です。したがって、このアルゴリズムの時間計算量は であり、 に等しくなります。
擬似コード
以下のコードはすべて疑似 MATLABコードです。まず、ビデオ シーケンスからデータを読み取ります。
for k = 2 : 1 : 13 % これはフレーム 2 から 13 までを意味し、ループごとに K の値が 1 増加します。I = imread ( currentfilename ); % 現在のフレームを読み取りますI1 = im2single ( I ); % 二重画像を単一画像に変換します (コマンド vlslic の要件) l = imread ( previousfilename ); % 前のフレームを読み取りますI2 = im2single ( l ); regionSize = 10 ; % SLIC のパラメーターを設定します このパラメーター設定は実験結果です。RegionSize はスーパーピクセルのサイズを意味します。regularizer = 1 ; % SLIC のパラメーターを設定しますsegment1 = vl_slic ( I1 , regionSize , normalizer ); % 現在のフレームのスーパーピクセルを取得しますsegment2 = vl_slic ( I2 , regionSize , normalizer ); % 前のフレームのスーパーピクセルを取得しますnumsuppix = max ( segment1 (:)); % スーパーピクセルの数を取得します。スーパーピクセルに関するすべての情報は、このリンク [http://www.vlfeat.org/overview/slic.html] にあります。regstats1 = regionprops ( segments1 , ' all ' ); regstats2 = regionprops ( segments2 , ' all ' ); % セグメント 1 に基づいて領域特性を取得します。
データを読み取った後、各フレームに対してスーパーピクセル処理を実行します。Spnum1 と Spnum2 は、現在のフレームと前のピクセルのピクセル番号を表します。
% まず、各ピクセルの値の距離を計算します。
% これはコアコードです。
for i = 1 : 1 : spnum1 % 最初のピクセルから最後のピクセルまで。 そして、各ループで i++ for j = 1 : 1 : spnum2 % 最初のピクセルから最後のピクセルまで。 j++。前のフレームcentredist ( i : j ) = sum (( center ( i ) - center ( j ))); % 中心距離を計算しますend end
次に、各ピクセルの色の距離を計算します。このプロセスをコントラクト関数と呼びます。
for i = 1 : 1 : spnum1 % 現在のフレームの最初のピクセルから最後の 1 ピクセルまで。 I ++ for j = 1 : 1 : spnum2 % 前のフレームの最初のピクセルから最後の 1 ピクセルまで。 J++ posdiff ( i , j ) = sum (( regstats1 ( j ). Centroid ' - mupwtd (:, i ))); % 色の距離を計算します。end end
この 2 つのプロセスの後、顕著性マップを取得し、これらすべてのマップを新しい FileFolder に保存します。
アルゴリズムの違い
関数 1 と関数 2 の主な違いは、コントラクト関数の違いです。spnum1 と spnum2 の両方が現在のフレームのピクセル番号を表す場合、このコントラクト関数は最初の顕著性関数用です。spnum1 が現在のフレームのピクセル番号で、spnum2 が前のフレームのピクセル番号を表す場合、このコントラクト関数は 2 番目の顕著性関数用です。同じフレームのピクセルを使用して中心距離を取得し、顕著性マップを取得する 2 番目のコントラクト関数を使用する場合、この顕著性関数を各フレームに適用し、現在のフレームの顕著性マップから前のフレームの顕著性マップを引いて、3 番目の顕著性関数の新しい顕著性結果である新しい画像を取得します。

データセット
顕著性データセットには通常、いくつかの画像シーケンスにおける人間の目の動きが含まれています。これは、新しい顕著性アルゴリズムの作成や既存のアルゴリズムのベンチマークに役立ちます。最も重要なデータセット パラメータは、空間解像度、サイズ、および視線追跡装置です。たとえば、MIT/Tübingen Saliency Benchmark データセットの大規模なデータセット テーブルの一部を以下に示します。
顕著性データセットを収集するには、画像またはビデオ シーケンスと視線追跡装置を準備し、観察者を招待する必要があります。観察者は正常視力または矯正視力を持ち、画面から同じ距離にいる必要があります。各記録セッションの開始時に、視線追跡装置が再調整されます。これを行うには、観察者は画面の中央に視線を固定します。その後、セッションが開始され、シーケンスを表示して視線を記録することで顕著性データが収集されます。
視線追跡装置は、少なくとも毎秒250フレームの目の動きを記録できる高速カメラです。カメラからの画像は、専用のコンピュータ上で実行されるソフトウェアによって処理され、視線データを返します。
参考文献
- ^ Subhash, Bijil (2022年3月6日). 「説明可能なAI:Saliencyマップ」. Medium . 2024年5月26日閲覧。
- ^ Guo , Chenlei; Zhang, Liming (2010 年 1 月)。「新しいマルチ解像度時空間サリエンシー検出モデルと画像およびビデオ圧縮への応用」。IEEE Transactions on Image Processing。19 ( 1 ): 185–198。Bibcode :2010ITIP...19..185G。doi : 10.1109 /TIP.2009.2030969。ISSN 1057-7149。PMID 19709976。S2CID 1154218 。
- ^ Tong, Yubing; Konik, Hubert; Cheikh, Faouzi; Tremeau, Alain (2010-05-01). 「Saliency Map Analysis に基づくフルリファレンス画像品質評価」. Journal of Imaging Science and Technology . 54 (3): 30503–1–30503-14. doi : 10.2352/J.ImagingSci.Technol.2010.54.3.030503 . hdl : 11250/142490 .
- ^ Goferman, Stas; Zelnik-Manor, Lihi; Tal, Ayellet (2012 年 10 月)。「コンテキスト認識型サリエンシー検出」。IEEE Transactions on Pattern Analysis and Machine Intelligence。34 (10): 1915–1926。doi : 10.1109 /TPAMI.2011.272。ISSN 1939-3539。PMID 22201056 。
- ^ Jiang, Huaizu; Wang, Jingdong; Yuan, Zejian; Wu, Yang; Zheng, Nanning; Li, Shipeng (2013 年 6 月)。「顕著な物体検出: 識別的な地域的特徴統合アプローチ」。2013 IEEEコンピュータービジョンおよびパターン認識会議。IEEE。pp. 2083–2090。arXiv : 1410.5926。doi : 10.1109/cvpr.2013.271。ISBN 978-0-7695-4989-7。
- ^ ab Müller, Romy (2024). 「説明可能なAIが人間のパフォーマンスに与える影響:サリエンシーマップの行動的結果に関する体系的なレビュー」. arXiv : 2404.16042 [cs.HC].
- ^ A. Maity (2015). 「即興的な顕著なオブジェクトの検出と操作」. arXiv : 1511.02999 [cs.CV].
外部リンク
- Zhai, Yun; Shah, Mubarak (2006-10-23)。「時空間キューを使用したビデオシーケンスの視覚的注意検出」。第14 回 ACM国際マルチメディア会議の議事録。MM '06。ニューヨーク、ニューヨーク、米国: ACM。pp. 815–824。CiteSeerX 10.1.1.80.4848。doi : 10.1145 /1180639.1180824。ISBN 978-1595934475. S2CID 5219826。
- VLfeat: http://www.vlfeat.org/index.html
- Scholarpediaの Saliency マップ
