視覚ルーチンとは、視覚的な場面から情報を抽出する手段のことである。
シモン・ウルマンは、人間の視覚認知に関する研究の中で、人間の視覚系が形状特性と空間関係を知覚するタスクは、2つの連続した段階に分かれていると提唱した。1つは、視覚入力から基本表現が生成される初期の「ボトムアップ」段階、もう1つは、「視覚ルーチン」と呼ばれる高レベルのプリミティブが基本表現から必要な情報を抽出する後の「トップダウン」段階である。 [ 1 ]人間の場合、ボトムアップ段階で生成される基本表現は、色、エッジの向き、動きの速度、動きの方向などの特性に対応する網膜局所マップ(皮質には15以上存在する)である。これらの基本表現は、視覚入力のフィールド全体で均一に実行される固定操作に依存しており、オブジェクト固有の知識、タスク固有の知識、またはその他の高レベルの情報は使用しない。[ 2 ]
ウルマンが提案したビジュアルルーチンは、シーンの構造を解析し、基本表現から空間情報を抽出する高レベルのプリミティブです。これらのビジュアルルーチンは、対象となるタスクに特有の一連の基本的なビジュアル演算子で構成されています。ビジュアルルーチンは、基本表現の固定操作とは異なり、視覚フィールド全体に均一に適用されるのではなく、ルーチンによって指定されたオブジェクトまたは領域にのみ適用されます。[ 1 ]
ウルマンは、視覚演算子の例として、処理の焦点を移動すること、顕著な項目をさらに処理するためにインデックス付けすること、境界で区切られた領域全体に活性化を広げること、境界をトレースすること、将来の参照のために場所やオブジェクトをマークすることなどを挙げている。これらの基本的な演算子を視覚ルーチンに組み合わせると、特定の特性を満たすオブジェクトの数を数えたり、複雑な形状を認識したりするなど、比較的高度な空間タスクを実行できる。[ 1 ]
多くの研究者が、カメラ画像内の人物が指している物体を特定するなどのタスクを実行するために、カメラ画像を処理するビジュアルルーチンを実装しました。[ 3 ] [ 4 ] [ 5 ]研究者はまた、リアルタイム2Dビデオゲームをプレイするための人工マップ表現にビジュアルルーチンアプローチを適用しました。ただし、これらの場合、ビデオゲームのマップが直接提供され、物体認識や遮蔽補正などの現実世界の知覚タスクに対処する必要性が軽減されました。