視覚的物体認識とは、視覚入力に基づいて視野内の物体を識別する能力を指します。視覚的物体認識の重要な特徴の1つは「物体不変性」、つまり照明、物体の姿勢、背景コンテキストの変化など、物体が見える詳細なコンテキストの変化を超えて物体を識別する能力です。[ 1 ]
神経心理学的証拠は、物体認識の過程には4つの特定の段階が存在することを裏付けている。[ 2 ] [ 3 ] [ 4 ]これらの段階は以下のとおりである。
これらの段階の中には、さまざまな処理コンポーネントを完了させるための、より具体的なプロセスが存在します。さらに、既存の他のモデルでは、この一般的なボトムアップ階層とは対照的に、統合的な階層構造(トップダウンとボトムアップ)や並列処理が提案されています。
視覚認識処理は、一般的に、情報が複雑さを増しながら順次処理されるボトムアップ階層として捉えられています。このプロセスでは、一次視覚野などの下位レベルの皮質プロセッサが階層の最下層に位置します。下側頭皮質(IT)などの上位レベルの皮質プロセッサは最上層に位置し、そこで視覚認識が促進されます。[ 5 ]よく知られているボトムアップ階層理論は、James DiCarlo の Untangling 記述[ 6 ]であり、階層的に配置された腹側視覚経路の各段階で操作が実行され、オブジェクト表現が徐々に容易に抽出可能な形式に変換されます。対照的に、ますます人気が高まっている認識処理理論は、トップダウン処理です。Moshe Bar (2003) が提案したモデルは、初期視覚入力が部分的に分析された状態で初期視覚野から前頭前野(PFC)に送られる「ショートカット」方法を説明しています。粗雑な視覚入力の可能な解釈は前頭前野(PFC)で生成され、その後下側頭皮質(IT)に送られ、関連する物体表現が活性化され、それがより遅いボトムアップ処理に組み込まれます。この「ショートカット」は、マッチングに必要な物体表現の数を最小限に抑え、物体認識を容易にすることを目的としています。[ 5 ]病変研究では、PFC病変のある個人の反応時間が遅いという発見により、この提案が支持されており、ボトムアップ処理のみが使用されていることが示唆されています。[ 7 ]
物体認識の重要な側面は、物体恒常性、つまりさまざまな視覚条件にわたって物体を認識する能力です。これらのさまざまな条件には、物体の向き、照明、および物体の変動性(サイズ、色、およびカテゴリ内のその他の違い)が含まれます。視覚系が物体恒常性を達成するには、異なる視点と網膜記述の間で物体記述の共通点を抽出できなければなりません。[9] 機能的磁気刺激を受けながら分類および認識タスクを行った参加者は、脳の特定の領域の活性化を示す血流の増加が見られました。分類タスクは、参加者が標準的な視点または非標準的な視点から物体を屋内または屋外の物体として配置することから構成されていました。認識タスクは、参加者が以前に見た画像を提示することによって行われます。これらの画像の半分は以前に提示されたものと同じ向きで、残りの半分は反対の視点で提示されました。心的回転に関与する脳領域、例えば腹側および背側視覚経路や前頭前皮質は、これらの課題中に血流が最も大きく増加し、複数の角度から物体を見る能力にとって重要であることが示された。[ 8 ] 物体認識のために物体恒常性がどのように達成されるかについての洞察を提供するいくつかの理論が生み出されており、これには視点不変理論、視点依存理論、および複数の視点理論が含まれる。
視点不変理論は、物体認識は個々のパーツなどの構造情報に基づいており、物体の視点に関係なく認識が行われることを示唆しています。したがって、物体の個々のパーツは特定のビューに合わせて回転させることができるため、どの視点からでも認識が可能です。[10]この形式の分析的認識は、構造パーツのみを符号化する必要があるため、記憶をほとんど必要としません。これにより、これらのパーツの相互関係と心的回転によって複数の物体表現が生成されます。[10]ある研究の参加者には、事前に選択された 24 個の物体それぞれから 1 つの符号化ビューと 5 つのフィラー画像が提示されました。次に、物体は、元の画像と同じ向きまたは異なる向きで中央の視野に表示されました。その後、参加者は、提示されたこれらの物体の奥行き方向のビューが同じか異なるかを答えるように求められました。 [ 9 ]その後、画像を左または右の視野に提示する場合に同じ手順が実行されました。テストビューが右半球に直接提示された場合、視点依存のプライミングが観察されましたが、テストビューが左半球に直接提示された場合は観察されませんでした。結果は、オブジェクトが視点依存的な方法で保存されるというモデルを支持する。なぜなら、結果は、異なる方向のビューから同じパーツセットが復元できるか、異なるパーツセットが復元できるかに依存しなかったからである。[ 9 ]
MarrとNishihara(1978)が提唱したこのモデルは、視覚対象から得られた3Dモデル表現を、垂直形状の原則として記憶に保存されている3Dモデル表現と照合することで、物体の認識が達成されると述べている。[ 10 ] Yi Yungfeng(2009)は、コンピュータプログラムとアルゴリズムを用いて、人間の脳が網膜に現れる2D画像のみを使用して3D画像を精神的に構築する能力を実証することができた。彼らのモデルはまた、2D画像間で形状の恒常性が高い度合いで保存されていることを示しており、これにより3D画像が認識される。[ 10 ]物体から得られる3Dモデル表現は、まず物体の凹面を識別することによって形成され、これにより刺激が個々の部分に分割される。最近の研究では、脳の尾側頭頂間野(CIP)と呼ばれる領域が、凹面認識を可能にする平面の傾斜と傾きを記憶する役割を担っていることが示唆されている。[ 11 ] Rosenburg らは、CIP 内のニューロンから単一ニューロンの活動を同時に記録しながら、眼の位置を監視するために強膜サーチコイルをサルに埋め込んだ。実験中、サルは視覚刺激を表示する LCD スクリーンから 30 cm 離れた場所に座った。両眼視差の手がかりは、刺激を緑赤アナグリフとしてレンダリングすることによってスクリーンに表示され、傾斜曲線は 0 から 330 までの範囲であった。1 つの試行は、注視点と、1 秒間の刺激の提示から構成された。その後、外科的に挿入されたマイクロ電極を使用してニューロンの活動が記録された。物体の特定の凹面に対するこれらの単一ニューロンの活動は、凹面を含む物体の個々の部分の各軸が記憶ストアに存在するという発見につながった。[ 11 ]物体の主軸を識別することは、記憶には物体の標準的な記述のみが保存されるため必要なメンタル回転による正規化プロセスに役立つ。認識は、観察対象の視点を、記憶されている標準的な記述と一致するように精神的に回転させたときに獲得される。

マールと西原のモデルを拡張した、ビダーマン(1987)が提唱したコンポーネントによる認識理論では、物体から得られた視覚情報は、ブロックや円柱などの単純な幾何学的コンポーネント(「ジオオン」(幾何学的イオン)とも呼ばれる)に分割され、次に、メモリに保存されている最も類似した物体表現と照合されて、物体の識別が行われるとされている(図1参照)。[ 12 ]
視点依存理論は、物体の認識はそれが見える視点によって影響を受けることを示唆しており、新しい視点から見た物体は物体識別の精度と速度を低下させることを意味します。[ 13 ]この認識理論は、部分ではなくより全体的なシステムに基づいており、物体は複数の視点と角度で記憶に保存されることを示唆しています。この形式の認識は、各視点を保存する必要があるため、多くのメモリを必要とします。認識の精度は、観察された物体の視点がどれだけ馴染み深いかにも依存します。[ 14 ]
この理論は、物体認識は視点の連続体上にあり、それぞれの視点が異なるタイプの認識に利用されると提唱している。この連続体の一方の極では、視点依存メカニズムがカテゴリ内の識別に使用され、もう一方の極では、視点不変メカニズムが物体の分類に使用される。[ 13 ]

脳内での物体の視覚処理は、2 つの処理経路に分けられます。1 つは視覚皮質から頭頂葉に伸びる背側経路(how/where)、もう1 つは視覚皮質から下側頭皮質(IT)に伸びる腹側経路(what)です。これら 2 つの独立した視覚処理経路の存在は、Ungerleider と Mishkin (1982) によって最初に提唱されました。彼らは病変研究に基づいて、背側経路は物体の位置特定 (where) などの視覚空間情報の処理に関与し、腹側経路は視覚的な物体識別情報 (what) の処理に関与すると示唆しました。[ 15 ]この最初の提案以来、背側経路は、ここで処理される視覚空間情報が物体との相互作用方法に関する情報を提供するので、「how」経路として知られるべきであるという別の提案がなされています。[ 16 ]物体認識の目的においては、神経的な焦点は腹側経路にあります。
腹側経路内では、機能的画像研究において、機能的特化が示唆される様々な領域が観察されている。機能的特化を示すことが最も一貫して認められている脳領域は、物体と比較して顔に対する活性化が増加する紡錘状顔領域(FFA)、物体と比較して風景に対する活動が増加する傍海馬場所領域(PPA)、物体と比較して身体部位に対する活動が増加する外側線条体身体領域(EBA)、静止刺激と比較して動的な刺激に対する活動が増加するMT+/V5、およびスクランブルされた刺激と比較して識別可能な形状に対する活動が増加する外側後頭複合体(LOC)である。[ 17 ](参照:個々のカテゴリーの物体に対する神経処理)
The lateral occipital complex (LOC) has been found to be particularly important for object recognition at the perceptual structural level. In an event-related [fMRI-en] study that looked at the adaptation of neurons activated in visual processing of objects, it was discovered that the similarity of an object's shape is necessary for subsequent adaptation in the LOC, but specific object features such as edges and contours are not. This suggests that activation in the LOC represents higher-level object shape information and not simple object features.[18] In a related [fMRI-en] study, the activation of the LOC, which occurred regardless of the presented object's visual cues such as motion, texture, or luminance contrasts, suggests that the different low-level visual cues used to define an object converge in "object-related areas" to assist in the perception and recognition process.[19] None of the mentioned higher-level object shape information seems to provide any [semantic-en] information about the object as the LOC shows a neuronal response to varying forms including non-familiar, abstract objects.[20]
Further experiments have proposed that the LOC consists of a hierarchical system for shape selectivity indicating greater selective activation in the posterior regions for fragments of objects whereas the [anterior-en] regions show greater activation for full or partial objects.[21] This is consistent with previous research that suggests a hierarchical representation in the ventral temporal cortex where primary feature processing occurs in the posterior regions and the integration of these features into a whole and meaningful object occurs in the [anterior-en] regions.[22]
意味的関連付けにより、物体の認識が速くなります。物体が以前に何らかの意味と関連付けられていた場合、人はその物体を正しく識別しやすくなります。研究によると、意味的関連付けにより、物体がさまざまな角度から見られている場合でも、物体の認識がはるかに速くなります。物体が従来の視点からますますずれた角度で見られる場合、学習された意味的関連付けを持つ物体は、学習された意味的関連付けを持たない物体と比較して、反応時間が短くなりました。[ 23 ] したがって、物体の認識がますます難しくなると、意味的関連付けにより認識がはるかに容易になります。同様に、対象物体に単純に関連する動作を観察することで、被験者は物体を認識するように準備することができます。これは、物体が感覚的、運動的、意味的関連付けのセットを持ち、それによって人が物体を正しく認識できることを示しています。[ 24 ] これは、脳が物体を正確に識別しようとする際に複数の部分を利用するという主張を裏付けています。
[神経心理学的-en]患者から提供された情報から、構造的処理と[意味的-en]処理の間で認識処理の解離が特定されており、構造的情報、色、および関連情報が選択的に障害される可能性がある。あるPET研究では、関連意味処理に関与していることが判明した領域には、構造的情報と色情報と比較した場合の左前上/中側頭回と左側頭極、および色判断課題のみと比較した場合の右側頭極が含まれる。[ 25 ]これらの結果は、保存された知覚知識と意味知識が物体認識において別々の皮質領域に関与していること、および側頭領域に半球差があることを示している。
研究では、視覚的な意味情報が下側頭葉の紡錘状回に収束するという証拠も得られています。カテゴリと属性の意味知識を比較した研究では、認識への貢献の仕方において、それぞれ異なる役割を果たしていることが分かりました。カテゴリの比較では、生物は紡錘状回の外側領域を活性化しましたが、非生物は内側領域を活性化しました。属性の比較では、全体的な形状は右紡錘状回を活性化しましたが、局所的な詳細は左紡錘状回を活性化しました。これらの結果は、意味認識の処理において、物体のカテゴリの種類によって紡錘状回のどの領域が活性化されるかが決まるのに対し、物体の属性によって、全体的な形状が処理されるか局所的な詳細が処理されるかに応じて、左または右の紡錘状回の活性化が決まることを示しています。[ 26 ]
さらに、紡錘状回前部領域の活性化は認識の成功を示すと提唱されている。[ 27 ]しかし、活性化レベルは対象物の意味的関連性に依存することがわかっている。ここでいう意味的関連性とは、「概念の中核的な意味に対する意味的特徴の貢献度」を指す。 [ 28 ]結果によると、人工物などの意味的関連性の高い対象物は、自然物などの意味的関連性の低い対象物と比較して活性化の増加を引き起こした。[ 28 ]これは、自然物は人工物と比較して構造的特性が非常に似ているため識別が難しく、区別するのがより困難であるということが提案されているためである。[ 27 ]したがって、対象物が識別しやすいほど、認識に成功する可能性が高くなる。
物体認識の成功に影響を与えるもう 1 つの条件は、文脈的促進です。物体認識のタスク中、物体には、その物体の典型的な文脈に関する意味情報を提供する「文脈フレーム」が付随すると考えられています。[ 29 ]物体が文脈から外れている場合、物体が適切な文脈にある場合の認識タスクと比較して、反応時間が遅くなり、不正確さが大きくなるため、物体認識のパフォーマンスが阻害されることがわかっています。[ 29 ] [fMRI-en] を使用した研究の結果に基づいて、脳内に文脈的に関連付けられた物体の「文脈ネットワーク」があり、その活動は主に傍海馬皮質(PHC) と後部帯状皮質 (RSC) で見られると提案されています。[ 30 ] PHC 内では、傍海馬場所領域(PPA) の活動は、物体よりもシーンに優先することがわかっています。しかし、文脈促進課題における単独物体に対するPHCの活動は、物体が文脈的に表現されている空間シーンのその後の思考によるものである可能性が示唆されている。さらなる実験により、PHCでは非空間的文脈と空間的文脈の両方で活性化が見られたが、非空間的文脈からの活性化は前部PHCに限定され、空間的文脈では後部PHCに限定されていたことがわかった。[ 30 ]
人が物体を見たとき、過去に見たことがあるため、それが何であるかを知っています。これが認識記憶です。視覚経路の腹側(何)経路の異常は、物体を認識する能力だけでなく、物体が私たちに提示される方法にも影響します。視覚認識記憶の注目すべき特徴の 1 つは、その驚異的な容量です。1 つの試行で何千もの画像を見た後でも、人間はその後の記憶テストで高い精度でパフォーマンスを行い、見た画像に関するかなりの詳細を覚えています[ 31 ] 。
コンテキストによって、物体認識の精度が大幅に向上します。識別可能な物体がぼやけている場合、物体が馴染みのあるコンテキストに置かれると、認識の精度が大幅に向上します。さらに、馴染みのないコンテキストであっても、物体が単独で表示される場合と比較して、物体認識の精度が向上します。[ 32 ] これは、物体が通常、全くコンテキストがない状態ではなく、何らかのコンテキストの中で見られるという事実に起因します。物体が置かれているコンテキストが視聴者にとって馴染みのあるものである場合、物体が何であるかを判断するのがはるかに容易になります。コンテキストは正しく認識するために必須ではありませんが、特定の物体と関連付ける要素の一部です。
顔や感情を認識する際には、文脈が特に重要になります。文脈なしに顔の感情が提示された場合、示されている感情を正確に説明できる能力は、文脈が与えられた場合よりも著しく低くなります。この現象はすべての年齢層と文化において当てはまり、文脈がすべての人にとって顔の感情を正確に識別するために不可欠であることを示しています。[ 33 ]
親しみやすさは、認識したものが、その対象をどのような文脈で知っているかを探すのに時間を費やすことなく、ただ親しみを感じるという意味で、文脈に依存しないメカニズムです。[ 34 ]前頭葉の腹外側領域は、偶発的学習中の記憶の符号化、そしてその後の意味記憶の維持と想起に関与しています。 [ 34 ] 親しみやすさは、馴染みのない対象とは異なる知覚プロセスを誘発する可能性があり、これは、限られた数の馴染みのある対象に対する私たちの知覚がユニークであることを意味します。[ 35 ]典型的な視点や文脈からの逸脱は、対象が最も効果的に認識される効率に影響を与える可能性があります。[ 35 ]馴染みのある対象は、馴染みのない視点から見るよりも馴染みのある視点から見る方が効率的に認識されるだけでなく、この原則は新しい対象にも適用されることがわかりました。これは、脳内の対象物の表象が、環境で観察される対象物により馴染みのある方法で組織されているという考えにつながります。[ 35 ]認識は、物体の形状や視点だけでなく、動的な情報にも大きく左右されます。[ 36 ]親しみやすさは、動的な点光源ディスプレイ、動く物体、顔の性別、顔認識の知覚に役立ちます。[ 35 ]
記憶は親しみと多くの類似点を共有していますが、文脈に依存しており、調査対象の出来事からの特定の情報が必要です。[ 34 ]
物体認識能力の喪失は、視覚性物体失認と呼ばれます。視覚性物体失認には、大きく分けて統覚性失認と連合性失認の2種類があります。優位半球の病変によって物体失認が生じる場合、単語の意味の喪失など、深刻な言語障害を伴うことがよくあります。
物体認識は複雑な課題であり、脳の複数の異なる領域が関与しており、1つの領域だけではありません。1つの領域が損傷すると、物体認識が損なわれる可能性があります。物体認識の主な領域は側頭葉にあります。たとえば、ラットの周嗅皮質の病変は、特に特徴の曖昧さが増加すると、物体認識の障害を引き起こすことがわかりました。[ 37 ]新生児期の扁桃体複合体の吸引病変は、初期の海馬病変よりも大きな物体記憶喪失をもたらしたようです。しかし、成体サルでは、物体記憶障害は、扁桃体核の損傷よりも周嗅皮質と内嗅皮質の損傷によってよりよく説明されます。[ 38 ]ラットの扁桃体海馬複合(A + H)病変は、保持間隔が0秒を超えて増加し、テスト刺激がセッション内で繰り返された場合に、物体認識課題のパフォーマンスを損ないました。 [扁桃体-en]または[海馬-en]の損傷は物体認識に影響を与えないが、A + Hの損傷は明らかな欠損を引き起こす。[ 39 ]物体認識課題において、ラットの淡蒼球(基底核の一部)の電気分解病変では、無名質/腹側淡蒼球と比較して弁別レベルが有意に低く、無名質/腹側淡蒼球は対照群および内側中隔/ブローカ垂直対角帯群と比較してさらに悪かった。しかし、淡蒼球のみが新しい物体と既知の物体を弁別しなかった。[ 40 ]これらの病変は、脳内の物体の視覚処理の腹側(何)経路を損傷する。
失認症はまれな症状であり、脳卒中、認知症、頭部外傷、脳感染症、または遺伝性の結果である可能性があります。[ 41 ]知覚失認は、物体の知覚に欠陥があり、物体の意味を理解できない状態です。[ 34 ] 同様に、連合視覚失認は、物体の意味を理解できない状態ですが、この場合は意味記憶に欠陥があります。[ 34 ]これらの失認症はどちらも、マールの視覚理論のように、物体認識の経路に影響を与える可能性があります。より具体的には、知覚失認とは異なり、連合失認の患者は描画、模写、マッチングのタスクでより成功しますが、これらの患者は知覚はできるが認識できないことを示しています。[ 41 ]統合失認(連合失認のサブタイプ)は、別々の部分を統合して全体のイメージを形成することができない状態です。[ 34 ]これらのタイプの失認では、視覚処理経路の腹側(何)ストリームに損傷があります。物体方向失認とは、適切な物体認識にもかかわらず、物体の方向を抽出できない状態です。[ 34 ]このタイプの失認では、視覚処理経路の背側(どこ)ストリームに損傷があります。これは、馴染みのある物体の認識に影響を与え、馴染みのない物体や視点ではさらに影響が大きくなります。顔の認識の困難さは、相貌失認によって説明できます。相貌失認の人は顔を識別することはできませんが、年齢、性別、感情表現は認識できます。[ 41 ]顔認識を司る脳領域は、紡錘状顔領域です。相貌失認は、統覚型と連想型のサブタイプに分類することもできます。個々の椅子、車、動物の認識も損なわれる可能性があります。したがって、これらの物体は、紡錘状顔領域で認識される顔と同様の知覚的特徴を共有しています。[ 41 ]
意味表現におけるカテゴリと属性の区別は、アルツハイマー病(AD)など、意味記憶に影響を与える加齢や疾患状態における意味機能の評価に役立つ可能性がある。[ 42 ]意味記憶の障害により、アルツハイマー病患者は物体の認識に困難を抱える。これは、意味記憶が物体の命名や分類のための情報検索に使用されることが知られているためである。[ 43 ]実際、ADにおける意味記憶の障害が、特定のカテゴリや概念の意味知識の喪失を反映しているのか、知覚的特徴や属性の知識の喪失を反映しているのかについては、大きな議論がある。[ 42 ]
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)