視覚とは、光を検知し、それを利用して周囲の環境の像を形成する能力のことです。[ 1 ]像の形成を伴わない光検出は、光感知に分類されます。ほとんどの脊椎動物では、視覚は明所視(昼間の視覚)または暗所視(夜間の視覚)によって可能になりますが、ほとんどの脊椎動物は両方を備えています。視覚は、環境内の物体によって反射された、または光源から放出された可視スペクトル内の光(光子)を検出します。可視光の範囲は、人間が容易に知覚できる範囲によって定義されますが、人間以外の動物の視覚は、しばしば可視スペクトルを超えて広がります。結果として生じる知覚は、視覚、視力、または眼(形容詞はそれぞれvisual、optical、ocular )としても知られています。視覚に関わるさまざまな生理学的要素は、まとめて視覚系と呼ばれ、言語学、心理学、認知科学、神経科学、分子生物学における多くの研究の焦点となっており、これらはまとめて視覚科学と呼ばれています。
視覚知覚は、脳が視覚入力を単に記録するのではなく、感覚情報を解釈して整理する能動的なプロセスです。[ 2 ]知覚は、事前の知識、期待、文脈情報などの要因によって影響を受け、視覚系が周囲の環境の意味のある表現を構築することを可能にします。[ 3 ]
視覚的知覚には、私たちが見るものだけでなく、脳がどのように情報を処理するかも含まれており、それは生涯の経験と変化する認知能力の両方によって適応的に影響を受けます。[ 4 ] [ 5 ]
ほとんどの脊椎動物は、同様の視覚システムによって視覚を得ています。一般的に、光は角膜を通って眼に入り、レンズによって眼の奥にある光感受性膜である網膜に焦点を合わせます。網膜にある特殊な光受容細胞は変換器として働き、光を神経インパルスに変換します。光受容体は大きく錐体細胞と桿体細胞に分類され、それぞれ明所視と暗所視を可能にします。これらの光受容体の信号は、視神経によって網膜から脳の中央神経節に伝達されます。外側膝状体は、情報を視覚皮質に伝達します。網膜からの信号は、網膜から上丘にも直接伝達されます。[ 6 ]
外側膝状体は、一次視覚野(線条皮質とも呼ばれる)に信号を送ります。線条外皮質(視覚連合皮質とも呼ばれる)は、線条皮質から、また互いに情報を受け取る皮質構造の集合です。[ 7 ]最近の視覚連合皮質の記述では、腹側経路と背側経路の 2 つの機能経路への分割が説明されています。この推測は、 2 つのストリーム仮説として知られています。
視覚における大きな問題は、人が見るものが網膜刺激(つまり網膜上の画像)を脳が変換して基本情報を変化させただけのものではないという点にある。そのため、知覚に関心を持つ人々は、視覚処理が実際に何が見えるのかを説明するのに長年苦労してきた。

古代ギリシャには、視覚の仕組みについて原始的な説明を提供する二つの主要な学派が存在した。
一つ目は、視覚の「放射説」であり、これは、光線が目から発せられ、視覚対象物に当たることで視覚が生じるという考え方である。対象物を直接見る場合、それは目から出た光線が再び対象物に当たることによって生じる。しかし、屈折像もまた、目から出た光線が空気中を通過し、屈折した後、目から出た光線の動きの結果として見える対象物に当たることによって生じる。この理論は、ユークリッドの『光学』やプトレマイオスの『光学』の信奉者である学者たちによって支持された。
第二の学派は、いわゆる「侵入」アプローチを提唱し、視覚は対象物を代表する何かが目に入ることによって生じると考えました。主な提唱者であるアリストテレス(『感覚について』)[ 8 ]とその追随者たち[ 8 ]によって、この理論は視覚が実際に何であるかについての現代の理論と何らかの接点があるように見えますが、実験的根拠を欠いた単なる推測にとどまりました。
入射説の最も決定的な発展は、11世紀の学者イブン・アル=ハイサム(アルハゼン)の研究からもたらされた。彼は著書『光学の書』(Kitāb al-Manāẓir、1021年頃)で、ユークリッドとプトレマイオスの反射説とアリストテレスの純粋に思弁的な説明の両方を否定した。体系的な実験を通して、彼は物体から反射された光線が目に入り、レンズによって網膜に焦点を結ぶことで視覚が生じることを実証した。この経験的なアプローチは転換点となった。アルハゼンは入射説による視覚の最初の正しい説明を提供しただけでなく[ 9 ]、ロジャー・ベーコン、ケプラー、そして最終的にはニュートンといった後のヨーロッパの学者に影響を与えた実験方法も導入した[ 10 ] [ 11 ]。
どちらの学派も「似たものは似たものによってのみ認識される」という原理に基づいており、したがって、目は可視光の「外的な火」と相互作用して視覚を可能にする何らかの「内的な火」で構成されているという考えに基づいていた。プラトンは対話篇『ティマイオス』(45bと46b)でこの主張をしており、エンペドクレスも同様である(アリストテレスが『感覚について』 、DK断片B17で報告している)。 [ 8 ]

アルハゼン(965年頃 - 1040年頃)は、視覚に関する多くの調査と実験を行い、プトレマイオスの両眼視に関する研究を拡張し、ガレノスの解剖学に関する著作にコメントしました。[ 12 ] [ 13 ]彼は、光が物体に反射して目に届くことで視覚が生じることを初めて説明した人物です。[ 14 ]
レオナルド・ダ・ヴィンチ(1452年 - 1519年)は、目の特別な光学的特性を最初に認識した人物と考えられています。彼は「人間の目の機能は…多くの著者が特定の方法で説明してきたが、私は全く異なることを発見した」と書いています。彼の主な実験的発見は、視線、つまり中心窩で終わる光学線においてのみ、明確で鮮明な視覚が得られるということでした。彼はこれらの言葉を文字通りに使用したわけではありませんが、実際には中心窩視覚と周辺視覚の現代的な区別の父と言えます。[ 15 ]
アイザック・ニュートン(1642年~1726/27年)は、プリズムを通過する光のスペクトルから個々の色を分離する実験を通して、物体の視覚的に知覚される色は物体が反射する光の性質によって生じること、そしてこれらの分離された色は他の色に変えることはできないことを初めて発見した。これは当時の科学的予想に反するものであった。[ 16 ]
ヘルマン・フォン・ヘルムホルツは、視覚知覚に関する最初の近代的な研究を行った人物としてしばしば評価されている。ヘルムホルツは人間の目を調べ、質の高い画像を生成する能力がないと結論付けた。情報が不十分なため、視覚は不可能であるように思われた。そのため、彼は視覚は「無意識の推論」の何らかの形態の結果であると結論付け、1867年にその用語を造語した。彼は、脳が過去の経験に基づいて、不完全なデータから仮定と結論を導き出していると提唱した。[ 17 ]
推論には、世界に関する事前の経験が必要である。
視覚経験に基づくよく知られた仮定の例としては、以下のようなものがある。
視覚錯覚(推論過程が誤っている場合)の研究は、視覚系がどのような仮定に基づいて行動しているかについて多くの洞察をもたらしてきた。
(確率に基づく)別のタイプの無意識的推論仮説は、最近、いわゆるベイズ的視覚研究で復活した。[ 19 ]このアプローチの支持者は、視覚系が感覚データから知覚を導き出すために何らかの形のベイズ推論を実行すると考えている。しかし、この見解の支持者が原理的に、ベイズ方程式に必要な関連確率をどのように導き出すかは明らかではない。この考えに基づくモデルは、動きの知覚、奥行きの知覚、図地知覚など、さまざまな視覚的知覚機能を記述するために使用されてきた。[ 20 ] [ 21 ]「完全に経験的な知覚理論」は、ベイズ形式を明示的に呼び起こさずに視覚的知覚を合理化する、関連する新しいアプローチである。
1930年代と1940年代を中心に活動したゲシュタルト心理学者たちは、今日視覚科学者によって研究されている多くの研究課題を提起した。[ 22 ]
ゲシュタルト組織法則は、人々が視覚要素を多くの異なる部分ではなく、組織化されたパターンまたは全体としてどのように認識するかの研究を導いてきました。「ゲシュタルト」はドイツ語で、「構成またはパターン」と「全体または出現構造」に部分的に翻訳されます。この理論によれば、視覚システムが自動的に要素をパターンにグループ化する方法を決定する8つの主要な要因があります。近接性、類似性、閉鎖性、対称性、共通の運命(つまり共通の動き)、連続性、および良いゲシュタルト(規則的で単純で秩序だったパターン)と過去の経験です。[ 23 ]
ジョージ・バークレーの足跡をたどって、オーストラリアの哲学者コリン・マレー・ターベインは、視覚知覚に関する古典的な「幾何学的モデル」に代わるものを提唱し、そのモデルの側面がユークリッドの時代以来、視覚に対する私たちの理解を不必要に曇らせてきたと主張した。彫刻家ナウム・ガボの言葉を引用して、彼はこう述べている。「線、形、色、動きにはそれぞれ独自の言語があるが、それを読むには時間がかかる。見るだけでは十分ではない。見なければならない。そして「見る」とは「読む」ことを意味する。 」 [ 24 ]ターベインは、「言語モデルは、私たちがどのように見るかというこの古くからの問題に特に光を当て、その偉大なライバルによってかすかに照らされた暗い領域に明るい光を当てる」と主張した。[ 25 ]具体的には、彼は、視覚の純粋に機械論的な説明に見られる限界を強調し、いくつかの「視覚的錯覚」の事例は、そのような言語モデルに見られる用語を利用することによってより適切に説明できると主張した。このことを念頭に置いて、彼は「バローヴィアン症例」、「水平月」の事例、「反転網膜像」の事例など、視覚の歪みの具体的な例の比較分析を提示した。[ 26 ] [ 24 ] [ 27 ]

1960年代には、技術開発により、読書中[ 28 ]、画像鑑賞中[ 29 ]、そして後には視覚的な問題解決中[ 30 ] 、さらにヘッドセットカメラが利用可能になると運転中[ 31 ]にも眼球運動を継続的に記録することが可能になった。
右の図は、視覚検査の最初の 2 秒間に何が起こるかを示しています。背景は周辺視野を表して焦点が合っていないため、最初の眼球運動は男性のブーツに向かいます (これは、ブーツが最初の注視点に非常に近く、適切なコントラストを持っているためです)。眼球運動は注意選択の機能を果たします。つまり、すべての視覚入力の一部を選択して、脳によるより深い処理を行います。[ 32 ]
以下の視線固定は顔から顔へと飛び移る。顔同士の比較さえも可能にするかもしれない。[ 33 ]
結論として、アイコンの顔は周辺視野において非常に魅力的な検索アイコンであると言える。中心窩視は周辺視野の第一印象に詳細な情報を加える。
また、眼球運動には、注視眼球運動(微小サッケード、眼球ドリフト、振戦)、輻輳運動、サッケード運動、追跡運動など、さまざまな種類があることも指摘できます。注視とは、眼球が静止する比較的静的な点のことです。しかし、眼球は決して完全に静止することはなく、視線の位置はドリフトします。これらのドリフトは、微小サッケードと呼ばれる非常に小さな注視眼球運動によって修正されます。輻輳運動は、両眼が協力して、画像が両網膜の同じ領域に映るようにする運動です。これにより、焦点の合った単一の画像が得られます。サッケード運動は、ある位置から別の位置へジャンプするタイプの眼球運動で、特定のシーンや画像を素早くスキャンするために使用されます。最後に、追跡運動は滑らかな眼球運動で、動いている物体を追うために使用されます。[ 34 ]
顔認識と物体認識は異なるシステムによって行われるという証拠がかなりある。例えば、相貌失認患者は顔処理に障害があるが物体処理には障害がないのに対し、物体失認患者(特に患者CK)は物体処理に障害があるが顔処理は保たれている。[ 35 ]行動的には、顔は反転効果を受けるが物体は受けないことが示されており、顔は「特別」であるという主張につながっている。[ 35 ] [ 36 ]さらに、顔処理と物体処理は異なる神経系を動員する。[ 37 ]注目すべきことに、人間の脳が顔処理に特化しているように見えるのは、真の領域特異性を反映しているのではなく、特定の刺激クラス内での専門家レベルの識別というより一般的なプロセスを反映していると主張する人もいるが、[ 38 ]この後者の主張は大きな議論の対象となっている。Doris TsaoらはfMRIと電気生理学を用いて、マカクザルの顔認識の脳領域とメカニズムを記述した。 [ 39 ]
下側頭皮質は、異なる物体の認識と区別のタスクにおいて重要な役割を果たします。MIT の研究によると、下側頭皮質のサブセット領域が異なる物体を担当しています。[ 40 ]皮質の多くの小さな領域の神経活動を選択的に遮断すると、動物は特定の物体のペアを交互に区別できなくなります。これは、下側頭皮質が異なる特定の視覚的特徴に反応する領域に分かれていることを示しています。同様に、皮質の特定のパッチと領域は、他の物体の認識よりも顔の認識に深く関わっています。
いくつかの研究では、均一な全体像ではなく、脳が画像内の物体を認識する必要があるときには、物体の特定の特徴や関心領域が重要な要素となる傾向があることが示されています。[ 41 ] [ 42 ]このように、人間の視覚は、物体の輪郭の乱れ、テクスチャの変更、または画像の重要な領域のわずかな変化など、画像の小さな特定の変化に対して脆弱です。[ 43 ]
長期間の失明後に視力が回復した人々の研究によると、彼らは必ずしも物体や顔を認識できるわけではない(色、動き、単純な幾何学的形状とは対照的に)。幼少期に失明すると、これらの高次のタスクに必要な視覚システムの一部が適切に発達しないという仮説もある。[ 44 ]臨界期は5歳か6歳まで続くという一般的な考えは、高齢の患者でも長年の露出によってこれらの能力を改善できることを発見した2007年の研究によって覆された。[ 45 ]
1970年代、デイビッド・マーは視覚の多層理論を開発し、さまざまな抽象度レベルで視覚のプロセスを分析しました。視覚における特定の問題の理解に焦点を当てるために、彼は計算レベル、アルゴリズムレベル、実装レベルの3つの分析レベルを特定しました。トマソ・ポッジョを含む多くの視覚科学者は、これらの分析レベルを受け入れ、計算論的観点から視覚をさらに特徴づけるためにこれらを使用しました。[ 46 ]
計算レベルでは、視覚系が克服しなければならない問題を、高度な抽象度で扱います。アルゴリズムレベルでは、これらの問題を解決するために用いられる戦略を特定しようとします。そして最後に、実装レベルでは、これらの問題に対する解決策が神経回路においてどのように実現されるかを説明しようとします。
マールは、これらのどのレベルにおいても視覚を独立して研究することが可能だと示唆した。マールは、視覚は(網膜上の)二次元的な視覚配列から、出力としての三次元的な世界記述へと進むと説明した。彼の視覚の段階には以下が含まれる。
Marr の 2 1/2 D スケッチは、奥行きマップが構築され、このマップが 3D 形状知覚の基礎であると仮定しています。しかし、立体視と絵画的知覚、および単眼視の両方から、3D 形状の知覚は点の奥行きの知覚に先行し、それに依存しないことが明らかです。予備的な奥行きマップが原理的にどのように構築できるか、またこれが図と地の組織化やグループ化の問題にどのように対処するかは明らかではありません。Marr が見落とした知覚的組織化制約が、両眼視された 3D オブジェクトからの 3D 形状知覚の生成において果たす役割は、3D ワイヤー オブジェクトの場合に経験的に実証されています。例: [ 48 ] [ 49 ]より詳細な議論については、Pizlo (2008) を参照してください。[ 50 ]
より最近の代替フレームワークでは、視覚は符号化、選択、復号化の 3 つの段階で構成されていると提案されています。[ 51 ]符号化は、視覚入力をサンプリングして表現することです (例えば、視覚入力を網膜の神経活動として表現する)。選択、または注意選択は、入力情報のごく一部を選択してさらに処理することです。例えば、視線を対象物や視覚的位置に移動して、その位置の視覚信号をより適切に処理します。復号化は、選択された入力信号を推論または認識することです。例えば、視線の中心にある対象物を誰かの顔として認識します。このフレームワークでは、[ 52 ]注意選択は視覚経路に沿って一次視覚皮質から始まり、注意の制約により、視覚認識または復号化のために中心視野と周辺視野の間に二分法が課されます。
変換とは、環境刺激からのエネルギーが神経活動に変換される過程のことです。網膜には、光受容体層、双極細胞層、神経節細胞層の 3 つの異なる細胞層があります。変換が行われる光受容体層は、レンズから最も遠い位置にあります。光受容体層には、桿体と錐体と呼ばれる感度の異なる光受容体が含まれています。錐体は色の知覚を担っており、赤、緑、青の 3 つの異なるタイプがあります。桿体は、暗い場所での物体の知覚を担っています。[ 53 ]光受容体には、ラメラ膜に埋め込まれた光色素と呼ばれる特殊な化学物質が含まれています。1 つの人間の桿体には、約 1000 万個の光色素が含まれています。光色素分子は、オプシン(タンパク質) とレチナール(脂質) の 2 つの部分から構成されています。[ 54 ]可視光のスペクトル全体に反応する 3 つの特定の光色素 (それぞれ独自の波長感度を持つ) があります。適切な波長(特定の光色素が感度を持つ波長)が光受容体に当たると、光色素は2つに分裂し、双極細胞層に信号を送ります。双極細胞層はさらに神経節細胞に信号を送り、神経節細胞の軸索が視神経を形成し、脳に情報を伝達します。遺伝的異常により特定の錐体細胞が欠損または異常な場合、色覚異常(色盲とも呼ばれる)が発生します。[ 55 ]
変換とは、光受容体から双極細胞を経て神経節細胞へと送られる化学的なメッセージの伝達のことです。複数の光受容体が1つの神経節細胞に情報を送ることがあります。神経節細胞には赤緑神経と黄青神経の2種類があります。これらのニューロンは、刺激を受けていなくても常に発火しています。脳は、これらのニューロンの発火頻度が変化することで、さまざまな色(そして多くの情報とともに画像)を解釈します。赤色の光は赤錐体を刺激し、赤緑神経節細胞を刺激します。同様に、緑色の光は緑錐体を刺激し、緑赤神経節細胞を刺激し、青色の光は青錐体を刺激し、青黄神経節細胞を刺激します。神経節細胞の発火頻度は、一方の錐体から信号が送られると増加し、もう一方の錐体から信号が送られると減少(抑制)します。神経節細胞の名前の最初の色は、その細胞を興奮させる色であり、2番目の色は、その細胞を抑制する色です。例えば、赤錐体は赤緑神経節細胞を興奮させ、緑錐体は赤緑神経節細胞を抑制します。これは拮抗過程です。赤緑神経節細胞の発火頻度が増加すると、脳は光が赤色であると認識し、発火頻度が減少すると、脳は光が緑色であると認識します。[ 55 ]
人工視覚認識は進化しており、機械に単に物体を見つけるだけでなく、シーンを理解するように教え、視覚に関する世渡りの知恵を与えている。[ 56 ]
視覚認識に関する理論と観察は、コンピュータビジョン(マシンビジョン、またはコンピュテーショナルビジョンとも呼ばれる)の主な着想源となっている。特殊なハードウェア構造とソフトウェアアルゴリズムによって、機械はカメラやセンサーから送られてくる画像を解釈する能力を獲得する。
{{cite book}}:|website=無視されました (ヘルプ)