音源定位とは、聞き手が感知した音の発生源の位置や方向、距離を特定する能力のことである。
哺乳類の聴覚系の音源定位メカニズムは、これまで広範に研究されてきた。聴覚系は、音源定位のために、両耳間の時間差やレベル差(または強度差)、スペクトル情報など、いくつかの手がかりを利用する。鳥類や爬虫類などの他の動物もこれらの手がかりを利用するが、その利用方法は異なる場合があり、また、耳の動きの影響など、人間の聴覚系には存在しない定位の手がかりを持つものもある。音源定位能力を持つ動物は、進化的に有利である。
音は、空気や水などの媒体を伝わる機械的振動の知覚結果です。圧縮と希薄化のメカニズムによって、音波は空気中を伝わり、外耳の耳介と耳甲介で反射し、外耳道に入ります。哺乳類では、音波が鼓膜を振動させ、中耳の3つの骨を振動させます。この振動によってエネルギーが卵円窓を通って蝸牛に送られ、コルチ器の有毛細胞によって化学信号に変換されます。有毛細胞は蝸牛神経を通って脳に伝わるらせん神経節線維とシナプスを形成します。
脊椎動物では、両耳間の時間差は脳幹の上オリーブ核で計算されることが知られています。ジェフレス[ 1 ]によると、この計算は遅延線に依存しています。遅延線とは、異なる接続軸索長で各耳から神経支配を受ける上オリーブ核のニューロンのことです。一部の細胞はもう一方の耳よりも直接的に接続されているため、特定の両耳間時間差に特化しています。この理論は、相互相関の数学的手順に相当します。しかし、ジェフレスの理論は、複数の同一の音のうち最初の音のみを使用して音の位置を決定する(反響による混乱を避ける)先行効果を説明できないため、この反応を完全に説明することはできません。さらに、小型哺乳類の脳幹および中脳で行われた最近の多くの生理学的観察により、ジェフレスの当初の考えの妥当性にかなりの疑問が生じています。[ 2 ]
両耳間レベル差(ILD)に敏感なニューロンは、片方の耳への刺激によって興奮し、もう片方の耳への刺激によって抑制されるため、細胞の応答の大きさは2つの入力の相対的な強さに依存し、それはさらに両耳における音の強度に依存する。
聴覚中脳核である下丘(IC)には、ILD(間欠的低強度)に敏感なニューロンの多くが、ILDに応じて最大スパイクからゼロスパイクまで急激に減少する応答関数を持つ。しかし、応答関数がはるかに緩やかで、ゼロスパイクまで減少しないニューロンも多数存在する。
音源定位とは、音源の位置を特定するプロセスです。脳は、音源の位置を特定するために、強度、スペクトル、タイミングの微妙な違いを利用します。[ 3 ] [ 4 ] [ 5 ]
音源の位置特定は、方位角または水平角、仰角または垂直角、距離(静止音の場合)または速度(移動音の場合)という3次元の位置で説明できます。[ 6 ]
音の方位は、両耳間の到達時間の差、高周波音の相対振幅(シャドウ効果)、および胴体、肩、耳介など体のさまざまな部分からの非対称なスペクトル反射によって示されます。[ 6 ]
距離の手がかりは、振幅の減少、高周波の減少、および直接信号と残響信号の比率である。[ 6 ]
音源の位置に応じて、私たちの頭は音色、強度、スペクトル特性を変化させる障壁として機能し、脳が音の発生源の位置を把握するのに役立ちます。[ 5 ]両耳間のこれらの微細な違いは、両耳間キューとして知られています。[ 5 ]
波長が長い低周波は、音を頭部の周囲で回折させ、脳が音源からの位相の手がかりだけに集中するように促します。[ 5 ]
ヘルムート・ハースは、最初に到達する波面を使用することで、元の波面よりも 10 デシベル大きい追加の反射音があっても音源を識別できることを発見しました。[ 5 ]この原理はハース効果として知られており、先行効果の特定のバージョンです。[ 5 ]ハースは、元の音と反射音のタイミングの 1 ミリ秒の差でさえ空間性を高め、脳が元の音の本当の位置を識別できるように測定しました。神経系はすべての初期反射を単一の知覚的全体と組み合わせることで、脳が複数の異なる音を同時に処理できるようにします。[ 7 ]神経系は、互いに約 35 ミリ秒以内の反射で、強度が似ているものを組み合わせます。[ 7 ]
聴覚系は、左右の入力方向(左、前、右)を判断するために、以下の耳からの信号情報を分析します。
1907年、レイリー卿は音叉を用いて単音励起を生成し、耳介のない人間の頭部モデルで側方音源定位理論を研究した。彼は、両耳間手がかり差に基づく音源定位理論を初めて発表した。これはデュプレックス理論として知られている。[ 8 ]人間の耳は頭の異なる側にあるため、空間座標が異なる。デュプレックス理論の図に示すように、音源と耳の間の距離が異なるため、両耳の音信号の間には時間差と強度差がある。これらの差をそれぞれ両耳間時間差(ITD)と両耳間強度差(IID)と呼ぶ。

二重理論の図から、音源B1または音源B2の場合、両耳間に伝搬遅延が生じ、ITDが発生することがわかります。同時に、人間の頭部や耳は高周波信号に対して遮蔽効果を持ち、IID(相互干渉)を引き起こす可能性がある。
800 Hz 未満の周波数では 、頭部の寸法 (耳間の距離 21.5 cm、両耳間の時間遅延 626 μs に相当) は音波の半波長 よりも小さい。そのため、聴覚系は混乱することなく両耳間の位相遅延を判別できる。この周波数範囲では、特に約 200 Hz 未満では両耳間のレベル差が非常に小さいため、レベル差のみに基づいて入力方向を正確に評価することはほぼ不可能である。周波数が 80 Hz 未満に低下すると、両耳間の位相差が方向評価には小さすぎるため、時間差またはレベル差のいずれを使用しても音の側方音源を決定することは困難または不可能になる。[ 12 ]
1600 Hz を超える周波数では、 頭部の寸法が音波の長さよりも大きくなります。これらの周波数では、両耳間位相のみに基づいて入力方向を明確に決定することはできません。しかし、両耳間レベル差は大きくなり、これらのレベル差は聴覚系によって評価されます。また、位相差と群遅延の組み合わせによって両耳間の遅延を検出することができ、これは高周波数でより顕著になります。つまり、音の開始がある場合、両耳間のこの開始の遅延を使用して、対応する音源の入力方向を決定できます。このメカニズムは、残響のある環境で特に重要になります。音の開始後、直接音が耳に到達するものの、反射音がまだ到達していない短い時間枠があります。聴覚系はこの短い時間枠を使用して音源の方向を評価し、反射と残響によって明確な方向推定が妨げられる限り、検出された方向を維持します。[ 13 ]上記のメカニズムでは、音源が聴取者の前方にあるか後方にあるかを区別することはできないため、追加の手がかりを評価する必要がある。[ 14 ]

デュプレックス理論では、ITDとIIDが音源定位において重要な役割を果たすとされていますが、側方定位の問題しか扱えません。例えば、2つの音源が人間の頭部の右側の前と後ろに左右対称に配置されている場合、コーンモデル効果と呼ばれる現象で、ITDとIIDは等しくなります。しかし、人間の耳はこれらの音源を区別することができます。さらに、自然な聴覚では、ITDやIIDがなくても、片耳だけで高い精度で音源を区別することができます。デュプレックス理論の欠点のため、研究者たちは耳介フィルタリング効果理論を提案しました。[ 15 ] [ 16 ]人間の耳介の形状は、複雑なひだを持つ凹面で、水平方向にも垂直方向にも非対称です。反射波と直接波は鼓膜上に音源に関連する周波数スペクトルを生成します。そして、聴神経はこの周波数スペクトルを使用して音源を定位します。[ 17 ]

耳介フィルタリング効果によって生成されるこれらのスペクトル情報は、頭部伝達関数(HRTF)として表すことができます。対応する時間領域の表現は、頭部インパルス応答(HRIR)と呼ばれます。HRTFは、自由音場から外耳道内の特定の点への伝達関数としても記述されます。HRTFは通常、LTIシステムとして認識されます。[ 9 ]
ここで、LとRはそれぞれ左耳と右耳を表す。そして左右の外耳道入口における音圧の振幅を表し、は、リスナーが存在しないときの頭部座標の中心における音圧の振幅です。一般に、HRTF はそして光源の角度位置の関数である仰角音源と頭部の中心との間の距離角速度頭部の等価寸法。
現在、HRTFデータベースの測定に取り組んでいる主な機関には、CIPIC [ 18 ]国際研究所、MITメディアラボ、オルデンブルク大学心理音響学大学院、ウィスコンシン大学マディソン校神経生理学研究所、NASAエイムズ研究所などがあります。正常聴力者と聴覚障害者、および動物のHRIRデータベースは一般に公開されています。
人間の外耳、すなわち耳介と外耳道の構造は、方向選択性フィルターを形成します。音の入力方向に応じて、異なるフィルター共振が活性化されます。これらの共振は、耳の周波数応答に方向固有のパターンを刻み込み、聴覚系はこれを音源定位のために評価します。頭部、肩、胴体における他の方向選択性反射と合わせて、これらは外耳伝達関数を形成します。耳の周波数応答におけるこれらのパターンは、外耳の形状と大きさによって大きく異なります。ヘッドホンを通して音が提示され、外耳表面の形状が異なる別の頭部で録音された場合、方向パターンはリスナー自身のものとは異なり、これらの異質な耳で正中面における方向を評価しようとすると問題が生じます。その結果、ダミーヘッド録音、あるいはバイノーラル録音と呼ばれるものを聴くと、前後の順列や頭内定位が生じる可能性があります。人間は高周波音は片耳で定位できるが、低周波音はできないことが示されている。しかし、低周波では両耳定位が可能であった。これは、耳介が小さく、高周波の音波としか相互作用しないためと考えられる。[ 19 ]人は、複雑で7,000 Hzを超える周波数を含む音の高度を正確に定位できるのは 耳介が存在する場合のみであるようだ。[ 20 ]
頭部が静止している場合、側方音源定位のための両耳性手がかり(両耳間時間差と両耳間レベル差)は、正中面における音の位置に関する情報を提供しません。側方方向が一定であれば、目の高さまたは任意の高さにある音によって同一のITDとILDが生成されます。しかし、頭部が回転すると、ITDとILDは動的に変化し、その変化は高さの異なる音によって異なります。たとえば、目の高さにある音源が正面にあり、頭部が左に回転すると、音は左耳よりも右耳で大きくなり(そして早く到達します)。しかし、音源が真上にある場合、頭部を回転させてもITDとILDに変化はありません。中間の高さでは中間的な変化が生じ、頭部の動き中に両耳への両耳性手がかりの提示が逆転すると、音はリスナーの後ろで聞こえることになります。[ 14 ] [ 21 ]ハンス・ワラック[ 22 ] は、頭部の動きに合わせて音の両耳キューを人工的に変化させた。音は客観的には目の高さに置かれたが、頭部が回転するにつれて ITD と ILD に生じる動的な変化は、音源が上昇した場合に生じる変化と同じであった。この状況では、音は合成された高さで聞こえた。音源が客観的には目の高さに留まっていたため、単耳キューでは高さを特定できず、頭部の動きに伴う両耳キューの動的な変化によって垂直方向の音源位置を正しく特定できたことが示された。頭部の動きは能動的に行う必要はなく、同様の設定で、目隠しをした被験者を回転椅子に座らせて受動的に頭部を回転させた場合でも、正確な垂直方向の音源位置特定が行われた。両耳キューの動的な変化が知覚される頭部の回転に伴っていれば、合成された高さが知覚された。[ 14 ]
人間の聴覚系には、音源までの距離を判断する能力が限られています。近距離では、極端な音量差(例えば、片耳にささやき声をかけた時など)や、近距離特有の耳介(耳の見える部分)の共鳴など、距離を判断するための手がかりがいくつかあります。
聴覚系は、音源までの距離を推定するために、以下の手がかりを利用します。
人間の聴覚系における音の処理は、いわゆる臨界帯域で行われます。聴覚範囲は24の臨界帯域に分割され、各帯域の幅は1バークまたは100メルです。方向分析では、臨界帯域内の信号がまとめて分析されます。
聴覚系は、妨害音の中から目的の音源の音を抽出することができます。これにより、他の話し手が話している場合でも、聞き手は1人の話し手に集中することができます(カクテルパーティー効果)。カクテルパーティー効果のおかげで、妨害する方向からの音は、目的の方向からの音に比べて減衰して聞こえます。聴覚系は信号対雑音比を最大15dBまで高めることができ、これは妨害音が実際の音量の半分(またはそれ以下)に減衰して聞こえることを意味します。
密閉された部屋では、音源からの直接音だけでなく、壁で反射した音も聞き手の耳に届きます。聴覚系は、音源定位のために最初に到着する直接音のみを分析し、後から到着する反射音は分析しません(第一波面の法則)。そのため、反響環境でも音源定位は可能です。この反響抑制は、外側毛帯背側核(DNLL)で起こります。[ 25 ]
直接音が優勢で方向評価に利用できる時間帯を特定するために、聴覚系は様々な臨界帯域における音量変化と知覚される方向の安定性を分析します。複数の臨界帯域で音量が急激に上昇し、知覚される方向が安定している場合、この急激な上昇は、新たに流入してきた、あるいは信号特性を変化させている音源の直接音によって引き起こされている可能性が高いです。聴覚系はこの短い時間帯を利用して、この音の方向と音量を分析します。反射音が少し遅れて到着すると、臨界帯域内の音量はそれほど強くは上昇しませんが、複数の反射方向の音が混ざり合うため、方向の手がかりが不安定になります。その結果、聴覚系は新たな方向分析を開始しません。
直接音から最初に検出された方向は、安定した方向情報と組み合わされた他の強いラウドネスアタックによって新たな方向分析が可能であることが示されるまで、発見された音源の方向として扱われます。(フランセン効果を参照)
この種の音源定位技術は、真の仮想ステレオシステムを提供します。[ 26 ] KEMAR などの「スマート」マネキンを使用して信号を収集したり、DSP 方法を使用して音源から耳への伝送プロセスをシミュレートしたりします。増幅、記録、送信後、受信した信号の 2 つのチャンネルがイヤホンまたはスピーカーを通して再生されます。この定位アプローチは、リスナーの聴覚器官を元の音場に転送することで、元の音場の空間情報を取得するために電気音響法を使用します。その最も大きな利点は、音響イメージが生き生きとして自然であることです。また、3D システムの音響イメージを再現するために必要なのは、2 つの独立した送信信号だけです。

この種のシステムの代表例としては、SRS Audio Sandbox、Spatializer Audio Lab、Qsound Qxpander が挙げられます。[ 26 ]これらは、HRTF を使用して、一般的なバイナリ チャネル ステレオ再生で、異なる方向から耳に届く音響信号をシミュレートします。そのため、反射音波をシミュレートして、空間と包囲感の主観的な感覚を向上させることができます。これらはパラ仮想化ステレオ システムであるため、主な目的はステレオ サウンド 情報をシミュレートすることです。従来のステレオ システムでは、人間の耳とはかなり異なるセンサーを使用します。これらのセンサーは異なる方向から音響情報を受信できますが、人間の聴覚システムと同じ周波数応答を持ちません。そのため、バイナリ チャネル モードを適用すると、人間の聴覚システムは 3D サウンド エフェクト フィールドを感じることができません。しかし、3D パラ仮想化ステレオ システムでは、このような欠点を克服しています。HRTF の原理を使用して、元の音場から音響情報を抽出し、一般的なイヤホンやスピーカーを通して、生き生きとした 3D サウンド フィールドを生成します。
マルチチャンネルステレオシステムでは多くの再生チャンネルが必要となるため、一部の研究者は再生チャンネル数を減らすためにHRTFシミュレーション技術を採用しました。[ 26 ]彼らはマルチチャンネルシステムで複数のスピーカーをシミュレートするために2つのスピーカーのみを使用します。このプロセスは仮想再生と呼ばれます。基本的に、このようなアプローチは両耳間差原理と耳介フィルタリング効果理論の両方を使用します。残念ながら、この種のアプローチは、5.1 / 7.1サラウンドサウンドシステムなどの従来のマルチチャンネルステレオシステムを完全に代替することはできません。これは、リスニングゾーンが比較的大きい場合、HRTFによるシミュレーション再生によって対称位置で音響イメージが反転する可能性があるためです。
ほとんどの動物は耳が2つあるため、人間の聴覚系の多くの効果は他の動物にも見られます。したがって、両耳間の時間差(両耳間の位相差)と両耳間のレベル差は、多くの動物の聴覚に役割を果たしています。しかし、これらの効果の定位への影響は、頭の大きさ、耳の距離、耳の位置、耳の向きに依存します。昆虫のような小さな動物は、耳の間隔が小さすぎるため、異なる技術を使用します。[ 27 ]定位を改善するために動物が音を発するプロセス、つまり生物学的なアクティブソナーについては、動物のエコーロケーションを参照してください。
耳が頭部の側面に位置する場合、人間の聴覚系と同様の側方定位の手がかりを利用できます。これは、低周波数では両耳間時間差(両耳間位相差)を評価し、高周波数では両耳間レベル差を評価することを意味します。両耳間位相差の評価は、明確な結果が得られる限り有効です。これは、耳間の距離が音波の長さの半分(最大1波長)よりも小さい場合に当てはまります。人間よりも頭の大きい動物の場合、両耳間位相差の評価範囲は低周波数側にシフトし、頭の小さい動物の場合は、この範囲は高周波数側にシフトします。
位置を特定できる最低周波数は、耳と耳の間の距離によって決まります。耳と耳の間の距離が大きい動物は、人間よりも低い周波数を特定できます。耳と耳の間の距離が小さい動物の場合、特定できる最低周波数は人間よりも高くなります。
耳が頭部の側面に位置する場合、高周波域で両耳間レベル差が生じ、これを定位タスクの評価に利用できます。一方、耳が頭部の頂部に位置する動物では、頭部による遮蔽効果が生じないため、評価可能な両耳間レベル差は大幅に減少します。これらの動物の多くは耳を動かすことができ、その耳の動きを側方定位の手がかりとして利用できます。
多くの哺乳類では、耳介の耳道入口付近に顕著な構造が存在します。その結果、方向依存共鳴が生じ、これは人間の聴覚系における正中面での定位と同様に、追加の定位手がかりとして利用できる可能性があります。動物が利用する追加の定位手がかりも存在します。
音源の正中面(音の高さ)における音源定位には、異なる高さに配置された2つの検出器を用いることもできます。しかし、動物の場合、音が十分に長く続く限り、頭を傾けるだけでおおよその高さ情報を得ることができます。これは、音源を正確に定位しようとする際に頭を片側に傾けるという生来の行動を説明するものです。時間差や振幅差の手がかりから2次元以上の空間で瞬時に音源定位を行うには、2つ以上の検出器が必要となります。
小さな寄生バエOrmia ochracea は、その独特な耳のため、音源定位実験のモデル生物となっています。この動物は小さすぎて、両耳に到達する音の時間差を通常の方法で計算することはできませんが、音源の方向を非常に高い精度で特定することができます。反対側の耳の鼓膜は機械的に直接接続されており、マイクロ秒以下の時間差を分解することができ[ 28 ] [ 29 ]、新しい神経符号化戦略を必要とします[ 30 ] 。Ho [ 31 ] は、カエルの結合鼓膜システムが、動物の頭部にわずかな到達時間と音圧レベルの差しか利用できない場合でも、両耳間の振動の不一致を増大させることができることを示しました。結合鼓膜構造に基づいた指向性マイクロホンの構築が進められています。
ほとんどのフクロウは夜行性または薄明薄暮性の猛禽類です。夜間に狩りをするため、視覚以外の感覚に頼らなければなりません。ロジャー・ペイン[ 32 ]の実験では、フクロウは熱や匂いではなく、獲物が出す音に敏感であることが示されています。実際、音の手がかりは、遠く離れた止まり木にいるネズミの位置を特定するために必要かつ十分です。これが機能するためには、フクロウは音源の方位角と仰角の両方を正確に特定できなければなりません。
イルカ(およびその他のハクジラ類)は、獲物の探知、識別、位置特定、捕獲にエコーロケーション を利用しています。イルカのソナー信号は、指向性が高く(3 dB ビーム幅が約 10 度)、広帯域(3 dB 帯域幅が通常約 40 kHz、ピーク周波数が 40 kHz ~ 120 kHz)、持続時間が短いクリック音(約 40 μs)を利用することで、3 次元の水中で複数の小さなターゲットの位置特定に適しています。イルカは、受動的にも能動的にも(エコーロケーションによって)音源の位置を特定でき、その解像度は約 1 度です。視覚とエコーロケーション間のクロスモーダルマッチングは、イルカがエコーロケーションによって探知された複雑な物体の空間構造を認識していることを示唆しており、これはおそらく個々の物体の特徴を空間的に分解し、物体の形状の全体的な表現に統合する必要があると考えられます。イルカは両耳のわずかな強度差や時間差にも敏感ですが、水平面と垂直面の両方で音源定位を行うために、発達した頭部関連伝達関数から得られる位置依存的なスペクトル手がかりを利用していることを示唆する証拠が増えています。非常に短い時間積分時間(264μs)により、さまざまな距離にある複数のターゲットの位置を特定できます。定位のための適応には、頭蓋骨、鼻嚢、額と顎の特殊な脂質構造の顕著な非対称性、および音響的に隔離された中耳と内耳が含まれます。
「バイノーラル」という用語は文字通り「両耳で聞く」という意味で、1859年に両耳で同じ音を聞く、または両耳でそれぞれ異なる2つの音を聞くという行為を指すために導入されました。ドイツの哲学者で心理学者のカール・シュトゥンプフ(1848-1936)が、それぞれの耳に異なる刺激を与えるダイコティック聴取と、両耳に同じ刺激を同時に与えるダイオティック聴取を区別したのは1916年のことでした。[ 33 ]
後に、両耳聴覚(二耳分離聴覚または両耳分離聴覚)が音源定位の手段であることが明らかになった。[ 33 ] [ 34 ]
両耳聴覚に関する科学的考察は、この現象がそう名付けられる前から始まっており、ウィリアム・チャールズ・ウェルズ(1757–1817)は、両眼視の研究に基づいて、 1792年に推測を発表した。[ 35 ]ジョヴァンニ・バッティスタ・ヴェントゥーリ(1746–1822)は、両耳または片耳を指で塞いで音源の位置を特定しようとする実験を行い、その内容を記述した。この研究はその後追跡されることはなく、人間の音源定位の仕組みが解明された後にようやく再発見された。[ 33 ] [ 35 ]レイリー卿(1842–1919)は、ヴェントゥーリが最初に行ったことを知らずに、ほぼ75年後に同じ実験を行い、結果を得た。[ 35 ]
チャールズ・ホイートストン(1802–1875)は光学と混色に関する研究を行い、聴覚についても研究しました。彼は、両耳に金属板を置き、それぞれを金属棒に接続した「マイクロホン」と呼ばれる装置を発明し、この装置を使って音を増幅しました。また、音叉を両耳に同時に、または別々に当てて、聴覚の仕組みを解明しようとする実験を行い、その結果を1827年に発表しました。[ 35 ]エルンスト・ハインリヒ・ウェーバー(1795–1878)、アウグスト・ゼーベック(1805–1849)、ウィリアム・チャールズ・ウェルズも、後に両耳聴覚として知られるようになるものと、一般的な両眼統合の原理との比較検討を試みました。[ 35 ]
両耳間の音信号の違いが、音源定位と方向認識を可能にする聴覚処理にどのように寄与するかについての理解は、1859年にサマービル・スコット・アリソンが聴診器を発明し、「両耳性」という用語を作り出した後、著しく進歩しました。アリソンは、ルネ・テオフィル・イアサント・ラエンネック(1781~1826)が発明した聴診器を基に聴診器を考案しました。聴診器には2つの独立した「ピックアップ」があり、ユーザーは2つの異なる場所から得られた音を聞いて比較することができました。[ 35 ]
たとえば、横75度から発生する音の場合、MAAは約7度になります。