3D 音源定位とは、3 次元空間で音源の位置を特定する音響技術を指します。音源の位置は通常、到来する音波の方向 (水平および垂直の角度) と音源とセンサー間の距離によって決まります。センサーの構造配置設計と信号処理技術が関係します。
ほとんどの哺乳類(人間を含む)は、両耳聴覚を使用して音源の位置を特定します。これは、各耳から受信した情報を、かなりの量の合成を伴う複雑なプロセスで比較することによって行われます。特に3D 空間では、片耳聴覚を使用して音源の位置を特定するのは困難です。
テクノロジー
音源定位技術は、補聴器、監視[1]、ナビゲーションなどのオーディオおよび音響分野で使用されています。既存のリアルタイムパッシブ音源定位システムは、主に到達時間差(TDOA )アプローチに基づいており、音源定位を2次元空間に限定しており、騒音下では実用的ではありません。
アプリケーション

音源定位の応用には、音源分離、音源追跡、音声強調などがあります。ソナーは音源定位技術を使用してターゲットの位置を特定します。3D音源定位は、効果的な人間とロボットの相互作用にも使用されます。ロボット聴覚の需要が高まるにつれて、ヒューマンマシンインターフェース、障害者補助、軍事用途など、3D音源定位のいくつかのアプリケーションが検討されています。[2]
音源定位の手がかり
音源定位の手がかり[3]は音源を定位するのに役立つ特徴である。音源定位の手がかりには、両耳用の手がかりと片耳用の手がかりがある。
- モノラルキューはスペクトル分析によって取得でき、通常は垂直方向の定位に使用されます。
- 両耳キューは、左耳と右耳の聴覚の違いによって生成されます。これらの違いには、両耳間時間差(ITD) と両耳間強度差 (IID) が含まれます。両耳キューは主に水平方向の位置特定に使用されます。
音をローカライズするにはどうすればいいでしょうか?
聴覚が最初に使う手がかりは両耳間の時間差です。私たちの真正面または真後ろにある音源からの音は両耳に同時に届きます。音源が左または右に移動すると、私たちの耳は同じ音源からの音を両耳に拾いますが、ある程度の遅れがあります。別の言い方をすれば、両耳が同じ信号の異なる位相を拾っているとも言えます。[4]
方法
3D サウンドの定位にはさまざまな方法があります。たとえば、次のようになります。
- マイクロフォンアレイや両耳聴覚ロボットヘッドなどのさまざまなタイプのセンサー構造。 [5]
- ニューラル ネットワーク、最大尤度、複数信号分類(MUSIC)など、最適な結果を得るためのさまざまな手法。
- 音響ベクトルセンサー(AVS)アレイを使用したリアルタイム手法[6]
- スキャン技術[7]
- オフライン方式(適時性による)
- マイクロフォンアレイアプローチ
ステアリングビームフォーマーアプローチ
このアプローチでは、信頼性加重位相変換 (RWPHAT) によって強化されたステアリング ビームフォーマーと組み合わせた 8 つのマイクを使用します。最終結果は、音源を追跡して誤った方向を防止する パーティクル フィルターによってフィルタリングされます。
この方法を使用する動機は、以前の研究に基づいています。サウンドトラッキングとローカリゼーションは単一の音源にのみ適用されますが、この方法は複数の音源のトラッキングとローカリゼーションに使用されます。
ビームフォーマーベースの音源定位
遅延加算ビームフォーマーの出力エネルギーを最大化するために、あらゆる方向に向けられたビームフォーマーの出力の最大値を見つけます。信頼性加重位相変換(RWPHAT)法を使用すると、Mマイク遅延加算ビームフォーマーの出力エネルギーは
ここで、E はエネルギー、K は定数であり、信頼性加重位相変換によって定義される マイクロフォン ペアの相互相関です。
加重係数は各周波数成分の信頼性を反映し、ウィーナーフィルタゲインとして定義されます。ここで、は、決定指向アプローチを使用して計算された、時間枠におけるマイクロフォンでの周波数に対する事前SNRの推定値です。 [8]
はマイクロフォン からの信号であり、はマイクロフォンの到着遅延である。この方法のより具体的な手順は、ValinとMichaud [9]によって提案されている。
この方法の利点は、音の方向を検出し、音源の距離を導き出すことです。ビームフォーミング アプローチの主な欠点は、移動するスピーカーを使用するニューラル ネットワーク アプローチと比較して、音源定位の精度と機能が不完全であることです。
共存型マイクロフォンアレイアプローチ
この方法は、音響ベクトル センサー (AVS) アレイを利用したリアルタイム音源定位の技術に関連しており、圧力情報と伝播する音響場の遅延のみを利用する従来の音響センサー アレイとは異なり、音響粒子速度の 3 つのコンポーネントすべてと音圧を測定します。この追加情報を利用することで、AVS アレイは音源定位の精度を大幅に向上させることができます。
音響ベクトルアレイ

• 直交して配置された 3 つの音響粒子速度センサー (X、Y、Z 配列として表示) と 1 つの全方向性音響マイク (O) が含まれています。
• 空中[10]と水中の両方で一般的に使用されます。
• オフラインキャリブレーションプロセス[11]と組み合わせて使用することで、X、Y、Z、Oアレイのインパルス応答を測定および補間し、それらのステアリングベクトルを取得できます。
音声信号は最初に長方形のウィンドウを使用してウィンドウ化され、次に各セグメント信号がフレームとして作成されます。 XYZO アレイから 4 つの並列フレームが検出され、DOA 推定に使用されます。 4 つのフレームは同じサイズの小さなブロックに分割され、ハミング ウィンドウと FFT を使用して各ブロックが時間領域から周波数領域に変換されます。 次に、このシステムの出力は、結合された 3D 空間スペクトルのピークによって検出される音源の水平角度と垂直角度で表されます。
このアレイの利点は、従来のマイクロフォンアレイと比較して、開口部が小さくても高性能であり、複数の低周波および高周波の広帯域音源を同時に特定できることです。O アレイを適用すると、振幅や時間差など、より多くの音響情報を利用できるようになります。最も重要なのは、XYZO アレイは小型でありながら優れた性能を備えていることです。
AVS は、共存する複数のマイクロフォン アレイの一種であり、複数のアレイによって音の方向を推定する複数のマイクロフォン アレイ アプローチを使用し、異なるアレイが交差する場所で方向が検出される場所などの反射情報を使用して位置を見つけます。
高度なマイクロフォンアレイの目的
実際の環境では音の反射は常に発生し、マイクロホンアレイ[12]ではそれらの反射を避けることはできません。この複数のアレイアプローチは天井に固定されたアレイを使用してテストされましたが、移動シナリオのパフォーマンスはまだテストする必要があります。
マルチマイクアレイの適用方法を学ぶ
方向を推定する際に角度の不確実性 (AU) が発生し、アレイとソース間の距離が増加すると位置の不確実性 (PU) も悪化します。次のことがわかっています。
ここで、r はアレイの中心からソースまでの距離、AU は角度の不確実性です。測定は、2 つの方向がどこかで交差するかどうかを判断するために使用されます。2 本の線間の最小距離:
ここで、およびは 2 つの方向、検出された方向に平行なベクトル、およびは配列の位置です。
もし
2 本の線が交差していると判断されます。2 本の線が交差している場合、次の式を使用して音源の位置を計算できます。
は音源位置の推定、は各方向が最短距離の線と交差する位置、は重み係数です。重み係数として、アレイから最短距離の線までの または を使用します。
スキャン技術

スキャンベースの技術は、単一のセンサーと位置追跡システムのみを使用するため、時間的に定常な音源の位置を特定して視覚化するための強力なツールです。これを実現するための一般的な方法の 1 つは、3D トラッカーと組み合わせて、3D サウンド インテンシティ プローブとも呼ばれる音響ベクトル センサー (AVS) を使用することです。
測定手順では、AVS センサーを手動で音源の周囲に動かしながら、ステレオ カメラを使用して 3 次元空間におけるセンサーの瞬間的な位置を抽出します。記録された信号は複数のセグメントに分割され、空間離散化アルゴリズムを使用して一連の位置に割り当てられます。これにより、音圧と 3 つの直交する音響粒子速度の組み合わせを使用して、音場全体の音響変化のベクトル表現を計算できます。
AVS 分析の結果は、テスト対象のオブジェクトの 3D スケッチ上に表示され、オブジェクトまたは環境の 3D メッシュの周囲の音の分布を視覚的に表現できます。これにより、音の分布と周囲の環境との相互作用を詳細に理解できるため、建築音響、騒音制御、オーディオ エンジニアリングなどのさまざまな分野で音源の位置を特定するのに役立ちます。
両耳聴覚の学習法

バイノーラル聴覚学習[5]はバイオニック手法である。センサーは、人工耳介(反射器)とともに 2 つのセンサーマイクを備えたロボットダミーヘッドである。ロボットヘッドには 2 つの回転軸があり、水平方向と垂直方向に回転できる。反射器は、入ってくるホワイトノイズ音波のスペクトルを特定のパターンに変更し、このパターンが垂直方向の位置特定に用いられる。水平方向の位置特定に用いられる手がかりは ITD である。このシステムは、安定したホワイトノイズ音源とともにヘッドを回転させ、スペクトルを分析することにより、ニューラルネットワークを用いた学習プロセスを利用する。実験では、このシステムは特定の範囲の到来角で音源の方向をうまく識別できることが示されている。反射器のスペクトルパターンが崩れているため、範囲外の音は識別できない。バイノーラル聴覚では 2 つのマイクのみを使用し、複数のノイズ源の中から 1 つの音源に集中することができる。
頭部伝達関数 (HRTF)
実際の音源定位では、2つの耳介に加えて、ロボットの頭部と胴体が機能的な役割を果たします。これは空間線形フィルタリングとして機能し、フィルタリングは常に頭部伝達関数(HRTF)の観点から定量化されます。[14] HRTFは、両耳聴覚モデルであるロボットの頭部センサーも使用します。HRTFは、定位のためのさまざまな手がかりに基づいて導き出すことができます。HRTFを使用した音源定位は、HRTFに基づいて設計されたフィルターを使用して入力信号をフィルタリングすることです。ニューラルネットワークを使用する代わりに、頭部伝達関数が使用され、定位は単純な相関アプローチに基づいています。
詳細については、「頭部伝達関数」を参照してください。
クロスパワースペクトル位相(CSP)分析
CSP法[15]もバイノーラルモデルに用いられる。この手法の考え方は、2つのマイク間の到達時間遅延(TDOA)から到達角度を導き出し、CSPの最大係数を見つけることでTDOAを推定できるというものである。CSP係数は次のように導出される。
ここで、 と はそれぞれマイクロフォンに入る信号であり、
到着時間遅延 ( ) は次のように推定できます。
音源方向は
ここで、は音の伝播速度、はサンプリング周波数、は2 つのマイク間の最大時間遅延距離です。
CPS 法では、HRTF に必要なシステム インパルス応答データは必要ありません。期待値最大化アルゴリズムも、複数の音源を特定し、特定エラーを減らすために使用されます。このシステムは、2 つのマイクのみを使用して、複数の移動する音源を識別できます。
2Dセンサーラインアレイ

3D空間で音源の位置を推定するために、2つのラインセンサーアレイを水平方向と垂直方向に配置することができます。一例として、水中音源の位置特定に使用される2Dラインアレイがあります。[16]最大尤度法を使用して2つのアレイからのデータを処理することにより、音源の方向、範囲、深さを同時に特定することができます。両耳聴覚モデルとは異なり、この方法はスペクトル解析法に似ています。この方法は、遠くの音源の位置を特定するために使用できます。
自己回転型バイマイクアレイ
2 マイクアレイ(バイマイクアレイ[17]とも呼ばれる)を回転させると、3D 環境内に存在する静止音源の正弦波チャネル間時間差 (ICTD) 信号が生成されます。結果として得られる正弦波信号の位相シフトは、音源の方位角に直接マッピングでき、ICTD 信号の振幅は、音源の仰角と 2 つのマイク間の距離の関数として表すことができます。[18]複数の音源がある場合、ICTD 信号には複数の不連続正弦波形を形成するデータポイントがあります。ランダムサンプルコンセンサス (RANSAC) やノイズを含むアプリケーションの密度ベース空間クラスタリング (DBSCAN) などの機械学習技術を適用して、ICTD 信号内の各不連続正弦波形の位相シフト (方位角へのマッピング) と振幅 (仰角へのマッピング) を識別できます。[19]
階層的ファジー人工ニューラルネットワークアプローチ

階層的ファジー人工ニューラルネットワークアプローチによる音源定位システムは、生物学的な両耳音源定位をモデルにしています。2 つの耳と小さな脳を持つ原始的な動物の中には、3D 空間を認識して音を処理できるものもありますが、そのプロセスは完全には理解されていません。動物の中には、頭が小さいために 3D 音源定位が難しい動物もいます。また、カエルの場合のように、コミュニケーション音の波長が頭の直径よりもはるかに大きい場合もあります。
階層型ファジー人工ニューラルネットワークシステムは、これまでの両耳音源定位法をベースに、両耳間時間差(ITDベース)と両耳間強度差(IIDベース)の音源定位法を組み合わせて、人間に近い高精度を実現しました。階層型ファジー人工ニューラルネットワーク[20]は 、人間の耳と同じ音源定位精度を目標に使用されました。
IIDベースまたはITDベースの音源定位方法には、前方後方混乱と呼ばれる主な問題があります。[21]階層型ニューラルネットワークシステムに基づくこの音源定位では、この問題を解決するために、IID推定とITD推定を組み合わせています。このシステムは広帯域音に使用され、非定常シナリオに展開されます。
モノラル音源の3D音源定位
通常、音源定位は 2 つ (またはそれ以上) のマイクを使用して行われます。2 つのマイクへの音の到着時間の差を使用することで、音源の方向を数学的に推定できます。ただし、マイクのアレイが音源を定位できる精度 (両耳間時間差を使用) は、基本的にアレイの物理的なサイズによって制限されます。アレイが小さすぎると、マイクの間隔が狭くなりすぎて、すべてが基本的に同じ音 (ITF がほぼゼロ) を録音することになり、方向の推定が極めて困難になります。したがって、マイク アレイの長さが数十センチメートル (デスクトップ アプリケーションの場合) から数十メートル (水中定位の場合) に及ぶことは珍しくありません。ただし、このサイズのマイク アレイは、小型ロボットで使用するのは実用的ではありません。大型ロボットであっても、このようなマイク アレイの取り付けや操作は面倒です。対照的に、単一のマイク(非常に小型にできる)を使用して音源の位置を特定する機能により、位置特定用のデバイスが大幅にコンパクトになり、コストと電力も削減される可能性があります。
従来のHRTFアプローチ
3D サウンドの定位を実装する一般的な方法は、HRTF (頭部伝達関数) を使用することです。まず、2 つの方程式を定式化して、3D サウンドの定位の HRTF を計算します。1 つは特定の音源の信号を表し、もう 1 つは音源から伝達された音に対するロボットの頭部マイクからの信号出力を示します。モノラル入力データはこれらの HRTF によって処理され、結果はステレオ ヘッドフォンから出力されます。この方法の欠点は、3D サウンドの定位を実現するためにフィルター セット全体に多くのパラメトリック操作が必要であり、計算の複雑さが増すことです。
3Dサウンド定位のDSP実装

組み込みDSPを使用したリアルタイム3D音源定位アプローチのDSPベースの実装は、計算の複雑さを軽減できます。図に示すように、このリアルタイムアルゴリズムの実装手順は、(i)周波数分割、(ii)音源定位、(iii)ミキシングの3つのフェーズに分かれています。モノラル音源の3D音源定位の場合、オーディオ入力データは左チャンネルと右チャンネルの2つに分割され、時系列のオーディオ入力データが次々に処理されます。[22]
このアプローチの特徴は、可聴周波数帯域が 3 つに分割され、3 つのサブバンドそれぞれに対して 3D サウンド定位の異なる手順を利用できることです。
シングルマイクアプローチ
モノラル音源定位は、外耳の構造によって可能になります。外耳の構造は、入射角に応じて音を変化させます。機械学習のアプローチは、単一のマイクと「人工耳介」(方向に応じて音を歪める)のみを使用して、モノラル音源定位に適応されています。このアプローチは、自然音と人工音の一般的な分布、および耳介によって誘発される方向に応じた音の変化をモデル化します。[23]実験結果では、アルゴリズムが人間の話し声、犬の鳴き声、滝、雷などの広範囲の音をかなり正確に定位できることも示されています。マイクアレイとは対照的に、このアプローチは、音源定位用のデバイスを大幅に小型化し、コストと電力を削減する可能性も提供します。
参照
参考文献
- ^ Keyrouz, Fakheredine; Diepold, Klaus; Keyrouz, Shady (2007 年 9 月)。「 監視アプリケーション向けの高性能 3D サウンド ローカリゼーション」。2007 IEEE 高度ビデオおよび信号ベース監視会議。pp. 563–6。doi :10.1109/ AVSS.2007.4425372。ISBN 978-1-4244-1695-0. S2CID 11238184。
- ^ ケアー、ブリュエル。 「騒音源の特定」。bksv.com。ブリュエル&ケアー。
- ^ Goldstein, E.Bruce (2009-02-13).感覚と知覚(第8版). Cengage Learning. pp. 293–297. ISBN 978-0-495-60149-4。
- ^ ケアー、ブリュエル。 「3Dで聴く」。ブリュエル&ケアー。
- ^ ab 中島 秀; 向井 孝 (2005). 「両耳聴覚の学習に基づく 3D 音源定位システム」2005 IEEE 国際システム・人間・サイバネティクス会議第 4 巻. pp. 3534–3539. doi :10.1109/ICSMC.2005.1571695. ISBN 0-7803-9298-1. S2CID 7446711。
- ^ Liang, Yun; Cui, Zheng; Zhao, Shengkui; Rupnow, Kyle; Zhang, Yihao; Jones, Douglas L.; Chen, Deming (2012)。「GPU での 3D サウンド ローカリゼーションのリアルタイム実装とパフォーマンス最適化」。Automation and Test in Europe Conference and Exhibition : 832–5。ISSN 1530-1591 。
- ^ Fernandez Comesana, D.; Steltenpool, S.; Korbasiewicz, M.; Tijs, E. (2015). 「直接音響ベクトル場マッピング: 3D 空間で 3D 音響強度を測定するための新しいスキャンツール」。Euronoise誌の議事録: 891–895。ISSN 2226-5147 。
- ^ Ephraim, Y.; Malah, D. (1984 年 12 月)。「最小平均二乗 誤差短時間スペクトル振幅推定器を使用した音声強調」。IEEE Transactions on Acoustics, Speech, and Signal Processing。32 (6): 1109–21。doi : 10.1109 /TASSP.1984.1164453。ISSN 0096-3518 。
- ^ Valin, JM; Michaud, F.; Rouat, Jean (2006 年 5 月 14 ~ 19 日)。「ビームフォーミングとパーティクル フィルタリングを使用した音源の堅牢な 3D 位置特定と追跡」。2006 IEEE国際音響会議音声および信号処理議事録。第 4 巻。p. IV。arXiv : 1604.01642。doi : 10.1109 /ICASSP.2006.1661100。ISBN 978-1-4244-0469-8. ISSN 1520-6149. S2CID 557491.
- ^ ペレス・カボ、ダニエル;デ・ブリー、ハンス・エリアス。フェルナンデス・コメサーニャ、ダニエル。ソブレイラ・セオアネ、マヌエル。 「音響ベクトルセンサーのネットワークを使用した現実の高調波発生源の位置特定」。ユーロノイズ 2015。
- ^ Salas Natera, MA; Martinez Rodriguez-Osorio, R.; de Haro Ariet, L.; Sierra Perez, M. (2012). 「宇宙通信のための新しいアンテナアレイアーキテクチャとテクノロジーのキャリブレーション提案」. IEEE Antennas and Wireless Propagation Letters . 11 : 1129–32. Bibcode :2012IAWPL..11.1129S. doi :10.1109/LAWP.2012.2215952. ISSN 1536-1225.
- ^ Ishi, CT; Even, J.; Hagita, N. (2013 年 11 月)。「複数のマイクアレイと反射を使用した音源の 3D 位置特定」。2013 IEEE/RSJ国際インテリジェントロボットおよびシステム会議。pp. 3937–42。doi :10.1109/ IROS.2013.6696919。ISBN 978-1-4673-6358-7. S2CID 16043629。
- ^ 「Lontra の LP2 コンプレッサーからの騒音放出の削減」。
- ^ Keyrouz, Fakheredine; Diepold, Klaus (2006). 「強化されたバイノーラル 3D サウンド ローカリゼーション アルゴリズム」2006 IEEE 国際信号処理および情報技術シンポジウムpp. 662–665. doi :10.1109/ISSPIT.2006.270883. ISBN 0-7803-9754-1.S2CID 14042947 。
- ^ Hyun-Don Kim; Komatani, K.; Ogata, T.; Okuno,HG (2008年1月). 3D移動音作成ツールを用いた2チャンネルベース音源定位の評価. ICERI 2008. doi :10.1109/ICKS.2008.25.
- ^ Tabrikian,J. ; Messer,H. (1996 年 1 月). 「導波管内の 3 次元音源位置特定」. IEEE Transactions on Signal Processing . 44 (1): 1–13. Bibcode :1996ITSP...44....1T. doi :10.1109/78.482007.
- ^ Gala, Deepak; Lindsay , Nathan; Sun, Liang (2018 年 7 月)。「自己回転型バイマイクアレイを使用した無人地上ロボットのリアルタイムアクティブ音源定位」。Journal of Intelligent & Robotic Systems。95 ( 3): 935–954。arXiv : 1804.03372。doi : 10.1007 /s10846-018-0908-3。S2CID 4745823。
- ^ Gala, Deepak; Lindsay, Nathan; Sun, Liang (2018年6月).自己回転型2マイクアレイによる無人地上車両の3次元音源定位. CDSR 2018. doi : 10.11159/cdsr18.104 .
- ^ Gala, Deepak; Lindsay, Nathan; Sun, Liang (2021年10月).自己回転型バイマイクアレイを備えた小型自律無人車両のための機械学習を使用した複数音源位置特定. Journal of Intelligent & Robotic Systems . Vol. 103, no. 3. arXiv : 1804.05111 . doi :10.1007/s10846-021-01481-4.
- ^ Keyrouz , Fakheredine; Diepold, Klaus (2008 年 5 月)。「ロボットによる 3D 音源検知のための新しい生物学的にヒントを得たニューラル ネットワーク ソリューション」。Soft Computing。12 ( 7 ): 721–9。doi : 10.1007 /s00500-007-0249-9。ISSN 1432-7643。S2CID 30037380 。
- ^ Hill, PA; Nelson, PA; Kirkeby, O .; Hamada, H. (2000 年 12 月)。「仮想音響画像システムにおける前後の混乱の解消」。Journal of the Acoustical Society of America。108 ( 6): 2901–10。Bibcode :2000ASAJ..108.2901H。doi : 10.1121 / 1.1323235。ISSN 0001-4966。PMID 11144583 。
- ^ 坂本 憲明、小林 渉、尾上 孝雄、白川 功 (2001)。「モノラル音源の 3D サウンド定位アルゴリズムの DSP 実装」 ICECS 2001。第 8 回 IEEE 国際エレクトロニクス、回路、システム会議 (カタログ番号 01EX483)。第 2 巻。pp. 1061–1064。doi :10.1109/ ICECS.2001.957673。ISBN 978-0-7803-7057-9. S2CID 60528168。
- ^ Saxena, A.; Ng, AY (2009). 「単一マイクからの音の位置の学習」2009 IEEE 国際ロボット工学およびオートメーション会議pp. 1737–1742. doi :10.1109/ROBOT.2009.5152861. ISBN 978-1-4244-2788-8. S2CID 14665341。
外部リンク
- 仮想音源の3D定位
- 3D音響ベクトルセンサー(空気)
