3Dサウンドは、一般的には日常生活における人間の音を指します。音はあらゆる方向と距離から耳に届き、それが人間の聴覚における三次元的なイメージを形成します。3Dサウンドを研究する科学者やエンジニアは、現実世界の音の複雑さを正確に合成することを目指しています。
日常生活における3Dサウンドの普及と3D音源定位技術の広範な利用に伴い、3Dサウンド合成技術はゲーム、ホームシアター、ヒューマンエイドシステムなどの分野で人気が高まっている。3Dサウンド合成の目的は、3Dサウンドから得られた情報を、データの分析や応用が可能な形で解釈することにある。
3Dサウンド合成の応用例としては、ゲーム、テレビ会議システム、遠隔アンサンブルシステムなどにおいて、よりリアルな環境や感覚を生み出すことで、仮想環境における臨場感を高めることが挙げられます。また、3Dサウンドは、視覚障害者などの感覚障害を持つ人々を支援し、他の感覚フィードバックの代替手段としても活用できます。
3Dサウンドには、音源の3次元空間における位置だけでなく、音源の3次元的な音響放射特性も含まれる可能性がある。 [ 1 ]
3Dサウンド合成における3つの主な問題点は、前後反転、頭蓋内聴取音、およびHRTF測定である。
前後反転とは、被験者が後ろにいるときに正面から聞こえる音、またはその逆の現象のことです。この問題は、被験者の頭の動きと耳介の反応を正確に考慮することで軽減できます。HRTF の計算中にこれら 2 つが欠落すると、逆の問題が発生します。別の解決策は、異なる方向からの音の差を誇張し、耳介の効果を強化することで前後反転率を低減する早期エコー応答です。[ 2 ] [ 3 ]
頭蓋内聴音とは、外部の音が人の頭の中で聞こえるように感じられる現象です。これは、残響音を加えることで解消できます。
HRTF測定は、発生する音、ノイズ、および線形性の問題に対処するためのものです。定位能力に優れた被験者に対して複数の主要な聴覚刺激を用いることで、ほとんどの場合において効果的なHRTFを生成することができます。
3Dサウンド合成に用いられる主な手法は、頭部伝達関数、サウンドレンダリング、そしてスピーカー位置に基づく3Dサウンド合成の3つである。

頭部伝達関数(HRTF)は、音源の位置に基づいた線形関数であり、両耳間時間差、頭部遮蔽、耳介反応、肩エコー、頭部運動、初期エコー反応、残響、視覚など、人間が音源の位置を特定するために使用するその他の情報も考慮に入れています。
このシステムは、マイクロホンアレイを使用して人間の耳の音を録音することで人間の音響システムをモデル化しようとし、より正確な 3D サウンドの合成を可能にします。HRTF は、これらの録音を元の音と比較することによって取得されます。次に、HRTF を使用して、特定の音の位置に対応する有限インパルス応答 ( FIR ) フィルタのペアを開発し、各音には左右の 2 つのフィルタがあります。3D 空間の特定の位置に音を配置するために、その位置に対応する FIR フィルタのセットが入力音に適用され、空間的なサウンドが生成されます。[ 4 ]空間の特定の点からの音信号を畳み込むのに必要な計算は通常大きいため、一般的に複雑さを軽減するために多くの作業が必要です。そのような作業の 1 つは、主成分分析(PCA) とバランス モデル切り捨て (BMT) を組み合わせることに基づいています。PCA は、データ マイニングとデータ削減で広く使用されている手法であり、冗長性を削減するために BMT より前に 3D サウンド合成で使用されていました。 BMTは計算の複雑さを軽減するために適用される。
サウンドレンダリングの手法では、シーン内の各オブジェクトに特徴的なサウンドを付加して、それを3Dサウンドとして合成することでサウンドワールドを作成します。音源は、サンプリングまたは人工的な方法で取得できます。この手法には2つの異なるパスがあります。最初のパスでは、各オブジェクトからマイクロフォンへの伝搬経路を計算し、その結果を収集して音源の幾何学的変換を行います。最初のステップからの変換は、遅延と減衰の両方によって制御されます。2番目のパスでは、サウンドオブジェクトが作成、変調、加算された後、最終的なサウンドトラックを作成します。[ 5 ]
HRTF生成よりもシンプルなレンダリング方法は、空間内の音があらゆる方向に伝播するという光と音波の類似性を利用しています。音波は光と同じように反射と屈折を起こします。最終的に聞こえる音は、複数の経路で伝送された信号の積分値となります。
処理手順は4つのステップから構成されます。最初のステップでは、各オブジェクトに固有の音を生成します。2番目のステップでは、生成された音を移動するオブジェクトに付加します。3番目のステップでは、残響効果に関連する畳み込みを計算します。サウンドレンダリングでは、オブジェクトに似た波長の音を使用することで、反射時に音が拡散し、音を滑らかにする効果が得られます。最後のステップでは、計算された畳み込みをステップ2で生成した音源に適用します。これらのステップにより、簡略化されたサウンドトラッキングアルゴリズムを使用しても、大きな違いは生じません。

この方法は、サンプリングされた音を物体に取り付けるのではなく、 8 つのスピーカーを戦略的に配置して空間音をシミュレートします。 [ 6 ]最初のステップは、元の音場に立方体マイクロホンアレイを使用して音をキャプチャすることです。次に、再生された音場に立方体スピーカーアレイを使用して音をキャプチャします。スピーカーアレイ内にいるリスナーは、音がマイクロホンアレイの上を移動しているときに、音が頭上を移動しているように感じます。[ 6 ]
波面合成は、ホイヘンス・フレネルの原理を用いて波面を合成する空間オーディオレンダリング技術です。まず、マイクロホンアレイで元の音を録音し、次にスピーカーアレイを使用してリスニングエリアで音を再生します。アレイは、マイクロホンとスピーカーが配置されているエリアの境界に沿って配置されます。この技術により、複数のリスナーがリスニングエリア内を移動しても、あらゆる方向から同じ音を聞くことができます。これは、バイノーラルやクロストークキャンセレーション技術では実現できないことです。一般的に、波面合成を用いた音響再生システムでは、スピーカーは2次元空間内で直線状に、またはリスナーの周囲に配置されます。