心理音響学は、人間の聴覚系による音の知覚を科学的に研究する精神物理学の一分野です。これは、騒音、音声、音楽など、音に関連する心理的反応を研究する科学分野です。心理音響学は、心理学、音響学、電子工学、物理学、生物学、生理学、コンピュータ科学を含む学際的な分野です。[ 1 ]
聴覚は、波の伝播という純粋な機械的現象ではなく、感覚的かつ知覚的な現象でもあります。人が何かを聞くとき、その音は空気中を伝わる機械的な音波として耳に到達しますが、耳の中で神経活動電位に変換されます。これらの神経パルスは脳に伝わり、そこで知覚されます。したがって、音声処理など、音響に関する多くの問題においては、環境の力学的な側面だけでなく、耳と脳の両方が人の聴覚体験に関わっているという事実も考慮に入れることが有益です。
例えば、内耳は音の波形を神経刺激に変換する際に重要な信号処理を行い、この処理によって波形間の特定の差異が知覚できなくなります。[ 2 ] MP3などのデータ圧縮技術はこの事実を利用しています。[ 3 ]さらに、耳は異なる強度レベルの音に対して非線形な応答を示します。この非線形な応答はラウドネスと呼ばれます。電話網やオーディオノイズ低減システムは、送信前にデータサンプルを非線形に圧縮し、再生時に展開することでこの事実を利用しています。[ 4 ]耳の非線形応答のもう1つの効果は、周波数が近い音がファントムビート音、つまり相互変調歪み生成物を生成することです。[ 5 ]
効果的な心理音響的手法を特定するには、少なくとも5つの特徴があります。それは、音量(知覚される音量の尺度)、粗さ(感覚的不協和)、鋭さ(スペクトル分布)、音色(音色スペクトルのピークの比率)、そして空間性(知覚される空間性を予測するため)です。
音楽ジャンルを認識したり、音楽を推薦したりする別の方法として、人間の知覚とは直接関係のない客観的な特徴を幅広く除去する方法がある。しかし、人間の知覚や身体感覚とは関係のない低レベルの特徴の中にも、音響心理学の発見に役立つものがある。
最初の二乗平均平方根(RMS)は、音の大きさ、特に音量を測定するもう1つの方法です。RMSは、音量を監視するのに役立つため、重要な測定プロセスです。スペクトルロールオフは、周波数をバランスよく調整するのに役立ちます。スペクトルフラットネスは、騒音の範囲がどれくらい大きいか、または小さいかを示すと考えられています。最後に、インターチャネルクロス相関は、片方の耳が音をどのように知覚したかと、もう一方の耳との関係を推定します。[ 6 ]

人間の耳は、通常、以下の範囲の音を聞き取ることができます。20~20,000Hz 。上限は年齢とともに低下する傾向があり、ほとんどの成人はそれ以上の周波数を聞き取ることができません。16,000 Hz 。理想的な実験室条件下では、音楽的な音として認識される最低周波数は 12 Hz です。[ 7 ] 4 Hz から 16 Hz の間の音は、身体 の触覚によって知覚できます。
人間の音声信号の時間分離の知覚は、10 μs 。これは、10 μsを超える周波数が100 kHz (1/10 μs)は可聴ですが、その時間弁別は周波数範囲と直接結びついていません。 [ 8 ] [ 9 ]
耳の周波数分解能は、 1オクターブあたり約3.6Hzです。1000〜2000 Hz つまり、臨床現場では3.6 Hz を超えるピッチの変化が知覚されることがあります。 [ 7 ]しかし、他の方法では、さらに小さなピッチの違いも知覚されることがあります。たとえば、2 つのピッチの干渉は、音の音量の繰り返しの変化として聞こえることがよくあります。この振幅変調は、2 つの音の周波数の差に等しい周波数で発生し、ビートとして知られています。
西洋音楽の記譜法で用いられる半音階は、線形周波数スケールではなく対数周波数スケールである。メルスケールやバークスケールなど、人間の聴覚に関する実験から直接導き出された他のスケール(これらは知覚の研究に用いられるが、通常は作曲には用いられない)は、高周波数側では周波数に関してほぼ対数的であるが、低周波数側ではほぼ線形である。
可聴音の強度範囲は非常に大きい。人間の鼓膜は音圧の変化に敏感で、数マイクロパスカル(μPa)という小さな変化から、それ以上の変化まで検出できる。100 kPa 。このため、音圧レベルも対数的に測定され、すべての圧力は100 kPaを基準としています。20 μPa (または1.973 85 × 10 −10 atm )。したがって、可聴域の下限は次のように定義されます。0 dB ですが、上限はそれほど明確に定義されていません。上限は、騒音性難聴を引き起こす可能性の問題です。
可聴域の下限をより厳密に調査すると、音が聞こえる最小閾値は周波数に依存することがわかります。さまざまな周波数のテストトーンの最小強度を測定することで、周波数依存の絶対聴力閾値(ATH)曲線を導き出すことができます。通常、耳は感度のピーク(つまり、最低ATH)を次の周波数で示します。1~5 kHzだが、閾値は年齢とともに変化し、高齢者の耳は 2 kHz 以上の感度が低下する。[ 10 ]
ATHは等ラウドネス曲線の中で最も低い値です。等ラウドネス曲線は、等ラウドネスと知覚される可聴周波数範囲における音圧レベル(dB SPL)を示します。等ラウドネス曲線は、 1933年にベル研究所のフレッチャーとマンソンによって、ヘッドホンで再生された純音を用いて初めて測定され、彼らが収集したデータはフレッチャー・マンソン曲線と呼ばれています。主観的なラウドネスを測定することは困難であったため、フレッチャー・マンソン曲線は多くの被験者で平均化されました。ロビンソンとダッドソンは1956年にこのプロセスを改良し、無響室で測定された正面音源の新しい等ラウドネス曲線セットを取得しました。ロビンソン・ダッドソン曲線は1986年にISO 226として標準化されました。 2003年には、 12の国際研究から収集されたデータを使用してISO 226が改訂されました。
音源定位とは、音源の位置を特定するプロセスです。脳は、両耳間の音量、音色、タイミングの微妙な違いを利用して、音源の位置を特定します。[ 11 ]定位は、方位角または水平角、天頂角または垂直角、距離(静止音の場合)または速度(移動音の場合)という3次元の位置で説明できます。 [ 12 ]人間は、ほとんどの四足動物と同様に、水平方向の方向を検出することに長けていますが、耳が左右対称に配置されているため、垂直方向の方向の検出はそれほど得意ではありません。フクロウの中には、耳が非対称に配置されており、3つの平面すべてで音を検出できる種もいます。これは、暗闇で小型哺乳類を狩るための適応です。[ 13 ]

あるリスナーが、無音の条件下で特定の音響信号を聞き取れるとします。別の音が再生されている間に別の信号が再生されている場合、リスナーがそれを聞き取るためには、その信号がより強くなければなりません。この干渉信号はマスカーと呼ばれ、妨げられる聴取はマスキングと呼ばれます。マスキングが発生するために、マスカーは元の信号の周波数成分を持つ必要はありません。マスキングされた信号は、マスカーよりも弱くても聞こえます。マスキングは、信号とマスカーが同時に再生された場合(例えば、一方がささやき、もう一方が叫んでいる場合)、リスナーは弱い信号をより大きなマスカーによってマスキングされるため、その信号を聞き取ることができません。マスキングは、マスカーが始まる前やマスカーが止まった後にも信号に発生することがあります。例えば、突然の大きな拍手音は、直前または直後の音を聞こえなくすることがあります。逆マスキングの効果は、順マスキングよりも弱いです。[ 10 ]マスキング効果は心理音響学の研究で広く研究されており、MP3などの非可逆音声符号化で利用されている。
2 f、 3 f、 4 f、 5 fなどの関係にある周波数の調和列(fは特定の周波数)を提示されると、人間はピッチがfであると知覚する傾向がある。音声例は YouTube で見つけることができる。[ 14 ]
音響心理学には、音楽心理学や音楽療法に関連するトピックや研究が含まれます。ベンジャミン・ボレッツなどの理論家は、音響心理学の結果の一部は音楽の文脈においてのみ意味を持つと考えています。[ 15 ]
アーヴ・タイベルの「環境」シリーズのLP(1969~79年)は、心理的能力を高めるために特別にリリースされた市販の音源の初期の例である。[ 16 ]

音響心理学は、長年にわたりコンピュータ科学と密接な関係を築いてきた。インターネットのパイオニアであるJCR・リックライダーとボブ・テイラーは共に音響心理学の大学院レベルの研究を修了しており、BBNテクノロジーズは当初、最初のパケット交換ネットワークの構築に着手する前は音響問題に関するコンサルティングを専門としていた。
リックライダーは「音高知覚の二重理論」というタイトルの論文を書いた。[ 17 ]
心理音響学は、ソフトウェア開発の多くの分野で応用されており、開発者はデジタル信号処理で実証済みおよび実験的な数学的パターンをマッピングします。MP3やOpusなどの多くのオーディオ圧縮コーデックは、圧縮率を高めるために心理音響モデルを使用しています。劇場や家庭での音楽再生のための従来のオーディオシステムの成功は心理音響学に起因すると考えられており[ 18 ] 、心理音響学の考察は心理音響音場合成などの新しいオーディオシステムを生み出しました[ 19 ]。さらに、科学者は、障害、危害、または殺害する可能性のある周波数を放出する新しい音響兵器の作成を限定的な成功で実験してきました[ 20 ] 。心理音響学は、複数の独立したデータ次元を可聴で容易に解釈できるようにするために、ソニフィケーションにも活用されています[ 21 ] 。これにより、空間オーディオを必要とせずに聴覚ガイダンスが可能になり、ソニフィケーションコンピュータゲーム[ 22 ]や、ドローン飛行や画像誘導手術などの他のアプリケーションで使用できます。[ 23 ]これは今日では音楽の分野でも応用されており、ミュージシャンやアーティストは楽器の不要な周波数をマスキングすることで、他の周波数を強調し、新しい聴覚体験を生み出し続けています。また、小型または低品質のスピーカーの設計にも応用されており、基本周波数が欠落する現象を利用して、スピーカーが物理的に生成できる周波数よりも低い周波数で低音の効果を得ることができます(参考文献を参照)。
自動車メーカーは、エンジンやドアに特定の音が出るように設計している。[ 24 ]

心理音響モデルは、特定のデジタルオーディオ信号のどの部分を削除または低品質で再生しても、知覚される音質に大きな損失が生じないかを記述することで、高品質な非可逆信号圧縮を実現します。これにより、全体の圧縮率が大幅に向上し、心理音響分析によって、高品質マスターの10分の1から12分の1のサイズでありながら、音質の損失が著しく少ない圧縮音楽ファイルが生成されることが一般的です。このような圧縮は、現代のほぼすべての非可逆オーディオ圧縮フォーマットの特徴です。これらのフォーマットには、 Dolby Digital (AC-3)、MP3、Opus、Ogg Vorbis、AAC、WMA、MPEG-1 Layer II (いくつかの国でデジタルオーディオ放送に使用)、およびMiniDiscや一部のウォークマンモデルで使用されている圧縮方式であるATRACなどがあります。
音響心理学は、人間の解剖学的構造、特に前述のように耳が音を知覚する際の限界に大きく基づいています。要約すると、主な限界は以下のとおりです。
圧縮アルゴリズムは、人間の可聴域外の音に低い優先度を割り当て、予測されるマスキングレベルに応じて異なる周波数の精度を低下させることができます。重要でない成分からビットを慎重に移動させ、重要な成分に移動させることで、リスナーが最も知覚しやすい音が最も正確に表現されるようにアルゴリズムは機能します。
音声エンコーダは、知覚モデル(心理音響モデル)を用いて音声を分析し、周波数帯域または時間区分ごとに必要な精度を計算します。この計算結果は、音声エンコード形式に応じて異なる符号化ツールを用いて、周波数と時間の関数として符号化精度を調整するために使用されます。これは、異なる形式がそれぞれ異なる符号化ツールをサポートしているためです。
そのようなコーディングツールの例としては、以下のようなものがあります。
多くのエンコーダでは、レート制御アルゴリズムによって、符号化された音声のビットレートが規定の範囲内に収まるように制御されます。目標ビットレートで透過的な符号化が実現できない場合、レート制御アルゴリズムは、心理音響モデルによって計算されたデータに基づいて、音スペクトルのさまざまな部分で符号化精度を調整し(その結果、歪みが生じます)、目標ビットレートに一致するまで調整を続けます。