音声分析とは、分析、分類、保存、検索、合成などのために、音声信号から情報や意味を抽出することを指します。観察媒体や解釈方法は様々で、音声分析は人間の耳と、人々が可聴音源をどのように解釈するかを指す場合もあれば、音声アナライザーなどの技術を用いて、振幅、歪み、周波数特性といった音源の他の特性を評価することを指す場合もあります。音源の情報が観察されると、明らかになった情報は、ユーザーによる論理的、感情的、記述的、あるいはその他の関連性のある解釈のために処理されます。
最も一般的な音声分析は、聴覚に由来するものです。地球上の多くの動物に見られる感覚知覚の一種である音声分析は、多くの生物にとって基本的なプロセスです。周囲の環境や他の生物が発する音は聴覚器官に入力され、聞き手の脳はその音を解釈し、どのように反応すべきかを判断します。音声分析の機能の例としては、会話、驚愕反応、音楽鑑賞などが挙げられます。
聴覚は人間の生来の能力であり、世界中のコミュニケーションにおいて基本的であり、音声に意味と価値を割り当てるプロセスは、人間の身体にとって複雑だが不可欠な機能である。聴覚系の研究は、数学と正弦波振動および音の分析を中心に進められてきた。フーリエ変換は、人間の耳が動く空気を処理し、それを約 20 ~ 20,000 Hz の可聴周波数範囲に変換する方法を理解する上で不可欠な定理である。[ 1 ]耳は、特定の周波数範囲に同調した外耳道の構造の違いにより、1 つの複雑な波形を受け取り、それをさまざまな周波数範囲に処理することができる。[ 2 ]その後、最初の感覚入力は、音の知覚が行われる神経系のさらに上位で分析される。
聴覚系は神経系と連携して働き、聞き手が音源の発生方向を空間的に特定できるようにします。これはハース効果または先行効果として知られており、2つの耳、つまり聴覚受容体があることで可能になります。音が両耳に到達するまでの時間の差が、脳が音源の空間的位置を計算するために必要な情報を提供します。[ 3 ]

音声信号は、信号から得たい情報の種類に応じて、いくつかの異なる方法で分析することができる。
信号解析の種類には以下が含まれます。

ハードウェアアナライザーは、ヒューレット・パッカード社が開発した最初のオーディオアナライザーであるHP200Aの発明以来、信号解析の主要な手段となってきました。ハードウェアアナライザーは、一般的に業務用および一般消費者向け製品のエンジニアリング、テスト、製造に使用されています。コンピュータ技術の進歩に伴い、これらのハードウェアシステムに統合ソフトウェアが導入され、その後、ソフトウェアを実行するコンピュータ以外にハードウェアコンポーネントを必要としないオーディオ解析ツールが登場しました。ソフトウェアオーディオアナライザーは、ライブオーディオ、ミキシング、マスタリングなど、音楽制作のさまざまな段階で日常的に使用されています。これらの製品は、高速フーリエ変換(FFT)アルゴリズムと処理を採用し、解析対象信号の視覚的な表現を提供します。表示および情報の種類には、周波数スペクトル、ステレオフィールド、サラウンドフィールド、スペクトログラムなどがあります。
{{citation}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク){{cite book}}:|journal=無視されました (ヘルプ){{cite book}}:|journal=無視されました (ヘルプ)