
音声符号化フォーマット[ 1 ]または音声圧縮フォーマットは、デジタルテレビ、デジタルラジオ、音声ファイルや動画ファイルなどのデジタル音声のエンコード形式です。音声符号化フォーマットの例としては、 MP3、AAC、Vorbis、FLAC、Opusなどがあります。特定の音声符号化フォーマットとの間で音声の圧縮と解凍が可能な特定のソフトウェアまたはハードウェア実装は、音声コーデックと呼ばれます。音声コーデックの例としてはLAMEがあり、これはMP3音声符号化フォーマットで音声のエンコードとデコードをソフトウェアで実装する複数の異なるコーデックの1つです。
音声符号化フォーマットの中には、音声符号化仕様書と呼ばれる詳細な技術仕様書で規定されているものがあります。こうした仕様書の中には、標準化団体によって技術標準として作成・承認され、音声符号化標準と呼ばれるものもあります。「標準」という用語は、正式な標準だけでなく、事実上の標準にも用いられることがあります。
特定のオーディオ コーディング フォーマットでエンコードされたオーディオ コンテンツは、通常、コンテナ フォーマット内にカプセル化されます。そのため、ユーザーは通常、生のAACファイルではなく、 AAC エンコードされたオーディオを含むMPEG-4 Part 14コンテナである .m4aオーディオ ファイルを持っています。コンテナには、タイトルやその他のタグなどのメタデータ、および高速シーク用のインデックスも含まれている場合があります。[ 2 ]注目すべき例外はMP3ファイルで、コンテナ フォーマットのない生のオーディオ コーディングです。タイトルやアーティストなどのメタデータ タグを MP3 に追加するための事実上の標準 ( ID3など) は、タグを MP3 に追加し、MP3 プレーヤーがそのチャンクを不正なオーディオ コーディングとして認識してスキップすることを期待するハックです。オーディオを含むビデオ ファイルでは、エンコードされたオーディオ コンテンツは、マルチメディア コンテナ フォーマット内にビデオ (ビデオ コーディング フォーマット)と一緒にバンドルされます。
音声符号化フォーマットは、そのフォーマットを実装するコーデックが使用するすべてのアルゴリズムを規定するものではありません。非可逆音声圧縮の重要な仕組みの一つは、心理音響モデルに基づいて、人間には聞こえない方法でデータを削除することです。エンコーダの実装者は、どのデータを削除するかについて(自身の心理音響モデルに基づいて)ある程度の自由度を持っています。

可逆圧縮方式の音声符号化フォーマットは、音を表現するために必要なデータ量を削減するだけでなく、元の非圧縮形式に復号化することも可能です。一方、非可逆圧縮方式の音声符号化フォーマットは、圧縮に加えて音のビット解像度も低下させるため、データ量は大幅に削減されるものの、失われた情報は取り返しのつかないものとなります。
送信(ストリーミング)される音声は、配信時の利便性を考慮して、多くの場合、非可逆圧縮方式の音声コーデックを用いて圧縮されます。最も広く使用されている音声符号化方式はMP3とAdvanced Audio Coding(AAC)で、どちらも修正離散コサイン変換(MDCT)と知覚符号化アルゴリズムに基づいた非可逆圧縮方式です。
FLACやApple Losslessといったロスレスオーディオ符号化フォーマットが利用できる場合もあるが、その分ファイルサイズが大きくなるという欠点がある。
パルス符号変調(PCM、または.wav)などの非圧縮オーディオフォーマットも使用されることがある。PCMはコンパクトディスクデジタルオーディオ(CDDA)の標準フォーマットだった。

1950年、ベル研究所は差動パルス符号変調(DPCM)の特許を出願した。[ 3 ]適応型DPCM (ADPCM)は、 1973年にベル研究所のP. Cummiskey、 Nikil S. Jayant、James L. Flanaganによって導入された。 [ 4 ] [ 5 ]
知覚符号化は、線形予測符号化(LPC)を用いた音声符号化圧縮に初めて使用されました。 [ 6 ] LPC の初期概念は、1966 年の板倉文忠(名古屋大学) と斎藤修三 (日本電信電話)の研究に遡ります。[ 7 ] 1970 年代には、ベル研究所のBishnu S. AtalとManfred R. Schroeder が、人間の耳のマスキング特性を利用した知覚符号化アルゴリズムである適応予測符号化(APC)と呼ばれる LPC の一種を開発し、1980 年代初頭には、当時としては大きな圧縮率を達成したコード励起線形予測(CELP) アルゴリズムが登場しました。 [ 6 ]知覚符号化は、 MP3 [ 6 ]やAACなどの現代の音声圧縮フォーマットで使用されています。
1974 年にNasir Ahmed、T. Natarajan、KR Raoによって開発された離散コサイン変換(DCT) [ 8 ]は、MP3 [ 9 ]や AAC などの現代のオーディオ圧縮フォーマットで使用される修正離散コサイン変換(MDCT)の基礎となりました。MDCT は、 1986 年に Princen と Bradley が行った以前の研究 [ 11 ] に続き、1987 年に JP Princen、AW Johnson、AB Bradley によって提案されました [ 10 ]。MDCTは、Dolby Digital [ 12 ] [ 13 ]、MP3 [ 9 ]、Advanced Audio Coding (AAC) [ 14 ]などの現代のオーディオ圧縮フォーマットで使用されています。