MP3(正式にはMPEG-1 Audio Layer IIIまたはMPEG-2 Audio Layer III)[ 5 ]は、カールハインツ・ブランデンブルクの主導の下、ドイツのフラウンホーファー協会によって主に開発されたオーディオ符号化フォーマットです。[ 11 ] [ 12 ]これは、オーディオを表現するために必要なデータ量を大幅に削減しつつ、ほとんどのリスナーにとって元の非圧縮オーディオの忠実な再現のように聞こえるように設計されています。たとえば、CD品質のデジタルオーディオと比較すると、MP3圧縮では、ビットレートに応じて、一般的に75~95%のサイズ削減が実現できます。[ 13 ]一般的には、MP3は、消費者向け電子機器にMP3ファイル形式( )で保存されたサウンドファイルまたは音楽録音ファイルを指すことがよくあります。.mp3
MPEG-1オーディオレイヤーIIIは、1991年にMPEG-1規格の3つのオーディオコーデックの1つとして定義されました( MPEG-1オーディオレイヤーIおよび MPEG-1オーディオレイヤーIIと共に)。これら3つのオプションはすべて維持され、さらに拡張されました。追加のビットレートが定義され、より多くのオーディオチャンネル(サラウンドサウンドのサポートなど)がサポートされるようになりました(これは後継のMPEG-2規格で実現されました)。
MP3というファイル形式は、一般的にMPEG-1オーディオまたはMPEG-2オーディオでエンコードされたデータの基本ストリームを含むファイルを指します。エンドユーザーにとって最も分かりやすい要素である音声圧縮に関して言えば、MP3は非可逆圧縮を使用してエンコードされたデータの精度を下げ、データの一部を破棄することで、非圧縮オーディオと比較してファイルサイズを大幅に削減します。
小型で音質も許容範囲内であることから、 1990年代後半にはインターネットを介した音楽配信が爆発的に普及し、帯域幅とストレージ容量がまだ限られていた時代には、MP3がその普及を支える技術として重要な役割を果たしました。MP3フォーマットはすぐに、著作権侵害、音楽の海賊版、 MP3.comやNapsterなどのファイルリッピングおよび共有サービスに関する論争と結びつくようになりました。スマートフォンを含むポータブルメディアプレーヤー(MP3プレーヤーを含む)の登場により、MP3のサポートはほぼ普遍的なものとなり、AACなどの新しいコーディングフォーマットが開発されたにもかかわらず、デジタルオーディオの事実上の標準となっています。
動画専門家グループ( MPEG) は、MPEG-1、そして後にMPEG-2規格の一部として MP3 を設計しました。MPEG-1 オーディオ (MPEG-1 パート 3) は、MPEG-1 オーディオ レイヤー I、II、および III を含み、1991 年にISO / IEC規格の委員会草案として承認され、 [ 14 ] [ 15 ] 1992 年に最終化され、[ 16 ] 1993 年に ISO/IEC 11172-3:1993 として発行されました。[ 7 ]サンプルレートとビットレートが低い MPEG-2 オーディオ (MPEG-2 パート 3) 拡張は、1995 年に ISO/IEC 13818-3:1995 として発行されました。[ 8 ] [ 17 ]既存の MPEG-1 デコーダに最小限の変更 (ヘッダー内の MPEG-2 ビットの認識と新しい低いサンプルレートとビットレートの追加) のみが必要です。
MP3 の非可逆圧縮アルゴリズムは、人間の聴覚の知覚限界である聴覚マスキングを利用しています。1894 年、アメリカの物理学者Alfred M. Mayerは、ある音はより低い周波数の別の音によって聞こえなくなる可能性があると報告しました。[ 18 ] 1959 年、Richard Ehmer はこの現象に関する一連の聴覚曲線を記述しました。[ 19 ] 1967 年と 1974 年の間に、Eberhard Zwicker は、重要な周波数帯域のチューニングとマスキングの分野で研究を行いました。[ 20 ] [ 21 ]これは、 Harvey Fletcherとベル研究所の共同研究者によるこの分野の基礎研究に基づいています。[ 22 ]
知覚符号化は、線形予測符号化(LPC)[ 23 ]による音声符号化圧縮に初めて使用され、これは1966年に板倉文忠(名古屋大学)と斎藤修三(日本電信電話)の研究に端を発している。[ 24 ] 1978年、ベル研究所のビシュヌ・S・アタルとマンフレッド・R・シュローダーは、人間の耳のマスキング特性を利用した心理音響符号化アルゴリズムを使用した適応予測符号化と呼ばれるLPC音声コーデックを提案した。 [ 23 ] [ 25 ]シュローダーとアタルがJLホールと共に行ったさらなる最適化は、後に1979年の論文で報告された。[ 26 ]同年、MA Krasner [ 27 ]も心理音響マスキングコーデックを提案し、音声用のハードウェア(音楽のビット圧縮には使用できない)を出版・製造したが、比較的無名のリンカーン研究所技術報告書[ 28 ]に掲載された彼の研究成果は、心理音響コーデック開発の主流にすぐには影響を与えなかった。
1972 年にNasir Ahmedによって提案された、非可逆圧縮用の変換符号化の一種である離散コサイン変換 (DCT)は、 1973 年に Ahmed と T. Natarajan およびKR Raoによって開発され、1974 年にその結果が発表されました。[ 29 ] [ 30 ] [ 31 ]これにより、1986 年にPrincen と Bradley による以前の研究に続き、1987 年に JP Princen、AW Johnson、および AB Bradley によって提案された修正離散コサイン変換(MDCT) の開発につながりました。 [ 32 ] [ 33 ] MDCT は後に MP3 アルゴリズムの中核部分となりました。[ 34 ]
エルンスト・テルハルトと他の共同研究者は、1982年に聴覚マスキングを高精度で記述するアルゴリズムを構築した。[ 35 ]この研究は、フレッチャーに遡る著者によるさまざまな報告や、最初に臨界比と臨界帯域幅を決定した研究に加わった。
1985年、AtalとSchroederは、当時としては大きなデータ圧縮率を達成した、聴覚マスキングを備えたLPCベースの知覚音声符号化アルゴリズムであるコード励起線形予測(CELP)を発表しました。 [ 23 ] IEEEの査読付きJournal on Selected Areas in Communicationsは、1988年にさまざまな(主に知覚的な)音声圧縮アルゴリズムについて報告しました。[ 36 ] 1988年2月に発行された「Voice Coding for Communications」版では、確立された実用的な音声ビット圧縮技術の幅広い範囲について報告しており、[ 36 ]その中には基本的な設計の一部として聴覚マスキングを使用しているものや、リアルタイムのハードウェア実装を示しているものもいくつかあります。
MP3技術の起源は、数年間ISO MPEGオーディオグループの議長を務めたハンス・ムスマン教授の論文[ 37 ]に詳しく記述されています。1988年12月、MPEGはオーディオ符号化規格を要求しました。1989年6月、14のオーディオ符号化アルゴリズムが提出されました。これらの符号化提案にはいくつかの類似点があったため、4つの開発グループに分類されました。最初のグループは、フラウンホーファー協会、AT&T、CNET(フランス・テレコム)、トムソンによるASPECでした[ 38 ]。2番目のグループは、松下電器産業、CCETT、ITT、フィリップスによるMUSICAMでした。3番目のグループは、富士通、JVC、NEC、ソニーによるATAC(ATRAC符号化)でした。そして4番目のグループは、 NTTとBTRLによるSB-ADPCMでした[ 37 ] 。
MP3 の直前の前身は、周波数領域における最適符号化 (OCF) [ 39 ]と知覚変換符号化 (PXFM) [ 40 ]でした。これらの 2 つのコーデックは、トムソン・ブラントによるブロック切り替えの貢献とともに、ASPEC というコーデックに統合され、MPEG に提出されて品質競争に勝ちましたが、実装するには複雑すぎるとして却下されました。ハードウェアでのオーディオ知覚コーダー (OCF) の最初の実用的な実装 (クラスナーのハードウェアは実用には扱いにくく遅すぎた) は、モトローラ 56000デジタル信号プロセッサ(DSP) チップに基づく心理音響変換コーダーの実装でした。
MP3フォーマットと技術のもう1つの前身は、心理音響モデルによって駆動される整数演算32サブバンドフィルタバンクに基づく知覚コーデックMUSICAMでした。これは主にデジタルオーディオ放送(デジタルラジオ)とデジタルテレビ向けに設計され、その基本原理は、1989年から松下電器産業とフィリップスと共同でMUSICAMに取り組んだ後、1991年にアトランタで開催されたIEEE- ICASSP会議でCCETT(フランス)とIRT(ドイツ)によって科学コミュニティに公開されました[ 41 ]。[ 37 ]
COFDM変調を使用する放送システムに組み込まれたこのコーデックは、1991年のNABショー(ラスベガス)でRadio CanadaとCRC Canadaとともに、オンエアとフィールドで実証されました[ 42 ]。この放送システムのオーディオ部分の実装は、2チップエンコーダ(1つはサブバンド変換用、もう1つはG. Stoll (IRTドイツ)のチームが設計した心理音響モデル用、後に心理音響モデルIとして知られる)と、YF Deheryのチーム(CCETT、フランス)が設計した整数演算ソフトウェアを実行するMotorola 56001 DSPチップを使用したリアルタイムデコーダに基づいています。対応するデコーダーのシンプルさと、48kHzの サンプリングレート、20ビット/サンプルの入力フォーマット(1991年当時利用可能な最高のサンプリング規格であり、AES/EBUプロフェッショナルデジタル入力スタジオ規格と互換性がある)を初めて採用したこのコーデックの高いオーディオ品質が、後にMUSICAMの特性を高度なデジタル音楽圧縮コーデックの基本機能として採用する主な理由となった。
MUSICAMエンコーディングソフトウェアの開発中、StollとDeheryのチームは、欧州放送連合のオーディオ専門家グループによって選定され、後に音楽圧縮コーデックの評価の基準として使用された一連の高品質オーディオ評価資料[ 43 ]を徹底的に活用しました。サブバンド符号化技術は、高品質サウンド素材の知覚符号化だけでなく、特に重要な打楽器サウンド素材(ドラム、トライアングルなど)の符号化にも効果的であることがわかりました。これは、MUSICAMサブバンドフィルタバンクの特定の時間マスキング効果によるものです(この利点は、短い変換符号化技術の特有の機能です)。
カールハインツ・ブランデンブルクは、ドイツのエアランゲン・ニュルンベルク大学の博士課程の学生として、1980年代初頭にデジタル音楽圧縮の研究を始め、人々が音楽をどのように知覚するかに焦点を当てた。彼は1989年に博士号を取得した。[ 44 ] MP3はOCFとPXFMから直接派生したもので、AT&Tベル研究所のジェームズ・D・ジョンストン(「JJ」)と共にAT&Tベル研究所でポスドク研究員として働いていたブランデンブルクと、エアランゲンのフラウンホーファー集積回路研究所(ベルンハルト・グリルと他の4人の研究者「オリジナル・シックス」[ 45 ]と共に働いていた)との共同研究の成果であり、心理音響サブバンドコーダーのMP2部門からの貢献は比較的小さい。1990年、ブランデンブルクはエアランゲン・ニュルンベルク大学の助教授になった。ブランデンブルクは、その地でフラウンホーファー協会のハインリッヒ・ヘルツ研究所の科学者たちと音楽圧縮の研究を続けた。1993年、彼はエアランゲンのフラウンホーファーIISのスタッフに加わった。[ 46 ] [ 44 ]スザンヌ・ヴェガの「トムズ・ダイナー」のアカペラバージョンは、ブランデンブルクがMP3フォーマットを開発するために最初に使用した曲だった。これは、MP3の圧縮アルゴリズムが人間の声をどれだけうまく処理できるかを確認するためのベンチマークとして使用された。ブランデンブルクはこの曲をテスト目的で採用し、圧縮アルゴリズムを改良するたびに何度も聴き、ヴェガの声の再現に悪影響を与えないことを確認した。[ 47 ]そのため、彼はヴェガを「MP3の母」と呼んだ。[ 48 ]
1991年、MPEGオーディオ規格の提案として、MUSICAM(Masking pattern adapted Universal Subband Integrated Coding And Multiplexing)とASPEC(Adaptive Spectral Perceptual Entropy Coding)の2つが評価されました。フィリップス(オランダ)、CCETT(フランス)、放送技術研究所(ドイツ)、松下電器産業(日本)が提案したMUSICAM技術[ 49 ]は、そのシンプルさとエラー耐性、そして高い計算効率[ 50 ]から選ばれました。サブバンド符号化に基づくMUSICAMフォーマットは、フレーム構造、ヘッダーフォーマット、サンプルレートなどを組み込んだMPEGオーディオ圧縮フォーマットの基礎となりました。
MUSICAM の技術とアイデアの多くは MPEG Audio Layer I と Layer II の定義に組み込まれましたが、MUSICAM のフィルタ バンクと 1152 サンプル フレーミング (ファイル フォーマットとバイト指向ストリーム) に基づくデータ構造は、計算効率の悪いハイブリッドフィルタバンクの一部として Layer III (MP3) フォーマットに残りました。ライプニッツ大学ハノーバーの Musmann 教授が議長を務め、標準の編集は Leon van de Kerkhof (オランダ)、Gerhard Stoll (ドイツ)、Yves-François Dehery (フランス) に委任され、彼らは Layer I と Layer II に取り組みました。ASPEC は AT&T Bell Laboratories、Thomson Consumer Electronics、Fraunhofer Society、CNETの共同提案でした。[ 51 ]最高の符号化効率を提供しました。
ファン・デ・ケルクホフ、ストール、レオナルド・キアリリオーネ(CSELTメディア担当副社長)、イヴ=フランソワ・デヘリー、カールハインツ・ブランデンブルク(ドイツ)、ジェームズ・D・ジョンストン(米国)からなるワーキンググループは、ASPEC のアイデアを取り入れ、レイヤー II のフィルターバンクを統合し、MUSICAM の共同ステレオ符号化などのアイデアを追加して、MP3 フォーマットを作成しました。MP3 は、192 kbit/sのMP2と同じ品質を128 kbit/sで実現するように設計されています。
MPEG-1 オーディオ レイヤ I、II、III のアルゴリズムは 1991 年に承認され[ 14 ] [ 15 ]、1992 年に最終決定されました[ 16 ] 。これは、 MPEGによる最初の標準スイートであるMPEG-1の一部であり、その結果、1993 年に国際標準ISO/IEC 11172-3 (別名MPEG-1 オーディオまたはMPEG-1 パート 3 ) が発行されました[ 7 ]。この標準に準拠するファイルまたはデータ ストリームは、48k、44100、および 32k のサンプル レートを処理する必要があり、現在のMP3 プレーヤーおよびデコーダで引き続きサポートされます。したがって、最初の世代の MP3 では、 MP3 フレーム データ構造とサイズ レイアウトの14 × 3 = 42 通りの解釈が定義されました。
エンコーダの圧縮効率は、通常ビットレートで定義されます。これは、圧縮率が入力信号のビット深度とサンプリングレートに依存するためです。しかしながら、圧縮率が公表されることもよくあります。その場合、コンパクトディスク(CD)のパラメータ(44.1 kHz、1チャンネルあたり16ビットの2チャンネル、または2×16ビット)を基準とする場合もあれば、デジタルオーディオテープ(DAT)SPのパラメータ(48 kHz、2×16ビット)を基準とする場合もあります。後者の基準を用いた場合の圧縮率は高くなりますが、これは、非可逆エンコーダに圧縮率 という用語を使用することの問題点を示しています。
ブランデンブルクは、MP3圧縮アルゴリズムを評価および改良するために、スザンヌ・ヴェガの曲「トムズ・ダイナー」の CD 録音を使用しました。[ 52 ]この曲は、ほぼモノラルでスペクトル成分が広いため、再生中に圧縮形式の不完全さを聞き取りやすくするために選ばれました。この特定のトラックには、2 つのチャンネルがほぼ同じですが、完全に同じではないという興味深い特性があり、エンコーダが状況を適切に認識して MPEG-2 AAC 心理音響モデルで詳述されているものと同様の補正を適用しない限り、バイノーラル マスキング レベル低下によりノイズ アーティファクトの空間的マスキング解除が発生するケースにつながります。EBU V3/SQAM リファレンス コンパクト ディスクから、より重要なオーディオ抜粋 (グロッケンシュピール、トライアングル、アコーディオンなど) が取得され、プロのサウンド エンジニアによって MPEG オーディオ フォーマットの主観的な品質を評価するために使用されています。
C 言語で記述され、後にISO 11172-5として知られる参照シミュレーション ソフトウェア実装は、ビット準拠の MPEG オーディオ ファイル (レイヤー 1、レイヤー 2、レイヤー 3) を生成するために、ISO MPEG オーディオ委員会のメンバーによって (1991 ~ 1996 年) 開発されました。これは、1994 年 3 月に ISO/IEC 技術レポートの委員会ドラフトとして承認され、1994 年 4 月に文書 CD 11172-5 として印刷されました。[ 53 ]これは、1994 年 11 月にドラフト技術レポート (DTR/DIS) として承認され、[ 54 ] 1996 年に最終化され、1998 年に国際標準 ISO/IEC TR 11172-5:1998 として発行されました。[ 55 ] C 言語の参照ソフトウェアは、後に自由に利用できる ISO 標準として公開されました。[ 56 ]いくつかのオペレーティングシステム上で非リアルタイムで動作し、圧縮オーディオの最初のリアルタイムハードウェアデコード(DSPベース)を実証することができました。MPEGオーディオエンコーダとデコーダの他のリアルタイム実装[ 57 ]は、消費者向け受信機やセットトップボックス向けのデジタル放送(ラジオDAB、テレビDVB )に利用可能でした。
1994 年 7 月 7 日、フラウンホーファー協会は、 l3encという名の最初のソフトウェア MP3 エンコーダをリリースしました。[ 58 ]ファイル名拡張子.mp3は、1995 年 7 月 14 日にフラウンホーファー チームによって選ばれました (以前はファイル名は.bitでした)。[ 59 ] [ 2 ]最初のリアルタイム ソフトウェア MP3 プレーヤーWinPlay3 (1995 年 9 月 9 日リリース) により、多くの人が PC で MP3 ファイルをエンコードして再生できるようになりました。当時のハードディスクは比較的小さかった (約 500 ~ 1000 MB ) ため、複数のアルバム分の音楽を完全な録音としてホーム コンピュータに保存するには、非可逆圧縮が不可欠でした ( MIDI記譜法や、記譜法と楽器が単音を演奏する短い録音を組み合わせたトラッカーファイルとは異なります)。
SoloHというニックネームのハッカーが、リリース直後にエアランゲン大学のサーバー上でdist10 MPEGリファレンス実装のソースコードを発見した。彼はそれをグラフィカルインターフェースに統合し、CDやWAVファイルからの簡単な変換を可能にし、インターネット上に拡散した。このソフトウェアは、 CDリッピングとMP3形式でのデジタル音楽のインターネット配信の普及のきっかけとなった。[ 60 ] [ 61 ] [ 62 ] [ 63 ]
* ISO規格ISO/IEC 11172-3(別名MPEG-1オーディオ)は、MPEG-1オーディオのレイヤーI、レイヤーII、レイヤーIIIの3つのフォーマットを定義しました。ISO規格ISO/IEC 13818-3(別名MPEG-2オーディオ)は、MPEG-1オーディオの拡張版であるMPEG-2オーディオのレイヤーI、レイヤーII、レイヤーIIIを定義しました。MPEG-2オーディオ(MPEG-2パート3)は、MPEG-2 AAC(MPEG-2パート7 – ISO/IEC 13818-7)と混同しないでください。 [ 17 ]
MPEGオーディオ[ 67 ]に関するさらなる作業は、1994年にMPEG規格の第2スイートであるMPEG-2の一部として完了しました。MPEG-2は、より正式には国際規格ISO/IEC 13818-3(別名MPEG-2パート3、または下位互換性のあるMPEG-2オーディオ、またはMPEG-2オーディオBC [ 17 ])として知られており、元々は1995年に発行されました。[ 8 ] [ 68 ] MPEG-2パート3(ISO/IEC 13818-3)は、MPEG-1オーディオレイヤI、II、およびIII用に42の追加ビットレートとサンプルレートを定義しました。新しいサンプリングレートは、MPEG-1オーディオで最初に定義されたもののちょうど半分です。このサンプリングレートの削減により、利用可能な周波数忠実度が半分になり、同様にビットレートも50%削減されます。 MPEG-2 Part 3 は、2 チャンネルを超えるオーディオ プログラムの符号化を可能にし、最大 5.1 マルチチャンネルまで対応することで MPEG-1 のオーディオ機能を強化したが、現在までにこの機能を使用したエンコーダは知られていない。[ 67 ]
MP3 スタイルのデータ ストリーム (ファイル) の第 3 世代は、MPEG-2 のアイデアと実装を拡張しましたが、MPEG-3 がすでに別の意味を持っていたため、MPEG-2.5 オーディオと名付けられました。この拡張は、フラウンホーファー IIS で、MP3 ヘッダーのフレーム同期フィールドを 12 ビットから 11 ビットに削減することによって開発されました。MPEG-1 から MPEG-2 への移行と同様に、MPEG-2.5 は、MPEG-2 で使用可能なサンプリング レートのちょうど半分のサンプリング レートを追加します。これにより、MP3 の範囲が人間の音声やその他のアプリケーションにまで広がり、MPEG-1 のサンプリング レートで可能な帯域幅 (周波数再現) の 25% しか必要としません。MPEG-2.5 は ISO で認められた標準ではありませんが、ほとんどのデジタル オーディオ プレーヤーや、コンピュータ ソフトウェアベースの MP3 エンコーダ ( LAME )、デコーダ (FFmpeg)、プレーヤー (MPC) で広くサポートされており、3 × 8 = 24種類の MP3 フレーム タイプが追加されています。 MP3の各世代は、前の世代のちょうど半分の3つのサンプリングレートをサポートしており、合計で9種類のMP3フォーマットファイルがあります。MPEG-1、2、および2.5のサンプリングレート比較表は、この記事の後半に記載されています。[ 65 ] [ 66 ] MPEG-2.5は、LAME(2000年以降)、Media Player Classic(MPC)、iTunes、およびFFmpegでサポートされています。
MPEG-2.5はMPEGによって開発されたものではなく(上記参照)、国際標準として承認されたこともありません。したがって、MPEG-2.5はMP3フォーマットの非公式な、あるいは独自の拡張機能と言えます。しかしながら、広く普及しており、特に低ビットレートの音声アプリケーションにおいて有利です。
1990年代後半、MP3ファイルはインターネット上で広まり始め、多くの場合、アンダーグラウンドの海賊版音楽ネットワークを介していました。インターネット配信の最初の既知の実験は、1990年代初頭にインターネットアンダーグラウンドミュージックアーカイブ(IUMAの略称でよく知られています)によって組織されました。非圧縮オーディオファイルを使用したいくつかの実験[ 69 ]の後、このアーカイブは、MP2(Layer II)形式を使用して圧縮されたMPEGオーディオファイルをネイティブの低速インターネット上で配信し始め、その後、標準が完全に完成するとMP3ファイルを使用するようになりました。MP3の人気は、1997年にリリースされたNullsoftのオーディオプレーヤーWinampの登場とともに急速に高まり始め、2023年時点でも8000万人のアクティブユーザーのコミュニティがありました。[ 70 ] 1998年、Windows Media Player 5.2以降はMP3フォーマットのサポートが追加され、韓国ソウルに本社を置くSaeHan Information Systemsが開発した初のポータブルソリッドステートデジタルオーディオプレーヤーMPManが発売され、RIAAによる法的抑圧の試みにもかかわらず、その後1998年にRio PMP300が販売された。[ 71 ]
1997年11月、ウェブサイトmp3.comは、インディーズアーティストが作成した数千ものMP3を無料で提供していた。[ 71 ] MP3ファイルのサイズが小さいため、以前はほぼ不可能だったCDからリッピングした音楽のピアツーピアファイル共有が広く普及した。最初の大規模なピアツーピアファイル共有ネットワークであるNapsterは1999年に立ち上げられた。MP3の作成と共有が容易になったことで、著作権侵害が広まった。大手レコード会社は、この音楽の無料共有が売上を減少させ、「音楽海賊行為」と呼んだ。彼らは、最終的に閉鎖され、後に売却されたNapsterと、ファイル共有に関与した個々のユーザーに対して訴訟を起こすことで対応した。Napsterは後に合法的な音楽ストリーミングサービスとして復活した。[ 72 ]
次世代のピアツーピアネットワーク上では、無許可のMP3ファイル共有が依然として続いている。Amazon.com 、Beatport、Bleep、eMusic、Juno Records、そして復活したNapsterといった正規サービスでは、MP3形式の音楽を制限なく販売している。
MP3 ファイルは、ヘッダーとデータ ブロックからなる MP3 フレームで構成されています。このフレームのシーケンスは、基本ストリームと呼ばれます。ビット リザーバのため、フレームは独立した項目ではなく、通常は任意のフレーム境界で抽出することはできません。MP3 データ ブロックには、周波数と振幅の (圧縮された) オーディオ情報が含まれています。図に示すように、MP3 ヘッダーは、有効なフレームの開始を識別するために使用される同期ワードで構成されています。これに続いて、これがMPEG標準であることを示す 1 ビットと、レイヤー 3 が使用されていることを示す 2 ビットが続きます。したがって、MPEG-1 オーディオ レイヤー 3 または MP3 となります。その後、値は MP3 ファイルによって異なります。ISO /IEC 11172-3 は、ヘッダーの仕様とともに、ヘッダーの各セクションの値の範囲を定義しています。今日のほとんどの MP3 ファイルには、図に示すように、MP3 フレームの前または後にID3メタデータが含まれています。データ ストリームには、オプションのチェックサムを含めることができます。
要するに、MP3圧縮は、(心理音響分析によって)ほとんどの人間の聴覚能力を超えていると考えられる音の特定の成分の精度を低下させることによって機能します。この方法は一般的に知覚符号化または心理音響モデリングと呼ばれています。[ 74 ]残りの音声情報は、 MDCTおよびFFTアルゴリズムを使用してスペース効率の良い方法で記録されます。
MP3 エンコード アルゴリズムは、一般的に 4 つの部分に分かれています。パート 1 では、オーディオ 信号をフレームと呼ばれる小さな断片に分割し、出力に対して MDCT フィルタを実行します。パート 2 では、サンプルを 1024 ポイントの高速フーリエ変換(FFT) に渡して、心理音響モデルを適用し、出力に対して別の MDCT フィルタを実行します。パート 3 では、ノイズ割り当てと呼ばれる各サンプルを定量化してエンコードし、ビット レートとサウンド マスキングの要件を満たすように調整します。パート 4 では、オーディオ フレームと呼ばれるビット ストリームをフォーマットします。オーディオ フレームは、ヘッダー、エラー チェック、オーディオ データ、および補助データの 4 つの部分で構成されています。[ 34 ]
MP3 はオーバーラップ MDCT 構造を使用します。各 MPEG-1 MP3 フレームは 1152 サンプルで、576 サンプルの 2 つの顆粒に分割されます。これらの 576 個の連続するサンプルは、最初は時間領域にあり、1 つのブロックで 576 個の周波数領域サンプルに変換されます。[ 75 ] MP3 では、顆粒内のブロックを 192 サンプルまで短くすることもできます。この機能は、過渡現象が検出された場合に適用されます。これにより、過渡現象に伴う量子化ノイズの時間的広がりが制限されます (音響心理学を参照)。周波数分解能は、小さな長いブロック ウィンドウ サイズによって制限され、符号化効率が低下します。[ 73 ]時間分解能は、過渡性の高い信号には低すぎる場合があり、打楽器の音のぼやけを引き起こす可能性があります。[ 73 ]
フィルタバンクのツリー構造のため、2 つのフィルタバンクの結合インパルス応答は時間/周波数分解能で最適なソリューションを提供しないため、プリエコーの問題が悪化します。[ 73 ]さらに、2 つのフィルタバンクの出力を組み合わせると、エイリアシング補償ステージで部分的に処理する必要のあるエイリアシング問題が発生しますが、これにより周波数領域で符号化される余剰エネルギーが発生し、符号化効率が低下します。[ 76 ]
一方、デコードは規格で厳密に定義されています。ほとんどのデコーダーはビットストリーム準拠であり、これは、特定のMP3ファイルから生成されるデコード出力が、指定された丸め許容範囲内で、ISO/IEC高規格文書(ISO/IEC 11172-3)で数学的に指定された出力と同じであることを意味します。したがって、デコーダーの比較は通常、計算効率(つまり、デコード処理で使用するメモリまたはCPU時間)に基づいて行われます。時間の経過とともに、 CPUクロックレートがMHzからGHzに移行するにつれて、この問題はそれほど重要ではなくなりました。エンコーダー/デコーダーの全体的な遅延は定義されていないため、ギャップレス再生の公式な規定はありません。ただし、LAMEなどの一部のエンコーダーは、対応するプレーヤーがシームレスな再生を実現できるように、追加のメタデータを付加することができます。
MP3データストリームを作成するなど、非可逆音声エンコードを実行する場合、生成されるデータ量と結果の音質の間にはトレードオフがあります。MP3を生成する人は、1秒あたり何キロビットの音声が必要かを指定するビットレートを選択します。ビットレートが高いほど、MP3データストリームは大きくなり、一般的に元の録音に近くなります。ビットレートが低すぎると、圧縮アーティファクト(つまり、元の録音には存在しなかった音)が再生時に聞こえることがあります。ランダム性と鋭いアタックのため、圧縮が難しい音声もあります。このような音声を圧縮すると、リンギングやプリエコーなどのアーティファクトが通常聞こえます。比較的低いビットレートの拍手やトライアングル楽器のサンプルは、圧縮アーティファクトの良い例です。知覚コーデックの主観的テストでは、このような種類の音源の使用を避ける傾向があるが、このフォーマットの基盤となっているレイヤーIIの32サブバンドフィルタバンクの特定の時間マスキング機能により、打楽器音によって生成されるアーティファクトはほとんど知覚できない。
MPEG -1規格には MP3 エンコーダの正確な仕様は含まれていませんが、元の規格の非規範的な部分で心理音響モデル、レート ループなどの例が提供されています。[ 77 ]この記述がなされた時点では、提案された実装はかなり古いものでした。規格の実装者は、音声入力から情報の一部を除去するのに適したアルゴリズムを考案することになっていました。その結果、さまざまな MP3 エンコーダが利用可能になり、それぞれ異なる品質のファイルが生成されました。比較は広く利用可能だったので、エンコーダの将来のユーザーが最適な選択肢を調べるのは簡単でした。高ビットレートでのエンコードに優れたエンコーダ ( LAMEなど) の中には、低ビットレートでは必ずしもそれほど優れていないものもありました。
MP3エンコードされた音声の品質は、エンコードされた音声のビットレートに加えて、エンコーダアルゴリズムの品質とエンコードされる信号の複雑さにも依存します。MP3規格ではエンコードアルゴリズムにかなりの自由度があるため、同じビットレートであっても、エンコーダによって品質が大きく異なります。たとえば、約128 kbit/sに設定された2つの初期のMP3エンコーダを使用した公開リスニングテストでは、[ 78 ] 1つは1~5のスケールで3.66を獲得しましたが、もう1つはわずか2.22でした。品質はエンコーダとエンコードパラメータの選択に依存します。[ 79 ]
この発見は、オーディオエンコーディングに革命をもたらしました。当初、ビットレートは唯一の重要な考慮事項でした。当時、MP3ファイルは非常にシンプルなタイプで、ファイル全体で同じビットレートを使用していました。このプロセスは、定ビットレート(CBR)エンコーディングとして知られています。定ビットレートを使用すると、エンコーディングが簡単になり、CPU負荷も軽減されます。しかし、ファイル全体でビットレートが変化するファイルを作成することで、ファイルサイズを最適化することもできます。これらは可変ビットレートとして知られています。ビットリザーバーとVBRエンコーディングは、オリジナルのMPEG-1規格の一部でした。これらの背後にある概念は、あらゆるオーディオにおいて、無音や少数の音しか含まない音楽など、圧縮しやすい部分と、圧縮しにくい部分があるということです。したがって、複雑でない部分には低いビットレートを、複雑な部分には高いビットレートを使用することで、ファイルの全体的な品質を向上させることができます。一部の高度なMP3エンコーダでは、特定の品質を指定することができ、エンコーダはそれに応じてビットレートを調整します。耳に違和感のない特定の「音質設定」を求めるユーザーは、すべての音楽をエンコードする際にこの値を使用でき、一般的には、適切なビットレートを決定するために各楽曲について個人的なリスニングテストを行う必要はありません。
知覚される音質は、リスニング環境(周囲の騒音)、リスナーの注意、リスナーのトレーニング、そしてほとんどの場合リスナーのオーディオ機器(サウンドカード、スピーカー、ヘッドホンなど)によって影響を受ける可能性があります。さらに、講義や人間の音声アプリケーションでは、より低い品質設定でも十分な品質が得られ、エンコード時間と複雑さが軽減されます。スタンフォード大学の音楽教授ジョナサン・バーガーが新入生に実施したテストでは、MP3品質の音楽に対する学生の好みが年々高まっていることが示されました。バーガーは、学生はMP3が音楽にもたらす「きらめき」音を好むようだと述べています。[ 80 ]
MP3オーディオ品質の詳細な研究であるサウンドアーティスト兼作曲家のライアン・マグワイアのプロジェクト「The Ghost in the MP3」は、MP3圧縮中に失われた音を分離します。2015年に彼は、MP3規格の策定に元々使用された楽曲「Tom's Diner」のMP3圧縮中に削除された音のみで構成された楽曲「moDernisT」(「Tom's Diner」のアナグラム)をリリースしました。MP3圧縮中に削除された音を分離するために使用された技術の詳細と、プロジェクトの概念的な動機は、2014年の国際コンピュータ音楽会議の議事録に掲載されました。[ 84 ]
ビットレート(技術的にはデータレート)は、通常ビット/秒で測定され、オーディオデータをエンコードする際に、サンプルサイズ(オーディオサンプルあたりのビット数)とサンプリングレートに関連しています16ビットサンプルを使用した単純なパルス符号変調でエンコードされます2つのチャンネル(左と右)それぞれについて、毎秒44,100回。したがって、 毎秒44,100サンプル 1サンプルあたり16ビット2 チャンネルで1,411,200ビット/秒 ― 非圧縮CDデジタルオーディオのデータレート。MP3はこのデータをエンコードするために設計されました。1411 kbit/s の生データ320 kbit/s以下。MP3アルゴリズムによって比較的単純な音声部分が検出された場合は、より低いビットレートが使用される場合があります。
以下の2つの表に示すように:
以前のシステムでは、MP3 の早送りや巻き戻しの再生制御もありませんでした。 [ 86 ] [ 87 ]
MPEG-1 フレームは、最も高い許容ビットレート設定である320 kbit/sモードで最も詳細を含んだ[ 88 ] 、無音と単純なトーンは依然として32 kbit/sを必要とする。MPEG-2 フレームは、最大160 kbit/s を必要とする最大 12 kHz の音声再生をキャプチャできる。
44.1 kHz のサンプリング レートは、MP3 ファイルを作成する主なソースであるCD オーディオ にも使用されているため、音楽再生によく使用されます。インターネットではさまざまなビット レートが使用されています。128 kbit/sのビット レートが一般的に使用されており、圧縮率は 11:1 で、比較的小さなスペースで十分なオーディオ品質を提供します。[ 89 ]インターネットの帯域幅とハード ドライブの容量が増加するにつれて、最大320 kbit/sのより高いビット レートが広く普及しています。オーディオ CD に保存されている非圧縮オーディオのビット レートは1,411.2 kbit/sです(16 ビット/サンプル× 44,100 サンプル/秒× 2 チャンネル/ 1,000 ビット/キロビット)。したがって、128、160、192 kbit/sのビット レートは、それぞれ約 11:1、9:1、7:1 の圧縮率を表します。
LAMEエンコーダとフリーフォーマットオプションを使用すると、最大640 kbit/sの非標準ビットレートを実現できますが、これらのファイルを再生できるMP3プレーヤーはほとんどありません。ISO規格によると、デコーダは最大320 kbit/sのストリームをデコードできるだけで十分です。[ 90 ] [ 91 ] [ 92 ]初期のMPEG Layer IIIエンコーダは、現在では定ビットレート(CBR)と呼ばれるものを使用していました。このソフトウェアは、MP3ファイルのすべてのフレームで均一なビットレートしか使用できませんでした。その後、より高度なMP3エンコーダは、ビットリザーバーを使用して平均ビットレートをターゲットにし、録音のその部分の音の複雑さに基づいて各フレームのエンコードレートを選択できるようになりました。
より高度な MP3 エンコーダは、可変ビットレートのオーディオを生成できます。MPEG オーディオはフレームごとにビットレートの切り替えを使用できますが、レイヤー III デコーダのみがそれをサポートする必要があります。[ 66 ] [ 93 ] [ 94 ] [ 95 ] VBR は、一定の品質レベルを達成することが目的の場合に使用されます。VBR エンコードの最終的なファイル サイズは、一定ビットレートの場合よりも予測しにくくなります。平均ビットレートは、この 2 つの間の妥協として実装された VBR の一種です。ビット レートは、より一貫した品質のために変化できますが、予測可能なファイル サイズのために、ユーザーが選択した平均値の近くに留まるように制御されます。MP3 デコーダは標準に準拠するために VBR をサポートする必要がありますが、歴史的に、特に VBR エンコーダが普及する前は、一部のデコーダには VBR デコードに関するバグがありました。
MPEG規格では最大320 kbit/sのビットレートが認められていますが、MP3仕様の見落としにより、標準CDサンプリングレート44.1 kHzで320 kbit/s( VBRファイル内の320 kbit/sフレームを含む)を使用すると、規格で認められているよりも大きなフレームが生成されます。ほとんどのプレーヤーはこれらのファイルも再生できます。44.1 kHzで規格に厳密に準拠する 最高ビットレートは256 kbit/sです。48 kHzではフレームサイズが制限内に収まるため、これは問題になりません。MPEG-1の場合、制限は1フレームあたり7680ビットで、これは320 kbpsの48 KHzフレームのサイズです。[ 96 ]
レイヤ III オーディオは、部分的に満たされたフレームが次のフレームのオーディオ データの一部を保持できるビット リザーバも使用でき、一定のビット レート ストリームでも実効ビット レートを一時的に変更できます。 [ 66 ] [ 93 ]ビット リザーバの内部処理により、エンコード遅延が増加します。[ 97 ]約 16 kHzを超える周波数にはスケール ファクター バンド 21 (sfb21) がないため、エンコーダはバンド 21 での精度の低い表現か、バンド 21 より低いすべてのバンドでの効率の低いストレージのどちらかを選択せざるを得ず、後者は VBR エンコードでビット レートの無駄につながります。[ 98 ]
補助データフィールドは、ユーザー定義データを格納するために使用できます。補助データはオプションであり、使用可能なビット数は明示的に指定されていません。補助データはハフマン符号ビットの後に配置され、次のフレームの main_data_begin が指す位置までの範囲です。エンコーダmp3PROは、補助データを使用して追加情報をエンコードし、そのアルゴリズムで復号化する際にオーディオ品質を向上させることができます。
音声ファイル内のタグは、タイトル、アーティスト、アルバム、トラック番号、またはファイルの内容に関するその他の情報などのメタデータを含むファイルの一部です。MP3規格ではMP3ファイルのタグ形式は定義されておらず、メタデータをサポートしてタグの必要性をなくす標準コンテナ形式もありません。しかし、タグ形式にはいくつかの事実上の標準が存在します。2010年現在、最も広く普及しているのはID3v1とID3v2、そして最近導入されたAPEv2です。これらのタグは通常、実際のMP3フレームデータとは別に、MP3ファイルの先頭または末尾に埋め込まれます。MP3デコーダは、タグから情報を抽出するか、タグを無視可能な非MP3ジャンクデータとして扱います。
再生および編集ソフトウェアにはタグ編集機能が含まれていることが多いが、専用のタグエディタアプリケーションもある。オーディオコンテンツに関するメタデータ以外にも、タグはDRMにも使用されることがある。[ 99 ] ReplayGainは、MP3ファイルの音量(オーディオ正規化)を測定し、メタデータタグに保存するための標準規格であり、ReplayGain準拠のプレーヤーが各ファイルの全体的な再生音量を自動的に調整できるようにする。MP3Gainは、ReplayGainの測定値に基づいてファイルを可逆的に変更するために使用でき、ReplayGain機能を持たないプレーヤーでも調整された再生を実現できる。
MP3の基本的なデコードおよびエンコード技術は、欧州連合では特許フリーであり、遅くとも2012年までにすべての特許が失効しています。米国では、この技術は2017年4月16日に実質的に特許フリーになりました(下記参照)。米国では、2007年から2017年の間にMP3の特許が失効しました。過去には、多くの組織がMP3のデコードまたはエンコードに関連する特許の所有権を主張しました。これらの主張は、さまざまな方面からの法的脅迫や訴訟につながりました。その結果、ソフトウェア特許を認めている国では、特許侵害を犯さずにMP3製品を作成するためにどの特許のライセンスを取得しなければならないかについての不確実性が、この技術の採用初期段階では一般的でした。
ほぼ完成した最初の MPEG-1 規格 (パート 1、2、および 3) は、1991 年 12 月 6 日に ISO CD 11172 として公開されました。[ 100 ] [ 101 ]ほとんどの国では、先行技術が公開された後は特許を出願することはできず、特許は最初の出願日から 20 年で失効します。他の国では、出願日から最大 12 か月後になる場合があります。その結果、MP3 を実装するために必要な特許は、ISO CD 11172 の公開から 21 年後の 2012 年 12 月までにほとんどの国で失効しました。
例外は米国で、1995 年 6 月 8 日より前に出願された有効な特許は、発行日から 17 年または優先日から 20 年のいずれか遅い方の後に失効します。特許審査手続きが長引くと、通常予想されるよりもはるかに遅れて特許が発行されることがあります (潜水艦特許を参照)。MP3 関連の各種特許は、米国では 2007 年から 2017 年の間に失効しました。[ 102 ] ISO CD 11172 に開示されているものに関する特許で、発行から 1 年以上後に出願されたものは疑わしいです。1992 年 12 月までに出願された既知の MP3 特許のみを考慮すると、1992 年 10 月にPCT 出願された米国特許 5,812,672が失効した 2015 年 9 月 22 日以降、米国では MP3 デコードは特許フリーとなっています。[ 103 ] [ 104 ] [ 105 ]上記の参考文献で言及されている最も長く有効な特許を基準とすると、MP3技術は、テクニカラー社が保有し管理していた米国特許第6,009,399号[ 106 ][ 107 ]が失効した2017年4月16日に米国で特許フリーになった。その結果、Fedora Linuxオペレーティングシステムなどの多くのフリーでオープンソースのソフトウェアプロジェクトは、デフォルトでMP3サポートを出荷することを決定し、ユーザーはMP3再生やエンコードのためにサードパーティのソフトウェアリポジトリが管理する非公式パッケージをインストールする必要がなくなった。[ 108 ]
テクニカラー(旧トムソン・コンシューマー・エレクトロニクス)は、米国、日本、カナダ、EU諸国を含む多くの国でレイヤー3特許のMP3ライセンスを管理していると主張した。[ 109 ]テクニカラーはこれらの特許を積極的に行使していた。[ 110 ]テクニカラーの管理によるMP3ライセンス収入は、2005年にフラウンホーファー協会に約1億ユーロをもたらした。[ 111 ] 1998年9月、フラウンホーファー研究所は、MP3ソフトウェアの複数の開発者に「デコーダおよび/またはエンコーダを配布および/または販売するにはライセンスが必要である」という内容の書簡を送付した。この書簡では、ライセンスのない製品は「フラウンホーファーとトムソンの特許権を侵害している。[MPEGレイヤー3]規格、ひいては当社の特許を使用する製品を製造、販売、または配布するには、当社からこれらの特許に基づくライセンスを取得する必要があります」と主張した。[ 112 ]このため、 LAME MP3エンコーダープロジェクトは、ユーザーのコンピュータで実行できる公式バイナリを提供できない状況に陥った。プロジェクトの立場は、ソースコードとしてのLAMEは、MP3エンコーダーの実装方法を記述したものに過ぎないというものだった。非公式には、コンパイル済みのバイナリは他のソースから入手可能だった。
ルクセンブルクに拠点を置く Sisvel SpA は、MPEG オーディオに適用される特許のライセンスを管理しています。[ 113 ]同社は、米国子会社 Audio MPEG, Inc. と共に、以前 MP3 技術の特許侵害で Thomson を訴えていましたが、[ 114 ]これらの紛争は 2005 年 11 月に Sisvel が Thomson に特許のライセンスを付与することで解決しました。Motorola もすぐにこれに続き、2005 年 12 月に Sisvel と MP3 関連の特許のライセンス契約を締結しました。[ 115 ] 3 つの特許を除いて、Sisvel が管理する米国特許[ 116 ]はすべて 2015 年に失効しました。例外の 3 つの特許は次のとおりです。米国特許 5,878,080、2017年 2 月に失効。米国特許 5,850,456、2017年 2 月に失効。また、米国特許第5,960,037号は2017年4月9日に失効した。2023年第1四半期頃には、Sisvelのライセンスプログラムは過去のものとなった。[ 117 ]
2006 年 9 月、ドイツ当局は、ライセンス権をめぐる紛争で Sisvel の代理として SanDisk に対して差止命令を獲得した後、ベルリンで開催されたIFA ショーのSanDiskのブースから MP3 プレーヤーを押収した。この差止命令は後にベルリンの裁判官によって取り消されたが、 [ 118 ]その取り消しは同日、同じ裁判所の別の裁判官によって阻止され、ある評論家は「ドイツに特許の無法地帯がもたらされた」と評した。[ 119 ] 2007 年 2 月、Texas MP3 Technologies は、テキサス東部連邦裁判所で Apple、Samsung Electronics、Sandisk を提訴し、Texas MP3 が譲渡されたと主張するポータブル MP3 プレーヤーの特許の侵害を主張した。Apple、Samsung、Sandisk は、2009 年 1 月に訴訟で和解した。[ 120 ] [ 121 ]
アルカテル・ルーセントは、 AT&Tベル研究所から引き継いだとされる複数のMP3符号化および圧縮特許を、自社の訴訟で主張している。2006年11月、両社が合併する前、アルカテルはマイクロソフトを7件の特許侵害で訴えた。2007年2月23日、サンディエゴの陪審は、そのうち2件の特許侵害でアルカテル・ルーセントに15億2000万米ドルの損害賠償を命じた。[ 122 ]しかし、裁判所はその後、1件の特許は侵害されておらず、もう1件はアルカテル・ルーセントが所有するものではなく、AT&Tとフラウンホーファーが共同所有し、マイクロソフトにライセンス供与していたものであるとして、賠償金を取り消した。[ 123 ]この判決は2008年の控訴審で支持された。 [ 124 ]
他の非可逆圧縮フォーマットも存在します。その中でも、Advanced Audio Coding (AAC) が最も広く使用されており、MP3 の後継として設計されました。mp3PROやMP2などの他の非可逆圧縮フォーマットも存在します。これらはMP3と同じ技術ファミリーに属し、ほぼ同様の心理音響モデルと MDCT アルゴリズムに依存しています。MP3 は MDCT とFFTを組み合わせたハイブリッド コーディング方式を使用していますが、AAC は純粋に MDCT であり、圧縮効率が大幅に向上しています。[ 125 ]これらのフォーマットの基盤となる基本特許の多くは、フラウンホーファー協会、アルカテル・ルーセント、トムソン・コンシューマー・エレクトロニクス、[ 125 ]ベル、ドルビー、LG エレクトロニクス、NEC、NTT ドコモ、パナソニック、ソニー、[ 126 ] ETRI、JVC ケンウッド、フィリップス、マイクロソフト、NTT が保有しています。[ 127 ]
マイクロソフトは、MP3 よりも優れていると主張して、独自の競合規格であるWindows Media Audio (WMA) を作成し、宣伝しました。 [ 128 ]デジタルオーディオプレーヤー市場が急成長していた頃、MP3 は標準として広く採用され、そのためMP3 プレーヤーという名前が広く知られるようになりました。ソニーは例外で、ミニディスク形式から派生した独自のATRACコーデックを使用し、ソニーはこれが優れていると主張しました。[ 129 ]批判と予想を下回るウォークマンの販売を受けて、2004 年にソニーは初めてウォークマンプレーヤーにネイティブ MP3 サポートを導入しました。[ 130 ]
また、 OpusやVorbis (OGG)のようなオープンな圧縮フォーマットもあり、これらは無料で利用でき、既知の特許制限もありません。[ 102 ]
非可逆圧縮方式に加え、可逆圧縮方式はMP3に代わる重要な選択肢です。可逆圧縮方式は音声コンテンツを劣化させることなく伝送できますが、ファイルサイズは非可逆圧縮方式よりも大きくなります。可逆圧縮方式には、FLAC(Free Lossless Audio Codec)、Apple Losslessなど、数多くの種類があります。
フラウンホーファー研究所には他に4人の研究者が加わった。ハインツ・ゲルハウザーは研究所のオーディオ研究グループを統括し、ハラルド・ポップはハードウェア専門家、エルンスト・エーベルラインは信号処理の専門家、ユルゲン・ヘレはブランデンブルクに匹敵する数学の才能を持つ大学院生だった。後にこのグループは自らを「オリジナル・シックス」と呼ぶことになる。
このワークステーションは、プロフェッショナルな編集ステーションとしてだけでなく、圧縮デジタルオーディオライブラリ用のイーサネットサーバーとしても使用され、インターネット上の将来のMP3を先取りしています。
業界にコーデックの使い方を示すために、MPEG は音楽を MP3 ファイルに変換する無料のサンプル プログラムを作成しました。デモ ソフトウェアは音質が悪く、フラウンホーファー研究所は使用を意図していませんでした。ソフトウェアの「ソース コード」、つまりその基本となる命令は、エアランゲン大学のアクセスしやすいコンピュータに保存されており、オランダのハッカー SoloH (おそらくスター ウォーズのファン) がそこからダウンロードしました。SoloH はソース コードを改良し、コンパクト ディスクのトラックを許容できる品質の音楽ファイルに変換するソフトウェアを作成しました。
「MPEG-2.5」は、フラウンホーファーIISが開発した独自の拡張機能の名称です。これにより、MP3は非常に低いビットレートでも問題なく動作し、8kHz 、11.025kHz 、 12kHzという追加のサンプリングレートが導入されます。
検索 – ディスク上の目的の位置を検索(オーディオCDのみ)(2004年製ブームボックス)
• MP3/WMA/JPEG-CD では早送りや再生レビューは機能しません。