
パルス符号変調(PCM)を用いたデジタルオーディオにおいて、ビット深度とは各サンプルに含まれる情報ビット数であり、各サンプルの解像度に直接対応します。ビット深度の例としては、 1サンプルあたり16ビットを使用するCD-DAやDVD-Video 、そして1サンプルあたり最大24ビットまで対応可能なDVD-AudioやBlu-ray Discなどが挙げられます。
基本的な実装では、ビット深度の変化は主に量子化誤差によるノイズレベル、ひいては信号対雑音比(SNR)とダイナミックレンジに影響を与えます。しかし、ディザリング、ノイズシェーピング、オーバーサンプリングなどの技術を用いることで、ビット深度を変更せずにこれらの影響を軽減できます。ビット深度はビットレートとファイルサイズにも影響します。
ビット深度は、PCMデジタル信号を記述するのに役立ちます。非PCM形式(例えば、非可逆圧縮を使用する形式)には、関連するビット深度はありません。[ a ]
PCM信号は、元のアナログ信号を復元するために必要な情報を含むデジタルオーディオサンプルのシーケンスです。各サンプルは、特定の時点における信号の振幅を表し、サンプルは時間的に均等な間隔で配置されています。振幅はサンプルに明示的に格納される唯一の情報であり、通常は整数または浮動小数点数として格納されます。浮動小数点数は、サンプルのビット深度(ワード長またはワードサイズとも呼ばれる)を持つバイナリ数としてエンコードされます。
分解能は、アナログ値の範囲で表現できる離散値の数を示します。バイナリ整数の分解能は、ワード長が増加するにつれて指数関数的に増加します。1ビット追加すると分解能は2倍になり、2ビット追加すると4倍になります。整数ビット深度で表現できる可能な値の数は、2 nを使用して計算できます。ここで、nはビット深度です。[ 1 ]したがって、16ビットシステムでは、65,536 (2 16 ) 個の可能な値の分解能があります。
整数PCMオーディオデータは通常、2の補数形式の符号付き数値として格納されます。[ 2 ]
今日では、ほとんどのオーディオファイル フォーマットとデジタル オーディオ ワークステーション(DAW) も、浮動小数点数で表現されるサンプルを含む PCM フォーマットをサポートしています。[ 3 ] [ 4 ] [ 5 ] [ 6 ] WAVファイル フォーマットとAIFFファイル フォーマットの両方が浮動小数点表現をサポートしています。 [ 7 ] [ 8 ]ビット パターンが単一のビット列である整数とは異なり、浮動小数点数は、数学的な関係によって数値を形成する別々のフィールドで構成されています。最も一般的な標準はIEEE 754で、これは、数値が正か負かを表す符号ビット、仮数、および仮数をスケーリングするための 2 乗係数を決定する指数という 3 つのフィールドで構成されています。仮数は、IEEE 2 進浮動小数点フォーマットではバイナリ小数として表現されます。 [ 9 ]
ビット深度は、再構成された信号の信号対雑音比(SNR)を量子化誤差によって決まる最大レベルに制限します。ビット深度は周波数応答には影響を与えません。周波数応答はサンプリングレートによって制約されます。
アナログ-デジタル変換(ADC)時に発生する量子化誤差は、量子化ノイズとしてモデル化できます。これは、ADCへのアナログ入力電圧と出力されるデジタル値との間の丸め誤差です。このノイズは非線形であり、信号に依存します。

理想的なADCでは、量子化誤差は最下位ビット(LSB) で、信号がすべての量子化レベルをカバーする均一分布を持つ場合、信号対量子化雑音比(SQNR) は次のように計算できます。
ここで、bは量子化ビット数であり、結果はデシベル(dB)で測定されます。[ 10 ] [ 11 ]
したがって、 CDに収録されている16ビットデジタルオーディオの理論上の最大SN比は98dBであり 、プロフェッショナル向け24ビットデジタルオーディオの最高SN比は146dBである 。2011年現在デジタルオーディオコンバータ技術は、集積回路設計の現実的な制約により、約 123 dB (実質的に 21 ビット)の SNRに制限されています。 [ 12 ] [ 13 ] [ 14 ]それでも、これは人間の聴覚系の性能とほぼ一致します。[ 17 ] [ 18 ]複数のコンバータを使用して同じ信号の異なる範囲をカバーすることができ、長期的にはより広いダイナミック レンジを記録するために組み合わせることができますが、短期的には単一のコンバータのダイナミック レンジによって制限されます。これはダイナミック レンジ拡張と呼ばれます。[ 19 ] [ 20 ]
浮動小数点サンプルの解像度は、整数サンプルよりも複雑です。なぜなら、浮動小数点値は等間隔ではないからです。浮動小数点表現では、隣接する2つの値の間の間隔は、その値に比例します。
浮動小数点形式と整数形式のトレードオフは、同じビット深度の大きな整数値間の間隔よりも、大きな浮動小数点値間の間隔の方が大きいことです。大きな浮動小数点数を丸めると、小さな浮動小数点数を丸めるよりも大きな誤差が生じますが、整数を丸めると常に同じレベルの誤差が生じます。言い換えれば、整数は均一な丸め処理を持ち、常に最下位ビット (LSB) を 0 または 1 に丸めます。一方、浮動小数点形式は均一な SNR を持ち、量子化ノイズレベルは常に信号レベルに対して一定の比率になります。[ 21 ]浮動小数点ノイズフロアは、信号が上昇すると上昇し、信号が下降すると下降するため、ビット深度が十分に低い場合は可聴域の変動が生じます。[ 22 ]
デジタルオーディオの処理操作のほとんどはサンプルの再量子化を伴うため、アナログ-デジタル変換中に発生する元の量子化誤差と同様の追加の丸め誤差が発生します。ADC中の暗黙の誤差よりも大きな丸め誤差を防ぐには、処理中の計算を入力サンプルよりも高い精度で実行する必要があります。[ 23 ]
デジタル信号処理(DSP)演算は、固定小数点精度または浮動小数点精度のいずれでも実行できます。いずれの場合も、各演算の精度は、入力データの解像度ではなく、処理の各ステップを実行するために使用されるハードウェア演算の精度によって決まります。たとえば、 x86プロセッサでは、浮動小数点演算は単精度または倍精度で実行され、固定小数点演算は16ビット、32ビット、または64ビットの解像度で実行されます。したがって、ソースフォーマットに関係なく、Intelベースのハードウェアで実行されるすべての処理は、これらの制約の下で実行されます。[ c ]
固定小数点デジタル信号プロセッサは、特定の信号分解能をサポートするために、特定のワード長をサポートすることがよくあります。たとえば、Motorola 56000 DSP チップは、24 ビット乗算器と 56 ビットアキュムレータを使用して、オーバーフローや切り捨てなしで 2 つの 24 ビットサンプルに対して乗算累積演算を実行します。 [ 24 ]大きなアキュムレータをサポートしないデバイスでは、固定小数点の結果が切り捨てられ、精度が低下する可能性があります。エラーは、実行される演算に応じて、DSP の複数のステージで累積します。DC オフセットのないオーディオデータに対する相関のない処理ステップでは、エラーは平均がゼロのランダムであると想定されます。この想定の下では、分布の標準偏差がエラー信号を表し、量子化エラーは演算数の平方根に比例します。[ 25 ]畳み込みなどの繰り返し処理を伴うアルゴリズムでは、高いレベルの精度が必要です。[ 23 ]無限インパルス応答(IIR) フィルタなどの再帰アルゴリズムでは、高い精度も必要です。 [ 26 ] IIR フィルタの場合、丸め誤差によって周波数応答が劣化し、不安定になる可能性があります。[ 23 ]

丸め誤差や音声処理中に発生する精度低下など、量子化誤差によって生じるノイズは、量子化前に信号にディザと呼ばれる少量のランダムノイズを加えることで軽減できます。ディザリングは非線形量子化誤差の挙動を排除し、歪みを非常に低く抑えますが、ノイズフロアがわずかに上昇するという代償を伴います。ITU -R 468 ノイズ重み付けを使用して測定した 16 ビット デジタル オーディオの推奨ディザは、アライメント レベルより約 66 dB 、またはデジタルフル スケールより 84 dB 低く、これはマイクロフォンと室内のノイズ レベルに匹敵するため、16 ビット オーディオではほとんど影響がありません。
24ビットおよび32ビットオーディオでは、デジタルコンバータのノイズレベルが常に適用される可能性のあるディザのレベルよりも大きいため、ディザリングは不要です。24ビットオーディオは理論的には144 dBのダイナミックレンジをエンコードでき、32ビットオーディオは192 dBを達成できますが、最高のセンサーやマイクでも130 dBを超えることはめったにないため、現実世界ではこれを達成することはほぼ不可能です 。[ 27 ]
ディザリングは、実効ダイナミックレンジを拡大するためにも使用できます。ノイズシェーピングディザリングを使用すると、人間の耳の周波数応答を利用して、 16ビットオーディオの知覚 ダイナミックレンジを120 dB以上にすることができます。[ 28 ] [ 29 ]
ダイナミックレンジとは、システムが記録または再生できる最大信号と最小信号の差のことです。ディザリングがない場合、ダイナミックレンジは量子化ノイズフロアと相関します。たとえば、16ビット整数解像度では、約96 dBのダイナミックレンジが可能です。ディザリングを適切に適用すると、デジタルシステムは、解像度で通常許容されるよりも低いレベルの信号を再生でき、解像度によって課される制限を超えて実効ダイナミックレンジを拡張できます。[ 30 ]オーバーサンプリングやノイズシェーピングなどの技術を使用すると、量子化誤差を対象周波数帯域から移動させることで、サンプリングされたオーディオのダイナミックレンジをさらに拡張できます。
信号の最大レベルがビット深度で許容されるレベルよりも低い場合、録音にはヘッドルームがあります。スタジオ録音時にビット深度を高くすることで、同じダイナミックレンジを維持しながらヘッドルームを確保できます。これにより、低音量時の量子化誤差を増加させることなく、クリッピングのリスクを低減できます。
オーバーサンプリングは、サンプルあたりのビット数を変更せずに PCM オーディオのダイナミック レンジを拡大する代替方法です。[ 31 ]オーバーサンプリングでは、オーディオ サンプルは目的のサンプル レートの倍数で取得されます。量子化誤差は周波数に対して一様に分布していると想定されるため、量子化誤差の大部分は超音波周波数にシフトし、再生中にデジタル - アナログ コンバータによって除去できます。
nビットの解像度増加に相当する増加を実現するには、信号をオーバーサンプリングする必要がある。
例えば、14ビットADCは、 16倍オーバーサンプリング(768kHz)で動作させると、16ビット48kHzのオーディオを生成できます 。したがって、オーバーサンプリングPCMは、同じ解像度を得るために、サンプルあたりのビット数を減らし、サンプル数を増やします。
信号再構成時にオーバーサンプリングを行うことで、ソースでのオーバーサンプリングを行わなくてもダイナミックレンジを向上させることができます。再構成時に16倍のオーバーサンプリングを行う場合を考えてみましょう。再構成時の各サンプルは、元のサンプルポイントごとに16個のサンプルが挿入されるため、それぞれ固有のものとなります。これらのサンプルはすべてデジタル再構成フィルタによって計算されたものです。実効ビット深度が増加するメカニズムは、前述のとおり、量子化ノイズパワーは低減されていませんが、ノイズスペクトルがオーディオ帯域幅の16倍に分散されているためです。
歴史的注記—コンパクトディスク規格は、ソニーとフィリップスの共同開発によって誕生しました。ソニー初の民生用ユニットは16ビットDACを搭載し、フィリップス初のユニットはデュアル14ビットDACを搭載していました。14ビットPCMは84dBの SNRを実現し、16ビットPCMより12dB低いため、市場やプロの間でも混乱が生じました。フィリップスは、理論的にはCDフォーマットの96dBのダイナミックレンジ全体を実現する 4倍オーバーサンプリングと一次ノイズシェーピングを実装していました。 [ 32 ]実際には、フィリップスCD100は20Hz~20kHzのオーディオ帯域で90dBのSNRと評価され、ソニーのCDP-101と同じでした。[ 33 ] [ 34 ]
信号をオーバーサンプリングすると、すべての周波数で単位帯域幅あたりの量子化ノイズが等しくなり、ダイナミックレンジはオーバーサンプリング比の平方根に比例して向上します。ノイズシェーピングは、より高い周波数で追加のノイズを加えることで、より低い周波数でのエラーの一部を打ち消し、オーバーサンプリング時にダイナミックレンジをより大きく向上させる技術です。n 次ノイズシェーピングの場合、オーバーサンプリングされた信号のダイナミックレンジは、ノイズシェーピングなしのオーバーサンプリングと比較して、さらに 6 n dB 向上します。[ 35 ]例えば、20 kHz のアナログオーディオを 4 倍オーバーサンプリングし、2 次ノイズシェーピングを適用すると、ダイナミックレンジは 30 dB 増加します。したがって、176 kHz でサンプリングされた 16 ビット信号は、ノイズシェーピングなしで 44.1 kHz でサンプリングされた 21 ビット信号と同じビット深度になります 。
ノイズシェーピングは、一般的にデルタシグマ変調を用いて実現されます。デルタシグマ変調を用いることで、ダイレクトストリームデジタルは、64倍オーバーサンプリングされた1ビットオーディオを使用し、オーディオ周波数において理論上120dBの SNRを達成します。
ビット深度は、デジタルオーディオ実装における基本的な特性です。アプリケーションの要件や機器の性能に応じて、異なるアプリケーションで異なるビット深度が使用されます。
ビット深度はビットレートとファイルサイズに影響します。ビットは、コンピューティングとデジタル通信で使用されるデータの基本単位です。ビットレートとは、1秒あたりに送受信されるデータ量、具体的にはビット数を指します。MP3やその他の非可逆圧縮オーディオフォーマットでは、ビットレートはオーディオ信号をエンコードするために使用される情報量を表します。通常、kb/sで測定されます。[ 58 ]
ビットDACは多くの場合、約16ビットの性能しか発揮できず、最高でも21ビット(ENOB)の性能にしか達しない。
ダイナミックレンジ(-60
dB入力、A特性):
標準124 dB ダイナミックレンジ(-60
dB入力、20
kHz帯域幅):
標準122 dB
SNR(A特性モノラル@48kHz
)、123dB
SNR(非特性ステレオ@48kHz
)
つまり、32ビットDACは最大でも21ビットの有用なデータしか出力できず
、残りのビットは回路ノイズによって隠されてしまいます。
現在存在する「32ビット対応」DACチップはすべて、実際の解像度が24ビット未満です
。
人間の聴覚のダイナミックレンジは[およそ]120
dBです。
dB]
と言える。
量子化ノイズのエネルギーを聞き取りにくい周波数に移動させるシェイプド ディザを使用すると、16 ビット オーディオの実効ダイナミック レンジは実際には 120dB に達し、96dB という主張の 15 倍以上深くなります。120dB は、同じ部屋のどこかにいる蚊と 1 フィート離れたジャックハンマーの差よりも大きく、... または、誰もいない「防音」の部屋と、数秒で聴覚障害を引き起こすほど大きな音の差よりも大きいです。16 ビットは、私たちが聞くことができるすべてを保存するのに十分であり、永遠に十分です。
PCMにおける偉大な発見の1つは、小さなランダムノイズ(ディザと呼ばれる)を加えることで、切り捨て効果をなくすことができるということだった。さらに重要なのは、加える
べき適切な
種類のランダムノイズが存在し、適切なディザを使用すると、デジタルシステムの解像度が
無限に
なるという認識だった。