無音圧縮は、無音区間を効果的にエンコードし、オーディオ録音の送信に必要なストレージまたは帯域幅の量を削減するために使用されるオーディオ処理技術です。
概要
無音は、無視できるほどの音を含むオーディオセグメントとして定義できます。無音の例としては、スピーチにおける単語や文の間の休止、音楽における音符の間の休止などがあります。無音区間を圧縮することで、オーディオファイルは小さくなり、元の音質を維持しながら、取り扱い、保存、送信が容易になります。技術はさまざまですが、無音圧縮は通常、無音区間の検出とそれに続くそれらの区間の圧縮という 2 つの重要なステップによって実現されます。無音圧縮の用途には、電気通信、オーディオストリーミング、音声認識、オーディオアーカイブ、メディア制作などがあります。[1]
テクニック
1. トリミング
トリミングは、無音区間を完全に削除する無音圧縮方法です。これは、一定の振幅しきい値を下回るオーディオ区間を識別し、無音を示し、その区間をオーディオから削除することによって行われます。トリミングの欠点は、元のオーディオを永久に変更し、オーディオを再生したときに目立つアーティファクトを引き起こす可能性があることです。[1]
a. 振幅閾値トリミング
振幅しきい値トリミングは、振幅しきい値を設定することで無音部分を削除します。このしきい値を下回るオーディオ セグメントは無音とみなされ、切り詰められるか完全に削除されます。一般的な振幅しきい値トリミング アルゴリズムには次のものがあります。[引用が必要]
- 固定しきい値:固定しきい値アプローチでは、静的な振幅レベルが選択され、このしきい値を下回るオーディオセグメントは削除されます。このアプローチの欠点は、録音条件とオーディオソースの違いにより、適切な固定しきい値を選択するのが難しい場合があることです。[引用が必要]
- 動的しきい値:動的しきい値アプローチでは、オーディオ特性に基づいてしきい値を動的に調整するアルゴリズムが適用されます。アルゴリズムの例としては、しきい値を特定のウィンドウ内の平均振幅の割合として設定することが挙げられます。このアプローチでは、さまざまなオーディオ ソースを処理する際の適応性が向上しますが、処理の複雑さが増します。[引用が必要]
b. エネルギーベースのトリミング
エネルギーベースのトリミングは、オーディオ信号のエネルギー レベルの分析を通じて機能します。オーディオ信号のエネルギー レベルは、短い時間間隔での信号の大きさです。オーディオのエネルギーを計算する一般的な式は で、 は信号のエネルギー、はオーディオ信号内のサンプル数、 は番目のサンプルの信号振幅です。エネルギー レベルが計算されると、しきい値が設定され、しきい値を下回るすべてのエネルギー レベルは無音と見なされ、削除されます。エネルギー ベースのトリミングは、音波の振幅だけでなくオーディオの全体的な出力を考慮するため、振幅ベースのトリミングよりも正確に無音を検出できます。エネルギー ベースのトリミングは、サウンドを含む関連部分のみを保存および送信する必要があるため、音声/スピーチ ファイルによく使用されます。一般的なエネルギー ベースのトリミング アルゴリズムには、短時間エネルギー (STE) 法とゼロ クロッシング レート(ZCR) 法があります。[2]同様に、これらのアルゴリズムは、音声アクティビティ検出(VAD)でもスピーチ アクティビティを検出するために使用されます。[1] [3]
2. 沈黙の抑制
無音抑制は、ボイスオーバーIP (VoIP)とオーディオストリーミングのコンテキスト内でデータ転送速度を最適化するために使用される技術です。無音区間のデータを一時的に削減することで、オーディオをインターネット上でリアルタイムに効率的にブロードキャストできます。[1] [3]
a.不連続伝送(DTX)
DTX は、無音区間を検出し、その区間の送信を一時停止することで、リアルタイム通信中の帯域幅の使用を最適化します。音声信号を継続的に監視することで、DTX アルゴリズムは事前に定義された基準に基づいて無音を検出できます。無音が検出されると、受信機に信号が送信され、音声データの送信が停止されます。音声/音が再開されると、音声送信が再開されます。この技術により、ネットワーク リソースの使用効率が非常に高く、中断のない通信が可能になります。[1] [3]
3. 無音エンコード
無音エンコーディングは、無音部分を完全に削除することなく、無音区間を効率的に表現するために不可欠です。これにより、オーディオ信号の整合性を維持しながら、無音部分をエンコードして送信するために必要なデータを最小限に抑えることができます。[4] [5] [6]この目的で使用されるエンコード方法はいくつかあります。
a.ランレングス符号化(RLE)
RLE は、オーディオ内の同じサンプルの繰り返しを検出し、それらのサンプルをよりスペース効率の高い方法でエンコードします。各同じサンプルを個別に保存するのではなく、RLE は単一のサンプルを保存し、それが何回繰り返されるかをカウントします。無音区間は多くの場合、同じサンプルの繰り返しシーケンスで構成されるため、RLE は無音のエンコードに適しています。その後に保存される同じサンプルが削減されると、オーディオ信号のサイズが削減されます。[4] [5]
b.ハフマン符号化
ハフマン符号化は、より一般的な値に、より少ないビット数で格納できる短いバイナリコードを割り当てるエントロピー符号化方式および可変長コードアルゴリズムです。ハフマン符号化は、頻繁に発生する無音パターンに短いバイナリコードを割り当てることでデータサイズを削減し、無音圧縮のコンテキストで機能します。[5] [6]
4. 差分符号化
差分符号化は、サンプル間の差分のみを保存することで、無音区間における連続するオーディオサンプル間の類似性を利用する。差分符号化は、音と無音の間の遷移を効率的に符号化するために使用され、無音とアクティブな音が混在するオーディオサンプルに有効である。[7] [8] [9]差分符号化アルゴリズムには次のものがある。
a.デルタ変調
デルタ変調は、オーディオサンプルの振幅の微分をエンコードすることで、連続するオーディオサンプル間の差異を量子化してエンコードします。サンプル自体ではなく、オーディオ信号が時間の経過とともにどのように変化するかを保存することで、無音から音への移行を効率的にキャプチャできます。デルタ変調は通常、1ビットの量子化メカニズムを使用し、1はサンプルサイズの増加を示し、0は減少を示します。これにより、帯域幅やストレージを効率的に使用できますが、低振幅信号の高忠実度エンコードは提供できません。[8]
b.デルタシグマ変調
デルタシグマ変調はデルタ変調のより高度な変種であり、低振幅信号の高忠実度エンコードを可能にします。これは、高オーバーサンプリングレートで量子化することによって行われ、オーディオ信号のわずかな変化を正確にエンコードできます。デルタシグマ変調は、高いオーディオ忠実度の維持が優先される状況で使用されます。[9]
アプリケーション
無音圧縮によるオーディオ サイズの縮小は、さまざまなアプリケーションで使用されます。
- 電気通信: VoIP などの電気通信システムにおけるサイレント送信の削減により、帯域幅の使用効率が向上し、データ コストが削減されます。
- オーディオ ストリーミング:無音圧縮により、オーディオ ストリーミング中のデータ使用量が最小限に抑えられ、高品質のオーディオをインターネット経由で効率的にブロードキャストできるようになります。
- オーディオ アーカイブ:無音圧縮により、オーディオの忠実度を維持しながら、オーディオを保存するために必要なスペースを節約できます。
参考文献
- ^ abcde Benyassine, A.; Shlomot, E.; Su, H.-Y.; Massaloux, D.; Lamblin, C.; Petit, J.-P. (1997). 「ITU-T勧告G.729 Annex B:V.70デジタル同時音声およびデータアプリケーション向けに最適化されたG.729で使用する無音圧縮方式」. IEEE Communications Magazine . 35 (9): 64–73. doi :10.1109/35.620527 . 2023-11-09閲覧。
- ^ Sahin, Arda; Unlu, Mehmet Zubeyir (2021-01-20). 「無声音/無音成分の除去による音声ファイル圧縮」. Sustainable Engineering and Innovation . 3 (1): 11–14. doi : 10.37868/sei.v3i1.119 . ISSN 2712-0562. S2CID 234125634.
- ^ abc 「ITU-T G.729.1無音圧縮方式について」IEEE . 2023年11月9日閲覧。
- ^ ab Elsayed, Hend A. (2014). 「ロスレスオーディオコーディングのためのBurrows-Wheeler変換とMove-to-FrontコーディングおよびRun Length Encodingの組み合わせ」。2014年第9回国際コンピュータエンジニアリングおよびシステム会議 (ICCES)。pp. 354–359。doi : 10.1109/ ICCES.2014.7030985。ISBN 978-1-4799-6594-6. S2CID 15743605 . 2023年11月9日閲覧。
- ^ abc Patil, Rupali B.; Kulat, KD (2017). 「動的ハフマンおよび RLE コーディングを使用したオーディオ圧縮」。2017 第 2 回国際通信・電子システム会議 (ICCES)。pp. 160–162。doi : 10.1109 / CESYS.2017.8321256。ISBN 978-1-5090-5013-0. S2CID 4122679 . 2023年11月9日閲覧。
- ^ ab Firmansah, Luthfi; Setiawan, Erwin Budi (2016). 「ハフマンシフトコーディングアルゴリズムによるロスレス FLAC 形式からロスのあるオーディオ MP3 形式へのデータオーディオ圧縮」 2016 第 4 回国際情報通信技術会議 (ICoICT)。pp. 1–5。doi : 10.1109 / ICoICT.2016.7571951。ISBN 978-1-4673-9879-4. S2CID 18754681 . 2023年11月9日閲覧。
- ^ Jensen, J.; Heusdens, R. (2003). 「低レート正弦波オーディオコーディングの差分方式の比較」 2003 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (IEEE Cat. No.03TH8684). pp. 205–208. doi :10.1109/ASPAA.2003.1285867. ISBN 0-7803-7850-4. S2CID 58213603 . 2023年11月9日閲覧。
- ^ ab Zhu, YS; Leung, SW; Wong, CM (1996). 「非均一サンプリングデルタ変調に基づくデジタルオーディオ処理システム」. IEEE Transactions on Consumer Electronics . 42 : 80–86. doi :10.1109/30.485464 . 2023年11月9日閲覧。
- ^ ab 「オーディオDSP向けシグマデルタ変調」。IEEE 。 2023年11月9日閲覧。
