情報理論において、データ圧縮、ソース符号化[ 1 ]、またはビットレート削減とは、元の表現よりも少ないビット数で情報を符号化するプロセスである[ 2 ] 。特定の圧縮は、可逆圧縮か非可逆圧縮のいずれかである。非可逆圧縮は、統計的冗長性を識別して除去することでビット数を削減する。非可逆圧縮では情報が失われることはない。非可逆圧縮は、不要な情報や重要度の低い情報を削除することでビット数を削減する[ 3 ]。一般的に、データ圧縮を実行するデバイスはエンコーダと呼ばれ、その逆の処理(解凍)を実行するデバイスはデコーダと呼ばれる。
データファイルのサイズを縮小するプロセスは、データ圧縮と呼ばれることが多い。データ伝送の文脈では、ソースコーディングと呼ばれる。エンコードは、データが保存または送信される前に、データのソースで行われる。[ 4 ]ソースコーディングは、誤り検出および訂正のためのチャネルコーディングや、データを信号にマッピングする手段であるラインコーディングと混同してはならない。
データ圧縮アルゴリズムは、情報を保存または送信するために必要なバイト数と、エンコードおよびデコードを実行するために必要な計算リソースとの間で、空間的・時間的複雑性のトレードオフを示します。データ圧縮方式の設計には、圧縮率、(非可逆データ圧縮を使用する場合に)発生する歪みの量、およびデータの圧縮と解凍に必要な計算リソースまたは時間のバランスを取ることが含まれます。[ 5 ]
可逆データ圧縮アルゴリズムは通常、統計的冗長性を利用して情報を失うことなくデータを表現するため、処理は可逆的です。可逆圧縮が可能なのは、現実世界のほとんどのデータに統計的冗長性があるためです。例えば、画像には複数のピクセルにわたって色が変化しない領域がある場合があります。「赤いピクセル、赤いピクセル、…」と符号化する代わりに、データは「279個の赤いピクセル」と符号化されることがあります。これはランレングス符号化の基本的な例です。冗長性を排除することでファイルサイズを削減する方式は他にも多数存在します。
Lempel –Ziv (LZ) 圧縮方式は、ロスレスストレージで最も人気のあるアルゴリズムの 1 つです。[ 6 ] DEFLATEは、解凍速度と圧縮率を最適化する LZ のバリエーションですが、[ 7 ]圧縮は遅くなることがあります。1980 年代半ば、Terry Welchの研究に続いて、Lempel–Ziv–Welch (LZW) アルゴリズムは、ほとんどの汎用圧縮システムで急速に選ばれる方法になりました。LZW は、GIF画像、 PKZIPなどのプログラム、モデムなどのハードウェア デバイスで使用されています。[ 8 ] LZ 方式は、テーブル エントリが繰り返しの文字列に置き換えられるテーブル ベースの圧縮モデルを使用します。ほとんどの LZ 方式では、このテーブルは入力の以前のデータから動的に生成されます。テーブル自体は、多くの場合ハフマン符号化されています。このような文法ベースのコードは、非常に反復的な入力を極めて効率的に圧縮できます。例えば、同じ種または近縁種の生物学的データコレクション、膨大なバージョン管理された文書コレクション、インターネットアーカイブなどが挙げられます。文法ベースのコードの基本的なタスクは、単一の文字列を導出する文脈自由文法を構築することです。その他の実用的な文法圧縮アルゴリズムには、SequiturやRe-Pairなどがあります。
最も強力な最新のロスレス圧縮器は、部分一致による予測などの確率モデルを使用します。バローズ・ウィーラー変換も、統計モデリングの間接的な形式と見なすことができます。確率モデリングの直接使用をさらに洗練させたものとして、統計的推定値を算術符号化と呼ばれるアルゴリズムと組み合わせることができます。算術符号化は、有限状態機械の数学的計算を使用して、一連の入力データシンボルから符号化されたビット列を生成する、より現代的な符号化技術です。よく知られているハフマンアルゴリズムなどの他の技術と比較して、優れた圧縮率を実現できます。内部メモリ状態を使用することで、個々の入力シンボルを整数ビット数を使用する個別の表現に1対1でマッピングする必要がなくなり、データシンボル列全体を符号化した後にのみ内部メモリをクリアします。算術符号化は、統計が変動し、コンテキストに依存する適応型データ圧縮タスクに特に適しています。これは、入力データの確率分布の適応型モデルと容易に組み合わせることができるためです。算術符号化の使用の初期の例は、JPEG画像符号化規格のオプション機能 (ただし広く使用されていない) にありました。[ 9 ]その後、 H.263、H.264/MPEG-4 AVC、HEVCなどのビデオ符号化を含むさまざまな設計に適用されました。[ 10 ]
アーカイブソフトウェアは通常、「辞書サイズ」を調整する機能を備えており、サイズが大きいほど圧縮および解凍時に多くのランダムアクセスメモリが必要になりますが、特にファイルの内容の繰り返しパターンに対してより強力に圧縮されます。[ 11 ] [ 12 ]

1980 年代後半にはデジタル画像がより一般的になり、可逆画像圧縮の標準が登場しました。1990 年代初頭には、非可逆圧縮方式が広く使われるようになりました。[ 13 ]これらの方式では、不要な詳細を削除することでストレージ容量を節約できるため、ある程度の情報が失われることが許容されます。情報の保持とサイズの削減の間には、それに応じたトレードオフがあります。非可逆データ圧縮方式は、人々が問題のデータをどのように認識するかの研究に基づいて設計されています。たとえば、人間の目は、色の変化よりも輝度の微妙な変化に対してより敏感です。JPEG 画像圧縮は、不要なビットを丸めることで部分的に機能します。[ 14 ]音声の心理音響学や画像とビデオの心理視覚学 など、多くの一般的な圧縮形式がこれらの知覚の違いを利用しています。
ほとんどの非可逆圧縮方式は変換符号化、特に離散コサイン変換(DCT)に基づいています。これは1972年にNasir Ahmedによって初めて提案され、その後1973年にT. NatarajanとKR Raoと共に実用的なアルゴリズムを開発し、1974年1月に発表されました。[ 15 ] [ 16 ] DCTは最も広く使用されている非可逆圧縮方式であり、画像(JPEGやHEIFなど)[ 17 ] 、ビデオ( MPEG、AVC 、HEVCなど)、オーディオ( MP3、AAC、Vorbisなど)のマルチメディア形式で使用されています。
デジタルカメラでは、記憶容量を増やすために非可逆画像圧縮が用いられています。同様に、DVD、Blu-ray、ストリーミングビデオでも非可逆ビデオ符号化フォーマットが使用されています。非可逆圧縮はビデオ分野で広く利用されています。
非可逆音声圧縮では、音声信号の非可聴成分(または可聴性の低い成分)を除去するために、心理音響学の手法が用いられます。人間の音声の圧縮は、さらに特殊な技術を用いて行われることが多く、音声符号化は汎用音声圧縮とは別の分野として区別されます。例えば、音声符号化はインターネット電話に用いられ、音声圧縮はCDリッピングに用いられ、オーディオプレーヤーによって復号化されます。
非可逆圧縮は、生成損失を引き起こす可能性があります。
圧縮の理論的基礎は情報理論、より具体的にはシャノンのソース符号化定理によって提供される。ドメイン固有の理論には、可逆圧縮のためのアルゴリズム情報理論と、非可逆圧縮のためのレート歪み理論がある。これらの研究分野は基本的にクロード・シャノンによって創始され、彼は1940年代後半から1950年代前半にかけてこのテーマに関する基礎的な論文を発表した。圧縮に関連するその他のトピックには、符号化理論と統計的推論がある。[ 18 ]
機械学習と圧縮には密接な関係があります。シーケンスの全履歴に基づいてシーケンスの事後確率を予測するシステムは、最適なデータ圧縮に使用できます(出力分布に算術符号化を使用することによって)。逆に、最適な圧縮器は予測に使用できます(過去の履歴に基づいて最も圧縮率の高いシンボルを見つけることによって)。この等価性は、データ圧縮を「汎用知能」のベンチマークとして使用することの正当化として使用されてきました。[ 19 ] [ 20 ] [ 21 ]
別の見方では、圧縮アルゴリズムは暗黙的に文字列を暗黙的な特徴空間ベクトルにマッピングし、圧縮ベースの類似度尺度はこれらの特徴空間内で類似度を計算すると説明できます。各圧縮器 C(.) に対して、関連するベクトル空間 ℵ を定義します。これは、C(.) が入力文字列 x をベクトルノルム ||~x|| に対応するようにマッピングします。すべての圧縮アルゴリズムの基となる特徴空間を網羅的に調べることはスペースの制約により不可能です。代わりに、特徴ベクトルでは、代表的な 3 つの可逆圧縮方法、LZW、LZ77、および PPM を調査することを選択します。[ 22 ]
AIXI理論によれば(この理論は『Hutter Prize』でより直接的に説明されている)、xの最適な圧縮とは、xを生成するソフトウェアの最小サイズである。例えば、このモデルでは、zipファイルの圧縮サイズにはzipファイル自体と解凍ソフトウェアの両方が含まれる。なぜなら、両方がなければ解凍できないからである。しかし、さらに小さい組み合わせ形式が存在する可能性もある。
AI を活用したオーディオ/ビデオ圧縮ソフトウェアの例としては、NVIDIA Maxine、AIVC などがあります。[ 23 ] AI を活用した画像圧縮を実行できるソフトウェアの例としては、OpenCV、TensorFlow、MATLABの Image Processing Toolbox (IPT)、High-Fidelity Generative Image Compression などがあります。[ 24 ]
教師なし機械学習では、k-meansクラスタリングは、類似したデータポイントをクラスタにグループ化することでデータを圧縮するために利用できます。この手法は、事前定義されたラベルのない大規模なデータセットの処理を簡素化し、画像圧縮などの分野で広く使用されています。[ 25 ]
データ圧縮は、データファイルのサイズを縮小し、ストレージ効率を高め、データ転送を高速化することを目的としています。教師なし機械学習アルゴリズムであるK平均クラスタリングは、データセットを指定された数のクラスタkに分割するために使用され、各クラスタは、その点の重心によって表されます。このプロセスにより、膨大なデータセットがよりコンパクトな代表点のセットに圧縮されます。特に画像処理や信号処理において有益なK平均クラスタリングは、データ点のグループをその重心に置き換えることでデータ削減を支援し、元のデータのコア情報を保持しながら、必要なストレージ容量を大幅に削減します。[ 26 ]
大規模言語モデル(LLM) は、DeepMindの Chinchilla 70B モデルによる研究で実証されているように、一部のデータセットでは効率的なロスレス データ圧縮器でもあります。DeepMind が開発した Chinchilla 70B は、効果的にデータを圧縮し、画像用のPortable Network Graphics (PNG) や音声用のFree Lossless Audio Codec (FLAC) などの従来の方法を上回りました。画像データと音声データをそれぞれ元のサイズの 43.4% と 16.4% に圧縮することに成功しました。ただし、テストに使用したデータセットが LLM のトレーニング データセットと重複しているため、Chinchilla 70B モデルは、すでにトレーニング済みのデータに対してのみ効率的な圧縮ツールである可能性があるという懸念があります。[ 27 ] [ 28 ]

データ圧縮は、データ差分法の特殊なケースと見なすことができます。[ 29 ] [ 30 ]データ差分法は、ソースとターゲットが与えられた場合に差分を生成することと、ソースと差分が与えられた場合にターゲットを再現するパッチングから成ります。データ圧縮ではソースとターゲットが分離されていないため、データ圧縮は空のソースデータを使用したデータ差分法と見なすことができ、圧縮されたファイルは何もないことからの差分に対応します。これは、絶対エントロピー(データ圧縮に対応)を、初期データがない相対エントロピー(データ差分法に対応)の特殊なケースと見なすことと同じです。
差分圧縮という用語は、データの差分化との関連性を強調するために用いられる。
エントロピー符号化は、 1940年代にシャノン・ファノ符号化が導入されたことから始まり[ 31 ]、1950年に開発されたハフマン符号化の基礎となった[ 32 ]。変換符号化は、1968年に高速フーリエ変換(FFT)符号化、1969年にアダマール変換が導入された1960年代後半に遡る[ 33 ]。
重要な画像圧縮技術の一つに、1970年代初頭に開発された離散コサイン変換(DCT)があります。 [ 15 ] DCTは、1992年にJoint Photographic Experts Group(JPEG)によって導入された非可逆圧縮フォーマットであるJPEGの基礎となっています。[ 34 ] JPEGは、画質の低下は比較的小さいものの、画像を表現するために必要なデータ量を大幅に削減し、最も広く使用されている画像ファイルフォーマットとなっています。[ 35 ] [ 36 ]その非常に効率的なDCTベースの圧縮アルゴリズムは、デジタル画像やデジタル写真の普及に大きく貢献しました。[ 37 ]
Lempel–Ziv–Welch (LZW) は、1984 年に開発された可逆圧縮アルゴリズムです。1987 年に導入されたGIFフォーマットで使用されています。 [ 38 ] 1996 年に規定されたDEFLATE は、Portable Network Graphics (PNG) フォーマットで使用されています。[ 39 ]
画像圧縮におけるウェーブレットの使用であるウェーブレット圧縮は、DCT コーディングの開発後に始まりました。[ 40 ] JPEG 2000規格は 2000 年に導入されました。[ 41 ]オリジナルの JPEG フォーマットで使用されていた DCT アルゴリズムとは対照的に、JPEG 2000 は離散ウェーブレット変換(DWT) アルゴリズムを使用します。[ 42 ] [ 43 ] [ 44 ] Motion JPEG 2000拡張機能を含む JPEG 2000 技術は、2004 年にデジタル シネマのビデオ コーディング規格として選択されました。[ 45 ]
音声データ圧縮(ダイナミックレンジ圧縮とは異なります)は、音声データの伝送帯域幅とストレージ要件を削減する可能性を秘めています。音声圧縮フォーマットの圧縮アルゴリズムは、ソフトウェア上でオーディオコーデックとして実装されます。非可逆圧縮と可逆圧縮の両方において、符号化、量子化、DCT、線形予測などの手法を用いて、非圧縮データを表現するために使用される情報量を削減することで、情報の冗長性を低減します。
非可逆音声圧縮アルゴリズムはより高い圧縮率を提供し、 VorbisやMP3を含む多数のオーディオアプリケーションで使用されています。これらのアルゴリズムはほぼすべて、心理音響学を利用して、聞こえにくい音の忠実度を低下または除去し、それによって音を保存または送信するために必要な容量を削減します。[ 2 ] [ 46 ]
音質の低下と伝送または保存容量の許容できるトレードオフは、アプリケーションによって異なります。たとえば、640 MB のコンパクト ディスク(CD) 1 枚には、非圧縮の高忠実度音楽が約 1 時間、ロスレスで圧縮された音楽が 2 時間未満、または中ビットレートのMP3形式で圧縮された音楽が 7 時間保存できます。デジタル サウンド レコーダーは通常、640 MB に約 200 時間分の明瞭な音声を保存できます。[ 47 ]
ロスレス音声圧縮は、元のデジタルデータの正確な複製に復号できるデジタルデータの表現を生成します。圧縮率は元のサイズの約 50 ~ 60% であり、[ 48 ]一般的なロスレスデータ圧縮の場合と同様です。ロスレスコーデックは、曲線フィッティングまたは線形予測を信号推定の基礎として使用します。推定と推定値と実際の信号との差を記述するパラメータは別々に符号化されます。[ 49 ]
ロスレスオーディオ圧縮フォーマットは数多く存在します。一覧については、ロスレスコーデックのリストを参照してください。一部のフォーマットは、特定のシステムに関連付けられています。例えば、スーパーオーディオCDで使用されるDirect Stream Transferや、 DVDオーディオ、ドルビートゥルーHD、ブルーレイ、HD DVDで使用されるMeridian Lossless Packingなどです。
音声ファイル形式の中には、非可逆圧縮形式と可逆圧縮補正を組み合わせたものがあります。これにより、補正部分を取り除くことで簡単に非可逆圧縮ファイルを取得できます。このような形式には、MPEG-4 SLS(Scalable to Lossless)、WavPack、OptimFROG DualStreamなどがあります。
音声ファイルをさらに圧縮したり編集したりする場合、元のファイル(非圧縮または可逆圧縮)をそのまま使用するのが望ましい。何らかの目的で非可逆圧縮されたファイルを処理しても、通常は非圧縮の元のファイルから同じ圧縮ファイルを作成した場合よりも最終結果が劣る。音声編集やミキシングに加え、可逆圧縮音声はアーカイブ保存やマスターコピーとしてもよく使用される。

非可逆音声圧縮は、幅広い用途で使用されています。MP3プレーヤーやコンピューターでのファイル再生といった音声のみのスタンドアロンアプリケーションに加え、デジタル圧縮された音声ストリームは、ほとんどのビデオDVD、デジタルテレビ、インターネット上のストリーミングメディア、衛星放送やケーブルラジオ、そして地上波ラジオ放送でもますます使用されています。非可逆圧縮は、心理音響最適化に基づいて重要度の低いデータを破棄することで、通常、可逆圧縮よりもはるかに高い圧縮率を実現します。 [ 50 ]
音響心理学では、音声ストリームに含まれるすべてのデータが人間の聴覚系で知覚できるわけではないことを認識しています。ほとんどの非可逆圧縮では、まず知覚的に無関係な音、つまり非常に聞き取りにくい音を特定することで冗長性を低減します。典型的な例としては、高周波音や、より大きな音と同時に発生する音などが挙げられます。これらの無関係な音は、精度を落として符号化されるか、あるいは全く符号化されません。
非可逆圧縮アルゴリズムの性質上、ファイルの解凍と再圧縮の際に音質が劣化します。そのため、非可逆圧縮は、サウンド編集やマルチトラック録音といったプロフェッショナルなオーディオエンジニアリングアプリケーションで中間結果を保存するのには適していません。しかし、MP3などの非可逆フォーマットは、ファイルサイズが元のサイズの5~20%に縮小され、1メガバイトで約1分間の音楽を十分な音質で保存できるため、エンドユーザーには非常に人気があります。
可逆圧縮と非可逆圧縮を組み合わせ、適応型ビットレートと低圧縮率を用いることで、より高品質なオーディオ性能を実現する独自の非可逆圧縮アルゴリズムがいくつか開発されている。例としては、aptX、LDAC、LHDC、MQA、SCL6などが挙げられる。
音声信号中のどの情報が知覚的に無関係であるかを判断するために、ほとんどの非可逆圧縮アルゴリズムは、修正離散コサイン変換(MDCT)などの変換を使用して、時間領域でサンプリングされた波形を変換領域 (通常は周波数領域) に変換します。変換後、コンポーネント周波数は、可聴性に応じて優先順位付けできます。スペクトル成分の可聴性は、絶対聴力閾値と同時マスキング(周波数で分離された別の信号によって信号がマスキングされる現象)の原理、および場合によっては時間マスキング(時間で分離された別の信号によって信号がマスキングされる現象) の原理を使用して評価されます。等ラウドネス輪郭を使用して、コンポーネントの知覚的重要性を重み付けすることもできます。このような効果を組み込んだ人間の耳と脳の組み合わせのモデルは、しばしば心理音響モデルと呼ばれます。[ 51 ]
音声に使用される線形予測符号化(LPC)などの他のタイプの非可逆圧縮器は、音源ベースの符号化器です。LPCは、人間の声道のモデルを使用して音声を分析し、モデルが音声を生成するために使用するパラメータを瞬間的に推測します。これらの変化するパラメータは送信または保存され、デコーダ内の別のモデルを駆動するために使用されます。デコーダは音声を再現します。
非可逆圧縮形式は、ストリーミングオーディオやインタラクティブ通信(携帯電話ネットワークなど)の配信によく使用されます。このようなアプリケーションでは、データストリーム全体が送信された後ではなく、データが流れている間にデータを解凍する必要があります。すべてのオーディオコーデックがストリーミングアプリケーションに使用できるわけではありません。[ 50 ]
遅延は、データのエンコードおよびデコードに使用される方法によって発生します。一部のコーデックは、効率を最適化するために、フレームと呼ばれるデータのより長いセグメントを分析し、その後、一度にデコードするためにより大きなデータセグメントを必要とする方法でエンコードします。コーディングアルゴリズム固有の遅延は重大な問題となる可能性があります。たとえば、電話の会話のように双方向のデータ伝送がある場合、大きな遅延は知覚品質を著しく低下させる可能性があります。
圧縮速度はアルゴリズムに必要な演算回数に比例するのに対し、ここでいうレイテンシーとは、音声ブロックを処理する前に解析しなければならないサンプル数を指します。最小の場合、レイテンシーはサンプル数ゼロです(例えば、コーダ/デコーダが信号の量子化に使用するビット数を減らすだけの場合)。LPCなどの時間領域アルゴリズムはレイテンシーが低いことが多く、そのため電話の音声符号化で広く用いられています。しかし、MP3などのアルゴリズムでは、周波数領域で心理音響モデルを実装するために多数のサンプルを解析する必要があり、レイテンシーは約23 ミリ秒になります。
音声符号化は、音声データ圧縮の重要なカテゴリです。人間の耳が聞き取れる音声の特徴を推定するために使用される知覚モデルは、一般的に音楽に使用されるモデルとは多少異なります。人間の声の音を伝えるために必要な周波数範囲は、通常、音楽に必要な周波数範囲よりもはるかに狭く、音自体も通常はそれほど複雑ではありません。そのため、音声は比較的低いビットレートで高品質に符号化できます。
これは一般的に、以下の2つのアプローチを組み合わせることによって達成されます。
音声符号化(および一般的に音声データ圧縮)で使用された初期のアルゴリズムは、A法則アルゴリズムとμ法則アルゴリズムでした。

初期の音声研究はベル研究所で行われた。そこで、1950年にC.チャピン・カトラーが差動パルス符号変調(DPCM)の特許を出願した。[ 52 ] 1973年には、 P.カミスキー、ニキル・S・ジャヤント、ジェームズ・L・フラナガンによって適応型DPCM(ADPCM)が導入された。[ 53 ] [ 54 ]
知覚符号化は、線形予測符号化(LPC)を用いた音声符号化圧縮に初めて使用されました。 [ 55 ] LPC の初期の概念は、1966 年の板倉文忠(名古屋大学) と斎藤修三 (日本電信電話)の研究に遡ります。[ 56 ] 1970 年代には、ベル研究所のBishnu S. AtalとManfred R. Schroeder が、人間の耳のマスキング特性を利用した知覚符号化アルゴリズムである適応予測符号化(APC)と呼ばれる LPC の一種を開発し、1980 年代初頭には、当時としては大きな圧縮率を達成したコード励起線形予測(CELP) アルゴリズムが登場しました。 [ 55 ]知覚符号化は、 MP3 [ 55 ]やAACなどの現代の音声圧縮フォーマットで使用されています。
1974 年にNasir Ahmed、T. Natarajan、KR Raoによって開発された離散コサイン変換(DCT) [ 16 ]は、MP3 [ 57 ]、Dolby Digital [ 58 ] [ 59 ]、AAC [ 60 ]などの現代のオーディオ圧縮フォーマットで使用される修正離散コサイン変換(MDCT)の基礎となった。MDCT は、1986 年にPrincen と Bradley が行った以前の研究[ 62 ]に続き、1987 年に JP Princen、AW Johnson、AB Bradley によって提案された[ 61 ] 。
世界初の商用放送自動化音声圧縮システムは、ブエノスアイレス大学の工学教授であるオスカー・ボネロによって開発されました。 [ 63 ]この放送自動化システムは、1987年にAudicom という名前で発売されました。 [ 64 ] [ 65 ]
1988年2月、IEEEのJournal on Selected Areas in Communications(JSAC )に、さまざまな音声符号化システムの文献集が掲載された。それ以前の論文もいくつかあったが、このコレクションには完成して動作するさまざまな音声コーダーが網羅されており、そのほとんどすべてが知覚技術と何らかの周波数分析およびバックエンドの無雑音符号化を使用している。[ 66 ]
非圧縮ビデオは非常に高いデータレートを必要とします。ロスレスビデオ圧縮コーデックは5~12の圧縮率で動作しますが、一般的なH.264ロッシー圧縮ビデオの圧縮率は20~200です。[ 67 ]
ビデオコーディング規格で使用される主要なビデオ圧縮技術は、 DCTと動き補償(MC)の2つです。H.26xやMPEGフォーマットなどのほとんどのビデオコーディング規格は、通常、動き補償DCTビデオコーディング(ブロック動き補償)を使用します。[ 68 ] [ 69 ]
ほとんどのビデオコーデックは、オーディオ圧縮技術と併用して、別々ではあるが相補的なデータストリームをいわゆるコンテナフォーマットを使用して1つの結合パッケージとして保存します。[ 70 ]
動画データは、一連の静止画像フレームとして表現される。このようなデータには通常、空間的および時間的な冗長性が豊富に含まれている。動画圧縮アルゴリズムは、この冗長性を削減し、情報をよりコンパクトに保存することを目的としている。
ほとんどのビデオ圧縮フォーマットとコーデックは、空間的冗長性と時間的冗長性の両方を利用します(たとえば、動き補償付き差分符号化による)。類似性は、たとえば時間的に隣接するフレーム間(フレーム間符号化)または空間的に隣接するピクセル間(フレーム内符号化)の差分のみを保存することによって符号化できます。フレーム間圧縮(時間的デルタ符号化)は、シーケンス内の1つ以上の前または後のフレームのデータを(再)使用して、現在のフレームを記述します。一方、フレーム内符号化は、現在のフレーム内のデータのみを使用するため、実質的には静止画圧縮です。[ 51 ]
カムコーダーやビデオ編集で使用されるフレーム内ビデオ符号化フォーマットは、フレーム内予測のみを使用するよりシンプルな圧縮方式を採用しています。これにより、圧縮されたフレームが編集者が削除したデータを参照してしまう事態を防ぐことができるため、ビデオ編集ソフトウェアが簡素化されます。
通常、ビデオ圧縮では、人間の視覚の知覚特性を利用して、人間の視覚知覚に(多かれ少なかれ)関係のないソースデータの側面を削減する量子化などの非可逆圧縮技術も使用されます。たとえば、色のわずかな違いは、明るさの変化よりも知覚しにくいです。圧縮アルゴリズムは、JPEG 画像圧縮で使用されるものと同様の方法で、これらの類似した領域全体で色を平均化できます。 [ 9 ]すべての非可逆圧縮と同様に、ビデオ品質とビットレート、圧縮と解凍の処理コスト、およびシステム要件の間にはトレードオフがあります。高度に圧縮されたビデオには、目に見えるまたは邪魔なアーティファクトが表示される場合があります。
フラクタル圧縮、マッチング追跡、離散ウェーブレット変換(DWT)の使用など、一般的な DCT ベースの変換形式以外の方法も研究対象となっているが、実用製品では通常使用されていない。ウェーブレット圧縮は、静止画コーデックや動き補償のないビデオコーデックで使用されている。フラクタル圧縮への関心は、最近の理論分析でそのような方法の有効性が比較的低いことが示されたため、薄れつつあるようだ。[ 51 ]
フレーム間符号化では、ビデオシーケンスの個々のフレームが1つのフレームから次のフレームに比較され、ビデオ圧縮コーデックは参照フレームとの差分を記録します。フレームに何も動いていない領域がある場合、システムは前のフレームのその部分を次のフレームにコピーする短いコマンドを発行するだけで済みます。フレームのセクションが単純な動きをする場合、圧縮機は(少し長い)コマンドを発行して、デコンプレッサにコピーをシフト、回転、明るく、または暗くするように指示します。この長いコマンドでも、フレーム内圧縮によって生成されるデータよりはるかに短くなります。通常、エンコーダは、参照画像との残りのより微妙な差分を記述する残差信号も送信します。エントロピー符号化を使用すると、これらの残差信号は完全な信号よりもコンパクトに表現されます。動きの多いビデオ領域では、圧縮は変化するピクセルの数が多いため、より多くのデータをエンコードする必要があります。一般的に、爆発、炎、動物の群れ、および一部のパンショットの高周波の詳細により、品質が低下したり、可変ビットレートが増加したりします。

一般的に使用されている多くのビデオ圧縮方式(例えば、ITU-TやISOが承認した規格に含まれるもの)は、1988年にITU-Tによって標準化されたH.261に遡る基本的なアーキテクチャを共有しています。これらの方式は主に、隣接するピクセルの矩形ブロックに適用されるDCTと、動きベクトルを使用した時間予測に依存しており、近年ではループ内フィルタリングステップも用いられています。
予測段階では、さまざまな重複排除および差分符号化技術が適用され、データの相関性を低減し、既に送信されたデータに基づいて新しいデータを記述するのに役立ちます。
次に、残りのピクセルデータの矩形ブロックが周波数領域に変換されます。主要な非可逆処理段階では、人間の視覚認識に関係のない情報を削減するために、周波数領域のデータが量子化されます。
最終段階では、統計的な冗長性はエントロピー符号化器によってほぼ完全に排除され、多くの場合、何らかの算術符号化が適用される。
追加のインループフィルタリング段階では、再構成された画像信号に様々なフィルタを適用できます。これらのフィルタをエンコードループ内で計算することで、予測プロセスで使用される前に参照素材に適用でき、元の信号に基づいて調整できるため、圧縮に役立ちます。最も一般的な例は、変換ブロック境界における量子化不連続性によるブロックノイズをぼかすデブロッキングフィルタです。
1967年、AH RobinsonとC. Cherryはアナログテレビ信号の伝送のためのランレングス符号化帯域幅圧縮方式を提案した。 [ 71 ]現代のビデオ圧縮の基礎となるDCT [ 72 ]は、 1974年にNasir Ahmed、T. Natarajan、KR Raoによって導入された。[ 16 ] [ 73 ]
1988年に登場したH.261は、ビデオ圧縮技術の一般的な基本アーキテクチャを商用的に導入しました。[ 74 ]これは、DCT圧縮に基づく最初のビデオ符号化フォーマットでした。 [ 72 ] H.261は、日立、ピクチャーテル、NTT、BT、東芝など、多くの企業によって開発されました。[ 75 ]
コーデックに使用されている最も一般的なビデオコーディング規格は、 MPEG規格です。MPEG -1は、1991年にモーションピクチャーエキスパートグループ(MPEG)によって開発され、 VHS品質のビデオを圧縮するように設計されました。1994年には、ソニー、トムソン、三菱電機などの多くの企業によって開発されたMPEG-2 / H.262 [ 74 ]がそれに続きました。[ 76 ] MPEG-2は、 DVDおよびSDデジタルテレビの標準ビデオフォーマットになりました。[ 74 ] 1999年には、 MPEG-4 / H.263 [ 74 ]がそれに続きました。これもまた、三菱電機、日立、パナソニックなどの多くの企業によって開発されました。[ 77 ]
H.264/MPEG-4 AVCは、主にパナソニック、合同会社IPブリッジ、LGエレクトロニクスなどの複数の組織によって2003年に開発されました。[ 78 ] AVCは、最新のコンテキスト適応型バイナリ算術符号化(CABAC)およびコンテキスト適応型可変長符号化(CAVLC)アルゴリズムを商用的に導入しました。AVCはBlu-ray Discの主要なビデオエンコーディング規格であり、 YouTube、Netflix、Vimeo、iTunes Storeなどのビデオ共有ウェブサイトやストリーミングインターネットサービス、 Adobe Flash PlayerやMicrosoft Silverlightなどのウェブソフトウェア、地上波および衛星テレビのさまざまなHDTV放送で広く使用されています。[ 79 ]
遺伝的圧縮アルゴリズムは、従来の圧縮アルゴリズムと特定のデータタイプに適合した遺伝的アルゴリズムの両方を使用してデータ(通常はヌクレオチドの配列)を圧縮する、最新世代の可逆圧縮アルゴリズムです。2012年、ジョンズ・ホプキンス大学の科学者チームは、圧縮に参照ゲノムを使用しない遺伝的圧縮アルゴリズムを発表しました。HAPZIPPERはHapMapデータ用に調整されており、20倍以上の圧縮(ファイルサイズが95%削減)を実現し、主要な汎用圧縮ユーティリティよりも2~4倍優れた圧縮率を提供し、計算負荷も低くなっています。このために、Chanda、Elhaik、およびBaderは、SNPをマイナーアレル頻度でソートすることによりデータセットの異質性を低減し、データセットを均質化するMAFベースのエンコーディング(MAFE)を導入しました。[ 80 ] 2009年と2013年に開発された他のアルゴリズム(DNAZipとGenomeZip)は、最大1200倍の圧縮率を実現しており、60億塩基対の二倍体ヒトゲノムを2.5メガバイトに保存できます(参照ゲノムに対する相対値、または多数のゲノムの平均値)。[ 81 ] [ 82 ]遺伝学/ゲノムデータ圧縮のベンチマークについては、[ 83 ]を参照してください。
世界のストレージデバイスに保存されているデータの総量は、既存の圧縮アルゴリズムでさらに平均4.5:1の係数で圧縮できると推定されている。[ 84 ]世界の情報保存のための技術能力の合計は、2007年には1,300エクサバイトのハードウェア桁を提供すると推定されているが、対応するコンテンツを最適に圧縮すると、これはわずか295エクサバイトのシャノン情報に相当する。[ 85 ]
ソース符号化の広範な目的は、PCMソースの「非効率的な」冗長性を利用または除去し、それによって全体のソースレートRを削減することです。
ウェーブレット符号化は、DCTベースの変換符号化の変形であり、そのいくつかの制限を軽減または解消します。(…) もう一つの利点は、JPEGやその他のブロックベースのDCT技術のように8×8ピクセルのブロックを扱うのではなく、ウェーブレット符号化は画像全体を同時に圧縮できることです。