レート歪み理論は情報理論の主要な分野であり、損失のあるデータ圧縮の理論的基礎を提供します。この理論は、チャネルを介して通信されるべきシンボルあたりの最小ビット数(レートRで測定)を決定する問題に取り組み、ソース(入力信号)が受信側(出力信号)で予想される歪みDを超えずに近似的に再構成されるようにします。

レート歪み理論は、非可逆圧縮方式を用いてどの程度の圧縮率を達成できるかを解析的に表現する。既存の音声、画像、動画の圧縮技術の多くは、レート歪み関数の一般的な形状を利用した変換、量子化、ビットレート割り当て手順を備えている。
レート歪み理論は、クロード・シャノンが情報理論の基礎的な研究の中で提唱したものである。
レート歪み理論では、レートは通常、保存または送信されるデータサンプルあたりのビット数として理解されます。歪みの概念は、現在も議論が続いているテーマです。[ 1 ]最も単純なケース(実際にはほとんどの場合に使用されています)では、歪みは入力信号と出力信号の差の二乗の期待値(つまり、平均二乗誤差)として定義されます。しかし、ほとんどの非可逆圧縮技術は、人間の消費者が知覚するデータ(音楽を聴いたり、写真やビデオを見たり)に対して動作することがわかっているため、歪み尺度は人間の知覚、そしておそらく美学に基づいてモデル化されることが望ましいです。可逆圧縮における確率の使用と同様に、歪み尺度は最終的に、ベイズ推定や決定理論で使用される損失関数と同一視できます。オーディオ圧縮では、知覚モデル(したがって知覚歪み尺度)は比較的よく開発されており、MP3やVorbisなどの圧縮技術で日常的に使用されていますが、レート歪み理論に含めるのは容易ではありません。画像およびビデオ圧縮においては、人間の知覚モデルはあまり発展しておらず、その活用は主にJPEGおよびMPEGの重み付け(量子化、正規化)行列に限られている。
歪み関数は、シンボルを表現するコストを測定する。近似記号による代表的な歪み関数としては、ハミング歪みと二乗誤差歪みが挙げられる。
レートと歪みの関係を表す関数は、以下の最小化問題の解として求められる。
ここテストチャネルとも呼ばれるこの値は、通信チャネル出力(圧縮信号)の条件付き確率密度関数(PDF)です。与えられた入力(元の信号)に対して、 そして相互情報量はそして定義される
どこそしてはそれぞれ、出力信号Yのエントロピーと、入力信号が与えられた場合の出力信号の条件付きエントロピーである。
この問題は、歪み率関数として定式化することもでき、与えられた速度制約の下で達成可能な歪みの最小値を求めます。関連する式は次のとおりです。
これら二つの定式化は、互いに逆関数の関係にある関数を導き出す。
相互情報は、受信者が送信者の信号について持つ「事前」の不確実性( H(Y ))の尺度として理解でき、送信者の信号に関する情報を受け取った後に残る不確実性によって減少します(もちろん、不確実性の低下は、伝達される情報量によるものであり、。
例えば、通信が全くない場合、そしてあるいは、通信チャネルが完全で受信信号が信号と同一送信者側で、そして。
レート歪み関数の定義において、そして歪みはそして特定のそれぞれ、規定された最大歪みです。平均二乗誤差を歪み尺度として使用する場合、(振幅連続信号の場合)次のようになります。
上記の式が示すように、レート歪み関数を計算するには、入力の確率的記述が必要となる。PDFに関してそして、条件付きPDFを見つけることを目指します。与えられた歪みに対してレートを最小化するこれらの定義は、離散型および混合型の確率変数も考慮に入れるように、測度論的に定式化することができる。
この最小化問題の解析解を得ることは、多くの場合困難ですが、例外的に可能な場合もあり、次に最もよく知られている2つの例を示します。任意の音源のレート歪み関数は、いくつかの基本的な性質に従うことが知られています。最も重要なのは、それが連続的で単調減少する凸関数(U)であるため、例の関数の形状が典型的であるということです(実際の測定されたレート歪み関数でさえ、非常に似た形状になる傾向があります)。
この問題に対する解析解は少ないものの、これらの関数には上限と下限があり、その中には有名なシャノン下限(SLB)も含まれている。これは、二乗誤差と無記憶ソースの場合、有限微分エントロピーを持つ任意のソースに対して、
ここで、h ( D )は分散Dを持つガウス型確率変数の微分エントロピーです。この下限は、記憶やその他の歪み尺度を持つソースにも拡張可能です。SLBの重要な特徴の1つは、低歪み領域では幅広いクラスのソースに対して漸近的にタイトであり、場合によっては実際にレート歪み関数と一致することです。シャノン下限は、任意の2つの数値間の歪みが、これら2つの数値の値の差の関数として表現できる場合に一般的に見つけることができます。
リチャード・ブラハットが共同開発したブラハット・アリモトアルゴリズムは、任意の有限入出力アルファベットソースのレート歪み関数を数値的に求めるための洗練された反復手法であり、より一般的な問題インスタンスに拡張するための多くの研究が行われてきた。
レート歪み関数の計算には、基となる分布の知識が必要ですが、これはデータサイエンスや機械学習の現代的なアプリケーションでは入手できないことがよくあります。しかし、この課題は、レート歪み関数の深層学習ベースの推定器を使用することで解決できます。[ 2 ]これらの推定器は一般的に「ニューラル推定器」と呼ばれ、レート歪み目的関数のパラメータ化された変分形式の最適化を伴います。
記憶を持つ定常光源を扱う場合、レート歪み関数の定義を変更する必要があり、それは長さが増加するシーケンスに対する極限という意味で理解されなければならない。
どこ
そして
ここで、上付き文字はその時点までの完全なシーケンスを表し、下付き文字0は初期状態を表します。
もしは分散を持つガウス型確率変数です。信号の連続サンプルを仮定すると確率的に独立である(あるいは同等に、ソースは記憶を持たない、または信号は無相関である)場合、レート歪み関数の解析的表現は次のようになります。
下記の図は、この関数がどのようなものかを示しています。
![]()
レート歪み理論によれば、「グレー領域外で動作する圧縮システムは存在しない」。実用的な圧縮システムが赤色(下限)境界に近いほど、性能は向上する。一般的に、この境界は符号化ブロック長パラメータを増やすことによってのみ達成できる。しかしながら、単位ブロック長であっても、レート歪み関数から実用上適切な距離で動作する優れた(スカラー)量子化器が見つかることが多い。 [ 4 ]
このレート歪み関数は、ガウス型メモリレスソースにのみ適用されます。ガウス型ソースはエンコードが最も「難しい」ソースであることが知られています。与えられた平均二乗誤差に対して、最も多くのビット数を必要とします。例えば画像を扱う実用的な圧縮システムの性能は、この関数を下回る可能性があります。下限値を表示しています。
ハミング歪みを持つベルヌーイ確率変数のレート歪み関数は次のように表される。
どこはバイナリエントロピー関数を表します。
レート歪み関数のプロット:
![]()
ソースに関する情報を、歪みがD を超えない状態でユーザーに送信したいとします。レート歪み理論によれば、少なくともソースからのビット/シンボルの情報がユーザーに届く必要があります。また、シャノンのチャネル符号化定理から、ソースのエントロピーがHビット/シンボルで、チャネル容量がC (ここで)、 それからこの情報を所定のチャネルで送信すると、ビット/シンボルが失われます。ユーザーが最大歪みDで復元できる見込みを持つためには、送信で失われる情報が最大許容損失を超えないという要件を課す必要があります。ビット/シンボル。これは、チャネル容量が少なくとも以下の値以上でなければならないことを意味します。[ 5 ]
つまり効用関数(歪み行列)とラグランジュ乗数
beta
が与えられた場合の「コードブック」と伝送レートRの決定を行うための非常にシンプルなPythonパッケージです。