情報理論の用語
情報理論において、情報次元とは、ユークリッド空間におけるランダムベクトルの情報量であり、ランダムベクトルの細かく量子化されたバージョンの正規化されたエントロピーに基づいています。この概念は、1959年にアルフレッド・レーニによって初めて導入されました。[1]
簡単に言えば、これは確率分布のフラクタル次元の尺度です。これは、空間を連続的に細かく離散化することによって与えられる
シャノンエントロピーの成長率を特徴付けます。
2010 年に、Wu と Verdú は、エンコーダ/デコーダのさまざまな規則性制約の下でのアナログ ソースの
ほぼロスレスなデータ圧縮の基本限界として、Rényi 情報次元の操作上の特徴付けを示しました。
定義とプロパティ
離散確率変数 のエントロピーは


ここで はのときの確率測度であり、 は集合 を表します。





を任意の実数値のランダム変数とする。正の整数が与えられたとき、新しい離散ランダム変数を作成する。


ここで、は実数をそれより小さい最大の整数に
変換する床演算子です。

そして

はそれぞれ の下限情報次元と上限情報次元と呼ばれます。 のとき、この値を の情報次元と呼びます。




情報次元のいくつかの重要な特性:

- 軽度の条件が満たされる場合は、 となります。


- 次元ランダムベクトルの場合、最初の特性は に一般化できます。



- 指数部分列に制限する場合は、上位情報次元と下位情報次元を計算するだけで十分です。

量子化で丸め関数または天井関数が使用される場合は変更されません。
d-次元エントロピー
情報次元が存在する場合、この分布の次元エントロピーは次のように
定義できる。


ただし、極限が存在する場合です。 の場合、ゼロ次元エントロピーは標準シャノンエントロピーに等しくなります。 整数次元 の場合、次元エントロピー は、それぞれの微分エントロピーを定義する 倍積分です。




1994年、川端とデンボは、Kawabata & Dembo 1994で、ランダム変数の
レート歪み値に基づいて情報を測定する新しい方法を提案しました。この尺度は次のように定義されます。

ここで、レート歪み関数は次のように定義される。


または同等に、の -近似値につながる最小限の情報。


彼らはさらに、そのような定義が情報次元の定義と同等であることを証明した。正式には、

次元率バイアス
上記のRényi情報次元の定義を使用して、d次元エントロピーと同様の尺度がCharusaie、Amini、Rini 2022で定義されています。次元レートバイアスと呼ばれるこの値は、レート歪み関数の有限項を捉える方法で定義されています。正式には、


次元率バイアスは、連続分布、離散分布、離散連続混合分布のd次元率に等しくなります。さらに、特異ランダム変数の集合に対して計算可能ですが、そこにはd次元エントロピーが必ずしも存在するわけではありません。
最後に、次元率バイアスはシャノンのエントロピーと微分エントロピーを一般化し、次の式を使用して
相互情報量を求めることができます。

離散-連続混合分布
ルベーグ分解定理[2]
によれば、確率分布は混合分布によって一意に表すことができる。

ここで、およびは純粋に原子的な確率測度(離散部分)、 は絶対的に連続的な確率測度、およびは ルベーグ測度に関して特異だが原子を含まない確率測度(特異部分)です。が となる確率変数で あるとします。 の分布が次のように表せると仮定します。








ここで は離散測度であり、 はとなる絶対連続確率測度である。すると



さらに、 と微分エントロピーが与えられている場合、-次元エントロピーは次のように単純に表される。



ここで、 は離散確率変数のシャノンエントロピーであり、次のように与えられる。




例
ガウス確率分布を持つ信号を考えます。
信号を半波整流器に通すと、負の値はすべて0になり、その他の値はそのままになります。半波整流器は次のような関数で特徴付けられます。

すると、整流器の出力では、信号は整流されたガウス分布になります。これは原子質量が 0.5 で特徴付けられ、すべての に対してガウス PDF を持ちます。

この混合分布に上記の式を適用して分布の情報次元を取得し、次元エントロピーを計算します。


平均ゼロのガウス分布の正規化された右側部分はエントロピーを持つので、


微分エントロピーとの関連
情報次元と微分エントロピーは密接に関連していることが示されている[3]。
を連続密度を持つランダム変数とし
ます。


の範囲を長さ のビンに分割するとします。平均値定理により、各ビン内には次のような
値が存在し、



離散化されたランダム変数を考えます 。


各サポートポイントの確率は


とする。 のエントロピーは



と設定すると、情報次元の定義とまったく同じ量子化が行われます。離散確率変数のイベントを再ラベルしてもエントロピーは変化しないため、



これにより

そして、が十分に大きい
場合、

これは連続確率変数の微分エントロピーである。特に、がリーマン積分可能であれば、



これを次元エントロピーと比較すると、微分エントロピーはまさに1次元エントロピーであることがわかる。


実際、これは高次元に一般化できる。レニイは、が-次元ユークリッド空間のランダムベクトルで、確率密度関数と整数部の有限エントロピー()を持つ絶対連続分布である場合、





そして

積分が存在する場合。
ロスレスデータ圧縮
分布の情報次元は、この分布から得られる変数を圧縮する場合、圧縮率の理論的な上限を示します。ロスレス データ圧縮のコンテキストでは、無限の精度を持つ実数をより小さな実数で圧縮しようとします。
ロスレスデータ圧縮の主な目的は、によるソース実現の効率的な表現を見つけることです。のコードは、マッピングのペアです。




- エンコーダー:ソースからの情報を通信または保存用のシンボルに変換するもの。

- デコーダー:逆のプロセスで、コード シンボルを受信者が理解できる形式に変換します。

ブロックエラー確率は です。

を の最小値として定義し、十分に大きいすべての に対してとなるようなコード列が存在するようにします。





基本的にはコード長とソース長の比率を示し、特定のエンコーダとデコーダのペアがどれだけ優れているかを示します。ロスレスソースコーディングの基本的な制限は次のとおりです。[4]
連続エンコーダ関数とその連続デコーダ関数を考えてみましょう。 および に規則性を課さない場合、の豊富な構造により、すべての に対して最小の-達成可能レートが得られます。これは、無限の圧縮率を持つエンコーダとデコーダのペアを構築できることを意味します。








重要で意味のある結論を得るために、線形エンコーダとボレル デコーダの最小達成可能レートを とします。ランダム変数が離散部分と連続部分が混在する分布を持つ場合、すべて に対してとなります。デコーダをリプシッツ連続関数に制限し、が成り立つとすると、すべて に対して の 最小達成可能レートがとなります。









ロスレスデータ圧縮における情報次元の基本的な役割は、iidデータを超えてさらに広がります。特定のプロセス(移動平均プロセスなど)の場合、ロスレス圧縮の比率も情報次元率に等しいことが示されています。[5]この結果により、プロセスの限界分布のみを考慮するだけでは不可能だったさらなる圧縮が可能になります。
参照
注記
- ^ Rényi 1959を参照。
- ^ Çınlar 2011を参照。
- ^ Cover & Thomas 2012を参照。
- ^ Wu & Verdu 2010を参照。
- ^ シャルサイ、アミニ、リニ 2022 を参照
参考文献
- Çınlar, Erhan (2011).確率と確率論. 数学の大学院テキスト. 第261巻. Springer. doi :10.1007/978-0-387-87859-1. ISBN 978-0-387-87858-4。
- Cover, Thomas M.; Thomas, Joy A. (2012). 情報理論の要素 (第2版). Wiley. pp. 247–248. ISBN 9781118585771。