
情報に関する数学理論は、確率論と統計学に基づいており、情報量をいくつかの情報量で測定します。ここで、情報量とは測定によって定量化できる性質のことです。[ a ]
以下の式における対数の底の選択によって、使用される情報の単位が決まります。情報エントロピーの最も一般的な単位は、ビット、より正確にはシャノン[ 3 ]で、これは二進対数に基づいています。ビットはシャノンの代わりに頻繁に使用されますが、その名前は、エントロピー(情報量)に関係なく、バイナリ値またはストリームを参照するためにデータ処理で使用されるビットと区別されません。その他の単位には、自然対数に基づくナット、および底10または常用対数に基づくハートレーがあります。
シャノンは、メッセージの自己情報量または「驚き度」と呼ばれる情報量尺度を導き出した。:
どこメッセージの確率はメッセージ空間内のすべての可能な選択肢から選ばれる対数の底はスケーリング係数にのみ影響し、結果として測定された情報量の表現単位に影響します。対数の底が2の場合、情報量はシャノン単位、またはより一般的には単に「ビット」単位で表されます(他の文脈では、ビットはむしろ「バイナリ数字」として定義され、その平均情報量は最大で1シャノンです)。
情報源からの情報は、受信者がそもそもその情報を持っていなかった場合に限り、受信者にもたらされる。特定の事象(P=1)に関する情報(あるいは、例えばバックチャネルを通じて確実に知られている事象)を伝えるメッセージは、上記の式が示すように、情報を提供しない。発生頻度の低いメッセージは、発生頻度の高いメッセージよりも多くの情報を含んでいる。
また、2つ(またはそれ以上)の無関係なメッセージからなる複合メッセージの情報量は、各メッセージの情報量の合計に等しいことも示せる。これは、複合メッセージを考えることで、この定義を用いて導き出すことができる。2 つの確率変数 M と N の値に関する情報を、基本メッセージmとnを連結したメッセージを使用して提供する。各メッセージの情報内容は次のように与えられる。そしてそれぞれ。メッセージmとnがそれぞれ M と N のみに依存し、プロセス M と N が独立である場合、(統計的独立性の定義)上記の定義から明らかなように、。
例えば、天気予報の放送が「今夜の予報:暗い。朝まで薄明かりがまばらに残るまで、暗闇が続くでしょう。」だとします。このメッセージにはほとんど情報がありません。しかし、吹雪の予報には必ず情報が含まれています。なぜなら、吹雪は毎晩起こるものではないからです。マイアミのような温暖な地域での正確な降雪予報には、さらに多くの情報が含まれるでしょう。雪が全く降らない場所(あり得ない出来事)での降雪予報に含まれる情報量は、最も多く(無限大)なります。
離散メッセージ空間のエントロピーこれは、どのメッセージが選択されるかについての不確実性の度合いを示す指標です。メッセージの平均自己情報量として定義されます。そのメッセージスペースから:
どこ
エントロピーの重要な特性は、メッセージ空間内のすべてのメッセージの確率が等しいときに最大化されることです(例:)。 この場合。
時々、その機能は分布の確率で表すと次のようになります。
この重要な特殊ケースとして、二値エントロピー関数が挙げられる。
2つの離散確率変数の結合エントロピーそしては、結合分布のエントロピーとして定義される。そして:
もしそしてそれらが独立である場合、結合エントロピーは単純に個々のエントロピーの合計になります。
(注:表記が似ているものの、結合エントロピーと交差エントロピーを混同してはならない。)
確率変数の特定の値が与えられた場合条件付きエントロピー与えられたは次のように定義されます。
どこは条件付き確率です与えられた。
条件付きエントロピー与えられた曖昧な表現とも呼ばれるについては次のように表されます。
これは確率論における条件付き期待値を利用しています。
条件付きエントロピーの基本的な性質は次のとおりです。
カルバック・ライブラー情報量(または情報量、情報利得、相対エントロピー)は、2つの分布を比較する方法であり、「真の」確率分布と、、そして任意の確率分布データを圧縮する際に、は、実際には、あるデータの根底にある分布です。が正しい分布である場合、カルバック・ライブラー情報量は、圧縮に必要なデータあたりの平均追加ビット数、つまり数学的には、
それはある意味で「距離」にただし、対称ではないため、真の指標とは言えません。
最も有用で重要な情報尺度の1つは、相互情報量、またはトランス情報量であることが判明しました。これは、ある確率変数を観測することによって、別の確率変数についてどれだけの情報が得られるかを示す尺度です。相対的に(これは概念的には、平均的な情報量を表しています。観察によって得られるもの) は次のように与えられます。
相互情報量の基本的な性質は次のとおりです。
つまり、知っていること平均で節約できますエンコードのビット知らないことと比較して相互情報量は対称的である。
相互情報量は、事後確率分布の 平均カルバック・ライブラー情報量(情報利得)として表現できる。値を考慮すると以前の分布に対して:
言い換えれば、これは平均的に確率分布がどれだけ値が与えられた場合、変更されますこれは、周辺分布の積から実際の同時分布への乖離として再計算されることが多い。
相互情報量は、分割表と多項分布の文脈における対数尤度比検定、およびピアソンの χ 2検定と密接に関連しています。相互情報量は、2 つの変数間の独立性を評価するための統計量とみなすことができ、明確に定義された漸近分布を持ちます。
離散エントロピーの基本的な尺度は、和を積分に、確率質量関数を確率密度関数に置き換えることで、類推により連続空間にも拡張されてきた。どちらの場合も、相互情報量は問題となる2つの情報源に共通する情報ビット数を表すが、類推は同一の性質を意味するものではない。例えば、微分エントロピーは負の値をとることもある。
エントロピー、結合エントロピー、条件付きエントロピー、相互情報量の微分類推は、以下のように定義される。
どこは結合密度関数であり、そしては周辺分布であり、これは条件付き分布です。