確率論、特に情報理論において、全相関(渡辺 1960)は相互情報量の一般化の一つである。これは多変量制約(ガーナー 1962)または多情報量(スチューデンニー&ヴェイナロヴァ 1999)とも呼ばれ、 n個の確率変数間の冗長性または依存性を定量化する。
意味
n 個のランダム変数の与えられたセットに対して
総相関係数
は、結合分布からのカルバック・ライブラー情報量として定義される。
独立した配信へ
、
![{\displaystyle C(X_{1},X_{2},\ldots ,X_{n})\equiv \operatorname {D_{KL}} \left[p(X_{1},\ldots ,X_{n})\|p(X_{1})p(X_{2})\cdots p(X_{n})\right]\;.}](https://wikimedia.org/api/rest_v1/media/math/render/svg/24f6ab52fd657652e9ad303a0dca9fe7cf0cff82)
この乖離は、より単純なエントロピーの差に帰着する。
![{\displaystyle C(X_{1},X_{2},\ldots ,X_{n})=\left[\sum _{i=1}^{n}H(X_{i})\right]-H(X_{1},X_{2},\ldots ,X_{n})}](https://wikimedia.org/api/rest_v1/media/math/render/svg/722fbd10338b4a79e9fb176345bf99709b6de1c1)
どこ
変数の情報エントロピー
、 そして
は変数セットの結合エントロピーです
変数の離散確率分布に関して
総相関は次のように表される。

総相関とは、セット内の変数間で共有される情報量のことです。
これは、変数が互いに完全に独立している場合(冗長でない場合)に変数が持つ情報量(ビット単位、2進数対数を仮定)を表し、あるいは同等に、各変数が(最適に)独立して符号化されている場合に、すべての変数の値を送信するための平均コード長を表します。
これは、変数セットに含まれる 実際の情報量、あるいは同等に、変数セットが(最適に)一緒に符号化された場合にすべての変数の値を伝送するための平均コード長です。したがって、これらの項の差は、与えられた変数セットに存在する絶対冗長性(ビット単位)を表し、変数セットに具現化された構造または組織の一般的な定量的尺度を提供します(Rothstein 1952)。総相関は、実際の分布間のKullback-Leiblerダイバージェンスでもあります。
そしてその最大エントロピー積近似
。
総相関は、変数群間の依存関係の度合いを定量化します。総相関がほぼゼロの場合、その変数群は統計的にほぼ独立していることを示します。つまり、ある変数の値を知っても他の変数の値の手がかりにはならないという意味で、変数群は完全に無関係です。一方、総相関が最大となる場合(個々のエントロピーのセットが固定されている場合)
) は次のように与えられる

これは、ある変数が他のすべての変数を決定する場合に発生します。この場合、変数は最大限に関連しており、ある変数の値を知ることで他のすべての変数の値に関する完全な情報が得られます。また、変数は歯車に例えることができ、ある歯車の位置が他のすべての歯車の位置を決定します(Rothstein 1952)。
総相関は一連の変数間のすべての冗長性をカウントしますが、これらの冗長性は変数セット全体にさまざまな複雑な方法で分布する可能性があることに注意することが重要です (Garner 1962)。たとえば、セット内の一部の変数は完全に相互冗長である一方、セット内の他の変数は完全に独立している場合があります。おそらくさらに重要なのは、冗長性はさまざまな程度の相互作用で伝達される可能性があることです。変数のグループはペアワイズ冗長性を持たないかもしれませんが、パリティ関数で例示されるような高次の相互作用冗長性を持つ場合があります。全体の相関関係を構成要素の冗長性に分解することは、多くの情報源で検討されています (Mcgill 1954、Watanabe 1960、Garner 1962、Studeny & Vejnarova 1999、Jakulin & Bratko 2003a、Jakulin & Bratko 2003b、Nemenman 2004、Margolin et al. 2008年、ハン1978年、ハン1980年)。
条件付き総相関係数
条件付き総相関は、総相関と同様に定義されますが、各項に条件を追加します。条件付き総相関は、2 つの条件付き確率分布間のカルバック・ライブラー情報量として同様に定義されます。
![{\displaystyle C(X_{1},X_{2},\ldots ,X_{n}|Y=y)\equiv \operatorname {D_{KL}} \left[p(X_{1},\ldots ,X_{n}|Y=y)\|p(X_{1}|Y=y)p(X_{2}|Y=y)\cdots p(X_{n}|Y=y)\right]\;.}](https://wikimedia.org/api/rest_v1/media/math/render/svg/b86cec2849df4b1c4f91c5f679a526c4f4bc74e8)
上記と同様に、条件付き総相関は条件付きエントロピーの差に帰着し、

参考文献
- Alfonso, L.、Lobbrecht, A.、Price, R. (2010)。情報理論を用いたポルダーシステムにおける水位監視ネットワークの最適化、Water Resources Research、46、W12553、13ページ、2010年、doi : 10.1029/2009WR008953。
- ガーナーWR(1962)。不確実性と構造:心理学的概念、ジョン・ワイリー・アンド・サンズ、ニューヨーク。
- Han TS (1978). 多変量対称相関の非負エントロピー尺度、Information and Control 36、133 – 156。
- Han TS ( 1980 ). 周波数データにおける多重相互情報と多重相互作用、情報と制御46、26-45。
- Jakulin A & Bratko I (2003a). 属性依存性の分析、N Lavra\quad{c}、D Gamberger、L Todorovski & H Blockeel 編、データベースにおける知識発見の原理と実践に関する第 7 回ヨーロッパ会議議事録、Springer、Cavtat-Dubrovnik、クロアチア、pp. 229 – 240。
- Jakulin A & Bratko I (2003b). 属性間の相互作用の定量化と可視化。
- Margolin A、Wang K、Califano A、Nemenman I (2010)。多変量依存性と遺伝子ネットワーク推論。IET Syst Biol 4、428。
- McGill WJ (1954 ) . 多変量情報伝達、Psychometrika 19、97-116。
- ネメンマン I (2004). 情報理論、多変量依存性、および遺伝子ネットワーク推論。
- Rothstein J (1952). 組織とエントロピー、応用物理学ジャーナル23、1281 – 1282 。
- Studený M & Vejnarová J (1999). 確率的依存性を測定するためのツールとしての多情報関数、MI Jordan 編、Learning in Graphical Models、MIT Press、ケンブリッジ、MA、pp. 261 – 296。
- 渡辺S(1960)。多変量相関の情報理論的分析、IBM研究開発 ジャーナル4、66-82。