意味 2 つの離散確率変数X とY のサンプルがあるとします。結合分布P X,Y ( x , y ) を構築し、そこから条件付き分布 P X | Y ( x | y ) = P X,Y ( x , y )/ P Y ( y ) およびP Y |X ( y | x ) = P X ,Y ( x , y )/ P X ( x ) を計算し、さまざまなエントロピーを計算することで、2 つの変数間の関連性の度合いを決定できます。
単一分布のエントロピーは次のように与えられます。 [ 1 ]
H ( X ) = − ∑ x P X ( x ) ログ P X ( x ) 、 {\displaystyle H(X)=-\sum _{x}P_{X}(x)\log P_{X}(x),} 条件付きエントロピー は次のように与えられます。[ 1 ]
H ( X | Y ) = − ∑ x 、 y P X 、 Y ( x 、 y ) ログ P X | Y ( x | y ) 。 {\displaystyle H(X|Y)=-\sum _{x,~y}P_{X,Y}(x,~y)\log P_{X|Y}(x|y).} 不確実性係数[ 2 ] または熟練度[ 3 ] は次のように定義される。
U ( X | Y ) = H ( X ) − H ( X | Y ) H ( X ) = 私 ( X ; Y ) H ( X ) 、 {\displaystyle U(X|Y)={\frac {H(X)-H(X|Y)}{H(X)}}={\frac {I(X;Y)}{H(X)}},} そして、Yが与えられたとき、 X のビットのうちどれだけの割合を予測できるかを教えてくれます。この場合、Xは 情報全体を含み、Y はその情報の一部を予測することを可能にするものと考えることができます。
上記の式から、不確実性係数は正規化された相互情報量 I(X;Y) であることが明らかです。特に、I(X;Y) < H(X)であり、 I(X,Y) とH(X) の両方が正またはゼロである場合、不確実性係数は [0 , 1] の範囲をとります。
すべての対数は比例関係にあるため、 U の値(ただしHの値は除く)は 対数 の底に依存しないことに注意してください。
不確実性係数は、統計的分類アルゴリズムの妥当性を測定するのに役立ち、異なるクラスの相対的な割合、つまりP ( x ) に影響されないという点で、精度や再現率 などのより単純な精度指標よりも優れています。 [ 4 ] また、一貫して誤ったクラスを予測する限り(つまり、単にクラスを並べ替えるだけであれば)、アルゴリズムにペナルティを与えないという独自の特性も持っています。これは、クラスタラベルには通常特定の順序がないため、クラスタリングアルゴリズムを評価する際に役立ちます。 [ 3 ]
バリエーション 不確実性係数は、 X とY の役割に関して対称ではありません。役割を逆転させることができ、対称的な尺度は、2 つの間の加重平均として定義されます。[ 2 ]
U ( X 、 Y ) = H ( X ) U ( X | Y ) + H ( Y ) U ( Y | X ) H ( X ) + H ( Y ) = 2 [ H ( X ) + H ( Y ) − H ( X 、 Y ) H ( X ) + H ( Y ) ] 。 {\displaystyle {\begin{aligned}U(X,~Y)&={\frac {H(X)U(X|Y)+H(Y)U(Y|X)}{H(X)+H(Y)}}\\[8pt]&=2\left[{\frac {H(X)+H(Y)-H(X,~Y)}{H(X)+H(Y)}}\right].\end{aligned}}} 不確実性係数は通常離散変数に適用されるが、密度推定 を用いることで連続変数にも拡張できる[ 1 ] 。
参考文献 1 2 3 クロード・E・シャノン、ウォーレン・ウィーバー(1963)。 コミュニケーションの数学理論 。イリノイ大学出版局。 1 2 William H. Press; Brian P. Flannery; Saul A. Teukolsky; William T. Vetterling (1992). "14.7.4". Numerical Recipes: the Art of Scientific Computing (3rd ed.). Cambridge University Press. p. 761. 1 2 White, Jim; Steingold, Sam; Fournelle, Connie. 「グループ検出アルゴリズムのパフォーマンス指標」 (PDF) . Interface 2004. 2012年4月13日にオリジナルからアーカイブ済み。 ↑ Peter, Mills (2011). "衛星計測の効率的な統計的分類" (PDF) . International Journal of Remote Sensing . 32 (21): 6109– 6132. arXiv : 1202.2194 . Bibcode : 2011IJRS...32.6109M . doi : 10.1080/01431161.2010.507795 . S2CID 88518570 . 2012年4月26日に オリジナル (PDF) からアーカイブされました。
外部リンク libagfには、不確実性係数を計算するためのソフトウェアが含まれています。