統計学、確率論、情報理論において、統計距離は、2 つの統計オブジェクト (2 つのランダム変数、2 つの確率分布またはサンプル)間の距離を定量化します。また、距離は、個々のサンプル ポイントと母集団またはより広範なポイントのサンプル間の距離である場合もあります。
母集団間の距離は、2つの確率分布間の距離を測るものとして解釈できるため、本質的には確率測度間の距離の尺度です。統計的距離の尺度がランダム変数間の差に関係する場合、これらには統計的依存性がある可能性があり、[1]そのため、これらの距離は確率測度間の距離の尺度とは直接関係ありません。また、ランダム変数間の距離の尺度は、個々の値ではなく、それらの間の依存性の程度に関係する場合があります。
多くの統計的距離測定はメトリックではなく、対称でないものもあります。二乗距離を一般化するいくつかの種類の距離測定は、(統計的)ダイバージェンスと呼ばれます。
用語
さまざまな距離の概念を指すために多くの用語が使用されていますが、これらはよく似ているため混乱を招きやすく、著者間で、また時間の経過とともに、大まかに、または厳密に技術的な意味で、一貫性のない方法で使用されている場合があります。「距離」に加えて、類似の用語には、逸脱、偏差、不一致、識別、発散、およびコントラスト関数やメトリックなどがあります。情報理論の用語には、交差エントロピー、相対エントロピー、識別情報、および情報ゲインがあります。
距離を指標として
メトリクス
集合X上の距離は関数(距離関数または単に距離と呼ばれる)d : X × X → R + (ここでR +は非負の実数の集合)です。X内のすべてのx、y、zについて、この関数は次の条件を満たす必要があります。
- d ( x , y ) ≥ 0 (非負値)
- d ( x , y ) = 0 は、 x = yの場合に限ります (識別不能なものは同一です。条件 1 と 2 を組み合わせると、正定値性が得られることに注意してください)
- d ( x , y ) = d ( y , x ) (対称性)
- d ( x , z ) ≤ d ( x , y ) + d ( y , z ) (劣加法性/三角不等式)。
一般化された指標
多くの統計的距離は、適切な計量の1つ以上の特性を欠いているため、計量ではありません。たとえば、疑似計量は特性(2)の識別不能なものの同一性に違反し、準計量は特性(3)の対称性に違反し、半計量は特性(4)の三角不等式に違反します。(1)と(2)を満たす統計的距離は発散と呼ばれます。
統計的にほぼ近い
有限領域における2つの分布との全変動距離(暗号学では統計的差[2] または統計的距離[3]と呼ばれることが多い )は次のように定義される。
。
が において無視できる関数である場合、2 つの確率集団 と は統計的に近いと言えます。
例
メトリクス
- 総変動距離(単に「統計距離」と呼ばれることもあります)
- ヘリンガー距離
- レヴィ・プロホロフ計量
- ワッサーシュタイン距離:カントロビッチ距離、またはアースムーバー距離とも呼ばれる
- マハラノビス距離
- アマリ距離
- 積分確率計量は分布に関するいくつかの計量または疑似計量を一般化する。
相違点
- カルバック・ライブラー距離
- レニの分岐
- ジェンセン・シャノン距離
- バッタチャリヤ距離(その名前にもかかわらず、三角不等式に違反するため距離ではありません)
- f-ダイバージェンス: いくつかの距離とダイバージェンスを一般化する
- 識別可能性指数、具体的にはベイズ識別可能性指数は、2 つの分布の重なりの正定値対称尺度です。
参照
注記
- ^ ドッジ、Y. (2003)—距離の項目
- ^ Goldreich, Oded (2001).暗号の基礎: 基本ツール(第 1 版). ベルリン: Cambridge University Press . p. 106. ISBN 0-521-79172-3。
- ^ レイジン、レオ。(講義ノート)抽出器と残りハッシュ補題
外部リンク
- 距離と類似度の測定 (Wolfram Alpha)
参考文献
- ドッジ、Y . (2003)オックスフォード統計用語辞典、OUP。ISBN 0-19-920613-9
