図 1: 2 つの単変量ヒストグラムの重なり領域から計算されたベイズ最適分類誤り確率とベイズ識別可能性指数。図 2: 2 つの二変量ヒストグラムの重なり体積から計算された同じ値。図 3: 不等分散を持つ 2 つの単変量正規分布の識別可能性指数。分類境界は黒で示されています。図 4: 不等共分散行列を持つ 2 つの二変量正規分布の識別可能性指数 (楕円は 1 sd 誤差楕円)。カラーバーは各次元による識別可能性への相対的な寄与を示しています。これらは数値法[1]によって計算されています。
感度指数、識別指数、検出可能性指数は、信号検出理論で使用される無次元統計です。指数が高いほど、信号がより容易に検出できることを示します。
意味
識別可能性指数は、標準偏差の単位で表した 2 つの分布 (通常は信号分布とノイズ分布) の平均間の分離です。
等分散/共分散
2 つの単変量分布が同じ標準偏差を持つ場合は、 (「ディープライム」)
で表されます。


。
より高次元の場合、つまり同じ分散共分散行列(その対称平方根、標準偏差行列は)を持つ 2 つの多変量分布の場合、これは2 つの分布間の
マハラノビス距離に一般化されます。

、
ここで、は平均を通る単位ベクトルに沿ったSDの1次元スライスです。つまり、は平均を通る1次元スライスに沿ったに等しくなります。 [1]


分散共分散が等しい 2 つの二変量分布の場合、これは次のように表されます。
、
ここで は相関係数であり、ここではおよび であり、つまり絶対値ではなく平均差の符号を含む。[1]

とも推定される。[2] : 8
不等分散/共分散
2 つの分布の標準偏差が異なる場合 (または一般的な次元では、共分散行列が異なる場合)、競合するインデックスが複数存在し、それらはすべて、分散/共分散が等しくなるように縮小されます。

ベイズ識別可能性指数
これは、2 つの分布の重複量に基づく、2 つの分布の最大 (ベイズ最適) 識別可能性指数、つまり理想的な観察者による分類の最適 (ベイズ) 誤差、またはその補数である最適精度です。


, [1]
ここで、は標準正規分布の逆累積分布関数です。単変量または多変量正規分布間のベイズ識別可能性は数値的に計算することができ[1](Matlabコード)、分布が正規分布に近い場合は近似値として使用することもできます。

は、カルバック・ライブラー分布の ような分布に関する仮定のない、正定値の統計的距離尺度です。は非対称ですが、 は2つの分布に対して対称です。 しかし、 は三角不等式を満たさないため、完全な測定基準ではありません。[1]


特に、平均と分散を持つ2つの単変量正規分布間のはい/いいえタスクの場合、ベイズ最適分類精度は次のようになります。[1]
、
ここで、は非心カイ二乗分布、、を表します。ベイズ識別可能性


単一のシフト基準を持つ2つの単変量正規分布間のはい/いいえタスクのROC曲線からも計算できます。また、シフト尤度比を持つ任意の2つの分布(任意の数の変数)のROC曲線から、対角線から最も遠いROC曲線上の点を見つけることによって計算することもできます。[1]
これらの分布間の2つの区間の課題では、最適精度は(一般化カイ2乗分布を表す)であり、ここで である
。[1]ベイズ識別可能性。




RMS sd識別指数
閉じた形式を持つ一般的な近似(すなわち、最適ではない)識別可能性指標は、分散の平均、すなわち2つの標準偏差のrmsを取ることである:[3]( とも表記される)。これは、単一基準の観察者の受信者動作特性曲線(AUC)の下の領域の -スコアを掛けたものである。この指標は、プールされた共分散、すなわち を共通のsd行列として使用するマハラノビス距離として一般的な次元に拡張される。 [1]



平均SD識別指数
もう一つの指標は であり、 を共通sd行列として一般次元に拡張される。 [1]
指標の比較
2つの単変量正規分布については、、多変量正規分布については、依然としてであることが示されている。[1]
したがって、および は、単変量正規分布の最大識別可能性を過小評価します。は、最大約 30% 過小評価される可能性があります。単変量正規分布の高識別可能性の限界では、は に収束します。これらの結果は、高次元では多くの場合当てはまりますが、常に当てはまるとは限りません。[1] Simpson と Fitter [3] は、特に 2 区間タスクの場合に が最良の指標として推奨されましたが、Das と Geisler [1] は、 がすべてのケースで最適な識別可能性であり、 が2 区間タスクの場合でもよりも優れた閉形式近似値であることが多いことを示しました。











標準偏差の幾何平均を使用する近似指数は、識別能力が小さい場合にはより小さくなりますが、識別能力が大きい場合には大きくなります。[1]
各次元による識別可能性への寄与
一般に、各次元または特徴による全体の識別可能性への寄与は、その次元が削除されたときに識別可能性がどれだけ低下するかで測定できます。全体のベイズ識別可能性が で、次元を削除したベイズ識別可能性が である場合、次元の寄与を と定義できます。これは、共分散行列が等しく対角である場合の次元の個々の識別可能性と同じですが、それ以外の場合は、この尺度は個々の識別可能性よりも次元の寄与をより正確に反映します。[1]




2つの分布の識別可能性のスケーリング
2つの分布の平均ベクトルとSD行列(共分散行列の平方根)を他の分布に線形補間することにより、2つの分布の識別可能性をスケーリングします。楕円は2つの分布の誤差楕円です。黒い曲線は2つの分布を分ける2次境界です。[1]
2 つのデータ分布を近づけたり遠ざけたりして、その識別可能性を拡張したい場合があります。そのようなケースの 1 つは、検出または分類タスクをモデル化しているときに、モデルのパフォーマンスが対象または観測データのパフォーマンスを上回る場合です。その場合、モデル変数分布を近づけて観測されたパフォーマンスと一致させると同時に、どの特定のデータ ポイントが重複して誤分類されるかを予測することができます。
これを行うにはいくつかの方法があります。1つは、2つの分布の平均ベクトルと共分散行列を計算し、次に線形変換を実行して、一方の分布の平均とSD行列(共分散行列の平方根)をもう一方の分布に補間することです。[1]
もう一つの方法は、多正規分布モデルの下でデータポイントの決定変数(あるポイントが1つの分布に属する対数尤度比と別の分布に属する対数尤度比)を計算し、これらの決定変数を近づけたり遠ざけたりすることです。[1]
参照
参考文献
- ^ abcdefghijklmnopqrs Das, Abhranil; Wilson S Geisler (2020). 「多重正規分布を統合し、分類尺度を計算する方法」. arXiv : 2012.14331 [stat.ML].
- ^ MacMillan, N.; Creelman, C. (2005). 検出理論: ユーザーズガイド. Lawrence Erlbaum Associates. ISBN 9781410611147。
- ^ ab Simpson, AJ; Fitter, MJ (1973). 「検出可能性の最良の指標とは何か?」心理学速報. 80 (6): 481–488. doi :10.1037/h0035203.
- ウィッケンズ、トーマス D. (2001)。初等信号検出理論。OUP USA。第 2 章、p. 20。ISBN 0-19-509250-3。
外部リンク
- d ′の計算を含むインタラクティブな信号検出理論チュートリアル。