ROC 曲線の下の部分領域 (pAUC) は、バイナリ分類器のパフォーマンスを測定する指標です。
これは、識別しきい値が変化するときの特定のバイナリ分類システムの診断能力を示す受信者動作特性 (ROC) 曲線 に基づいて計算されます。ROC 曲線は、さまざまなしきい値設定で真陽性率(TPR) と偽陽性率(FPR) をプロットすることによって作成されます。

ROC曲線の下の面積(AUC) [ 1] [2]は、分類器の診断能力を1つの数値で要約するためによく使用されます。AUCは、ROC曲線の下にあるROC空間の面積として簡単に定義されます。
ただし、ROC 空間には、FPR または TPR の値が許容できないか、実際には実行できない領域があります。たとえば、FPR が 0.8 より大きい領域では、陰性の被験者の 80% 以上が誤って陽性と分類されますが、これは多くの実際のケースでは許容できません。結果として、ROC 空間全体で計算された AUC (つまり、FPR と TPR の両方が 0 から 1 の範囲) は、誤解を招く表示になる可能性があります。
AUCのこの限界を克服するために、FPRとTPRの興味深い(つまり、実際に実行可能または許容可能な)値に対応するROC空間の領域でROC曲線の下の領域を計算することが提案されました[3]。
基本的な考え方
ROC空間では、x=FPR(偽陽性率)、y=ROC(x)=TPR(真陽性率)であり、

AUC は、特に 2 つ (またはそれ以上) のバイナリ分類器のパフォーマンスを比較するために広く使用されています。最高の AUC を達成する分類器の方が優れていると判断されます。ただし、2 つの分類器とを比較する場合、次の 3 つの状況が考えられます。
- のROC曲線は、のROC曲線より上には決してならない。
- のROC曲線は、のROC曲線より下には決してならない。
- 分類器の ROC 曲線は互いに交差します。
ケース 1 では分類器が望ましく、ケース 2) では分類器が望ましいという一般的なコンセンサスがあります。一方、ケース 3) では、ROC 空間の が望ましい領域と が望ましい領域があります。この観察から、ROC 空間全体ではなく、ROC 空間の特定の関心領域 (RoI) のみを考慮したパフォーマンス メトリックを計算することで、分類の精度を評価するようになりました。これらのパフォーマンス メトリックは一般に「部分 AUC」(pAUC) と呼ばれています。pAUC は、ROC 曲線の下にある ROC 空間の選択された領域の面積です。
FPRを制約して得られた部分AUC
部分AUCの考え方は、もともと[3]、診断目的で興味深いと考えられる偽陽性率の範囲内で与えられたROC曲線の評価を制限することを目的として提案されました。したがって、部分AUCは、FPRが範囲[ 、 ]にあるROC空間の垂直帯におけるROC曲線の下の面積として計算されました。
FPR を制約して計算された pAUC は、2 つの部分領域を比較するのに役立ちます。ただし、いくつかの制限があります。
- RoI は ROC 空間の垂直帯でなければなりません。
- RoI を特定するための基準は示されていません。何らかの専門家が特定して、;
- 関連する ROC 曲線を介して 2 つの分類器を比較する場合、RoI の選択における比較的小さな変更によって、異なる結論が導かれる可能性があります。上記の例では、 のバンドを考慮すると の方が良いという結論につながり、 のバンドを考慮すると の方が良いという結論につながりません 。
TPRを制約して得られた部分AUC
もう一つのタイプの部分AUCは、偽陽性率ではなく真陽性率を制限することによって得られる。つまり、部分AUCはROC曲線の下と水平線の上の面積である。[4]

言い換えると、pAUC は、真陽性率が指定されたしきい値より大きい ROC 空間の部分で計算されます(真陽性の数を制限することは意味がないため、上限は使用されません)。
この提案にもいくつかの制限があります。
- 真陽性率を制限することによって、偽陽性率の制限も暗黙的に設定されます。
- RoIを特定するための基準は示されていない。専門家が許容可能な最小の真陽性率を特定できることが期待される。
- 関連する ROC 曲線を介して 2 つの分類器を比較する場合、RoI の選択における比較的小さな変更が異なる結論につながる可能性があります。これは、指定された ROC 曲線が互いに交差するポイントに近い場合に発生します。
FPRとTPRの両方を制約することによって得られる部分AUC
「双方向」pAUCは、真陽性率と偽陰性率の両方を制約することによって定義されました。[5] TPRには最小値が指定され、FPRには最大値が設定されているため、RoIは点( , )、( , 1)、(0, 1)、(0, )を頂点とする左上の四角形になります。双方向pAUCは、そのような四角形に属するROC曲線の下の領域です。
双方向 pAUC は、FPR または TPR のみを制約して定義された pAUC よりも明らかに柔軟性があります。実際、後者の 2 種類の pAUC は、双方向 pAUC の特殊なケースと見なすことができます。

上で説明した pAUC と同様に、関連する ROC 曲線を介して 2 つの分類器を比較する場合、RoI の選択における比較的小さな変更が異なる結論につながる可能性があります。RoI を識別するための基準が示されていないため、これは特にデリケートな問題です (他の pAUC と同様に、専門家がと を識別できることが期待されます)。
関心領域に客観的制約を適用して得られた部分AUC
RoIを定義するための客観的かつ健全な基準がいくつか定義されている。[6] [7]具体的には、pAUCの計算は、
- 検討された分類器は(選択された何らかのパフォーマンス メトリックによれば)ランダム分類よりも優れています。
- 検討対象の分類器は、選択されたいくつかのパフォーマンス メトリックの少なくとも最小値を達成します。
- 検討対象の分類器による誤分類によるコストは許容範囲内である。
ランダム分類のパフォーマンスに基づいてRoIを定義する
pAUC が計算される領域を定義する方法としては、ランダム分類によって達成されるパフォーマンスよりも悪いパフォーマンスを表す ROC 空間の領域を除外することが考えられます。
ランダム分類では、特定の項目を確率で陽性と評価し、確率 (1- ) で陰性と評価します。n 項目のデータ セットで、そのうち AP 項目が実際に陽性である場合、最適な推測は と設定することで得られます(はデータ セット内の陽性の「有病率」とも呼ばれます)。

によるランダム分類は、平均して、、およびを達成することが示されています。[6]したがって、選択するパフォーマンス メトリックが TPR、FPR、および精度である場合、RoI は、、、およびとなるROC 空間の部分に限定する必要があります。この領域は、頂点が (0,0)、(0,1)、( , 1)、および ( , )である長方形であることが示されています。[6]
この手法は、双方向 pAUC を計算するときに TPR と FPR を制約する問題を解決します。
関連エリア比率(RRA)指標
pAUCを計算するには、まずRoIを定義する必要があります。たとえば、平均ランダム分類よりも高い精度が必要な場合、RoIは(0,0)、(0,1)、( , 1)、( , )に頂点を持つ長方形です。これは、RoIのサイズが に応じて変化することを意味します。また、完全なROC、つまり点(0,1)を通るROCはpAUC= (1- )です。
pAUCをベースとした[0,1]の範囲の指標を得るために、RRAが提案された: [6]
RRA=1 は完全な精度を示しますが、RRA=0 は RoI に属する ROC 曲線の下の領域がヌルであることを示します。したがって、精度はランダム分類よりも優れていません。
パフォーマンスメトリックのしきい値に基づいてRoIを定義する

バイナリ分類器には、いくつかのパフォーマンス メトリックを使用できます。最も一般的なメトリックの 1 つは、ファイ係数[8] (マシューズ相関係数[9]とも呼ばれる) です。ファイは、ファイ = 0 を特徴とするランダム分類に対して、分類がどれだけ優れているか (または劣っているか) を測定します。Cohen が提案した基準値[8]によると、分類のファイの最小許容レベルとしてファイ = 0.35 を使用できます。ROC 空間では、非ヌル定数に等しいファイは楕円の弧に対応し、ファイ = 0 は対角線、つまり FPR = TPR の点に対応します。したがって、ROC のファイ > 0.35 の部分を考慮することは、楕円の上にある ROC 空間の部分として RoI を定義することに対応します。pAUC は、楕円の上および ROC 曲線の下の領域です。
誤分類のコストに基づいてROIを定義する
ほとんどのバイナリ分類器は誤分類を生じ、その結果、何らかのコストが発生します。
誤分類のコスト C は と定義されます。ここで、は偽陰性の単位コスト、 は偽陽性の単位コスト、 FN と FP はそれぞれ偽陰性と偽陽性の数です。
正規化コストNC [10]は次のように定義される。
を設定すると 、
ランダム分類によって得られた平均NCは[6]
コストが より大きいパフォーマンスを除外して分類器を評価するには、正規化されたコストが より低い RoI を定義することができます。そのような領域は線より上にあります。

NCが の 分数よりも小さいRoIを定義することも可能である。この場合、RoIの下限は線
さまざまな値によって、最もよく知られているパフォーマンス メトリックのいくつかと同じように RoI が定義されます。
- FPRを使用してRoIを区切ることと同等である
- 精度を使用してROIを区切ることと同等である
- F-1スコア[11]を使用してRoIの範囲を限定することに相当する。
- TPRを使用してRoIを区切ることと同等である
したがって、パフォーマンス メトリックを選択することは、偽陰性に対する偽陽性の相対コストの特定の値を選択することと同じです。ROC 空間では、一定の正規化コスト (したがって、一定の総コスト) を表す線の傾きは、または、同様に、使用されているパフォーマンス メトリックに依存します。
ユーデンのJ =TPR−FPRの値が最高となるROC曲線の点を最良の分類として選択するのが一般的な方法である[12] [13] 。 [14]誤分類に関連するコストを考慮すると、この方法は偽陽性と偽陰性の相対的なコストに関する仮説を立てることに相当するが、これが正しいことはめったにない。[7]
pAUCとRRAの計算方法
pAUCとRRAを計算するためのソフトウェアライブラリはPythonとRで利用可能である。[15]
参考文献
- ^ Van der Shouw、YT;ファーベーク、A.ルイス、JH (1992)。 「新しい診断検査の初期評価のための ROC 曲線」。家族の練習。9 (4): 506–511。土井:10.1093/ファンプラ/9.4.506。ISSN 0263-2136。PMID 1490547。
- ^ Bradley, Andrew P. (1997). 「機械学習アルゴリズムの評価におけるROC曲線下面積の利用」.パターン認識. 30 (7): 1145–1159. Bibcode :1997PatRe..30.1145B. doi :10.1016/S0031-3203(96)00142-2. ISSN 0031-3203. S2CID 13806304.
- ^ ab McClish, DK (1989). 「 ROC曲線の一部を分析する」。医療意思決定。9 (3): 190–195。doi : 10.1177/ 0272989X8900900307。ISSN 0272-989X。PMID 2668680。S2CID 24442201 。
- ^ Jiang, Y; Metz, CE; Nishikawa, RM (1996). 「高感度診断テストのための受信者動作特性部分領域指数」.放射線学. 201 (3): 745–750. doi :10.1148/radiology.201.3.8939225. ISSN 0033-8419. PMID 8939225.
- ^ Yang, Hanfang; Lu, Kun; Lyu, Xiang ; Hu, Feifang (2017-07-14). 「双方向部分 AUC とその特性」。医療研究 における統計的手法。28 (1): 184–195。arXiv : 1508.00298。doi : 10.1177 / 0962280217718866。ISSN 0962-2802。PMID 28707503。S2CID 10666428 。
- ^ abcde Morasca, Sandro; Lavazza, Luigi (2020-08-19). 「ROC曲線によるソフトウェア欠陥予測モデルの評価について」. Empirical Software Engineering . 25 (5): 3977–4019. doi : 10.1007/s10664-020-09861-4 . ISSN 1382-3256. S2CID 221167342.
- ^ ab Lavazza, Luigi; Morasca, Sandro (2021-12-20). 「ROC空間における関心領域に関する考察」.医療研究における統計的手法. 31 (3): 419–437. doi :10.1177/09622802211060515. ISSN 0962-2802. PMID 34928729. S2CID 245354164.
- ^ ab Cohen, Jacob (1988).行動科学のための統計的検出力分析、第2版。Lawrence Earlbaum Associates。ISBN 9780203771587。
- ^ Matthews, BW (1975). 「T4ファージリゾチームの予測二次構造と実測二次構造の比較」Biochimica et Biophysica Acta (BBA) - タンパク質構造405 ( 2): 442–451. doi :10.1016/0005-2795(75)90109-9. ISSN 0005-2795. PMID 1180967.
- ^ Cahill, Jaspar; Hogan, James M.; Thomas, Richard (2013). 「ランク合計分類による障害が発生しやすいソフトウェア モジュールの予測」2013 第 22 回オーストラリア ソフトウェア エンジニアリング カンファレンス. IEEE. pp. 211–219. doi :10.1109/aswec.2013.33. ISBN 978-0-7695-4995-8. S2CID 302819。
- ^ ファン・ライスバーゲン、CJ (1979)。情報検索。バターワース。
- ^ Perkins, NJ; Schisterman, EF (2006). 「受信者動作特性曲線に基づく 2 つの基準を使用して得られた「最適な」カットポイントの不一致」。American Journal of Epidemiology . 163 (7): 670–675. doi : 10.1093 /aje/kwj063 . PMC 1444894. PMID 16410346.
- ^ Akobeng, AK (2007). 「診断検査の理解: 受信者動作特性曲線」. Acta Paediatrica . 95 (5): 644–647. doi :10.1111/j.1651-2227.2006.00178.x. PMID 17376185. S2CID 25035474.
- ^ Youden, WJ (1950). 「診断検査の評価のための指標」. Cancer . 3 (1): 32–35. doi : 10.1002/1097-0142(1950)3:1<32::aid-cncr2820030106>3.0.co;2-3 . ISSN 0008-543X. PMID 15405679. S2CID 43532502.
- ^ Python ライブラリのダウンロード、R ライブラリのダウンロードは、 インスブリア大学の Web サイトで入手できます。ライブラリの簡単な説明も参照できます。
