
二値分類器の評価では、通常、分類器の精度を表す数値(または複数の数値)が割り当てられます。例えば、誤り率があり、これは分類器が誤分類する頻度を測定するものです。
使用できる指標は数多くあり、分野によって好みが異なります。例えば、医学分野では感度と特異度がよく用いられる一方、コンピュータサイエンス分野では適合率と再現率が好まれます。
重要な区別は、出現率や偏り(各クラスが人口の中でどれくらいの頻度で出現するか)に依存しない指標と、出現率に依存する指標との間にある。どちらのタイプも有用だが、特性は大きく異なる。
評価は、多くの場合、2つの分類方法を比較し、一方を採用して他方を破棄するために用いられます。このような比較は、2つの指標ではなく、単一の統一的な指標が得られるような評価方法を用いることで、より直接的に実現できます。
データセットが与えられた場合、分類(そのセットに対する分類器の出力)は、陽性数と陰性数の2つの数値を出力し、これらを合計するとセットの総サイズになります。分類器を評価するには、その出力を別の参照分類(理想的には完璧な分類ですが、実際には別のゴールドスタンダードテストの出力)と比較し、2つの分類を比較するデータを2×2の分割表にクロス集計します。次に、これら4つの数値の要約統計量を計算して、ゴールドスタンダードに対する分類器の評価を行います。一般に、これらの統計量はスケール不変(すべての数値を同じ係数でスケーリングしても出力は変化しない)であり、母集団のサイズに依存しないようにします。これは、同次関数の比率、最も単純な場合は同次線形関数または同次二次関数を使用することで実現されます。
ある病気の有無を調べるために、何人かの人を検査するとします。検査を受けた人の中には、実際に病気にかかっていて、検査結果も正しく陽性と判定された人がいます。このような人は真陽性(TP)と呼ばれます。また、病気にかかっているにもかかわらず、検査結果が誤って陰性と判定された人もいます。このような人は偽陰性(FN)と呼ばれます。さらに、病気にかかっていないにもかかわらず、検査結果が陰性と判定された人もいます。このような人は真陰性(TN)と呼ばれます。最後に、健康な人が検査で陽性と判定される場合もあります。このような人は偽陽性(FP)と呼ばれます。これらは、2×2の分割表(混同行列)にまとめることができ、通常は縦軸に検査結果、横軸に実際の状態が示されます。
これらの数値を合計すると、総計と周辺合計の両方が得られます。表全体を合計すると、真陽性、偽陰性、真陰性、偽陽性の数は、セットの 100% になります。列を合計 (垂直方向に加算) すると、真陽性と偽陽性の数はテスト陽性の 100% になり、陰性についても同様です。行を合計 (水平方向に加算) すると、真陽性と偽陰性の数は条件陽性の 100% になります (陰性については逆)。基本的な周辺比率統計は、表の 2×2=4 の値を周辺合計 (行または列) で割ることによって得られ、2 つの補助 2×2 表が生成され、合計 8 つの比率が得られます。これらの比率は 4 つの相補的なペアで構成され、各ペアの合計は 1 になります。したがって、これらの派生 2×2 表はそれぞれ、2 つの数値のペアとその補数として要約できます。これらの比率の比率、比率の比率、あるいはより複雑な関数を用いることで、さらに詳細な統計情報を得ることができる。
分割表と最も一般的な算出比率を以下にまとめます。詳細は後述します。
行は、色分けで示されているように、実際の状態が陽性か陰性か(またはゴールドスタンダードによってそのように分類されたか)に対応しており、関連する統計値は有病率に依存しません。一方、列は検査結果が陽性か陰性かに対応しており、関連する統計値は有病率に依存します。予測値についても同様の尤度比がありますが、これらはあまり一般的ではなく、上記には示されていません。
多くの場合、精度は標準的なパターンで構成された一対の指標を用いて評価される。
基本的な有病率に依存しない統計量は、感度と特異度である。
感度、または真陽性率(TPR)は、リコールとも呼ばれ、検査で陽性反応を示し、実際に陽性であった人(条件陽性、CP = TP + FN)の割合です。これは、患者が病気であるという前提で検査が陽性となる確率と考えることができます。感度が高いほど、実際の病気の症例が見逃される可能性が低くなります(あるいは、工場の品質管理の場合、不良品が市場に出回る可能性が低くなります)。
特異度(SPC)または真陰性率(TNR)とは、検査で陰性と判定され、実際に陰性であった人(真陰性、TN)の割合を、実際に陰性であった人(条件陰性、CN = TN + FP)で割ったものです。感度と同様に、患者が病気ではないという前提で検査結果が陰性となる確率と考えることができます。特異度が高いほど、健康な人が病気と判定されるケースが少なくなり(工場の事例で言えば、良品が廃棄されるケースが少なくなります)。
感度と特異度の関係、および分類器の性能は、受信者操作特性(ROC)曲線を用いて視覚化し、分析することができる。
理論上、感度と特異度は独立しており、両方で 100% を達成することが可能です (上記の赤/青のボールの例のように)。しかし、より実際的で、あまり作為的でない例では、通常、トレードオフがあり、ある程度反比例の関係にあります。これは、分類したい対象そのものを測定することはほとんどなく、むしろ、分類したい対象の指標、つまりサロゲートマーカーを測定するためです。ボールの例で 100% を達成できるのは、赤と青が赤と青を直接検出することによって決定されるためです。しかし、指標は、非指標が指標を模倣する場合や、指標が時間依存で一定の遅延時間後にのみ明らかになる場合など、時には損なわれることがあります。次の妊娠検査の例では、そのような指標を使用します。
現代の妊娠検査では、妊娠そのものを妊娠状態の判定に用いるのではなく、妊娠女性の尿中に存在するヒト絨毛性ゴナドトロピン(hCG)を代替マーカーとして用いて、女性が妊娠しているかどうかを判断します。hCGは腫瘍によっても産生される可能性があるため、現代の妊娠検査の特異度は100%ではありません(偽陽性が出る可能性があるため)。また、hCGは受精後および初期胚発生後には尿中に非常に微量しか存在しないため、現代の妊娠検査の感度も100%ではありません(偽陰性が出る可能性があるため)。
二値分類テストの性能は、感度と特異度に加えて、陽性予測値(PPV)(精度とも呼ばれる)と陰性予測値(NPV)によって測定できます。陽性予測値は、「検査結果が陽性の場合、実際に疾患が存在することをどの程度正確に予測できるか」という問いに答えるものです。これはTP/(TP + FP)として計算され、つまり、すべての陽性結果のうち真陽性の割合です。陰性予測値は、当然ながら陰性の場合について、同じ計算式で表されます。
有病率は予測値に大きな影響を与えます。例えば、感度99%、特異度99%の疾患検査があるとします。2000人を検査し、サンプルにおける有病率が50%の場合、1000人が病気で、1000人が健康です。したがって、約990人の真陽性と990人の真陰性、10人の偽陽性と10人の偽陰性が生じると考えられます。陽性および陰性の予測値は99%となるため、結果に対する信頼性は高くなります。
しかし、罹患率がわずか5%で、2000人のうち実際に病気なのは100人だけの場合、予測値は大きく変わります。考えられる結果は、真陽性99人、偽陰性1人、真陰性1881人、偽陽性19人です。検査で陽性となった19+99人のうち、実際に病気にかかっているのは99人だけです。つまり、直感的に言えば、患者の検査結果が陽性だった場合、実際に病気にかかっている確率は84%しかありません。一方、患者の検査結果が陰性だった場合、検査結果に関わらず、患者が病気にかかっている確率は1882分の1、つまり0.05%しかありません。
精度と再現率は、(推定)条件付き確率として解釈できます。精度は次のように表されます。記憶は次のように与えられる[ 9 ]ここで予測クラスであり、は実際のクラスです。したがって、両方の量はベイズの定理によって関連付けられています。
これらの比率の間には様々な関係性がある。
有病率、感度、特異度が分かっている場合、陽性予測値は次の式から求めることができます。
有病率、感度、特異度が分かっている場合、陰性予測値は次の式から求めることができます。
ペア指標に加えて、テストを評価するための単一の数値を提供する単一指標も存在する。
おそらく最も単純な統計は、正答率または正解率(FC) であり、これは正しく分類されたすべての事例の割合を測定します。これは、正しい分類の数と正しいまたは間違った分類の総数との比率です。(TP + TN)/総人口 = (TP + TN)/(TP + TN + FP + FN)。このように、事前テスト確率と事後テスト確率の推定値を比較します。まったくの無知の場合、ルールをコイン投げ (p0=0.5) と比較することができます。この尺度は有病率に依存します。COVID 症状のある人の 90% が COVID ではない場合、事前確率 P(-) は 0.9 であり、「そのような患者をすべて COVID フリーと分類する」という単純なルールは 90% の精度になります。診断はそれよりも優れている必要があります。最も可能性の高い結果を使用して単純なルールを上回ることを期待する診断方法について、p0 を max(事前確率) = max(P(-),P(+)) とする「1 比率 z 検定」を構築できます。ここでは、「帰無仮説 Ho: p ≤ 0.9 対 対立仮説 Ha: p > 0.9」という仮説が立てられており、z の値が大きい場合は Ho を棄却します。診断ルールの精度が既知で、z 統計量の計算時に p0 に代入できる場合は、一方の診断ルールを他方の診断ルールと比較することができます。精度が既知でなく、データから計算できない場合は、「Ho: p1 = p2 のプールされた 2 標本比率 z 検定」を使用して精度比較テストを行うことができます。
あまり使われていない統計量として、誤分類率(FiC) があります。FC + FiC = 1、または (FP + FN)/(TP + TN + FP + FN) – これは、反対角成分の合計を総人口で割ったものです。コスト加重誤分類率を用いることで、異なる手法における誤分類の予想コストを比較できます。
診断オッズ比(DOR)は、より有用な全体的な指標となり得ます。これは、(TP×TN)/(FP×FN) = (TP/FN)/(FP/TN) と直接定義することも、比の比の比(尤度比の比、尤度比自体は真率または予測値の比)として間接的に定義することもできます。これは、オッズ比として有用な解釈が可能であり、有病率に依存しません。尤度比は一般的に有病率に依存しないと考えられており、事前確率を事後確率に変換する乗数として容易に解釈できます。
Fスコアは、精度と再現率を組み合わせた単一のスコアです。パラメータβを持つ統計量ファミリーがあり、このβが精度と再現率の相対的な重みを決定します。従来の、またはバランスのとれたFスコア(F1スコア)は、精度と再現率の調和平均です。
F スコアは真の陰性率を考慮しないため、真の陰性が無数にある情報検索や情報抽出の評価に適しています。代わりに、ファイ係数、マシューズ相関係数、情報量、コーエンのカッパなどの尺度が、バイナリ分類器のパフォーマンスを評価するのに適している場合があります。[ 10 ] [ 11 ]相関係数として、マシューズ相関係数は、問題とその双対の回帰係数の幾何平均です。マシューズ相関係数の構成要素回帰係数は、マークネス(deltap) と情報量 (ユーデンの J 統計量または deltap') です。[ 12 ]
Handは、適切な評価方法を選択することの重要性を強調している。しかし、分類器の精度を評価するためのさまざまな方法があるが、どの状況でどの方法を使用すべきかを決定する一般的な方法はない。さまざまな分野でさまざまなアプローチが取られてきた。[ 13 ]
カレルン・ボーンは、評価に対する3つの基本的なアプローチを区別している。
° 数学的 - 例えばマシューズ相関係数など、両方の種類の誤差が公理的に同等に問題のあるものとして扱われる。
° 費用便益分析 - 通貨(例:お金または質調整生存年)を採用し、経験的測定に基づいてエラーと成功に値を割り当てる。
° 判断型 - 2 種類のエラーの相対的な重要性について人間の判断が下される。通常、これは感度と特異度、精度と再現率、陽性予測値と陰性予測値などの指標のペアを採用することから始まる。
判決の事例では、どの指標のペアをいつ使用すべきかを決定するためのフローチャートが提供されており、その結果、受信者操作特性曲線と適合率再現率曲線のどちらを選択するかが示されています。[ 14 ]
多くの場合、特定の方法で動作する特定の分類器ではなく、その基盤となる技術を評価したいと考えます。通常、この技術はスコア関数の閾値を変更することで調整でき、閾値によって結果が陽性か陰性かが決まります。このような評価には、「ROC曲線下面積」(AUC)という単一の指標が有用です。
精度以外にも、二値分類器は、例えば処理速度やコストなど、さまざまな方法で評価することができる。
確率的分類モデルは、二値出力を提供するだけでなく、各クラスの確率スコアを生成します。これらのモデルは、インスタンスが異なるクラスに属する可能性または確率を評価するように設計されています。確率的分類器を評価する際には、これらのモデルのパフォーマンスを適切に評価するために、代替の評価指標が開発されています。これらの指標は、分類器の出力の確率的性質を考慮に入れ、異なるクラスに正確な確率を割り当てる際の有効性について、より包括的な評価を提供します。これらの評価指標は、確率的分類器の予測の較正、識別、および全体的な精度を捉えることを目的としています。
データベースやウェブ検索エンジンなどの情報検索システムは、さまざまな指標で評価されます。これらの指標の中には、結果を真陽性(正しく取得された文書)、真陰性(正しく取得されなかった文書)、偽陽性(誤って取得された文書)、偽陰性(誤って取得されなかった文書)に分類する混同行列から導き出されたものもあります。一般的に使用される指標には、精度と再現率の概念があります。この文脈では、精度は、人間が選択した一連の正解関連結果を使用して、取得された文書(真陽性÷真陽性+偽陽性)と比較した、正しく取得された文書の割合として定義されます。再現率は、関連文書(真陽性÷真陽性+偽陰性)と比較した、正しく取得された文書の割合として定義されます。あまり一般的ではありませんが、正確度という指標も使用されます。正確度は、文書(真陽性+真陰性÷真陽性+真陰性+偽陽性+偽陰性)と比較した、正しく分類された文書の割合として定義されます。
これらの指標はいずれも検索結果のランキングを考慮していません。ウェブ検索エンジンにとってランキングは非常に重要です。なぜなら、読者は検索結果の最初のページ以降を見ることはほとんどなく、ウェブ上には膨大な数のドキュメントが存在するため、それらすべてを手動で分類して、特定の検索に含めるべきか除外すべきかを判断することは不可能だからです。特定の検索結果数でカットオフを設定することで、ランキングをある程度考慮に入れることができます。たとえば、 k における精度という指標は、上位 10 件 (k=10) の検索結果のみを対象とした精度の指標です。割引累積利得などのより高度な指標は、個々のランキングを考慮に入れており、ランキングが重要な場合によく使用されます。