
分類において、精度と再現率は、コレクション、コーパス、またはサンプル空間から取得されたデータに適用されるパフォーマンス指標です。
精度(陽性予測値とも呼ばれる)とは、取得されたインスタンスのうち、関連するインスタンスの割合のことです。数式で表すと次のようになります。
再現率(感度とも呼ばれる)は、関連する事例のうち、実際に検索された事例の割合です。数式で表すと次のようになります。
したがって、精度と再現率はどちらも関連性に基づいている。
デジタル写真から犬(関連要素)を認識するコンピュータプログラムを考えてみましょう。10匹の猫と12匹の犬が写っている写真を処理すると、プログラムは8匹の犬を識別します。犬として識別された8つの要素のうち、実際に犬であるのは5つ(真陽性)だけで、残りの3つは猫(偽陽性)です。7匹の犬が見逃され(偽陰性)、7匹の猫が正しく除外されました(真陰性)。したがって、プログラムの精度は5/8(真陽性数/選択された要素数)であり、再現率は5/12(真陽性数/関連要素数)です。
仮説検定アプローチを採用すると、この場合、帰無仮説は、特定の項目が無関係である(犬ではない)というものであり、タイプIエラーとタイプIIエラーがない(完全な特異度と感度)ことは、それぞれ完全な精度(偽陽性なし)と完全な再現率(偽陰性なし)に対応します。
より一般的に言えば、想起率は単純に第II種過誤率の補数(つまり、1から第II種過誤率を引いた値)です。精度は第I種過誤率と関連していますが、関連項目と無関係項目の事前分布にも依存するため、やや複雑な関係になります。
上記の猫と犬の例では、合計10匹の猫(真陰性)のうち、 8 − 5 = 3 の第一種過誤(偽陽性)が発生し、第一種過誤率は 3/10 でした。また、12 − 5 = 7 の第二種過誤(偽陰性)が発生し、第二種過誤率は 7/12 でした。精度は品質の尺度、再現率は量の尺度と見なすことができます。精度が高いということは、アルゴリズムが無関係な結果よりも関連性の高い結果を多く返すことを意味し、再現率が高いということは、アルゴリズムが関連性の高い結果のほとんどを返すことを意味します(無関係な結果も返されるかどうかに関わらず)。

分類タスクにおいて、あるクラスの精度は、真陽性の数(つまり、正のクラスに属すると正しくラベル付けされた項目の数)を、正のクラスに属するとラベル付けされた要素の総数(つまり、真陽性と偽陽性(クラスに属すると誤ってラベル付けされた項目)の合計)で割った値です。この文脈における再現率は、真陽性の数を、実際に正のクラスに属する要素の総数(つまり、真陽性と偽陰性(正のクラスに属するとラベル付けされなかったが、本来は属するべきだった項目)の合計)で割った値として定義されます。
精度と再現率は、単独で使用してもあまり有用な指標とは言えません。例えば、すべての項目を単純に検索すれば、完璧な再現率を達成できます。同様に、極めて可能性の高いごく少数の項目を選択するだけで、完璧な精度を達成することも可能です。
分類タスクにおいて、クラスCの精度スコアが1.0であるということは、クラスCに属するとラベル付けされたすべての項目が実際にクラスCに属していることを意味します(ただし、クラスCの項目のうち、正しくラベル付けされなかった項目の数については何も示していません)。一方、再現率が1.0であるということは、クラスCのすべての項目がクラスCに属するとラベル付けされたことを意味します(ただし、他のクラスの項目のうち、誤ってクラスCに属するとラベル付けされた項目の数については何も示していません)。
多くの場合、精度と再現率の間には逆相関関係があり、一方を向上させると他方が低下する可能性がありますが、特定の状況ではどちらをより重視するかは文脈によって決まる場合があります。
煙感知器は一般的に、第一種過誤(危険がない状況でも警報を発する)を多く起こすように設計されています。なぜなら、第二種過誤(大火災時に警報を発しない)のコストは法外に高いからです。そのため、煙感知器は、精度の低下(誤報の多発)をほとんど考慮せず、記憶(実際の危険をすべて捉えること)を重視して設計されています。一方、ブラックストーンの「10人の有罪者が逃亡する方が、1人の無実の者が苦しむよりもましだ」という格言は、第一種過誤(無実の者を有罪にすること)のコストを強調しています。そのため、刑事司法制度は、記憶の低下(より多くの有罪者を釈放すること)を犠牲にしてでも、精度(無実の者を有罪にしないこと)を重視しています。
脳外科医が患者の脳から癌性腫瘍を切除する例も、トレードオフをよく示しています。外科医は、残った癌細胞が腫瘍を再生させるため、すべての腫瘍細胞を除去する必要があります。逆に、健康な脳細胞を除去してしまうと、患者の脳機能が損なわれるため、外科医は健康な脳細胞を除去してはなりません。外科医は、すべての癌細胞を確実に除去するために、切除する脳の領域をより広範囲に及ぶ場合があります。この決定は、記憶の再現性を高めますが、精度を低下させます。一方、外科医は、癌細胞のみを確実に除去するために、切除する脳細胞をより慎重に選ぶ場合があります。この決定は、精度を高めますが、記憶の再現性を低下させます。つまり、記憶の再現性が高いほど、健康な細胞を除去する可能性(負の結果)と、すべての癌細胞を除去する可能性(正の結果)が高くなります。精度が高いほど、健康な細胞を除去する可能性(正の結果)は低くなりますが、すべての癌細胞を除去する可能性(負の結果)も低くなります。
通常、精度と再現率のスコアは単独で議論されることはありません。精度-再現率曲線は、再現率の関数として精度をプロットしたもので、通常、再現率が増加するにつれて精度は低下します。あるいは、一方の尺度の値を他方の尺度の固定レベル(例:再現率0.75での精度)で比較したり、両方を単一の尺度に組み合わせたりすることもできます。精度と再現率の組み合わせである尺度の例としては、F尺度(精度と再現率の加重調和平均)や、偶然補正された変数である回帰係数情報量( DeltaP')と顕著性(DeltaP)の幾何平均であるマシューズ相関係数などがあります。 [ 1 ] [ 2 ]正確度は、精度と逆精度(バイアスで加重)の加重算術平均、および再現率と逆再現率(有病率で加重)の加重算術平均です。[ 1 ]逆精度と逆再現率は、正と負のラベルが交換された逆問題の精度と再現率です (実際のクラスと予測ラベルの両方について)。真陽性率と偽陽性率、または同等の再現率と 1 - 逆再現率は、 ROC曲線として互いにプロットされることが多く、動作点のトレードオフを調査するための原理的なメカニズムを提供します。情報検索以外では、再現率、精度、F 値の適用は、分割表の真の負のセルを無視し、予測にバイアスをかけることで簡単に操作できるため、欠陥があると主張されています。[ 1 ] 最初の問題は精度を使用することで「解決」され、2 番目の問題は偶然の要素を割り引いてコーエンのカッパに再正規化することで「解決」されますが、これではトレードオフをグラフィカルに調査する機会がなくなります。しかし、情報量と識別力は、再現率と精度のカッパのような正規化であり、[ 3 ]、それらの幾何平均マシューズ相関係数は、バイアスの除去されたF値のように機能します。
分類タスクにおいて、真陽性、真陰性、偽陽性、偽陰性という用語は、テスト対象の分類器の結果を信頼できる外部の判断と比較するものです。陽性と陰性という用語は、分類器の予測(期待値とも呼ばれる)を指し、真と偽という用語は、その予測が外部の判断(観測値とも呼ばれる)と一致するかどうかを指します。
ある条件について、 P個の陽性事例とN個の陰性事例からなる実験を定義してみましょう。4つの結果は、以下のように2×2の分割表または混同行列で表すことができます。
精度と再現率は次のように定義されます。[ 12 ]
この文脈における再現率は、真陽性率または感度とも呼ばれ、精度は陽性予測値(PPV)とも呼ばれます。分類で使用されるその他の関連尺度には、真陰性率と精度があります。[ 12 ]真陰性率は特異度とも呼ばれます。
精度と再現率の両方は、データが不均衡な場合に役立つ可能性があります。ただし、偽陽性または偽陰性の結果がコストのかかる場合は、一方の指標を他方よりも優先することが有益となる場合があります。たとえば、医療診断では、偽陽性検査は不必要な治療と費用につながる可能性があります。このような状況では、再現率よりも精度を重視することが有益です。他のケースでは、偽陰性のコストが高く、再現率の方がより価値のある指標となる可能性があります。たとえば、不正検出における偽陰性のコストは高く、不正取引を検出できないと重大な金銭的損失につながる可能性があります。[ 13 ]
精度と再現率は(推定)条件付き確率として解釈できます。[ 14 ] 精度は次のように表されます。記憶は次のように与えられる[ 15 ]ここで予測クラスであり、実際のクラスは(実際のクラスが正であることを意味します)。したがって、両方の量はベイズの定理によって関連付けられています。
確率的解釈により、スキルなし分類器がどのように機能するかを容易に導き出すことができる。スキルなし分類器は、結合確率が分類とクラスの存在は独立しているため、これは無条件確率の積にすぎません。
例えば、スキルを必要としない分類器の精度は単なる定数である。つまり、クラスPが発生する確率/頻度によって決定される。
リコールについても同様の議論が成り立つ。 これは、陽性分類となる確率です。
精度は、分類器が陽性症例と陰性症例をどれだけうまく識別できるかを、疾患の基本有病率で重み付けした加重平均として表現できます(この定式化は、感度(真陽性率)と特異度(真陰性率)に基づいています。
機械学習の用語では、感度はポジティブクラスのリコール(しばしばこう呼ばれる)に相当します。)、一方、特異度は陰性クラスの再現率(しばしばこう呼ばれる)に相当します。この式は、データセットで利用可能な実際の陽性および陰性症例数によって真陽性率と真陰性率を直接スケーリングするため、すべての有病率レベルにわたって数学的に厳密に制限されます。[ 16 ]
あるいは、精度は精度と()、 想起 (つまり、)、および有病率(分類器の精度は、精度を総エラー率から1を引いた値として表すと、次のようになります。
この式を導出するために、まず混同行列の標準的な定義から始めます。データセット全体の人口を表します。
基本指標は次のように定義されます。
ステップ1:誤差率で精度を表す 精度 とは、正しく予測された予測の全体の割合です。言い換えれば、1から総誤差率を引いた値です。
ステップ 2: リコールを使用して偽陰性 (FN) を表現する リコールの定義から、真陽性 ()および偽陰性()実際の陽性症例総数に対する割合として():
ステップ 3: 精度と再現率を使用して偽陽性 (FP) を表現する 精度の定義から、代数的に解くと次のようになります。: 式を代入してステップ2の結果をこの方程式に代入します。
ステップ4:エラーを結合する 式を追加しますそして合計エラー数を取得するには、以下を組み合わせます。 実際の陽性症例を除外する():
ステップ 5: 総人口 (N) で割る 全体のエラー率を求めるには、方程式の両辺を で割ります。: 有病率は次のように定義される代わりに方程式に組み込む:
ステップ6:精度方程式の確定 ステップ1の精度式に、この合計誤差率を代入します。
この形式では、この方程式は、有病率によってスケーリングされた 2 つの異なるエラーによって精度がどのようにペナルティを受けるかを分離します。陽性症例が見逃される割合 ()、およびそれらを検出することによって発生する付随的な偽陽性率(この明確な関係は、不均衡なデータセットにおける根本的な有病率に応じて、精度と再現率の変化が全体的な精度に不均衡な影響を与えることを示している。
しかし、有病率、精度、再現率は独立変数ではないため、この式は厳密に数学的な制限を受けます。数学的に示される偽陽性の数は、データセット内の実際の陰性症例の総数を超えることはできません。したがって、上記の精度式は、最小精度に関する次の制約の下でのみ有効です。[ 17 ]
上記の理由から、異なる基本有病率(つまり、不均衡の異なるデータセット)を持つデータセットを比較する場合、精度は限定的または誤解を招く指標となる可能性があります。たとえば、精度90%、再現率50%の手法では、データセットの有病率が30%か90%かによって、精度は83%または50%になります。また、サンプルに95個の陰性値と5個の陽性値がある場合、すべての値を陰性と分類すると(再現率100%、精度0%)、精度スコアは0.95になります。
この問題の影響を受けない指標は数多く存在する。例えば、バランス精度[ 18 ](bACC)は、真陽性予測と真陰性予測をそれぞれ陽性サンプル数と陰性サンプル数で正規化し、それらの合計を2で割る。
前述の例(陰性サンプル95個、陽性サンプル5個)では、すべてを陰性と分類すると、バランス精度スコアは0.5になります(bACCスコアの最大値は1)。これは、バランスの取れたデータセットにおけるランダムな推測の期待値に相当します。FNのコストがFPのコストと同じであると仮定すれば、データの真のラベルが不均衡であるかどうかにかかわらず、バランス精度はモデルの全体的なパフォーマンス指標として使用できます。
TPRとFPRは、特定の閾値で動作する分類器の特性です。ただし、TP、FPなどの総数は、クラス比率を介してデータのクラス不均衡に依存します。リコール(またはTPR)は陽性症例のみに依存するため、しかし、精度は。
したがって、精度は明確に以下に依存する[ 19 ]バランスの取れたクラスから始めるとそして徐々に減少分母が大きくなるため、対応する精度は低下します。
もう一つの指標は、予測陽性率(PPCR)です。これは、全データのうち、フラグが立てられたデータの割合を示します。例えば、100万件のドキュメントのうち30件の結果(取得されたドキュメント)を返す検索エンジンの場合、PPCRは0.003%となります。
SaitoとRehmsmeierによると、不均衡データで二値分類器を評価する場合、ROCプロットよりも適合率-再現率プロットの方が情報量が多い。このようなシナリオでは、ROCプロットは分類性能の信頼性に関する結論に関して視覚的に誤解を招く可能性がある。[ 20 ] [ 21 ]
上記のアプローチとは異なり、混同行列の要素に重み付けすることで不均衡スケーリングを直接適用する場合、不均衡なデータセットの場合でも標準的な指標の定義が適用されます。[ 22 ]重み付け手順は、混同行列の要素を各クラスのサポートセットに関連付けます。
精度と再現率を組み合わせた指標としては、精度と再現率の調和平均、すなわち従来のF値またはバランスFスコアが挙げられる。
この尺度は、2つが近い場合、ほぼ2つの平均値であり、より一般的には調和平均であり、2つの数値の場合、幾何平均の2乗を算術平均で割った値と一致します。Fスコアは、評価指標としての偏りのため、特定の状況下では批判される可能性があります。[ 1 ]これは、再現率と適合率が均等に重み付けされているため、測定します。
これは一般的な測定(非負の実数値の場合) ):
他によく使われる2つの対策は測定、重みは精度よりも高いことを思い出す、そしてこれは、再現率よりも精度を重視する測定方法です。
F値はvan Rijsbergen(1979)によって導出され、「添付したユーザーに関して、検索の有効性を測定する」「正確さよりも想起の方がはるかに重要である」。これは、ファン・ライスベルゲンの有効性指標に基づいている。2番目の項は、重み付けされた精度と再現率の加重調和平均である。彼らの関係はどこ。
情報検索システムの性能指標には、 ROC曲線下面積(AUC)[ 23 ]や擬似R二乗などの他のパラメータや戦略があります。
精度と再現率の値は、2 つ以上のクラスを持つ分類問題でも計算できます。[ 24 ]特定のクラスの精度を取得するには、真陽性の数をそのクラスに対する分類器のバイアス (分類器がそのクラスを予測した回数) で割ります。特定のクラスの再現率を計算するには、真陽性の数をそのクラスの出現頻度 (データ サンプルでそのクラスが出現した回数) で割ります。
クラスごとの精度と再現率の値は、例えばマクロF1メトリックを使用して、全体的なマルチクラス評価スコアに組み合わせることができます。[ 24 ]
精度、再現率、Fスコアの古典的な定義は、各インスタンスが真か偽かのいずれかである二値分類用に定式化されています。しかし、多くの実用的な領域では、離散的なラベルではなく、本質的に連続的な信号が生成されます。これらの指標を連続分布に一般化することで、閾値処理によって生じる情報損失なしに、そのようなデータに直接適用できるようになります。[ 25 ]
2つの具体例は、二項対立的な枠組みの限界を示している。
させては期待される(真の)信号を表し、各データポイントにおける観測された(予測された)信号すると、精度、再現率、F値は次のように計算できます。
注:他の連続変数に応じて、連続分布の場合は合計を積分に置き換えることができます(例:、、)
これらの定義は、以下の場合に古典的なバイナリバージョンに還元されます。しかし、連続的な指標は、より深い数学的な優雅さを明らかにします。ランダムな信号を持つ完全に間違った機械学習モデルを考えてみましょう。大きさや符号を考慮しない従来の二値指標では、このようなモデルでも正の精度、再現率、Fスコア(密な信号の場合は25%以上)が与えられる可能性があります。一方、連続的な式では、このような状況では精度、再現率、Fスコアは正確に0になります。これは、期待される信号と観測された信号が相関しない場合、分子の項が相殺されてゼロになるためです。
精度は、疾患の有病率に基づいた感度と特異度の加重平均として表すことができます。精度 = (有病率 × 感度) + ((1 - 有病率) × 特異度)。
式 2 は、Precision = TPR / (TPR + (1/r)FPR) であることを示しています。偽陽性率 (FPR) の最大値は 1 であり、クラス不均衡比 r = Prevalence / (1 - Prevalence) であるため、特定の有病率とリコールが与えられた場合、精度の厳密な下限が確立されます。