バイナリ分類は、集合の要素を2 つのグループ (それぞれクラスと呼ばれる) のいずれかに分類するタスクです。一般的なバイナリ分類の問題には、次のようなものがあります。
- 患者が特定の病気にかかっているかどうかを判断するための医学的検査。
- 業界における品質管理、仕様が満たされているかどうかを判断すること。
- 情報検索において、ページが検索結果セットに含まれるべきかどうかを決定すること
- 行政においては、運転免許証を発行するかどうかを決定する
- 認知において、物体が食べ物であるか否かを判断すること。
バイナリ分類器の精度を測定する場合、最も簡単な方法はエラーを数えることです。しかし、現実の世界では、2 つのクラスのうちの 1 つがより重要であることが多いため、異なるタイプのエラーの両方の数が重要になります。たとえば、医療検査では、病気が存在しないのに病気を検出すること (偽陽性) と、病気が存在するのに病気を検出しないこと (偽陰性)は別として考えられます。

= 真陽性、TN = 真陰性、FP = 偽陽性 (タイプ I エラー)、FN = 偽陰性 (タイプ II エラー)、TPR = 真陽性率を決定するインスタンス セット、FPR = 偽陽性率を決定するインスタンス セット、PPV = 陽性予測値、NPV = 陰性予測値。
4つの結果
特定のデータ セットの分類では、実際のデータ カテゴリと割り当てられたカテゴリの基本的な組み合わせは 4 つあります。真陽性TP (正しい陽性割り当て)、真陰性TN (正しい陰性割り当て)、偽陽性FP (誤った陽性割り当て)、および偽陰性FN (誤った陰性割り当て) です。
これらは 2×2 の分割表に整理することができ、行は実際の値(状態が陽性か状態が陰性か)に対応し、列は分類値(テスト結果が陽性かテスト結果が陰性か)に対応します。
評価
4 つの基本的な結果の集計から、分類子または予測子の精度を測定するために使用できるアプローチは多数あります。分野によって優先順位が異なります。
8つの基本比率
評価の一般的なアプローチは、まず標準パターンの 2 つの比率を計算することです。分割表から計算できるこの形式の基本比率は 8 つあり、4 つの補数ペア (各ペアの合計は 1 になります) になります。これらは、4 つの数値をそれぞれ行または列の合計で割ることで得られ、8 つの数値が生成されます。これらの数値は、一般的に「真陽性行比率」または「偽陰性列比率」という形で参照できます。
したがって、列比のペアが 2 つ、行比のペアが 2 つあり、各ペアから 1 つの比を選択して、これらを 4 つの数値でまとめることができます。残りの 4 つの数値は補数です。
行の比率は次のとおりです。
- 真陽性率(TPR) = (TP/(TP+FN))、別名感度または再現率。これらは、テストが正しい
条件を持つ集団の割合です。
- 補数では偽陰性率(FNR)=(FN/(TP+FN))
- 真陰性率(TNR)=(TN/(TN+FP)、別名特異度(SPC)、
- 補体偽陽性率(FPR)=(FP/(TN+FP))であり、有病率とは無関係とも呼ばれる。
列の比率は次のとおりです。
- 陽性予測値(PPV、別名精度)(TP/(TP+FP))。これは、特定の検査結果に対して検査が正しい
集団の割合です。
- 補完的な偽発見率(FDR)(FP/(TP+FP))
- 陰性の予測値(NPV)(TN/(TN+FN))
- 偽脱落率(FOR)(FN/(TN+FN))を補い、有病率への依存性とも呼ばれます。
診断検査では、主に使用される比率は真の列比率(真陽性率と真陰性率)で、これらは感度と特異度として知られています。情報検索では、主に使用される比率は真陽性比率(行と列)(陽性予測値と真陽性率)で、これらは精度と再現率として知られています。
Cullerne Bownは、どの指標のペアをいつ使用すべきかを決定するためのフローチャートを提案しています。[1]そうでなければ、決定するための一般的なルールはありません。また、ある分類器を別の分類器よりも優先するタイミングなど、具体的な質問を決定するために指標のペアをどのように使用すべきかについても一般的な合意はありません。
相補的な比率のペアの比率を取ることで、4 つの尤度比(比率の列比率 2 つ、比率の行比率 2 つ) が得られます。これは主に列 (状態) 比率に対して行われ、診断検査における尤度比が得られます。これらの比率のグループの 1 つの比率を取ることで、最終的な比率である診断オッズ比(DOR) が得られます。これは、(TP×TN)/(FP×FN) = (TP/FN)/(FP/TN) として直接定義することもできます。これは、オッズ比として有用な解釈があり、有病率に依存しません。
その他の指標
他にも多くの指標がありますが、最も単純なのは、すべてのインスタンスのうち正しく分類された割合を測定する精度または Fraction Correct (FC) です。その補完指標は Fraction Incorrect (FiC) です。 F スコアは、重み付けの選択 (最も単純な等重み付け) によって、適合率と再現率を 1 つの数値に組み合わせたもので、バランスのとれた F スコア ( F1 スコア) となります。一部の指標は回帰係数(顕著性、情報量、およびそれらの幾何平均、Matthews 相関係数)から得られます。その他の指標には、 Youden の J 統計量、不確実性係数、ファイ係数、およびCohen のカッパ係数があります。
統計的二分分類
統計的分類は、分類ルールに基づいて分類を実行する機械学習で研究される問題です。これは、カテゴリが事前に定義されている機械学習の方法である教師あり学習の一種であり、新しい確率的観察をそれらのカテゴリに分類するために使用されます。カテゴリが 2 つしかない場合、この問題は統計的バイナリ分類と呼ばれます。
バイナリ分類に一般的に使用される方法の一部を以下に示します。
- 決定木
- ランダムフォレスト
- ベイジアンネットワーク
- サポートベクターマシン
- ニューラルネットワーク
- ロジスティック回帰
- プロビットモデル
- 遺伝的プログラミング
- 多式プログラミング
- 線形遺伝的プログラミング
各分類器は、観測数、特徴ベクトルの次元、データ内のノイズ、その他多くの要因に基づいて、選択されたドメインでのみ最適です。たとえば、ランダムフォレストは、3Dポイントクラウドに対してSVM分類器よりも優れたパフォーマンスを発揮します。[2] [3]
連続値をバイナリに変換する
バイナリ分類は、連続関数をバイナリ変数に変換する二分法 の一種です。ほとんどの血液値など、結果が連続値となる検査は、カットオフ値を定義することで人工的にバイナリにすることができます。カットオフ値より高いか低いかによって、 検査結果が陽性か陰性かが指定されます。
しかし、このような変換では、結果のバイナリ分類では値がカットオフよりどれだけ上または下であるかがわからないため、情報が失われます。その結果、カットオフに近い連続値をバイナリ値に変換すると、結果の陽性または陰性の予測値は、連続値から直接得られる予測値よりも一般的に高くなります。このような場合、検査が陽性または陰性であると指定されると、不適切に高い確実性があるように見えますが、実際には値は不確実な範囲内にあります。たとえば、hCGの尿濃度が連続値である場合、尿妊娠検査で 52 mIU/ml の hCG が測定され、カットオフが 50 mIU/ml で「陽性」と表示されることがありますが、実際には不確実な範囲内にあり、元の連続値を知ることによってのみ明らかになることがあります。一方、カットオフから非常に離れた検査結果の場合、結果の陽性または陰性の予測値は、連続値から得られる予測値よりも一般的に低くなります。たとえば、尿中の hCG 値が 200,000 mIU/ml の場合、妊娠の可能性が非常に高くなりますが、バイナリ値に変換すると、52 mIU/ml の場合と同じように「陽性」と表示されます。
参照
- 近似メンバーシップクエリフィルター
- ベイズ推論の例
- 分類ルール
- 混同行列
- 検出理論
- カーネルメソッド
- 多クラス分類
- マルチラベル分類
- 1クラス分類
- 検察官の誤謬
- 受信者動作特性
- 閾値処理(画像処理)
- 不確実性係数、別名熟練度
- 質的特性
- 精度と再現率(同等の分類スキーマ)
参考文献
- ^ William Cullerne Bown (2024). 「感度と特異度と精度と再現率、および関連するジレンマ」。Journal of Classification。
- ^ Zhang & Zakhor、Richard & Avideh (2014)。「LiDARとカメラを使用し た屋内ポイントクラウド上の窓領域の自動識別」VIP Lab Publications。CiteSeerX 10.1.1.649.303。
- ^ Y. Lu および C. Rasmussen (2012)。「3D ポイントクラウドの効率的な セマンティックラベル付けのための簡略化されたマルコフランダムフィールド」(PDF) 。IROS。
文献
- Nello CristianiniとJohn Shawe-Taylor。サポートベクターマシンとその他のカーネルベースの学習方法の紹介。ケンブリッジ大学出版局、2000年。ISBN 0-521-78019-5 ([1] SVMブック)
- John Shawe-Taylor および Nello Cristianini。 パターン分析のためのカーネル法。ケンブリッジ大学出版局、2004 年。ISBN 0-521-81397-2 (書籍の Web サイト)
- Bernhard Schölkopf および AJ Smola:カーネルで学ぶ。MIT 出版、マサチューセッツ州ケンブリッジ、2002 年。ISBN 0-262-19475-9
