二値分類とは、物事を2つのカテゴリ(それぞれをクラスと呼ぶ)のいずれかに分類する作業です。つまり、任意の数のクラスに分類するという一般的な作業の中で最も単純な形式と言えます。典型的な二値分類問題には以下のようなものがあります。
分類を行うための一般的な統計的手法は、二項回帰である。
二値分類器の精度を測定する最も簡単な方法は、エラーの数を数えることです。しかし、現実世界では、2つのクラスのうちどちらか一方がより重要であることが多いため、2種類のエラーの両方の数を考慮する必要があります。例えば、医療検査では、実際には病気がないのに病気を検出してしまうこと(偽陽性)と、病気があるのに検出できないこと(偽陰性)は、異なるものとして扱われます。

特定のデータセットの分類が与えられた場合、実際のデータカテゴリと割り当てられたカテゴリの基本的な組み合わせは4つあります。真陽性TP(正しい陽性割り当て)、真陰性TN(正しい陰性割り当て)、偽陽性FP(誤った陽性割り当て)、および偽陰性FN(誤った陰性割り当て)です。
これらは2×2の分割表に整理することができ、行は実際の値(状態陽性または状態陰性)に対応し、列は分類値(検査結果陽性または検査結果陰性)に対応します。
4つの基本的な結果を集計することで、分類器や予測器の精度を測定するための様々な手法が存在します。分野によって好みは異なります。
評価の一般的なアプローチは、まず標準パターンの2つの比率を計算することです。分割表から計算できるこの形式の基本的な比率は8つあり、それぞれ4つの相補的なペア(各ペアの合計が1)で構成されています。これらは、4つの数値をその行または列の合計で割ることによって得られ、8つの数値が得られます。これらの数値は、「真陽性行比率」または「偽陰性列比率」という形式で一般的に参照できます。
したがって、列比は2組、行比も2組あり、それぞれの組から1つの比を選択することで、これらを4つの数値で要約することができます。残りの4つの数値は、その補数です。
行比率は次のとおりです。
列の比率は次のとおりです。
診断検査では、主に真陽性率と真陰性率という列比率が用いられ、これらは感度と特異度として知られています。情報検索では、真陽性率(行と列)という真陽性予測値と真陽性率という比率が用いられ、これらは精度と再現率として知られています。
カレルン・ボーンは、どの指標のペアをいつ使用すべきかを決定するためのフローチャートを提案している。[ 1 ]それ以外には、決定するための一般的なルールはない。また、ある分類器を別の分類器よりも優先する時期など、具体的な問題を決定するために指標のペアをどのように使用すべきかについても、一般的な合意はない。
相補的な比率のペアの比率を取ることで、4 つの尤度比(2 つの列比率と 2 つの行比率) を得ることができます。これは主に列 (条件) 比率に対して行われ、診断検査における尤度比が得られます。これらの比率のグループの 1 つの比率を取ると、最終的な比率である診断オッズ比(DOR) が得られます。これは (TP×TN)/(FP×FN) = (TP/FN)/(FP/TN) と直接定義することもできます。これはオッズ比として有用な解釈を持ち、有病率に依存しません。
他にも多くの指標がありますが、最も単純なものは精度または正答率(FC)で、正しく分類されたすべてのインスタンスの割合を測定します。その補数は誤答率(FiC)です。Fスコアは、重み付けの選択によって精度と再現率を1つの数値に組み合わせたもので、最も単純なのは均等重み付けで、バランスFスコア(F1スコア)です。回帰係数から得られる指標もあります。顕著性と情報量、およびそれらの幾何平均であるマシューズ相関係数です。その他の指標には、ユーデンのJ統計量、不確実性係数、ファイ係数、コーエンのカッパ係数などがあります。
統計的分類は、機械学習において分類ルールに基づいて分類を行う問題です。これは教師あり学習の一種であり、カテゴリが事前に定義されている機械学習手法で、新しい確率的観測値をこれらのカテゴリに分類するために使用されます。カテゴリが2つしかない場合、この問題は統計的二値分類と呼ばれます。
二値分類で一般的に用いられる手法には、以下のようなものがあります。
各分類器は、観測数、特徴ベクトルの次元、データのノイズ、その他多くの要因に基づいて、特定のドメインでのみ最適です。たとえば、ランダムフォレストは、3D点群に対してSVM分類器よりも優れた性能を発揮します。[ 2 ] [ 3 ]
二値分類は、連続関数を二値変数に変換する二分法 の一種です。ほとんどの血液検査のように、結果が連続値となる検査は、カットオフ値を定義することで人為的に二値化できます。検査結果は、カットオフ値より高いか低いかに応じて、陽性または陰性と判定されます。
しかし、このような変換は情報損失を引き起こします。なぜなら、結果として得られる二値分類では、値がカットオフ値からどれだけ上回っているか、あるいは下回っているかが分からないからです。結果として、カットオフ値に近い連続値を二値値に変換すると、結果として得られる陽性または陰性の予測値は、連続値から直接得られる予測値よりも一般的に高くなります。このような場合、検査結果を陽性または陰性と判定すると、実際には不確実性の範囲内にあるにもかかわらず、不適切に高い確実性があるように見えます。例えば、尿中のhCG濃度を連続値とした場合、hCG濃度が52 mIU/mlの尿妊娠検査は、カットオフ値を50 mIU/mlとすると「陽性」と判定されるかもしれませんが、実際には不確実性の範囲内にあり、これは元の連続値を知ることによってのみ明らかになります。一方、カットオフ値から大きく離れた検査結果では、結果として得られる陽性または陰性の予測値は、一般的に連続値から得られる予測値よりも低くなります。例えば、尿中のhCG値が200,000 mIU/mlであれば妊娠の可能性が非常に高いが、二値化すると52 mIU/mlの場合と全く同じように「陽性」と表示される。