母集団の各メンバーが複数の異なる集合またはクラスのいずれかに属している場合、分類規則または分類器は、母集団の集合の要素がそれぞれいずれかのクラスに属すると予測する手順です。[1]完全な分類とは、母集団のすべての要素が実際に属するクラスに割り当てられる分類です。ベイズ分類器は、分類する要素の既知の属性(つまり、特徴または回帰変数)に基づいてクラスを最適に割り当てる分類器です。
特殊な種類の分類規則は、クラスが 2 つしかない問題に対する バイナリ分類です。
分類ルールのテスト
xとy のペアで構成されるデータセットが与えられます。ここで、x は母集団の要素を表し、y はそれが属するクラスを表します。分類規則h ( x ) は、各要素x を予測クラスに割り当てる関数です。バイナリ分類では、ラベルy は2 つの値のうち 1 つだけを取ることができます。
真のラベルy i は分かっていますが、必ずしもその近似値と一致するとは限りません。バイナリ分類では、正しく分類されない要素は偽陽性と偽陰性と呼ばれます。
一部の分類ルールは静的関数です。その他の分類ルールはコンピュータ プログラムです。コンピュータ分類器は静的分類ルールを学習したり実装したりできます。トレーニング データ セットの場合、真のラベルy j は不明ですが、分類手順の主な目標は可能な限り近似することです。この近似の品質は、将来の観察が引き出される全体の母集団の統計的または確率的特性に基づいて判断する必要があります。
分類ルールが与えられた場合、分類テストは、そのルールを初期データ セットの有限サンプルに適用した結果です。
バイナリおよびマルチクラス分類
分類は、 2 値分類と多クラス分類という 2 つの別々の問題として考えることができます。より理解しやすいタスクである 2 値分類では、2 つのクラスのみが関係しますが、多クラス分類では、オブジェクトを複数のクラスのうちの 1 つに割り当てます。[2]多くの分類方法は 2 値分類専用に開発されているため、多クラス分類では、多くの場合、複数の 2 値分類器を組み合わせて使用する必要があります。重要な点は、多くの実際の 2 値分類問題では、2 つのグループが対称的ではないことです。全体的な精度ではなく、異なる種類のエラーの相対的な割合が重要です。たとえば、医療検査では、偽陽性 (病気が存在しないのに病気を検出する) と偽陰性 (病気が存在するのに病気を検出しない) は別のものとして扱われます。多クラス分類では、クラスは対称的 (すべてのエラーが同等) に扱われることもあれば、かなり複雑になる非対称的に扱われることもあります。
バイナリ分類法には、プロビット回帰とロジスティック回帰が含まれます。マルチクラス分類法には、多項プロビットと多項ロジットが含まれます。
混同行列と分類器

= 真陽性、TN = 真陰性、FP = 偽陽性 (タイプ I エラー)、FN = 偽陰性 (タイプ II エラー)、TPR = 真陽性率、FPR = 偽陽性率、PPV = 陽性予測値、NPV = 陰性予測値。
分類機能が完璧でない場合、誤った結果が表示されます。右の画像の例では、線の左側 (真の側) に 20 個の点がありますが、そのうち実際に真であるのは 8 個だけです。線の右側 (偽の側) も同様の状況で、右側には 16 個の点がありますが、そのうち 4 個は誤って真としてマークされています。点の位置を使用して、値を表す混同行列を作成できます。4 つの異なるメトリックを使用して、4 つの異なる可能性のある結果を表現できます。真陽性 (TP)、偽陽性 (FP)、偽陰性 (FN)、真陰性 (TN) です。
誤検知
偽陽性は、検査で誤って(不正確に)陽性の結果が報告された場合に発生します。たとえば、ある病気の医療検査では、患者が病気にかかっていない場合でも、病気にかかっていることを示す陽性の結果が返される場合があります。偽陽性は、混同マトリックスの右上の(状態陰性×検査結果陽性)単位として一般的に示されます。
偽陰性
一方、偽陰性は、検査で誤って陰性の結果を報告した場合に発生します。たとえば、病気の医療検査では、患者が実際には病気にかかっているにもかかわらず、病気ではないことを示す陰性の結果が返される場合があります。偽陰性は、通常、混同マトリックスの左下 (状態陽性 X 検査結果陰性) の単位として示されます。
真の陽性
真陽性は、検査が正しく陽性結果を報告した場合に発生します。たとえば、病気の医療検査では、患者が病気にかかっていることを示す陽性結果が返される場合があります。患者の検査で病気の存在が確認された場合、これが真であることが示されます。真陽性は、混同マトリックスの左上 (状態陽性 X 検査結果陽性) の単位として一般的に示されます。
真陰性
真陰性の結果は、検査が正しく陰性の結果を報告した場合です。たとえば、病気の医療検査では、患者が病気にかかっていないことを示す陽性の結果が返される場合があります。患者の検査でも病気にかかっていないことが報告された場合、これが真であることが示されます。真陰性は、混同マトリックスの右下 (状態陰性 X 検査結果陰性) の単位として一般的に示されます。
ベイズの定理の応用
ベイズの定理を使用して、真陽性、偽陽性、真陰性、偽陰性を計算することもできます。ベイズの定理を使用すると、イベントに関連する可能性のある条件に関する事前の知識に基づいて、イベントの確率(確率論)を説明するのに役立ちます。以下の例を使用して、4 つの分類が表現されています。
- 検査を受けた患者が病気にかかっていない場合、検査では 5% の確率、つまり 0.05 の確率で陽性の結果が返されます。
- 人口のわずか 0.1% がその病気にかかっていると仮定すると、ランダムに選択された患者がその病気にかかっている事前確率は 0.001 になります。
- Aは患者の病気の状態を表すものとする
- \neg Aは患者が病気にかかっていない状態を表すものとする
- B が陽性の検査結果の証拠を表すものとします。
- \neg B が陰性のテスト結果の証拠を表すものとします。
真陽性、偽陽性、偽陰性、真陰性に関して:
- 偽陽性とは、\neg A (患者は病気ではない) の次に B (患者は病気の検査で陽性となる) となる確率 P であり、P(\neg A|B) とも表されます。
- 偽陰性は、A(患者が病気にかかっている)そして\neg B(患者が病気の検査で陰性である)となる確率Pであり、P( A|\neg B)とも表されます。
- 真陽性とは、A(患者が病気にかかっている)の次にB(患者が病気の検査で陽性である)となる確率Pであり、P(A|B)とも表される。
- 真陰性は、\neg A (患者は病気に罹っていない)、次に\neg B (患者は病気の検査で陰性) となる確率 P であり、P(\neg A|\neg B) とも表されます。
誤検知
ベイズの定理を使用すると、陽性の結果が実際には偽陽性である確率を判断できます。病気がまれな場合、検査が比較的正確であっても、陽性の結果の大部分が偽陽性である可能性があることがわかります。
単純に考えれば、陽性検査結果の 5% だけが偽物であると考える人もいるかもしれませんが、後で説明するように、それはまったくの間違いです。
人口のわずか 0.1% がその病気にかかっていると仮定すると、ランダムに選択された患者がその病気にかかっている事前確率は 0.001 になります。
ベイズの定理を使用して、陽性の検査結果が偽陽性である確率を計算できます。
したがって、陽性の結果が偽陽性である確率は約 1 − 0.019 = 0.98、つまり 98% になります。
この検査の精度は高いようですが、病気の発生率は非常に低いため、陽性反応を示した患者の大多数は病気ではありません。それでも、陽性反応を示した患者のうち病気にかかっている人の割合 (0.019) は、まだ検査を受けていない人のうち病気にかかっている人の割合 (0.001) の 19 倍です。したがって、この検査は役に立たないわけではなく、再検査を行うことで結果の信頼性が向上する可能性があります。
偽陽性の問題を減らすためには、患者が病気にかかっていない場合に検査で陰性結果を報告する精度が非常に高くなければなりません。病気にかかっていない患者に対して検査で陰性結果が報告される確率が0.999であれば、
つまり、1 − 0.5 = 0.5 が偽陽性の確率となります。
偽陰性
上記の例を使用して、ベイズの定理を使用して、陰性の結果が実際には偽陰性である確率を判断できます。
陰性の結果が偽陰性である確率は約 0.0000105 または 0.00105% です。病気がまれな場合、偽陰性は検査で大きな問題にはなりません。
しかし、人口の60%が病気にかかっている場合、偽陰性の確率はより高くなります。上記の検査では、偽陰性の確率は次のようになります。
陰性の結果が偽陰性である確率は 0.0155 または 1.55% に上昇します。
真の陽性
上記の例を使用して、ベイズの定理を使用して、陽性の結果が実際に真陽性である確率を判断できます。
- 検査を受けた患者が病気にかかっている場合、検査では 99% の確率、つまり 0.99 の確率で陽性の結果が返されます。
- 検査を受けた患者が病気にかかっていない場合、検査では 5% の確率、つまり 0.05 の確率で陽性の結果が返されます。
- 人口のわずか 0.1% がその病気にかかっていると仮定すると、ランダムに選択された患者がその病気にかかっている事前確率は 0.001 になります。
A は患者が病気にかかっている状態を表し、B は検査結果が陽性である証拠を表します。検査結果が陽性の場合、患者が実際に病気にかかっている確率は次のようになります。
陽性の結果が真陽性である確率は約0.019%である。
真陰性
ベイズの定理を使用して、真陰性の確率を計算すること もできます。上記の例を使用すると、次のようになります。
- 検査を受けた患者が病気にかかっている場合、検査では 99% の確率、つまり 0.99 の確率で陽性の結果が返されます。
陰性の結果が真陰性である確率は 0.9999494 または 99.99% です。この病気はまれであり、陽性から陽性への割合が高く、陰性から陰性への割合も高いため、真陰性率は高くなります。
感度と特異度による分類器の測定
分類器をトレーニングする際には、広く受け入れられている感度と特異度の測定基準を使用してそのパフォーマンスを測定したい場合があります。分類器を、病気の有病率に基づいてコインを投げるランダム分類器と比較すると有益です。人が病気にかかっている確率が で、かかっていない確率が であるとします。次に、同じ確率で患者が病気にかかっていると推測し、同じ確率でかかっていないと推測するランダム分類器があるとします。
真陽性の確率は、患者が病気にかかっている確率と、ランダム分類器がこれを正しく推測する確率を掛け合わせたものです。同様の推論で、偽陰性の確率は です。上記の定義から、この分類器の感度は です。同様の推論で、特異度は と計算できます。
したがって、この指標自体は病気の有病率とは無関係ですが、このランダム分類器のパフォーマンスは病気の有病率に依存します。分類器のパフォーマンスは、このランダム分類器と似ていますが、より重み付けされたコイン (より高い感度と特異性) を備えている可能性があります。したがって、これらの指標は病気の有病率の影響を受ける可能性があります。パフォーマンスの代替指標はMatthews 相関係数で、これに対してランダム分類器の平均スコアは 0 になります。
この概念を非バイナリ分類に拡張すると、混同行列が生成されます。
参照
注記
参考文献
- ^ 統計的検定に関するMathworldの記事
- ^ Har-Peled, S.、Roth, D.、Zimak, D. (2003)「マルチクラス分類とランキングのための制約分類」。Becker, B.、Thrun, S.、Obermayer, K. (編)ニューラル情報処理システムの進歩 15: 2002 年会議議事録、MIT プレス。ISBN 0-262-02550-7
