混同行列( エラー行列 とも呼ばれる) [ 1 ] は、特定のタスクにおける人またはアルゴリズムのパフォーマンスを視覚化できる特定の表形式です。 聴覚学 では、これらの行列は、人が特定の単語や音を聞き取れるかどうかを測定します。[ 2 ] 機械学習 では、これらの行列は、教師あり学習 と教師なし学習の 両方における学習システムの成功を示し、通常はマッチング行列 と呼ばれます。
行列 の各行は実際のクラスのインスタンスを表し、各列は予測されたクラスのインスタンスを表すか、あるいはその逆で、 どちらのバリアントも文献に見られます。[ 3 ] したがって、行列の対角線は正しく予測されたすべてのインスタンスを表します。[ 4 ] この名前は、システムが 2 つのクラスを混同しているかどうか (つまり、一般的にあるクラスを別のクラスとして誤ってラベル付けしているかどうか) を簡単に識別できるという事実に由来しています。混同行列は、人間の聴覚刺激の知覚研究に起源を持ちます。これは機械学習の研究に適応され、フランク・ローゼンブラットをはじめとする初期の研究者によって、視覚 (そして後に聴覚) 刺激の人間と機械の分類を比較するために使用されました。[ 5 ]
これは特殊な分割表 であり、2つの次元(「実際」と「予測」)を持ち、両方の次元に同一の「クラス」のセットが存在する(次元とクラスの各組み合わせが分割表の変数となる)。
例 12人の被験者のサンプルがあり、そのうち8人が癌と診断され、4人が癌ではないと診断された場合、癌患者はクラス1(陽性)に属し、癌ではない人はクラス0(陰性)に属するとすると、そのデータは次のように表示できます。
がん患者と非がん患者を何らかの方法で区別する分類器があると仮定し、12人の被験者をその分類器に通します。すると、分類器は9件の正確な予測を行い、3件の予測を誤ります。その内訳は、がん患者2人ががんではないと誤って予測され(サンプル1と2)、がんではない1人ががんであると誤って予測された(サンプル9)というものです。
実際の分類結果と予測された分類結果を比較すると、特定の列において4つの異なる結果が生じる可能性があることに注意してください。
実際の分類は陽性であり、予測された分類も陽性(1,1)です。これは、陽性サンプルが分類器によって正しく識別されたため、真陽性結果と呼ばれます。 実際の分類は陽性であり、予測された分類は陰性(1,0)です。これは、陽性サンプルが分類器によって誤って陰性と識別されたため、偽陰性結果と呼ばれます。 実際の分類は陰性であるにもかかわらず、予測された分類は陽性(0、1)である。これは、陰性サンプルが分類器によって誤って陽性と識別されたため、偽陽性結果と呼ばれる。 実際の分類は陰性であり、予測された分類も陰性(0,0)です。これは、陰性サンプルが分類器によって正しく識別されるため、真の陰性結果と呼ばれます。 次に、実際の分類結果と予測された分類結果を比較し、その情報を表に追加します。正しい結果は緑色で表示されるため、より簡単に識別できます。
任意の二値混同行列のテンプレートは、上記で説明した4種類の結果(真陽性、偽陰性、偽陽性、真陰性)と、陽性および陰性の分類を使用します。4つの結果は、次のように2×2の混同行列で表すことができます。
上記の3つのデータ表の色分けは、データを容易に区別できるように、この混同行列に合わせて選択されました。
これで、各タイプの結果を合計し、テンプレートに代入することで、分類器のテスト結果を簡潔にまとめた混同行列を作成できます。
この混同行列では、癌のある8つのサンプルのうち、システムは2つを癌ではないと判断し、癌のない4つのサンプルのうち、1つを癌であると予測しました。すべての正しい予測は表の対角線上(緑色で強調表示)に位置しているため、対角線外の値が予測エラーを表すため、表を視覚的に簡単に検査できます。混同行列の2つの行を合計することで、元のデータセットの陽性(P)および陰性(N)サンプルの総数を推測することもできます。P = T P + F N {\displaystyle P=TP+FN} そしてN = F P + T N {\displaystyle N=FP+TN} 。
混乱の表 予測分析 において、混同表( 混同行列 とも呼ばれる)は、真陽性 、偽陰性 、偽陽性 、真陰性 の数を報告する2行2列の表です。これにより、正しく分類された割合(精度)を単に観察するよりも詳細な分析が可能になります。データセットが不均衡な場合、つまり、異なるクラスの観測数が大きく異なる場合、精度は誤解を招く結果をもたらす可能性があります。
例えば、データにがんサンプルが95個、非がんサンプルが5個しかない場合、特定の分類器はすべての観測値をがんと分類するかもしれません。全体の精度は95%になりますが、より詳細に見ると、この分類器はがんクラスに対しては100%の認識率(感度 )を持ちますが、非がんクラスに対しては0%の認識率となります。このような場合、 F1スコアは さらに信頼性が低く、97.4%を超える値になりますが、情報 に基づく判断ではこのようなバイアスが排除され、あらゆる推測(ここでは常にがんと推測)に対する情報に基づく判断の確率は0となります。
Davide ChiccoとGiuseppe Jurmanによると、混同行列を評価する上で最も有益な指標はマシューズ相関係数(MCC) である。[ 12 ]
混同行列には他の指標も含めることができ、それぞれに重要性と用途がある。
↑ データ中の実際の陽性症例数 ↑ 状態または特性の存在を正しく示す検査結果 ↑ 第二種過誤:特定の状態または属性が存在しないことを誤って示す検査結果 ↑ データ中の実際の陰性症例数 ↑ 状態または特性の欠如を正しく示す検査結果 ↑ 第一種過誤:特定の状態または属性が存在すると誤って示す検査結果 一部の研究者は、混同行列およびそこから導出される指標は、モデルの知識を 真に反映していないと主張している。特に、混同行列は、正しい予測が健全な推論によって達成されたのか、単なる偶然によって達成されたのかを示すことができない(哲学では認識的幸運として知られる問題)。また、予測を行うために使用された事実が後に変化したり、誤りであることが判明したりする状況(反証可能性)も捉えることができない。つまり、混同行列は分類性能を測定するための有用なツールではあるが、モデルの真の信頼性を完全に表すものではない可能性がある。[ 21 ]
混同行列指標。精度、適合率、感度(再現率)、特異度を含む。
2つ以上のカテゴリを含む混同行列 混同行列は二値分類に限定されず、多クラス分類器にも使用できます。上記で説明した混同行列には、正と負の2つの条件しかありません。たとえば、下の表は、 2人の話者間の口笛言語 のコミュニケーションをまとめたもので、分かりやすくするためにゼロ値は省略されています。[ 22 ]
複数カテゴリ混同行列。偽陽性、偽陰性、真陽性、真陰性の位置を表示します。
マルチラベル分類およびソフトラベル分類における混同行列 混同行列は、単一ラベル分類 (クラスが1つしか存在しない場合)やハードラベル設定(クラスが完全に存在する場合は1、存在しない場合は0)に限定されません。マルチラベル分類 (複数のクラスを同時に予測できる場合)やソフトラベル分類(クラスが部分的に存在する場合)にも拡張できます。
そのような拡張の1つが、最適輸送 理論と最大エントロピー原理に基づいて構築された 輸送ベース混同行列(TCM) [ 23 ]です 。TCMは、シングルラベル、マルチラベル、ソフトラベルの設定に適用されます。標準的な混同行列の馴染みのある構造、つまりクラス数と同じサイズの正方行列を保持しており、対角要素は正しい予測を示し、非対角要素は混同を示します。シングルラベルの場合、TCMは標準的な混同行列と同一です。
TCMは、標準的な混同行列と同じ考え方に従います。クラスAが過大評価されている場合(予測値がラベル値より大きい場合)、クラスBが過小評価されている場合(予測値がラベル値より小さい場合)、AはBと混同されているとみなされ、エントリ(B, A)が増加します。クラスが予測され、かつ存在する場合、正しく識別され、対角エントリ(A, A)が増加します。これらのエントリがどの程度更新されるかを決定するために、最適輸送と最大エントロピーが使用されます。[ 23 ]
TCMは、複雑な分類タスクにおいて予測とラベル間の比較をより明確にすると同時に、設定間で一貫したマトリックス形式を維持することを可能にする。[ 23 ]
参考文献 ↑ Stehman, Stephen V. (1997). "主題分類精度の尺度の選択と解釈". Remote Sensing of Environment . 62 (1): 77– 89. Bibcode : 1997RSEnv..62...77S . doi : 10.1016/S0034-4257(97)00083-7 . ↑ Qinglin Meng 他、デジタル聴覚医療 2022 1 2 Powers, David MW (2011). "評価: 精度、再現率、F値から ROC、情報量、特徴量、相関まで" . Journal of Machine Learning Technologies . 2 (1): 37– 63. S2CID 55767944 . ↑ Opitz, Juri (2024). "分類評価指標のより詳細な検討と一般的な評価方法の批判的考察" . Transactions of the Association for Computational Linguistics . 12 : 820–836 . arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 . ↑ ドブソン、 ジェームズ (2024)。 「混同行列について」 。Configurations。32 ( 4 ): 331–350。doi : 10.1353 /con.2024.a942087 。 ↑ プロボスト、フォスター、ファウセット、トム (2013). ビジネスのためのデータサイエンス:データマイニングとデータ分析的思考について知っておくべきこと (第1版、第2 版)。北京ケルン:オライリー 。ISBN 978-1-4493-6132-7 。↑ Fawcett, Tom (2006). "An Introduction to ROC Analysis" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. Bibcode : 2006PaReL..27..861F . doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . ↑ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (編). 機械学習百科事典 . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8 。↑ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (2015-01-26). "WWRP/WGNE 予報検証研究に関する合同作業部会" . オーストラリア気象気候研究協力機構 . 世界気象機関 . 2019-07-17 に取得. ↑ Chicco D、Jurman G (2020 年 1月)。 「二 値分類評価におけるF1スコアと精度に対するマシューズ相関係数(MCC ) の 利点」 。BMC Genomics。21 ( 1) 6 : 6-1–6-13。doi : 10.1186/ s12864-019-6413-7。PMC 6941312。PMID 31898477 。 ↑ Tharwat A. (2018年8月) 「分類評価方法」 . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 . ↑ Chicco D、Jurman G (2020 年 1月)。 「二 値分類評価におけるF1スコアと精度に対するマシューズ相関係数(MCC ) の 利点」 。BMC Genomics。21 ( 1) 6 : 6-1–6-13。doi : 10.1186/ s12864-019-6413-7。PMC 6941312。PMID 31898477 。 ↑ Fawcett, Tom (2006). "ROC分析入門" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . ↑ プロボスト、フォスター、トム・フォーセット (2013-08-01)。 「ビジネスのためのデータサイエンス:データマイニングとデータ分析的思考について知っておくべきこと」 。O'Reilly Media, Inc. ↑ Powers, David MW (2011). "評価: 精度、再現率、F値からROC、情報量、顕著性、相関まで" . Journal of Machine Learning Technologies . 2 (1): 37– 63. ↑ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (編). 機械学習百科事典 . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8 。↑ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (2015-01-26). "WWRP/WGNE 予報検証研究に関する合同作業部会" . オーストラリア気象気候研究協力機構 . 世界気象機関 . 2019-07-17 に取得. ↑ Chicco D、Jurman G (2020 年 1月)。 「二値分類評価におけるF1スコアと精度に対するマシューズ相関係数(MCC ) の 利点」 。BMC Genomics。21 ( 1 ) : 6-1–6-13。doi : 10.1186/ s12864-019-6413-7。PMC 6941312。PMID 31898477 。 ↑ Chicco D、Toetsch N、Jurman G (2021 年 2 月)。 「マシューズ相関係数 (MCC) は、2 クラス混同行列評価において、バランス精度、ブックメーカー情報、およびマークネスよりも信頼性が高い」 。BioData Mining。14 ( 13 ) : 13。doi : 10.1186 / s13040-021-00244- z。PMC 7863449。PMID 33541410 。 ↑ Tharwat A. (2018年8月) 「分類評価方法」 . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 . ↑ van der Linde, Ian (2025). 「混同行列が知識モデルとして失敗する理由」。AI & Society . doi : 10.1007/s00146-025-02456-x . ↑ Rialland, Annie (2005年8月). 「口笛言語の音韻論的および音声学的側面」. Phonology . 22 (2): 237– 271. CiteSeerX 10.1.1.484.4384 . doi : 10.1017/S0952675705000552 . S2CID 18615779 . 1 2 3 Erbani, Johan; Portier, Pierre-Édouard; Egyed-Zsigmond, Előd; Nurbakova, Diana (2024). "混同行列: 統一理論" . IEEE Access . 12 . IEEE: 181372– 181419. Bibcode : 2024IEEEA..12r1372E . doi : 10.1109/ACCESS.2024.3507199 . ISSN 2169-3536 .