精度と再現性 二値分類 および情報検索 システムの統計 分析において、 Fスコア またはF値は 予測性能の指標です。これは、テストの精度 と再現率 から算出されます。精度は、正しく識別されなかったサンプルも含め、陽性と予測された全サンプル数に対する真陽性結果の数の比率であり、再現率は、陽性と識別されるべき全サンプル数に対する真陽性結果の数の比率です。精度は陽性予測値 とも呼ばれ、再現率は診断二値分類における感度 とも呼ばれます。
F 1 スコアは、適合率と再現率の 調和平均 です。したがって、適合率と再現率の両方を 1 つの指標で対称的に表します。より一般的なF β {\displaystyle F_{\beta }} スコアは追加の重み付けを適用し、精度または再現率のどちらか一方を他方よりも高く評価します。
Fスコアの最大値は1.0で、これは精度と再現率が完璧であることを示します。最小値は0で、これは精度または再現率がゼロの場合に発生します。
語源 F値という名称は、ヴァン・ライスベルゲンの著書の中で別のF関数にちなんで名付けられたと考えられており、第4回メッセージ理解会議 (MUC-4、1992年)で紹介された。[ 1 ]
意味 従来のF値またはバランスFスコア(F1スコア )は、精度 と再現率の調和平均です。 [ 2 ]
F 1 = 2 r e c 1 l l − 1 + p r e c 私 s 私 o n − 1 = 2 p r e c 私 s 私 o n ⋅ r e c 1 l l p r e c 私 s 私 o n + r e c 1 l l = 2 T P 2 T P + F P + F N {\displaystyle F_{1}={\frac {2}{\mathrm {recall} ^{-1}+\mathrm {precision} ^{-1}}}=2{\frac {\mathrm {precision} \cdot \mathrm {recall} }{\mathrm {precision} +\mathrm {recall} }}={\frac {2\mathrm {TP} }{2\mathrm {TP} +\mathrm {FP} +\mathrm {FN} }}} 精度 = TP / (TP + FP) および再現率 = TP / (TP + FN) であることから、 F 1 の分子はそれらの分子の合計であり、F 1 の分母はそれらの分母の合計であることがわかります。
FP=FNの場合
F 1 = 2 T P 2 T P + 2 F P = T P T P + F P {\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FP} }}={\frac {\mathrm {TP} }{\mathrm {TP} +\mathrm {FP} }}}
または
F 1 = 2 T P 2 T P + 2 F N = T P T P + F N {\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FN} }}={\frac {\mathrm {TP} }{\mathrm {TP} +\mathrm {FN} }}}
つまり、F1 = 精度 = 再現率
TP=FP=FNの場合
F 1 = 2 T P 2 T P + 2 F P = 2 T P 4 T P = 1 2 = 0.5 {\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FP} }}={\frac {2\mathrm {TP} }{4\mathrm {TP} }}={\frac {1}{2}}=0.5}
または
F 1 = 2 T P 2 T P + 2 F N = 2 T P 4 T P = 1 2 = 0.5 {\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FN} }}={\frac {2\mathrm {TP} }{4\mathrm {TP} }}={\frac {1}{2}}=0.5}
調和平均として見るには、次の点に注意してください。F 1 − 1 = 1 2 ( r e c 1 l l − 1 + p r e c 私 s 私 o n − 1 ) {\displaystyle F_{1}^{-1}={\frac {1}{2}}(\mathrm {recall} ^{-1}+\mathrm {precision} ^{-1})} 。
診断検査 これは二値分類 の分野に関連しており、再現率はしばしば「感度」と呼ばれます。
↑ データ中の実際の陽性症例数 ↑ 状態または特性の存在を正しく示す検査結果 ↑ 第二種過誤:特定の状態または属性が存在しないことを誤って示す検査結果 ↑ データ中の実際の陰性症例数 ↑ 状態または特性の欠如を正しく示す検査結果 ↑ 第一種過誤:特定の状態または属性が存在すると誤って示す検査結果 正規化調和平均プロット。x軸は 精度、y 軸は再現率、縦軸はF1スコア (パーセントポイント)を表す。 適合率-再現率曲線:異なる閾値の点が色分けされており、最適なFスコアの点は赤色で強調表示されています。
Fスコアのクラス不均衡への依存性 精度-再現率曲線、したがってF β {\displaystyle F_{\beta }} スコアは、比率に明示的に依存します r {\displaystyle r} 陽性テストケースと陰性テストケースの比率。[ 12 ] これは、クラス比率が異なるさまざまな問題間でFスコアを比較することが困難であることを意味します。この問題に対処する1つの方法(例えば、Siblini et al., 2020 [ 13 ] を参照)は、標準的なクラス比率を使用することです。r 0 {\displaystyle r_{0}} そのような比較を行う際には。
物件 F 1 スコアは、検索されたアイテムのセットと関連アイテムのセットのDice 係数 です。 [ 19 ]
常に正のクラスを予測する分類器のF1スコアは、 正のクラスの確率が増加するにつれて1に収束する。 常に正のクラスを予測する分類器のF 1 スコアは、再現率が 1 であり、適合率が正のクラスの割合に等しいため、2 * proportion_of_positive_class / ( 1 + proportion_of_positive_class ) に等しくなります。[ 20 ] スコアリングモデルが情報を持たない場合(陽性クラスと陰性クラスを区別できない場合)、最適な閾値は0となり、常に陽性クラスが予測される。 F 1 スコアは真陽性率に対して凹型である。 [ 21 ]
批判 デビッド・ハンドらは、 F1 スコアが精度と再現率に等しく重要性を与えているため、広く使用されていることを批判している。実際には、異なる種類の誤分類は異なるコストを伴う。言い換えれば、精度と再現率の相対的な重要性は問題の一側面である。[ 22 ]
Davide ChiccoとGiuseppe Jurmanによると、F 1スコアは二値評価分類において マシューズ相関係数(MCC) よりも真実性や情報量が少ない。[ 23 ]
David MW Powers は、F 1 は 真の陰性を無視するため、不均衡なクラスに対して誤解を招く可能性があると指摘している一方、カッパと相関尺度は対称的で、分類器が真のクラスを予測する方向と真のクラスが分類器の予測を予測する方向の両方の予測可能性を評価し、2 つの方向に対して別々の多クラス尺度である情報量 と顕著性 を提案し、それらの幾何平均が相関であると述べている。[ 24 ]
F 1 に対するもう 1 つの批判は、その対称性の欠如です。これは、データセットのラベル付けが変更されると、つまり「正」のサンプルが「負」と名付けられ、その逆になると、その値が変わる可能性があることを意味します。この批判に対しては、 F 1 の対称的な拡張として示されることもあるP4 メトリックの 定義が対応しています。[ 25 ]
最後に、Ferrer [ 26 ] と Dyrland ら[ 27 ] は、期待コスト (またはその対義語である期待効用) が分類決定の評価のための唯一の原理的指標であり、F スコアや MCC に比べてさまざまな利点があると主張しています。両方の研究は、F スコアがシステムの絶対的および相対的な品質について誤った結論をもたらす可能性があることを示しています。
多クラス分類への拡張 Fスコアは、2つ以上のクラスを持つ分類問題(多クラス分類 )の評価にも使用されます。一般的な方法は、各クラスのFスコアを平均して、パフォーマンスのバランスの取れた測定を目指すことです。[ 29 ]
マクロF1 マクロF1 は、バランスの取れたパフォーマンス測定を目的としたマクロ平均F1スコアです。マクロF1を計算するために、2つの異なる平均化式が使用されています。クラスごとの精度と再現率の(算術)平均のF1スコア、またはクラスごとのF1スコアの算術平均です。後者の方が望ましい特性を示します。[ 30 ]
マイクロF1 マイクロF1は、 マイクロ精度 とマイクロ再現率 の調和平均です。単一ラベル多クラス分類では、マイクロ精度はマイクロ再現率と等しいため、マイクロF1は両方と等しくなります。しかし、よくある誤解とは異なり、マイクロF1は一般的に精度 と等しくありません。精度は真の陰性を考慮に入れますが、マイクロF1は考慮に入れないからです。[ 31 ]
参考文献 ↑ 佐々木 裕(2007)「F値の真実」(PDF) . Teach Tutor Mater . Vol. 1, no. 5. pp. 1– 5. ↑ Aziz Taha, Abdel (2015). "3D医用画像セグメンテーションを評価するための指標:分析、選択、およびツール" . BMC Medical Imaging . 15 (29) 29: 1– 28. doi : 10.1186/s12880-015-0068-x . PMC 4533825 . PMID 26263899 . ↑ ファン・ライスバーゲン、CJ (1979)。 情報検索 (第 2 版)。バターワース=ハイネマン。 ↑ Fawcett, Tom (2006). "ROC分析入門" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . ↑ プロボスト、フォスター、トム・フォーセット (2013-08-01)。 「ビジネスのためのデータサイエンス:データマイニングとデータ分析的思考について知っておくべきこと」 。O'Reilly Media, Inc. ↑ Powers, David MW (2011). "評価: 精度、再現率、F値からROC、情報量、顕著性、相関まで" . Journal of Machine Learning Technologies . 2 (1): 37– 63. ↑ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (編). 機械学習百科事典 . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8 。↑ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (2015-01-26). "WWRP/WGNE 予報検証研究に関する合同作業部会" . オーストラリア気象気候研究協力機構 . 世界気象機関 . 2019-07-17 に取得. ↑ Chicco D、Jurman G (2020 年 1月)。 「二値分類評価におけるF1スコアと精度に対するマシューズ相関係数(MCC ) の 利点」 。BMC Genomics。21 ( 1 ) : 6-1–6-13。doi : 10.1186/ s12864-019-6413-7。PMC 6941312。PMID 31898477 。 ↑ Chicco D、Toetsch N、Jurman G (2021 年 2 月)。 「マシューズ相関係数 (MCC) は、2 クラス混同行列評価において、バランス精度、ブックメーカー情報、およびマークネスよりも信頼性が高い」 。BioData Mining。14 ( 13 ) : 13。doi : 10.1186 / s13040-021-00244- z。PMC 7863449。PMID 33541410 。 ↑ Tharwat A. (2018年8月) 「分類評価方法」 . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 . ↑ ヤン・ブラベック;コマレク、トマーシュ。フラン、ヴォイチェフ。マチリツァ、ルカシュ(2020)。 「クラス不均衡が一定でない場合のモデル評価について」。 計算科学に関する国際会議 。スプリンガー。ページ 74–87。arXiv : 2001.05571 。 土井 : 10.1007/978-3-030-50423-6_6 。 ↑ Siblini, W.; Fréry, J.; He-Guelton, L.; Oblé, F.; Wang, YQ (2020). "キャリブレーションでメトリクスをマスターする". M. Berthold; A. Feelders; G. Krempl (eds.). Advances in Intelligent Data Analysis XVIII . Springer. pp. 457– 469. arXiv : 1909.02827 . doi : 10.1007/978-3-030-44584-3_36 . ↑ Beitzel., Steven M. (2006). On Understanding and Classifying Web Queries (Ph.D. thesis). IIT. CiteSeerX 10.1.1.127.634 . ↑ X. Li; Y.-Y. Wang; A. Acero (2008年7月). 正規化されたクリックグラフからのクエリ意図の学習 . 第31回SIGIR会議議事録 . p. 339. doi : 10.1145/1390334.1390393 . ISBN 9781605581644 . S2CID 8482989 . ↑ 例えば、。 ↑ Powers, David M. W (2015). "F値が測定しないもの". arXiv : 1503.06410 [ cs.IR ]. ↑ Derczynski, L. (2016). 相補性、Fスコア、およびNLP評価 。 言語資源と評価に関する国際会議の議事録 。 ↑ マニング、クリストファー(2009年4月1日)。 情報検索入門 (PDF) 。演習8.7:ケンブリッジ大学出版局。p.200 。 2022年 7月 18日 取得 。 {{cite book}}: CS1メンテナンス: 場所 (リンク)↑ 「二値分類器のF1スコアの基準値は何ですか? 」 ↑ Zachary Chase Lipton; Elkan, Charles; Narayanaswamy, Balakrishnan (2014). "Thresholding Classifiers to Maximize F1 Score". arXiv : 1402.1892 [ stat.ML ]. ↑ Hand, David (2018 年 5 月). "レコードリンケージアルゴリズムの評価に F 値を使用する際の注意 - Dimensions" . app.dimensions.ai . 28 (3): 539– 547. doi : 10.1007/s11222-017-9746-6 . hdl : 10044/1/46235 . S2CID 38782128 . 2018 年 12 月 8 日 取得 . ↑ Chicco D、Jurman G (2020年1月)。 「二 値分類評価におけるF1スコアと精度に対するマシューズ相関係数( MCC ) の 利点」 。BMC Genomics。21 ( 6) 6。doi : 10.1186 / s12864-019-6413-7。PMC 6941312。PMID 31898477 。 ↑ Powers, David MW (2011). "評価: 精度、再現率、F スコアから ROC、情報量、顕著性、相関まで". Journal of Machine Learning Technologies . 2 (1): 37– 63. hdl : 2328/27165 . ↑ Sitarz, Mikolaj (2023). "Extending F1 Metric, Probabilistic Approach". Advances in Artificial Intelligence and Machine Learning . 03 (2): 1025– 1038. arXiv : 2210.11997 . doi : 10.54364/AAIML.2023.1161 . ↑ Ferrer L (2025 年 2 月) 「アドホックな代替手段は不要: 期待コストは原則に基づいた汎用的な分類指標である」 . Transactions on Machine Learning Research . ↑ Dyrland K、Lundervold AS、Porta Mana P (2022年5月)。「評価は評価に耐えうるか?分類器の評価に対する第一原理アプローチ」。arXiv : 2302.12006 [ cs.LG ]。 ↑ Tharwat A (2018年8月) 「分類評価方法」 . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 . ↑ Opitz, Juri (2024). "分類評価指標のより詳細な検討と一般的な評価方法の批判的考察" . Transactions of the Association for Computational Linguistics . 12 : 820–836 . arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 . ↑ J. Opitz; S. Burst (2019). "Macro F1 and Macro F1". arXiv : 1911.03347 [ stat.ML ]. ↑ Brownlee, Jason (2021年9月7日). "4.3 – マイクロF1スコア". Pythonによる不均衡分類:より良い指標、偏ったクラスのバランス、コスト重視の学習 . 機械学習マスター. p. 40. ISBN 979-8468452240 。