
バイナリ分類および情報検索システムの統計分析では、 F スコアまたはF 尺度は予測性能の尺度です。これは、テストの精度と再現率から計算されます。精度は、正しく識別されなかったものも含め、陽性と予測されたすべてのサンプルの数で割った真陽性結果の数であり、再現率は、陽性と識別されるべきすべてのサンプルの数で割った真陽性結果の数です。診断バイナリ分類では、 精度は陽性予測値とも呼ばれ、再現率は感度とも呼ばれます。
F 1スコアは、精度と再現率の調和平均です。したがって、1 つのメトリックで精度と再現率の両方を対称的に表します。より一般的なスコアでは、追加の重みが適用され、精度または再現率のいずれかが他方よりも重視されます。
F スコアの最高値は 1.0 で、これは完全な精度と再現率を示します。最低値は 0 で、これは精度と再現率がゼロであることを示します。
語源
F-measureという名前は、第4回メッセージ理解会議(MUC-4、1992年)で紹介されたVan Rijsbergenの著書の別のF関数にちなんで名付けられたと考えられています。 [1]
意味
伝統的なF値またはバランスFスコア(F 1スコア)は、精度と再現率の調和平均である:[2]
- 。
ふβスコア
より一般的な F スコア は、再現率が精度の 倍重要であると考えられるように選択される正の実数因子 を使用し、次のように なります。
- 。
タイプ I およびタイプ II のエラーに関しては、次のようになります。
- 。
よく使用される 2 つの値は、再現率を精度より重視する 2 と、再現率を精度より重視する 0.5 です。
F値は、 「精度よりも再現性を重視するユーザーに対する検索の有効性を測定する」ために導き出された。 [3]これは、Van Rijsbergenの有効性測定法 に基づいている。
- 。
彼らの関係はです。
診断検査
これは、リコールが「感度」と呼ばれることが多い バイナリ分類の分野に関連しています。
- ^ データ内の実際の陽性症例数
- ^ 状態または特性の存在を正しく示す検査結果
- ^ タイプIIエラー: 特定の条件または属性が欠如していると誤って示すテスト結果
- ^ データ内の実際の陰性症例数
- ^ 症状や特徴が存在しないことを正しく示す検査結果
- ^ タイプIエラー: 特定の条件または属性が存在すると誤って示すテスト結果


Fスコアの階級不均衡への依存性
適合率-再現率曲線、そしてスコアは、陽性テストケースと陰性テストケースの比率に明示的に依存します 。 [12]これは、クラス比が異なる異なる問題間でFスコアを比較することに問題があることを意味します。この問題に対処する1つの方法(例えば、Siblini et al.、2020 [13] を参照 )は、そのような比較を行うときに標準クラス比を使用することです。
アプリケーション
Fスコアは、情報検索の分野で、検索、文書分類、クエリ分類のパフォーマンスを測定するためによく使用されます。[14]これは、主に正のクラスに関係し、負のクラスに比べて正のクラスがまれであるアプリケーションで特に重要です。
以前の研究では主にF1スコアに焦点を当てていましたが、大規模検索エンジンの普及に伴い、パフォーマンス目標は精度または再現率のいずれかに重点を置くように変化し[15]、幅広い応用が見られるようになりました。
Fスコアは機械学習でも使用されます。[16]しかし、F尺度では真陰性が考慮されないため、バイナリ分類器のパフォーマンスを評価するには、マシューズ相関係数、情報量、 コーエンのカッパなどの尺度が好まれる場合があります。[17]
Fスコアは自然言語処理の文献では広く使用されており、[18]固有表現認識や単語分割の評価などに使用されています。
プロパティ
F1スコアは、検索された項目の集合と関連項目の集合のDice係数である。 [19]
- 常に正のクラスを予測する分類器のF 1スコアは、正のクラスの確率が増加するにつれて 1 に収束します。
- 常に正クラスを予測する分類器のF 1スコアは、再現率が1であり、適合率が正クラスの割合に等しいため、2 * percentage_of_positive_class / ( 1 + percentage_of_positive_class )に等しくなります。[20]
- スコアリング モデルが有益でない場合 (正クラスと負クラスを区別できない場合)、最適なしきい値は 0 となり、常に正クラスが予測されます。
- F1スコアは真陽性率において凹状である。 [ 21 ]
批判
デイビッド・ハンドらは、 F1スコアが精度と再現率を同等に重視しているため、その広範な使用を批判している。実際には、誤分類の種類によってコストは異なる。言い換えれば、精度と再現率の相対的な重要性が問題の一側面である。[22]
ダビデ・チッコとジュゼッペ・ジャーマンによれば、バイナリ評価分類においてF1スコアはマシューズ相関係数(MCC)よりも真実性や情報量が少ないとのことです。 [23]
デビッド・MW・パワーズは、F1は真陰性を無視するため、不均衡なクラスについては誤解を招く可能性があると指摘しているが、カッパと相関の尺度は対称的で予測可能性の両方向(分類器が真のクラスを予測し、真のクラスが分類器の予測を予測する)を評価するため、2つの方向に対して別々のマルチクラス尺度である情報量と有標性を提案し、それらの幾何平均は相関であることを指摘している。[24]
F 1に対するもう一つの批判は、その対称性の欠如である。これは、データセットのラベル付けが変更されると値が変わる可能性があることを意味する。つまり、「陽性」サンプルが「陰性」と命名され、その逆も起こる。この批判は、 F 1の対称的な拡張として示されることもあるP4 メトリック定義によって満たされる。[25]
フォークス・マロウズ指数との違い
F値は再現率と精度の調和平均であるのに対し、 Fowlkes-Mallows指数はそれらの幾何平均である。[26]
多クラス分類への拡張
Fスコアは、2つ以上のクラスを持つ分類問題(多クラス分類)の評価にも使用されます。一般的な方法は、パフォーマンスのバランスの取れた測定を目的として、各クラスのFスコアを平均化することです。[27]
マクロ F1
マクロF1は、バランスのとれたパフォーマンス測定を目的としたマクロ平均F1スコアです。マクロF1を計算するために、2つの異なる平均化式が使用されています。1つは(算術)クラスごとの精度と再現率の平均のF1スコア、もう1つはクラスごとのF1スコアの算術平均で、後者の方がより望ましい特性を示します。[28]
マイクロF1
マイクロF1は、マイクロ精度(偽陽性で正規化された正しい予測の数)とマイクロ再現率(偽陰性で正規化された正しい予測の数)の調和平均です。多クラス評価では、偽陽性の総量は偽陰性の量に等しいため、マイクロF1は正確度に相当します。[27]
参照
参考文献
- ^ Sasaki, Y. (2007). 「F 尺度の真実」(PDF) .ティーチ・チューター・マター. 第 1 巻、第 5 号、pp. 1–5.
- ^ Aziz Taha、Abdel (2015)。「3D医療画像セグメンテーションを評価 するための指標:分析、選択、およびツール」。BMC Medical Imaging。15 ( 29): 1–28。doi :10.1186 / s12880-015-0068 - x。PMC 4533825。PMID 26263899。
- ^ ファン・ライスバーゲン、CJ (1979)。情報検索 (第 2 版)。バターワース=ハイネマン。
- ^ Fawcett, Tom (2006). 「ROC分析入門」(PDF) .パターン認識レター. 27 (8): 861–874. doi :10.1016/j.patrec.2005.10.010. S2CID 2027090.
- ^ Provost, Foster、Tom Fawcett (2013-08-01)。「ビジネスのためのデータサイエンス: データマイニングとデータ分析的思考について知っておくべきこと」。O'Reilly Media, Inc.
- ^ Powers, David MW (2011). 「評価: 精度、再現率、F 値から ROC、情報量、注目度、相関まで」。機械学習テクノロジージャーナル。2 (1): 37–63。
- ^ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (編).機械学習百科事典. Springer. doi :10.1007/978-0-387-30164-8. ISBN 978-0-387-30164-8。
- ^ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (2015-01-26). 「WWRP/WGNE Joint Working Group on Forecast Verification Research」.オーストラリア気象気候研究のためのコラボレーション。世界気象機関。2019-07-17閲覧。
- ^ Chicco D、Jurman G (2020年1月)。「バイナリ分類評価におけるF1スコアと 精度に対するMatthews相関係数(MCC )の利点」。BMC Genomics。21 ( 1 ) :6-1–6-13。doi : 10.1186 / s12864-019-6413-7。PMC 6941312。PMID 31898477。
- ^ Chicco D、Toetsch N、Jurman G (2021年2月)。「マシューズ相関係数(MCC)は、2クラス混同行列評価において、バランスのとれた正確性、ブックメーカーの情報、マーク度よりも信頼性が高い」。BioData Mining。14 ( 13 ):13。doi :10.1186 /s13040-021-00244 - z。PMC 7863449。PMID 33541410。
- ^ Tharwat A. (2018年8月). 「分類評価方法」.応用コンピューティングと情報科学. 17 :168–192. doi : 10.1016/j.aci.2018.08.003 .
- ^ ヤン・ブラベック;コマレク、トマーシュ。フラン、ヴォイチェフ。マチリツァ、ルカシュ(2020)。 「クラス不均衡が一定でない場合のモデル評価について」。計算科学に関する国際会議。スプリンガー。 74–87ページ。arXiv : 2001.05571。土井: 10.1007/978-3-030-50423-6_6。
- ^ Siblini, W.; Fréry, J.; He-Guelton, L.; Oblé, F.; Wang, YQ (2020). 「Master your metrics with Calibration」. M. Berthold; A. Feelders; G. Krempl (eds.). Advances in Intelligent Data Analysis XVIII . Springer. pp. 457–469. arXiv : 1909.02827 . doi : 10.1007/978-3-030-44584-3_36 .
- ^ Beitzel., Steven M. (2006). Webクエリの理解と分類について(博士論文). IIT. CiteSeerX 10.1.1.127.634 .
- ^ X. Li; Y.-Y. Wang; A. Acero (2008 年 7 月)。正規化されたクリック グラフからクエリの意図を学習する。第 31 回 SIGIR カンファレンスの議事録。p. 339。doi :10.1145/1390334.1390393。ISBN 9781605581644. S2CID 8482989。
- ^ 例えば、[1]の評価を参照。
- ^ Powers, David M. W (2015). 「F値で測定できないもの」. arXiv : 1503.06410 [cs.IR].
- ^ Derczynski, L. (2016). 相補性、Fスコア、およびNLP評価。言語資源と評価に関する国際会議の議事録。
- ^ Manning, Christopher (2009年4月1日). 情報検索入門(PDF) . 演習8.7: Cambridge University Press. p. 200 . 2022年7月18日閲覧。
{{cite book}}: CS1 メンテナンス: 場所 (リンク) - ^ 「バイナリ分類器の F1 スコアのベースラインは何ですか?」
- ^ Lipton, ZC, Elkan, CP, & Narayanaswamy, B. (2014). マルチラベル設定における F1 最適閾値設定。ArXiv, abs/1402.1892.
- ^ Hand, David. 「レコードリンクアルゴリズムを評価するための F 値の使用に関するメモ - Dimensions」. app.dimensions.ai . doi :10.1007/s11222-017-9746-6. hdl : 10044/1/46235 . S2CID 38782128. 2018 年 12 月 8 日閲覧。
- ^ Chicco D、Jurman G (2020年1月)。「バイナリ分類評価におけるF1スコアと精度に対するMatthews相関係数(MCC)の利点」。BMC Genomics。21 (6) : 6。doi : 10.1186 / s12864-019-6413-7。PMC 6941312。PMID 31898477。
- ^ Powers, David MW (2011). 「評価: 精度、再現率、 Fスコアから ROC、情報量、注目度、相関まで」。機械学習テクノロジージャーナル。2 (1): 37–63。hdl : 2328/27165。
- ^ Sitarz, Mikolaj (2022). 「F1メトリックの拡張、確率的アプローチ」. arXiv : 2210.11997 [cs.LG].
- ^ Tharwat A (2018年8月). 「分類評価方法」.応用コンピューティングと情報科学. 17 :168–192. doi : 10.1016/j.aci.2018.08.003 .
- ^ ab Opitz, Juri (2024). 「分類評価指標の詳細と一般的な評価方法の批判的考察」. Transactions of the Association for Computational Linguistics . 12 : 820–836. arXiv : 2404.16958 . doi :10.1162/tacl_a_00675.
- ^ J. Opitz; S. Burst (2019). 「Macro F1とMacro F1」. arXiv : 1911.03347 [stat.ML].
