データマイニング とアソシエーションルール学習 において、リフト とは、ランダム選択ターゲティングモデルと比較して、ターゲティングモデル (アソシエーションルール)が(母集団全体と比較して)応答が向上したケースを予測または分類する際のパフォーマンスを測定する指標です。ターゲティングモデルは、応答がP ( B ∣ T ) {\displaystyle P(B\mid T)} ターゲット内(T {\displaystyle T} )はベースラインよりもはるかに優れている(P ( B ) {\displaystyle P(B)} )は、集団全体の平均値です。リフトは、これらの値の比率です。目標応答を平均応答で割ったものです。数学的には、
リフト = P ( B ∣ T ) P ( B ) = P ( T ∧ B ) P ( T ) P ( B ) {\displaystyle \operatorname {lift} ={\frac {P(B\mid T)}{P(B)}}={\frac {P(T\wedge B)}{P(T)P(B)}}} 例えば、ある集団の平均応答率が5%であると仮定します。しかし、あるモデル(またはルール)によって応答率が20%のセグメントが特定された場合、そのセグメントのリフト値は4.0(20%/5%)となります。
リフトは、このグラフに示すように、精度 と有病率 の比率でもあります。
↑ データ中の実際の陽性症例数 ↑ 状態または特性の存在を正しく示す検査結果 ↑ 第二種過誤:特定の状態または属性が存在しないことを誤って示す検査結果 ↑ データ中の実際の陰性症例数 ↑ 状態または特性の欠如を正しく示す検査結果 ↑ 第一種過誤:特定の状態または属性が存在すると誤って示す検査結果 リフトは精度 と出現率 の比率であり、出現率はターゲットセットの選択によって変化しないため、リフトは精度に比例します。したがって、リフト対再現率(つまり捕捉率)をプロットしたリフト曲線は、精度-再現率 曲線と形状が同一です。リフト曲線は常に右下隅の点(1, 1)または(100%, 1)で終わります。これは、精度-再現率曲線が点(1/P(B), 1)で終わるのと同様です。この点は、母集団全体をターゲットセットとして選択した場合に対応します。
精度-再現率曲線と同様に、リフト曲線は受信者操作特性(ROC)曲線と同様のトレードオフを示します。また、 計量経済学で ローレンツ 曲線またはべき乗曲線として知られる曲線にも似ています。[ 9 ]
アプリケーション 通常、モデリング担当者は対象集団を分位 に分割し、リフト値に基づいて各分位をランク付けします。組織は各分位を検討し、予測される反応率(およびそれに伴う経済的利益)とコストを比較検討することで、その分位に対してマーケティングを行うかどうかを決定できます。
例 マイニング対象のデータセットは 以下のとおりとします。
ここで、前件とは制御可能な入力変数であり、後件とは予測しようとしている変数です。実際の鉱業問題では、通常、前件はより複雑になりますが、後件は通常、単一の値を持つ変数に焦点を当てます。
ほとんどのマイニングアルゴリズムは、以下のルール(ターゲットモデル)を決定します。
ルール1:Aは0を意味する ルール2:Bは1を意味する これらは単にデータに見られる最も一般的なパターンだからです。上記の表をざっと見れば、これらのルールは明らかでしょう。
ルール1の支持度は 3/7です。これは、データセット内で前件がAで後件が0である項目の数です。ルール2の支持度は2/7です。これは、7つのレコードのうち2つが前件がBで後件が1であるからです。支持度は次のように表すことができます。
補足 ( A ⇒ 0 ) = P ( A ∧ 0 ) = P ( A ) P ( 0 ∣ A ) = P ( 0 ) P ( A ∣ 0 ) {\displaystyle \operatorname {supp} (A\Rightarrow 0)=P(A\land 0)=P(A)P(0\mid A)=P(0)P(A\mid 0)} 補足 ( B ⇒ 1 ) = P ( B ∧ 1 ) = P ( B ) P ( 1 ∣ B ) = P ( 1 ) P ( B ∣ 1 ) {\displaystyle \operatorname {supp} (B\Rightarrow 1)=P(B\land 1)=P(B)P(1\mid B)=P(1)P(B\mid 1)} ルール1の信頼度 は3/4です。これは、Aの前提条件を満たす4つのレコードのうち3つが、0の前提条件を満たすためです。ルール2の信頼度は2/3です。これは、Bの前提条件を満たす3つのレコードのうち2つが、1の前提条件を満たすためです。信頼度は次のように表すことができます。
conf ( A ⇒ 0 ) = P ( 0 ∣ A ) {\displaystyle \operatorname {conf} (A\Rightarrow 0)=P(0\mid A)} conf ( B ⇒ 1 ) = P ( 1 ∣ B ) {\displaystyle \operatorname {conf} (B\Rightarrow 1)=P(1\mid B)} リフトは、信頼度を後件の無条件確率で割るか、サポートを前件の確率と後件の確率の積で割ることによって求められます。
ルール1のリフトは(3/4)/(4/7) = (3*7)/(4 * 4) = 21/16 ≈ 1.31です。 ルール2のリフトは(2/3)/(3/7) = (2*7)/(3 * 3) = 14/9 ≈ 1.56です。 リフト ( A ⇒ 0 ) = P ( 0 ∣ A ) P ( 0 ) = P ( A ∧ 0 ) P ( A ) P ( 0 ) {\displaystyle \operatorname {lift} (A\Rightarrow 0)={\frac {P(0\mid A)}{P(0)}}={\frac {P(A\land 0)}{P(A)P(0)}}} リフト ( B ⇒ 1 ) = P ( 1 ∣ B ) P ( 1 ) = P ( B ∧ 1 ) P ( B ) P ( 1 ) {\displaystyle \operatorname {lift} (B\Rightarrow 1)={\frac {P(1\mid B)}{P(1)}}={\frac {P(B\land 1)}{P(B)P(1)}}} ある規則のリフト値が1であれば、それは前件の発生確率と後件の発生確率が互いに独立していることを意味する。2つの事象が互いに独立している場合、それらの事象を含む規則を導き出すことはできない。
リフトが1より大きい場合(ルール1とルール2の場合のように)、それは2つの事象が互いにどの程度依存しているかを示しており、これらのルールが将来のデータセットにおける結果を予測するのに役立つ可能性があることを示しています。
ルール1は信頼度が高いにもかかわらず、リフト値が低いことに注目してください。直感的には、ルール1は信頼度が高い分、より正確(より裏付けが取れている)であるように思えるかもしれません。しかし、データセットとは無関係なルールの正確さだけでは誤解を招く可能性があります。リフト値の価値は、ルールの信頼度とデータセット全体の両方を考慮に入れる点にあります。
参考文献 ↑ Fawcett, Tom (2006). "ROC分析入門" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . ↑ プロボスト、フォスター、トム・フォーセット (2013-08-01)。 「ビジネスのためのデータサイエンス:データマイニングとデータ分析的思考について知っておくべきこと」 。O'Reilly Media, Inc. ↑ Powers, David MW (2011). "評価: 精度、再現率、F値からROC、情報量、顕著性、相関まで" . Journal of Machine Learning Technologies . 2 (1): 37– 63. ↑ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (編). 機械学習百科事典 . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8 。↑ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (2015-01-26). "WWRP/WGNE 予報検証研究に関する合同作業部会" . オーストラリア気象気候研究協力機構 . 世界気象機関 . 2019-07-17 に取得. ↑ Chicco D、Jurman G (2020 年 1月)。 「二値分類評価におけるF1スコアと精度に対するマシューズ相関係数(MCC ) の 利点」 。BMC Genomics。21 ( 1 ) : 6-1–6-13。doi : 10.1186/ s12864-019-6413-7。PMC 6941312。PMID 31898477 。 ↑ Chicco D、Toetsch N、Jurman G (2021 年 2 月)。 「マシューズ相関係数 (MCC) は、2 クラス混同行列評価において、バランス精度、ブックメーカー情報、およびマークネスよりも信頼性が高い」 。BioData Mining。14 ( 13 ) : 13。doi : 10.1186 / s13040-021-00244- z。PMC 7863449。PMID 33541410 。 ↑ Tharwat A. (2018年8月) 「分類評価方法」 . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 . ↑ タフェリー、ステファン (2011); Data Mining and Statistics for Decision Making 、イギリス、チチェスター: John Wiley & Sons、フランス語のData Mining et statistique décisionnelle (Éditions Technip、2008) コッポック、デビッド S. (2002-06-21). 「なぜ持ち上げるのか?」. 2015-07-05 に取得。