統計学では、データ分析におけるオーバーサンプリングとアンダーサンプリングは、データセットのクラス分布(つまり、表される異なるクラス/カテゴリ間の比率)を調整するために使用される手法です。これらの用語は、統計的サンプリング、調査設計方法論、機械学習の両方で使用されます。
オーバーサンプリングとアンダーサンプリングは正反対の、ほぼ同等の手法です。また、合成少数派オーバーサンプリング手法などのアルゴリズムを使用して人工的なデータポイントを作成するなど、より複雑なオーバーサンプリング手法もあります。[1] [2]
オーバーサンプリングとアンダーサンプリングの動機
オーバーサンプリングとアンダーサンプリングはどちらも、データにすでに存在する不均衡、または完全にランダムなサンプルを採取した場合に発生する可能性のある不均衡を補正するために、あるクラスから他のクラスよりも多くのサンプルを選択するというバイアスを導入することを伴います。データの不均衡には、次の種類があります。
- 1 つ以上の重要な予測変数におけるクラスの過少代表。性差別の問題に対処するために、コンピュータ ソフトウェアなどの特定の分野における給与に関する調査データがあるとします。ソフトウェア エンジニアのランダム サンプルでは女性の割合がかなり低いことがわかっており、これは勤続年数や現在の役職レベルなどの他の変数を調整するときに重要になります。ソフトウェア エンジニアの 20% だけが女性であると仮定します。つまり、男性は女性の 4 倍の頻度です。データを収集するための調査を設計する場合、最終的なサンプルでは男女が均等に表されるように、男性の 4 倍の女性を調査します。(層別サンプリングも参照してください。)
- 結果 (従属) 変数の 1 つのクラスが過小評価されています。大規模な臨床データセットから、どの患者が特定の病気 (糖尿病など) を発症する可能性が高いかを予測するとします。ただし、患者の 10% だけが病気を発症すると仮定します。大規模な既存のデータセットがあるとします。病気を発症した患者 1 人につき、病気を発症しなかった患者の 9 倍の数を選択できます。
オーバーサンプリングは、アンダーサンプリングよりも一般的に頻繁に使用されます。特に、詳細なデータが調査、インタビューなどによってまだ収集されていない場合によく使用されます。アンダーサンプリングはそれほど頻繁に使用されません。すでに収集されたデータの過剰は、「ビッグデータ」の時代にのみ問題となり、アンダーサンプリングを使用する理由は主に実用的であり、リソースコストに関連しています。具体的には、有効な統計的結論を導き出すには適度に大きなサンプルサイズが必要ですが、データを使用する前にデータをクリーニングする必要があります。クリーニングには通常、かなりの人的要素が関与し、データセットと分析の問題に固有のものであるため、時間と費用がかかります。例:
- ドメイン エキスパートは、変数内チェック (許容値、最大および最小の有効な値など) だけでなく、変数間チェックも含むデータセット固有の検証方法を提案します。たとえば、白血球数の分画の個々の要素は、それぞれが合計のパーセンテージであるため、すべて合計が 100 になる必要があります。
- 物語テキストに埋め込まれたデータ (インタビューの記録など) は、統計パッケージまたは機械学習パッケージが処理できる個別の変数に手動でコード化する必要があります。データが増えるほど、コード化の作業量も増えます。(コード化はソフトウェアで実行できる場合もありますが、多くの場合、誰かがカスタムの 1 回限りのプログラムを作成し、偽陽性と偽陰性の結果の観点からプログラムの出力の正確性をテストする必要があります。)
これらの理由から、通常は、統計的に妥当な信頼性で質問に答えるために必要なデータのみをクレンジングしますが (サンプル サイズを参照)、それ以上はクレンジングしません。
分類問題のためのオーバーサンプリング技術
ランダムオーバーサンプリング
ランダムオーバーサンプリングでは、少数クラスのいくつかのコピーをトレーニングデータに追加します。オーバーサンプリングは複数回(2倍、3倍、5倍、10倍など)実行できます。これは最も早く提案された方法の1つであり、堅牢性も証明されています。[3]少数クラスのすべてのサンプルを複製する代わりに、その一部をランダムに選択して置換することができます。
スモート
典型的な分類問題(ラベル付けされたトレーニング画像セットを与えられた画像セットを分類アルゴリズムを使用して分類する)で使用されるデータセットをオーバーサンプリングする方法はいくつかあります。最も一般的な手法は、SMOTE(Synthetic Minority Over-sampling Technique)として知られています。[4]ただし、この手法では、少数派クラスに属する確率が過大評価され、適切に調整されていないモデルが生成されることが示されています。[5]
この手法の仕組みを説明するために、データの特徴空間にs 個のサンプルとf個の特徴を持つトレーニング データを考えてみましょう。これらの特徴は、簡単にするために連続していることに注意してください。例として、分類用の鳥のデータセットを考えてみましょう。オーバーサンプリングする少数クラスの特徴空間は、くちばしの長さ、翼幅、重量 (すべて連続) などです。次にオーバーサンプリングするには、データセットからサンプルを取り出し、そのk 個の最近傍 (特徴空間内) を検討します。合成データ ポイントを作成するには、それらのk個の近傍の 1 つと現在のデータ ポイントの間のベクトルを取ります。このベクトルに、0 から 1 までの間の乱数xを掛けます。これを現在のデータ ポイントに追加して、新しい合成データ ポイントを作成します。
SMOTE法は提案されて以来、多くの修正と拡張が行われてきました。[6]
アダシン
適応合成サンプリングアプローチ、またはADASYNアルゴリズム[7]は、SMOTEの方法論に基づいており、分類境界の重要性を難しい少数派クラスに移しています。ADASYNは、学習の難易度に応じてさまざまな少数派クラスの例に加重分布を使用し、学習が難しい少数派クラスの例ではより多くの合成データが生成されます。
増強
データ分析におけるデータ拡張とは、既存のデータのわずかに変更されたコピーや、既存のデータから新しく作成された合成データを追加することで、データ量を増やすために使用される手法です。これは正規化子として機能し、機械学習モデルをトレーニングする際の過剰適合を減らすのに役立ちます。 [8] (参照:データ拡張)
分類問題のためのアンダーサンプリング技術
ランダムアンダーサンプリング
多数派クラスからランダムにサンプルを削除します(置換の有無は問いません)。これはデータセットの不均衡を軽減するために使用された最も初期の手法の1つですが、分類器の分散が増加する可能性があり、有用なサンプルや重要なサンプルが破棄される可能性が非常に高くなります。[6]
クラスタ
クラスター セントロイドは、サンプルのクラスターを K 平均アルゴリズムのクラスター セントロイドに置き換える方法です。クラスターの数は、アンダーサンプリングのレベルによって設定されます。
トメックリンク
Tomek リンクは、クラス間の不要な重複を削除します。この重複では、最小距離にある最近傍ペアがすべて同じクラスになるまで、多数派クラスのリンクが削除されます。Tomek リンクは次のように定義されます。インスタンス ペア (およびはとの間の距離)が与えられた場合、またはとなるインスタンスが存在しない場合に、そのペアはTomek リンクと呼ばれます。このように、2 つのインスタンスが Tomek リンクを形成する場合、これらのインスタンスのいずれかがノイズであるか、両方が境界付近にあります。したがって、Tomek リンクを使用してクラス間の重複をクリーンアップできます。重複する例を削除することで、トレーニング セット内に明確に定義されたクラスターを確立し、分類パフォーマンスを向上させることができます。
アンサンブル学習によるアンダーサンプリング
最近の研究では、アンダーサンプリングとアンサンブル学習を組み合わせることでより良い結果が得られることがわかっています。IFME:デジタルライブラリ環境におけるアンダーサンプリングによる複数の例による情報フィルタリングを参照してください。[9]
回帰問題に対するテクニック
サンプリング技術は主に分類タスクのために開発されてきたが、不均衡回帰の問題にも注目が集まっている。[10]アンダーサンプリング、オーバーサンプリング、SMOTEなど、一般的な戦略の適応が利用可能である。[11] [12]サンプリング技術は、時系列予測[13]や時空間予測[ 14]など、依存性指向データの数値予測の文脈でも研究されてきた。
追加のテクニック
オーバーサンプリングとアンダーサンプリングの技術をハイブリッド戦略に組み合わせることが可能です。一般的な例としては、SMOTEとTomekリンク、またはSMOTEと編集された最近傍法(ENN)などがあります。不均衡なデータセットで学習する追加の方法には、トレーニングインスタンスの重み付け、正の例と負の例に異なる誤分類コストの導入、ブートストラップなどがあります。[15]
実装
- scikit-learn Pythonライブラリと互換性のあるimbalanced-learnパッケージ[1]には、さまざまなデータ再サンプリング手法が実装されています。再サンプリング手法は、多数派クラスのアンダーサンプリング、少数派クラスのオーバーサンプリング、オーバーサンプリングとアンダーサンプリングの組み合わせ、アンサンブルサンプリングの4つの異なるカテゴリで実装されています。
- モデル選択関数を備えた85の少数オーバーサンプリング手法のPython実装は、smote-variants [2]パッケージで入手できます。
批判
[バイナリ分類] 設定における貧弱なモデルは、多くの場合、決定論的分類器の適合、再サンプリングまたは再重み付け方法の使用によるトレーニング データ内のクラス頻度のバランス、および精度などのスコアによるモデルの評価 (これらの組み合わせ) の結果です。... まれなクラスを含む少数のケースから魔法のようにより多くの情報を生成する再サンプリング手法はありません。
— 機械学習と保険数理実務における一貫したスコアリング関数のためのモデル比較およびキャリブレーション評価ユーザーガイド、Tobias Fissler、arXiv:2202.12780v3、Christian Lorentzen、Michael Mayer、2023
条件付き分布(ベイズ則による)をモデル化しようとする確率的機械学習モデルは、アンダーサンプリングやダウンサンプリングを適用してトレーニング中に自然分布を変更すると、誤った較正が行われる。 [16]
この点は、簡単な例で説明できます。予測変数がなく、 の比率が 0.01、 の比率が0.99 であると仮定します。学習するモデルは役に立たず、アンダーサンプリングまたはオーバーサンプリングによって修正する必要がありますか? 答えは「いいえ」です。クラスの不均衡は、それ自体ではまったく問題ではありません。
さらに、
- オーバーサンプリング
- アンダーサンプリング
- サンプルに重みを割り当てる
多クラス分類やコスト構造が非常に不均衡な状況では、専門家がこれを適用できる。これは、各クラスで「望ましい」最高のパフォーマンス(各クラスの精度と再現率として測定される可能性がある)を達成するために行われる。しかし、多クラス分類の最高のパフォーマンスや、精度と再現率の最良のトレードオフを見つけることは、本質的に多目的最適化問題である。これらの問題には通常、複数の比較できないパレート最適解があることはよく知られている。オーバーサンプリングやアンダーサンプリング、およびサンプルへの重み付けは、特定のパレート最適解を見つけるための暗黙的な方法である(推定確率の較正は犠牲になる)。オーバーサンプリングやダウンサンプリングよりも明示的な方法は、次の方法で パレート最適解を選択することである。
- 誤分類されたサンプルに明示的なコストを割り当て、コストに敏感な機械学習によって合計(スカラー化)コストを最小化する。[17]
- バイナリ分類設定で閾値調整を実行し、一定の検証精度と再現率を達成する[18] [19]
参照
- サンプリング(統計)
- データ拡張
- アンダーサンプリング(信号処理)
文学
- Kubat, M. (2000)。不均衡なトレーニング セットの呪いへの対処: 片側選択。第 14 回国際機械学習会議。
- Chawla, Nitesh V. (2010) 不均衡なデータセットのデータマイニング: 概要doi :10.1007/978-0-387-09823-4_45 In: Maimon, Oded; Rokach, Lior (Eds)データマイニングおよび知識発見ハンドブック、Springer ISBN 978-0-387-09823-4 (ページ 875–886)
- Lemaître、G. Nogueira、F. Aridas、Ch.K. (2017) Imbalanced-learn: 機械学習における不均衡なデータセットの呪いに立ち向かう Python ツールボックス、Journal of Machine Learning Research、vol. 18、no. 17、2017 年、pp. 1–5。
参考文献
- ^ ab "Scikit-learn-contrib/Imbalanced-learn". GitHub . 2021年10月25日.
- ^ ab "Analyticalmindsltd/Smote_variants". GitHub . 2021年10月26日.
- ^ Ling, Charles X.、Chenghui Li. 「ダイレクトマーケティングのためのデータマイニング:問題と解決策」Kdd . Vol. 98. 1998 年。
- ^ Chawla, NV; Bowyer, KW; Hall, LO; Kegelmeyer, WP (2002-06-01). 「SMOTE: 合成少数派オーバーサンプリング手法」. Journal of Artificial Intelligence Research . 16 : 321–357 . arXiv : 1106.1813 . doi :10.1613/jair.953. ISSN 1076-9757. S2CID 1554582.
- ^ van den Goorbergh, Ruben; van Smeden, Maarten; Timmerman, Dirk; Van Calster, Ben (2022-09-01). 「リスク予測モデルにおけるクラス不均衡補正の弊害:ロジスティック回帰を用いた図解とシミュレーション」Journal of the American Medical Informatics Association . 29 (9): 1525– 1534. doi :10.1093/jamia/ocac093. ISSN 1527-974X. PMC 9382395 . PMID 35686364.
- ^ ab Chawla, Nitesh V.; Herrera, Francisco; Garcia, Salvador ; Fernandez, Alberto (2018-04-20). 「不均衡なデータからの学習のための SMOTE: 15 周年を迎えての進歩と課題」。Journal of Artificial Intelligence Research。61 : 863–905。doi : 10.1613 /jair.1.11192。hdl : 10481 / 56411。ISSN 1076-9757。
- ^ He, Haibo; Bai, Yang; Garcia, Edwardo A.; Li, Shutao (2008 年 6 月)。「ADASYN: 不均衡学習のための適応合成サンプリング手法」( PDF)。2008 IEEE 国際ニューラル ネットワーク合同会議 (IEEE 計算知能世界会議)。pp. 1322– 1328。doi :10.1109 / IJCNN.2008.4633969。ISBN 978-1-4244-1820-6. S2CID 1438164 . 2022年12月5日閲覧。
- ^ Shorten, Connor; Khoshgoftaar, Taghi M. (2019). 「ディープラーニングのための画像データ拡張に関する調査」.シミュレーションにおける数学とコンピュータ. 6. springer: 60. doi : 10.1186/s40537-019-0197-0 .
- ^ Zhu, Mingzhu; Xu, Chao; Wu, Yi-Fang Brook (2013-07-22). IFME: デジタルライブラリ環境におけるアンダーサンプリングによる複数例による情報フィルタリング。ACM。pp . 107– 110。doi : 10.1145 /2467696.2467736。ISBN 9781450320771. S2CID 13279787。
- ^ Ribeiro, Rita P.; Moniz, Nuno (2020-09-01). 「不均衡回帰と極値予測」.機械学習. 109 (9): 1803– 1835. doi : 10.1007/s10994-020-05900-9 . ISSN 1573-0565. S2CID 222143074.
- ^ トルゴ、ルイス;ブランコ、ポーラ。リベイロ、リタ P.ファーリンガー、ベルンハルト(2015 年 6 月)。 「回帰のためのリサンプリング戦略」。エキスパートシステム。32 (3): 465–476 .土井:10.1111/exsy.12081。S2CID 205129966。
- ^ トルゴ、ルイス;リベイロ、リタ P.ファーリンガー、ベルンハルト。ブランコ、ポーラ (2013)。 「回帰のための SMOTE」。コヘイア、ルイス。レイス、ルイス・パウロ。カスカリョ、ホセ (編)。人工知能の進歩。コンピューターサイエンスの講義ノート。 Vol. 8154. ベルリン、ハイデルベルク: Springer。 pp. 378–389。土井:10.1007/978-3-642-40669-0_33。hdl : 10289/8518。ISBN 978-3-642-40669-0. S2CID 16253787。
- ^ Moniz, Nuno; Branco, Paula; Torgo, Luís (2017-05-01). 「不均衡な時系列予測のための再サンプリング戦略」. International Journal of Data Science and Analytics . 3 (3): 161– 181. doi : 10.1007/s41060-017-0044-3 . ISSN 2364-4168. S2CID 25975914.
- ^ マリアナ、オリベイラ;モニス、ヌーノ。トルゴ、ルイス。サントス・コスタ、ヴィトル(2021-09-01)。 「不均衡な時空間予測のための偏ったリサンプリング戦略」。データサイエンスと分析の国際ジャーナル。12 (3): 205–228。土井:10.1007/s41060-021-00256-2。ISSN 2364-4168。S2CID 210931099。
- ^ Haibo He; Garcia, EA (2009). 「不均衡なデータからの学習」. IEEE Transactions on Knowledge and Data Engineering . 21 (9): 1263– 1284. doi :10.1109/TKDE.2008.239. S2CID 206742563.
- ^ 「不均衡補正により、結果イベントのある患者とない患者を区別する能力が向上しないまま、大きな誤較正を伴うモデルが生まれました。不正確な確率推定により、治療に関する決定が十分な情報に基づいていないため、モデルの臨床的有用性が低下します。」、リスク予測モデルに対するクラス不均衡補正の害:ロジスティック回帰を使用した図解とシミュレーション、2022 年、Ruben van den Goorbergh、Maarten van Smeden、Dirk Timmerman、Ben Van Calster https://doi.org/10.1093/jamia/ocac093
- ^ 機械学習百科事典 (2011)。ドイツ: Springer。193 ページ、https://books.google.com/books?id=i8hQhp1a62UC&pg=PT193
- ^ Elor, Yotam; Averbuch-Elor, Hadar (2022). 「SMOTE するべきか、しないべきか?」arXiv : 2201.08528v3 [cs.LG].
- ^ Guillaume Lemaitre EuroSciPy 2023 - scikit-learn 分類器を最大限に活用する https://www.youtube.com/watch?v=6YnhoCfArQo
