CRISP-DM [1]として知られるデータマイニングの業界標準プロセスは、データマイニングの専門家が使用する一般的なアプローチを記述したオープン標準プロセスモデルです。これは最も広く使用されている分析モデルです。[2]
2015年にIBMは、CRISP-DMを改良・拡張した、 Analytics Solutions Unified Method for Data Mining/Predictive Analytics [3] [4] (ASUM-DMとも呼ばれる)という新しい方法論をリリースしました。
歴史
CRISP-DM は 1996 年に構想され、 1997 年にESPRIT資金提供イニシアチブの下で欧州連合プロジェクトになりました。このプロジェクトは、Integral Solutions Ltd (ISL)、Teradata、Daimler AG、NCR Corporation、保険会社 OHRA の 5 社によって主導されました。
このコアコンソーシアムは、プロジェクトにさまざまな経験をもたらしました。ISL は後に買収され、SPSSに統合されました。コンピュータ大手の NCR Corporation は、Teradataデータウェアハウスと独自のデータマイニングソフトウェアを開発しました。ダイムラーベンツには、重要なデータマイニングチームがありました。OHRA は、データマイニングの潜在的な使用法を模索し始めていました。
この方法論の最初のバージョンは、1999年3月にブリュッセルで開催された第4回CRISP-DM SIGワークショップで発表され、[5]その年の後半にステップバイステップのデータマイニングガイドとして出版されました。[6]
2006年から2008年にかけて、CRISP-DM 2.0 SIGが結成され、CRISP-DMプロセスモデルの更新について議論が行われました。[7]これらの取り組みの現在の状況は不明です。ただし、レビューで引用されている元のcrisp-dm.org Webサイト[8] [9]とCRISP-DM 2.0 SIG Webサイトはどちらも現在はアクティブではありません。[7]
IBM以外のデータマイニング専門家の多くはCRISP-DMを使用していますが、[10] [11] [12] IBMは現在CRISP-DMプロセスモデルを使用している主な企業です。IBMは古いCRISP-DMドキュメントの一部をダウンロードできるようにしており、それをSPSS Modeler製品に組み込んでいます。[6]
現在の研究に基づくと、CRISP-DMは、データマイニング業界の既存の問題を解決するさまざまな利点があるため、最も広く使用されているデータマイニングモデルの形式です。このモデルの欠点のいくつかは、プロジェクト管理活動を実行しないことです。CRISP-DMの成功は、業界、ツール、アプリケーションに中立であるという事実に大きく起因しています。[13]
主なフェーズ

CRISP-DMはデータマイニングのプロセスを6つの主要なフェーズに分割します。[14]
- ビジネス理解
- データの理解
- データ準備
- モデリング
- 評価
- 展開
フェーズの順序は厳密ではなく、通常は異なるフェーズ間を行ったり来たりする必要があります。プロセス図の矢印は、フェーズ間の最も重要で頻繁な依存関係を示します。図の外側の円は、データ マイニング自体の循環的な性質を表しています。データ マイニング プロセスは、ソリューションが展開された後も継続されます。プロセス中に学んだ教訓によって、新しい、多くの場合より焦点を絞ったビジネス上の質問が生まれ、その後のデータ マイニング プロセスは以前のプロセスの経験から恩恵を受けることになります。
世論調査と代替プロセスフレームワーク
同じウェブサイト(KDNuggets)で2002年、2004年、2007年、2014年に実施された世論調査では、この調査に回答することを決めた業界のデータマイナーが使用した主な方法論であったことが示されています。[10] [11] [12] [15]これらの世論調査で名前が挙がった唯一の他のデータマイニング手法はSEMMAでした。しかし、SAS Instituteは、SEMMAはデータマイニング方法論ではなく、「SAS Enterprise Minerの機能ツールセットの論理的な編成」であると明確に述べています。 2009年のデータマイニングプロセスモデルのレビューと批評では、CRISP-DMは「データマイニングと知識発見プロジェクトを開発するための事実上の標準」と呼ばれました。[16] CRISP-DMとデータマイニングプロセスモデルの他のレビューには、KurganとMusilekの2006年のレビュー、[8]およびAzevedoとSantosの2008年のCRISP-DMとSEMMAの比較があります。[9]方法論を更新する取り組みは2006年に始まりましたが、2015年6月現在、新しいバージョンはリリースされておらず、責任のある「特別利益団体」(SIG)とウェブサイトは長い間姿を消しています(CRISP-DMの歴史を参照)。
2024年にハーバード・ビジネス・レビューは、分析、データサイエンス、データマイニングプロジェクト全般ではなく、ビジネス担当者との関連性を高め、特に機械学習プロジェクトに特化したフレームワークであるbizMLを更新して公開しました。[17]
参考文献
- ^ Shearer C.、「CRISP-DMモデル:データマイニングの新しい青写真」、J Data Warehousing (2000); 5:13—22。
- ^ データマイニングプロセスについてIT部門が知っておくべきこと Forbes、2015年7月29日発行、2018年6月24日閲覧
- ^ ASUM-DM をご覧になりましたか?、Jason Haffar 著、2015 年 10 月 16 日、SPSS Predictive Analytics、IBM、Wayback Machineで 2016 年 3 月 8 日にアーカイブ
- ^ Analytics Solutions Unified Method - Agile 原則による実装 IBM 発行、2016 年 3 月 1 日、2018 年 10 月 5 日閲覧
- ^ Pete Chapman (1999); CRISP-DM ユーザー ガイド。
- ^ ab Pete Chapman、Julian Clinton、Randy Kerber、Thomas Khabaza、Thomas Reinartz、Colin Shearer、およびRüdiger Wirth (2000); The CRISP-DM User Guide (semantic scholarのエントリ、PDFへのリンクを含む)、(高解像度のグラフィックを含むPDFバージョンは2020年9月12日にWayback Machineにアーカイブされています)。
- ^ ab Colin Shearer (2006); 最初の CRISP-DM 2.0 ワークショップが開催されました
- ^ ab Lukasz Kurgan および Petr Musilek (2006); 知識発見およびデータマイニングプロセスモデルの調査。The Knowledge Engineering Review。第 21 巻第 1 号、2006 年 3 月、pp 1–24、Cambridge University Press、ニューヨーク、NY、USA doi: 10.1017/S0269888906000737。
- ^ ab Azevedo, A. および Santos, MF (2008); KDD、SEMMA、CRISP-DM: 並列概要。IADIS ヨーロッパデータマイニング会議 2008 の議事録、pp 182–185。
- ^ ab グレゴリー・ピアテツキー=シャピロ(2002);KDnuggets 調査方法
- ^ ab グレゴリー・ピアテツキー=シャピロ(2004);KDnuggets 調査方法
- ^ ab グレゴリー・ピアテツキー=シャピロ(2007);KDnuggets 調査方法
- ^ Mariscal, G., Marban, O., Fernandez, C. (2010). 「データマイニングと知識発見プロセスのモデルと方法論の調査」.ナレッジエンジニアリングレビュー. 25 (2): 137–166. doi :10.1017/S0269888910000032. S2CID 31359633.
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ Harper , Gavin; Stephen D. Pickett (2006 年 8 月)。「HTS データのマイニング方法」。Drug Discovery Today。11 ( 15–16): 694–699。doi :10.1016/j.drudis.2006.06.006。PMID 16846796 。
- ^ グレゴリー・ピアテツキー=シャピロ(2014);KDnuggets方法論調査
- ^ マルティネス・プルームド、フェルナンド;コントレラス・オチャンド、リディア;フェリ、セザール。フラッハ、ピーター。ヘルナンデス・オラロ、ホセ。カル、ミーリス。ラシシュ、ニコラ。ラミレス=キンタナ、マリア・ホセ(2017年9月19日)。 「CASP-DM: データマイニングのためのコンテキスト認識型標準プロセス」。arXiv : 1709.09003 [cs.DB]。
- ^ エリック・シーゲル (2024); 機械学習プロジェクトをアイデアから実行まで
