データマイニングは、機械学習、統計学、データベースシステムの交点にある手法を用いて、膨大なデータセットからパターンを抽出し見つけるプロセスです。[ 1 ]データマイニングは、コンピュータサイエンスと統計学の学際的なサブフィールドであり、データセットから(インテリジェントな手法を用いて)情報を抽出し、その情報を理解可能な構造に変換してさらに利用することを全体的な目標としています。[ 1 ] [ 2 ] [ 3 ] [ 4 ]データマイニングは、「データベースにおける知識発見」プロセス、またはKDDの分析ステップです。[ 5 ]生の分析ステップの他に、データベースとデータ管理の側面、データの前処理、モデルと推論の考慮事項、興味深さの指標、複雑性の考慮事項、発見された構造の後処理、視覚化、およびオンライン更新も含まれます。[ 1 ]
「データマイニング」という用語は、その目的が大量のデータからパターンや知識を抽出することであり、データ自体を抽出(マイニング)することではないため、誤称である。[ 6 ]また、これは流行語でもあり[ 7 ]、大規模なデータや情報処理(収集、抽出、保管、分析、統計)のあらゆる形態、および人工知能(機械学習など)やビジネスインテリジェンスを含むコンピュータ意思決定支援システムのあらゆる応用によく適用される。多くの場合、より一般的な用語である(大規模)データ分析やアナリティクス、あるいは実際の手法を指す場合は人工知能や機械学習の方が適切である。
実際のデータマイニング作業は、大量のデータを半自動または自動で分析し、これまで知られていなかった興味深いパターン(データレコードのグループ(クラスタ分析)、異常なレコード(異常検出)、依存関係(アソシエーションルールマイニング、シーケンシャルパターンマイニング)など)を抽出することです。これには通常、空間インデックスなどのデータベース技術が使用されます。これらのパターンは入力データの要約と見なすことができ、さらなる分析や、例えば機械学習や予測分析に使用できます。例えば、データマイニングのステップでデータ内の複数のグループが特定され、それを使用して意思決定支援システムによるより正確な予測結果を得ることができます。データ収集、データ準備、結果の解釈と報告は、データマイニングのステップには含まれませんが、KDDプロセス全体の追加ステップとして含まれます。
データ分析とデータマイニングの違いは、データ分析はデータセット上でモデルや仮説を検証するために使用され、例えば、データの量に関係なくマーケティングキャンペーンの効果を分析するのに対し、データマイニングは機械学習や統計モデルを使用して大量のデータの中に隠されたパターンを明らかにする点にある。[ 8 ]
データマイニング、データフィッシング、データスヌーピングといった関連用語は、データマイニング手法を用いて、より大きなデータセットから、発見されたパターンの妥当性について信頼できる統計的推論を行うには小さすぎる(または小さすぎる可能性がある)部分をサンプリングすることを指します。ただし、これらの手法は、より大きなデータセットに対して検証するための新たな仮説を作成する際に利用できます。
1960年代、統計学者や経済学者は、事前の仮説なしにデータを分析するという悪しき慣習を指して、データフィッシングやデータドレッジングといった用語を使用していた。経済学者のマイケル・ラヴェルは、1983年にReview of Economic Studiesに掲載された記事の中で、「データマイニング」という用語を同様に批判的に使用した。[ 9 ] [ 10 ]ラヴェルは、この慣習は「実験」(肯定的)から「釣り」や「スヌーピング」(否定的)まで、さまざまな別名で偽装されていると指摘している。
データマイニングという用語は、1990 年頃にデータベース コミュニティで登場し、概ね肯定的な意味合いで使われていました。1980 年代には短期間、「データベース マイニング」™ というフレーズが使われていましたが、サンディエゴに拠点を置く HNC 社が自社のデータベース マイニング ワークステーションを売り込むために商標登録していたため[ 11 ]、研究者たちはデータ マイニングに目を向けました。その他に使われている用語には、データ考古学、情報収集、情報発見、知識抽出などがあります。グレゴリー ピアテツキー シャピロは、同じテーマの最初のワークショップ (KDD-1989) [ 12 ]で「データベースにおける知識発見」という用語を作り出し、この用語はAIや機械学習のコミュニティでより普及しました。しかし、ビジネスや報道のコミュニティではデータ マイニングという用語の方が普及しました。[ 13 ]現在、データ マイニングと知識発見という用語は同義語として使われています。
データからパターンを手動で抽出することは何世紀にもわたって行われてきました。データのパターンを識別する初期の方法には、ベイズの定理(1700年代)や回帰分析(1800年代)などがあります。[ 14 ]コンピュータ技術の普及、遍在、および能力の向上により、データの収集、保存、および操作能力が劇的に向上しました。データセットのサイズと複雑さが増すにつれて、直接的な「ハンズオン」データ分析は、コンピュータ科学、特に機械学習の分野における他の発見(ニューラルネットワーク、クラスタ分析、遺伝的アルゴリズム(1950年代)、決定木と決定ルール(1960年代)、サポートベクターマシン(1990年代)など)によって支援された、間接的で自動化されたデータ処理によってますます強化されてきました。データマイニングは、大規模なデータセットに隠されたパターンを明らかにする目的で、これらの方法を適用するプロセスです。[ 15 ]これは、応用統計学や人工知能(通常は数学的な背景を提供する)とデータベース管理との間のギャップを埋めるものであり、データベースにおけるデータの保存方法やインデックス付け方法を利用して、実際の学習アルゴリズムや発見アルゴリズムをより効率的に実行することで、こうした手法をますます大規模なデータセットに適用できるようにする。
データベースにおける知識発見(KDD)プロセスは、一般的に以下の段階で定義されます。
しかし、このテーマには多くのバリエーションが存在し、例えば、データマイニングのための業界横断型標準プロセス(CRISP-DM)では、6つのフェーズが定義されています。
または、(1)前処理、(2)データマイニング、(3)結果検証などの簡略化されたプロセス。
2002年、2004年、2007年、2014年に実施された調査によると、CRISP-DM手法はデータマイナーが使用する主要な手法であることが示されています。[ 16 ] [ 17 ] [ 18 ] [ 19 ]
これらの調査で挙げられた他のデータマイニング標準はSEMMAのみでした。しかし、CRISP-DMを使用していると回答した人は3~4倍に上りました。複数の研究者チームがデータマイニングプロセスモデルのレビューを発表しており[ 20 ] 、AzevedoとSantosは2008年にCRISP-DMとSEMMAの比較を行いました[ 21 ]。
データマイニングアルゴリズムを使用する前に、対象データセットを組み立てる必要があります。データマイニングはデータに実際に存在するパターンしか明らかにできないため、対象データセットはこれらのパターンを包含するのに十分な大きさであると同時に、許容可能な時間制限内でマイニングできるほど簡潔である必要があります。データの一般的なソースは、データマートまたはデータウェアハウスです。データマイニングの前に多変量データセットを分析するには、前処理が不可欠です。次に、対象セットをクリーニングします。データクリーニングでは、ノイズを含む観測値と欠損データを含む観測値を削除します。
データマイニングには、6つの一般的なタスククラスが含まれます。[ 5 ]

Data mining can unintentionally be misused, producing results that appear to be significant but which do not actually predict future behavior and cannot be reproduced on a new sample of data, therefore bearing little use. This is sometimes caused by investigating too many hypotheses and not performing proper statistical hypothesis testing. A simple version of this problem in machine learning is known as overfitting, but the same problem can arise at different phases of the process and thus a train/test split—when applicable at all—may not be sufficient to prevent this from happening.[22]
The final step of knowledge discovery from data is to verify that the patterns produced by the data mining algorithms occur in the wider data set. Not all patterns found by the algorithms are necessarily valid. It is common for data mining algorithms to find patterns in the training set which are not present in the general data set. This is called overfitting. To overcome this, the evaluation uses a test set of data on which the data mining algorithm was not trained. The learned patterns are applied to this test set, and the resulting output is compared to the desired output. For example, a data mining algorithm trying to distinguish "spam" from "legitimate" e-mails would be trained on a training set of sample e-mails. Once trained, the learned patterns would be applied to the test set of e-mails on which it had not been trained. The accuracy of the patterns can then be measured from how many e-mails they correctly classify. Several statistical methods may be used to evaluate the algorithm, such as ROC curves.
学習したパターンが望ましい基準を満たさない場合は、前処理とデータマイニングの手順を再評価し、修正する必要があります。学習したパターンが望ましい基準を満たしている場合は、最終段階としてそれらを解釈し、知識へと変換します。
この分野における最高峰の専門機関は、Association for Computing Machinery (ACM) の知識発見およびデータマイニングに関する特別利益団体 (SIGKDD)です。[ 23 ] [ 24 ]この ACM SIG は 1989 年以来、毎年国際会議を開催し、その議事録を出版しています。[ 25 ]また、1999 年以来、「SIGKDD Explorations」というタイトルの隔年学術誌を出版しています。[ 26 ]
データマイニングに関するコンピュータサイエンスの会議には、以下のようなものがあります。
データマイニングに関するトピックは、ICDE会議、SIGMOD会議、国際超大規模データベース会議など、多くのデータ管理/データベース関連の会議でも取り上げられています。
データマイニングプロセスの標準を定めるための取り組みはいくつか行われており、例えば1999年の欧州産業横断型データマイニング標準プロセス(CRISP-DM 1.0)や2004年のJavaデータマイニング標準(JDM 1.0)などがある。これらのプロセスの後継となる標準(CRISP-DM 2.0およびJDM 2.0)の開発は2006年に活発に行われたが、それ以降停滞している。JDM 2.0は最終草案に至ることなく撤回された。
抽出されたモデルを交換する場合、特に予測分析で使用する場合、主要な標準は予測モデルマークアップ言語(PMML)です。これは、データマイニンググループ(DMG)によって開発されたXMLベースの言語で、多くのデータマイニングアプリケーションで交換フォーマットとしてサポートされています。名前が示すように、これは予測モデルのみを対象としており、ビジネスアプリケーションにとって非常に重要な特定のデータマイニングタスクです。ただし、(たとえば)部分空間クラスタリングをカバーするための拡張がDMGとは独立して提案されています。[ 27 ]
データマイニングは、デジタルデータが利用可能なあらゆる分野で活用されています。データマイニングの顕著な例は、ビジネス、医療、科学、金融、建設、監視など、幅広い分野で見られます。
「データマイニング」という用語自体には倫理的な意味合いはないかもしれないが、ユーザーの行動(倫理的なものもそうでないものも)に関連する情報のマイニングと関連付けられることが多い。 [ 28 ]
データマイニングの使用方法によっては、場合によってはプライバシー、合法性、倫理に関する疑問が生じる可能性があります。[ 29 ]特に、Total Information Awareness ProgramやADVISEのように、国家安全保障や法執行目的で政府や商業データセットをデータマイニングすることは、プライバシーに関する懸念を引き起こしています。[ 30 ] [ 31 ]
データマイニングでは、機密性やプライバシーの義務を損なう情報やパターンを明らかにするデータ準備が必要です。その一般的な方法は、データ集約です。データ集約とは、分析を容易にする形で(さまざまなソースから)データを結合することです(ただし、個人レベルのプライベートなデータの識別が推測可能になったり、明らかになったりする可能性もあります)。[ 32 ]データがコンパイルされた後、データマイナーや新しくコンパイルされたデータセットにアクセスできる人が特定の個人を識別できるようになると、特にデータが元々匿名であった場合に、個人のプライバシーに対する脅威が生じます。[ 33 ]
データは匿名化されるように変更されることもあり、個人が容易に特定されないようにすることができる。[ 32 ]しかし、「匿名化された」データセットであっても、個人を特定できるほどの情報が含まれている可能性があり、 AOLが誤って公開した検索履歴に基づいてジャーナリストが複数の個人を見つけることができた事例がある。[ 34 ]
提供者につながる個人識別情報の意図しない開示は、公正情報慣行に違反します。この軽率な行為は、該当する個人に金銭的、精神的、または身体的な損害を与える可能性があります。プライバシー侵害の一例として、ウォルグリーンズの顧客は2011年に同社を提訴しました。同社は処方箋情報をデータマイニング会社に販売し、その会社がさらに製薬会社にデータを提供したためです。[ 35 ]
ヨーロッパには比較的強力なプライバシー法があり、消費者の権利をさらに強化するための取り組みが進められています。しかし、 1998年から2000年にかけて策定された米欧セーフハーバー原則は、現在、ヨーロッパのユーザーを米国企業によるプライバシー侵害に事実上さらしています。エドワード・スノーデンによる世界的な監視の暴露の結果、特にデータが国家安全保障局に完全に公開されることから、この協定を破棄する議論が活発化しており、米国との合意に達する試みは失敗に終わっています。[ 36 ]
特に英国では、企業がデータマイニングを利用して特定の顧客グループをターゲットにし、不当に高い価格を支払わせる事例が発生している。これらのグループは、デジタルマーケットプレイスでどのように搾取される可能性があるかに精通していない、社会経済的地位の低い人々である傾向がある。[ 37 ]
米国では、プライバシーに関する懸念は、米国議会が医療保険の携行性と説明責任に関する法律(HIPAA)などの規制を制定することによって対処されてきました。HIPAAは、個人が提供する情報とその現在および将来の使用目的について「インフォームド・コンセント」を与えることを義務付けています。Biotech Business Weekの記事によると、「実際には、HIPAAは研究分野における長年の規制よりも大きな保護を提供するものではないかもしれない」とAAHCは述べています。さらに重要なのは、インフォームド・コンセントによる保護という規則の目標が、一般の人々にとって理解しがたいレベルに近づいていることです。[ 38 ]これは、データ集計およびマイニングの実践においてデータの匿名性が必要であることを強調しています。
米国におけるHIPAAやFERPAといった情報プライバシー関連法は、それぞれの法律が対象とする特定の分野にのみ適用されます。米国企業の大多数が行っているデータマイニングは、いかなる法律によっても規制されていません。
データセットに著作権がない場合でも、欧州連合はデータベース権を認めているため、データマイニングはデータベース指令によって保護されている知的財産権者の権利の対象となります。欧州の著作権データベース法では、著作権者の許可なしに著作権保護対象作品(ウェブマイニングなど)をマイニングすることは、2019年デジタル単一市場における著作権指令の第3条および第4条で認められています。第3条では科学研究のための特定のTDM例外が規定されていますが、第4条で規定されているより一般的な例外は、著作権者がオプトアウトしていない場合にのみ適用されます。
欧州委員会は2013年に「欧州のためのライセンス」というタイトルでテキストマイニングとデータマイニングに関する利害関係者の議論を促進した。[ 39 ]制限や例外ではなくライセンスなどのこの法的問題の解決策に焦点を当てたため、大学、研究者、図書館、市民社会団体、オープンアクセス出版社の代表者が2013年5月に利害関係者対話から離脱した。[ 40 ]
ハーグリーブス報告書の勧告に基づき、英国政府は2014年に著作権法を改正し、コンテンツマイニングを制限および例外として認めるに至った。[ 41 ]英国は、2009年にデータマイニングの例外を導入した日本に次いで世界で2番目にそうした国となった。しかし、情報社会指令(2001年)の制限により、英国の例外は非営利目的でのコンテンツマイニングのみを認めている。また、英国の著作権法では、この規定を契約条件で覆すことも認められていない。
2020年以降、スイスもスイス著作権法第24条d項で定められた一定の条件下で研究分野でのデータマイニングを許可することで、データマイニングを規制している。この新しい条項は2020年4月1日に発効した。[ 42 ]
米国の著作権法、特にフェアユースの規定は、米国およびイスラエル、台湾、韓国などのフェアユースが認められている他の国々において、コンテンツマイニングの合法性を支持しています。コンテンツマイニングは変容的であり、つまり元の著作物を置き換えるものではないため、フェアユースの下で合法とみなされています。例えば、Google Bookの和解の一環として、この訴訟を担当した裁判官は、著作権保護期間中の書籍のGoogleのデジタル化プロジェクトは、デジタル化プロジェクトが示した変容的な利用(テキストマイニングやデータマイニングなど)を理由の一つとして、合法であると判決を下しました。[ 43 ]
以下のアプリケーションは、フリー/オープンソースライセンスで提供されています。アプリケーションのソースコードも公開されています。
以下のアプリケーションは、独自のライセンスに基づいて提供されています。
データから情報を抽出する方法(データ分析とは異なる方法)の詳細については、以下を参照してください。
したがって、データマイニングは「データからの知識マイニング」と名付けるべきだったが、残念ながら少し長すぎる。
年 10 月 6 日、
欧州司法裁判所は
、現在実施されているセーフ ハーバー (即時発効) を無効にする判決を下した。