ビジネスインテリジェンスにおいて、データ分類とは「一連のケースの連続性を判断するための何らかの方法を構築することであり、それぞれの新しいケースは事前に定義されたクラスの1つに割り当てられる必要があります。」[1]
データ分類はデータクラスタリングと密接な関係がありますが、データクラスタリングが記述的であるのに対し、データ分類は予測的です。[2] [3]本質的には、データ分類は既知の値を持つ変数を使用して、他の変数の未知または将来の値を予測することです。これは、ダイレクトマーケティング、保険詐欺の検出、医療診断などに使用できます。[3]
データ分類を行うための最初のステップは、カテゴリトレーニングに使用するデータセットをクラスタリングして、必要な数のカテゴリを作成することです。次に、分類器と呼ばれるアルゴリズムをカテゴリに適用して、各カテゴリの記述モデルを作成します。これらのモデルは、作成された分類システムで新しい項目を分類するために使用できます。[2]
効果
GolfarelliとRizziによれば、分類器の有効性の尺度は次の通りである。[2]
- 予測精度: 新しい観測のカテゴリをどの程度正確に予測できるか?
- 速度: 分類器を使用する場合の計算コストはどれくらいですか?
- 堅牢性:データ品質が低い場合、作成されたモデルはどの程度うまく機能しますか?
- スケーラビリティ: 分類器は大量のデータに対して効率的に機能しますか?
- 解釈可能性: 結果はユーザーにとって理解可能でしょうか?
データ分類の入力の典型的な例としては、人口統計、ライフスタイル情報、経済行動 などの変数が挙げられます。
課題
データ分類の作業には、いくつかの課題があります。特に、顧客やクライアントなどのカテゴリを使用するすべての人が、反復的なプロセスでモデリングを行う必要があることです。これは、顧客グループの特性の変化が気付かれず、既存のカテゴリが誰にも気付かれずに時代遅れにならないようにするためです。
これは、詐欺の検出が極めて重要な保険会社や銀行会社にとって特に重要です。これらの変化を監視し、カテゴリが変化、消滅、または新しいカテゴリが出現したときに警告する方法が開発および実装されていない場合、新しい詐欺パターンに気付かれない可能性があります。
参考文献
- ^ Mehanna, Fadi Samih Omar (2005). スケーラブルで効率的なデータ分類手法に向けて。ルイビル大学。p.v . 2024年1月10日閲覧。
- ^ abc Golfarelli, M. & Rizzi, S. (2009).データ ウェアハウス設計: 最新の原則と方法論。McGraw - Hill Osburn。ISBN 0-07-161039-1
- ^ ab Kimball, R. et al. (2008).データウェアハウスライフサイクルツールキット。(第2版) . Wiley. ISBN 0-471-25547-5
