データプロファイリングとは、既存の情報源(データベースやファイルなど)から入手可能なデータを調べ、そのデータに関する統計情報や要約情報を収集するプロセスです。[1]これらの統計情報の目的は、次のとおりです。
- 既存のデータが他の目的に簡単に使用できるかどうかを調べる
- キーワードや説明でタグ付けしたり、カテゴリに割り当てたりすることで、データを検索する機能を向上させます。
- データが特定の基準やパターンに準拠しているかどうかなど、データの品質を評価する[2]
- 結合の課題を含め、新しいアプリケーションにデータを統合する際のリスクを評価する
- 値のパターンと分布、キー候補、外部キー候補、機能的依存関係など、ソースデータベースのメタデータを検出します。
- 既知のメタデータがソースデータベースの実際の値を正確に表しているかどうかを評価する
- データ集約型プロジェクトの早い段階でデータの課題を把握することで、プロジェクトの後半で予期せぬ事態が発生するのを回避できます。プロジェクトの後半でデータの問題が見つかると、遅延やコスト超過につながる可能性があります。
- 主要データが必要なマスター データ管理や、データ品質を向上させるデータ ガバナンスなどの用途で、すべてのデータをエンタープライズ ビューで表示します。
導入
データプロファイリングとは、データウェアハウスで使用するために、データの構造、内容、関係、導出ルールを明らかにするために情報を分析することを指します。[3]プロファイリングは、異常を理解してデータ品質を評価するだけでなく、エンタープライズメタデータを発見、登録、評価するのにも役立ちます。[4] [5]分析の結果は、候補となるソースシステムの適合性を判断するために使用され、通常は早期のゴー/ノーゴー決定の根拠となり、また、後のソリューション設計のための問題を特定するためにも使用されます。[3]
データプロファイリングの実施方法
データプロファイリングでは、最小値、最大値、平均値、最頻値、パーセンタイル、標準偏差、頻度、変動、カウントや合計などの集計などの記述統計手法と、データプロファイリング中に取得されるデータ型、長さ、離散値、一意性、NULL値の発生、一般的な文字列パターン、抽象型の認識などの追加のメタデータ情報を利用します。[4] [6] [7]メタデータを使用して、不正な値、スペルミス、欠損値、さまざまな値表現、重複などの問題を発見できます。
異なる構造レベルに対して異なる分析が実行されます。たとえば、単一の列を個別にプロファイルして、各列のさまざまな値、タイプ、および使用の頻度分布を理解することができます。埋め込まれた値の依存関係は、列間分析で明らかにすることができます。最後に、エンティティ間の外部キー関係を表す可能性のある重複する値セットを、テーブル間分析で調査することができます。[4]
通常、データプロファイリングには、プロセスを容易にするために専用のツールが使用されます。[3] [4] [6] [7] [8] [9]単一列から単一テーブル、さらにはテーブル間の構造プロファイリングに移行すると、計算の複雑さが増します。そのため、パフォーマンスはプロファイリングツールの評価基準となります。[5]
データプロファイリングはいつ実行されますか?
Kimball 氏によると、[3]データ プロファイリングは、データ ウェアハウスの開発プロセス全体を通じて、さまざまな強度で複数回実行されます。候補となるソース システムが特定され、DW/BI のビジネス要件が満たされたら、すぐに簡単なプロファイリング評価を実施する必要があります。この初期分析の目的は、適切な詳細レベルで正しいデータが利用可能かどうか、および異常が後で処理できるかどうかを早い段階で明らかにすることです。そうでない場合は、プロジェクトを終了する場合があります。[3]
さらに、データを次元モデルに変換するために何が必要かを評価するために、次元モデリングプロセスの前に、より詳細なプロファイリングが行われます。詳細なプロファイリングは、ETLシステム設計プロセスにまで及び、抽出する適切なデータとデータセットに適用するフィルターを決定します。[3]
さらに、データがステージングやデータ マートなどにロードされた後、データ ウェアハウス開発プロセスでデータ プロファイリングが実行されることもあります。これらの段階でデータを実行すると、データのクリーニングと変換が正しく実行され、要件に準拠していることを確認できます。
メリットと例
データプロファイリングの利点は、データ品質の向上、主要プロジェクトの実装サイクルの短縮、ユーザーのデータ理解の向上です。[9]データ自体に埋め込まれたビジネス知識を発見することは、データプロファイリングから得られる重要な利点の1つです。[5]データプロファイリングは、企業データベースのデータ精度を向上させる最も効果的な技術の1つです。[9]
参照
参考文献
- ^ Johnson, Theodore (2009). 「データプロファイリング」 Springer, Heidelberg (編)データベースシステム百科事典。
- ^ Woodall, Philip; Oberhofer, Martin; Borek, Alexander (2014). 「データ品質評価および改善方法の分類」International Journal of Information Quality . 3 (4): 298. doi :10.1504/ijiq.2014.068656.
- ^ abcdef Kimball, Ralph; et al. (2008). The Data Warehouse Lifecycle Toolkit (第 2 版). Wiley. pp. 376. ISBN 9780470149775。
- ^ abcd ロシン、デビッド(2009)。マスターデータ管理。モルガンカウフマン。pp.94-96。ISBN 9780123742254。
- ^ abc ロシン、デビッド(2003)。ビジネスインテリジェンス:賢明なマネージャーのためのガイド、新興ITへの対応。モルガン・カウフマン。pp. 110–111。ISBN 9781558609167。
- ^ ab Rahm , Erhard; Hai Do, Hong (2000 年 12 月)。「データクリーニング: 問題と現在のアプローチ」。データエンジニアリング技術委員会紀要。23 (4)。IEEE コンピュータ協会。
- ^ ab Singh, Ranjit; Singh, Kawaljeet; et al. (2010 年 5 月). 「データウェアハウスにおけるデータ品質問題の原因の記述的分類」. IJCSI International Journal of Computer Science 号. 2. 7 (3).
- ^ Kimball, Ralph (2004)。「Kimball 設計のヒント #59: データ プロファイリングの驚くべき価値」(PDF)。Kimball グループ。
- ^ abc Olson, Jack E. (2003).データ品質: 正確さの側面. Morgan Kaufmann. pp. 140–142.
