データ前処理とは、分析前にデータを操作、フィルタリング、または拡張することを指し、データマイニングプロセスにおいて重要なステップとなることが多い。データ収集方法はしばしば管理が緩いため、範囲外の値、あり得ないデータの組み合わせ、欠損値などの問題が発生する。前処理とは、非構造化データを機械学習モデルに適した理解可能な表現に変換するプロセスである。このモデルのフェーズでは、ノイズに対処し、ノイズの多い元のデータセットからより良い結果を得る。このデータセットには、ある程度の欠損値も含まれている。

使用する前処理パイプラインは、下流の分析から得られる結論に大きな影響を与えることがよくあります。したがって、分析を実行する前にデータの表現と品質が必要です。 [ 1 ]無関係で冗長な情報の割合が高い場合、またはノイズが多く信頼性の低いデータが存在する場合、トレーニングフェーズでの知識発見はより困難になる可能性があります。データの準備とフィルタリングのステップには、かなりの処理時間が必要になる場合があります。データ前処理で使用される方法の例には、クリーニング、インスタンス選択、正規化、ワンホットエンコーディング、データ変換、特徴抽出、特徴選択などがあります。
データ前処理では、データクリーニングを使用して不要なデータを削除できます。これにより、ユーザーは前処理段階後に、データマイニングプロセスの後半でのデータ操作のために、より価値のある情報を含むデータセットを取得できます。データの破損や人為的ミスを修正するためにデータセットを編集することは、医療診断で一般的に使用される混同行列で見つかる真陽性、真陰性、偽陽性、偽陰性などの正確な定量化子を取得するために重要なステップです。ユーザーはデータファイルを結合し、前処理を使用してデータから不要なノイズをフィルタリングすることで、より高い精度を実現できます。ユーザーは、カンマ区切り値からデータフレームとしてデータをインポートできるpandasライブラリを備えたPythonプログラミングスクリプトを使用します。データフレームは、Excelでは難しいデータの操作に使用されます。Pandas (ソフトウェア)は、データ分析と操作を可能にする強力なツールであり、データの視覚化、統計操作などを大幅に容易にします。多くの人が、このようなタスクを実行するためにRプログラミング言語も使用しています。
ユーザーが既存のファイルを新しいファイルに変換する理由は数多くあります。データ前処理の側面には、欠損値の補完、数値量の集計、連続データのカテゴリへの変換(データビニング)などが含まれます。[ 2 ]主成分分析や特徴選択などのより高度な技術は統計式を使用しており、GPSトラッカーやモーションキャプチャデバイスによって記録された複雑なデータセットに適用されます。
セマンティックデータマイニングは、形式意味論などのドメイン知識をデータマイニングプロセスに組み込むことを特に目指すデータマイニングのサブセットです。ドメイン知識とは、データが処理された環境に関する知識のことです。ドメイン知識は、前処理フェーズで冗長なデータや矛盾したデータをフィルタリングするなど、データマイニングの多くの側面にプラスの影響を与えることができます。[ 3 ]ドメイン知識は制約としても機能します。これは、事前知識のセットとして機能し、検索に必要なスペースを削減し、データのガイドとして機能することによって実現されます。簡単に言えば、セマンティック前処理は、データの元の環境を使用してデータをより正確かつ効率的にフィルタリングすることを目指します。
既存の情報をより良く分析するために、より高度な技術で解決する必要のある複雑な問題が増えています。異なる数値を単一の値に集約する単純なスクリプトを作成する代わりに、意味論に基づくデータ前処理に焦点を当てるのが理にかなっています。[ 4 ]そのアイデアは、問題が何であるかをより高いレベルで説明する専用のオントロジーを構築することです。 [ 5 ]意味論的データマイニングと意味論的前処理に関して、オントロジーは意味論的知識とデータを概念化し、形式的に定義する方法です。Protégé (ソフトウェア)は、オントロジーを構築するための標準ツールです。一般的に、オントロジーの使用は、意味論的不一致から生じるデータ、アプリケーション、アルゴリズム、および結果の間のギャップを埋めます。その結果、意味論的曖昧さがデータシステムの有用性と効率に影響を与える可能性がある多くのアプリケーションで、オントロジーと組み合わせた意味論的データマイニングが使用されています。応用分野には、医療分野、言語処理、銀行業務[ 6 ]、さらには家庭教師[ 7 ]など、その他多数が含まれます。
セマンティックデータマイニングとオントロジーベースのアプローチを使用することにはさまざまな利点があります。前述のように、これらのツールは、データセットから望ましくないデータをフィルタリングすることで、前処理フェーズで役立ちます。さらに、適切に設計されたオントロジーに統合された適切に構造化された形式的セマンティクスは、機械が簡単に読み取って処理できる強力なデータを返すことができます。[ 8 ]この特に有用な例は、セマンティックデータ処理の医療用途にあります。たとえば、患者が医療上の緊急事態に陥り、病院に緊急搬送されているとします。救急隊員は、患者を助けるために投与する最適な薬を特定しようとしています。通常のデータ処理では、患者が最適な治療を受けていることを確認するために患者のすべての医療データを精査するには時間がかかりすぎ、患者の健康や生命を危険にさらす可能性があります。しかし、セマンティックに処理されたオントロジーを使用すると、救急隊員は患者の命を救うことができます。セマンティック推論器のようなツールは、患者の医療記録で使用されている自然言語を調べるだけで、患者の病歴に基づいて患者に投与するのに最適な薬を推論するためにオントロジーを使用できます。例えば、特定の癌やその他の疾患があるかどうかなどです。 [ 9 ]これにより、救急隊員は患者の病歴を気にすることなく、迅速かつ効率的に薬を検索できます。セマンティック推論器がすでにこのデータを分析し、解決策を見つけているからです。一般的に、これはセマンティックデータマイニングとオントロジーを使用することの驚異的な強みを示しています。セマンティックに前処理されたデータと、データ用に構築されたオントロジーがこれらの変数の多くをすでに考慮しているため、ユーザーが考慮する変数が少なくなり、ユーザー側でより迅速かつ効率的なデータ抽出が可能になります。ただし、このアプローチにはいくつかの欠点があります。つまり、比較的小さなデータセットであっても、大量の計算能力と複雑さを必要とします。[ 10 ]これにより、セマンティックデータ処理システムの構築と維持のコストが増加し、困難が増す可能性があります。データセットが既に適切に整理され、フォーマットされている場合は、この問題をある程度軽減できますが、それでもなお、標準的なデータ処理と比較すると複雑さは高くなります。
以下は、いくつかのプロセス、特にセマンティックデータマイニングとそのオントロジーにおける利用を組み合わせた簡単な図です。

この図は、データセットが2つの部分に分割される様子を示しています。1つはドメインの特性、つまりドメイン知識であり、もう1つは実際に取得されたデータです。ドメイン特性は処理され、ユーザーが理解できるドメイン知識となり、データに適用できるようになります。一方、データセットは処理され、保存されるため、ドメイン知識を適用して処理を継続できます。この適用によってオントロジーが形成されます。そして、このオントロジーを用いてデータを分析し、結果を処理することができます。
ファジー前処理は、複雑な問題を解決するためのより高度な手法です。ファジー前処理とファジーデータマイニングは、ファジー集合を利用します。これらのデータセットは、集合と、0と1で構成される集合のメンバーシップ関数という2つの要素から構成されます。ファジー前処理では、このファジーデータセットを使用して、数値を言語情報でグラウンディングします。その後、生データは自然言語に変換されます。最終的に、ファジーデータマイニングの目標は、不完全なデータベースなどの不正確な情報に対処することです。現在、ファジー前処理やその他のファジーベースのデータマイニング手法は、ニューラルネットワークや人工知能で頻繁に使用されています。[ 11 ]
{{cite web}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite conference}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite web}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite web}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)