Loading article…
データ抽出とは、 (通常は非構造化または構造化が不十分な)データ ソースからデータを取得し、さらにデータを処理したり、データを保存したり(データ移行)する行為またはプロセスです。したがって、中間抽出システムへのインポートの後には、通常、データ変換が行われ、場合によってはメタデータが追加されてから、データワークフローの別のステージにエクスポートされます。
通常、データ抽出という用語は、(実験)データが測定デバイスや記録デバイスなどの一次ソースからコンピューターに最初にインポートされるときに適用されます。今日の電子機器には通常、電気コネクタ( USBなど)があり、それを介して「生データ」をパソコンにストリーミングできます。
データソース
一般的な非構造化データ ソースには、Web ページ、電子メール、ドキュメント、PDF、ソーシャル メディア、スキャンされたテキスト、メインフレーム レポート、スプール ファイル、マルチメディア ファイルなどがあります。これらの非構造化ソースからデータを抽出することは、かなりの技術的課題になっています。歴史的に、データ抽出は物理的なハードウェア形式の変更に対処する必要がありましたが、現在のデータ抽出の大部分は、これらの非構造化データ ソースから、およびさまざまなソフトウェア形式からデータを抽出することに取り組んでいます。Web からのデータ抽出のこの成長プロセスは、「Web データ抽出」または「Web スクレイピング」と呼ばれています。
堂々とした構造
非構造化データに構造を追加する行為にはさまざまな形がある
- 正規表現などのテキストパターン マッチングを使用して、レポート内のレコードやヘッダーとフッターからの関連データなどの小規模または大規模な構造を識別します。
- 表ベースのアプローチを使用して、限定されたドメイン内の共通セクションを特定します。たとえば、電子メールで送信された履歴書では、スキル、以前の職務経験、資格などを、一般的に使用される見出しの標準セット (言語によって異なります) を使用して特定します。たとえば、教育は、教育/資格/コースの下にある可能性があります。
- テキスト分析を使用してテキストを理解し、他の情報にリンクする
参照
- データマイニング、統計、データベース知識、機械学習を使用して大規模なデータセット内のパターンを発見する
- データ検索、データベース管理システムからデータを取得すること。多くの場合、一連の基準を持つクエリを使用する。
- 抽出、変換、ロード(ETL)、1 つ以上のソースからデータをコピーし、ソース システムでデータを変換し、宛先システムにコピーする手順
- 情報抽出、非構造化または半構造化機械可読データ[1]から構造化情報を自動的に抽出すること、例えば自然言語処理を使用して画像、音声、または文書からコンテンツを抽出すること
参考文献
- ^ Hartley, Miranda. 「AIを使用してPDFから非構造化データを抽出する:利点と考慮事項」。Evolution AI 。 2024年11月20日閲覧。
