
非構造化データ(または非構造化情報)とは、事前に定義されたデータモデルを持たない、あるいは事前に定義された方法で整理されていない情報のことです。非構造化情報は通常、テキストが中心ですが、日付、数値、事実などのデータも含まれる場合があります。そのため、データベースにフィールド形式で保存されたデータや、文書に注釈(意味タグ付け)されたデータと比べて、従来のプログラムでは理解しにくい不規則性や曖昧さが生じます。
1998年、メリルリンチは「非構造化データは組織内で見つかるデータの大部分を占めており、推定では80%にも達する」と述べた。[ 1 ]この数字の出所は不明だが、それでも一部では受け入れられている。[ 2 ]他の情報源では、非構造化データの割合が同様またはそれ以上であると報告されている。[ 3 ] [ 4 ] [ 5 ]
2012年、International Data Corporation(IDC)とDell EMCは、データ量が2020年までに40ゼタバイトに増加し、2010年初頭から50倍になると予測した。 [ 6 ]さらに最近では、IDCとSeagateは、世界のデータスフィアが2025年までに163ゼタバイトに増加し[ 7 ]、その大部分が非構造化データになると予測している。Computer World誌は、非構造化情報が組織内の全データの70~80%以上を占める可能性があると述べている。
ビジネスインテリジェンスに関する初期の研究は、数値データではなく、非構造化テキストデータに焦点を当てていました。[ 8 ] 1958年にはすでに、HP Luhnのようなコンピュータサイエンスの研究者は、非構造化テキストの抽出と分類に特に関心を寄せていました。[ 8 ]しかし、技術が研究の関心に追いついたのは、20世紀に入ってからのことです。2004年、SAS Instituteは、特異値分解(SVD)を使用して超次元テキスト空間をより小さな次元に縮小し、機械分析を大幅に効率化するSAS Text Minerを開発しました。 [ 9 ]機械によるテキスト分析によってもたらされた数学的および技術的な進歩は、多くの企業がアプリケーションを研究するきっかけとなり、感情分析、顧客の声のマイニング、コールセンターの最適化などの分野の発展につながりました。[ 10 ] 2000年代後半のビッグデータの出現は、予測分析や根本原因分析などの現代分野における非構造化データ分析のアプリケーションへの関心を高めました。[ 11 ]
この用語は、いくつかの理由から不正確である。
データマイニング、自然言語処理(NLP)、テキスト分析などの技術は、この情報からパターンを見つけたり、その他の方法で解釈したりするためのさまざまな手法を提供します。テキストを構造化する一般的な手法としては、メタデータによる手動タグ付けや、テキストマイニングに基づくさらなる構造化のための品詞タグ付けなどが挙げられます。非構造化情報管理アーキテクチャ(UIMA)規格は、この情報を処理して意味を抽出し、情報に関する構造化データを作成するための共通フレームワークを提供しました。
機械処理可能な構造を作成するソフトウェアは、あらゆる形態の人間コミュニケーションに存在する言語的、聴覚的、視覚的構造を利用できます。[ 12 ]アルゴリズムは、たとえば単語形態、文構文、その他の小規模および大規模なパターンを調べることによって、テキストからこの固有の構造を推論できます。その後、非構造化情報は、曖昧さに対処するために強化およびタグ付けされ、関連性に基づく手法を使用して検索と発見を容易にすることができます。「非構造化データ」の例には、書籍、雑誌、文書、メタデータ、健康記録、音声、ビデオ、アナログデータ、画像、ファイル、電子メールメッセージの本文、Web ページ、またはワードプロセッサ文書などの非構造化テキストが含まれます。伝達される主要なコンテンツには明確な構造はありませんが、一般的には構造を持つオブジェクト (たとえば、ファイルや文書など) にパッケージ化されており、構造化データと非構造化データが混在していますが、総称して「非構造化データ」と呼ばれます。[ 13 ]例えば、HTMLウェブページにはタグが付けられていますが、HTML マークアップは通常、レンダリングのためだけに機能します。ページの情報コンテンツの自動処理をサポートする方法で、タグ付き要素の意味や機能を捉えることはありません。XHTMLタグ付けは要素の機械処理を可能にしますが、通常はタグ付き用語の意味を捉えたり伝えたりすることはありません。
電子文書には非構造化データが一般的であるため、文書全体を分類できるコンテンツ管理システムや文書管理システムを利用する方が、文書内部からデータを転送・操作するよりも好ましい場合が多い。したがって、文書管理は文書コレクションに構造を与える手段を提供する。
検索エンジンは、特にテキストなどのデータをインデックス化して検索するための一般的なツールとなっている。
テキスト文書に含まれる非構造化データに構造を与えるために、特定の計算ワークフローが開発されてきました。これらのワークフローは一般的に、数千または数百万の文書セットを処理するように設計されており、手動で注釈を付ける方法では処理できないほど多くの文書を処理できます。これらのアプローチのいくつかは、オンライン分析処理(OLAP)の概念に基づいており、テキストキューブなどのデータモデルによってサポートされる場合があります。[ 14 ]データモデルを通じて文書メタデータが利用可能になると、フレーズベースのアプローチを使用して、文書のサブセット(つまり、テキストキューブ内のセル)の要約を生成することができます。[ 15 ]
情報抽出(IE)とは、非構造化および/または半構造化された機械可読文書やその他の電子的に表現されたソースから構造化された情報を自動的に抽出するタスクです。通常、これには自然言語処理(NLP)による人間の言語テキストの処理が含まれます。 [ 16 ]マルチメディア文書処理における最近の活動、例えば画像/音声/ビデオ/文書からの自動注釈やコンテンツ抽出などは、情報抽出と見なすことができます。
近年の自然言語処理技術の進歩により、以前に比べてパフォーマンスが大幅に向上しました。[ 17 ]一例として、ニュースワイヤーレポートからの企業合併の抽出が挙げられます。これは、形式的な関係式で表されます。
オンラインニュースの文章から例を挙げると:
情報工学(IE)の大きな目標は、これまで構造化されていなかったデータに対して計算を実行できるようにすることです。より具体的な目標は、入力データの論理形式について自動的に推論できるようにすることです。構造化データとは、選択された対象ドメインから意味的に明確に定義されたデータであり、カテゴリとコンテキストに基づいて解釈されます。
情報抽出は、テキストの送信、保存、表示を超えて、テキスト管理のための自動化された方法を考案するという問題に取り組む、より大きなパズルのピースです。情報検索(IR) [ 18 ]の分野では、大規模なドキュメント コレクションをインデックス化し、ドキュメントを分類するための、統計的な手法が一般的に開発されています。もう 1 つの補完的なアプローチは、自然言語処理(NLP) であり、タスクの規模を考慮すると、人間の言語処理をモデル化する問題をかなりの成功を収めて解決しています。難易度と重点の両面で、IE は IR と NLP の中間のタスクを扱います。入力に関して、IE は、各ドキュメントがテンプレートに従う一連のドキュメントの存在を前提としています。つまり、1 つ以上のエンティティまたはイベントを、他のドキュメントと同様の方法で記述しますが、詳細が異なります。例として、ラテンアメリカのテロに関するニュース記事のグループを考えてみましょう。各記事は、1 つ以上のテロ行為に基づいていると想定されます。また、任意の情報抽出タスクに対してテンプレートを定義します。テンプレートとは、単一の文書に含まれる情報を保持するためのケースフレーム(またはケースフレームのセット)です。テロの例では、テンプレートには、テロ行為の実行犯、被害者、武器、および事件発生日に対応するスロットが含まれます。この問題に対する情報抽出システムは、攻撃に関する記事を、このテンプレートのスロットに対応するデータを見つけるのに十分な程度に「理解」するだけで済みます。
生物医学研究は、研究者が研究結果を学術誌に発表することが多いため、非構造化データの主要な情報源の 1 つを生成します。これらの文書の言語は、構造要素を抽出するのが困難ですが (たとえば、文書に含まれる複雑な専門用語や、観察結果を完全に文脈化するために必要なドメイン知識のため)、これらの活動の結果は、技術研究と医学研究の間のリンク[ 19 ]や、新しい疾患治療に関する手がかりをもたらす可能性があります。[ 20 ]生物医学文書に構造を適用するための最近の取り組みには、文書間のトピックを識別するための自己組織化マップアプローチ[ 21 ]、汎用的な教師なしアルゴリズム[ 22 ] 、および文献中のタンパク質名と心血管疾患トピック間の関連性を決定するための CaseOLAP ワークフロー[ 15 ]の適用が含まれます。 [ 23 ] CaseOLAP は、フレーズとカテゴリの関係を正確 (関係を識別)、一貫性 (再現性が高い)、かつ効率的な方法で定義します。このプラットフォームはアクセシビリティを向上させ、広範な生物医学研究アプリケーションのためのフレーズマイニングツールを生物医学コミュニティに提供します。[ 23 ]
スウェーデン(EU)では、2018年以前は、問題となっているデータが「非構造化」であると確認された場合、一部のデータプライバシー規制は適用されませんでした。[ 24 ]この「非構造化データ」という用語は、2018年にGDPRが施行されて以降、EUではほとんど使用されていません。GDPRは「非構造化データ」について言及も定義もしていません。GDPRは「構造化」という言葉を次のように使用しています(定義はしていません)。
GDPRの判例法では、「ファイリングシステム」の定義について、「説教に従事する各メンバーが収集した個人データのセットが実際にどのような基準や形式で構成されているかは関係ない。ただし、そのデータセットによって、連絡を受けた特定の人物に関するデータを容易に取得できる必要がある。ただし、これは、本訴訟における事件のすべての状況を考慮して、付託裁判所が判断すべき事項である。」( CJEU、Todistajat v. Tietosuojavaltuutettu、Jehovan、第61項)。
個人データが容易に取得できる場合、それはファイルシステムとみなされ、「構造化」されているか否かにかかわらず、GDPRの適用範囲に含まれる。今日のほとんどの電子システムは、アクセス権限と適用されているソフトウェアによっては、データの容易な取得を可能にする。