ダークデータとは、さまざまなコンピュータネットワーク操作によって取得されるものの、洞察を得たり意思決定に利用されたりしないデータのことです。[ 1 ] [ 2 ]組織のデータ収集能力は、データ分析のスループットを超えることがあります。場合によっては、組織はデータが収集されていることにさえ気づいていないかもしれません。[ 3 ] IBMは、センサーやアナログ-デジタル変換によって生成されるデータの約90%が利用されないと推定しています。[ 4 ]
産業分野では、ダークデータにはセンサーやテレマティクスによって収集された情報が含まれる。[ 5 ]
組織はさまざまな理由でダークデータを保持しており、ほとんどの企業はデータの 1% しか分析していないと推定されています。[ 6 ]多くの場合、規制遵守[ 7 ]および記録保持のために保存されています。[ 1 ]一部の組織は、より優れた分析およびビジネスインテリジェンス技術を取得して情報を処理すれば、将来的にダークデータが役立つ可能性があると考えています。 [ 3 ]ストレージは安価であるため、データの保存は簡単です。しかし、データの保存とセキュリティには、通常、潜在的な利益よりも大きな費用 (またはリスク) が伴います。[ 1 ]
学術的な議論において、「ダークデータ」という用語は、基本的にブライアン・P・ハイドーンによって造語されました。彼は、特に科学のロングテール(多数の小規模な研究プロジェクト)からの研究データを説明するためにこの用語を使用しています。これらのデータは、適切なデータ管理が行われずに引き出しの中に消えてしまうため、研究に利用できないか、もはや利用できません。[ 8 ]適切なデータ管理が行われないと、データはダークデータとなり、その原因としては、メタデータ注釈の欠如、データ管理計画の欠如、データキュレーターの不在などが挙げられます。[ 9 ]
「ダークデータ」という用語は、コンピュータ処理に適さないデータを指すことが非常に多い。例えば、企業がスキャンされたページ画像としてのみ存在する大量のデータを持っている場合がある。このような文書のテキストでさえ、光学文字認識(OCR)のような技術を用いなければ利用できない。しかも、OCRの精度は大きく変動する。OCRを用いても、データの各部分の意味は分からない。分かりやすい例としては、大文字で始まる単語が名前かどうか、そして名前であれば、それが人、場所、組織、あるいは芸術作品のどれを表しているのか、といったことが挙げられる。書誌情報やその他の参照、表内のデータ(人間にとっては十分にラベル付けされているかもしれないが、処理には適していない)、そして人間の言語の複雑さと曖昧さをそのままに表現された無数の主張なども同様である。
未使用データの多くは非常に価値が高く、利用可能であれば活用されるはずですが、処理、分類、識別、分析が困難な形式であるため、活用が阻害されています。企業がダークデータを活用しない理由の多くは、必要なリソースの量と、データの分析の難しさにあります。つまり、データが「ダーク」であるのは、使用されていないからではなく、表現方法が不十分なため、(現実的にも費用対効果の面でも)利用できないからです。
自動化においてデータをより容易に利用できるデータ表現方法は数多く存在する。しかしながら、多くの情報には情報項目や情報間の関係性を識別する情報が欠如しており、さらに多くの情報は、ページ指向の表現への保存、印刷、スキャン、ファックスといった「ダウンヒル」変換の過程で失われてしまう。こうした情報を「アップヒル」変換によって復元するには、多大なコストがかかる可能性がある。
Computer Weeklyによると、組織の60%が自社のビジネスインテリジェンスレポート機能が「不十分」だと考えており、65%が「やや整理されていないコンテンツ管理アプローチ」を持っていると述べている。[ 10 ]
有用なデータであっても、処理速度が遅いと無関係になり、ダークデータになってしまう可能性があります。これは「ライブフローデータ」における「生鮮インサイト」と呼ばれています。例えば、顧客の位置情報が企業に分かっている場合、企業はその位置情報に基づいてオファーを行うことができますが、このデータがすぐに処理されないと、将来的に無関係になる可能性があります。IBMによると、データの約60%はすぐに価値を失います。[ 4 ]
ニューヨーク・タイムズによると、データセンターで使用されるエネルギーの90%は無駄になっている。[ 11 ]データが保存されていなければ、エネルギーコストを節約できる。さらに、情報の利用不足に伴うコストや機会損失も発生する。Datamationによると、「EMEA地域の組織のストレージ環境は、54%がダークデータ、32%が冗長で陳腐化した些細なデータ、14%がビジネス上重要なデータで構成されている。2020年までに、これは本来なら回避できるはずのストレージと管理コストで8910億ドルに達する可能性がある。」[ 12 ]
ダークデータの継続的な保存は、特にそのデータが機密性の高いものである場合、組織を危険にさらす可能性があります。侵害が発生した場合、深刻な影響が生じる可能性があります。これには、金銭的、法的、そして組織の評判を著しく損なう可能性があります。たとえば、顧客の個人記録が侵害されると、機密情報が盗まれ、なりすましにつながる可能性があります。別の例としては、研究開発に関連する企業自身の機密情報が侵害される可能性があります。これらのリスクは、このデータが組織にとって有用かどうかを評価および監査し、強力な暗号化とセキュリティを採用し[ 13 ]、最後に、破棄する必要があると判断された場合は、復元不可能な方法で破棄することによって軽減できます[ 14 ] 。
データ分析のための高度なコンピューティングシステムが構築されるにつれて、ダークデータの価値が高まることが一般的に考えられています。「データと分析は現代の産業革命の基盤となる」と指摘されています。[ 5 ]もちろん、これには、処理するリソースが不足しているため現在「ダークデータ」とみなされているデータも含まれます。収集されているこれらのデータはすべて、将来的に生産性を最大化し、組織が消費者の需要を満たす能力を高めるために使用できます。技術の進歩は、このダークデータを手頃な価格で活用するのに役立っています。さらに、多くの組織は現在ダークデータの価値を認識していません。たとえば、医療や教育機関では、消費者や金融サービスがターゲット層を追求する方法で学生や患者にサービスを提供する大きな可能性を生み出す可能性のある大量のデータを扱っています。[ 15 ]