
データ(/ ˈdeɪtə / DAY - tə、米国では/ ˈdætə / DAT -əとも)は、情報を伝える離散値または連続値の集合であり、量、質、事実、統計、その他の基本的な意味の単位、または形式的にさらに解釈できる記号のシーケンスを記述します。データポイントまたはデータムは、データの集合内の個々の値です。データは通常、追加のコンテキストと意味を提供するテーブルなどの構造に整理され、それ自体がより大きな構造内のデータとして使用されることがあります。データは、計算プロセスで変数として使用されることがあります。[ 1 ] [ 2 ]データは、抽象的なアイデアまたは具体的な測定値を表すことができます。[3] データは、科学研究、経済学、および事実上他のすべての形態の人間の組織活動 で一般的に使用されています。データセットの例には、価格指数(消費者物価指数など)、失業率、識字率、国勢調査データなどがあります。この文脈において、データとは、有用な情報を抽出できる生の事実や数値を指す。
データは、測定、観察、照会、分析などの手法を用いて収集され、通常は数値または文字として表現され、さらに処理される可能性があります。フィールドデータとは、管理されていない現場環境で収集されたデータです。実験データとは、管理された科学実験の過程で生成されたデータです。データは、計算、推論、議論、プレゼンテーション、視覚化、またはその他の形式の事後分析などの手法を用いて分析されます。分析の前に、生データ(または未処理データ)は通常、クリーニングされます。外れ値は除去され、明らかな機器エラーまたはデータ入力エラーが修正されます。
データは、計算、推論、または議論の基礎として使用できる事実情報の最小単位と見なすことができます。データは、抽象的なアイデアから具体的な測定値まで、統計を含むがこれに限定されない範囲に及びます。関連するコンテキストで提示されたテーマ的に関連付けられたデータは、情報と見なすことができます。コンテキストに関連付けられた情報は、データインサイトまたはインテリジェンスとして説明できます。時間の経過とともに蓄積され、データの情報への統合の結果として生じるインサイトとインテリジェンスのストックは、知識として説明できます。データは「デジタル経済の新しい石油」と表現されています。[ 4 ] [ 5 ]一般的な概念として、データは、既存の情報または知識が、より良い使用または処理に適した形式で表現またはコード化されているという事実を指します。
コンピューティング技術の進歩により、ビッグデータという概念が出現しました。ビッグデータとは、一般的にペタバイト規模という非常に大量のデータを指します。従来のデータ分析手法やコンピューティングに限定した場合、このような大規模(かつ増加し続ける)データセットを扱うことは困難、あるいは不可能です。これに対し、比較的新しい分野であるデータサイエンスは、機械学習(およびその他の人工知能)の手法を用いて、ビッグデータへの分析手法の効率的な適用を可能にしています。
ラテン語のdataはdatumの複数形で、「(何か)与えられたもの」という意味で、datumはdareの過去分詞形「与える」です。[ 6 ]英語でdataという単語が初めて使われたのは1640年代です。dataが「伝達可能で保存可能なコンピュータ情報」という意味で初めて使われたのは1946年です。データ処理という表現が初めて使われたのは1954年です。[ 6 ]
データが情報の同義語としてより一般的に使用される場合、それは単数形の集合名詞として扱われます。この用法は、日常言語や、ソフトウェア開発やコンピュータサイエンスなどの技術および科学分野で一般的です。この用法の一例として、 「ビッグデータ」という用語があります。データセットの処理と分析を指すために、より具体的に使用される場合、この用語は複数形を保持します。この用法は20世紀と21世紀に人気が高まり、自然科学、生命科学、社会科学、コンピュータサイエンス、およびソフトウェアエンジニアリングで一般的です。一部のスタイルガイドでは、この用語の異なる意味を認識せず、ガイドの対象読者に最も適した形式を推奨するだけです。たとえば、第7版のAPAスタイルでは、データは複数形として扱う必要があります。[ 7 ]

データ、情報、知識、知恵は密接に関連した概念ですが、それぞれが他の概念に対して役割を持ち、それぞれの用語に意味があります。一般的な見解では、データは収集され分析され、何らかの方法で分析された後にのみ意思決定に適した情報になります。[ 8 ]データセットが誰かにとってどれほど有益かは、そのデータがその人にとってどれほど予期せぬものであるかに依存すると言えます。データストリームに含まれる情報の量は、シャノンエントロピーによって特徴付けられます。
知識とは、ある存在が持つ環境に対する認識であり、データは単にその知識を伝えるものに過ぎない。例えば、データベースに記録されたエベレスト山の高さを示すデータは、正確に測定された値を伝えるデータである。この測定値は、エベレストに関する他のデータとともに書籍に掲載され、登山に最適な方法を検討したい人にとって役立つ形で山を説明するために用いられる。このデータが表す特性を認識することが知識である。
データは最も抽象度の低い概念であり、次に抽象度の低い概念は情報であり、知識は最も抽象度の高い概念であると想定されることが多い。[ 9 ]この見方では、データは解釈によって情報になる。例えば、エベレスト山の高さは一般的に「データ」とみなされ、エベレスト山の地質学的特徴に関する本は「情報」とみなされ、エベレスト山頂への最適な到達方法に関する実用的な情報を含む登山ガイドブックは「知識」とみなされる。「情報」は、日常的な使用から技術的な使用まで、多様な意味を持つ。しかし、この見方は、データが情報から、情報が知識からどのように出現するかを逆転させるとも主張されている。[ 10 ]一般的に、情報の概念は、制約、コミュニケーション、制御、データ、形式、指示、知識、意味、精神的刺激、パターン、知覚、表現の概念と密接に関連している。ベノン=デイヴィスは、記号の概念を用いてデータと情報を区別している。データは一連の記号であり、情報は記号が何かを指すために使用されるときに発生する。[ 11 ] [ 12 ]
コンピューター機器や機械が開発される以前は、人々は手作業でデータを収集し、パターンを適用しなければなりませんでした。コンピューター機器や機械の開発により、これらの機器もデータを収集できるようになりました。2010年代には、マーケティング、市民による社会サービスの利用状況の分析、科学研究など、さまざまな分野でコンピューターがデータ収集、分類、処理に広く使用されました。データ内のこれらのパターンは、知識の向上に利用できる情報と見なされています。これらのパターンは「真実」(ただし、「真実」は主観的な概念である可能性があります)として解釈され、一部の分野や文化では美的および倫理的基準として認められる場合があります。知覚可能な物理的または仮想的な痕跡を残す出来事は、データを通じて遡って追跡できます。マークと観察の間のリンクが切断されると、マークはもはやデータとはみなされなくなります。[ 13 ]
機械式計算機は、データの表現方法によって分類されます。アナログコンピュータは、電圧、距離、位置、またはその他の物理量としてデータを表します。デジタルコンピュータは、固定されたアルファベットから抽出された記号のシーケンスとしてデータを表します。最も一般的なデジタルコンピュータは、バイナリアルファベット、つまり通常「0」と「1」で表される2文字のアルファベットを使用します。数字や文字などのより馴染みのある表現は、バイナリアルファベットから構築されます。いくつかの特殊な形式のデータが区別されます。コンピュータプログラムは、命令として解釈できるデータの集合です。ほとんどのコンピュータ言語は、プログラムと、プログラムが操作する他のデータを区別しますが、Lispや類似の言語など一部の言語では、プログラムは他のデータと本質的に区別できません。メタデータ、つまり他のデータの記述を区別することも有用です。メタデータの類似した、しかしより古い用語は「補助データ」です。メタデータの典型的な例は、書籍の内容を記述した図書館の目録です。
マーケティングやその他の企業によるデータ収集の過程で収集されたデータの所有権に関して、データは、そのデータがソースにどれだけ近いか、または追加の処理によって生成されたかどうかに応じて、当事者ごとに特徴付けられてきました。「ゼロパーティデータ」とは、顧客が「意図的かつ積極的に共有する」データを指します。 [ 14 ]この種のデータは、購読、プリファレンスセンター、クイズ、アンケート、ポップアップフォーム、インタラクティブなデジタル体験など、さまざまなソースから取得できます。[ 15 ]「ファーストパーティデータ」は、企業が顧客から直接収集する場合があります。[ 16 ]企業間でのファーストパーティデータの安全な交換は、データクリーンルームを使用して行うことができます。[ 17 ]「セカンドパーティデータ」とは、購入またはその他の手段によって他の組織またはパートナーから取得したデータを指し、「他の組織のファーストパーティデータ」と表現されています。[ 18 ] [ 19 ]「サードパーティデータ」とは、他の組織によって収集され、その後さまざまなソース、Webサイト、プラットフォームから集約されたデータです。[ 18 ]
「ノーパーティ」データは、元のデータのパターンに基づいて生成された合成データを指す場合がある。[ 17 ]
データを登録する必要がある場合、データはデータ文書の形式で存在します。データ文書の種類には以下が含まれます。
これらのデータ文書(データリポジトリ、データ研究、データセット、ソフトウェアなど)の一部はデータ引用索引に索引付けされていますが、データ論文はサイエンス引用索引などの従来の書誌データベースに索引付けされています。
データの収集は、一次情報源(研究者が最初にデータを取得する人)または二次情報源(研究者が科学雑誌に掲載されたデータなど、他の情報源によって既に収集されたデータを取得する)を通じて行うことができます。データ分析の方法論は多様であり、データ三角測量とデータ浸透が含まれます。[ 20 ]後者は、研究の客観性を最大限に高め、調査対象の現象を可能な限り完全に理解できるように、5つの可能な分析の角度(少なくとも3つ)を使用してデータを収集、分類、分析する明確な方法を提供します。その角度とは、定性的および定量的方法、文献レビュー(学術論文を含む)、専門家へのインタビュー、およびコンピュータシミュレーションです。その後、データは、最も関連性の高い情報を抽出するために、一連の事前に決定された手順を使用して「浸透」されます。
コンピュータ科学、テクノロジー、図書館学において重要な分野の一つに、データの長期保存性があります。科学研究は、特にゲノミクスや天文学、そして医用画像処理などの医学分野において、膨大な量のデータを生成します。従来、科学データは論文や書籍として出版され、図書館に保管されていましたが、近年では事実上すべてのデータがハードディスクや光ディスクに保存されています。しかし、紙とは異なり、これらの記憶装置は数十年後には読み取り不能になる可能性があります。科学出版社や図書館は数十年にわたりこの問題に取り組んできましたが、数世紀、あるいは永遠にわたるデータの長期保存に対する満足のいく解決策はまだ見つかっていません。
データへのアクセス。もう 1 つの問題は、多くの科学データが公開されず、データベースなどのデータ リポジトリに保存されないことです。最近の調査では、2 年から 22 年前に公開された 516 の研究からデータが要求されましたが、要求されたデータを提供できる、または提供する意思のある研究は 5 分の 1 以下でした。全体として、データの取得の可能性は、公開後毎年 17% 低下しました。[ 21 ]同様に、 Dryadの 100 のデータセットの調査では、半数以上がこれらの研究の研究結果を再現するための詳細情報が不足していることがわかりました。[ 22 ]これは、公開されていない、または再現するのに十分な詳細情報がない科学データへのアクセスの深刻な状況を示しています。
データの信頼性。データが実際のデータである、十分な品質である、または適切なデータ出所とメタデータで正確に文書化されているという前提でデータが使用されると、より深刻な問題が発生する可能性があります。データリポジトリでは、義務付けられたデータ出所報告を要求することはほとんどなく、捏造された、合成された、または非倫理的なデータが、必要な考慮なしにリポジトリにアップロードされる可能性があります。健康および医療研究の例として、潜在的な捏造の証拠、関連性の説明がない、および文書化されていないため信頼できないとみなされたKaggleのデータが、125の臨床予測モデルの開発に使用されていました[ 23 ]。
再現性の問題に対する解決策は、FAIRデータ、つまり、検索可能、アクセス可能、相互運用可能、再利用可能なデータを要求する試みである。これらの要件を満たすデータは、その後の研究で使用でき、科学技術の進歩につながる。[ 24 ]
データは他の分野でもますます利用されるようになっているが、その高度に解釈的な性質は、「与えられたもの」としてのデータの倫理観と矛盾する可能性があると指摘されている。ピーター・チェックランドは、膨大な数の可能性のあるデータと、注目が向けられるそのサブセットを区別するために、capta(ラテン語のcapere 「取る」に由来)という用語を導入した。 [ 25 ]ヨハンナ・ドラッカーは、人文科学は知識生産を「状況依存的で、部分的で、構成的」であると肯定しているため、データを使用すると、例えば現象が離散的であるとか、観察者に依存しないといった、逆効果な仮定を導入する可能性があると主張している。[ 26 ]観察行為を構成的なものとして強調するcaptaという用語は、人文科学における視覚的表現のためのデータの代替として提案されている。
データ駆動型という用語は、他のあらゆる要素よりもデータによって主に推進される活動に用いられる新語である。データ駆動型の応用例としては、データ駆動型プログラミング、データ駆動型ジャーナリズムなどが挙げられる。