
生データ(一次データとも呼ばれる)とは、情報源から収集されたデータ(数値、計測値、図表など)のことです。試験の文脈では、生データは(テストスコアに続いて)生スコアと呼ばれることがあります。
科学者が試験管内の化学混合物の温度を毎分記録するコンピュータ化された温度計を設置した場合、スプレッドシートに印刷されたりコンピュータ画面に表示されたりする毎分の温度測定値のリストは「生データ」です。生データは、外れ値、明らかな機器の読み取りエラー、データ入力エラーを除去するために研究者によって「クリーニング」されたり、分析(平均値や中央値などの中心傾向の決定など)が行われたりしていません。また、生データは、ソフトウェア プログラムや人間の研究者、アナリスト、技術者によるその他の操作も受けていません。これらは一次データとも呼ばれます。生データは相対的な用語です(データを参照)。なぜなら、生データが1つの研究チームによって「クリーニング」され処理された後でも、別のチームがこれらの処理済みデータを研究の別の段階で「生データ」とみなす可能性があるからです。生データは、コンピュータ プログラムに入力したり、調査からの統計の分析などの手動の手順で使用したりできます。 「生データ」という用語は、ハードディスクドライブなどの電子記憶装置上のバイナリデータ(「低レベルデータ」とも呼ばれる)を指す場合がある。
データの作成方法には2種類あります。1つ目は「キャプチャデータ」[ 1 ]と呼ばれ、意図的な調査や分析によって得られるデータです。2つ目は「エグゾーストデータ」[ 1 ]と呼ばれ、通常は機械や端末によって二次的な機能として収集されます。例えば、レジ、スマートフォン、スピードメーターは主要な機能を持ちますが、二次的なタスクとしてデータを収集することもあります。エグゾーストデータは通常、処理するには大きすぎたり、あまり役に立たなかったりするため、「一時的な」データとなり、破棄されます。[ 1 ]
コンピューティングにおいて、生データには次のような属性がある可能性があります。人的、機械的、または機器のエラーが含まれている可能性があり、検証されていない可能性があります。さまざまな地域(口語的)形式である可能性があり、コード化されていないか、フォーマットされていない可能性があります。また、一部のエントリが「疑わしい」(たとえば、外れ値)ため、確認または引用が必要になる場合があります。たとえば、データ入力シートには、「1999 年 1 月 31 日」、「31/01/1999」、「31/1/99」、「31 Jan」、「今日」など、さまざまな形式の生データとして日付が含まれている可能性があります。取得された生データは、コンピュータと人間が後で処理する際に解釈しやすくするために、おそらくユリウス日などの正規化された形式で処理または保存される可能性があります。生データ(口語的には「ソース」データまたは「エギー」データと呼ばれることもあります。後者は、生卵のように「調理されていない」、つまり「未処理」であることを指します)は、処理へのデータ入力です。データと情報は区別され、情報はデータ処理の最終成果物であると考えられています。処理を経た生データは、俗に「加工済み」データと呼ばれることもあります。生データは「情報」 に変換される可能性を秘めていますが、利用可能な情報に変換するには、抽出、整理、分析、そして提示のためのフォーマット化といった処理が必要です。
例えば、混雑したスーパーマーケットのPOS端末(コンピュータ化されたレジ)は、顧客の購入に関する膨大な量の生データを毎日収集します。しかし、この食料品のリスト、価格、購入日時といった情報は、処理されるまではほとんど役に立ちません。ソフトウェアプログラム、あるいはペンと紙と電卓を使う研究者によって処理・分析されると、この生データは、各顧客が購入した特定の商品、購入日時、価格を示すことができます。また、アナリストやマネージャーは、顧客一人当たりの平均総売上高や、曜日別・時間別の平均支出額を計算することもできます。このように処理・分析されたデータは、マネージャーにとって有益な情報となり、例えば、何人のレジ係を何時に雇用するかといった判断に役立てることができます。こうした情報は、例えば予測マーケティングキャンペーンの一環として、さらなる処理のためのデータとなる可能性があります。処理の結果、生データはデータベースに格納されることがあり、これにより、さまざまな方法で生データにアクセスし、さらなる処理や分析を行うことが可能になります。
ティム・バーナーズ=リー(ワールドワイドウェブの発明者)は、生データの共有が社会にとって重要だと主張している。 オープンナレッジ財団のルーファス・ポロックの投稿に触発された彼の行動喚起は「今すぐ生データ」であり、これは政府や企業が収集したデータを生データとして共有するよう誰もが要求すべきだという意味だ。彼は「データは私たちの生活で起こることの大部分を左右する…なぜなら誰かがデータを受け取り、それを使って何かをするからだ」と指摘している。バーナーズ=リーにとって、科学の進歩は基本的にこの生データの共有から生まれる。オープンデータの支持者は、市民や市民社会組織が企業や政府のデータにアクセスできるようになれば、市民やNGOが独自にデータを分析できるようになり、人々や市民社会に力を与えることができると主張する。例えば、政府は政策によって失業率が低下していると主張するかもしれないが、貧困対策団体はスタッフの計量経済学者に生データを独自に分析させ、データセットについて異なる結論を導き出す可能性がある。
批判的データ研究の学者たちは、 「生データ」という用語を批判してきた。[ 2 ] [ 3 ]この批判は、データは決して生のままではなく、常に人々の決定によって構築され、形作られるという考えに基づいている。人文科学の学者ヨハンナ・ドラッカーは、データは「キャプチャされ、取得され、構築される」と主張した。 [ 4 ]例えば、温度計やその他の機器からデータが生成される場合、データは機器の設計に特有の構成によって形作られる。
生データ(一次データとも呼ばれる)は、情報源や機器から直接収集された、未処理の元のデータです。エラー、矛盾、冗長な情報が含まれている可能性があり、通常、クリーニング、検証、構造化などの処理ステップを経て利用可能になります。処理済みデータは、生データを整理され解釈可能な形式に変換することで、分析、視覚化、意思決定に適したデータとなります。生データの柔軟性と完全性により、包括的で多様な分析が可能になる一方、処理済みデータは実用的な洞察を生み出すための基盤となります。生データは最も詳細な情報を保持しているため、結論の正確性やモデルのトレーニングに高品質の入力が不可欠な科学研究や機械学習において非常に貴重です。