データキュレーションとは、さまざまなソースから収集されたデータの整理と統合のことです。このプロセスには、データの注釈、公開、および提示が含まれ、その目的は、時間の経過とともにデータの価値を維持し、再利用と保存のために継続的に利用できるようにすることです。データキュレーションには、「原則に基づき管理されたデータの作成、維持、管理に必要なすべてのプロセスと、データに価値を付加する能力」が含まれます。[ 1 ]科学においては、データキュレーションは、専門家による研究論文などの科学テキストから重要な情報を抽出し、それを生物学的データベースへのエントリなどの電子形式に変換するプロセスを指す場合があります。[ 2 ]
ビッグデータの現代において、データのキュレーションは、特に大量かつ複雑なデータシステムを処理するソフトウェアにおいて、ますます重要性を増している。 [ 3 ] この用語は人文科学の分野でも使用されており、[ 4 ]デジタル人文科学プロジェクトから得られる文化や学術データの増加に伴い、データキュレーションの専門知識と分析手法が求められている。[ 5 ]広義には、キュレーションは、コンポーネントの作成、管理、維持、検証に関わる一連の活動とプロセスを包含する。[ 6 ]具体的には、データキュレーションとは、どの情報を保存する価値があるか、そしてどのくらいの期間保存するかを決定する試みである。[ 7 ]
データキュレーションとメタデータの維持は、データベース自体ではなく、通常はユーザーが開始します。[ 8 ]イリノイ大学図書館情報科学大学院によると、「データキュレーションとは、学術、科学、教育に対する関心と有用性のライフサイクル全体を通して、データを能動的かつ継続的に管理することです。キュレーション活動により、データの発見と検索が可能になり、品質が維持され、価値が付加され、時間の経過とともに再利用が可能になります。」[ 9 ]データキュレーションのワークフローは、データ品質管理、データ保護、ライフサイクル管理、データ移動 とは異なります。[ 8 ]
国勢調査データは、20世紀初頭から表形式のパンチカードで入手可能であり、1960年代からは電子化されている。[ 10 ]大学間政治社会研究コンソーシアム(ICPSR)のウェブサイトでは、1962年が最初の調査データアーカイブの日付として記されている。[ 11 ]
データライブラリに関する詳細な背景情報は、1982 年発行のイリノイ州の雑誌Library Trends に掲載されています。[ 12 ]データアーカイブ運動の歴史的背景については、「数値データに対する社会科学情報ニーズ:国際データアーカイブインフラストラクチャの進化」を参照してください。[ 13 ] 組織内で実施される正確なキュレーションプロセスは、データの量、データに含まれるノイズの量、およびデータの将来的な使用が普及にどのような意味を持つかによって異なります。[ 3 ]
宇宙データの危機により、1999年にオープンアーカイブ情報システム(OAIS)モデルが作成されました[ 14 ]。これは、1982年に設立された宇宙データシステム諮問委員会(CCSDS)によって管理されています[ 15 ]。
データキュレーションという用語は、生物学的データベースの文脈で使用されることがあります。生物学的データベースでは、まずさまざまな研究論文から特定の生物学的情報を取得し、特定のカテゴリのデータベースに保存します。たとえば、抗うつ薬に関する情報はさまざまなソースから取得でき、データベースとして利用可能かどうかを確認した後、薬のデータベースの抗うつ薬カテゴリに保存されます。企業も、データの品質と正確性を確保するために、運用および戦略プロセス内でデータキュレーションを活用しています。[ 16 ] [ 17 ]
情報再利用のための普及情報パッケージ(DIPS)(DIPIR)プロジェクトは、定量的社会科学者、考古学者、動物学者によって作成および使用される研究データを研究しています。対象となるのは、二次データを使用する研究者、デジタルキュレーター、デジタルリポジトリ管理者、データセンタースタッフ、およびデジタル情報を収集、管理、保存するその他の人々です。[ 18 ]
タンパク質データバンクは1971年にブルックヘブン国立研究所で設立され、世界的なプロジェクトへと成長しました。[ 19 ]タンパク質やその他の大型生体分子の3次元構造データのデータベースであるPDBには、標準化され、実験データと照合され、注釈が付けられた12万を超える構造が含まれています。
ショウジョウバエ科の昆虫の遺伝子および分子データの主要なリポジトリであるFlyBaseは、1992年に設立されました。FlyBaseは、キイロショウジョウバエのゲノム全体に注釈を付けています。[ 20 ]
言語データコンソーシアムは、1992年に遡る言語データのデータリポジトリです。[ 21 ]
スローン・デジタル・スカイ・サーベイは2000年に夜空の調査を開始しました。[ 22 ]コンピュータ科学者のジム・グレイは、SDSSのデータアーキテクチャに取り組んでいる際に、科学におけるデータキュレーションの考え方を提唱しました。[ 23 ]
DataNet は、米国国立科学財団サイバーインフラストラクチャ局の研究プログラムであり、科学分野のデータ管理プロジェクトに資金を提供していました。[ 24 ] DataONE (地球データ観測ネットワーク) は、 DataNetを通じて資金提供を受けたプロジェクトの 1 つです。環境科学コミュニティがデータを保存および共有するのを支援しています。[ 25 ] データキュレーションの商業的重要性は、この分野における特許の存在によって強調されています。たとえば、Tamr Inc. や Praxi Data などの企業は、データキュレーション技術およびプロセスに関連する特許を保有しています。[ 26 ]