データ公開 (データパブリッシング とも呼ばれる)とは、研究データを 公開形式 で公開し、他者が利用できるようにすることです。これは、特定のデータ またはデータセットを 公開用に準備し、誰もが自由に利用できるようにするための実践です。この実践は、オープンサイエンス 運動の不可欠な部分です。この実践から得られる利点については、幅広い分野にわたるコンセンサスがあります。[ 1 ] [ 2 ] [ 3 ]
主な目標は、データを一流の研究成果に高めることである。[ 4 ] 進行中のイニシアチブが多数あり、合意点とまだ議論の余地のある問題が存在する。[ 5 ]
研究データを公開する方法はいくつかあり、例えば以下のようなものがある。
研究論文 に関連する補足資料としてデータを公開すること。通常、データファイルは論文の発行元によってホストされる。公開ウェブサイトにデータをホストし、ファイルをダウンロードできるようにする。 データ公開をサポートするために開発されたリポジトリにデータをホストする、例えばfigshare 、Dryad 、Dataverse 、Zenodo など。一般的なデータリポジトリや専門分野別のデータリポジトリ(研究トピック別など)が多数存在する。[ 6 ] 例えば、UK Data Service では、ユーザーが データコレクション を預け、研究目的で再共有することができる。 データセットに関するデータ論文を発表する。この論文は、プレプリントとして、通常の学術誌 に、またはデータ論文の支援を専門とするデータジャーナルに掲載される可能性がある。データは、当該学術誌がホストする場合もあれば、データリポジトリに別途ホストする場合もある。 データ公開によって、研究者は自身のデータを他者が利用できるようにできるだけでなく、データセットを他の研究出版物(論文や書籍など)と同様に引用することも可能になり、データセットの作成者は自身の研究に対して学術的な評価を得ることができる。
データ公開の動機は、研究へのアクセスを容易にしたいという願望、データセットの引用可能性を高めたい、あるいはオープンデータ公開を義務付ける研究資金提供者や出版社の指示など多岐にわたります。英国データサービスは、データの正しい引用の重要性を高め[ 7 ] 、研究者がそれを実行できるように支援するために、他の組織と協力している主要な組織の1つです。
データ公開におけるプライバシー保護のための解決策として、プライバシー保護アルゴリズム、データ「マスキング」手法、地域別プライバシーレベル計算アルゴリズムなどが提案されている。[ 8 ]
データ公開の方法
データファイルは補足資料として提供されます。 多くの学術誌や出版社は、データセットを含む研究論文への補足資料の添付を認めている。従来、こうした資料は図書館への配布(依頼があった場合のみ、あるいはマイクロフィルム で配布)されていたが、今日では学術誌がオンラインで公開するのが一般的である。補足資料は、学術誌の購読者、または論文や学術誌がオープンアクセスであれば誰でも利用できる。
データリポジトリ 一般的なトピックと専門的なトピックの両方で、多数のデータリポジトリが存在します。多くのリポジトリは、特定の研究分野に焦点を当てた分野別リポジトリであり、例えば、社会、経済、人文科学データの信頼できるデジタルリポジトリである 英国データサービス などがあります。リポジトリは、研究者がデータをアップロードするのに無料の場合もあれば、データのホスティングに対して1回限りまたは継続的な料金を請求する場合もあります。これらのリポジトリは、ホストされているデータセットを検索および閲覧するための公開アクセス可能なWebインターフェースを提供し、データの永続的な引用のためのデジタルオブジェクト識別子 や、関連する公開論文やコードへのリンクなどの追加機能を含む場合があります。これに関連して、考古学向けのサービスであるOpen Contextなどのデータ公開サービスもあります。このようなサービスでは、個々のデータレコードの検索、クエリ、分析、引用が可能です。粒度と統合により、Web上でデータを動的に公開および公開展示することができます。[ 9 ] [ 10 ]
データ論文 データ論文 またはデータ記事は 、「特定のオンラインでアクセス可能なデータセット、またはデータセットのグループを記述する検索可能なメタデータ文書の学術出版物であり、標準的な学術慣行に従って公開される」ものです。[ 11 ] 最終的な目的は、「データの何、どこ、なぜ、どのように、誰が」に関する情報を提供することです。[ 4 ] データ論文の意図は、データの処理や分析ではなく、データ収集、特徴、アクセス、および潜在的な再利用に焦点を当てた関連データセットに関する記述情報を提供することです。[ 12 ] データ論文は他の種類の論文と何ら変わらない学術出版物とみなされるため、データを共有する科学者は学術システム内で認識される通貨でクレジットを受け取ることができ、それによって「データ共有が意味を持つ」ようになります。[ 13 ] これは、データを共有する追加のインセンティブを提供するだけでなく、ピアレビュー プロセスを通じてメタデータの品質を高め、共有データの再利用性を向上させます。
このように、データ論文はデータ共有 に対する学術的なコミュニケーション 手法を表しています。データ論文には可能性はありますが、データ共有と再利用に関するすべての問題に対する究極的かつ完全な解決策ではなく、場合によっては研究コミュニティに誤った期待を抱かせる可能性があると考えられています。[ 14 ]
参考文献 ↑ Costello MJ (2009). 「データのオンライン公開を促進する」. BioScience . 59 (5): 418–427 . doi : 10.1525/bio.2009.59.5.9 . hdl : 2292/7173 . S2CID 55591360 . ↑ Smith VS (2009). "データ公開: あらゆるもののデータベースに向けて" . BMC Research Notes . 2 (113): 113. doi : 10.1186/1756-0500-2-113 . PMC 2702265 . PMID 19552813 . ↑ Lawrence, B; Jones, C.; Matthews, B.; Pepler, S.; Callaghan, S. (2011). "データの引用と査読:正式なデータ公開に向けて" . International Journal of Digital Curation . 6 (2): 4– 37. doi : 10.2218/ijdc.v6i2.205 . 1 2 Callaghan S、Donegan S、Pepler S、Thorley M、Cunningham N、Kirsch P、Ault L、Bell P、Bowie R、Leadbetter A、Lowry R、Moncoiffé G、Harrison K、Smith-Haddon B、Weatherby A、Wright D (2012)。 「データを一流の科学的成果物にする:NERCの環境データセンターによるデータの引用と出版」 。International Journal of Digital Curation。7 ( 1 ): 107– 113。doi : 10.2218/ijdc.v7i1.218 。 ↑ Kratz J 、Strasser C (2014)。 「 データ 公開 の コンセンサスと論争」 。F1000Research。3 ( 94): 94。doi : 10.12688 / f1000research.4518。PMC 4097345。PMID 25075301 。 ↑ Assante, M.; Candela, L.; Castelli, D.; Tani, A. (2016). "科学データリポジトリは研究データの公開に対応できているか?" . Data Science Journal . 15 . doi : 10.5334/dsj-2016-006 . ↑ 英国データサービス。 「データ利用初心者向け」 。 英国データサービス 。 ↑ Zhang, Longbin; Wang, Yuxiang; Xu, Xiaoliang (2017年8月) 「オンライン集約のための論理分割に基づくガウスサンプリング」 2017 年第5回先進クラウドおよびビッグデータ国際会議(CBD) IEEE、pp. 182–187 、 doi : 10.1109/cbd.2017.39 、 ISBN 978-1-5386-1072-5 . S2CID 40025084 . ↑ Kansa, E; Kansa, SW (2026). "変化するコンテキストにおけるオープンコンテキスト:データ公開、相互運用性、ガバナンス" . Internet Archaeology (71). doi : 10.11141/ia.71.3 . ↑ Muñoz, T (2013). 「デジタル人文科学のための出版としてのデータキュレーション」 . Journal of Digital Humanities (2). ↑ Chavan, V. & Penev, L. (2011). "データペーパー:生物多様性科学におけるデータ公開を促進するメカニズム" . BMC Bioinformatics . 12 (15): S2. doi : 10.1186/1471-2105-12-S15-S2 . PMC 3287445 . PMID 22373175 . ↑ Newman Paul; Corke Peter (2009). "データ論文 - 高品質データセットの査読付き出版物" . International Journal of Robotics Research . 28 (5): 587. doi : 10.1177/0278364909104283 . S2CID 209308576 . ↑ Gorgolewski KJ、Margulies DS 、Milham MP (2013)。 「 データ 共有を有効活用する:出版に基づく解決策 」 。Frontiers in Neuroscience。7 : 9。doi : 10.3389 / fnins.2013.00009。PMC 3565154。PMID 23390412 。 ↑ Parsons, MA; Fox, PA (2013). 「データ公開は適切なメタファーか?」 . Data Science Journal . 12 : WDS31– WDS46. doi : 10.2481/dsj.WDS-042 . ↑ Candela L、 Castelli D、Manghi P 、Tani A (2015)。 「 データジャーナル:概観」 。 情報科学 技術 協会誌 。66 (1): 1747–1762。doi : 10.1002/asi.23358。S2CID 31358007 。 ↑ 「データセットのピアレビューのソース - datashare - Wiki Service」 。 ↑ オーストラリア国立データサービス:データ引用に関する意識向上(2012年3月7日アーカイブ、Wayback Machine にて 閲覧)(2012年3月20日アクセス) ↑ Ball, A., Duke, M. (2011). 'データ引用とリンク'. DCC ブリーフィングペーパー. エジンバラ: デジタルキュレーションセンター. オンラインで入手可能: http://www.dcc.ac.uk/resources/briefing-papers/ ↑ MOONEY, Hailey (2011年4月) 「社会科学におけるデータソースの引用:著者はそれをしているのか?」 Learned Publishing . 24 (2): 99–108 . doi : 10.1087/20110204 . S2CID 34513423 . ↑ Edmunds, Scott C.; Pollard, Tom J.; Hole, Brian; Basford, Alexandra T. (2012-07-02). "データ引用の冒険:ソルガムゲノムデータは新たなゴールドスタンダードを体現する" . BMC Research Notes . 5 (1): 223. doi : 10.1186/1756-0500-5-223 . ISSN 1756-0500 . PMC 3392744 . PMID 22571506 . ↑ 「引用されなければ忘れられる:データの引用に関する実践、政策、および技術の現状」 。 データサイエンスジャーナル 。12 : CIDCR1– CIDCR75 。2013年。doi : 10.2481 /dsj.OSOM13-043 。 ↑ Mooney, Hailey; Newton, Mark P. (2012). "データ引用の構造: 発見、再利用、およびクレジット". Academic Commons . 1 (1). Columbia University: eP1035. doi : 10.7916/D8MW2STM . ↑ Data Citation Synthesis Group (2014). Martone, M. (編). "Joint Declaration of Data Citation Principles" . San Diego: Force11 Scholarly Communication Institute . doi : 10.25490/a97f-egyk . ↑ Lin, Jennifer (2018年10月4日). "データ引用: やってみよう" . Crossref . doi : 10.64000/y3w79-cfb36 . ↑ 「データ引用が必要」 。Scientific Data。6 ( 1 ):27。2019年4月10 日 。Bibcode : 2019NatSD ... 6 ... 27。doi : 10.1038 / s41597-019-0026-5。PMC 6472333。PMID 30971699 。 ↑ Pierce, Heather H.; Dev, Anurupa; Statham, Emily; Bierer, Barbara E. (2019年6月4日). "データ再利用のためのデータ生成器のクレジット" . Nature . 570 (7759): 30– 32. Bibcode : 2019Natur.570...30P . doi : 10.1038/d41586-019-01715-4 . PMID 31164773 . S2CID 174809246 . ↑ Buneman, Peter; Davidson, Susan; Frew, James (2016年9月) 「データ引用が計算上の問題である理由」 Communications of the ACM . 59 (9): 50– 57. doi : 10.1145/2893181 . ISSN 0001-0782 . PMC 5687090. PMID 29151602 . ↑ Silvello, G. (2018). 「データ引用の理論と実践」。情報科学技術協会誌(JASIST)(AIS Review)、第69巻、第1号、6-20ページ、2018年。オンラインで入手可能(オープンアクセス): https://onlinelibrary.wiley.com/doi/full/10.1002/asi.23917 ↑ Buneman, P. および Silvello, G. (2010). 「構造化および進化するデータセットのためのルールベースの引用システム」. IEEE Bulletin of the Technical Committee on Data Engineering, Vol. 3, No. 3. IEEE Computer Society, pp. 33-41, September 2010. オンライン入手可能: http://sites.computer.org/debull/A10sept/buneman.pdf ↑ Silvello, G. (2017). 「引用学習フレームワーク:階層型データの引用を自動的に構築する方法」。情報科学技術協会誌(JASIST)、第68巻第6号、1505-1524ページ、2017年6月。オンラインで入手可能: http://www.dei.unipd.it/~silvello/papers/2016-DataCitation-JASIST-Silvello.pdf ↑ Silvello, G. (2015). 「リンクトオープンデータサブセットを引用するための方法論」。D-Lib Magazine 21 (1/2), 2015。オンラインで入手可能: http://www.dlib.org/dlib/january15/silvello/01silvello.html ↑ Buneman, P. (2006). 「キュレーションされたデータベースの引用方法と引用可能にする方法」。第18回国際科学統計データベース管理会議(SSDBM 2006)議事録、195~203ページ、2006年。