
オープンサイエンスインフラストラクチャ(またはオープン学術インフラストラクチャ)は、出版物、データセット、メタデータ、コードなどの科学的成果物のオープンな共有をサポートする情報インフラストラクチャです。2021年11月のユネスコのオープンサイエンスに関する勧告では、これを「オープンサイエンスをサポートし、さまざまなコミュニティのニーズに応えるために必要な共有研究インフラストラクチャ」と説明しています。[ 1 ]
オープンサイエンスインフラストラクチャは、オープンな知識の生産を支援する科学インフラストラクチャ(サイバーインフラストラクチャ、eサイエンス、 eインフラストラクチャとも呼ばれる)の一形態です。共通リソースの管理にとどまらず、多くの場合、コミュニティ主導のイニシアチブとして構築され、一連の共通の規範とガバナンス規則が定められているため、知識コモンズの一形態でもあります。オープンサイエンスインフラストラクチャの定義には、通常、大手商業出版社が運営する私有の科学インフラストラクチャは含まれません。逆に、オープンアクセス出版プラットフォーム(オープン学術コミュニケーションサービス)など、オープンサイエンスのエコシステムにおいて重要な役割を果たす、必ずしも科学インフラストラクチャとして特徴づけられない主体が含まれる場合もあります。
1960年代以降、コンピューティングインフラとオンラインサービスは、科学知識の生産と普及において重要な役割を果たしてきた。これらの初期の科学インフラは当初、コミュニティ主導の取り組みとして構想されたものの、相互接続性の欠如とネットワーク接続コストの高さから、広く一般に利用することはできなかった。ワールドワイドウェブの登場により、データや出版物を大規模に共有することが可能になった。オンライン研究プロジェクトやサービスの持続可能性は重要な政策課題となり、2000年代には大規模なインフラ整備が不可欠となった。
オープンサイエンスインフラストラクチャの概念は、2015年以降、多数の研究活動における商業的および私有のインフラストラクチャの拡大をめぐる科学政策論争と、「オープン学術インフラストラクチャの原則」の発表を受けて出現しました。2010年代以降、新たなオープンサイエンスプロジェクトの開発と既存インフラストラクチャのオープンサイエンス原則への転換を通じて、ヨーロッパ、南北アメリカにおいて相互接続された大規模な科学インフラストラクチャのエコシステムが出現しています。
オープンサイエンスインフラストラクチャとは、出版物、データ、ソフトウェアなどのオープンな科学的成果物を作成、公開、維持することを可能にする知識インフラストラクチャの一形態である。
2021年11月に承認されたユネスコのオープンサイエンスに関する勧告では、オープンサイエンスインフラストラクチャを「オープンサイエンスをサポートし、さまざまなコミュニティのニーズに応えるために必要な共有研究インフラストラクチャ」と定義しています。[ 1 ]欧州のオープンサイエンスインフラストラクチャに関するSPARCレポートでは、オープンサイエンスインフラストラクチャの範囲内で次の活動が含まれています。「オープンアクセスとオープンサイエンスインフラストラクチャを、コラボレーションと実験からデータ収集と保存、データ整理、データ分析と計算、著者、投稿、レビューと注釈、コピー編集、出版、アーカイブ、引用、発見など、研究ライフサイクルに貢献するサービス、プロトコル、標準、ソフトウェアのセットと定義します。」[ 2 ]
「インフラストラクチャ」という用語の使用は、産業革命後に複雑な経済および社会システムを運営することを可能にした電力網、道路網、電気通信などの物理的なインフラストラクチャとネットワークを明確に指しています。「インフラストラクチャという用語は、1920年代から、産業経済が機能するために必要な道路、電力網、電話システム、橋、鉄道線路、および同様の公共事業を総称して指すために使用されてきました。(…)インフラストラクチャが産業経済に必要であれば、サイバーインフラストラクチャが知識経済に必要であると言えるでしょう。」[ 3 ]インフラストラクチャの概念は、1996年にスーザン・リー・スターとカレン・ルーレダーによって、初期のオープンサイエンスインフラストラクチャであるワームコミュニティシステムの実証的観察を通じて、コンピュータを介した知識生産の形態にまで拡張されました。[ 4 ]この定義は、その後20年間、科学技術研究において影響力を持ち続け[ 5 ]、2000年代初頭から科学インフラストラクチャの構築に関する政策論争に影響を与えてきました。[ 3 ]
オープンサイエンスのインフラストラクチャには、他の形態のオープンサイエンスプロジェクトやイニシアチブとは異なる特有の特性があります。
オープンサイエンスインフラストラクチャはオープンであり、他の科学知識インフラストラクチャ、特にサブスクリプションベースの商用インフラストラクチャとは区別されます。オープン性は、インフラストラクチャの目的、ガバナンス、管理に影響を与える中核的価値と指導原則の両方です。オープンサイエンスインフラストラクチャは、オープンデータリポジトリやウィキペディアのような大規模な共同プロジェクトなど、他のオープン機関が直面するのと同様の問題に直面しています。「現代の知識インフラストラクチャを研究すると、オープン性の価値がしばしばそこに埋め込まれていることがわかりますが、オープン性の価値をインフラストラクチャの設計やインフラストラクチャ構築の実践に翻訳することは、複雑で偶発的なプロセスです。」[ 14 ]
オープンサイエンスインフラストラクチャの概念的定義は、エリノア・オストロムによるコモンズ、特に知識コモンズに関する分析に大きく影響を受けている。オストロムの見解に倣い、キャメロン・ネイロンは、オープンインフラストラクチャは共有リソースのプールの管理だけでなく、共通のガバナンスと規範の構築によっても特徴づけられると述べている。[ 15 ]コモンズの経済理論は、学者協会の限られた範囲を超えて、大規模なコミュニティ主導のイニシアチブへと拡大することを可能にする。「オストロムの研究は(…)ローカルクラブからコミュニティ全体のインフラストラクチャへの移行のためのテンプレートを提供する」[ 16 ]オープンサイエンスインフラストラクチャは、科学コミュニティの強い関与を伴う非営利で公的資金によるモデルを好む傾向があり、私有の閉鎖的なインフラストラクチャとは区別される。「オープンインフラストラクチャは多くの場合、学者主導で非営利団体によって運営され、利益主導ではなく使命主導となっている」[ 17 ]この地位は、インフラストラクチャの自律性を確保し、商業インフラストラクチャへの組み込みを防ぐことを目的としています。[ 18 ]これは、組織の管理方法に広範囲にわたる影響を及ぼします。「商業サービスと非営利サービスの違いは、環境への対応のほぼすべての側面に浸透しています。」[ 19 ]
オープンサイエンスインフラストラクチャは、科学インフラストラクチャやサイバーインフラストラクチャのより具体的なサブセットであるだけでなく、この定義に当てはまらない主体も含まれる可能性があります。Scielo、OpenEdition、Open Library of Humanitiesなどの「オープンアクセス出版プラットフォーム」は、UNESCOの定義[1]やいくつかの文献レビュー[20]、政策報告書[21]ではオープンサイエンスインフラストラクチャの不可欠な部分とみなされていますが、サイバーインフラストラクチャやeインフラストラクチャに関する政策議論では通常、別個の存在として扱われていました[ 22 ] 。 2010年の欧州委員会のeインフラストラクチャに関する報告書では、科学出版プラットフォームは「eインフラストラクチャではないが、それに密接に関連している」とされています[ 23 ] 。
オープンサイエンスのインフラストラクチャには、追加の価値観や倫理原則も組み込まれる可能性があります。サミュエル・ムーアは、まだ存在しないものの、オープンサイエンスのインフラストラクチャやコミュニティの潜在的な形態を組み込む、配慮のある学術的コモンズの形態を理論化しました。「他のプロジェクトとリソースを共有することに加えて、コモンズでは、コモンズ利用者が他のコモンズプロジェクトに対して外向きで寛大な態度を採用し、労働力を独占的なものから転換することも求められます。」[ 24 ] 2018年、オクネらは、「多様なアクター間での複数の参加形態を意図的に可能にし、(…)特定のコンテキスト内での権力関係を是正しようとする」同様の概念である「包括的な知識インフラストラクチャ」を導入しました。[ 9 ]
2015年に「オープンな学術インフラストラクチャの原則」が、オープンサイエンスインフラストラクチャの影響力のある規範的な定義を提示しました。オープンサイエンスインフラストラクチャのその後の定義と用語は、主にこの定義に基づいて詳細化されています。[ 2 ] [ 25 ] [ 26 ]この文書は、2021年11月にユネスコが保持したオープンサイエンスインフラストラクチャの定義にも影響を与えています。[ 27 ]
本原則は、インフラストラクチャ研究の枠組みと、エリノア・オストロムが提唱したコモンズの分析を融合させようとするものである。本原則は、オープンインフラストラクチャの成功にとって重要な3つの分野において、一連の提言を提示する。
本文は、これらの原則の潜在的な結果についていくつか言及して締めくくられています。著者らは、GoogleやFacebookのような大規模なウェブ商用プラットフォームとは異なる責任ある中央集権化を提唱しつつ、中央集権型インフラストラクチャの重要な利点を維持しています。「私たちは、この中央集権化を責任を持って管理する、説明責任があり信頼できる組織を構築することができるでしょう」。[ 12 ]大規模なオープンインフラストラクチャの既存の例としては、ORCID、ウィキメディア財団、CERNなどがあります。
より批判的な反応は、原則の根底にある政治哲学に焦点を当てている。[ 28 ] [ 29 ]科学コミュニティはオープンサイエンスインフラストラクチャのガバナンスの重要な部分であるが、サミュエル・ムーアはそれが決して正確に定義されていないことを強調しており、少数派グループの過小代表の潜在的な問題を引き起こしている。
これは、誰が統治し排除する権利を持つコミュニティなのか、そして彼らに条件を決定する権利を与えるものは何かという疑問を提起する。これらの疑問は、包括的または大規模に運営されるコモンズの理解にとって特に重要であり、グローバル・ノースのより強力な利害関係者、裕福な学問分野、および国々を優遇する傾向がある。このようなコモンズは、特定の状況に組み込まれ、非対称的な権力構造を持つさまざまな関係やプロジェクトに絡み合っているのではなく、政治的な真空状態にある主体を扱う。[ 30 ]

科学プロジェクトは、デジタルインフラストラクチャの最も初期のユースケースの一つでした。科学知識インフラストラクチャの理論化は、コンピューティング技術の開発よりもさらに古いものです。ポール・オトレやヴァネヴァー・ブッシュが構想した知識ネットワークは、すでにオンライン科学インフラストラクチャの多くの機能を組み込んでいました。[ 31 ]
第二次世界大戦後、米国は「定期刊行物危機」に直面した。既存の学術誌では、急速に増加する科学論文に対応できなかったからである。[ 32 ]スプートニクの打ち上げ成功後、この問題は政治的に重要なものとなった。「スプートニク危機は、図書館員の書誌管理の問題を国家の情報危機に変えた。」[ 33 ]新たに登場したコンピューター技術は、より多くの科学論文を読みやすく検索可能にするための潜在的な解決策としてすぐに検討された。外国語の出版物へのアクセスも、機械翻訳によって解決されると期待された重要な問題であった。1950年代には、特にソ連圏からの科学出版物のかなりの量が英語で入手できなかった。
ジョシュア・レーデバーグのような国立科学財団の有力メンバーは、 「中央集権型情報システム」であるSCITELの創設を提唱した。これは当初は印刷された学術誌と共存し、その効率性から徐々にそれらを完全に置き換えるものであった。[ 34 ] 1961年11月にレーデバーグがユージン・ガーフィールドに提示した計画では、このデータベースは年間最大100万件の科学論文を索引付けすることになっていた。全文検索に加えて、このインフラストラクチャは引用やその他のメタデータの索引付け、および外国語論文の自動翻訳も保証することになっていた。[ 35 ]
SCITEL計画はオンライン科学プラットフォームの主要な機能を先取りしていたものの、当時としては技術的に非現実的だった。1963年にスタンフォード研究所のダグ・エンゲルハートとチャールズ・ボーンによって開発されたオンライン検索システムの最初の動作プロトタイプは、メモリの問題によって大きく制約されており、数件の文書の1万語を超える部分をインデックス化することはできなかった。[ 36 ]

汎用出版プラットフォームの代わりに、初期の科学計算インフラストラクチャは、医学のMEDLINE 、宇宙工学のNASA/RECON、図書館検索のOCLC Worldcatなど、特定の研究分野に焦点を当てていました。「初期のオンライン検索システムのほとんどは書誌データベースへのアクセスを提供し、残りは百科事典の記事、在庫データ、または化学化合物など、別の種類の情報を含むファイルを使用していました。」[ 37 ]この初期の科学計算の発展は、社会科学を含むさまざまな分野やコミュニティに影響を与えました。「1960年代と1970年代には、定量的データ収集を調整するための12以上のサービスと専門家協会が設立されました。」[ 38 ]しかし、これらのインフラストラクチャは、研究のほとんどが専門の図書館員によって行われていたため、研究者にはほとんど見えませんでした。検索オペレーティングシステムは使用が複雑だっただけでなく、長距離通信の法外なコストを考えると、検索は非常に効率的に実行されなければなりませんでした。[ 39 ]技術的に実現可能になるためには、科学インフラは決してオープンにならず、エンドユーザーにとって根本的に隠蔽されることになった。
最初のオンラインシステムの設計者たちは、検索はエンドユーザーが行うものと想定していた。この想定がシステム設計の根底にあった。MEDLINEは医学研究者や臨床医が利用することを想定しており、NASA/RECONは航空宇宙エンジニアや科学者向けに設計されていた。しかし、多くの理由から、70年代を通してほとんどのユーザーは図書館員や訓練を受けた仲介者であり、エンドユーザーに代わって業務を行っていた。実際、一部の専門検索者は、熱心なエンドユーザーが端末にアクセスできるようにすることさえも良くない考えだと懸念していた。[ 40 ]
科学出版のためのデジタルインフラの開発は、主に民間企業によって行われた。1963年、ユージン・ガーフィールドは、レーダーバーグと共に当初構想したプロジェクトを収益性の高い事業へと転換することを目指し、科学情報研究所(ISI)を設立した。サイエンス引用索引( SCI)は、引用データのコンピュータ処理に依存していた。 20世紀末の数十年間、世界の科学出版の構造化に巨大かつ永続的な影響を与えた。その最も重要な指標であるジャーナルインパクトファクターは、「最終的に、ジャーナル間の競争市場を構築するために必要な指標ツールを提供するようになった」からである。[ 41 ]ガーフィールドはまた、SCITELで構想された中央リポジトリの簡略化された商用版として機能する科学抄録の定期刊行物であるCurrent Contentsを成功裏に立ち上げた。中央集権的な情報システムに置き換えられるのではなく、主要な科学出版社は独自の情報インフラストラクチャを開発することができ、最終的にビジネス上の地位を強化した。1960年代末までに、オランダの出版社Elsevierとドイツの出版社Springerは 、社内データとジャーナルレビューの管理をコンピュータ化し始めた。[ 42 ]
ウェブの出現まで、科学インフラの状況は断片化したままだった。[ 43 ]プロジェクトやコミュニティは、国レベルまたは機関レベルで独自の接続されていないネットワークに依存していた。「ヨーロッパでは、人々が別のネットワークプロトコルセットを追求していたため、インターネットはほとんど見えなかった」。[ 44 ]ワールドワイドウェブの発祥の地であるCERNは、独自のインターネットバージョンであるCERN-Netを持ち、電子メール交換のための独自のプロトコルもサポートしていた。[ 45 ]欧州宇宙機関は、NASAのエンジニアも使用していたRECONシステムの独自のバージョンを使用していた(ESRO/RECON)。[ 46 ]孤立した科学インフラは、ウェブの出現以前はほとんど接続できなかった。科学インフラ間の通信は、空間的に困難であるだけでなく、時間的にも困難だった。通信プロトコルが維持されなくなると、それが伝達するデータや知識も失われる可能性が高かった。「歴史研究とコンピューティングの関係は、中止されたプロジェクト、データの損失、回復不可能なフォーマットによって永続的に影響を受けてきた」[ 22 ] 。
ワールドワイドウェブは、当初はオープンな科学インフラストラクチャとして構想されました。このプロジェクトは、高エネルギー物理学の特定のニーズのためにCERNがティム・バーナーズ=リーに委託した情報管理ソフトウェアENQUIREに触発されました。ENQUIREの構造は、データの内部ウェブに近く、人、ソフトウェアモジュールなどを参照でき、作成、包含、記述などのさまざまな関係で相互接続できる「ノード」を接続していました。[ 47 ] ENQUIREは「情報間のランダムなリンクを促進する」ことはできましたが、「国際的な高エネルギー物理学研究コミュニティで望まれていたコラボレーションを促進する」ことはできませんでした。[ 48 ] 1990年代以前の重要なコンピューティング科学インフラストラクチャと同様に、ENQUIREの開発は最終的に相互運用性の欠如とネットワーク通信の管理の複雑さによって阻害されました。「Enquireはドキュメントとデータベースをリンクする方法を提供し、ハイパーテキストはそれらを表示するための共通の形式を提供しましたが、異なるオペレーティングシステムを持つ異なるコンピュータ同士を通信させるという問題が依然としてありました。」[ 44 ]
1991年8月にプロジェクトが初めて発表されたとき、ワールドワイドウェブの初期コミュニケーションでは、データの共有とデータドキュメントが主要な焦点でした 。「WWWプロジェクトは、高エネルギー物理学者がデータ、ニュース、ドキュメントを共有できるようにするために開始されました。私たちはウェブを他の分野に広げ、他のデータのためのゲートウェイサーバーを持つことに非常に興味があります。」[ 49 ]
ウェブは、より高度なコンピューティング機能を備えていた既存のオンラインインフラストラクチャを急速に凌駕しました。1991年から1994年にかけて、線虫に関する主要な生物学データベースであるワームコミュニティシステムのユーザーは、ウェブとGopherに移行しました。ウェブにはデータ検索やコラボレーションのための高度な機能は多くありませんでしたが、アクセスは容易でした。一方、ワームコミュニティシステムは、科学機関間で共有される特定の端末でのみ閲覧可能でした。「カスタム設計された強力なWCS(便利なインターフェース付き)を導入するには、作業習慣、コンピュータの使用、およびラボのリソースの交差点で不便を強いられます(…)。一方、ワールドワイドウェブは、さまざまな端末や接続からアクセスでき、インターネットコンピュータのサポートは、ほとんどの学術機関で、また比較的安価な商用サービスを通じて容易に利用できます。」[ 50 ]
当時開発されたウェブや類似のプロトコルは、科学出版物に同様の影響を与えた。オープンアクセス出版の初期の形態は、大規模な機関インフラによってではなく、小規模な取り組みによって開発された。オペレーティングシステムに関係なく普遍的にアクセスできるようになったことで、オンラインの商業科学出版が実現可能になる何年も前から、コミュニティ主導の電子ジャーナルを維持・共有することが可能になった。
80年代後半から90年代初頭にかけて、メーリングリストや(後に)ウェブ上で数多くの新しい学術誌が創刊された。Postmodern Cultures、Surfaces、Bryn Mawr Classical Review、Public-Access Computer Systems Reviewといった学術誌は、出版専門家ではなく、学者や図書館職員によって運営されていた。[ 51 ]
最初のオープンアクセスリポジトリも、個人またはコミュニティのイニシアチブでした。1991年8月、ポール・ギンスパーグは、科学論文の共有の増加に伴う学術メールボックスのストレージの問題への対応として、ロスアラモス国立研究所でarXivプロジェクトの最初の構想を作成しました。[ 52 ]
ワールドワイドウェブの発展により、既存の多くの科学インフラが時代遅れになった。また、オンラインでの貢献やネットワーク管理に対する多くの制約や障害が取り除かれ、より野心的なプロジェクトに挑戦することが可能になった。1990年代末までに、公共の科学計算インフラの構築は主要な政策課題となった。[ 53 ] 1990年代から2000年代初頭にかけてのウェブベースの科学プロジェクトの第一波は、持続可能性に関する重大な問題を露呈した。資金が特定の期間に割り当てられるため、重要なデータベース、オンラインツール、または出版プラットフォームを維持することは困難であった。[ 22 ]プロジェクトマネージャーは、「助成金と継続的な運営資金の間」の死の谷に直面した。[ 54 ]
このニーズを満たすために、いくつかの競合する用語が現れた。米国では、 2003年に米国国立科学財団(NSF)のブルーリボン委員会が科学的な文脈でサイバーインフラストラクチャを使用した。「新しい用語であるサイバーインフラストラクチャは、分散型コンピュータ、情報、通信技術に基づくインフラストラクチャを指します。インフラストラクチャが産業経済に必要であれば、サイバーインフラストラクチャは知識経済に必要であると言えるでしょう。」[ 3 ]英国やヨーロッパ諸国では、eインフラストラクチャまたはeサイエンスが同様の意味で使用された。
「多額の投資」のおかげで、[ 55 ] 2000 年代初頭の最初の政策議論から 2007 ~ 2008 年の経済危機までの間に、 Open Science Grid、BioGRID、JISC、DARIAH、Project Bambooなどの主要な国内および国際的なインフラストラクチャが設立されました。[ 22 ] [ 56 ] Open Journal Systems のような科学出版のための専門的な無料ソフトウェアが2000 年以降に利用可能になりました。この開発により、ジャーナルの Web サイトの作成と管理、および既存のジャーナルのデジタル変換が容易になり、非営利のオープン アクセス ジャーナルが大幅に拡大しました。[ 57 ] Directory of Open Access Journals に登録されている非営利ジャーナルのうち、年間作成数は 1990 年代末の 100 から 2010 年頃に 800 に増加し、それ以降は大きく変化していません。[ 58 ]
2010年までに、インフラストラクチャは「もはや初期段階」ではなく、「まだ完全に成熟しているわけでもない」。[ 55 ]ウェブの開発によりネットワーク管理に関する多くの技術的問題が解決されたものの、科学インフラストラクチャの構築は依然として困難であった。ガバナンス、関係するすべてのステークホルダー間のコミュニケーション、戦略的な相違が、成功または失敗の主要な要因であった。人文科学および社会科学のための最初の主要なインフラストラクチャの1つであるプロジェクトBambooは、最終的にその野心的な目標を達成できなかった。「初期の計画ワークショップから、プロジェクトの最終提案の試みに対するメロン財団の拒否まで、Bambooは、自らを具体的に定義することへの消極性および/または能力の欠如に悩まされた」。 [ 59 ]この明確さの欠如は、プロジェクトの発起人と、それが奉仕しようとしたコミュニティとの間の度重なるコミュニケーションの誤りによってさらに悪化した。「コミュニティは声を上げ、サービス指向アーキテクチャを強調し続けることは、Bambooが最も恩恵を与えるはずだったコミュニティのメンバー、つまり学者自身を疎外することになると明確にした」。[ 60 ] 2007年から2008年の経済危機後の予算削減は、多額の経常資金に依存する野心的なインフラ計画の脆弱性を浮き彫りにした。[ 61 ]

大手商業出版社は当初、学術出版におけるウェブの予想外の台頭に距離を置いていた。エルゼビアの経営陣は「電子出版の重要性を全く理解しておらず、したがって、それがもたらす致命的な危険、つまり科学者がジャーナルなしでやっていけてしまうという危険を理解していなかった」[ 62 ] 。購読料からの高収益の継続と業界の統合により、既存のオンラインサービスをウェブに変換することや過去のコレクションをデジタル化するための資金を調達することが可能になった。2010年代までに、大手出版社は「コンテンツ提供からデータ分析ビジネスへ移行」[ 63 ]し、科学および教育活動を管理するための新しい重要なインフラストラクチャを開発または買収した。「エルゼビアは、影響力とインフラストラクチャの所有権を学術知識生産プロセスのあらゆる段階に拡大する製品を買収し、発売した」[ 64 ] 。出版を超えて拡大したため、民間所有のインフラストラクチャの垂直統合は、日常の研究活動に広く統合されるようになった。
学術インフラの民営化による支配は、エルゼビアやシュプリンガーネイチャーなどの出版社が、投稿から出版、そしてそれ以降に至るまでの研究ライフサイクルのあらゆる側面を支配することで目指している「垂直統合」の文脈において特に顕著である。例えば、この垂直統合は、エルゼビアによるメンデレー(文献管理ソフト)、SSRN(プレプリントリポジトリ)、Bepress(大学向けリポジトリおよび出版ソフトウェアプロバイダー)などの数々の企業買収に表れている。[ 65 ]
商業科学インフラの統合と拡大に伴い、「コミュニティが管理するインフラ」を確保するための新たな要求が生じた。[ 66 ]オープンリポジトリであるDigital CommonsとSSRNがElsevierに買収されたことで、オープンサイエンスにとって重要な科学インフラの信頼性の欠如が浮き彫りになった。[ 67 ] [ 68 ] [ 69 ]欧州インフラに関するSPARCレポートは、「多くの重要なインフラが危機に瀕しており、その結果、オープンインフラを構成する製品やサービスは、大企業からの買収提案にますます誘惑されている。この脅威は、非営利のオープンインフラとクローズドインフラの両方に影響を与え、近年、SSRN、bepress、Mendeley、Githubなどの一般的に利用されているツールやプラットフォームが買収されたことで証明されている」と強調している。[ 2 ]
私有インフラの統合とは対照的に、オープンサイエンス運動は「新しい形態の知識インフラの設計において、社会構造やシステム上の制約の重要性を見落としがちである」[ 70 ] 。それは主に科学研究の内容に焦点を当てており、技術ツールの統合はほとんどなく、大規模なコミュニティイニシアチブもほとんどない。「共有リソースプールは、現在の学術コモンズイニシアチブによって統治または管理されていない。専用のハードインフラはなく、新興のコミュニティは存在するかもしれないが、正式なメンバーシップはない」[ 71 ] 。
インフラストラクチャの構築に、オープン性、コミュニティへの貢献、自律的なガバナンスの倫理原則を組み込み、小規模な地域密着型の学術ネットワークを大規模な「コミュニティ全体」の構造へと変革するためには、より正確な概念が必要でした。[ 15 ] 2013年、キャメロン・ネイロンは、共通インフラストラクチャの欠如がオープンサイエンスエコシステムの主な弱点の1つであることを強調しました。「データを保存するよりも分析をやり直す方が安上がりな世界では、研究の物質的成果の共有をサポートする可能性のある社会的、物理的、物質的インフラストラクチャを真剣に検討する必要があります。」[ 72 ] 2年後、ネイロン、ジェフリー・ビルダー、ジェニファー・リンは、科学出版物やデータセットのオープン性の向上と、それらの流通を管理するインフラストラクチャの閉鎖性との間の不一致に主に対応した一連のオープン学術インフラストラクチャの原則を定義しました。[ 12 ]
過去 10 年間、研究の主張を裏付けるデータの入手可能性をさらに確保するために、私たちは大きな進歩を遂げてきました。この取り組みはまだ完了には程遠いものです。私たちは、研究プロセス自体に関するデータも、全く同じレベルの敬意と配慮を受けるに値すると考えています。学術コミュニティは、この情報のほとんどを所有または管理していません。たとえば、書誌データや引用を収集するためのインフラストラクチャを構築または引き継ぐこともできましたが、その作業は民間企業に任されました。[ 12 ]
2015 年以降、これらの原則はオープン サイエンス インフラストラクチャの最も影響力のある定義となり、Crossref [ 73 ] 、 OpenCitations [ 74 ]、Data Dryad [ 75 ]などの主要なインフラストラクチャによって支持され、既存のオープン インフラストラクチャの制度的評価の共通基盤となっています。[ 76 ]原則の主な焦点は、ガバナンス、財政的持続可能性、技術的効率の面で重要なコミットメントを持つ「信頼できる機関」を構築し、科学コミュニティが永続的に頼ることができるようにすることです。[ 15 ]
2021 年までに、公共サービスや研究インフラは、活動やアイデンティティの不可欠な部分としてオープンサイエンスを概ね支持するようになりました。「オープンサイエンスは、新しいオンライン研究サービスが参照する主要な言説です。」[ 19 ]欧州研究インフラ戦略フォーラム(ESFRI)の 2021 年ロードマップによると、ヨーロッパの主要な既存インフラはオープンサイエンスの原則を採用しています。「ESFRI ロードマップに掲載されている研究インフラのほとんどは、オープンサイエンス運動の最前線にあり、オープンサイエンスのパラダイムに従って研究プロセス全体を変革することで、デジタル変革に重要な貢献をしています。」[ 77 ]大規模なデータ共有プログラムの例としては、欧州社会調査(社会科学)、ECRIN ERIC (臨床データ)、チェレンコフ望遠鏡アレイ(天文学) などがあります。[ 77 ]
原則の当初の意図に一致して、オープンサイエンスインフラストラクチャは「学術コミュニケーションの分野で見られる市場集中の増加に対する解毒剤として見なされている」[ 17 ] 。 2021年11月、ユネスコのオープンサイエンスに関する勧告は、オープンサイエンスインフラストラクチャを、オープンサイエンスの知識、社会主体のオープンな関与、他の知識システムとのオープンな対話とともに、オープンサイエンスの4つの柱の1つとして認め、持続的な投資と資金提供を求めた。「オープンサイエンスインフラストラクチャは、多くの場合、コミュニティ構築の努力の結果であり、それは長期的な持続可能性にとって重要であるため、非営利であり、可能な限り最大限にすべての一般市民への永続的かつ無制限のアクセスを保証する必要がある。」[ 1 ]
オープンな科学インフラストラクチャの開発は、オンライン科学研究の将来に関する議論の的となっている。2021年1月、研究者グループは、 cOAlition Sのオープンサイエンスに関する国際イニシアチブであるPlan Sの欠点と認識されたことへの対応として、Plan IまたはPlan Infrastructureを提唱した。[ 69 ] Plan Sが科学出版に焦点を当てているのとは対照的に、Plan Iは、大規模な相互運用可能なインフラストラクチャにすべての研究成果を統合することを目指している。「研究と学術は、すべての学術成果、テキスト、データ、コードを平等に扱い、オープンスタンダードとオープンマーケットに基づく情報インフラストラクチャに決定的に依存している。」[ 78 ]
オープンインフラストラクチャに関する概況報告のほとんどはヨーロッパで作成され、ラテンアメリカではそれほど多くはありません。ヨーロッパでは、主な情報源として、2020年のSPARCレポート[ 79 ] 、社会科学および人文科学インフラストラクチャに関するOPERASレポート[ 80 ] 、そして2019年のキャサリン・スキナーのレポート(北米のインフラストラクチャの一部にも及んでいる)[ 81 ]があります。国際的な研究としては、主にヨーロッパ、南米、北米からのインプットを受けている欧州委員会の2010年のEインフラストラクチャの役割に関するレポート[ 82 ]があります。
これらの報告書は、重要なオープンサイエンスのインフラストラクチャが既に存在しているにもかかわらず、資金提供者や科学政策には見えないままになっている可能性があることを強調している。「ヨーロッパ内外に代替的な実践やプロジェクトが存在するが、これらのプロジェクトは公的機関の目にはほとんど見えない」[ 83 ] 。
オープンアクセスリポジトリは、オープンサイエンスインフラストラクチャの最も一般的な形態であり[ 84 ] 、OpenDOAR [ 85 ]によると、2021年12月時点で5,791のリポジトリが存在する。
しかし、少なくとも最大規模のインフラストラクチャの間では、オープンサイエンスインフラストラクチャの役割と活動には大きな多様性が見られます。SPARC Europeが実施した欧州インフラストラクチャの調査では、回答者の95%が、研究生産の6つの段階(作成、評価、公開、ホスティング、発見、アーカイブ)のうち少なくとも3つの異なる段階でサービスを提供していると述べています。[ 86 ]集約、ホスティング、インデックス作成は、焦点に関係なく、ほとんどのオープンサイエンスインフラストラクチャに共通する特に中心的な活動です。
より高次のレベルでは専門化が進む。ネットワーク分析では「2つの主要な活動クラスター」が特定される。
標準化はオープンサイエンスインフラストラクチャの主要な機能であり、共有およびサポートするコンテンツが一貫して配布され、再利用が容易になるようにすることを目的としている。
オープンスタンダードの維持は、主要なヨーロッパのオープンインフラストラクチャが認識している主な課題の 1 つです。これは、場合によっては競合する標準の中から選択すること、および標準が正しく更新され、API やその他のエンドポイントを通じてアクセス可能であることを保証することを意味します。[ 88 ]回答者の 3 分の 2 は、主要なコンポーネントが陳腐化していないことを確認するために、過去 1 年間に技術環境の評価を実施しました。[ 89 ]この継続的な努力の結果、ほとんどのオープンインフラストラクチャは、FAIR データやPlan Sなどの新しい確立されたオープンサイエンスの標準に準拠しています。[ 89 ]
オープンサイエンスインフラストラクチャは、他のオープンサイエンスインフラストラクチャの標準を統合することが望ましい。ヨーロッパのインフラストラクチャの中では、「最もよく引用されるシステム、つまり多くの人にとって不可欠なインフラストラクチャは、ORCID、Crossref、DOAJ、BASE、OpenAIRE、Altmetric、およびDataciteであり、そのほとんどは非営利である」[ 90 ] 。Google Scholarは最初に挙げられた商用サービスであり、Elsevierが開発した主要な独自の学術検索エンジンであるScopusは、最も引用されていない主要サービスの1つである[ 91 ] 。オープンサイエンスインフラストラクチャは、現在の大部分が閉鎖的なシステムよりも優れた、「研究者中心で低コスト、革新的で相互運用可能な研究ツール」という前提を持つ、出現しつつある「真に相互運用可能なオープンサイエンスコモンズ」の一部である[ 92 ] 。
インフラストラクチャは、外部の利害関係者、特に科学出版社の選択に大きく依存している。彼らは「コンテンツプロバイダーのポリシーに依存しているため、コンテンツのオープン性について自ら決定することはない」[ 93 ] 。これはコンテンツだけでなく、「出版社によって設定され、利用可能になるものを制限するユーザーデータポリシー」にも影響を与える[ 94 ] 。
オープンサイエンスインフラストラクチャは、オープンソース運動と強い繋がりを持っています。SPARCが調査したヨーロッパのインフラストラクチャの82%は、部分的にオープンソースソフトウェアを構築したと主張しており、53%は技術インフラストラクチャ全体をオープンソースで構築しています。[ 89 ]
SPARCが調査した欧州のインフラストラクチャは、ガバナンスを潜在的な弱点として自覚している。[ 95 ]この点に関して「成熟」段階にあると考えている回答者は半数以下であり、「優れたガバナンス」が主な課題として挙げられている。[ 88 ]支援対象とするコミュニティと他の利害関係者や資金提供者との間の相互作用は特に複雑である。「特定された具体的な課題の1つは、ユーザーコミュニティのニーズに応えることと、OSIに資金援助を提供するクライアントのニーズを優先することとの間の緊張関係であった。」[ 88 ]
中央集権化と多様性の間の緊張関係は、オープンサイエンスインフラストラクチャの特徴を大きく左右する。歴史的には「中央集権型の[オープンアクセス]プロジェクト」と定義されてきたが、Redalycは「ラテンアメリカにおけるコミュニティベースの持続可能なインフラストラクチャ」になることを目指している(Berrecil)。ヨーロッパの主要なオープンインフラストラクチャは、「十分な(そして十分に多様な)代表性を確保すること」や、研究者や図書館員などの専門家コミュニティの関与に関する課題を報告している。[ 88 ]
オープンサイエンスインフラストラクチャは「幅広いステークホルダーを対象とし、サービスを提供する」[ 96 ] 。研究者は依然として主な対象であるが、Sparc Europeが調査したインフラストラクチャの半数以上では、図書館、教師、学習者が想定される対象となっている。
ヨーロッパのインフラの大部分は「グローバルな規模で運用」されており、回答者の82%が英語を主要言語としている。[ 97 ]これらのインフラは多言語対応であることが多く、特定の国の焦点を統合している。つまり、「地域的および国際的に重要なさまざまな言語コンテンツへのアクセスを提供する」のである。[ 97 ]

オープンサイエンスインフラストラクチャは、多様な分野や科学コミュニティに恩恵をもたらします。2020年、Sparc Europeが調査したヨーロッパのインフラストラクチャの72%が、すべての分野をサポートしていると主張しています。社会科学と人文科学が最も多く言及されている分野ですが、これは調査が「OPERASネットワークによって広く配布された」という事実にも一部起因しています。[ 98 ] 2010年には、社会科学と人文科学をサポートするインフラストラクチャははるかに少なく、ユースケースのほとんどは「生物科学、高エネルギー物理学、その他の物理学、地球および環境科学、コンピュータ科学、天文学および天体物理学の分野」からのものでした。[ 99 ]
多くのオープンサイエンスインフラストラクチャは、小規模インフラストラクチャがオープンサイエンスエコシステムの重要な部分であるため、「比較的低コスト」で運営されています。[ 100 ] 2020年には、調査対象となった53のヨーロッパのインフラストラクチャのうち21が「5万ユーロ未満の支出」を報告しています。[ 100 ]その結果、調査対象となったヨーロッパのインフラストラクチャの75%以上が、5 FTE以下の小規模チームによって運営されています。[ 101 ]インフラストラクチャの規模と資金の規模は、それが提供する重要なサービスに必ずしも比例しているわけではありません。「最も頻繁に使用されるサービスのいくつかは、2人から5人の小さなコアチームで何とかやりくりしています。」[ 102 ]ボランティアの貢献も重要であり、これは「OSIの持続可能性にとって強みと弱みの両方」です。[ 100 ]したがって、オープンサイエンスインフラストラクチャの状況は、学術コモンズの理論家が構想した「小規模プロジェクトの分散型ネットワーク」の理想にかなり近いものとなっています。[ 103 ]オープンサイエンスのインフラストラクチャの大部分は非営利であり[ 104 ]、民間部門からの協力や資金援助は依然として非常に限られている。[ 105 ]
全体として、2020年の欧州のインフラストラクチャは財政的に持続可能であった[ 106 ]。これは10年前の状況とは対照的である。2010年の欧州のインフラストラクチャははるかに認知度が低く、通常は「長期的な展望」を欠き、「5年以上の資金確保」に苦労していた[ 107 ] 。 2020年の欧州のインフラストラクチャは、多くの場合、各国の基金や欧州委員会からの助成金に依存している[ 105 ] 。これらの助成金がなければ、これらの主体のほとんどは「1年未満しか存続できない」だろう[ 104 ] 。しかし、調査対象となった欧州のインフラストラクチャの4分の1は、助成金や補助金を受けておらず、代替収入源または自主的な寄付を利用していた[ 100 ] 。オープンサイエンスのインフラストラクチャは「適切に定義するのが難しい」ため、資金提供機関に見過ごされる可能性があり、それが「資金確保の課題の一因となっている」[ 108 ] 。