
FAIRデータとは、2016年に初めて正式に発表された、検索性、アクセス性、相互運用性、再利用性という2016年のFAIR原則を満たすデータのことです。[ 1 ] [ 2 ]
FAIR原則は、機械による実行可能性、つまり、人間の介入がまったくないか最小限でデータを見つけ、アクセスし、相互運用し、再利用する計算システムの能力を重視しています。これは、データの量、複雑さ、および生成速度の増加の結果として、人間がデータを扱うために計算支援にますます依存するようになっているためです。これらの原則は、従来の意味でのデータだけでなく、そのデータにつながるアルゴリズム、ツール、およびワークフローにも適用されるように設計されています。すべての学術的なデジタル研究オブジェクトは、透明性、再現性、および再利用性を確保するために研究プロセスのすべてのコンポーネントが利用可能である必要があるため、これらの原則の適用から恩恵を受けます。[ 3 ]
FAIR/Oデータという略語は、問題のデータセットまたはデータベースがFAIR原則に準拠しており、かつ明示的なデータ対応オープンライセンスも付与されていることを示すために使用されることがあります。
データの再利用の第一歩は、データを見つけることです。メタデータとデータは、人間とコンピュータの両方にとって簡単に見つけられる必要があります。機械可読メタデータは、データセットとサービスの自動発見に不可欠です。[ 3 ]
ユーザーが必要なデータを見つけたら、認証や認可を含めて、そのデータにアクセスする方法を知る必要があります。[ 3 ]
データは通常、他のデータと統合する必要があります。さらに、データは分析、保存、処理のためのアプリケーションやワークフローと相互運用する必要があります。[ 3 ]
FAIRの究極の目標は、データの再利用を最適化することです。これを実現するには、メタデータとデータを適切に記述して、異なる環境で複製および/または組み合わせられるようにする必要があります。[ 3 ]
これらの原則は、データ(またはあらゆるデジタルオブジェクト)、メタデータ(そのデジタルオブジェクトに関する情報)、およびインフラストラクチャという3種類のエンティティに言及しています。例えば、原則F4では、メタデータとデータの両方が検索可能なリソース(インフラストラクチャコンポーネント)に登録またはインデックス化されることが定義されています。
適切なデータ管理はそれ自体が目的ではなく、知識の発見と革新、そしてデータ公開後のコミュニティによるデータと知識の統合と再利用へとつながる重要な手段です。科学研究資金提供機関、出版社、政府機関は、公的資金による実験で生成されたデータについて、データ管理およびデータ管理計画をますます強く求めるようになっています。
FAIR 以前は、2007 年の OECD レポート[ 4 ]が、データアクセス可能性に関連する同様のアイデアを論じた最も影響力のある論文でした。2014 年 1 月、ライデン大学のローレンツ センターは、「データ FAIRPORT の共同設計」 [ 5 ] と題したワークショップを開催し、参加者はそこで初めて FAIR 原則を策定しました。FORCE11コミュニティのメンバーによって設立された FAIR 専門ワーキング グループが、その後、原則を微調整および改善しました。それらは Scientific Data の 2016 年 3 月号に掲載されました。[ 6 ]
FAIR原則の際立った特徴は、他の多くの取り組みと比べて、人間主導の活動と機械主導の活動の両方に等しく注意を払っている点です。ウェブ上でデータを検索・処理しようとする際に、人間と機械はそれぞれ異なる障壁に直面します。人間は、文脈上の手がかりを識別・解釈できるため、デジタルオブジェクトの意味や意図といった意味論を直感的に理解できます。しかし、人間の最大の限界は、現代の科学データが要求する範囲、規模、速度で処理できないことです。そのため、人間は、発見や統合といった作業を代行してくれる計算エージェントにますます頼るようになっています。
「機械が実行可能」という表現は、デジタルオブジェクトが自律的に動作する計算データエクスプローラーにますます詳細な情報を提供する、可能な状態の連続体を示しています。機械がデジタルオブジェクトを完全に理解し、自律的に正しく操作できる最適な状態は、めったに達成されないかもしれません。しかしながら、FAIR原則は、機械が実行可能になるための道筋に沿ったステップを提供します。FAIR原則を全体または一部採用することで、リソースはこの連続体に沿って最適な状態へと導かれます。[ 1 ]
FAIR原則は意図的に概念的なものであり、具体的な実施方法やガイドラインを規定していません。そのため、デジタル資産のあらゆるレベル(メタデータ、データ、関連データサービスなど)にFAIR原則を適用できるため、デジタルオブジェクトのFAIR性を評価する際に課題が生じます。
研究データアライアンス(RDA)のFAIRデータ成熟度モデルワーキンググループ[ 7 ] は、2020年に仕様を公開し、FAIR原則を41の指標に分解し、データとメタデータの両方について各原則にコンテキストと具体性を追加し、該当する場合は機械可読性とコミュニティ採用に関する追加指標を追加しました。[ 8 ]
これを踏まえ、欧州委員会の共同研究センター(JRC)は2025年にFAIRデータガイドライン[ 9 ]を発表し、これらの指標をJRCデータエコシステムに特化した5つの段階的な成熟度レベルに整理しました。これらのレベルは、評価尺度としてではなく、データ発行者がどのような行動が必要で、どのような次のステップが可能かを評価するのに役立つ実践的なフレームワークとして設計されています。
・FAIR原則に基づくスタート ― 基本レベル。データは必須メタデータ要素が記録されたデータカタログに公開される。検索性とアクセス性は、機関プラットフォームを通じて確保される。データ自体は、機械による再利用を前提とした構造になっていない場合がある。
• フェアプレイ — データセットと関連リソース(出版物、ソースデータ、バージョン、視覚化)間のリンクを追加し、メタデータの出所情報と相互参照を強化することで、ベースラインを拡張します。
・FAIR原則 — データは、メタデータに明示的に宣言された関連するコミュニティ標準を使用してエンコードおよび構造化されます。データモデルと用語は定義されますが、必ずしも機械可読形式である必要はありません。このレベルでは、データ辞書とテキストによる説明が許容されます。
・公平な共有 ― データモデルは機械可読形式(例:JSON Schema、XML Schema、SHACL、ShExを使用)であり、データ用語は機械可読なデータ辞書を参照します。ソースデータや変換プロセスなど、来歴は詳細に文書化されています。
・FAIR原則の最高レベル。データモデルは機械可読であり、関連する科学分野のコミュニティによって承認および維持されています。用語と概念は、そのコミュニティで共有されているFAIR語彙を使用して公開され、機械エージェントによる最大限の相互運用性と再利用を可能にします。
JRCのガイドラインでは、データのFAIR原則への準拠は静的な作業ではないと指摘しています。ある時点でFAIR原則に準拠しているデジタル資産も、技術的および社会的な変化に伴い、その状態が変化する可能性があります。標準規格、プラットフォーム、プロトコル、その他の要因によって、積極的に維持管理を行わないと、データのFAIR性レベルが時間とともに低下する可能性があります。また、ガイドラインでは、すべてのデータセットが最高レベルの成熟度を目指す必要はないことも認めています。適切なレベルは、データのキュレーションが行われる目的と、想定される再利用の範囲によって異なります。
2016年のG20杭州サミットで、G20首脳はFAIR原則を研究に適用することを支持する声明を発表した。[ 10 ] [ 11 ]また、2016年には、オーストラリアの複数の組織が、FAIR原則をより一般的に研究成果に拡大することを目的とした「オーストラリアの研究成果へのFAIRアクセスに関する声明」を作成した。[ 12 ] 2017年には、ドイツ、オランダ、フランスがFAIRイニシアチブを支援する国際事務所、 GO FAIR国際支援調整事務所を設立することに合意した。 [ 13 ] [ 14 ]

CODATAやResearch Data Alliance(RDA)など、研究データエコシステムで活動している他の国際組織も、コミュニティによるFAIRの実装を支援しています。FAIR原則の実装評価は、RDAのFAIRデータ成熟度モデルワーキンググループによって検討されています[ 8 ]。CODATAの戦略的10年計画「Data for Planet: Making data work for cross-domain challenges」[ 15 ]では、 FAIRデータ原則がデータ駆動型科学の基本的な実現要因として言及されています。欧州研究図書館協会は、 FAIR原則の使用を推奨しています[ 16 ] 。
欧州委員会の欧州データ戦略[ 17 ]は、データセットのより調和のとれた記述と概要を実現し、データの相互運用性を促進するための重要な手段としてFAIR原則を特定しています。Horizo n Europeの資金提供を受けるすべての者は、オープンデータに関するガイドラインを遵守する必要があります。具体的には、この枠組みで生成されるすべてのデータは、デフォルトでFAIRでなければなりません。
2020 年 1 月、世界中の 9 つの大学グループの代表者が、研究データの権利に関するソルボンヌ宣言[ 18 ]を発表し、その中には FAIR データへのコミットメントが含まれており、政府にそれを可能にするための支援を提供するよう求めました。[ 19 ] 2021 年、研究者らは、FAIR 原則をデータカタログ ソフトウェア ツールの概念的構成要素として特定し、他の構成要素はメタデータ管理、ビジネス コンテキスト、およびデータ責任の役割であるとしました。[ 20 ] 2022 年 4 月、Matthias Scheffler 氏らはNature 誌で、データ マイニングと人工知能がデータから有用な科学情報を抽出できるように、FAIR 原則は「必須」であると主張しました。 [ 21 ]地球科学では、10 進ジオレファレンシングを使用して FAIR データを確立する動きがありました。 [ 22 ]
FAIRデータの提唱者による2017年の論文では、FAIRの概念に対する認識は様々な研究者や機関の間で高まっているものの、異なる人々がそれぞれ異なる視点を適用しているため、概念の理解が混乱しているという報告がなされている。[ 23 ]
FAIRデータプラクティスの実装に関するガイドでは、FAIRデータプラクティスに準拠したデータ管理計画のコストは、研究予算総額の5%であるべきだと述べられています。[ 24 ]
2019年、グローバル先住民データアライアンス(GIDA)は、補完的なガイドとして先住民データガバナンスのためのCARE原則を発表しました。CARE原則は、 FAIRフレームワークを拡張し、集団的利益、管理権限、責任、倫理を含み、データガイドラインが歴史的背景と権力格差に対処することを保証します。CARE原則は、2018年11月にボツワナのハボローネで開催された国際データウィークと研究データアライアンス総会の共催イベントで作成されました。[ 25 ]
欧州オープンサイエンスクラウド(EOSC)もまた、FAIRコミュニティの重要なメンバーとなっています。EOSC協会の戦略目標の一つは、公的資金による研究データをデフォルトでFAIR原則に準拠させることです。
データ(および研究成果)をFAIRにすることは困難な作業であり、FAIR性を評価することも困難です。2020年に、データ成熟度モデルワーキンググループ[ 7 ] FAIRは、FAIR性を評価するためのガイドラインを発表しました[ 8 ] 。その後、FAIR成熟度評価サービス(FAIRSharing) [ 26 ]やF-UJI自動FAIRデータ評価ツール(FAIRsFAIR)[ 27 ]など、多数の評価ツールが開発されました。
相互運用性は特に複雑です。ネットワークインフラストラクチャを介してシステムが通信できること、エンコード形式を解釈できること、交換されるデータの意味を理解できることなど、さまざまな問題に対処する必要があります。データの種類によって固有の特性が異なるため、すべてのデータが同じエンコード形式を使用できるわけではなく、同じ形式であっても、構造や意味が異なる場合があります。類似した種類のデータについては、同じドメイン関連のコミュニティ標準を採用することが、相互運用性を向上させる最も効果的なアプローチです。
統制されたFAIR語彙は、相互運用性の向上において極めて重要な役割を果たします。特定のコミュニティや分野に合わせて構築されたこれらの構造化された用語と概念のセットは、多様なステークホルダー間のデータ交換を促進する共通語として機能します。共通の用語と定義を確立することで、これらの語彙は曖昧さを最小限に抑え、異なるシステムやアプリケーション間で情報が一貫して解釈されることを保証します。シソーラス、タクソノミー、オントロジーといったより複雑な語彙は、データが作成された元のコンテキストを超えた、より深い洞察を引き出すことができます。
地球科学分野でも、十進数ジオレファレンシングを用いてFAIRデータを確立しようとする動きが見られる。研究者たちは、メタデータ管理、ビジネスコンテキスト、データ責任の役割と並んで、FAIR原則をデータカタログソフトウェアツールの概念的な構成要素として位置づけている。
{{cite web}}: CS1 maint: 数値名: 著者リスト (リンク)