NCSAブラウンドッグは、大規模な科学研究の長期的な存続可能性を維持するために保存された過去の研究データに簡単にアクセスする方法を開発する研究プロジェクトです。これは、国立科学財団(NSF)の資金提供を受けている国立スーパーコンピューティング応用センター(NCSA)によってサポートされています。[1]
歴史
Brown Dog は、2008 年に NSF が資金提供したDataNetパートナー プログラムの一部です。DataNetは、科学、工学、教育のデジタル化とデータ集約化が進む状況に対応するために考案されました。Brown Dog は、DataNet をサポートするソフトウェアの構築に重点を置いた、 Data Infrastructure Building Blocks (DIBBs)と呼ばれる後続の取り組みの一部です。このプロジェクトは、NCSA とイリノイ大学アーバナシャンペーン校の研究者、およびボストン大学とノースカロライナ大学チャペルヒル校の研究者によって提案されました。
非構造化、非キュレーション、ロングテールデータ
科学データの多くは、小規模で、構造化されておらず、整理もされていないため、簡単に共有できません。このようなデータは、「ロングテール」データと呼ばれることもあります。これは統計用語を借用したもので、プロジェクト規模の分布の末端を指します。小規模プロジェクトの大半は、生成したデータを適切に管理するためのリソースが不足しています。このいわゆる「ロングテール」データは、過去も現在も、多くの研究分野で将来の研究に役立つ可能性があります。このデータの多くは、ソフトウェアやファイル形式の旧式化によりアクセスできなくなっています。その結果、古い研究のデータを確認できなくなり、科学研究プロジェクト全体が混乱します。[2]
アプローチ
Brown Dog は、自らをソフトウェアの「スーパー雑種」と称しています[3] (そのため「Brown Dog」という名前が付けられています)。インターネット上のデジタル データ コンテンツをインターフェイスする低レベルのデータ インフラストラクチャとして機能します。そのアプローチは、存在するあらゆる自動化されたヘルプ (つまりソフトウェア) を堅牢かつ出所を保持する方法で使用して、このデータを可能な限り処理できるサービスを作成することです[4] 。このプロジェクトは、その作業のより広範な影響を、一般の人々に対して一種の「データ用の DNS」として役立つ可能性にあると考えています。その目標は、すべてのデータとすべてのファイル形式を、今日の Web ページと同じくらいアクセス可能にすることです。
テクノロジー
Brown Dog は、ファイル形式の変換を支援するデータ アクセス プロキシ (DAP) とファイル コンテンツからメタデータを自動的に抽出するデータ ティリング サービス (DTS) という 2 つのサービスを開発することで、整理されていない非構造化データ コレクションの使用に伴う問題に対処しようとしています。開発が完了すれば、研究者や一般ユーザーは、Brown Dog ツール カタログからブラウザー プラグインやその他のツールをダウンロードできるようになります。[1] [5]
データ耕作サービス
データ ティリング サービス (DTS) を使用すると、ユーザーは既存のファイルを使用してデータ コレクションを検索し、コレクション内の他の類似ファイルを発見できます。サンプル ファイルをドロップできる構成済みブラウザーに DTS 検索フィールドが追加されます。これにより、DTS は、ドロップされたファイルに類似するファイルについて、指定されたURLのすべてのファイルを検索します。たとえば、オンライン画像コレクションを参照しているときに、ユーザーが 3 人の画像を検索フィールドにドロップすると、DTS はコレクション内で 3 人の人物を含むすべての画像を返します。DTS は、外部ファイル形式を検出すると、DAP を使用してファイルをアクセス可能にします。また、DTS はデータのインデックスを作成し、ファイルとコレクションにメタデータを抽出して追加するため、ユーザーは、検出しているデータのタイプをある程度把握できます。
このサービスはポート 9443 で実行されます。
データ アクセス プロキシ
データ アクセス プロキシ (DAP) を使用すると、ユーザーは、他の方法では読み取り不可能なデータ ファイルにアクセスできるようになります。インターネット ゲートウェイやドメイン ネーム サービスと同様に、DAP 構成はユーザーのマシンとブラウザーの設定に入力されます。HTTP 経由のデータ要求は、まず DAP によって検査され、ネイティブ ファイル形式がクライアント デバイスで読み取り可能かどうかが判断されます。読み取り可能でない場合、DAP はファイルをクライアント マシンで読み取り可能な最適な形式に変換します。または、ユーザーが希望する形式を自分で指定することもできます。
このサービスはポート 8184 で実行されます。
ユースケース
Brown Dog は、EarthCube 研究コミュニティ内のグループによって提案された 3 つのユースケースを対象としています。これらのコミュニティの開発者と研究者は、地球科学、工学、生物学、社会科学にわたるユースケースに協力して取り組みます。
生態学と地球変動生物学におけるロングテール植生データ
このユースケースは、ボストン大学のマイケル・ディーツェ氏が主導しています。
植生の豊かさ、種の構成、サイズ構造に関するデータは、生態学、保全、天然資源管理、地球変動生物学の幅広い分野にとって極めて重要です。しかし、これらの分野の差し迫った問題の多くに対処するには、陸上生物圏と水文学モデルが、存在するもののほとんどアクセスできない大量のロングテールデータを同化できる必要があります。ブラウンドッグチームは、ディーツェ研究室の研究者と協力して、数十年にわたって収集された小規模な研究指向の植生データセットの膨大な量と、1785年に遡る公共土地調査データに埋め込まれた歴史的植生データの収集を促進します。このデータは、モデルの初期条件として、他の大規模なデータセットの意味を理解し、モデルの調整と検証に使用されます。[1] [6]
雨水と人間の要件を考慮したグリーンインフラの設計
このユースケースは、イリノイ大学アーバナ・シャンペーン校のバーバラ・ミンスカー氏、イリノイ大学アーバナ・シャンペーン校のウィリアム・サリバン氏、イリノイ大学アーバナ・シャンペーン校のアーサー・シュミット氏が主導しています。
このケーススタディでは、雨水管理と生態系、人間の健康と幸福の要件を統合した新しいグリーンインフラ設計基準とモデルの開発に取り組んでいます。緑地の設計に関連する科学的および社会的問題に対処するには、データのアクセス性と可用性が大きな課題です。この研究では、シカゴ市内のグリーン健康地区計画地域のうち、既存の下水道の性能が最も不十分で、グリーンインフラによる不浸透性エリアの変更がサービスが行き届いていない近隣地域に有益となる特定の地域に焦点を当てます。ブラウンドッグは、人間の景観の好みと健康への影響に関するロングテール実験データを抽出するために使用されます。このデータは、ブラウンドッグテクノロジーを使用して陸上生物圏モデルと雨水モデルにリンクされる人間の健康影響モデルの開発に使用されます。[1]
クリティカルゾーン研究の開発と応用
このユースケースは、イリノイ大学アーバナ・シャンペーン校のPraveen Kumar氏が主導しています。
クリティカル ゾーン(CZ) は、樹木のてっぺんから岩盤まで広がる地球の「皮膚」で、微生物からバイオームまでさまざまな規模で機能する生命プロセスによって形成されます。クリティカル ゾーンは、すべての陸上生物システムを支えています。その上部はバイオ マントルです。ここは、陸上生物が生息し、繁殖し、エネルギーを使用および消費する場所であり、その廃棄物や残骸が蓄積して分解する場所です。クリティカル ゾーンは土壌を囲み、土壌はジオメンブレンとして機能し、水や溶質、エネルギー、ガス、固体、生物が大気、生物圏、水圏、岩石圏と相互作用します。気候や森林破壊から農業、放牧、人間の開発まで、さまざまな要因がこのバイオダイナミック ゾーンに影響を及ぼします。これらの影響を理解して予測することは、土壌の肥沃度、水の浄化、食糧資源の生産、さらに大規模な地球規模の炭素循環と炭素隔離など、重要な生態系サービスを管理および維持する上で重要です。 CZ は、陸地表面と地表付近の環境を統合するための統一的な枠組みを提供し、非常に異なる時間的および空間的スケールで発生する生物学的および化学的プロセスと人間の影響の複雑なネットワークを反映しています。これらのデータの性質は、データ製品とモデルの多様性と数の統合が障壁となっているため、CZ の学際的研究にとって大きな課題を生み出しています。一方、CZ データは、ブラウン ドッグ テクノロジーの定義、テスト、実装の優れた機会を提供します。このコンテキストでは、「非構造化」データは、時間的および学問的遺産を反映する形式の異種データのコレクション、明確に定義されたメタデータとセンサー特性のない新興の低コストのオープン ハードウェア ベースのセンサーと組み込みセンサー ネットワークからのデータ、およびマップ、画像、テキストとして利用できるデータで構成されると広く見なされています。[1]
NSF賞
CIF21 DIBBs: ブラウンドッグは2013年冬に授与され、開始日は2013年10月1日でした。推定有効期限は2018年9月30日です。[7]
賞金は 10,519,716 ドルで、DIBB の賞金としては最高額です。主任研究者は、イリノイ大学アーバナ・シャンペーン校 NCSA の Kenton McHenry 氏です。共同リーダーは、NCSA/UIUC の Jong Lee 氏、イリノイ大学アーバナ・シャンペーン校土木環境工学の Barbara Minsker 氏、イリノイ大学アーバナ・シャンペーン校土木環境工学の Praveen Kumar 氏、ボストン大学地球環境学部の Michael Dietze 氏です。
参考文献
- ^ abcde 「Brown Dog」。NCSA Brown Dog 。 2014年7月31日閲覧。
- ^ 「DataUp - 科学のロングテールのためのデータキュレーション」。Microsoft Research Connections ブログ。Microsoft Research Connections チーム。2014年8 月 7 日閲覧。
- ^ Woodie, Alex (2014 年 1 月 6 日). 「NCSA プロジェクトは、データ用の DNS のようなサービスの作成を目指しています」. datanami . 2014 年8 月 7 日閲覧。
- ^ Pletz, John (2013 年 12 月)。「U of I の研究者、ビッグデータの傾向を探る「スーパー雑種犬」に数百万ドルを調達」シカゴ ビジネス。Crain Communications, Inc. 2014 年8 月 7 日閲覧。
- ^ Jewett, Barbara. 「DATA SET FREE」. NCSA Access Magazine . NCSA . 2014年8月7日閲覧。
- ^ 「ボストン大学の科学者と協力者が、キュレーションされていないデータ用のソフトウェアを開発するために 1,050 万ドルの助成金を獲得」www.newswise.com。ボストン大学芸術科学部。2014年8 月 7 日閲覧。
- ^ 「Award#1261582 - CIF21 DIBBs: Brown Dog」. nsf.gov . 2014年7月31日閲覧。
外部リンク
- 公式サイト
