
高性能統合仮想環境(HIVE) は、次世代シーケンシング(NGS) データ、前臨床、臨床、市販後データ、有害事象、メタゲノムデータなどの分析を含む、ヘルスケア IT および生物学研究に使用される分散コンピューティング環境です。 [1] 現在、米国食品医薬品局 (政府ドメイン)、ジョージワシントン大学 (学術ドメイン)、DNA-HIVE、WHISE-Global、Embleema (商用ドメイン) によってサポートされ、継続的に開発されています。HIVE は現在、米国 FDA 内で完全に機能しており、多種多様な (60 を超える) 規制研究および規制レビュー プロジェクトをサポートしているほか、MDEpiNet 医療機器市販後レジストリをサポートしています。HIVE の学術的展開は、NGS 分析、がん研究、マイクロバイオーム研究の研究活動や出版、および GWU の学生向け教育プログラムに使用されています。商業企業は、腫瘍学、微生物学、ワクチン製造、遺伝子編集、ヘルスケア IT、実世界データの調和、前臨床研究および臨床研究に HIVE を使用しています。
インフラストラクチャー
HIVE は、分散ストレージ ライブラリと分散コンピューティング パワーハウスがシームレスにリンクされた、超並列分散コンピューティング環境です。 [2]このシステムは、ストレージとメタデータデータベースの両方を同じネットワーク上に 維持することで、堅牢性と柔軟性の両方を実現しています。 [3]ソフトウェアの分散ストレージ レイヤーは、ファイルとアーカイブの管理の主要コンポーネントであり、デポジション パイプラインのバックボーンです。データ デポジション バックエンドにより、外部データセットを HIVE データ リポジトリに自動的にアップロードおよびダウンロードできます。メタデータ データベースを使用すると、システムに取り込まれた非常に大きなファイル (ビッグ データ) に関する特定の情報や、システムで実行される計算に関連するメタデータを維持できます。このメタデータにより、将来、実験を検証または複製するために、計算パイプラインの詳細を簡単に呼び出すことができます。メタデータは計算に関連付けられているため、システム内のあらゆる計算のパラメーターを保存し、手動で記録を保持する必要がなくなります。[要出典]
HIVE が他のオブジェクト指向データベースと異なる点は、HIVE があらゆる種類のデータを検索、表示、操作するための統合APIのセットを実装していることです。このシステムは、セキュリティ サブシステムに多数のルールを作成することなく、きめ細かな方法でデータ アクセス権限を決定できる、非常に安全な階層型アクセス制御および許可システムも実現しています。機密データ用に設計されたセキュリティ モデルは、HIVE のFISMA中程度のシステムとしての指定に準拠した包括的な制御および監査機能を提供します。[4]
HIVEの技術力
- データ取得: HIVE は、ローカル、クラウドベース、ネットワーク ストレージ、シーケンシング機器、http、ftp、sftp リポジトリなど、さまざまなソースからデータを取得できます。さらに、HIVE は、NIH/NCBI などの既存の大規模データ プラットフォームとの高度なハンドシェイク プロトコルを実装し、ユーザーに代わって大量の参照ゲノム データまたはシーケンス読み取りデータを簡単かつ正確にダウンロードします。
- データ ウェアハウス: HIVE ハニカム データ モデルは、科学的なデータタイプの複雑な階層を採用するために特別に作成され、オブジェクト指向データ モデルのフレームワーク内でデータの標準化と出所のプラットフォームを提供します。統合データ エンジンであるハニカムを使用することで、HIVE は生物医学計算の正確性に貢献し、生物計算プロセスの再現性と調和を確保するのに役立ちます。
- セキュリティ: HIVE-honeycomb は階層型セキュリティ制御システムを採用しており、多数のルールでセキュリティ サブシステムに負担をかけることなく、アクセス権限を非常に細かく決定できます。PII のオンザフライ暗号化/復号化を提供し、規制 FISMA 中程度の環境で動作することが許可されているシステムに要求される最高のセキュリティ プロトコルに準拠しています。

- 統合: HIVE は、あらゆる種類のデータと計算を検索、編集、表示、保護、共有、および操作するための統合アプリケーション プログラム インターフェイス (API) を提供します。インテグレーター プラットフォームとして、HIVE は開発者に、汎用適応フレームワークを使用して既存のほぼすべてのオープン ソースまたは商用ツールを開発 (C/C++、Python、Perl、JavaScript、R) および統合し、コマンド ライン ツールを統合する手段を提供します。さらに、セッション制御の Web API は、リモート ユーザーに代わって HIVE がデータ品質管理と複雑な計算を実行するようにする手段を提供します。現在、HIVE には数十のビッグ データ分析ツールが実稼働しており、さらに数十のツールが開発中です。これらには、細菌、ウイルス、ヒトの生殖細胞系列および体細胞プロファイル、準種、感染症、病原体を研究するための DNA、RNA、トランスポゾン、チップ、免疫シーケンシング、デノボ アセンブリ、集団ゲノミクス メタゲノム シーケンシング、差分プロファイリング、統計、分類、およびクラスタ化ユーティリティが含まれますが、これらに限定されません。
- 計算: 多くの仮想コンピューティング環境とは異なり、HIVE はプロセスではなくサービスを仮想化します。ハードウェア、ソフトウェア、およびユーザーが要求する計算タスクの間に、非依存の抽象化レイヤーを導入することで、計算をサービスとして提供します。データをコンピューティング コアに移動するのではなく、計算をデータの近くに再配置するという新しいパラダイムは、ネットワーク インフラストラクチャを介したタスクとデータの最適なフローの鍵であることが証明されています。
- 視覚化: HIVE は、データ駆動型ドキュメント コンテキスト内で HTML5、SVG、D3JS などのテクノロジを使用して、多数の科学的視覚化コンポーネントを提供します。JSON や CSV ベースの通信プロトコルで提供されるネイティブ データとメタデータ、および計算結果は、インタラクティブでユーザー主導のカスタマイズ可能なツールを生成するために使用され、バイオインフォマティクス担当者は Web ブラウザーのみを使用してテラバイト単位の超大容量データを操作できます。
HIVEオープンソース
FDA は、NGS 分析のエンドツーエンドのニーズをサポートするプラットフォームとして HIVE Open Source を立ち上げました。https://github.com/FDA/fda-hive
HIVE バイオコンピューティング調和プラットフォームは、規制科学のための高スループット シーケンシング計算標準 (HTS-CSRS) プロジェクトの中核です。その使命は、科学コミュニティにバイオコンピューティングの調和、相互運用性の促進、バイオインフォマティクス プロトコルの検証を行うフレームワークを提供することです (https://hive.biochemistry.gwu.edu/htscsrs)。詳細については、FDA 外部研究ページのプロジェクトの説明を参照してください (https://www.fda.gov/ScienceResearch/SpecialTopics/RegulatoryScience/ucm491893.htm)。
HIVEアーキテクチャ

- ハードウェアアーキテクチャ: HIVE のコアには、いくつかの冗長な重要なコンポーネントとスケーラブルなコンピューティングおよびストレージユニットで構成された堅牢なバックボーンハードウェアが存在します。右の図は、このような HIVE クラスターの接続性とコンポーネントの割り当てを示しています。HIVE クラウドの重要な機能を提供するコアコンポーネントには、次のものがあります。
- ウェブポータル機能をサポートするために、ハイエンドの安全なファイアウォールを介して外部に面しているウェブサーバー。
- クラウド サーバーは、複雑なキューイングと優先順位付けのスキーマを通じて分散ストレージと計算ワークフローを調整する中核的な機能ユニットです。
- 高可用性ドローン ハードウェアは、科学的な視覚化とユーザー インターフェイス サポート機能のための計算ユニットとして機能します。
- 超高速プロセス間通信ストレージ ユニットは、分散計算、データ交換、ステージング アリーナを整理します。
- スイッチとファイアウォール ハードウェアにより、HIVE クラウドの安全で高性能なネットワーク環境が構築されます。
- それぞれの永久ストレージ ユニットは、数百テラバイトの NGS データと参照ゲノムを保存するだけでなく、計算結果と個人のユーザー ファイルを保存するように設計されています。
スケーラブルで高性能、高密度のコンピューティング コアのサブ クラスターは、NGS アルゴリズムの超大規模な分散並列コンピューティングの原動力として機能します。システムは非常にスケーラブルで、単一の HIVE インボックス アプライアンスから数千のコンピューティング ユニットの大規模なエンタープライズ レベルのシステムまで、さまざまな展開インスタンスがあります。
- ソフトウェア アーキテクチャ: HIVE ソフトウェア インフラストラクチャは、段階的に機能を提供するレイヤーで構成されています。

- カーネル バックボーン レイヤーは、異機種ハードウェアおよびオペレーティング システム プラットフォームとの統合を提供します。
- HIVE クラウド バックボーンは、分散ストレージ、セキュリティ、コンピューティング環境をサポートします。
- サイエンスバックボーンは、化学、生物学、統計学、その他の純粋に科学的な概念のためのさまざまな科学的計算、数学的装置を実行するための低レベルの科学ライブラリのセットを表します。
- CGI および Java スクリプト レイヤーは、Web ポータルと Web アプリケーションの互換性レイヤーを提供します。
- 低レベル ライブラリは、ツールやユーティリティを開発するためのアプリケーション プログラミング インターフェイス (API) を提供します。
- 統合アプリは主要なNGSツールの武器庫を提供する
- WebアプリとHIVEポータルはWebポータル機能を提供します
公開プレゼンテーション
- ヴァハン・シモニャン博士とラジャ・マズムダー博士は、NIHフロンティア・イン・データサイエンス[5]で、研究と規制分析の橋渡しとして機能するHIVEについて発表しました。[6] [7] シモニャンは、2014年のバイオITワールドエキスポでもこのトピックについて発表しました。[8]
- HIVEについてはFedScoopでもさらに議論された。[9]
- FDAのマルチオミクスコンピューティングアーキテクチャHIVEの内部、BioIT World。[10]
参考文献
- ^ Simonyan, Vahan; Mazumder, Raja (2014). 「ビッグデータ分析のための高性能統合仮想環境 (HIVE) ツールとアプリケーション」。Genes . 5 (4): 957– 81. doi : 10.3390/genes5040957 . PMC 4276921 . PMID 25271953。
- ^ https://hive.biochemistry.gwu.edu/help/HIVEWhitePaper_12_16_2014.pdf [全文引用が必要]
- ^ https://hive.biochemistry.gwu.edu/help/HIVEInfrastructuresUK.pdf [全文引用が必要]
- ^ Wilson, CA; Simonyan, V. (2014). 「FDA による「次世代」シーケンシング技術の規制適用支援活動」PDA Journal of Pharmaceutical Science and Technology . 68 (6): 626– 30. doi :10.5731/pdajpst.2014.01024. PMID 25475637. S2CID 37583755.
- ^ 「NIH ログインユーザー名とパスワードまたは PIV カード認証」。2016 年 1 月 1 日時点のオリジナルよりアーカイブ。2016年 2 月 1 日閲覧。
- ^ 「NIH VideoCast - 高性能統合仮想環境 (HIVE): 規制 NGS データ分析プラットフォーム」。2016 年 1 月 29 日。
- ^ 「NIH ログインユーザー名とパスワードまたは PIV カード認証」。2016 年 1 月 1 日時点のオリジナルよりアーカイブ。2016年 2 月 1 日閲覧。
- ^ スタッフ (2014)。「2014-BIT-パンフレット」(PDF)。2014 Bio-IT World Expo。ケンブリッジヘルステック研究所。p. 6 (col 2) 。2016 年6 月 15 日閲覧。
(タイトル) ビッグデータ分析のための高性能統合仮想環境 (HIVE) インフラストラクチャ: 次世代シーケンシング情報科学への応用
- ^ http://fedscoop.com/fdas-examines-nextgen-sequencing-too [全文引用が必要] l
- ^ 「バイオITワールド」。
外部リンク
- HIVEのパブリックバージョンはhttps://hive.biochemistry.gwu.edu/dna.cgi?cmd=aboutにあります。
