![]() | |
| コンテンツ | |
|---|---|
| 説明 | ヌクレオチド配列、注釈、関連データの包括的なアーカイブ。 |
キャプチャされたデータの種類 | ヌクレオチド配列、機能注釈、シーケンス読み取りとシーケンサー情報、サンプルの詳細、その他の関連レコード。 |
| 生物 | 全て |
| 接触 | |
| 研究センター | 欧州バイオインフォマティクス研究所 |
| 研究室 | パンダグループ |
| 主な引用 | 20972220 の検索結果 |
| 発売日 | 1982年4月 |
| アクセス | |
| データ形式 | XML FASTQ EMBL-Bank 形式 |
| Webサイト | エナ |
| ダウンロードURL | ENA ダウンロード |
| ウェブサービスURL | ENAブラウザ |
| ツール | |
| スタンドアロン | CRAM ツールキット |
| その他 | |
| ライセンス | 制限なし |
欧州ヌクレオチドアーカイブ(ENA )は、注釈付きのDNAおよびRNA配列への無料かつ無制限のアクセスを提供するリポジトリです。また、実験手順、配列アセンブリの詳細、および配列決定プロジェクトに関連するその他のメタデータなどの補足情報も保存します。[1] アーカイブは、シーケンスリードアーカイブ、トレースアーカイブ、およびEMBLヌクレオチド配列データベース(EMBLバンクとも呼ばれる)の3つの主要なデータベースで構成されています。[2] ENAは、欧州バイオインフォマティクス研究所によって作成および管理されており、日本DNAデータバンクおよびGenBankとともに国際ヌクレオチド配列データベースコラボレーション(INSDC)のメンバーです。
ENAは、1982年に初めて国際的にサポートされたヌクレオチド配列データリソースとしてリリースされたEMBLデータライブラリから成長しました。[3] 2012年初頭の時点で、ENAと他のINSDCメンバーデータベースにはそれぞれ5,682の生物の完全なゲノムと約70万の配列データが含まれていました。[4] さらに、データ量は約10か月で倍増し、指数関数的に増加しています。 [5]
歴史
欧州ヌクレオチドアーカイブは、別々のデータベースから生まれたもので、その最も古いものは、1980年10月にハイデルベルクの欧州分子生物学研究所(EMBL)に設立されたEMBLデータライブラリでした。[3]このデータベースの最初のリリースは1982年4月に行われ、約50万塩基対からなる合計568の個別のエントリが含まれていました。[6] 1984年に、EMBLデータライブラリを参照して、KnealeとKennardは「分子生物学の研究には大規模なコンピューター化された配列データベースが不可欠であることは数年前から明らかでした」と述べました。[6]

当時の主な配布方法は磁気テープであったが、1987年までにEMBLデータライブラリは世界中で推定1万人の科学者によって使用されていた。[7]同年、EMBLファイルサーバが導入され、BITNET、EARN、初期のインターネットを介してデータベースレコードが提供されるようになった。[8] 1988年5月、 Nucleic Acids Research誌は「[Nucleic Acids Research]に提出され、配列データを含むか議論している原稿には、データがEMBLデータライブラリに寄託されているという証拠を添付する必要がある」という方針を導入した。[9]

1990年代にEMBLデータライブラリはEMBLヌクレオチド配列データベースに改名され[10] 、正式にハイデルベルクから欧州バイオインフォマティクス研究所(EBI)に移転されました。 [11] 2003年には、ヌクレオチド配列データベースが拡張され、データベースの現在のエントリと以前のエントリの記録をすべて保持するシーケンスバージョンアーカイブ(SVA)が追加されました。[1] 1年後の2004年6月には、各レコードの最大シーケンス長の制限(当時は350キロベース)が削除され、ゲノム配列全体を単一のデータベースエントリとして保存できるようになりました。[12]
サンガーシークエンシングの普及に続いて、ウェルカムトラストサンガー研究所(当時はサンガーセンターとして知られていた)は、トレースアーカイブと呼ばれるデータベースに、シーケンスリードと品質情報をカタログ化し始めました。[13]トレースアーカイブは、ロシュやイルミナなどの企業によるハイスループットパラレルシークエンシング技術の商業化により大幅に成長しました。[14] 2008年に、EBIはトレースアーカイブ、EMBLヌクレオチド配列データベース(現在はEMBLバンクとしても知られています)[2]、および新しく開発されたシーケンス(またはショート)リードアーカイブ(SRA)を統合してENAを構成し、包括的なヌクレオチド配列アーカイブを提供することを目指しました。[13]国際ヌクレオチド配列データベースコラボレーションのメンバーとして、ENAは毎日、日本DNAデータバンクおよびGenBankとデータを交換しています。[15]
EMBL ヌクレオチド配列データベース

EMBLヌクレオチド配列データベース(EMBLバンクとも呼ばれる)は、ENAのセクションであり、高レベルのゲノムアセンブリの詳細、アセンブリされた配列、およびその機能注釈が含まれています。[12] [17] EMBLバンクは、ゲノムコンソーシアムや小規模な研究グループからの直接の提出と、特許出願に関連する配列データの検索によって貢献しています。[2] [18]
リリース114(2012年12月)時点で、EMBLヌクレオチド配列データベースには約5×10 11ヌクレオチドが含まれており、非圧縮ファイルサイズは1.6テラバイトです。[16]
データクラス
EMBLヌクレオチド配列データベースは、以下のものを含むがこれに限定されないさまざまなソースから得られたさまざまなデータをサポートしています。[19]
- 表現されたシーケンス タグとそれに関連付けられたサンプル データ。
- 完全なコンティグや注釈付きの完全に組み立てられた配列など、アセンブリのさまざまな段階で全ゲノム配列決定プロジェクトから生成されるヌクレオチド配列。
- オプションの注釈付きの、相補 DNAなどのトランスクリプトミクスに関連するデータ。
- 既存のコード配列の新規または拡張された注釈。たとえば、開始コドンまたは終止コドンが修正された新しい配列バージョンなど。
EMBL-Bank 形式
EMBLヌクレオチド配列データベースは、通常EMBL-Bank形式と呼ばれるフラットファイルプレーンテキスト形式を使用してデータを表現および保存します。 [20] EMBL-Bank形式は、DDBJやGenBankのレコードとは異なる構文を使用しますが、各形式では、 NCBI Taxonデータベースで定義されている分類法など、特定の標準化された命名法が使用されます。EMBL形式ファイルの各行は、アクセッション番号のラベル付けやレコードに関連するキーワードのリストなどの2文字のコードで始まり、各レコードはで終わります。[20]ACKW//
シーケンス読み取りアーカイブ
_size_of_the_Sequence_Read_Archive.svg/500px-History_(and_predicted_future)_size_of_the_Sequence_Read_Archive.svg.png)
ENAは、公開を目的としたシーケンスリードと解析のアーカイブリポジトリであるシーケンスリードアーカイブ(SRA)のインスタンスを運営しています。[23]元々はショートリードアーカイブと呼ばれていましたが、将来のシーケンシング技術がより長いシーケンスリードを生成できるようになることを見越して名前が変更されました。[24]現在、アーカイブは、イルミナゲノムアナライザーやABI SOLiDなどの次世代シーケンシングプラットフォームによって生成されたシーケンスリードと、それに対応する解析およびアライメントを受け入れています。[25] SRAは、国際ヌクレオチド配列データベースコラボレーション(INSDC)[23]の指導の下で運営されており、ENAで最も急速に成長しているリポジトリです。[14]
2010年には、シーケンスリードアーカイブはENAを通じて入手可能な塩基対データの約95%を占め、 [13] 60兆(6×10 13)を超える塩基対で構成される500,000,000,000を超えるシーケンスリードを網羅していました。 [23]このデータのほぼ半分は、研究者がリアルタイムでシーケンスデータをSRAに公開した1000ゲノムプロジェクトに関連して寄託されました。[26] 2010年9月時点で、シーケンスリードアーカイブの65%はヒトゲノムシーケンスであり、さらに16%はヒトメタゲノムシーケンスリードに関連していました。[23]
SRAに提出されるファイルの推奨データ形式はBAM形式で、アラインメントされたリードとアラインメントされていないリードの両方を保存できます。 [23] SRAは内部的に、3つのINSDCメンバーデータベースすべてで使用されているNCBI SRAツールキットに依存して、柔軟なデータ圧縮、APIアクセス、 FASTQなどの他の形式への変換を提供しています。[22]
データアクセス

ENAに含まれるデータには、ENAブラウザを通じてREST URL経由で手動またはプログラムでアクセスできます。当初はシーケンスリードアーカイブに限定されていましたが[14] 、 ENAブラウザは現在ではトレースアーカイブとEMBLバンクへのアクセスも提供しており、XML、HTML、FASTA、FASTQなどのさまざまな形式でファイルを取得できます。[13]個々のレコードにはアクセッション番号を使用してアクセスでき、その他のテキストクエリはEB-eye検索エンジンを通じて有効になります。 [13]さらに、De Bruijnグラフを使用して実装された配列類似性ベースの検索は、 ENAからレコードを取得する別の方法を提供します。 [ 14 ]
ENAはEBI SOAPおよびREST APIを介してアクセス可能であり、 EnsemblやInterProなどEBIでホストされている他のデータベースへのアクセスも提供します。[27]
ストレージ
欧州ヌクレオチドアーカイブは、大きなストレージ課題となる大量のデータを扱っています。[5] [28] 2012年現在、ENAのストレージ要件は指数関数的に増加し続けており、倍増するのに約10か月かかります。[5]この増加を管理するために、ENAは価値の低いシーケンシングプラットフォームデータを選択的に破棄し、高度な圧縮戦略を実装しています。[23] [29] CRAM参照ベースの圧縮ツールキットは、ENAのストレージ要件を削減するために開発されました。[5] [30]
資金調達
現在、ENAは欧州分子生物学研究所、欧州委員会、ウェルカムトラストの共同資金提供を受けている。[13] EBI所長ジャネット・ソーントンが調整する新たなELIXIRフレームワークは、 ENAのような生命科学データベースの継続的な利用をサポートするために、持続可能な欧州の資金基盤を確保することを目的としている。[29] [31] [32]
参照
参考文献
- ^ ab Cochrane, G.; Akhtar, R.; Aldebert, P.; Althorpe, N.; Baldwin, A.; Bates, K.; Bhattacharyya, S.; Bonfield, J.; Bower, L. (2007). 「Ensembl Trace Archive および EMBL Nucleotide Sequence Database におけるヌクレオチド トレース、シーケンス、および注釈データ キャプチャの優先度」。Nucleic Acids Research。36 (データベース): D5 – D12。doi : 10.1093 /nar/gkm1018。ISSN 0305-1048。PMC 2238915。PMID 18039715。
- ^ abc EMBL-EBI. 「EMBLヌクレオチド配列データベース」。2013年1月8日閲覧。
- ^ ab Hamm, GH; Cameron, GN (1986). 「EMBLデータライブラリ」.核酸研究. 14 (1): 5–9. doi :10.1093/nar/14.1.5. PMC 339348. PMID 3945550.
- ^ Cochrane, Guy; Cook, Charles E; Birney, Ewan (2012). 「DNA配列アーカイブの将来」GigaScience . 1 (1): 2. doi : 10.1186/2047-217X-1-2 . ISSN 2047-217X. PMC 3617450 . PMID 23587147.
- ^ abcd Cochrane, G.; Alako, B.; Amid, C.; Bower, L.; Cerdeno-Tarraga, A.; Cleland, I.; Gibson, R.; Goodgame, N.; Jang, M. (2012). 「欧州ヌクレオチドアーカイブの成長への対応」。核酸 研究。41 ( D1 ): D30 – D35。doi : 10.1093/nar/gks1175。ISSN 0305-1048。PMC 3531187。PMID 23203883。
- ^ ab Kneale, G.; Kennard, O. (1984). 「EMBLヌクレオチド配列データライブラリ」.生化学協会トランザクション. 12 (6): 1011–1014. doi :10.1042/bst0121011. PMID 6530028.
- ^ Cameron, GN (1988). 「EMBLデータライブラリ」.核酸研究. 16 (5): 1865–1867. doi :10.1093/nar/16.5.1865. PMC 338182. PMID 3353226 .
- ^ Fuchs, R.; Stoehr, P.; Rice, P.; Omond, R.; Cameron, G. (1990). 「EMBLデータライブラリの新しいサービス」. Nucleic Acids Research . 18 (15): 4319–4323. doi :10.1093/nar/18.15.4319. PMC 331247. PMID 2388823 .
- ^ Kahn, P.; Hazledine, D. (1988). 「EMBLデータライブラリへのデータ提出に関するNARの新要件: 著者向け情報」. Nucleic Acids Research . 16 (10): I–IV. PMC 336623. PMID 16617480 .
- ^ 「欧州ヌクレオチドアーカイブとは?」 EMBL-EBI . 2013年1月6日閲覧。
- ^ Rodriguez-Tomé, P.; Stoehr, PJ; Cameron, GN; Flores, TP (1996). 「欧州バイオインフォマティクス研究所 (EBI) データベース」. Nucleic Acids Research . 24 (1): 6–12. doi :10.1093/nar/24.1.6. PMC 145572. PMID 8594602 .
- ^ ab Stoesser, G.; Baker, W; Van Den Broek, A; Garcia-Pastor, M; Kanz, C; Kulikova, T; Leinonen, R; Lin, Q; Lombard, V (2003). 「EMBLヌクレオチド配列データベース:主要な新開発」. Nucleic Acids Research . 31 (1): 17–22. doi :10.1093/nar/gkg021. ISSN 1362-4962. PMC 165468. PMID 12519939 .
- ^ abcdef Leinonen R、Akhtar R、Birney E、et al. (2011年1月). 「The European Nucleotide Archive」. Nucleic Acids Res . 39 (データベース号): D28–31. doi :10.1093/nar/gkq967. PMC 3013801. PMID 20972220 .
- ^ abcd Leinonen, R.; Akhtar, R.; Birney, E.; Bonfield, J.; Bower, L.; Corbett, M.; Cheng, Y.; Demiralp, F.; Faruque, N. (2009). 「欧州ヌクレオチドアーカイブのサービス改善」. Nucleic Acids Research . 38 (データベース): D39–D45. doi :10.1093/nar/gkp998. ISSN 0305-1048. PMC 2808951. PMID 19906712 .
- ^ EMBL-EBI. 「欧州ヌクレオチドアーカイブについて」2013年1月7日閲覧。
- ^ ab 「EMBLヌクレオチド配列データベース: リリースノート」。EMBL -Bank リリースノート 114。EMBL-EBI。2012年12月。2013年1月2日時点のオリジナルよりアーカイブ。 2013年1月7日閲覧。
- ^ Amid, C.; Birney, E.; Bower, L.; Cerdeno-Tarraga, A.; Cheng, Y.; Cleland, I.; Faruque, N.; Gibson, R.; Goodgame, N. (2011). 「欧州ヌクレオチドアーカイブにおける主要な投稿ツールの開発」. Nucleic Acids Research . 40 (D1): D43–D47. doi :10.1093/nar/gkr946. ISSN 0305-1048. PMC 3245037. PMID 22080548 .
- ^ Stoesser, G.; Baker, W; Van Den Broek, A; Camon, E; Garcia-Pastor, M; Kanz, C; Kulikova, T; Leinonen, R; Lin, Q (2002). 「EMBLヌクレオチド配列データベース」. Nucleic Acids Research . 30 (1): 21–26. doi :10.1093/nar/30.1.21. ISSN 1362-4962. PMC 99098. PMID 11752244 .
- ^ 「EMBL-Bank データクラス」EBML-EBI. 2012 . 2013年1月8日閲覧。
- ^ ab 「EMBL-Bank ユーザーマニュアル (リリース 129)」(プレーンテキスト)。EMBL-EBI。2016 年 9 月。2016年 11 月 3 日閲覧。
- ^ 「NCBI SRA 概要」。NCBI。2013年1月1日。2013年2月8日時点のオリジナルよりアーカイブ。 2013年1月8日閲覧。
- ^ ab Kodama, Y.; Shumway, M.; Leinonen, R. (2011). 「シーケンスリードアーカイブ:シーケンスデータの爆発的な増加」。核酸研究。40 ( D1 ): D54–D56。doi : 10.1093/nar/gkr854。ISSN 0305-1048。PMC 3245110。PMID 22009675 。
- ^ abcdefg Leinonen R、Sugawara H 、Shumway M (2011年1月)。「シーケンスリードアーカイブ」。Nucleic Acids Res . 39 (データベース号): D19–21。doi :10.1093/ nar /gkq1019。PMC 3013647。PMID 21062823 。
- ^ Ostell, Jim (2009). 「NCBI のシーケンス読み取りアーカイブ: 中核となるインフラストラクチャ」. Bio IT World . 2013 年 1 月 8 日閲覧。
- ^ 「NCBIシーケンスリードアーカイブについて」。NCBI。2013年1月8日。2013年4月19日時点のオリジナルよりアーカイブ。 2013年1月10日閲覧。
- ^ Shumway, M .; Cochrane, G.; Sugawara, H. (2009) .「次世代シーケンシングデータのアーカイブ化」。核酸研究。38 (データベース): D870–D871。doi : 10.1093 /nar/gkp1078。ISSN 0305-1048。PMC 2808927。PMID 19965774 。
- ^ Mcwilliam, H.; Valentin, F.; Goujon, M.; Li, W.; Narayanasamy, M.; Martin, J.; Miyar, T.; Lopez, R. (2009). 「欧州バイオインフォマティクス研究所の Web サービス - 2009」。Nucleic Acids Research . 37 (Web サーバー): W6–W10. doi :10.1093/nar/gkp302. ISSN 0305-1048. PMC 2703973 . PMID 19435877.
- ^ Cochrane, G.; Akhtar, R.; Bonfield, J.; Bower, L.; Demiralp, F.; Faruque, N.; Gibson, R.; Hoad, G.; Hubbard, T. (2009). 「欧州ヌクレオチドアーカイブにおけるペタバイト規模のイノベーション」。核酸 研究。37 (データベース): D19–D25。doi : 10.1093/ nar /gkn765。ISSN 0305-1048。PMC 2686451。PMID 18978013。
- ^ ab 「EMBL-EBI は生データについて Sequence Read Archive を引き続きサポートします」(PDF)。プレスリリース。EMBL-EBI。2011 年 2 月 16 日。2011年 5 月 15 日時点のオリジナル(PDF)からアーカイブ。2013 年 1 月 7 日閲覧。
- ^ Hsi-Yang Fritz, M.; Leinonen, R.; Cochrane, G.; Birney, E. (2011). 「参照ベースの圧縮を使用した高スループット DNA シーケンス データの効率的な保存」. Genome Research . 21 (5): 734–740. doi :10.1101/gr.114819.110. ISSN 1088-9051. PMC 3083090. PMID 21245279 .
- ^ 「ELIXIRについて」。ELIXIR 。 2013年1月9日閲覧。
- ^ Crosswell, Lindsey C.; Thornton, Janet M. (2012). 「ELIXIR: 欧州の生物学的データのための分散インフラストラクチャ」. Trends in Biotechnology . 30 (5): 241–242. doi :10.1016/j.tibtech.2012.02.002. ISSN 0167-7799. PMID 22417641.
外部リンク
- 欧州ヌクレオチドアーカイブ
- EMBL ヌクレオチド配列データベース
- 欧州ヌクレオチドアーカイブ: クイックツアー

