| コンテンツ | |
|---|---|
| 説明 | ゲノムの厳選された非冗長配列データベース。 |
| 接触 | |
| 研究センター | 国立バイオテクノロジー情報センター |
| 主な引用 | プルーイットKD ら(2005)[1] |
| アクセス | |
| Webサイト | https://www.ncbi.nlm.nih.gov/RefSeq |
参照配列(RefSeq)データベース[1]は、公開されているヌクレオチド配列(DNA、RNA)とそのタンパク質産物のオープンアクセスで注釈付き、キュレーションされたコレクションです。RefSeqは2000年に導入されました。[2] [3]このデータベースは国立生物工学情報センター(NCBI)によって構築されており、GenBankとは異なり、ウイルスから細菌、真核生物に至るまでの主要な生物の天然の生物学的分子(DNA、RNA、タンパク質)ごとに1つのレコードのみを提供します。
RefSeqは、各モデル生物について、ゲノムDNA、遺伝子転写産物、およびそれらの転写産物から生じるタンパク質の個別かつリンクされた記録を提供することを目指しています。RefSeqは、十分なデータが利用可能な主要な生物(2022年7月時点で121,461の異なる「命名された」生物)に限定されていますが、 [4] GenBankには、提出されたあらゆる生物(正式に記述された種約504,000種)の配列が含まれています。[5]
RefSeq カテゴリ
RefSeq コレクションは、さまざまな起源を持つさまざまなデータ タイプで構成されているため、各データ タイプを保存するための標準カテゴリと識別子を確立する必要があります。最も重要なカテゴリは次のとおりです。
詳細とその他のカテゴリについては、『The Reference Sequence (RefSeq) Database』の第 18 章の表 1 を参照してください。
RefSeq プロジェクト
NCBI は現在、 RefSeqサービスを改善するためのいくつかのプロジェクトを開発しており、その多くは EMBL-EBI などの研究センターと共同で行われています。
- コンセンサスCDS(CCDS):このプロジェクトは、ヒトとマウスのタンパク質コード領域のコアセットを特定し、ゲノム注釈の品質が高く一貫したレベルの遺伝子セットを標準化することを目的としています。このプロジェクトは2009年に発表され、現在も開発中です。 [6] [7]
- RefSeq機能要素(RefSeqFE):エンハンサー、サイレンサー、DNase I過敏領域、DNA複製起点などの遺伝子制御領域である非遺伝子機能要素の記述に焦点を当てています。このプロジェクトの現在の範囲は、ヒトとマウスのゲノムに限定されています。[8]
- RefSeqGene:その主な目的は、十分に特徴付けられた遺伝子の参照標準として使用されるゲノム配列を定義することです。これまで説明されたmRNA、タンパク質、染色体配列には、遺伝子の隣接領域とイントロン領域の明確なゲノム座標が提供されず、新しいゲノムアセンブリごとに変化する不自然なほど大きな座標が表示されるという弱点があります。RefSeqGeneプロジェクトは、これらのエラーを排除するように設計されています。[9]
- 標的遺伝子座:このプロジェクトは、系統解析やバーコーディング解析に使用される分子マーカー、特にタンパク質コード遺伝子座とリボソームRNA遺伝子座を記録します。このプロジェクトの範囲には、EntrezおよびBLASTクエリを介してアクセス可能な古細菌、細菌、真菌の配列が含まれます。また、BLASTクエリを介してアクセス可能な動物、植物、原生生物のGenBank配列も含まれます。[10]
- ウイルス変異(ViV):インフルエンザウイルス、エボラウイルス、MERSコロナウイルス、ジカウイルスなど、いくつかのウイルスグループの配列を表示および取得するための配列データ処理パイプラインと分析ツールの特定のリソースです。新しいウイルス、処理パイプライン、ツール、その他の機能が定期的に追加されます。[11]
- RefSeq Select:このプロジェクトは、臨床データベースでの過去の使用、転写産物の発現、コード領域の進化的保存など、複数の基準に基づいて、すべてのタンパク質コード遺伝子を最も代表するRefSeq Select転写産物のデータセットを選択することを目的としています。選択的スプライシングという生物学的プロセスにより、多くの遺伝子が複数のRefSeq転写産物/タンパク質によって表されるため、この複雑さは比較ゲノミクスや臨床変異データの交換などの研究にとって問題となります。 [12]
- MANE(NCBIとEMBL -EBIの一致アノテーション):これはNCBIとEMBL - EBIの共同プロジェクトであり、その主な目的はヒトゲノム内のすべてのタンパク質コード遺伝子の転写産物とそのタンパク質のセットを定義することです。そうすることで、RefSeqとEnsembl / GENCODEアノテーションシステム間の転写産物アノテーションの違いが減ります。MANE Select転写産物セットは、臨床報告や比較または進化ゲノミクスの有用な普遍的な標準として作成されています。2番目のMANE Plus Clinicalセットも、公開リソースで利用可能なすべての病原性(P)または病原性が高い(LP)臨床変異を報告するための追加の転写産物で作成されています。 [13]このプロジェクトは2018年に発表され、2022年に終了する予定です。
統計
RefSeqリリース213(2022年7月)によると、データベースに収録されている種の数は、分類IDごとに以下の通りです。[4]
分子タイプごとのアクセッション数と塩基対数は以下のとおりです: [4]
参照
参考文献
- ^ ab Pruitt KD、 Tatusova T、Maglott DR (2005 年 1 月)。「NCBI Reference Sequence (RefSeq): ゲノム、転写産物、タンパク質の厳選された非冗長配列データベース」。 Nucleic Acids Research 。33 (データベース号): D501–D504。doi :10.1093/nar/gki025。PMC 539979。PMID 15608248。
- ^ Maglott DR 、Katz KS、Sicotte H、Pruitt KD(2000年1月)。「NCBIのLocusLinkとRefSeq」。核酸研究。28(1):126–128。doi : 10.1093 / nar /28.1.126。PMC 102393。PMID 10592200。
- ^ Pruitt KD、Katz KS、Sicotte H 、 Maglott DR (2000年1月)。「RefSeqとLocusLinkの紹介:NCBIのキュレーションされたヒトゲノムリソース」。Trends in Genetics。16(1):44–47。doi :10.1016/s0168-9525(99)01882-x。PMID 10637631 。
- ^ abc RefSeq Release 213統計(レポート)。国立医学図書館。2022年7月11日。 2022年7月20日閲覧。
- ^ Sayers EW、Cavanaugh M、Clark K、Pruitt KD、Schoch CL、Sherry ST、Karsch-Mizrachi I (2022年1月)。「GenBank」。核酸研究 。50 ( D1 ): D161 – D164。doi : 10.1093/nar/ gkab1135。PMC 8690257。PMID 34850943。
- ^ Pruitt KD、Harrow J、Harte RA、Wallin C、Diekhans M、Maglott DR、他 (2009 年 7 月)。「コンセンサスコーディング配列 (CCDS) プロジェクト: ヒトおよびマウスゲノムの共通タンパク質コーディング遺伝子セットの特定」。ゲノム研究 。19 ( 7 ) : 1316–1323。doi :10.1101/gr.080531.108。PMC 2704439。PMID 19498102。
- ^ Pujar S、O'Leary NA、Farrell CM、Loveland JE、Mudge JM、Wallin C、他 (2018 年 1 月)。「コンセンサスコーディング配列 (CCDS) データベース: 専門家によるキュレーションでサポートされるヒトおよびマウスのタンパク質コーディング領域の標準化されたセット」。核酸研究。46 ( D1 ): D221–D228。doi :10.1093/ nar /gkx1031。PMC 5753299。PMID 29126148。
- ^ Farrell CM、Goldfarb T、Rangwala SH、Astashyn A、Ermolaeva OD、Hem V、et al. (2022年1月)。「RefSeq機能要素は、実験的にアッセイされた非遺伝子参照標準およびヒトとマウスにおける機能的相互作用として機能します。」ゲノム研究。32 ( 1 ) : 175–188。doi :10.1101/gr.275819.121。PMC 8744684。PMID 34876495 。
- ^ Gulley ML、Braziel RM、Halling KC、Hsi ED、Kant JA、Nikiforova MN、他 (2007 年 6 月)。「分子病理学における臨床検査報告」。Archives of Pathology & Laboratory Medicine。131 ( 6): 852–863。doi : 10.5858 / 2007-131-852 -CLRIMP。PMID 17550311 。
- ^ 「NCBI RefSeq Targeted Loci Project」www.ncbi.nlm.nih.gov . 2022年7月27日閲覧。
- ^ Hatcher EL、Zhdanov SA、Bao Y、Blinkova O、Nawrocki EP、Ostapchuck Y、他 (2017 年 1 月)。「ウイルス変異リソース - 緊急ウイルス発生への対応の改善」。核酸研究。45 ( D1 ): D482–D490。doi :10.1093/nar/ gkw1065。PMC 5210549。PMID 27899678 。
- ^ 「NCBI RefSeq Select」www.ncbi.nlm.nih.gov . 2022年7月27日閲覧。
- ^ Morales J、Pujar S、Loveland JE、Astashyn A、Bennett R、Berry A、et al. (2022年4月). 「臨床ゲノミクスと研究のためのNCBIとEMBL-EBIの共同転写産物セット」. Nature . 604 (7905): 310–315. Bibcode :2022Natur.604..310M. doi :10.1038/s41586-022-04558-8. PMC 9007741. PMID 35388217 .
出典
この記事には、NCBI ハンドブック (国立生物工学情報センター)のパブリック ドメイン資料が組み込まれています。
外部リンク
- 参照シーケンス
- GenBank、RefSeq、TPA、UniProt: 名前には何が含まれていますか?
