| コンテンツ | |
|---|---|
| 説明 | 遺伝子注釈の標準セットへの収束 |
| 接触 | |
| 研究センター | 国立バイオテクノロジー情報センター 欧州バイオインフォマティクス研究所 カリフォルニア大学サンタクルーズ校 ウェルカムトラスト サンガー研究所 |
| 著者 | キム・D・プルーイット |
| 主な引用 | プルーイットKD他(2009)[1] |
| 発売日 | 2009 |
| アクセス | |
| Webサイト | https://www.ncbi.nlm.nih.gov/projects/CCDS/CcdsBrowse.cgi |
| その他 | |
| バージョン | CCDS リリース 24 |
コンセンサスコーディングシーケンス(CCDS)プロジェクトは、ヒトとマウスの参照ゲノムアセンブリ上で同一の注釈が付けられたタンパク質コード領域のデータセットを維持するための共同作業です。CCDSプロジェクトは、安定した識別子(CCDS ID)を使用して、参照マウスとヒトゲノム上の同一のタンパク質注釈を追跡し、それらが国立生物工学情報センター(NCBI)、Ensembl、およびUCSCゲノムブラウザによって一貫して表されるようにします。[1] CCDSデータセットの整合性は、厳格な品質保証テストと継続的な手動キュレーションによって維持されています。[2]
動機と背景
生物学および生物医学の研究は、ゲノムアセンブリ上の遺伝子とその産物の正確で一貫した注釈に依存するようになりました。ゲノムの参照注釈はさまざまなソースから入手できますが、それぞれが独自の目標とポリシーを持っているため、注釈に多少のばらつきが生じます。
CCDS プロジェクトは、参加する注釈グループによってヒトとマウスの参照ゲノムアセンブリに同一に注釈が付けられているタンパク質コード遺伝子注釈のゴールドスタンダードセットを特定するために設立されました。さまざまなパートナーの合意によって決定された CCDS 遺伝子セット[2]は、現在 18,000 を超えるヒト遺伝子と 20,000 を超えるマウス遺伝子で構成されています (CCDS リリース履歴を参照)。CCDS データセットは、新しいリリースごとに、より多くの選択的スプライシングイベントを表すようになっています。 [3]
貢献グループ
参加している注釈グループには以下のものがある: [3]
- 国立生物工学情報センター(NCBI)
- 欧州バイオインフォマティクス研究所(EBI)
- ウェルカムトラストサンガー研究所(WTSI)
- HUGO 遺伝子命名委員会(HGNC)
- マウスゲノムインフォマティクス(MGI)
手動注釈は以下によって提供されます:
CCDS遺伝子セットの定義
「コンセンサス」とは、開始コドン、終止コドン、スプライスジャンクションで一致し、予測が品質保証ベンチマークを満たすタンパク質コード領域として定義されます。[1] (NCBI) とEnsembl (手動 HAVANA 注釈を組み込んでいる)によって提供される手動および自動ゲノム注釈の組み合わせを比較して、一致するゲノム座標を持つ注釈を特定します。
品質保証テスト
CDSの高品質を保証するために、複数の品質保証(QA)テストが実行されます(表1)。すべてのテストは、各CCDSビルドのアノテーション比較ステップの後に実行され、アノテーション比較の前に実行される個々のアノテーショングループのQAテストとは独立しています。[3]
QA テストに合格しなかった注釈は、手動チェックを経て結果が改善されるか、QA の失敗に基づいて注釈の一致を拒否する決定が下される可能性があります。
レビュープロセス
CCDS データベースは、複数の共同作業者によってレビュー プロセスが実行され、変更を行う前に合意に達しなければならないという点で独特です。これは、作業プロセス フローと分析および議論のためのフォーラムを含む共同作業者調整システムによって可能になります。CCDS データベースは、キュレーターとのコミュニケーション、共同作業者の投票、特別レポートの提供、CCDS 表現のステータスの追跡など、複数の目的を果たす内部 Web サイトを運営しています。共同作業を行う CCDS グループ メンバーがレビューが必要な可能性のある CCDS ID を特定すると、投票プロセスを使用して最終結果が決定されます。
手動キュレーション
調整された手動キュレーションは、アクセス制限付きの Web サイトとディスカッション メール リストによってサポートされています。CCDS キュレーション ガイドラインは、高頻度に見られる特定の競合に対処するために作成されました。CCDS キュレーション ガイドラインの作成により、競合する投票数と合意に達するための議論に費やす時間が削減され、CCDS キュレーション プロセスの効率が向上しました。CCDS キュレーション ガイドラインへのリンクは、こちらにあります。
CCDSデータセット用に確立されたキュレーションポリシーは、 RefSeqとHAVANAのアノテーションガイドラインに統合されているため、両方のグループによって提供される新しいアノテーションは一致する可能性が高く、CCDS IDが追加されます。これらの標準は特定の問題領域に対処するものであり、包括的なアノテーションガイドラインではなく、協力グループのアノテーションポリシーを制限するものではありません。[2]例としては、開始コドンの選択や、ナンセンス介在分解の候補であると予測される上流ORFと転写産物の解釈に関する標準化されたキュレーションガイドラインがあります。キュレーションは継続的に行われ、協力センターのいずれかがCCDS IDを更新または撤回する可能性があるものとしてフラグ付けできます。
意見の対立については、科学の専門家や、HUGO 遺伝子命名委員会(HGNC)やマウスゲノムインフォマティクス(MGI)などの他の注釈キュレーショングループと協議して対処します。意見の対立が解決できない場合は、より多くの情報が利用可能になるまで共同研究者は CCDS ID を撤回することに同意します。
キュレーションの課題と注釈のガイドライン
ナンセンス媒介分解 (NMD): NMD は最も強力なmRNA監視プロセスです。NMDは、欠陥のあるmRNA をタンパク質に翻訳される前に排除します。 [4]これは、欠陥のあるmRNAが翻訳されると、切断されたタンパク質が病気を引き起こす可能性があるため重要です。NMDを説明するためにさまざまなメカニズムが提案されています。その 1 つがエクソン ジャンクション コンプレックス(EJC) モデルです。このモデルでは、終止コドンが最後のエクソン ジャンクションの 50 nt を超える上流にある場合、転写物はNMD候補であると想定されます。 [2] CCDS の協力者は、EJC モデルに基づく保守的な方法を使用してmRNA転写物をスクリーニングします。NMD 候補であると判断された転写物は、次の状況を除いて CCDS データ セットから除外されます。[2]
- 特定の遺伝子座のすべての転写産物はNMD候補であると評価されますが、その遺伝子座は以前にタンパク質コード領域であることがわかっています。
- NMD候補転写産物から機能的なタンパク質が生成されることを示す実験的証拠がある。
以前は、NMD候補転写物はRefSeqとHAVANAの両方でタンパク質コード転写物とみなされ、そのためこれらのNMD候補転写物は CCDS データ セットに表示されていました。RefSeqグループと HAVANA プロジェクトはその後、注釈ポリシーを改訂しました。
複数のインフレーム翻訳開始部位: 翻訳開始には、上流オープンリーディングフレーム(uORF)、二次構造、翻訳開始部位の周囲の配列コンテキストなど、複数の要因が寄与します。共通の開始部位は、コザックコンセンサス配列内で定義されています: 脊椎動物では (GCC) GCCACCAUGG。括弧内の配列 (GCC) は、生物学的影響が不明なモチーフです。[5]コザックコンセンサス配列内にはバリエーションがあり、たとえば、G または A は AUG の 3 ヌクレオチド上流 (位置 -3) に見られます。コザック配列の位置 -3 と +4 の間の塩基は、翻訳効率に最も大きな影響を与えます。したがって、配列 (A/G)NNAUGG は、CCDS プロジェクトで強いコザックシグナルとして定義されています。
スキャン機構によれば、小さなリボソームサブユニットは最初に到達した開始コドンから翻訳を開始することができます。スキャンモデルには例外があります。
- 開始部位が強力なコザック信号に囲まれていない場合、リーキースキャンが発生します。これにより、リボソームはこの AUG をスキップし、下流の開始部位から翻訳を開始します。
- ORFが短いとリボソームは下流のORFで翻訳を再開することができる。[5]
CCDS 注釈ガイドラインによれば、翻訳を開始するために内部開始部位が使用されているという実験的証拠がある場合を除き、最長のORFに注釈を付ける必要があります。さらに、リボソームプロファイリングデータ[6]などの他の種類の新しいデータを使用して、開始コドンを特定できます。CCDS データ セットは、CCDS ID ごとに 1 つの翻訳開始部位を記録します。翻訳には任意の代替開始部位が使用される可能性があり、CCDS パブリック ノートに記載されます。
上流オープンリーディングフレーム: 転写リーダー内に位置する AUG 開始コドンは、上流 AUG (uAUG) として知られています。uAUG は u ORFと関連付けられることがあります。u ORF は、ヒトおよびマウスの転写産物の約 50% に見られます。[7] u ORFの存在は、CCDS データ セットのもう 1 つの課題です。翻訳開始のスキャン メカニズムでは、小さなリボソーム サブユニット (40S) が新生mRNA転写産物の 5' 末端に結合し、最初の AUG 開始コドンをスキャンすることが示唆されています。[5] uAUG が最初に認識され、対応する uORF が翻訳される可能性があります。翻訳された u ORF はNMD候補になる可能性がありますが、研究では、一部の u ORF はNMD を回避できることが示されています。NMDを回避するu ORFの平均サイズ制限は、約 35アミノ酸です。[2] [8]また、u ORFはリボソーム開始複合体を捕捉し、リボソームがタンパク質コード領域に到達する前にmRNA転写産物から解離させることで、下流遺伝子の翻訳を阻害するとも示唆されている。 [4] [7]現在、u ORFが翻訳制御に及ぼす全体的な影響を報告した研究はない。
現在のCCDSアノテーションガイドラインでは、u ORFを含むmRNA転写物が以下の2つの生物学的要件を満たす場合に、その転写物を含めることが許可されている: [2]
- mRNA転写産物には強い Kozak シグナルがあります。
- mRNA転写産物は35アミノ酸以上であるか、主要なオープンリーディングフレームと重複している。
リードスルー転写産物: リードスルー転写産物は、結合遺伝子または共転写遺伝子とも呼ばれます。リードスルー転写産物は、同じ染色体上に同じ方向にある 2 つ以上の異なる既知の (パートナー) 遺伝子のそれぞれから 1 つのエクソンの少なくとも一部を組み合わせた転写産物として定義されます。[9]リードスルー転写産物とそれに対応するタンパク質分子の生物学的機能はまだ不明です。ただし、CCDS データ セットにおけるリードスルー遺伝子の定義では、個々のパートナー遺伝子は異なる必要があり、リードスルー転写産物は、異なる短い遺伝子座のそれぞれと 1 つ以上のエクソン (または共有末端エクソンの場合を除き 2 つ以上のスプライス サイト) を共有する必要があります。[2]次の状況では、転写産物はリードスルー転写産物とは見なされません。
- 重複する遺伝子から転写産物が生成されるが同じスプライス部位を共有していない場合。
- 転写産物が、互いに入れ子構造を持つ遺伝子から翻訳される場合。この場合、CCDS の協力者とHGNC は、リードスルー転写産物を別の遺伝子座として表すことに合意しました。
参照ゲノム配列の品質: CCDS データ セットはヒトとマウスのゲノム注釈を表すために構築されているため、ヒトとマウスの参照ゲノム配列の品質問題が別の課題となります。品質問題は、参照ゲノムが誤ってアセンブルされたときに発生します。そのため、誤ってアセンブルされたゲノムには、未熟な終止コドン、フレームシフト インデル、または多型性疑似遺伝子が含まれる可能性があります。これらの品質問題が特定されると、CCDS の協力者は問題をゲノム参照コンソーシアムに報告し、コンソーシアムは調査して必要な修正を行います。
CCDSデータへのアクセス
CCDS プロジェクトは、NCBI CCDS データ セット ページ (こちら) から入手できます。このページには、CCDS の配列と位置に関する情報を取得するための FTP ダウンロード リンクとクエリ インターフェイスが用意されています。CCDS レポートは、CCDS データ セット ページの上部にあるクエリ インターフェイスを使用して取得できます。ユーザーは、CCDS ID、遺伝子 ID、遺伝子シンボル、ヌクレオチド ID、タンパク質 ID など、さまざまな種類の識別子を選択して、特定の CCDS 情報を検索できます。[1] CCDS レポート (図 1) は表形式で表示され、履歴レポート、Entrez Gene [10]などの特定のリソースへのリンクが提供されたり、CCDS データ セットが再クエリされたりします。配列識別子テーブルには、 VEGA、Ensembl、Blink での転写情報が表示されます。染色体位置テーブルには、特定のコード配列の各エクソンのゲノム座標が含まれています。このテーブルには、コード領域の構造を視覚化できるさまざまなゲノム ブラウザーへのリンクも用意されています。[1]特定のコード配列の正確なヌクレオチド配列とタンパク質配列もCCDS配列データのセクションに表示されます。

現在のアプリケーション
CCDSデータセットはGENCODE遺伝子アノテーションプロジェクト[11]の不可欠な部分であり、臨床研究、大規模エピゲノム研究、エクソームプロジェクト、エクソンアレイ設計など、さまざまな研究分野で高品質のコーディングエクソン定義の標準として使用されています。[3] 独立したアノテーショングループによるCCDSエクソンのコンセンサスアノテーションにより、特にエクソームプロジェクトではCCDSコーディングエクソンを下流研究(例:一塩基変異の検出)の信頼できるターゲットと見なしており、これらのエクソンは市販のエクソームキットのコーディング領域ターゲットとして使用されています。[12]
CCDS リリース履歴
CCDS データ セットのサイズは、国際ヌクレオチド配列データベース共同体 (INSDC) に提出された新しいデータ セットを統合する計算ゲノム注釈の更新と、その注釈を補足または改善する進行中のキュレーション活動の両方によって増加し続けています。表 2 は、各 CCDS ビルドの主要な統計をまとめたものです。ここで、パブリック CCDS ID は、現在のリリース日時点でレビュー中または更新または撤回待ちではなかったすべての ID です。
リリース統計の完全なセットは、公式 CCDS Web サイトの「リリースと統計」ページで確認できます。
今後の展望
長期的な目標には、転写産物の注釈が同一である場所(UTRを含む)を示す属性の追加や、同じ CCDS ID を持つ異なるUTRを持つスプライスバリアントを示す属性の追加が含まれます。また、他の生物のより完全で高品質のゲノム配列データが利用可能になると、これらの生物の注釈が CCDS 表現の範囲に入ることも予想されます。
CCDS セットは、独立したキュレーション グループが当初は異なっていたケースについて合意し、弱く支持されていた遺伝子の追加的な実験的検証が行われ、自動注釈付け方法が継続的に改善されるにつれて、より完全なものになります。CCDS 協力グループ間のコミュニケーションは継続しており、CCDS 更新サイクル間の相違点を解決し、改良点を特定します。ヒトの更新はおよそ 6 か月ごとに行われ、マウスのリリースは毎年行われる予定です。[3]
参照
参考文献
- ^ abcde プルーイット KD、ハロー J、ハート RA、ウォリン C、ディーハンス M、マグロット DR、サール S、ファレル CM、ラブランド JE、ルーフ BJ、ハート E、スーナー MM、ランドラム MJ、エイケン B、アイリング S、バーチ R、フェルナンデス=バネット J、チェリー JL、カーウェン V、ディクーチョ M、ケリス M、リーJ、リン MF、シュスター M、シュケダ A、アミッド C、ブラウン G、ドゥカニーナ O、フランキッシュ A、ハート J、マイダック BL、マッジ J、マーフィー MR、マーフィー T、ラジャン J、ラジプート B、リディック LD、スノー C、スチュワード C、ウェッブ D、ウェバー JA、ウィルミング L、ウー W、バーニー E、ハウスラー D、ハバード T、オステル J、ダービン R、リップマン D (2009). 「コンセンサスコーディング配列(CCDS)プロジェクト:ヒトとマウスのゲノムに共通するタンパク質コーディング遺伝子セットの特定」Genome Res . 19 (7): 1316–23. doi :10.1101/gr.080531.108. PMC 2704439。PMID 19498102 。
- ^ abcdefgh Harte, RA; Farrell, CM; Loveland, JE; Suner, MM; Wilming, L; Aken, B; Barrell, D; Frankish, A; Wallin, C; Searle, S; Diekhans, M; Harrow, J; Pruitt, KD (2012). 「CCDS プロジェクトの国際キュレーション活動の追跡と調整」.データベース. 2012 : bas008. doi :10.1093/database/bas008. PMC 3308164 . PMID 22434842.
- ^ abcdef ファレル、CM;ノースカロライナ州オレアリー。 RA州ハート。 JE、ラブランド。ウィルミング、LG;ワリン、C;ディハンス、M;バレル、D;サール、SM;アーケン、B;ハイアット、SM;フランク人、A;スーナー、MM;ラージプート、B;カリフォルニア州スチュワード。ブラウン、GR;ベネット、R;マーフィー、M;ウー、W;ケイ、国会議員。ハート、J;ラジャン、J;ウェーバー、J;雪、C; LD、リディック。ハント、T;ウェッブ、D;トーマス、M;タメス、P;ランワラ、SH;マクガーベイ、ケンタッキー州。プージャー、S;シュケダ、A;マッジ、JM。ゴンザレ、JM。ギルバート、JG。トレヴァイオン、SJ;ベーチュ、R; JL、ハロー。ハバード、T; Ostell, JM; Haussler, D; Pruitt, KD (2014). 「コンセンサスコーディングシーケンスデータベースの現状と新機能」。Nucleic Acids Res . 42 (D1): D865–D872. doi :10.1093/nar/gkt1059. PMC 3965069。PMID 24217909。
- ^ ab Alberts, B; Johnson, A; Lewis, J; Raff, M; Roberts, K; Walter, P (2002).細胞の分子生物学第5版。ニューヨーク:ガーランドサイエンス。
- ^ abc Kozak, M (2002). 「翻訳開始のためのスキャン機構の限界を押し広げる」. Gene . 299 (1–2): 1–34. doi :10.1016/S0378-1119(02)01056-9. PMC 7126118 . PMID 12459250.
- ^ Ingolia, NT; Brar, GA; Rouskin, S; McGeachy, AM; Weissman, JS (2014). 「リボソームプロファイリングによるゲノムワイドアノテーションと翻訳の定量化」Curr. Protoc. Mol. Biol . 第4章: 4.18.1–4.18.19. doi :10.1002/0471142727.mb0418s103. ISBN 9780471142720. PMC 3775365 . PMID 23821443.
- ^ ab Calvo, SE; Pagliarni, DJ; Mootha, VK (2009). 「上流オープンリーディングフレームはタンパク質発現の広範な減少を引き起こし、ヒトの間で多型性がある」(PDF) . Proc. Natl. Acad. Sci. USA . 106 (18): 7507–12. Bibcode :2009PNAS..106.7507C. doi : 10.1073/pnas.0810916106 . PMC 2669787 . PMID 19372376.
- ^ Silva, AL; Pereira, FJC; Morgado, A; Kong, J; Martins, R; Faustino, P; Liebhaber, SA; Romao, L (2006). 「標準的な UPF1 依存性ナンセンス mRNA 分解は、配列コンテキストに依存しない短いオープンリーディングフレームを持つ転写物では阻害される」. RNA . 12 (12): 2160–70. doi :10.1261/rna.201406. PMC 1664719. PMID 17077274 .
- ^ Prakash, Tulika; Sharma, Vineet K.; Adati, Naoki; Ozawa, Ritsuko; Kumar, Naveen; Nishida, Yuichiro; Fujikake, Takayoshi; Takeda, Tadayuki; Taylor, Todd D.; Michalak, Pawel (2010 年 10 月 12 日). 「結合遺伝子の発現: 真核生物における遺伝子調節のもう 1 つのメカニズム」. PLOS ONE . 5 (10): e13284. Bibcode :2010PLoSO...513284P. doi : 10.1371/journal.pone.0013284 . PMC 2953495. PMID 20967262 .
- ^ Maglott, D. ; Ostell, J.; Pruitt, KD; Tatusova, T. (2010 年 11 月 28 日). 「Entrez Gene: NCBI の遺伝子中心の情報」. Nucleic Acids Res . 39 (データベース): D52–D57. doi :10.1093/nar/gkq1237. PMC 3013746. PMID 21115458 .
- ^ ハロー、J.フランキッシュ、A.ゴンザレス、JM。タパナリ、E.ディーカンス、M.ココシンスキー、F.アーケン、BL;バレル、D.ザディッサ、A.サール、S.バーンズ、I.ビネル、A.ボイチェンコ、V。ハント、T.ケイ、M。ムケルジー、G.ラジャン、J.デスパシオ・レイエス、G.サンダース、G.スチュワード、C.ハート、R.リン、M。ハワルド、C.タンザー、A.デリエン、T.クラスト、J.ウォルターズ、N.バラスブラマニアン、S.ペイ、B.トレス、M.ロドリゲス、JM。エズクルディア、I。ファン・バーレン、J.ブレント、M。ハウスラー、D.ケリス、M。バレンシア、A.レイモンド、A.ガーシュタイン、M.ギーゴ、R.ハバード、TJ (2012 年 9 月 5 日)。 「GENCODE: ENCODE プロジェクトの参照ヒトゲノム注釈」。ゲノム解析22 (9): 1760 ~ 1774 年。土井:10.1101/gr.135350.111。PMC 3431492。PMID 22955987。
- ^ Parla, Jennifer S; Iossifov, Ivan; Grabill, Ian; Spector, Mona S; Kramer, Melissa; McCombie, W Richard (2011). 「エクソームキャプチャの比較分析」Genome Biol . 12 (9): R97. doi : 10.1186/gb-2011-12-9-r97 . PMC 3308060 . PMID 21958622.
外部リンク
- CCDSホームページ
