GENCODEはゲノム研究における科学プロジェクトであり、 ENCODE(DNA要素百科事典)の規模拡大プロジェクトの一部である。
GENCODEコンソーシアムは、当初、ENCODEプロジェクトのパイロットフェーズの一環として、ENCODE領域(ヒトゲノムの約1%)内のすべてのタンパク質コード遺伝子を特定し、マッピングするために設立されました。[ 2 ]プロジェクトの初期段階での成功を受けて、GENCODEは現在、「遺伝子と遺伝子変異の百科事典」の構築を目指しています。[ 2 ]
その結果、代替転写バリアントを持つすべてのタンパク質コード遺伝子座[ 3 ]、転写証拠のある非コード遺伝子座[ 4 ]、および偽遺伝子[ 5 ]を含む注釈のセットが得られます。
GENCODEは現在、プロジェクトのフェーズ2の目標に向けて進んでいます。[ 6 ]
ヒト遺伝子セット注釈の最新リリースはGencode 36で、凍結日は2020年12月です。このリリースでは、最新のGRCh38ヒト参照ゲノムアセンブリが使用されています。[ 7 ]
マウス遺伝子セット注釈の最新リリースはGencode M25で、凍結日は2020年12月です。[ 7 ]
2009年9月以降、GENCODEはEnsemblプロジェクトで使用されているヒト遺伝子セットであり、GENCODEの新しいリリースはEnsemblのリリースに対応しています。[ 8 ]

2003年9月
このプロジェクトは、パイロット、技術開発、生産フェーズの 3 つのフェーズで設計されました。[ 9 ] ENCODE プロジェクトのパイロット段階では、ヒトゲノムの約 1% に相当する、合計 30 Mb の配列の 44 領域を、計算と実験の両方で詳細に調査することを目的としていました。この段階の一環として、ENCODE 領域内のすべてのタンパク質コード遺伝子を特定してマッピングするために GENCODE コンソーシアムが結成されました。[ 2 ]最初の 2 つのフェーズの結果は、費用対効果が高く包括的な生産フェーズでヒトゲノムの残りの 99% を分析するための最善の道筋を決定するために使用されることが想定されていました。[ 9 ]
2005年4月 44のENCODE領域の注釈の最初のリリースは2005年4月29日に確定され、最初のENCODEゲノム注釈評価プロジェクト(E-GASP)ワークショップで使用されました。[ 2 ] GENCODEリリース1には、416の既知の遺伝子座、26の新規(コーディングDNA配列)CDS遺伝子座、82の新規転写遺伝子座、78の推定遺伝子座、104の処理済み偽遺伝子、および66の未処理偽遺伝子が含まれていました。
2005年10月 2005年10月14日に第2バージョン(リリース02)が確定し、RACEおよびRT-PCR技術を用いた実験的検証による発見に基づく更新が含まれた。[ 2 ] GENCODEリリース2には、411の既知の遺伝子座、30の新規CDS遺伝子座、81の新規転写遺伝子座、83の推定遺伝子座、104の処理済み偽遺伝子、および66の未処理偽遺伝子が含まれていた。
2007年6月パイロットプロジェクト の結論は2007年6月に発表された。[ 10 ]この調査結果は、ヒトゲノムの機能要素を特徴付けるための実現可能なプラットフォームと新しい技術を作成するパイロットプロジェクトの成功を強調しており、ゲノムワイド研究への研究の道を開くものである。
2007年10月、 新たな資金提供は、NHGRIがENCODEプロジェクトを全ゲノムを対象とした生産段階へと拡大し、さらにパイロット規模の研究を追加で実施するための取り組みの一環であった。
2012年9月 2012年9月、GENCODEコンソーシアムは、2011年12月に確定した主要リリースであるGENCODEリリース7の結果について議論する主要論文を発表しました。[ 11 ]
2018 2018 年、GENCODE プロジェクトに新たに追加されたものの 1 つは、ヒトおよびモデル生物アセンブリ の CRISPR/Cas9 トラックでした。CRISPR は、編集対象領域に高い特異性で結合する RNA 配列を使用するゲノム編集技術です。この新しいトラックは、転写領域の隣、または転写領域から 200 bp 以内にある CRISPR/Cas9 複合体の潜在的な結合部位をリストアップすることで、適切なガイド センテンスの検索を支援するように設計されています。各部位について、トラックは、ガイド シーケンスの候補と、それらのガイド シーケンスの予測効率および特異性スコアのコレクションを提供します。また、オフターゲットとガイド間のミスマッチの数でグループ化された潜在的なオフターゲットに関する情報も提供します。[ 11 ]
2020年の 成果としては、マウス参照ゲノムの手動アノテーションの第1段階を完了し、アノテーションの収束を目指してRefSeqおよびUniprot参照アノテーションデータベースとの協力を開始し、既存の遺伝子座における新規遺伝子座および新規転写産物の発見によりlncRNAのアノテーションを改善しました。また、2020年のCOVID-19パンデミックにより、状況に対応する研究を支援する必要性が高まり、GENCODEはSARSCoV-2感染に関連する一連のタンパク質コード遺伝子のアノテーションを見直し、改善しました。[ 12 ]
GENCODEプロジェクトの主要参加者は、プロジェクトの様々な段階を通じて比較的安定しており、現在はウェルカム・トラスト・サンガー研究所がプロジェクト全体の取り組みを主導している。
各段階の主要参加機関の概要を以下に示します。[ 6 ] [ 13 ]
出典:[ 8 ]
GENCODEは設立以来、ヒト遺伝子セットのアノテーションを36バージョン(マイナーアップデートを除く)リリースしてきました。
最新のGENCODEヒト遺伝子セット注釈(リリース49)の主要な要約統計を以下に示します。[ 14 ]
シーケンス技術(RT-PCR-seqなど)の進歩、手動アノテーションによるカバレッジの向上(HAVANAグループ)、Ensemblを用いた自動アノテーションアルゴリズムの改良などにより、GENCODEのアノテーションの精度と完全性は、リリースを重ねるごとに継続的に向上してきました。
2014年までのGENCODEの主要リリース3件の主要統計の比較を以下に示します。[ 14 ]発見された遺伝子の総数で見ると、網羅性は着実に増加していますが、タンパク質をコードする遺伝子の数は実際に減少していることが明らかです。これは主に、Cap Analysis Gene Expression (CAGE)クラスター、注釈付きPolyAサイト、およびペプチドヒットを使用して得られた新しい実験的証拠によるものです。[ 11 ]

推定される遺伝子座はウェットラボ実験で検証でき、計算による予測は手動で分析されます。[ 15 ] 現在、アノテーションセットが手動でアノテーションされた領域だけでなく、ゲノム全体をカバーしていることを保証するために、HAVANAからの手動アノテーションとEnsemblの自動アノテーション遺伝子セットからの自動アノテーションを使用して統合データセットが作成されます。このプロセスでは、Ensemblタンパク質コーディングセットからの固有の全長CDS予測も手動でアノテーションされた遺伝子に追加され、可能な限り完全で最新のゲノムアノテーションが提供されます。[ 16 ]
Ensemblトランスクリプトは、Ensembl自動遺伝子アノテーションシステム(遺伝子アノテーションパイプラインの集合)の産物であり、Ensembl遺伝子ビルドと呼ばれています。すべてのEnsemblトランスクリプトは実験的証拠に基づいており、そのため自動パイプラインは科学コミュニティから公開データベースに登録されたmRNAとタンパク質配列に依存しています。[ 17 ]
GENCODEコンソーシアムには、手動アノテーターが未注釈領域のモデルを作成するのを支援し、完全に欠落した遺伝子座、欠落した代替アイソフォーム、誤ったスプライス部位、誤ったバイオタイプなど、見落とされた、または誤った手動アノテーションを特定するパイプラインを実行する分析グループがいくつかあります。これらは、AnnoTrack追跡システムを使用して手動アノテーターにフィードバックされます。[ 18 ]これらのパイプラインの一部は、RNASeqデータ、ヒストン修飾、CAGEおよびDitagデータなど、他のENCODEサブグループのデータを使用します。RNAseqデータは重要な新しい証拠源ですが、そこから完全な遺伝子モデルを生成することは難しい問題です。GENCODEの一環として、さまざまなRNAseq予測パイプラインによって生成された予測の品質を評価するためのコンペティションが実施されました(下記のRGASPを参照)。不確実なモデルを確認するために、GENCODEはRNAシーケンスとRACEを使用した実験的検証パイプラインも持っています。[ 16 ]
GENCODE 7では、転写産物モデルは、転写産物の品質を評価するために開発された新しい方法に基づいて、高いまたは低いレベルのサポートが割り当てられます。[ 2 ]
現在のGENCODEヒト遺伝子セットバージョン(GENCODEリリース20)には、すべてのゲノム領域(参照染色体/パッチ/スキャフォールド/ハプロタイプ)のGENCODEアノテーションに関連付けられたアノテーションファイル(GTFおよびGFF3形式)、FASTAファイル、およびMETADATAファイルが含まれています。アノテーションデータは参照染色体に基づいており、以下の内容を含む個別のファイルに格納されています。遺伝子アノテーション、HAVANAによってアノテーションされたポリA機能、YaleおよびUCSCパイプラインによって予測された(レトロトランスポゾン)偽遺伝子(HAVANAでは予測されていない)、長鎖ノンコーディングRNA、およびtRNA-Scanによって予測されたtRNA構造。GTF形式の行の例を以下に示します。

GENCODE GTFファイル形式に含まれる列については、以下に説明します。
GENCODE GTFファイルのフォーマット説明。タブ区切りの標準GTF列
GENCODE GTFファイルの9列目におけるキーと値のペアの説明(形式:キー "値")
また、GENCODEのウェブサイトには、ヒトとマウスのゲノムブラウザがあり、染色体番号と開始-終了位置(例:22:30,700,000..30,900,000)を指定することで任意のゲノム領域にアクセスできます。また、ENS転写産物ID(バージョンあり/なし)、ENS遺伝子ID(バージョンあり/なし)、遺伝子名でもアクセスできます。このブラウザはBiodallianceによって提供されています。[ 19 ]
「遺伝子」の定義は、ヒトゲノムの発見以来、数多くの定義や概念が提案されてきたように、決して些細な問題ではありませんでした。1900年代には、遺伝子は遺伝の独立した単位として捉えられ、その後、タンパク質合成の設計図と考えられ、近年では、 RNAに転写される遺伝暗号として定義されるようになりました。遺伝子の定義は過去1世紀にわたって大きく進化してきましたが、多くの研究者にとって依然として困難で議論の的となるテーマです。ENCODE/GENCODEプロジェクトの登場により、エクソンの連続がイントロンによって分離される選択的スプライシング、遺伝子間転写、分散制御の複雑なパターン、非遺伝子領域の保存、そして非コードRNA遺伝子の豊富さなど、定義のさらに複雑な側面が明らかになってきました。 GENCODEは遺伝子と遺伝子変異体の百科事典を構築しようと努力しているが、これらの問題はGENCODEプロジェクトにとって遺伝子の最新の概念を考案するという大きな課題となった。[ 20 ]
ヒトゲノムプロジェクトは、ヒトゲノムの配列を決定し、それに含まれる遺伝子を特定するための国際的な研究プロジェクトでした。このプロジェクトは、米国国立衛生研究所と米国エネルギー省によって調整されました。その他の貢献者には、米国中の大学と、英国、フランス、ドイツ、日本、中国の国際的なパートナーが含まれていました。ヒトゲノムプロジェクトは正式には1990年に開始され、当初の予定より2年早い2003年に完了しました。[ 21 ]
GENCODEプロジェクトの主要な研究分野は、長鎖ノンコーディングRNA(lncRNA)の生物学的意義を調査することでした。ヒトにおけるlncRNAの発現をよりよく理解するために、GENCODEはサブプロジェクトを作成し、GENCODE lncRNAアノテーションの転写産物を定量化できるカスタムマイクロアレイプラットフォームを開発しました。[ 4 ] Agilent Technologies eArrayシステムを使用して多数のデザインが作成され、これらのデザインは標準的なカスタムAgilentフォーマットで利用可能です。[ 4 ]
RNA -seqゲノムアノテーション評価プロジェクト(RGASP)プロジェクトは、高品質のRNAシーケンスデータ解析のためのさまざまな計算方法の有効性を評価するために設計されています。RGASPの主な目標は、RNA-seqアライメント、転写産物特性評価(発見、再構築、定量化)ソフトウェアの偏りのない評価を提供すること、およびトランスクリプトームシーケンスに基づく自動ゲノムアノテーションの実現可能性を判断することです。[ 23 ]
RGASPは、EGASP(ENCODEゲノムアノテーション評価プロジェクト)遺伝子予測ワークショップをモデルとしたコンソーシアムの枠組みで組織されており、RNA-seq解析のさまざまな側面や、変化するシーケンス技術とフォーマットに対応するために、2回のワークショップが実施されました。プロジェクトの第1ラウンドと第2ラウンドの主な発見の1つは、生成される遺伝子予測の品質に対するリードのアライメントの重要性でした。そのため、現在(2014年)、主にゲノムへのリードマッピングに焦点を当てた第3ラウンドのRGASPワークショップが実施されています。[ 23 ]