DNA要素百科事典(ENCODE )は、「ヒトゲノムの機能要素の包括的な部品リストを構築する」ことを目的とした公的研究プロジェクトである。[ 2 ]
ENCODEは、「ゲノムデータ、ゲノムデータ分析のためのソフトウェア、ツール、方法、およびデータ分析と解釈から得られる製品などのコミュニティリソースを生成する」ことによって、さらなる生物医学研究も支援しています。[ 3 ] [ 2 ]
ENCODEの現在のフェーズ(2016~2019年)では、細胞の種類、データの種類、アッセイの数を増やすことでリソースの深みを増しており、マウスゲノムの解析もサポートするようになりました。[ 3 ]
歴史
ENCODEは、米国国立ヒトゲノム研究所(NHGRI)によって2003年9月に開始されました。 [ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ]ヒトゲノムプロジェクトの後継として意図されたENCODEプロジェクトは、ヒトゲノムのすべての機能要素を特定することを目的としています。[ 9 ]
このプロジェクトには世界中の研究グループのコンソーシアムが関わっており、このプロジェクトから生成されたデータは公開データベースを通じてアクセスできます。ENCODEの最初のリリースは2013年で、それ以来、コンソーシアムメンバーとポータルを使用してENCODEデータにアクセスする科学者のより広いコミュニティの推奨事項に従って変更されています。ENCODEの2つの目標は、「実験プロトコル、分析手順、およびデータ自体」のための公開アクセス可能なデータベースとして機能することと、「同じインターフェースで、データの出所を記録し、生物学的観点からその解釈を正当化する、慎重にキュレーションされたメタデータを提供すること」です。[ 10 ]このプロジェクトは2017年2月に第4フェーズ(ENCODE 4)を開始しました。[ 11 ]
ENCODEコンソーシアム
ENCODEコンソーシアムは、主に米国国立ヒトゲノム研究所(NHGRI)から資金提供を受けた科学者で構成されています。プロジェクトに貢献するその他の参加者は、コンソーシアムまたは解析ワーキンググループに加わります。
パイロットフェーズは、8つの研究グループと、ENCODE技術開発フェーズに参加する12のグループで構成されていました。2007年以降、パイロットフェーズが正式に終了したことで、参加者数は世界32の研究室に所属する440人の科学者にまで拡大しました。現在、コンソーシアムは、それぞれ異なる役割を担う複数のセンターで構成されています。
ENCODEは国際ヒトエピゲノムコンソーシアム(IHEC)のメンバーである。[ 14 ]
NHGRIがENCODE資金提供研究の成果物に対して求める主な要件は、ゲノム研究を促進するために、すべての研究者が無料で容易にアクセスできる方法で共有することです。ENCODE研究は、ゲノム解析に関連するソフトウェア、方法、データ、その他のツールの再現性、ひいては透明性を可能にします。 [ 3 ]
ENCODEプロジェクト
ENCODEは現在、4つのフェーズで実施されています。パイロットフェーズと技術開発フェーズは同時に開始されました[ 15 ]。そして、本番フェーズです。第4フェーズは第3フェーズの続きであり、百科事典の機能特性評価とさらなる統合分析が含まれます。
パイロットフェーズの目標は、組み合わせることで費用対効果が高くハイスループットで適用でき、ヒトゲノムの広範囲を正確かつ包括的に特徴づけることができる一連の手順を特定することでした。パイロットフェーズでは、機能配列を検出するための現在のツールセットのギャップを明らかにする必要があり、また、当時使用されていたいくつかの方法が非効率的であるか、大規模な利用に適していないかどうかも明らかにすると考えられていました。これらの問題の一部は、ENCODE技術開発フェーズで対処する必要がありました。このフェーズでは、既知の機能配列を特定したり、新しい機能ゲノム要素を発見したりする能力を向上させる新しい実験室および計算方法を考案することを目指しました。最初の2つのフェーズの結果により、費用対効果が高く包括的な生産フェーズでヒトゲノムの残りの99%を分析するための最善の道筋が決定されました。[ 5 ]
ENCODEフェーズIプロジェクト:パイロットプロジェクト
パイロットフェーズでは、ヒトゲノム配列の特定の部分を厳密に分析するための既存の方法をテストし、比較しました。これはオープンコンソーシアムとして組織され、多様なバックグラウンドと専門知識を持つ研究者を集め、さまざまな技術、テクノロジー、戦略のそれぞれの相対的な利点を評価しました。プロジェクトの同時進行の技術開発フェーズでは、機能要素を特定するための新しいハイスループット法を開発することを目指しました。これらの取り組みの目標は、ヒトゲノム内のすべての機能要素を包括的に特定できる一連のアプローチを特定することでした。ENCODEパイロットプロジェクトを通じて、米国国立ヒトゲノム研究所(NHGRI)は、ヒトゲノム全体を分析する取り組みにさまざまなアプローチをスケールアップできるかどうか、またゲノム配列内の機能要素を特定する能力のギャップを見つけることができるかどうかを評価しました。
ENCODEパイロットプロジェクトのプロセスでは、計算科学者と実験科学者が緊密に連携して、ヒトゲノムの注釈付けのためのさまざまな方法を評価しました。ヒトゲノムの約1%(30 Mb)に相当する領域がパイロットプロジェクトの対象として選択され、ENCODEパイロットプロジェクトのすべての研究者によって分析されました。ENCODE参加者によってこれらの領域で生成されたすべてのデータは、迅速に公開データベースに公開されました。[ 7 ] [ 16 ]
ターゲット選択
ENCODEパイロットプロジェクトで使用するために、ヒトゲノムの特定領域(約30Mb、ヒトゲノム全体の約1%に相当)が選定された。これらの領域は、ヒトDNA中の様々な機能要素を見つけるための多様な手法と技術の有効性と効率性を検証・評価するための基盤となった。
ターゲット選択に着手する前に、30Mbの配列のうち50%を手動で選択し、残りの配列をランダムに選択することに決定した。手動で選択する領域の主な基準は、1) よく研究されている遺伝子またはその他の既知の配列要素の存在、および 2) 相当量の比較配列データの存在であった。この方法を用いて、合計14.82Mbの配列が手動で選択され、そのサイズは500kbから2Mbまでの14個のターゲットで構成されている。
残りの 50% の 30Mb の配列は、遺伝子密度と非エクソン保存レベルに基づく層別ランダムサンプリング戦略に従って選択された 30 個の 500kb 領域で構成されていました。これらの特定の基準を使用するという決定は、遺伝子やその他の機能要素の内容が大きく異なるゲノム領域を適切にサンプリングすることを保証するためでした。ヒトゲノムは、2 つの軸 (1)遺伝子密度と 2) 相同マウスゲノム配列に対する非エクソン保存レベル (下記参照) に沿って、上位 20%、中間 30%、下位 50% の 3 つの部分に分割され、合計 9 つの層になりました。各層から、パイロットプロジェクト用に 3 つのランダムな領域が選択されました。手動で選択された層では、4 番目の領域が選択され、合計 30 の領域になりました。すべての層について、予期せぬ技術的問題が発生した場合に使用するための「バックアップ」領域が指定されました。
より詳細に言うと、層別化基準は以下のとおりであった。
- 遺伝子密度:領域の遺伝子密度スコアは、 Ensemblデータベースの遺伝子、またはUCSCゲノムブラウザデータベースのヒトmRNAベストBLAT(BLASTのようなアライメントツール)アライメントによってカバーされる塩基の割合です。
- 非エクソン保存:この領域は、重複しない 125 塩基のサブウィンドウに分割されました。マウス配列との塩基配列一致率が 75% 未満のサブウィンドウは破棄されました。残りのサブウィンドウについては、マウスとの塩基配列同一性が 80% 以上であり、Ensembl遺伝子、GenBank mRNA BLASTZ アライメント、Fgenesh++ 遺伝子予測、TwinScan 遺伝子予測、スプライシング EST アライメント、または反復配列 ( DNA ) に対応しない部分の割合が、非エクソン保存スコアとして使用されました。
上記のスコアは、ゲノム全体にわたる重複しない500kbの完成配列ウィンドウ内で計算され、各ウィンドウを層に割り当てるために使用されました。[ 17 ]
パイロットフェーズの結果
パイロットフェーズは成功裏に終了し、結果は2007年6月にNature [ 7 ]とGenome Researchの特集号[ 18 ]で発表されました。最初に挙げた論文で発表された結果は、ヒトゲノム機能に関する集合的な知識をいくつかの主要な分野で前進させました。以下にハイライトを示します。[ 7 ]
- ヒトゲノムは広範囲にわたって転写されており、その塩基の大部分は少なくとも1つの主要な転写産物と関連付けられており、多くの転写産物は遠位領域を既知のタンパク質コード遺伝子座に連結している。
- 多くの新規な非タンパク質コード転写産物が同定されており、これらの多くはタンパク質コード遺伝子座と重複しており、また、これまで転写的に不活性であると考えられていたゲノム領域に位置しているものもある。
- これまで認識されていなかった多数の転写開始部位が特定されており、その多くは、よく理解されているプロモーターと同様のクロマチン構造と配列特異的なタンパク質結合特性を示している。
- 転写開始部位を取り囲む調節配列は対称的に分布しており、上流領域への偏りは見られない。
- クロマチンへのアクセス可能性とヒストン修飾パターンは、転写開始部位の存在と活性の両方を高い精度で予測する。
- 遠位DNaseI高感受性部位は、プロモーターとは確実に区別できる特徴的なヒストン修飾パターンを有しており、これらの遠位部位の中には、インスレーター機能と一致する特徴を示すものもある。
- DNA複製タイミングはクロマチン構造と相関関係にある。
- ゲノム中の塩基のうち、哺乳類において進化的な制約を受けていると確実に特定できる塩基は全体の5%に過ぎない。そして、これらの制約を受けた塩基のうち約60%については、これまでに実施された実験結果に基づき、機能を持つという証拠が得られている。
- 実験的アッセイによって機能的であると特定されたゲノム領域と、進化的な制約を受けている領域の間には概ね重複が見られるものの、これらの実験的に定義された領域内のすべての塩基が制約の証拠を示すわけではない。
- さまざまな機能要素は、ヒト集団全体で配列の多様性が大きく異なり、ゲノムの構造的に可変な領域内に存在する可能性も大きく異なります。
- 驚くべきことに、多くの機能要素は哺乳類の進化において制約を受けていないように見える。これは、生化学的に活性ではあるものの、生物に特定の利益をもたらさない中立要素の大きなプールが存在する可能性を示唆している。このプールは自然選択の「倉庫」として機能し、系統特異的な要素や、種間で機能的に保存されているが相同性のない要素の供給源となる可能性がある。
ENCODEフェーズIIプロジェクト:生産フェーズプロジェクト
UCSCゲノムブラウザにおけるENCODEデータの画像。これは、遺伝子制御に関する情報を含む複数のトラックを示しています。左側の遺伝子(ATP2B4 )は、非常に多様な細胞で転写されています( H3K4me1データも参照)。右側の遺伝子は、胚性幹細胞を含むごく少数の細胞でのみ転写されています。2007年9月、国立ヒトゲノム研究所(NHGRI)はENCODEプロジェクトの生産段階への資金提供を開始した。この段階の目標は、ゲノム全体を解析し、「追加のパイロット規模の研究」を実施することであった。[ 19 ]
パイロットプロジェクトと同様に、生産活動はオープンコンソーシアムとして組織されています。2007 年 10 月、NHGRI は 4 年間で総額 8,000 万ドルを超える助成金を授与しました。[ 20 ]生産フェーズには、データ調整センター、データ解析センター、および技術開発活動も含まれています。[ 21 ] 当時、プロジェクトは真にグローバルな事業へと発展し、世界中の 32 の研究室から 440 人の科学者が参加しました。パイロットフェーズが完了すると、プロジェクトは 2007 年に「スケールアップ」し、次世代シーケンシングマシンから多大な恩恵を受けました。そして、データは確かに膨大で、研究者たちは約 15テラバイトの生データを生成しました。
2010年までに、ENCODEプロジェクトによって1,000を超えるゲノムワイドデータセットが作成されました。これらのデータセットを総合すると、どの領域がRNAに転写されるか、どの領域が特定の細胞種で使用される遺伝子を制御する可能性が高いか、そしてどの領域が多様なタンパク質と関連しているかが明らかになります。ENCODEで主に用いられるアッセイは、ChIP-seq、DNase I過敏性試験、RNA-seq 、およびDNAメチル化アッセイです。
生産段階の結果
2012年9月、このプロジェクトは、 Nature誌に6本、 Genome Biology誌に6本、 Genome Research誌の特集号に18本の論文を含む、複数のジャーナルに同時に掲載された30本の論文で、はるかに広範な結果を発表しました。[ 22 ]
著者らは、ヒトゲノム全体の機能要素に注釈を付けるために設計された1,640のデータセットの作成と初期分析について説明し、細胞型内の多様な実験結果、147種類の異なる細胞型を含む関連実験、およびゲノムワイド関連研究(GWAS)の候補領域や進化的に制約された領域などの他のリソースとのすべてのENCODEデータを統合しました。これらの取り組みにより、ヒトゲノムの構成と機能に関する重要な特徴が明らかになり、概要論文で以下のようにまとめられています。[ 23 ]
- ヒトゲノムの大部分(80.4%)は、少なくとも1つの細胞型において、少なくとも1つの生化学的RNAおよび/またはクロマチン関連イベントに関与している。ゲノムの大部分は調節イベントの近くに位置しており、ゲノムの95%はDNA-タンパク質相互作用(結合ChIP-seqモチーフまたはDNaseIフットプリントによって測定)から8kb以内に位置し、99%はENCODEによって測定された少なくとも1つの生化学的イベントから1.7kb以内に位置する。
- 霊長類特有の要素と、哺乳類特有の制約が検出されない要素は、全体として負の選択の証拠を示しており、したがって、それらのいくつかは機能的であると予想される。
- ゲノムを7つのクロマチン状態に分類すると、エンハンサー様の特徴を持つ領域が399,124個、プロモーター様の特徴を持つ領域が70,292個、さらに数十万個の静止領域が存在することが示唆される。高解像度解析では、ゲノムはさらに機能特性の異なる数千個の狭い状態に細分化される。
- RNA配列の生成と処理を、プロモーターにおけるクロマチンマークと転写因子(TF)結合の両方と定量的に相関させることが可能であり、プロモーターの機能がRNA発現変動の大部分を説明できることを示している。
- 個々のゲノム配列における非コード領域の変異の多くは、ENCODEによって注釈付けされた機能領域に存在しており、その数はタンパク質をコードする遺伝子に存在する変異の数と少なくとも同程度である。
- GWASによって疾患と関連付けられたSNPは、非コード機能要素に多く存在し、その大部分はタンパク質コード遺伝子の外側にあるENCODEで定義された領域内またはその近傍に位置している。多くの場合、疾患表現型は特定の細胞型または転写因子と関連付けられる。
最も注目すべき発見は、生物学的に活性なヒトDNAの割合が、これまでの最も楽観的な推定値よりもかなり高いということである。ENCODEコンソーシアムは概要論文で、メンバーがゲノムの80%以上に生化学的機能を割り当てることができたと報告した。[ 23 ]このうち大部分は、ゲノムの1%未満を占めるコードDNAの発現レベルの制御に関与していることがわかった。
この「百科事典」の最も重要な新要素は以下のとおりです。
- DNase 1 過敏部位の包括的なマップ。これは、通常遺伝子の隣接部に位置し、化学因子が遺伝子の発現に影響を与えることを可能にする調節 DNA のマーカーである。このマップは、この種の部位を 300 万近く特定しており、これにはこれまで知られていたほぼすべてと、多くの新規の部位が含まれている。[ 24 ]
- DNA結合タンパク質の認識モチーフを形成する短いDNA配列のレキシコン。約840万個のそのような配列が見つかり、これは全DNAの約2倍の大きさに相当する。数千個の転写プロモーターが、単一の定型的な50塩基対のフットプリントを利用していることがわかった。[ 25 ]
- ヒト転写因子のネットワークのアーキテクチャの予備的な概略図。転写因子とは、DNAに結合して遺伝子の発現を促進または抑制する因子である。このネットワークは非常に複雑で、さまざまなレベルで機能する因子や、さまざまなタイプの多数のフィードバックループが存在することがわかった。[ 26 ]
- ヒトゲノムのうちRNAに転写可能な部分の割合を測定した。この割合は全DNAの75%以上と推定され、これまでの推定値よりもはるかに高い値となった。このプロジェクトでは、さまざまな場所で生成されるRNA転写産物の種類を特徴づけることも開始した。[ 27 ]
データ管理と分析
生成される多様なデータの取得、保存、統合、表示は困難です。ENCODEデータ調整センター(DCC)は、コンソーシアム内のラボによって生成されたデータを整理して表示し、データが一般公開される際に特定の品質基準を満たしていることを保証します。ラボがデータを提出する前に、DCCとラボは、実験パラメータと関連するメタデータを定義するデータ契約を作成します。DCCは、受信データを検証して、契約との整合性を確保します。また、すべてのデータが適切なオントロジーを使用して注釈付けされていることも確認します。[ 28 ]次に、データをテストサーバーにロードして予備検査を行い、ラボと連携してデータを一貫したトラックのセットに整理します。トラックの準備ができたら、DCC品質保証チームが一連の整合性チェックを実行し、データが他のブラウザデータと一貫した方法で提示されていることを確認し、おそらく最も重要なこととして、メタデータと付随する説明テキストがユーザーにとって有用な方法で提示されていることを確認します。データは、これらのチェックがすべて完了した後にのみ、公開されているUCSC ゲノム ブラウザーのWeb サイトに掲載されます。並行して、データは、さまざまな製造ラボの分析チームと他の研究者からなるコンソーシアムである ENCODE データ分析センターによって分析されます。これらのチームは、新しいアッセイからのデータを分析するための標準化されたプロトコルを開発し、ベスト プラクティスを決定し、標準化されたピーク コーラーやアライメントパイルアップからのシグナル生成などの一貫した分析方法のセットを作成します。[ 29 ]
国立ヒトゲノム研究所(NHGRI)は、ENCODEを「コミュニティリソースプロジェクト」と位置付けています。この重要な概念は、2003年1月にフォートローダーデールで開催された国際会議で、広範な科学コミュニティのリソースとしての主な用途となるデータ、試薬、またはその他の材料のセットを作成するために特別に考案され、実施された研究プロジェクトとして定義されました。したがって、ENCODEのデータ公開ポリシーでは、検証されたデータは公開データベースに寄託され、制限なく誰でも使用できるようになると規定されています。[ 29 ]
その他のプロジェクト
第3フェーズの継続に伴い、ENCODEコンソーシアムは、ENCODEプロジェクトと並行する目標を持つ追加プロジェクトにも関与するようになった。これらのプロジェクトの中には、ENCODEの第2フェーズの一部であったものもある。
遺伝子制御のゲノミクス
2015 年初頭、NIH は遺伝子制御のゲノミクス (GGR) プログラムを開始しました。[ 39 ] 3 年間続くこのプログラムの目標は、遺伝子発現を制御するメカニズムをさらに理解することを期待して、体のさまざまなシステムの遺伝子ネットワークと経路を研究することです。ENCODE プロジェクトは GGR とは別ですが、ENCODE DCC は ENCODE ポータルで GGR データをホストしています。[ 40 ]
ロードマップ
2008年、NIHはロードマップ・エピゲノミクス・マッピング・コンソーシアムを開始しました。その目標は「基礎生物学と疾患指向の研究を促進するためのヒトエピゲノムデータの公開リソース」を作成することでした。[ 41 ] 2015年2月、コンソーシアムは「111の参照ヒトエピゲノムの統合解析」というタイトルの記事を発表し、コンソーシアムの目標を達成しました。コンソーシアムは、127の参照エピゲノムにわたる情報を統合し、調節エレメントを注釈付けしました。そのうち16はENCODEプロジェクトの一部でした。[ 42 ]ロードマッププロジェクトのデータは、ロードマップポータルまたはENCODEポータルで見つけることができます。
ロードマップエピゲノムと国際ヒトエンコードコンソーシアム(IHEC)の開始を強調したタイムライン。[ 43 ]fruitENCODEプロジェクト
fruitENCODE :果実成熟のためのDNA要素百科事典は、植物ENCODEプロジェクトの一つであり、様々な発達段階にあるすべての多肉果実種について、DNAメチル化、ヒストン修飾、DHS、遺伝子発現、転写因子結合のデータセットを生成することを目的としています。プレリリースデータはfruitENCODEポータルで入手できます。
プロジェクトに対する批判
コンソーシアムはENCODEプロジェクトはまだ終わっていないと主張しているが、発表された論文や発表に伴う報道に対する反応の多くは好意的だった。Natureの編集者とENCODEの著者は「…何ヶ月にもわたって協力し、可能な限り大きなインパクトを与え、研究コミュニティだけでなく一般大衆の注目を集めた」[ 44 ] 。ENCODE プロジェクトが主張する、ヒトゲノムの80%が生化学的機能を持つ[ 23 ]という主張は、大衆メディアによってすぐに取り上げられ、プロジェクトの結果はジャンクDNAの死につながると表現された[ 45 ] [ 46 ]。
しかし、ゲノムの大部分が「機能的」であるという結論は、ENCODEプロジェクトが「機能的」の定義を広く解釈し、転写されるものはすべて機能的であるとみなしたことを理由に批判されている。この結論は、比較ゲノミクスによるゲノム保存推定に基づく、転写される偽遺伝子などの多くのDNA要素が機能的ではないという広く受け入れられている見解にもかかわらず導き出されたものである。さらに、ENCODEプロジェクトは特異性よりも感度を重視したため、多くの偽陽性が検出された可能性がある。[ 47 ] [ 48 ] [ 49 ]細胞株や転写因子の選択がやや恣意的であったこと、および適切な対照実験が欠如していたことも、ランダムなDNAがENCODEのような「機能的」な挙動を模倣するとして、ENCODEに対するその他の大きな批判となっている。[ 50 ]
批判の一部に対して、他の科学者たちは、生化学的検査によってヒトゲノムで直接観察される広範な転写とスプライシングは、ゲノム保存推定値よりも遺伝子機能のより正確な指標であると主張した。なぜなら、保存推定値はすべて相対的であり、近縁種であってもゲノムサイズの信じられないほどの変動のために整合させることが難しく、部分的に同義反復であり、これらの推定値はゲノム上の機能の直接的な検査に基づいていないからである。[ 51 ] [ 52 ]保存推定値は、ゲノム内の機能要素を特定するための手がかりを提供するために使用できるが、ゲノム内に存在する可能性のある機能要素の総量を制限したり上限を設けたりするものではない。[ 52 ]さらに、批判者によって議論されているゲノムの大部分は、遺伝子発現などのエピジェネティック制御に関与しているようで、複雑な生物の発生に必要であると思われる。[ 51 ] [ 53 ] ENCODEの結果は、機能の帰属の増加が過去数十年の研究で予見されていたため、必ずしも予想外のものではなかった。[ 51 ] [ 53 ]さらに、ENCODEプロジェクトは当初から、進化的な機能要素ではなく、ゲノム内の生物医学的に関連する機能要素を探すことに基づいて範囲が設定されていたと指摘する人もいる。進化的な選択は機能を確立するのに十分でも必要でもないため、これらは必ずしも同じものではない。これは関連する機能の非常に有用な代理指標ではあるが、不完全なものであり、唯一のものではない。[ 54 ]
最近、ENCODEの研究者たちは、その主な目標はヒトゲノム内の機能要素を特定することであると改めて述べた。[ 55 ] 2020年のフォローアップ論文で、ENCODEは特定された要素の機能アノテーションは「まだ初期段階にある」と述べた。[ 56 ]
「機能」という言葉の定義に関する苦情に対し、ENCODEはそれが何を意味するのかを定義しており、ENCODEの範囲はゲノム内の生物医学的に関連する機能要素を探すことであったため、プロジェクトの結論は「 ゲノムの80%が、生物医学研究に関連すると考えられる現象において因果関係を持つ可能性が非常に高い関連する生化学的活動に関与している」と解釈されるべきであると指摘する者もいる。[ 54 ] ENCODEの研究者の1人であるEwan Birneyは、「機能」は実際的に「特定の生化学的活動」を意味するために使用され、これにはRNA、「広範な」ヒストン修飾、「狭い」ヒストン修飾、DNaseI高感受性部位、転写因子ChIP-seqピーク、DNaseIフットプリント、転写因子結合モチーフ、およびエクソンなど、さまざまな種類のアッセイが含まれるとコメントした。[ 57 ]
2014年、ENCODEの研究者らは、文献において、ゲノムの機能的部分は、使用されたアプローチによって過去の研究で異なる方法で特定されてきたと指摘した。ヒトゲノムの機能的部分を特定するために、大きく分けて3つのアプローチが用いられてきた。遺伝学的アプローチ(表現型の変化に基づく)、進化学的アプローチ(保存性に基づく)、そして生化学的アプローチ(生化学的検査に基づくもので、ENCODEでも用いられた)である。これら3つのアプローチにはそれぞれ限界がある。遺伝学的アプローチでは、生物に物理的に現れない機能要素を見落とす可能性があり、進化学的アプローチでは、近縁種であってもゲノムが大きく異なるため、正確な多種配列アライメントを用いるのが難しい。また、生化学的アプローチは再現性が高いものの、生化学的特徴が必ずしも機能を示すとは限らない。研究者らは、進化学的および遺伝学的証拠とは対照的に、生化学的データは、基礎となるDNA要素が担う分子機能と、それらが作用する細胞の種類に関する手がかりを提供し、最終的にはこれら3つのアプローチすべてを相補的に用いることで、ヒトの生物学や疾患において機能する可能性のある領域を特定できると結論付けた。さらに、ENCODEによって提供された生化学的マップは、これらの特徴が分子、細胞、および個体の機能にどのように関連しているかをテストするための出発点を提供するので、このプロジェクトで最も価値のあるものであると彼らは指摘した。[ 52 ]
このプロジェクトは、高額な費用(総額約4億ドル)と、生産性の高い研究者主導の研究から資金を奪う大規模科学を優遇している点でも批判されている。[ 58 ]パイロットENCODEプロジェクトの費用は推定5500万ドル、スケールアップは約1億3000万ドルで、米国国立ヒトゲノム研究所(NHGRI)は次のフェーズに最大1億2300万ドルを拠出する可能性がある。一部の研究者は、この投資に対する確かなリターンはまだ見られないと主張している。ENCODEが重要な役割を果たしている論文を文献から探し出す試みがあり、2012年以降300本の論文が発表されているが、そのうち110本はENCODEの資金提供を受けていない研究室からのものである。さらに問題なのは、ENCODEがENCODEプロジェクト専用の固有の名称ではないため、「encode」という言葉が多くの遺伝学およびゲノム学の文献に登場することである。[ 59 ]
もう一つの大きな批判は、成果がプロジェクトに費やされた時間に見合うものではなく、プロジェクト自体が本質的に完了不可能であるという点である。ヒトゲノム計画(HGP)と比較され、HGPの次のステップとさえ呼ばれることが多いが、HGPには明確な終着点があったのに対し、ENCODEにはそれが欠けている。
著者らは科学的な懸念に共感しているようで、同時にインタビューに応じ、ENCODEの詳細を科学界だけでなくマスメディアにも説明することで、自分たちの努力を正当化しようとしている。また、DNAが生命の遺伝物質であるという認識からヒトゲノム配列の解明まで半世紀以上かかったため、次の世紀の計画は配列そのものを真に理解することだと主張している。[ 59 ]
ファクターブック
ENCODEプロジェクトによって生成された転写因子結合データの解析結果は、現在、ウェブアクセス可能なリポジトリFactorBookで入手可能です。[ 60 ] Factorbook.orgは、基本的にENCODEコンソーシアムによって生成された転写因子結合データのためのWikiベースのデータベースです。最初のリリースでは、Factorbookには以下のデータが含まれています。
- 複数のヒト細胞株における119の転写因子に関する457のChIP-seqデータセット
- 転写因子結合領域周辺のヒストン修飾とヌクレオソーム配置の平均プロファイル
- 領域に豊富に存在する配列モチーフと、モチーフ部位間の距離および方向の好み。[ 61 ]
参考文献
- ↑ Hong EL、Sloan CA、Chan ET、Davidson JM、Malladi VS、Strattan JS、Hitz BC、Gabdank I、Narayanan AK、Ho M、Lee BT、Rowe LD、Dreszer TR、Roe GR、Podduturi NR、Tanaka F、Hilton JA、Cherry JM (2016 年 1 月)。「ENCODEデータ調整センターにおけるメタデータ編成の原則 (2016 年更新)」。Database。2016 baw001。doi : 10.1093 / database / baw001。PMC 4792520。PMID 26980513。
- 1 2 「ENCODEプロジェクト:プロジェクト概要」 www.endodeproject.org 2023年2月23日取得。
- 1 2 3 「データ使用、ソフトウェア、および分析リリースポリシー – ENCODE」。www.encodeproject.org。2021年12月18日取得。
- ↑ Raney BJ、Cline MS、Rosenbloom KR、Dreszer TR、Learned K、Barber GP、Meyer LR、Sloan CA、Malladi VS、Roskin KM、Suh BB、Hinrichs AS、Clawson H、Zweig AS、Kirkup V、Fujita PA、Rhead B、Smith KE、Pohl A、Kuhn RM、Karolchik D、Haussler D、Kent WJ (2011 年 1 月)。「 UCSCゲノム ブラウザの ENCODE 全ゲノム データ (2011 年更新)」。Nucleic Acids Res. 39 (データベース号): D871–5。doi : 10.1093/nar/ gkq1017。PMC 3013645。PMID 21037257。
- 1 2 3 ENCODEプロジェクトコンソーシアム(2004)。「ENCODE(DNAエレメント百科事典)プロジェクト」。サイエンス。306 ( 5696 ): 636–640。Bibcode : 2004Sci ... 306..636E。doi :10.1126 / science.11 05136。PMID 15499007。S2CID 22837649。
- ↑ ENCODEプロジェクトコンソーシアム(2011)。Becker PB (編)。「DNAエレメント百科事典(ENCODE)ユーザーガイド」。PLOS Biology。9( 4 )e1001046。doi :10.1371 / journal.pbio.1001046。PMC 3079585。PMID 21526222。

- 1 2 3 4 ENCODEプロジェクトコンソーシアム、Birney E、Stamatoyannopoulos JA、Dutta A、Guigó R、Gingeras TR、Margulies EH、Weng Z、Snyder M、Dermitzakis ET、et al . ( 2007)。「ENCODEパイロットプロジェクトによるヒトゲノムの1%の機能要素の同定と解析」。Nature。447 ( 7146 ) : 799–816。Bibcode : 2007Natur.447..799B。doi : 10.1038 / nature05874。PMC 2212820。PMID 17571346。
- ↑ギゴ R、フリチェク P、アブリル JF、レイモンド A、ラガルド J、ドヌー F、アントナラキス S、アッシュバーナー M、バジック VB、バーニー E、カステロ R、エイラス E、ユークラ C、ジンゲラス TR、ハロー J、ハバード T、ルイス SE、リース MG (2006)。「EGASP: ヒト ENCODE ゲノム アノテーション評価プロジェクト」。ゲノム生物学。7 (補足 1): S2.1–31。土井: 10.1186/gb-2006-7-s1-s2。PMC 1810551。PMID 16925836。
- ↑ 「ENCODEプロジェクト:プロジェクト概要」。www.endodeproject.org。2023年2月23日取得。
- ↑デイビス、キャリー A.;ヒッツ、ベンジャミン C.スローン、クリケットA.チャン、エスター・T.デビッドソン、ジーン・M.ガブダンク、イダン。ヒルトン、ジェイソンA。ジャイナ教、クリティ。バイムラドフ、ウルグベク K.。ナラヤナン、アディティ K.オナテ、カトリーナ C. (2018-01-04)。「DNA 要素百科事典 (ENCODE): データ ポータルの更新」。核酸研究。46 (D1): D794 – D801。土井:10.1093/nar/gkx1081。ISSN 1362-4962。PMC 5753278。PMID 29126249。
- ↑ 「ENCODEプロジェクト:DNA要素の百科事典」。www.genome.gov。2016年5月13日取得。
- ↑ Saey, Tina Hesman (2012年10月6日). 「チームがヒトゲノムの続編を発表」 . Society for Science & the Public. 2012年10月23日のオリジナルからアーカイブ済み。 2012年10月18日閲覧。
- ↑「図3:ENCODEデータを使用した出版物|Nature 」。Natureevents Directory。ISSN 1476-4687。
- ↑ GmbH、ユーリス。「アメリカ合衆国・IHEC」。ihec -epigenomes.org 。 2017年7月18日取得。
- ↑ 「ENCODEプロジェクト」。www.genome.gov 。2016年5月17日にオリジナルからアーカイブ済み。2016年5月16日に取得。
- ↑ ENCODEプログラムスタッフ(2012年10月18日)。「ENCODE:パイロットプロジェクト:概要」。国立ヒトゲノム研究所。
- ↑ ENCODEプログラムスタッフ(2012年2月19日)。「ENCODE:パイロットプロジェクト:ターゲット選択」。国立ヒトゲノム研究所。
- ↑ Weinstock GM (2007). "ENCODE: More genomic empowerment" . Genome Research . 17 (6): 667–668 . doi : 10.1101/gr.6534207 . PMID 17567987 .
- ↑ "Genome.gov | ENCODE および modENCODE プロジェクト" . ENCODE プロジェクト: DNA 要素の百科事典. 米国国立ヒトゲノム研究所。2011 年 8 月 1 日。2011年 8 月 5 日取得。
- ↑ 「国立ヒトゲノム研究所 - 組織」。NIH年鑑。米国国立衛生研究所。2011年8月5日取得。
- ↑ "Genome.gov | ENCODE参加者とプロジェクト" . ENCODEプロジェクト:DNA要素の百科事典. 米国国立ヒトゲノム研究所。2011年8月1日。 2011年8月5日取得。
- ↑ Ecker JR、Bickmore WA、Barroso I、Pritchard JK、Gilad Y、Segal E(2012年9月)。「ゲノミクス: ENCODEの説明」。Nature。489 ( 7414 ):52–5。Bibcode : 2012Natur.489 ...52E。doi:10.1038 / 489052a。PMID 22955614。S2CID 5366257。
- 1 2 3 Bernstein BE 、 Birney E 、 Dunham I、Green ED、Gunter C、Snyder M (2012 年 9 月)。「ヒトゲノムにおけるDNA要素の統合百科事典」。Nature。489 ( 7414 ): 57–74。Bibcode : 2012Natur.489...57T。doi : 10.1038 / nature11247。PMC 3439153。PMID 22955616。
- ↑ Thurman RE、Rynes E 、 Humbert R、Vierstra J、Maurano MT、Haugen E、Sheffield NC、Stergachis AB、Wang H、et al . ( 2012 年 9 月)。「ヒトゲノムのアクセス可能なクロマチンランドスケープ」。Nature。489 ( 7414 ): 75–82。Bibcode : 2012Natur.489... 75T。doi : 10.1038 / nature11232。PMC 3721348。PMID 22955617。
- ↑ Neph S、Vierstra J、Stergachis AB、Reynolds AP、Haugen E、Vernot B、Thurman RE、John S、Sandstrom R、et al . (2012 年 9 月)。「転写因子の痕跡にコード化された広範なヒト調節語彙」。Nature。489 ( 7414 ) : 83–90。Bibcode : 2012Natur.489 ...83N。doi : 10.1038 / nature11212 。PMC 3736582。PMID 22955618。
- ↑ Gerstein MB、Kundaje A、Hariharan M、Landt SG、Yan KK 、 Cheng C、Mu XJ、Khurana E、Rozowsky J、et al . (2012年9月)。「 ENCODEデータから導出されたヒト制御ネットワークのアーキテクチャ」。Nature。489 ( 7414 ) : 91–100。Bibcode : 2012Natur.489... 91G。doi : 10.1038 / nature11245。PMC 4154057。PMID 22955619。
- ↑ Djebali S、Davis CA、Merkel A 、 Dobin A 、Lassmann T、Mortazavi A、Tanzer A、Lagarde J、Lin W、et al . (2012年9月)。 「ヒト細胞における転写のランドスケープ」。Nature。489 ( 7414 ) : 101–8。Bibcode : 2012Natur.489..101D。doi : 10.1038/ nature11233。PMC 3684276。PMID 22955620。
- ↑ Malladi VS、Erickson DT、Podduturi NR、Rowe LD、Chan ET、Davidson JM、Hitz BC、Ho M、Lee BT、Miyasato S、Roe GR、Simison M、Sloan CA、Strattan JS、Tanaka F、Kent WJ、Cherry JM、Hong EL (2015)。「ENCODE DCCにおけるオントロジーの適用と使用」。Database ( Oxford)。2015。doi : 10.1093/ database / bav010。PMC 4360730。PMID 25776021。
- 1 2 Brian J. Raney; et al. (2010-10-30). "UCSCゲノムブラウザにおけるENCODE全ゲノムデータ(2011年更新)" . Nucleic Acids Res . 39 (データベース特集号). Nucleic Acids Research: D871–5. doi : 10.1093/nar/gkq1017 . PMC 3013645 . PMID 21037257 .
- 1 2 「modENCODEプロジェクト:DNA要素のモデル生物百科事典(modENCODE)」。NHGRIウェブサイト。 2008年11月13日取得。
- ↑ 「modENCODE参加者とプロジェクト」。NHGRIウェブサイト。2008年11月13日取得。
- ↑ 「バークレー研究所生命科学部門、ショウジョウバエと線虫の研究でNIH助成金を受賞」。ローレンス・バークレー国立研究所ウェブサイト。2007年5月14日。2008年9月21日のオリジナルからアーカイブ。 2008年11月13日取得。
- ↑ゲルシュタイン MB、ルー ZJ、ヴァン ノストランド EL、チェン C、アルシノフ BI、リュー T、イップ KY、ロビロット R、レヒトシュタイナー A、他。 (2010年)。「modENCODEプロジェクトによる線虫ゲノムの統合的解析」科学。330 (6012): 1775–1787。Bibcode : 2010Sci...330.1775G。土井:10.1126/science.1196914。PMC 3142569。PMID 21177976。
- ↑ modENCODE Consortium、Roy S、Ernst J、Kharchenko PV、Kheradpour P、Negre N、Eaton ML、Landolin JM、Bristow CA、Ma L、et al. (2010). "ショウジョウバエmodENCODEによる機能要素と制御回路の同定" . Science . 330 (6012): 1787– 1797. Bibcode : 2010Sci...330.1787R . doi : 10.1126/science.11 98374 . PMC 3192495 . PMID 21177974 .
- ↑ 「modENCODE」。国立ヒトゲノム研究所。
- ↑ Celniker S (2009-06-11). "ゲノムの秘密を解き明かす" . Nature . 459 (7249): 927– 930. Bibcode : 2009Natur.459..927C . doi : 10.1038/459927a . PMC 2843545 . PMID 19536255 .
- ↑ "レポート ⟩ レポーター"。
- ↑ 「検索 – エンコード」。
- ↑ 「2015年発表:NIHの助成金は遺伝子制御の言語を解読することを目指す」。www.genome.gov 。 2016年4月6日にオリジナルからアーカイブ済み。
- ↑ 「検索 – エンコード」。
- ↑ 「ロードマップ エピゲノミクス プロジェクト - ホーム」。2021年4月8日にオリジナルからアーカイブ済み。2014年1月10日に取得。
- ↑アンシュル、クンダジェ。ムルマン、ワウター。エルンスト、ジェイソン。ビレンキー、ミーシャ。イェン、アンジェラ。ヘラヴィ・ムサヴィ、アリレザ。ケラドプール、プーヤ。張志卓。王建栄。ジラー、マイケル・J。アミン、ヴィレン。ウィテカー、ジョン・W。シュルツ、マシュー D.ウォード、ルーカス D.サルカール、アビシェク。クオン、ジェラルド。サンドストローム、リチャード S.イートン、マシュー L.ウー、イーチエ;フェニング、アンドレアス R.ワン・シンチェン。クラウスニッツァー、メリーナ。劉亜平。コアファ、クリスティアン。ハリス、R. アラン。ショアシュ、ノーム。エプスタイン、チャールズ B.ジョネスカ、エリザベタ。レオン、ダニー。他。 (2015年)。「111個の参照ヒトエピゲノムの統合解析」 . Nature . 518 (7539): 317–330 . Bibcode : 2015Natur.518..317. . doi : 10.1038/nature14248 . PMC 4530010 . PMID 25693563 .
- ↑ Cho, Young-Dan; Kim, Woo-Jin; Ryoo, Hyun-Mo; Kim, Hong-Gee; Kim, Kyoung-Hwa; Ku, Young; Seol, Yang-Jo (2021-04-26). "ENCODEプロジェクトによる歯周病学におけるエピジェネティクスの最新の進歩:レビューと今後の展望" . Clinical Epigenetics . 13 (1): 92. doi : 10.1186/s13148-021-01074-w . ISSN 1868-7083 . PMC 8077755 . PMID 33902683 . S2CID 233402899 .
- ↑ Maher B (2012-09-06). "ENCODEとジャンクをめぐる論争" .ニュースブログ. Nature Publishing Group. 2013-08-06 のオリジナルからアーカイブ済み。2013-08-17 に取得。
- ↑ Kolata G (2012-09-05). 「『ジャンク』とは程遠く、DNAダークマターは健康に不可欠であることが証明された」 .ニューヨーク・タイムズ.
- ↑ Gregory TR (2012-09-06). "ENCODE メディアの誇大宣伝マシン" . Genomicron. 2015-04-06 のオリジナルからアーカイブ済み。2013-08-17に取得。
- ↑ Graur D ; Zheng Y; Price N; Azevedo RB; Zufall RA; Elhaik E (2013). "テレビの不滅性について: ENCODEの進化フリー福音書に基づくヒトゲノムにおける「機能」" . Genome Biol Evol . 5 (3): 578–90 . doi : 10.1093/gbe/evt028 . PMC 3622293 . PMID 23431001 .
- ↑ Moran LA (2013-03-15). 「砂浜散歩:『機能』という言葉の意味について」「 . 砂浜。
- ↑ Gregory TR (2013-04-11). 「査読付きジャーナルにおけるENCODEへの批判」。「Genomicron」。Genomicron。 2013年4月21日のオリジナルからアーカイブ済み。
- ↑ White MA、Myers CA、Corbo JC、Cohen BA (2013年7月)。「大規模並列in vivoエンハンサーアッセイにより、高度に局所的な特徴がChIP-seqピークのシス調節機能を決定することが明らかになった」。Proc . Natl . Acad . Sci . USA。110 ( 29 ) : 11952–7。Bibcode : 2013PNAS..11011952W。doi : 10.1073/ pnas.1307449110。PMC 3718143。PMID 23818646。
- マイク・ホワイト(2013年7月17日)「帰無仮説によるゲノムの機能の発見」。The Finch & Pea。
- 1 2 3 Mattick JS、Dinger ME (2013)。「ヒトゲノムにおける機能性の範囲」。The HUGO Journal。7 ( 1 ) 2。doi : 10.1186 /1877-6566-7-2。PMC 4685169。
- 1 2 3 Kellis M, et al. (2014). "ヒトゲノムにおける機能的DNA要素の定義" . Proc. Natl. Acad. Sci. USA . 111 (17): 6131– 8. Bibcode : 2014PNAS..111.6131K . doi : 10.1073/pnas.1318948111 . PMC 4035993 . PMID 24753594 .
- 1 2キャリー、ネッサ(2015)。ジャンクDNA:ゲノムの暗黒物質を巡る旅。コロンビア大学出版局。ISBN 978-0-231-17084-0。
- 1 2 Germain, Pierre-Luc; Ratti, Emanuele; Boem, Federico (2014年11月)「ジャンクDNAか機能的DNAか?ENCODEと機能論争」Biology & Philosophy . 29 (6): 807– 831. doi : 10.1007/s10539-014-9441-3 . S2CID 84480632 .
- ↑ Abascal F、Acosta R、Addleman NJ、Adrian J、et al . (2020年7月30日)。「ヒトおよびマウスゲノムにおけるDNA要素の拡張百科事典」。Nature。583 ( 7818 ) : 699–710。Bibcode : 2020Natur.583..699E。doi : 10.1038 /s41586-020-2493-4。PMC 7410828。PMID 32728249。ENCODEプロジェクトは、機能要素をコードするヒトおよびマウスゲノムのセグメントを正確かつ包括的に特定することを目的としています
。
- ↑ Snyder MP、Gingeras MB、Ren B、Hardison RC、et al. (2020)。「ENCODEに関する展望」。Nature。583 :583–698。重要なことに、非常に多くの非コード要素が
定義されていますが、ENCODEで識別された要素の機能的注釈はまだ初期段階にあります。
- ↑ Birney, Ewan (2012年9月5日). "ENCODE: 私自身の考え" . Ewan's Blog: Bioinformatician at large .
- ↑ Timpson T (2013-03-05). "ENCODEをめぐる議論:Dan Graur、Michael Eisen" . Mendelspod. 2015-04-11のオリジナルからアーカイブ済み。2013-08-15に取得。
- 1 2 Maher B (2012年9月) 「ENCODE :人類百科事典」 Nature.489 ( 7414 ): 46–8.doi : 10.1038 / 489046a.PMID 22962707 .
- ↑ファクターブック
- ↑ Wang J (2012-11-29). "Factorbook.org: ENCODEコンソーシアムによって生成された転写因子結合データのWikiベースのデータベース" . Nucleic Acids Research . 41 (データベース特集号): D171-6. doi : 10.1093/nar/gks1221 . PMC 3531197 . PMID 23203885 .