ゲノムプロジェクトは、最終的には生物(動物、植物、菌類、細菌、古細菌、原生生物、ウイルスなど)の完全なゲノム配列を決定し、タンパク質をコードする遺伝子やその他の重要なゲノムコード化された特徴を注釈付けすることを目的とする科学的取り組みです。[ 1 ]生物のゲノム配列には、その生物の各染色体の集合的なDNA配列が含まれます。単一の染色体を持つ細菌の場合、ゲノムプロジェクトはその染色体の配列をマッピングすることを目的とします。ゲノムに22対の常染色体と2つの性染色体を含むヒトの場合、完全なゲノム配列には46個の個別の染色体配列が含まれます。
ゲノムアセンブリとは、多数の短いDNA配列を取り出し、それらを再構成して、 DNAの起源となった元の染色体の構造を再現するプロセスを指します。ショットガンシーケンスプロジェクトでは、まず、ある生物(通常は単一の生物、細菌から哺乳類まで)から採取したすべてのDNAを数百万個の小さな断片に分割します。これらの断片は、自動シーケンシング装置によって「読み取られます」。ゲノムアセンブリアルゴリズムは、すべての断片を互いに整列させ、2つの短い配列(リード)が重なる箇所をすべて検出することで機能します。重なり合うリードはマージされ、このプロセスが繰り返されます。
ゲノムアセンブリは非常に難しい計算問題であり、多くのゲノムには反復配列と呼ばれる多数の同一配列が含まれているため、さらに難しくなっています。これらの反復配列は数千ヌクレオチドにも及ぶことがあり、特に植物や動物の大きなゲノムでは、さまざまな場所に存在します。
得られた(ドラフト)ゲノム配列は、配列決定されたコンティグの情報を組み合わせ、連結情報を用いてスキャフォールドを作成することによって生成される。スキャフォールドは染色体の物理マップに沿って配置され、「ゴールデンパス」を形成する。
当初、ほとんどの大規模DNAシーケンスセンターは、生成したシーケンスをアセンブルするための独自のソフトウェアを開発していました。しかし、ソフトウェアがより複雑になり、シーケンスセンターの数が増えるにつれて、これは変化しました。そのようなアセンブラの例として、 BGIが開発したShort Oligonucleotide Analysis Packageがあり、ヒトサイズのゲノムのde novoアセンブリ、アライメント、SNP検出、再シーケンス、インデル検出、構造変異解析に使用されます。[ 3 ] [ 4 ] [ 5 ]
1980年代以降、分子生物学とバイオインフォマティクスの発展により、 DNAアノテーションの必要性が高まった。DNAアノテーション、あるいはゲノムアノテーションとは、配列に生物学的情報を付加するプロセスであり、特に遺伝子の位置を特定し、それらの遺伝子の働きを解明するプロセスである。
ゲノム配列を決定する際には、通常、配列決定が困難な領域(多くの場合、反復性の高いDNA領域)が存在します。そのため、「完成した」ゲノム配列は実際にはほとんど完成しておらず、「作業ドラフト」や「ほぼ完成」といった用語が、こうしたゲノムプロジェクトの現状をより正確に表すために用いられてきました。ゲノム配列のすべての塩基対が決定されたとしても、DNA配列決定は完全に正確なプロセスではないため、エラーが存在する可能性は依然としてあります。また、ミトコンドリアや(植物の場合は)葉緑体といった細胞小器官も独自のゲノムを持っているため、完全なゲノムプロジェクトにはこれらの細胞の配列も含まれるべきだという意見もあります。
ゲノム配列決定の目的は、そのゲノム配列に含まれる遺伝子の全セットに関する情報を得ることであるとよく言われます。遺伝子をコードするゲノムの割合は非常に小さい場合があり(特にヒトなどの真核生物では、コード領域DNAは全配列の数パーセントに過ぎない)、コード領域のみを個別に配列決定することが常に可能であるとは限りません(また、望ましいとも限りません)。さらに、科学者たちがこの非コード領域DNA (しばしばジャンクDNAと呼ばれる)の役割についてより深く理解するにつれて、あらゆる生物の遺伝学や生物学を理解するための背景として、完全なゲノム配列を持つことがますます重要になってくるでしょう。
ゲノムプロジェクトは、生物のDNA配列を決定するだけにとどまらない場合が多い。こうしたプロジェクトには、ゲノム内の遺伝子の位置や機能を特定するための遺伝子予測も含まれる。また、遺伝子の実際の位置を特定するために、ESTやmRNAの配列を決定する関連プロジェクトも存在する。
従来、真核生物のゲノム(線虫Caenorhabditis elegansなど)の配列決定を行う際には、まずゲノム全体をマッピングして、ゲノム全体にわたる一連の目印を設定するのが一般的でした。染色体を一度に配列決定するのではなく、(その断片がより大きな染色体のどこにあるかという事前の知識に基づいて)断片ごとに配列決定を行っていました。技術の進歩、特にコンピュータの処理能力の向上により、現在ではゲノムを一度に「ショットガンシーケンス」することが可能になりました(ただし、この方法には従来の方法と比較した場合の注意点があります)。
DNA配列決定技術の進歩により、新しいゲノム配列を決定するコスト(塩基対あたりのコスト)は着実に低下しており、また、新しい技術によってゲノム配列決定をはるかに迅速に行えるようになった。
研究機関が新たにゲノム配列を決定する際、重点が置かれるのは、モデル生物として非常に重要な種、あるいは人間の健康に関係のある種(例えば、病原性細菌や蚊などの病原体媒介生物)、または商業的に重要な種(例えば、家畜や作物)である。二次的な重点は、ゲノムが分子進化における重要な疑問の解明に役立つ種(例えば、チンパンジー)に置かれる。
将来的には、ゲノム配列決定はさらに安価かつ迅速になる可能性が高い。これにより、同一種に属する多くの個体から完全なゲノム配列を決定できるようになるだろう。ヒトの場合、これはヒトの遺伝的多様性の様々な側面をより深く理解するのに役立つだろう。


多くの生物種において、ゲノムプロジェクトが既に完了しているか、間もなく完了する予定である。例えば、以下のような生物種が挙げられる。