2008 年 1 月から 2015 年にかけて行われた1000 ゲノム プロジェクト( 1KGP )は、当時最も詳細なヒトの遺伝的変異のカタログを作成するための国際的な研究プロジェクトでした。科学者たちは、新たに開発された技術の進歩を利用して、今後 3 年以内に、さまざまな民族グループから少なくとも 1000 人の匿名の健康な参加者のゲノムをシーケンスすることを計画しました。2010 年に、このプロジェクトはパイロット フェーズを完了し、その詳細は学術誌Natureの出版物で説明されました。[ 1 ] 2012 年に、1092 個のゲノムのシーケンスがNatureの出版物で発表されました。[ 2 ] 2015 年に、Natureの 2 つの論文で、プロジェクトの完了と今後の研究の機会の結果が報告されました。[ 3 ] [ 4 ]
近縁のグループに限定された多くの希少な変異が特定され、8つの構造変異クラスが分析された。[ 5 ]
このプロジェクトは、中国、イタリア、日本、ケニア、ナイジェリア、ペルー、英国、米国など世界中の研究所から集まった学際的な研究チームを結集させ、配列データセットと、科学コミュニティと一般の人々が公共データベースを通じて自由にアクセスできる改良されたヒトゲノムマップに貢献しました。[ 2 ]
国際ゲノムサンプルリソースは、プロジェクト終了後にデータセットをホストし、拡張するために作成されました。[ 6 ]

ヒトゲノムプロジェクトの完了以来、ヒト集団遺伝学および比較ゲノミクスの進歩により、遺伝的多様性に関するさらなる洞察が可能になった。[ 7 ]構造的変異(挿入/欠失(インデル)、コピー数変異(CNV)、レトロエレメント)、一塩基多型(SNP)、および自然選択に関する理解が固まりつつあった。[ 8 ] [ 9 ] [ 10 ] [ 11 ]
ヒトの遺伝的変異の多様性、例えばインデルなどが明らかになり、ヒトゲノム変異が研究されてきた。
また、自然選択が集団間の違いに与える影響を調査するために使用できる証拠を提供することも目的としていました。DNA多型のパターンは、選択の痕跡を確実に検出するために使用でき、病気への抵抗性や薬物代謝の変動の根底にある可能性のある遺伝子を特定するのに役立つ可能性があります。[ 12 ] [ 13 ]このような知見は、表現型の変動、遺伝性疾患、メンデル遺伝、およびそれらがさまざまなヒト集団の生存や生殖に与える影響についての理解を深める可能性があります。
1000ゲノムプロジェクトは、主に単純な形質に深刻な影響を与える稀な遺伝子変異(例:嚢胞性線維症、ハンチントン病)と、軽微な影響しか与えず複雑な形質(例:認知、糖尿病、心臓病)に関与する一般的な遺伝子変異との間の知識のギャップを埋めるように設計されました。[ 14 ]
このプロジェクトの主な目的は、遺伝的変異と疾患との関連研究に使用できる、ヒトの遺伝的変異の完全かつ詳細なカタログを作成することでした。コンソーシアムは、ゲノム全体でマイナーアレル頻度が1%以下、遺伝子領域では0.1~0.5%以下の変異(SNP、CNV、インデルなど)の95%以上を発見し、変異アレルの集団頻度、ハプロタイプ背景、連鎖不平衡パターンを推定することを目指しました。[ 15 ]
二次的な目標には、将来の研究におけるジェノタイピングプラットフォームのためのより良いSNPおよびプローブ選択のサポート、およびヒト参照配列の改善が含まれていました。完成したデータベースは、選択を受けている領域、複数の集団における変異、および突然変異と組換えの根本的なプロセスを理解するための有用なツールになると期待されていました。[ 15 ]
ヒトゲノムは約30億個のDNA塩基対からなり、約2万個のタンパク質コード遺伝子を持つと推定されている。研究の設計において、コンソーシアムは、技術的課題、データ品質基準、配列カバレッジなど、プロジェクトの指標に関するいくつかの重要な問題に対処する必要があった。[ 15 ]
次の3年間で、サンガー研究所、BGI深圳、国立ヒトゲノム研究所の大規模シーケンスネットワークの科学者たちは、少なくとも1,000のヒトゲノムのシーケンスを行う計画を立てた。必要なシーケンスデータの量が膨大であるため、追加の参加者の募集が続けられた。[ 14 ]
2年間の生産期間中、1日あたり約100億塩基の配列決定が行われる予定で、これは24時間ごとに2つ以上のヒトゲノムの配列決定に相当する。意図された配列データセットは6兆のDNA塩基から構成され、当時DNAデータベースで公開されていた配列データの60倍となる予定だった。 [ 14 ]
プロジェクト全体の最終設計を決定するために、プロジェクトの最初の 1 年以内に 3 つのパイロット研究を実施することになっていた。最初のパイロットでは、3 つの主要な地理的グループの 180 人を低カバレッジ (2 ×) で遺伝子型判定することを目的としている。2 番目のパイロット研究では、2 つの核家族 (両親と成人した子供) のゲノムを高カバレッジ (ゲノムあたり 20 ×) でシーケンスする予定である。3 番目のパイロット研究では、1,000 人の 1,000 個の遺伝子のコーディング領域 (エクソン) を高カバレッジ (20 ×) でシーケンスすることが含まれる。[ 14 ] [ 15 ]
標準的なDNAシーケンス技術を使用した場合、このプロジェクトには5億ドル以上かかると推定された。いくつかの新しい技術(Solexa、454、SOLiDなど)が適用され、予想コストは3,000万ドルから5,000万ドルに削減された。主な支援は、英国ヒンクストンのウェルカム・トラスト・サンガー研究所、中国深圳の北京ゲノム研究所(BGI深圳)、および米国国立衛生研究所(NIH)の一部であるNHGRIによって提供された。[ 14 ]
フォートローダーデール原則[ 16 ]に従い、プロジェクトの進行に伴い、すべてのゲノム配列データ(バリアントコールを含む)が無料で利用可能となり、1000ゲノムプロジェクトのウェブページからFTP経由でダウンロードできます。[ 17 ]

プロジェクトの全体的な目標に基づき、サンプルは、一般的な疾患の関連研究が行われている集団において検出力を高めるように選択されます。さらに、提案されているカタログは人間の多様性に関する基本的なリソースとなるため、サンプルには医学的情報や表現型情報は必要ありません。[ 15 ]
パイロット研究では、 HapMapコレクションのヒトゲノムサンプルをシーケンスします。他のプロジェクトの結果と比較できるように、追加データ(ENCODEシーケンス、ゲノムワイド遺伝子型、フォスミド末端配列、構造変異アッセイ、遺伝子発現など)が利用可能なサンプルに焦点を当てるのが有用です。[ 15 ]
1000ゲノムプロジェクトは、広範な倫理的手続きに従って、ボランティア提供者からのサンプルを使用します。研究には、次の集団が含まれます。ナイジェリアのイバダンのヨルバ族(YRI)、東京の日本人(JPT)、北京の中国人(CHB)、北欧および西欧の祖先を持つユタ州住民(CEU)、ケニアのウェブイェのルヒヤ族(LWK)、ケニアのキニャワのマサイ族(MKK)、イタリアのトスカーナ人(TSI)、ペルーのリマのペルー人(PEL)、ヒューストンのグジャラート系インド人(GIH)、デンバー大都市圏の中国人(CHD)、ロサンゼルスのメキシコ系の人々(MXL)、米国南西部のアフリカ系の人々 (ASW)。[ 14 ]
*ディアスポラで収集された人口
1000ゲノムプロジェクトによって生成されたデータは遺伝学コミュニティで広く利用されており、最初の1000ゲノムプロジェクトは生物学で最も引用されている論文の1つとなっています。[ 19 ]このユーザーコミュニティを支援するために、プロジェクトは2012年7月にコミュニティ分析会議を開催し、主要なプロジェクト発見、集団遺伝学とヒト疾患研究への影響、および他の大規模シーケンス研究の概要を強調する講演を行いました。[ 20 ]
パイロットフェーズは、以下の3つのプロジェクトで構成されていた。
平均して、各人は注釈付き遺伝子に約250~300個の機能喪失型変異と、遺伝性疾患に関与することが以前に示唆された50~100個の変異を保有していることが判明した。2つのトリオに基づくと、新規生殖細胞系変異率は1世代あたり塩基あたり約10⁻⁸と推定される。[ 1 ]