ヒトゲノムは、22本の常染色体と2本の性染色体(XとY)それぞれの完全なDNA配列のセットです。ミトコンドリア内には小さなDNA分子が存在します。これらは通常、核ゲノムとミトコンドリアゲノムとして別々に扱われます。[ 1 ]
ヒトゲノムには、遺伝子とその他様々な機能的なDNA要素が含まれています。後者は多様なカテゴリーであり、調節DNA足場領域、テロメア、セントロメア、複製起点などが含まれます。さらに、多数の転移因子、内在性ウイルスDNA、非機能的な偽遺伝子、単純で高度に反復的な配列も存在します。イントロンはヒトゲノムの大部分を占めています。
ゲノムの一部は、偽遺伝子などの機能を持たないジャンクDNAであるが、ジャンクDNAの総量については確固たる合意が得られていない。
2000年に科学者たちはヒトゲノムの88%の配列決定を報告したが[ 2 ]、2020年の時点で少なくとも8%がまだ欠落していた[ 3 ] 。 2021年には科学者たちは完全な女性ゲノム(つまりY染色体を除く)の配列決定を報告した[ 4 ] [ 3 ] 。異なる細胞株由来で62,460,029塩基対からなるヒトY染色体は、すべての男性に見られ、2022年1月に完全に配列決定された[ 5 ]。
標準参照ゲノムの現在のバージョンはGRCh38.p14(2023年7月)と呼ばれています。これは22本の常染色体と1コピーのX染色体、1コピーのY染色体から構成されています。約31億塩基対が含まれています。[ 6 ]これは複数の個体からのデータに基づく複合ゲノムのサイズを表していますが、Y染色体は非常に小さいため、半数体染色体セットの典型的なDNA量を示す良い指標となります。[ 7 ]ほとんどのヒト細胞は二倍体であるため、2倍のDNA(約62億塩基対)を含んでいます。
2023年にヒトパンゲノム参照のドラフト版が発表された。[ 8 ]これは、様々な民族の人々の47のゲノムに基づいている。[ 8 ]さらに広範囲のサンプルからより多くの生物多様性を捉えた改良版参照の計画が進行中である。[ 8 ]
ヒト個体のゲノム間には大きな違いがあるものの(一塩基変異による違いは約0.1% [ 9 ] 、挿入・欠失を考慮すると0.6% )、[ 10 ]、これらはヒトと最も近縁な現生種であるボノボやチンパンジーとの間の違い(固定一塩基変異は約1.1% [ 11 ]、挿入・欠失を含めると4%)[ 12 ]よりもかなり小さい。
ヒト参照ゲノムの全長は、特定の個人の配列を表すものではなく、細胞内に存在するすべてのDNAの配列を表すものでもありません。ヒト参照ゲノムには、対になった相同な常染色体のそれぞれ1コピーと、2つの性染色体(XとY)のそれぞれ1コピーのみが含まれています。この参照ゲノムに含まれるDNAの総量は31億塩基対です。[ 13 ]
タンパク質をコードする配列は、ヒトゲノムの中で最も広く研究され、最もよく理解されている構成要素である。これらの配列は最終的にすべてのヒトタンパク質の生成につながるが、いくつかの生物学的プロセス(例えば、DNAの再編成や代替的なプレmRNAスプライシング)によって、タンパク質をコードする遺伝子の数よりもはるかに多くの種類のタンパク質が生成される可能性がある。
ヒト参照ゲノムには、19,000~20,000個のタンパク質コード遺伝子が含まれています。[ 14 ] [ 15 ]これらの遺伝子には平均10個のイントロンが含まれており、イントロンの平均サイズは約6kb(6,000bp)です。[ 16 ]つまり、タンパク質コード遺伝子の平均サイズは約62kbであり、これらの遺伝子はゲノムの約40%を占めています。[ 17 ]
エクソン配列は、成熟mRNAの両端にあるコードDNAと非翻訳領域(UTR)から構成されます。コードDNAの総量はゲノムの約1~2%です。[ 18 ] [ 16 ]
多くの人は、ゲノムの中で最も重要な機能的構成要素はコードDNAであるという考えに基づき、ゲノムをコードDNAと非コードDNAに分類する。しかし、ヒトゲノムの約98~99%は非コードDNAである。
非コードRNA分子は、細胞内で多くの重要な役割を果たしており、特にタンパク質合成やRNAプロセシングの多くの反応において重要な役割を果たしています。非コード遺伝子には、tRNA、リボソームRNA、マイクロRNA、snRNA、長鎖非コードRNA(lncRNA)の遺伝子が含まれます。[ 19 ] [ 20 ] [ 21 ] [ 22 ]報告されている非コード遺伝子の数はゆっくりと増加し続けていますが、ヒトゲノムにおける正確な数はまだ確定していません。多くのRNAは機能を持たないと考えられています。[ 23 ]
多くのncRNAは遺伝子制御と発現において重要な要素である。非コードRNAはエピジェネティクス、転写、RNAスプライシング、翻訳機構にも寄与している。遺伝子制御と疾患におけるRNAの役割は、未解明のゲノム複雑性の新たな可能性を示唆している。[ 24 ]
偽遺伝子は、タンパク質をコードする遺伝子の不活性コピーであり、多くの場合、遺伝子重複によって生成され、不活性化変異の蓄積によって機能しなくなりました。ヒトゲノム中の偽遺伝子の数は約13,000個であり[ 25 ]、一部の染色体では、機能的なタンパク質をコードする遺伝子の数とほぼ同じです。遺伝子重複は、分子進化の過程で新しい遺伝物質が生成される主要なメカニズムです。
例えば、嗅覚受容体遺伝子ファミリーは、ヒトゲノムにおける偽遺伝子の最もよく研究された例の一つです。このファミリーの遺伝子の60%以上は、ヒトでは機能しない偽遺伝子です。これに対し、マウスの嗅覚受容体遺伝子ファミリーの遺伝子のうち偽遺伝子はわずか20%です。研究によると、これは種特異的な特徴であり、最も近縁な霊長類はすべて、偽遺伝子の割合が相対的に少ないことが示唆されています。この遺伝学的発見は、ヒトの嗅覚が他の哺乳類に比べて鈍い理由を説明するのに役立ちます。[ 26 ]
ヒトゲノムには、遺伝子発現を制御するために重要なさまざまな調節配列があります。一部の科学者は、これらの配列がゲノムの 8% を占めていると考えていますが[ 27 ]、他の科学者は、ヒトゲノムの 20% 以上が調節配列に費やされている可能性があると予測しています。[ 28 ] [ 29 ]
8%という値は、遺伝子あたり約10,000 bpの調節DNAに相当し、20%という値は、遺伝子あたり25,000 bpの調節DNAに相当する。多くの科学者は、これらの推定値は不当に高く、ゲノムの10%だけが機能的で、90%はジャンクDNAであるという見解と矛盾すると考えている。[ 30 ]
調節配列は1960年代後半から知られていました。[ 31 ]ヒトゲノムにおける調節配列の最初の同定は、組換えDNA技術に依存していました。[ 32 ]その後、ゲノムシーケンスの出現により、これらの配列の同定は進化的な保存によって推測できるようになりました。たとえば、霊長類とマウスの間の進化の分岐は7000万~9000万年前に起こりました。 [ 33 ]したがって、保存配列を特定する遺伝子配列のコンピュータ比較は、遺伝子調節などの機能におけるそれらの重要性を示すものとなります。[ 34 ]
結果は、ヒトゲノムの約10%が保存されていることを示している。[ 35 ] [ 36 ]数十万のヒトゲノム配列が解読されており、個人間にはかなりの変異がある。ゲノムのわずか10%だけが浄化選択によって突然変異から保護されているようだ。[ 37 ]
2012年現在、研究の焦点はChIP-Seq法によるDNAと調節タンパク質の相互作用の発見、あるいはDNAがヒストンによってパッケージ化されていないギャップ(DNase過敏部位)の発見へと移っており、これら2つは調査対象の細胞型に潜在的な調節配列が存在する場所を示している。[ 27 ]
ヒトゲノムの約8%はタンデムDNAアレイまたはタンデムリピートで構成されており、これは複数の隣接するコピーを持つ低複雑度反復配列です(例:「CAGCAGCAG...」)。[ 39 ]タンデム配列の長さは2ヌクレオチドから数十ヌクレオチドまで様々です。これらの配列は、近縁の個人間でも非常に多様であるため、系図DNA検査や法医学DNA分析に使用されます。[ 40 ]
10 ヌクレオチド未満の繰り返し配列 (例えば、ジヌクレオチド繰り返し (AC) n ) はマイクロサテライト配列と呼ばれます。マイクロサテライト配列の中でも、トリヌクレオチド繰り返しは特に重要で、タンパク質の遺伝子のコード領域内に発生することがあり、遺伝性疾患を引き起こす可能性があります。例えば、ハンチントン病は、ヒト染色体 4 上のハンチンチン遺伝子内のトリヌクレオチド繰り返し (CAG) nの伸長によって引き起こされます。テロメア(線状染色体の末端) は、マイクロサテライト ヘキサヌクレオチド繰り返し配列 (TTAGGG) nで終わります。[ 41 ]
より長い配列のタンデムリピート(10~60ヌクレオチド長の繰り返し配列の配列)はミニサテライトと呼ばれる。[ 42 ]
転移性遺伝因子は、宿主ゲノム内の他の場所に複製して挿入できるDNA配列であり、ヒトゲノムに豊富に存在する。最も豊富なトランスポゾン系統であるAluには約50,000個の活性コピーがあり[ 43 ]、遺伝子内領域と遺伝子間領域に挿入される可能性がある[ 44 ] 。もう1つの系統であるLINE-1には、ゲノムあたり約100個の活性コピーがある(その数は人によって異なる)[ 45 ] 。古いトランスポゾンの機能しない残骸と合わせて、これらはヒトDNA全体の半分以上を占める[ 46 ] 。「ジャンプ遺伝子」とも呼ばれるトランスポゾンは、ヒトゲノムの形成に大きな役割を果たしてきた。これらの配列の中には、内在性レトロウイルス、つまりゲノムに永久的に組み込まれ、次世代に受け継がれるようになったウイルス配列のDNAコピーを表すものもある。ヒトのDNAには多数のレトロウイルスも存在し、そのうち少なくとも3つは重要な機能を持つことが証明されている(例えば、HIVのような機能性HERV-K、非機能性ウイルスHERV-WおよびHERV-FRDのエンベロープ遺伝子は細胞融合を誘導することで胎盤形成に役割を果たしている)。
ヒトゲノム内の可動性遺伝因子は、LTRレトロトランスポゾン(全ゲノムの8.3%)、Aluエレメントを含むSINE(全ゲノムの13.1%)、LINE(全ゲノムの20.4%)、SVA(SINE- VNTR -Alu)、およびクラスII DNAトランスポゾン(全ゲノムの2.9%)に分類できる。
遺伝学者、進化生物学者、分子生物学者がそれぞれ異なる定義や方法を用いているため、ゲノムにおける「機能的」要素が何であるかについては合意が得られていない。[ 47 ] [ 48 ]用語の曖昧さから、さまざまな学派が出現している。[ 49 ]進化論的定義では、コーディングDNAか非コーディングDNAかを問わず、「機能的」DNAは生物の適応度に貢献するため、負の進化圧によって維持される一方、「非機能的」DNAは生物に利益をもたらさないため、中立的な選択圧を受ける。このタイプのDNAはジャンクDNAと呼ばれている。[ 50 ] [ 51 ]遺伝学的定義では、「機能的」DNAはDNAセグメントが表現型によってどのように現れるかに関連しており、「非機能的」は生物に対する機能喪失効果に関連している。[ 47 ]生化学的な定義では、「機能的」DNAとは、分子産物(非コードRNAなど)や遺伝子またはゲノム制御における機構的役割を持つ生化学的活性(すなわち、細胞の種類、状態、分子プロセスなどの細胞レベルの活性に影響を与えるDNA配列)を指定するDNA配列を指します。[ 52 ] [ 47 ]機能的DNAの量については文献でコンセンサスが得られていません。「機能」の理解の仕方によって、ヒトゲノムの最大90%が非機能的DNA(ジャンクDNA)である可能性が高い[ 53 ]、ゲノムの最大80%が機能的である可能性が高い[ 54 ]と推定されている範囲が異なるためです。また、ジャンクDNAが将来的に機能を獲得し、進化において役割を果たす可能性もありますが[ 55 ]、これは非常にまれにしか起こらないと考えられます。[ 50 ]最後に、生物にとって有害で負の選択圧を受けているDNAは、ガベージDNAと呼ばれます。[ 51 ]
ヒトゲノムの最初の配列は、 2001年2月にヒトゲノムプロジェクト[ 56 ]とセララ社[ 57 ]によってほぼ完全なドラフト形式で公開されました。ヒトゲノムプロジェクトの配列決定作業の完了は、2004年にドラフトゲノム配列の公開とともに発表され、配列には341のギャップが残りました。これは、当時利用可能な技術では配列決定できなかった高度に反復的なDNAやその他のDNAを表しています[ 58 ] 。ヒトゲノムは、ほぼ完全に配列決定されたすべての脊椎動物の最初のものであり、2018年までに、次世代シーケンシングを使用して100万人以上の人間の二倍体ゲノムが決定されました[ 59 ]。
これらのデータは、生物医学、人類学、法医学、その他の科学分野で世界中で利用されています。こうしたゲノム研究は、疾病の診断と治療の進歩、そして人類の進化を含む生物学の多くの分野における新たな知見をもたらしてきました。
2018年までに、遺伝子の総数は少なくとも46,831個に増加し[ 60 ] 、さらに2,300個のマイクロRNA遺伝子が発見された[ 61 ]。2018年の人口調査では、参照配列に含まれていないヒトゲノムの塩基がさらに3億塩基あることが判明した[ 62 ]。全ゲノム配列が取得される前は、ヒト遺伝子の数の推定値は50,000から140,000の範囲であった(これらの推定値に非タンパク質コード遺伝子が含まれているかどうかについては、時折曖昧な点があった)[ 63 ] 。ゲノム配列の品質とタンパク質コード遺伝子を特定する方法が向上するにつれて[ 58 ] 、認識されたタンパク質コード遺伝子の数は19,000~20,000に減少した[ 64 ]。
2022年、テロメア・トゥ・テロメア(T2T)コンソーシアムはヒト女性ゲノムの完全な配列を報告し、X染色体(2020年)と22本の常染色体(2021年5月)のすべてのギャップを埋めた。 [ 3 ] [ 65 ]これまで配列が解読されていなかった部分には、感染症への適応と生存に役立つ免疫応答遺伝子や、薬剤反応の予測に重要な遺伝子が含まれている。 [ 66 ]完成したヒトゲノム配列は、ヒトが個体としてどのように形成されるか、またヒトが互いに、そして他の種とどのように異なるかについての理解を深めることにもつながるだろう。[ 66 ]
ヒトゲノムプロジェクトの「完了」は2001年に発表されたものの、[ 2 ]数百のギャップが残っており、全配列の約5〜10%が未決定のままであった。欠落した遺伝情報は主に反復性のヘテロクロマチン領域とセントロメアおよびテロメア付近にあったが、遺伝子をコードするユークロマチン領域も含まれていた。 [ 67 ] 2015年に、以前は配列決定されていなかった別の50の領域にわたる配列が決定された時点で、160のユークロマチンギャップが残っていた。[ 68 ] 2020年になって初めて、ヒト染色体の真の完全なテロメアからテロメアまでの配列が決定された。それはX染色体の配列であった。[ 69 ]ヒト常染色体である8番染色体の完全なテロメアからテロメアまでの配列が初めて決定されたのは、その1年後であった。[ 70 ]ヒトゲノム全体(Y染色体を除く)は2021年に発表され、Y染色体を含むゲノムは2022年1月に発表された。[ 3 ] [ 4 ] [ 71 ]
2023年、T2Tコンソーシアムは、ヒトY染色体の完全な配列を報告した。これは最後に完成した染色体であり、以前の参照の誤りを修正し、GRCh38に欠けていた3000万塩基対以上を追加した。[ 72 ]さまざまな系統の43個のY染色体を組み立てた関連研究では、男性間でその長さが2倍以上異なることがわかった。[ 73 ]
2025年、研究チームはフェムト秒レーザー刻印技術を用いて、ヒトゲノムのデジタルコピーを5Dメモリ結晶に保存した。このゲノムは、生物学的情報を極めて長い期間(数十億年)保存することを目的とした長期アーカイブ活動の一環として保存され、オーストリアのハルシュタットにある塩洞窟内の人類の記憶アーカイブに保管されている。[ 74 ] [ 75 ]
一卵性双生児を除き、すべての人間のゲノムDNA配列には大きな個人差が見られる。ヒト参照ゲノム(HRG)は、標準的な配列参照として用いられる。
ヒト参照ゲノムに関して、いくつか重要な点があります。
ゲノム参照コンソーシアムはHRGの更新を担当しています。参照アセンブリ(GRCh38)の最新の座標変更アップデートは2013年12月にリリースされ、現在のアセンブリ(GRCh38.p14または「h38」、NCBI RefSeq ID: GCF_000001405.40)の最新パッチは2022年2月にリリースされました。[ 76 ] [ 77 ]
HRGシステムにおけるパッチは、一般的に、変更されていない元のアセンブリと並んで表記されるマイナーアップデートです。これは、非常に多くのユーザーのために座標システムの安定性を維持しながら、ヒトの遺伝的変異をより適切に網羅する、より新しく、より正確なシーケンスを提供するために行われます。たとえば、ヒトABO遺伝子は9番染色体に位置し、h38では133,233,278番目の塩基対から始まり、133,276,024番目の塩基対で終わります。上流の要素に対する新しいシーケンスランなど、これらの座標の上流のどこかに1つの塩基対を追加または削除すると、そのアップデート以前の研究で使用されたABO遺伝子の座標が壊れ、公開されたアクセッションが使用できなくなります。パッチはFIXまたはNOVELに分類されます。前者は新しいデータによって特定されたアセンブリ配列エラーを修正し、後者は、特定のゲノム要素が参照アセンブリの座標と異なる一部の個体に存在する、新たに特定された遺伝子座を表記します。これを代替遺伝子座と呼びます。[ 78 ]
ヒトの遺伝的変異に関する研究のほとんどは、染色体上の個々の塩基の置換である一塩基多型(SNP)に焦点を当てています。ほとんどの分析では、SNPは平均してヒトのユークロマチンゲノムで1000塩基対に1つの割合で発生すると推定されていますが、その密度は均一ではありません。そのため、「人種に関係なく、私たちは皆、遺伝的に99.9%同じである」という一般的な主張が生まれますが[ 79 ]、ほとんどの遺伝学者はこれを多少修正するでしょう。たとえば、ゲノムのより大きな部分がコピー数変異に関与していると考えられています[ 80 ]。ヒトゲノムのSNP変異をカタログ化するための大規模な共同作業は、国際ハップマッププロジェクトによって行われています[ 81 ]。
特定の種類の短い反復配列のゲノム上の位置と長さは個人によって大きく異なり、これがDNAフィンガープリンティングやDNA親子鑑定技術の基礎となっている。ヒトゲノムのヘテロクロマチン領域は、数億塩基対に及ぶが、ヒト集団内でもかなり多様であると考えられている(反復配列が多く、長さも長いため、現在の技術では正確に配列決定することができない)。これらの領域には遺伝子がほとんど含まれておらず、反復配列やヘテロクロマチンの典型的な変異が表現型に重大な影響を与えるかどうかは不明である。
配偶子生殖細胞における大規模なゲノム変異のほとんどは、おそらく生存不能な胚をもたらすが、多くのヒト疾患は大規模なゲノム異常と関連している。ダウン症候群、ターナー症候群、その他多くの疾患は、染色体全体の不分離によって引き起こされる。がん細胞は染色体および染色体腕の異数性を示すことが多いが、異数性とがんとの因果関係は確立されていない。
ゲノム配列はゲノム内のすべてのDNA塩基の順序をリストするのに対し、ゲノムマップはランドマークを特定します。ゲノムマップはゲノム配列よりも詳細度が低く、ゲノム内をナビゲートするのに役立ちます。[ 82 ] [ 83 ]
変異マップの一例として、国際ハップマッププロジェクトによって開発されているハップマップがあります。ハップマップはヒトゲノムのハプロタイプマップであり、「ヒトDNA配列変異の一般的なパターンを記述する」ものです。 [ 84 ]これは、単一のDNA文字または塩基を含むゲノムの小規模な変異のパターンをカタログ化しています。
研究者らは、2008 年 5 月に、学術誌Natureにヒトゲノム全体の大規模構造変異の配列ベースの最初のマップを発表した。[ 85 ] [ 86 ]大規模構造変異とは、数千から数百万の DNA 塩基に及ぶ、人々のゲノムの違いのことである。ゲノム配列の断片の獲得または喪失であるものもあれば、配列の断片の再配置として現れるものもある。これらの変異には、個人が持つ特定の遺伝子のコピー数の違い、欠失、転座、および逆位が含まれる。
構造変異とは、点突然変異とは異なり、ヒトゲノムのより大きなセグメントに影響を与える遺伝子変異を指します。構造変異(SV)は、欠失、重複、挿入、逆位、その他の再編成など、50塩基対(bp)以上の変異として定義されることがよくあります。構造変異の約90%は非コード領域の欠失ですが、ほとんどの人は1000個以上の欠失を持っています。欠失のサイズは数十塩基対から数万塩基対に及びます。[ 87 ]平均して、個人はコード領域を変化させる約3つのまれな構造変異(例:エクソンの欠失)を持っています。約2%の人が、特に再編成などの超まれなメガベース規模の構造変異を持っています。つまり、染色体内で数百万塩基対が逆位している可能性があります。超まれとは、個人またはその家族にのみ見られるため、ごく最近発生したことを意味します。[ 87 ]
一塩基多型(SNP)はヒトゲノム全体に均一に分布しているわけではありません。実際、遺伝子間でSNPの頻度には大きなばらつきがあり、これは各遺伝子に対する選択圧の違いや、ゲノム全体における突然変異率と組換え率の違いを反映しています。しかし、SNPに関する研究はコーディング領域に偏っており、そこから得られるデータはゲノム全体におけるSNPの分布を反映しているとは考えにくいです。そのため、SNPコンソーシアムのプロトコルはコーディング領域に偏りなくSNPを同定するように設計されており、コンソーシアムの10万個のSNPは概してヒト染色体全体の配列の多様性を反映しています。SNPコンソーシアムは、 2001年第1四半期末までにゲノム全体で同定されるSNPの数を30万個に増やすことを目指しています。[ 88 ]

非コード配列の変化とコード配列の同義変化は、一般的に非同義変化よりも多く、アミノ酸の同一性を決定する位置での多様性を減少させる選択圧が大きいことを反映している。遷移変化は転位変化よりも多く、CpGジヌクレオチドは最も高い突然変異率を示しており、これはおそらく脱アミノ化によるものと考えられる。[ 89 ]
個人ゲノム配列とは、一人の人間のDNAを構成する化学塩基対の(ほぼ)完全な配列のことです。一塩基多型(SNP)などの遺伝的変異により、医療処置は人によって異なる効果をもたらすため、個人ゲノムの解析は、個々の遺伝子型に基づいた個別化された医療処置につながる可能性があります。[ 90 ]
最初に決定された個人ゲノム配列は、 2007年のクレイグ・ベンターのものでした。DNAサンプルを提供したボランティアの身元を保護するため、公開されているヒトゲノムプロジェクトでは個人ゲノムの配列決定は行われていませんでした。その配列は、多様な集団の複数のボランティアのDNAから得られたものです。[ 91 ]しかし、ベンターが主導したセララ・ゲノミクスのゲノム配列決定作業の初期段階で、複合サンプルの配列決定から、後にベンター自身であることが判明した単一の個人のDNAを使用するように変更することが決定されました。したがって、2000年に公開されたセララのヒトゲノム配列は、大部分が1人の男性のものでした。その後、初期の複合由来のデータを置き換え、当初報告された一倍体配列ではなく、両方の染色体セットを表す二倍体配列を決定したことで、最初の個人ゲノムが公開されました。[ 92 ] 2008年4月には、ジェームズ・ワトソンのゲノムも完成しました。 2009年、スティーブン・クエイクは、自身が設計したシーケンサー「ヘリスコープ」から得られた自身のゲノム配列を公開した。[ 93 ]ユアン・アシュリー率いるスタンフォード大学のチームは、クエイクのゲノムに適用されたヒトゲノムの医学的解釈のためのフレームワークを発表し、初めて全ゲノム情報に基づいた医療上の意思決定を行った。[ 94 ]このチームはさらに、イルミナのパーソナルゲノムシーケンシングプログラムの一環として最初に配列決定されたウェスト一家にこのアプローチを拡張した。[ 95 ]それ以来、デズモンド・ツツ[ 97 ] [ 98 ]やパレオ・エスキモー[ 99 ]など数百の個人ゲノム配列が公開されている。[ 96 ] 2012年には、1092のゲノムのうち2つの家族トリオの全ゲノム配列が公開された。[ 9 ] 2013 年 11 月、スペインの家族が 4 つの個人エクソームデータセット (ゲノムの約 1%) をクリエイティブ コモンズのパブリック ドメイン ライセンスの下で公開しました。[ 100 ] [ 101 ]パーソナルゲノム プロジェクト(2005 年に開始) は、ゲノム配列とそれに対応する医学的表現型の両方を公開している数少ないプロジェクトの一つです。[ 102 ] [ 103 ]
個々のゲノムの配列決定により、これまで認識されていなかった遺伝的複雑性のレベルがさらに明らかになった。パーソナルゲノミクスは、SNPだけでなく構造的変異にも起因するヒトゲノムの多様性のレベルを明らかにするのに役立った。しかし、このような知識を病気の治療や医療分野に応用することは、まだ始まったばかりである。[ 104 ]エクソームシーケンスは、エクソームがゲノム配列のわずか1%を占めるにすぎないが、病気に大きく寄与する変異の約85%を占めるため、遺伝性疾患の診断を支援するツールとしてますます普及している。[ 105 ]
ヒトにおいては、遺伝子ノックアウトはヘテロ接合型またはホモ接合型の機能喪失型遺伝子ノックアウトとして自然に発生する。これらのノックアウトは、特に遺伝的背景が多様な場合、区別が難しいことが多い。また、発生頻度が低いため、発見も困難である。

近親婚率の高い集団、例えばいとこ婚率の高い国々では、ホモ接合型遺伝子ノックアウトの頻度が最も高い。こうした集団には、パキスタン、アイスランド、アーミッシュの人々などが含まれる。親族関係が密接なこれらの集団は、ヒトのノックアウト研究の対象となっており、ヒトにおける特定の遺伝子の機能を解明するのに役立ってきた。研究者は、特定のノックアウトを区別することで、これらの個体の表現型解析を用いて、ノックアウトされた遺伝子の特徴を明らかにすることができる。

特定の遺伝子のノックアウトは遺伝性疾患を引き起こす可能性があり、有益な効果をもたらす可能性があり、表現型への影響が全くない場合もあります。しかし、ノックアウトの表現型への影響をヒトで判定することは困難な場合があります。ノックアウトの特徴付けと臨床的解釈における課題には、DNA変異の検出の難しさ、タンパク質機能の破壊の判定(アノテーション)、モザイク現象が表現型に及ぼす影響の程度を考慮することなどが含まれます。[ 106 ]
ヒトのノックアウトを調査した主要な研究の 1 つは、パキスタン心筋梗塞リスク研究です。[ 107 ] APOC3遺伝子の機能喪失型ヘテロ接合遺伝子ノックアウトを持つ人は、変異のない人に比べて、高脂肪食を摂取した後の血中トリグリセリド値が低いことがわかりました。しかし、APOC3 遺伝子の機能喪失型ホモ接合遺伝子ノックアウトを持つ人は、機能的な APOC3 タンパク質を産生しないため、脂肪負荷試験後の血中トリグリセリド値が最も低くなりました。[ 108 ]
人体の各細胞において、ヒトゲノムは平均して1日に数万回のDNA損傷イベントを経験します。 [ 109 ]これらの損傷イベントはゲノム複製やゲノム転写を阻害する可能性があり、修復さ れない場合や誤って修復された場合は、突然変異やヒトゲノムにおけるその他のゲノム変化を引き起こし、細胞の生存を脅かす可能性があります。 [ 109 ]
人間の生物学のほとんどの側面は、遺伝的(遺伝性)要因と非遺伝的(環境的)要因の両方に関係しています。遺伝的変異の中には、医学的性質を持たない生物学的側面(身長、目の色、特定の化合物の味覚や嗅覚など)に影響を与えるものもあります。さらに、一部の遺伝性疾患は、適切な環境要因(食事など)と組み合わさった場合にのみ疾患を引き起こします。これらの注意点を踏まえると、遺伝性疾患は、ゲノムDNA配列の変異によって引き起こされる臨床的に定義された疾患として説明できます。最も単純なケースでは、疾患は単一の遺伝子の変異に関連している可能性があります。たとえば、嚢胞性線維症はCFTR遺伝子の変異によって引き起こされ、1,300を超える異なる変異が知られている白人集団で最も一般的な劣性疾患です。[ 110 ]
特定の遺伝子の疾患を引き起こす変異は、通常、遺伝子機能の観点から重篤であり、まれであるため、遺伝性疾患も同様に個々にはまれです。しかし、遺伝性疾患を引き起こす可能性のある遺伝子は多数存在するため、全体としては、特に小児医療において、既知の疾患の重要な構成要素となっています。分子的に特徴づけられた遺伝性疾患とは、根本的な原因遺伝子が特定されている疾患のことです。現在、OMIMデータベースには、そのような疾患が約2,200件注釈されています。[ 110 ]
遺伝性疾患の研究は、多くの場合、家族を対象とした研究によって行われます。フィンランド、フランス系カナダ人、ユタ州、サルデーニャ島などのいわゆる創始者集団の場合、集団を対象としたアプローチが用いられることもあります。遺伝性疾患の診断と治療は、通常、臨床遺伝学の訓練を受けた遺伝学者(医師)によって行われます。ヒトゲノム計画の成果は、遺伝子関連疾患の遺伝子検査の利用可能性を高め、最終的には治療の改善につながると考えられます。両親は遺伝性疾患のスクリーニングを受け、その影響、遺伝の可能性、そして子孫への遺伝を回避または軽減する方法についてカウンセリングを受けることができます。
DNA配列の変異には、染色体の完全な過剰または欠失から単一ヌクレオチドの変化まで、さまざまな種類があります。一般的に、ヒト集団における自然発生的な遺伝的変異の多くは表現型的に中立であると考えられています。つまり、個体の生理機能に検出可能な影響はほとんど、あるいは全くありません(ただし、進化的な時間スケールで定義される適応度のわずかな違いは存在する可能性があります)。遺伝性疾患は、既知のすべての種類の配列変異によって引き起こされる可能性があります。新しい遺伝性疾患を分子レベルで特徴づけるには、特定のゲノム配列変異と調査対象の臨床疾患との間に因果関係を確立する必要があります。このような研究は、ヒト分子遺伝学の領域を構成します。
ヒトゲノム計画と国際ハップマッププロジェクトの出現により、糖尿病、喘息、片頭痛、統合失調症など、多くの一般的な疾患に対する微妙な遺伝的影響を調査することが可能になった。特定の遺伝子のゲノム配列変異とこれらの疾患の一部との間に因果関係が発見され、しばしば一般メディアで大きく報道されているものの、これらの疾患は、多くの異なる遺伝的要因と環境要因が関与する複雑な原因を持つため、通常は遺伝性疾患とはみなされていない。したがって、特定の疾患を遺伝性疾患と呼ぶべきかどうかについては、個々のケースで意見が分かれる可能性がある。
その他の遺伝性疾患としては、カルマン症候群およびファイファー症候群(遺伝子FGFR1)、フックス角膜ジストロフィー(遺伝子TCF4)、ヒルシュスプルング病(遺伝子RETおよびFECH)、バルデ・ビードル症候群1(遺伝子CCDC28BおよびBBS1)、バルデ・ビードル症候群10(遺伝子BBS10)、および顔面肩甲上腕型筋ジストロフィー2型(遺伝子D4Z4およびSMCHD1)が挙げられる。[ 111 ]
ゲノムシーケンスにより、ゲノムを特定の場所に絞り込み、遺伝性疾患を引き起こす変異をより正確に検出できるようになりました。コピー数多型(CNV)や一塩基多型(SNV)も、次世代シーケンス(NGS)と呼ばれる新しいシーケンス手順で、ゲノムシーケンスと同時に検出できます。[ 112 ]これは、ゲノムのごく一部、約1~2%のみを解析します。このシーケンスの結果は、アッシャー症候群、網膜疾患、聴覚障害、糖尿病、てんかん、リー症候群、遺伝性癌、神経筋疾患、原発性免疫不全症、重症複合免疫不全症(SCID)、ミトコンドリア疾患などの遺伝性疾患の臨床診断に使用できます。[ 113 ] NGSは、受胎前に疾患の保因者を特定するためにも使用できます。このシーケンスで検出できる疾患には、テイ・サックス病、ブルーム症候群、ゴーシェ病、カナバン病、家族性自律神経失調症、嚢胞性線維症、脊髄性筋萎縮症、脆弱X症候群などがあります。次世代ゲノムシーケンスは、特定の民族集団でより多く見られる疾患を具体的に探すように絞り込むことができます。[ 114 ]
哺乳類のゲノムの比較ゲノム研究によると、ヒトゲノムの約5%は、約2億年前に現存する系統が分岐して以来、進化によって保存されており、遺伝子の大部分が含まれていることが示唆されている。[ 115 ] [ 116 ]公開されているチンパンジーのゲノムは、直接配列比較でヒトゲノムと1.23%異なっている。[ 117 ]この数値の約20%は各種内の変異によって説明され、共有遺伝子におけるヒトとチンパンジー間の一貫した配列の相違はわずか約1.06%にとどまる。 [ 118 ]しかし、このヌクレオチドごとの違いは、ヒトまたはチンパンジーのいずれかに固有の機能遺伝子の約6%を含む、各ゲノムの共有されていない部分に比べると小さい。[ 119 ]
言い換えれば、ヒトとチンパンジーの間に見られる大きな違いは、共通遺伝子のDNA配列の変化よりも、遺伝子の数、機能、発現におけるゲノムレベルの変動に大きく起因している可能性がある。実際、ヒト内でも、これまで認識されていなかったコピー数多型(CNV)が発見されており、ヒトゲノムの5~15%を占めることもある。言い換えれば、ヒト間では、±5億塩基対のDNAが存在し、その中には活性遺伝子、不活性化遺伝子、または異なるレベルで活性を示す遺伝子がある可能性がある。この発見の真の意義はまだ明らかになっていない。平均的に、典型的なヒトのタンパク質コード遺伝子は、チンパンジーの相同遺伝子とわずか2つのアミノ酸置換で異なっている。ヒト遺伝子のほぼ3分の1は、チンパンジーの相同遺伝子と全く同じタンパク質翻訳を行う。 2つのゲノムの大きな違いは、ヒトの染色体2であり、これはチンパンジーの染色体12と13の融合産物に相当する。[ 120 ](後にそれぞれ染色体2Aと2Bに改名された)。
人類は近年の進化の過程で嗅覚受容体遺伝子を著しく失っており、これが他のほとんどの哺乳類に比べて嗅覚が比較的原始的である理由である。進化論的証拠は、人類および他のいくつかの霊長類種における色覚の出現が嗅覚の必要性を低下させたことを示唆している。[ 121 ]
2016年9月、科学者たちは、ヒトDNA遺伝子研究に基づき、今日世界にいるすべての非アフリカ人は、 5万年から8万年前にアフリカを出た単一の集団に遡ることができると報告した。[ 122 ]
ヒトのミトコンドリアDNAは、ミトコンドリア病において間違いなく役割を果たしているため、遺伝学者にとって非常に興味深い研究対象です。また、ヒトの進化を解明する上でも重要な役割を果たしています。例えば、ヒトのミトコンドリアゲノムの変異を解析した結果、母系系統においてすべての人類に共通する比較的最近の祖先が存在するという仮説が立てられました(ミトコンドリア・イブを参照)。
活性酸素種への曝露によって誘発される損傷のため、ミトコンドリアDNA(mtDNA)は核DNAよりも変異速度が速い。この20倍高い突然変異率により、mtDNAは母系祖先のより正確な追跡に使用できる。集団におけるmtDNAの研究により、シベリアからのネイティブアメリカン[ 123 ]や東南アジアからのポリネシア人の移動など、古代の移動経路をたどることができた。また、純粋に母系系統を通じて受け継がれたヨーロッパ人の遺伝子混合物にはネアンデルタール人のDNAの痕跡がないことを示すためにも使用された[ 124 ] 。mtDNAの遺伝は制限的な全か無かの方式であるため、ネアンデルタール人の祖先の割合が大きかったり、そのmtDNAに対する強い正の選択があったりしない限り、この結果(ネアンデルタール人のmtDNAの痕跡がない)はありそうにない。例えば、5世代遡ると、ある人の32人の祖先のうち、その人のミトコンドリアDNAに貢献したのはたった1人だけなので、もしこの32人のうちの1人が純粋なネアンデルタール人だった場合、その人の常染色体DNAの約3%がネアンデルタール人由来になると予想されるが、ネアンデルタール人のミトコンドリアDNAの痕跡が全くない確率は約97%である。
エピジェネティクスは、クロマチンパッキング、ヒストン修飾、DNAメチル化など、ヒトゲノムの基本的なDNA配列を超えたさまざまな特徴を記述し、遺伝子発現、ゲノム複製、その他の細胞プロセスの調節において重要です。エピジェネティックマーカーは特定の遺伝子の転写を強化または弱化しますが、DNAヌクレオチドの実際の配列には影響しません。DNAメチル化は、遺伝子発現に対するエピジェネティック制御の主要な形態であり、エピジェネティクスで最も研究されているトピックの1つです。発生の過程で、ヒトのDNAメチル化プロファイルは劇的な変化を経験します。初期の生殖細胞では、ゲノムのメチル化レベルは非常に低くなっています。これらの低いレベルは一般的に活性遺伝子を表しています。発生が進むにつれて、親のインプリンティングタグによりメチル化活性が増加します。[ 125 ] [ 126 ]
エピジェネティックパターンは、個体内の組織間だけでなく、個体間でも識別できます。エピジェネティック状態のみが異なる同一の遺伝子は、エピ対立遺伝子と呼ばれます。エピ対立遺伝子は、個体の遺伝子型によって直接決定されるもの、遺伝子型の影響を受けるもの、および遺伝子型と完全に独立したものの3つのカテゴリーに分類できます。エピゲノムは、環境要因によっても大きく影響を受けます。食事、毒素、ホルモンはエピジェネティック状態に影響を与えます。食事操作の研究では、メチル基欠乏食がエピゲノムの低メチル化と関連していることが示されています。このような研究は、エピジェネティクスが環境とゲノムの間の重要なインターフェースであることを確立しています。[ 127 ]
受理
離散的で線形に順序付けられた配列特徴として定義されます。
ゲノムの80%について生化学的機能を割り当てることができました。 。
受けている (50–100 bp) の小さなセグメントの割合は約 5% と推定できます。
この割合は、タンパク質をコードする配列だけでは説明できないほど高く、ゲノムには生物学的機能のために選択を受けている多くの追加的な特徴(非翻訳領域、調節要素、非タンパク質コード遺伝子、染色体構造要素など)が含まれていることを示唆している。
計算され、より限定的な研究からの最近の結果が確認されました。
約1.06%以下である。
私たちの結果は、ヒトとチンパンジーの遺伝子構成が少なくとも6%(22,000個の遺伝子のうち1,418個)異なっていることを示唆しており、これは、よく引用される相同ヌクレオチド配列間の1.5%の差とは著しく対照的である。
の祖先染色体の融合によって生じた。 Olson MV、Varki A ( 2003年1月)。「チンパンジーゲノムのシーケンス解析:ヒトの進化と疾患への洞察」。Nature Reviews Genetics。4 ( 1 ):20–28。doi:10.1038 /nrg981。PMID 12509750。S2CID 205486561。チンパンジーゲノムの大規模シーケンス解析が
間近に迫っている。
私たちの研究結果は、霊長類における完全な三色覚の獲得と同時に嗅覚レパートリーの劣化が起こったことを示唆しています。