
コピー数多型(CNV)は、ゲノムの一部が繰り返され、その繰り返し回数が個体によって異なる現象です。[ 1 ]コピー数多型は構造変異の一種であり、具体的には、かなりの数の塩基対に影響を与える重複または欠失イベントの一種です。 [ 2 ]ヒトゲノム全体の約3分の2は繰り返し配列で構成されている可能性があり[ 3 ]、ヒトゲノムの4.8~9.5%はコピー数多型に分類されます。[ 4 ]哺乳類では、コピー数多型は集団における必要な変異や疾患表現型の生成に重要な役割を果たしています。[ 1 ]
コピー数多型は、一般的に短い反復配列と長い反復配列の 2 つの主要なグループに分類できます。ただし、この 2 つのグループの間には明確な境界はなく、分類は対象となる遺伝子座の性質に依存します。短い反復配列には、主にジヌクレオチド反復配列 (2 つのヌクレオチドが繰り返される、例: ACACAC...) とトリヌクレオチド反復配列が含まれます。長い反復配列には、遺伝子全体の反復が含まれます。反復配列のサイズに基づくこの分類は、サイズが反復配列を生じさせた可能性が最も高いメカニズムの種類を調べる上で重要な要素であるため、最も明白な分類タイプです[ 5 ]。したがって、これらの反復配列が表現型に及ぼす可能性のある影響を調べることができます。
短いコピー数多型の最もよく知られた例の 1 つは、神経疾患であるハンチントン病の原因となるハンチンチン遺伝子の CAG 塩基対のトリヌクレオチド反復です。[ 6 ]この特定のケースでは、トリヌクレオチド反復伸長で CAG トリヌクレオチドが 36 回以上繰り返されると、個人にハンチントン病が発症する可能性が高く、その子孫にも遺伝する可能性が高くなります。[ 6 ] CAG トリヌクレオチドの反復回数は、ハンチントン病の発症年齢と逆相関しています。 [ 7 ]これらのタイプの短い反復は、ポリメラーゼのスリップ、テンプレートスイッチング、フォークスイッチングなど、複製中のポリメラーゼ活性のエラーによるものと考えられており、これについては後で詳しく説明します。これらのコピー数多型の短い反復サイズは、これらの反復領域がポリメラーゼによって誤って認識されやすく、複製された領域が再び複製されて、反復の余分なコピーにつながる可能性があるため、ポリメラーゼのエラーにつながりやすいです。[ 8 ]さらに、これらのトリヌクレオチド反復配列が遺伝子のコード領域の同じ読み枠にある場合、同じアミノ酸の長い鎖につながり、細胞内でタンパク質凝集体を形成する可能性があります。 [ 7 ]また、これらの短い反復配列が遺伝子の非コード領域にある場合、遺伝子発現と調節に影響を与える可能性があります。一方、遺伝子全体の反復配列の可変数は、ゲノム内ではあまり一般的ではありません。遺伝子全体の反復配列の1つの例は、異なる食生活を送る異なる集団間でコピー数に大きな変動があるα-アミラーゼをコードするα-アミラーゼ1遺伝子(AMY1 )です。 [ 9 ] AMY1遺伝子のコピー数を増減させる具体的なメカニズムはまだ議論の的となっていますが、非相同末端結合またはマイクロホモロジー媒介末端結合がこれらの遺伝子全体の反復配列の原因である可能性が高いという仮説もあります。[ 9 ]遺伝子全体の繰り返しは、その特定の遺伝子の発現に即座に影響を及ぼし、 AMY1のコピー数変異は遺伝子が食生活と関連していることは、最近の人類の進化適応の顕著な例である。[ 9 ]これらはコピー数変異が分類される一般的なグループであるが、コピー数変異が影響を与える塩基対の正確な数は、特定の関心のある遺伝子座によって異なる。現在、報告されているすべてのコピー数変異のデータを使用すると、コピー数変異の平均サイズは約 118kb、中央値は約 18kb である。[ 10 ]
コピー数変異の構造的アーキテクチャに関して、研究では、コピー数変異が4倍多く存在するゲノムのホットスポット領域が示唆され、定義されています。[ 2 ]これらのホットスポット領域は、セグメント重複として知られる90~100%類似した長い反復配列を含む領域として定義され、タンデムまたは散在のいずれかであり、最も重要なことに、これらのホットスポット領域では染色体再編成の速度が増加しています。[ 2 ]これらの大規模な染色体再編成は、コピー数変異を含む正常な変異と遺伝性疾患を引き起こすと考えられていました。 [ 1 ]さらに、これらのコピー数変異ホットスポットは、異なる大陸の多くの集団で一貫しており、これらのホットスポットがすべての集団によって独立して獲得され、世代を超えて受け継がれたか、または集団が分岐する前の初期の人類進化で獲得されたことを示唆しており、後者のほうが可能性が高いようです。[ 1 ]最後に、コピー数変異が最も密に分布する位置の空間的偏りはゲノムでは発生しないようです。[ 1 ]当初は蛍光in situハイブリダイゼーションとマイクロサテライト解析によって、コピー数反復はテロメア、セントロメア、ヘテロクロマチンなどの高度に反復する領域に局在することが検出されましたが、[ 11 ]最近のゲノムワイド研究では、これとは異なる結論が出ています。[ 2 ]つまり、サブテロメア領域とペリセントロメア領域が染色体再編成ホットスポットの大部分が存在する場所であり、その領域ではコピー数変異の著しい増加は見られません。[ 2 ]さらに、これらの染色体再編成ホットスポット領域では遺伝子数が減少しておらず、これもまた、コピー数変異のゲノム上の位置の空間的偏りが最小限であることを示唆しています。[ 2 ]
細胞遺伝学的観察から、コピー数多型は当初、ゲノムのごくわずかで無視できる部分を占めていると考えられていました。 [ 12 ]コピー数多型は一般的に、小さなタンデムリピートまたは特定の遺伝性疾患にのみ関連付けられており、[ 13 ]そのため、コピー数多型は当初、特定の遺伝子座の観点からのみ調べられていました。しかし、技術の発展により、コピー数多型を同定および研究するための非常に正確な方法が増加しました。コピー数多型は、染色体の物理的構造を観察できる技術である細胞遺伝学的技術によって最初に研究されました。[ 12 ]これらの技術の1つは、蛍光in situハイブリダイゼーション(FISH)であり、結合するためにゲノム内で高い相補性を必要とする蛍光プローブを挿入します。 [ 10 ]比較ゲノムハイブリダイゼーションも、蛍光色素の可視化によってコピー数多型を検出し、染色体の長さを比較するために一般的に使用されていました。[ 10 ]
ゲノム技術の最近の進歩により、非常に高いゲノム解像度を持つ多くの重要な手法が生まれ、その結果、ゲノム内のコピー数変異がますます多く報告されるようになった。[ 10 ]当初、これらの進歩には、遺伝子全体にわたって約1メガベースの間隔を持つ細菌人工染色体(BAC)アレイの使用が含まれていた。 [ 14 ] BACは、再編成ホットスポットのコピー数変異も検出でき、119の新規コピー数変異の検出を可能にした。[ 2 ]ハイスループットゲノムシーケンスは、ヒトゲノム学の分野に革命をもたらし、ゲノム内のコピー数変異を検出するためにインシリコ研究が実施された。 [ 2 ]フォスミドクローンを厳密に40kbに制御することにより、フォスミドを使用して参照配列を他の関心のある配列と比較した。 [ 15 ]シーケンスのエンドリードは、参照配列を目的の配列にアラインメントするのに十分な情報を提供し、ミスアラインメントは容易に検出できるため、クローンのその領域内のコピー数変異であると結論付けられます。[ 15 ]このタイプの検出技術は、高いゲノム解像度とゲノム内の反復配列の正確な位置を提供し、逆位などの他のタイプの構造的変異も検出できます。[ 10 ]
さらに、コピー数多型を検出するもう1つの方法は、一塩基多型(SNP)を使用することです。[ 10 ]ヒトSNPデータが豊富にあるため、コピー数多型を検出する方向は、これらのSNPを利用する方向に変化しました。[ 16 ]ヒトの組換えは比較的まれであり、組換えイベントの多くは組換えホットスポットとして知られるゲノムの特定の領域で発生するという事実に基づいて、連鎖不平衡を使用してコピー数多型を特定できます。[ 16 ]連鎖不平衡を分析することにより、コピー数多型を特定のハプロタイプSNPと関連付ける努力がなされており、これらの関連性を使用して、SNPをマーカーとして使用してゲノムのコピー数多型を認識することができます。ショートリードおよびロングリードシーケンスを含む次世代シーケンス技術は、現在ますます使用されており、コピー数多型を検出するためにアレイベースの技術に取って代わり始めています。[ 17 ] [ 18 ]
コピー数変異の形成には、相同性に基づくものと非相同性に基づくものの2つの主要な分子メカニズムがあります。[ 5 ]多くの提案がなされてきましたが、これらの理論のほとんどは推測と憶測です。特定のコピー数変異と特定のメカニズムを関連付ける決定的な証拠はありません。

コピー数変異や欠失、逆位を引き起こす最もよく知られた理論の 1 つは、非対立相同組換えです。[ 19 ]減数分裂組換え中、相同染色体が対合し、2 つの末端二本鎖切断が形成され、ホリデー接合部となります。しかし、異常なメカニズムでは、ホリデー接合部の形成中に二本鎖切断がずれて、クロスオーバーが同じ染色体上の非対立位置に発生します。ホリデー接合部が解消されると、不均等なクロスオーバーイベントにより、2 つの相同染色体間で遺伝物質が転送され、その結果、両方の相同染色体の DNA の一部が繰り返されます。[ 19 ]繰り返し領域はもはや独立して分離しないため、染色体の重複領域が遺伝します。コピー数変異を引き起こす可能性のある相同組換えに基づく別のメカニズムは、切断誘発複製として知られています。[ 20 ]ゲノムで予期せず二本鎖切断が発生すると、細胞は切断の修復を媒介する経路を活性化します。[ 20 ]非対立相同組換えと同様に、切断の修復エラーは、ゲノムの特定の領域のコピー数の増加につながる可能性があります。二本鎖切断の修復中に、切断された末端は元の鎖に再結合する代わりに、相同染色体に侵入する可能性があります。[ 20 ]非対立相同組換えメカニズムと同様に、特定の領域の余分なコピーが別の染色体に転送され、重複イベントにつながります。さらに、コヒーシンタンパク質は、2つの末端を近接してクランプすることにより、染色体間の末端の侵入を防ぎ、二本鎖切断の修復システムを助けることがわかっています。[ 21 ]リボソームRNAの活性化など何らかの理由でコヒーシン活性が影響を受けると、二本鎖切断修復エラーが局所的に増加する可能性がある。[ 21 ]
コピー数変異を引き起こすと考えられるもう1つのメカニズムは、非相同性に基づくものです。これを相同性に基づくメカニズムと区別するには、相同性の概念を理解する必要があります。染色体の相同ペアリングには、互いに非常に類似した(約97%)DNA鎖が使用され、これらの鎖は、短くても非常に類似したペアリングを避けるために、一定の長さより長くなければなりません。[ 5 ]一方、非相同ペアリングは、2つの鎖間の類似した塩基対がわずかであるため、非相同性に基づく二本鎖修復の過程で遺伝物質が交換または複製される可能性があります。[ 5 ]
非相同性に基づくメカニズムの一種に、非相同末端結合またはマイクロ相同末端結合メカニズムがあります。[ 22 ]このメカニズムは二本鎖切断の修復にも関与していますが、相同性や限定的なマイクロ相同性を必要としません。[ 5 ]鎖が修復されると、修復された鎖に小さな欠失や挿入が加わることがよくあります。レトロトランスポゾンがこの修復システムを介してゲノムに挿入される可能性があります。[ 22 ]レトロトランスポゾンが染色体の非対立遺伝子位置に挿入されると、減数分裂組換えによって挿入が既に存在する同じ領域のコピーと同じ鎖に組み込まれる可能性があります。別のメカニズムは、二本鎖切断によって両方ともテロメア領域を失った姉妹染色分体が関与する切断融合橋サイクルです。 [ 23 ]これらの姉妹染色分体が融合して 1 つの二動原体染色体を形成し、その後 2 つの異なる核に分離すると考えられています。[ 23 ]二動原体染色体を引っ張ると二本鎖切断が生じるため、末端領域が他の二本鎖切断と融合してサイクルを繰り返すことができます。[ 23 ] 2 つの姉妹染色分体の融合は逆位重複を引き起こす可能性があり、これらのイベントがサイクル全体で繰り返されると、逆位領域が繰り返され、コピー数が増加します。[ 23 ]コピー数変動につながる最後のメカニズムは、テンプレートスイッチングとしても知られるポリメラーゼスリッページです。[ 24 ]通常の DNA 複製中、ラギング鎖のポリメラーゼは、複製領域を継続的にクランプ解除および再クランプする必要があります。[ 24 ] DNA配列に既に小さな反復配列が存在する場合、ポリメラーゼは複製を続けるために再クランプする際に「混乱」し、正しい塩基対にクランプする代わりに、数塩基対ずらして反復領域の一部を再度複製する可能性がある。[ 24 ]これは実験的に観察され、広く受け入れられているメカニズムであるが、このエラーにつながる分子間相互作用は不明のままであることに注意されたい。さらに、このタイプのメカニズムではポリメラーゼがDNA鎖を飛び回る必要があり、ポリメラーゼが数キロベース離れた別の場所で再クランプすることは考えにくいため、これはジヌクレオチドやトリヌクレオチドの反復配列のような短い反復配列により適している。[ 25 ]

Amylase is an enzyme in saliva that is responsible for the breakdown of starch into monosaccharides, and one type of amylase is encoded by the alpha-amylase gene (AMY1).[9] The AMY1 locus, as well as the amylase enzyme, is one of the most extensively studied and sequenced genes in the human genome. Its homologs are also found in other primates and therefore it is likely that the primateAMY1 gene is ancestral to the human AMY1 gene and was adapted early in primate evolution.[9]AMY1 is one of the most well studied genes which has wide range of variable numbers of copies throughout different human populations.[9] The AMY1 gene is also one of the few genes that had been studied that displayed convincing evidence which correlates its protein function to its copy number.[9] Copy number is known to alter transcription as well as translation levels of a particular gene, however research has shown that the relationship between protein levels and copy number is variable.[26] In the AMY1 genes of European Americans it is found that the concentration of salivary amylase is closely correlated to the copy number of the AMY1 gene.[9] As a result, it was hypothesized that the copy number of the AMY1 gene is closely correlated with its protein function, which is to digest starch.[9]
AMY1遺伝子のコピー数は、異なる集団の食事中のデンプンのレベルと相関していることがわかっています。[ 9 ]異なる大陸の8つの集団を高デンプン食と低デンプン食に分類し、高解像度FISHとqPCRを使用してAMY1遺伝子のコピー数を可視化しました。[ 9 ]日本人、ハッザ族、ヨーロッパ系アメリカ人の集団からなる高デンプン食の集団は、ビアカ族、ムブティ族、ダトグ族、ヤクート族の集団を含む低デンプン食の集団よりも平均AMY1コピー数が有意に高い(2倍高い)ことがわかりました。 [ 9 ] AMY1の基質である通常の食事中のデンプンのレベルが、AMY1遺伝子のコピー数に直接影響を与える可能性があると仮説が立てられました。[ 9 ] AMY1のコピー数が唾液アミラーゼと直接相関することが結論付けられたため、[ 9 ]集団の日常の食事にデンプンが多く含まれるほど、AMY1遺伝子のコピーが複数ある方が進化的に有利になります。AMY1 遺伝子は、分子遺伝学的レベルで進化の強力な証拠を提供する最初の遺伝子でした。[ 26 ]さらに、比較ゲノムハイブリダイゼーションを使用して、日本人集団の全ゲノムのコピー数変異をヤクート人集団のものと比較しました。[ 9 ] AMY1遺伝子のコピー数変異は、ゲノムの他の遺伝子または領域のコピー数変異とは有意に異なることがわかりました。これは、 AMY1遺伝子が他のコピー数変異にはほとんどまたは全く影響を与えない強い選択圧を受けていることを示唆しています。[ 9 ]最後に、2 つの集団間の 783マイクロサテライトの長さの変動をAMY1遺伝子のコピー数変動と比較しました。AMY1遺伝子のコピー数の範囲は、調べたマイクロサテライトの97%以上よりも大きいことがわかった。 [ 9 ]これは、自然選択がこれら2つの集団におけるAMY1遺伝子の平均数を形成する上で大きな役割を果たしたことを示唆している。 [ 9 ]しかし、調査対象となったのはわずか6つの集団であるため、デンプン以外にも、彼らの食生活や文化においてAMY1遺伝子のコピー数に影響を与えた可能性のある要因が存在することを考慮することが重要である。

AMY1遺伝子のコピー数がいつ増加し始めたかは不明ですが、 AMY1遺伝子が初期の霊長類に存在していたことは知られており、確認されています。ヒトに最も近い進化上の親戚であるチンパンジーは、ヒトのAMY1遺伝子と同じ長さのAMY1遺伝子の二倍体コピーを2つ持っていることがわかっています[ 9 ]。これはヒトよりもかなり少ないです。一方、現代人の近縁種であるボノボは、 AMY1遺伝子の二倍体コピーを2つ以上持っていることがわかりました[ 9 ] 。しかし、ボノボのAMY1遺伝子の配列決定と解析が行われ、 AMY1遺伝子のコード配列が破壊されていることがわかりました。これは、機能不全の唾液アミラーゼの産生につながる可能性があります[ 9 ] 。これらの結果から、ボノボのAMY1コピー数の増加は、食事中のデンプンの量とは相関していない可能性が高いと推測できます。さらに、機能的なタンパク質を生成するAMY1遺伝子のコピーが 2 つ以上ある大型類人猿は存在しなかったため、コピー数の増加は初期のヒト科動物の進化の比較的最近に始まったという仮説が立てられた。 [ 9 ]また、AMY1コピー数の増加は、人類が狩猟採集生活から農耕社会に移行した約 20,000 年前に始まったと推測された。この時期は、人類がデンプンを多く含む根菜に大きく依存していた時期でもある。 [ 9 ]この仮説は論理的ではあるものの、人間の食生活の変化、特にデンプンを多く含む根菜に関する情報の収集が困難であるため、実験的証拠が不足している。デンプンを多く含む根菜は直接観察したり検査したりすることができないからである。最近の DNA シーケンスのブレークスルーにより、研究者はネアンデルタール人などの古い DNAをある程度の精度でシーケンスできるようになった。ネアンデルタール人の DNA をシーケンスすることで、AMY1遺伝子のコピー数が増加した時期のタイムマーカーが得られ、人間の食生活と遺伝子の進化についての洞察が得られるかもしれない。
現在、アミラーゼ遺伝子の最初の重複を引き起こしたメカニズムは不明であり、レトロウイルス配列の挿入は非相同末端結合によるものであり、それがAMY1遺伝子の重複を引き起こしたことを示唆している可能性がある。[ 27 ]しかし、現在この理論を裏付ける証拠はなく、したがってこの仮説は推測のままである。マルチコピーAMY1遺伝子の最近の起源は、環境に応じて、AMY1遺伝子のコピー数が、環境と直接的に相互作用しない遺伝子と比較して非常に急速に増減する可能性があることを示唆している。[ 26 ] AMY1遺伝子は、遺伝子量が特定の環境における生物の生存にどのように影響するかを示す優れた例である。AMY1遺伝子の複数のコピーは、高デンプン食に大きく依存する生物に進化上の利点を与え、そのため高遺伝子コピー数は集団内で存続する。[ 26 ]
ヒトの脳のニューロンでは、体細胞由来のコピー数変異が頻繁に見られます。[ 28 ]コピー数変異は、さまざまな研究で脳ニューロンの9~100%に見られるように、非常にばらつきがあります。ほとんどの変異は2~10Mbのサイズで、欠失が増幅をはるかに上回っています。[ 28 ]
遺伝子のゲノム重複および三重重複は、パーキンソン病のまれな原因であるが、点突然変異よりは一般的である。[ 29 ]
RCL1遺伝子のコピー数変異は、小児におけるさまざまな神経精神医学的表現型と関連している。 [ 30 ]

最近、コピー数変異と遺伝子ファミリーを結びつける議論が行われている。遺伝子ファミリーは、類似した機能を果たすが、時間的または空間的にわずかな違いがある関連遺伝子のセットとして定義され、これらの遺伝子はおそらく1つの祖先遺伝子から派生したものである。[ 26 ]コピー数変異が遺伝子ファミリーと関連付けられる主な理由は、ファミリー内の遺伝子が異なるコピーに複製された1つの祖先遺伝子から派生した可能性があるからである。[ 26 ]遺伝子には時間の経過とともに突然変異が蓄積し、遺伝子に自然選択が作用すると、一部の突然変異は環境上の利点をもたらし、それらの遺伝子が遺伝し、最終的に明確な遺伝子ファミリーが分離される。コピー数変異によって作成された可能性のある遺伝子ファミリーの例は、グロビン遺伝子ファミリーである。グロビン遺伝子ファミリーは、アルファグロビン遺伝子とベータグロビン遺伝子からなる複雑な遺伝子ネットワークであり、胚と成体の両方で発現する遺伝子と偽遺伝子も含まれる。[ 31 ]グロビンファミリーのこれらのグロビン遺伝子はすべてよく保存されており、遺伝子のごく一部しか異なっていないことから、共通の祖先遺伝子から派生したことが示唆され、おそらく最初のグロビン遺伝子の重複によるものと考えられる。[ 31 ]
研究によると、コピー数変異は、基本的な細胞活動に関与するタンパク質よりも、環境と直接相互作用するタンパク質をコードする遺伝子において有意に多く見られることが示されています。[ 32 ]コピー数変異に伴う遺伝子量効果は、必須の細胞機能が阻害された場合に有害な影響をもたらす可能性があるため、細胞経路に関与するタンパク質は強い浄化選択を受けることが示唆されています。[ 32 ]さらに、タンパク質は互いに機能し、他の経路のタンパク質と相互作用するため、自然選択の影響を個々のタンパク質ではなく生体分子経路で見ることが重要です。そうは言っても、経路の周辺にあるタンパク質はコピー数変異が豊富であるのに対し、経路の中心にあるタンパク質はコピー数変異が少ないことがわかっています。[ 33 ]経路の周辺にあるタンパク質は相互作用するタンパク質が少ないため、コピー数の変化によって影響を受けるタンパク質量の変化は、細胞経路の全体的な結果に及ぼす影響が小さい可能性があると説明されています。[ 33 ]