反復配列(反復要素、反復単位、または反復とも呼ばれる)は、ゲノム全体に複数コピー存在する短いまたは長いパターンである。多くの生物では、ゲノムDNAのかなりの割合が反復しており、ヒトでは配列の3分の2以上が反復要素で構成されている。[ 1 ]これらの反復配列の中には、テロメアやセントロメアなどの重要なゲノム構造を維持するために必要なものもある。[ 2 ]
反復配列は、構造、長さ、位置、起源、および増殖様式などの特徴に応じて、さまざまなクラスに分類されます。ゲノム全体における反復要素の配置は、タンデム反復と呼ばれる直接隣接する配列、またはゲノム全体に散在する反復と呼ばれる配列のいずれかになります。[ 3 ]タンデム反復と散在反復は、反復配列の長さおよび/または増殖様式に基づいて、さらにサブクラスに分類されます。
反復DNA配列の中には、細胞機能やゲノム維持に重要なものがある一方で、有害なものもある。多くの反復DNA配列は、ハンチントン病やフリードライヒ運動失調症などのヒト疾患と関連付けられている。一部の反復要素は中立であり、転移や交叉の仕方によって特定の配列に対する選択圧がない場合に生じる。[ 2 ]しかし、中立的な反復配列が大量に蓄積すると、ゲノムの進化に影響を与える可能性がある。全体として、反復配列はヒト疾患やゲノム進化に関する知見をもたらす可能性があるため、重要な研究対象となっている。[ 2 ]
1950年代、バーバラ・マクリントックはコールド・スプリング・ハーバー・シンポジウムで初めてDNA転座を観察し、セントロメアとテロメアの機能を示した。 [ 4 ]マクリントックの研究は、転座、セントロメア構造、テロメア構造はすべて反復要素によって可能となるため、反復配列の発見への道を開いたが、当時はこれが完全には理解されていなかった。「反復配列」という用語は、 1968年にロイ・ジョン・ブリテンとDE・コーネによって初めて使用された。彼らはDNAの再会合に関する実験を通して、真核生物ゲノムの半分以上が反復DNAであることを発見した。[ 5 ]反復DNA配列は保存され遍在していたが、その生物学的役割はまだ不明であった。 1990年代には、 DNAベースの法医学や分子生態学における重要性から、ミニサテライトおよびマイクロサテライト反復配列の進化ダイナミクスを解明するための研究がさらに行われた。DNA分散反復配列は、遺伝的変異と制御の潜在的な源としてますます認識されるようになった。有害な反復DNA関連疾患の発見は、この研究分野への関心をさらに高めた。[ 6 ] 2000年代には、真核生物ゲノム全体のシーケンスデータにより、反復領域によってコードされるさまざまなプロモーター、エンハンサー、および制御RNAの同定が可能になった。今日でも、反復DNA配列の構造的および制御的役割は、活発な研究分野であり続けている。
多くの反復配列は、機能を持たない、転移因子の劣化残骸である可能性が高く、これらは「ジャンク」または「利己的」DNAと呼ばれています。[ 7 ] [ 8 ] [ 9 ]それにもかかわらず、時折、一部の反復配列は他の機能に転用されることがあります。[ 10 ]
タンデムリピートは、ゲノム内で互いに直接隣接している反復配列です。[ 11 ]タンデムリピートは、反復配列を構成するヌクレオチドの数と、配列が繰り返される回数が異なる場合があります。反復配列が2~10ヌクレオチド長の場合、その反復はショートタンデムリピート(STR)またはマイクロサテライトと呼ばれます。[ 12 ]反復配列が10~60ヌクレオチド長の場合、その反復はミニサテライトと呼ばれます。[ 13 ]ミニサテライトとマイクロサテライトの場合、単一の遺伝子座での配列の繰り返し回数は2回から数百回まで様々です。
タンデムリピートはゲノム内で多様な生物学的機能を持つ。例えば、ミニサテライトは真核生物の減数分裂相同組換えのホットスポットとなることが多い。 [ 14 ]組換えとは、2つの相同染色体が整列し、切断され、再結合して断片を交換することである。組換えは遺伝的多様性の源として、損傷したDNAを修復するメカニズムとして、減数分裂における染色体の適切な分離に必要なステップとして重要である。[ 14 ]反復配列DNAの存在は相同領域が整列しやすくし、それによって組換えが起こる時期と場所を制御する。
タンデムリピートは、組換えにおいて重要な役割を果たすだけでなく、ゲノムにおいて重要な構造的役割も果たしています。例えば、テロメアは主にタンデムTTAGGGリピートで構成されています。[ 15 ]これらのリピートは、高度に組織化されたG四重鎖構造に折り畳まれ、染色体DNAの末端を分解から保護します。[ 16 ]反復配列は染色体の中央部にも豊富に存在します。セントロメアは、姉妹染色分体を結合し、細胞分裂中に有糸分裂紡錘体が姉妹染色分体に付着して分離することを可能にする、染色体の非常にコンパクトな領域です。[ 17 ]セントロメアは、αサテライトリピートと呼ばれる177塩基対のタンデムリピートで構成されています。[ 16 ]セントロメア周辺ヘテロクロマチンは、セントロメアを取り囲み、構造維持に重要なDNAであり、α、β、γサテライト、HSATII、HSATIII、sn5リピートを含むさまざまなサテライトサブファミリーの混合物から構成されている。[ 18 ]

上記で述べた構造的役割を持つ反復配列など、一部の反復配列は、適切な生物学的機能に必要な役割を果たします。他のタンデムリピートは、病気を引き起こす有害な役割を果たします。しかし、他の多くのタンデムリピートは、機能が不明または十分に理解されていません。[ 19 ]
散在反復配列は、ゲノム全体にわたって異なる場所に存在する同一または類似のDNA配列です。[ 20 ]散在反復配列は、反復配列が互いに直接隣接しているのではなく、異なる染色体に散在しているか、同じ染色体上で遠く離れている可能性があるという点で、タンデム反復配列とは区別されます。ほとんどの散在反復配列は、ゲノム内の異なる場所に「切り取って貼り付ける」または「コピーして貼り付ける」ことができる可動配列である転移因子(TE)です。 [ 21 ] TEは、移動する能力があることから、当初は「ジャンプ遺伝子」と呼ばれていましたが、すべてのTEが独立した遺伝子ではないため、この用語はやや誤解を招く可能性があります。[ 22 ]
RNAに転写され、DNAに逆転写され、ゲノムに再統合される転移因子はレトロトランスポゾンと呼ばれます。[ 21 ]タンデムリピートが繰り返し配列の長さに基づいてさらに細分類されるのと同様に、レトロトランスポゾンにもさまざまな種類があります。長鎖散在核因子(LINE)は通常3~7キロベースの長さです。[ 23 ]短鎖散在核因子(SINE)は通常100~300塩基対で、600塩基対を超えることはありません。[ 23 ]長末端反復レトロトランスポゾン(LTR)は、レトロトランスポゾンの3番目の主要なクラスであり、繰り返し配列の末端に高度に反復した配列があることが特徴です。[ 21 ]転移因子が中間体としてRNAを経由しない場合、それはDNAトランスポゾンと呼ばれます。[ 21 ]他の分類システムでは、レトロトランスポゾンを「クラス I」、DNA トランスポゾンを「クラス II」の転移因子と呼んでいます。[ 22 ]
転移因子はヒトゲノムの45%を占めると推定されている。[ 24 ] TEの制御されない増殖はゲノムに大混乱をもたらす可能性があるため、DNAメチル化、ヒストン修飾、低分子干渉RNA(siRNA)を含む非コードRNA(ncRNA)、クロマチンリモデリング因子、ヒストンバリアント、その他のエピジェネティック因子など、その拡散を抑制するための多くの制御機構が進化してきた。[ 22 ]しかし、TEはさまざまな重要な生物学的機能を果たしている。TEがウイルスなどから新しい宿主に導入されると、遺伝的多様性が増加する。[ 22 ]場合によっては、宿主生物はTE外適応と呼ばれる進化プロセスでTEを発現することによって生じるタンパク質の新しい機能を見つける。[ 22 ]最近の研究では、TEが高次クロマチン構造と3Dゲノム構造の維持にも役立つことが示唆されている。[ 25 ]さらに、TEは遠位エンハンサーおよび転写因子結合部位として機能することにより、他の遺伝子の発現調節に寄与する。[ 26 ]
ゲノム中に散在反復配列が広く存在することから、その起源と機能に関する研究がますます注目されている。Alu反復配列やLINE1など、特定の散在反復配列については既に特徴づけられている。
タバコ(Nicotiana tabacum)の体細胞における染色体反復配列間の相同組換えは、DNA鎖を架橋する二官能性アルキル化剤であるマイトマイシンCに曝露されると増加することがわかった。 [ 27 ] この組換えの増加は、染色体内の組換え修復の増加に起因すると考えられている。[ 27 ] このプロセスにより、一方の配列のマイトマイシンCによる損傷を受けたDNAは、もう一方の反復配列からの完全な情報を使用して修復される。
タンデムリピートと散在リピートはゲノム内の位置に基づいて区別されるが、直接リピートと逆方向リピートはヌクレオチド塩基の順序に基づいて区別される。直接リピートは、ヌクレオチド配列が同じ方向性で繰り返されるときに発生する。逆方向リピートは、ヌクレオチド配列が逆方向に繰り返されるときに発生する。たとえば、「CATCAT」の直接リピートは、「CATCAT」の別の繰り返しとなる。対照的に、逆方向リピートは「ATGATG」となる。逆方向リピートを隔てるヌクレオチドがない場合、たとえば「CATCATATGATG」の場合、その配列は回文リピートと呼ばれる。逆方向リピートは、ステムループや十字形を形成することによって、DNAおよびRNAで構造的な役割を果たすことができる。[ 28 ]
減数分裂による有性生殖の進化上の起源は、長年にわたる進化上の謎とみなされている。[ 29 ]原核生物 では、水平遺伝子伝達が初期の進化形態の性的相互作用として出現した。しかし、原核生物のDNAの反復配列は、有害な突然変異を除去する水平遺伝子伝達の有効性を制限し、[ 29 ]相同組換えによるDNA損傷の正確な修復も制限する。Colnoghiら[ 29 ]は、原核生物における性的相互作用の有益な効果に対するこのような制約が、減数分裂による有性生殖の進化、ひいては真核生物の出現を促進したと提唱した。減数分裂中に起こる線状染色体に沿った相同対合への移行が減数分裂による有性生殖における重要な革新であり、この革新が機能的および形態的複雑性の増加を促進した真核生物ゲノムの進化的拡大に重要な役割を果たしたと結論付けられた。[ 29 ]
ヒトの場合、一部の反復DNA配列は疾患と関連している。特に、タンデム反復配列は、ハンチントン病、脆弱X症候群、いくつかの脊髄小脳失調症、筋強直性ジストロフィー、フリードライヒ失調症などのトリヌクレオチド反復疾患をはじめとする、いくつかのヒト疾患の根底にある。[ 30 ]生殖細胞系列におけるトリヌクレオチド反復配列の世代を経るごとに伸長すると、疾患の症状がますます重篤になる可能性がある。これらのトリヌクレオチド反復配列の伸長は、DNA複製中またはDNA修復合成中の鎖滑りによって起こる可能性がある。[ 30 ]病原性CAG反復配列を含む遺伝子は、 DNA損傷応答に関与するタンパク質をコードしていることが多く、反復配列の伸長は特定のDNA修復経路を阻害する可能性があることが指摘されている。[ 31 ]反復配列におけるDNA損傷の修復不全は、これらの配列のさらなる伸長を引き起こし、病理の悪循環を生み出す可能性がある。[ 31 ]

ハンチントン病は、ハンチンチン遺伝子(HTT )のエクソン1におけるCAGトリヌクレオチド配列の繰り返し伸長によって引き起こされる神経変性疾患です。この遺伝子は、アポトーシス(細胞死とも呼ばれる)の防止や酸化DNA損傷の修復に関与するハンチンチンタンパク質をコードしています。[ 32 ] [ 33 ] ハンチントン病では、CAGトリヌクレオチド配列の伸長により、ポリグルタミン領域が伸長した変異型ハンチンチンタンパク質が生成されます。[ 34 ]この領域により、タンパク質が神経細胞内で凝集し、正常な細胞機能が阻害され、神経変性が引き起こされます。

脆弱X症候群は、 X染色体上のFMR1遺伝子のDNA配列CCGの伸長によって引き起こされます。 [ 35 ]この遺伝子はRNA結合タンパク質FMRPを生成します。脆弱X症候群の場合、反復配列によって遺伝子が不安定になり、FMR1遺伝子がサイレンシングされます。[ 36 ]この遺伝子はX染色体上に存在するため、2つのX染色体を持つ女性は、1つのX染色体と1つのY染色体しか持たない男性よりも影響を受けにくくなります。これは、2番目のX染色体が、もう一方のX染色体上の遺伝子のサイレンシングを補償できるためです。
脊髄小脳失調症は、いくつかのタイプの脊髄小脳失調症(SCA- SCA1、SCA2、SCA3、SCA6、SCA7、SCA12、SCA17)の根底にあるCAGトリヌクレオチド反復配列を持つ疾患である。 [ 37 ]ハンチントン病と同様に、このトリヌクレオチド伸長によって生成されるポリグルタミンテールはタンパク質の凝集を引き起こし、正常な細胞機能を妨げ、神経変性を引き起こす。[ 38 ]
フリードライヒ運動失調症は、フラタキシン遺伝子の反復配列GAAが伸長した運動失調症の一種です。[ 39 ]フラタキシン遺伝子は、エネルギー産生と細胞呼吸に関与するミトコンドリアタンパク質であるフラタキシンタンパク質の産生を担っています。[ 40 ]伸長したGAA配列は、最初のイントロンのサイレンシングを引き起こし、フラタキシンタンパク質の機能が失われます。機能的なFXN遺伝子の喪失は、ミトコンドリア全体の機能に問題を引き起こし、患者では歩行困難として表現されることがあります。
筋強直性ジストロフィーは、筋力低下を特徴とする疾患であり、DM1とDM2の2つの主要なタイプがあります。[ 41 ]どちらのタイプの筋強直性ジストロフィーも、DNA配列の伸長が原因です。DM1では伸長するDNA配列はCTGであり、DM2ではCCTGです。これらの2つの配列は異なる遺伝子上に存在し、DM2の伸長配列はZNF9遺伝子上に、DM1の伸長配列はDMPK遺伝子上に存在します。ハンチントン病や脆弱X症候群などの他の疾患とは異なり、これらの2つの遺伝子はタンパク質をコードしません。しかし、RNA毒性とDM1およびDM2の反復配列との間には関連性があることが示されています。
反復DNA配列によって引き起こされる疾患はすべてトリヌクレオチド反復疾患というわけではない。筋萎縮性側索硬化症や前頭側頭型認知症は、 C9orf72遺伝子のヘキサヌクレオチドGGGGCC反復配列によって引き起こされ、RNA毒性を生じさせ、神経変性につながる。[ 42 ] [ 37 ]
反復DNAは、短いリードからの配列アセンブリでは反復部分の長さを決定できないため、次世代シーケンシング技術を使用して配列決定するのが困難です。この問題は、1~6bpの小さな反復単位で構成されるマイクロサテライトで特に深刻です。 [ 43 ]これらの短い反復配列は配列決定が難しいものの、DNAフィンガープリンティングや進化研究において非常に価値があります。多くの研究者は、技術的な制約のために、これまで全ゲノムデータの解析と発表の際に反復配列を除外してきました。[ 44 ]
Bustosらは、長い反復DNA配列を決定する1つの方法を提案した[ 43 ]。この方法は、安定化のための線状ベクターの使用と、連続する単純反復配列(SSR)に富む領域の削除のためのエキソヌクレアーゼIIIの使用を組み合わせたものである。まず、SSRに富む断片を、最大30kbのタンデム反復を安定的に組み込むことができる線状ベクターにクローニングする。反復の発現は、ベクター内の転写終結因子によって禁止される。2番目のステップでは、エキソヌクレアーゼIIIを使用する。この酵素は3'末端のヌクレオチドを削除することができ、その結果、SSR断片の一方向性の削除が生成される。最後に、削除された断片を含むこの産物を増幅し、コロニーPCRで分析する。次に、異なる削除を含む一連のクローンの順序付きシーケンスによって配列が構築される。