調節配列とは、核酸分子の一部であり、生物体内における特定の遺伝子の発現を増減させる能力を持つ配列のことである。遺伝子発現の調節は、すべての生物およびウイルスにとって不可欠な機能である。

DNAでは、遺伝子発現の調節は通常、RNA生合成(転写)のレベルで行われます。これは、転写を活性化または阻害するタンパク質(転写因子)の配列特異的な結合によって達成されます。転写因子は、活性化因子、抑制因子、またはその両方として作用する可能性があります。抑制因子は、 RNAポリメラーゼが転写開始領域(プロモーター)と生産的な複合体を形成するのを阻害することによって作用することが多く、一方、活性化因子は生産的な複合体の形成を促進します。さらに、DNAモチーフはエピゲノム修飾を予測できることが示されており、転写因子がエピゲノムの調節に役割を果たしていることが示唆されています。[ 2 ]

RNAにおける調節は、タンパク質生合成(翻訳)、RNA切断、RNAスプライシング、または転写終結のレベルで起こる可能性がある。調節配列はメッセンジャーRNA(mRNA)分子によく関連しており、mRNAの生合成や翻訳を制御するために用いられる。この調節を行うために、タンパク質(翻訳抑制因子やスプライシング因子など)、他のRNA分子(miRNAなど) 、リボスイッチなどの低分子など、さまざまな生物学的分子がRNAに結合する可能性がある。
調節DNA配列は、活性化されない限り調節機能を発揮しない。異なる調節配列は活性化されると、それぞれ異なるメカニズムによって調節機能を発揮する。
哺乳類の遺伝子発現は、遺伝子に関連するプロモーターにシグナルが伝達されると上方制御される。 遺伝子のプロモーターから離れたDNA領域に位置するシス調節DNA配列は、遺伝子発現に非常に大きな影響を与える可能性があり、一部の遺伝子では、このようなシス調節配列によって発現が最大100倍増加することがある。[ 3 ]これらのシス調節配列には、エンハンサー、サイレンサー、インスレーター、テザリングエレメントが含まれる。[ 4 ]これらの配列群の中で、エンハンサーとそれに関連する転写因子タンパク質は、遺伝子発現の調節において主導的な役割を果たしている。[ 5 ]
エンハンサーは、主要な遺伝子調節要素であるゲノム配列です。エンハンサーは、多くの場合、長い距離をループして標的遺伝子のプロモーターに物理的に近づくことで、細胞型特異的な遺伝子発現プログラムを制御し、制御します。[ 6 ] 脳皮質ニューロンの研究では、24,937個のループが発見され、エンハンサーがプロモーターに近づいていました。[ 3 ] 複数のエンハンサーは、それぞれ標的遺伝子から数万または数十万ヌクレオチド離れていることが多く、標的遺伝子のプロモーターにループして互いに協調し、共通の標的遺伝子の発現を制御します。[ 6 ]

このセクションの模式図は、エンハンサーがループ状に回り込んで標的遺伝子のプロモーターに物理的に近接する様子を示しています。ループはコネクタータンパク質の二量体(例えばCTCFまたはYY1の二量体)によって安定化され、二量体の一方はエンハンサー上の結合モチーフに、もう一方はプロモーター上の結合モチーフに固定されています(図中の赤いジグザグで表されています)。[ 7 ]いくつかの細胞機能特異的な転写因子タンパク質(2018年にLambertらはヒト細胞には約1,600の転写因子が存在すると指摘しました[ 8 ])は、一般的にエンハンサー上の特定のモチーフに結合し[ 9 ]、これらのエンハンサーに結合した転写因子の小さな組み合わせがDNAループによってプロモーターに近づくと、標的遺伝子の転写レベルを制御します。 メディエーター(コアクチベーター)(通常、相互作用構造にある約26個のタンパク質からなる複合体)は、エンハンサーDNAに結合した転写因子からの調節シグナルを、プロモーターに結合したRNAポリメラーゼII(RNAP II)酵素に直接伝達する。[ 10 ]
エンハンサーは、活性化されると、一般的にDNAの両鎖から転写され、RNAポリメラーゼが2つの異なる方向に作用して、図に示すように2つのeRNAを生成します。[ 11 ] 不活性エンハンサーには、不活性転写因子が結合している場合があります。転写因子のリン酸化により転写因子が活性化され、活性化された転写因子が結合しているエンハンサーを活性化する可能性があります(図中のエンハンサーに結合した転写因子のリン酸化を表す小さな赤い星を参照)。[ 12 ]活性化されたエンハンサーは、プロモーターを活性化して標的遺伝子からのメッセンジャーRNA の転写を開始する前に、自身のRNAの転写を開始します。 [ 13 ]
エンハンサー内の転写因子結合部位(上の図を参照)は通常約 10 塩基対の長さですが、数塩基対から約 20 塩基対まで変化する可能性があります。[ 14 ] エンハンサーは通常、平均約 204 塩基対のエンハンサー部位内に約 10 個の転写因子結合部位を持っています。[ 15 ] 352 種類の細胞および組織で発生するエンハンサーと遺伝子の制御相互作用を調べたところ、1300 万を超える活性エンハンサーが見つかりました。[ 16 ]

エンハンサーは細胞内での遺伝子の転写を低レベル以上にするために必要ですが、スーパーエンハンサーと呼ばれるエンハンサーのクラスターは、標的遺伝子の転写をさらに高いレベルで引き起こすことができます。スーパーエンハンサーは通常、細胞のアイデンティティに必要な遺伝子を高レベルで発現させます。[ 17 ] [ 18 ]がんにおいては、スーパーエンハンサーが特定の癌遺伝子を高レベルで発現させることもあります。[ 17 ] [ 18 ]
スーパーエンハンサーは、ゲノム上で近接した(長さが約9,000 [ 17 ]~22,000 [ 19 ]塩基対以内)典型的なエンハンサーのクラスターとして定義され、これらが一体となって標的遺伝子の発現を制御します。[ 20 ] スーパーエンハンサーによって駆動される遺伝子は、典型的なエンハンサーによって制御される遺伝子の発現よりも有意に高いレベルで発現します。[ 20 ]
このセクションの図にスーパーエンハンサーの図を示します。この図では、スーパーエンハンサーは12,000ヌクレオチドの長さで、その長さ内に4つの典型的なエンハンサーがあります。それぞれの典型的なエンハンサーは、同じ標的遺伝子のプロモーター領域に同時に接触します。スーパーエンハンサー内のそれぞれの典型的なエンハンサーには、転写因子が結合する複数のDNAモチーフがあります。それぞれの典型的なエンハンサーは、エンハンサーに結合した転写因子からのシグナルを共通の標的遺伝子のプロモーターに伝達する26成分メディエーター複合体にも結合しています。タンパク質BRD4は、スーパーエンハンサー内のそれぞれの典型的なエンハンサーと複合体を形成し、スーパーエンハンサーの構造を安定化させるのに役立ちます。[ 21 ] さらに、構造タンパク質YY1(対になった赤いジグザグで示されています)は、スーパーエンハンサー内の典型的なエンハンサーを標的遺伝子に引き寄せるループをまとめるのに役立ちます。[ 7 ]したがって、スーパーエンハンサーには多くのタンパク質が密接に関連しています。これらのタンパク質は一般的に、構造化されたドメインと、本質的に無秩序な領域(IDR)を持つ尾部を有しています。[ 22 ]これらのタンパク質のIDRの多くは互いに相互作用し、それによってスーパーエンハンサーの周囲に水を排除するゲルまたは相分離凝縮物を形成します。 [ 22 ]
マウスα-グロビンスーパーエンハンサー[ 23 ]やWapスーパーエンハンサー[ 24 ]のように、非常に高いレベルの転写を誘導するスーパーエンハンサーもある。 マウスα-グロビンスーパーエンハンサーには、スーパーエンハンサー内に5つの典型的なエンハンサーがある。これらが一緒に作用するときのみ、α-グロビン遺伝子の転写が450倍増加する[ 23 ] 。別の例として、マウスWapスーパーエンハンサーには3つの典型的なエンハンサーが含まれている。これら3つの典型的なエンハンサーが一緒に作用するときのみ、 Wap遺伝子の転写が1000倍 増加する[ 24 ] 。
上述のスーパーエンハンサー内のエンハンサーは相乗的に作用する。しかし、2 つ目のタイプのスーパーエンハンサーでは、構成要素のエンハンサーは相加的に作用する。3 つ目のグループでは、プロモーター活性が限界に達すると、スーパーエンハンサーは「ロジスティック」に作用するように見える。ある研究では、773 個の標的遺伝子を、近くにある可能性のあるスーパーエンハンサーのグループ (近接する 2 ~ 20 個のエンハンサーがスーパーエンハンサーとして作用している可能性が高い) とペアにして調べた。この研究では、可能性のあるスーパーエンハンサーのうち、277、92、250 個が相加的、相乗的、ロジスティック モデルで作用しているように見えた。[ 25 ]
スーパーエンハンサーは、ゲノム上で約 10,000 ~ 60,000 ヌクレオチド長の領域を占める可能性がある。[ 26 ]一方、典型的なエンハンサーはそれぞれ約 204 塩基対長である。[ 15 ] 8 種類の細胞を評価したところ、スーパーエンハンサーは転写を促進するエンハンサーの 2.5% ~ 10.9% を占め、典型的なエンハンサーは転写を促進するエンハンサーの大部分を占めていた。これらの 8 種類の細胞には、257 ~ 1,099 個のスーパーエンハンサーと 5,512 ~ 23,869 個の典型的なエンハンサーが存在した。[ 27 ]
スーパーエンハンサーは細胞内の転写活性部位の約2.5%~10.9%でしか活性化しないが、典型的な単一エンハンサーよりも転写機構をより活発に動員する。細胞内のスーパーエンハンサーは、細胞のRNAポリメラーゼ、メディエータータンパク質、BRD4タンパク質、およびその他の転写機構の約12%~36%を利用する。[ 17 ]

5-メチルシトシン(5-mC)は、DNA塩基シトシンのメチル化形態です(図を参照)。5-mCは、主にCpGジヌクレオチド内のシトシンに存在するエピジェネティックマーカーです。CpGジヌクレオチドは、 DNA鎖に沿って5'から3'の方向に読み取られるシトシンの後にグアニンが続く構造( CpGサイト)です。ヒトゲノムには約2800万個のCpGジヌクレオチドが存在します。[ 28 ]哺乳類のほとんどの組織では、平均してCpGシトシンの70%から80%がメチル化されています(5-メチル-CpG、または5-mCpGを形成)。[ 29 ] CpG配列内のメチル化シトシンは、 CpGアイランド と呼ばれるグループで存在することがよくあります。プロモーター配列の約59%がCpGアイランドを持ち、エンハンサー配列の約6%のみがCpGアイランドを持っています。[ 30 ] CpGアイランドは調節配列を構成しており、遺伝子のプロモーターでCpGアイランドがメチル化されると、遺伝子発現が減少または抑制される可能性がある。[ 31 ]
DNAメチル化は、MeCP2、MBD1、MBD2などのメチル結合ドメイン(MBD)タンパク質との相互作用を介して遺伝子発現を調節します。これらのMBDタンパク質は、高度にメチル化されたCpGアイランドに最も強く結合します。[ 32 ] これらのMBDタンパク質は、メチルCpG結合ドメインと転写抑制ドメインの両方を持っています。[ 32 ] これらはメチル化DNAに結合し、クロマチンリモデリングおよび/またはヒストン修飾活性を持つタンパク質複合体をメチル化CpGアイランドに誘導または指示します。MBDタンパク質は一般的に、抑制性ヒストンマークの導入を触媒したり、ヌクレオソームリモデリングおよびクロマチン再編成を介して全体的な抑制性クロマチン環境を作成したりすることによって、局所的なクロマチンを抑制します。[ 32 ]
転写因子は、特定の遺伝子の発現を調節するために特定のDNA配列に結合するタンパク質です。DNA中の転写因子の結合配列は通常約10または11ヌクレオチドの長さです。ヒトゲノムには約1,400種類の異なる転写因子がコードされており、これらはヒトの全タンパク質コード遺伝子の約6%を占めています。[ 33 ] シグナル応答性遺伝子に関連する転写因子結合部位の約94%はエンハンサーに存在し、プロモーターに存在する部位は約6%にすぎません。[ 9 ]
EGR1は、CpGアイランドのメチル化の調節に重要な転写因子です。EGR1転写因子結合部位は、エンハンサーまたはプロモーター配列に頻繁に存在します。[ 34 ] 哺乳類のゲノムには約12,000個のEGR1結合部位があり、その約半分はプロモーターに、残りの半分はエンハンサーに位置しています。[ 34 ] EGR1の標的DNA結合部位への結合は、DNA中のシトシンメチル化の影響を受けません。[ 34 ]
刺激を受けていない細胞ではEGR1タンパク質は少量しか検出されないが、刺激後1時間でEGR1のタンパク質への翻訳は著しく増加する。[ 35 ] 様々な種類の細胞におけるEGR1の発現は、成長因子、神経伝達物質、ホルモン、ストレス、および損傷によって刺激される可能性がある。[ 35 ] 脳では、ニューロンが活性化されると、EGR1タンパク質がアップレギュレーションされ、ニューロンで高発現している既存のTET1酵素に結合(リクルート)する。TET 酵素は5-メチルシトシンの脱メチル化を触媒することができる。EGR1転写因子がTET1酵素をプロモーターのEGR1結合部位に運ぶと、TET酵素はそれらのプロモーターのメチル化されたCpGアイランドを脱メチル化することができる。脱メチル化後、これらのプロモーターは標的遺伝子の転写を開始することができる。ニューロンの活性化後、数百の遺伝子が、プロモーター内のメチル化された調節配列へのTET1のEGR1リクルートメントを介して、異なる発現を示す。[ 34 ]
プロモーターの約 600 個の調節配列とエンハンサーの約 800 個の調節配列は、活性化のためにトポイソメラーゼ 2β (TOP2B) によって開始される二本鎖切断に依存しているようです。[ 36 ] [ 37 ] 特定の二本鎖切断の誘導は、誘導シグナルに関して特異的です。ニューロンがin vitro で活性化されると、ゲノム内で TOP2B によって誘導される二本鎖切断はわずか 22 個しか発生しません。[ 38 ] しかし、マウスで文脈的恐怖条件付けが行われると、この条件付けにより、学習と記憶に重要な内側前頭前皮質と海馬で数百個の遺伝子関連 DSB が発生します。[ 39 ]

このようなTOP2B誘導二本鎖切断には、非相同末端結合(NHEJ)DNA修復経路の少なくとも4つの酵素(DNA-PKcs、KU70、KU80、およびDNAリガーゼIV)が関与している(図を参照)。これらの酵素は、約15分から2時間以内に二本鎖切断を修復する。[ 38 ] [ 40 ] プロモーターにおける二本鎖切断は、TOP2Bおよび少なくともこれら4つの修復酵素と関連している。これらのタンパク質は、標的遺伝子の転写開始部位付近に位置する単一のプロモーターヌクレオソーム(1つのヌクレオソームに巻き付いたDNA配列は約147ヌクレオチド)上に同時に存在する。[ 40 ]
TOP2Bによって導入された二本鎖切断は、RNAポリメラーゼが結合した転写開始部位のプロモーターの一部を解放し、関連するエンハンサーに物理的に移動させるようです。これにより、エンハンサーは、結合した転写因子とメディエータータンパク質とともに、転写開始部位で一時停止していたRNAポリメラーゼと直接相互作用して転写を開始することができます。[ 38 ] [ 10 ]
同様に、トポイソメラーゼ I (TOP1) 酵素は多くのエンハンサーに存在し、TOP1 が一本鎖切断を導入すると、それらのエンハンサーが活性化される。[ 41 ] TOP1 は、特定のエンハンサー結合転写因子によってシグナルされると、特定のエンハンサー DNA 調節配列に一本鎖切断を引き起こす。[ 41 ] トポイソメラーゼ I による切断は、TOP2B による切断を取り巻くものとは異なる DNA 修復因子と関連している。TOP1 の場合、切断は最も直接的に DNA 修復酵素MRE11、RAD50、およびATRと関連している。[ 41 ]
ゲノムは体系的に解析して調節領域を特定することができる。[ 42 ]保存された非コード配列には調節領域が含まれていることが多く、そのため、これらの解析の対象となることが多い。