
STARR-seq (自己転写活性調節領域シーケンスの略)は、任意のDNAソースから数百万の候補のエンハンサー活性をアッセイする方法です。これは、転写エンハンサーとして機能する配列を直接的、定量的、かつゲノムワイドな方法で特定するために使用されます。[ 1 ]
真核生物では、転写は遺伝子のプロモーターに関連する配列特異的なDNA結合タンパク質(転写因子)と、エンハンサーを含む遠隔の制御配列によって制御されます。エンハンサーは、さまざまな転写因子の結合部位を複数含む非コードDNA配列です。 [ 2 ]これらは通常、クロマチン構造を調節し、遺伝子のプロモーターに配置された転写機構と直接相互作用する転写因子をリクルートします。エンハンサーは、遺伝子のプロモーターからの位置や距離に関係なく、細胞型特異的な方法で標的遺伝子の転写を制御することができます。 [ 1 ]特定の状況(遺伝学のトランスベクションを参照)では、異なる染色体に位置する遺伝子の転写を制御することさえできます。[ 3 ] しかし、これまでのエンハンサーに関する知識は、ゲノム全体規模で正確に特定することが困難であったため、少数のエンハンサーの研究に限られていました。[ 2 ]さらに、多くの制御要素は、特定の細胞型と特定の条件下でのみ機能します。[ 4 ]
ショウジョウバエにおけるエンハンサー検出は、最小プロモーターの下流にレポータータンパク質をコードするトランスポゾン由来ベクターをランダムに挿入する独自のメソッドです。このアプローチにより、トランスジェニック動物におけるレポーターの発現を観察することができ、これらの配列によって制御される近傍の遺伝子に関する情報が得られます。この技術の発見により、細胞型とその決定に関与する遺伝子の発見と特徴付けが大幅に改善されました。[ 5 ] [ 6 ] [ 7 ] [ 8 ]
過去数年間、ポストゲノム技術は、準備状態および活性状態のエンハンサーの特定の特性を示し、エンハンサーの発見を改善しました。[ 2 ] DNase I 過敏部位のディープシーケンス ( DNase-Seq )、ホルムアルデヒド補助による調節エレメントの分離シーケンス ( FAIRE-Seq )、クロマチン免疫沈降とそれに続くディープシーケンス ( ChIP-sequencing )、および MNase 定義シストローム占有分析 (MOA-seq [ 9 ] ) などの新しい方法の開発により、エンハンサー関連のクロマチン特性によるゲノムワイドなエンハンサー予測が提供されます。[ 1 ]
しかし、DNase-seqとFAIRE-seqだけではエンハンサー活性の直接的な機能的または定量的読み取りはできないため、エンハンサー活性を定量的に評価するには、レポーター転写産物の定量的濃縮からエンハンサー強度を推測できるレポーターアッセイが必要です。しかし、これらのアッセイはハイスループット(ハイスループット生物学)ではありません。ゲノムワイドな方法でエンハンサーを同定するために必要な数百万のテストを実行することは不可能です。[ 1 ] STARR-seqの開発は、この分析上の障壁を回避しようとしています。エンハンサーは相対的な位置とは独立して機能できるという知識を利用して、候補配列を最小プロモーターの下流に配置し、活性エンハンサーが自己転写できるようにします。各エンハンサーの強度は、細胞RNA間の相対的な濃縮によって反映されます。候補配列とエンハンサー活性のこのような直接的な結合により、任意のソースからの数百万のDNA断片を並行して評価できます。[ 1 ]
ゲノムDNAはランダムにせん断され、小さな断片に分解されます。アダプターはサイズ選択されたDNA断片に連結されます。次に、アダプターが連結された断片が増幅され、PCR産物が精製された後、候補配列がスクリーニングベクターの最小プロモーターの下流に配置され、自己転写の機会が与えられます。次に、候補細胞にレポーターライブラリーをトランスフェクションして培養します。その後、全RNAが抽出され、ポリA RNAが単離されます。逆転写法を使用してcDNAが生成、増幅され、候補断片がハイスループットペアエンドシーケンスに使用されます。シーケンスリードは参照ゲノムにマッピングされ、データの計算処理が実行されます。[ 1 ]
この技術をショウジョウバエのゲノムに適用したところ、Arnold ら[ 1 ] は、少なくとも 10 倍のカバー率を持つ非反復ゲノムの 96% を発見しました。著者らは、同定されたエンハンサーのほとんど (55.6%) がイントロン内、特に最初のイントロンと遺伝子間領域に配置されていることを発見しました。エンハンサーの 4.5% は転写開始部位(TSS)に位置しており、これらのエンハンサーが転写を開始し、遠い TSS からの転写も改善できることを示唆しています。[ 1 ]最も強力なエンハンサーは、酵素や細胞骨格の構成要素などのハウスキーピング遺伝子や、転写因子などの発生調節因子の近くにありました。最も強力なエンハンサーは、転写因子 zfh1 のイントロン内にありました。この転写因子は、ショウジョウバエの幼虫の神経筋接合部の神経ペプチド発現と成長を調節します。[ 10 ]リボソームタンパク質遺伝子は、エンハンサーランキングが低い唯一の遺伝子クラスでした。さらに、著者らは、単一の細胞型であっても、多くの遺伝子が複数の独立した活性エンハンサーによって制御されていることを示した。さらに、遺伝子発現レベルは平均して遺伝子ごとのエンハンサー強度の合計と相関しており、遺伝子発現とエンハンサー活性の間に直接的な関連性があることを裏付けている。[ 1 ]
この技術を調節バリアントアレルの特性評価と発見に適用し、Vockley ら[ 11 ] は、研究コホートの 95 人のゲノムから直接取得した 100 個の推定エンハンサーの活性を測定することにより、ヒトの遺伝的変異が非コード調節エレメント機能に及ぼす影響を特徴づけた。このアプローチにより、eQTL解析によって特定された高い連鎖不平衡領域における原因となる調節バリアントの機能的精密マッピングが可能になる。このアプローチは、複雑な表現型に寄与する遺伝子調節エレメントの摂動を特定するための一般的な道筋を提供する。
STARR-seqは、特定の転写因子が占有する部位が濃縮されたDNA断片の調節活性を測定するために使用されてきました。グルココルチコイド受容体のクロマチン免疫沈降から生成されたChIP DNAライブラリーをSTARR-seqにクローニングすることで、グルココルチコイド誘導エンハンサー活性のゲノム規模での定量化が可能になりました。[ 12 ] このアプローチは、同じ転写因子が結合する部位間のエンハンサー活性の違いを測定するのに役立ちます。
STARR-seqは、従来の手法とハイスループットシーケンス技術、高度に専門化されたバイオコンピューティング手法を組み合わせることで、定量的かつゲノムワイドな方法でエンハンサーを検出できます。正常な発生時および疾患時のゲノムにおける遺伝子制御とその責任経路の研究は非常に困難です。そのため、STARR-seqを様々な生物の多くの細胞型に適用することで、細胞型特異的な遺伝子制御要素の特定を支援し、疾患を引き起こす非コード変異を実際に評価することができます。最近、関心領域のキャプチャとSTARR-seq技術を組み合わせた関連手法が開発され、哺乳類細胞株で広く検証されています。[ 13 ]