系統学的フットプリント法は、異なる種の相同配列と比較することで、対象のDNAの非コード領域内の転写因子結合部位(TFBS)を識別するために使用される技術です。この技術が多数の近縁種に使用される場合、これは系統学的シャドウイングと呼ばれます。[1]
研究者らは、 DNAの非コード部分に、遺伝子の時空間的発現を制御する調節タンパク質の結合部位が含まれていることを発見した。これらの転写因子結合部位 (TFBS)、つまり調節モチーフは、主に長さが短く、配列の変異を示す可能性があるため、特定が困難であることが判明している。多くの生物学分野における転写調節の重要性から、研究者らは TFBS の存在を予測する戦略を開発しており、その多くは公開データベースにつながっている。そのような手法の 1 つが 系統学的 フットプリンティングである。
系統学的フットプリントは、2 つの主要な概念に基づいています。
- 転写因子の機能とDNA 結合の好みは、多様な種間でよく保存されています。
- 遺伝子発現の制御に不可欠な重要な非コードDNA配列は、異なる選択圧を示す。TFBSでは、非コードゲノムの他のそれほど重要でない部分よりも変化の速度が遅い。[2]
歴史
系統学的フットプリント法は1988年にTagleらによって初めて使用され、発表されました。これにより研究者は霊長類の胚のεおよびγグロブリン遺伝子発現に関与する進化的に保存されたシス調節要素を予測できるようになりました。[3]
系統学的フットプリント法が使われる前は、タンパク質をDNA転写因子結合部位(TFBS)に結合させてDNase消化から保護するDNaseフットプリント法が使われていました。この技術の問題の1つは、時間と労力がかかることでした。DNaseフットプリント法とは異なり、系統学的フットプリント法はゲノム内の進化的制約に依存しており、配列の「重要な」部分は異なる種間で保存されています。[4]
プロトコル
この技術を使用する場合、配列をどのゲノムに合わせるかを決めることが重要です。種間の相違が大きいほど、相同遺伝子間の配列の類似性は低くなります。したがって、相同性を検出するのに十分な関連性があり、かつ非整列「ノイズ」を最大化するのに十分な相違がある種を選択することが重要です。系統学的フットプリントへの段階的なアプローチは、次のとおりです。
- 関心のある遺伝子を決定する必要があります。
- 相同遺伝子を持つ種を慎重に選択してください。
- 調査対象となる上流または下流領域の長さを決定します。
- シーケンスを揃えます。
- 保存された領域を探して分析します。
すべてのTFBSが見つかるわけではない
この技術の統計的性質のため、系統学的フットプリント法ではすべての転写結合部位が見つかるわけではありません。一部の TFBS が見つからない理由はいくつかあります。
種特異的結合部位
一部の結合部位は、他のほとんどの種では有意な一致がないようです。したがって、近縁種が多数存在しない限り、系統学的フットプリント法でこれらの部位を検出することは不可能と思われます。
非常に短い結合部位
いくつかの結合部位は優れた保存性を示していますが、検索された領域よりも短い領域にあります。このような短いモチーフ (例: GC ボックス) は、非機能的配列で偶然に発生することが多く、これらのモチーフを検出するのは困難な場合があります。
あまり特異的でない結合因子
一部の結合部位はある程度の保存性を示していますが、挿入または削除が行われています。挿入または削除のあるこれらの配列がまだ機能するかどうかは明らかではありません。ただし、結合因子の特異性が低い (または「選り好み」が少ない) 場合は、まだ機能する可能性があります。結合部位での削除と挿入はまれであるため、配列内の挿入と削除を考慮すると、真の TFBS がいくつか検出されますが、偽陽性がさらに多く含まれる可能性があります。
データが不十分です
いくつかのモチーフは非常によく保存されていますが、特定のデータセットでは統計的に重要ではありません。モチーフは、偶然に異なる種に現れた可能性があります。より多くの生物の配列が利用可能であれば、これらのモチーフを検出できます。したがって、将来的にはこの問題は少なくなるでしょう。
化合物結合領域
一部の転写因子は二量体として結合します。したがって、それらの結合部位は、いくつかの可変ヌクレオチドによって分離された 2 つの保存領域で構成される場合があります。可変内部配列のため、モチーフを検出できません。ただし、変異をカウントせずに、中央に可変配列を含むモチーフを検索するプログラムを使用できれば、これらのモチーフを発見できます。
正確さ
すべての保存された配列が選択圧を受けているわけではないことを念頭に置くことが重要です。偽陽性を排除するには、報告されたモチーフの変異率が周囲の非機能的配列の変異率よりも有意に低いことを示す統計分析を実行する必要があります。
さらに、配列に関する事前知識を考慮すると、結果はより正確になる可能性があります。たとえば、一部の調節要素はプロモーター領域で 15 回繰り返されます (たとえば、一部のメタロチオネイン プロモーターには最大 15 個の金属応答要素 (MRE) があります)。したがって、種間で順序が一貫していない誤ったモチーフを排除するには、プロモーター領域内の調節要素の方向と順序がすべての種で同じである必要があります。この種の情報は、十分に保存されていないが、入力配列に複数のコピーが存在する調節要素を識別するのに役立ちます。[5]
参考文献
- ^ 霊長類配列の系統学的シャドウイングによるヒトゲノムの機能領域の発見doi :10.1126/science.1081331
- ^ Neph, S. および Tompa, M. 2006. MicroFootPrinter: 原核生物ゲノムの系統学的フットプリント作成ツール。核酸研究。34: 366–368
- ^ Tagle, DA, Koop, BF, Goodman, M., Slightom, JL, Hess, D., および Jones, RT 1988. 原猿類霊長類(Galago crassicaudatis)の胚性εおよびγグロビン遺伝子:ヌクレオチドおよびアミノ酸配列、発生調節、および系統学的足跡。J. Mol. Biol. 203:439–455。
- ^ Zhang, Z. および Gerstein, M. 2003. マウスと人間: 系統学的フットプリント法は調節要素の発見に役立つ。J . Biol. 2:11-11.4
- ^ Blanchette, M. および Tompa, M. 2002. 系統学的フットプリントの計算手法による調節要素の発見。Genome Res. 12: 739–748
