
生物学において、配列モチーフとは、広く普及しており、通常、高分子の生物学的機能に関連していると考えられるヌクレオチドまたはアミノ酸の 配列 パターンです。たとえば、Nグリコシル化部位モチーフは、Asn、Pro 以外の任意の残基、Ser または Thr、Pro 残基以外の任意の残基の順に定義できます。
概要
遺伝子のエクソンに配列モチーフが出現すると、タンパク質の「構造モチーフ」がコード化される可能性があります。これは、タンパク質の全体構造の典型的な要素です。ただし、モチーフは、明確な二次構造に関連付けられている必要はありません。「非コード」配列はタンパク質に翻訳されず、このようなモチーフを持つ核酸は、典型的な形状(「B 型」 DNA 二重らせんなど)から逸脱する必要はありません。
遺伝子エクソンの外側には、サテライト DNAなどの「ジャンク」内に、調節配列モチーフやモチーフが存在します。これらの一部は核酸の形状に影響を及ぼすと考えられていますが[1] ( RNA 自己スプライシングなどを参照)、これはまれなケースです。たとえば、特定のDNA 結合部位に親和性を持つ多くのDNA 結合タンパク質は、二重らせん構造の DNA にのみ結合します。これらのタンパク質は、二重らせんの主溝または副溝との接触を通じてモチーフを認識することができます。
二次構造を欠いているように見える短いコーディングモチーフには、細胞の特定の部分に送達するためにタンパク質を標識するものや、リン酸化のためにタンパク質をマークするものが含まれます。
研究者は、配列または配列データベース内で、 BLASTなどのコンピューターベースの配列解析技術を使用してモチーフを検索して見つけます。このような技術は、バイオインフォマティクスの分野に属します。コンセンサス配列も参照してください。
モチーフ表現
上で述べたNグリコシル化部位モチーフを考えてみましょう。
- Asn、Pro 以外の文字、Ser または Thr、Pro 以外の文字の順
このパターンは と表記されます。N{P}[ST]{P}ここで、N= Asn、P= Pro、S= Ser、T= Thr;{X}は を除く任意のアミノ酸を意味しX、 はまたは の[XY]いずれかを意味します。
XY
この表記法は、パターンの確率やパターンの発生を[XY]示すものではありません。観測された確率は、シーケンス ロゴを使用してグラフィカルに表現できます。パターンは、隠れマルコフ モデルなどの確率モデルによって定義されることもあります。
XY
モチーフとコンセンサス配列
表記はまたはまたは を[XYZ]意味しますが、特定の一致の可能性を示すものではありません。このため、定義パターンとさまざまな典型的なパターンなど、2 つ以上のパターンが 1 つのモチーフに関連付けられることがよくあります。
XYZ
たとえば、IQ モチーフの定義シーケンスは次のようになります。
[FILV]Qxxx[RK]Gxxx[RK]xx[FILVWY]
ここで、 はx任意のアミノ酸を表し、角括弧は代替を示します (表記の詳細については以下を参照してください)。
ただし、通常は最初の文字は でありI、両方の[RK]選択肢は に解決されますR。最後の選択肢の幅が広いため、パターンはIQxxxRGxxxRIQ モチーフ自体と同一視されることがあります。ただし、より正確な説明は、IQ モチーフのコンセンサス シーケンスです。
パターン記述表記
モチーフを記述するための表記法はいくつかありますが、そのほとんどは正規表現の標準表記法のバリエーションであり、次の規則を使用します。
- 単一の文字からなるアルファベットがあり、それぞれが特定のアミノ酸またはアミノ酸のセットを表します。
- アルファベットから引かれた文字列は、対応するアミノ酸の配列を表します。
- 角括弧で囲まれたアルファベットの文字列は、対応するアミノ酸のいずれかに一致します。たとえば、またはまたは
[abc]で表されるアミノ酸のいずれかに一致します。abc
これらすべての表記法の背後にある基本的な考え方は、パターン表記法の要素のシーケンスに意味を割り当てる一致原則です。
- パターン表記の要素のシーケンスがアミノ酸のシーケンスに一致するのは、後者のシーケンスをサブシーケンスに分割して、各パターン要素が対応するサブシーケンスに順番に一致する場合のみです。
したがって、パターンは、、、、、およびに対応する[AB] [CDE] F6 つのアミノ酸配列と一致します。
ACFADFAEFBCFBDFBEF
パターン記述表記法によって、パターン要素を形成する方法が異なります。これらの表記法の 1 つが PROSITE 表記法です。これについては、次のサブセクションで説明します。
PROSITEパターン表記
PROSITE表記法はIUPAC の1 文字コードを使用し、連結記号「 」がパターン要素間で使用される点を除いて上記の説明に準拠しています-が、パターン アルファベットの文字間では連結記号が省略されることがよくあります。
PROSITE では、前述のパターン要素に加えて、次のパターン要素も使用できます。
- 小文字の「
x」は、任意のアミノ酸を表すパターン要素として使用できます。 - アルファベットから抽出され、中括弧で囲まれた文字列は、文字列内のアミノ酸を除く任意のアミノ酸を表します。たとえば、はまたは
{ST}以外の任意のアミノ酸を表します。ST - パターンがシーケンスの N 末端に制限されている場合、パターンの前に '
<' が付きます。 - パターンがシーケンスの C 末端に制限されている場合、パターンの末尾に '
>' が付きます。 - 文字 '
>' は終了角括弧パターン内に出現することもできるため、これはS[T>]"ST" と "S>" の両方に一致します。 eがパターン要素であり、およびmが<=nの 2 つの 10 進整数である場合、次のようになります。mne(m)e正確にm回数繰り返すことと同等です。e(m,n)は、 <= <= を満たす任意の整数について、eちょうど回の繰り返しに相当します。kkmkn
例:
x(3)は と同等ですx-x-x。x(2,4)x-xまたはx-x-xまたは に一致する任意のシーケンスに一致しますx-x-x-x。
C2H2 型ジンクフィンガードメインの特徴は次のとおりです。
C-x(2,4)-C-x(3)-[LIVMFYWC]-x(8)-H-x(3,5)-H
マトリックス
固定長モチーフの各位置にある各残基またはヌクレオチドのスコアを含む数値のマトリックス。重みマトリックスには 2 つのタイプがあります。
- 位置頻度マトリックス (PFM) は、各残基またはヌクレオチドの位置依存頻度を記録します。PFM は、SELEX 実験から実験的に決定することも、隠れマルコフ モデルを使用する MEME などのツールによって計算的に検出することもできます。
- 位置重みマトリックス( PWM) には、一致スコアを計算するための対数オッズ重みが含まれています。入力シーケンスがモチーフと一致するかどうかを指定するには、カットオフが必要です。PWM は PFM から計算されます。PWM は PSSM とも呼ばれます。
転写因子 AP-1 の TRANSFACデータベースからの PFM の例:
最初の列は位置を指定し、2 番目の列にはその位置での A の出現回数、3 番目の列にはその位置での C の出現回数、4 番目の列にはその位置での G の出現回数、5 番目の列にはその位置での T の出現回数、最後の列にはその位置の IUPAC 表記が含まれます。PFM は複数のコンセンサス配列を集約して得られるため、各行の A、C、G、および T の出現回数の合計は等しくなることに注意してください。
モチーフの発見
概要
配列モチーフの発見プロセスは、1990 年代から十分に開発されてきました。特に、既存のモチーフ発見研究のほとんどは DNA モチーフに焦点を当てています。ハイスループット シーケンシングの進歩により、このようなモチーフ発見の問題は、配列パターンの縮退問題とデータ集約型の計算スケーラビリティ問題の両方によって解決が困難になっています。
発見のプロセス

モチーフの発見は、3 つの主要な段階で行われます。前処理段階では、アセンブリとクリーニングのステップで配列を慎重に準備します。アセンブリでは、目的のモチーフを大量に含む配列を選択し、クラスタリングを使用して不要な配列を抽出します。その後、クリーニングによって交絡因子が確実に除去されます。次に、発見段階があります。この段階では、配列はコンセンサス文字列または位置固有の重み付けマトリックス (PWM)を使用して表されます。モチーフの表現後、目的関数が選択され、適切な検索アルゴリズムが適用されてモチーフが発見されます。最後に、後処理段階では、発見されたモチーフを評価します。[2]
デノボモチーフ発見
複数の入力配列が与えられると、1 つ以上の候補モチーフを特定しようとするソフトウェア プログラムがあります。1 つの例は、各候補の統計情報を生成するMultiple EM for Motif Elicitation (MEME) アルゴリズムです。[3]モチーフ発見アルゴリズムを詳述した出版物は 100 件以上あり、Weirauchらは2013 年のベンチマークで多くの関連アルゴリズムを評価しました。[4]プランテッド モチーフ検索は、組み合わせアプローチに基づく別のモチーフ発見方法です。
系統発生モチーフの発見
モチーフは系統学的アプローチを取り、異なる種の類似遺伝子を研究することによっても発見されている。例えば、ヒト、マウス、およびショウジョウバエのGCM(グリア細胞欠損)遺伝子によって指定されるアミノ酸配列を並べることで、秋山らは1996年にGCMモチーフと名付けたパターンを発見した。[5] それは約150アミノ酸残基に及び、次のように始まる。
WDIND*.*P..*...D.F.*W***.**.IYS**...A.*H*S*WAMRNTNNHN
ここで、それぞれは.単一のアミノ酸またはギャップを表し、それぞれは*密接に関連したアミノ酸ファミリーの 1 つのメンバーを示します。著者らは、このモチーフが DNA 結合活性を持つことを示すことができました。
同様のアプローチは、Pfamなどの現代のタンパク質ドメインデータベースでも一般的に使用されています。人間のキュレーターが関連性が知られている配列のプールを選択し、コンピュータプログラムを使用してそれらを整列させてモチーフプロファイルを作成します(PfamはHMMを使用しており、これを使用して他の関連タンパク質を識別できます。[6]系統学的アプローチを使用してde novo MEMEアルゴリズムを強化することもできます。PhyloGibbsがその一例です。[7]
デノボモチーフペアの発見
2017年には、ペア配列に直接適用できるモチーフ発見ツールとしてMotifHyadesが開発されました。[8]
デノボタンパク質からのモチーフ認識
2018年には、タンパク質のDNA結合ドメインからDNAモチーフを推測するためのマルコフランダムフィールドアプローチが提案されました。[9]
モチーフ発見アルゴリズム
モチーフ発見アルゴリズムは、多様な戦略を使用して DNA 配列のパターンを発見します。列挙型、確率型、自然からヒントを得たアプローチを統合することで、その適応性が実証され、複数の方法を使用することで識別精度の向上に効果的であることが証明されています。
列挙的アプローチ: [2]
モチーフ発見の旅を開始する列挙アプローチでは、アルゴリズムが細心の注意を払って潜在的なモチーフを生成し、評価します。この分野の先駆者は、YMF や DREME などの単純な単語列挙技術で、短いモチーフを探すために配列を体系的に調べます。これらを補完する CisFinder などのクラスタリングベースの方法は、モチーフのクラスタリングにヌクレオチド置換マトリックスを使用して、冗長性を効果的に軽減します。同時に、Weeder や FMotif などのツリーベースの方法はツリー構造を活用し、グラフ理論ベースの方法 (WINNOWER など) はグラフ表現を使用して、列挙戦略の豊富さを実証します。
確率的アプローチ: [2]
確率論的領域に分岐するこのアプローチは、確率モデルを利用して配列内のモチーフを識別します。決定論的例である MEME は、位置重みマトリックス (PWM) を最適化し、整列していない DNA 配列内の保存領域を解明するために期待値最大化を採用しています。これとは対照的に、ギブス サンプリングなどの確率論的手法は、ランダムなモチーフ位置の割り当てでモチーフの発見を開始し、予測を繰り返し改良します。この確率論的フレームワークは、モチーフの発見に関連する固有の不確実性を巧みに捉えています。
高度なアプローチ: [2]
さらに進化した高度なモチーフ発見には、ベイズモデリング[10]を中心とした洗練された技術が取り入れられています。このコホートの代表例であるLOGOSとBaMMは、モチーフ識別のためにベイズアプローチとマルコフモデルを複雑に織り交ぜています。ベイズクラスタリング法を組み込むことで確率論的基盤が強化され、DNA配列のパターン認識のための総合的なフレームワークが提供されます。
自然にヒントを得たヒューリスティックアルゴリズム: [2]
アルゴリズムが生物学の領域からインスピレーションを得るという、明確なカテゴリが展開されます。FMGAとMDGAに代表される遺伝的アルゴリズム(GA)[11]は、遺伝的演算子と特殊な戦略を通じてモチーフ検索を進めます。群知能の原理を利用して、 GAEM、GARP、MACSに搭載されている粒子群最適化(PSO)、人工蜂コロニー(ABC)アルゴリズム、カッコウ検索(CS)アルゴリズムは、フェロモンベースの探索に挑戦します。これらのアルゴリズムは、自然の適応性と協力的なダイナミクスを反映しており、モチーフ識別のための先進的な戦略として機能します。ハイブリッドアプローチでのヒューリスティック手法の統合は、モチーフ発見という複雑な領域におけるこれらのアルゴリズムの適応性を強調しています。

モチーフケース
3次元チェーンコード
大腸菌ラクトースオペロンリプレッサーLacI (PDB:1lcc 鎖A)と大腸菌カタボライト遺伝子アクティベーター(PDB:3gap 鎖A)はどちらもヘリックス・ターン・ヘリックスモチーフを持っていますが、以下の表に示すように、それらのアミノ酸配列はあまり類似していません。1997年に、松田らは、タンパク質構造を文字列として表す「3次元チェーンコード」と呼ばれるコードを考案しました。このエンコード方式により、アミノ酸配列よりもはるかに明確にタンパク質間の類似性が明らかになります(記事からの例):[12]このコードは、タンパク質バックボーンのアルファ炭素間のねじれ角をエンコードします。「W」は常にアルファヘリックスに対応します。
参照
- 生体分子構造
- 哺乳類モチーフファインダー
- モチビュー
- モチーフ誘発のための多重EM
- 核酸配列
- タンパク質の一次構造
- タンパク質のI部位
- シーケンスロゴ
- シーケンスマイニング
- 構造モチーフ
- 短い線状のモチーフ
- 保存された配列
- タンパク質ドメイン
- 構造モチーフ
参考文献
一次資料
- ^ Dlakić , Mensur; Harrington, Rodney E. (1996). 「DNA の曲率に対する配列コンテキストの影響」。米国科学 アカデミー紀要。93 (9): 3847–3852。Bibcode : 1996PNAS ...93.3847D。doi : 10.1073 / pnas.93.9.3847。ISSN 0027-8424。JSTOR 39155。PMC 39447。PMID 8632978。
- ^ abcde Hashim, Fatma A.; Mabrouk, Mai S.; Al-Atabany, Walid (2019). 「さまざまな配列モチーフ検索アルゴリズムのレビュー」. Avicenna Journal of Medical Biotechnology . 11 (2): 130–148. ISSN 2008-2835. PMC 6490410. PMID 31057715 .
- ^ Bailey TL、Williams N、 Misleh C、Li WW (2006 年 7 月)。「MEME: DNA およびタンパク質配列モチーフの発見と分析」。Nucleic Acids Research。34 ( Web Server版): W369-73。doi : 10.1093/nar/gkl198。PMC 1538909。PMID 16845028。
- ^ Weirauch MT、Cote A、Norel R、Annala M、Zhao Y、Riley TR、et al. (2013 年 2 月)。「転写因子配列特異性をモデル化する手法の評価」。Nature Biotechnology。31 ( 2 ) : 126–34。doi :10.1038 / nbt.2486。PMC 3687085。PMID 23354101。
- ^ Akiyama Y, Hosoya T, Poole AM, Hotta Y (1996年12月). 「gcmモチーフ:ショウジョウバエと哺乳類で保存されている新しいDNA結合モチーフ」. Proceedings of the National Academy of Sciences of the United States of America . 93 (25): 14912–6. Bibcode :1996PNAS...9314912A. doi : 10.1073/pnas.93.25.14912 . PMC 26236 . PMID 8962155.
- ^ 「Pfamでのモデリング」。Pfam 。 2023年12月14日閲覧。
- ^ Siddharthan R、Siggia ED、van Nimwegen E (2005 年 12 月)。「PhyloGibbs: 系統発生 を組み込んだギブス サンプリング モチーフ ファインダー」。PLOS Computational Biology。1 ( 7): e67。Bibcode : 2005PLSCB ... 1 ...67S。doi : 10.1371/ journal.pcbi.0010067。PMC 1309704。PMID 16477324。
- ^ Wong KC (2017年10月). 「MotifHyades: ペア配列上のde novo DNAモチーフペア発見の期待値最大化」.バイオインフォマティクス. 33 (19): 3028–3035. doi : 10.1093/bioinformatics/btx381 . PMID 28633280.
- ^ Wong KC (2018年9月). 「タンパク質配列からのDNAモチーフ認識モデリング」. iScience . 7 : 198–211. Bibcode :2018iSci....7..198W. doi :10.1016/j.isci.2018.09.003. PMC 6153143. PMID 30267681 .
- ^ Miller, Andrew K.; Print, Cristin G.; Nielsen, Poul MF; Crampin, Edmund J. (2010-11-18). 「転写モチーフのベイジアン検索」. PLOS ONE . 5 (11): e13897. Bibcode :2010PLoSO...513897M. doi : 10.1371/journal.pone.0013897 . ISSN 1932-6203. PMC 2987817 . PMID 21124986.
- ^ Che, Dongsheng; Song, Yinglei; Rasheed, Khaled (2005-06-25)。「MDGA: 遺伝的アルゴリズムを使用したモチーフの発見」。遺伝的および進化的計算に関する第 7 回年次会議の議事録。GECCO '05。ニューヨーク、ニューヨーク州、米国: Association for Computing Machinery。pp. 447–452。doi :10.1145/1068009.1068080。ISBN 978-1-59593-010-1. S2CID 7892935。
- ^ Matsuda H, Taniguchi F, Hashimoto A (1997). 「バックボーンコンフォメーションのエンコード方式を用いたタンパク質構造モチーフの検出方法」(PDF) . Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing : 280–91. PMID 9390299.
さらに読む
- Kadaveru K、Vyas J、 Schiller MR (2008 年 5 月)。「ウイルス感染とヒト疾患 - ミニモチーフからの洞察」。Frontiers in Bioscience。13 ( 13): 6455–71。doi :10.2741/3166。PMC 2628544。PMID 18508672。
- Stormo GD (2000 年 1 月). 「DNA 結合部位: 表現と発見」.バイオインフォマティクス. 16 (1): 16–23. doi :10.1093/bioinformatics/16.1.16. PMID 10812473.
一次資料
- Altarawy D、Ismail MA、Ghanem S (2009)。「MProfiler: DNA モチーフ発見のためのプロファイルベースの方法」。バイオインフォマティクスにおけるパターン認識。コンピュータサイエンスの講義ノート。第 5780 巻。pp. 13–23。doi : 10.1007/ 978-3-642-04031-3_2。ISBN 978-3-642-04030-6。
- Schiller MR (2007)。「Minimotif Miner: タンパク質の機能、疾患、遺伝的多様性を調査するための計算ツール」。Current Protocols in Protein Science 48 ( 1)。Wiley: 2.12.1–2.12.14。doi : 10.1002 /0471140864.ps0212s48。ISBN 978-0471140863. PMID 18429315. S2CID 10406520.
- Balla S、Thapar V、Verma S、 Luong T 、 Faghri T、Huang CH、他 (2006 年 3 月)。 「Minimotif Miner: タンパク質機能の調査ツール」。Nature Methods。3 (3) : 175–7。doi :10.1038/nmeth856。PMID 16489333。S2CID 15571142 。
