数理モデルと推論
数理モデル DCAの基礎は、系統発生的に関連する 生物学的配列のセット内の変動性に関する統計モデルです。長さの配列の 多重配列アライメント (MSA)に適合させると、N {\displaystyle N} このモデルでは、同じ長さのすべての可能な配列の確率を定義します。[ 1 ] この確率は、問題の配列がMSA内の配列と同じクラスの配列に属する確率、たとえば特定のタンパク質ファミリー に属するすべてのタンパク質配列のクラスに属する確率として解釈できます。
数列を次のように表す。1 = ( 1 1 、 1 2 。 。 、 1 N ) {\displaystyle a=(a_{1},a_{2}..,a_{N})} で1 私 {\displaystyle a_{i}} 配列のモノマー を表すカテゴリ変数 である(例えば、配列がタンパク質ファミリーのタンパク質の整列された アミノ酸配列である場合、 1 私 {\displaystyle a_{i}} 20種類の標準アミノ酸 のいずれかを値として取る)。モデル内の配列の確率は次のように定義される。
P ( 1 | J 、 h ) = 1 Z exp ( ∑ 私 = 1 N − 1 ∑ j = 私 + 1 N J 私 j ( 1 私 、 1 j ) + ∑ 私 = 1 N h 私 ( 1 私 ) ) 、 {\displaystyle {\begin{aligned}P\left(a|J,h\right)={\frac {1}{Z}}\exp {\left(\sum \limits _{i=1}^{N-1}\sum \limits _{j=i+1}^{N}J_{ij}(a_{i},a_{j})+\sum \limits _{i=1}^{N}h_{i}(a_{i})\right)},\end{aligned}}} どこ
J 、 h {\displaystyle J,h} これらはモデルのパラメータを表す実数の集合です(詳細は後述)。Z {\displaystyle Z} は正規化定数(実数 )であり、∑ 1 P ( 1 | J 、 h ) = 1 {\displaystyle \sum \limits _{a}P(a|J,h)=1} パラメータh 私 ( 1 私 ) {\displaystyle h_{i}(a_{i})} 1つのポジションに依存する私 {\displaystyle i} そしてシンボル1 私 {\displaystyle a_{i}} この位置では、これらは通常フィールド[ 1 ] と呼ばれ、それぞれがシンボルの傾向を表します。1 私 {\displaystyle a_{i}} 位置で見つかります私 {\displaystyle i} パラメータJ 私 j ( 1 私 、 1 j ) {\displaystyle J_{ij}(a_{i},a_{j})} 位置のペアに依存する私 、 j {\displaystyle i,j} そしてシンボル1 私 、 1 j 、 {\displaystyle a_{i},a_{j},} これらの位置では、通常、結合[ 1 ] と呼ばれ、相互作用、つまり両方の位置のシンボルが互いにどの程度互換性があるかを定量化する項を表します。モデルは完全に接続されて いるため、すべての位置のペア間に相互作用があります。このモデルは、スピンが 2 つの値だけでなく、与えられた有限アルファベットの任意の値を取るという、イジングモデル の一般化と見なすことができます。実際、アルファベットのサイズが 2 の場合、モデルはイジングモデルに帰着します。また、同名のモデル を彷彿とさせるため、ポッツモデル と呼ばれることもよくあります。[ 19 ]
すべてのシーケンスの確率を知っていても、パラメータは決定されませんJ 、 h {\displaystyle J,h} 独自に。たとえば、パラメータの単純な変換
J 私 j ( 1 、 b ) → J 私 j ( 1 、 b ) + R 私 j {\displaystyle J_{ij}(a,b)\rightarrow J_{ij}(a,b)+R_{ij}} 任意の実数の集合に対してR 私 j {\displaystyle R_{ij}} 確率は同じままです。尤度関数 もこのような変換の下で不変なので、データを使用してこれらの自由度を固定することはできません(ただし、パラメータの事前分布を使用すれば固定できる可能性があります [ 3 ] )。
文献[ 3 ] [ 20 ] でよく見られる慣習は、結合行列のフロベニウスノルム が
F 私 j = ∑ 1 、 b J 私 j ( 1 、 b ) 2 、 {\displaystyle F_{ij}={\sqrt {\sum \limits _{a,b}J_{ij}(a,b)^{2}}},} 最小化される(位置のペアごとに独立して)私 {\displaystyle i} そしてj {\displaystyle j} )
最大エントロピーの導出 ポッツモデルを正当化するために、最大エントロピー原理 に従って導出できることがよく指摘される。[ 21 ] 与えられたサンプル共分散 と頻度のセットに対して、ポッツモデルは、それらの共分散と頻度を再現するすべての分布の中で最大のシャノンエントロピー を持つ分布を表す。多重配列アライメント の場合、サンプル共分散は次のように定義される。
C 私 j ( 1 、 b ) = f 私 j ( 1 、 b ) − f 私 ( 1 ) f j ( b ) {\displaystyle C_{ij}(a,b)=f_{ij}(a,b)-f_{i}(a)f_{j}(b)} 、どこf 私 j ( 1 、 b ) {\displaystyle f_{ij}(a,b)} 記号を見つける相対頻度1 {\displaystyle a} そしてb {\displaystyle b} ポジション私 {\displaystyle i} そしてj {\displaystyle j} MSA と同じ順序で、f 私 ( 1 ) {\displaystyle f_{i}(a)} シンボルを見つける相対頻度1 {\displaystyle a} ポジション私 {\displaystyle i} ポッツモデルは、その一意の分布である。P {\displaystyle P} 機能性を最大化する
F [ P ] = − ∑ 1 P ( 1 ) ログ P ( 1 ) + ∑ 私 < j ∑ x 、 y λ 私 j ( x 、 y ) ( P 私 j ( x 、 y ) − f 私 j ( x 、 y ) ) + ∑ 私 ∑ x λ 私 ( x ) ( P 私 ( x ) − f 私 ( x ) ) + Ω ( 1 − ∑ 1 P ( 1 ) ) 。 {\displaystyle {\begin{aligned}F[P]=&-\sum \limits _{a}P(a)\log P(a)\\&+\sum \limits _{i<j}\sum \limits _{x,y}\lambda _{ij}(x,y){\Big (}P_{ij}(x,y)-f_{ij}(x,y){\Big )}\\&+\sum \limits _{i}\sum \limits _{x}\lambda _{i}(x){\Big (}P_{i}(x)-f_{i}(x){\Big )}\\&+\Omega \left(1-\sum \limits _{a}P(a)\right).\end{aligned}}} 関数の最初の項は、分布のシャノンエントロピーです。 λ {\displaystyle \lambda } ラグランジュ乗数 であることを保証するP 私 j ( x 、 y ) = f 私 j ( x 、 y ) {\displaystyle P_{ij}(x,y)=f_{ij}(x,y)} 、 とP 私 j ( x 、 y ) {\displaystyle P_{ij}(x,y)} 記号を見つける周辺確率x 、 y {\displaystyle x,y} ポジション私 、 j {\displaystyle i,j} ラグランジュ乗数Ω {\displaystyle \Omega } 正規化を保証します。この機能を最大化し、識別します。
λ 私 j ( x 、 y ) = J 私 j ( x 、 y ) λ 私 ( x ) = h 私 ( x ) Ω = Z {\displaystyle {\begin{aligned}&\lambda _{ij}(x,y)=J_{ij}(x,y)\\&\lambda _{i}(x)=h_{i}(x)\\&\Omega =Z\\\end{aligned}}} これは上記のポッツモデルにつながります。この手順ではポッツモデルの関数形式しか得られず、ラグランジュ乗数(パラメータと同一視される)の数値は、モデルをデータに当てはめることで決定する必要があります。
アプリケーション
タンパク質ファミリーのMSAに適合させたモデルにおけるカップリング値が大きい場合、考えられる解釈の一つは、ファミリー内の位置(残基)間に保存された接触が存在することです。このような接触は分子共進化 につながる可能性があります。なぜなら、2つの残基のうち一方に突然変異が生じ、他方の残基に補償変異が生じない場合、タンパク質の構造が 破壊され、タンパク質の適応度に悪影響を及ぼす可能性が高いからです。したがって、相互適合性を維持するための強い選択圧 がかかる残基ペアは、一緒に突然変異するか、全く突然変異しないかのどちらかであると予想されます。この考え方(DCAの概念が生まれるずっと前から文献で知られていた[ 26 ] )は、例えばタンパク質残基間の相互情報を分析することによって、タンパク質接触マップを 予測するために使用されてきました。
DCAの枠組みでは、一対の残基間の直接的な相互作用の強さを表すスコア私 、 j {\displaystyle i,j} はフロベニウスノルムを用いて定義されることが多い[ 3 ] [ 20 ]。 F 私 j {\displaystyle F_{ij}} 対応する結合行列のJ 私 j {\displaystyle J_{ij}} そして、平均積補正 (APC)を適用する。
F 私 j A P C = F 私 j − F 私 F j F 、 {\displaystyle F_{ij}^{APC}=F_{ij}-{\frac {F_{i}F_{j}}{F}},} どこF 私 j {\displaystyle F_{ij}} 上記で定義されており、
F 私 = 1 N ∑ j ≠ 私 N F 私 j F = 1 N 2 − N ∑ 私 、 j 、 私 ≠ j N F 私 j {\displaystyle {\begin{aligned}&F_{i}={\frac {1}{N}}\sum \limits _{j\neq i}^{N}F_{ij}\\&F={\frac {1}{N^{2}-N}}\sum \limits _{i,j,i\neq j}^{N}F_{ij}\end{aligned}}} 。この補正項は相互情報量[ 27 ] に最初に導入され、特定の位置のバイアスを除去して大きな値を生成するために使用されます。F 私 j {\displaystyle F_{ij}} パラメータ変換によって確率に影響しない不変のスコアも使用されています。[ 1 ] このスコアですべての残基ペアをソートすると、リストの上位が相同タンパク質のタンパク質接触マップと比較して残基接触が強く濃縮されたリストが得られます。[ 4 ] 残基接触の高品質な予測は、タンパク質構造予測 における事前情報として価値があります。[ 4 ]
タンパク質間相互作用の推論 DCAは、タンパク質ファミリー間の保存された相互作用 を検出したり、タンパク質複合 体内でどの残基ペアが接触を形成するかを予測したりするために使用できます。[ 8 ] [ 9 ] このような予測は、これらの複合体の構造モデルを生成するとき[ 28 ] 、または2つ以上のタンパク質から構成されるタンパク質間相互作用ネットワークを推論するときに使用できます。[ 9 ] [ 12 ]
適応度景観のモデリング DCAは、適応度ランドスケープをモデル化したり、タンパク質のアミノ酸配列の変異がその適応度に及ぼす影響を予測したりするために使用できます。[ 13 ] [ 14 ]
外部リンク オンラインサービス:
EVカップリング グレムリン DCAウェブサービス アモアイ エリクシル ソースコード:
便利なアプリケーション:
DCA-MOL: 構造に対する DCA の結果を分析するための PyMOL プラグイン[ 29 ]
参考文献 1 2 3 4 5 6 7 8 Morcos, F.; Pagnani, A.; Lunt, B.; Bertolino, A.; Marks, DS; Sander, C.; Zecchina, R.; Onuchic, JN; Hwa, T.; Weigt, M. (2011年11月21日). "残基共進化の直接結合解析により、多くのタンパク質ファミリーにわたる天然の接触が捉えられる" . Proceedings of the National Academy of Sciences . 108 (49): E1293– E1301. arXiv : 1110.5223 . Bibcode : 2011PNAS..108E1293M . doi : 10.1073/pnas.1111471108 . PMC 3241805 . PMID 22106262。 ↑ Kamisetty, H.; Ovchinnikov, S.; Baker, D. (2013年9月5日). "配列と構造が豊富な時代における共進化に基づく残基間接触予測の有用性の評価" . Proceedings of the National Academy of Sciences . 110 (39): 15674– 15679. Bibcode : 2013PNAS..11015674K . doi : 10.1073/pnas.1314045110 . PMC 3785744 . PMID 24009338 . 1 2 3 4 5 Ekeberg, Magnus; Lövkvist, Cecilia; Lan, Yueheng; Weigt, Martin; Aurell, Erik (2013 年 1 月 11 日). "タンパク質における接触予測の改善: 擬似尤度を使用してポッツモデルを推測". Physical Review E . 87 (1) 012707. arXiv : 1211.1281 . Bibcode : 2013PhRvE..87a2707E . doi : 10.1103/PhysRevE.87.012707 . PMID 23410359 . S2CID 27772365 . 1 2 3 Marks, Debora S.; Colwell, Lucy J.; Sheridan, Robert; Hopf, Thomas A.; Pagnani, Andrea; Zecchina, Riccardo; Sander, Chris; Sali, Andrej (2011年12月7日). "進化配列変異から計算されたタンパク質の3D構造" . PLOS ONE . 6 (12) e28766. Bibcode : 2011PLoSO...628766M . doi : 10.1371/journal.pone.0028766 . PMC 3233603 . PMID 22163331 . ↑ Ekeberg, Magnus; Hartonen, Tuomo; Aurell, Erik (2014-11-01). "多数の相同アミノ酸配列からのタンパク質構造の直接結合解析のための高速擬似尤度最大化" . Journal of Computational Physics . 276 : 341– 356. arXiv : 1401.4832 . Bibcode : 2014JCoPh.276..341E . doi : 10.1016/j.jcp.2014.07.024 . ISSN 0021-9991 . S2CID 15635703 . ↑ De Leonardis, Eleonora; Lutz, Benjamin; Ratz, Sebastian; Cocco, Simona; Monasson, Rémi; Schug, Alexander; Weigt, Martin (2015年9月29日). "ヌクレオチド共進化の直接結合解析によりRNA二次構造および三次構造の予測が促進される" . Nucleic Acids Research . 43 (21): 10444– 55. arXiv : 1510.03351 . doi : 10.1093/nar/gkv932 . PMC 4666395 . PMID 26420827 . ↑ Weinreb, Caleb; Riesselman, Adam J.; Ingraham, John B.; Gross, Torsten; Sander, Chris; Marks, Debora S. (2016 年 5 月). "3D RNA と進化的結合からの機能的相互作用" . Cell . 165 (4): 963– 975. doi : 10.1016/j.cell.2016.03.030 . PMC 5024353 . PMID 27087444 . 1 2 Ovchinnikov, Sergey; Kamisetty, Hetunandan; Baker, David (2014 年 5 月 1 日). 「進化情報を用いたタンパク質界面における残基間相互作用の堅牢かつ正確な予測」 . eLife . 3 e02030 . doi : 10.7554/eLife.02030 . PMC 4034769. PMID 24842992 . 1 2 3 Feinauer, Christoph; Szurmant, Hendrik; Weigt, Martin; Pagnani, Andrea; Keskin, Ozlem (2016年2月16日). "Inter-Protein Sequence Co-Evolution Predicts Known Physical Interactions in Bacterial Ribosomes and the Trp Operon" . PLOS ONE . 11 (2) e0149166. arXiv : 1512.05420 . Bibcode : 2016PLoSO..1149166F . doi : 10.1371/journal.pone.0149166 . PMC 4755613 . PMID 26882169 . ↑ dos Santos, RN; Morcos, F.; Jana, B.; Andricopulo, AD; Onuchic, JN (2015年9月4日). "直接共進化カップリングを用いた二量体相互作用と複合体形成" . Scientific Reports . 5 13652. Bibcode : 2015NatSR...513652D . doi : 10.1038/srep13652 . PMC 4559900 . PMID 26338201 . ↑ Uguzzoni, Guido; John Lovis, Shalini; Oteri, Francesco; Schug, Alexander; Szurmant, Hendrik; Weigt, Martin (2017-03-28). "直接結合解析によるホモオリゴマータンパク質界面を横断する共進化シグナルの大規模同定" . Proceedings of the National Academy of Sciences . 114 (13): E2662– E2671. arXiv : 1703.01246 . Bibcode : 2017PNAS..114E2662U . doi : 10.1073/pnas.1615068114 . ISSN 0027-8424 . PMC 5380090 . PMID 28289198 . 1 2 Croce, Giancarlo; Gueudré, Thomas; Cuevas, Maria Virginia Ruiz; Keidel, Victoria; Figliuzzi, Matteo; Szurmant, Hendrik; Weigt, Martin (2019-10-21). "タンパク質ドメイン間の相互作用を予測するためのマルチスケール共進化アプローチ" . PLOS Computational Biology . 15 (10) e1006891. Bibcode : 2019PLSCB..15E6891C . doi : 10.1371/journal.pcbi.1006891 . ISSN 1553-7358 . PMC 6822775 . PMID 31634362 . 1 2 Ferguson, Andrew L.; Mann, Jaclyn K.; Omarjee, Saleha; Ndung'u, Thumbi; Walker, Bruce D.; Chakraborty, Arup K. (2013 年 3 月). "HIV 配列を定量的適応度ランドスケープに変換することで、合理的な免疫原設計のためのウイルス脆弱性を予測できます" . Immunity . 38 (3): 606– 617. doi : 10.1016/j.immuni.2012.11.022 . PMC 3728823 . PMID 23521886 . 1 2 Figliuzzi, Matteo; Jacquier, Hervé; Schug, Alexander; Tenaillon, Oliver; Weigt, Martin (2016 年 1 月) 「共進化景観推論とベータラクタマーゼ TEM-1 の変異の文脈依存性」 . Molecular Biology and Evolution . 33 (1): 268– 280. doi : 10.1093/molbev/msv211 . PMC 4693977 . PMID 26446903 . ↑ Asti, Lorenzo; Uguzzoni, Guido; Marcatili, Paolo; Pagnani, Andrea; Ofran, Yanay (2016年4月13日). "配列化された免疫レパートリーの最大エントロピーモデルによる抗原抗体親和性の予測" . PLOS Computational Biology . 12 (4) e1004870. Bibcode : 2016PLSCB..12E4870A . doi : 10.1371/journal.pcbi.1004870 . PMC 4830580 . PMID 27074145 . ↑ ラス、ウィリアム P.フィグリウッツィ、マッテオ。ストッカー、クリスチャン。バラ=シャルレー、ピエール。ソコリッチ、マイケル。カスト、ピーター。ドナルド、ヒルバート。モナソン、レミ。コッコ、シモナ。ウェイト、マーティン。ランガナタン、ラーマ(2020-07-24)。 「コリスミ酸ムターゼ酵素を設計するための進化に基づくモデル」 。 科学 。 369 (6502): 440–445 。 Bibcode : 2020Sci...369..440R 。 土井 : 10.1126/science.aba3304 。 ISSN 0036-8075 。 PMID 32703877 。 S2CID 220714458 。 ↑ Rodriguez-Rivas, Juan; Croce, Giancarlo; Muscat, Maureen; Weigt, Martin (2022-01-25). "エピスタシスモデルはSARS-CoV-2タンパク質およびエピトープの変異部位を予測する" . Proceedings of the National Academy of Sciences . 119 (4). arXiv : 2112.10093 . Bibcode : 2022PNAS..11913118R . doi : 10.1073/pnas.2113118119 . ISSN 0027-8424 . PMC 8795541 . PMID 35022216 . ↑ Vigué, Lucile; Croce, Giancarlo; Petitjean, Marie; Ruppé, Etienne; Tenaillon, Olivier; Weigt, Martin (2022-07-12). "エピスタシス配列ランドスケープによる61,157個の大腸菌ゲノムの多型性の解読" . Nature Communications . 13 (1): 4030. Bibcode : 2022NatCo..13.4030V . doi : 10.1038/s41467-022-31643-3 . ISSN 2041-1723 . PMC 9276797 . PMID 35821377 . ↑ Feinauer, Christoph; Skwark, Marcin J.; Pagnani, Andrea; Aurell, Erik (2014年10月9日). "3次元に沿った接触予測の改善" . PLOS Computational Biology . 10 (10) e1003847. arXiv : 1403.0379 . Bibcode : 2014PLSCB..10E3847F . doi : 10.1371/journal.pcbi.1003847 . PMC 4191875 . PMID 25299132 . 1 2 3 Baldassi, Carlo; Zamparo, Marco; Feinauer, Christoph; Procaccini, Andrea; Zecchina, Riccardo; Weigt, Martin; Pagnani, Andrea (2014年3月24日). "タンパク質ファミリーの高速かつ正確な多変量ガウスモデル化: 残基接触とタンパク質相互作用パートナーの予測" . PLOS ONE . 9 (3) e92721. arXiv : 1404.1240 . Bibcode : 2014PLoSO...992721B . doi : 10.1371/journal.pone.0092721 . PMC 3963956 . PMID 24663061 . ↑ Stein, Richard R.; Marks, Debora S.; Sander, Chris; Chen, Shi-Jie (2015年7月30日). "最大エントロピー確率モデルを用いた生物学的データからのペアワイズ相互作用の推論" . PLOS Computational Biology . 11 (7) e1004182. Bibcode : 2015PLSCB..11E4182S . doi : 10.1371/journal.pcbi.1004182 . PMC 4520494 . PMID 26225866 . ↑ Burger, Lukas; van Nimwegen, Erik; Bourne, Philip E. (2010年1月1日). "タンパク質アライメントにおける残基の直接的および間接的共進化の分離" . PLOS Computational Biology . 6 (1) e1000633. Bibcode : 2010PLSCB...6E0633B . doi : 10.1371/journal.pcbi.1000633 . PMC 2793430 . PMID 20052271 . ↑ Weigt, M.; White, RA; Szurmant, H.; Hoch, JA; Hwa, T. (2008年12月30日). "メッセージパッシングによるタンパク質間相互作用における直接残基接触の同定" . Proceedings of the National Academy of Sciences . 106 (1): 67– 72. arXiv : 0901.1248 . Bibcode : 2009PNAS..106...67W . doi : 10.1073/pnas.0805923106 . PMC 2629192 . PMID 19116270 . ↑ Figliuzzi, Matteo; Barrat-Charlaix, Pierre; Weigt, Martin (2018年4月1日). "How Pairwise Coevolutionary Models Capture the Collective Residue Variability in Proteins?". Molecular Biology and Evolution . 35 (4): 1018– 1027. arXiv : 1801.04184 . doi : 10.1093/molbev/msy007 . ↑ Barton, JP; De Leonardis, E.; Coucke, A.; Cocco, S. (2016年6月21日). "ACE: 最大エントロピーグラフィカルモデル推論のための適応型クラスタ拡張" . Bioinformatics . 32 (20): 3089– 3097. doi : 10.1093/bioinformatics/btw328 . PMID 27329863 . ↑ Göbel, Ulrike; Sander, Chris; Schneider, Reinhard; Valencia, Alfonso (1994 年 4 月) 「タンパク質における相関変異と残基接触」。Proteins : Structure, Function, and Genetics . 18 (4): 309– 317. doi : 10.1002/prot.340180402 . PMID 8208723 . S2CID 14978727 . ↑ Dunn, SD; Wahl, LM; Gloor, GB (2007年12月5日). 「系統発生やエントロピーの影響を受けない相互情報量により、残基接触予測が劇的に改善される」 . Bioinformatics . 24 (3): 333– 340. doi : 10.1093/bioinformatics/btm604 . PMID 18057019 . ↑ Schug, A.; Weigt, M.; Onuchic, JN; Hwa, T.; Szurmant, H. (2009年12月17日). "ゲノム情報と分子シミュレーションの統合による高解像度タンパク質複合体" . Proceedings of the National Academy of Sciences . 106 (52): 22124– 22129. Bibcode : 2009PNAS..10622124S . doi : 10.1073/pnas.0912100106 . PMC 2799721 . PMID 20018738 . ↑ Jarmolinska, Aleksandra I.; Zhou, Qin; Sulkowska, Joanna I. ; Morcos, Faruck (2019年1月11日). "DCA-MOL: 直接進化カップリングを解析するためのPyMOLプラグイン". Journal of Chemical Information and Modeling . 59 (2): 625–629 . doi : 10.1021/acs.jcim.8b00690 . PMID 30632747. S2CID 58634008 .