分子生物学における擬似アミノ酸組成( PseAAC )は、もともと2001年にKuo-Chen Chouによって導入され、タンパク質サンプルを表現し、タンパク質の細胞内局在予測と膜タンパク質の型予測を改善するためのものでした。[1]バニラアミノ酸組成(AAC)法と同様に、主にアミノ酸頻度のマトリックスを使用してタンパク質を特徴付け、他のタンパク質と有意な配列相同性のないタンパク質を扱うのに役立ちます。AACと比較して、特定の距離にある残基間の相関関係など、いくつかのローカルな特徴を表現するための追加情報もマトリックスに含まれています。[2] PseAACの場合を扱うとき、Chouの不変性定理がよく使用されます。
背景
タンパク質の細胞内局在やその他の属性をその配列に基づいて予測するために、タンパク質サンプルを表現するために一般に2種類のモデルが使用されます。(1) シーケンシャルモデルと (2) 非シーケンシャルモデルまたは離散モデルです。
タンパク質サンプルの最も一般的なシーケンシャル表現は、その完全な情報を含むことができるアミノ酸(AA) 配列全体です。これはシーケンシャル モデルの明らかな利点です。望ましい結果を得るために、予測を実行するために、通常は配列類似性検索ベースのツールが使用されます。
アミノ酸残基 を含むタンパク質配列Pが与えられた場合、すなわち、
ここで、R 1 はタンパク質Pの 1 番目の残基、R 2 は2 番目の残基を表します。これは、シーケンシャル モデルによるタンパク質の表現です。
しかし、この種のアプローチは、クエリタンパク質が既知のタンパク質と有意な相同性を持たない場合には失敗します。そのため、配列順序に依存しないさまざまな離散モデルが提案されました。最も単純な離散モデルは、アミノ酸組成(AAC)を使用してタンパク質サンプルを表すものです。AACモデルでは、式1のタンパク質Pは次のように表すこともできます。
ここで、はP 中の20個の天然アミノ酸の正規化された出現頻度、Tは転置演算子です。タンパク質のAACは、式1に示すように、タンパク質の一次構造がわかれば簡単に導き出せます。また、正確な配列を知らなくても加水分解によって導くことも可能で、実際、そのようなステップはタンパク質の配列決定の前提条件となることがよくあります。[3]
アミノ酸組成 (AAC) モデルは、その単純さから、タンパク質の特性を予測するための多くの以前の統計的手法で広く使用されていました。ただし、配列順序の情報はすべて失われます。これが主な欠点です。
コンセプト
配列順序情報が完全に失われるのを避けるために、PseAAC(擬似アミノ酸組成)の概念が提案されまし た。 [1]従来のアミノ酸組成(AAC)には、 タンパク質中の20種類の天然アミノ酸の1つの出現頻度をそれぞれ反映する20の要素が含まれていますが、PseAACには20を超える個別の要素のセットが含まれており、最初の20は従来のアミノ酸組成の要素を表し、追加の要素はさまざまな擬似要素を介して配列順序情報を組み込んでいます。
追加因子は、タンパク質鎖に沿った一連のランクの異なる相関因子ですが、何らかのシーケンス順序効果を何らかの方法で反映できる限り、他の因子の任意の組み合わせにすることもできます。したがって、PseAAC の本質は、一方では AA 構成をカバーし、他方では AA 構成を超えた情報を含み、したがって離散モデルを通じてタンパク質シーケンスの特徴をより適切に反映できることです。
一方、2009年のレビュー記事にまとめられているように、PseAACベクターを処方するためのさまざまなモードも開発されています。[2]
アルゴリズム

PseAACモデルによれば、式1のタンパク質Pは次のように定式化できる。
ここで()成分は次のように与えられる。
ここで、は重み係数であり、第- 層の相関係数は、次のように定式化される、最も連続する すべての第 - 層の残基間の配列順序相関を反映する。
と
ここで、はアミノ酸 の 番目の機能、は考慮される機能の総数です。たとえば、Chou の原著論文[1]では、、はそれぞれアミノ酸 の疎水性値、親水性値、側鎖質量です。一方、、はアミノ酸 の対応する値です。したがって、考慮される機能の総数は です。式 3から、最初の 20 個の成分、つまりはタンパク質の従来の AA 構成に関連付けられており、残りの成分は第 1 層、第 2 層、...、および第 番目の層の配列順序相関パターンを反映する相関係数であることがわかります (図 1 )。これらの追加要因を通じて、いくつかの重要な配列順序効果が組み込まれています。
式3の は整数のパラメータであり、 に異なる整数を選択すると次元の異なるPseAA構成につながる。[4]
式6の使用は、PseAACまたはその構成要素の相関係数を導出するための多くのモードのうちの1つにすぎません。物理化学的距離モード[5]や両親媒性パターンモード[6]などの他のモードも、2009年のレビュー記事[2]で要約されているように、さまざまなタイプのPseAACを導出するために使用できます。 2011年に、PseAAC(式3 )の定式化は、次に示す一般的なPseAACの形に拡張されました:[7]
ここで下付き文字 は整数であり、その値と成分は式1のPのアミノ酸配列から目的の情報を抽出する方法によって異なります 。
一般的なPseAACは、機能ドメイン、シーケンシャル進化、遺伝子オントロジーなどのコア機能を含む研究対象に応じて任意の機能を反映するために使用でき、タンパク質の細胞内局在の予測品質を向上させることができます。[8] [9]およびその他の多くの重要な属性も同様です。
参考文献
- ^ abc Chou KC (2001年5月). 「擬似アミノ酸組成を用いたタンパク質細胞特性の予測」.タンパク質. 43 (3): 246–55. doi :10.1002/prot.1035. PMID 11288174. S2CID 28406797.
- ^ abc Chou KC (2009). 「擬似アミノ酸組成とバイオインフォマティクス、プロテオミクス、システム生物学への応用」Current Proteomics 6 ( 4): 262–274. doi :10.2174/157016409789973707.
- ^ ミハイル・A・アルターマン、ピーター・ハンジカー(2011年12月2日)。アミノ酸分析:方法とプロトコル。ヒューマナ・プレス。ISBN 978-1-61779-444-5。
- ^ Chou KC、Shen HB (2007 年 11 月)。「タンパク質の細胞内局在予測における最近の進歩」。Anal . Biochem . 370 (1): 1–16. doi :10.1016/j.ab.2007.07.006. PMID 17698024。
- ^ Chou KC (2000 年 11 月). 「準配列順序効果を取り入れたタンパク質細胞内位置の予測」. Biochem. Biophys. Res. Commun . 278 (2): 477–83. doi :10.1006/bbrc.2000.3815. PMID 11097861.
- ^ Chou KC (2005年1月). 「両親媒性擬似アミノ酸組成を用いた酵素サブファミリークラスの予測」.バイオインフォマティクス. 21 (1): 10–9. doi : 10.1093/bioinformatics/bth466 . PMID 15308540.
- ^ Chou KC (2011年3月). 「タンパク質属性予測と疑似アミノ酸組成に関するいくつかのコメント」. Journal of Theoretical Biology . 273 (1): 236–47. Bibcode :2011JThBi.273..236C. doi :10.1016/j.jtbi.2010.12.024. PMC 7125570. PMID 21168420 .
- ^ Chou KC、Shen HB (2008)。「Cell-PLoc: さまざまな生物におけるタンパク質の細胞内局在を予測するための Web サーバーのパッケージ」Nat Protoc。3 ( 2): 153–62。doi : 10.1038 /nprot.2007.494。PMID 18274516。S2CID 226104。2007-08-27 に オリジナルからアーカイブ。2008-03-24に取得。
- ^ Shen HB、Chou KC (2008 年 2 月)。「PseAAC: さまざまな種類のタンパク質疑似アミノ酸組成を生成するための柔軟な Web サーバー」。Anal . Biochem . 373 (2): 386–8. doi :10.1016/j.ab.2007.10.012. PMID 17976365。
外部リンク
- PseAAC ウェブサーバー
