Chou –Fasman法は、タンパク質の二次構造を予測するための経験的手法であり、もともとは1970年代にPeter Y. ChouとGerald D. Fasmanによって開発されました。[ 1 ] [ 2 ] [ 3 ]この手法は、X線結晶構造解析によって解明された既知のタンパク質構造に基づいて、 αヘリックス、βシート、およびターンにおける各アミノ酸の相対頻度の分析に基づいています。これらの頻度から、各二次構造タイプにおける各アミノ酸の出現確率パラメータのセットが導出され、これらのパラメータは、特定のアミノ酸配列がタンパク質内でヘリックス、βストランド、またはターンを形成する確率を予測するために使用されます。この手法は、正しい二次構造を識別する精度がせいぜい50~60%程度であり、 [ 4 ]これは最新の機械学習ベースの手法よりも精度が著しく低いものです。[ 5 ]
オリジナルの Chou–Fasman パラメータでは、個々のアミノ酸が他のものよりもある種の二次構造を好む強い傾向があることがわかった。アラニン、グルタミン酸、ロイシン、メチオニンはらせん形成アミノ酸として同定されたが、プロリンとグリシンは、ペプチド結合の独特な立体配座特性により、一般的にらせんの末端に位置する。オリジナルの Chou–Fasman パラメータ[ 6 ]は、研究当時知られていたタンパク質構造の数が少なかったため、非常に小さく代表的でないサンプルから導出された。これらのオリジナルのパラメータはその後信頼性が低いことが示され[ 7 ]、現在のデータセットから更新され、初期アルゴリズムも修正された[ 8 ] 。
Chou–Fasman法は、各アミノ酸がらせん、鎖、またはターンに現れる確率のみを考慮します。より複雑なGOR法とは異なり、隣接するアミノ酸が既にその構造を持っている場合に、アミノ酸が特定の二次構造を形成する条件付き確率は反映されません。この協調性の欠如は計算効率を高めますが、個々のアミノ酸の傾向が決定的な予測を行うほど強くない場合が多いため、精度は低下します。[ 5 ]
Chou–Fasman法は、同様の方法でらせん構造と鎖構造を予測します。まず、配列を直線的に探索して、らせん構造または鎖構造の確率が高い「核形成」領域を探し、次に、後続の4残基のウィンドウの確率が1未満になるまで領域を拡張します。当初の説明では、連続する6つのアミノ酸のうち4つがあればらせん構造の核形成に十分であり、連続する5つのアミノ酸のうち3つがあればシート構造の核形成に十分でした。らせん構造と鎖構造の核形成の確率閾値は一定ですが、必ずしも等しいわけではありません。当初は、らせん構造のカットオフ値が1.03、鎖構造のカットオフ値が1.00に設定されていました。
ターンも4残基単位で評価されますが、多くのターン領域にはヘリックス領域やシート領域にも出現する可能性のあるアミノ酸が含まれているため、多段階の手順で計算されます。4残基ターンには固有のアミノ酸があり、プロリンとグリシンはどちらもターンによく見られます。ターンは、ターンの確率がヘリックスまたはシートの確率よりも大きく、かつターン内の特定のアミノ酸の位置に基づく確率値が所定の閾値を超える場合にのみ予測されます。ターンの確率p(t)は次のように決定されます。
ここで、jは 4 残基のウィンドウ内でのアミノ酸の位置です。p(t) が任意のカットオフ値 (元々は 7.5e–3) を超え、p(j) の平均が 1 を超え、かつ p(t) がそのウィンドウの α ヘリックスと β シートの確率を超える場合、ターンが予測されます。最初の 2 つの条件が満たされているが、β シートの確率 p(b) が p(t) を超える場合、代わりにシートが予測されます。