予測アラインメント誤差( PAE ) は、DeepMind [ 1 ]が開発したタンパク質構造予測システムAlphaFoldやその他の同様のプログラムによって生成される定量的出力です。トレーニング中、2 つの残基iとjの間のアラインメント誤差は、トレーニングデータ内の実験構造の同じ原子に、残基iの予測された N、Cα、および C 原子をアラインメントし、残基jの Cα 原子の予測位置と実験的な位置との間の結果として生じる距離を測定することによって計算されます。ネットワークは、各残基ペアのアラインメント誤差の確率分布を計算するようにトレーニングされ、そこから各ペアの PAE を計算できます。したがって、PAE は、予測された構造を異なる残基の実験構造にアラインメントした場合に、予測されたタンパク質構造内の各残基の期待される位置誤差を推定します。この測定は、科学者が予測されたタンパク質モデルのさまざまな部分の相対的な位置と向きの信頼性を評価するのに役立ちます。[ 2 ]
AlphaFold2およびAlphaFold3ネットワークは、64個のビンにおける予測された整列エラーの確率分布を生成するようにトレーニングされています。ビン1~64は(0,0.5), (0.5,1.0),..., (31.0,31.5), (31.5-)をカバーし、最後のビンは31.5 Åより大きいすべての距離をカバーする。64個のビンの合計は1.0である。
PAEは、各確率に各ビンの中心値を乗じて合計することで計算されます。
どこ。
PAEは、2次元(2D)のインタラクティブなプロットとして表示され、座標の色は、予測された構造と実際の構造が残基で整列された場合の、(x, y)その残基における予測位置誤差を表します。[ 3 ]異なるドメインの残基ペアのPAE値が低いほど、予測における相対的な位置と向きが明確に定義されていることを示唆し、PAE値が高いほど、相対的な位置または向きに不確実性があることを示します。ユーザーは、すべての残基ペアの生PAEデータをカスタムJSON形式でダウンロードして、 Pythonなどのプログラミング言語を使用してさらに分析または視覚化できます。JSONファイルの形式は次のとおりです。xy
[ { "predicted_aligned_error": [[0, 1, 4, 7, 9, ...], ...], 「max_predicted_aligned_error」:31.75 } ] JSONファイルでは、このフィールドにはpredicted_aligned_error各残基ペアのPAE値(最も近い整数に丸められた値)が、このフィールドにはmax_predicted_aligned_error最大PAE値(上限は31.75 Å)がそれぞれ格納されています。PAEの単位はオングストロームです。
PAEの3Dビューアは別途開発されており、より直感的な視覚化が可能となっている。[ 4 ]

PAE値の解釈により、科学者はタンパク質の予測構造に対する信頼度を理解することができます。異なるドメインの残基ペア間のPAE値が低いほど、モデルがそれらのドメインの明確な相対位置と配向を予測していることを示します。そのような残基ペアのPAE値が高い場合は、3D構造におけるこれらのドメインの相対位置および/または配向が不確実であり、解釈すべきではないことを示唆しています。[ 5 ]
PAEは貴重な情報を提供するものの、非対称であることに注意する必要がある。特に、方向が非常に不確実なループ領域間では、(x, y)のPAE値は(y, x)の値と異なる可能性がある。[ 6 ]さらに、AlphaFoldは有用なドメイン間予測を行うことができるが、 CASP14検証に基づくと、ドメイン内予測の精度の方が信頼性が高いと予想される。
単一のタンパク質鎖または複合体全体の場合、AlphaFold2 および AlphaFold3 は予測テンプレートモデリングスコアを計算します。これは、整列エラーの確率分布から算出されます。各残基(i=1,L)について、一度に1つずつ整列を行い、構造内のすべての残基についてTMスコア方程式の平均値を計算し、TM平均値の最大値を取ることによって計算されます。
両方そして構造内のすべての残基にわたる範囲、。は、無関係なタンパク質の構造サイズに対してTMスコアがほぼ平坦になるように調整されたスケーリングパラメータです(約0.15)[ 7 ] :
AlphaFold-Multimer は、(インターフェース予測テンプレートモデリングスコア)を使用して、タンパク質複合体の予測精度を評価します。名前とは裏腹に、界面残基だけでなく、鎖全体にわたって計算されます。
PAEは非対称であるため、非対称になる場合もあります。非対称スコアは、一方の鎖で一度に1つの残基をアラインメントし、もう一方の鎖のすべての残基の平均TMスコアを計算し、TM平均値の最大値を取ることによって計算されます。
AlphaFoldコードは、2つのタンパク質鎖の長さの合計としてLを計算し、として出力これは、両方の鎖におけるすべての可能な配置の中での最大値、つまり次のようになります。
多タンパク質複合体の場合、最大値はすべての鎖のすべての残基(セットC )について取られ、平均値は残基iと同じ鎖にないすべての残基jについて取られます。計算に使用されるLの値これは、複合体内のすべてのタンパク質の長さの合計です。
タンパク質複合体の他のいくつかの指標は、PAE マトリックス (または基礎となる確率分布) から導出されており、actifpTM [ 8 ]、pDockQ2 [ 9 ]、LIS [ 10 ]、ipSAE [ 11 ]などがある。後者のスコアは、秩序領域と無秩序領域に等しい重み付けをすることや、PAE をタンパク質システム全体のサイズでスケーリングすることなど、元の ipTM スコアのいくつかの欠点を考慮している[ 11 ]。