プロキシによる解像度(ResProx) は、 NMR由来のタンパク質構造の同等のX 線解像度を評価する方法です。ResProx は、電子密度やその他の実験入力ではなく、座標データから解像度を計算します。これにより、構造がどのように解決されたか ( X 線、NMR、EM、モデリング、ab initio 予測) に関係なく、構造の解像度を計算することが可能になります。ResProx は、もともと、 X 線構造の品質/解像度と特定のNMR構造の品質を直接比較できる、単純な単一数値評価として機能するように設計されました。しかし、実験的に報告されたX 線構造の解像度の信頼性を評価したり、従来とは異なる方法またはハイブリッドな方法で解決されたタンパク質構造を評価したり、PDB に登録された不正な構造を特定したりするためにも使用できます。[ 1 ] ResProx は、単一の解像度のような値を決定するために、25 を超える異なる構造的特徴を取り入れています。ResProx の値はオングストロームで報告されます。数千のX線構造に対するテストでは、ResProxの値がX線結晶学者によって報告された分解能値と非常に近いことが示されています。[ 1 ]新たに決定されたタンパク質構造については、無料でアクセスできるResProxウェブサーバーを使用して、代理分解能値を計算できます。 [ 1 ]このサーバーは、タンパク質の座標データ(PDB形式)を受け取り、その入力構造の分解能推定値(オングストローム単位)を生成します。
X線結晶構造解析において、分解能とは分子の電子密度マップの分解能または精度を表す尺度です。分解能は通常、X線結晶構造ではオングストローム(Å、10⁻¹⁰メートル)で表されます。数値が小さいほど、原子分解能が高くなります。タンパク質のX線結晶構造解析では、通常、最高分解能は約1Åです。このレベルの分解能により、個々の水素原子を可視化し、重原子(C、O、N)を非常に正確にマッピングすることができます。現在解明されているほとんどのタンパク質構造の分解能は1.5~2.5Åであり、これは水素原子が見えず、重原子の正確な位置に不確実性があることを意味します。 分解能が2.5Åを超えるタンパク質構造は、一般的に座標の不正確さやその他の構造上の問題を抱えています。分解能が3.5Åを超えると、原子の位置だけでなく、個々のアミノ酸残基の同一性にもかなりの不確実性が生じることがよくあります。言い換えれば、分解能は構造品質と反比例の関係にあります(つまり、数値が高いほど構造の質が低いことを意味します)。X線分解能におけるタンパク質構造品質のこの傾向は、 NMRで決定されたタンパク質構造の品質に見られる傾向と非常によく一致しています。一部のNMR構造は、多数の制約(NOE、水素結合、J結合、双極子結合)、優れた幾何学的構造、高い構造品質、および優れた原子精度(RMSD < 1 Å)を持つ非常にタイトなアンサンブルを備えています。他のNMR構造は、制約が非常に少なく、幾何学的構造または構造品質が悪く、非常に緩いアンサンブル(RMSD > 3 Å)を備えています。しかし、 NMR RMSD値とX線分解能値の間には単純な対応関係はありません。つまり、1 Å RMSDのNMRアンサンブルは、1 Å分解能のX線構造と品質または精度において対応しません。これは、RMSD値がアンサンブルで使用される構造の数と、構造アンサンブルを登録する分光学者の選択バイアスの両方の関数であるためです。同様に、 NMRでは、高品質で正確に決定されたタンパク質構造を生成することが可能です。比較的少数の、適切に選択された制約を用いることが重要です。しかし、多数の制約を不注意に評価したり、誤って割り当てたりすると、非常に低品質なNMR構造が生成されてしまう可能性もあります。
過去 20 年間、X 線 回折データではなくX 線座標データのみを使用して「等価分解能」を計算するいくつかの方法が提案されてきました。Procheck -NMR [ 2 ]のようにNMR構造の 評価に特化して設計されたものもあれば、MolProbity [ 3 ]や RosettaHoles2 [ 4 ]のようにX 線構造の構造品質評価と検証に特化して設計されたものもあります。しかし、これらの方法は、分解能を予測するために比較的少数のタンパク質構造品質尺度 (それぞれ 4、3、1 尺度) に依存しているため、観測された (X 線) 分解能と予測された分解能との相関はあまり良くありません。ねじれ角の分布、原子衝突の存在、水素結合の正常性、結合長と結合角の違反の数、空洞の存在、残基固有のパッキング体積、パッキング効率、およびスレッディングエネルギーを含むように構造特徴の数を拡張することで、この相関を大幅に改善することができます。
ResProx は、既知の X 線分解能を持つ 2400 個のタンパク質構造のセットで予測分解能と観測された X 線分解能との相関を最大化するためにサポート ベクター回帰法で使用される 25 種類の異なるタンパク質構造特徴 (ねじれ角分布、水素結合、パッキング ボリューム、空洞、モルプロビティ 尺度など) のコレクションを使用します。アルゴリズムの正確な詳細は、Wishart らが発表した論文に記載されています。[ 1 ]独立したテスト セットでのトレーニングと適切な検証の後、この SVR モデルは、相関係数 0.92、平均絶対誤差0.28 Å で解決されたX 線構造の分解能を推定できます。これは、既存の方法よりも約 15〜30% 優れています。これは図 1 に示されています。ResProx メソッドのパフォーマンスが非常に高く、同等のX 線分解能の推定値を生成するために座標データのみを必要とするため、 NMR構造に適用するのに最適です。 ResProxでNMR構造を解析すると、平均的なNMR構造のX線分解能は2.8Åと比較的低い値になります(図2)。これは、NMR構造の全体的な品質と精度に関する定性的な観察結果と一致しています。図2に示すように、 1.0Å未満の分解能を示すNMR構造はごく少数ですが、そのような構造はまれです。
図1.トレーニングデータおよびテストデータに対するResProxの性能。
図2. NMRモデルのResProx等価分解能とX線構造の実験分解能のヒストグラム。PDBから500個のNMRアンサンブルと500個のX線構造をランダムに選択した。タンパク質は0.25Å分解能のビンに分類した。X軸の分解能値は、各分解能ビンの上限値を示す。NMR構造とX線構造の値は、各分解能ビンに含まれる構造の数を表す。
ResProxウェブサーバーは、NMRタンパク質座標データ(PDB形式)を受け取り、そのNMR構造の分解能推定値(オングストローム単位)を生成する、無料でアクセスできるサーバーです。ResProxのダウンロード版も利用可能です。ResProxは、 PDB識別子と観測分解能、および対応するResProx値を持つ50834個のタンパク質構造のリストも提供します。