計算生物学において、de novoタンパク質構造予測とは、アミノ酸一次配列からタンパク質の三次構造を予測するアルゴリズム的プロセスを指します。この問題自体は、数十年にわたり一流の科学者を悩ませてきましたが、未だ解決されていません。Science誌によると、この問題は現代科学における上位125の未解決問題の1つです。[ 1 ]現在、最も成功している方法のいくつかは、小さな単一ドメインタンパク質の折り畳みを構造全体で1.5オングストローム以内の精度で予測できる合理的な確率を持っています。[ 2 ]
ウィリアム・デグラードが最初に提唱した用語であるデノボ法[ 3 ]は、膨大な計算リソースを必要とする傾向があり、そのため比較的小さなタンパク質に対してのみ実施されてきた。デノボタンパク質構造モデリングは、テンプレートベースモデリング(TBM)とは異なり、対象となるタンパク質の既知の相同タンパク質を使用しないため、アミノ酸配列からタンパク質構造を予測することは非常に困難である。より大きなタンパク質のデノボタンパク質構造予測には、より優れたアルゴリズムと、強力なスーパーコンピュータ(Blue GeneやMDGRAPE-3など)または分散コンピューティングプロジェクト(Folding@home、Rosetta@home、Human Proteome Folding Project、Nutritious Rice for the Worldなど)によって提供されるような、より大きな計算リソースが必要となる。計算上の障壁は大きいものの、構造ゲノミクス(予測法または実験法による)が医学や創薬などの分野にもたらす潜在的なメリットにより、デノボ構造予測は活発な研究分野となっている。
現在、既知のタンパク質配列と確認されたタンパク質構造の間には大きなギャップが存在する。2008年初頭の時点で、UniProtKBデータベースに登録されている配列のうち、タンパク質データバンク(PDB)の構造に対応していたのはわずか約1%であり、配列と構造の間には約500万のギャップが残っていた。[ 4 ]三次構造を決定するための実験的手法は、特定のタンパク質の構造を決定する能力において深刻なボトルネックに直面している。例えば、X線結晶構造解析は、約8万個の細胞質タンパク質の結晶化に成功しているが、膜タンパク質の結晶化にははるかに成功しておらず、約280個にとどまっている。 [ 5 ]実験上の制約を考慮すると、既知の配列と構造の間のギャップを埋めるための効率的なコンピュータプログラムを考案することが、唯一実現可能な選択肢であると考えられている。[ 5 ]
新規タンパク質構造予測法は、明示的なテンプレートを使用せずに、タンパク質の折り畳みエネルギーを支配する一般原則や、天然構造が獲得する立体構造的特徴の統計的傾向に基づいて、配列から三次構造を予測しようとするものです。新規構造予測の研究は、主に次の3つの分野に集中しています。タンパク質の代替的な低解像度表現、正確なエネルギー関数、および効率的なサンプリング方法。
新規予測の一般的なパラダイムは、スコアリング関数やその他の配列依存バイアスによって誘導されるコンフォメーション空間のサンプリングを含み、多数の候補(「デコイ」)構造が生成されます。次に、スコアリング関数とコンフォーマークラスタリングを使用して、これらのデコイからネイティブ様コンフォメーションが選択されます。高解像度リファインメントは、ネイティブ様構造を微調整するための最終ステップとして使用されることがあります。スコアリング関数には大きく分けて2つのクラスがあります。物理ベースの関数は、分子間相互作用の既知の物理の側面を記述する数学モデルに基づいています。知識ベースの関数は、ネイティブタンパク質コンフォメーションの特性の側面を捉える統計モデルで形成されます。[ 6 ]
タンパク質の一次配列には、タンパク質全体の三次元構造に必要なすべての情報が含まれており、de novoタンパク質予測が可能であるという考え方を支持する証拠がいくつか提示されている。第一に、異なる機能を持つタンパク質は通常、異なるアミノ酸配列を持つ。第二に、デュシェンヌ型筋ジストロフィーなど、いくつかの異なるヒト疾患は、一次配列中のたった1つのアミノ酸の変化によって生じるタンパク質機能の喪失と関連付けられる。第三に、多くの異なる種で類似した機能を持つタンパク質は、しばしば類似したアミノ酸配列を持つ。例えば、ユビキチンは他のタンパク質の分解を調節するタンパク質であり、そのアミノ酸配列は、ショウジョウバエとヒトのように遠く離れた種でもほぼ同一である。第四に、思考実験によって、タンパク質の折り畳みは完全にランダムなプロセスではなく、折り畳みに必要な情報は一次構造内にコード化されているに違いないと推論できる。例えば、小さなポリペプチド鎖内の100個のアミノ酸残基それぞれが平均して10種類の異なる立体配座をとると仮定すると、ポリペプチド鎖全体では10^100種類の異なる立体配座が存在することになります。10^-13秒ごとに1つの立体配座をテストすると仮定すると、すべての立体配座を網羅するには約10^77年かかることになります。しかし、タンパク質は体内で常に短い時間スケールで適切に折り畳まれているため、その過程はランダムではなく、モデル化できる可能性があります。
タンパク質の三次構造をコード化するために必要なすべての関連情報が一次配列に含まれているという仮説を裏付ける最も強力な証拠の一つは、1950年代にクリスチャン・アンフィンセンによって実証された。彼は古典的な実験で、リボヌクレアーゼAを還元剤(安定化ジスルフィド結合を切断するため)の存在下で尿素溶液(安定化疎水性結合を破壊するため)に浸漬することで完全に変性させることができることを示した。この環境からタンパク質を取り出すと、変性して機能を失ったリボヌクレアーゼタンパク質は自発的に縮合して機能を回復し、タンパク質の三次構造が一次アミノ酸配列にコード化されていることを示した。もしタンパク質がランダムに再形成されていたとしたら、4つのジスルフィド結合の100種類以上の異なる組み合わせが形成された可能性がある。しかし、ほとんどの場合、タンパク質は細胞内で適切に折り畳まれるために分子シャペロンの存在を必要とする。タンパク質の全体的な形状はアミノ酸構造にコード化されているかもしれないが、その折り畳みは折り畳みを助けるシャペロンに依存する可能性がある。[ 7 ]
![ヒトアルテミンの一次構造(アイソフォーム1 [UniParc])](https://img-server.japedia.wiki/wikipedia/commons/4/48/Artemin_Primary_Structure.png)

デノボ立体配座予測ツールは通常、候補となる立体配座(デコイ)を生成し、それらの熱力学的安定性とエネルギー状態に基づいて選択することで機能します。最も成功する予測ツールには、次の3つの共通点があります。
1) タンパク質の天然構造に最も熱力学的に安定な状態を対応させる、正確なエネルギー関数
2) 構造探索によって低エネルギー状態を迅速に特定できる効率的な探索方法
3) デコイ構造のコレクションからネイティブのようなモデルを選択する能力[ 4 ]
デノボプログラムは3次元空間を探索し、その過程で候補となるタンパク質構造を生成します。タンパク質が正しく折り畳まれた天然の状態に近づくにつれて、エントロピーと自由エネルギーは減少します。この情報を使用して、デノボ予測器はデコイを区別することができます。具体的には、デノボプログラムは自由エネルギーが低い可能性のある構造を選択します。これは、自由エネルギーが高い構造よりも正しい可能性が高いです。[ 2 ] [ 7 ] [ 8 ]デビッド A. ベイカーが自身のデノボ Rosetta 予測器の動作について述べたように、「折り畳み中、鎖の各局所セグメントは、異なる局所構造のサブセット間で点滅します...局所セグメントが採用する構造とそれらの相対的な向きが...天然タンパク質構造の低エネルギー特性を可能にするときに、天然構造への折り畳みが起こります。Rosetta アルゴリズムでは...プログラムは、全体的なエネルギーが最も低いこれらの局所構造の組み合わせを探索します。」[ 9 ]
しかし、一部のde novo法は、タンパク質構造の簡略化された表現を使用してまずコンフォメーション空間全体を列挙し、次に天然に近い可能性が最も高いものを選択することによって機能します。このアプローチの一例として、四面体格子を使用してタンパク質の折り畳みを表現し、四面体表現を使用して得られたすべての可能なコンフォメーションの上にすべての原子モデルを構築する方法があります。このアプローチは、CASP3でマイケル・レビットのチームによって、これまでトポロジーが観察されていなかったタンパク質の折り畳みを予測するために成功裏に使用されました。 [ 10 ]
XuとZhangはQUARKプログラムを開発することで、知識ベースの力場を通していくつかのタンパク質のab initio構造を首尾よく構築できることを示した。[ 11 ] [ 12 ]

既知の三次構造を持つタンパク質が、構造が未確定の相同タンパク質と少なくとも30%の配列を共有している場合、未知の構造候補を既知の構造に重ね合わせる比較手法を用いて、未知のタンパク質の構造を予測することができる。しかし、この閾値を下回る場合は、初期モデルから可能な構造を決定するために、他の3つの戦略(タンパク質の第一原理予測、フォールド認識、スレッディング)が用いられる。
フォールド戦略とスレッディング戦略の両方の目標は、未知のタンパク質のフォールドが、タンパク質データバンク(PDB)などのデータベースに登録されている既知のタンパク質のドメインと類似しているかどうかを確認することです。これは、タンパク質のフォールドをデータベース内の構造と比較する代わりに、物理ベースのアプローチを使用して構造を決定するde novo(ab initio)法とは対照的です。[ 13 ]
新規タンパク質予測法の大きな制約は、タンパク質の天然構造を正確に解くために必要なコンピュータ時間が膨大であることです。Rosetta@home などの分散型手法は、個人を募り、その人が空いている自宅のコンピュータ時間をデータ処理にボランティアとして提供することで、この問題を改善しようと試みてきました。しかし、これらの手法にも課題があります。たとえば、ワシントン大学とハワード・ヒューズ医学研究所の研究チームは、分散型手法を用いて、アミノ酸配列からタンパク質 T0283 の三次構造を予測しました。この分散型手法の精度を、タンパク質データバンク (PDB) に登録されている実験的に確認された構造と比較するブラインドテストでは、予測器は登録された構造と非常によく一致しました。しかし、この偉業に必要な時間とコンピュータの数は膨大で、それぞれ約 2 年と約 70,000 台の家庭用コンピュータが必要でした。[ 14 ]
このような制限を克服するために提案されている方法の1つは、マルコフモデルの使用です(マルコフ連鎖モンテカルロを参照)。このようなモデルは、おそらく計算シミュレーションを改良することによって、自由エネルギー計算とタンパク質構造予測を支援するために構築される可能性があります。[ 15 ]計算能力の制限を回避するもう1つの方法は、粗視化モデリングを使用することです。粗視化タンパク質モデルは、短い計算時間で小さなタンパク質または大きなタンパク質断片のde novo構造予測を可能にします。[ 16 ]
タンパク質構造予測ソフトウェアのもう 1 つの制限は、特定の種類のタンパク質、すなわちde novoタンパク質に関するものです。AlphaFold などの構造予測ソフトウェアは、多重配列アライメント (MSA)および相同タンパク質配列から得られる共進化データに依存してタンパク質の構造を予測します。しかし、定義上、de novoタンパク質は進化的に新しいため、相同配列がありません。[ 17 ]したがって、このような相同性に依存する構造予測ソフトウェアは、 de novoタンパク質の構造予測において性能が低いことが予想されます。[ 18 ] de novoタンパク質の構造予測の精度を向上させるために、新しいソフトウェアが開発されました。具体的には、ESMFold は、アミノ酸配列のみに基づいてタンパク質構造を予測するための新しく開発された大規模言語モデル (LLM) です。単一のアミノ酸配列を入力するだけで、原子レベルの解像度でタンパク質の 3D 構造を予測できます。[ 19 ]

「計算によるタンパク質構造予測手法のあらゆるバリアントの進歩は、年2回開催されるコミュニティ全体のタンパク質構造予測の重要評価(CASP)実験で評価されます。CASP実験では、研究グループは、天然構造がまだ知られていないが、近いうちに決定され発表される予定のアミノ酸配列に予測手法を適用するよう招待されます。CASP実験で提供されるアミノ酸配列の数は少ないものの、これらの競争は、おそらく偏りのない方法で、この分野の手法と進歩をベンチマークするための良い指標となります。」[ 20 ]