タンパク質の構造と用語 タンパク質は、ペプチド結合 によって連結されたアミノ酸 の鎖である。この鎖は、Cα原子における2つのねじれ角φとψを中心とした主鎖の回転によって、多様な立体構造をとることができる。この立体構造の柔軟性 が、タンパク質の三次元構造の多様性を生み出している。
立体構造の柔軟性によってタンパク質が動き、ここではリボソームが 生物学的機械 のようにDNA を翻訳する様子が観察される。このようなタンパク質ドメインの動態は、 中性子スピンエコー 分光法によって観察することができる。 鎖中のペプチド結合は極性があり、つまりカルボニル基 には水素結合受容体として、NH基には水素結合供与体として、それぞれ正と負の電荷(部分電荷)が分離しています。したがって、これらの基はタンパク質構造内で相互作用することができます。タンパク質は主に20種類のL-α-アミノ酸(タンパク質構成アミノ酸 )から構成されています。これらは側鎖の化学に基づいて分類することができ、側鎖も重要な構造的役割を果たします。グリシンは 側鎖が最も小さく、水素原子が1つしかないため、タンパク質構造の局所的な柔軟性を高めることができるという特別な位置を占めています。一方、システインは 別のシステイン残基と反応して1つのシスチン を形成し、それによって構造全体を安定化させる架橋を形成することができます。
タンパク質の構造は、 αヘリックス やβシート などの二次構造要素の配列から生じる。二次構造では、空間的に隣接するアミノ酸の主鎖NH基とCO基の間に規則的な水素結合パターンが形成され、アミノ酸は類似したΦ角とψ角を 持つ。[ 1 ]
タンパク質主鎖のねじれ角φとψ これらの二次構造の形成は、ペプチド結合の水素結合能力を効率的に満たします。二次構造は疎水性環境のタンパク質コアに密に詰め込まれることもありますが、極性タンパク質表面にも存在し得ます。各アミノ酸側鎖は、占める体積が限られており、他の近傍側鎖との相互作用の数も限られているため、分子モデリングやアライメントではこの状況を考慮する必要があります。[ 2 ] [ 3 ]
αヘリックス水素結合(黄色の点)を持つαヘリックス αヘリックスは、タンパク質において最も多く存在する二次構造です。αヘリックスは1回転あたり3.6個のアミノ酸からなり、4個ごとに1つのアミノ酸残基間に水素結合が形成されます。平均長さは10個のアミノ酸(3回転)または10Åですが 、5~40個(1.5~11回転)まで変化します。水素結合の配列により、ヘリックスに双極子モーメントが生じ、ヘリックスのアミノ末端に部分的な正電荷が発生します。この領域には遊離のNH2基が存在するため、 リン酸基などの負電荷を持つ基と相互作用します。αヘリックスの最も一般的な位置は、タンパク質コアの表面であり、そこで水性環境との界面を形成します。ヘリックスの内側には疎水性アミノ酸が、外側には親水性アミノ酸が存在する傾向があります。したがって、鎖に沿って4個のアミノ酸のうち3個ごとに疎水性アミノ酸が存在する傾向があり、このパターンは容易に検出できます。ロイシンジッパーモチーフでは、隣接する2つのヘリックスの向かい合う側のロイシンの繰り返しパターンがモチーフを強く予測します。この繰り返しパターンは、ヘリカルホイールプロットで示すことができます。タンパク質コアや細胞膜に埋もれている他のαヘリックスは、疎水性アミノ酸の分布がより高く、より規則的であり、このような構造を強く予測します。表面に露出しているヘリックスは、疎水性アミノ酸の割合が低くなっています。アミノ酸含有量は、αヘリックス領域を予測することができます。アラニン (A)、グルタミン酸 (E)、ロイシン (L)、メチオニン (M)が豊富で、プロリン (P)、グリシン (G)、チロシン (Y)、セリン (S)が少ない領域は、αヘリックスを形成する傾向があります。プロリンはαヘリックスを不安定化または破壊しますが、より長いヘリックスに存在して屈曲を形成することがあります。
βシートβシートは、鎖の一方の部分にある平均5~10個の連続するアミノ酸と、鎖のさらに下流にある別の5~10個のアミノ酸との間の水素結合によって形成されます。相互作用する領域は、短いループを挟んで隣接している場合もあれば、他の構造を挟んで離れている場合もあります。すべての鎖が同じ方向に走って平行シートを形成する場合もあれば、逆方向に走って逆平行シートを形成する場合もあり、また、鎖が混合シートを形成する場合もあります。水素結合のパターンは、平行配置と逆平行配置で異なります。シートの内側の鎖にある各アミノ酸は、隣接するアミノ酸と2つの水素結合を形成しますが、外側の鎖にある各アミノ酸は、内側の鎖と1つの結合のみを形成します。シートを鎖に対して直角に横切ると、より遠い鎖はわずかに反時計回りに回転して左巻きのねじれを形成します。Cα原子はプリーツ構造でシートの上と下に交互に配置され、アミノ酸のR側鎖はプリーツの上と下に交互に配置されます。ラマチャンドランプロット のある領域では、シート中のアミノ酸のΦ角とΨ角が大きく変化する。βシートの位置を予測するのは、αヘリックスの位置を予測するよりも難しい。多重配列アラインメントにおけるアミノ酸の多様性を考慮に入れると、状況はいくらか改善される。
デルタ タンパク質の一部は、規則的な構造を持たない固定された三次元構造を持つ場合があります。これらは、無秩序または折り畳まれていない タンパク質セグメントや、固定された三次元構造を持たない折り畳まれていないポリペプチド鎖であるランダムコイルと 混同してはなりません。これらの部分は、βシートとαヘリックスをつなぐことから、 「デルタ 」(Δ )と呼ばれることがよくあります。デルタは通常、タンパク質の表面に位置しているため、その残基の変異はより容易に許容されます。配列アライメントの特定の領域に置換、挿入、および欠失が多い場合は、デルタの存在を示している可能性があります。ゲノムDNAのイントロン の位置は、コードされたタンパク質のループの位置と相関している可能性があります。デルタはまた、荷電アミノ酸と極性アミノ酸を持つ傾向があり、活性部位の構成要素となることがよくあります。
タンパク質の分類 タンパク質は、構造的類似性と配列類似性の両方に基づいて分類できます。構造的分類では、前述の段落で説明した二次構造のサイズと空間配置を、既知の三次元構造で比較します。配列類似性に基づく分類は、歴史的に最初に用いられた分類法です。当初は、全配列のアライメントに基づく類似性が評価されました。その後、保存されたアミノ酸パターンの出現に基づいてタンパク質が分類されるようになりました。これらの分類法の1つ以上でタンパク質を分類するデータベース が利用可能です。タンパク質の分類法を検討する際には、いくつかの点に留意することが重要です。まず、異なる進化起源を持つ2つの全く異なるタンパク質配列が、類似した構造に折り畳まれることがあります。逆に、特定の構造の古代遺伝子の配列は、異なる種で大きく分岐しながらも、同じ基本的な構造的特徴を維持している場合があります。このような場合、残存する配列類似性を認識することは非常に困難な作業となる可能性があります。次に、互いに、または3番目の配列と有意な配列類似性を共有する2つのタンパク質は、進化起源も共有しており、構造的特徴も共有しているはずです。しかし、進化の過程での遺伝子重複や遺伝子再編成によって新たな遺伝子コピーが生じ、それが新たな機能や構造を持つタンパク質へと進化する可能性がある。[ 2 ]
タンパク質の構造と配列を分類するために使用される用語 タンパク質の進化および構造的関係を表すために一般的に用いられる用語を以下に示します。タンパク質に見られる様々な構造的特徴を表すために、他にも多くの用語が用いられています。これらの用語の説明は、CATHウェブサイト、タンパク質の構造分類 (SCOP)ウェブサイト、およびスイスのバイオインフォマティクスExpasyウェブサイトにあるGlaxo Wellcomeのチュートリアルで確認できます。
アクティブサイト 活性部位とは、三次構造(三次元構造)または四次構造(タンパク質サブユニット構造)内のアミノ酸側鎖が局所的に結合した部位であり、特定の化学基質と相互作用することで、タンパク質に生物学的活性を与える。アミノ酸配列が大きく異なるタンパク質でも、同じ活性部位を持つ構造に折り畳まれることがある。 建築 これは、類似のループ構造を共有しているかどうかに関係なく、三次元構造における二次構造の相対的な向きを表すものです。 折り畳み(トポロジー) 保存ループ構造を持つタイプのアーキテクチャ。 ブロック は、タンパク質ファミリーにおける保存されたアミノ酸配列パターンです。このパターンには、表現された配列の各位置における一連の可能な一致が含まれますが、パターンまたは配列には挿入または欠失した位置はありません。対照的に、配列プロファイルは、挿入と欠失を含む同様のパターンセットを表すスコアリングマトリックスの一種です。 クラス タンパク質ドメインを二次構造の内容と組織に基づいて分類するために使用される用語。LevittとChothia(1976)によって最初に4つのクラス が認識され、SCOPデータベースにはさらにいくつかのクラスが追加されている。CATHデータベースには、主にα、主にβ、およびα–βの3つのクラスが示されており、α–βクラスには、交互にα/β構造とα+β構造の両方が含まれる。 コア 折り畳まれたタンパク質分子のうち、αヘリックスとβシートの疎水性内部を構成する部分。このコンパクトな構造により、アミノ酸の側鎖が十分に近接し、相互作用が可能となる。SCOPデータベースのようにタンパク質構造を比較する場合、コアとは、共通の折り畳み構造を持つ、あるいは同じスーパーファミリーに属する構造のほとんどに共通する領域を指す。構造予測においては、コアは進化の過程で保存される可能性が高い二次構造の配置として定義されることもある。 ドメイン (配列コンテキスト)ポリペプチド鎖のうち、他の鎖部分の存在に関わらず三次元構造に折り畳むことができる部分。特定のタンパク質の個々のドメインは、広範囲に相互作用する場合もあれば、ポリペプチド鎖の一部によってのみ結合されている場合もある。複数のドメインを持つタンパク質は、これらのドメインを異なる分子との機能的な相互作用に利用する可能性がある。 ファミリー (シーケンスコンテキスト)配列をアラインメントしたときに 50% 以上の同一性を示す、類似した生化学的機能を持つタンパク質のグループ。この同じカットオフは、タンパク質情報リソース (PIR) でも引き続き使用されています。タンパク質ファミリーは、異なる生物で同じ機能を持つタンパク質 (オルソロガス配列) で構成されますが、遺伝子重複や再編成によって生じた、同じ生物内のタンパク質 (パラロガス配列) も含まれる場合があります。タンパク質ファミリーの多重配列アラインメントで、タンパク質の長さ全体にわたって共通の類似性が明らかになった場合、PIR はそのファミリーをホメオモルフィックファミリーと呼びます。アラインメントされた領域はホメオモルフィックドメインと呼ばれ、この領域は他のファミリーと共有されるいくつかの小さな相同性ドメインで構成される場合があります。ファミリーは、配列類似性の高低レベルに基づいて、さらにサブファミリーに細分化したり、スーパーファミリーにグループ化したりできます。SCOP データベースには 1296 ファミリーが、CATH データベース (バージョン 1.7 beta) には 1846 ファミリーが報告されています。 同じ機能を持つタンパク質の配列をより詳細に調べると、高い配列類似性を示すものがあることがわかります。これらは明らかに上記の基準から同じファミリーのメンバーです。しかし、他のファミリーメンバーとの配列類似性が非常に低い、あるいはほとんどないものもあります。このような場合、2つの遠縁のファミリーメンバーAとCの間のファミリー関係は、AとCの両方と有意な類似性を示す追加のファミリーメンバーBを見つけることで証明できることがよくあります。したがって、BはAとCをつなぐ役割を果たします。別の方法としては、遠縁の配列アライメントを調べて、高度に保存された一致を探す方法があります。 相同性が50%の場合、タンパク質は同じ三次元構造を持つ可能性が高く、配列アライメントで同一となる原子は、構造モデルにおいても約1Å以内で重なり合います。したがって、あるファミリーのメンバーの構造が分かっていれば、そのファミリーの別のメンバーの構造を高い精度で予測できます。相同性が高いほど、予測の信頼性も高まります。タンパク質の構造モデリングは、アミノ酸置換が三次元構造のコア部分にどの程度適合するかを調べることで実行できます。 家族(構造的文脈) FSSPデータベース(構造的に類似したタンパク質のファミリー )およびDALI/FSSP Webサイトで使用されているように、構造的に有意な類似性を持つが、必ずしも有意な配列類似性を持つとは限らない2つの構造。 折り畳み 構造モチーフと同様に、同じ構成の二次構造単位のより大きな組み合わせを含みます。したがって、同じフォールドを共有するタンパク質は、類似のループで連結された同じ二次構造の組み合わせを持ちます。例としては、複数の交互に配置されたαヘリックスと平行なβストランドからなるロスマンフォールドがあります。SCOP、CATH、およびFSSPデータベースでは、既知のタンパク質構造は、フォールドを基本分類レベルとして、構造的複雑性の階層レベルに分類されています。 相同ドメイン(配列コンテキスト) 配列アライメント法によって一般的に発見される、アライメントされた配列間の共通の進化起源を示す拡張配列パターン。相同ドメインは一般的にモチーフよりも長い。ドメインは、特定のタンパク質配列全体を含む場合もあれば、配列の一部のみを含む場合もある。ドメインの中には複雑なものもあり、進化の過程で結合してより大きなドメインを形成した、いくつかの小さな相同ドメインから構成されている。配列全体をカバーするドメインは、PIR(Protein Information Resource )では同型ドメインと呼ばれている。 モジュール 保存されたアミノ酸パターンからなる領域で、1つ以上のモチーフを含み、構造または機能の基本単位と考えられている。モジュールの存在は、タンパク質をファミリーに分類する際にも用いられる。 モチーフ (配列コンテキスト)2つ以上のタンパク質に見られる保存されたアミノ酸パターン。Prositeカタログでは、 モチーフは類似した生化学的活性を持つタンパク質のグループに見られるアミノ酸パターンであり、多くの場合、タンパク質の活性部位の近くにある。配列モチーフデータベースの例としては、PrositeカタログとStanford Motifs Databaseがある。[ 4 ] モチーフ(構造的文脈) ポリペプチド鎖の隣接する部分が折り畳まれて特定の三次元構造を形成することによって生じる、複数の二次構造要素の組み合わせ。例としては、ヘリックス・ループ・ヘリックスモチーフが挙げられる。構造モチーフは、超二次構造や折り畳み構造とも呼ばれる。 位置特異的スコアリングマトリックス (シーケンスコンテキスト、重みまたはスコアリングマトリックスとも呼ばれる)これは、ギャップのない多重配列アライメントにおける保存領域を表します。各行列列は、多重配列アライメントの1列に見られる変異を表します。 位置別スコアリングマトリックス — 3D(構造的コンテキスト)これは、同じ構造クラスに属するタンパク質の配列において見られるアミノ酸の変異を表します。行列の列は、配列された構造における1つのアミノ酸位置で見られるアミノ酸の変異を表します。 主要構造 タンパク質の直線状のアミノ酸配列であり、化学的にはペプチド結合によって結合されたアミノ酸からなるポリペプチド鎖である。 プロファイル(シーケンスコンテキスト) タンパク質ファミリーの多重配列アライメントを表すスコアリングマトリックス。プロファイルは通常、多重配列アライメントのよく保存された領域から取得されます。プロファイルはマトリックスの形式で、各列はアライメント内の位置を表し、各行はアミノ酸の1つを表します。マトリックスの値は、アライメント内の対応する位置における各アミノ酸の尤度を示します。プロファイルは、動的計画法アルゴリズムによってターゲット配列に沿って移動され、最もスコアの高い領域が特定されます。マッチング中にギャップが許容され、この場合、アミノ酸が一致しない場合は負のスコアとしてギャップペナルティが含まれます。配列プロファイルは、プロファイルHMMと呼ばれる隠れマルコフモデル によって表現することもできます。 プロファイル(構造的文脈) 既知のタンパク質構造における連続した位置において、どのアミノ酸が適合し、どのアミノ酸が適合しないかを示すスコアリングマトリックス。プロファイル列は構造内の連続した位置を表し、プロファイル行は20種類のアミノ酸を表す。配列プロファイルと同様に、構造プロファイルは動的計画法アルゴリズムによってターゲット配列に沿って移動され、可能な限り高いアライメントスコアが求められる。ギャップが含まれる場合があり、その場合はペナルティが課される。得られたスコアは、ターゲットタンパク質がそのような構造をとる可能性があるかどうかを示す指標となる。 四次構造 複数の独立したポリペプチド鎖から構成されるタンパク質分子の三次元構造。 二次構造 ポリペプチド鎖中のアミノ酸のC、O、NH基の間で起こる相互作用により、αヘリックス、βシート、ターン、ループなどの構造が形成され、三次元構造への折り畳みが促進される。 スーパーファミリー 同じ長さまたは異なる長さのタンパク質ファミリーのグループで、遠く離れているが検出可能な配列類似性によって関連付けられている。したがって、特定のスーパーファミリー のメンバーは共通の進化起源を持つ。元々、Dayhoffは、配列が関連していない確率が10⁶未満であることをスーパーファミリーのステータスのカットオフとして定義した(Dayhoff et al. 1978)。配列のアライメントで同一性が少ないが、構造的および機能的特徴が十分に共通しているタンパク質は、同じスーパーファミリーに分類される。三次元構造レベルでは、スーパーファミリーのタンパク質は共通のフォールドなどの共通の構造的特徴を共有するが、二次構造の数と配置に違いがある場合もある。PIRリソースでは、ホメオモルフィックスーパーファミリー という用語を使用して、アライメント全体に広がる類似領域である単一の配列相同ドメインの共有を表す、端から端までアライメントできる配列で構成されるスーパーファミリーを指す。このドメインは、他のタンパク質ファミリーやスーパーファミリーと共有されるより小さな相同ドメインを含む場合もある。あるタンパク質配列は複数のスーパーファミリーに属するドメインを含む場合があり、複雑な進化の歴史を示唆するものの、配列は多重配列アライメント全体における類似性に基づいて、同型スーパーファミリーにのみ割り当てられる。スーパーファミリーのアライメントには、アライメント内またはアライメントの両端でアライメントされない領域が含まれる場合もある。対照的に、同じファミリーに属する配列は、アライメント全体を通して良好にアライメントされる。 超二次構造 構造モチーフと似た意味を持つ用語。三次構造とは、ポリペプチド鎖の二次構造がパッキングまたは折り畳まれて形成される三次元または球状構造のことである。[ 2 ]
三次構造 タンパク質構造予測の実際的な役割は、これまで以上に重要になっています。[ 30 ] ヒトゲノムプロジェクト などの現代の大規模DNA シーケンスの取り組みにより、膨大な量のタンパク質配列データが生成されています。構造ゲノミクス におけるコミュニティ全体の取り組みにもかかわらず、実験的に決定されたタンパク質構造(通常は時間のかかる比較的高価なX線結晶構造解析 またはNMR分光法 による)の出力は、タンパク質配列の出力に大きく遅れています。
タンパク質構造予測は、依然として極めて困難で未解決の課題である。主な問題は、タンパク質の自由エネルギー の計算と、このエネルギーのグローバル最小値の探索である。タンパク質構造予測法は、 天文学的に大きな 可能なタンパク質構造の空間を探索する必要がある。これらの問題は、「比較」または相同性モデリング およびフォールド認識 法では部分的に回避できる。これらの方法では、問題のタンパク質が、別の相同タンパク質の実験的に決定された構造に近い構造をとるという仮定によって探索空間が剪定される。対照的に、de novoタンパク質構造予測 法は、これらの問題を明示的に解決する必要がある。タンパク質構造予測の進歩と課題については、Zhangによってレビューされている。[ 31 ]
モデリングを行う前に Rosetta などのほとんどの三次構造モデリング手法は、単一のタンパク質ドメインの三次構造をモデリングするように最適化されています。通常、最初にドメイン解析 またはドメイン境界予測 と呼ばれるステップを実行して、タンパク質を潜在的な構造ドメインに分割します。三次構造予測の他の部分と同様に、これは既知の構造から比較して実行することも[ 32 ] 、配列のみを使用してab initioで実行することもできます (通常は共変動によって支援される 機械学習 によって)。[ 33 ] 個々のドメインの構造は、ドメインアセンブリ と呼ばれるプロセスでドッキングされ、最終的な三次構造を形成します。[ 34 ] [ 35 ]
第一原理 タンパク質モデリング
1990年代にシーケンシングがより一般的になると、いくつかのグループがタンパク質配列アライメントを使用して相関変異を 予測し、これらの共進化残基を使用して三次構造を予測できることが期待されました(NMR などの実験手順からの距離制約との類似性を使用)。単一の残基変異がわずかに有害である場合、残基間の相互作用を再安定化するために補償変異が発生する可能性があるという仮定です。この初期の研究では、タンパク質配列から相関変異を計算するために局所 法として知られるものを使用しましたが、各残基ペアを他のすべてのペアから独立していると扱うことによって生じる間接的な偽相関に悩まされました。[ 40 ] [ 41 ] [ 42 ]
2011年に、今回はグローバルな 統計的手法を用いて、十分な配列(1,000を超える相同配列が必要)があれば、予測された共進化残基でタンパク質の3Dフォールドを予測できることが実証されました。[ 43 ] この手法EVfoldは、相同性モデリング、スレッディング、3D構造フラグメントを使用せず、数百残基のタンパク質でも標準的なパーソナルコンピュータで実行できます。この手法および関連手法を用いて予測された接触の精度は、実験的に未解決の膜貫通タンパク質の予測を含め、多くの既知の構造および接触マップで実証されています。[ 44 ] [ 45 ] [ 46 ] [ 47 ]
比較タンパク質モデリング 比較タンパク質モデリングでは、既に解明された構造を起点またはテンプレートとして使用します。これは、実際のタンパク質の数は膨大であるにもかかわらず、ほとんどのタンパク質が属する限られた数の三次 構造モチーフ が存在するため効果的です。自然界には数百万もの異なるタンパク質が存在するにもかかわらず、約2,000種類の異なるタンパク質フォールドしか存在しないことが示唆されています。比較タンパク質モデリングは、構造予測における進化的共変動と組み合わせることができます。[ 48 ]
これらの方法は、2 つのグループに分けられることもあります。[ 31 ]
相同性モデリングは、2 つの 相同 タンパク質が非常に類似した構造を共有するという妥当な仮定に基づいています。タンパク質の折り畳みはアミノ酸配列よりも進化的に保存されているため、ターゲットとテンプレートの関係が配列アライメント によって識別できる場合、ターゲット配列を非常に遠縁のテンプレート上で妥当な精度でモデル化できます。比較モデリングにおける主なボトルネックは、既知の良好なアライメントが与えられた場合の構造予測のエラーではなく、アライメントの困難さから生じると示唆されています。[ 49 ] 当然のことながら、相同性モデリングは、ターゲットとテンプレートが類似した配列を持つ場合に最も正確です。タンパク質スレッディング [ 50 ] は、未知の構造のアミノ酸配列を、既知の構造のデータベースと照合します。各ケースにおいて、スコアリング関数 を用いて配列と構造の適合性を評価し、可能な3次元モデルを生成します。このタイプの方法は、3次元構造と線状タンパク質配列間の適合性解析を行うことから、3D-1Dフォールド認識とも呼ばれています。この方法から、与えられた構造と大規模な配列データベースとの適合性を評価し、特定のフォールドを生成する可能性のある配列を予測する 、逆フォールド探索を 行う方法も生まれました。
アミノ酸側鎖 の正確なパッキングは、タンパク質構造予測における別の課題である。側鎖の幾何学的形状を予測する問題に特化した手法としては、デッドエンド除去法 や自己無撞着平均場法などが挙げられる。エネルギーの低い側鎖コンフォメーションは、通常、剛体ポリペプチド主鎖上で、「 回転異性体 」と呼ばれる一連の離散的な側鎖コンフォメーションを用いて決定される。これらの手法は、モデル全体のエネルギーを最小化する回転異性体のセットを特定しようとするものである。
これらの方法では、タンパク質の各残基タイプに好ましい立体配座のコレクションである回転異性体ライブラリを使用します。回転異性体ライブラリには、立体配座、その頻度、および平均二面角の標準偏差に関する情報が含まれている場合があり、これらはサンプリングに使用できます。[ 51 ] 回転異性体ライブラリは、構造バイオインフォマティクス またはタンパク質の既知の実験構造における側鎖立体配座のその他の統計分析から派生しており、例えば、四面体炭素の観測された立体配座をスタッガード(60°、180°、-60°)値の近くにクラスタリングすることによって得られます。
ロタマーライブラリは、主鎖非依存型、二次構造依存型、または主鎖依存型に分類できます。主鎖非依存型ロタマーライブラリは主鎖の立体配座を考慮せず、特定のタイプの利用可能なすべての側鎖から計算されます(例えば、1987年にイェール大学のPonderとRichards によって作成された最初のロタマーライブラリの例)。[ 52 ] 二次構造依存型ライブラリは、異なる二面角および/またはロタマー周波数を示します。α {\displaystyle \alpha } -ヘリックス、β {\displaystyle \beta } -シートまたはコイル二次構造。[ 53 ] バックボーン依存回転異性体ライブラリは、 バックボーン二面角によって定義される局所的なバックボーン構造に依存するコンフォメーションおよび/または周波数を示します。ϕ {\displaystyle \phi } そしてψ {\displaystyle \psi } 二次構造に関係なく。[ 54 ]
ほとんどのソフトウェアで使用されているこれらのライブラリの最新版は、確率または頻度の多次元分布として提示され、ピークはリスト内の個々の回転異性体として考慮される二面角コンフォメーションに対応します。一部のバージョンは非常に慎重にキュレーションされたデータに基づいており、主に構造検証に使用されますが、[ 55 ] 他のバージョンははるかに大きなデータセットの相対頻度を重視しており、ダンブラック回転異性体ライブラリ のように、主に構造予測に使用される形式です。[ 56 ]
側鎖パッキング法は、側鎖がより密に詰まっているタンパク質の疎水性 コアの解析に最も有用である。一方、表面残基の制約が緩く柔軟性が高い場合、表面残基は単一の回転異性体構造ではなく複数の回転異性体構造をとることが多いため、これらの方法では対処が難しくなる。[ 57 ] [ 58 ]
四次構造 2つ以上のタンパク質からなる複合体 の場合、タンパク質の構造が既知であるか、高い精度で予測できる場合は、タンパク質間ドッキング 法を用いて複合体の構造を予測することができる。特定の部位における変異が複合体の親和性に及ぼす影響に関する情報は、複合体の構造を理解し、ドッキング法を導く上で役立つ。
ソフトウェア タンパク質構造予測のためのソフトウェアツールは数多く存在する。アプローチには、相同性モデリング 、タンパク質スレッディング 、ab initio 法、二次構造予測 、膜貫通ヘリックスおよびシグナルペプチド予測などがある。特に、長短期記憶 に基づく深層学習は、2007年にタンパク質相同性検出 [ 59 ] やタンパク質の細胞内局在予測[ 60 ] に成功裏に適用されて以来、この目的で使用されてきた。CASP実験 に基づく最近の成功例には、 I-TASSER 、HHpred 、AlphaFold などがある。2021年には、AlphaFoldが最高のパフォーマンス を発揮したと報告されている[ 61 ]。
タンパク質の構造を知ることで、その機能も予測できる場合が多い。例えば、コラーゲンは長く伸びた繊維状の鎖に折り畳まれており、そのため繊維状タンパク質となる。近年、タンパク質の折り畳み、ひいてはタンパク質の構造を予測するための様々な技術が開発されており、例えばItasserやAlphaFoldなどが挙げられる。
AI手法 AlphaFoldは 、タンパク質構造を予測する最初のAIの1つです。これは、2018年に開催された第13回CASPコンペティションでGoogleのDeepMindによって発表されました。[ 61 ] AlphaFoldは、アミノ酸配列と整列した相同配列 を使用して、特定のタンパク質のすべての非水素原子の3D座標を直接予測する ニューラルネットワーク アプローチに依存しています。AlphaFoldネットワークは、繰り返しレイヤーを通して入力を処理するトランクと、明示的な3D構造を導入する構造モジュールで構成されています。[ 61 ] 以前のタンパク質構造予測用のニューラルネットワークはLSTM を使用していました。[ 59 ] [ 60 ]
AlphaFoldはタンパク質の座標を直接出力するので、タンパク質配列の長さに応じて、グラフィックス処理ユニット(GPU)数分から数時間で予測を生成します。[ 61 ]
欧州バイオインフォマティクス研究所は、 DeepMind と共同で、予測されたタンパク質構造のためのAlphaFold – EBIデータベース[ 62 ] を構築した。[ 63 ]
予測タンパク質構造の現在のAI手法とデータベース AlphaFold2はCASP14で導入され、実験精度に近いタンパク質構造の予測が可能である。[ 64 ] AlphaFoldに続いてRoseTTAFold [ 65 ] 、そして後にOmegaFoldとESMメタゲノムアトラスが登場した。[ 66 ]
Sommerら(2022)は、ゲノムアノテーションにおけるタンパク質構造予測の応用、特にhttps://www.isoform.ioで利用可能な計算予測構造を用いた機能性タンパク質アイソフォームの同定を実証した。[ 67 ] この研究は、ゲノムアノテーションツールとしてのタンパク質構造予測の可能性を強調し、あらゆるゲノムのアノテーションを強化するために使用できる、構造に基づいた実用的なアプローチを提示している。
2024年、デビッド・ベイカー とデミス・ハサビス( ジョン・M・ジャンパー と共に )は、タンパク質構造予測のためのAIベースのモデルであるAlphaFold2の開発を含む、計算タンパク質モデリングへの貢献により、ノーベル化学賞を受賞しました [ 68 ] 。AlphaFold2の精度は、二乗平均平方根偏差 (RMSD)などの指標を使用して、実験的に決定されたタンパク質構造と比較して評価されています[69]。同じ タンパク質の 異なる実験構造間の中央値RMSDは約0.6Åですが、AlphaFold2の予測と実験構造間の中央値RMSDは約1Åです。AlphaFold2が高い信頼度を割り当てる領域では、中央値RMSDは約0.6Åで、異なる実験構造間で観察される変動に匹敵します。しかし、信頼度の低い領域では、RMSDは2Åを超える可能性があり、より大きな偏差を示しています。柔軟なリンカーで連結された複数のドメインを持つタンパク質では、AlphaFold2 は個々のドメイン構造を正確に予測しますが、これらのドメインにランダムな相対位置を割り当てる場合があります。さらに、AlphaFold2 は膜平面などの構造的制約を考慮しないため、タンパク質ドメインを膜と物理的に衝突する位置に配置することがあります。[ 70 ]
自動構造予測サーバーの評価 CASP (Critical Assessment of Techniques for Protein Structure Predictionの略)は、1994年から2年ごとに開催されている、タンパク質構造予測に関するコミュニティ全体の実験です。CASPは、利用可能な人間による非自動化手法(人間カテゴリ)と、タンパク質構造予測のための自動サーバー(サーバーカテゴリ、CASP7で導入)の品質を評価する機会を提供します。[ 71 ]
CAMEO3D継続的自動モデル評価サーバーは、 新たに公開されたタンパク質構造に対するブラインド予測を用いて、自動タンパク質構造予測サーバーを毎週評価します。CAMEOは評価結果を自社ウェブサイトで公開しています。
参考文献 ↑ IUPAC-IUB生化学命名法委員会(1970年9月1日)「IUPAC-IUB生化学命名法委員会。ポリペプチド鎖の立体構造を記述するための略語と記号。暫定規則(1969)」 。生化学 。9 ( 18 ) : 3471–3479。doi : 10.1021 / bi00820a001。PMID 5509841。S2CID 196933。 1 2 3 4 5 6 7 8 Mount DM (2004). バイオインフォマティクス:配列とゲノム解析 。第 2巻。コールド・スプリング・ハーバー研究所出版局 。ISBN 978-0-87969-712-9 。↑ Yousif, Ragheed Hussam, et al.「計算アプローチによるネオキュリンとヒト甘味受容体間の分子相互作用の探索」 Sains Malaysiana 49.3 (2020): 517-525. ↑ Huang JY 、Brutlag DL (2001 年1 月 )。 「 EMOTIF データベース」 。Nucleic Acids Research。29 ( 1): 202–4。doi : 10.1093 / nar/ 29.1.202。PMC 29837。PMID 11125091 。 ↑ Pirovano W、Heringa J (2010) 「タンパク質 の 二次構造予測」。 生命科学のためのデータマイニング技術 。分子生物学の方法。第609巻、 327~ 48 ページ。doi : 10.1007 /978-1-60327-241-4_19。ISBN 978-1-60327-240-7 . PMID 20221928 . ↑ Guzzo AV (1965年11月) 「アミノ酸配列がタンパク質構造に及ぼす影響」 Biophysical Journal 5 ( 6): 809–22 . Bibcode : 1965BpJ.....5..809G . doi : 10.1016/S0006-3495(65)86753-4 . PMC 1367904 . PMID 5884309 . ↑ Prothero JW (1966 年 5 月) 「アミノ酸と α ヘリックスの分布の相関」 Biophysical Journal 6 ( 3): 367–70 . Bibcode : 1966BpJ.....6..367P . doi : 10.1016/S0006-3495(66)86662-6 . PMC 1367951 . PMID 5962284 . ↑ Schiffer M、Edmundson AB (1967 年 3 月 )。 「タンパク質 の 構造を表し、らせん構造の可能性を持つセグメントを識別するためのらせんホイールの使用」 。Biophysical Journal。7 ( 2 ) : 121–35。Bibcode : 1967BpJ ..... 7..121S。doi : 10.1016 / S0006-3495(67) 86579-2。PMC 1368002。PMID 6048867 。 ↑ Kotelchuck D、Scheraga HA (1969 年 1 月)。 「タンパク質の形成に対する短距離相互作用の影響。II. タンパク質の α ヘリックス領域を予測するためのモデル」 。 米国 科学 アカデミー紀要 。62 ( 1 ) : 14–21。Bibcode : 1969PNAS...62 ... 14K。doi : 10.1073 / pnas.62.1.14。PMC 285948。PMID 5253650 。 ↑ Lewis PN、Go N、Go M、Kotelchuck D、Scheraga HA (1970 年 4 月)。 「 変性 タンパク質のらせん確率プロファイル と天然構造 と の相関」 。 米国科学アカデミー紀要 。65 (4): 810–5。Bibcode : 1970PNAS ... 65..810L。doi : 10.1073 / pnas.65.4.810。PMC 282987。PMID 5266152 。 ↑ Froimowitz M 、Fasman GD (1974)。「ヘリックス-コイル遷移理論を用いたタンパク質の二次構造の予測」 。Macromolecules。7 ( 5 ) : 583–9。Bibcode : 1974MaMol ... 7..583F。doi : 10.1021 / ma60041a009。PMID 4371089 。 ↑ Qian, Ning; Sejnowski, Terry J. (1988). "ニューラルネットワークモデルを用いた球状タンパク質の二次構造の予測" (PDF) . Journal of Molecular Biology . 202 (4): 865– 884. doi : 10.1016/0022-2836(88)90564-5 . PMID 3172241 . Qian1988. ↑ Rost, Burkhard ; Sander, Chris (1993). "タンパク質の二次構造を70%以上の精度で予測" (PDF) . Journal of Molecular Biology . 232 (2): 584– 599. doi : 10.1006/jmbi.1993.1413 . PMID 8345525 . Rost1993. 2019-01-31 の オリジナル (PDF)からアーカイブ済み。2023-04-20 に 取得 。 1 2 Dor O 、Zhou Y (2007 年3 月 )。「大規模トレーニング による二次構造予測の 80% の 10 分割交差検証精度の達成」。Proteins。66 ( 4 ) : 838–45。doi : 10.1002 / prot.21298。PMID 17177203。S2CID 14759081 。 ↑ Chou PY、Fasman GD (1974 年1 月 ) 。「タンパク質の立体構造の予測」。 生化学 。13 ( 2 ): 222–45。doi : 10.1021/bi00699a002。PMID 4358940 。 ↑ Garnier J 、Osguthorpe DJ、Robson B (1978 年 3 月)。「球状タンパク質の二次構造を予測するための単純な方法の精度と影響の分析」。Journal of Molecular Biology。120 ( 1): 97–120。doi : 10.1016/0022-2836( 78 ) 90297-8。PMID 642007 。 1 2 Pham TH、Satou K、Ho TB (2005 年 4 月 )。「タンパク質の β ターンと γ ターンの予測と分析のためのサポート ベクター マシン」。Journal of Bioinformatics and Computational Biology。3 ( 2): 343–58。doi : 10.1142/S0219720005001089。PMID 15852509 。 ↑ Zhang Q、Yoon S、Welsh WJ (2005 年5 月)。「サポートベクターマシン を 使用したベータターン予測の改良法」。Bioinformatics。21 ( 10): 2370–4。doi : 10.1093 /bioinformatics/ bti358。PMID 15797917 。 ↑ Zimmermann O、Hansmann UH (2006 年12 月)。「二面角領域 の 予測のため の サポートベクターマシン」。Bioinformatics。22 ( 24): 3009–15。doi : 10.1093 /bioinformatics/ btl489。PMID 17005536 。 ↑ Kuang R 、 Leslie CS 、Yang AS (2004 年 7月)。 「機械学習アプローチによるタンパク質主鎖角度予測」 。Bioinformatics。20 ( 10 ): 1612–21。doi : 10.1093 /bioinformatics/ bth136。PMID 14988121 。 ↑ Faraggi E 、 Yang Y、Zhang S、Zhou Y ( 2009 年11月)。 「連続的な局所構造 の予測と 、 断片フリーのタンパク質構造予測における二次構造への置換の影響」 。Structure。17 ( 11 ) : 1515–27。doi : 10.1016 / j.str.2009.09.006。PMC 2778607。PMID 19913486 。 ↑ Zhong L、Johnson WC (1992 年 5 月 )。 「環境 は アミノ酸の二次構造に対する嗜好に影響を与える」 。 米国 科学 アカデミー 紀要 。89 ( 10 ): 4462–5。Bibcode : 1992PNAS...89.4462Z。doi : 10.1073 / pnas.89.10.4462。PMC 49102。PMID 1584778 。 ↑ Macdonald JR 、Johnson WC (2001年6月)。 「 環境特性 は タンパク質の二次 構造 を 決定する上で重要である」 。Protein Science。10 (6): 1172–7。doi : 10.1110/ ps.420101。PMC 2374018。PMID 11369855 。 ↑ Costantini S、Colonna G、Facchiano AM ( 2006 年 4月)。「アミノ酸の二次構造形成傾向はタンパク質の構造クラスによって影響を受ける」。Biochemical and Biophysical Research Communications。342 ( 2 ): 441–51。Bibcode : 2006BBRC..342..441C。doi : 10.1016 / j.bbrc.2006.01.159。PMID 16487481 。 ↑ Marashi SA、Behrouzi R、Pezeshk H ( 2007 年 1 月)。「異なる環境へのタンパク質 の 適応:枯草菌と大腸菌のプロテオーム構造 特性の比較」。 理論生物学ジャーナル 。244 ( 1) : 127–32。Bibcode : 2007JThBi.244..127M。doi : 10.1016 / j.jtbi.2006.07.021。PMID 16945389 。 ↑ Costantini S、Colonna G、Facchiano AM ( 2007 年 10 月)。「PreSSAPro: アミノ酸特性による二次構造予測のためのソフトウェア」。Computational Biology and Chemistry。31 ( 5–6 ) : 389–92。doi : 10.1016 / j.compbiolchem.2007.08.010。PMID 17888742 。 ↑ Momen-Roknabadi A、Sadeghi M、Pezeshk H、Marashi SA (2008 年 8 月)。 「残基 の アクセス 可能な表面積がタンパク質の二次構造の予測に 与える 影響 」 。BMC Bioinformatics。9 357。doi : 10.1186 / 1471-2105-9-357。PMC 2553345。PMID 18759992 。 ↑ Adamczak R 、Porollo A、Meller J (2005 年 5 月 )。「タンパク質の二次構造と溶媒接近性の予測の組み合わせ 」 。Proteins。59 ( 3 ) : 467–75。doi : 10.1002 / prot.20441。PMID 15768403。S2CID 13267624 。 ↑ Lakizadeh A、Marashi SA (2009)。 「接触番号情報の追加により 、ニューラルネットワークによるタンパク質 の 二次構造予測が改善される」 (PDF) 。Excli J。8 : 66–73 。 ↑ Dorn, Márcio; e Silva, Mariel Barbachan; Buriol, Luciana S.; Lamb, Luis C. (2014-12-01). "3次元タンパク質構造予測:方法と計算戦略" . Computational Biology and Chemistry . 53 : 251– 276. doi : 10.1016/j.compbiolchem.2014.10.001 . ISSN 1476-9271 . PMID 25462334 . 1 2 3 Zhang Y (2008 年 6 月) 「タンパク質構造予測の進歩と課題」 . Current Opinion in Structural Biology . 18 (3): 342–8 . doi : 10.1016/j.sbi.2008.02.004 . PMC 2680823 . PMID 18436442 . ↑ Ovchinnikov S 、 Kim DE 、Wang RY、Liu Y、DiMaio F、Baker D (2016 年 9 月)。 「 Rosetta に 共進化情報を組み込むことで CASP11 の de novo 構造予測を改善」 。Proteins。84 ( Suppl 1 ): 67–75。doi : 10.1002/ prot.24974。PMC 5490371。PMID 26677056 。 ↑ Hong SH、Joo K、Lee J(2018年11月)。「ConDo:共進化情報を 用い たタンパク質ドメイン境界予測」。 バイオ インフォマティクス 。35 ( 14 ): 2411–2417。doi : 10.1093 /bioinformatics/ bty973。PMID 30500873 。 ↑ Wollacott AM、Zanghellini A、Murphy P、Baker D (2007 年 2 月 )。 「個々のドメインの構造から多ドメインタンパク質の構造を予測 する 」 。Protein Science。16 ( 2 ) : 165–75。doi : 10.1110 / ps.062270707。PMC 2203296。PMID 17189483 。 ↑ Xu D、 Jaroszewski L 、 Li Z、Godzik A (2015年7月)。 「AIDA: 自動化されたマルチドメインタンパク質構造予測およびドメイン間相互作用予測のためのab initioドメインアセンブリ」 。Bioinformatics。31 ( 13 ) : 2098–105。doi : 10.1093 / bioinformatics / btv092。PMC 4481839。PMID 25701568 。 ↑ Shaw DE、Dror RO、Salmon JK、Grossman JP、Mackenzie KM、Bank JA、Young C、Deneroff MM、Batson B、Bowers KJ、Chow E (2009)。Anton 上 でのミリ秒スケールの分子動力学シミュレーション 。高性能コンピューティング、 ネットワーキング、ストレージ、分析に関する会議(SC '09)議事録。p. 1。doi : 10.1145 /1654059.1654126。ISBN 978-1-60558-744-8 。↑ Pierce LC、Salomon-Ferrer R、de Oliveira CA、McCammon JA、Walker RC (2012 年 9 月)。 「 加速分子動力学によるミリ秒時間スケールイベントへのルーチンアクセス」 。Journal of Chemical Theory and Computation。8 ( 9 ) : 2997–3002。doi : 10.1021 / ct300284c。PMC 3438784。PMID 22984356 。 ↑ クミーシク S、グロント D、コリンスキー M、ヴィエテスカ L、ダヴィド AE、コリンスキー A (2016 年 7 月)。 「粗粒タンパク質モデルとその応用」 。 化学レビュー 。 116 (14): 7898–936 . 土井 : 10.1021/acs.chemrev.6b00163 。 PMID 27333362 。 ↑ Cheung NJ、Yu W (2018年11月) 「超高速分子動力学シミュレーションを用いたde novoタンパク質構造予測」 PLOS ONE 13 ( 11) e0205819. Bibcode : 2018PLoSO..1305819C . doi : 10.1371/journal.pone.0205819 . PMC 6245515 . PMID 30458007 . ↑ Göbel U 、 Sander C 、 Schneider R、Valencia A (1994 年4 月 )。「タンパク質における相関変異と残基接触」。Proteins。18 ( 4 ) : 309–17。doi : 10.1002 / prot.340180402。PMID 8208723。S2CID 14978727 。 ↑ Taylor WR、Hatrick K (1994 年 3 月)。「タンパク質多重配列アライメントにおける補償的変化」。Protein Engineering。7 ( 3 ) : 341–8。doi : 10.1093 /protein/7.3.341。PMID 8177883 。 ↑ Neher E (1994 年 1 月) 「タンパク質配列ファミリーにおける相関変化はどのくらいの頻度で起こるか?」 米国 科学 アカデミー紀要 91 (1): 98– 102. Bibcode : 1994PNAS...91...98N . doi : 10.1073/pnas.91.1.98 . PMC 42893 . PMID 8278414 . ↑ Marks DS、Colwell LJ、Sheridan R、Hopf TA、Pagnani A、Zecchina R、Sander C (2011)。 「 進化 配列変異から計算さ れたタンパク質 の 3D構造」 。PLOS ONE。6 ( 12 ) e28766。Bibcode : 2011PLoSO...628766M。doi : 10.1371 / journal.pone.0028766。PMC 3233603。PMID 22163331 。 ↑ Burger L、van Nimwegen E (2010年1月) 「タンパク質アライメントにおける残基の直接的および間接的な共進化の分離」 PLOS Computational Biology 6 (1) e1000633. Bibcode : 2010PLSCB ...6E0633B . doi : 10.1371/journal.pcbi.1000633 . PMC 2793430 . PMID 20052271 . ↑ Morcos F、Pagnani A、Lunt B、Bertolino A、Marks DS、Sander C、Zecchina R、Onuchic JN、Hwa T、Weigt M (2011 年 12 月)。 「残基共進化の直接結合解析 により、多く の タンパク質ファミリーにわたる天然の接触が捉えられる」 。 米国 科学 アカデミー 紀要 。108 ( 49): E1293-301。arXiv : 1110.5223。Bibcode : 2011PNAS..108E1293M。doi : 10.1073 / pnas.1111471108。PMC 3241805。PMID 22106262 。 ↑ Nugent T、Jones DT (2012 年 6 月)。 「フラグメントアセンブリと相関変異解析を用いた大型膜貫通タンパク質ドメインの正確な de novo 構造予測」 。 米国 科学 アカデミー 紀要 。109 ( 24 ) : E1540-7。Bibcode : 2012PNAS..109E1540N。doi : 10.1073 / pnas.1120036109。PMC 3386101。PMID 22645369 。 ↑ Hopf TA、Colwell LJ 、Sheridan R、Rost B、Sander C、Marks DS (2012年6月)。 「 ゲノム 配列 決定 による 膜タンパク質 の 三次元構造」 。Cell。149 (7): 1607–21。doi : 10.1016 /j.cell.2012.04.012。PMC 3641781。PMID 22579045 。 ↑ Jin, Shikai; Chen, Mingchen; Chen, Xun; Bueno, Carlos; Lu, Wei; Schafer, Nicholas P.; Lin, Xingcheng; Onuchic, José N.; Wolynes, Peter G. (2020年6月9日). "AWSEM-Suiteを使用したCASP13におけるタンパク質構造予測". Journal of Chemical Theory and Computation . 16 (6): 3977–3988 . doi : 10.1021/acs.jctc.0c00188 . PMID 32396727. S2CID 218618842 . ↑ Zhang Y、Skolnick J (2005 年 1 月) 「タンパク質構造予測問題は、現在の PDB ライブラリを使用して解決できる」 米国 科学 アカデミー紀要 102 (4): 1029–34 . Bibcode : 2005PNAS..102.1029Z . doi : 10.1073/pnas.0407152101 . PMC 545829 . PMID 15653774 . ↑ Bowie JU 、Lüthy R、Eisenberg D (1991年7 月)。「既知 の 三次元構造に折り畳まれるタンパク質配列を同定する方法」。Science。253 ( 5016 ) : 164–70。Bibcode : 1991Sci ...253..164B。doi : 10.1126 / science.1853201。PMID 1853201 。 ↑ Dunbrack RL (2002 年 8 月) 「21 世紀のロタマー ライブラリー」 Current Opinion in Structural Biology . 12 (4): 431–40 . doi : 10.1016/S0959-440X(02)00344-5 . PMID 12163064 . ↑ Ponder JW、Richards FM (1987 年 2 月)。「タンパク質 の三次 構造 テンプレート。異なる構造クラスの許容配列の列挙におけるパッキング基準の使用」。Journal of Molecular Biology。193 ( 4): 775–91。doi : 10.1016/ 0022-2836 ( 87)90358-5。PMID 2441069 。 ↑ Lovell SC 、 Word JM、 Richardson JS、Richardson DC (2000 年 8 月)。「最後から 2 番目の回転異性体ライブラリ」。Proteins。40 ( 3 ) : 389–408。doi : 10.1002 / 1097-0134(20000815)40:3 < 389 ::AID - PROT50 > 3.0.CO ; 2-2。PMID 10861930。S2CID 3055173 。 ↑ Shapovalov MV、Dunbrack RL (2011 年 6 月)。 「適応カーネル 密度 推定と回帰から 得られたタンパク質 の 平滑化され た バックボーン依存回転異性体ライブラリ」 。Structure。19 ( 6): 844–58。doi : 10.1016/ j.str.2011.03.019。PMC 3118414。PMID 21645855 。 ↑ Chen VB、Arendall WB、Headd JJ、Keedy DA、Immormino RM、Kapral GJ、Murray LW、Richardson JS、Richardson DC (2010 年 1 月)。 「 MolProbity : 高分子結晶学のための全原子構造検証」 。Acta Crystallographica。Section D、Biological Crystallography。66 ( Pt 1 ) : 12–21。Bibcode : 2010AcCrD..66 ... 12C。doi : 10.1107 / S0907444909042073。PMC 2803126。PMID 20057044 。 ↑ Bower MJ、Cohen FE、Dunbrack RL (1997 年 4 月)。「主鎖依存回転異性体ライブラリからのタンパク質側鎖回転異性体の予測:新しい相同性モデリングツール」。Journal of Molecular Biology。267 ( 5 ): 1268–82。doi : 10.1006 /jmbi.1997.0926。PMID 9150411 。 ↑ Voigt CA、Gordon DB、Mayo SL (2000年6月)。「精度と速度 の トレードオフ:タンパク質配列設計における検索アルゴリズムの定量的比較」。Journal of Molecular Biology。299 ( 3 ) : 789–803。CiteSeerX 10.1.1.138.2023。doi : 10.1006 / jmbi.2000.3758。PMID 10835284 。 ↑ Krivov GG 、 Shapovalov MV、Dunbrack RL (2009 年12 月 )。 「SCWRL4 による タンパク質 側鎖コンフォメーションの予測の改善」 。Proteins。77 ( 4 ) : 778–95。doi : 10.1002/ prot.22488。PMC 2885146。PMID 19603484 。 1 2 Hochreiter, S.; Heusel, M.; Obermayer, K. (2007). "アライメントなしの高速モデルベースタンパク質相同性検出" . Bioinformatics . 23 (14): 1728– 1736. doi : 10.1093/bioinformatics/btm247 . PMID 17488755 . 1 2 Thireou, T.; Reczko, M. (2007). "真核生物タンパク質の細胞内局在を予測するための双方向長短期記憶ネットワーク". IEEE /ACM Transactions on Computational Biology and Bioinformatics . 4 (3): 441–446 . Bibcode : 2007ITCBB...4..441T . doi : 10.1109/tcbb.2007.1015 . PMID 17666763. S2CID 11787259 . 1 2 3 4 Jumper, John; Evans, Richard; Pritzel, Alexander; Green, Tim; Figurnov, Michael; Ronneberger, Olaf; Tunyasuvunakool, Kathryn; Bates, Russ; Žídek, Augustin; Potapenko, Anna; Bridgland, Alex (2021 年 8 月). "AlphaFold による高精度タンパク質構造予測" . Nature . 596 (7873): 583– 589. Bibcode : 2021Natur.596..583J . doi : 10.1038/s41586-021-03819-2 . ISSN 1476-4687 . PMC 8371605 . PMID 34265844 . ↑ 「AlphaFoldタンパク質構造データベース」 。EMBL -EBI 。 2022年 11月30日 取得 。 ↑ Varadi M、Anyango S、Deshpande M、Nair S、Natassia C、Yordanova G、et al. (2022 年 1 月)。 「AlphaFold タンパク質構造データベース: 高精度モデルによるタンパク質配列空間の構造的カバレッジの大幅な拡張」 。Nucleic Acids Res . 50 (D1): D439– D444. doi : 10.1093/nar/ gkab1061 . PMC 8728224. PMID 34791371 . ↑ Jumper J、Evans R 、 Pritzel A 、 Green T、Figurnov M、Ronneberger O、et al. ( 2021年8 月 ) 。 「AlphaFold による 高精度タンパク質構造予測」 。Nature。596 ( 7873 ): 583–589。Bibcode : 2021Natur.596..583J。doi : 10.1038 /s41586-021-03819-2。PMC 8371605。PMID 34265844 。 ↑ Baek M、DiMaio F、Anishchenko I、Dauparas J、Ovchinnikov S、Lee GR、et al. (2021年8月) 「3トラックニューラルネットワークを用いたタンパク質構造と相互作用の正確な予測」 . Science . 373 ( 6557): 871– 876. Bibcode : 2021Sci...373..871B . doi : 10.1126/science.abj8754 . PMC 7612213. PMID 34282049 . ↑ Callaway E (2022年11 月 ) 「AlphaFold の新たなライバル ? Meta AIが6億 個のタンパク質の形状 を 予測」 Nature.611 (7935): 211–212.Bibcode : 2022Natur.611..211C.doi : 10.1038 / d41586-022-03539-1.PMID 36319775.S2CID 253257926 . ↑ Sommer, Markus J.; Cha, Sooyoung; Varabyou, Ales; Rincon, Natalia; Park, Sukhwan; Minkin, Ilia; Pertea, Mihaela; Steinegger, Martin; Salzberg, Steven L. (2022-12-15). "Structure-guided isoform identification for the human transcriptome" . eLife . 11 e82556 . doi : 10.7554/eLife.82556 . PMC 9812405. PMID 36519529 . ↑ 「2024年 ノーベル 化学賞」 。NobelPrize.org 。 2025年2月3日 取得 。 ↑ 「計算によるタンパク質設計とタンパク質構造予測」 (PDF) 。 ↑ EMBL-EBI. 「AlphaFold2の構造予測はどの程度正確か? | AlphaFold」 2025年2月3日 取得 。 ↑ Battey JN 、 Kopp J 、 Bordoli L、Read RJ、Clarke ND、Schwede T (2007)。 「 CASP7 における 自動サーバー予測」 。Proteins。69 ( Suppl 8): 68–82。doi : 10.1002/ prot.21761。PMID 17894354。S2CID 29879391 。
さらに読む Majorek K、Kozłowski L、Jąkalski M、Bujnicki JM(2008年12月18日) 「第2章:タンパク質構造予測の第一歩」(PDF) 。Bujnicki J(編)『タンパク質の構造、機能、相互作用の予測 』John Wiley & Sons, Ltd.、pp . 39–62。doi : 10.1002 / 9780470741894.ch2。ISBN 978-0-470-51767-3 。 Baker D 、Sali A ( 2001 年 10月)。「タンパク質構造予測と構造ゲノミクス」。Science。294 ( 5540 ):93–6。Bibcode : 2001Sci ... 294...93B。doi : 10.1126 / science.1065659。PMID 11588250。S2CID 7193705。 Kelley LA、Sternberg MJ (2009)。「Web 上でのタンパク質構造予測:Phyre サーバーを使用したケーススタディ」( PDF ) 。Nature Protocols。4 ( 3 ): 363–71。doi : 10.1038 / nprot.2009.2。hdl : 10044 / 1 / 18157。PMID 19247286。S2CID 12497300。 Kryshtafovych A、Fidelis K(2009年4 月 )。「タンパク質構造予測とモデル品質評価」。Drug Discovery Today。14 (7–8 ) :386–93。doi : 10.1016 / j.drudis.2008.11.010。PMC 2808711。PMID 19100336 。 Qu X、Swanson R、Day R、Tsai J (2009年6月)「テンプレートに基づく構造予測のガイド」Current Protein & Peptide Science . 10 (3): 270–85 . doi : 10.2174/138920309788452182 . PMID 19519455 . Daga PR、Patel RY、Doerksen RJ (2010) 「テンプレートベースのタンパク質モデリング:最近の方法論的進歩」 Current Topics in Medicinal Chemistry . 10 (1): 84–94 . doi : 10.2174/156802610790232314 . PMC 5943704. PMID 19929829 . Fiser, A. (2010). 「テンプレートベースのタンパク質構造モデリング」. Computational Biology . Methods in Molecular Biology. Vol. 673. pp. 73–94 . doi : 10.1007/978-1-60761-842-3_6 . ISBN 978-1-60761-841-6 . PMC 4108304 . PMID 20835794 . Cozzetto D、Tramontano A(2008年 12月)。「タンパク質構造予測の進歩と落とし穴」。Current Protein & Peptide Science。9 (6 ):567–77。doi : 10.2174 / 138920308786733958。PMID 19075747 。 Nayeem A 、 Sitkoff D、Krystek S(2006年4月)。「高精度相同性モデリングに利用可能なソフトウェアの比較研究:配列アライメントから構造モデルまで」 。Protein Science。15 ( 4 ) :808–24。doi :10.1110 / ps.051892906。PMC 2242473。PMID 16600967 。
外部リンク 公式サイト 、タンパク質構造予測センター、CASP実験ExPASyプロテオミクスツール– 予測ツールとサーバーの一覧