
構造アライメントは、形状と三次元構造に基づいて、2つ以上のポリマー構造間の相同性を確立しようとするものです。このプロセスは通常、タンパク質の三次構造に適用されますが、大きなRNA分子にも使用できます。少なくとも2つの構造のいくつかの同等の残基が既知である単純な構造重ね合わせとは対照的に、構造アライメントでは同等の位置に関する事前の知識は必要ありません。構造アライメントは、配列類似性が低いタンパク質の比較に有用なツールであり、標準的な配列アライメント技術ではタンパク質間の進化関係を容易に検出できません。したがって、構造アライメントは、共通配列がほとんどないタンパク質間の進化関係を推測するために使用できます。これらの関係は、構造系統学によって特徴付けることができます。ただし、無関係または遠縁のアミノ酸配列が共通の三次構造に収束する収束進化の潜在的な交絡効果のため、結果を共通の進化祖先の証拠として解釈する際には注意が必要です。
構造アライメントは、2 つの配列または複数の配列を比較できます。これらのアライメントは、すべてのクエリ配列の三次元構造に関する情報に依存するため、この方法は、これらの構造が既知の配列にのみ使用できます。これらは通常、X 線結晶構造解析またはNMR 分光法によって見つかります。構造予測法によって生成された構造に対して構造アライメントを実行することは可能です。実際、このような予測を評価するには、モデルの品質を評価するために、モデルと真の既知の構造との間の構造アライメントが必要になることがよくあります。[ 1 ]構造アライメントは、構造ゲノミクスおよびプロテオミクスの取り組みからのデータの分析に特に役立ち、純粋に配列ベースのバイオインフォマティクス法によって生成されたアライメントを評価するための比較点として使用できます。[ 2 ] [ 3 ] [ 4 ]
構造アライメントの出力は、原子座標セットの重ね合わせと、構造間の最小二乗平均平方根偏差(RMSD )です。アライメントされた2つの構造のRMSDは、それらの構造間の差異を示します。入力構造の1つ以上に複数のタンパク質ドメインが存在する場合、構造アライメントは複雑になることがあります。これは、アライメント対象の2つの構造間でドメインの相対的な向きが変化すると、RMSDが人為的に大きくなる可能性があるためです。
構造アライメントが成功した場合に得られる最小限の情報は、構造間で同等とみなされる残基のセットです。この同等性のセットは、通常、各入力構造の3次元座標を重ね合わせるために使用されます。(1つの入力要素が参照として固定されている場合、その重ね合わせられた座標は変化しないことに注意してください。)適合された構造は、相互RMSD値や、グローバル距離テスト(GDT、[ 5 ] CASPで使用されるメトリック)などのより高度な構造類似性の尺度を計算するために使用できます。構造アライメントは、対応する1次元配列アライメントも意味し、そこから配列同一性、つまり入力構造間で同一の残基の割合を計算して、2つの配列がどれだけ密接に関連しているかの尺度にすることができます。
タンパク質構造は、側鎖が共通のタンパク質骨格で連結されたアミノ酸から構成されているため、構造アライメントを作成し、対応するRMSD値を計算する際には、タンパク質高分子を構成する原子のさまざまなサブセットを使用できます。配列が大きく異なる構造をアライメントする場合、多くのアライメントされた残基間で側鎖原子の同一性が異なるため、側鎖原子は一般的に考慮されません。このため、構造アライメント法では、デフォルトでペプチド結合に含まれる骨格原子のみを使用するのが一般的です。ペプチド結合は最小限の変異しか持たない平面構造であるため、簡便性と効率性を考慮して、多くの場合、α炭素の位置のみが考慮されます。アライメントする構造が非常に類似しているか、あるいは同一である場合にのみ、側鎖原子の位置をアライメントすることが意味を持ちます。この場合、RMSDはタンパク質骨格のコンフォメーションだけでなく、側鎖の回転異性体状態も反映します。ノイズを低減し、正の一致を強化するその他の比較基準には、二次構造の割り当て、ネイティブコンタクトマップまたは残基相互作用パターン、側鎖パッキングの尺度、および水素結合保持の尺度などがあります。[ 6 ]
タンパク質構造間の最も基本的な比較では、入力構造を整列させる試みは行われず、配列中のどの残基を RMSD 計算で考慮するかを決定するために、事前に計算された整列を入力として必要とします。構造重ね合わせは、同じタンパク質の複数のコンフォメーションを比較する場合(この場合、配列が同じであるため整列は不要)、および構造が既知の 2 つ以上の配列間で配列情報のみを使用して作成された整列の品質を評価する場合によく使用されます。この方法は従来、単純な最小二乗フィッティングアルゴリズムを使用しており、重ね合わせ内のすべての構造間の二乗距離の合計を最小化することによって最適な回転と並進を見つけます。[ 7 ]最近では、最尤法とベイズ法によって、重ね合わせの推定回転、並進、および共分散行列の精度が大幅に向上しました。[ 8 ] [ 9 ]
多次元回転と修正四元数に基づくアルゴリズムは、あらかじめ定められたアライメントを必要とせずにタンパク質構造間のトポロジー関係を特定するために開発されました。このようなアルゴリズムは、4ヘリックスバンドルなどの標準的なフォールドをうまく特定しています。[ 10 ] SuperPose ( Wayback Machineに 2015-10-31 にアーカイブ)法は、相対的なドメイン回転やその他の構造上の落とし穴を修正するのに十分な拡張性があります。[ 11 ]
構造的重ね合わせを求める目的は、重ね合わせそのものではなく、2 つの構造の類似性の評価や遠隔アライメントの信頼性であることが多い。[ 1 ] [ 2 ] [ 3 ]最大構造的重ね合わせとの微妙だが重要な違いは、アライメントを意味のある類似性スコアに変換することである。[ 12 ] [ 13 ]ほとんどの方法は、重ね合わせの質を示す何らかの「スコア」を出力する。[ 5 ] [ 14 ] [ 15 ] [ 12 ] [ 13 ]しかし、実際に欲しいのは、単に推定された 「Z スコア」や、偶然に観測された重ね合わせを見る推定E 値ではなく、推定E 値が真の E 値と密接に相関していることである。重要なことに、ある手法の推定E値が平均的に正確に正しい場合でも、推定値生成プロセスにおける標準偏差が低い場合、クエリタンパク質と比較セットの相対的類似性の順位付けは、「真の」順位付けと一致することはほとんどない。[ 12 ] [ 13 ]
異なる方法では、異なる品質保証と「オーバーラップ」の定義を使用するため、異なる数の残基が重ね合わされます。一部の方法では、複数の局所的および全体的な重ね合わせ基準を満たす残基のみが含まれますが、他の方法では、より貪欲で、柔軟で、無差別です。重ね合わされる原子の数が多いほど類似性が高くなる可能性がありますが、重ね合わせのあり得なさを定量化する最適な E 値が常に得られるとは限らず、特に遠縁の相同体では、類似性を評価するのにそれほど役立たない場合があります。[ 1 ] [ 2 ] [ 3 ] [ 4 ]
タンパク質配列を既知の構造に最適に「スレッディング」し、最適な多重配列アライメントを生成することは、 NP完全であることが示されています。[ 16 ] [ 17 ]しかし、これは構造アライメント問題がNP完全であることを意味するものではありません。厳密に言えば、タンパク質構造アライメント問題の最適解は、タンパク質構造予測実験で使用される尺度、GDT_TS [ 5 ]、MaxSub [ 14 ]などの特定のタンパク質構造類似度尺度についてのみ知られています。これらの尺度は、事前に定義された距離カットオフの下で重ね合わせることができる2つのタンパク質の原子数を最大化できるアルゴリズムを使用して厳密に最適化できます。[ 15 ]残念ながら、最適解のアルゴリズムは、実行時間が入力タンパク質の長さだけでなく、固有の幾何学にも依存するため、実用的ではありません。
与えられたスコアリング関数に対して近似パラメータ内で「最適」解のファミリーを生成する構造アライメントの近似多項式時間アルゴリズムが開発されている。 [ 15 ] [ 18 ]これらのアルゴリズムは理論的には近似タンパク質構造アライメント問題を「扱いやすい」と分類するものの、大規模なタンパク質構造解析には依然として計算コストが高すぎる。結果として、スコアリング関数が与えられた場合にアライメントのグローバル解に収束する実用的なアルゴリズムは存在しない。したがって、ほとんどのアルゴリズムはヒューリスティックであるが、スコアリング関数の少なくとも局所最大値への収束を保証し、かつ実用的なアルゴリズムが開発されている。[ 19 ]
タンパク質構造を比較可能にするには、何らかの座標に依存しない空間で表現する必要があります。これは通常、固定座標空間に対する絶対距離ではなく、比較指標を含む配列対配列行列または一連の行列を構築することによって実現されます。直感的な表現は距離行列であり、これは各構造内の原子のサブセット(例えば、α炭素)間のすべてのペアワイズ距離を含む2次元行列です。この行列は、同時に整列する構造の数が増えるにつれて次元が増加します。距離を破棄することによる情報の損失にもかかわらず、ノイズも破棄されるため、タンパク質を二次構造要素(SSE)や構造断片などの粗い指標に縮小することでも、妥当な整列が得られます。 [ 20 ]計算を容易にする表現を選択することは、効率的な整列メカニズムを開発する上で重要です。
構造アライメント技術は、個々の構造や構造セットの比較だけでなく、タンパク質データバンク(PDB)に存在するすべての構造ペア間の差異を測定する「全対全」比較データベースの作成にも用いられてきました。このようなデータベースは、タンパク質をそのフォールドに基づいて分類するために使用されます。

一般的な構造アライメント法として、DALI(Distance-matrix ALIgnment)法があります。これは、入力構造をヘキサペプチド断片に分割し、連続する断片間の接触パターンを評価することによって距離行列を計算します。[ 21 ] 配列で連続する残基を含む二次構造の特徴は、行列の主対角線上に現れます。行列内の他の対角線は、配列内で互いに近くにない残基間の空間的接触を反映しています。これらの対角線が主対角線と平行な場合、それらが表す特徴は平行です。垂直な場合、それらの特徴は反平行です。正方行列の特徴は主対角線に関して対称(したがって冗長)であるため、この表現はメモリを大量に消費します。
2 つのタンパク質の距離行列がほぼ同じ位置で同じまたは類似した特徴を共有している場合、それらは類似した折り畳みと、それらの二次構造要素を接続する類似した長さのループを持っていると言えます。DALI の実際の整列プロセスでは、2 つのタンパク質の距離行列が構築された後に類似性検索が必要です。これは通常、6x6 サイズの重複するサブ行列のシリーズを介して実行されます。サブ行列の一致は、標準的なスコア最大化アルゴリズムを介して最終的な整列に再構成されます 。DALI の元のバージョンでは、モンテカルロシミュレーションを使用して、想定される対応する原子間の距離の関数である構造類似性スコアを最大化していました。特に、対応する特徴内のより遠い原子は、ループの可動性、らせんのねじれ、およびその他の小さな構造的変動によって導入されるノイズの影響を減らすために指数関数的に重みが下げられます。[ 20 ] DALI は全対全の距離行列に依存しているため、構造的に整列した特徴が比較対象の 2 つの配列内で異なる順序で現れる可能性を考慮できます。
DALI法は、FSSP(タンパク質の構造間アライメントに基づくフォールド分類、または構造的に類似したタンパク質のファミリー)と呼ばれるデータベースの構築にも用いられており、既知のすべてのタンパク質構造を互いにアライメントして、構造上の類似性やフォールド分類を決定します。DALIに基づく検索可能なデータベースに加え、DaliLiteと呼ばれるスタンドアロン版に基づくダウンロード可能なプログラムやウェブ検索も提供されています。
組み合わせ拡張 (CE) 法は、クエリ セット内の各構造を一連のフラグメントに分解し、それらを完全なアライメントに再構成しようとする点で DALI と似ています。アラインメント フラグメント ペア (AFP) と呼ばれるフラグメントのペアワイズの組み合わせのシリーズを使用して類似性マトリックスを定義し、それを通して最終的なアライメントを特定するための最適なパスを生成します。必要な検索空間を減らし、効率を高めるために、局所的な類似性に関する所定の基準を満たす AFP のみがマトリックスに含まれます。[ 22 ]類似性メトリックは多数存在します。CE 法の元の定義には構造の重ね合わせと残基間の距離のみが含まれていましたが、その後、二次構造、溶媒露出、水素結合パターン、二面角などの局所的な環境特性を含むように拡張されました。[ 22 ]
アライメントパスは、類似性マトリックスを直線的に進み、次に可能な高スコアの AFP ペアでアライメントを拡張することによって、最適なパスとして計算されます。アライメントの核となる最初の AFP ペアは、シーケンスマトリックスの任意の場所に存在できます。拡張は、指定された距離基準を満たす次の AFP で進み、アライメントを小さなギャップサイズに制限します。各 AFP のサイズと最大ギャップサイズは必須の入力パラメータですが、通常はそれぞれ経験的に決定された値 8 と 30 に設定されます。[ 22 ] DALI や SSAP と同様に、CE はPDBの既知のタンパク質構造から、オールツーオールフォールド分類データベースを構築するために使用されています。
RCSB PDBは最近、 RCSB PDBタンパク質比較ツールの一部として、CE、Mammoth、およびFATCATの更新版をリリースしました。これは、タンパク質構造の環状置換を検出できるCEの新しいバリエーションを提供します。[ 23 ]
MAMMOTH [ 12 ]は、他のほとんどすべての方法とは異なる目的からアライメント問題に取り組みます。最大数の残基を重ね合わせるアライメントを見つけようとするのではなく、偶然に起こる可能性が最も低い構造アライメントのサブセットを探します。これを行うために、ローカルモチーフアライメントにフラグを付けて、どの残基が同時に、より厳密な基準を満たすかを示します。1) ローカル構造の重複 2) 規則的な二次構造 3) 3D 重ね合わせ 4) 一次配列の同じ順序。高信頼度で一致する残基の数とタンパク質のサイズの統計を変換して、偶然の結果の期待値を計算します。統計的に信頼できるサブアライメントの抽出を重視し、最大の配列アライメントや最大の 3D 重ね合わせの達成を重視しないため、特に ab initio 構造予測によって生成された構造を SCOP などの構造ファミリーにマッチングさせるのに優れています。[ 2 ] [ 3 ]
7 つの連続する残基の重複するウィンドウごとに、隣接する C-α 残基間の変位方向単位ベクトルのセットを計算します。 URMS スコアに基づいて、すべてのローカル モチーフが比較されます。 これらの値は、シード ペア ワイズ残基アライメントを生成する動的計画法のペア アライメント スコア エントリになります。 第 2 段階では、修正された MaxSub アルゴリズムを使用します。各タンパク質の 7 つの残基のアライメント ペアを 1 つ使用して、2 つの全長タンパク質構造を、これらの 7 つの C-α だけを最大限に重ね合わせるように方向付け、この方向で、3D で近い追加のアライメント ペアをスキャンします。 この拡張されたセットを重ね合わせるように構造を再方向付けし、3D で一致するペアがなくなるまで繰り返します。 このプロセスは、シード アライメントの 7 つの残基ウィンドウごとに再開されます。 出力は、これらの初期シードのいずれかから見つかった原子の最大数です。 この統計は、タンパク質の類似性について較正された E 値に変換されます。
Mammoth は、初期アライメントを繰り返したり、高品質のサブセットを拡張したりする試みは一切行いません。そのため、表示されるシードアライメントは、単に検索空間を剪定するためのヒューリスティックとして形成されたものであるため、DALI や TM align と公平に比較することはできません。(長距離の剛体原子アライメントに依存しない、局所的な構造モチーフの類似性のみに基づくアライメントが必要な場合に使用できます。)この同じ簡潔さのおかげで、DALI、CE、TM-align よりも 10 倍以上高速です。[ 24 ]多くの場合、これらの低速なツールと併用して、大規模なデータベースを事前スクリーニングし、より徹底的な重ね合わせや高コストな計算のために、E 値に関連する最良の構造のみを抽出します。 [ 25 ] [ 26 ]
特に、ab initio構造予測からの「デコイ」構造の解析に成功している。[ 1 ] [ 2 ] [ 3 ]これらのデコイは、局所的なフラグメントモチーフ構造を正しく取得し、正しい3D三次構造のカーネルを形成するものの、全長三次構造を誤って取得することで悪名高い。この薄明の遠隔相同性領域では、CASP [ 1 ]タンパク質構造予測評価に対するMammothのe値は、SSAPやDALIよりも人間のランキングと有意に相関していることが示されている。[ 12 ]既知の構造を持つタンパク質との多基準部分重複を抽出し、適切なE値でランク付けするMammothの能力は、その速度と相まって、既知のタンパク質との遠隔相同性に基づいて最も可能性の高い正しいデコイを特定するために、膨大な数のデコイモデルをPDBデータベースに対してスキャンすることを容易にする。 [ 2 ]
SSAP(Sequential Structure Alignment Program)法は、二重動的計画法を用いて、構造空間における原子間ベクトルに基づく構造アライメントを生成します。構造アライメントで一般的に使用されるα炭素の代わりに、SSAPはグリシンを除くすべての残基のβ炭素からベクトルを構築します。この方法により、各残基の回転異性体状態と主鎖上の位置の両方が考慮されます。SSAPは、まず各タンパク質上の各残基とその最も近い非連続隣接残基との間の一連の残基間距離ベクトルを構築することによって機能します。次に、ベクトルが構築された各残基ペアについて、隣接残基間のベクトルの差を含む一連の行列が構築されます。結果として得られた各行列に動的計画法を適用することで、一連の最適な局所アライメントが決定され、それらが「要約」行列に合計され、その行列に再び動的計画法を適用して全体の構造アライメントが決定されます。
SSAPは当初、ペアワイズアライメントのみを生成していましたが、その後、マルチプルアライメントにも拡張されました。[ 27 ]これは、 CATH (クラス、アーキテクチャ、トポロジー、相同性)として知られる階層的なフォールド分類スキームを生成するためにオールツーオール方式で適用され、[ 28 ] CATHタンパク質構造分類データベースの構築に使用されています。
タンパク質構造アライメントプログラムの特殊なクラスは、入力された構造を構造を記述する文字のシーケンスに変換します。これにより、配列アライメントの手法をこの分野に適用して、より効率的な検索が可能になり、一部の実装では、実際の3D空間でのアライメントと重ね合わせも可能になります。
構造アライメント手法の改善は活発な研究分野であり、より古く広く普及している手法よりも優れているとされる新しい手法や改良された手法がしばしば提案されている。最近の例として、TM-align は距離行列に重み付けする新しい手法を使用しており、その後、標準的な動的計画法が適用される。[ 32 ] [ 13 ]重み付けは、動的計画法の収束を加速し、アライメントの長さから生じる影響を補正するために提案されている。ベンチマーク研究では、TM-align は DALI および CE よりも速度と精度の両方で優れていると報告されている。[ 32 ]
構造アライメントの他の有望な方法は、局所構造アライメント法です。これらは、タンパク質のあらかじめ選択された部分(結合部位、ユーザー定義の構造モチーフなど)[ 33 ] [ 34 ] [ 35 ]を、結合部位または全タンパク質構造データベースと比較します。MultiBindおよびMAPPISサーバー[ 35 ] [ 36 ]は、小分子との相互作用によって定義されたユーザー提供のタンパク質結合部位のセット(MultiBind)またはユーザー提供のタンパク質間インターフェースのセット(MAPPIS)において、水素結合供与体、受容体、脂肪族、芳香族、疎水性などの物理化学的特性の共通の空間配置を識別できます。その他は、全タンパク質構造[ 37 ]を、多数のユーザー提出構造または大規模なタンパク質構造データベースと妥当な時間で比較します(ProBiS [ 38 ])。グローバルアライメントアプローチとは異なり、局所構造アライメントアプローチは、結合部位によく現れ、リガンド結合に大きく関与する官能基の局所的に保存されたパターンの検出に適しています。[ 36 ]例として、局所構造アライメントツールである G-Losa [ 39 ]と、グローバル構造アライメントに基づく手法である TM-align を比較してみましょう。G-Losa は、TM-align よりも正確に、単鎖タンパク質標的における薬剤様リガンドの位置を予測しますが、TM-align の全体的な成功率は優れています。[ 40 ]
しかし、アルゴリズムの改善とコンピュータの性能向上により、従来の手法における純粋に技術的な欠陥が解消されたため、「最適な」構造アライメントのための普遍的な基準は存在しないことが明らかになりました。たとえば、TM-align は、配列長に大きな差異があるタンパク質のセット間の比較を定量化するのに特に堅牢ですが、進化的に関連するタンパク質のアライメントのより良い指標となる可能性のある水素結合や二次構造の順序の保存を間接的にしか捉えていません。そのため、最近の開発では、速度、スコアの定量化、代替ゴールドスタンダードとの相関、構造データや第一原理構造モデルの不完全性に対する許容度などの特定の属性の最適化に重点が置かれています。人気が高まっている別の手法は、さまざまな方法のコンセンサスを使用してタンパク質の構造的類似性を確認することです。[ 41 ]
構造アライメント技術は、従来、特徴的な三次元構造をとる主要な生体高分子であるタンパク質にのみ適用されてきました。しかし、大きなRNA分子も特徴的な三次構造を形成し、これは主に塩基対間の水素結合と塩基スタッキングによって媒介されます。機能的に類似した非コードRNA分子は、RNAとタンパク質の両方で構造が配列よりも強く保存されているため、ゲノムデータから抽出するのが特に困難です[ 43 ]。また、RNAのアルファベットがより限られているため、任意の位置の任意のヌクレオチドの情報量が減少します。
しかし、RNA構造への関心の高まりと、実験的に決定された3D RNA構造の数の増加により、近年、いくつかのRNA構造類似性手法が開発されています。そのような手法の1つがSETTER [ 44 ]で、各RNA構造を一般二次構造単位(GSSU)と呼ばれるより小さな部分に分解します。GSSUはその後整列され、これらの部分的な整列が最終的なRNA構造整列に統合され、スコアが付けられます。この手法はSETTERウェブサーバーに実装されています。[ 45 ]
配列同一性が低いRNA配列のペアワイズ構造アライメントのための最近の手法が発表され、プログラムFOLDALIGNに実装されている。[ 46 ]しかし、この手法は、実験的に決定された構造を入力として必要とするのではなく、RNA入力配列の構造を計算によって予測するため、タンパク質構造アライメント技術とは真に類似しているとは言えない。タンパク質の折り畳み過程の計算による予測は今日まで特に成功していないが、擬似結び目のないRNA構造は、塩基対形成とスタッキングを考慮した自由エネルギーベースのスコアリング法を用いて、しばしば妥当に予測できる。[ 47 ]
構造アライメント用のソフトウェアツールを選択することは、方法論や信頼性が大きく異なるさまざまなパッケージが利用可能であるため、困難な場合があります。この問題に対する部分的な解決策が[ 41 ]で提示され、ProCKSIウェブサーバーを通じて一般に公開されています。現在利用可能で無料で配布されている構造アライメントソフトウェアのより完全なリストは、構造アライメントソフトウェアにあります。
Proteopedia.Org の構造アライメントツールでは、いくつかの構造アライメントサーバーとソフトウェアパッケージの特性がまとめられ、例とともにテストされています。
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 数値名: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)