
多重配列アライメント(MSA )とは、一般的にタンパク質、DNA、またはRNAといった3つ以上の生物学的配列をアライメントするプロセス、またはその結果を指します。これらのアライメントは、系統解析を通じて進化上の関係を推測するために使用され、配列間の相同性を強調することができます。アライメントは、点突然変異(単一のアミノ酸またはヌクレオチドの変化)、挿入突然変異、欠失突然変異などの突然変異イベントを強調し、配列の保存性を評価し、タンパク質ドメイン、三次構造、二次構造、および個々のアミノ酸やヌクレオチドの存在と活性を推測するために使用されます。
多重配列アライメントは、ペアワイズアライメントよりも計算が複雑であるため、より高度な手法を必要とします。ほとんどの多重配列アライメントプログラムは、中程度の長さの複数の配列間の最適なアライメントを特定するには計算コストが非常に高いため、グローバル最適化ではなくヒューリスティック法を使用しています。しかし、ヒューリスティック法は一般的に高品質のソリューションを保証することはできず、ベンチマークテストケースでほぼ最適なソリューションが得られないことが示されています。[ 1 ] [ 2 ] [ 3 ]
与えられた配列、下記のフォームと同様の形式です。
この配列セットの多重配列アライメントが作成される。必要な数の隙間をそれぞれに挿入することによりシーケンス修正された配列まで、すべて長さに準拠シーケンスには値がありません同じ列の要素はギャップのみで構成されます。上記のシーケンスセットのMSAの数学的表現を以下に示します。
各シーケンスから戻るに隙間をすべて取り除きます。
多重配列アライメントを計算する際の一般的なアプローチは、グラフを用いてすべての異なるアライメントを特定することです。グラフを用いてアライメントを検索する場合、頂点の集合と辺の集合を含む重み付きグラフで完全なアライメントが作成されます。グラフの各辺には、各アライメントまたは元のグラフのサブセットを評価するのに役立つ特定のヒューリスティックに基づいた重みが付けられます。
各MSAに最適なアライメントを決定する際には、通常トレースが生成されます。トレースとは、対応する頂点間で選択されたエッジに基づいて特定の重みが割り当てられた、実現された、つまり対応して整列された頂点の集合です。一連の配列に対してトレースを選択する際には、配列の最適なアライメントを得るために、重みが最大のトレースを選択する必要があります。
複数の配列間でアライメントのスコアと正確性を最大化するために、さまざまなアライメント手法が用いられています。それぞれの手法は通常、進化過程に関する知見に基づいた特定のヒューリスティックなアプローチを採用しています。ほとんどの手法は、進化を再現することで、配列間の関係を最も正確に予測できる、現実的なアライメントを得ようと試みています。
MSA を作成する直接的な方法では、動的計画法を使用して、全体的に最適なアライメント解を特定します。タンパク質の場合、この方法は通常、2 つのパラメータセットを使用します。ギャップペナルティと置換マトリックスです。置換マトリックスは、アミノ酸の化学的性質の類似性と突然変異の進化確率に基づいて、可能な各アミノ酸ペアのアライメントにスコアまたは確率を割り当てます。ヌクレオチド配列の場合、同様のギャップ ペナルティが使用されますが、完全に一致するものと一致しないもののみを考慮する、はるかに単純な置換マトリックスが一般的です。置換マトリックスのスコアは、全体的なアライメントの場合はすべて正または正と負の混合になりますが、局所的なアライメントの場合は正と負の両方でなければなりません。[ 4 ]
n個の個々の配列に対して、ナイーブな方法では、標準的なペアワイズ配列アライメントで形成される行列のn次元相当物を構築する必要があります。したがって、検索空間はn の増加とともに指数関数的に増加し、配列の長さにも強く依存します。計算複雑度を測定するためによく使用されるビッグO 表記で表現すると、ナイーブMSA の生成にはO(Length Nseqs )時間がかかります。この方法でn 個の配列のグローバル最適解を見つけることは、 NP 完全問題であることが示されています。[ 5 ] [ 6 ] [ 7 ] 1989 年に、Carrillo-Lipman アルゴリズムに基づいて、[ 8 ] Altschul は、n 次元の検索空間を制限するためにペアワイズ アライメントを使用する実用的な方法を導入しました。[ 9 ]このアプローチでは、クエリ セットの各ペアの配列に対してペアワイズ動的計画法アライメントが実行され、これらのアライメントの n 次元の交差付近の空間のみが n 方向のアライメントのために検索されます。 MSAプログラムは、アライメント内の各位置にあるすべての文字ペアの合計(いわゆるペアスコアの合計)を最適化し、多重配列アライメントを構築するためのソフトウェアプログラムに実装されています。[ 10 ] 2019年に、Hosseininasabとvan Hoeveは、決定図を使用することで、MSAを多項式空間複雑度でモデル化できることを示しました。[ 3 ]
多重配列アライメントで最も広く使用されているアプローチは、1987 年に Da-Fei Feng と Doolittle によって開発されたプログレッシブ法 (階層法またはツリー法とも呼ばれる) と呼ばれるヒューリスティック探索を使用します。[ 11 ]プログレッシブアライメントは、最も類似したペアから始めて最も遠縁のペアへと進むペアワイズアライメントを組み合わせることによって最終的な MSA を構築します。すべてのプログレッシブアライメント法は 2 つの段階を必要とします。最初の段階では、配列間の関係がガイドツリーと呼ばれる系統樹として表現され、2 番目の段階では、ガイドツリーに従って配列を順次成長中の MSA に追加することによって MSA が構築されます。最初のガイドツリーは、近隣結合法や算術平均による非加重ペアグループ法( UPGMA )などの効率的なクラスタリング法によって決定され、同一の 2 文字サブシーケンスの数に基づく距離を使用する場合があります (動的計画法アライメントではなくFASTAのように)。 [ 12 ]
プログレッシブアライメントは、グローバルに最適であるとは限らない。主な問題は、MSA の作成中のどの段階でエラーが発生しても、これらのエラーが最終結果に伝播してしまうことである。また、セット内のすべての配列がかなり遠縁である場合、パフォーマンスは特に悪くなる。最新のプログレッシブ法のほとんどは、スコアリング関数を二次重み付け関数で修正し、クエリセットの個々のメンバーに、最も近い隣接配列からの系統発生距離に基づいて非線形的にスケーリング係数を割り当てる。これにより、アライメントプログラムに与えられる配列の非ランダムな選択が補正される。[ 12 ]
プログレッシブアライメント法は、多数の(数百から数千の)配列に対して大規模に実装するのに十分な効率性があります。人気の高いプログレッシブアライメント法は、Clustalファミリーです。[ 13 ] [ 14 ] Clustal Wは、編集されていないアライメントをそのような研究や相同性モデリングによるタンパク質構造予測の入力として使用すべきではないという著者の明確な警告にもかかわらず、系統樹の構築に広く使用されています。欧州バイオインフォマティクス研究所(EMBL-EBI)は、CLustalW2が2015年8月に期限切れになると発表しました。彼らは、シード付きガイドツリーとHMMプロファイルプロファイル技術に基づいてタンパク質アライメントを実行するClustal Omegaを推奨しています。プログレッシブDNAアライメントの代替ツールは、高速フーリエ変換を使用した多重アライメント(MAFFT)です。[ 15 ]
T-Coffee [ 16 ]と呼ばれる別の一般的なプログレッシブアライメント法は、Clustal およびその派生法よりも処理速度は遅いものの、一般的に遠縁の配列セットに対してより正確なアライメントを生成します。T-Coffee は、ペアの直接アライメントと、ペアの各配列を第 3 の配列にアライメントする間接アライメントを組み合わせることによって、ペアワイズアライメントを計算します。Clustal の出力と、2 つの配列間の複数の局所アライメント領域を見つける別の局所アライメントプログラム LALIGN を使用します。結果として得られるアライメントと系統樹は、新しい、より正確な重み係数を生成するためのガイドとして使用されます。
漸進的手法は、グローバル最適解に収束することが保証されていないヒューリスティックであるため、アライメント品質の評価が難しく、その真の生物学的意義が不明瞭になることがあります。アライメント品質を向上させ、損失のあるヒューリスティックを使用せず、かつ多項式時間で実行される半漸進的手法が、プログラムPSAlignに実装されています。[ 17 ]
漸進的方法に内在するエラーを減らしながら MSA を生成する一連の方法は、「反復的」に分類されます。これは、漸進的方法と同様に動作するものの、初期配列を繰り返し再アラインメントし、新しい配列を成長中の MSA に追加していくためです。漸進的方法が高品質の初期アラインメントに強く依存する理由の 1 つは、これらのアラインメントが常に最終結果に組み込まれるという事実です。つまり、配列が MSA にアラインメントされると、そのアラインメントはそれ以上考慮されません。この近似により、精度を犠牲にして効率が向上します。対照的に、反復的方法では、高品質のアラインメント スコアを見つけるなどの一般的な目的関数を最適化する手段として、クエリ シーケンスのサブセットを組み込んだ以前に計算されたペアワイズ アラインメントまたはサブ MSA に戻ることができます。[ 12 ]
微妙に異なるさまざまな反復方法がソフトウェア パッケージに実装され、利用可能になっています。レビューや比較は役立っていますが、一般的には「最良」の手法を選択することは避けています。[ 18 ]ソフトウェア パッケージ PRRN/PRRP は、ヒル クライミング アルゴリズムを使用してMSA アライメント スコアを最適化し[ 19 ]、アライメント ウェイトと、成長中の MSA の局所的に分岐した、または「ギャップのある」領域の両方を反復的に修正します。[ 12 ] PRRP は、より高速な方法で以前に構築されたアライメントを改良する場合に最高のパフォーマンスを発揮します。[ 12 ]
別の反復プログラムである DIALIGN は、ギャップ ペナルティを導入せずに、サブセグメントまたは配列モチーフ間の局所的なアライメントに狭く焦点を当てるという珍しいアプローチを採用しています。 [ 20 ]個々のモチーフのアライメントは、ペアワイズ アライメントのドット マトリックス プロットに似たマトリックス表現で実現されます。高速な局所アライメントをアンカー ポイントまたはシードとして使用し、より低速なグローバル アライメント手順を実行する代替手法がCHAOS/DIALIGN スイートに実装されています。[ 20 ]
3つ目の一般的な反復ベースの手法であるMUSCLE(多重配列アライメント対数期待値法)は、2つの配列の関連性を評価するためのより正確な距離尺度でプログレッシブ手法を改善しています。[ 21 ]距離尺度は反復ステージ間で更新されます(ただし、元の形式では、MUSCLEは改良が有効になっているかどうかに応じて2〜3回の反復しか含まれていませんでした)。
コンセンサス法は、同じ配列セットの複数の異なるアライメントが与えられた場合に、最適な多重配列アライメントを見つけようとするものです。一般的に使用されているコンセンサス法は、M-COFFEEとMergeAlignの2つです。[ 22 ] M-COFFEEは、7つの異なる方法で生成された多重配列アライメントを使用してコンセンサスアライメントを生成します。MergeAlignは、異なる配列進化モデルまたは異なる多重配列アライメント方法を使用して生成された任意の数の入力アライメントからコンセンサスアライメントを生成できます。MergeAlignのデフォルトオプションは、91の異なるタンパク質配列進化モデルを使用して生成されたアライメントを使用してコンセンサスアライメントを推論することです。

隠れマルコフモデル(HMM)は、ギャップ、マッチ、ミスマッチのすべての可能な組み合わせに尤度を割り当てて、最も可能性の高いMSAまたは可能なMSAのセットを決定できる確率モデルです。HMMは、最も高いスコアの出力を1つ生成することもできますが、生物学的意義を評価できる可能なアライメントのファミリーを生成することもできます。HMMは、グローバルアライメントとローカルアライメントの両方を生成できます。HMMベースの方法は比較的最近開発されたものですが、特に重複領域を含む配列の場合、計算速度が大幅に向上します。[ 12 ]
典型的な HMM ベースの手法は、MSA を部分順序グラフと呼ばれる有向非巡回グラフの形式で表現することで機能します。部分順序グラフは、MSA の列の可能なエントリを表す一連のノードで構成されます。この表現では、完全に保存されている列 (つまり、MSA 内のすべてのシーケンスが特定の位置で特定の文字を共有している) は、アライメントの次の列の可能な文字と同じ数の出力接続を持つ単一のノードとしてコード化されます。典型的な隠れマルコフモデルの観点から、観測された状態は個々のアライメント列であり、「隠れた」状態は、クエリ セットのシーケンスが派生したと仮定される推定祖先シーケンスを表します。動的計画法の効率的な検索バリアントであるViterbi アルゴリズムは、一般的に、成長中の MSA をクエリ セットの次のシーケンスに順次アライメントして新しい MSA を生成するために使用されます。[ 23 ]これは、新しいシーケンスが追加されるたびに以前のシーケンスのアライメントが更新されるため、プログレッシブ アライメント法とは異なります。しかし、プログレッシブ法と同様に、この手法はクエリセット内の配列がアライメントに組み込まれる順序によって影響を受ける可能性があり、特に配列が遠縁である場合は顕著である。[ 12 ]
HMMベースの手法のバリアントが実装され、スケーラビリティと効率性で知られるソフトウェアプログラムがいくつか利用可能であるが、HMM手法を適切に使用することは、より一般的なプログレッシブ手法を使用するよりも複雑である。最も単純なのは部分順序アライメント(POA)[ 24 ]であり、同様のより一般的な手法は、配列アライメントおよびモデリングシステム(SAM)ソフトウェアパッケージ[ 25 ]およびHMMER [ 26 ]に実装されている。SAMは、タンパク質構造予測 のアライメントのソースとして使用され、構造予測の重要評価(CASP )構造予測実験に参加し、酵母種S. cerevisiaeの予測タンパク質のデータベースを開発している。HHsearch [ 27 ]は、HMMのペアワイズ比較に基づいて遠縁のタンパク質配列を検出するソフトウェアパッケージである。HHsearch( HHpred )を実行しているサーバーは、CASP7およびCASP8構造予測コンペティションの10の自動構造予測サーバーの中で最速であった。[ 28 ]

ほとんどの多重配列アライメント法は、挿入/欠失(ギャップ)の数を最小限に抑え、結果としてコンパクトなアライメントを生成します。アライメント対象の配列に非相同領域が含まれている場合、またはギャップが系統解析で情報を提供する場合、これはいくつかの問題を引き起こします。これらの問題は、注釈が不十分で、フレームシフト、間違ったドメイン、または非相同スプライシングエクソンを含む可能性のある新しく生成された配列でよく見られます。このような最初の方法は、2005 年に Löytynoja と Goldman によって開発されました。[ 29 ]同じ著者は、2008 年にPRANKと呼ばれるソフトウェア パッケージをリリースしました。 [ 30 ] PRANK は、挿入が存在する場合にアライメントを改善します。ただし、数年にわたって開発されてきた漸進的および/または反復的な方法と比較すると、実行速度が遅くなります。
2012年に、2つの新しい系統発生認識ツールが登場しました。1つはPRANKと同じチームによって開発されたPAGANです。 [ 31 ]もう1つはSzalkowskiによって開発されたProGraphMSAです。 [ 32 ]どちらのソフトウェアパッケージも独立して開発されましたが、共通の特徴があり、特に非相同領域の認識を改善するためにグラフアルゴリズムを使用していること、およびこれらのソフトウェアをPRANKよりも高速にするコードの改善が挙げられます。

プロファイル解析とも呼ばれるモチーフ探索は、グローバルMSA内の配列モチーフを特定する方法であり、より良いMSAを作成する手段であると同時に、類似のモチーフを他の配列で検索するために使用するスコアリングマトリックスを作成する手段でもある。モチーフを分離するためのさまざまな方法が開発されているが、いずれも、より大きなアライメント内の短く高度に保存されたパターンを特定し、推定モチーフ内の各位置のアミノ酸またはヌクレオチド組成を反映する置換マトリックスに似たマトリックスを構築することに基づいている。その後、これらのマトリックスを使用してアライメントを改良することができる。標準的なプロファイル解析では、マトリックスには、可能な各文字のエントリとギャップのエントリが含まれる。[ 12 ]あるいは、統計的パターン探索アルゴリズムは、モチーフを派生ではなくMSAの前駆体として特定することができる。クエリセットに少数の配列しか含まれていない場合や、高度に類似した配列しか含まれていない場合は、スコアリングマトリックスに反映される分布を正規化するために擬似カウントが追加されることが多い。特に、これにより、マトリックス内の確率がゼロのエントリが、小さいがゼロではない値に修正される。
ブロック分析は、モチーフをアライメント内のギャップのない領域に限定するモチーフ発見法です。ブロックはMSAから生成することも、既知の遺伝子ファミリーから事前に生成された共通モチーフの事前計算セットを使用して、アライメントされていない配列から抽出することもできます。[ 33 ]ブロックスコアリングは一般的に、明示的な置換行列の計算ではなく、高頻度文字の間隔に依存します。
統計的パターンマッチングは、期待値最大化アルゴリズムとギブスサンプラーの両方を使用して実装されています。最も一般的なモチーフ発見ツールの 1 つは、Multiple EM for Motif Elicitation (MEME) と呼ばれ、期待値最大化法と隠れマルコフ法を使用してモチーフを生成し、それらのモチーフは、MEME/MAST 統合スイート内のコンパニオン MAST によって検索ツールとして使用されます。[ 34 ] [ 35 ]
非コードDNA領域、特に転写因子結合部位(TFBS)は保存されているものの、必ずしも進化的に関連しているとは限らず、共通祖先とは異なる祖先から収斂進化した可能性がある。したがって、タンパク質配列とDNAコード領域のアラインメントに用いられる仮定は、TFBS配列に適用される仮定とは本質的に異なる。相同配列のDNAコード領域を突然変異演算子を用いてアラインメントすることは有意義であるが、同じ転写因子の結合部位配列のアラインメントは、進化的に関連する突然変異操作に依拠することはできない。同様に、点突然変異の進化演算子を用いてコード配列の編集距離を定義することは可能であるが、TFBS配列においては、結合部位が機能するためには、いかなる配列変異も一定レベルの特異性を維持する必要があるため、この演算子はほとんど意味を持たない。これは、既知のTFBS配列をアラインメントして、同じTFBSの未知の位置を予測する教師ありモデルを構築しようとする場合に特に重要となる。したがって、多重配列アライメント法では、結合部位の特異性を維持しながら最も低い熱力学的アライメントを探索するために、隣接する塩基の熱力学的情報を組み込んだ発表された研究[ 36 ]のように、基礎となる進化仮説と使用される演算子を調整する必要があります。
コンピュータサイエンスにおける標準的な最適化手法(どちらも物理プロセスに触発されたものだが、直接再現するものではない)も、より効率的に高品質の MSA を生成するために使用されてきた。そのような手法の 1 つである遺伝的アルゴリズムは、クエリ セットの分岐を生み出したとされる進化プロセスを広くシミュレートする目的で MSA 生成に使用されてきた。この手法は、一連の可能な MSA を断片に分割し、さまざまな位置にギャップを導入しながらそれらの断片を繰り返し再配置することによって機能する。シミュレーション中に一般的な目的関数が最適化され、最も一般的には動的計画法に基づく MSA 手法で導入された「ペアの合計」最大化関数が使用される。タンパク質配列の手法は、ソフトウェア プログラム SAGA (Sequence Alignment by Genetic Algorithm) [ 37 ]に実装されており、RNA における同等のものは RAGA と呼ばれている。[ 38 ]
シミュレーテッドアニーリング法は、別の方法で作成された既存のMSAを、入力アライメントが既に占めている領域よりも優れたアライメント空間領域を見つけるように設計された一連の再配置によって改良する手法です。遺伝的アルゴリズム法と同様に、シミュレーテッドアニーリング法は、ペアの合計関数などの目的関数を最大化します。シミュレーテッドアニーリング法は、再配置の進行速度と各再配置の尤度を決定する比喩的な「温度因子」を使用します。典型的な使用法では、再配置速度が高く尤度が比較的低い期間(アライメント空間のより遠い領域を探索するため)と、再配置速度が低く尤度が高い期間(新しく「植民地化された」領域の近くの局所的最小値をより徹底的に探索するため)を交互に繰り返します。このアプローチは、MSASA(Multiple Sequence Alignment by Simulated Annealing)プログラムに実装されています。[ 39 ]
数理計画法、特に混合整数計画モデルは、MSA 問題を解決するためのもう 1 つのアプローチです。このような最適化モデルの利点は、従来の DP アプローチと比較して、より効率的に最適な MSA 解を見つけるために使用できることです。これは、数理計画法に分解手法を適用できることに一部起因しており、MSA モデルはより小さな部分に分解され、最適な解が見つかるまで反復的に解かれます。MSA の混合整数計画モデルを解くために使用されるアルゴリズムの例には、分岐限定法[ 40 ]とベンダー分解法[ 3 ]があります。厳密なアプローチは、MSA のヒューリスティック アルゴリズムと比較して計算速度が遅いですが、大規模な問題であっても、最終的には最適な解に到達することが保証されています。
2017年1月、D-Wave Systemsは、同社のオープンソース量子コンピューティングソフトウェアであるqbsolvがMSA問題のより高速な解を見つけるために成功したと発表した。[ 41 ]
多重配列アライメントにヒューリスティックを使用する必要があるということは、任意のタンパク質セットに対して、アライメントにエラーが含まれる可能性が常に高いことを意味します。たとえば、BAliBaseベンチマークを使用していくつかの主要なアライメントプログラムを評価したところ、アライメントされたすべてのアミノ酸ペアの少なくとも24%が誤ってアライメントされていることがわかりました。[ 2 ]これらのエラーは、配列の1つ以上の領域への固有の挿入、または配列だけでは容易にアライメントできないタンパク質につながるより複雑な進化プロセスによって発生する可能性があります。配列の数とその分岐が増加すると、MSAアルゴリズムのヒューリスティックな性質のために、より多くのエラーが発生します。多重配列アライメントビューアを使用すると、多くの場合、2つ以上の配列上の注釈付き機能部位のアライメントの品質を検査することによって、アライメントを視覚的にレビューできます。また、多くの場合、系統解析や比較モデリングで使用するのに適した最適な「キュレーションされた」アライメントを取得するために、これらの(通常は軽微な)エラーを修正するようにアライメントを編集することもできます。[ 42 ]
しかし、配列の数が増えるにつれて、特に多くの MSA を含むゲノムワイド研究では、すべてのアライメントを手動でキュレーションすることは不可能です。さらに、手動キュレーションは主観的です。そして最後に、最も優れた専門家でさえ、高度に分岐した配列のより曖昧なケースを確実にアライメントすることはできません。このような場合、自動手順を使用して MSA から信頼性の低いアライメント領域を除外するのが一般的です。系統樹再構築の目的で (下記参照)、Gblocks プログラムは、アライメント列のギャップ配列の数に関するさまざまなカットオフに従って、低品質と思われるアライメントブロックを除去するために広く使用されています。[ 43 ]ただし、これらの基準は、まだ確実にアライメントできる挿入/欠失イベントのある領域を過度にフィルタリングする可能性があり、これらの領域は、正の選択の検出などの他の目的で望ましい場合があります。いくつかのアライメントアルゴリズムは、高信頼性の領域を選択できるサイト固有のスコアを出力します。このようなサービスは、SOAP プログラム[ 44 ]によって最初に提供されました。SOAP プログラムでは、一般的なアライメント プログラム CLUSTALW のパラメータの摂動に対する各列の堅牢性をテストします。T-Coffee プログラム[ 45 ]は、最終的な MSA の構築にアライメントのライブラリを使用し、その出力 MSA は、アライメントされた各残基に関してライブラリ内の異なるアライメント間の合意を反映する信頼度スコアに従って色付けされます。その拡張機能である Transitive Consistency Score (TCS) は、T-Coffeeのペアワイズ アライメントライブラリを使用して、サードパーティの MSA を評価します。ペアワイズ 投影は、高速または低速の方法を使用して生成できるため、速度と精度のトレードオフが可能になります。[ 46 ] [ 47 ]信頼度スコア付きの MSA を出力できる別のアライメント プログラムとして FSA [ 48 ]があります。FSA では、アライメントの不確実性を計算できる統計モデルを使用します。 HoT(表裏)スコアは、複数の共最適解が存在するため、サイト固有のアライメントの不確実性の尺度として使用できます。[ 49 ] GUIDANCEプログラム[ 50 ]は、プログレッシブ アライメント プログラムで使用されるガイド ツリーの不確実性に対するアライメントの堅牢性に基づいて、同様のサイト固有の信頼度尺度を計算します。アライメントの不確実性を評価するための、より統計的に正当化された代替アプローチは、系統発生とアライメントの同時推定に確率的進化モデルを使用することです。ベイズ アプローチでは、推定された系統発生とアライメントの事後確率を計算できます。これは、これらの推定値の信頼度を測る尺度です。この場合、アライメントの各サイトについて事後確率を計算できます。このようなアプローチは、BAli-Phy プログラムで実装されています。[ 51 ]
複数の配列アライメントを視覚化するための無料プログラムがいくつかあり、例えばJalviewやUGENEなどが挙げられる。
多重配列アライメントは、系統樹を作成するために使用できます。[ 52 ]これは、2 つの理由により可能になります。1 つ目は、注釈付き配列で知られている機能ドメインを、注釈なし配列のアライメントに使用できることです。もう 1 つは、機能的に重要であることがわかっている保存領域を見つけることができることです。これにより、多重配列アライメントを使用して、配列間の相同性を通じて進化関係を分析および発見することが可能になります。点突然変異や挿入または欠失イベント (インデルと呼ばれる) を検出できます。
多重配列アライメントは、保存ドメインを特定することにより、結合部位、活性部位、または他の重要な機能に対応する部位など、機能的に重要な部位を特定するためにも使用できます。多重配列アライメントを検討する際には、配列を比較する際に、配列のさまざまな側面を考慮することが有用です。これらの側面には、同一性、類似性、相同性が含まれます。同一性とは、配列がそれぞれの位置に同一の残基を持つことを意味します。一方、類似性とは、比較対象の配列が量的に類似した残基を持つことを意味します。たとえば、ヌクレオチド配列に関して言えば、ピリミジンは互いに類似していると考えられ、プリンも同様です。類似性は最終的に相同性につながり、配列が類似しているほど、相同性に近づきます。配列のこの類似性は、共通の祖先を見つけるのに役立ちます。[ 52 ]
{{cite book}}:|journal=無視されました (ヘルプ)