バイオインフォマティクスでは、配列アライメントは、 DNA、RNA、またはタンパク質の配列を並べて、配列間の機能的、構造的、または進化的関係の結果である可能性のある類似領域を特定する方法です。 [ 1 ]ヌクレオチドまたはアミノ酸残基の整列された配列は、通常、マトリックス内の行として表されます。同一または類似の文字が連続する列に整列するように、残基間にギャップが挿入されます。配列アライメントは、自然言語の文字列間の距離コストを計算したり、金融データを表示したりするなど、非生物学的配列にも使用されます。

アライメント内の 2 つの配列が共通の祖先を共有する場合、ミスマッチは、それらが互いに分岐して以来、一方または両方の系統で導入された点突然変異、ギャップはインデル(つまり、挿入または欠失突然変異) として解釈できます。タンパク質の配列アライメントでは、配列内の特定の位置を占めるアミノ酸間の類似性の程度は、特定の領域または配列モチーフが系統間でどの程度保存されているかの概算値として解釈できます。配列の特定の領域に置換がない、または非常に保存的な置換 (つまり、側鎖が類似した生化学的特性を持つアミノ酸の置換) のみが存在することは、この領域が構造的または機能的に重要であることを示唆しています[ 3 ] 。DNA および RNAヌクレオチド塩基はアミノ酸よりも互いに類似していますが、塩基対の保存は、同様の機能的または構造的役割を示す可能性があります。
非常に短い配列や非常に類似した配列は、手作業で整列させることができます。しかし、最も興味深い問題では、人間の努力だけでは整列できない、長くて非常に多様な、あるいは非常に多数の配列の整列が必要となります。高品質の配列整列を作成するためにさまざまなアルゴリズムが考案され、場合によっては、アルゴリズムで表現するのが難しいパターン(特にヌクレオチド配列の場合)を反映するように最終結果を調整しています。配列整列の計算アプローチは、一般的に、グローバル整列とローカル整列の 2 つのカテゴリに分類されます。グローバル整列の計算は、すべてのクエリ配列の全長にわたって整列を「強制」するグローバル最適化の一種です。対照的に、ローカル整列は、全体的に大きく異なることが多い長い配列内の類似領域を特定します。ローカル整列の方が好ましい場合が多いですが、類似領域を特定するという追加の課題があるため、計算がより困難になる場合があります。[ 4 ]さまざまな計算アルゴリズムが配列整列問題に適用されています。これには、動的計画法のような、遅いが形式的に正しい方法が含まれます。これらには、大規模データベース検索用に設計された効率的なヒューリスティックアルゴリズムや確率的手法も含まれますが、必ずしも最適な一致が見つかるとは限りません。
アライメントは、一般的にグラフィカル形式とテキスト形式の両方で表現されます。ほとんどすべての配列アライメント表現では、配列は行に記述され、整列した残基が連続する列に表示されます。テキスト形式では、同一または類似の文字を含む整列した列は、保存記号のシステムで示されます。上の画像のように、2 つの列の同一性を示すためにアスタリスクまたはパイプ記号が使用されます。その他のあまり一般的ではない記号には、保存的置換のためのコロンと、半保存的置換のためのピリオドがあります。多くの配列可視化プログラムでは、個々の配列要素の特性に関する情報を表示するために色も使用されます。DNA および RNA 配列では、これは各ヌクレオチドに独自の色を割り当てることに相当します。上の画像のようなタンパク質アライメントでは、特定のアミノ酸置換の保存性を判断するのに役立つように、アミノ酸の特性を示すために色が使用されることがよくあります。複数の配列の場合、各列の最後の行は、アライメントによって決定されたコンセンサス配列であることがよくあります。コンセンサス配列は、各ヌクレオチドまたはアミノ酸文字のサイズがその保存度に対応する配列ロゴを使用してグラフィカル形式で表現されることもよくあります。 [ 5 ]
配列アライメントは、さまざまなテキストベースのファイル形式で保存できますが、その多くは元々特定のアライメントプログラムまたは実装と連携して開発されたものです。ほとんどのウェブベースのツールは、FASTA形式やGenBank形式など、限られた数の入出力形式しかサポートしておらず、出力は簡単に編集できません。READSEQ [ 6 ]やEMBOSSなど、グラフィカルインターフェースやコマンドラインインターフェースを提供する変換プログラムがいくつかあります。また、 BioPython、 BioRuby、BioPerlなど、この変換機能を提供するプログラミングパッケージもいくつかあります。SAM /BAMファイルは、 CIGAR (Compact Idiosyncratic Gapped Alignment Report)文字列形式を使用して、一連のイベント(一致/不一致、挿入、削除など)をエンコードすることで、配列と参照配列のアライメントを表します。[ 7 ]
参照 : GTCGTAGAATA 読み取り: CACGTAG—TA CIGAR: 2S5M2D2M ここで: 2S = 2 ソフト クリッピング (ミスマッチ、または一致したシーケンスより長い読み取りである可能性があります) 5M = 5 一致またはミスマッチ 2D = 2 欠失 2M = 2 一致またはミスマッチ
exonerateアライメントプログラムのオリジナルのCIGARフォーマットでは、M文字を含むミスマッチとマッチを区別していませんでした。
SAMv1仕様書では、より新しいCIGARコードが定義されています。ほとんどの場合、一致または不一致を示すために、曖昧な古い「M」文字ではなく、「=」と「X」文字を使用することが推奨されます。
すべての配列のすべての残基を整列させようとするグローバルアライメントは、クエリセット内の配列が類似していて、サイズがほぼ同じである場合に最も有用です。(これは、グローバルアライメントがギャップで開始および/または終了できないという意味ではありません。)一般的なグローバルアライメント手法は、動的計画法に基づくNeedleman–Wunschアルゴリズムです。ローカルアライメントは、より大きな配列コンテキスト内に類似領域または類似の配列モチーフが含まれていると疑われる、類似していない配列に対してより有用です。Smith –Watermanアルゴリズムは、同じ動的計画法スキームに基づく一般的なローカルアライメント手法ですが、任意の場所で開始および終了できる追加の選択肢があります。[ 4 ]
半グローバル法または「グローカル」(グローバル・ローカルの略)法として知られるハイブリッド法は、 2 つの配列の可能な限り最良の部分アライメントを探索します(つまり、一方または両方の開始と一方または両方の終了の組み合わせがアライメントされていると宣言されます)。これは、一方の配列の下流部分が他方の配列の上流部分と重複する場合に特に役立ちます。この場合、グローバルアライメントもローカルアライメントも完全には適切ではありません。グローバルアライメントは、重複領域を超えてアライメントを強制的に拡張しようとしますが、ローカルアライメントは重複領域を完全にカバーしない可能性があります。[ 8 ]半グローバルアライメントが役立つもう 1 つのケースは、一方の配列が短く(たとえば遺伝子配列)、もう 1 つの配列が非常に長い場合(たとえば染色体配列)です。この場合、短い配列はグローバル(完全)アライメントされるべきですが、長い配列にはローカル(部分)アライメントのみが必要です。
遺伝子データの急速な増加は、既存のDNA配列アライメントアルゴリズムの速度に課題を突きつけている。効率的かつ正確なDNA変異検出手法には、リアルタイム並列処理のための革新的なアプローチが不可欠である。光コンピューティング手法は、既存の電気的な実装に代わる有望な選択肢として提案されているが、その適用可能性はまだ検証されていない。。
ペアワイズ配列アライメント法は、2 つのクエリ配列の最も一致する部分的 (局所的または全体的) アライメントを見つけるために使用されます。ペアワイズアライメントは一度に 2 つの配列間でのみ使用できますが、計算が効率的であり、極端な精度を必要としない方法 (クエリと高い類似性を持つ配列をデータベースで検索するなど) によく使用されます。ペアワイズアライメントを作成する主な 3 つの方法は、ドットマトリックス法、動的計画法、およびワード法です。[ 1 ]ただし、複数の配列アライメント技術でも、ペアの配列をアライメントできます。各方法にはそれぞれ長所と短所がありますが、3 つのペアワイズ方法すべては、情報量の少ない高度に反復する配列、特にアライメントする 2 つの配列で反復回数が異なる場合に困難を抱えています。
特定のペアワイズアライメントの有用性を定量化する1つの方法は、「最大一意マッチ」(MUM)、つまり両方のクエリ配列に出現する最長のサブシーケンスです。MUMシーケンスが長いほど、計算生物学におけるゲノムの多重配列アライメントにおいて、より近縁であることを示します[ 9 ]。MUMmerなどの大規模なアライメントシステムでは、MUMやその他の潜在的なアンカーの識別が最初のステップです。アンカーは、2つのゲノム間で非常に類似している領域です。MUMとは何かを理解するために、頭字語の各単語を分解してみましょう。マッチとは、アライメントする両方の配列にサブストリングが出現することを意味します。一意とは、各配列にサブストリングが1回だけ出現することを意味します。最後に、最大とは、サブストリングが、上記の2つの要件を満たす別のより大きな文字列の一部ではないことを意味します。この背後にある考え方は、完全に一致し、各ゲノムに1回だけ出現する長いシーケンスは、ほぼ確実にグローバルアライメントの一部であるということです。
より正確に言うと:
「2つのゲノムAとBが与えられたとき、最大一意一致(MUM)部分文字列は、指定された最小長d(デフォルトではd=20)よりも長い長さのAとBの共通部分文字列であり、
- それは最大であり、つまり、不一致を生じさせることなく両端に拡張することはできない。
- 両方の配列においてユニークである」[ 10 ]
ドットマトリックス法は、個々の配列領域のアライメントのファミリーを暗黙的に生成するため、定性的で概念的に単純ですが、大規模な分析には時間がかかります。ノイズがない場合、ドットマトリックス図から挿入、欠失、繰り返し、逆方向繰り返しなどの特定の配列の特徴を視覚的に識別するのは容易です。ドットマトリックス図を作成するには、2 つの配列を 2 次元マトリックスの最上行と最左列に書き込み、適切な列の文字が一致する任意の場所にドットを配置します。これは典型的な再帰プロットです。保守的な置換に対応するために、2 つの文字の類似度に応じてドットのサイズまたは強度を変化させる実装もあります。非常に類似した配列のドットプロットは、マトリックスの主対角線に沿って 1 本の線として表示されます。
ドットプロットを情報表示手法として用いる場合の問題点としては、ノイズ、不明瞭さ、直感性の欠如、2つの配列におけるマッチの要約統計量やマッチ位置の抽出の難しさなどが挙げられます。また、マッチデータが対角線上に重複して表示されるため、無駄なスペースが多く、プロットの実際の領域の大部分が空白またはノイズで占められてしまいます。さらに、ドットプロットは2つの配列に限定されます。これらの制限はMiropeatsアライメント図には当てはまりませんが、Miropeatsアライメント図には独自の欠点があります。
ドットプロットは、単一の配列における反復性を評価するためにも使用できます。配列をそれ自身と比較すると、有意な類似性を持つ領域は主対角線から外れた線として表示されます。この効果は、タンパク質が複数の類似した構造ドメインから構成されている場合に発生します。
動的計画法の手法は、Needleman-Wunsch アルゴリズムによるグローバル アライメントと、Smith-Waterman アルゴリズムによるローカルアライメントの生成に適用できます。一般的な使用法では、タンパク質アライメントは置換行列を使用してアミノ酸の一致または不一致にスコアを割り当て、一方の配列のアミノ酸が他方の配列のギャップに一致する場合にギャップ ペナルティを割り当てます。DNA および RNA アライメントではスコアリング マトリックスを使用する場合があります。ただし、実際には、単に正の一致スコア、負の不一致スコア、および負のギャップ ペナルティを割り当てることがよくあります。(標準的な動的計画法では、各アミノ酸位置のスコアは隣接するアミノ酸の同一性とは無関係であるため、塩基スタッキング効果は考慮されません。ただし、アルゴリズムを修正することで、そのような効果を考慮することは可能です。) 標準的な線形ギャップ コストの一般的な拡張として、アフィン ギャップ コストがあります。ここでは、ギャップを開く場合とギャップを拡張する場合に 2 つの異なるギャップ ペナルティが適用されます。通常、前者は後者よりもはるかに大きく、たとえばギャップを開く場合は -10、ギャップを拡張する場合は -2 です。これにより、アライメントのギャップが少なくなり、残基とギャップが一緒に保持されるため、生物学的配列の特徴がよりよく表れる。Gotohアルゴリズムは、3つの行列を使用してアフィンギャップコストを実装する。[ 11 ] [ 12 ]
動的計画法は、ヌクレオチド配列とタンパク質配列のアラインメントに役立ちます。この作業は、フレームシフト変異(通常は挿入または欠失)を考慮する必要があるため複雑です。フレームサーチ法は、クエリヌクレオチド配列と検索対象のタンパク質配列セットの間、またはその逆の、一連のグローバルまたはローカルなペアワイズアラインメントを生成します。任意の数のヌクレオチドでオフセットされたフレームシフトを評価できるため、この方法は、多数のインデルを含む配列に役立ちます。インデルは、より効率的なヒューリスティック法ではアラインメントが非常に困難な場合があります。実際には、この方法には大量の計算能力、または動的計画法に特化したアーキテクチャを持つシステムが必要です。BLASTおよびEMBOSSスイートは、翻訳されたアラインメントを作成するための基本的なツールを提供します(ただし、これらのアプローチの一部は、ツールの配列検索機能の副作用を利用しています)。より一般的な方法は、GeneWiseなどのオープンソースソフトウェアから入手できます。
動的計画法は、特定のスコアリング関数が与えられた場合、最適なアライメントを見つけることが保証されています。しかし、適切なスコアリング関数を特定することは、理論的な問題というよりは経験的な問題であることが多いです。動的計画法は2つ以上のシーケンスにも拡張可能ですが、シーケンスの数が非常に多い場合や、シーケンスが極めて長い場合は、処理速度が著しく低下します。
ワード法( kタプル法とも呼ばれる)は、最適なアライメント解を見つけることが保証されていないものの、動的計画法よりもはるかに効率的なヒューリスティック法です。これらの方法は、候補配列の大部分がクエリ配列と実質的に有意な一致を示さないことがわかっている大規模なデータベース検索で特に役立ちます。ワード法は、データベース検索ツールFASTAおよびBLASTファミリーでの実装で最もよく知られています。[ 1 ]ワード法は、クエリ配列内の短い重複しない部分配列(「ワード」)のシリーズを識別し、それらを候補データベース配列に一致させます。比較対象の2つの配列におけるワードの相対位置を減算してオフセットを取得します。複数の異なるワードが同じオフセットを生成する場合、これはアライメント領域を示します。この領域が検出された場合にのみ、これらの方法はより感度の高いアライメント基準を適用します。したがって、類似性がほとんどない配列との多くの不要な比較が排除されます。
FASTA 方式では、ユーザーがデータベースの検索に使用する単語長としてk の値を定義します。この方式は、 kの値が小さいほど検索速度は遅くなりますが感度が高く、非常に短いクエリ シーケンスを含む検索にも適しています。BLAST ファミリーの検索方式は、遠縁の配列の一致を検索するなど、特定のタイプのクエリに最適化された多数のアルゴリズムを提供します。BLAST は、精度を大きく損なうことなく FASTA よりも高速な代替手段を提供するために開発されました。FASTA と同様に、BLAST は長さkの単語検索を使用しますが、FASTA のようにすべての単語の一致を評価するのではなく、最も重要な単語の一致のみを評価します。ほとんどの BLAST 実装では、クエリとデータベースの種類に最適化された固定のデフォルトの単語長を使用し、反復的または非常に短いクエリ シーケンスで検索する場合など、特別な状況でのみ変更されます。実装は、EMBL FASTAやNCBI BLASTなどの多数の Web ポータルから入手できます。

多重配列アライメントは、一度に 2 つ以上の配列を取り込むようにペアワイズアライメントを拡張したものです。多重アライメント法は、与えられたクエリ セット内のすべての配列をアライメントしようとします。多重アライメントは、進化的に関連していると仮定される配列群全体にわたって保存された配列領域を特定するためによく使用されます。このような保存された配列モチーフは、構造情報やメカニズム情報と組み合わせて、酵素の触媒活性部位を特定するために使用できます。アライメントは、系統樹を構築することによって進化関係を確立するのにも使用されます。多重配列アライメントは計算上生成が難しく、この問題のほとんどの定式化はNP 完全な組み合わせ最適化問題につながります。[ 13 ] [ 14 ]それにもかかわらず、バイオインフォマティクスにおけるこれらのアライメントの有用性により、3 つ以上の配列をアライメントするのに適したさまざまな方法が開発されました。
動的計画法は理論的には任意の数のシーケンスに適用できますが、時間とメモリの両方で計算コストが高いため、最も基本的な形式では3つまたは4つ以上のシーケンスにはほとんど使用されません。この方法では、2つのシーケンスから形成されるシーケンス行列のn次元相当物を構築する必要があります。ここでnはクエリ内のシーケンスの数です。標準的な動的計画法は、まずすべてのクエリシーケンスのペアに適用され、次に中間位置での可能な一致またはギャップを考慮して「アライメント空間」が埋められ、最終的に各2つのシーケンスのアライメント間で本質的にアライメントが構築されます。この手法は計算コストが高いですが、グローバル最適解が保証されるため、少数のシーケンスのみを正確にアライメントする必要がある場合に役立ちます。動的計画法の計算要求を削減する1つの方法は、「ペアの合計」目的関数に依存しており、 MSA [リンク削除]ソフトウェアパッケージに実装されています。[ 15 ]
プログレッシブ法、階層法、またはツリー法では、まず最も類似した配列をアラインメントし、次にクエリセット全体がソリューションに組み込まれるまで、関連性の低い配列またはグループを順次アラインメントに追加することで、多重配列アラインメントを生成します。配列の関連性を記述する初期ツリーは、FASTAと同様のヒューリスティックなペアワイズアラインメント法を含むペアワイズ比較に基づいています。プログレッシブアラインメントの結果は、「最も関連性の高い」配列の選択に依存するため、初期ペアワイズアラインメントの不正確さに敏感になる可能性があります。ほとんどのプログレッシブ多重配列アラインメント法では、クエリセット内の配列を関連性に応じて重み付けするため、初期配列の選択が不適切になる可能性が低くなり、アラインメントの精度が向上します。
Clustalのプログレッシブ実装[ 16 ] [ 17 ] [ 18 ]の多くのバリエーションは、多重配列アライメント、系統樹の構築、およびタンパク質構造予測の入力として使用されています。プログレッシブメソッドのより遅いが正確なバリアントはT-Coffeeとして知られています。[ 19 ]
反復法は、漸進法の弱点である初期ペアワイズアライメントの精度への過度な依存を改善しようと試みます。反復法は、選択されたアライメントスコアリング方法に基づいて目的関数を最適化し、初期グローバルアライメントを割り当て、次にシーケンスサブセットを再アライメントします。再アライメントされたサブセット自体がアライメントされ、次の反復の多重シーケンスアライメントが生成されます。シーケンスサブグループと目的関数を選択するさまざまな方法が[ 20 ]でレビューされています。
プロファイル解析とも呼ばれるモチーフ探索では、クエリセット内の配列間で短い保存配列モチーフをアラインメントしようとするグローバル多重配列アラインメントを作成します。これは通常、まず一般的なグローバル多重配列アラインメントを作成し、次に高度に保存された領域を分離してプロファイル行列のセットを作成することによって行われます。各保存領域のプロファイル行列はスコアリング行列のように配置されますが、各位置における各アミノ酸またはヌクレオチドの頻度カウントは、より一般的な経験的分布からではなく、保存領域の特性分布から導出されます。次に、プロファイル行列を使用して、特徴付けられたモチーフの出現を他の配列で検索します。元のデータセットに少数の配列しか含まれていない場合、または高度に類似した配列のみが含まれている場合は、擬似カウントを追加して、モチーフで表された特性分布を正規化します。

コンピュータサイエンスで一般的に使用されているさまざまな汎用最適化アルゴリズムも、多重配列アライメント問題に適用されています。隠れマルコフモデルは、与えられたクエリセットの可能な多重配列アライメントのファミリーの確率スコアを生成するために使用されています。初期のHMMベースの方法は期待外れの性能でしたが、後のアプリケーションでは、保守的または半保守的な置換によって生成されるノイズの影響を受けにくいため、遠縁の配列を検出するのに特に効果的であることがわかりました。[ 21 ]遺伝的アルゴリズムとシミュレーテッドアニーリングも、ペアの合計法などのスコアリング関数によって判断される多重配列アライメントスコアの最適化に使用されています。より詳細な情報とソフトウェアパッケージについては、メイン記事の多重配列アライメントを参照してください。
Burrows –Wheeler変換は、 BowtieやBWAなどの一般的なツールにおいて、高速ショートリードアライメントに成功裏に適用されています。FM -indexを参照してください。
構造アライメントは、通常はタンパク質配列、場合によってはRNA配列に特化しており、タンパク質またはRNA分子の二次構造および三次構造に関する情報を使用して配列のアライメントを支援します。これらの方法は2つ以上の配列に使用でき、通常は局所的なアライメントを生成します。ただし、構造情報の利用可能性に依存するため、対応する構造が既知である配列(通常はX線結晶構造解析またはNMR分光法による)にのみ使用できます。タンパク質とRNAの構造はどちらも配列よりも進化的に保存されているため[ 22 ]、構造アライメントは、非常に遠縁で、配列比較では類似性を確実に検出できないほど大きく分岐した配列間でより信頼性が高くなります。
構造アライメントは、相同性に基づくタンパク質構造予測のアライメントを評価する際の「ゴールドスタンダード」として使用されています[ 23 ]。これは、構造アライメントが、配列情報のみに依存するのではなく、構造的に類似したタンパク質配列の領域を明示的に整列させるためです。しかし、クエリセット内の少なくとも1つの配列がモデル化の対象となるものであり、その構造が不明であるため、構造アライメントを構造予測に使用することは明らかにできません。対象配列とテンプレート配列間の構造アライメントが与えられれば、対象タンパク質配列の非常に正確なモデルを作成できることが示されています。相同性に基づく構造予測における大きな障害は、配列情報のみに基づいて構造的に正確なアライメントを作成することです。[ 23 ]
DALI法、または距離行列アライメントは、クエリ配列内の連続するヘキサペプチド間の接触類似性パターンに基づいて構造アライメントを構築するフラグメントベースの方法です。[ 24 ]この方法は、ペアワイズまたはマルチプルアライメントを生成し、 Protein Data Bank (PDB)内のクエリ配列の構造的近傍を特定できます。この方法は、 FSSP構造アライメントデータベース(タンパク質の構造-構造アライメントに基づくフォールド分類、または構造的に類似したタンパク質のファミリー)の構築に使用されています。DALIウェブサーバーはDALIでアクセスでき、FSSPはThe Dali Databaseにあります。
SSAP(sequential structure alignment program)は、構造空間内の原子間ベクトルを比較点として使用する動的計画法に基づく構造アライメント手法です。当初の説明以降、多重アライメントとペアワイズアライメントの両方を含むように拡張され[ 25 ] 、タンパク質フォールドの階層的データベース分類であるCATH(Class、Architecture、Topology、Homology)の構築に使用されています[ 26 ] 。CATHデータベースはCATH Protein Structure Classificationでアクセスできます。
構造アライメントの組み合わせ拡張法は、分析対象の 2 つのタンパク質の短い断片を局所的な幾何学を使用して整列させ、これらの断片をより大きなアライメントに組み立てることによって、ペアワイズ構造アライメントを生成します。[ 27 ]剛体二乗平均平方根距離、残基間距離、局所二次構造、および残基近傍の疎水性などの周囲の環境特性などの尺度に基づいて、「整列された断片ペア」と呼ばれる局所アライメントが生成され、事前定義されたカットオフ基準内のすべての可能な構造アライメントを表す類似性マトリックスの構築に使用されます。次に、成長するアライメントを一度に 1 つの断片ずつ拡張することによって、マトリックスを通して、あるタンパク質構造状態から別のタンパク質構造状態へのパスがトレースされます。このような最適なパスが組み合わせ拡張アライメントを定義します。この方法を実装し、タンパク質データバンクの構造のペアワイズアライメントのデータベースを提供するウェブベースのサーバーは、組み合わせ拡張ウェブサイトにあります。
系統学と配列アライメントは、配列の関連性を評価する必要性が共通しているため、密接に関連した分野です。[ 28 ]系統学の分野では、異なる種のゲノムに存在する相同遺伝子間の進化関係を分類するために使用される系統樹の構築と解釈において、配列アライメントが広く利用されています。クエリセット内の配列の相違の程度は、配列間の進化距離と質的に関連しています。大まかに言えば、配列の同一性が高いということは、問題の配列が比較的若い最近の共通祖先を持っていることを示唆し、同一性が低いということは、分岐がより古いことを示唆します。この近似は、ほぼ一定の進化変化率を使用して、2 つの遺伝子が最初に分岐してから経過した時間 (つまり、合体時間) を外挿できるという「分子時計」仮説を反映しており、突然変異と選択の影響が配列系統全体で一定であると仮定しています。したがって、この方法は、生物種間におけるDNA修復速度の差異や、配列中の特定領域の機能的保存の可能性を考慮していません。(ヌクレオチド配列の場合、分子時計仮説の最も基本的な形態では、特定のコドンの意味を変えないサイレント変異と、タンパク質に異なるアミノ酸が組み込まれる他の変異との間の受容率の差も考慮していません。)より統計的に正確な方法では、系統樹の各枝における進化速度の変動を許容し、遺伝子の合体時間のより正確な推定値を得ることができます。
漸進的多重アライメント手法は、配列を関連性の順に成長中のアライメントに組み込むため、必然的に系統樹を生成します。多重配列アライメントと系統樹を組み立てる他の手法では、まずツリーにスコアを付けてソートし、最もスコアの高いツリーから多重配列アライメントを計算します。系統樹構築に一般的に使用される方法は、主にヒューリスティックです。これは、最適なツリーを選択する問題が、最適な多重配列アライメントを選択する問題と同様に、NP困難であるためです。[ 29 ]
配列アライメントは、バイオインフォマティクスにおいて、配列類似性の特定、系統樹の作成、タンパク質構造の相同性モデルの開発に役立つ。しかし、配列アライメントの生物学的意義は必ずしも明確ではない。アライメントは、共通祖先から派生した配列間の進化的な変化の程度を反映していると想定されることが多いが、進化的に無関係でありながら類似した機能と構造を持つタンパク質間で、収斂進化によって見かけ上の類似性が生じる可能性も理論的には考えられる。
BLASTなどのデータベース検索では、統計的手法を用いて、検索対象のデータベースのサイズと構成に基づいて、配列間または配列領域間の特定のアライメントが偶然に生じる可能性を判定できます。これらの値は、検索空間によって大きく変動する可能性があります。特に、データベースがクエリ配列と同じ生物由来の配列のみで構成されている場合、特定のアライメントが偶然に見つかる可能性が高くなります。データベースまたはクエリ内の反復配列も、検索結果と統計的有意性の評価の両方を歪める可能性があります。BLASTは、統計的なアーティファクトである見かけ上のヒットを回避するために、クエリ内のこのような反復配列を自動的にフィルタリングします。
ギャップのある配列アライメントの統計的有意性推定法は文献で入手可能である。[ 28 ] [ 30 ] [ 31 ] [ 32 ] [ 33 ] [ 34 ] [ 35 ] [ 36 ]
統計的有意性は、特定の品質のアライメントが偶然に生じる確率を示しますが、特定のアライメントが同じ配列の別のアライメントよりもどれだけ優れているかを示すものではありません。アライメントの信頼性の尺度は、特定の配列ペアに対する最もスコアの高いアライメントが実質的にどの程度類似しているかを示します。ギャップのある配列アライメントのアライメント信頼性推定方法は文献に記載されています。[ 37 ]
既知の配列に関する生物学的または統計的観察を反映するスコアリング関数の選択は、良好なアライメントを作成する上で重要です。タンパク質配列は、特定の文字から文字への置換の確率を反映する置換行列を使用してアライメントされることがよくあります。PAM行列(Point Accepted Mutation matrices、元々はマーガレット・デイホフによって定義され、「デイホフ行列」と呼ばれることもある)と呼ばれる一連の行列は、特定のアミノ酸変異の速度と確率に関する進化的近似を明示的に符号化します。もう1つの一般的なスコアリング行列のシリーズであるBLOSUM(Blocks Substitution Matrix)は、経験的に導出された置換確率を符号化します。両方のタイプの行列のバリアントは、異なるレベルの分岐を持つ配列を検出するために使用され、BLASTまたはFASTAのユーザーが検索をより近縁の一致に限定したり、より分岐した配列を検出するように拡張したりすることを可能にします。ギャップペナルティは、ヌクレオチド配列とタンパク質配列の両方におけるギャップの導入(進化モデルでは挿入または欠失変異に相当)を考慮に入れるため、ペナルティ値はそのような変異の予想発生率に比例するべきである。したがって、生成されるアライメントの品質は、スコアリング関数の品質に依存する。
スコアリングマトリックスやギャップペナルティ値など、異なる選択肢を用いて同じアライメントを複数回試行し、結果を比較することは、非常に有益で参考になります。アライメントパラメータの変動に対してどの領域が頑健であるかを観察することで、解が弱い、あるいは一意でない領域を特定できる場合が多くあります。
発現配列タグや全長mRNAなどの配列決定されたRNAは、配列決定されたゲノムにアラインメントすることで、遺伝子の位置を特定し、代替スプライシング[ 38 ]やRNA編集[ 39 ]に関する情報を得ることができます。配列アラインメントはゲノムアセンブリの一部でもあり、配列をアラインメントして重複部分を見つけ、コンティグ(長い配列の断片)を形成できるようにします[ 40 ] 。もう1つの用途はSNP解析で、異なる個体の配列をアラインメントして、集団内でしばしば異なる単一の塩基対を見つけます[ 41 ] 。
生物学的配列アライメントに使用される手法は、他の分野にも応用されており、特に自然言語処理や社会科学では、Needleman-Wunsch アルゴリズムが通常最適マッチングと呼ばれています。[ 42 ]自然言語生成アルゴリズムで単語を選択する要素のセットを生成する技術は、コンピュータで生成された数学的証明の言語バージョンを作成するために、バイオインフォマティクスから多重配列アライメント技術を借用しています。[ 43 ]歴史言語学および比較言語学の分野では、配列アライメントは、言語学者が伝統的に言語を再構築する比較方法を部分的に自動化するために使用されています。[ 44 ]ビジネスおよびマーケティング調査でも、時間の経過に伴う一連の購入を分析するために多重配列アライメント技術が適用されています。[ 45 ]
アルゴリズムとアライメントの種類別に分類された利用可能なソフトウェアのより完全なリストは、sequence alignment softwareで入手できますが、一般的な配列アライメントタスクに使用される一般的なソフトウェアツールには、アライメント用の ClustalW2 [ 46 ]と T-coffee [ 47 ]、データベース検索用の BLAST [ 48 ]と FASTA3x [ 49 ]があります。DNASTAR Lasergene、Geneious、PatternHunterなどの商用ツールも利用可能です。配列アライメントを実行するツールは、bio.toolsレジストリにリストされています。
アライメントアルゴリズムとソフトウェアは、 BAliBASE と呼ばれる標準化されたベンチマーク参照多重配列アライメントセットを使用して直接比較できます。[ 50 ]このデータセットは構造アライメントで構成されており、純粋に配列ベースの方法を比較するための標準とみなすことができます。頻繁に遭遇するアライメント問題に対する多くの一般的なアライメント方法の相対的なパフォーマンスが表にまとめられ、選択された結果が BAliBASE でオンラインで公開されています。[ 51 ] [ 52 ]多くの (現在 12 種類) の異なるアライメントツールの BAliBASE スコアの包括的なリストは、タンパク質ワークベンチ STRAP 内で計算できます。[ 53 ]
{{cite journal}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)