FASTAは、 1985年にDavid J. LipmanとWilliam R. Pearsonによって初めて記述されたDNAおよびタンパク質配列アライメントソフトウェアパッケージです。[ 1 ]その遺産は、現在バイオインフォマティクスで広く使用されているFASTAフォーマットです。
オリジナルの FASTA プログラムは、タンパク質配列の類似性検索用に設計されました。1980 年代には遺伝情報が指数関数的に増加し、コンピュータの速度とメモリが限られていたため、クエリ配列をデータベース全体にアラインメントするヒューリスティックな方法が導入されました。1987 年に公開された FASTA では、DNA:DNA 検索、翻訳されたタンパク質:DNA 検索を実行する機能が追加され、統計的有意性を評価するためのより高度なシャッフル プログラムも提供されました。[ 2 ]このパッケージには、タンパク質配列と DNA 配列のアラインメントを可能にするプログラムがいくつかあります。今日では、コンピュータの性能が向上したことにより、 Smith–Waterman アルゴリズムを使用してデータベース内の局所アラインメント検出の検索を実行できるようになりました。
FASTAは「ファストA」と発音され、「FAST-All」の略です。これは、あらゆるアルファベットに対応していることから、元の「FAST-P」(タンパク質)および「FAST-N」(ヌクレオチド)アライメントツールの拡張版と言えます。

現在のFASTAパッケージには、タンパク質間、DNA間、タンパク質と翻訳済みDNA(フレームシフトあり)、および順序付きまたは順序なしのペプチド検索のためのプログラムが含まれています。FASTAパッケージの最新バージョンには、ヌクレオチド配列データとタンパク質配列データを比較する際に、フレームシフトエラーを正しく処理する特別な翻訳検索アルゴリズムが含まれています(6フレーム翻訳検索ではフレームシフトエラーの処理が不十分な場合があります)。
FASTAパッケージは、高速なヒューリスティック探索手法に加えて、最適なSmith–Watermanアルゴリズムの実装であるSSEARCHを提供します。
このパッケージの主な目的は、正確な類似性統計を計算することです。これにより、生物学者はアライメントが偶然に起こった可能性が高いか、相同性を推測するために使用できるかを判断できます。FASTAパッケージは、バージニア大学[ 3 ]および欧州バイオインフォマティクス研究所[ 4 ]から入手できます。
このソフトウェアの入力として使用されるFASTAファイル形式は、現在では他の配列データベース検索ツール( BLASTなど)や配列アライメントプログラム(Clustal、T-Coffeeなど)で広く使用されています。
FASTAは、与えられたヌクレオチドまたはアミノ酸配列を受け取り、局所的な配列アライメントを使用して、対応する配列データベースを検索し、類似のデータベース配列の一致を見つけます。
FASTAプログラムは、実行速度の速さに貢献する、主にヒューリスティックな手法を採用しています。まず、指定された長さの単語の一致パターンを観察し、潜在的な一致箇所をマークした後、スミス・ウォーターマン型のアルゴリズムを用いた、より時間のかかる最適化された検索を実行します。
パラメータ kmer で指定される単語のサイズは、プログラムの感度と速度を制御します。k -mer の値を大きくすると、バックグラウンドヒットの検出数が減少します。プログラムは、返された単語ヒットの中から、近くにヒットが集中しているセグメントを探します。そして、これらのセグメントを調査して、一致する可能性のある単語を探します。
fastnとfastpには使用する配列の種類に関していくつかの違いがありますが、どちらも4つのステップを使用し、3つのスコアを計算して配列類似性の結果を記述およびフォーマットします。それらは以下のとおりです。

FASTA は、低複雑性領域を小文字でエンコードし、-S オプションを使用することで、配列をアラインメントする前に複雑性領域を除去できます。ただし、BLAST プログラムでは、偏った構成統計を補正するためのオプションがさらに多く提供されています。そのため、FASTA 配布パッケージに PRSS プログラムが追加されました。PRSS は、データベース内の一致する配列を 1 文字レベルでシャッフルするか、ユーザーが長さを決定できる短いセグメントをシャッフルします。シャッフルされた配列は再びアラインメントされ、スコアが予想よりも高い場合は、クエリにマッピングされたままの低複雑性領域が混ざっていることが原因です。シャッフルされた配列が獲得するスコアの量によって、PRSS は元の配列のスコアの有意性を予測できます。シャッフルされた配列のスコアが高いほど、元のデータベースとクエリ配列の間で見つかった一致の有意性は低くなります。[ 5 ]
FASTAプログラムは、タンパク質またはDNAのデータベースを検索したり、配列内の局所的な重複を特定したりすることで、タンパク質またはDNA配列間の局所的または全体的な類似領域を検出します。他のプログラムは、アライメントの統計的有意性に関する情報を提供します。BLASTと同様に、FASTAは配列間の機能的および進化的関係を推測したり、遺伝子ファミリーのメンバーを特定したりするために使用できます。
スコアの統計的有意性は通常、順列検定によって決定されます。クエリデータはランダムに並べ替えられ(ヌクレオチド/アミノ酸比は変更されません)、対応するスコアが計算されます。スコアを比較する場合、進化モデルに基づく仮定は行われず、代わりに基となるデータをランダムに並べ替えることで有意でない(帰無仮説)と判断します。これは、置換行列(通常はアミノ酸の場合はBLOSUMまたはPAM)から導出されたモデル化された分布(Karlin-Altschul検定統計量[ 6 ])に基づく統計的検定を使用するBLASTとは対照的です。これにより仮説検定は大幅に遅くなりますが、異常なアミノ酸組成の処理も可能になります。