| ファイル名拡張子 |
.fasta、.fas、.fa、.fna、.ffn、.faa、.mpfa、.frn |
|---|---|
| インターネットメディアの種類 | text/x-fasta |
| 統一型識別子 (UTI) | いいえ |
| 開発者 | デビッド・J・リップマン ウィリアム ・R・ピアソン[1] [2] |
| 初回リリース | 1985 |
| フォーマットの種類 | バイオインフォマティクス |
| 延長 | FASTAのASCII |
| 延長 | FASTQフォーマット[3] |
| Webサイト | www.ncbi.nlm.nih.gov/BLAST/fasta.shtml |
バイオインフォマティクスと生化学において、FASTA 形式は、ヌクレオチド配列またはアミノ酸 (タンパク質) 配列を表すテキストベースの形式であり、ヌクレオチドまたはアミノ酸は1 文字のコードを使用して表されます。
このフォーマットでは、配列名とコメントを配列の前に付けることができます。これはFASTAソフトウェアパッケージから始まり、それ以来バイオインフォマティクスのほぼ普遍的な標準となっています。[4]
FASTA 形式はシンプルなので、テキスト処理ツールやスクリプト言語を使用してシーケンスを操作および解析することが容易になります。
概要
シーケンスは大なり記号 (>") で始まり、その後にシーケンスの説明が続きます (すべて 1 行で)。説明行の直後の行はシーケンス表現で、アミノ酸または核酸ごとに 1 文字で構成され、通常は 80 文字以内です。
例えば:
>MCHU - カルモジュリン - ヒト、ウサギ、ウシ、ラット、ニワトリ
MADQLTEEQIAEFKEAFSLFDKDGDGTITTKELGTVMRSLGQNPTEAELQDMINEVDADGNGTID
FPEFLTMMARKMKDTDSEEEIREAFRVFDKDGNGYISAAELRHVMTNLGEKLTDEEVDEMIREA
ありがとう*
オリジナルフォーマット
オリジナルの FASTA/ Pearson形式は、 FASTAプログラム スイートのドキュメントに記載されています。FASTA の無料配布物からダウンロードできます (fasta20.doc、fastaVN.doc、または fastaVN.me を参照してください。VN はバージョン番号です)。
元の形式では、シーケンスは一連の行として表現され、各行は 120 文字以内で、通常は 80 文字を超えませんでした。これはおそらく、ソフトウェアで固定の行サイズを事前に割り当てられるようにするためでした。当時、ほとんどのユーザーは、1 行に 80 文字または 132 文字を表示できるDigital Equipment Corporation (DEC) VT220 (または互換) 端末に依存していました。 [5] [6]ほとんどの人は 80 文字モードで大きなフォントを好んだため、FASTA 行では 80 文字以下 (多くの場合 70 文字) を使用するのが推奨されるようになりました。また、標準的な印刷ページの幅は 70 から 80 文字です (フォントによって異なります)。したがって、80 文字が標準になりました。[7]
FASTA ファイルの最初の行は、">" (大なり) 記号で始まるか、まれに ";" [8] (セミコロン) で始まる場合、コメントとして扱われます。セミコロンで始まる後続の行はソフトウェアによって無視されます。使用されるコメントは最初の行だけであったため、すぐに、一意のライブラリ アクセス番号で始まるシーケンスの概要説明を保持するために使用されるようになりました。時間の経過とともに、最初の行には常に ">" を使用し、";" コメント (そうでない場合は無視されます) を使用しないことが一般的になりました。
最初の行 (シーケンスの一意の説明に使用) の次には、標準の 1 文字の文字列で実際のシーケンス自体が続きます。有効な文字以外はすべて無視されます (スペース、タブ、アスタリスクなど)。シーケンスを "*" (アスタリスク) 文字で終了することも一般的です (PIR 形式のシーケンスでの使用に類似)。また、同じ理由で、説明とシーケンスの間に空白行を残します。以下に、いくつかのサンプル シーケンスを示します。
;LCBO - プロラクチン前駆体 - ウシ
; FASTA形式のサンプル配列
MDSKGSSQKGSRLLLLLVVSNLLLCQGVVSTPVCPNGPGNCQVSLRDLFDRAVMVSHYIHDLSS
EMFNEFDKRYAQGKGFITMALNSCHTSSLPTPEDKEQAQQTHHEVLMSLILGLLRSWNDPLYHL
VTEVRGMKGAPDAILSRAIEIEEENKRLLEGMEMIFGQVIPGAKETEPYPVWSGLPSLQTKDED
安全で健康的
>MCHU - カルモジュリン - ヒト、ウサギ、ウシ、ラット、ニワトリ
MADQLTEEQIAEFKEAFSLFDKDGDGTITTKELGTVMRSLGQNPTEAELQDMINEVDADGNGTID
FPEFLTMMARKMKDTDSEEEIREAFRVFDKDGNGYISAAELRHVMTNLGEKLTDEEVDEMIREA
ありがとう*
>gi|5524211|gb|AAD44166.1|シトクロム b [Elephas maximus maximus]
LCLYTHIGRNIYYGSYLYSETWNTGIMLLLITMATAFMGYVLPWGQMSFWGATVITNLFSAIPYIGTNLV
EWIWGGFSVDKATLNRFFAFHFILPFTMVALAGVHLTFLHETGSNNPLGLTSDSDKIPFHPYYTIKDFLG
LILILLLLALLSPDMLGDPDNHMPADPLNTPLHIKPEWYFLFAYAILRSVPNKLGGVLALFLSIVIL
GLMPFLHTSKHRSMMLRPLSQALFWTLTMDLLTLTWIGSQPVEYPYTIIGQMASILYFSIILAFLPIAGX
イエニー
複数シーケンス FASTA 形式、またはマルチ FASTA 形式は、複数の単一シーケンス FASTA ファイルを 1 つのファイルに連結することによって得られます。これは、FASTA ファイルの最初の行のみが「;」または「>」で始まることができるため、形式との矛盾を意味するものではありません。これにより、後続のすべてのシーケンスは、個別のシーケンスとして扱われるために「>」で始まる必要があります (さらに、シーケンス定義行に「>」を排他的に予約する必要があります)。したがって、上記の例をまとめると、マルチ FASTA ファイルになります。
FASTA 形式に依存する最新のバイオインフォマティクス プログラムでは、シーケンス ヘッダーの前に ">" が付くことが想定されています。シーケンスは一般に「インターリーブ」として、つまり上記の例のように複数行で表されますが、「シーケンシャル」として、つまり 1 行で表される場合もあります。異なるバイオインフォマティクス プログラムを実行するには、「シーケンシャル」と「インターリーブ」の FASTA 形式間の変換が必要になる場合があります。
説明文
">" で始まる説明行 (defline) またはヘッダー/識別子行には、シーケンスの名前や一意の識別子が与えられ、追加情報も含まれる場合があります。廃止された方法では、ヘッダー行に ^A (Control-A) 文字で区切られた複数のヘッダーが含まれることがありました。元のPearson FASTA 形式では、行の先頭のセミコロンで区別される 1 つ以上のコメントがヘッダーの後に続く場合があります。一部のデータベースおよびバイオインフォマティクス アプリケーションはこれらのコメントを認識せず、NCBI FASTA 仕様に従います。複数シーケンス FASTA ファイルの例を次に示します。
>シーケンス_1
MTEITAAMVKELRESTGAGMMDCKNALSETNGDFDKAVQLLREKGLGKAAKKADRLAAEG
LVSVKVSDDFTIAAMRPSYLSYEDLDMTFVENEYKALVAELEKENEERRRLKDPNKPEHK
IPQFASRKQLSDAILKEAEEKIKEELKAQGKPEKIWDNIIPGKMNSFIADNSQLDSKLTL
MGQFYVMDDKKTVEQVIAEKEKEFGGKIKIVEFICFEVGEGLEKKTEDFAAEVAAQL
>シーケンス_2
SATVSEINSETDFVAKNDQFIALTKDTTAHIQSNSLQSVEELHSSTINGVKFEEYLKSQI
ATIGENLVVRRFATLKAGANGVVNGYIHTNGRVGVVIAAACDSAEVASKSRDLLRQICMH
NCBI識別子
NCBIは、ヘッダー行の配列に使用される一意の識別子(SeqID)の標準を定義しました。これにより、データベースから取得された配列に、そのデータベースレコードへの参照をラベル付けすることができます。データベース識別子の形式は、makeblastdbやなどのNCBIツールによって認識されますtable2asn。次のリストは、NCBI FASTAで定義された配列識別子の形式を示しています。[9]
上記のリストの縦棒 ("|") は、バッカス・ナウア形式の意味での区切り文字ではありませんが、形式の一部です。複数の識別子を連結することもでき、縦棒で区切ることもできます。
シーケンス表現
ヘッダー行に続いて、実際の配列が表されます。配列はタンパク質配列または核酸配列であり、ギャップまたはアライメント文字を含むことができます (配列アライメントを参照)。配列は、標準の IUB/IUPACアミノ酸および核酸コードで表されますが、次の例外があります。小文字は受け入れられ、大文字にマッピングされます。単一のハイフンまたはダッシュを使用してギャップ文字を表すことができます。アミノ酸配列では、U と * は受け入れられる文字です (以下を参照)。数字は許可されていませんが、一部のデータベースでは配列内の位置を示すために使用されます。サポートされている核酸コードは次のとおりです: [10] [11] [12]
サポートされているアミノ酸コード (22 個のアミノ酸と 3 個の特殊コード) は次のとおりです。
FASTA ファイル
ファイル名拡張子
FASTA 形式のシーケンスを含むテキスト ファイルには、標準的なファイル名拡張子はありません。以下の表に、各拡張子とその意味を示します。
圧縮
FASTAファイルの圧縮には、識別子と配列の両方の情報チャネルを処理するための特定の圧縮器が必要です。圧縮結果を向上させるために、これらは主に2つのストリームに分割され、独立性を前提として圧縮されます。たとえば、アルゴリズムMFCompress [14]は、コンテキストモデリングと算術符号化を使用してこれらのファイルのロスレス圧縮を実行します。ゲノムファイルを圧縮するためのソフトウェアパッケージであるGenozip [15]は、拡張可能なコンテキストベースのモデルを使用します。FASTAファイル圧縮アルゴリズムのベンチマークは、2016年にHosseiniらによって報告されています。[16] Kryukovらは2020年に報告しました。[17]
暗号化
FASTAファイルの暗号化は、CryfaやGenozipなどのさまざまなツールで実行できます。CryfaはAES暗号化を使用し、データ圧縮も可能にします。[18] [19]同様に、Genozipは圧縮時にFASTAファイルをAES-256で暗号化できます。[15]
拡張機能
FASTQフォーマットは、配列に関する情報を示すために拡張されたFASTAフォーマットの一種です。ケンブリッジのサンガーセンターによって作成されました。[3]
A2M/A3Mは、配列アライメントに使用されるFASTA由来のフォーマットのファミリーです。A2M/A3M配列では、小文字は挿入を意味するものとみなされ、他の配列ではドット(「.」)文字として示されます。ドットは、情報を失うことなく簡潔にするために破棄することができます。アライメントで使用される一般的なFASTAファイルと同様に、ギャップ(「-」)は正確に1つの位置を意味します。[20] A3MはA2Mに似ていますが、挿入にアライメントされたギャップも破棄できるというルールが追加されています。[21]
FASTA ファイルの操作
コミュニティからは、FASTA ファイルの操作を行うためのユーザーフレンドリーなスクリプトが多数提供されています。FaBox [22]や Galaxy サーバー内の FASTX-Toolkit などのオンライン ツールボックスも利用できます。[23]これらを使用すると、シーケンス ヘッダー/識別子を分離したり、名前を変更したり、短縮したり、必要な識別子のリストに基づいて大規模な FASTA ファイルから目的のシーケンスを抽出したりできます (他の利用可能な機能もいくつかあります)。FigTreeビューアで目的のシーケンスの色付けや注釈に基づいて、複数の FASTA ファイルを並べ替えるツリーベースのアプローチ (TREE2FASTA [24] ) も存在します。さらに、 Bioconductor Biostringsパッケージを使用して、 Rで FASTA ファイルを読み込んで操作できます。[25]
複数のFASTAファイルを異なるフォーマット(NEXUS、PHYLIPなど)に素早く再フォーマットし、異なる系統発生プログラムで使用できるようにするためのオンラインフォーマットコンバーターがいくつか存在し、例えばphylogeny.frで利用できるコンバーターなどがある。[26]
参照
- FASTQ 形式は、DNA シーケンサーの読み取りと品質スコアを表すために使用されます。
- SAMおよびCRAM形式は、ゲノム配列に整列されたゲノムシーケンサーの読み取りを表すために使用されます。
- GVF 形式 (Genome Variation Format) は、 GFF3形式に基づく拡張です。
参考文献
- ^ Lipman DJ、 Pearson WR (1985 年 3 月)。「迅速で高感度なタンパク質類似性検索」。Science . 227 (4693): 1435–41。Bibcode : 1985Sci ...227.1435L。doi :10.1126/science.2983426。PMID 2983426 。
- ^ Pearson WR、Lipman DJ (1988年4月)。「生物学的配列比較のための改良ツール」。 米国科学アカデミー紀要。85 (8):2444–8。Bibcode : 1988PNAS ... 85.2444P。doi : 10.1073 / pnas.85.8.2444。PMC 280013。PMID 3162770。
- ^ ab Cock PJ、Fields CJ、Goto N、Heuer ML、Rice PM (2010 年 4 月)。「品質スコア付きシーケンスの Sanger FASTQ ファイル形式と Solexa/Illumina FASTQ バリアント」。核酸研究。38 ( 6 ): 1767–71。doi :10.1093/ nar /gkp1137。PMC 2847217。PMID 20015970。
- ^ 「FASTA形式とは?」Zhang Lab . 2022年12月4日時点のオリジナルよりアーカイブ。2022年12月4日閲覧。
- ^ Landsteiner, mass:werk, Norbert (2019-02-20). 「(Now Go Bang!) Raster CRT Typography (According to DEC)」. Now Go Bang! — mass:werk / Blog . 2024-03-15閲覧。
{{cite web}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ 「VT220 組み込みグリフ」。VT100 。2024年3月15日閲覧。
- ^ 「なぜコード幅の「標準」制限は 80 文字なのでしょうか?」。ソフトウェア エンジニアリング Stack Exchange。2024年 3 月 15 日閲覧。
- ^ 「FASTA データベース形式」. www.loc.gov。 2023-08-01 。2024 年 3 月 15 日に取得。
- ^ NCBI C++ ツールキットブック。国立生物工学情報センター。2018年 12 月 19 日閲覧。
- ^ Tao Tao (2011-08-24). 「ヌクレオチドの1文字コード」. [NCBIラーニングセンター] .国立生物工学情報センター. 2012-09-14時点のオリジナルからアーカイブ。2012-03-15に取得。
- ^ 「IUPAC コード表」。NIAS DNA バンク。2011 年 8 月 11 日時点のオリジナルよりアーカイブ。
- ^ "anysymbol". MAFFT - 多重配列アライメントプログラム。
- ^ 「Alignment Fileformats」. 2019年5月22日. 2019年5月22日閲覧。
- ^ Pinho AJ、Pratas D (2014 年 1 月)。 「MFCompress: FASTA およびマルチ FASTA データ用の圧縮ツール」。バイオインフォマティクス。30 (1): 117-8.土井:10.1093/バイオインフォマティクス/btt594。PMC 3866555。PMID 24132931。
- ^ ab Lan, Divon; Tobler, Ray; Souilmi, Yassine; Llamas, Bastien (2021-02-15). 「Genozip: ユニバーサル拡張可能ゲノムデータコンプレッサー」.バイオインフォマティクス. 37 (16): 2225–2230. doi :10.1093/bioinformatics/btab102. ISSN 1367-4803. PMC 8388020. PMID 33585897 .
- ^ ホセイニ、モルテザ;プラタス、ディオゴ。ピニョ、アルマンド J. (2016) 「生物配列のデータ圧縮手法に関する調査」情報。7 (4): 56.土井: 10.3390/info7040056。ISSN 2078-2489。
- ^ Kryukov K, Ueda MT, Nakagawa S, Imanishi T (2020年7月). 「シーケンス圧縮ベンチマーク(SCB)データベース—FASTA形式のシーケンスに対する参照フリーコンプレッサーの包括的な評価」. GigaScience . 9 (7): giaa072. doi :10.1093/gigascience/giaa072. PMC 7336184 . PMID 32627830.
- ^ Pratas D、Hosseini M、Pinho A (2017)。「Cryfa: FASTA ファイルを圧縮および暗号化するツール」。第11 回国際計算生物学およびバイオインフォマティクス実用化会議 (PACBB) 。インテリジェント システムとコンピューティングの進歩。第 616 巻。Springer。pp. 305–312。doi :10.1007/978-3-319-60816-7_37。ISBN 978-3-319-60815-0。
- ^ Hosseini, Morteza; Pratas, Diogo; Pinho, Armando J (2019-01-01). Berger, Bonnie (ed.). 「Cryfa: ゲノムデータ用の安全な暗号化ツール」.バイオインフォマティクス. 35 (1): 146–148. doi :10.1093/bioinformatics/bty645. ISSN 1367-4803. PMC 6298042. PMID 30020420 .
- ^ 「A2M アライメント形式の説明」。SAMtools。2022年8月15日時点のオリジナルよりアーカイブ。
- ^ "soedinglab/hh-suite: Reformat.pl". GitHub。 2022 年 11 月 20 日。
- ^ Villesen, P. (2007). 「FaBox: fasta 配列のオンライン ツールボックス」.分子生態学ノート. 7 (6): 965–968. doi :10.1111/j.1471-8286.2007.01821.x. ISSN 1471-8278.
- ^ Blankenberg D, Von Kuster G, Bouvier E, Baker D, Afgan E, Stoler N, Galaxy Team, Taylor J, Nekrutenko A (2014). 「Galaxy ToolShed による科学ソフトウェアの普及」.ゲノム生物学. 15 (2): 403. doi : 10.1186/gb4161 . PMC 4038738. PMID 25001293 .
- ^ Sauvage T、Plouviez S、Schmidt WE 、 Fredericq S (2018 年 3 月)。「TREE2FASTA: 探索的系統樹から FASTA 配列をバッチ抽出するための柔軟な Perl スクリプト」。BMC研究ノート。11 ( 1): 403。doi : 10.1186 /s13104-018-3268- y。PMC 5838971。PMID 29506565。
- ^ Pagès, H; Aboyoun, P; Gentleman, R; DebRoy, S (2018). 「Biostrings: 生物学的ストリングの効率的な操作」. Bioconductor.org . R パッケージ バージョン 2.48.0. doi :10.18129/B9.bioc.Biostrings.
- ^ Dereeper A、Guignon V、Blanc G、Audic S、Buffet S、Chevenet F、Dufayard JF、Guindon S、Lefort V、Lescot M、Claverie JM、Gascuel O (2008 年 7 月)。「Phylogeny.fr: 非専門家向けの堅牢な系統発生分析」。核酸研究。36 ( Web サーバー版): W465–9。doi : 10.1093/ nar /gkn180。PMC 2447785。PMID 18424797。
外部リンク
- バイオコンダクター
- FASTX ツールキット
- FigTree ビューア
- 系統発生学.fr
- GTO
