| 開発者 | セドリック ノートルダム、セントロ デ レグラシオ ジェノミカ (CRG) - バルセロナ |
|---|---|
| 安定版リリース | 13.45.0.4846264 / 2020年10月15日 |
| プレビューリリース | 13.45.33.7d7e789 / 2020年12月23日 |
| リポジトリ |
|
| オペレーティング·システム | Unix、Linux、Windows、macOS |
| タイプ | バイオインフォマティクスツール |
| ライセンス | ライセンス |
| Webサイト | 詳しくはこちら |
T-Coffee ( Tree-based Consistency Objective Function for Alignment Evaluation ) は、プログレッシブアプローチを使用した多重配列アライメントソフトウェアです。 [1]多重配列アライメントをガイドするために、ペアワイズアライメントのライブラリを生成します。 また、以前に取得した多重配列アライメントを組み合わせることもでき、最新バージョンではタンパク質データバンク(PDB) ファイルの構造情報を使用できます (3D-Coffee)。 アライメントの品質を評価する高度な機能と、モチーフの発生を識別する能力があります (Mocca)。 デフォルトでは aln 形式 ( Clustal ) でアライメントを生成しますが、 PIR、 MSF、およびFASTA 形式も生成できます。 最も一般的な入力形式 ( FASTA、Protein Information Resource (PIR)) がサポートされています。
アルゴリズム
T-Coffeeアルゴリズムは2つの主な機能から構成されています。1つ目は、異種データソースを使用して、複数のアライメントを生成するためのシンプルで柔軟な手段を提供できることです。T-Coffeeは、ローカルとグローバルのペアワイズアライメントを組み合わせて生成されたライブラリを使用して、複数のアライメントを計算できます。[1]
2 つ目は「最適化法」で、 Clustal Wで使用されるものと比較できる漸進的な戦略を使用して、入力ライブラリ内のペアワイズ アラインメントに最も適合する多重アラインメントを見つけるために使用されます。最適化法には、高速で堅牢であるという利点があります。ライブラリ内の情報は漸進的なアラインメントを実行するために使用され、漸進的な多重アラインメントの各ステップを実行する際にすべてのペア間のアラインメントを考慮するという作業を容易にします。[1]
アライメントのプライマリライブラリの生成
ライブラリには、アラインメントするすべての配列間のペアワイズアラインメントのセットが組み込まれていますが、アラインメントは一貫している必要はありません。ライブラリ内には、N(N-1)/2Nが配列の数である各配列に関する情報が含まれています。配列の各ペアには2つのアラインメントソースが使用され、1つはローカルとして分類され、もう1つはグローバルとして分類されます。[1]
グローバルアラインメントは、 Clustal W を用いて配列に対して 2 つずつ構築され、各配列ペア間に 1 つの完全長アラインメントが生成されます。ローカルアラインメントは、 FASTAパッケージの Lalign プログラムを使用して収集された、スコアの高い 10 個の非交差ローカルアラインメントです。[1]
各アライメントは、ペアワイズ残基マッチのリストとしてライブラリに表され、各ペアは制約です。ただし、一部の制約は他の制約よりも関連性があります。各制約の重要性は、どの制約が正しい可能性が高いかによって異なります。複数のアライメントを計算する際には、重み付けスキームを使用して最も信頼性の高い残基ペアに優先順位が付けられます。[1]
ライブラリの組み合わせ
ローカルおよびグローバルアライメント情報の効率的な組み合わせは、T-Coffee の重要な要素です。Clustal W および Lalign プライマリライブラリを使用すると、追加のプロセスでこれを実現できます。両方のライブラリ間で重複したペアは、両方のペアの合計の重みを持つ単一のエントリにマージされます。それ以外の場合は、ペアの新しいエントリが作成されます。重みが 0 のペアは表示されません。[1]ライブラリ内のアライメントされた残基の各ペアに対して、それらの残基が一貫してアライメントされている度合いに属する重みを割り当てることができます。これはライブラリ拡張と呼ばれます。
他のアライメントソフトウェアとの比較
デフォルトの出力は Clustal のような形式ですが、ClustalW/X の出力とは大きく異なるため、Clustal 形式をサポートする多くのプログラムでは読み込めません。幸い、ClustalX はT-Coffee の出力をインポートできるため、この問題の最も簡単な修正方法は通常、T-Coffee の出力を ClustalX にインポートしてから再度エクスポートすることです。もう 1 つの方法は、オプション " -output=clustalw_aln" を使用して厳密な ClustalW 出力形式を要求することです。
T-Coffee の重要な特徴は、さまざまな方法とさまざまなデータ タイプを組み合わせることができることです。最新バージョンの T-Coffee では、タンパク質の配列と構造、RNA の配列と構造を組み合わせることができます。また、最も一般的な配列と構造のアライメント パッケージの出力を実行して組み合わせることもできます。
T-Coffee には、seq_reformat という高度なシーケンス再フォーマット ユーティリティが付属しています。詳細なドキュメントがオンラインで入手できます。
バリエーション
- M-Coffee: T-Coffee の特別なモードで、最も一般的な多重配列アライメント パッケージ (Muscle、ClustalW、Mafft、ProbCons など) の出力を組み合わせることができます。結果として得られるアライメントは個々のアライメントよりもわずかに優れていますが、最も重要なのは、プログラムがさまざまなパッケージが一致するアライメント領域を示すことです。一致率の高い領域は通常、適切にアライメントされています。[2]
- Expressoと3D-Coffee: これらはT-Coffeeの特別なモードで、配列と構造を組み合わせてアラインメントを行うことができます。構造ベースのアラインメントは、TMalign、Mustang、sapなどの最も一般的な構造アライナーを使用して実行できます。[3] [4] [5] [6]
- R-Coffee: T-Coffeeの特別なモードで、二次構造情報を使用しながらRNA配列をアラインメントすることが可能です。[7] [8]
- PSI-Coffee: 相同性拡張法を用いて遠縁のタンパク質をアラインメントする(低速かつ正確)[9] [10]
- TM-Coffee: 相同性拡張法を用いて膜貫通タンパク質を整列させる[11]
- プロコーヒー:相同プロモーター領域を整列させる[12]
- 正確性:DNA、RNA、タンパク質に対して最も正確なモードを自動的に組み合わせます(実験的)。[13]
- 結合: 2つ(またはそれ以上)の多重配列アライメントを1つに結合します。[1] [9]
評価
推移的一貫性スコア(TCS)は、T-Coffeeスコアリングスキームの拡張バージョンです。[14] T-Coffeeのペアワイズアラインメントライブラリを使用して、サードパーティのMSAを評価します。ペアワイズプロジェクションは高速または低速の方法で生成できるため、速度と精度のトレードオフが可能です。TCSは、Heads-or-Tails、GUIDANCE、Gblocks、およびtrimAlと比較して、構造精度の推定値が大幅に向上し、系統樹の精度が向上することが示されています。[15]
参照
参考文献
- ^ abcdefgh Notredame C, Higgins DG , Heringa J (2000-09-08). 「T-Coffee: 高速かつ正確な多重配列アラインメントを実現する新しい手法」J Mol Biol . 302 (1): 205–217. doi :10.1006/jmbi.2000.4042. PMID 10964570. S2CID 10189971.
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ Wallace, Iain M.; O'Sullivan, Orla; Higgins, Desmond G.; Notredame, Cedric (2006). 「M-Coffee: 複数の配列アラインメント法とT-Coffeeの併用」. Nucleic Acids Research . 34 (6): 1692–1699. doi :10.1093/nar/gkl091. ISSN 1362-4962. PMC 1410914. PMID 16556910 .
- ^ Armougom, Fabrice; Moretti, Sébastien; Poirot, Olivier; Audic, Stéphane; Dumas, Pierre; Schaeli, Basile; Keduas, Vladimir; Notredame, Cedric (2006-07-01). 「Expresso: 3D-Coffee を使用した複数の配列アラインメントへの構造情報の自動取り込み」。Nucleic Acids Research . 34 (Web Server 版): W604–608. doi :10.1093/nar/gkl092. ISSN 1362-4962. PMC 1538866 . PMID 16845081.
- ^ Zhang, Yang; Skolnick, Jeffrey (2005). 「TM-align: TMスコアに基づくタンパク質構造アラインメントアルゴリズム」. Nucleic Acids Research . 33 (7): 2302–2309. doi :10.1093/nar/gki524. ISSN 1362-4962. PMC 1084323. PMID 15849316 .
- ^ Konagurthu, Arun S.; Whisstock, James C.; Stuckey, Peter J.; Lesk, Arthur M. (2006-08-15). 「MUSTANG: 多重構造アラインメントアルゴリズム」.タンパク質. 64 (3): 559–574. doi :10.1002/prot.20921. ISSN 1097-0134. PMID 16736488. S2CID 14074658.
- ^ Sun, Zheng; Tian, Weidong (2012). 「SAP - 長いシーケンスの読み取りのアラインメントと正確な変異の発見のためのシーケンスマッピングおよび分析プログラム」. PLOS ONE . 7 (8): e42887. Bibcode :2012PLoSO...742887S. doi : 10.1371/journal.pone.0042887 . ISSN 1932-6203. PMC 3413671. PMID 22880129 .
- ^ Wilm, Andreas; Higgins, Desmond G.; Notredame, Cédric (2008年5月). 「R-Coffee: 非コードRNAの多重アラインメント法」. Nucleic Acids Research . 36 (9): e52. doi :10.1093/nar/gkn174. ISSN 1362-4962. PMC 2396437. PMID 18420654 .
- ^ Moretti, Sébastien; Wilm, Andreas; Higgins, Desmond G.; Xenarios, Ioannis; Notredame, Cédric (2008-07-01). 「R-Coffee: 非コーディングRNA配列を正確にアラインメントするWebサーバー」. Nucleic Acids Research . 36 (Web Server号): W10–13. doi :10.1093/nar/gkn278. ISSN 1362-4962. PMC 2447777. PMID 18483080 .
- ^ ab Di Tommaso P、Moretti S、Xenarios I、Orobitg M、Montanyola A、Chang JM、Taly JF、Notredame C (2011 年 7 月)。「T-Coffee: 構造情報と相同性拡張を使用してタンパク質と RNA 配列の多重配列アラインメントを行う Web サーバー」。Nucleic Acids Res . 39 ( Webサーバー号): W13–7。doi :10.1093/nar/gkr245。PMC 3125728。PMID 21558174。
- ^ Kemena C, Notredame C (2009-10-01). 「ハイスループット時代における多重配列アラインメント法の今後の課題」.バイオインフォマティクス. 25 ( 19): 2455–65. doi :10.1093/bioinformatics/btp452. PMC 2752613. PMID 19648142.
- ^ Chang JM、Di Tommaso P、Taly JF、Notredame C (2012-03-28)。「PSI-Coffee による膜貫通タンパク質の正確な多重配列アラインメント」。BMC Bioinformatics . 13 : S1. doi : 10.1186/1471-2105-13-S4-S1 . PMC 3303701 . PMID 22536955。
- ^ エルブ I、ゴンサレス=バリナス JR、ブソッティ G、ブランコ E、エイラス E、ノートルダム C (2012 年 4 月)。 「複数のプロモーターのアライメント法の設計のための ChIP-Seq データの使用」。核酸研究40 (7): e52。土井:10.1093/nar/gkr1292。PMC 3326335。PMID 22230796。
- ^ 「T-Coffee Server」. tcoffee.crg.eu . 2023年12月26日閲覧。
- ^ Chang, JM; Di Tommaso, P; Lefort, V; Gascuel, O; Notredame, C (2015 年 7 月 1 日). 「TCS: 多重配列アラインメント評価および系統学的再構築のための Web サーバー」. Nucleic Acids Research . 43 (W1): W3-6. doi :10.1093/nar/gkv310. PMC 4489230. PMID 25855806 .
- ^ Chang, JM; Di Tommaso, P.; Notredame, C. (2014 年 6 月). 「TCS: アラインメントの精度を推定し、系統樹の再構築を改善するための新しい多重配列アラインメント信頼性尺度」. Molecular Biology and Evolution . 31 (6): 1625–37. doi : 10.1093/molbev/msu117 . PMID 24694831.
外部リンク
- 公式サイト
- T-コーヒー アライナー サーバー
- T-Coffee ダウンロードページ
- 技術文書
- チュートリアル
- T-Coffee がサポートするサードパーティ製アライナーのリスト
- T-coffee オリジナルペーパー
