| 原作者 | ロバート・C・エドガー |
|---|---|
| 開発者 | ドライブ5 |
| 初回リリース | 2004年 |
| 安定版リリース | 3.8.31 / 2016年8月18日 |
| リポジトリ | GitHubのgithub.com/rcedgar/muscle/releases/tag/v5.1 |
| オペレーティング·システム | Linux、macOS、Windows |
| プラットフォーム | IA-32、x86-64 |
| 利用可能 | 英語 |
| タイプ | 多重配列アライメント |
| ライセンス | パブリックドメイン |
| Webサイト | drive5.com/muscle/ |
MUSCLE ( MUltiple Sequence Comparison by Log-Expectation ) は、タンパク質およびヌクレオチド配列の多重配列アライメントを行うコンピュータソフトウェアです。パブリックドメインとしてライセンスされています。この方法は、2004年にRobert C. Edgarによって2つの論文で発表されました。Nucleic Acids Researchに掲載された最初の論文では、配列アライメントアルゴリズムが紹介されました。[1] BMC Bioinformaticsに掲載された2番目の論文では、より技術的な詳細が提示されました。[2]
アルゴリズム
MUSCLE アルゴリズムは、ドラフト プログレッシブ ステージ、改善プログレッシブステージ、および改良ステージの 3 つのステージで進行します。
ステージ1: ドラフトプログレッシブ
この最初の段階では、アルゴリズムは精度よりも速度を重視した多重アライメントを生成します。このステップは、入力シーケンスのすべてのペアのk-mer距離を計算して距離行列を作成することから始まります。UPGMAは距離行列をクラスター化してバイナリツリーを生成します。このツリーから、ツリーの各リーフのプロファイルの作成から始めて、プログレッシブ アライメントが構築されます。ツリー内のすべてのノードについて、2 つの子プロファイルのペアワイズ アライメントが構築され、そのノードに割り当てられる新しいプロファイルが作成されます。これは、ツリーのルートですべての入力シーケンスの多重シーケンス アライメントが作成されるまで続きます。 [1]
ステージ2: 改善されたプログレッシブ
この段階では、段階 1 で得られた多重配列アライメントを使用して入力配列の各ペアのKimura 距離を計算し、より最適なツリーを取得することに焦点を当て、2 番目の距離行列を作成します。UPGMA は、この距離行列をクラスタ化して 2 番目のバイナリ ツリーを取得します。段階 1 と同様に、多重配列アライメントを取得するためにプログレッシブ アライメントが実行されますが、最初のバイナリ ツリーから分岐順序が変更されたサブツリーのアライメントのみを計算することで最適化され、より正確なアライメントが得られます。[1]
ステージ3: 改良
この最終段階では、2 番目のツリーからエッジが選択され、ルートからの距離が減少するエッジが訪問されます。選択されたエッジは削除され、ツリーは 2 つのサブツリーに分割されます。次に、各サブツリーの多重アライメントのプロファイルが計算されます。サブツリー プロファイルを再アライメントすることで、新しい多重配列アライメントが生成されます。SP スコアが改善された場合は、新しいアライメントが保持され、改善されなかった場合は破棄されます。エッジを削除してアライメントするプロセスは、収束するか、ユーザー定義の制限に達するまで繰り返されます。[1]
複雑さと比較
アルゴリズムの最初の2つの段階では、時間計算量はO( N 2 L + NL 2 )、空間計算量はO( N 2 + NL + L 2 )です。改良段階では、時間計算量に別の項O( N 3 L )が追加されます。[1] MUSCLEは、選択されたオプションに応じて、通常は(常にではありませんが)より良い配列アラインメントを提供するため、 Clustalの代替としてよく使用されます。はClustalよりも大幅に高速で、大規模なアラインメントではさらに高速です。[1] [2]
アルゴリズムフローチャート
統合
MUSCLEはDNASTARのLasergeneソフトウェア、Geneious、MacVectorに統合されており、Sequencher、MEGA、UGENEでプラグインとして利用できます。MUSCLEは、欧州分子生物学研究所(EMBL)-欧州バイオインフォマティクス研究所(EBI)を通じてウェブサービスとしても利用できます。[3] 2016年9月現在、MUSCLEを説明する2つの論文は合計19,000回以上引用されています。[4]
参照
参考文献
- ^ abcdef Edgar RC (2004). 「MUSCLE: 高精度かつ高スループットの多重配列アラインメント」. Nucleic Acids Research . 32 (5): 1792–97. doi :10.1093/nar/gkh340. PMC 390337. PMID 15034147.
- ^ ab Edgar RC (2004). 「MUSCLE: 時間と空間の複雑さを軽減した多重配列アラインメント法」BMC Bioinformatics . 5 (1): 113. doi : 10.1186/1471-2105-5-113 . PMC 517706 . PMID 15318951.
- ^ 「MUSCLE < Multiple Sequence Alignment < EMBL-EBI」。2015年1月18日時点のオリジナルよりアーカイブ。2014年9月1日閲覧。
- ^ “Robert C. Edgar - Google Scholar Citations”. 2016年9月24日時点のオリジナルよりアーカイブ。 2016年9月1日閲覧。
外部リンク
- 公式サイト
- MUSCLE Web サーバー (EMBL-EBI)
