| 開発者 | ヨハネス・セーディング、ミヒャエル・レンメルト、アンドレアス・ビーゲルト、アンドレアス・ハウザー、マルクス・マイヤー、マルティン・シュタイネッガー |
|---|---|
| 安定版リリース | 3.3.0 / 2020年8月25日 |
| リポジトリ |
|
| 書かれた | C++ |
| オペレーティング·システム | Unixライク; Debianパッケージが利用可能[1] |
| 利用可能 | 英語 |
| タイプ | バイオインフォマティクスツール |
| ライセンス | GPL v3 |
| Webサイト | https://github.com/soedinglab/hh-suite |
HH -suite は、高感度なタンパク質配列検索のためのオープンソース ソフトウェアパッケージです。タンパク質配列データベースで類似のタンパク質配列を検索できるプログラムが含まれています。配列検索は、類似の配列を持つタンパク質の機能から未知のタンパク質の機能を推測できる、現代生物学の標準的なツールです。HHsearchとHHblits は、パッケージ内の 2 つの主要プログラムであり、検索機能へのエントリ ポイントです。後者はより高速な反復処理が可能です。[2] [3] HHpred は、 HH-suite からの相同性情報を使用するタンパク質構造予測のオンライン サーバーです。[4]
HHスイートは隠れマルコフモデル(HMM)を使用して配列を検索します。この名前は、HMM-HMMアライメントを実行することに由来しています。タンパク質配列マッチングの最も人気のある方法の1つであり、 Google Scholarによると、このプログラムは合計5000回以上引用されています。[5]
背景
タンパク質は、生命のあらゆるプロセスにおいて中心的な役割を果たしています。タンパク質を理解することは、細胞内の分子プロセスを理解する上で重要です。これは、病気の起源を理解するために特に重要です。しかし、約 20,000 のヒトタンパク質の大部分については、構造と機能が未だ不明です。多くのタンパク質は、多くの細菌、パン酵母、ショウジョウバエ、ゼブラフィッシュ、マウスなどのモデル生物で調査されており、これらのモデル生物では、ヒト細胞よりも実験が簡単に行えることがよくあります。アミノ酸の配列のみがわかっているタンパク質の機能、構造、またはその他の特性を予測するには、そのタンパク質の配列を公開データベース内の他のタンパク質の配列と比較します。十分に類似した配列を持つタンパク質が見つかった場合、2 つのタンパク質は進化的に関連している ( 「相同」 ) 可能性があります。その場合、それらは同様の構造と機能を共有している可能性があります。したがって、十分に類似した配列を持ち、機能や構造がわかっているタンパク質を配列検索で見つけることができれば、未知のタンパク質の機能、構造、ドメイン構成を予測できます。このような予測は、対象を絞った検証実験による機能や構造の決定を大幅に容易にします。
配列検索は、未知のタンパク質の機能をその配列から推測するために生物学者によって頻繁に実行されます。この目的で、タンパク質の配列は公開データベース内の他のタンパク質の配列と比較され、その機能は最も類似した配列から推測されます。多くの場合、このような検索では注釈付きの機能を持つ配列は見つかりません。この場合、より遠く離れたタンパク質またはタンパク質ファミリーを識別するために、より感度の高い方法が必要です。これらの関係から、タンパク質の機能、構造、およびドメイン構成に関する仮説を推測できます。HHsearch は、データベースを介してタンパク質配列の検索を実行します。HHpred サーバーと HH-suite ソフトウェア パッケージは、Protein Data Bank のほか、InterPro、Pfam、COG、およびSCOPデータベースなど、多くの一般的な定期的に更新されるデータベースを提供します。
アルゴリズム

タンパク質検索のための最新の高感度な方法は、配列プロファイルを利用する。配列をプロファイルと比較したり、HH-suite などのより高度なケースでは、プロファイル間のマッチングに使用できる。[2] [6] [7] [8]プロファイルとアラインメント自体は、たとえばPSI-BLASTや HHblits を使用してマッチングから導出される。位置固有のスコアリング マトリックス(PSSM) プロファイルには、クエリ配列の各位置について 20 個のアミノ酸の類似性スコアが含まれている。プロファイルは、関連するタンパク質が一緒に書き込まれる (アラインされる)多重配列アラインメント(MSA) から導出される。これにより、各位置のアミノ酸の頻度は、新しい関連するタンパク質のアミノ酸の確率として解釈され、「類似性スコア」を導出するために使用できる。プロファイルには単一の配列よりもはるかに多くの情報 (位置固有の保存度など) が含まれているため、プロファイル間比較方法は、BLASTなどの配列間比較方法や PSI-BLAST などのプロファイル間比較方法よりもはるかに強力である。[6]
HHpred と HHsearch は、クエリとデータベースのタンパク質をプロファイル隠れマルコフモデル(HMM) で表します。これは、位置固有のアミノ酸の挿入と削除の頻度も記録する PSSM 配列プロファイルの拡張です。HHsearch は、クエリ HMM を使用して HMM のデータベースを検索します。実際の HMM データベースの検索を開始する前に、HHsearch/HHpred はHHblits プログラムを使用して、クエリ配列/MSA に関連する配列の多重配列アライメントを構築します。このアライメントから、プロファイル HMM が計算されます。データベースには、PSI-BLAST を使用して同じ方法で事前計算された HMM が含まれています。HHpred と HHsearch の出力は、データベース一致のランク付けされたリスト (真の関係の E 値と確率を含む) と、クエリとデータベースのペアワイズ配列アライメントです。
2001 年から HH スイートの一部である HHblits は、単一のクエリ シーケンスまたは MSA から高品質の多重配列アラインメント(MSA) を構築します。PSI-BLAST と同様に、反復的に動作し、前回のラウンドで見つかった結果を追加することで、新しいクエリ プロファイルを繰り返し構築します。タンパク質シーケンス データベースから派生した、それぞれが関連するタンパク質の「クラスター」を表す、事前に構築された HMM データベースと照合します。HHblits の場合、このような照合は HMM-HMM プロファイルのレベルで行われるため、感度が向上します。事前フィルタリングにより、照合する HMM が数千万から数千に削減され、低速な HMM-HMM 比較プロセスが高速化されます。[3]
HHスイートには、HHblitsやHHsearchを使って検索できる、あらかじめ構築されたプロファイルHMMが多数付属しており、その中には、 UniProtデータベースのクラスター化バージョン、構造が既知のタンパク質のProtein Data Bank 、 Pfamタンパク質ファミリーのアラインメント、SCOP構造タンパク質ドメインなどが含まれています。[9]
アプリケーション
HHpredとHHsearchの応用には、タンパク質構造予測、複合体構造予測、機能予測、ドメイン予測、ドメイン境界予測、タンパク質の進化分類などがある。[10]
HHsearch は、ホモロジー モデリング、つまり、配列のみがわかっているクエリ タンパク質の構造モデルの構築によく使用されます。この目的のために、タンパク質データ バンクなどの構造がわかっているタンパク質のデータベースで、クエリ タンパク質に類似した「テンプレート」タンパク質を検索します。このようなテンプレート タンパク質が見つかった場合、クエリとテンプレート タンパク質配列のペアワイズ配列アライメントに基づいて、対象のタンパク質の構造を予測できます。たとえば、3D 構造が解決されているタンパク質の PDB データベースの検索には数分かかります。PDB データベースで構造がわかっているタンパク質 (「テンプレート」) との有意な一致が見つかった場合、HHpred では、クエリとテンプレートのペアワイズ アライメントから始めて、 MODELLERソフトウェアを使用してホモロジー モデルを構築できます。
HHpred サーバーは、ブラインド タンパク質構造予測実験において、 CASP 7、8、9で最高のサーバーとしてランク付けされました。CASP9 では、HHpredA、B、C は、テンプレート ベース モデリングで 81 の自動構造予測サーバーのうち 1 位、2 位、3 位にランク付けされ[11]、147 のターゲットすべてで 6 位、7 位、8 位にランク付けされ、最高の 20 のサーバーよりもはるかに高速でした。[12] CASP 8では、HHpred はすべてのターゲットで 7 位、単一ドメイン タンパク質のサブセットで 2 位にランク付けされ、それでも上位のサーバーよりも 50 倍以上高速でした。[4]
コンテンツ
HHsearch と HHblits に加えて、HH スイートには、フォーマット変換、MSA のフィルタリング、プロファイル HMM の生成、MSA への二次構造予測の追加、プログラム出力からのアライメントの抽出、カスタマイズされたデータベースの生成のためのプログラムと Perl スクリプトが含まれています。
HHblitsとHHsearchのHMM-HMMアライメントアルゴリズムは、HHスイートのバージョン3のベクトル命令を使用することで大幅に高速化されました。 [13]
参照
- 配列アライメントソフトウェア
- タンパク質構造予測
- ポジション別スコアリングマトリックス
- 多重配列アライメント
- CASP - タンパク質構造予測技術の批判的評価
- BLAST (基本的なローカルアライメント検索ツール)
- コンテキスト固有のBLAST(CS-BLAST)
参考文献
- ^ Debian hhsuite パッケージ
- ^ ab Söding J (2005). 「HMM-HMM比較によるタンパク質相同性検出」.バイオインフォマティクス. 21 (7): 951–960. doi : 10.1093/bioinformatics/bti125 . hdl : 11858/00-001M-0000-0017-EC7A-F . PMID 15531603.
- ^ ab Remmert M, Biegert A, Hauser A, Söding J (2011). 「HHblits: HMM-HMMアライメントによる超高速反復タンパク質配列検索」(PDF) . Nat. Methods . 9 (2): 173–175. doi :10.1038/NMETH.1818. hdl : 11858/00-001M-0000-0015-8D56-A . PMID 22198341. S2CID 205420247.
- ^ ab Söding J、Biegert A 、Lupas AN (2005)。「タンパク質相同性検出および構造予測のためのHHpredインタラクティブサーバー」。核酸研究。33 (Webサーバー号) :W244–248。doi :10.1093/nar/gki408。PMC 1160169。PMID 15980461。
- ^ HHpred、HHsearch、HHblits への引用
- ^ ab Jaroszewski L 、Rychlewski L 、 Godzik A (2000)。「トワイライトゾーンアラインメントの品質向上」。 タンパク質科学。9 (8): 1487–1496。doi :10.1110 / ps.9.8.1487。PMC 2144727。PMID 10975570。
- ^ Sadreyev RI、Baker D、Grishin NV (2003)。「 COMPASSによるプロファイル-プロファイル比較は 、タンパク質ファミリー間の複雑な相同性を予測します」。タンパク質科学。12 ( 10): 2262–2272。doi :10.1110/ps.03197403。PMC 2366929。PMID 14500884。
- ^ Dunbrack RL Jr (2006). 「配列比較とタンパク質構造予測」Current Opinion in Structural Biology 16 ( 3): 374–384. doi :10.1016/j.sbi.2006.05.006. PMID 16713709.
- ^ Li, Zhaoyu. 「HHSuiteに関するメモ」。2019年4月3日時点のオリジナルよりアーカイブ。2019年4月3日閲覧。
- ^ Guerler A, Govindarajoo B, Zhang Y (2013). 「モノマースレッドのタンパク質間構造予測へのマッピング」. Journal of Chemical Information and Modeling . 53 (3): 717–25. doi :10.1021/ci300579r. PMC 4076494. PMID 23413988 .
- ^ テンプレートベースのモデリング カテゴリの公式 CASP9 結果 (121 ターゲット)
- ^ 全147ターゲットに対する公式CASP9結果
- ^ Steinegger M、Meier M、Mirdita M、Vöhringer H、Haunsberger S、Söding J (2019)。「高速リモートホモロジー検出とディープタンパク質アノテーションのためのHH-suite3」。BMCバイオインフォマティクス 。20 ( 1 ): 473。doi : 10.1186 / s12859-019-3019-7。PMC 6744700。PMID 31521110。
外部リンク
- ゲッティンゲンのマックス・プランク研究所の Soeding 研究室 - HH スイート開発者
- コンパイル済みのHHスイートバイナリとデータベースは開発者からダウンロードできます
- HHpred — テュービンゲンのマックスプランク研究所の無料サーバー
- HHblits — テュービンゲンのマックスプランク研究所の無料サーバー
- CASPウェブサイト
- CASP9テンプレートベースのモデリング結果
- HH-suite Debian パッケージ
- HH-suite Ubuntu パッケージ
- HH-suite Arch Linux ユーザー リポジトリ
