| コンテンツ | |
|---|---|
| 説明 | Pfam データベースは、タンパク質ドメインのアラインメントと隠れマルコフ モデルを提供します。 |
キャプチャされたデータの種類 | タンパク質ファミリー |
| 生物 | 全て |
| 接触 | |
| 研究センター | EBI |
| 主な引用 | 19920124 の検索結果 |
| アクセス | |
| データ形式 | ストックホルム形式 |
| Webサイト | www.ebi.ac.uk/interpro/entry/pfam/#table |
| ダウンロードURL | FTP |
| その他 | |
| ライセンス | GNU 劣等一般公衆利用許諾書 |
| バージョン | 37.0 |
| ブックマーク可能な エンティティ | はい |
Pfamはタンパク質ファミリーのデータベースであり、隠れマルコフモデルを使用して生成された注釈と多重配列アラインメントが含まれています。[1] [2] [3] Pfamの最新バージョン37.0は2024年6月にリリースされ、21,979のファミリーが含まれています。[4]現在、 InterProのWebサイトを通じて提供されています。
用途
Pfamデータベースの一般的な目的は、タンパク質ファミリーとドメインの完全かつ正確な分類を提供することです。[5]もともと、データベースを作成した理由は、既知のタンパク質ファミリーに関する情報を半自動的にキュレートして、ゲノムの注釈付けの効率を向上させることでした。[6] Pfamタンパク質ファミリーの分類は、タンパク質を幅広くカバーし、命名規則が理にかなっているため、生物学者に広く採用されています。[7]
Pfamは、特定のタンパク質を研究する実験生物学者、構造決定のための新しいターゲットを特定する構造生物学者、配列を整理する計算生物学者、タンパク質の起源をたどる進化生物学者によって使用されています。[8]ヒトやハエなどの初期のゲノムプロジェクトでは、ゲノムデータの機能的注釈付けにPfamが広く使用されていました。[9] [10] [11]
InterProのウェブサイトでは、ユーザーがタンパク質またはDNA配列を送信して、Pfamデータベース内のファミリーに一致するものを検索することができます。DNAを送信すると、6フレームの翻訳が実行され、各フレームが検索されます。[12] Pfamは、一般的なBLAST検索を実行するのではなく、プロファイル隠れマルコフモデルを使用します。これは、保存されたサイトでの一致に大きな重みを付け、より優れたリモートホモロジー検出を可能にするため、適切に注釈が付けられた近縁種がない生物のゲノムに注釈を付けるのに適しています。[13]
Pfamは、構造データベースの情報とPfamドメインの構造へのマッピングに基づいて、タンパク質内およびタンパク質間のドメイン間相互作用をカタログ化するiPfamなどの他のリソースの作成にも使用されています。[14]
特徴
Pfam の各家族では、次のことが可能です。
- 家族の説明を見る
- 複数のアライメントを見る
- タンパク質ドメインアーキテクチャを表示
- 種の分布を調べる
- 他のデータベースへのリンクをたどる
- 既知のタンパク質構造を見る
エントリには、ファミリー、ドメイン、リピート、モチーフなど、いくつかの種類があります。ファミリーはデフォルトのクラスで、メンバーが関連していることを示します。ドメインは、複数のタンパク質コンテキストで見つかる自律的な構造単位または再利用可能な配列単位として定義されます。リピートは通常、単独では安定しておらず、ドメインまたは拡張構造を形成するためにタンデムリピートを形成する必要があります。モチーフは通常、球状ドメインの外側にある短い配列単位です。[9]
Pfam ファミリーの説明は、Wikipedia を使用して一般の人々によって管理されています (#コミュニティ キュレーションを参照)。
リリース29.0時点では、UniprotKBのタンパク質配列の76.1%が少なくとも1つのPfamドメインと一致していました。[15]
新しいエントリの作成
新しいファミリーはさまざまな情報源から得られますが、主にPDBと完全なプロテオームの解析によってPfamヒットのない遺伝子が見つかります。[16]
各ファミリーについて、代表的な配列のサブセットが高品質のシードアラインメントにアラインメントされます。シードアラインメントの配列は主にpfamseq(参照プロテオームの非冗長データベース)から取得され、UniprotKB [15]からいくらか補足されます。このシードアラインメントは、 HMMERを使用してプロファイル隠れマルコフモデルを構築するために使用されます。次に、この HMM を配列データベースに対して検索し、キュレーションされた収集しきい値に達するすべてのヒットをタンパク質ファミリーのメンバーとして分類します。結果として得られたメンバーのコレクションは、プロファイル HMM にアラインメントされ、完全なアラインメントが生成されます。
各ファミリーには、手動でキュレーションされた収集しきい値が割り当てられ、ファミリーへの真の一致数を最大化し、偽陽性の一致を除外します。偽陽性は、同じクランに属さないPfamファミリーヒット間の重複を観察することによって推定されます。このしきい値は、ファミリーHMMへの一致をタンパク質ファミリーに含める必要があるかどうかを評価するために使用されます。Pfamが更新されるたびに、収集しきい値が再評価され、新しいファミリーと既存のファミリーの重複が防止されます。[16]
機能不明のドメイン
機能不明ドメイン(DUF) は、Pfam データベースで増加している割合を占めています。これらのファミリーは、種を超えて保存されているものの、その役割が不明であることがわかっているため、このように命名されています。新しく追加された各 DUF は、追加された順に命名されます。これらのエントリの名前は、機能が特定されるにつれて更新されます。通常、DUF に属する少なくとも 1 つのタンパク質の機能が特定されると、DUF 全体の機能が更新され、ファミリーの名前が変更されます。命名されたファミリーの中には、YbbR など、代表的なタンパク質にちなんで命名された機能不明ドメインもあります。保存された機能不明の配列が配列データで特定され続けるにつれて、DUF の数は増え続けると予想されます。最終的には、DUF の数が機能既知のファミリーの数を上回ると予想されます。[16]
氏族
時間の経過とともに、配列と残基のカバー範囲は拡大し、ファミリーが成長するにつれて、より多くの進化的関係が発見され、ファミリーをクランにグループ化できるようになりました。[8]クランは、2005年に初めてPfamデータベースに導入されました。クランは、構造、機能、配列、HMMの比較によって確認された、単一の進化的起源を共有する関連ファミリーのグループです。[5]リリース29.0の時点で、タンパク質ファミリーの約3分の1がクランに属していました。[15]この割合は、2019年(バージョン32.0)までに約4分の3に増加しました。[17]
可能性のあるクランの関係を特定するために、Pfamキュレーターは、Simple Comparison Of Outputs Program (SCOOP)とECODデータベースの情報を使用します。[17] ECODは、既知の構造を持つタンパク質ファミリーの半自動階層データベースであり、Pfamエントリに容易にマッピングされるファミリーと、通常Pfamクランにマッピングされる相同性レベルが含まれています。[18]
歴史
Pfam は、多細胞動物のタンパク質コード遺伝子に注釈を付けるために使用できる、一般的に発生するタンパク質ドメインのコレクションとして、1995 年に Erik Sonnhammer、Sean Eddy、Richard Durbinによって設立されました。 [6]設立当初の主な目的の 1 つは、 C. elegansゲノムの注釈付けを支援することでした。 [6]このプロジェクトは、Cyrus Chothia の著書「分子生物学者のための 1000 ファミリー」で、約 1500 種類のタンパク質ファミリーがあり、タンパク質の大部分はこれらのうちのわずか 1000 種類に分類されるという主張に部分的に基づいて推進されました。[5] [19]この主張に反して、Pfam データベースには現在、固有のタンパク質ドメインとファミリーに対応する 16,306 のエントリが含まれています。ただし、これらのファミリーの多くには、共通の進化的起源を示す構造的および機能的な類似点があります (氏族を参照)。[5]
Pfam と他のデータベースとの開始時の大きな違いは、エントリに 2 種類のアラインメント タイプを使用していることでした。1 つは手動でチェックされた小規模なシード アラインメント、もう 1 つはシード アラインメントから構築されたプロファイル隠れマルコフ モデルに配列をアラインメントして構築された完全なアラインメントです。この小規模なシード アラインメントは、新しいリリースの配列データベースがリリースされても更新が容易で、ゲノム シーケンシングがより効率的になり、時間の経過とともに処理する必要のあるデータが増えるにつれて、データベースを最新の状態に保つ方法というジレンマに対する有望なソリューションとなりました。データベースの更新速度は、バージョン 24.0 でさらに向上し、HMMER2 よりも約 100 倍高速で感度も高い HMMER3 が導入されました。[8]
Pfam-Aのエントリは既知のタンパク質をすべて網羅しているわけではないため、Pfam-Bと呼ばれる自動生成された補足が提供されました。Pfam-Bには、ADDAと呼ばれるアルゴリズムによって生成されたクラスターから派生した多数の小さなファミリーが含まれていました。[20]品質は低いですが、Pfam-BファミリーはPfam-Aファミリーが見つからない場合に役立ちます。Pfam-Bはリリース28.0で廃止されましたが、[21]その後、新しいクラスタリングアルゴリズムMMSeqs2を使用してリリース33.1で再導入されました。[22]
Pfamはもともと冗長性を保つために世界中の3つのミラーサイトでホストされていました。しかし、2012年から2014年の間に、PfamのリソースはEMBL-EBIに移され、重複した独立したデータセンターを使用して、1つのドメイン(xfam.org)からウェブサイトをホストできるようになりました。これにより、更新の集中化が改善され、Rfam、TreeFam、iPfamなどの他のXfamプロジェクトとグループ化され、複数のセンターからのホスティングによって提供される重要な回復力も維持されました。[23]
2014年から2016年にかけて、Pfamはキュレーションに伴う手作業をさらに削減し、より頻繁な更新を可能にするために大幅な再編を受けました。[15] 2022年頃、Pfamは欧州バイオインフォマティクス研究所のInterProに統合されました。[24]
コミュニティキュレーション
このような大規模なデータベースを管理するには、追加する必要のある新しいファミリーと更新された情報の量に対応するという点で問題がありました。データベースのリリースを迅速化するために、開発者はデータベースの管理にコミュニティがより積極的に関与できるようにするためのいくつかの取り組みを開始しました。
更新のペースを改善し、エントリを改善する上で重要なステップは、リリース 26.0 で Pfam ドメインの機能注釈を Wikipedia コミュニティに公開することでした。[16]すでに Wikipedia エントリがあるエントリについては、これが Pfam ページにリンクされ、そうでないエントリについては、コミュニティがエントリを作成してキュレーターに通知し、リンクされるようにするよう求められました。コミュニティの関与によってこれらのファミリーの注釈レベルが大幅に向上すると予想されますが、一部は Wikipedia に含めるには注目度が不十分なままになる可能性があり、その場合は元の Pfam の説明が保持されます。一部の Wikipedia 記事は、Zinc finger の記事のように複数のファミリーをカバーしています。InterPro および Pfam データに基づいて記事を生成するための自動化された手順も実装されており、これによりページに情報とデータベースへのリンク、および利用可能な画像が入力され、記事がキュレーターによってレビューされると、サンドボックスから Wikipedia 本体に移動されます。記事の荒らしを防ぐために、Wikipedia の各改訂版は、Pfam のウェブサイトに掲載される前にキュレーターによって確認されます。しかし、ほとんどすべての荒らしは、キュレーターに届く前にコミュニティによって修正されています。[16]
Pfamは3つのグループからなる国際コンソーシアムによって運営されています。Pfamの以前のリリースでは、ファミリーエントリは英国ケンブリッジのサイトでのみ変更可能であり、コンソーシアムメンバーがサイトのキュレーションに貢献する能力が制限されていました。リリース26.0では、開発者は新しいシステムに移行し、登録ユーザーは世界中のどこにいてもPfamファミリーを追加または変更できるようになりました。[16]
参照
- 生物学データベース一覧
- PANDIT、タンパク質ドメインをカバーする生物学データベース
- 保存された非コードRNAファミリーのRfamデータベース
- TreeFam動物遺伝子の系統樹データベース
- TrEMBLデータベースは、タンパク質配列の自動注釈付けを実行します
- InterProタンパク質ドメインとタンパク質ファミリーデータベースの統合
- PDBfam —タンパク質データバンク(PDB)の配列へのPfamドメインの徹底的な割り当て[25] [26]
参考文献
- ^ Finn RD、Tate J、Mistry J、Coggill PC、Sammut SJ、Hotz HR、Ceric G、Forslund K、Eddy SR、Sonnhammer EL、Bateman A (2008)。「Pfamタンパク質ファミリーデータベース」。Nucleic Acids Res . 36 (データベース 号): D281–8。doi :10.1093/ nar /gkm960。PMC 2238907。PMID 18039703。
- ^ Finn, RD; Mistry, J.; Schuster-Böckler, B.; Griffiths-Jones, S.; Hollich, V.; Lassmann, T.; Moxon, S.; Marshall, M.; Khanna, A.; Durbin, R.; Eddy, SR; Sonnhammer, EL; Bateman, A. (2006 年 1 月). 「Pfam: 氏族、ウェブ ツール、サービス」(無料全文) . Nucleic Acids Research . 34 (データベース号): D247–D251. doi :10.1093/nar/gkj149. ISSN 0305-1048. PMC 1347511 . PMID 16381856.
- ^ Bateman, A. ; Coin, L.; Durbin, R. ; Finn, RD; Hollich, V.; Griffiths-Jones, S.; Khanna, A.; Marshall, M.; Moxon, S.; Sonnhammer, EL; Studholme, DJ; Yeats, C.; Eddy, SR (2004). 「Pfam タンパク質ファミリーデータベース」. Nucleic Acids Research . 32 (データベース号): 138D–1141. doi :10.1093/nar/gkh121. ISSN 0305-1048. PMC 308855. PMID 14681378 .
- ^ 「Xfam Blog」。Xfam Blog 。 2024年9月10日閲覧。
- ^ abcd Sammut, Stephen; Finn, Robert D.; Bateman, Alex (2008). 「Pfam 10 周年: 10,000 家族、そして今も成長中」。Briefings in Bioinformatics . 9 (3): 210–219. doi : 10.1093/bib/bbn010 . PMID 18344544.
- ^ abc Sonnhammer, Erik LL; Eddy, Sean R.; Durbin, Richard (1997). 「Pfam: シードアラインメントに基づくタンパク質ドメインファミリーの包括的なデータベース」.タンパク質. 28 (3): 405–420. doi :10.1002/(sici)1097-0134(199707)28:3<405::aid-prot10>3.0.co;2-l. PMID 9223186. S2CID 9569028.
- ^ Xu, Qifang; Dunbrack, Roland L. (2012). 「既存のドメインおよびファミリー分類システムへのタンパク質配列の割り当て: Pfam と PDB」.バイオインフォマティクス. 28 (21): 2763–2772. doi :10.1093/bioinformatics/bts533. PMC 3476341. PMID 22942020 .
- ^ abc Finn, RD; Mistry, J.; Tate, J.; Coggill, P.; Heger, A.; Pollington, JE; Gavin, OL; Gunasekaran, P.; Ceric, G.; Forslund, K.; Holm, L.; Sonnhammer, ELL; Eddy, SR; Bateman, A. (2009). 「Pfamタンパク質ファミリーデータベース」. Nucleic Acids Research . 38 (データベース): D211–D222. doi :10.1093/nar/gkp985. ISSN 0305-1048. PMC 2808889. PMID 19920124 .
- ^ ab Bateman A, Birney E, Cerruti L, Durbin R, Etwiller L, Eddy SR, Griffiths-Jones S, Howe KL, Marshall M, Sonnhammer EL (2002). 「Pfamタンパク質ファミリーデータベース」. Nucleic Acids Res . 30 (1): 276–80. doi :10.1093/nar/30.1.276. PMC 99071. PMID 11752314.
- ^ Adams MD, Celniker SE, Holt RA, Evans CA, Gocayne JD, et al. (2000). 「Drosophila melanogaster のゲノム配列」. Science . 287 (5461): 2185–95. Bibcode :2000Sci...287.2185.. CiteSeerX 10.1.1.549.8639 . doi :10.1126/science.287.5461.2185. PMID 10731132.
- ^ Lander, Eric S.; Linton, Lauren M.; Birren, Bruce; Nusbaum, Chad; Zody, Michael C.; et al. (2001). 「ヒトゲノムの初期配列決定と分析」. Nature . 409 (6822): 860–921. doi : 10.1038/35057062 . hdl : 2027.42/62798 . ISSN 0028-0836. PMID 11237011.
- ^ Finn, Robert D.; Bateman, Alex; Clements, Jody; Coggill, Penelope; Eberhardt, Ruth Y.; Eddy, Sean R.; Heger, Andreas; Hetherington, Kirstie; Holm, Liisa; Mistry, Jaina; Sonnhammer, Erik LL; Tate, John; Punta, Marco (2014). 「Pfam: タンパク質ファミリーデータベース」. Nucleic Acids Research . 42 (D1): D222–D230. doi :10.1093/nar/gkt1223. ISSN 0305-1048. PMC 3965110. PMID 24288371 .
- ^ Sonnhammer EL、Eddy SR、Birney E、Bateman A、Durbin R (1998)。「Pfam: タンパク質ドメインの多重配列アラインメントとHMMプロファイル」。Nucleic Acids Res . 26 (1): 320–2. doi :10.1093/nar/26.1.320. PMC 147209 . PMID 9399864。
- ^ Finn, RD; Marshall, M.; Bateman, A. (2004). 「iPfam: ドメインおよびアミノ酸解像度での PDB におけるタンパク質間相互作用の視覚化」.バイオインフォマティクス. 21 (3): 410–412. doi : 10.1093/bioinformatics/bti011 . ISSN 1367-4803. PMID 15353450.
- ^ abcd Finn, Robert D.; Coggill, Penelope; Eberhardt, Ruth Y.; Eddy, Sean R.; Mistry, Jaina; Mitchell, Alex L.; Potter, Simon C.; Punta, Marco; Qureshi, Matloob; Sangrador-Vegas, Amaia; Salazar, Gustavo A.; Tate, John; Bateman, Alex (2016). 「Pfamタンパク質ファミリーデータベース:より持続可能な未来に向けて」。核酸研究。44 ( D1 ) : D279–D285。doi : 10.1093/nar/gkv1344。ISSN 0305-1048。PMC 4702930。PMID 26673716。
- ^ abcdef Punta, M.; Coggill, PC; Eberhardt, RY; Mistry, J.; Tate, J.; Boursnell, C.; Pang, N.; Forslund, K.; Ceric, G.; Clements, J.; Heger, A.; Holm, L.; Sonnhammer, ELL; Eddy, SR; Bateman, A.; Finn, RD (2011). 「Pfamタンパク質ファミリーデータベース」. Nucleic Acids Research . 40 (D1): D290–D301. doi :10.1093/nar/gkr1065. ISSN 0305-1048. PMC 3245129. PMID 22127870 .
- ^ ab El-Gebali, Sara; Mistry, Jaina; Bateman, Alex; Eddy, Sean R; Luciani, Aurélien; Potter, Simon C; Qureshi, Matloob; Richardson, Lorna J; Salazar, Gustavo A; Smart, Alfredo; Sonnhammer, Erik LL; Hirsh, Layla; Paladin, Lisanna; Piovesan, Damiano; Tosatto, Silvio CE; Finn, Robert D (2019年1月8日). 「2019年のPfamタンパク質ファミリーデータベース」. Nucleic Acids Research . 47 (D1): D427–D432. doi :10.1093/nar/gky995. PMC 6324024. PMID 30357350 .
- ^ 「タンパク質ドメインの進化的分類」prodata.swmed.edu . 2019年5月18日閲覧。
- ^ Chothia, Cyrus (1992). 「分子生物学者のための1000の家族」. Nature . 357 (6379): 543–544. Bibcode :1992Natur.357..543C. doi : 10.1038/357543a0 . ISSN 0028-0836. PMID 1608464. S2CID 4355476.
- ^ Heger, A.; Wilton, CA; Sivakumar, A.; Holm, L. (2005 年 1 月). 「ADDA: タンパク質宇宙をグローバルにカバーするドメイン データベース」(全文無料) . Nucleic Acids Research . 33 (データベース号): D188–D191. doi :10.1093/nar/gki096. ISSN 0305-1048. PMC 540050 . PMID 15608174.
- ^ 「Pfam 28.0 リリースノート」 。 2015年6月30日閲覧。
- ^ 「新しいPfam-Bがリリースされました」。Xfamブログ。2020年6月30日。
- ^ 「xfam.orgへの移行」。2016年11月25日閲覧。
- ^ name=""> Paysan-Lafosse, Typhaine (2023). 「InterPro in 2022」.核酸研究. 51 (D1): D418–D427. doi :10.1093/nar/gkac993. PMC 9825450 .
- ^ Dunbrack, Roland. 「PDBfam」. Fox Chase Cancer Center . 2013年3月9日閲覧。
- ^ Xu , Qifang; Dunbrack, Roland (2012). 「タンパク質配列の既存のドメインおよびファミリー分類システムへの割り当て:PfamとPDB」。バイオインフォマティクス。28 (21): 2763–72。doi :10.1093/ bioinformatics /bts533。PMC 3476341。PMID 22942020。
外部リンク
- Pfam -英国EMBL-EBIのタンパク質ファミリーデータベース
- PDBfam -米国フォックスチェイスがんセンターのPDBにおける配列へのPfamドメインの割り当て
