タンパク質の構造分類(SCOP)データベースは、タンパク質の構造ドメインを、その構造とアミノ酸配列の類似性に基づいて、主に手作業で分類したものです。この分類の目的は、タンパク質間の進化的な関係を明らかにすることです。形状は同じでも、配列や機能の類似性がほとんどないタンパク質は、異なるスーパーファミリーに分類され、非常に遠い共通祖先を持つと想定されます。形状が同じで、配列や機能に多少の類似性があるタンパク質は、「ファミリー」に分類され、より近い共通祖先を持つと想定されます。
CATHやPfamデータベースと同様に、SCOPはタンパク質全体の分類ではなく、タンパク質の個々の構造ドメインの分類を提供する。タンパク質全体は、多数の異なるドメインを含む可能性がある。
SCOP データベースはインターネット上で無料でアクセスできます。SCOP は 1994 年にタンパク質工学センターと分子生物学研究所で作成されました。[ 3 ] 2010 年に閉鎖されるまで、タンパク質工学センターの Alexey G. Murzin と同僚によって維持され、その後、イギリスのケンブリッジにある分子生物学研究所で維持されました。[ 4 ] [ 5 ] [ 6 ] [ 1 ]
SCOP 1.75 の開発は 2014 年に中止されました。それ以降、UC バークレーの SCOPe チームが、自動化された方法と手動の方法を組み合わせて、互換性のある方法でデータベースを更新する責任を負っています。2019年4 月現在 最新リリースはSCOPe 2.07(2018年3月)です。[ 2 ]
新しいタンパク質構造分類バージョン2(SCOP2)データベースは、2020年初頭にリリースされました。この新しいアップデートでは、改良されたデータベーススキーマ、新しいAPI、最新のWebインターフェースが採用されました。これは、SCOP 1.75以来、ケンブリッジグループによる最も重要なアップデートであり、SCOP 2プロトタイプのスキーマの進歩に基づいています。[ 7 ]
タンパク質構造の情報源はタンパク質データバンクです。SCOPにおける構造の分類単位はタンパク質ドメインです。SCOPの著者が「ドメイン」で何を意味しているかは、小型タンパク質とほとんどの中型タンパク質にはドメインが1つしかないという彼らの記述[ 8 ] 、およびα2β2構造を持つヒトヘモグロビン[ 9 ]にはαサブユニットとβサブユニットにそれぞれ1つずつ、2つのSCOPドメインが割り当てられているという観察から示唆されます。
SCOPでは、ドメインの形状を「フォールド」と呼びます。同じフォールドに属するドメインは、同じトポロジー接続で同じ配置の主要な二次構造を持ちます。SCOPバージョン1.75には1195のフォールドが収録されています。各フォールドの簡単な説明が提供されています。例えば、「グロビン様」フォールドは、コア:6つのヘリックス、折り畳まれた葉、部分的に開いた状態と説明されています。ドメインがどのフォールドに属するかは、ソフトウェアではなく目視によって決定されます。
SCOPバージョン1.75のレベルは以下のとおりです。
SCOPバージョン1.75における最も広範な分類群は、タンパク質フォールドクラスです。これらのクラスは、二次構造の構成は類似しているものの、全体的な三次構造と進化上の起源が異なる構造をグループ化します。これは、SCOP階層分類の最上位レベルの「ルート」にあたります。
括弧内の数字は「sunid」と呼ばれ、SCOP階層内の各ノードを識別するためのSCOP固有の整数識別子です。括弧内の数字は、各カテゴリに含まれる要素の数を示します。例えば、「すべてのアルファタンパク質」クラスには284個のフォールドがあります。階層の各メンバーは、階層の次のレベルへのリンクとなります。
各クラスには、多数の異なるフォールドが含まれています。この分類レベルは、類似した三次構造を示していますが、必ずしも進化的な関連性を示しているわけではありません。たとえば、「オールαタンパク質」クラスには、グロビン様(コア:6つのヘリックス、折り畳まれた葉状構造、部分的に開いた状態)、長いαヘアピン(2つのヘリックス、逆平行ヘアピン、左巻きのねじれ)、およびタイプIドッケリンドメイン( 2つのカルシウム結合ループヘリックスモチーフのタンデムリピート、EFハンドとは異なる)など、280を超える異なるフォールドが含まれています。
フォールド内のドメインはさらにスーパーファミリーに分類されます。これは、構造的類似性によって進化的な関連性が示され、共通の祖先を共有するタンパク質の最大のグループです。ただし、スーパーファミリーの異なるメンバーは配列の相同性が低いため、この祖先は遠いと推定されます。たとえば、「グロビン様」フォールドの2つのスーパーファミリーは、グロビンスーパーファミリーとαヘリックスフェレドキシンスーパーファミリー(2つのFe4-S4クラスターを含む)です。
タンパク質ファミリーはスーパーファミリーよりも密接に関連しています。ドメインは、以下のいずれかの条件を満たす場合に同じファミリーに分類されます。
配列と構造の類似性は、これらのタンパク質が同じスーパーファミリーのタンパク質よりも進化的に近縁であることを示す証拠です。BLAST などの配列ツールは、ドメインをスーパーファミリーやファミリーに分類するのを助けます。たとえば、「グロビン様」フォールドの「グロビン様」スーパーファミリーの 4 つのファミリーは、切断型ヘモグロビン (最初のヘリックスがない)、神経組織ミニヘモグロビン (最初のヘリックスがないが、それ以外は切断型よりも従来のグロビンに類似している)、グロビン (ヘム結合タンパク質)、およびフィコシアニン様フィコビリソームタンパク質 ( N 末端に 2 つの余分なヘリックスを含む 2 種類の異なるグロビン様サブユニットのオリゴマーで、ビリン発色団に結合する) です。SCOP のファミリーにはそれぞれ簡潔な分類文字列sccsが割り当てられ、文字はドメインが属するクラスを識別します。以下の整数は、それぞれフォールド、スーパーファミリー、ファミリーを識別します(例:「Globin」ファミリーの場合は a.1.1.2)。[ 10 ]
「TaxId」は分類ID番号で、NCBI分類ブラウザにリンクしており、タンパク質が属する種に関する詳細情報を提供します。種またはアイソフォームをクリックすると、ドメインのリストが表示されます。たとえば、「ヒト(Homo sapiens)由来のヘモグロビン、アルファ鎖」タンパク質には、2dn3(cmoと複合体を形成)や2dn1(hem、mbn、oxyと複合体を形成)など、190を超える構造が解明されています。PDB番号をクリックすると分子の構造が表示されるはずですが、現在リンクが壊れています(リンクはSCOP以前のバージョンでは機能していました)。
SCOPのほとんどのページには検索ボックスがあります。「trypsin +human」と入力すると、ヒト由来のタンパク質であるトリプシノーゲンを含む、いくつかのタンパク質が検索結果に表示されます。その項目を選択すると、SCOPのほとんどのページの上部に表示される「系統」を含むページが表示されます。
「Subtilisin」を検索すると、「Bacillus subtilis, carlsberg由来のSubtilisin」というタンパク質が返され、その系統は以下のとおりです。
これらのタンパク質はどちらもプロテアーゼであるが、同じフォールドに属しておらず、これは収斂進化の一例であることと一致する。
SCOPの分類は、主要な競合相手であるCATHの半自動分類よりも、手動による判断に大きく依存している。特定のタンパク質が進化的に関連しているため同じスーパーファミリーに分類されるべきか、あるいは類似性が構造的制約の結果であるため同じフォールドに属するのかを判断するために、人間の専門知識が用いられる。別のデータベースであるFSSPは、完全に自動生成(定期的な自動更新を含む)であるが、分類は提供せず、個々のタンパク質構造のペアワイズ比較に基づいて、構造的関係の重要性についてユーザーが独自の結論を導き出すことができる。
2009 年までに、オリジナルの SCOP データベースは、38,000 件の PDB エントリを厳密に階層的な構造に手動で分類しました。タンパク質構造の発表ペースが加速するにつれて、分類の自動化が限られていたため追いつけなくなり、包括的なデータセットが作成できませんでした。2012 年に、同じ階層システムの自動化が大幅に向上した Structural Classification of Proteins extended (SCOPe) データベースがリリースされ、SCOP バージョン 1.75 と完全に下位互換性があります。2014 年に、正確な構造割り当てを維持するために、手動によるキュレーションが SCOPe に再導入されました。2015 年 2 月現在、SCOPe 2.05 は、合計 110,000 件の PDB エントリのうち 71,000 件を分類しています。[ 11 ]
SCOP2 プロトタイプは、タンパク質の構造分類と分類システムのベータ版であり、タンパク質構造の進化に内在する進化の複雑さをより深く理解することを目的としていました。[ 12 ] そのため、単純な階層構造ではなく、環状置換、ドメイン融合、ドメイン崩壊などの構造的および進化的関係を表すタンパク質スーパーファミリーを接続する有向非巡回グラフネットワークです。結果として、ドメインは厳密な固定境界によって分離されるのではなく、最も類似した他の構造との関係によって定義されます。このプロトタイプは、SCOP バージョン 2 データベースの開発に使用されました。[ 7 ] 2020 年 1 月にリリースされた SCOP バージョン 2 には、SCOP 1.75 の 3902 ファミリーと 1962 スーパーファミリーと比較して、5134 ファミリーと 2485 スーパーファミリーが含まれています。分類レベルは、504,000 を超えるタンパク質構造を表す 41,000 を超える非冗長ドメインを整理しています。
2014 年にリリースされた Evolutionary Classification of Protein Domains (ECOD) データベースは、SCOP バージョン 1.75 の SCOPe 拡張版に似ています。互換性のある SCOPe とは異なり、クラス - フォールド - スーパーファミリー - ファミリーの階層を、アーキテクチャ - X - ホモロジー - トポロジー - ファミリー (A-XHTF) グループに改名し、最後のレベルは主にPfamによって定義され、分類されていない配列についてはHHsearchクラスタリングによって補完されています。[ 13 ] ECOD は、3 つの後継データベースの中で最も優れた PDB カバレッジを誇り、すべてのPDB 構造をカバーし、2 週間ごとに更新されます。[ 14 ] Pfam への直接マッピングは、ホモロジー レベルのカテゴリを使用して「クラン」グループを補完する Pfam キュレーターにとって有用であることが証明されています。[ 15 ]