保存ドメインデータベース(CDD )は、古代ドメインと全長タンパク質のための、十分に注釈付けされた多重配列アライメントモデルと派生データベース検索モデルのデータベースです。 [ 1 ]このデータベースは位置特異的スコアマトリックスで構成されており、保存ドメインの識別や機能部位の推論など、タンパク質注釈のリソースとして機能します。[ 2 ]
ドメインは、タンパク質の明確な機能的および/または構造的単位と考えることができます。実際、これら2つの分類はしばしば一致し、ポリペプチド鎖の独立して折り畳まれる単位は、特定の機能も担っています。ドメインは、さまざまな文脈で存在しうる、繰り返し出現する(配列または構造)単位として識別されることがよくあります。分子進化において、このようなドメインは構成要素として利用され、タンパク質の機能を調節するためにさまざまな配置で組み換えられてきた可能性があります。CDDは、保存ドメインを分子進化における繰り返し出現する単位と定義しており、その範囲は配列および構造解析によって決定できます。
NCBIの保存ドメインキュレーションプロジェクトの目標は、データベース利用者に、ファミリー内の残基の保存と分岐のパターンが機能特性とどのように関連しているかについての洞察を提供し、配列/構造/機能の関係を理解するのに役立つより詳細な情報への有用なリンクを提供することです。この目的のために、CDDキュレーターは、ドメインモデルの基盤となる従来の多重配列アライメントを補完し充実させるために、3次元構造と保存されたコアモチーフ、保存された特徴/部位、系統発生的組織、電子文献リソースへのリンクなど、以下の種類の情報を含めています。
CDDコンテンツには、NCBIが手動でキュレーションしたドメインモデルと、多数の外部ソースデータベース(Pfam、SMART、COG、PRK、TIGRFAM)からインポートされたドメインモデルが含まれています。NCBIがキュレーションしたドメインの特徴は、3D構造情報を使用してドメイン境界を明示的に定義し、ブロックを整列させ、整列の詳細を修正し、配列/構造/機能の関係についての洞察を提供する点です。手動でキュレーションされたモデルは、共通の祖先によって明確に関連付けられているドメインファミリーを記述する場合、階層的に整理されます。データの重複のない表示を提供するために、CDDはさまざまなソースからの類似したドメインモデルをスーパーファミリーにクラスタリングします。
このコレクションは、NCBIのEntrezクエリおよび取得システムの一部でもあり、他の多数のリソースと相互リンクされています。CDDは、タンパク質配列上のドメインフットプリントと保存された機能部位の注釈を提供します。NCBIのEntrezシステムで追跡されているタンパク質配列については、事前に計算されたドメイン注釈を取得でき、CDDのモデルコレクションは、「CD-Searchサービス」を介して新しいタンパク質配列でクエリできます。米国国立生物工学情報センター。または「バッチCD検索」 * 。米国国立生物工学情報センター。これにより、大規模なタンパク質クエリセットに対するアノテーションの計算とダウンロードが可能になります。