WormBaseは、線虫モデル生物であるCaenorhabditis elegansの生物学とゲノムに関するオンライン生物データベースであり、他の関連線虫に関する情報も含まれています。[ 1 ] [ 2 ] WormBaseは、C. elegans研究コミュニティによって情報リソースとして、また研究成果を発表・配布する場として利用されています。データベースは定期的に更新され、2か月ごとに新しいバージョンがリリースされます。WormBaseは、Generic Model Organism Database (GMOD)プロジェクトに参加している組織の1つです。また、Alliance of Genome Resourcesの一部でもあります。[ 3 ]
WormBaseは、以下の主要なデータセットで構成されています。
さらに、WormBaseにはC. elegansの研究に関する最新の検索可能な文献目録が含まれており、 WormBookプロジェクトと連携しています。
WormBaseは、データベースからデータを検索および取得するためのさまざまな方法を提供しています。
WormBaseにおける配列キュレーションとは、主要なゲノム配列およびコンセンサス遺伝子セットの維持と注釈付けを指します。
C. elegansのゲノム配列は最も正確で完全な真核生物ゲノム配列であるにもかかわらず、新たな証拠が生み出されるにつれて、継続的に改良が必要とされてきた。これらの変更の多くは単一ヌクレオチドの挿入または欠失であったが、いくつかの大きな誤アセンブリが発見された。たとえば、2005年には39 kbのコスミドを反転させる必要があった。その他の改善は、ゲノムDNAとcDNA配列の比較およびRNASeqハイスループットデータの解析から得られた。ゲノム配列と転写産物の違いが特定された場合、元のゲノムデータを再解析すると、ゲノム配列の修正につながることが多い。ゲノム配列の変更は、WormBaseの異なるリリースから得られたデータの染色体座標を比較する際に困難をもたらす。座標再マッピングプログラムがあり、これらの比較を支援するためにマッピングデータが利用可能である。 [ 7 ]
WormBaseに登録されているすべての遺伝子セットは、当初、遺伝子予測プログラムによって生成されました。遺伝子予測プログラムは妥当な遺伝子構造のセットを提供しますが、最も優れたものでも完全な遺伝子構造の約80%しか正しく予測できません。これらのプログラムは、異常な構造を持つ遺伝子、弱い翻訳開始シグナル、弱いスプライス部位、または単一エクソン遺伝子の予測が困難です。また、遺伝子が偽遺伝子である場合、コーディング遺伝子モデルを誤って予測したり、遺伝子のアイソフォームを予測したりすることがほとんどありません。
C. elegans、C. briggsae、C. remanei、およびC. brenneriの遺伝子モデルは、手作業でキュレーションされています。遺伝子構造の変更の大部分は、小原雄二氏のESTライブラリ、マーク・ヴィダル氏のOrfeomeプロジェクト(worfdb.dfci.Harvard.edu/)、ウォーターストンとヒリアーのIlluminaデータ、マケドンカ・ミトレヴァ氏の454データなどの大規模プロジェクトの転写データに基づいています。ただし、他のデータタイプ(タンパク質アライメント、ab initio予測プログラム、トランススプライスリーダー部位、ポリAシグナルと付加部位、SAGEおよびTEC-RED転写タグ、質量分析ペプチド、保存タンパク質ドメインなど)は、特に発現量が低く転写データが十分に利用できない場合に、構造の改良に役立ちます。利用可能な線虫種間で遺伝子が保存されている場合は、比較分析も非常に有益です。
WormBaseは、研究者に対し、遺伝子構造の誤りを示す証拠がある場合は、ヘルプデスクを通じて報告するよう推奨しています。変更を示すcDNAまたはmRNA配列の証拠は、EMBL/GenBank/DDBJに提出してください。WormBaseはこれらの公開データベースから定期的に配列データを取得しているため、これは遺伝子モデルの確認と証拠の裏付けに役立ちます。また、これによりデータが公開され、研究者への適切な参照と謝辞が可能になります。
CDS(または偽遺伝子)に変更が加えられると、古い遺伝子モデルは「履歴」オブジェクトとして保存されます。このオブジェクトには「AC3.5:wp119」のような接尾辞が付きます。ここで「AC3.5」はCDSの名前、「119」は変更が行われたデータベースのリリース番号を示します。変更の理由と根拠はCDSの注釈に追加されます。これらは、WormBaseウェブサイトのCDSの「ツリー表示」セクションにある「表示/備考」セクションで確認できます。
WormBaseでは、遺伝子とは発現している領域、または発現していたが現在は偽遺伝子となっている領域のことです。遺伝子には「WBGene00006415」のような固有の識別子があります。C. elegansのすべてのWormBase遺伝子には、配列名も付いています。これは、遺伝子が存在するコスミド、フォスミド、またはYACクローンから派生したもので、例えばF38H4.7は、コスミド「F38H4」上にあり、そのコスミド上に少なくとも6つの他の遺伝子が存在することを示しています。遺伝子がファミリーのメンバーとして分類できるタンパク質を生成する場合、その遺伝子には、タグ遺伝子ファミリーの30番目のメンバーであることを示すtag-30のようなCGC名も割り当てられることがあります。遺伝子ファミリー名の割り当てはWormBaseによって管理されています。[ 8 ]出版前に、WormBaseで名前のリクエストを行う必要があります。[ 9 ]
There are a few exceptions to this format, like the genes cln-3.1, cln-3.2, and cln-3.3 which all are equally similar to the human gene CLN3. Gene GCG names for non-elegans species in WormBase have the 3-letter species code prepended, like Cre-acl-5, Cbr-acl-5, Cbn-acl-5.
A gene can be a Pseudogene, or can express one or more non-coding RNA genes (ncRNA) or protein-coding sequences (CDS).
Pseudogenes are genes that do not produce a reasonable, functional transcript. They may be pseudogenes of coding genes or of non-coding RNA and may be whole or fragments of a gene and may or may not express a transcript. The boundary between what is considered a reasonable coding transcript is sometimes subjective as, in the absence of other evidence, the use of weak splice sites or short exons can often produce a putative, though unsatisfactory, model of a CDS. Pseudogenes and genes with a problematic structure are constantly under review in WormBase and new evidence is used to try to resolve their status.
Coding Sequences (CDSs) are the only part of a Gene's structure that is manually curated in WormBase. The structure of the Gene and its transcripts are derived from the structure of their CDSs.
CDSs have a Sequence Name that is derived from the same Sequence Name as their parent Gene object, so the gene 'F38H4.7' has a CDS called 'F38H4.7'. The CDS specifies coding exons in the gene from the START (Methionine) codon up to (and including) the STOP codon.
Any gene can code for multiple proteins as a result of alternative splicing. These isoforms have a name that is formed from the Sequence Name of the gene with a unique letter appended. In the case of the gene bli-4 there are 6 known CDS isoforms, called K04F10.4a, K04F10.4b, K04F10.4c, K04F10.4d, K04F10.4e and K04F10.4f.
It is common to refer to isoforms in the literature using the CGC gene family name with a letter appended, for example pha-4a, however this has no meaning within the WormBase database and searches for pha-4a in WormBase will not return anything. The correct name of this isoform is either the CDS/Transcript name: F38A6.1a, or even better, the Protein name: WP:CE15998.
The transcripts of a gene in WormBase are automatically derived by mapping any available cDNA or mRNA alignments onto the CDS model. These gene transcripts will therefore often include the UTR exons surrounding the CDS. If there are no available cDNA or mRNA transcripts, then the gene transcripts will have exactly the same structure as the CDS that they are modelled on.
遺伝子転写産物は、それらを作成するために使用されたCDSの配列名にちなんで命名されます。たとえば、F38H4.7またはK04F10.4aです。
ただし、UTR に代替スプライシングがあり、タンパク質配列が変わらない場合は、代替スプライシングされた転写産物には数字が付加されます。たとえば、K04F10.4a.1とK04F10.4a.2です。たとえばAC3.5のように、コード遺伝子のアイソフォームがない場合でも、UTR に代替スプライシングがある場合は、AC3.5.1とAC3.5.2など、複数の転写産物が存在します。代替 UTR 転写産物がない場合、単一の coding_transcript は CDS と同じ名前になり、K04F10.4f の場合のように .1 は付加されません。
オペロンとして共転写される遺伝子群は、オペロンオブジェクトとしてキュレーションされます。これらのオブジェクトにはCEOP5460のような名前が付けられ、SL2トランススプライシングリーダー配列部位からの証拠に基づいて手動でキュレーションされます。
WormBaseには、非コードRNA遺伝子のクラスがいくつか存在します。
scRNA遺伝子も1つ存在する。
トランスポゾンは遺伝子として分類されないため、親遺伝子オブジェクトを持ちません。その構造は、 C29E6.6のような名前の Transposon_CDS オブジェクトとして管理されます。
WormBaseに登録されている線虫以外の種は、コスミドやYACのシーケンス解析を用いないシーケンス技術によってゲノムが構築されています。そのため、これらの種にはコスミド名に基づくCDSや遺伝子転写産物の配列名がありません。代わりに、以下の表に示すような固有の英数字識別子が付与されています。
遺伝子のタンパク質産物は、CDS配列の翻訳によって生成されます。それぞれの固有のタンパク質配列には、WP:CE40440のような固有の識別名が付けられます。WormBaseに登録されている各種のタンパク質識別名の例を、以下の表に示します。
同一種内において、異なる遺伝子由来の2つのCDS配列が同一である可能性があり、そのため、異なる遺伝子によってコードされるタンパク質が同一である可能性もある。このような場合、たとえ2つの遺伝子によって産生されたタンパク質であっても、単一の固有の識別名が用いられる。
WormBase ParaSite [ 10 ]は、欧州バイオインフォマティクス研究所とウェルカム・トラスト・サンガー研究所で開発された、寄生性蠕虫(線虫類と扁形動物)の約100のドラフトゲノムのサブポータルです。すべてのゲノムはアセンブルされ、注釈が付けられています。タンパク質ドメインや遺伝子オントロジー用語などの追加情報も利用可能です。遺伝子ツリーにより、寄生性蠕虫、他の線虫類、および非蠕虫類の比較対象種間のオルソログのアライメントが可能になります。大規模なデータアクセスを可能にするBioMartデータマイニングツールが提供されています。
WormBaseは、欧州バイオインフォマティクス研究所、ウェルカム・トラスト・サンガー研究所、オンタリオがん研究所、セントルイス・ワシントン大学、カリフォルニア工科大学の共同プロジェクトです。国立衛生研究所からの助成金P41-HG002223と英国医学研究評議会からの助成金G0701197によって支援されています。[ 11 ]カリフォルニア工科大学は生物学的キュレーションと基盤となるオントロジーの開発を行い、EBIは配列キュレーションと計算、データベース構築を行い、サンガー研究所は主に寄生性線虫のゲノムと遺伝子のキュレーションと表示に関与し、OICRはウェブサイトと主要なデータマイニングツールを開発しています。