Ensemblゲノムデータベースプロジェクトは、欧州バイオインフォマティクス研究所の科学プロジェクトであり、遺伝学者、分子生物学者、および私たち自身の種や他の脊椎動物やモデル生物のゲノムを研究する他の研究者のための集中リソースを提供します。[ 2 ] [ 3 ] [ 4 ] Ensemblは、ゲノム情報を取得するためのいくつかのよく知られたゲノムブラウザの1つです。
同様のデータベースとブラウザは、 NCBIとカリフォルニア大学サンタクルーズ校(UCSC)にも存在する。
ヒトゲノムは30億塩基対からなり、約2万~2万5千個の遺伝子をコードしています。しかし、個々の遺伝子の位置と関係が特定されない限り、ゲノムだけではほとんど役に立ちません。1つの選択肢は手動アノテーションで、科学者チームが科学雑誌や公開データベースの実験データを使用して遺伝子の位置を特定しようとします。しかし、これは時間がかかり、骨の折れる作業です。自動アノテーションとして知られる代替手段は、コンピュータの力を使用してタンパク質とDNAの複雑なパターンマッチングを行うことです。[ 5 ] [ 6 ] Ensemblプロジェクトは、ヒトゲノムプロジェクトの完了が間近に迫っていたことを受けて1999年に開始され、当初の目標はヒトゲノムを自動的にアノテーションし、このアノテーションを利用可能な生物学的データと統合し、このすべての知識を一般に公開することでした。[ 2 ]
Ensemblプロジェクトでは、配列データが遺伝子アノテーションシステム( Perlで書かれたソフトウェア「パイプライン」の集合)に入力され、予測された遺伝子位置のセットが作成され、後続の解析と表示のためにMySQLデータベースに保存されます。Ensemblはこれらのデータを世界の研究コミュニティに無料で公開しています。Ensemblプロジェクトによって生成されたすべてのデータとコードはダウンロード可能であり[ 7 ]、リモートアクセスを可能にする公開データベースサーバーもあります。さらに、EnsemblのWebサイトでは、データの多くをコンピュータで生成した視覚表示を提供しています。
このプロジェクトは時間の経過とともに、マウス、ショウジョウバエ、ゼブラフィッシュなどの主要なモデル生物を含む追加の種や、遺伝子変異や調節機能を含むより広範なゲノムデータを含むように拡大しました。2009 年 4 月以降、姉妹プロジェクトであるEnsembl Genomes は、Ensembl の範囲を無脊椎動物、植物、菌類、細菌、原生生物に拡張し、遺伝子の分類学的および進化的コンテキストを提供することに重点を置いていますが、元のプロジェクトは引き続き脊椎動物に重点を置いています。[ 8 ] [ 9 ]
2020年現在、EnsemblはEnsemblおよびEnsembl Genomesデータベースの両方で5万を超えるゲノムをサポートしており、ゲノム注釈データをユーザーがより迅速に利用できるように設計された新しいウェブサイトであるRapid Releaseや、 SARS-CoV-2参照ゲノムにアクセスするための新しいウェブサイトであるCOVID-19など、いくつかの革新的な新機能を追加しています。

Ensemblのコンセプトの中核となるのは、参照ゲノムに対する遺伝子やその他のゲノムデータの配列をグラフィカルに自動的に生成する機能です。これらはデータトラックとして表示され、個々のトラックの表示/非表示を切り替えることで、ユーザーは研究テーマに合わせて表示をカスタマイズできます。また、インターフェースでは、特定の領域を拡大表示したり、ゲノム上をどちらの方向にも移動したりすることも可能です。
その他の表示では、全核型からDNAおよびアミノ酸配列のテキストベースの表現まで、さまざまな解像度レベルのデータを表示したり、さまざまな種にわたる類似遺伝子(相同遺伝子)の系統樹など、他の種類の表示方法を提供したりできます。グラフィックは表形式の表示によって補完され、多くの場合、 FASTAなどのさまざまな標準ファイル形式でページから直接データをエクスポートできます。
外部で作成されたデータも、 BAM、BED、PSLなどのサポートされている形式の適切なファイルをアップロードすることで、表示に追加できます。
グラフィックは、標準のPerlグラフィック表示ライブラリであるGDをベースにした、一連のカスタムPerlモジュールを使用して生成されます。
Ensemblは、ウェブサイトに加えて、遺伝子やタンパク質などの生物学的オブジェクトをモデル化するREST APIとPerl API [ 10 ] (アプリケーションプログラミングインターフェース)を提供しており、関心のあるデータを取得するための簡単なスクリプトを作成できます。同じAPIが、ウェブインターフェースの内部でデータを表示するために使用されています。これは、コアAPI、比較ゲノミクスデータ用比較API、SNP、SNV、CNVなどにアクセスするためのバリエーションAPI、および制御データにアクセスするための機能ゲノミクスAPIなどのセクションに分かれています。Ensemblのウェブサイトには、APIのインストール方法と使用方法に関する詳細な情報が掲載されています。
このソフトウェアを使用すれば、公開されているMySQLデータベースにアクセスでき、膨大なデータセットをダウンロードする必要がなくなります。ユーザーは、SQLクエリを直接使用してMySQLからデータを取得することもできますが、そのためには現在のデータベーススキーマに関する高度な知識が必要です。
BioMartデータマイニングツールを使用すれば、大規模なデータセットを取得できます。このツールは、複雑なクエリを使用してデータセットをダウンロードするためのWebインターフェースを提供します。
最後に、 FTPサーバーがあり、これを利用すると、MySQLデータベース全体だけでなく、選択したデータセットを他の形式でダウンロードすることもできます。
注釈付きゲノムには、最も完全に配列決定された脊椎動物と選択されたモデル生物が含まれます。これらはすべて真核生物であり、原核生物は含まれていません。2022年現在、271種が登録されており、これには以下が含まれます。[ 11 ]
Ensemblプロジェクトのデータはすべてオープンアクセスであり、ソフトウェアもすべてオープンソースで、CC BY 4.0ライセンスの下で科学コミュニティに無料で提供されています。現在、Ensemblデータベースのウェブサイトは、サービスの向上を図るため、世界3か所にミラーリングされています。