KEGG(京都遺伝子ゲノム百科事典)は、ゲノム、生物学的経路、疾患、医薬品、化学物質に関するデータベースの集合体です。KEGGは、ゲノミクス、メタゲノミクス、メタボロミクスなどのオミクス研究におけるデータ解析、システム生物学におけるモデリングとシミュレーション、創薬におけるトランスレーショナルリサーチなど、バイオインフォマティクスの研究と教育に活用されています。
KEGGデータベースプロジェクトは、当時進行中だった日本のヒトゲノム計画の下、京都大学化学研究所の教授であった金久実によって1995年に開始されました。[ 1 ] [ 2 ]ゲノム配列データの生物学的解釈に使用できるコンピュータ化されたリソースの必要性を予見し、彼はKEGG PATHWAYデータベースの開発を開始しました。これは、細胞や生物の代謝やその他のさまざまな機能に関する実験的知識を表す、手作業で作成されたKEGGパスウェイマップのコレクションです。各パスウェイマップには分子の相互作用と反応のネットワークが含まれており、ゲノム内の遺伝子をパスウェイ内の遺伝子産物(主にタンパク質)にリンクするように設計されています。これにより、KEGGパスウェイマッピングと呼ばれる分析が可能になり、ゲノム内の遺伝子コンテンツをKEGG PATHWAYデータベースと比較することで、どのパスウェイと関連する機能がゲノムにコードされている可能性が高いかを調べることができます。
開発者によると、KEGGは生物システムの「コンピュータ表現」である。[ 3 ]これはシステムの構成要素と配線図を統合している。より具体的には、遺伝子とタンパク質の遺伝的構成要素、小分子と反応の化学的構成要素、分子間相互作用と反応ネットワークの配線図である。この概念は、システム、ゲノム、化学、健康情報に分類されるKEGGの以下のデータベースで実現されている。[ 4 ]
KEGG PATHWAYデータベース(配線図データベース)は、KEGGリソースの中核を成すものです。これは、遺伝子、タンパク質、RNA、化合物、糖鎖、化学反応、疾患遺伝子、薬剤標的など、多くの要素を統合したパスウェイマップのコレクションであり、これらの要素はKEGGの他のデータベースに個別のエントリとして保存されています。パスウェイマップは、以下のセクションに分類されます。
代謝セクションには、通常の代謝経路マップに加えて、代謝の全体像を示す美しく描かれたグローバルマップが含まれています。低解像度のグローバルマップは、例えば、ゲノム研究における異なる生物の代謝能力の比較や、メタゲノム研究における異なる環境サンプルの比較などに使用できます。一方、KEGG MODULEデータベースのKEGGモジュールは、より高解像度で局所的な配線図であり、特定の生物群間で保存されているサブパスウェイや分子複合体など、経路マップ内のより密接な機能単位を表しています。KEGGモジュールは、特定の代謝能力やその他の表現型特性にリンクできる特徴的な遺伝子セットとして定義されており、ゲノムデータやメタゲノムデータの自動解釈に使用できます。
KEGG PATHWAYを補完するもう一つのデータベースとして、KEGG BRITEデータベースがあります。これは、遺伝子、タンパク質、生物、疾患、薬剤、化合物など、さまざまな実体の階層的な分類を含むオントロジーデータベースです。KEGG PATHWAYはこれらの実体の分子間相互作用と反応に限定されていますが、KEGG BRITEは多種多様な関係性を網羅しています。
1995年にKEGGプロジェクトが開始されてから数か月後、完全に配列決定された細菌ゲノムの最初の報告が発表されました。[ 5 ]それ以来、公開されたすべての完全ゲノムは、真核生物と原核生物の両方についてKEGGに蓄積されています。KEGG GENESデータベースには、これらのゲノムの遺伝子/タンパク質レベルの情報が含まれており、KEGG GENOMEデータベースには、生物レベルの情報が含まれています。KEGG GENESデータベースは、完全ゲノムの遺伝子セットで構成されており、各セットの遺伝子には、KEGGパスウェイマップ、KEGGモジュール、およびBRITE階層の配線図との対応関係を確立する形で注釈が付けられています。
これらの対応関係は、オルソログの概念を用いて作成されます。KEGG パスウェイ マップは特定の生物における実験的証拠に基づいて作成されますが、ヒトやマウスなどの異なる生物は、オルソログ遺伝子またはオルソログと呼ばれる機能的に同一の遺伝子からなる同一のパスウェイを共有することが多いため、他の生物にも適用できるように設計されています。KEGG GENES データベースのすべての遺伝子は、KEGG ORTHOLOGY (KO) データベースでこのようなオルソログにグループ化されています。KEGG パスウェイ マップのノード (遺伝子産物) および KEGG モジュールと BRITE 階層には KO 識別子が割り当てられているため、ゲノム内の遺伝子がKEGG のゲノム注釈手順によって KO 識別子で注釈付けされると、対応関係が確立されます。[ 4 ]
KEGG代謝経路マップは、代謝ネットワークの2つの側面を表すように描かれています。1つは、ゲノムにコードされた酵素がどのように接続されて連続反応を触媒するかを示すゲノムネットワーク、もう1つは、基質と生成物の化学構造がこれらの反応によってどのように変換されるかを示す化学ネットワークです。[ 6 ]ゲノム内の酵素遺伝子のセットは、KEGG経路マップに重ね合わせると酵素関係ネットワークを特定し、それによって化学構造変換ネットワークが特徴付けられ、生物の生合成および生分解の可能性を解釈することができます。あるいは、メタボロームで特定された代謝物のセットは、酵素経路と関連する酵素遺伝子の理解につながります。
化学情報カテゴリのデータベースは、総称して KEGG LIGAND と呼ばれ、化学ネットワークの知識を収集することによって整理されています。KEGG プロジェクトの開始当初、KEGG LIGAND は、化学化合物用の KEGG COMPOUND、化学反応用の KEGG REACTION、酵素命名法による反応用の KEGG ENZYME の 3 つのデータベースで構成されていました。[ 7 ]現在では、グリカン用の KEGG GLYCAN [ 8 ]と、RPAIR (反応物ペアアライメント) および RCLASS (反応クラス) と呼ばれる 2 つの補助反応データベースが追加されています。[ 9 ] KEGG COMPOUND は、代謝物に加えて、異物などのさまざまな化合物も含むように拡張されています。
KEGGでは、疾患は遺伝的要因と環境的要因の撹乱因子によって引き起こされる生物システムの撹乱状態とみなされ、薬剤は異なるタイプの撹乱因子とみなされます。[ 10 ] KEGG PATHWAYデータベースには、生物システムの正常状態だけでなく撹乱状態も含まれています。しかし、分子メカニズムが十分に理解されていないため、ほとんどの疾患について疾患経路マップを描くことはできません。KEGG DISEASEデータベースでは、疾患の既知の遺伝的要因と環境的要因を単純にカタログ化するという別のアプローチが取られています。これらのカタログは、最終的に疾患のより完全な配線図につながる可能性があります。
KEGG DRUGデータベースには、日本、米国、欧州で承認されている医薬品の有効成分が収録されています。これらの有効成分は、化学構造や化学成分によって分類され、 KEGGパスウェイマップやBRITE階層構造において、標的分子、代謝酵素、その他の分子間相互作用ネットワーク情報と関連付けられています。これにより、ゲノム情報と医薬品相互作用を統合的に解析することが可能になります。承認医薬品の範疇に含まれない生薬やその他の健康関連物質は、KEGG ENVIRONデータベースに収録されています。健康情報分野のデータベースは総称してKEGG MEDICUSと呼ばれ、日本国内で販売されているすべての医薬品の添付文書も含まれています。
2011年7月、KEGGは政府資金の大幅な削減によりFTPダウンロードのサブスクリプションモデルを導入した。KEGGは引き続きウェブサイトを通じて無料で利用できるが、サブスクリプションモデルはバイオインフォマティクスデータベースの持続可能性についての議論を引き起こしている。[ 11 ] [ 12 ]