遺伝子オントロジー( GO )用語エンリッチメントは、遺伝子オントロジー分類システムを利用して遺伝子セットを解釈する手法です。このシステムでは、遺伝子は機能特性に応じて事前に定義された一連のビンに割り当てられます。たとえば、遺伝子FasRは受容体として分類され、アポトーシスに関与し、細胞膜上に位置しています。
遺伝子セット(たとえば、異なる条件下で差次的に発現する遺伝子)を生成するハイスループット実験を実行する研究者は、多くの場合、基礎となる生物学的プロセスをより深く理解するために、その遺伝子セットの機能プロファイルを取得したいと考えています。これは、入力遺伝子セットを GO 内の各ビン(用語)と比較することで実行できます。各ビンに対して統計テストを実行して、入力遺伝子が濃縮されているかどうかを確認できます。
分析の出力は通常、GO用語のランク付けされたリストであり、それぞれにp値が関連付けられている。[1]
背景
遺伝子オントロジー
遺伝子オントロジー (GO) は、遺伝子または遺伝子産物をグラフ構造 (またはオントロジー) に整理された用語に階層的に分類するシステムを提供します。用語は、分子機能 (遺伝子の分子活動を説明)、生物学的プロセス (他の遺伝子と連携して遺伝子によって実行される、より大きな細胞または生理学的役割を説明)、および細胞成分 (遺伝子産物がその機能を実行する細胞内の場所を説明) の 3 つのカテゴリにグループ化されます。各遺伝子は、複数の用語で説明 (注釈付け) できます。GO は、ヒト、モデル生物、およびさまざまな他の種の 遺伝子を分類するために積極的に使用されています。
GO を使用すると、任意の遺伝子を説明するために使用される用語のセットを取得したり、逆に、用語を指定すると、その用語に注釈が付けられた遺伝子のセットを返すことができます。後者のクエリでは、完全な結果を提供するために GO の階層システムが採用されています。たとえば、核の GO 用語のクエリでは、「核膜」という用語に注釈が付けられた遺伝子が返されます。
高スループットデータの解釈
特定の種類のハイスループット実験 (例: RNA seq ) では、過剰発現または過少発現している遺伝子のセットが返されます。GO を使用すると、この遺伝子セットの機能的プロファイリングや、入力遺伝子に注釈が付けられた用語セットを調べるときに、どの GO 用語が偶然に予想されるよりも頻繁に出現するかを判断できます。たとえば、実験では、健康な細胞とがん細胞の遺伝子発現を比較する場合があります。機能プロファイリングを使用すると、がん状態に関連する根本的な細胞メカニズムを解明できます。これは、GO 用語が特定の遺伝子セットに対して統計的にエンリッチされているかどうかをテストするため、用語エンリッチメントまたは用語過剰表現とも呼ばれます。
方法
GOを使用して用語エンリッチメントを実行するためのさまざまな方法があります。方法は適用される統計テストの種類によって異なる場合がありますが、最も一般的なのはフィッシャーの正確検定/超幾何検定です。一部の方法ではベイズ統計が利用されます。 [2]多重比較に適用される補正の種類にもばらつきがありますが、最も一般的なのはボンフェローニ補正です。
方法によって入力内容も異なります。ランク付けされていない遺伝子セットを使用するものもあれば、ランク付けされた遺伝子セットを使用するものもあります。より洗練された方法では、各遺伝子を大きさ(発現レベルなど)に関連付けることができるため、恣意的なカットオフを回避できます。
ツール
- MOET: ラットゲノムデータベースにおけるマルチオントロジーおよびマルチ種解析のためのウェブベースの遺伝子セットエンリッチメントツール[3]
- PlantRegMap: 165種のGOアノテーションとGO用語エンリッチメント分析
- PLAZA Workbench: さまざまな植物種の GO、InterPro、MapMan エンリッチメント分析。
- 遺伝子オントロジーコンソーシアム(GOC)は用語エンリッチメントツールを提供しています。[4]
- 用語の強化
- FunRich [5]は、Windowsベースの無料のスタンドアロン機能エンリッチメント解析ツールです。
- Blast2GO [6]は、プラットフォームに依存しないデスクトップアプリケーションであり、新規配列データの機能エンリッチメント解析と機能アノテーションを実行する。
参考文献
- ^ Rhee, SY; Wood, V; Dolinski, K; Draghici, S (2008). 「遺伝子オントロジー注釈の使用と誤用」。Nature Reviews Genetics . 9 (7): 509–15. doi :10.1038/nrg2363. PMID 18475267. S2CID 15599098.
- ^ Bauer, S; Gagneur, J; Robinson, PN (2010). 「GOing Bayesian: ゲノムスケールデータのモデルベース遺伝子セット分析」Nucleic Acids Research . 38 (11): 3523–32. doi :10.1093/nar/gkq045. PMC 2887944 . PMID 20172960.
- ^ Vedi M、Nalabolu HS、Lin CW、Hoffman MJ、Smith JR、Brodie K、De Pons JL、Demos WM、Gibson AC、Hayman GT、Hill ML、Kaldunski ML、Lamers L、Laulederkind SJ、Thorat K、Thota J、Tutaj M、Tutaj MA、Wang SJ、Zacher S、Dwinell MR、Kwitek AE (2022年4月)。「MOET:ラットゲノムデータベースのマルチオントロジーおよびマルチ種解析のためのウェブベースの遺伝子セットエンリッチメントツール」。 遺伝学。220 ( 4)。doi : 10.1093 / genetics/iyac005。PMC 8982048。PMID 35380657。
- ^ Carbon S、Ireland A、Mungall CJ、Shu S、Marshall B、Lewis S (2008)。「AmiGO: オントロジーと注釈データへのオンラインアクセス」。バイオインフォマティクス。25 (2) 。AmiGO Hub; Webプレゼンスワーキンググループ: 288–9。doi :10.1093/bioinformatics/btn615。PMC 2639003。PMID 19033274。
- ^ Pathan, M; Keerthikumar, S; Ang, CS; Gangoda, L; Quek, CY; Williamson, NA; Mouradov, D; Sieber, OM; Simpson, RJ; Salim, A; Bacic, A; Hill, A; Stroud, DA; Ryan, MT; Agbinya, JI; Mariadasson, JM; Burgess, AW; Mathivanan, S (2015). 「テクニカルブリーフ funrich: オープンアクセスのスタンドアロン機能エンリッチメントおよび相互作用ネットワーク分析ツール」.プロテオミクス. 15 (15): 2597–601. doi :10.1002/pmic.201400515. PMID 25921073. S2CID 28583044.
- ^ Götz, S; García-Gómez, JM; Terol, J; Williams, TD; Nagaraj, SH; Nueda, MJ; Robles, M; Talón, M; Dopazo, J; Conesa, A (2008 年 6 月)。「Blast2GO スイートによる高スループット機能注釈およびデータマイニング」。核酸研究 。36 ( 10 ): 3420–35。doi :10.1093/ nar /gkn176。PMC 2425479。PMID 18445632。
