| 開発者 | クリストファー・バージ |
|---|---|
| 利用可能 | 英語 |
| タイプ | バイオインフォマティクスツール |
| Webサイト | genes.mit.edu/GENSCANinfo.html |
バイオインフォマティクスにおいて、GENSCANはゲノムDNAの完全な遺伝子構造を識別するプログラムである。これはG HMMベースのプログラムであり、さまざまな生物のゲノム配列における遺伝子の位置とエクソン-イントロン境界を予測するために使用できる。GENSCAN WebサーバーはMITにある。[1]
GENSCANは、スタンフォード大学のサミュエル・カーリンの研究グループのクリストファー・バージによって開発されました。[2] [3] [4]
歴史
2001年、ヒト遺伝子予測の世界は比較ゲノム科学に参入しました。その結果、GENSCANをより高精度に改良したTWINSCANというプログラムが開発されました。その後、GHMMモデルをさらに改良したN-SCANなどのプログラムが開発されました。[5]
2002年時点で、GENSCANはバイオインフォマティクスの分野で人気のツールであり続け、カリフォルニア大学サンタクルーズ校とEnsembl ゲノムブラウザで公開されたゲノムの標準機能となった。[5]
実装
ゲノムモデル
GENSCANのゲノム配列モデルを開発する際の主な目標は、真核生物遺伝子の個々の機能単位を構成する一般的な特性と特定の特性(エクソン、イントロン、スプライス部位、プロモーターなど)の両方を特定することでした。遺伝子や遺伝子ファミリーの転写やスプライシングに関連するシグナル( TATAボックスなど)ではなく、すべてのタンパク質コード遺伝子の大部分を処理する一般的な転写、スプライシング、翻訳機構によって認識可能な特徴に特に重点が置かれました。さらに、特定のタンパク質モチーフやデータベース相同性情報のモデルではなく、コード領域の一般的な3周期5次マルコフモデルが使用されています。さらに、モデルはヒトゲノムの構成領域間の構造的および密度的な違いを考慮しています。[ 3]
これらの要素の使用により、GENSCANはタンパク質配列データベース内の類似遺伝子を参照する必要なく機能します。代わりに、GENSCANによって生成された予測は、相同性に基づく遺伝子同定方法(BLASTXを使用したタンパク質データベースのクエリなど)によって収集された予測を補完します。全体として、GENSCANで使用されるモデルの構造は、一般隠れマルコフモデルに似ています。[3]
特徴
GENSCAN の実装は、他のプログラムとはさまざまな点で異なります。注目すべき違いは、GENSCAN が、両方の鎖に存在する遺伝子を同時に分析する二本鎖 DNAのみに焦点を当てたゲノム配列モデルを使用していることです。また、GENSCAN は、当時の他のプログラムのように単一の完全な遺伝子配列しか分析できなかったのに対し、部分的な遺伝子があるか遺伝子がない状況でもゲノムを分析できます。これら 2 つの要素により、GENSCAN は、より長いヒトゲノムの分析に特に役立ちます。さらに、GENSCAN は、DNA およびタンパク質配列の機能信号をモデル化できるように最大依存性分解の概念を採用しており、プログラムで信号位置間の依存性を考慮できるようになります。これは、GENSCAN で実装されており、ドナースプライス信号のモデルが生成され、プレ mRNA配列のドナースプライス部位の認識メカニズムに関連する依存性をキャプチャします。[3]
GENSCANは、前方後方アルゴリズムを使用して各予測の精度を計算する機能を備えています。[3]
より長い配列におけるエクソンと遺伝子の位置に関してヒト遺伝子の構造と全体的な構成を予測することは、GENSCAN のさらに有用なコンポーネントです。これの一部として、いくつかの異なる機能があります。その 1 つは、経験的に生成されたモデル パラメータのセットを使用して、ヒトゲノムの C + G 領域間の遺伝子構造と構成の違いを捉える機能です。もう 1 つの派生機能は、前述のように、部分的な遺伝子と二本鎖 DNA を扱う機能に加えて、配列内の複数の遺伝子を予測することです。最後に、これにより、GENSCAN は、ドナーとアクセプターのスプライス サイトの新しいモデルを使用して、シグナル位置間の依存関係を捉えることもできます。[3]
効率
GENSCANの実行時間は、現実的なサイズのシーケンス(最低でも数キロビット)が与えられた場合、ほぼ線形に増加しますが、最悪の場合には2乗になります。[3]
補足的な使用法
GENSCAN は、他のゲノム予測プログラムと同様に、他のプログラムと完全に一致する結果を生成しません。これは、アルゴリズム、パラメータ、トレーニング セットの違いなど、さまざまな要因によるものです。そのため、GENSCAN は、2 つの遺伝子予測プログラムの結果を組み合わせる際に利用され、組み合わせたプログラムの 1 つがシーケンス予測に自信がある場合は、そのシーケンスが使用されます。一方、どちらのプログラムも予測に自信がない場合は、両方のプログラムが同意した場合にのみ、予測されたシーケンスが使用されます。[6]
正確さ
短いデータセットで GENSCAN の精度を評価するテストが行われました。1 つのテストは、570 個の脊椎動物のマルチエクソン遺伝子配列を含む Burset/Guigó データセットで行われました。このテストから生成されたデータは、同じデータセットで他のプログラムをテストして生成されたデータとともに、下の表に示されています。表では、GENSCAN は、ヌクレオチドとエクソンの両方を含む配列の予測において、競合他社よりも一般的に正確であることが示されています。[3]
さらに、以下の表は、 C + Gの範囲と生物の種類別に整理されたゲノム配列に関するGENSCANの精度を具体的に説明しています。提供されたデータから、GENSCANの精度の変動はC + G含有量と生物の種類にほとんど影響されないことがわかります。これは、比較可能なゲノム予測プログラムの結果に影響を与える要因からGENSCANが独立していることをさらに示しています。[3]
GENSCAN の精度に関する別のテストが、以前の GeneParser テスト セットのものとアミノ酸に関して 25% 以上一致するすべての遺伝子を取り除いた 2 つの GeneParser データ セットを使用して実施されました。このテストと他のプログラムで実行された同じテストの結果のデータを以下の表に示します。前述の Burset/Guigó データ セットと GeneParser データ セットでの GENSCAN の精度にはほとんど差がないことがわかります。ただし、変動が大きい特定のデータ ポイント (たとえば、GeneParser セット II の高 C + G ヌクレオチドの 98% CC に対して、Burset/Guigó の C + G >60 ヌクレオチドの 90% CC) は、GeneParser データ セットのサンプル サイズがはるかに小さいことに起因する可能性があります。前述の 3 つのデータ セットのテストでは、それぞれの結論を導き出すのに十分な情報が得られました。ただし、これらのデータセットは現実的なサイズではないため、その信頼性と範囲は当然疑問視されています。[3]
1997年、GENSCANは以前の遺伝子予測プログラムよりも精度が高いことが判明しました。しかし、GENSCANは現実的なデータセットで遺伝子の10~15%しか正確に予測できないことが示されたため、まだ研究が必要でした。[5]このような不正確さのため、GENSCANや他のプログラムによる予測は、相補DNA配列、発現配列タグ(EST)配列、または既知のタンパク質配列と比較して検証する必要があります。[6]
参考文献
- ^ http://genes.mit.edu/GENSCAN.html 2013-09-06にWayback MachineでアーカイブMITのGENSCAN Webサーバー
- ^ Burge, CB (1998) pre-mRNA スプライシングシグナルの依存性のモデリング。Salzberg , S.、Searls, D.、Kasif, S. 編。分子生物学における計算方法、Elsevier Science、アムステルダム、pp. 127-163。ISBN 978-0-444-50204-9
- ^ abcdefghijklm Burge, Christopher ; Karlin, Samuel (1997). 「ヒトゲノムDNAの完全な遺伝子構造の予測」(PDF) . Journal of Molecular Biology . 268 (1): 78–94. CiteSeerX 10.1.1.115.3107 . doi :10.1006/jmbi.1997.0951. PMID 9149143. 2015-06-20に オリジナル(PDF)からアーカイブ。
- ^ Burge, C. ; Karlin, S. (1998). 「ゲノムDNA中の遺伝子の発見」Current Opinion in Structural Biology . 8 (3): 346–354. doi : 10.1016/S0959-440X(98)80069-9 . PMID 9666331.
- ^ abc Flicek, Paul (2007). 「遺伝子予測:比較と対比」.ゲノム生物学. 8 (12): 233. doi : 10.1186/gb-2007-8-12-233 . ISSN 1474-760X. PMC 2246255. PMID 18096089 .
- ^ ab Rogic, S.; Ouellette, BFF; Mackworth, AK (2002-08-01). 「2つの遺伝子検索プログラムからの予測を組み合わせることで遺伝子認識の精度を向上させる」.バイオインフォマティクス. 18 (8): 1034–1045. doi : 10.1093/bioinformatics/18.8.1034 . ISSN 1367-4803. PMID 12176826.
