
計算生物学において、遺伝子予測または遺伝子探索とは、ゲノムDNAのうち遺伝子をコードする領域を特定するプロセスを指します。これには、タンパク質をコードする遺伝子やRNA遺伝子だけでなく、調節領域などの他の機能要素の予測も含まれます。遺伝子探索は、ゲノム配列が決定された後、その生物種のゲノムを理解するための最初にして最も重要なステップの一つです。
初期の頃、「遺伝子探索」は、生きた細胞や生物に対する綿密な実験に基づいて行われていました。複数の異なる遺伝子の相同組換え率を統計的に分析することで、特定の染色体上の遺伝子の順序を決定することができ、こうした多くの実験から得られた情報を組み合わせることで、既知の遺伝子の相対的なおおよその位置を示す遺伝子地図を作成することができました。今日では、包括的なゲノム配列と強力な計算リソースが研究コミュニティで利用可能になったことで、遺伝子探索は主に計算問題として再定義されています。
配列が機能的であるかどうかを判断することは、遺伝子またはその産物の機能を判断することとは区別されるべきである。遺伝子の機能を予測し、その予測が正確であることを確認するには、遺伝子ノックアウトやその他のアッセイによる生体内実験[ 1 ]が依然として必要であるが、バイオインフォマティクス研究の最前線[ 2 ]では、配列のみに基づいて遺伝子の機能を予測することがますます可能になっている。
遺伝子予測は、配列アセンブリ、非コード領域のフィルタリング、反復配列のマスキングに続く、ゲノムアノテーションの重要なステップの1つです。 [ 3 ]
遺伝子予測は、 DNA結合タンパク質(転写因子)がゲノム内の特定の結合部位をどのように見つけるかを調査するいわゆる「ターゲット探索問題」と密接に関連しています。[ 4 ] [ 5 ]構造遺伝子予測の多くの側面は、遺伝子転写、翻訳、タンパク質間相互作用、調節プロセスなど、細胞内の基礎的な生化学的プロセスに関する現在の理解に基づいています。これらは、トランスクリプトミクス、プロテオミクス、メタボロミクス、そしてより一般的には構造および機能ゲノミクスなどのさまざまなオミクス分野で活発に研究されています。
経験的(類似性、相同性、または証拠に基づく)遺伝子探索システムでは、標的ゲノム内で、既知の発現配列タグ、メッセンジャーRNA(mRNA)、タンパク質産物、相同配列またはオルソロガス配列といった外部証拠に類似した配列が検索されます。mRNA配列が与えられれば、それが転写されたはずの固有のゲノムDNA配列を導き出すのは容易です。タンパク質配列が与えられれば、遺伝暗号の逆翻訳によって、考えられるコーディングDNA配列のファミリーを導き出すことができます。候補となるDNA配列が決定されれば、標的ゲノム内で完全一致または部分一致、完全一致または不完全一致の一致を効率的に検索することは、比較的簡単なアルゴリズムの問題です。配列が与えられれば、BLAST、FASTA、Smith-Watermanなどの局所アライメントアルゴリズムが、標的配列と候補となる一致との間の類似領域を探します。一致は完全一致または部分一致、完全一致または不完全一致のいずれかになります。このアプローチの成功は、配列データベースの内容と精度によって制限されます。
既知のメッセンジャーRNAまたはタンパク質産物との高い類似性は、標的ゲノムの領域がタンパク質コード遺伝子であることを示す強力な証拠となる。しかし、このアプローチを体系的に適用するには、mRNAおよびタンパク質産物の広範な配列決定が必要となる。これは費用がかかるだけでなく、複雑な生物では、ゲノム内のすべての遺伝子のうち、特定の時点で発現するのはごく一部に過ぎないため、多くの遺伝子の外因性証拠を単一の細胞培養で容易に得ることはできない。したがって、複雑な生物のほとんどまたはすべての遺伝子の外因性証拠を収集するには、数百または数千もの細胞型を研究する必要があり、これはさらなる困難を伴う。例えば、ヒトの遺伝子の中には、胚または胎児としての発生中にのみ発現するものがあり、倫理的な理由から研究が難しい場合がある。
こうした困難にもかかわらず、ヒトだけでなく、マウスや酵母といった生物学における重要なモデル生物についても、膨大な転写産物およびタンパク質配列データベースが作成されてきた。例えば、RefSeqデータベースには多くの異なる種の転写産物およびタンパク質配列が含まれており、Ensemblシステムはこれらの情報をヒトおよび他のいくつかのゲノムに包括的にマッピングしている。しかしながら、これらのデータベースは不完全であり、少量ではあるが重要な量の誤ったデータが含まれている可能性が高い。
RNA-SeqやChIP-シーケンシングなどの新しいハイスループットトランスクリプトームシーケンシング技術は、遺伝子予測と検証に外部証拠を追加する機会を開き、発現配列タグやDNAマイクロアレイなどの従来の遺伝子発現測定方法に代わる、構造的に豊富でより正確な方法を可能にします。
遺伝子予測における主な課題としては、生DNAデータにおけるシーケンスエラーへの対処、シーケンスアセンブリの品質への依存、ショートリードの処理、フレームシフト変異、重複遺伝子、不完全な遺伝子などが挙げられる。
原核生物では、遺伝子配列の相同性を探す際に水平遺伝子伝達を考慮することが不可欠です。現在の遺伝子検出ツールで十分に活用されていないもう1つの重要な要素は、原核生物と真核生物の両方に存在する遺伝子クラスター、すなわちオペロン(単一のプロモーターの制御下にある遺伝子クラスターを含む機能的なDNA単位)の存在です。最も一般的な遺伝子検出ツールは、各遺伝子を他の遺伝子とは独立して個別に扱いますが、これは生物学的に正確ではありません。
遺伝子予測は、遺伝子の内容とシグナル検出に基づく内在的な手法です。多くの遺伝子について外部証拠を得るには多大な費用と困難が伴うため、ゲノムDNA配列のみを体系的に検索してタンパク質コード遺伝子の特徴的な兆候を探す、遺伝子探索に頼らざるを得ません。これらの兆候は、遺伝子が近くにあることを示す特定の配列であるシグナル、またはタンパク質コード配列自体の統計的特性である内容に大別できます。遺伝子探索は、推定遺伝子が機能的であることを決定的に立証するには一般的に外部証拠が必要となるため、遺伝子予測と表現する方がより正確かもしれません。

原核生物のゲノムでは、遺伝子にはプリブナウボックスや転写因子結合部位など、特異的で比較的よく理解されているプロモーター配列(シグナル)があり、体系的に容易に同定できます。また、タンパク質をコードする配列は、通常数百から数千塩基対の長さを持つ、連続した1つのオープンリーディングフレーム(ORF)として存在します。終止コドンの統計的性質から、この長さのオープンリーディングフレームが見つかるだけでも、かなり有益な情報となります。(遺伝暗号の64個のコドンのうち3個が終止コドンであるため、ランダムな配列では約20~25コドンごと、つまり60~75塩基対ごとに終止コドンが存在すると予想されます。)さらに、タンパク質をコードするDNAには、この長さの配列で容易に検出できる一定の周期性やその他の統計的特性があります。これらの特性により、原核生物の遺伝子探索は比較的容易であり、適切に設計されたシステムでは高い精度を達成できます。
真核生物、特にヒトのような複雑な生物における遺伝子の第一原理探索は、いくつかの理由からかなり困難である。第一に、これらのゲノムにおけるプロモーターやその他の調節シグナルは、原核生物よりも複雑で理解が不十分であるため、確実に認識することがより困難である。真核生物の遺伝子探索によって特定されたシグナルの2つの典型的な例は、CpGアイランドとポリ(A)テールの結合部位である。
第二に、真核細胞が用いるスプライシング機構により、ゲノム内の特定のタンパク質コード配列は、非コード配列(イントロン)によって隔てられた複数の部分(エクソン)に分割されます。(スプライス部位自体も、真核生物の遺伝子探索ツールがしばしば識別するように設計されているシグナルの一つです。)ヒトの典型的なタンパク質コード遺伝子は、それぞれ200塩基対未満の長さのエクソンが十数個、中には20~30塩基対と短いものもあるかもしれません。そのため、真核生物のタンパク質コードDNAの周期性やその他の既知の内容特性を検出することは、はるかに困難になります。
原核生物と真核生物のゲノム両方に対する高度な遺伝子探索ツールは、通常、さまざまなシグナルとコンテンツ測定からの情報を統合するために、隠れマルコフモデル(HMM)などの複雑な確率モデルを使用します。 GLIMMERシステムは、原核生物に対して広く使用されている高精度の遺伝子探索ツールです。GeneMarkも人気のあるアプローチです。それに比べて、真核生物のab initio遺伝子探索ツールは限られた成功しか収めていません。 注目すべき例としては、 GENSCANとgeneidプログラムがあります。 GeneMark-ES と SNAP 遺伝子探索ツールは、GENSCAN と同様に GHMM ベースです。 これらは、学習されていないゲノム配列に対して遺伝子探索ツールを使用することに関連する問題に対処しようとしています。[ 7 ] [ 8 ] mSplicer [ 9 ] CONTRAST [ 10 ]またはmGene [ 11 ]などの最近のアプローチも、サポートベクターマシンなどの機械学習技術を使用して、遺伝子予測を成功させています。彼らは、隠れマルコフサポートベクターマシンまたは条件付き確率場を用いて識別モデルを構築し、正確な遺伝子予測スコアリング関数を学習する。
第一原理法はベンチマークされており、感度が100%に近いものもありますが、[ 3 ]感度が高くなるにつれて、偽陽性の増加により精度が低下します。
予測に使用される派生シグナルには、 k-mer統計、アイソコア(遺伝学)または構成ドメインGC組成/均一性/エントロピー、配列とフレーム長、イントロン/エクソン/ドナー/アクセプター/プロモーターおよびリボソーム結合部位語彙、フラクタル次元、擬似数値コード化DNAのフーリエ変換、 Z曲線パラメータ、および特定の実行特徴などのサブシーケンス統計から得られる統計が含まれます。[ 12 ]
配列で直接検出できるシグナル以外のシグナルが遺伝子予測を改善する可能性があることが示唆されている。たとえば、調節モチーフの同定における二次構造の役割が報告されている。[ 13 ]さらに、RNA二次構造の予測がスプライス部位の予測に役立つことが示唆されている。[ 14 ] [ 15 ] [ 16 ] [ 17 ]
人工ニューラルネットワークは、機械学習とパターン認識に優れた計算モデルです。ニューラルネットワークは、実験データに一般化できるようになる前に、例データでトレーニングし、ベンチマークデータでテストする必要があります。ニューラルネットワークは、十分なトレーニングデータがあれば、アルゴリズム的に解決するのが難しい問題に対して近似解を出すことができます。遺伝子予測に適用する場合、ニューラルネットワークは、スプライス部位などの生物学的特徴を予測または識別するために、他のab initio法と併用できます。 [ 18 ] 1つのアプローチ[ 19 ]では、スライディングウィンドウを使用し、配列データを重複するように走査します。各位置での出力は、ネットワークがウィンドウにドナースプライス部位またはアクセプタースプライス部位が含まれていると考えるかどうかに基づくスコアです。ウィンドウが大きいほど精度は高くなりますが、より多くの計算能力も必要になります。ニューラルネットワークは、ゲノム内の機能部位を識別することを目標としているため、シグナルセンサーの一例です。
Makerなどのプログラムは、タンパク質データとESTデータをゲノムにマッピングすることで、外因的アプローチとab initioアプローチを組み合わせ、 ab initio予測を検証します。Makerパイプラインの一部として使用されるAugustusは、ESTアライメントやタンパク質プロファイルといったヒントを取り入れることで、遺伝子予測の精度を高めることもできます。
多くの異なる種のゲノム全体が解読されるにつれて、遺伝子探索に関する現在の研究において有望な方向性の一つは、比較ゲノム解析のアプローチである。
これは、自然選択の力によって遺伝子やその他の機能要素がゲノムの他の部分よりも遅い速度で突然変異を起こすという原理に基づいています。これは、機能要素の突然変異は他の部分の突然変異よりも生物に悪影響を与える可能性が高いからです。したがって、関連種のゲノムを比較して、この保存のための進化的な圧力を検出することで遺伝子を検出できます。このアプローチは、SLAM、SGP、TWINSCAN/N-SCAN、CONTRASTなどのプログラムを使用して、マウスとヒトのゲノムに最初に適用されました。[ 20 ]
TWINSCANは、相同遺伝子を探すためにヒトとマウスのシンテニーのみを調べました。N-SCANやCONTRASTなどのプログラムでは、複数の生物からのアライメント、またはN-SCANの場合はターゲットの1つの代替生物からのアライメントを組み込むことができました。複数の情報源を使用することで、精度が大幅に向上する可能性があります。[ 20 ]
CONTRASTは2つの要素から構成されています。1つ目は、ドナースプライス部位とアクセプタースプライス部位、および開始コドンと終止コドンを識別する小型の分類器です。2つ目の要素は、機械学習を使用して完全なモデルを構築することです。問題を2つに分割することで、より小さなターゲットデータセットを使用して分類器をトレーニングでき、その分類器は独立して動作し、より小さなウィンドウでトレーニングできます。完全なモデルは独立した分類器を使用でき、イントロン-エクソン境界を再分類するために計算時間やモデルの複雑さを無駄にする必要はありません。CONTRASTが紹介されている論文では、彼らの方法(およびTWINSCANなどの方法)は、代替ゲノムを使用するde novo遺伝子アセンブリに分類され、ターゲット「情報提供者」ゲノムを使用するab initioとは異なるものとして識別されるべきであると提案されています。[ 20 ]
比較遺伝子探索は、あるゲノムから別のゲノムへ高品質なアノテーションを投影するためにも利用できる。代表的な例としては、Projector、GeneWise、GeneMapper、GeMoMaなどが挙げられる。こうした技術は現在、あらゆるゲノムのアノテーションにおいて中心的な役割を担っている。
偽遺伝子は遺伝子の近縁種であり、非常に高い配列相同性を共有しているが、同じタンパク質産物をコードすることはできない。かつては遺伝子配列決定の副産物として扱われていたが、調節機能が解明されるにつれて、それ自体が予測対象になりつつある。[ 21 ]偽遺伝子予測は、既存の配列類似性およびab initio法を利用し、さらにフィルタリングと偽遺伝子特性を識別する方法を追加している。
配列類似性法は、候補となる偽遺伝子を見つけるための追加のフィルタリングを使用して、偽遺伝子予測用にカスタマイズできます。これには、機能的なコーディング配列を切り詰めたり崩壊させたりするナンセンス変異やフレームシフト変異を探す無効化検出を使用できます。[ 22 ]さらに、DNAをタンパク質配列に翻訳することは、単純なDNA相同性よりも効果的です。[ 21 ]
コンテンツセンサーは、偽遺伝子と遺伝子の統計的特性の違い、例えば偽遺伝子におけるCpGアイランドの数の減少や、偽遺伝子とその近傍のGC含有量の違いに基づいてフィルタリングすることができる。シグナルセンサーは、イントロンやポリアデニンテールの欠如を探すことで、偽遺伝子に特化することもできる。 [ 23 ]
メタゲノミクスとは、環境から採取された遺伝物質を研究し、様々な生物の配列情報を得る学問である。遺伝子の予測は、比較メタゲノミクスにおいて有用である。
メタゲノミクスツールは、配列類似性アプローチ(MEGAN4)とab initio技術(GLIMMER-MG)のいずれかを使用するという基本的なカテゴリに分類されます。
Glimmer-MG [ 24 ]は、遺伝子発見に主にab initioアプローチを用い、関連生物のトレーニングセットを使用するGLIMMERの拡張版です。予測戦略は、ab initio遺伝子予測手法を適用する前に、遺伝子データセットを分類およびクラスタリングすることで強化されます。データは種ごとにクラスタリングされます。この分類手法は、メタゲノム系統分類の技術を活用しています。この目的のためのソフトウェアの例としては、補間マルコフモデルを使用するPhymmと、BLASTを分類ルーチンに統合するPhymmBLがあります。
MEGAN4 [ 25 ]は、既知の配列のデータベースに対して局所的なアライメントを使用する配列類似性アプローチを使用していますが、機能的役割、生物学的経路、酵素に関する追加情報を使用して分類も試みています。単一生物の遺伝子予測と同様に、配列類似性アプローチはデータベースのサイズによって制限されます。
FragGeneScanとMetaGeneAnnotatorは、隠れマルコフモデルに基づいた人気の高い遺伝子予測プログラムです。これらの予測ツールは、シーケンスエラーや部分的な遺伝子を考慮し、短いリードにも対応しています。
メタゲノムにおける遺伝子予測のためのもう1つの高速かつ正確なツールはMetaGeneMarkです。[ 26 ]このツールは、DOE Joint Genome Instituteによって、現在までに最大のメタゲノムコレクションであるIMG/Mの注釈付けに使用されています。