
プロテオゲノミクスは、プロテオミクス、ゲノミクス、トランスクリプトミクスを組み合わせてペプチドの発見と同定を支援する生物学研究分野です。プロテオゲノミクスは、ゲノム情報とトランスクリプトミクス情報から得られたタンパク質データベースとMS/MSスペクトルを比較することで、新しいペプチドを同定するために使用されます。プロテオゲノミクスは、多くの場合、質量分析から得られるプロテオミクス情報を使用して遺伝子アノテーションを改善する研究を指します。プロテオミクスとゲノミクスの両方のデータの利用と、分光分析およびクロマトグラフィー技術の利用可能性と性能の向上により、2004年にプロテオゲノミクスが独立した分野として確立されました。
プロテオミクスは、ゲノミクスが生物全体の遺伝暗号を研究するのと同様にタンパク質を扱い、トランスクリプトミクスはRNA配列決定と転写産物の研究を扱います。これら3つの分野はいずれも質量分析法やクロマトグラフィーを用いてDNA、RNA 、タンパク質の機能を同定・研究しますが、プロテオミクスは、現在の遺伝子モデルが正しいこと、そして関連するすべてのタンパク質配列がプロテオミクス同定データベースなどの参照データベースに存在することを前提としています。プロテオゲノミクスは、複数の分野のデータセットを組み合わせてタンパク質または遺伝子マーカーのデータベースを作成することで、既存の限定的な遺伝子モデルへの依存を解消します。さらに、突然変異による新規タンパク質配列の出現は、従来のプロテオミクスデータベースでは考慮できないことが多いですが、ゲノムデータとトランスクリプトミクスデータを統合することで予測・研究することが可能です。
この研究成果は、遺伝子アノテーションの改善、突然変異の研究、遺伝子操作の影響の理解などに応用できる。
近年では、CITE-SeqやESCAPEなどの方法による単一細胞からの表面タンパク質とmRNA転写産物の同時プロファイリングは、単一細胞プロテオゲノミクスと呼ばれていますが、これらの研究の目的はペプチドの同定とは関係ありません。2019年以降、これらの方法はマルチモーダルオミクスまたはマルチオミクスと呼ばれることが多くなっています。[ 5 ]
プロテオゲノミクスは、次世代シーケンシングゲノミクスと質量分析プロテオミクスの技術進歩の統合に基づいて、2004年に独立した分野として出現しました。[ 6 ]この用語自体は、ジョージ・チャーチの研究グループが、プロテオミクスデータを使用して細菌M. pneumoniaeのゲノムをより良く注釈付けするプロテオゲノムマッピング技術を発見したことを記述した論文を発表したその年に使用されました。最新のタンパク質データベースを使用して、研究室はタンデム質量分析を使用して全細胞で検出されたペプチドを遺伝子足場にマッピングし、生成された「ヒット」を使用して、従来の遺伝子シグナルに基づいて「プロテオゲノムマップ」を作成しました。結果として得られたマップは非常に正確であることが証明され、研究された細菌細胞で予測されたゲノム読み取りフレームの81%以上が検出されました。さらに、研究室では、純粋な遺伝的手法では予測できなかったいくつかの新しいフレームを発見したほか、遺伝モデルに基づくいくつかの予測が誤りである可能性を裏付ける証拠もいくつか見つかり、ハイブリッド技術の正確性と費用対効果が証明された。[ 7 ] [ 8 ]
この分野はその後20年間で拡大し、当初はプロテオミクスデータを使用してタンパク質データベースを介して遺伝子モデルを改良するのに役立てられていました。[ 6 ] 2020年代には、ペプチドを同定する最も一般的な手法の1つは、タンデム質量分析法を使用することです。この手法は1994年にEngとYatesによって考案され、理論的なペプチド断片スペクトルを実験的に得られたペプチドスペクトルと比較し、見つかった最も可能性の高い一致を出力するものです。[ 7 ]しかし、確立されたペプチドデータベースがない場合、プロテオゲノミクスでは代わりに実験スペクトルをゲノムデータベースと比較し、その後、George Churchの研究で説明されているように、ゲノムアノテーションに使用できます。[3]後者の手法は、ゲノムシーケンス技術の手頃な価格と速度の向上と質量分析法に基づくプロテオミクスの感度の向上により、過去10年間で広く使用されるようになりました。[ 6 ]

プロテオゲノミクスアプローチの主な考え方は、MS/MSデータを予測されたタンパク質配列を含むタンパク質データベースと比較することによってペプチドを同定することです。[ 9 ]タンパク質データベースは、ゲノムデータとトランスクリプトームデータを利用してさまざまな方法で生成されます。以下に、タンパク質データベースが生成される方法のいくつかを示します。
6フレーム翻訳は、タンパク質配列を予測するデータベースを生成するために利用できます。この方法の限界は、生成される配列の数が多いためデータベースが非常に大きくなり、その中には自然界に存在しないものもあることです。[ 10 ]
この方法では、タンパク質コード領域の特定を可能にする遺伝子予測アルゴリズムによってタンパク質ベースが生成されます。データベースは非常に大規模になる可能性があるという点で、6フレーム翻訳によって生成されるデータベースと似ています。[ 10 ]
6フレーム翻訳では、発現配列タグ(EST)を利用してタンパク質データベースを生成できます。ESTデータは、データベースの作成に役立つ転写情報を提供します。データベースは非常に大きくなる可能性があり、特定の配列のコピーが複数存在するという欠点がありますが、この問題は、計算戦略によって生成されたタンパク質配列を圧縮することで回避できます。[ 10 ]
タンパク質データベースは、 RNAシーケンスデータ、注釈付きRNA転写産物、および変異タンパク質配列を使用して作成することもできます。また、目的のペプチドを適切に識別するために作成できる、より専門的なタンパク質データベースもあります。[ 10 ]
プロテオゲノミクスによるタンパク質の同定におけるもう1つの方法は、比較プロテオゲノミクスです。比較プロテオゲノミクスは、複数の関連種のプロテオミクスデータを同時に比較し、それらのタンパク質間の相同性を利用して、より高い統計的信頼性でアノテーションを改善します。[ 11 ] [ 12 ]
プロテオゲノミクスはさまざまな方法で応用できます。その応用例の1つは、さまざまな生物の遺伝子アノテーションの改善です。遺伝子アノテーションには、遺伝子とその機能の発見が含まれます。[ 13 ] プロテオゲノミクスは、原核生物の遺伝子アノテーションの発見と改善に特に役立っています。たとえば、大腸菌、マイコバクテリウム、および複数の種のシェワネラ菌を含むさまざまな微生物のゲノムアノテーションがプロテオゲノミクスアプローチによって研究されています。 [ 14 ]
遺伝子アノテーションの改善に加えて、プロテオゲノミクス研究は、プログラムされたフレームシフト、N末端メチオニン除去、シグナルペプチド、 タンパク質分解、およびその他の翻訳後修飾の存在に関する貴重な情報も提供できます。[ 15 ] [ 11 ]プロテオゲノミクスは、医学、特に腫瘍学研究において潜在的な応用があります。癌は、メチル化、転座、体細胞変異などの遺伝子変異によって発生します。研究により、癌につながる分子変異を理解するには、ゲノム情報とプロテオーム情報の両方が必要であることが示されています。[ 16 ] [ 17 ]プロテオゲノミクスは、癌で機能的役割を持つ可能性のあるタンパク質配列の同定によってこれを支援してきました。[ 18 ]この具体的な例として、大腸癌に関する研究があり、癌治療の潜在的な標的の発見につながりました。[ 16 ]プロテオゲノミクスは、がん抗原に対する抗体エピトープをプロテオゲノミクスを用いて予測し、患者固有の腫瘍に作用する薬剤を作成する個別化がん標的免疫療法にもつながっています。[ 19 ]治療に加えて、プロテオゲノミクスはがんの診断にも洞察を与える可能性があります。結腸がんおよび直腸がんに関する研究では、体細胞変異を特定するためにプロテオゲノミクスが利用されました。患者の体細胞変異の特定は、患者のがんの診断に使用できます。がんの治療と診断への直接的な応用に加えて、プロテオゲノミクスアプローチは、化学療法に対する耐性をもたらすタンパク質の研究にも使用できます。[ 17 ]
プロテオゲノミクスは、プロテオミクスが直面する不完全または不正確なタンパク質データベースという欠点なしにペプチドを同定する方法を提供する可能性がありますが、プロテオゲノミクスアプローチには課題が生じています。[ 10 ]プロテオゲノミクスの最大の課題の1つは、生成されるタンパク質データベースの膨大なサイズです。統計的に、大規模なタンパク質データベースは、タンパク質データベースからのデータとMS/MSデータの不正確なマッチングにつながる可能性が高く、この問題は新しいペプチドの同定を妨げる可能性があります。偽陽性もプロテオゲノミクスアプローチで問題になります。偽陽性は、ミスマッチしたデータによって誤った同定につながる非常に大規模なタンパク質データベースの結果として発生する可能性があります。もう1つの問題は、実際のペプチドではなく類似のペプチドに対応するタンパク質配列データへのMS/MSスペクトルの不正確なマッチングです。複数の遺伝子部位に位置するペプチドのデータを受け取るケースがあり、これはさまざまな方法で解釈できるデータにつながる可能性があります。これらの課題にもかかわらず、発生するエラーの多くを減らす方法があります。例えば、非常に大規模なタンパク質データベースを扱う場合、同定された新規ペプチド配列をデータベース内のすべての配列と比較し、翻訳後修飾を比較することができます。次に、2つの配列が同じペプチドを表しているか、または2つの異なるペプチドであるかを判断できます。[ 10 ]