
プロテオームとは、ゲノム、細胞、組織、または生物が特定の時点で発現している、あるいは発現しうるタンパク質の総体を指します。つまり、特定の種類の細胞または生物において、特定の時点で、定められた条件下で発現しているタンパク質の集合です。プロテオミクスとは、このプロテオームを研究する学問です。
プロテオームとは一般的に生物のプロテオームを指すが、多細胞生物では細胞ごとにプロテオームが大きく異なる場合があるため、細胞と生物のプロテオームを区別することが重要である。
細胞プロテオームとは、ホルモン刺激への曝露など、特定の環境条件下における特定の細胞型に存在するタンパク質の集合体である。
また、生物の完全なプロテオームを考慮することも有用である。これは、様々な細胞プロテオームに含まれるすべてのタンパク質の完全なセットとして概念化できる。これは、おおまかに言えば、ゲノムのタンパク質版と言える。
プロテオームという用語は、細胞小器官などの特定の細胞内システムにおけるタンパク質の集合体を指すためにも使用されています。例えば、ミトコンドリアのプロテオームは3000種類以上の異なるタンパク質から構成されている可能性があります。[ 1 ] [ 2 ] [ 3 ]
ウイルスに含まれるタンパク質は、ウイルスプロテオームと呼ばれる。通常、ウイルスプロテオームはウイルスゲノムから予測される[ 4 ]が、ウイルスゲノムから発現されるすべてのタンパク質、すなわちウイルスプロテオームを決定しようとする試みもいくつか行われている[ 5 ] 。しかし、ウイルスプロテオミクスでは、ウイルス感染時の宿主タンパク質の変化を分析することが多く、事実上、2つのプロテオーム(ウイルスとその宿主のプロテオーム)が研究されることになる[ 6 ] 。

プロテオームは、異なる癌細胞株を比較分析するために使用できます。プロテオミクス研究は、膀胱癌細胞株KK47およびYTS1における転移の可能性を特定するために使用され、36個の制御されていないタンパク質と74個の制御が下方制御されているタンパク質があることがわかりました。[ 7 ]タンパク質発現の違いは、新しい癌シグナル伝達メカニズムを特定するのに役立ちます。
質量分析法に基づくプロテオミクス解析により、がんのバイオマーカーが発見されています。プロテオミクスの使用、すなわちプロテオームの研究は、患者固有のプロテオームおよびゲノムプロファイルに合わせて薬剤カクテルを調整するための個別化医療における一歩前進です。[ 8 ]卵巣がん細胞株の解析により、卵巣がんの推定バイオマーカーには、「α-エノラーゼ(ENOA)、ミトコンドリア伸長因子Tu(EFTU)、グリセルアルデヒド-3-リン酸デヒドロゲナーゼ(G3P)、ミトコンドリアストレス70タンパク質(GRP75)、アポリポタンパク質A-1(APOA1)、ペルオキシレドキシン(PRDX2)、アネキシンA(ANXA)」が含まれることが示されました。[ 9 ]
11種類の細胞株の比較プロテオミクス解析により、各細胞株の代謝プロセスに類似性が認められました。この研究では、11,731種類のタンパク質が完全に同定されました。ハウスキーピングタンパク質は、細胞株間でより大きな変動を示す傾向があります。[ 10 ]
特定の抗がん剤に対する耐性は、まだ十分に解明されていません。プロテオミクス解析は、特に結腸がん治療薬イリノテカンに対して、抗がん剤特性を持つ可能性のあるタンパク質を特定するために使用されてきました。[ 11 ]腺癌細胞株LoVoの研究では、8つのタンパク質が調節されておらず、7つのタンパク質がダウンレギュレーションされていることが示されました。差次的発現を示したタンパク質は、転写、アポトーシス、細胞増殖/分化などのプロセスに関与していました。
様々な種類の細菌において、異なる条件に対する代謝反応を評価するためにプロテオミクス解析が行われてきました。例えば、クロストリジウムやバチルスなどの細菌では、長期間の休眠後にこれらの細菌の胞子が発芽する際に、異なるタンパク質がどのように役立つかを調べるためにプロテオミクス解析が用いられました。[ 12 ]胞子を適切に除去する方法をよりよく理解するためには、プロテオミクス解析を実施する必要があります。
マーク・ウィルキンスは、 1994年にイタリアのシエナで開催された「2D電気泳動:タンパク質マップからゲノムへ」というシンポジウムで、プロテオーム[ 13 ]という用語を造語しました。この用語は、1995年に彼の博士論文の一部が出版された際に印刷物として発表されました[ 14 ] 。ウィルキンスはこの用語を、ゲノム、細胞、組織、または生物によって発現されるタンパク質の全体を表すために使用しました。
ウイルスや原核生物のゲノムは、各タンパク質をオープンリーディングフレームに基づいて高い信頼度で予測できるため、比較的明確に定義されたプロテオームをコードしています(ウイルスでは約3~1000個、細菌では約500~10,000個のタンパク質)。[ 15 ]しかし、ほとんどのタンパク質予測アルゴリズムは、50個または100個のアミノ酸などの特定のカットオフを使用するため、小さなタンパク質はこのような予測で見逃されることがよくあります。[ 16 ]真核生物では、ほとんどの遺伝子から代替スプライシングにより複数のタンパク質が生成されるため、これははるかに複雑になります(たとえば、ヒトゲノムは約20,000個のタンパク質をコードしていますが、一部の推定では92,179個のタンパク質が予測され、そのうち71,173個がスプライシングバリアントです)。[ 17 ]
プロテオームサイズとDNA修復能力の関連性
「プロテオーム制約」の概念は、DNA修復能力がゲノムの情報量と正の相関関係にあり、ゲノムの情報量はプロテオームのサイズとほぼ関連しているというものである。[ 18 ]細菌、古細菌、DNAウイルス では、DNA修復能力はゲノムの情報量とゲノムサイズに正の相関関係にある。[ 18 ] 「プロテオーム制約」は、DNA修復遺伝子などの突然変異率の調節因子が、ゲノムの情報量に比例した選択圧を受けることを提案している。[ 18 ]
プロテオフォーム。タンパク質に多様性をもたらす要因はいくつかあります。SAP(単一アミノ酸多型)と非同義一塩基多型(nsSNP)は、異なる「プロテオフォーム」 [ 19 ]または「プロテオモルフ」につながる可能性があります。最近の推定では、現在SwissProtに格納されている検証済みの非同義cSNPは約135,000個であることがわかりました。dbSNPには470万個の候補cSNPがありますが、タンパク質のアミノ酸の同一性を変える非同義cSNPとして1,000ゲノムセットで検証されているcSNPは約670,000個だけです。[ 19 ]
ダークプロテオーム。Perdigãoらが提唱したダークプロテオームという用語は、既知の三次元構造を持つ他のタンパク質との配列相同性が検出されないタンパク質の領域を定義しており、したがって相同性によってモデル化することはできません。546,000 個の Swiss-Prot タンパク質について、真核生物とウイルスのプロテオームの 44 ~ 54% が「ダーク」であることが判明しましたが、古細菌と細菌ではわずか約 14%でした。[ 20 ]
ヒトプロテオーム。現在、ヒトプロテオームのマッピングを目指すプロジェクトがいくつかあり、その中には、 Human Proteome Map (2020年8月6日アーカイブ)、ProteomicsDB、isoform.io、およびThe Human Proteome Project (HPP)が含まれます。ヒトゲノムプロジェクトと同様に、これらのプロジェクトは、ヒトゲノム内のすべての予測タンパク質コード遺伝子の証拠を見つけて収集することを目指しています。Human Proteome Mapは現在 (2020年10月)、異なる基準を使用して17,294個のタンパク質、ProteomicsDBは15,479個のタンパク質を主張しています。2020年10月16日、HPPは、予測タンパク質コード遺伝子の90%以上をカバーする高ストリンジェンシー設計図[ 21 ]を公開しました。タンパク質は、造血細胞を含む胎児および成人の幅広い組織および細胞タイプから同定されています。

タンパク質の解析は、核酸配列の解析よりも難しいことがわかっています。DNAを構成するヌクレオチドはわずか4種類ですが、タンパク質を構成するアミノ酸は少なくとも20種類以上あります。さらに、現在、単一のタンパク質を複製するためのハイスループット技術は知られていません。タンパク質、タンパク質群、またはプロテオーム全体を研究するための方法は数多く存在します。実際、タンパク質は、計算手法やゲノム解析などを用いて間接的に研究されることもよくあります。以下に、その例をいくつか示します。
プロテオミクス、すなわちプロテオームの研究は、主に二次元ゲル電気泳動によるタンパク質の分離によって行われてきた。第一次元では、等電点電気泳動によってタンパク質が分離され、電荷に基づいてタンパク質が分離される。第二次元では、SDS-PAGEを用いて分子量に基づいてタンパク質が分離される。ゲルはクーマシーブリリアントブルーまたは銀で染色され、タンパク質が可視化される。ゲル上のスポットは、特定の場所に移動したタンパク質である。
質量分析法は、プロテオームを研究するための重要な方法の 1 つです。[ 22 ]重要な質量分析法には、Orbitrap 質量分析法、MALDI (マトリックス支援レーザー脱離イオン化)、およびESI (エレクトロスプレーイオン化) などがあります。ペプチド質量フィンガープリンティングは、タンパク質を短いペプチドに切断し、観測されたペプチド質量を配列データベースと照合することによってタンパク質の正体を推測することによってタンパク質を識別します。 一方、タンデム質量分析法は、個々のペプチドを分離し、非反応性ガスと衝突させ、生成されたフラグメントイオンをカタログ化することによって、個々のペプチドから配列情報を取得できます。[ 23 ]
2014年5月、ヒトプロテオームのドラフトマップがNature誌に掲載された。[ 24 ]このマップは、高分解能フーリエ変換質量分析法を用いて作成された。この研究では、組織学的に正常なヒトサンプル30個をプロファイリングし、17,294個の遺伝子によってコードされるタンパク質を同定した。これは、注釈付けされたタンパク質コード遺伝子全体の約84%に相当する。
液体クロマトグラフィーは、プロテオームの研究において重要なツールです。マトリックスへの親和性に基づいて、さまざまな種類のタンパク質を非常に高感度に分離することができます。タンパク質の分離と識別のための新しい方法には、モノリシックキャピラリーカラムの使用、高温クロマトグラフィー、キャピラリー電気クロマトグラフィーなどがあります。[ 25 ]
ウェスタンブロッティングは、特定のタンパク質の量を定量化するために使用できる。目的のタンパク質に特異的な抗体を用いることで、タンパク質の混合物から特定のタンパク質の存在を検出することが可能となる。
タンパク質断片相補性アッセイは、タンパク質間相互作用を検出するためによく使用されます。酵母ツーハイブリッドアッセイが最も一般的ですが、in vitroとin vivoの両方で使用される多数のバリエーションがあります。プルダウンアッセイは、特定のタンパク質のタンパク質結合パートナーを決定する方法です。[ 26 ]
タンパク質構造予測は、全プロテオームの三次元タンパク質構造予測を提供するために使用できます。2022年に、EMBL-EBIとDeepMindの大規模な共同研究により、生命の系統樹全体にわたる2億を超えるタンパク質の予測構造が提供されました。[ 27 ]小規模なプロジェクトでも、タンパク質構造予測を使用して個々の生物のプロテオームをマッピングするのに役立てられており、たとえばisoform.ioは、ヒトゲノムの20,000を超える遺伝子の複数のタンパク質アイソフォームを網羅しています。[ 28 ]
ヒトタンパク質アトラスには、細胞、組織、臓器に含まれるヒトタンパク質に関する情報が収録されています。この知識リソースに含まれるすべてのデータはオープンアクセスであり、学術界と産業界の科学者がヒトプロテオームの研究のために自由にデータにアクセスできます。ELIXIRは、このタンパク質アトラスが幅広い生命科学コミュニティにとって極めて重要であることから、コアリソースとして選定しました。
Wayback Machineに 2021-01-27 にアーカイブされた血漿プロテオームデータベースには、10,500 種類の血漿タンパク質に関する情報が含まれています。血漿中のタンパク質含有量の範囲は非常に広いため、豊富に存在するタンパク質と比較して希少なタンパク質を検出することは困難です。これは、超低濃度のタンパク質の検出の障壁となる可能性のある分析上の限界です。[ 29 ]
neXtprotやUniProtなどのデータベースは、ヒトプロテオミクスデータの中心的なリソースである。