
タンパク質配列決定とは、タンパク質またはペプチドの全部または一部のアミノ酸配列を決定する実際的なプロセスである。これは、タンパク質の同定や翻訳後修飾の特徴付けに役立つ。通常、タンパク質の部分配列決定によって、遺伝子の概念的翻訳から得られたタンパク質配列データベースを参照してタンパク質を同定するのに十分な情報(1つ以上の配列タグ)が得られる。
タンパク質配列決定の主要な直接法は、質量分析法と、タンパク質シーケンサー(シーケンサー)を用いたエドマン分解法の2つである。質量分析法は現在、タンパク質配列決定と同定に最も広く用いられているが、エドマン分解法はタンパク質のN末端を特徴づけるための貴重なツールとして依然として利用されている。

順序付けられた配列を見つけようとする前に、タンパク質の非順序アミノ酸組成を知っておくことが望ましい場合が多い。この知識は、配列決定プロセスにおけるエラーの発見を容易にしたり、曖昧な結果を区別したりするために使用できるからである。特定のアミノ酸の頻度に関する知識は、タンパク質の消化に使用するプロテアーゼを選択するためにも使用できる。また、タンパク質への非標準アミノ酸(例えばノルロイシン)の低レベルの誤取り込みも特定できる。[ 1 ]アミノ酸頻度を決定するための、アミノ酸分析[ 2 ]と呼ばれる一般的な方法は以下のとおりである。
加水分解は、タンパク質のサンプルを6 M塩酸中で100~110 ℃で24時間以上加熱することによって行われます。かさ高い疎水性基を多く持つタンパク質は、より長い加熱時間が必要になる場合があります。しかし、これらの条件は非常に厳しいため、一部のアミノ酸(セリン、トレオニン、チロシン、トリプトファン、グルタミン、システイン)が分解されます。この問題を回避するために、Biochemistry Onlineは、別々のサンプルを異なる時間加熱し、得られた各溶液を分析し、加水分解時間をゼロに外挿することを提案しています。Rastallは、チオール試薬やフェノールなど、トリプトファンとチロシンを塩素による攻撃から保護し、システインを前酸化するなど、分解を防止または軽減するためのさまざまな試薬を提案しています。また、アミド加水分解の程度を決定するために、発生したアンモニアの量を測定することも提案しています。
アミノ酸はイオン交換クロマトグラフィーで分離した後、検出を容易にするために誘導体化することができる。より一般的には、アミノ酸を誘導体化した後、逆相HPLCで分離する。
イオン交換クロマトグラフィーの一例として、NTRCはスルホン化ポリスチレンをマトリックスとして使用し、酸性溶液中のアミノ酸を添加し、pHを徐々に上昇させた緩衝液をカラムに通す方法を示している。アミノ酸は、pHがそれぞれの等電点に達したときに溶出される。アミノ酸が分離されたら、着色誘導体を形成する試薬を添加して、それぞれの量を測定する。アミノ酸の量が10 nmolを超える場合は、ニンヒドリンを用いることができる。ニンヒドリンはプロリンと反応すると黄色になり、他のアミノ酸と反応すると鮮やかな紫色になる。アミノ酸の濃度は、得られた溶液の吸光度に比例する。10 pmol程度のごく少量の場合は、オルトフタルアルデヒド(OPA)やフルオレスカミンなどの試薬を用いて蛍光誘導体を形成できる。
プレカラム誘導体化では、エドマン試薬を用いてUV光で検出可能な誘導体を生成する。蛍光誘導体を生成する試薬を用いると、より高い感度が得られる。誘導体化されたアミノ酸は、通常C8またはC18シリカカラムと最適化された溶出勾配を用いた逆相クロマトグラフィーにかけられる。溶出されたアミノ酸はUV検出器または蛍光検出器で検出され、そのピーク面積を誘導体化標準物質のピーク面積と比較することで、試料中の各アミノ酸を定量する。

ペプチド鎖のN末端を構成するアミノ酸を特定することは、2つの理由から有用である。1つは、個々のペプチド断片の配列を完全な鎖に並べるのに役立つこと、もう1つは、エドマン分解の最初の段階では不純物が混入することが多く、 N末端アミノ酸を正確に特定できないためである。N末端アミノ酸分析の一般的な方法を以下に示します。
末端アミノ酸を標識するために使用できる試薬は数多くあります。これらの試薬はすべてアミン基と反応するため、リジンなどのアミノ酸の側鎖のアミン基にも結合します。そのため、クロマトグラムの解釈には注意が必要であり、正しいスポットが選択されていることを確認する必要があります。よく使用される試薬としては、サンガー試薬(1-フルオロ-2,4-ジニトロベンゼン)とダンシルクロリドなどのダンシル誘導体があります。エドマン分解の試薬であるフェニルイソチオシアネートも使用できます。アミノ酸組成の決定と同様の疑問がここでも生じますが、試薬が着色誘導体を生成するため染色は不要であり、定性分析のみが必要である点が異なります。したがって、アミノ酸をクロマトグラフィーカラムから溶出させる必要はなく、標準物質と比較するだけで済みます。もう一つ考慮すべき点は、アミン基が標識試薬と反応しているため、イオン交換クロマトグラフィーは使用できず、代わりに薄層クロマトグラフィーまたは高速液体クロマトグラフィーを使用する必要があるということです。
C末端アミノ酸分析に利用できる方法は、 N末端分析に利用できる方法に比べてはるかに少ない。最も一般的な方法は、タンパク質溶液にカルボキシペプチダーゼを加え、一定間隔でサンプルを採取し、アミノ酸濃度を時間に対してプロットして末端アミノ酸を決定するというものである。この方法は、ポリペプチドやN末端がブロックされたタンパク質の場合に非常に有用である。C末端配列決定は、DNA配列から予測されるタンパク質の一次構造を検証したり、既知のコドン配列からの遺伝子産物の翻訳後修飾を検出したりするのに大いに役立つだろう。
エドマン分解は、タンパク質のアミノ酸配列を決定する上で非常に重要な反応であり、タンパク質のアミノ酸配列を明らかにすることができる。現在では、自動エドマンシーケンサーが広く普及しており、約50アミノ酸長までのペプチドの配列決定が可能である。以下に、エドマン分解によるタンパク質配列決定の反応スキームを示す。いくつかのステップについては、後ほど詳しく説明する。
約50~70アミノ酸より長いペプチドは、エドマン分解法では確実に配列決定することができません。そのため、長いタンパク質鎖は小さな断片に分解し、それぞれの断片を個別に配列決定する必要があります。分解は、トリプシンやペプシンなどのエンドペプチダーゼ、または臭化シアンなどの化学試薬によって行われます。酵素によって切断パターンが異なるため、断片間の重複を利用して全体の配列を構築することができます。
配列決定するペプチドは固体表面に吸着される。一般的な基板の一つは、カチオン性ポリマーであるポリブレンでコーティングされたガラス繊維である。吸着したペプチドに、エドマン試薬であるフェニルイソチオシアネート(PITC)と、12%トリメチルアミンの弱塩基性緩衝溶液を加える。これにより、N末端アミノ酸のアミノ基と反応する。
末端アミノ酸は、無水酸を添加することで選択的に分離できる。得られた誘導体は異性化して置換フェニルチオヒダントインとなり、これを洗浄してクロマトグラフィーで同定し、このサイクルを繰り返すことができる。各ステップの効率は約98%であり、これにより約50種類のアミノ酸を確実に同定できる。

タンパク質シークエンサー[ 3 ]は、エドマン分解を自動化して行う装置です。タンパク質またはペプチドのサンプルをタンパク質シークエンサーの反応容器に固定し、エドマン分解を行います。各サイクルで、タンパク質またはペプチドのN末端から1つのアミノ酸が遊離して誘導体化され、遊離したアミノ酸誘導体はHPLCによって同定されます。シーケンス処理は、測定可能な配列全体が確立されるか、またはあらかじめ定められたサイクル数に達するまで、ポリペプチド全体に対して繰り返し行われます。
タンパク質同定とは、目的タンパク質(POI)のアミノ酸配列に基づいて、そのタンパク質に名前を付けるプロセスです。通常、タンパク質のDNA配列から推定されたタンパク質配列データベースを参照してタンパク質を同定するために、タンパク質配列の一部を実験的に決定するだけで十分です。さらに詳細なタンパク質特性解析には、POIの実際のN末端およびC末端の確認、配列変異の決定、および存在する翻訳後修飾の同定が含まれる場合があります。
タンパク質同定のための一般的なスキームについて説明します。[ 4 ] [ 5 ]
ペプチドの断片化パターンから、de novoシーケンス法によって直接配列を決定することができる。この配列は、タンパク質配列データベースとの照合や、翻訳後修飾または化学修飾の調査に利用できる。また、上記の方法で行われたタンパク質同定の補足的な証拠となる場合もある。
タンパク質同定時に一致するペプチドは、必ずしも一致したタンパク質に対して予測されたN末端またはC末端を含むとは限りません。これは、N末端またはC末端ペプチドが質量分析法(MS)で同定しにくい(例えば、短すぎるか長すぎる)、翻訳後修飾を受けている(例えば、N末端アセチル化)、あるいは予測と実際に異なっている、といったことが原因である可能性があります。翻訳後修飾や末端の切断は、データをより詳細に解析する(すなわち、de novoシーケンス解析を行う)ことで特定できる場合があります。特異性の異なるプロテアーゼを用いた繰り返し消化も有効な場合があります。
既知のタンパク質配列に基づく予測と質量分析データを詳細に比較することで翻訳後修飾を特定できる場合があるが、データ取得に的を絞ったアプローチを用いることもできる。例えば、リン酸化ペプチドを特異的に濃縮することで、タンパク質中のリン酸化部位を特定できる可能性がある。質量分析計におけるペプチド断片化の代替手法(ETDやECDなど)を用いることで、補完的な配列情報が得られる場合もある。
タンパク質の全質量は、そのアミノ酸残基の質量に水分子の質量を加えたもので、翻訳後修飾を考慮して調整されます。タンパク質は、そこから誘導されるペプチドほどイオン化されにくいものの、溶液中のタンパク質はESI-MSにかけられ、2万分の1以上の精度で質量を測定できる場合があります。これは多くの場合、末端を確認する(つまり、タンパク質の測定質量が配列から予測される質量と一致することを確認する)ことや、多くの翻訳後修飾の有無を推測するのに十分です。
プロテオリシスによって、POIの全配列を網羅する分析しやすいペプチド群が必ずしも得られるとは限らない。質量分析計におけるペプチドの断片化では、各ペプチド結合の切断に対応するイオンが得られない場合が多い。そのため、各ペプチドについて推定される配列は必ずしも完全ではない。標準的な断片化法では、ロイシン残基とイソロイシン残基は異性体であるため、両者を区別することはできない。
エドマン分解はタンパク質のN末端から進行するため、N末端が化学的に修飾されている場合(例えば、アセチル化やピログルタミン酸の形成など)は機能しません。また、エドマン分解は一般的にジスルフィド結合の位置を決定するのに適していません。さらに、明確な結果を得るには1ピコモル以上のペプチド量が必要となるため、質量分析法よりも感度が低くなります。
生物学において、タンパク質はメッセンジャーRNA(mRNA)の翻訳によって生成され、タンパク質配列はmRNA中のコドン配列に由来する。mRNA自体は遺伝子の転写によって形成され、さらに修飾されることもある。これらのプロセスは十分に理解されており、全ゲノムDNAシーケンスプロジェクトなどのDNA配列からタンパク質配列を予測するコンピュータアルゴリズムを自動化することが可能になっている。これにより、 UniProtのような大規模なタンパク質配列データベースが構築された。予測されたタンパク質配列は、質量分析法によるタンパク質同定において重要なリソースとなる。
従来、エドマン分解法によって決定された短いタンパク質配列(10~15残基)は、対応する遺伝子または相補的DNAの分子クローンを単離するためのプローブまたはプライマーとして使用できるDNA配列に逆翻訳されてきた。クローン化されたDNAの配列が決定され、それを用いてタンパク質の完全なアミノ酸配列が推定された。
バイオインフォマティクスツールは、質量スペクトルの解釈(de novoペプチドシーケンスを参照)、タンパク質配列の比較や分析(配列分析を参照)、またはペプチド配列やタンパク質配列を使用したデータベースの検索(BLASTを参照)を支援するために存在します。
タンパク質配列決定の難しさは、最近、 k回実行された後に自己破壊するプログラム、すなわちk時間プログラムを作成するための基礎として提案された。しかし、すべてのソフトウェアは本質的に無制限に複製可能であるため、このようなものを純粋にソフトウェアだけで構築することは不可能である。