遺伝学および生化学において、シーケンシングとは、分岐のない生体高分子の一次構造(時に誤って一次配列と呼ばれることもある)を決定することを意味する。シーケンシングの結果得られるのは、配列と呼ばれる記号的な線状表現であり、これは配列決定された分子の原子レベルの構造の多くを簡潔に要約したものである。
DNAシーケンスとは、特定のDNA断片のヌクレオチド配列を決定するプロセスです。これまで、ほとんどのDNAシーケンスは、フレデリック・サンガーによって開発された鎖終結法を用いて行われてきました。この技術は、修飾ヌクレオチド基質を用いたDNA合成反応の配列特異的終結を利用します。しかし、パイロシークエンシングなどの新しいシーケンス技術が、シーケンス市場でますますシェアを獲得しています。現在では、サンガーDNAシーケンスよりもパイロシークエンシングによって生成されるゲノムデータの方が多くなっています。パイロシークエンシングは、ゲノムの迅速なシーケンスを可能にしました。この技術では、細菌ゲノムを1回のランで数倍のカバー率でシーケンスすることができます。この技術は、最近ジェームズ・ワトソンのゲノムのシーケンスにも使用されました。[ 1 ]
DNAの配列は、生物が生存し繁殖するために必要な情報を符号化しています。そのため、DNA配列の解明は、生物がなぜ、どのように生きるのかという基礎研究だけでなく、応用分野においても有用です。DNAは生物にとって極めて重要な役割を担っているため、DNA配列に関する知識は、生物学研究のほぼあらゆる分野で役立ちます。例えば、医学においては、遺伝性疾患の特定、診断、そして将来的な治療法の開発に活用できます。同様に、病原体の研究は、感染症の治療法開発につながる可能性があります。バイオテクノロジーは急速に発展している分野であり、多くの有用な製品やサービスを生み出す可能性を秘めています。
カールソン曲線は、ムーアの法則のバイオテクノロジー版を説明するためにエコノミスト誌[ 2 ]が作った用語で、著者ロブ・カールソンにちなんで名付けられました[ 3 ] 。 カールソンは、DNAシーケンシング技術の倍増時間(コストとパフォーマンスで測定)がムーアの法則と同等かそれ以上に速いと正確に予測しました[ 4 ] 。カールソン曲線は、DNAシーケンシング、 DNA合成、タンパク質発現やタンパク質構造の決定に使用されるさまざまな物理的および計算ツール など、さまざまな技術のコストの急速な(場合によっては超指数関数的な)減少とパフォーマンスの向上を示しています。

鎖終結シーケンス法(サンガーシーケンス法)では、テンプレートDNA上の特定の部位で、その部位のテンプレートに相補的な短いオリゴヌクレオチド「プライマー」を用いて伸長を開始します。オリゴヌクレオチドプライマーは、DNAを複製する酵素であるDNAポリメラーゼを用いて伸長されます。プライマーとDNAポリメラーゼには、4種類のデオキシヌクレオチド塩基(DNAの構成要素)と、低濃度の鎖終結ヌクレオチド(最も一般的にはジデオキシヌクレオチド)が含まれています。デオキシヌクレオチドは、リボース分子の2'位と3'位の両方にOH基を持たないため、DNA分子内に挿入されると、それ以上伸長が進まなくなります。このシーケンサーでは、4種類のジデオキシリボヌクレオチドのうち1種類だけを含む4つの異なる容器が使用されます。DNAポリメラーゼによる鎖終結ヌクレオチドのランダムな位置への組み込みにより、特定のジデオキシリボヌクレオチドで終結する、異なるサイズの関連DNA断片のシリーズが生成されます。その後、断片は平板状ポリアクリルアミドゲルを用いた電気泳動、または現在ではより一般的には粘性ポリマーで満たされた細いガラス管(毛細管)を用いた電気泳動によってサイズ別に分離される。

プライマーの標識に代わる方法として、ターミネーターを標識する方法があり、これは一般に「色素ターミネーターシーケンシング」と呼ばれています。この方法の大きな利点は、標識プライマー法で必要な4つの反応ではなく、1つの反応で完全なシーケンシングセットを実行できることです。これは、ジデオキシヌクレオチド鎖ターミネーターをそれぞれ異なる波長で蛍光を発する別の蛍光色素で標識することによって実現されます。この方法は色素プライマー法よりも簡単で迅速ですが、大きな色素鎖ターミネーターの取り込みがテンプレートに依存するため、データピークの不均一性(高さの差)が大きくなる可能性があります。この問題は、取り込みのばらつきを最小限に抑える新しい酵素と色素の導入によって大幅に軽減されました。この方法は、より簡単で安価であるため、現在ではシーケンシング反応の大部分で使用されています。その主な理由は、プライマーを個別にラベル付けする必要がないことにある(これは使い捨てのカスタムプライマーにとっては大きなコストとなる可能性がある)。ただし、頻繁に使用される「ユニバーサル」プライマーの場合は、この点はそれほど問題にならない。イルミナ、454、ABI、ヘリコス、ドーバーなどの第2世代および第3世代システムのコスト効率が向上しているため、この状況は急速に変化しつつある。
パイロシークエンシング法は、ヌクレオチドの取り込みに伴うピロリン酸の放出を検出することに基づいています。パイロシークエンシングを行う前に、配列決定するDNA鎖をPCRで増幅する必要があります。次に、シーケンサーにヌクレオチドを添加する順序(GATCなど)を選択します。特定のヌクレオチドが添加され、DNAポリメラーゼがそれを成長中の鎖に取り込むと、ピロリン酸が放出され、ATPスルホリラーゼによってATPに変換されます。ATPはルシフェラーゼを介してルシフェラーゼの酸化を促進し、この反応によってピログラムのピークとして記録される光信号が生成されます。このようにして、ヌクレオチドの取り込みは信号と相関付けられます。光信号は、DNA鎖の合成中に組み込まれたヌクレオチドの量に比例します(つまり、2つのヌクレオチドが組み込まれると、2つのピログラムピークに対応します)。添加されたヌクレオチドがDNA分子に組み込まれない場合、信号は記録されません。酵素アピラーゼが、反応中に残っている未組み込みのヌクレオチドを除去します。この方法は、蛍光標識ヌクレオチドもゲル電気泳動も必要としません。Pål Nyrén と Mostafa Ronaghi DNA によって開発されたパイロシークエンシングは、Biotage (低スループットシークエンシング用) と 454 Life Sciences (高スループットシークエンシング用) によって商品化されています。後者のプラットフォームは、1 台のマシンで 7 時間の実行で約 100メガベース(現在は最大 400 メガベース) をシーケンスします。アレイベースの方法 (454 Life Sciences によって商品化) では、一本鎖 DNA がビーズにアニーリングされ、EmPCRによって増幅されます。これらの DNA 結合ビーズは、 ATPの存在下で光を生成する酵素とともに、光ファイバー チップ上のウェルに配置されます。遊離ヌクレオチドがこのチップ上を洗浄されると、ヌクレオチドが相補的な塩基対と結合するときに ATP が生成され、光が生成されます。 1つ(または複数)のヌクレオチドが添加されると、反応が起こり、光信号が発生します。この信号は、装置内のCCDカメラによって記録されます。信号強度は、ヌクレオチドの数、例えば、1つのヌクレオチドの流れに組み込まれたホモポリマーの伸長数に比例します。
上記の方法は様々なシーケンス解析手法を説明するものですが、ゲノムの大部分をシーケンス解析する際には、関連する別の用語が使用されます。エクソームシーケンス(遺伝子をコードする全染色体上の全DNAのサブセット)や全ゲノムシーケンス(ヒトの全核DNAのシーケンス解析)を実行するためのプラットフォームがいくつか開発されています。
RNAは細胞内では不安定であり、実験的にヌクレアーゼによる攻撃を受けやすい。RNAはDNAからの転写によって生成されるため、その情報はすでに細胞のDNAに存在している。しかし、RNA分子の配列を決定することが望ましい場合もある。DNAの配列決定は生物の遺伝子プロファイルを提供するが、RNAの配列決定は細胞内で活発に発現している配列のみを反映する。RNAの配列を決定する一般的な方法は、まずサンプルから抽出したRNAを逆転写してcDNA断片を生成することである。その後、上記のように配列決定を行うことができる。細胞内で発現するRNAの大部分はリボソームRNAまたは小型RNAであり、細胞翻訳には有害であるが、研究の焦点となることは少ない。しかし、この画分は試験管内で除去することができ、通常関心の対象となるメッセンジャーRNA(mRNA)を濃縮することができる。これらのmRNAはエクソンから生成され、後に特定の細胞機能をサポートするタンパク質に翻訳される。したがって、発現プロファイルは細胞活性を示しており、特に疾患、細胞挙動、試薬や刺激に対する応答の研究において有用です。真核生物のRNA分子は、イントロンが除去されるため、必ずしもDNAテンプレートと共線的ではありません。このため、リード配列をゲノムにマッピングしてその起源を特定するには、ある程度の複雑さが生じます。全トランスクリプトームに適用される次世代シーケンシングの機能の詳細については、RNA-SeqおよびマイクロRNAシーケンシングを参照してください。
タンパク質配列決定を行う方法には、以下のようなものがある。
タンパク質をコードする遺伝子が分かっている場合、現在ではDNA配列を決定してタンパク質配列を推定することがはるかに容易になっている。上記の方法のいずれかを用いてタンパク質のアミノ酸配列の一部(多くの場合、末端部分)を決定するだけで、その遺伝子を持つクローンを特定できる場合がある。
多糖類も生体高分子ですが、いくつかの理由から、多糖類の「配列決定」について語ることはあまり一般的ではありません。多くの多糖類は直鎖状ですが、分岐を持つものも多くあります。さまざまな単位(個々の単糖)が使用でき、さまざまな方法で結合できます。しかし、主な理論的理由は、ここに挙げた他のポリマーは主に1つのプロセス酵素によって「テンプレート依存的」に生成されるのに対し、多糖類の個々の結合はそれぞれ異なる酵素によって形成される可能性があるということです。多くの場合、アセンブリは一意に指定されていません。どの酵素が作用するかによって、いくつかの異なる単位のいずれかが組み込まれる可能性があります。これにより、類似した分子のファミリーが形成される可能性があります。これは特に植物多糖類に当てはまります。オリゴ糖と多糖類の構造決定方法には、 NMR分光法とメチル化分析が含まれます。[ 5 ]