
2 塩基エンコーディング( SOLiD(オリゴヌクレオチド連結および検出によるシーケンス)とも呼ばれる)は、 Applied Biosystemsが開発した次世代シーケンス技術で、2008 年以来市販されています。これらの技術は、一度に数十万の短いシーケンスリードを生成します。このようなDNA シーケンス方法のよく知られた例としては、454パイロシーケンス(2005 年に導入)、Solexa システム(2006 年に導入)、SOLiD システム(2007 年に導入)などがあります。これらの方法により、コストは 2004 年の 0.01 ドル/塩基から 2006 年の 0.0001 ドル/塩基近くまで削減され、シーケンス処理能力は 2004 年の 1 台のマシンで 1 日あたり 1,000,000 塩基から 2006 年のマシンで 1 日あたり 100,000,000 塩基以上に増加しました。
2塩基エンコーディングは、合成によるシーケンスではなく、ライゲーションシーケンスに基づいています。[ 1 ]ただし、6塩基しか区別できない蛍光標識9-merプローブを使用する代わりに、2塩基エンコーディングは、2つの3プライム最上位塩基を区別する蛍光標識8-merプローブを利用しますが、Macevicz法と同様にサイクルできるため、6bpを超えるリードが得られます(25~50bpが発表されています、[ 2 ] 2008年2月にNCBIで50bp )。2塩基エンコーディングにより、2倍の作業を行うことなく、各塩基を2回読み取ることができます。[ 3 ] [ 4 ] [ 5 ] [ 6 ]
これらの次世代シーケンシング技術の多くに共通する一般的な手順は以下のとおりです。
1988年、WhiteleyらはDNA変異体の検出に蛍光標識オリゴヌクレオチドライゲーションの使用を実証した。[ 9 ] 1995年、Macevicz [ 10 ]は連続DNA変異体を検出するためにオリゴヌクレオチドの繰り返しライゲーションを実証した。2003年、Dressmanら[ 11 ]は、これらの繰り返しライゲーションアッセイを実行できるクローン増幅ビーズを数百万個生成するためにエマルジョンPCRを使用することを実証した。2005年、Shendureらは、 WhiteleyとDressmanの技術を組み合わせたシーケンス手順を実行し、プローブのラベルと非縮重塩基に応じて異なる塩基を区別する蛍光標識「8塩基縮重」9-merプローブのライゲーションを実行した。このプロセスは、(Macevicz のように伸長可能な末端を再生することなく)同一のプライマーを使用し、異なる非縮重塩基を識別するラベル付きプローブを使用して、5→3 方向の 6bp リードと 3→5 方向の 7bp リードをシーケンスするために繰り返された。
SOLiDシーケンシングシステムは、二重塩基エンコーディングのプローブを使用します。
基礎となる化学反応は、以下の手順で要約されます。[ 12 ]
ステップ1:ライブラリーの準備:このステップでは、まずゲノムDNAを小さな断片に切断します。次に、2種類の異なるアダプター(例えばA1とA2)を追加します。こうして得られるライブラリーには、両端に1つのアダプターが付加されたテンプレートDNA断片(A1-テンプレート-A2)が含まれます。
- ステップ 2、エマルジョン PCR: このステップでは、ライブラリーの DNA 断片、以前に使用したアダプター (P1 と A1、P2 と A2) に相補的な 2 つのプライマー (P1 と P2)、その他の PCR 反応成分、およびプライマー (例えば P1) の 1 μm ビーズと結合した 1μm ビーズを使用して、DNA ライブラリーからの希釈を行い、1 つの DNA 断片と 1 つのビーズを含む液滴を単一のエマルジョン液滴に最大化します。
各液滴内では、DNAテンプレートがA1側からP1結合ビーズにアニーリングする。その後、DNAポリメラーゼがP1から伸長して相補配列を合成し、最終的に単一のテンプレート由来のPCR産物が濃縮されたビーズが得られる。PCR反応後、テンプレートは変性してビーズから解離する。この技術は、Dressmanらによって2003年に初めて報告された。
ステップ3、ビーズ濃縮:実際には、標的DNAを持つビーズは全体の30%に過ぎません。標的DNAを持つビーズの数を増やすため、A2でコーティングされた大型ポリスチレンビーズを溶液に加えます。これにより、伸長生成物を含むビーズは、P2末端を介してポリスチレンビーズと結合します。得られた複合体は、標的DNAを持たないビーズから分離され、融解して標的ビーズをポリスチレンから解離させます。このステップにより、濃縮前の30%から濃縮後の80%へと、このシステムの処理能力を向上させることができます。
濃縮後、生成物の3'末端(P2末端)が修飾され、次のステップで共有結合が可能となる。したがって、このステップの生成物は、各DNA鎖の3'末端が修飾されたDNA結合ビーズとなる。
ステップ4、ビーズの堆積:このステップでは、前のステップで得られた生成物をガラススライド上に堆積させます。ビーズは、3'-修飾ビーズとガラスとの共有結合によって、ガラス表面にランダムに付着します。
- ステップ 5、シーケンス反応:前述のように、合成によってシーケンスを行う他の次世代シーケンス法とは異なり、2塩基エンコーディングはライゲーションによるシーケンスに基づいています。ライゲーションは、特定の8-merプローブを使用して行われます。
これらのプローブは8塩基長で、3'末端に遊離ヒドロキシル基、5'末端に蛍光色素、5番目と6番目のヌクレオチド間に切断部位があります。最初の2つの塩基(3'末端から)は、配列決定対象のヌクレオチドと相補的です。3番目から5番目の塩基は縮重しており、鋳型配列上のどのヌクレオチドとも対合できます。6番目から8番目の塩基も縮重していますが、反応が進むにつれて蛍光色素とともに切断されます。蛍光色素と6番目から8番目の塩基が切断されると、遊離の5'リン酸基が残り、さらなる連結が可能になります。このようにして、n+1番目とn+2番目の位置が正しく塩基対合し、続いてn+6番目とn+7番目の位置が正しく対合するなど、同様の手順が繰り返されます。n+3番目、n+4番目、n+5番目の塩基の構成は、配列決定反応がさらに繰り返されるまで未決定のままです。
シーケンスステップは基本的に5つのラウンドで構成され、各ラウンドは約5~7サイクルからなります(図2)。各ラウンドは、P1に相補的なユニバーサルプライマーの添加から始まります。このプライマーは、例えばnヌクレオチドからなり、その5'末端はP1の3'末端と完全に一致します。各サイクルでは、8merプローブが添加され、最初の塩基と2番目の塩基に基づいて連結されます。次に、残りの未結合プローブが洗い流され、結合したプローブからの蛍光シグナルが測定され、結合したプローブは5番目と6番目のヌクレオチドの間で切断されます。最後に、プライマーとプローブはすべて次のラウンドのためにリセットされます。
次のラウンドでは、新しいユニバーサルプライマーが位置n-1(その5'末端がP1の3'末端の直前の塩基と一致する)にアニーリングし、その後のサイクルは最初のラウンドと同様に繰り返されます。残りの3つのラウンドは、P1の3'末端を基準として位置n-2、n-3、n-4にアニーリングする新しいユニバーサルプライマーを用いて実行されます。
5回の反応を完了することで、P1由来のテンプレートの約25塩基対の配列を決定することができる。
- ステップ 6、データのデコード: 色で表されたデータをデコードするには、まず 2 つの重要な要素を知る必要があります。まず、各色が 2 つの塩基を示していることを知っておく必要があります。次に、配列中の塩基の 1 つを知る必要があります。この塩基は、ステップ 5 の最後の (5 番目の) ラウンドで配列に組み込まれています。この既知の塩基は、既知の P1 の 3' 末端の最後のヌクレオチドです。したがって、各色は 2 つのヌクレオチドを表し、各ジヌクレオチド単位の 2 番目の塩基が次のジヌクレオチドの最初の塩基を構成しているため、配列中の 1 つの塩基を知るだけで、配列全体を解釈することができます (図 2)。[ 13 ]
実際には、カラーリードをベースリードに直接変換することは推奨されません。カラーコールでエラーが発生すると、ベースコールのフレームシフトが発生するためです。2 ベースエンコーディングの「エラー訂正」特性を最大限に活用するには、ベース参照配列をカラースペースに変換するのが最善です。ベース参照配列からカラースペースへの明確な変換は 1 つだけあり、逆もまた真ですが、シーケンスエラーがあると変換が非常に不正確になる可能性があります。[ 14 ]
色空間の読み取り値を色空間の参照値にマッピングすることで、隣接する色の違いのみが真の塩基多型を表すことができる2塩基符号化規則を適切に利用できます。色読み取り値を直接デコードしたり、塩基に変換したりするだけでは、他の知識なしに効率的にこれを行うことはできません。
より具体的に言うと、この方法はエラー訂正ツールではなく、エラー変換ツールです。カラースペースは、最も一般的なエラーモード(単一測定エラー)を、最も一般的なDNA変異(SNPまたは単一塩基置換)とは異なる頻度に変換します。これらの単一塩基置換は、カラースペース内の隣接する色に影響を与えます。隣接するエラーを「有効な」エラーと「無効な」エラーに修正するのに役立つ論理ルールが存在します。
50 bp の読み取りで隣接する 2 つのエラーが発生する確率は推定できます。50 文字の文字列 (50 bp の読み取り) に隣接する変更を加える方法は 49 通りあります。50 文字の文字列に隣接しない変更を加える方法は 1225 通りあります (50 個から 2 つを選択)。簡単に言うと、エラーが完全にランダムであると仮定すると (通常、読み取りの末尾で頻度が高くなります)、1225 個のエラーのうち SNP の候補となるのは 49 個だけです。さらに、プローブの既知のラベル付けに従って有効なエラーとなるのは隣接するエラーの 3 分の 1 つだけなので、SNP の候補となるエラーは 1225 個のうち 16 個だけです。これは、低カバレッジでの偽陽性を減らすため、低カバレッジ SNP 検出に特に役立ちます (Smithら[ 15 ] ) 。
このシーケンス解析法では、各塩基が2回読み取られます。これにより、隣接する2つのカラースペースのコールの色が変わります。したがって、SNPを誤判定するには、隣接する2つのカラーを誤判定する必要があります。このため、SNPの誤判定率はe^2のオーダーになります。ここで、eはデバイスのエラー率です。
塩基コールでは、単一の色の誤コールによってリードの残りの部分にエラーが発生します。SNPコールではこれを修正できるため、SNPコールのエラー率は低くなります。しかし、単純なde novoアセンブリでは、生のデバイスエラー率が残りますが、これはSNPコールで報告されている0.06%よりもかなり高くなります。リードの品質フィルタリングにより、より高い生の精度を持つリードが得られ、これをカラーコンティグにアライメントすることで、2塩基エンコーディングをより効果的に活用できる参照配列が得られます。他の技術とのハイブリッドアセンブリでも、2塩基エンコーディングをより効果的に活用できます。