
デュプレックス シーケンシングは、二本鎖DNAのランダムなタグ付けを使用して、より高い精度とより低いエラー率で変異を検出する次世代シーケンシング(NGS) プラットフォーム用のライブラリ準備および分析方法です。
この方法では、シーケンシング アダプターに加えて縮重分子タグを使用して、各 DNA 鎖に由来する読み取りを認識します。2 つの鎖は相補的であるため、真の変異は両方の鎖の同じ位置に見つかります。対照的に、PCR またはシーケンシング エラーは 1 つの鎖にのみ変異をもたらすため、技術的なエラーとして無視できます。デュプレックス シーケンシングは、理論的には 5 x 10 −8という低い頻度の変異を検出できます。これは、従来の次世代シーケンシング方法と比較して 10,000 倍以上の精度です。[1] [2]
標準的な次世代シーケンシングプラットフォームの推定エラー率は、1ベースコールあたり10 −2~ 10 −3です。このエラー率では、NGS によって生成される数十億のベースコールで数百万のエラーが発生します。これらのエラーは、ポリメラーゼ連鎖反応、シーケンシング、画像解析エラーなどのサンプル準備とシーケンシング中に発生します。NGS プラットフォームのエラー率は、クローン変異の検出などの一部のアプリケーションでは許容範囲内ですが、生物内モザイク、遺伝的に異質な癌のサブクローン変異、循環腫瘍 DNAの検出など、低頻度変異の検出に高い精度が求められるアプリケーションでは大きな制限となります。[3] [4] [5]
分子バーコーディングや円形コンセンサスシーケンシング法など、NGSプラットフォームの精度を高めるライブラリ準備戦略がいくつか開発されている。[6] [7] [8] [9] NGSプラットフォームと同様に、これらの方法で生成されるデータは1本のDNA鎖に由来するため、PCR増幅、組織処理、DNA抽出、ハイブリダイゼーションキャプチャ(使用する場合)またはDNAシーケンシング自体で導入されるエラーは、依然として真の変異体として区別できる。デュプレックスシーケンシング法は、2本のDNA鎖の相補性を利用し、両方のDNA鎖に存在する変異体のみを確認することで、この問題に対処している。2つの相補的エラーが両方の鎖の同じ場所で発生する確率は非常に低いため、デュプレックスシーケンシングはシーケンシングの精度を大幅に向上させる。[1] [6] [8] [10]
実験的なワークフロー
デュプレックスシーケンシングタグ付きアダプターは、ほとんどのNGSアダプターと組み合わせて使用できます。この記事の図とワークフローのセクションでは、公開された元のプロトコルに従って、イルミナシーケンシングアダプターを例として使用しています。[1] [2]

アダプタのアニーリング
このステップでは2つのオリゴヌクレオチドが使用されます(図1:アダプターオリゴ)。オリゴヌクレオチドの1つには、12ヌクレオチドの一本鎖ランダムタグ配列と、それに続く固定された5'ヌクレオチド配列(図1の黒い配列)が含まれています。このステップでは、必要な時間条件でインキュベーションすることにより、オリゴヌクレオチドは相補領域でアニールされます。[1] [2]
アダプター合成
アニールに成功したアダプターはDNAポリメラーゼによって伸長・合成され、相補的なタグを含む二本鎖アダプターが完成する(図1)。[1] [2]
3'-dT-テーリング
延長された二本鎖アダプターは、タグ配列の3'側にある特定の制限部位でHpyCH4IIIによって切断され、3'-dTオーバーハングが生成され、アダプターライゲーションステップでDNAライブラリの3'-dAオーバーハングにライゲーションされます(図1)。[1] [2]
ライブラリの準備
二本鎖DNAは、超音波処理、酵素消化、噴霧化のいずれかの方法で切断されます。断片はAmpure XPビーズを使用してサイズ選択されます。ゲルベースのサイズ選択は、DNA二本鎖の溶解や紫外線曝露によるDNA損傷を引き起こす可能性があるため、推奨されません。選択されたDNA断片のサイズは、3'末端dAテーリングにかけられます。[1] [2]
アダプターライゲーション
このステップでは、2 つのタグ付きアダプターが、二本鎖 DNA ライブラリ断片の両側の 3'-dT テールから 3'-dA テールに連結されます。このプロセスにより、両側に互いに逆相補関係にある 2 つのランダム タグ (α と β) を含む二本鎖ライブラリ断片が生成されます (図 1 および 2)。「DNA: アダプター」の比率は、連結の成功を決定する上で非常に重要です。[1] [2]
タグライブラリへのシーケンスアダプターの挿入
二重鎖シーケンシングライブラリの準備の最後のステップでは、シーケンシングアダプタを含むプライマーを使用したPCR増幅によって、タグ付き二重鎖ライブラリにイルミナシーケンシングアダプタが追加されます。PCR増幅中、DNAの両方の相補鎖が増幅され、2種類のPCR産物が生成されます。産物1は、イルミナアダプタ1の隣に固有のタグ配列(図2ではαと呼ばれる)を持つ鎖1に由来し、産物2はイルミナアダプタ1の隣に固有のタグ(図2ではβと呼ばれる)を持っています。(各鎖で、タグαはタグβの逆相補であり、逆もまた同様です)。二重鎖タグとイルミナアダプタを含むライブラリは、イルミナTruSeqシステムを使用してシーケンスされます。DNAのすべての単一鎖に由来するリードは、同じタグを共有するリードのグループ(タグファミリー)を形成します。検出されたリードファミリーは、次のステップでシーケンスデータを解析するために使用されます。[1] [2]
考慮事項
アダプターライゲーションの効率
アダプターライゲーション効率は、二本鎖シーケンシングを成功させる上で非常に重要です。ライブラリやアダプターの量が多すぎると、DNAとアダプターのバランスに影響を及ぼし、それぞれライゲーションの効率が悪くなり、プライマーダイマーの量が過剰になります。そのため、DNAとアダプターのモル濃度を最適な比率(0.05)に保つことが重要です。[2]
タグファミリーのサイズ
デュプレックス シーケンシングの効率は、各ファミリーのリード数 (ファミリー サイズ) に直接関連する最終的な DCS 数に依存します。ファミリー サイズが小さすぎると DCS を組み立てることができず、同じタグを共有するリードが多すぎると、データ収量が低くなります。ファミリー サイズは、PCR 増幅に必要な DNA テンプレートの量と専用のシーケンシング レーンの割合によって決まります。最適なタグ ファミリー サイズは、6 ~ 12 メンバーです。最適なファミリー サイズを得るには、DNA テンプレートの量と専用のシーケンシング レーンの割合を調整する必要があります。次の式は、カバレッジの深さ (N=40DG÷R) に影響を与える可能性のある最も重要な変数を考慮しています。ここで、「N」はリード数、「D」は必要なカバレッジの深さ、「G」は DNA ターゲットの塩基対のサイズ、「R」は最終的なリード長です。
計算ワークフロー
フィルタリングとトリミング
各デュプレックスシーケンスリードには、12ヌクレオチドのタグ配列の上流に位置する固定の5ヌクレオチド配列(図では黒で表示)が含まれています。予想される5ヌクレオチド配列を持たないか、各タグ内に9を超える同一またはあいまいな塩基がある場合、リードはフィルタリングされます。リード両端の2つの12ヌクレオチドタグは結合され、リードヘッダーに移動されます。2本のDNA鎖に由来する2つのリードファミリーが形成されます。1つのファミリーには鎖1に由来するαβヘッダーを持つリードが含まれ、2つ目には鎖2に由来するβαヘッダーを持つリードが含まれます(図2)。次に、固定の5塩基対配列と、ライゲーションおよび末端修復部位にある4つのエラーが発生しやすいヌクレオチドを削除して、リードをトリミングします。[1] [2]残りのリードは、SSCSおよびDCSアセンブリを使用してコンセンサス配列にアセンブルされます。
SSCSアセンブリ
前のステップでトリミングされた配列は、Burrows–Wheeler アライナー(BWA) を使用して参照ゲノムにアラインされ、マッピングされていないリードは削除されます。同じ 24 塩基対のタグ配列とゲノム領域を持つアラインされたリードが検出され、グループ化されます (図 2 の αβ ファミリーと βα ファミリー)。各グループは「タグ ファミリー」を表します。メンバーが 3 つ未満のタグ ファミリーは分析されません。PCR 増幅またはシーケンシング中に発生するエラーを除去するために、メンバー (リード) の 70% 未満でサポートされている変異は分析から除外されます。次に、残りのリードの各位置にある同一の配列を使用して、各ファミリーのコンセンサス シーケンスが生成されます。コンセンサス シーケンスは SSCS と呼ばれます。これにより、NGS の精度が約 20 倍向上します。ただし、この方法は DNA の一本鎖からのシーケンシング情報に依存するため、最初のラウンドまたは PCR 増幅前に誘発されるエラーの影響を受けます。[1] [2]
DCSアセンブリ
最後のステップからの読み取りは、参照ゲノムに再調整されます。この方法では、相補的なタグを持つ SSCS ファミリーペアがグループ化されます (図 2 のファミリー αβ と βα)。これらの読み取りは、2 つの相補的な DNA 鎖に由来します。各ファミリーの完全に一致するベースコールに基づいて、信頼性の高いシーケンスが選択されます。最終的なシーケンスは DCS と呼ばれます。真の変異は、相補的な SSCS 間で完全に一致するものです。このステップでは、PCR 増幅の最初のラウンド中またはサンプルの準備中に発生した残りのエラーが除外されます。[1] [2]
利点
シーケンスのエラー率の低減
標準的なNGSプラットフォームでは、サンプルの準備やシーケンシング中に生じる高いエラー率(0.01~0.001)が、細胞のごく一部に存在する変異体の検出における大きな制限となっている。デュプレックスタグ付けシステムとDNAの両鎖の情報を利用することにより、デュプレックスシーケンシングでは、SSCS法とDCS法の両方を使用してシーケンシングのエラー率を約1000万倍大幅に削減した。[1] [2] [10]
変異呼び出しの精度の向上
標準的なNGS法では、変異率が(10 −2~ 10 −3)であるため、希少変異を正確に特定することは困難です。サンプル準備の初期段階で発生するエラーは、希少変異として検出される可能性があります。このようなエラーの例としては、C>A/G>T転座が挙げられます。これは、ディープシーケンシングやターゲットキャプチャデータを使用して低頻度で検出され、サンプル準備中のDNA酸化によって発生します。[11]これらのタイプの偽陽性変異は、真の変異として検証するためにDNAの両方の鎖で変異が正確に一致する必要があるため、デュプレックスシーケンシング法によって除外されます。デュプレックスシーケンシングは、標準的なNGS法の10 −2の率と比較して、 10 −8という低い頻度の変異を理論的に検出できます。[1] [2] [10]
ほとんどのNGSプラットフォームに適用可能
デュプレックス シーケンシングのもう 1 つの利点は、標準プロトコルに大きな変更を加えることなく、ほとんどの NGS プラットフォームと組み合わせて使用できることです。
制限事項
料金
デュプレックス シーケンシングは、シーケンシング精度が著しく高く、DNA の両方の鎖の情報を使用するため、シーケンシングの深度がはるかに深くなるため、コストのかかるアプローチとなります。このコストにより、現時点ではターゲット シーケンシングとアンプリコン シーケンシングへの適用が制限されており、全ゲノム シーケンシング アプローチには適用できません。ただし、NGS のコストが下がれば、より大きな DNA ターゲットへのデュプレックス シーケンシングの適用がより現実的になります。
実用化
デュプレックスシーケンシングは新しい方法であり、その効率は標的キャプチャーシーケンシングを用いた点変異の検出などの限られた用途で研究されてきた。 [12]より多くの変異、インデル、コピー数変異を含むより複雑なサンプルにデュプレックスシーケンシングの適用と実現可能性を拡大するには、さらなる研究を行う必要がある。
アプリケーション
頻度の低い変異体の検出
デュプレックスシーケンシングとシーケンシング精度の大幅な向上は、まれなヒト遺伝子変異の検出、遺伝的に異質な癌の治療に対する耐性のメカニズムに関与するサブクローン変異の検出、非侵襲的バイオマーカーとしての循環腫瘍 DNA の変異のスクリーニング、胎児の遺伝子異常の出生前スクリーニングなどのアプリケーションに重要な影響を及ぼしました。
コピー数検出
二重鎖シーケンシングのもう一つの応用は、変異体の相対頻度を推定することでDNA/RNAコピー数を検出することである。次世代シーケンシングに応用したPCRテンプレート分子をカウントする方法がその一例である。[1]
分析とソフトウェア
SSCS および DCS 分析に必要なツールとパッケージのリストはオンラインで見つかります。
参照
参考文献
- ^ abcdefghijklmno MW Schmitt、SR Kennedy、JJ Salk、et al. 「次世代シーケンシングによる超希少変異の検出」 Proc. Natl. Acad. Sci.、vol. 109 no. 36。2012年。PMID 22853953。
- ^ abcdefghijklmn SR Kennedy、MW Schmitt、EJ Fox、BF Kohrn、他「二重シーケンスによる超低頻度変異の検出」Nature Protoc.、vol. 9 no. 11、2586-606。2014年。PMID 25299156 。
- ^ TE Druley、FLM Vallania、DJ Wegner、他「プールされたゲノムDNAからの希少対立遺伝子変異の定量化」Nature Methods、vol. 6、no. 4、pp. 263–265、2009年。PMID 19252504 。
- ^ N. McGranahan および C. Swanton。「癌の進化における腫瘍内不均一性の生物学的および治療的影響」Cancer Cell、vol. 27、no. 1、pp. 15–26、2015。PMID 25584892 。
- ^ C Bettegowda、M Sausen 、 RJ Leary、他「早期および後期ヒト悪性腫瘍における循環腫瘍DNAの検出」Sci Transl Med、vol. 6、no. 224、p. 224ra24、2014年。PMID 24553385。
- ^ ab BE Miner、RJ Stöger、AF Burden、et al。「分子バーコードがヘアピン亜硫酸水素PCRの冗長性と汚染を検出する」[リンク切れ ]。Nucleic Acids Res、vol. 32、no. 17、p. e135、2004。PMID 15459281 。
- ^ ML McCloskey、R. Stoger、RS Hansen、et al.「バッチスタンプとバーコードによるPCR製品のエンコード」、Biochem. Genet.、vol. 45、no. 11–12、pp. 761–767、2007年。PMID 17955361 。
- ^ ab DI Lou、JA Hussmann、RM Mcbee、et al。 「サークルシーケンシングを使用すると、ハイスループットDNAシーケンシングのエラーが桁違いに減少します」。Proc Natl Acad Sci USA、vol. 110 no. 49、19872–19877、2013。PMID 24243955。
- ^ AY Maslov、W. Quispe-Tintaya、T. Gorbacheva、RR White、J. Vijg、「変異検出におけるハイスループットシーケンシング:遺伝毒性試験の新世代?」、Mutat. Res.、vol. 776、pp. 136–43、2015年。PMID 25934519 。
- ^ abc EJ Fox、KS Reid-Bayliss、MJ Emond 、他「次世代シーケンシングプラットフォームの精度」Next Gener Seq Appl.、pp. 1–9、2015年。PMID 25699289。
- ^ M. Costello、TJ Pugh、TJ Fennell、他「サンプル調製中の酸化DNA損傷によるディープカバレッジターゲットキャプチャシーケンスデータにおける人工変異の発見と特徴付け」Nucleic Acids Res、vol. 41、no. 6、pp. 1–12、2013年。PMID 23303777。
- ^ MW Schmitt、EJ Fox、MJ Prindle、他「高効率かつ極めて高い精度で小さなゲノムターゲットをシーケンシング」Nat Methods、vol. 12、no. 5、pp. 423–425、2015年。PMID 2584963 。
