第三世代シーケンシング(ロングリードシーケンシングとも呼ばれる)は、第二世代シーケンシング(次世代シーケンシングとも呼ばれる) [ 2 ]よりも大幅に長いリード(長さ10 kbから1 Mb以上)を生成する能力を持つDNAシーケンシング法の一種です。これらの方法は2008年に登場し、ナノポアシーケンシングやシングル分子リアルタイムシーケンシングなどの技術を特徴としており、開発が続けられています。[ 2 ]より長いリードをシーケンスできる能力は、ゲノム科学と生物学全般の研究の両方にとって重要な意味を持ちます。構造変異の検出において、第三世代シーケンシングは、シーケンシングの深度が低い場合でも、既存の方法よりも優れていることがわかっています。[ 3 ]しかし、第三世代シーケンシングデータは、以前の技術よりもエラー率がはるかに高いため、下流のゲノムアセンブリと結果データの解析が複雑になる可能性があります。[ 4 ]これらの技術は活発に開発が進められており、高いエラー率の改善が期待されている。[ 1 ]
第2世代プラットフォームとは異なるアプローチのシーケンス技術は、2008~2009年に初めて「第3世代」として記述されました。[ 5 ]
現在、第三世代シーケンシング技術の開発を主導している企業は複数あり、具体的にはパシフィック・バイオサイエンス、オックスフォード・ナノポア・テクノロジー、クアンタポア(米国カリフォルニア州)、ストラトス(米国ワシントン州)などが挙げられる。これらの企業は、単一DNA分子のシーケンシングにおいて、根本的に異なるアプローチを採用している。
PacBio社は、ゼロモード導波路の特性に基づいた、シングル分子リアルタイムシーケンシング(SMRT)のシーケンシングプラットフォームを開発しました。信号は、zLウェルの底に結合したDNAポリメラーゼによって取り込まれた各ヌクレオチドからの蛍光発光の形をとります。
オックスフォード・ナノポア社の技術は、 DNA分子をナノスケールの細孔構造に通し、その細孔周辺の電場変化を測定するものです。一方、クアンタポア社は独自のナノポア技術を採用しています。ストラトス・ゲノミクス社は、ポリマー製の挿入物「Xpandomers」を用いてDNA塩基の間隔を広げることで、ナノポアによる一本鎖DNAの読み取りにおける信号対雑音比の課題を克服しています。
第2世代のシーケンシング技術と比較して、第3世代のシーケンシングは、はるかに長いリードを生成するという明らかな利点があります。これらの長いリード長は、ゲノムアセンブリ、転写再構築、メタゲノミクスなど、現代生物学および医学の重要な分野を取り巻く数多くの計算上の課題を軽減することが期待されています。[ 2 ]
霊長類やヒトを含む真核生物のゲノムは複雑で、多数の長い反復領域を持つことはよく知られています。第2世代シーケンシングの短いリードでは、アセンブリや遺伝子変異検出のために、長距離にわたる配列を推定するには近似的な手法に頼らざるを得ません。第2世代シーケンシングでは、これらの制約に対処するためにペアエンドリードが活用されてきました。しかし、ペアエンドの正確な断片長は不明な場合が多く、同様に近似する必要があります。第3世代シーケンシング技術は、長いリード長を可能にすることで、明確な利点を持っています。
エピジェネティックマーカーは、DNA分子の配列には含まれない、安定していて遺伝する可能性のある修飾です。例としては、遺伝子発現に影響を与えることがわかっているCpG部位のDNAメチル化が挙げられます。ヒストン修飾も別の例です。現在のシーケンス技術は、エピジェネティックマーカーの検出にChIPシーケンスなどの実験室技術に依存しています。これらの技術では、DNA鎖にタグを付け、マーカーを含む断片を切断してフィルタリングし、その後シーケンスを行います。第3世代シーケンスでは、他の4つのヌクレオチド塩基とは異なる特徴的なシグナルにより、これらのマーカーを直接検出できる可能性があります。[ 6 ]

第三世代シーケンシング技術のその他の重要な利点としては、携帯性とシーケンシング速度が挙げられます。[ 7 ]第二世代シーケンシングと比較してサンプル前処理が最小限で済むため、より小型の装置を設計できます。オックスフォード・ナノポア・テクノロジーは最近、MinIONシーケンサーを商品化しました。このシーケンシング装置は、通常のUSBフラッシュドライブとほぼ同じサイズで、ラップトップに接続してすぐに使用できます。さらに、シーケンシングプロセスはゲノムの領域全体で並列化されていないため、データをリアルタイムで収集および分析できます。第三世代シーケンシングのこれらの利点は、迅速かつオンサイトでのデータ収集と分析が求められる病院環境に適している可能性があります。
2008年時点で、第3世代シーケンシングは、主にヌクレオチド塩基の正確な識別に関する重要な課題に直面しており、エラー率は第2世代シーケンシングに比べて依然としてかなり高かった。[ 4 ]これは一般的に、関連する分子機構の不安定性によるものである。例えば、PacBioのシングル分子リアルタイムシーケンシング技術では、シーケンシング処理が進むにつれてDNAポリメラーゼ分子が損傷を受けていく。[ 4 ]さらに、処理が高速で行われるため、個々の塩基から発せられる信号が隣接する塩基からの信号によってぼやけてしまう可能性がある。これは、信号を解読し、結果として配列を推測するための新たな計算上の課題となる。例えば、隠れマルコフモデルなどの手法がこの目的のために活用され、一定の成果を上げている。 [ 6 ]
平均すると、人類集団の異なる個体は、遺伝子の約99.9%を共有している。つまり、2人の個体間で異なる塩基配列は、およそ1000個に1個程度である。第三世代シーケンシングに伴う高いエラー率は、同種個体間の個体差を特徴づけるという目的においては、必然的に問題となる。
ゲノムアセンブリとは、ゲノム全体のDNA配列を再構築することである。これは一般的に、根本的に異なる2つのアプローチで行われる。
ヒトのように参照ゲノムが利用可能な場合、新たにシーケンスされたリードをその参照ゲノムにアラインメントするだけで、その特性を解析できる。このような参照ゲノムに基づくアセンブリは迅速かつ容易であるが、新規配列や大きなコピー数変異を「隠してしまう」という欠点がある。さらに、ほとんどの生物種についてはまだ参照ゲノムが存在しない。
デノボアセンブリは、リファレンスアライメントに代わるゲノムアセンブリ手法です。これは、生のシーケンスリードからゲノム全体の配列を再構築することを指します。この方法は、リファレンスゲノムが存在しない場合、メタゲノミクスのように対象生物の種が不明な場合、またはリファレンスゲノムアライメントでは検出されない可能性のある注目すべき遺伝子変異が存在する場合に選択されます。
現在のシーケンス技術で生成されるリードが短いことを考えると、de novoアセンブリは大きな計算上の問題です。これは通常、適切なオーバーラップを持つシーケンスリードを見つけて接続する反復プロセスによってアプローチされます。この問題を解決するために、デブルイングラフやオーバーラップレイアウトコンセンサスグラフなどのさまざまな計算および統計的手法が活用されてきました。しかし、真核生物ゲノムの反復性の高さから、de novoアセンブリでゲノム配列を正確かつ完全に再構築することは依然として困難です。ペアエンドリードは可能な解決策として提案されていますが、正確な断片長は不明な場合が多く、近似する必要があります。[ 8 ]

第三世代シーケンシングによって得られる長いリード長は、de novoゲノムアセンブリが現在直面している多くの課題を軽減する可能性がある。たとえば、反復領域全体を単一のリードで明確にシーケンスできれば、計算による推論は不要になる。高いエラー率の問題を軽減するために、計算手法が提案されている。たとえば、ある研究では、PacBioシーケンシングのみを使用した微生物ゲノムのde novoアセンブリが、第二世代シーケンシングよりも優れていることが実証された。[ 9 ]
第三世代シーケンシングは、第二世代シーケンシングと併用されることもあります。このアプローチは、ハイブリッドシーケンシングと呼ばれることがよくあります。たとえば、第三世代シーケンシングのロングリードは、第二世代シーケンシングを使用して以前にアセンブルされたゲノムに存在する曖昧さを解消するために使用されることがあります。一方、第二世代のショートリードは、第三世代のロングリードに存在するエラーを修正するために使用されます。一般的に、このハイブリッドアプローチは、de novoゲノムアセンブリを大幅に改善することが示されています。[ 10 ]
DNAメチル化(DNAm)は、 CpG部位におけるDNAの共有結合修飾であり、メチル基が付加されるエピジェネティック機構の中で最もよく理解されている要素です。DNA修飾とそれに伴う遺伝子発現は、細胞の種類、時間的発達、遺伝的祖先によって異なり、環境刺激によって変化し、遺伝します。DNAmの発見後、研究者たちは、がんや自閉症などの疾患との相関関係も発見しました。[ 11 ]この疾患病因の文脈において、DNAmは今後の研究の重要な方向性です。
現在最も一般的なメチル化状態を調べる方法は、Illuminaプラットフォームでの標準的な第2世代シーケンスの前にDNAを断片化するアッセイを必要とする。リード長が短いため、より長いメチル化パターンに関する情報が失われる。[ 6 ]第3世代シーケンス技術は、より長いリードの単一分子リアルタイムシーケンスと、前述のアッセイなしでのDNA修飾の検出を可能にする。[ 12 ]

Oxford Nanopore Technologies社のMinIONはDNAメチル化の検出に用いられてきました。各DNA鎖がポアを通過する際に、ヌクレオチドのエピジェネティックな変化に敏感であることが分かっている電気信号が生成され、隠れマルコフモデル(HMM)を用いてMinIONデータを解析し、5-メチルシトシン(5mC)DNA修飾を検出しました。[ 6 ]このモデルは合成メチル化大腸菌DNAを用いてトレーニングされ、得られた信号はナノポア技術によって測定されました。次に、トレーニングされたモデルを用いて、既に参照メチロームを持つヒト細胞株のMinIONゲノムリード中の5mCを検出しました。この分類器は、ランダムにサンプリングされた単一部位で82%の精度を持ち、より厳密な閾値を適用すると95%に向上します。[ 6 ]
他の方法では、MinIONプラットフォームを使用してさまざまな種類のDNA修飾を扱っています。Stoiberらは、5mCとともに4-メチルシトシン(4mC)と6-メチルアデニン(6mA)を調べ、生のMinIONデータを人間が理解しやすい方法で直接視覚化するソフトウェアも作成しました。[ 13 ]ここで彼らは、メチロームが既知のE. coliでは、5塩基対の長さのイベントウィンドウを使用して、生のMinION電気信号を分割して統計的に分析できることを発見しました。単純なMann-Whitney U検定により、 E. coli配列の修飾部分を検出でき、さらに修飾を4mC、6mA、または5mC領域に分割できます。[ 13 ]
将来的には、MinIONの生データがDNA中の様々なエピジェネティック修飾を検出するために利用される可能性が高いと思われる。
PacBioシーケンスは、DNA メチル化の検出にも使用されています。このプラットフォームでは、パルス幅 (蛍光光パルスの幅) が特定の塩基に対応します。2010 年に、コントロールサンプルとメチル化サンプルのパルス間隔が異なり、各メチル化タイプに「特徴的な」パルス幅があることが示されました。[ 12 ] 2012 年に、PacBio プラットフォームを使用して、DNAメチルトランスフェラーゼの結合部位が特徴付けられました。[ 14 ] 2015 年に、 C エレガンスにおける N6 メチル化の検出が示されました。[ 15 ] 2016 年に、マウス胚性幹細胞における PacBio プラットフォームを使用した N6-アデニン上の DNA メチル化が示されました。[ 16 ]
重金属、酸化、紫外線による損傷など、その他の形態のDNA修飾も、オックスフォード・ナノポア社およびPacBio社の第三世代シーケンシング技術を用いた研究の対象となる可能性がある。
MinIONの生データでは、中央値信号への正規化などの生データの処理が必要であり、この技術のリアルタイム機能が低下します。[ 13 ]電気信号の一貫性は依然として問題であり、ヌクレオチドを正確にコールすることが困難です。MinIONはスループットが低く、複数の重複リードを取得することが難しいため、下流のDNA修飾検出の精度の問題がさらに発生します。隠れマルコフモデルとMinION生データで使用される統計的手法の両方で、検出のためにDNA修飾の繰り返し観測が必要であり、つまり、個々の修飾ヌクレオチドが、サンプル中の複数の細胞やプラスミドなど、ゲノムの複数のコピーに一貫して存在する必要があります。
PacBioプラットフォームにおいても、検出したいメチル化の種類によって、必要なカバレッジは異なります。2017年3月現在、ヒストン修飾などの他のエピジェネティック因子は、第3世代技術では検出されていません。より長いメチル化パターンは、より小さなコンティグを組み立てる必要があるため、しばしば失われます。
トランスクリプトミクスとは、通常、研究対象組織におけるメッセンジャーRNA分子の相対的な存在量を解析することによって、転写産物群(トランスクリプトーム)を研究する学問である。分子生物学の中心教義によれば、遺伝情報は二本鎖DNA分子から一本鎖mRNA分子へと流れ、そこで容易に機能的なタンパク質分子へと翻訳される。トランスクリプトームを研究することで、遺伝子発現の調節機構に関する貴重な知見を得ることができる。
第二世代シーケンシングでは発現レベルをある程度正確に描写できますが(転写産物集団の実際の存在量がランダムにサンプリングされていると仮定できます)、転写産物レベルの情報は依然として重要な課題です。[ 17 ]その結果、分子生物学における選択的スプライシングの役割は依然としてほとんど解明されていません。第三世代シーケンシング技術は、mRNA分子を全長にわたってシーケンスすることを可能にすることで、この問題を解決する有望な見込みを持っています。
選択的スプライシング(AS)は、単一の遺伝子から複数の異なるmRNA転写産物が生じ、結果として異なるタンパク質翻訳が生じるプロセスです。[ 18 ]いくつかの証拠は、ASが普遍的な現象であり、特に複雑な真核生物において、生物の表現型を決定する上で重要な役割を果たしている可能性があることを示唆しています。すべての真核生物は、ASを受ける可能性のあるイントロンからなる遺伝子を含んでいます。特に、ヒトのマルチエクソン遺伝子の95%でASが発生すると推定されています。[ 19 ] ASは、無数の生物学的プロセスに影響を与える可能性を秘めています。この分野の知識の進歩は、生物学全般の研究にとって重要な意味を持ちます。
現在の世代のシーケンス技術では短いリードしか生成されないため、個別の転写産物を検出する能力に大きな制限が生じます。短いリードは、結果として得られたリードの観測結果を生み出した可能性のある元の転写産物に逆算する必要があります。[ 20 ]この作業は、転写産物間で発現レベルが大きく変動し、その結果、遺伝子の配列全体でリードのカバー率が変動するため、さらに複雑になります。[ 20 ]さらに、エクソンは個々の転写産物間で共有される可能性があり、明確な推論は事実上不可能になります。[ 18 ]既存の計算方法は、さまざまな配列位置での短いリードの蓄積に基づいて推論を行うことが多く、多くの場合、単純化された仮定を行います。[ 20 ] Cufflinks は、可能な限り少ない数の転写産物ですべてのリードを説明しようとする、簡潔なアプローチを採用しています。[ 21 ]一方、StringTie は、リードを組み立てながら転写産物の存在量を同時に推定しようとします。[ 20 ]これらの方法は妥当ですが、常に実際の転写産物を特定できるとは限りません。
2008 年に発表された研究では、25 種類の既存の転写産物再構築プロトコルを調査しました。[ 17 ]その証拠は、既存の方法は一般的に転写産物の組み立てが弱いものの、個々のエクソンを検出する能力は比較的健全であることを示唆しています。[ 17 ]推定によると、25 種類のプロトコル全体でエクソンを検出する平均感度は、線虫Caenorhabditis elegans の遺伝子で 80% です。[ 17 ]それに対して、転写産物の識別感度は 65% に低下します。ヒトの場合、この研究ではエクソン検出感度が平均 69%、転写産物検出感度が平均わずか 33% であると報告されています。[ 17 ]つまり、ヒトの場合、既存の方法では、存在するすべての転写産物の半分未満しか識別できないということです。
第三世代シーケンシング技術は、転写産物の検出と転写産物レベルでのmRNA存在量の推定という問題を解決する上で有望な見通しを示しています。エラー率は依然として高いものの、第三世代シーケンシング技術は、より長いリード長を生成する能力を持っています。[ 22 ] Pacific Bioscienceは、mRNA分子を全長でシーケンスすることを提案するiso-seqプラットフォームを発表しました。[ 22 ] Oxford Nanoporeも同様の技術を発表すると予想されています。エラー率が高いという問題は、高品質の短いリードを補足することで軽減できる可能性があります。このアプローチは以前にテストされ、エラー率を3倍以上削減することが報告されています。[ 23 ]
メタゲノミクスとは、環境サンプルから直接採取された遺伝物質を分析する学問である。
メタゲノミクスにおける第三世代シーケンシング技術の主な利点は、第二世代技術と比較してシーケンシング速度が速いことである。シーケンシング速度は、例えば臨床現場(病原体の同定など)において、効率的な診断と迅速な臨床対応を可能にするために重要である。
オックスフォード・ナノポア社のMinIONは、2015年に複雑でバックグラウンドの高い臨床サンプル中の病原体のリアルタイムメタゲノム検出に使用されました。最初のエボラウイルス(EBOV)リードは、データ取得から44秒後にシーケンスされました。[ 24 ]リードはゲノムに均一にマッピングされ、少なくとも1つのリードがゲノムの88%以上にマッピングされました。比較的長いリードにより、一次臨床サンプルから直接、ほぼ完全なウイルスゲノムを高精度(97~99%の同一性)でシーケンスすることが可能になりました。[ 24 ]
微生物群集の多様性研究における一般的な系統発生マーカーは、16SリボソームRNA遺伝子である。この遺伝子のシーケンスには、MinIONとPacBioのSMRTプラットフォームの両方が使用されている。[ 25 ] [ 26 ]この文脈では、PacBioのエラー率は、454およびIlluminaのMiSeqシーケンスプラットフォームからの短いリードのエラー率と同程度であった。
MinIONのエラー率が高い(約10~40%)ため、単一ヌクレオチド分解能が必要な抗菌薬耐性マーカーの同定ができませんでした。同じ理由で、真核生物病原体も同定されませんでした。[ 24 ]同じフローセルを再利用する際に、キャリーオーバー汚染が発生しやすいことも懸念事項です(標準的な洗浄プロトコルでは対応できません)。独自のバーコードにより、より多くのマルチプレックスが可能になるかもしれません。さらに、細菌、真菌、寄生虫はゲノムの大部分を共有しており、一部は5%未満しか異ならないため、正確な種同定を行うことは非常に困難です。
塩基あたりのシーケンスコストは依然としてMiSeqよりもかなり高い。しかし、サンガー法による検出限界以下の生物の全長配列で参照データベースを補完できる見込みがあり[ 25 ]、これはメタゲノミクスにおける生物の同定に大いに役立つ可能性がある。