NGSデータからのSNV検出は、次世代シーケンシング(NGS)実験の結果から一塩基多型(SNV)の存在を特定するためのさまざまな方法のいずれかです。これらは計算技術であり、既知の集団全体の一塩基多型に基づく特別な実験方法( SNPジェノタイピングを参照)とは対照的です。NGSデータの増加に伴い、これらの技術はSNPジェノタイピングを実行するためにますます普及しており、特定の実験設計とアプリケーション用に設計されたさまざまなアルゴリズムがあります。[ 1 ]通常のSNPジェノタイピングの適用領域に加えて、これらの技術は、集団内の希少SNPを特定すること[ 2 ] 、および複数の組織サンプルを使用して個人内の体細胞SNVを検出する ことにもうまく適用されています。[ 3 ]
SNV検出のためのNGSベースの方法のほとんどは、個人のゲノムにおける生殖細胞系列変異を検出するように設計されています。これらは、個人が生物学的に両親から受け継ぐ変異であり、このような解析を行う際に検索される一般的な変異の種類です(体細胞変異を探す特定の用途を除く)。多くの場合、検索される変異は集団全体で一定の頻度(まれな場合もある)で発生し、その場合は一塩基多型(SNP)と呼ばれることがあります。技術的には、SNPという用語はこのような種類の変異のみを指しますが、実際には、変異検出に関する文献ではSNVと同義語としてよく使われます。さらに、生殖細胞系列SNVの検出には各遺伝子座における個人の遺伝子型を決定する必要があるため、「SNPジェノタイピング」という用語もこのプロセスを指すのに使用されることがあります。ただし、この用語は、既知のSNP位置のセットで遺伝子型を分類するためのウェットラボ実験手順を指す場合もあります。
このような技術の一般的なプロセスは、以下に基づいています。[ 1 ]
これらの手順の通常の出力はVCFファイルです。

リードカバレッジが高い理想的なエラーのない世界では、NGSデータアライメントの結果からバリアントコールを行う作業は単純です。各遺伝子座(ゲノム上の位置)で、その位置にアライメントされたリードの中で各異なるヌクレオチドの出現回数を数えることができ、真の遺伝子型は明らかになります。すべてのヌクレオチドがアレルAに一致する場合はAA、アレルBに一致する場合はBB、混合している場合はABです。しかし、実際のNGSデータを扱う場合、入力データのノイズを考慮できないため、このような単純なアプローチは使用されません。[ 4 ] 塩基コールに使用されるヌクレオチドカウントには、シーケンスされたリード自体とアライメントプロセスの両方に起因するエラーとバイアスが含まれています。この問題は、リードカバレッジの深度を高くしてシーケンスすることである程度軽減できますが、これは多くの場合高価であり、多くの実用的な研究では低カバレッジデータに基づいて推論を行う必要があります。[ 1 ]
確率的手法は、ノイズや推定精度向上に利用できるその他の事前情報も考慮に入れ、考えられる各遺伝子型の確率を頑健に推定することで、上記の問題を克服することを目指します。そして、これらの確率に基づいて、多くの場合MAP推定値に従って遺伝子型を予測します。
バリアントコールにおける確率的手法は、ベイズの定理に基づいています。バリアントコールの文脈において、ベイズの定理は、観測されたデータが与えられた場合に、各遺伝子型が真の遺伝子型である確率を、各遺伝子型の事前確率と、各遺伝子型が与えられた場合のデータの確率分布を用いて定義します。その式は次のとおりです。
上記の式において:
上記の枠組みに基づくと、SNVを検出するためのさまざまなソフトウェアソリューションは、事前確率の計算方法によって異なる。確率をモデル化するために使用される誤差モデル、そして全体の遺伝子型を個別のサブ遺伝子型に分割し、この枠組みの中でそれぞれの確率を個別に推定することができる。[ 5 ]
事前確率の計算は、研究対象のゲノムから得られる利用可能なデータと、実行される解析の種類に依存します。既知の変異の頻度を含む良好な参照データが利用可能な研究(たとえば、ヒトゲノムデータの研究)では、集団におけるこれらの既知の遺伝子型の頻度を使用して事前確率を推定できます。集団全体の対立遺伝子頻度が与えられれば、ハーディ・ワインベルグ平衡に従って、各遺伝子座における事前遺伝子型確率を計算できます。[ 6 ] このようなデータがない場合は、遺伝子座とは無関係に一定の事前確率を使用できます。これらは、研究で探している変異の種類に基づいて、ヒューリスティックに選択された値を使用して設定できます。あるいは、提供されたNGSデータを使用して、サンプル内の個体の最適な事前値を学習しようとする教師あり機械学習手順が調査されています。[ 4 ]
バリアントコールの確率的方法を作成する際に使用されるエラーモデルは、ベイズの定理で使用される用語。データがエラーフリーであると仮定すると、各遺伝子座で観測されたヌクレオチド数の分布は二項分布に従い、 AAおよびBBの場合、ヌクレオチドの 100% がそれぞれ A または B アレルに一致し、 ABの場合、各ヌクレオチドがAまたはBのいずれかに一致する確率は 50% になります。しかし、リードデータにノイズが存在する場合、この仮定は破られ、各遺伝子座のアラインメントされたリードに誤ったヌクレオチドが存在する可能性を考慮して、値を決定する必要がある。
単純なエラーモデルでは、ホモ接合の場合のデータ確率項に小さなエラーを導入し、AAの場合にAアレルに一致しないヌクレオチドが観察される小さな定数確率、およびBBの場合にBアレルに一致しないヌクレオチドが観察される小さな定数確率を許容します。しかし、条件付きデータ確率を計算する際に、実際のデータで観察される実際のエラーパターンをより現実的に再現しようとする、より洗練された手順が利用可能です。たとえば、リード品質の推定値 (Phred 品質スコアとして測定)がこれらの計算に組み込まれており、遺伝子座の各個々のリードにおける期待されるエラー率を考慮に入れています。[ 7 ] エラーモデルにうまく組み込まれているもう 1 つの手法は、塩基品質の再較正です。これは、エラーパターンに関する既知の事前情報に基づいて、考えられる各ヌクレオチド置換について個別のエラー率を計算するものです。研究によると、考えられる各ヌクレオチド置換がシーケンスデータでエラーとして現れる可能性は均等ではないため、塩基品質の再較正がエラー確率の推定値を改善するために適用されています。[ 6 ]
上記の議論では、各遺伝子座における遺伝子型確率は独立して計算されると仮定されています。つまり、遺伝子型全体が各遺伝子座の独立した遺伝子型に分割され、それぞれの確率が独立して計算されます。しかし、連鎖不平衡のため、近傍の遺伝子座の遺伝子型は一般に独立ではありません。そのため、遺伝子型全体を重複するハプロタイプのシーケンスに分割することで、これらの相関関係をモデル化することができ、事前分布に集団全体のハプロタイプ頻度を組み込むことで、より正確な確率推定値が得られます。ハプロタイプを使用して変異検出精度を向上させる方法は、例えば1000ゲノムプロジェクトなどで成功裏に適用されています。[ 8 ]
確率的方法の代替として、 NGSデータでバリアントコールを実行するためのヒューリスティック法が存在する。観測データの分布をモデル化してベイズ統計を使用して遺伝子型確率を計算する代わりに、最小アレル数、リード品質カットオフ、リード深度の境界など、さまざまなヒューリスティック要因に基づいてバリアントコールが行われる。確率的方法と比較すると、実際にはあまり普及していないが、境界とカットオフを使用するため、確率モデルの仮定に違反する外れ値データに対して頑健である。[ 9 ]
NGSデータを用いたバリアントコール手法の設計において重要な要素の一つは、NGSリードをアラインメントする参照DNA配列です。ヒト遺伝学の研究では、HapMapプロジェクト[ 10 ]などのソースから高品質の参照配列が利用可能であり、 バリアントコールアルゴリズムによるバリアントコールの精度を大幅に向上させることができます。さらに、このような参照配列は、ベイズベースの解析における事前遺伝子型確率のソースとしても利用できます。しかし、このような高品質の参照配列がない場合は、まず実験的に得られたリードをアセンブルして、アラインメント用の参照配列を作成することができます[ 1 ] 。
バリアントコール実験において、エラーやバイアスの原因を取り除くために、データをフィルタリングする様々な方法が存在する。これには、アライメントを実行する前に疑わしいリードを除去したり、バリアントコールアルゴリズムによって返されたバリアントリストをフィルタリングしたりすることが含まれる。
使用するシーケンスプラットフォームによっては、シーケンスされたリードのセット内にさまざまなバイアスが存在する可能性があります。たとえば、ストランドバイアスが発生する可能性があり、これは、ある領域でアラインされたリードの順方向と逆方向の分布が非常に不均等である場合です。さらに、一部のリードの異常に高い重複が発生する可能性もあります(たとえば、PCRのバイアスによる)。このようなバイアスは疑わしいバリアントコールにつながる可能性があります。たとえば、ある遺伝子座でPCRエラーを含む断片がPCRバイアスによって過剰に増幅された場合、その遺伝子座では偽アレルが多くなり、SNVとしてコールされる可能性があります。そのため、解析パイプラインでは、これらのバイアスに基づいてコールをフィルタリングすることがよくあります。[ 1 ]
生殖細胞系遺伝子変異を検出するために個々のサンプルからのリードをリファレンスゲノムにアラインメントする方法に加えて、単一の個体内の複数の組織サンプルからのリードをアラインメントして比較することで、体細胞変異を検出することもできます。これらの変異は、個体内の体細胞群内で新たに発生した変異に対応します(つまり、個体の生殖細胞には存在しません)。この分析方法は、がんの研究に頻繁に適用されており、がん組織内の体細胞変異のプロファイルを調査することを中心に設計された多くの研究があります。このような調査により、臨床応用されている診断ツールが開発され、例えば、新しいがん関連遺伝子の発見、関連する遺伝子制御ネットワークと代謝経路の特定、腫瘍の成長と進化のモデルへの情報提供などによって、疾患の科学的理解を深めるために使用されています。[ 11 ]
最近まで、この種の分析を実行するためのソフトウェアツールは著しく未発達であり、生殖細胞系列変異を検出するために使用されるのと同じアルゴリズムに基づいていた。このような手順は、同じ個人の複数の組織サンプルに存在する遺伝子型間の統計的相関を適切にモデル化していないため、このタスクには最適化されていない。[ 3 ]
最近の研究では、複数の組織サンプルからの体細胞変異の検出に特化して最適化されたソフトウェアツールが開発されています。確率的手法が開発され、各遺伝子座のすべての組織サンプルからのアレル数をプールし、すべての組織の結合遺伝子型の尤度と遺伝子型が与えられた場合のアレル数の分布に関する統計モデルを使用して、利用可能なすべてのデータを使用して各遺伝子座での体細胞変異の比較的堅牢な確率を計算できます。[ 3 ] [ 12 ] さらに、この分析を実行するための機械学習ベースの手法についても最近研究が行われています。 [ 13 ] [ 14 ] [ 15 ] [ 16 ]
2021年、シーケンス品質管理フェーズ2コンソーシアム[ 17 ]は、コンソーシアムが参照サンプル、データ、コールセットとして確立した腫瘍細胞株と正常細胞株のペアに基づいて、サンプル調製、シーケンスライブラリキット、シーケンスプラットフォーム、バイオインフォマティクスワークフローが体細胞SNV検出の精度に及ぼす影響を調査した多数 の研究を発表した[ 18 ] 。 [ 19 ]
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数名: 著者リスト (リンク) CS1 maint: 数値名: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)