タグSNPとは、連鎖不平衡の高いゲノム領域における代表的な一塩基多型(SNP)であり、ハプロタイプと呼ばれるSNP群を代表するものです。染色体領域内のすべてのSNPを遺伝子型判定することなく、遺伝的変異と表現型との関連性を特定することが可能になります。これにより、個々のSNPを研究する必要がなくなるため、疾患に関連するゲノム領域のマッピングにかかる費用と時間を削減できます。タグSNPは、ゲノム全体にわたる数十万個のSNPを遺伝子型判定する全ゲノムSNP関連研究において有用です。

2つの遺伝子座は、それらの遺伝が独立した事象である場合、連鎖平衡(LE)にあると言われます。これらの遺伝子座の対立遺伝子が非ランダムに遺伝する場合、それらは連鎖不平衡(LD)にあると言われます。LDは、遺伝子の物理的な連鎖によって最も一般的に引き起こされます。2つの遺伝子が同じ染色体上で遺伝する場合、それらの距離と遺伝子座間の組換えの可能性に応じて、高いLDになる可能性があります。しかし、LDは機能的な相互作用によっても観察されることがあり、異なる染色体上の遺伝子であっても、共同で進化的に選択された表現型を付与したり、潜在的な子孫の生存能力に影響を与えたりする可能性があります。
家族では、組換えイベントの数が最も少ない(減数分裂イベントが最も少ない)ため、LD が最も高くなります。これは特に近親交配系統間で当てはまります。集団では、選択、組換え率を低下させる遺伝子の物理的な近さ、または最近の交雑や移住により LD が存在します。集団レベルでは、連鎖不平衡に影響を与えるプロセスには、遺伝的連鎖、エピスタシス的自然選択、組換え率、突然変異、遺伝的浮動、ランダム交配、遺伝的ヒッチハイク、遺伝子流動などがあります。[ 2 ]
LDが高いためにSNPのグループが一緒に遺伝する場合、冗長な情報が生じる傾向があります。これらのグループの代表としてタグSNPを選択することで、形質/疾患に関連するゲノムの部分を分析する際の冗長性を減らすことができます。[ 3 ] LDが高いゲノム領域で、一緒に遺伝する特定のSNPセットが存在する領域は、ハプロタイプとしても知られています。したがって、タグSNPはハプロタイプ内のすべてのSNPを代表するものです。
タグSNPの選択は、ゲノムに存在するハプロタイプに依存します。ほとんどのシーケンス技術は、ハプロタイプではなく遺伝子型情報を提供します。つまり、存在する特定の塩基に関する情報は提供しますが、位相情報(各塩基がどの特定の染色体に現れるか)は提供しません。[ 4 ]ハプロタイプの決定は、分子生物学的手法(対立遺伝子特異的PCR、体細胞ハイブリッド)によって行うことができます。これらの手法は、遺伝子型判定の前に染色体を分離することにより、どの対立遺伝子がどの染色体に存在するかを区別します。これらの手法は非常に時間がかかり、費用もかかるため、より安価で自動化されたオプションとして統計的推論手法が開発されました。これらの統計的推論ソフトウェアパッケージは、ハプロタイプを決定するために、最小進化法、最尤法、およびベイズアルゴリズムを利用します。統計的推論の欠点は、推論されたハプロタイプの一部が間違っている可能性があることです。[ 5 ]
ゲノムワイド関連解析にハプロタイプを用いる場合、研究対象集団に注意することが重要です。異なる集団では、連鎖不平衡(LD)のパターンが異なることがよくあります。異なるパターンの例としては、アフリカ系集団とヨーロッパ系およびアジア系集団が挙げられます。人類はアフリカで起源し、ヨーロッパ、そしてアジア大陸とアメリカ大陸へと広がったため、アフリカ系集団は遺伝的に最も多様でLD領域が小さい一方、ヨーロッパ系およびアジア系集団は創始者効果によりLD領域が大きくなっています。集団間でLDパターンが異なると、ハプロタイプブロックの変化によりSNP同士が関連しなくなる可能性があります。つまり、ハプロタイプブロックの代表であるタグSNPは集団ごとに固有のものであり、関連解析を行う際には集団間の違いを考慮する必要があります。[ 6 ]

ほぼすべての形質は、遺伝的要因と環境要因の両方の影響を受けています。遺伝率とは、表現型のばらつきのうち、祖先から受け継がれる割合のことです。関連研究は、表現型発現に対する遺伝的影響を決定するために用いられます。関連研究は主に疾患をゲノム領域にマッピングするために用いられますが、身長や目の色など、あらゆる表現型の遺伝率をマッピングするためにも使用できます。
ゲノムワイド関連研究(GWAS)は、一塩基多型(SNP)を使用して、臨床状態や表現型特性との遺伝的関連性を特定します。[ 8 ]仮説に基づかず、ゲノム全体のアプローチを使用して、表現型を発現する多数の個人と発現しない多数の人々を比較することで特性を調査します。GWASの究極の目標は、誰が病気のリスクがあるか、病気感受性の生物学的基盤は何か、新しい予防および治療戦略を作成するために使用できる遺伝的リスク因子を決定することです。[ 1 ]国立ヒトゲノム研究所と欧州バイオインフォマティクス研究所は、公開されているゲノムワイド関連研究のカタログであるGWASカタログを公開しており、数百のSNPと幅広い表現型との間の統計的に有意な関連性を強調しています。[ 9 ]

SNP バリアントの数が非常に多いため (2015 年 6 月時点で 1 億 4900 万以上[ 10 ] [ 11 ] )、すべての SNP をシーケンスすることは依然として非常に高価です。そのため、GWAS では、タグ SNP として識別されたバリアントのサブセットのみをジェノタイピングするために、カスタマイズ可能なアレイ(SNP チップ)を使用します。ほとんどの GWAS では、2 つの主要なジェノタイピング プラットフォームの製品を使用します。Affymetrixプラットフォームは、サンプル DNA の特定のアレルにハイブリダイズする DNA プローブをガラスまたはシリコン チップに印刷します。Illuminaプラットフォームは、より長い DNA 配列で、より高い特異性を生み出すビーズ ベースのテクノロジーを使用します。[ 1 ]どちらのプラットフォームも、既製の DNA オリゴまたはカスタムDNA オリゴを使用して、100 万を超えるタグ SNP をジェノタイピングできます。
ゲノムワイド研究は、一般的な疾患は一般的な遺伝的変異によって影響を受けるという、一般的な疾患-一般的な変異(CD/CV)仮説に基づいています。一般的な変異の効果量(浸透率)は、希少疾患で見られるものに比べて小さくなければなりません。つまり、一般的なSNPは遺伝的要因による分散のごく一部しか説明できず、一般的な疾患は効果量の小さい複数の一般的な対立遺伝子によって影響を受けるということです。別の仮説は、一般的な疾患は、一般的な変異と合成的に連鎖している希少変異によって引き起こされるというものです。この場合、GWASから得られるシグナルは、連鎖不平衡にある1つ以上の希少な原因変異間の間接的(合成的)な関連です。タグSNPのグループを選択する際に、この現象が起こり得ることを認識することが重要です。疾患がハプロタイプと関連していることが判明した場合、そのハプロタイプ内のいくつかのSNPは、疾患と合成的に関連していることになります。原因となるSNPを特定するには、ハプロタイプブロックの選択においてより高い解像度が必要です。全ゲノムシーケンス技術は急速に進化し、価格も下がってきていることから、原因となる変異を特定するために必要な解像度を提供する現在の遺伝子型判定技術に取って代わる可能性が高いと考えられます。
個人の全ゲノムシーケンスは依然としてコストがかかりすぎるため、国際的なHapMapプロジェクトは、ヒトの遺伝的変異の一般的なパターンを記述できるハプロタイプグループ(ハプロタイプブロック)にヒトゲノムをマッピングすることを目標として構築されました。ゲノム全体をハプロタイプにマッピングすることで、遺伝子研究で調べられるハプロタイプブロックを表すタグSNPを特定できます。遺伝子研究を計画する際に考慮すべき重要な要素は、特定の対立遺伝子の頻度とリスクです。これらの要素は異なる集団で異なる可能性があるため、HapMapプロジェクトではさまざまなシーケンス技術を使用して、さまざまな集団セットからSNPを発見してカタログ化しました。当初、このプロジェクトは、アフリカ起源のヨルバ族(YRI)、西ヨーロッパ系の祖先を持つユタ州の住民(CEU)、日本の東京の非血縁者(JPT)、中国の北京の非血縁の漢民族(CHB)の個人のシーケンスを行いました。最近では、データセットは他の集団(11グループ)を含むように拡張されています。[ 1 ]
最も情報量の多いタグSNPの選択はNP完全問題である。しかし、誤差範囲内で近似解を提供するアルゴリズムを考案することができる。[ 12 ]各タグSNP選択アルゴリズムを定義するために必要な基準は以下のとおりである。
特徴選択の方法は、フィルタ法とラッパー法の2つのカテゴリに分類されます。フィルタアルゴリズムは、特定の分類方法の使用を前提としない一般的な前処理アルゴリズムです。一方、ラッパーアルゴリズムは、特徴選択を特定の分類器に「ラップ」し、交差検証を使用して分類器の精度に基づいて特徴のサブセットを選択します。[ 13 ]
タグSNPを選択するのに適した特徴選択方法は、以下の特性を備えている必要がある。
タグSNPを選択するためのアルゴリズムがいくつか提案されている。最初のアプローチは、SNPセットの良し悪しの尺度に基づいており、サイズは小さいが定義された尺度で高い値を示すSNPサブセットを探索するものであった。すべてのSNPサブセットを調べて良し悪しを見つける方法は、データセットが小さい場合にのみ計算上実行可能である。
別のアプローチでは、主成分分析(PCA)を使用して、データ分散の大部分を捉えるSNPのサブセットを見つけます。スライディングウィンドウ法を使用して、短い染色体領域にPCAを繰り返し適用します。これにより、生成されるデータが減少し、指数関数的な検索時間も必要ありません。しかし、PCA法は計算が複雑なため、大規模な染色体データセットに適用することは現実的ではありません。[ 13 ]
最も一般的に使用されているブロックベースの方法は、ハプロタイプブロック内で観察される連鎖不平衡の原理を利用しています。[ 12 ]染色体領域をハプロタイプブロックに分割するためのいくつかのアルゴリズムが考案されており、これらはハプロタイプの多様性、LD、4つの配偶子テスト、および情報複雑性に基づいており、タグSNPはそのブロックに属するすべてのSNPから選択されます。このアルゴリズムの主な前提は、SNPが二対立遺伝子であるということです。[ 14 ]主な欠点は、ブロックの定義が常に単純明快ではないことです。ハプロタイプブロックを形成するための基準のリストはありますが、それについて合意はありません。また、タグSNPの局所相関に基づく選択は、ブロック間の相関を無視します。[ 12 ]
ブロックベースのアプローチとは異なり、ブロックフリーのアプローチはブロック構造に依存しません。SNP頻度と組換え率はゲノム全体で変動することが知られており、いくつかの研究では、報告されている最大ブロックサイズよりもはるかに長いLD距離が報告されています。近傍の厳密な境界を設定することは望ましくなく、ブロックフリーのアプローチではタグSNPをグローバルに検索します。これを行うためのアルゴリズムがいくつかあります。1つのアルゴリズムでは、タグなしSNPはタグSNPのブール関数として表現され、集合論的手法を使用して検索空間を削減します。別のアルゴリズムでは、連続しないブロックから得られるマーカーのサブセットを検索します。マーカーの近傍により、検索空間が削減されます。[ 13 ]
遺伝子型が決定された個体数とデータベース内のSNP数の増加に伴い、タグSNPの選択には計算に時間がかかりすぎる。タグSNP選択方法の効率を向上させるために、アルゴリズムはまず二対立遺伝子であるSNPを無視し、次に同じ情報を持つSNPサイトをグループ化することでハプロタイプ行列の長さ(SNP数)を圧縮する。ハプロタイプを同じグループに分割するSNPサイトは冗長サイトと呼ばれる。ブロック内に異なる情報を含むSNPサイトは非冗長サイト(NRS)と呼ばれる。ハプロタイプ行列をさらに圧縮するために、アルゴリズムは行列のすべてのハプロタイプを区別できるようなタグSNPを見つける必要がある。共同分割の考え方を用いることで、効率的なタグSNP選択アルゴリズムが提供される。[ 14 ]
タグSNPの選択方法に応じて、交差検証プロセス中に異なる予測方法が使用されました。機械学習法は、除外されたハプロタイプの予測に使用されました。別のアプローチでは、nとの相関係数が最も高いタグSNPから、非タグSNP nのアレルを予測しました。相関係数の高いタグSNP tが1つ見つかった場合、アレルの頻度がtのアレル頻度と一致するようにアレルが割り当てられます。複数のタグSNPがnと同じ(高い)相関係数を持つ場合、nの共通アレルが有利になります。この場合、予測方法は、SNP間の相関係数の行列に対してPCAを使用する選択方法とよく一致することが容易にわかります。[ 13 ]
タグSNP選択方法の精度を評価する他の方法もあります。精度は、品質指標R2によって評価できます。これは、SNPの全セットで定義されたハプロタイプコピーの真の数と、タグSNPのサブセットに基づいて予測されたハプロタイプコピーの数との間の関連性の尺度です。この尺度は、二倍体データと、遺伝子型からのハプロタイプの明示的な推論を前提としています。[ 13 ]
クレイトンによる別の評価方法は、ハプロタイプの多様性の尺度に基づいています。多様性は、ハプロタイプ間のすべてのペアワイズ比較における差異の総数として定義されます。ハプロタイプのペア間の差異は、すべてのSNPにわたる差異の合計です。クレイトンの多様性尺度は、タグSNPのセットが異なるハプロタイプをどの程度区別できるかを定義するために使用できます。この尺度は、ハプロタイプの多様性が限られているハプロタイプブロックにのみ適しており、複数のハプロタイプブロックで構成される大規模なデータセットにどのように使用するかは明確ではありません。[ 13 ]
最近の研究では、タグSNP選択アルゴリズムを、タグSNPが非タグSNPの予測にどれだけ有効に使用できるかに基づいて評価している。予測精度は、リーブワンアウトやホールドアウトなどの交差検証を使用して決定される。リーブワンアウト交差検証では、データセット内の各シーケンスについて、アルゴリズムをデータセットの残りの部分で実行して、最小限のタグSNPセットを選択する。[ 13 ]
Taggerは、国際ハップマッププロジェクトなどの遺伝子型データからタグSNPを評価および選択するためのWebツールです。ペアワイズ法とマルチマーカーハプロタイプアプローチを利用します。ユーザーはHapMap遺伝子型データまたは家系図形式をアップロードでき、連鎖不平衡パターンが計算されます。Taggerのオプションを使用すると、ユーザーは染色体ランドマークを指定できます。これは、タグSNPを選択するためのゲノム内の関心領域を示します。その後、プログラムはタグSNPのリストとその統計的検定値、およびカバレッジレポートを生成します。これは、ブロード研究所のマサチューセッツ総合病院およびハーバード大学医学部のヒト遺伝学研究センターのDavid AltshulerとMark Dalyの研究室でPaul de Bakkerによって開発されました。[ 15 ]
フリーウェアのCLUSTAGとWCLUSTAGには、染色体領域内の既知のすべてのSNPを表すことができるタグSNPのセットを取得するためのクラスタリングアルゴリズムとセットカバーアルゴリズムが含まれています。これらのプログラムはJavaで実装されており、WindowsプラットフォームとUnix環境で実行できます。香港大学のSIO-IONG AOらによって開発されました。[ 16 ] [ 17 ]