
コンティグ(contiguousから)とは、DNA の共通領域を表す、重複するDNAセグメントのセットのことである。[ 1 ]
ボトムアップシーケンスプロジェクトでは、コンティグは重複するシーケンスデータ(リード)を指します。[ 2 ]トップダウンシーケンスプロジェクトでは、コンティグはシーケンスとアセンブリのガイドとして使用されるゲノムの物理的マップを形成する重複するクローンを指します。[ 3 ]したがって、コンティグは、文脈に応じて、重複するDNA配列とクローンに含まれる重複する物理的セグメント(フラグメント)の両方を指すことがあります。
1980年、Staden [ 4 ]は次のように書いています。ショットガンシーケンス法で得られたデータについて簡単に説明できるように、「コンティグ」という言葉を考案しました。コンティグとは、配列の重複によって互いに関連付けられたゲル読み取り値の集合です。すべてのゲル読み取り値は、ただ1つのコンティグに属し、各コンティグには少なくとも1つのゲル読み取り値が含まれています。コンティグ内のゲル読み取り値を合計すると、連続したコンセンサス配列が形成され、この配列の長さがコンティグの長さになります。
配列コンティグは、ボトムアップシーケンス戦略によって生成された小さなDNA断片を再構成することによって得られる連続した(連続していない)配列です。このコンティグの意味は、ロジャー・スタデン(1979)による元の定義と一致しています。[ 5 ]ボトムアップDNAシーケンス戦略では、ゲノムDNAを多数の小さな断片(「ボトム」)に切断し、これらの断片をシーケンスし、それらをコンティグに再構成し、最終的にゲノム全体(「アップ」)を構築します。現在の技術では、比較的短いDNA断片(300~1000ヌクレオチド)のみを直接シーケンスできるため、ゲノムDNAはシーケンスの前に小さな断片に分割する必要があります。[ 6 ]ボトムアップシーケンスプロジェクトでは、増幅されたDNAがランダムに切断され、シーケンスに適したサイズの断片になります。その後のシーケンスリード(小さな断片の配列を含むデータ)はデータベースに格納されます。アセンブリソフトウェア[ 6 ]は、このデータベースから重複するリードのペアを検索します。このようなペアのリード(もちろん、同一配列のコピーは1つだけ)を組み立てると、配列決定されたDNAのより長い連続リード(コンティグ)が生成されます。このプロセスを、最初は最初の短いリードのペアで、次に以前のアセンブリの結果として得られるより長いペアを使用して何度も繰り返すことで、染色体全体のDNA配列を決定できます。
今日では、一定サイズの長いDNA断片の両端をシーケンスするペアエンドシーケンス技術を使用するのが一般的です。ここでも、コンティグは、リードのオーバーラップによって作成された連続したシーケンスデータの領域を指します。断片の長さが既知であるため、各断片の両端のリード間の距離が既知です。[ 7 ]これにより、これらのリードから構築されたコンティグの向きに関する追加情報が得られ、スキャフォールディングと呼ばれるプロセスでそれらをスキャフォールドに組み立てることができます。
スキャフォールドは、既知の長さのギャップで隔てられた重複するコンティグから構成されます。コンティグの向きに課せられた新しい制約により、ゲノム内の高度に反復された配列を配置することが可能になります。一方の末端リードが反復配列を持つ場合、そのメイトペアがコンティグ内に位置する限り、その配置は既知となります。[ 7 ]スキャフォールド内のコンティグ間の残りのギャップは、PCR増幅後にシーケンスを行う方法(より小さなギャップの場合)や、 BACクローニング法後にシーケンスを行う方法(より大きなギャップの場合)など、さまざまな方法でシーケンスすることができます。[ 2 ]
コンティグは、トップダウンまたは階層的シーケンス戦略が使用される場合に染色体の物理的マップを形成する重複クローンを指すこともあります。 [ 1 ] このシーケンス方法では、ゲノムのシーケンスリードの後のアセンブリをガイドするためのフレームワークを提供するために、シーケンスの前に低解像度マップが作成されます。このマップは、シーケンスに使用されるクローンの相対的な位置と重複を特定します。連続したDNA領域を形成する重複クローンのセットはコンティグと呼ばれ、染色体全体をカバーするコンティグを形成する最小数のクローンが、シーケンスに使用されるタイリングパスを構成します。タイリングパスが選択されると、その構成要素であるBACはより小さな断片に切断され、シーケンスされます。したがって、コンティグは階層的シーケンスのフレームワークを提供します。[ 3 ]
コンティグマップの組み立てにはいくつかのステップがあります。まず、DNAをより大きな(50~200kb)断片に切断し、それをBACまたはPACにクローニングしてBACライブラリを作成します。これらのクローンはゲノム/染色体全体をカバーする必要があるため、理論的には染色体全体をカバーするBACのコンティグを組み立てることができます。[ 1 ]しかし、現実は必ずしも理想的ではありません。ギャップが残ることが多く、マップ領域をカバーするコンティグとギャップからなるスキャフォールドが最初の結果となることがよくあります。[ 1 ]コンティグ間のギャップは、以下に概説するさまざまな方法で閉じることができます。
BACコンティグは、さまざまな方法を用いて既知の重複領域を持つBAC領域を整列させることによって構築されます。一般的な戦略の1つは、配列タグ付きサイト(STS)コンテンツマッピングを使用して、BAC間で共通する固有のDNAサイトを検出することです。重複の程度は、2つのクローン間で共通するSTSマーカーの数によっておおよそ推定され、共通するマーカーが多いほど重複が大きいことを示します。[ 2 ]この戦略では重複の非常に大まかな推定しか得られないため、クローン重複のより正確な測定を提供する制限酵素消化断片分析がよく使用されます。 [ 2 ]この戦略では、クローンを1つまたは2つの制限酵素 で処理し、得られた断片をゲル電気泳動によって分離します。2つのクローンであれば、制限酵素部位が共通している可能性が高く、したがっていくつかの断片を共有します。[ 3 ] 共通する断片の数とこれらの断片の長さがわかっているため(長さはサイズ標準との比較によって判断されます)、重複の程度を高い精度で推測できます。
初期の BAC コンティグ構築後にギャップが残ることがよくあります。これらのギャップは、スクリーニングされた細菌人工染色体(BAC) ライブラリーの複雑性が低い場合、つまり STS または制限酵素部位の数が少ない場合、または特定の領域がクローニング宿主で不安定で、ライブラリーに十分に表現されていない場合に発生します。[ 1 ] STS ランドマーク マッピングと制限酵素フィンガープリンティングを実行した後もコンティグ間にギャップが残っている場合は、コンティグ末端のシーケンスを使用してこれらのギャップを閉じることができます。この末端シーケンス戦略は、基本的に他のコンティグをスクリーニングするための新しい STS を作成します。あるいは、コンティグの末端配列をプライマーとして使用して、ギャップを横断するプライマー ウォークを行うこともできます。[ 2 ]