
遺伝子発現シリアル解析(SAGE)は、分子生物学者が対象サンプル中のメッセンジャーRNA集団のスナップショットを、それらの転写産物の断片に対応する小さなタグの形で作成するために使用するトランスクリプトーム技術です。その後、いくつかのバリアントが開発され、最も有名なのは、より堅牢なバージョンのLongSAGE [ 2 ] 、 RL-SAGE [ 3 ]、そして最新のSuperSAGE [ 4 ]です。これらの多くは、より長いタグを捕捉することで技術を改良し、ソース遺伝子のより確実な識別を可能にしました。
簡単に言うと、SAGE実験は次のように進められます。
SAGEの出力は、短い配列タグのリストと、それが検出された回数です。配列データベースを使用することで、研究者は通常、ある程度の確信を持って、そのタグがどの元のmRNA(したがってどの遺伝子)から抽出されたかを特定できます。
統計的手法を用いることで、異なるサンプルから得られたタグリストやカウントリストを分析し、どの遺伝子の発現量が高いかを判断することができる。例えば、正常組織サンプルと対応する腫瘍組織サンプルを比較することで、どの遺伝子の活性が高い(あるいは低い)かを判断することができる。
1979年、ハーバード大学とカリフォルニア工科大学の研究チームは、試験管内でmRNAのDNAコピーを作成するという基本的なアイデアを、細菌プラスミド内のそのようなライブラリーの増幅にまで拡張しました。[ 5 ] 1982年から1983年にかけて、そのようなcDNAライブラリーからランダムまたは半ランダムなクローンを選択して配列決定するというアイデアが、グレッグ・サトクリフとその同僚によって検討されました。[ 6 ]また、パトニーらは、ウサギの筋肉cDNAライブラリーから178個のクローンを配列決定しました。[ 7 ] 1991年、アダムスとその同僚は、発現配列タグ(EST)という用語を作り出し、プロジェクトとしてcDNAのより体系的な配列決定を開始しました(600個の脳cDNAから開始)。[ 8 ] ESTの同定は急速に進み、現在では数百万個のESTが公共データベース(例:GenBank)で利用可能です。
1995年、タグ長を100~800 bpから10~22 bpに短縮するというアイデアは、mRNA調査のコスト削減に役立った。[ 9 ]この年、ジョンズ・ホプキンス大学腫瘍センターのビクター・ベルクレスクによって、オリジナルのSAGEプロトコルが発表された。[ 9 ] SAGEはもともと癌研究での使用を目的として考案されたものだが、他の疾患やさまざまな生物のトランスクリプトームを記述するためにも成功裏に使用されている。
この技術の一般的な目的は、DNAマイクロアレイと似ています。ただし、SAGEサンプリングは、mRNA出力をプローブにハイブリダイゼーションさせるのではなく、mRNA出力のシーケンスに基づいているため、転写レベルはマイクロアレイよりも定量的に測定されます。さらに、mRNA配列を事前に知る必要がないため、未知の遺伝子や遺伝子変異体を発見できます。 マイクロアレイ実験ははるかに安価に実施できるため、大規模な研究では通常SAGEは使用されません。SAGEでは転写産物の数を直接カウントするため、遺伝子発現の定量化がより正確になります。一方、マイクロアレイではスポット強度が非離散的な勾配で分布し、バックグラウンドノイズの影響を受けやすいです。
マイクロRNA、略してmiRNAは、遺伝子調節において重要な役割を果たすことがわかっている、約22ヌクレオチドの小さなRNA断片です。細胞または組織内のmiRNAをクローニングおよび同定するための最も一般的な方法の1つは、Bartel研究室で開発され、Lauら(2001)の論文で発表されました。それ以来、いくつかのバリアントプロトコルが登場しましたが、ほとんどは同じ基本形式です。手順はSAGEと非常によく似ています。小さなRNAを単離し、それぞれにリンカーを追加し、RT-PCRによってRNAをcDNAに変換します。その後、内部制限部位を含むリンカーを適切な制限酵素で消化し、粘着末端を連結してコンカテマーにします。連結後、断片をプラスミドに連結し、細菌を形質転換して、挿入を含むプラスミドの多数のコピーを生成します。その後、それらの配列を解析して存在するmiRNAを特定したり、SAGEと同様に、特定のmiRNAの発現量をカウントすることでその発現レベルを分析したりすることができる。
LongSAGEは、2002年に開発されたオリジナルのSAGEのより堅牢なバージョンで、スループットが高く、20 μgのmRNAを使用して数千のタグのcDNAライブラリを生成しました。[ 10 ] Robust LongSage(RL-SAGE)は、LongSAGEプロトコルをさらに改良し、挿入サイズが50 ng mRNAのライブラリを生成する能力を備えており、これは以前のLongSAGEの挿入サイズ2 μg mRNAよりもはるかに小さく[ 10 ] 、完全なcDNAライブラリを得るために使用するditagポリメラーゼ連鎖反応( PCR)の数が少なくなっています。[ 11 ]
SuperSAGEはSAGEの派生技術であり、ファージP1のタイプIIIエンドヌクレアーゼEcoP15Iを使用して、各転写産物のcDNAから26 bp長の配列タグを切り出し、前身の技術であるSAGEおよびLongSAGEと比較してタグサイズを少なくとも6 bp拡張します。[ 12 ]タグサイズが長くなると、各追加塩基ごとに注釈の精度が大幅に向上するため、対応する転写産物へのタグの割り当てがより正確になります。
オリジナルの SAGE プロトコルと同様に、いわゆる ditag は、平滑末端タグを使用して形成されます。ただし、SuperSAGE は、ランダム性が低い LongSAGE 20 bp ditag 連結中に観察されるバイアスを回避します。[ 13 ]ハイスループットシーケンス技術 (次世代シーケンス、すなわちパイロシーケンス) による直接シーケンスにより、数十万または数百万のタグを同時に分析することができ、非常に正確で定量的な遺伝子発現プロファイルが生成されます。したがって、「デジタル遺伝子発現プロファイリング」(DGE) とも呼ばれるタグベースの遺伝子発現プロファイリングは、今日ではマイクロアレイの限界を克服する最も正確な転写プロファイルを提供できます。[ 14 ] [ 15 ]
2010年代半ば、次世代シーケンシングと組み合わせたいくつかの技術が開発され、タグ付け酵素を使用せずに「デジタル遺伝子発現プロファイリング」のための「タグ」原理が採用されました。「MACE」(Massive Analysis of cDNA Ends)アプローチは、転写産物の最後の1500 bpのどこかにタグを生成します。この技術はもはや制限酵素に依存しないため、cDNA内の制限部位の有無や位置に関連するバイアスを回避できます。代わりに、cDNAはランダムに断片化され、ポリAテールを持つcDNA分子の5'末端から3'末端がシーケンスされます。タグのシーケンス長は自由に選択できます。このため、タグをコンティグに組み立てることができ、タグの注釈を大幅に改善できます。したがって、MACEは非モデル生物の解析にも使用されます。さらに、より長いコンティグは多型をスクリーニングできます。 UTRは個体間で多数の多型を示すため、MACE法は対立遺伝子の決定、対立遺伝子特異的遺伝子発現プロファイリング、および育種のための分子マーカーの探索に適用できます。さらに、この方法では転写産物の代替ポリアデニル化を決定できます。MACE法は転写産物の3'末端のみを必要とするため、部分的に分解されたRNAでも、分解依存性バイアスを少なくして分析できます。MACE法は、PCRバイアスの識別を可能にするために、独自の分子識別子を使用します。 [ 16 ]