| 開発者 | ジム・ケント、UCSC |
|---|---|
| リポジトリ |
|
| タイプ | バイオインフォマティクスツール |
| ライセンス | 非商用利用は無料、商用利用は可能、ソースは利用可能 |
| Webサイト | genome.ucsc.edu/cgi-bin/hgBlat |
BLAT(BLASTのようなアライメントツール)は、2000年代初頭にカリフォルニア大学サンタクルーズ校(UCSC)のジム・ケントによって開発された、ヒトゲノムのアセンブリとアノテーションを支援するためのペアワイズ配列アライメント アルゴリズムです。[1]これは主に、マウスのゲノムリードと発現配列タグをヒトゲノム配列に対して何百万ものアライメントに必要な時間を短縮するために設計されました。当時のアライメントツールは、ヒトゲノムアセンブリを定期的に更新できるような方法でこれらの操作を実行することができませんでした。既存のツールと比較して、BLATはmRNA / DNAアライメントの実行で約500倍、タンパク質/ タンパク質アライメントで約50倍高速でした。[1]
概要
BLATは、DNA、RNA、タンパク質などの生物学的配列の分析と比較のために開発された複数のアルゴリズムの1つであり、ゲノム配列の生物学的機能を発見するために相同性を推測することを主な目的としています。 [2]古典的なNeedleman-Wunsch [3]やSmith-Waterman [4] の 動的計画法アルゴリズムのように、2つの配列間の数学的に最適なアラインメントを見つけることは保証されていません。むしろ、最初に相同である可能性が高い短い配列を迅速に検出し、次に相同領域をアラインメントしてさらに拡張します。これはヒューリスティックBLAST [5] [6]アルゴリズムファミリーに似ていますが、各ツールは異なるアルゴリズム手法を試みることで、生物学的配列をタイムリーかつ効率的にアラインメントする問題に対処しようとしています。[2] [7]
BLATの用途
BLAT は、DNA 配列だけでなく、タンパク質や翻訳されたヌクレオチド (mRNA または DNA) 配列のアラインメントにも使用できます。類似性が高い配列で最も効果的に機能するように設計されています。DNA 検索は霊長類に最も効果的で、タンパク質検索は陸生脊椎動物に効果的です。[1] [8]さらに、タンパク質または翻訳された配列クエリは、DNA 配列クエリよりも遠距離の一致の特定や種間分析に効果的です。[9] BLAT の一般的な用途は次のとおりです。
- 複数のmRNA配列をゲノムアセンブリ上に整列させ、それらのゲノム座標を推測する。[10]
- ある種のタンパク質またはmRNA配列を別の種の配列データベースにアラインメントして相同性を決定する。2つの種があまり異なっていない限り、種間のアラインメントは一般的にBLATで効果的である。これはBLATが完全な一致を必要とせず、アラインメントの不一致を許容するため可能である。[11]
- BLATは2つのタンパク質配列のアラインメントに使用できます。しかし、このタイプのアラインメントには最適なツールではありません。標準タンパク質BLASTツールであるBLASTPは、タンパク質間のアラインメントに効果的です。[1]
- 遺伝子のエクソン領域とイントロン領域の分布の決定。[9] [10]
- 特定の遺伝子クエリの遺伝子ファミリーメンバーの検出。[9] [10]
- 特定の遺伝子のタンパク質コード配列の表示。[9] [10]
BLATは、95%以上のヌクレオチド同一性または80%以上の翻訳タンパク質同一性を共有する、少なくとも40塩基の長さの配列間の一致を見つけるように設計されています。[9] [10]
プロセス
BLATは、検査中のクエリ配列に類似するターゲットゲノムデータベース内の領域を見つけるために使用されます。BLATが従う一般的なアルゴリズムプロセスは、最初にデータベース内の短いセグメントと、一定数の一致する要素を持つクエリ配列を検索するという点で、 BLASTのものと似ています。これらのアライメントシードは、高スコアのペアを形成するために、配列の両方向に拡張されます。[12]ただし、BLATはBLASTとは異なるインデックス作成アプローチを使用しており、クエリ配列との類似性について非常に大規模なゲノムデータベースとタンパク質データベースを迅速にスキャンできます。これは、ターゲットデータベースのインデックス付きリスト(ハッシュテーブル)をメモリ内に保持することによって行われ、クエリ配列とターゲットデータベースの比較に必要な時間が大幅に短縮されます。このインデックスは、高度に繰り返されるk-merを除く、ターゲットデータベース内のすべての重複しないk-mer(k文字の単語)の座標を取得することによって構築されます。次にBLATはクエリ配列から重複するすべてのk-merのリストを作成し、ターゲットデータベースでこれらを検索して、配列間で一致するヒットのリストを作成します[1](図1はこのプロセスを示しています)。

検索ステージ
候補となる相同領域を検索するために使用される戦略は 3 つあります。
- 最初の方法では、クエリとデータベースのシーケンスが 1 つだけ完全に一致する必要があります。つまり、2 つの k-mer ワードがまったく同じです。このアプローチは、最も実用的とは言えません。これは、高いレベルの感度を達成するには小さな k-mer サイズが必要であるためですが、これにより誤検出数が増加し、アルゴリズムのアライメント ステージで費やされる時間が長くなります。[1]
- 2番目の方法では、2つのk-mer単語間に少なくとも1つの不一致を許容します。これにより、偽陽性の量が減り、前の方法で生成されたものよりも計算コストの少ないより大きなk-merサイズを処理できるようになります。この方法は、小さな相同領域を識別するのに非常に効果的です。[1]
- 3番目の方法では、互いに近接した複数の完全一致が必要です。ケントが示すように[1] 、これは相同領域内の小さな挿入や削除を考慮できる非常に効果的な手法です。
ヌクレオチドをアラインメントする場合、BLAT は 11 文字 (11 文字) の 2 つの完全な単語一致を必要とする 3 番目の方法を使用します。タンパク質をアラインメントする場合、BLAT のバージョンによって検索方法が決まります。クライアント/サーバー バージョンを使用する場合、BLAT は 3 つの完全な 4 文字一致を検索します。スタンドアロン バージョンを使用する場合、BLAT はクエリとデータベース シーケンス間で 1 つの完全な 5 文字を検索します。[1]
BLAT 対 BLAST
BLAT と BLAST の違いのいくつかを以下に概説します。
- BLATはゲノム/タンパク質データベースにインデックスを付け、そのインデックスをメモリに保持し、クエリ配列をスキャンして一致するものを探します。一方、BLASTはクエリ配列のインデックスを作成し、データベースを検索して一致するものを探します。[1] BLASTの変種であるMegaBLASTは、アライメントを高速化するために4つのデータベースにインデックスを付けます。[9]
- BLATは複数の完全一致およびほぼ完全一致(デフォルトではヌクレオチド検索の場合は長さ11の完全一致が2つ、タンパク質検索の場合は長さ4の完全一致が3つ)を拡張できますが、BLASTは1つまたは2つの一致が近接して発生した場合にのみ拡張します。[1] [9]
- BLATは、2つの配列間の各相同領域を1つの大きなアラインメントに結び付けます。これは、各相同領域を個別のローカルアラインメントとして返すBLASTとは対照的です。BLASTの結果はエクソンのリストであり、各アラインメントはエクソンの終わりを超えて拡張されます。ただし、BLATはmRNAの各塩基をゲノム上に正しく配置し、各塩基を1回だけ使用し、イントロン-エクソン境界(つまりスプライスサイト)を識別するために使用できます。[1] [13]
- BLATはBLASTよりも感度が低い。[2]
プログラムの使用
BLATはWebベースのサーバークライアントプログラムとしても、スタンドアロンプログラムとしても使用できます。[9]
サーバークライアント
BLATのウェブベースのアプリケーションは、UCSCゲノムバイオインフォマティクスサイトからアクセスできます。[8]インデックスの構築は比較的時間のかかる手順です。そのため、ウェブベースのBLATで使用される各ゲノムアセンブリは、アラインメントに使用できる事前計算されたインデックスを持つように、BLATサーバーに関連付けられています。これらのウェブベースのBLATサーバーは、ユーザーがクエリシーケンスを入力できるように、インデックスをメモリ内に保持します。[11]
クエリ配列を検索フィールドにアップロード/貼り付けすると、ユーザーは、ターゲットとする種のゲノム(現在 50 種以上が利用可能)やそのゲノムのアセンブリ バージョン(たとえば、ヒトゲノムには 4 つのアセンブリから選択できます)、クエリの種類(つまり、配列が DNA、タンパク質などに関連するかどうか)、出力設定(つまり、出力をどのように並べ替えて視覚化するか)などのさまざまなパラメータを選択できます。その後、ユーザーはクエリを送信するか、BLAT の「I'm feeling lucky」検索を使用して検索を実行できます。[8]
Bhagwat et al. [9]はBLATを以下のように使用する方法について段階的なプロトコルを提供している。
- mRNA/cDNA 配列をゲノム配列にマッピングします。
- タンパク質配列をゲノムにマッピングします。
- 相同性検索を実行します。
入力
BLATは長いデータベース配列を処理できますが、長いクエリ配列よりも短いクエリ配列の方が効果的です。Kent [1]は、最大クエリ長を200,000塩基にすることを推奨しています。UCSCブラウザは、 DNA検索の場合はクエリ配列を25,000文字未満(つまりヌクレオチド)、タンパク質および翻訳配列検索の場合は10,000文字未満(つまりアミノ酸)に制限しています。[8]

UCSC の Web サイトで利用できる BLAT 検索ゲノムでは、クエリ シーケンスをテキストとして (クエリ ボックスに切り取って貼り付ける) 受け入れるか、テキスト ファイルとしてアップロードします。BLAT 検索ゲノムでは、同じタイプのシーケンスを一度に複数受け入れることができ、最大 25 個まで受け入れることができます。シーケンスが複数ある場合、ヌクレオチドの総数は、DNA 検索の場合は 50,000 個、タンパク質または翻訳されたシーケンスの検索の場合は 25,000 文字を超えてはなりません。DNA クエリ シーケンスを使用してターゲット データベースを検索する例を図 2 に示します。
出力
BLAT 検索では、スコアに基づいて降順で並べられた結果のリストが返されます。返される情報は、アライメントのスコア、データベース シーケンスに一致するクエリ シーケンスの領域、クエリ シーケンスのサイズ、アライメントのパーセンテージとしての同一性のレベル、およびクエリ シーケンスがマップされる染色体と位置です。[9] Bhagwatら[9]は、 BLAT の「スコア」と「同一性」の測定値の計算方法を説明しています。
各検索結果には、UCSC ゲノム ブラウザへのリンクが提供され、ユーザーは染色体上のアラインメントを視覚化できます。これは、スタンドアロン BLAT よりも Web ベースの BLAT が優れている点です。ユーザーは、クエリが一致する可能性のある遺伝子に関する情報など、アラインメントに関連付けられた生物学的情報を取得できます。[9] また、ユーザーには、クエリ シーケンスとゲノム アセンブリのアラインメントを表示するためのリンクも提供されます。クエリとゲノム アセンブリの一致は青で、アラインメントの境界は明るい色で表示されます。これらのエクソン境界はスプライス サイトを示しています。[8] [9] 「I'm feeling lucky」検索結果では、ユーザーが選択した出力並べ替えオプションに基づいて、最初のクエリ シーケンスの最高スコアのアラインメントが返されます。[8]
スタンドアロン
スタンドアロンBLATはバッチ実行に適しており、WebベースのBLATよりも効率的です。インデックスのみをメモリに保存するWebベースのアプリケーションとは異なり、ゲノムをメモリに保存できるため、より効率的です。[1] [9]
ライセンス
BLAT のソースとコンパイル済みバイナリは、学術的および個人的使用のために無料で利用できます。スタンドアロン BLAT の商用ライセンスは、Kent Informatics, Inc. によって配布されています。
参照
- BLAST基本ローカルアライメント検索ツール
- 配列アライメントソフトウェア
参考文献
- ^ abcdefghijklmn Kent, W James (2002). 「BLAT - BLASTのようなアラインメントツール」.ゲノム研究. 12 (4): 656–664. doi : 10.1101/gr.229202. PMC 187518. PMID 11932250.
- ^ abc イメルフォート、マイケル(2009)。エドワーズ、D; スタジッチ、J; ハンセン、D(編)。バイオインフォマティクス:ツールとアプリケーション。ニューヨーク:シュプリンガー。pp. 19–20。ISBN 978-0-387-92737-4。
- ^ Needleman, SB; Wunsch, CD (1970). 「2つのタンパク質のアミノ酸配列の類似性の検索に適用可能な一般的な方法」. Journal of Molecular Biology . 48 (3): 443–53. doi :10.1016/0022-2836(70)90057-4. PMID 5420325.
- ^ Smith, TF; Waterman, MS (1981). 「共通分子サブシーケンスの識別」. Journal of Molecular Biology . 147 (1): 195–7. CiteSeerX 10.1.1.63.2897 . doi :10.1016/0022-2836(81)90087-5. PMID 7265238.
- ^ Altschul, SF; Gish, W; Miller, W; Myers, EW; Lipman, DJ (1990). 「基本的なローカルアラインメント検索ツール」. Journal of Molecular Biology . 215 (3): 403–10. doi :10.1016/S0022-2836(05)80360-2. PMID 2231712. S2CID 14441902.
- ^ Altschul, SF; Madden, TL; Schäffer, AA; Zhang, J; Zhang, Z; Miller, W; Lipman, DJ (1997). 「Gapped BLAST および PSI-BLAST: 新世代のタンパク質データベース検索プログラム」Nucleic Acids Research . 25 (17): 3389–402. doi :10.1093/nar/25.17.3389. PMC 146917 . PMID 9254694.
- ^ Baxevanis, Andreas D.; Ouellette, BF Francis (2001).バイオインフォマティクス: 遺伝子とタンパク質の分析の実践ガイド(第 2 版). ニューヨーク: Wiley-Interscience. pp. 187–214. ISBN 978-0-471-22392-4。
- ^ abcdefg UCSC ゲノムバイオインフォマティクスサイト
- ^ abcdefghijklmn Bhagwat, Medha; Young, Lynn; Robison, Rex R (2012年3月). BLATを使用した近縁ゲノムの配列類似性の検出. 10.8. 第10巻. pp. 10.8.1–10.8.24. doi :10.1002/0471250953.bi1008s37. ISBN 978-0-471-25095-1. PMC 4101998 . PMID 22389010.
{{cite book}}:|journal=無視されました (ヘルプ) - ^ abcde Ye, Shui Qing (2008).バイオインフォマティクス: 実践的アプローチ. ロンドン: Chapman & Hall. pp. 11–12. ISBN 978-1-58488-810-9。
- ^ ab Kuhn, RM; Haussler, D; Kent, WJ (2013). 「UCSCゲノムブラウザと関連ツール」.バイオインフォマティクスのブリーフィング. 14 (2): 144–61. doi :10.1093/bib/bbs038. PMC 3603215. PMID 22908213 .
- ^ Lobo, Ingrid. 「Basic Local Alignment Search Tool (BLAST)」。Nature Education 。 2013年10月15日閲覧。
- ^ Pevsner, J (2009).バイオインフォマティクスと機能ゲノミクス. ニュージャージー: John Wiley & Sons, Inc. pp. 166–167. ISBN 978-0-470-08585-1。
- ^ 「NCBI – GenBank: AACZ03015565.1」 。 2013年10月12日閲覧。
外部リンク
- UCSC BLATゲノム検索
- ケントインフォマティクス株式会社
- BLAT ソースコード
- BLAT FAQ — UCSC による
- BLAT Suite プログラムの仕様とユーザー ガイド
- ヒューマンBLAT検索
