| ファイル名拡張子 | .bed |
|---|---|
| インターネットメディアの種類 | テキスト/プレーン |
| フォーマットの種類 | テキストファイル |
| Webサイト | https://samtools.github.io/hts-specs/BEDv1.pdf |
BED ( Browser Extensible Data ) 形式は、ゲノム領域を座標と関連する注釈として保存するために使用されるテキストファイル形式です。データは、スペースまたはタブで区切られた列の形式で表示されます。この形式は、ヒトゲノムプロジェクト[1]中に開発され、その後、他のシーケンスプロジェクトに採用されました。この使用が広まった結果、この形式は、正式な仕様が作成される前に、すでにバイオインフォマティクスの事実上の標準となっていました。
この形式の利点の 1 つは、ヌクレオチド配列の代わりに座標を操作することです。これにより、ゲノムの全体または一部を比較する際のパワーと計算時間が最適化されます。さらに、そのシンプルさにより、Python、Ruby、Perlなどのワードプロセッサやスクリプト言語、または BEDTools などのより専門的なツール を使用して、座標や注釈を簡単に操作および読み取り (または解析) できます。
歴史
20世紀末には、完全なゲノム配列を決定する最初のプロジェクトが登場しました。これらのプロジェクトの中で、ヒトゲノムプロジェクトは当時最も野心的で、初めて数ギガベースのゲノムを配列決定することを目指していました。これには、配列処理とその分析を自動化するために、配列決定センターで大規模な方法論の開発を行う必要がありました。そのため、FASTQ、[2]、GFF、BED [1]など、多くの形式が作成されました。ただし、当時は公式の仕様が公開されていなかったため、21世紀初頭に 配列決定プロジェクトが増加したときに、FASTQなどの一部の形式に影響を与えました。
ゲノムブラウザ内で広く使用されているため、この記述は多くのツールで使用されているため、この形式を比較的安定した方法で定義することが可能になりました。
形式
当初、BEDフォーマットには公式仕様はありませんでした。代わりに、 UCSCゲノムブラウザ[3]によって提供された説明が参考として広く使用されてきました。
正式なBED仕様[4]は、Global Alliance for Genomics and Healthの支援の下、2021年に[5]公開されました。
説明
BEDファイルは最低3つの列から構成され、オプションで9つの列を追加して合計12の列にすることができます。最初の3つの列には、染色体またはスキャフォールドの名前、検討対象の配列の開始座標と終了座標が含まれます。次の9つの列には、これらの配列に関連する注釈が含まれます。これらの列は、スペースまたはタブで区切る必要があります。プログラム間の互換性のため、タブの使用が推奨されています。[6]ファイルの各行には、同じ数の列が必要です。列の順序は尊重する必要があります。つまり、大きい数値の列を使用する場合は、中間の数値の列を埋める必要があります。
ヘッダ
BEDファイルにはオプションでヘッダーを含めることができます。ただし、ヘッダーの形式に関する公式の説明はありません。ヘッダーには1行以上の行が含まれ、機能的役割に応じて異なる単語や記号で示される場合もあれば、単に説明的な場合もあります[6]。したがって、ヘッダー行は次の単語または記号で始まることができます。
- 「ブラウザ」: UCSCゲノムブラウザが関連するオプションを設定するために使用する機能ヘッダー。
- 「トラック」:ゲノムブラウザが関連する表示オプションを指定するために使用する機能ヘッダー。
- 「#」: 各列の名前などのコメントを追加するための説明ヘッダー。
座標系
GFFなどの他の標準で使用される座標系とは異なり、BED形式で使用される座標系は、座標の開始がゼロベース、座標の終了が1ベースです。[6]したがって、ゲノム内の座標1のヌクレオチドは、列2では値0、列3では値1になります。
次の開始と終了を持つ 1000 ベースの BED 間隔:
chr7 0 1000
UCSC などのゲノム ブラウザーで使用される、次の 1 ベースの「ヒト」ゲノム座標に変換されます。
chr7 1 1000
この選択は、検討対象のゲノム領域の長さを計算する方法によって正当化されます。この計算は、終了座標 (列 3) を開始座標 (列 2) で単純に減算することに基づいています: 。座標系が最初の位置を指定するために 1 を使用することに基づいている場合、計算は少し複雑になります: 。このわずかな違いは、数千から数十万の行を含む データ セットが使用される場合、計算時間の点で比較的大きな影響を与える可能性があります。
あるいは、両方の座標をゼロベースと見なすこともできます。この場合、終了位置は含まれません。言い換えると、ゼロベースの終了位置は、フィーチャの後の最初の位置のインデックスを示します。上記の例では、ゼロベースの終了位置 1000 は、位置 0 から 999 までを含むフィーチャの後の最初の位置を示します。
例
以下に最小限の例を示します。
chr7 127471196 127472363 chr7 127472363 127473530 chr7 127473530 127474697
以下はUCSC Genome Browserの 9 つの列を持つ典型的な例です。最初の 3 行は UCSC Genome Browser の設定であり、BED 形式で指定されたデータとは無関係です。
ブラウザの位置 chr7:127471196-127495720 ブラウザ すべて非表示 トラック名="ItemRGBDemo" 説明="アイテム RGB デモ" visibility=2 itemRgb="オン" chr7 127471196 127472363 位置1 0 + 127471196 127472363 255,0,0 chr7 127472363 127473530 位置2 0 + 127472363 127473530 255,0,0 chr7 127473530 127474697 位置 3 0 + 127473530 127474697 255,0,0 chr7 127474697 127475864 位置4 0 + 127474697 127475864 255,0,0 chr7 127475864 127477031 負1 0 - 127475864 127477031 0,0,255 chr7 127477031 127478198 負2 0 - 127477031 127478198 0,0,255 chr7 127478198 127479365 負3 0 - 127478198 127479365 0,0,255 chr7 127479365 127480532 位置5 0 + 127479365 127480532 255,0,0 chr7 127480532 127481699 負4 0 - 127480532 127481699 0,0,255
ファイル拡張子
現在、BEDファイルには標準的なファイル拡張子はありませんが、「.bed」拡張子が最もよく使われています。列の数はファイル拡張子に記されている場合もあります。たとえば、「.bed3」、「.bed4」、「.bed6」、「.bed12」などです。[7]
使用法
新しいシーケンス技術の出現と、ますます大きなシーケンスファイルの操作により、 BED ファイルの使用が急速に広まりました。シーケンス自体を比較してゲノム シーケンスまたはゲノム全体を比較すると、すぐに大量の計算リソースが必要になり、時間がかかるようになります。BED ファイルを処理すると、座標を使用してシーケンス セットから目的のシーケンスを抽出したり、2 つの座標セットを直接比較して操作したりすることで、この作業がより効率的になります。
これらのタスクを実行するには、次のようなさまざまなプログラムを使用して BED ファイルを操作できます (ただし、これらに限定されません)。
- ゲノムブラウザ:BEDファイルから、現在配列決定されている哺乳類ゲノムの配列を視覚化および抽出することができます(例: UCSCゲノムブラウザのカスタムトラックの管理機能)。[3]
- Galaxy:ウェブベースのプラットフォーム。[7]
- コマンドラインツール:
- BEDTools: 座標セットの操作とBEDファイルからのシーケンスの抽出を可能にするプログラム。[6]
- BEDOPS: BEDファイルに対する高速ブール演算のためのツールスイート。[8]
- BedTk: 限定された特殊な操作のサブセットに対するBEDToolsのより高速な代替手段。[9]
- covtobed: BAMファイルをBEDカバレッジトラックに変換するツール。[10]
.genome ファイル
BEDtools は、.genomeファイルを使用して染色体の境界を決定し、パディング操作が染色体の境界を超えないようにします。ゲノム ファイルは、次に示すように、1 行のヘッダーを持つ 2 列のタブ区切りファイルとしてフォーマットされます。
クロムサイズ chr1 248956422 chr2 242193529 chr3 198295559 chr4 190214555 chr5 181538259 chr6 170805979 chr7 159345973 ...
参考文献
- ^ ab Kent, W. James; Sugnet, Charles W.; Furey, Terrence S.; Roskin, Krishna M.; Pringle, Tom H.; Zahler, Alan M.; Haussler, David (2002 年 6 月 1 日). 「UCSC のヒトゲノムブラウザ」.ゲノム研究. 12 (6): 996–1006. doi : 10.1101/gr.229102 . ISSN 1088-9051. PMC 186604. PMID 12045153 .
- ^ Cock, Peter JA; Fields, Christopher J.; Goto, Naohisa; Heuer, Michael L.; Rice, Peter M. (2010 年 4 月). 「品質スコア付きシーケンスの Sanger FASTQ ファイル形式と Solexa/Illumina FASTQ バリアント」. Nucleic Acids Research . 38 (6): 1767–1771. doi : 10.1093/nar/gkp1137 . ISSN 1362-4962. PMC 2847217. PMID 20015970 .
- ^ ab 「よくある質問: データファイル形式。BED 形式」。UCSC ゲノム ブラウザ。カリフォルニア大学サンタクルーズ校ゲノミクス研究所。2019年10 月 2 日閲覧。
- ^ 「ブラウザ拡張データ (BED) 形式」(PDF) . samtools.github.io .
- ^ 「GA4GH BED v1.0: 正式な標準規格がゲノム特性の基本ルールを設定」www.ga4gh.org . 2022-03-30.
- ^ abcd Quinlan, AR; Hall, IM (2010年9月21日). BEDToolsマニュアル(PDF) . 2019年10月3日閲覧。
- ^ ab 「データ型」。Galaxy Community Hub 。 2019年10月3日閲覧。
- ^ Neph, S; Kuehn, MS; Reynolds, AP; Haugen, E; Thurman, RE; Johnson, AK; Rynes, E; Maurano, MT; Vierstra, J; Thomas, S; Sandstrom, R; Humbert, R; Stamatoyannopoulos, JA (2012 年 7 月 15 日). 「BEDOPS: 高性能ゲノム特徴操作」.バイオインフォマティクス. 28 (14): 1919–20. doi : 10.1093/bioinformatics/bts277 . PMC 3389768. PMID 22576172 .
- ^ Li, Heng; Rong, Jiazhen (2021年6月9日). 「Bedtk: 暗黙の区間木による区間重複の検出」.バイオインフォマティクス. 37 (9): 1315–1316. doi :10.1093/bioinformatics/btaa827. PMC 8189672 .
- ^ Birolo, Giovanni; Telatin, Andrea (2020年3月6日). 「covtobed: BAMファイルからカバレッジトラックを抽出するシンプルで高速なツール」. Journal of Open Source Software . 5 (47): 2119. Bibcode :2020JOSS....5.2119B. doi : 10.21105/joss.02119 .
