| ファイル名拡張子 | .sto、.stk |
|---|---|
| インターネットメディアの種類 | text/x-stockholm-alignment |
| 開発者 | エリック・ソンハマース |
| フォーマットの種類 | バイオインフォマティクス |
| オープンフォーマット? | はい |
| Webサイト | Sonnhammer.sbc.su.se/Stockholm.html |
ストックホルム形式は、タンパク質、RNA、DNA配列アライメントを配布するために、 Pfam、Rfam、Dfamで使用される多重配列アライメント形式です。 [1] [2] [3]アライメントエディタのRalee、[4] Belvu、Jalviewは、確率データベース検索ツールのInfernalとHMMER、系統解析ツールのXrateと同様にストックホルム形式をサポートしています。ストックホルム形式のファイルのファイル名拡張子は、多くの場合またはです。[5] .sto.stk
構文
適切に作成されたストックホルムファイルには、常に、フォーマットとバージョン識別子 (現在は ' ') を示すヘッダーが含まれます。ヘッダーの後には、マークアップ ( ## STOCKHOLM 1.0で始まる) とシーケンスが混在する複数の行が続きます。最後に、" " 行はアライメントの終了を示します。
//
マークアップなしの例は次のようになります。
# ストックホルム 1.0 #=GF IDの例 <seqname> <整列されたシーケンス> <seqname> <整列されたシーケンス> <seqname> <整列されたシーケンス> //
シーケンスは 1 行に 1 つずつ記述されます。シーケンス名が最初に記述され、任意の数の空白の後にシーケンスが記述されます。シーケンス名は通常、「name/start-end」または単に「name」の形式です。シーケンス文字には、空白以外の任意の文字を含めることができます。ギャップは、「.」または「-」で示されます。
マークアップ行は#で始まります。"パラメータ" は空白で区切られるため、1 列あたり 1 文字のマークアップにはスペースではなくアンダースコア ("_") を使用する必要があります。定義されているマークアップ タイプは次のとおりです。
#=GF <機能> <ファイルごとの一般的な注釈、フリーテキスト> #=GC <機能> <列ごとの汎用注釈、列ごとに正確に 1 文字> #=GS <seqname> <feature> <シーケンスごとの一般的な注釈、フリーテキスト> #=GR <seqname> <feature> <残基ごとの一般的な注釈、残基ごとに正確に 1 文字>
おすすめの機能
これらの機能名は、Pfam と Rfam によって特定の種類の注釈に使用されます。(「フィールドの説明」の Pfam と Rfam のドキュメントを参照してください)
#=GF
Pfam と Rfam は次のタグを使用できます。
必須フィールド:
------------------
AC アクセス番号: PFxxxxx (Pfam) または RFxxxxx (Rfam) 形式のアクセス番号。
ID 識別: 家族の名前を一言で表します。
DE 定義: 家族の簡単な説明。
AU 著者: エントリの著者。
SE シードのソース: シード メンバーが 1 つのファミリーに属していることを示唆するソース。
SS 構造のソース: Rfam で使用されるコンセンサス RNA 二次構造のソース (予測または出版物)。
BMビルド方法: モデルを生成するために使用するコマンドライン
SM検索方法: 検索を実行するために使用するコマンドライン
GA 収集しきい値: 完全なアライメントを構築するための検索しきい値。
TC 信頼カットオフ: 完全なアラインメント内で一致する最低のシーケンス スコア (および Pfam のドメイン スコア)。
NC ノイズ カットオフ: 完全なアライメントではない一致の最高シーケンス スコア (および Pfam のドメイン スコア)。
TP タイプ: ファミリーのタイプ (現在、Pfam の場合はファミリー、ドメイン、モチーフ、または繰り返し)。
-- Rfam の Gene、Intron、または Cis-reg のルートを持つツリー。
SQ シーケンス: アラインメント内のシーケンスの数。
オプションフィールド:
----------------
DC データベース コメント: データベース参照に関するコメント。
DR データベース参照: 外部データベースへの参照。
RC 参照コメント: 文献参照に関するコメント。
RN 参照番号: 参照番号。
RM Reference Medline: 8 桁の Medline UI 番号。
RT 参照タイトル: 参照タイトル。
RA 参照著者: 参照著者
RL 参照場所: ジャーナルの場所。
PI 以前の識別子: 以前のすべての ID 行の記録。
KW キーワード: キーワード。
CC コメント: コメント。
NE Pfam アクセッション: ネストされたドメインを示します。
NL の場所: ネストされたドメインの場所 - シーケンス ID、挿入の開始と終了。
WK Wikipediaリンク: Wikipediaページ
CL クラン: クラン加入
MBメンバーシップ: クランメンバーシップをリストするために使用されます
埋め込みツリーの場合:
----------------
NH ニューハンプシャー New Hampshire eXtended 形式のツリー。
TN ツリー ID 次のツリーの一意の識別子。
他の:
------
FR False Discovery Rate: ビットスコアの閾値を、
予想される偽陽性から真陽性まで。0 から 1 までの浮動小数点数。
CB キャリブレーション方法: モデルのキャリブレーションに使用するコマンド ライン (Rfam のみ、リリース 12.0 以降)
- 注: ツリーは複数の #=GF NH 行に格納される場合があります。
- 複数のツリーが同じファイルに保存されている場合、各ツリーの前に、一意のツリー識別子を持つ #=GF TN 行がなければなりません。 1 つのツリーだけが含まれている場合、#=GF TN 行は省略できます。
#=GS
Rfam と Pfam は次の機能を使用できます:
機能の説明
--------------------- -----------
AC <accession> アクセス番号
DE <フリーテキスト> 説明
DR <db>; <accession>; データベースリファレンス
OS <生物> 生物(種)
OC <clade> 生物の分類(clade など)
LO <look> 見た目(色など)
#=GR
機能説明マークアップ文字
------- ----------- --------------
SS RNA の二次構造 [.,;<>(){}[]AaBb.-_] --擬似結び目とさらなる構造マークアップをサポートします (WUSS ドキュメントを参照)
タンパク質の場合 [HGIEBTSCX]
SA 表面アクセシビリティ [0-9X]
(0=0%-10%; ...; 9=90%-100%)
TM トランスメンブレン [ミオ]
PP事後確率[0-9*]
(0=0.00-0.05; 1=0.05-0.15; *=0.95-1.00)
LIリガンド結合[*]
ASアクティブサイト[*]
pAS AS - Pfam予測値 [*]
sAS AS - SwissProtより[*]
IN INtron(以降)[0-2]
RNA三次相互作用の場合:
------------------------------
tWW WC/WC in trans 塩基対の場合: [<>AaBb...Zz] 非塩基対の場合: [.]
cWH WC/Hoogsteen シス
cWS WC/シュガーエッジ(シス)
tWS WC/SugarEdge の翻訳
注: (1) 一般的な形式は{c,t}{W,H,S}{W,H,S}。
(2)cWWはSSと同等である。
#=GC
有効な機能のリストには、以下に示す機能に加えて、#=GR と同じ機能に「コンセンサス」を意味する「_cons」が追加された機能が含まれます。例: 「SS_cons」。
機能説明説明
------- ----------- --------------
RF参照注釈コンセンサスRNAまたはタンパク質配列が参照として使用されることが多い
ギャップのない文字(例:x)はコンセンサス/保存/一致列を示すことができる
. または - は挿入列を示します
~は非整列挿入を示す
大文字と小文字は、強い保存性と弱い保存性を区別するために使用できます。
それぞれ残基
MMモデルマスクは、アライメント内のどの列をマスクするかを示します。
対応する一致状態の放出確率は
これらの列はバックグラウンド分布になります。
注記
- 同じ #=GC ラベルを持つ複数の行を使用しないでください。
- 単一のシーケンスの場合、同じ #=GR ラベルを持つ複数の行を使用しないでください。シーケンスごとに、一意の機能割り当てを 1 つだけ行うことができます。
- SA および SS の「X」は「構造が不明な残基」を意味します。
- タンパク質の SS 文字はDSSPから取られています: H=アルファヘリックス、G=3/10 ヘリックス、I=p ヘリックス、E=延長鎖、B=孤立した b ブリッジ内の残基、T=ターン、S=ベンド、C=コイル/ループ。
- RNA SS 文字は、WUSS (ワシントン大学二次構造) 表記法から取られています。一致するネストされた括弧文字 <>、()、[]、または {} は、塩基対を示します。記号 '.'、','、および ';' は、対になっていない領域を示します。一致する英語のアルファベットの大文字と小文字は、擬似ノット相互作用を示します。ノット内の 5' ヌクレオチドは大文字、3' ヌクレオチドは小文字にする必要があります。
推奨される配置
- #=GF アライメントの上
- #=GC アライメントの下
- #=GS アラインメントの上または対応する配列のすぐ下
- #=GR 対応するシーケンスのすぐ下
サイズ制限
どのフィールドにも明示的なサイズ制限はありません。ただし、固定フィールド サイズを使用する単純なパーサーは、次の制限内で Pfam および Rfam アラインメントで安全に動作するはずです。
- 行の長さ: 10000。
- <seqname>: 255。
- <機能>: 255。
例
ストックホルム形式の擬似ノットを用いたRfamアライメント(UPSK RNA)の簡単な例を以下に示します。[6]
# ストックホルム 1.0 #=GF ID UPSK #=GF SE 予測; 地獄 #=GF SS 公開済み; PMID 9223489 #=GFRN [1] #=GF RM 9223489 #=GF RT カブ黄色モザイクの3'末端における擬似結び目の役割 #=GF RTウイルスRNAは、ウイルスRNA依存性RNAによるマイナス鎖合成中 #=GF RTポリメラーゼ。 #=GF RA Deiman BA、Kortlever RM、Pleij CW; #=GFRLJウイルス1997;71:5990-5996. AF035635.1/619-641 ウガグウクックガウクククAAAAUCG M24804.1/82-104 ウガグウククアウククアアアウCG J04373.1/6212-6234 UAAGUUCUCGAUCUUUAAAAUCG M24803.1/1-23 UAAGUUCUCGAUCUCUCAAAAUCG #=GC SS_cons .AAA....<<<<aaa....>>>> //
以下は、Pfam CBSドメインを示す、もう少し複雑な例です。
# ストックホルム 1.0 #=GF ID CBS #=GFACPF00571 #=GF DE CBSドメイン #=GF AU ベイトマン A #=GF CC CBSドメインは主に細胞内に見られる小さなモジュールである #=GF CC はタンパク質内に 2 つまたは 4 つのコピーとして存在します。 #=GF スキル 5 #=GS O31698/18-71 AC O31698 #=GS O83071/192-246 AC O83071 #=GS O83071/259-312 AC O83071 #=GS O31698/88-139 AC O31698 #=GS O31698/88-139 OS 枯草菌 O83071/192-246 MTCRAQLIAVPRASSLAEAIACAQKMRVSRVPVYERS #=GR O83071/192-246 SA 9998877564535242525515252536463774777 O83071/259-312 MQHVSAPVFVFECTRLAYVQHKLRAHSRAVAIVLDEY #=GR O83071/259-312 SS CCCCCHHHHHHHHHHHHHEEEEEEEEEEEEEEEEEE O31698/18-71 MIEADKVAHVQVGNNLEHALLVLTKTGYTAIPVLDPS #=GR O31698/18-71 SS CCCHHHHHHHHHHHHHHHEEEEEEEEEEEEEEEEHHH O31698/88-139 EVMLTDIPRLHINDPIMKGFGMVINN..GFVCVENDE #=GR O31698/88-139 SS CCCCCCCHHHHHHHHHHHHEEEEEEEEEEEEEEEEEE #=GC SS_cons CCCCCHHHHHHHHHHHHHEEEEEEEEEEEEEEEEEE O31699/88-139 EVMLTDIPRLHINDPIMKGFGMVINN..GFVCVENDE #=GR O31699/88-139 AS ___*____________________ #=GR O31699/88-139 IN ____________1____________2______0____ //
参照
参考文献
- ^ Gardner PP、Daub J、Tate JG、Nawrocki EP、Kolbe DL、Lindgreen S、他 (2009 年 1 月)。「Rfam: RNA ファミリー データベースのアップデート」。Nucleic Acids Research。37 (データベース号): D136–D140。doi : 10.1093 / nar /gkn766。PMC 2686503。PMID 18953034。
- ^ Finn RD、Tate J、Mistry J、Coggill PC、Sammut SJ 、 Hotz HR、他 (2008 年 1 月)。「Pfam タンパク質ファミリー データベース」。核酸研究。36 ( データベース号): D281 – D288。doi :10.1093/ nar /gkm960。PMC 2238907。PMID 18039703。
- ^ Storer J、Hubley R、Rosen J、Wheeler TJ 、 Smit AF(2021年1月)。「転座因子ファミリー、 配列モデル、ゲノム注釈のDfamコミュニティリソース」。モバイルDNA。12(1):2。doi :10.1186 / s13100-020-00230 - y。PMC 7805219。PMID 33436076。
- ^ Griffiths-Jones S (2005年1月). 「RALEE--EmacsのRNAアライメントエディタ」.バイオインフォマティクス. 21 (2): 257–259. doi : 10.1093/bioinformatics/bth489 . PMID 15377506.
- ^ 「Alignment Fileformats」. 2019年5月22日. 2019年5月22日閲覧。
- ^ Deiman BA、Kortlever RM、Pleij CW (1997 年 8 月)。「ウイルス RNA 依存性 RNA ポリメラーゼによるマイナス鎖合成における、カブ黄色モザイクウイルス RNA の 3' 末端のシュードノットの役割」。Journal of Virology。71 ( 8 ): 5990–5996。doi : 10.1128 / JVI.71.8.5990-5996.1997。PMC 191855。PMID 9223489。
外部リンク
- エリック・ゾンハマーズによるストックホルム・フォーマットの定義
