
バイオインフォマティクスにおいて、配列ロゴは、ヌクレオチド( DNA / RNA鎖内)またはアミノ酸(タンパク質配列内)の配列保存をグラフィカルに表現したものです。 [1] 配列ロゴは、整列した配列のコレクションから作成され、配列のコンセンサス配列と多様性を表します。配列ロゴは、DNAのタンパク質結合部位やタンパク質の機能単位などの配列特性を表すために頻繁に使用されます。
概要
シーケンス ロゴは、各位置の文字のスタックで構成されます。文字の相対的なサイズは、シーケンス内での頻度を示します。文字の合計の高さは、位置の情報量をビット単位で表します。
ロゴ作成
配列ロゴを作成するには、関連する DNA、RNA、タンパク質配列、または共通の保存された結合部位を持つ DNA 配列を、最も保存されている部分が適切なアラインメントを作成するように配置します。次に、保存された複数の配列アラインメントから配列ロゴを作成できます。配列ロゴは、各位置で残基がどの程度保存されているかを示します。残基の数が多いほど、その位置での保存が優れているため、文字が大きくなります。同じ位置にある異なる残基は、その頻度に応じて拡大縮小されます。残基のスタック全体の高さは、ビットで測定された情報です。配列ロゴは、転写因子が結合する保存されたDNA 結合部位を表すために使用できます。
位置の情報量(y軸)は次のように表される: [2]
- アミノ酸の場合、
- 核酸の場合、
位置の不確実性(シャノンエントロピーと呼ばれることもある)はどこにあるか
ここで、は位置 における塩基またはアミノ酸の相対頻度であり、は文字の配置に対する小標本補正である。[2] [3]列内の文字の高さは次のように与えられる。
小サンプル補正の近似値は次のように表されます。
ここで、はヌクレオチドの場合は 4、アミノ酸の場合は 20、 はアライメント内の配列の数です。
コンセンサスロゴ
コンセンサス ロゴは、テキスト形式で埋め込むことができるシーケンス ロゴの簡略化されたバリエーションです。シーケンス ロゴと同様に、コンセンサス ロゴは、整列したタンパク質または DNA/RNA シーケンスのコレクションから作成され、シーケンス モチーフまたはシーケンス アラインメントの各位置の保存に関する情報を伝えます[1] [4] 。ただし、コンセンサス ロゴには保存情報のみが表示され、各位置の各ヌクレオチドまたはアミノ酸 の頻度情報は明示的には表示されません。各文字の相対頻度を示す複数の文字のスタックの代わりに、コンセンサス ロゴは、その位置のコンセンサス文字の高さを使用して各位置の保存の程度を表します。


利点と欠点
シーケンスロゴに対するコンセンサスロゴの主な、そして明らかな利点は、リッチテキストフォーマットをサポートするエディター/ビューアにテキストとして埋め込むことができ、したがって科学論文にも埋め込むことができることです。前述のように、コンセンサスロゴはシーケンスロゴとコンセンサスシーケンスの中間です。その結果、シーケンスロゴと比較すると、コンセンサスロゴには情報(モチーフ/アラインメント内のその位置の保存に対する各文字の相対的な貢献)が省略されています。したがって、可能な限りシーケンスロゴを優先的に使用する必要があります。そうは言っても、シーケンスロゴを表示するためにグラフィック図を含める必要があるため、コンセンサスシーケンスは保存と頻度の両方に関する情報を伝えることができないにもかかわらず、科学論文で使用され続けています。[5]したがって、モチーフ/アラインメント情報をテキストに制限する必要がある場合は、コンセンサスロゴはコンセンサスシーケンスよりも優れています。
拡張機能
隠れマルコフモデル(HMM)は、アラインメント内の位置の情報量だけでなく、挿入と削除の情報量も考慮します。Pfamが使用するHMMシーケンスロゴには、占有(存在)と挿入の頻度、および予想される挿入長を示すために3行が追加されています。[6]

参照
参考文献
- ^ ab Schneider TD; Stephens RM (1990). 「シーケンスロゴ: コンセンサス配列を表示する新しい方法」. Nucleic Acids Res . 18 (20): 6097–6100. doi : 10.1093/nar/18.20.6097. PMC 332411. PMID 2172928.
- ^ ab Schneider TD; Stormo GD (1986). 「ヌクレオチド配列上の結合部位の情報量」(PDF) . Journal of Molecular Biology . 188 (3): 415–431. doi :10.1016/0022-2836(86)90165-8. PMID 3525846.
- ^ Basharin GP (1959). 「一連の独立したランダム変数のエントロピーの統計的推定について」.確率論とその応用. 4 (3): 333–336. doi :10.1137/1104033.
- ^ Anzaldi LJ; Muñoz-Fernández D; Erill I. (2012). 「BioWord: Microsoft Word 用のシーケンス操作スイート」. BMC Bioinformatics . 13 (124): 124. doi : 10.1186/1471-2105-13-124 . PMC 3546851. PMID 22676326.
- ^ Schneider TD (2002). 「コンセンサスシーケンスZen」. Appl Bioinform . 1 (3): 111–119. PMC 1852464. PMID 15130839 .
- ^ Wheeler, Travis J; Clements, Jody; Finn, Robert D (2014 年 1 月 13 日). 「Skylign: 配列アラインメントとプロファイル隠れマルコフモデルを表す有益なインタラクティブロゴを作成するツール」. BMC Bioinformatics . 15 (1): 7. doi : 10.1186/1471-2105-15-7 . PMC 3893531. PMID 24410852 .
外部リンク
- シーケンスロゴの読み方。
- シーケンスロゴを作成するための推奨事項。
- Erill, I.、「転写因子結合部位の情報内容への簡単な入門」、Eprint
- シーケンスロゴとは何ですか?
