
位置重みマトリックス (PWM) は、位置固有重みマトリックス (PSWM)または位置固有スコアリング マトリックス (PSSM)とも呼ばれ、生物学的配列における モチーフ(パターン)の表現としてよく使用されます。
PWM は、機能的に関連していると考えられる整列した配列のセットから派生することが多く、計算モチーフの発見のための多くのソフトウェア ツールの重要な部分になっています。
背景
創造
シーケンスから位置確率行列への変換
PWM には、アルファベットの各シンボルに対して 1 行 ( DNA配列のヌクレオチドの場合は 4 行、タンパク質配列のアミノ酸の場合は 20 行)、パターン内の各位置に対して 1 列あります。PWM を構築する最初のステップでは、各位置での各ヌクレオチドの出現回数をカウントして、基本的な位置頻度マトリックス (PFM) を作成します。PFM から、各位置での以前のヌクレオチド数をシーケンスの数で割って値を正規化することで、位置確率マトリックス (PPM) を作成できます。正式には、長さlのN 個の整列したシーケンスのセットX が与えられた場合、PPM Mの要素は次のように計算されます。
ここで、i (1,..., N )、j (1,..., l )、k はアルファベットの記号の集合であり、I(a=k) はa =kの場合は 1、それ以外の場合は 0 となる指示関数です。
たとえば、次の DNA 配列があるとします。
対応する PFM は次のとおりです。
したがって、結果として得られるPPMは次のようになる。[1]
PPM と PWM はどちらも、パターン内の位置間の統計的独立性を前提としており、各位置の確率は他の位置とは独立して計算されます。上記の定義から、特定の位置の値の合計 (つまり、すべてのシンボルの合計) は 1 になります。したがって、各列は独立した多項分布と見なすことができます。これにより、各位置の関連する確率を乗算することで、PPM が与えられたシーケンスの確率を簡単に計算できます。たとえば、上記の PPM Mが与えられた場合のシーケンスS = GAGGTAAACの確率は次のように計算できます。
小さなデータセットに基づいてPPMを計算する場合、行列のエントリが0の値を持つことを避けるために、疑似カウント(またはラプラス推定量)がよく適用されます。[2]これは、PPMの各列にディリクレ分布を掛けることに相当し、新しいシーケンス(つまり、元のデータセットの一部ではなかったシーケンス)の確率を計算できます。上記の例では、疑似カウントがない場合、4番目の位置にGがなく、5番目の位置にTがないシーケンスは、他の位置に関係なく、確率が0になります。
位置確率行列から位置重み行列への変換
ほとんどの場合、PWM の要素は対数オッズとして計算されます。つまり、PPM の要素はバックグラウンド モデルを使用して次のように変換されます。
は、PWM(左)の要素、を計算する方法を示しています。最も単純な背景モデルでは、各文字がデータセット内で同じ頻度で出現すると想定しています。つまり、アルファベットのすべての記号の の値(ヌクレオチドの場合は 0.25、アミノ酸の場合は 0.05)です。この変換を上記の PPM Mに適用すると(疑似カウントは追加されません)、次のようになります。
マトリックスのエントリは、特に小さなデータセットを使用して M を構築する場合に、疑似カウントを追加する利点を明確に示しています。背景モデルは、各シンボルに等しい値を持つ必要はありません。たとえば、GC 含有量の高い生物を研究する場合、 CとGの値が増加し、それに応じてAとT の値が減少する場合があります。
PWM要素が対数尤度を使用して計算される場合、シーケンスのスコアは、PWMの各位置の関連値を(乗算するのではなく)加算することによって計算できます。シーケンススコアは、シーケンスがランダムシーケンスとどの程度異なるかを示します。シーケンスが機能サイトである確率とランダムサイトである確率が同じである場合、スコアは0です。機能サイトである可能性がランダムサイトである可能性よりも高い場合、スコアは0より大きくなり、機能サイトである可能性よりもランダムサイトである可能性の方が高い場合は0より小さくなります。[1]シーケンススコアは、物理的なフレームワークでは、そのシーケンスの結合エネルギーとして解釈することもできます。
情報内容
PWM の情報量( IC) は、特定の PWM が均一分布とどの程度異なるかを示すため、興味深い場合があります。
モチーフの特定の位置にある特定のシンボルを観察することによる 自己情報は次のとおりです。
PWM 内の特定の要素の予想される (平均) 自己情報は次のようになります。
最後に、PWM の IC は、各要素の予想される自己情報の合計になります。
多くの場合、各文字の確率が等しいと仮定するよりも、研究している配列の背景文字頻度で情報量を計算する方が有用です(例えば、好熱菌のDNAのGC含有量は65.3から70.8の範囲です[3]。したがって、ATATモチーフにはCCGGモチーフよりもはるかに多くの情報が含まれます)。したがって、情報量の式は次のようになります。
ここで、 は文字 の背景頻度です。これは、カルバック・ライブラー情報量または相対エントロピーに対応します。ただし、PSSMを使用してゲノム配列を検索する場合(以下を参照)、実際のゲノムではn-merが不均一に分布しているため、この均一な補正により、モチーフ内のさまざまな塩基の重要性が過大評価され、偽陽性の数が大幅に増加する可能性があることが示されています。[4]
用途
シーケンス内のPWMのヒットをスキャンするアルゴリズムは様々あります。1つの例は、ModuleMasterに実装されているMATCHアルゴリズム[5]です。 [6]ヌクレオチドとアミノ酸のPWM / PSSMを使用した高速データベース検索のためのより洗練されたアルゴリズムは、possumsearchソフトウェアに実装されています。[7]
基本的なPWM/PSSMでは挿入や削除を処理できません。各位置での挿入と削除の確率を追加したPSSMは隠れマルコフモデルとして解釈できます。これはPfamが使用したアプローチです。[8] [9]
参照
参考文献
- ^ ab Guigo, Roderic. 「位置特定スコアリングマトリックス入門」。bioinformatica.upf.edu 。2013年11月12日閲覧。
- ^ Nishida, K.; Frith, MC; Nakai, K. (2008 年 12 月 23 日). 「転写因子結合部位の擬似カウント」. Nucleic Acids Research . 37 (3): 939–944. doi :10.1093/nar/gkn1019. PMC 2647310. PMID 19106141 .
- ^ アレクサンドラシュキナ NI、エゴロワ LA (1978)。 「テルマス属の好熱性細菌の DNA のヌクレオチド構成」。微生物学。47 (2): 250-2。PMID 661633。
- ^ Erill I 、 O'Neill MC (2009)。「DNA結合部位同定 のための情報理論に基づく方法の再検討」。BMCバイオインフォマティクス。10 :57。doi : 10.1186/ 1471-2105-10-57。PMC 2680408。PMID 19210776。
- ^ Kel AE, et al. (2003). 「MATCHTM: DNA配列中の転写因子結合部位を検索するためのツール」. Nucleic Acids Research . 31 (13): 3576–3579. doi :10.1093/nar/gkg585. PMC 169193. PMID 12824369 .
- ^ ウルゾデク、クレメンス;シュレーダー、エイドリアン。ドレーゲル、アンドレアス;ヴァンケ、ディアーク。ベレンツェン、ケネス・W.クロンフェルド、マルセル。ハーター、クラウス。ゼル、アンドレアス(2009年10月9日)。 「ModuleMaster: 転写制御ネットワークを解読するための新しいツール」。バイオシステム。99 (1): 79–81。土井:10.1016/j.biosystems.2009.09.005。ISSN 0303-2647。PMID 19819296。
- ^ Beckstette, M.; et al. (2006). 「位置固有のスコアリングマトリックスをマッチングするための高速インデックスベースのアルゴリズムとソフトウェア」BMC Bioinformatics . 7 : 389. doi : 10.1186/1471-2105-7-389 . PMC 1635428 . PMID 16930469.
- ^ Kim, Seyoung; Chikina, Maria. 「PSC103 Spring 2016 / HMMs and biological sequence analysis」(PDF) . csb.pitt.edu . 2023年12月14日閲覧。
- ^ 「プロファイル隠れマルコフモデルとは何か?」Pfam。
外部リンク
- 3PFDB – 新しいデータマイニング手法を使用して生成された、タンパク質ファミリーの最も代表的な PSSM プロファイル (BRP) のデータベース。
- UGENE – PSS マトリックス設計、JASPAR、UniPROBE、SITECON データベースへの統合インターフェース。
