分子生物学およびバイオインフォマティクスにおいて、コンセンサス配列(または標準配列)とは、配列アライメントの各位置で見つかった最も頻繁に出現する残基(ヌクレオチドまたはアミノ酸)の計算された配列のことです。これは、関連する配列同士を比較し、類似の配列モチーフを計算する多重配列アライメントの結果を表します。このような情報は、 RNAポリメラーゼなどの配列依存性酵素を検討する際に重要です。[ 1 ]
コンセンサス配列の限界(位置ごとに1つの残基に変動性を制限する)に対処するため、配列ロゴは整列された配列のより豊かな視覚的表現を提供する。ロゴは各位置を文字(ヌクレオチドまたはアミノ酸)のスタックとして表示し、文字の高さは整列におけるその頻度に対応し、スタック全体の高さは情報量(ビット単位で測定)を反映する。最も頻繁に出現する残基がスタックの最上部に表示され、コンセンサスを維持しながら、機能的に重要だが出現頻度の低い残基(代替開始コドンや転写因子結合部位など)といった微妙なパターンも明らかにする。 [ 2 ]

コンセンサス配列で表されるタンパク質結合部位は、ゲノム中に複数回出現し、異なる位置でも同じ役割を果たすと考えられている短いヌクレオチド配列である。例えば、多くの転写因子は、制御する遺伝子のプロモーター領域にある特定のパターンを認識する。同様に、制限酵素は通常、回文構造のコンセンサス配列を持ち、これは通常、DNAを切断する部位に対応する。トランスポゾンも、転移の標的配列を識別する際に、ほぼ同じように機能する。最後に、スプライス部位(エクソンとイントロンの境界を囲む配列)もコンセンサス配列とみなすことができる。
したがって、コンセンサス配列は推定DNA結合部位のモデルであり、特定の認識部位の既知の例をすべて整列させることによって得られ、各位置で優勢な塩基を表す理想化された配列として定義されます。実際の例はすべて、コンセンサス配列と数個の置換以上異なるべきではありませんが、このようにミスマッチを数えると矛盾が生じる可能性があります。[ 3 ]
コアプロモーター配列中の変異ヌクレオチドがコンセンサス配列により近い構造になるような変異は、アップ変異と呼ばれます。この種の変異は一般的にプロモーターを強化し、RNAポリメラーゼが転写したいDNAに強く結合するため、転写が促進されます。一方、コンセンサス配列中の保存されたヌクレオチドを破壊する変異は、ダウン変異と呼ばれます。これらの変異は、RNAポリメラーゼがコアプロモーター配列に強く結合できなくなるため、転写を抑制します。
パターン認識ソフトウェアの開発は、遺伝学、分子生物学、バイオインフォマティクスにおける主要な研究テーマである。特定の配列モチーフは、生合成を制御する調節配列として、あるいは分子を細胞内の特定の部位に誘導したり成熟を調節したりするシグナル配列として機能する。これらの配列の調節機能は重要であるため、長期間の進化を通じて保存されていると考えられている。場合によっては、これらの部位の保存度合いによって進化的な関連性を推定できる。
保存された配列モチーフはコンセンサス配列と呼ばれ、どの残基が保存され、どの残基が可変であるかを示します。次のDNA配列の例を考えてみましょう。
この表記では、A はその位置に常に A が存在することを意味します。[CT] は C または T のいずれかを表します。N は任意の塩基を表します。{A} は A 以外の任意の塩基を表します。Y は任意のピリミジンを表し、R は任意のプリンを表します。この例では、表記 [CT] はその位置に C または T が出現する相対頻度を示しません。また、これを ACNCCA のような単一のコンセンサス配列として記述することはできません。コンセンサス配列を表す別の方法として、シーケンス ロゴを使用します。これはコンセンサス配列のグラフィカルな表現であり、シンボルのサイズは特定のヌクレオチド (またはアミノ酸) が特定の位置に出現する頻度に関連しています。シーケンス ロゴでは、残基の保存性が高いほど、その残基のシンボルは大きくなり、頻度が低いほどシンボルは小さくなります。配列ロゴは、 WebLogoまたはシステム生物学研究所の Gustavo Glusman が作成した公開されている視覚化ツールであるGestalt Workbenchを使用して生成できます。[ 3 ]
バイオインフォマティクスツールは、コンセンサス配列を計算し、視覚化することができる。ツールの例としては、JalViewやUGENEなどが挙げられる。