

核酸配列とは、 DNA(GACTを使用)またはRNA (GACUを使用)分子内の対立遺伝子を形成するヌクレオチド内の塩基の連続です。この連続は、ヌクレオチドの順序を示す5種類の異なる文字の系列で表されます。慣例として、配列は通常5'末端から3'末端の順で示されます。二重らせん構造を持つDNAの場合、表記される配列には2つの方向があり、そのうちセンス鎖が使用されます。核酸は通常、線状(分岐のない)ポリマーであるため、配列を指定することは、分子全体の共有結合構造を定義することと同等です。このため、核酸配列は一次構造とも呼ばれます。
この配列は遺伝情報を表しています。生物学的デオキシリボ核酸は、生物の機能を指示する情報を表しています。
核酸には二次構造と三次構造も存在する。一次構造は「一次配列」と誤って呼ばれることがあるが、二次配列や三次配列といった概念は存在しない。

核酸は、ヌクレオチドと呼ばれる連結単位の鎖から構成されています。各ヌクレオチドは3つのサブユニットから成り立っています。リン酸基と糖(RNAの場合はリボース、DNAの場合はデオキシリボース)が核酸鎖の骨格を形成し、その糖に一連の核酸塩基のいずれかが結合しています。核酸塩基は、鎖の塩基対形成において重要な役割を果たし、有名な二重らせん構造などの高次二次構造や三次構造を形成します。
使用可能な文字はA、C、G、Tで、これらはDNA 鎖の4 つのヌクレオチド塩基(アデニン、シトシン、グアニン、チミン)を表し、ホスホジエステル骨格に共有結合しています。典型的な場合、配列はギャップなく隣接して印刷され、配列 AAAGTCTGAC は5' から 3' の方向に左から右に読みます。転写に関して言えば、配列が転写された RNA と同じ順序である場合、その配列はコード鎖上にあると言えます。
ある配列が別の配列と相補的であるということは、それぞれの配列の各位置の塩基が相補的(AとT、CとGなど)で、かつ逆順になっていることを意味します。例えば、TTACの相補配列はGTAAです。二本鎖DNAの一方の鎖をセンス鎖とすると、もう一方の鎖(アンチセンス鎖)はセンス鎖と相補的な配列を持つことになります。
A、T、C、Gは特定の位置にあるヌクレオチドを表しますが、その位置に複数の種類のヌクレオチドが存在する可能性がある場合に使用される曖昧さを表す文字もあります。国際純正・応用化学連合(IUPAC)の規則は次のとおりです。[ 1 ]
例えば、Wは、その位置にアデニンまたはチミンのどちらが存在しても、配列の機能性が損なわれないことを意味する。
これらの記号はRNAにも適用できますが、T(チミン)の代わりにU(ウラシル)が使用されます。[ 1 ]
DNAとRNAには、アデニン(A)、シトシン(C)、グアニン(G)、チミン(T)、ウラシル(U)の他に、核酸鎖が形成された後に修飾された塩基も含まれています。DNAでは、最も一般的な修飾塩基は5-メチルシチジン(m5C)です。RNAには、シュードウリジン(Ψ)、ジヒドロウリジン(D)、イノシン(I)、リボチミジン(rT) 、 7-メチルグアノシン(m7G)など、多くの修飾塩基があります。[ 3 ] [ 4 ]ヒポキサンチンとキサンチンは、変異原の存在によって生成される多くの塩基のうちの2つで、どちらも脱アミノ化(アミン基がカルボニル基に置換される)によって生成されます。ヒポキサンチンはアデニンから生成され、キサンチンはグアニンから生成されます。[ 5 ]同様に、シトシンの脱アミノ化によってウラシルが生成されます。
2つの10ヌクレオチド配列を並べて、違いを比較します。DNA塩基間の違いの数をヌクレオチドの総数で割って、パーセント差を計算します。この場合、10ヌクレオチド配列には3つの違いがあります。したがって、30%の差があります。

生物系において、核酸は生細胞が特定のタンパク質を構築するために利用する情報を含んでいる。核酸鎖上の塩基配列は、細胞の機構によってタンパク質鎖を構成するアミノ酸配列へと翻訳される。3つの塩基のグループはコドンと呼ばれ、それぞれが1つのアミノ酸に対応し、3つの塩基のあらゆる組み合わせが特定のアミノ酸に対応する特定の遺伝暗号が存在する。
分子生物学の中心教義は、核酸に含まれる情報を用いてタンパク質が構築されるメカニズムを概説している。DNAはmRNA分子に転写され、リボソームへと移動し、そこでmRNAはタンパク質鎖構築の鋳型として用いられる。核酸は相補的な配列を持つ分子と結合できるため、タンパク質をコードする「センス」配列と、それ自体は機能を持たないがセンス鎖に結合できる相補的な「アンチセンス」配列とが区別される。

DNAシーケンシングとは、特定のDNA断片のヌクレオチド配列を決定するプロセスです。生物のDNA配列は、その生物が生存し繁殖するために必要な情報を符号化しています。したがって、配列の決定は、生物がなぜ、どのように生きるのかという基礎研究だけでなく、応用分野においても有用です。生物にとってDNAは非常に重要であるため、DNA配列の知識は、事実上あらゆる生物学的研究において有用となる可能性があります。例えば、医学においては、遺伝性疾患の特定、診断、そして将来的な治療法の開発に利用できます。同様に、病原体の研究は、伝染病の治療法につながる可能性があります。バイオテクノロジーは急速に発展している分野であり、多くの有用な製品やサービスを生み出す可能性を秘めています。
RNAは直接配列決定されません。代わりに、逆転写酵素によってDNAにコピーされ、そのDNAが配列決定されます。
現在のシーケンス解析法はDNAポリメラーゼの識別能力に依存しているため、4種類の塩基しか識別できません。イノシン(RNA編集時にアデノシンから生成される)はGとして読み取られ、5-メチルシトシン(DNAメチル化によってシトシンから生成される)はCとして読み取られます。現在の技術では、信号が弱すぎて測定できないため、少量のDNAのシーケンス解析は困難です。この問題は、ポリメラーゼ連鎖反応(PCR)増幅によって克服されます。

生物から核酸配列が取得されると、それはデジタル形式でコンピュータ上に保存されます。デジタル遺伝子配列は、配列データベースに保存したり、解析したり(下記の「配列解析」を参照)、デジタル的に改変したり、人工遺伝子合成を用いて新しい実際のDNAを作成するためのテンプレートとして使用したりすることができます。
デジタル遺伝子配列は、バイオインフォマティクスのツールを用いて解析され、その機能を解明しようとする試みが行われる。
生物のゲノムに含まれるDNAを分析することで、遺伝性疾患に対する脆弱性を診断できるほか、子供の父(遺伝上の父親)や個人の祖先を特定するためにも使用できます。通常、人はそれぞれ、母親から受け継いだものと父親から受け継いだものの2種類の遺伝子変異を持っています。ヒトゲノムには約2万~2万5千個の遺伝子が含まれていると考えられています。染色体を個々の遺伝子レベルで研究することに加え、より広い意味での遺伝子検査には、遺伝性疾患の可能性や、遺伝性疾患の発症リスクを高める遺伝子の変異型の存在を調べる生化学的検査も含まれます。
遺伝子検査は、染色体、遺伝子、またはタンパク質の変化を特定します。[ 6 ]通常、検査は遺伝性疾患に関連する変化を見つけるために使用されます。遺伝子検査の結果は、疑われる遺伝性疾患を確認または否定したり、遺伝性疾患を発症または伝達する可能性を判断するのに役立ちます。現在、数百の遺伝子検査が使用されており、さらに多くの検査が開発されています。[ 7 ] [ 8 ]
バイオインフォマティクスでは、配列アライメントは、 DNA、RNA、またはタンパク質の配列を並べて、配列間の機能的、構造的、または進化的関係に起因する可能性のある類似領域を特定する方法です。 [ 9 ]アライメント内の 2 つの配列が共通の祖先を共有する場合、ミスマッチは、互いに分岐してからの期間に一方または両方の系統で導入された点突然変異、ギャップは挿入または欠失突然変異(インデル)として解釈できます。タンパク質の配列アライメントでは、配列内の特定の位置を占めるアミノ酸間の類似性の程度は、特定の領域または配列モチーフが系統間でどの程度保存されているかの概算尺度として解釈できます。配列の特定の領域に置換がない、または非常に保存的な置換 (つまり、側鎖が類似した生化学的特性を持つアミノ酸の置換) のみが存在する場合、この領域が構造的または機能的に重要であることを示唆します。 [ 10 ] DNAとRNAのヌクレオチド塩基はアミノ酸よりも互いに類似しているが、塩基対の保存は同様の機能的または構造的役割を示している可能性がある。[ 11 ]
計算系統学では、系統樹の構築と解釈において配列アライメントが広く利用されており、これは、異なる種のゲノムに存在する相同遺伝子間の進化関係を分類するために使用されます。クエリセット内の配列の相違の程度は、配列間の進化距離と質的に関連しています。大まかに言えば、配列の同一性が高いほど、問題の配列は比較的若い最近共通祖先を持つことを示唆し、同一性が低いほど、分岐がより古いことを示唆します。この近似は、進化変化の速度がほぼ一定であるという仮説に基づいて、2つの遺伝子が最初に分岐してから経過した時間(つまり、合祖時間)を推定できるという「分子時計」仮説を反映しており、突然変異と選択の影響が配列系統全体で一定であると仮定しています。したがって、生物や種間のDNA修復速度の差異や、配列内の特定領域の機能的保存の可能性は考慮されていません。 (ヌクレオチド配列の場合、分子時計仮説の最も基本的な形では、特定のコドンの意味を変えないサイレント変異と、タンパク質に異なるアミノ酸が組み込まれる結果となる他の変異との間の受容率の差も無視している。)より統計的に正確な方法では、系統樹の各枝における進化速度が変化することを認め、それによって遺伝子の合体時間のより正確な推定値が得られる。
一次構造には、機能的に重要なモチーフがコードされていることが多い。配列モチーフの例としては、snoRNAのC/D ボックス[ 12 ]およびH / ACAボックス[ 13 ] 、 U1、U2、U4、U5、U6、U12、U3などのスプライソソームRNAに見られるSm結合部位、シャイン・ダルガノ配列[ 14 ]、コザックコンセンサス配列[ 15 ] 、RNAポリメラーゼIIIターミネーター[ 16 ]などがある。
バイオインフォマティクスでは、配列エントロピー(配列複雑性または情報プロファイルとも呼ばれる)[ 17 ]は、処理の方向に関係なく、DNA配列の局所的な複雑性を定量的に測定する数値シーケンスです。情報プロファイルの操作により、モチーフや再配置の検出など、アライメントフリーの手法を使用して配列を分析できます。[ 17 ] [ 18 ] [ 19 ]