非コードDNA(ncDNA)配列は、生物のDNAのうちタンパク質配列をコードし ない部分です。非コードDNAの一部は、機能的な非コードRNA分子(例えば、トランスファーRNA、マイクロRNA、piRNA、リボソームRNA、および調節RNA )に転写されます。非コードDNA部分のその他の機能領域には、遺伝子発現を制御する調節配列、足場結合領域、DNA複製起点、セントロメア、およびテロメアが含まれます。イントロン、偽遺伝子、遺伝子間DNA、トランスポゾンやウイルスの断片など、ほとんど機能しない非コード領域もあります。完全に機能しない領域はジャンクDNAと呼ばれます。
細菌では、コード領域がゲノムの 88% を占めるのが一般的です。[ 1 ]残りの 12% はタンパク質をコードしませんが、その多くはRNA 転写産物が機能する遺伝子(非コード遺伝子) や調節配列を介して生物学的機能を有しており、細菌ゲノムのほぼすべてが機能を持っていることを意味します。[ 1 ]真核生物のコード DNA の量は、真核生物のゲノムには原核生物には見られない大量の反復 DNA が含まれているため、通常はゲノムのごくわずかな割合です。ヒトゲノムには1~2% のコード DNA が含まれています。[ 2 ] [ 3 ]機能的なコードエクソンの数やヒトゲノムの総サイズについて議論があるため、正確な数はわかりません。これは、ヒトゲノムの 98~99% が非コード DNA で構成されており、これには非コード遺伝子や調節配列などの多くの機能要素が含まれていることを意味します。
真核生物のゲノムサイズは、近縁種間でも広範囲にわたって変化する可能性がある。この不可解な現象は、当初は「C値パラドックス」として知られており、「C」は半数体ゲノムサイズを指す。[ 4 ]このパラドックスは、ほとんどの差異が遺伝子の数ではなく、反復DNAの拡大と縮小によるものであることが発見されたことで解決された。一部の研究者は、この反復DNAの大部分はジャンクDNAであると推測した。ゲノムサイズの変化の理由はまだ解明されておらず、この問題はC値エニグマと呼ばれている。[ 5 ]
このことから、遺伝子の数は比較的一定であるため、複雑性の概念と相関しないように見えるという観察に至り、この問題はG 値のパラドックスと呼ばれています。[ 6 ]例えば、単細胞生物であるPolychaos dubium (以前はAmoeba dubiaとして知られていた) のゲノムには、ヒトの DNA の 200 倍以上の量が含まれていることが報告されています (つまり、6000 億対以上の塩基対に対し、ヒトでは 30 億強)。[ 7 ]トラフグTakifugu rubripes のゲノムはヒトのゲノムの約 8 分の 1 の大きさですが、同程度の数の遺伝子を持っているようです。遺伝子はトラフグのゲノムの約 30% を占め、コード DNA は約 10% です。 (非コードDNA=90%。)フグのゲノムサイズが小さいのは、イントロンの長さが短くなり、反復DNAが少なくなったためである。[ 8 ] [ 9 ]
タヌキモ科の植物であるUtricularia gibbaは、非常に小さな核ゲノム(100.7 Mb)を持っています。 [ 10 ] [ 11 ]おそらく、1,500 Mbのサイズの祖先ゲノムから進化したと考えられます。 [ 11 ]タヌキモのゲノムは他の植物とほぼ同じ数の遺伝子を持っていますが、コーディングDNAの総量はゲノムの約30%になります。 [ 10 ] [ 11 ]
ゲノムの残りの部分(70% は非コード DNA)は、他の植物種よりも短いプロモーターと調節配列で構成されています。 [ 10 ]遺伝子にはイントロンが含まれていますが、他の植物ゲノムのイントロンよりも少なく、サイズも小さくなっています。[ 10 ]リボソーム RNA 遺伝子の多くのコピーを含む非コード遺伝子があります。[ 11 ]予想どおり、ゲノムにはテロメア配列とセントロメアも含まれています。[ 11 ]他の真核生物に見られる反復 DNA の多くは、この系統が他の植物の系統から分岐して以来、タヌキモのゲノムから削除されています。タヌキモのゲノムの約 59% はトランスポゾン関連配列で構成されていますが、ゲノムが他のゲノムよりもはるかに小さいため、これはこの DNA の量の大幅な減少を表しています。[ 11 ] 2013年の原著論文の著者らは、動物の非コードDNAにおける追加の機能要素に関する主張は、植物ゲノムには当てはまらないようだと指摘している。[ 10 ]
ニューヨーク・タイムズの記事によると、この種の進化の過程で、「…役に立たない遺伝的ジャンクは排除され、必要なものだけが残された」とのことです。[ 12 ] バッファロー大学のビクター・アルバート氏によると、この植物はいわゆるジャンクDNAを排除することができ、「さまざまな細胞、器官、組織の種類、花を持つ完璧な多細胞植物を持つことができ、ジャンクなしでもそれができる。ジャンクは必要ない」とのことです。[ 13 ]
遺伝子には、タンパク質をコードする遺伝子と非コード遺伝子の2種類があります。[ 14 ]非コード遺伝子は非コードDNAの重要な部分であり、転移RNAとリボソームRNAの遺伝子が含まれます。これらの遺伝子は1960年代に発見されました。原核生物のゲノムには他の多くの非コードRNAの遺伝子が含まれていますが、非コードRNA遺伝子は真核生物でより一般的です。
真核生物における非コード遺伝子の典型的なクラスには、小型核RNA(snRNA)、小型核小体RNA(snoRNA)、マイクロRNA(miRNA)、短鎖干渉RNA(siRNA)、PIWI相互作用RNA(piRNA)、および長鎖非コードRNA (lncRNA)の遺伝子が含まれる。さらに、触媒RNAを生成する独自のRNA遺伝子も多数存在する。[ 15 ]
非コード遺伝子は原核生物のゲノムのわずか数パーセントを占めるにすぎないが[ 16 ]、真核生物のゲノムでははるかに高い割合を占める可能性がある[ 17 ] 。ヒトでは、非コード遺伝子はゲノムの少なくとも6%を占めており、これは主にリボソームRNA遺伝子が数百コピー存在するためである。タンパク質コード遺伝子はゲノムの約38%を占めており、これは遺伝子に大きなイントロンが含まれているため、コード領域よりもはるかに高い割合である。
ヒトゲノム中の非コード遺伝子の総数は議論の的となっている。非コード遺伝子は約5,000個しかないと考える科学者もいれば、10万個以上あると考える科学者もいる(非コードRNAに関する記事を参照)。この違いは主にlncRNA遺伝子の数に関する議論によるものである。[ 18 ]
プロモーターとは、遺伝子の5'末端付近にあるDNA断片で、転写が開始される場所です。RNAポリメラーゼが結合してRNA合成を開始する部位でもあります。すべての遺伝子には非コードプロモーターが存在します。
調節エレメントとは、近傍の遺伝子の転写を制御する部位のことである。これらはほぼ例外なく、転写因子がDNAに結合する配列であり、これらの転写因子は転写を活性化(活性化因子)するか、転写を抑制する(抑制因子)かのいずれかの働きをする。調節エレメントは1960年代に発見され、その一般的な特徴は1970年代に細菌やバクテリオファージにおける特定の転写因子の研究によって解明された。
プロモーターと調節配列は、非コードDNAの豊富なクラスを構成していますが、それらは主に比較的短い配列の集合体であるため、ゲノムのごく一部を占めるにすぎません。哺乳類のゲノムにおける調節DNAの正確な量は不明です。これは、偽の転写因子結合部位と機能的な結合部位を区別することが困難であるためです。典型的なDNA結合タンパク質の結合特性は1970年代に解明され、転写因子の生化学的特性から、ゲノムの大きい細胞では、結合部位の大部分は生物学的に機能しないと予測されます。
多くの調節配列はプロモーター付近、通常は遺伝子の転写開始部位の上流に位置します。一部は遺伝子内に存在し、ごく一部は転写終結部位の下流に位置しています。真核生物では、プロモーター領域からかなり離れた位置にある調節配列もいくつか存在します。一部の調節配列はエンハンサーまたはサイレンサーと呼ばれますが、他の転写因子結合部位と区別する厳密な定義はありません。[ 19 ] [ 20 ] [ 21 ] [ 22 ]

イントロンとは、遺伝子の一部で、前駆体RNA配列に転写されるものの、成熟RNAへの処理過程でRNAスプライシングによって最終的に除去される部分である。イントロンは、タンパク質をコードする遺伝子と非コード遺伝子の両方に存在する。原核生物にも存在するが、真核生物のゲノムではより一般的である。
グループ I およびグループ II イントロンは、存在する場合でもゲノムのごく一部しか占めません。スプライソソーム イントロン (図を参照) は真核生物にのみ存在し、ゲノムのかなりの割合を占める可能性があります。たとえば、ヒトでは、タンパク質コード遺伝子のイントロンがゲノムの 37% を占めています。これに約 1% のコード配列を加えると、タンパク質コード遺伝子はヒトゲノムの約 38% を占めることになります。非コード遺伝子の計算は、非コード遺伝子の総数についてかなりの議論があるため、より複雑ですが、明確に定義されている例のみを考慮すると、非コード遺伝子はゲノムの少なくとも 6% を占めることになります。[ 23 ] [ 2 ]
標準的な生化学および分子生物学の教科書では、mRNA の非コードヌクレオチドは遺伝子の 5' 末端と翻訳開始コドンの間に位置していると説明されています。これらの領域は 5' 非翻訳領域または 5'-UTR と呼ばれます。同様の領域は 3' 非翻訳領域 (3'-UTR) と呼ばれ、遺伝子の末端にあります。5'-UTR と 3'-UTR は細菌では非常に短いですが、真核生物では数百ヌクレオチドの長さになることがあります。これらには、翻訳の開始 (5'-UTR) と転写の終結 (3'-UTR) を制御する短い要素、および mRNA の安定性、プロセシング、および細胞のさまざまな領域へのターゲティングを制御する可能性のある調節要素が含まれています。[ 24 ] [ 25 ] [ 26 ]
DNA合成は、複製起点と呼ばれる特定の部位で開始されます。複製起点は、DNA複製機構が組み立てられ、DNAがほどかれてDNA合成が開始されるゲノム上の領域です。ほとんどの場合、複製は複製起点から両方向に進行します。
複製起点の主な特徴は、特定の開始タンパク質が結合する配列です。典型的な複製起点は、約 100 ~ 200 塩基対の DNA をカバーします。原核生物は染色体またはプラスミドごとに 1 つの複製起点を持ちますが、真核生物の染色体には通常複数の複製起点があります。ヒトゲノムには約 100,000 個の複製起点があり、これはゲノムの約 0.3% に相当します。[ 27 ] [ 28 ] [ 29 ]

セントロメアは、細胞分裂時に娘細胞に分配するために、新たに複製された染色体に紡錘糸が付着する部位です。真核生物の各染色体には、凝縮した中期染色体で狭窄した領域として観察される単一の機能的なセントロメアがあります。セントロメアDNAは、多数の反復DNA配列から構成されており、各セントロメアが数百万塩基対の長さになる可能性があるため、ゲノムのかなりの部分を占めることがよくあります。たとえば、ヒトでは、24個のセントロメアすべての配列が決定されており[ 31 ]、ゲノムの約6%を占めています。しかし、セントロメアDNAの総量は個人によってかなり異なるため、この非コードDNAのすべてが必須であるとは考えにくいです[ 32 ] 。セントロメアは、半世紀近く前から知られている機能的な非コードDNA配列のもう1つの例であり、コードDNAよりも豊富である可能性が高いです。
テロメアは染色体の末端にある反復DNA領域であり、 DNA複製中の染色体の劣化から保護する役割を果たします。最近の研究では、テロメアは自身の安定性を維持する機能も持っていることが示されています。テロメア反復配列含有RNA(TERRA)はテロメア由来の転写産物です。TERRAはテロメラーゼ活性を維持し、染色体の末端を長くすることが示されています。[ 33 ]
原核生物と真核生物のゲノムはどちらも、タンパク質に結合したDNAの大きなループに組織化されています。真核生物では、ループの基部は足場結合領域(SAR)と呼ばれ、RNA/タンパク質複合体を結合してループを安定化させるDNAの領域で構成されています。ヒトゲノムには約10万個のループがあり、各SARは約100 bpのDNAで構成されているため、SARに充てられるDNAの総量はヒトゲノムの約0.3%を占めます。[ 34 ]
偽遺伝子は、主に突然変異によって機能しなくなった元遺伝子ですが、機能遺伝子によって生成されたRNAから派生した不活性DNA配列(処理済み偽遺伝子)もこの用語で表されます。偽遺伝子は負の選択によって排除されるため、原核生物のゲノムにおける非コードDNAのごく一部にすぎません。しかし、一部の真核生物では、選択が偽遺伝子を排除するほど強力ではないため、偽遺伝子が蓄積することがあります(分子進化のほぼ中立説を参照)。
ヒトゲノムには、タンパク質をコードする遺伝子に由来する約15,000個の偽遺伝子と、非コード遺伝子に由来する未知の数が含まれています。[ 35 ]これらの偽遺伝子の多くは以前のイントロン配列を含んでいるため、ゲノムのかなりの部分(約5%)を占めている可能性があります。
偽遺伝子は定義上ジャンクDNAであり、ジャンクDNAに期待されるように中立的な速度で進化します。[ 36 ]一部の偽遺伝子は二次的に機能を獲得しており、このことから、ほとんどの偽遺伝子はまだ発見されていない機能を持っているためジャンクではないと推測する科学者もいます。[ 37 ]

トランスポゾンとレトロトランスポゾンは可動遺伝因子です。レトロトランスポゾンの反復配列は、長鎖散在反復配列(LINE)と短鎖散在反復配列(SINE)を含み、多くの種のゲノム配列の大部分を占めています。短鎖散在反復配列に分類されるAlu配列は、ヒトゲノムで最も豊富な可動因子です。SINEがいくつかのタンパク質コード遺伝子の転写制御を及ぼす例がいくつか見つかっています。[ 38 ] [ 39 ] [ 40 ]
内在性レトロウイルス配列は、レトロウイルスゲノムが生殖細胞のゲノムに逆転写された産物である。これらの逆転写された配列内の変異は、ウイルスゲノムを不活性化する可能性がある。[ 41 ]
ヒトゲノムの 8% 以上は、(主に分解された)内因性レトロウイルス配列で構成されており、レトロトランスポゾン由来であることが認識できる 42% 以上の割合の一部となっています。また、別の 3% はDNA トランスポゾンの残骸であることが特定できます。現在起源が説明されていないゲノムの残りの半分は、非常に昔(2 億年以上前)に活動していた転移因子に由来すると考えられており、ランダムな突然変異によって認識できなくなっています。[ 42 ]少なくとも 2 種類の植物のゲノムサイズの変動は、主にレトロトランスポゾン配列の結果です。[ 43 ] [ 44 ]
高度反復DNAは、短いDNA配列が何度も連続して(一つずつ)繰り返された構造をしています。反復配列の長さは通常2~10塩基対ですが、より長いものも知られています。高度反復DNAは原核生物ではまれですが、真核生物、特にゲノムサイズの大きい生物では一般的です。サテライトDNAと呼ばれることもあります。
高度に反復性の高い DNA の大部分はセントロメアとテロメアに存在し (上記参照)、そのほとんどは機能的であるが、一部は冗長である可能性がある。もう 1 つの重要な部分は、ATC などの単純な反復配列の短い断片からなる短いタンデム反復配列 (STR、マイクロサテライトとも呼ばれる) に存在する。ヒトゲノムには約 350,000 個の STR があり、平均長さが約 25 回でゲノム全体に散在している。[ 45 ] [ 46 ]
STR反復配列の数の変動は、それが遺伝子内に存在する場合、遺伝性疾患を引き起こす可能性がありますが、これらの領域のほとんどは機能しないジャンクDNAであり、反復配列の数は個人によって大きく異なります。そのため、これらの長さの違いはDNAフィンガープリンティングで広く利用されています。
ジャンクDNAとは、偽遺伝子やかつて活性だったトランスポゾンの断片など、生物学的に関連のある機能を持たないDNAのことです。細菌やウイルスのゲノムにはジャンクDNAがほとんどありません[ 47 ] [ 48 ]が、一部の真核生物のゲノムにはかなりの量のジャンクDNAが含まれている可能性があります[ 49 ] 。ヒトやゲノムの大きい他の種における非機能性DNAの正確な量は決定されておらず、科学文献ではかなりの議論があります[ 50 ] [ 51 ] 。
細菌ゲノムにおける非機能性DNAは、主に非コードDNAの遺伝子間領域に存在するが、真核生物ゲノムではイントロン内にも存在する。非コードDNAには機能性DNA要素が数多く存在し、非コードDNAをジャンクDNAと同一視するのは誤りである。
ゲノムワイド関連研究(GWAS)は、対立遺伝子と表現型や疾患などの観察可能な形質との間の関連性を特定します。関連性のほとんどは、一塩基多型(SNP)と調査対象の形質との間のものであり、これらのSNPのほとんどは非機能的なDNAに位置しています。関連性は、形質に関与するDNA領域をマッピングするのに役立つ連鎖を確立しますが、必ずしも疾患や表現型の違いを引き起こす変異を特定するものではありません。[ 52 ] [ 53 ] [ 54 ] [ 55 ] [ 56 ]
形質と密接に連鎖しているSNPは、原因となる変異を特定する可能性が最も高い。(この関連性は、強い連鎖不平衡と呼ばれる。)これらの多型の約12%はコーディング領域に存在し、約40%はイントロンに位置し、残りのほとんどは調節配列を含む遺伝子間領域に存在する。[ 53 ]