遺伝子のコード領域は、コードDNA配列(CDS )とも呼ばれ、タンパク質をコードする遺伝子のDNAまたはRNAの部分です。[ 1 ]異なる種や時代におけるコード領域の長さ、構成、調節、スプライシング、構造、機能を非コード領域と比較して研究することで、原核生物と真核生物の遺伝子構成と進化に関する重要な情報を大量に得ることができます。[ 2 ]これは、ヒトゲノムのマッピングや遺伝子治療の開発にも役立ちます。[ 3 ]
この用語はエクソンと互換的に使用されることもありますが、厳密には同じものではありません。エクソンは、RNAのコード領域と3'および5'非翻訳領域から構成されるため、エクソンは部分的にコード領域から構成されます。タンパク質をコードしないRNAの3'および5'非翻訳領域は非コード領域と呼ばれ、このページでは説明しません。[ 4 ]
コーディング領域とエクソームはしばしば混同されますが、これらの用語には明確な違いがあります。エクソームはゲノム内のすべてのエクソンを指すのに対し、コーディング領域はDNA(または一次転写産物)の一部、あるいは特定の種類のタンパク質をコードする処理済みmRNAの特定の部分を指します。
1978年、ウォルター・ギルバートは「遺伝子はなぜ断片化されているのか」を出版し、遺伝子はモザイクであるという考え、つまり各核酸鎖は連続的にコード化されているのではなく、「サイレント」な非コード領域によって中断されているという考えを初めて探求し始めた。これは、タンパク質をコードするゲノムの部分(現在ではコーディング領域と呼ばれている)とそうでない部分を区別する必要があることを初めて示唆した。[ 5 ]

証拠は、塩基組成パターンとコーディング領域の利用可能性の間に一般的な相互依存関係があることを示唆している。[ 6 ]コーディング領域は、非コーディング領域よりもGC含有量が高いと考えられている。コーディング鎖が長いほどGC含有量が高くなることが発見されたさらなる研究がある。短いコーディング鎖は、TAG、TAA、TGAなどの翻訳終止コドンの塩基組成のGC含有量が低いのと同様に、比較的GC含有量が低い。 [ 7 ]
GCリッチ領域では、点突然変異の比率もわずかに変化します。プリンからプリンまたはピリミジンからピリミジンへの変化であるトランジションが、プリンからピリミジンまたはピリミジンからプリンへの変化であるトランスバージョンよりも多くなります。トランジションはコードされるアミノ酸を変化させる可能性が低く、サイレント突然変異のままです(特にコドンの3番目のヌクレオチドで発生する場合)。これは通常、翻訳とタンパク質形成中に生物にとって有益です。[ 8 ]
これは、必須コーディング領域(遺伝子が豊富な領域)は、補助領域や非必須領域(遺伝子が乏しい領域)に比べてGC含量が高く、より安定していて変異に強いことを示している。 [ 9 ]しかし、これが中立的でランダムな変異によるものか、選択のパターンによるものかはまだ不明である。[ 10 ]また、GC含量とコーディング領域の関係を確かめるために用いられる遺伝子ウィンドウなどの方法が正確で偏りがないかどうかも議論されている。[ 11 ]


DNAでは、コード領域は鋳型鎖の5'末端にあるプロモーター配列と3'末端にある終結配列に挟まれています。転写中、RNAポリメラーゼ(RNAP)はプロモーター配列に結合し、鋳型鎖に沿ってコード領域まで移動します。RNAPは、コード領域に相補的なRNAヌクレオチドを付加してmRNAを形成し、チミンの代わりにウラシルを置換します。[ 12 ]これは、RNAPが終結配列に到達するまで続きます。[ 12 ]
転写と成熟の後、形成された成熟mRNAは、最終的にタンパク質に翻訳されるために重要な複数の部分を含んでいます。mRNAのコード領域は、 5'非翻訳領域(5'-UTR)と3'非翻訳領域(3'-UTR)[ 1 ] 、 5'キャップ、およびポリAテールによって挟まれています。翻訳中、リボソームはtRNAをコード領域に3ヌクレオチドずつ(コドン)結合させます。[ 13 ] tRNAは、結合したアミノ酸を成長中のポリペプチド鎖に転送し、最終的に最初のDNAコード領域で定義されたタンパク質を形成します。

遺伝子発現を制御するために、コード領域を改変することができる。
アルキル化は、コード領域の調節の一形態である。[ 15 ]転写されるはずだった遺伝子は、特定の配列を標的にすることでサイレンシングされる。この配列の塩基はアルキル基でブロックされ、サイレンシング効果が生じる。[ 16 ]
遺伝子発現の調節は細胞内で作られるRNAやタンパク質の量を制御するが、これらのメカニズムの調節はDNA鎖のオープンリーディングフレームの開始前に存在する調節配列によって制御される。調節配列は、タンパク質コード領域の発現が起こる場所と時間を決定する。[ 17 ]
RNAスプライシングは最終的に配列のどの部分が翻訳され発現されるかを決定し、このプロセスにはイントロンの切り出しとエクソンの結合が含まれます。しかし、RNAスプライソソームが切断する場所は、スプライス部位、特にスプライシングの最初のステップの基質の1つである5'スプライシング部位の認識によって誘導されます。 [ 18 ]コーディング領域はエクソン内にあり、エクソンは共有結合して成熟メッセンジャーRNAを形成します。
遺伝子コード領域の変異は、生物の表現型に非常に多様な影響を与える可能性がある。DNA/RNAのこの領域における変異の中には、有利な変化をもたらすものもあれば、有害で、場合によっては生物の生存にとって致命的なものもある。一方、非コード領域の変化は、必ずしも表現型に目に見える変化をもたらすとは限らない。

コーディング領域では、さまざまな形態の突然変異が発生する可能性があります。その1つはサイレント突然変異で、ヌクレオチドの変化が転写と翻訳後のアミノ酸の変化を引き起こしません。[ 20 ]また、ナンセンス突然変異も存在し、コーディング領域の塩基の変化が早期終止コドンをコードし、より短い最終タンパク質を生成します。翻訳中に異なるアミノ酸をコードする、コーディング領域の単一塩基対の変化である点突然変異は、ミスセンス突然変異と呼ばれます。その他のタイプの突然変異には、挿入や欠失などのフレームシフト突然変異が含まれます。[ 20 ]
突然変異には遺伝性のもの(生殖細胞系列突然変異)があり、親から子に受け継がれます。[ 21 ]このような突然変異したコード領域は、生物のすべての細胞に存在します。その他の突然変異は、生物の生涯を通じて獲得されるもの(体細胞突然変異)であり、細胞ごとに一定ではない場合があります。[ 21 ]これらの変化は、変異原、発がん物質、またはその他の環境因子(例:紫外線)によって引き起こされる可能性があります。獲得突然変異は、 DNA複製中のコピーエラーの結果であることもあり、子孫には受け継がれません。コード領域の変化は、de novo (新規)である場合もあります。このような変化は、受精直後に起こると考えられており、精子と卵子の両方には存在しない突然変異が子孫のDNAに存在することになります。[ 21 ]
コーディング領域の有害な突然変異による致死を防ぐための転写および翻訳メカニズムが複数存在する。そのような対策には、複製中の一部のDNAポリメラーゼによる校正、複製後のミスマッチ修復[ 22 ] 、およびmRNAコドン内の3番目の塩基の縮重を説明する「ウォブル仮説」 [ 23 ]などがある。
個人のゲノムは、他の個体のゲノムと比較すると大きな違いがあることはよく知られているが、最近の研究では、一部のコーディング領域は、同じ種の個体間で高度に制約されている、つまり変異に抵抗性があることがわかった。これは、保存された配列における種間制約の概念に似ている。研究者らは、これらの高度に制約された配列を制約コーディング領域(CCR)と名付け、このような領域が高度な浄化選択に関与している可能性があることも発見した。平均すると、7つのコーディング塩基ごとに約1つのタンパク質変化変異があるが、一部のCCRは、タンパク質変化変異が観察されない配列に100塩基以上を持ち、同義変異さえもないものもある。[ 24 ]ゲノム間のこのような制約のパターンは、まれな発達障害や、場合によっては胚致死の原因の手がかりとなる可能性がある。 CCRにおける臨床的に検証された変異体およびde novo変異は、これまで乳児てんかん性脳症、発達遅延、重度の心臓疾患などの疾患と関連付けられてきた。[ 24 ]

DNA配列内のオープンリーディングフレームの同定は簡単ですが、コーディング配列の同定は簡単ではありません。なぜなら、細胞はすべてのオープンリーディングフレームのごく一部しかタンパク質に翻訳しないからです。 [ 26 ]現在、CDS予測は細胞からのmRNAのサンプリングとシーケンスを使用していますが、特定のmRNAのどの部分が実際にタンパク質に翻訳されるかを決定するという問題がまだ残っています。CDS予測は遺伝子予測のサブセットであり、後者にはタンパク質だけでなくRNA遺伝子や調節配列などの他の機能要素もコードするDNA配列の予測も含まれます。
原核生物と真核生物の両方において、遺伝子の重複は、利用可能なコード領域からさまざまなタンパク質を生成する能力を維持しながらゲノムサイズを縮小するという進化上の利点として、DNA ウイルスと RNA ウイルスの両方で比較的頻繁に発生します。[ 27 ] [ 28 ] DNA と RNA の両方について、ペアワイズ アライメントは、ウイルスの短いオープン リーディング フレームを含む重複するコード領域を検出できますが、潜在的な重複コード鎖と比較するための既知のコード鎖が必要になります。[ 29 ]単一のゲノム配列を使用する別の方法では、比較を実行するために複数のゲノム配列は必要ありませんが、感度を上げるには少なくとも 50 ヌクレオチドの重複が必要です。[ 30 ]
{{cite book}}:|journal=無視されました (ヘルプ){{citation}}: CS1 maint: 数値名: 著者リスト (リンク)