
分子生物学と遺伝学の分野では、ゲノムとは生物のすべての遺伝情報のことです。これは、DNA(またはRNAウイルスの場合はRNA )のヌクレオチド配列から構成されています。核ゲノムには、タンパク質をコードする遺伝子と非コード遺伝子、調節配列などのゲノムの他の機能領域(非コードDNAを参照)、そして多くの場合、明らかな機能を持たないジャンクDNAのかなりの部分が含まれています。[ 1 ] [ 2 ]ほとんどすべての真核生物はミトコンドリアと小さなミトコンドリアゲノムを持っています。[ 1 ]藻類と植物には、葉緑体ゲノムを持つ葉緑体も含まれています。
ゲノムの研究はゲノミクスと呼ばれています。多くの生物のゲノムが配列決定され、さまざまな領域が注釈付けされています。最初に配列決定されたゲノムは、1977年のウイルスφX174のゲノムでした。[ 3 ]原核生物(インフルエンザ菌)の最初のゲノム配列は1995年に発表されました。[ 4 ]酵母(サッカロミセス・セレビシエ)のゲノムは、1996年に配列決定された最初の真核生物のゲノムでした。[ 5 ]ヒトゲノムプロジェクトは1990年10月に開始され、ヒトゲノムの最初のドラフト配列は2003年4月に報告されました。 [ 6 ] [ 7 ]
ゲノムという用語は、1920 年にドイツのハンブルク大学の植物学教授であったハンス・ウィンクラーによって作られました。 [ 8 ] Oxford DictionariesとOnline Etymology Dictionary のウェブサイトでは、この名前はgeneとchromosome という単語の組み合わせであると示唆されています。[ 9 ] [ 10 ] [ 11 ] [ 12 ]ただし、より詳細な議論については、 omics を参照してください。 biomeやrhizomeなど、関連する-ome の単語がすでにいくつか存在しており、ゲノムが体系的に当てはまる語彙を形成しています。[ 13 ]
「ゲノム」という用語は通常、生物の遺伝情報を運ぶDNA(または場合によってはRNA)分子を指しますが、どの分子を含めるべきかが不明確な場合もあります。たとえば、細菌は通常、必須の遺伝物質すべてを含む1つまたは2つの大きなDNA分子(染色体)を持っていますが、重要な遺伝情報を運ぶ小さな染色体外プラスミド分子も持っています。科学文献では、「ゲノム」という用語は通常、細菌の大きな染色体DNA分子を指します。[ 14 ]
真核生物のゲノムは、ほとんどすべての真核生物種が核染色体に加えてミトコンドリアに余分なDNA分子を持っているため、定義するのがさらに困難です。さらに、藻類と植物は葉緑体DNAを持っています。ほとんどの教科書は核ゲノムとオルガネラ(ミトコンドリアと葉緑体)ゲノムを区別しているので、たとえばヒトゲノムについて話すときは、核内の遺伝物質のみを指しています。[ 1 ] [ 15 ]これは科学文献における「ゲノム」の最も一般的な使用法です。
ほとんどの真核生物は二倍体であり、核内には各染色体が2本ずつ存在しますが、「ゲノム」とは各染色体の1コピーのみを指します。一部の真核生物は、哺乳類のX染色体とY染色体のように、特徴的な性染色体を持っているため、ゲノムの技術的な定義には性染色体の両方のコピーを含める必要があります。たとえば、ヒトの標準参照ゲノムは、22本の常染色体のそれぞれ1コピーと、1本のX染色体および1本のY染色体から構成されています。[ 16 ]
ゲノム配列とは、個体または種のすべての染色体を構成するヌクレオチド(DNAゲノムの場合はA、C、G、T)の完全なリストのことです。同一種内では、ヌクレオチドの大部分は個体間で同一ですが、遺伝的多様性を理解するためには、複数の個体の配列を決定する必要があります。

1976年、ベルギーのゲント大学のウォルター・フィアーズが、ウイルスRNAゲノム(バクテリオファージMS2)の完全なヌクレオチド配列を初めて確立した。翌年、フレッド・サンガーが、5386塩基対のファージX174の最初のDNAゲノム配列を完成させた。 [ 17 ] [ 18 ]最初に配列決定された細菌ゲノムは、1995年にゲノム研究所のチームによって完成したインフルエンザ菌のゲノムである。数か月後、最初の真核生物ゲノムが完成し、1980年代半ばに始まったヨーロッパ主導の取り組みの結果として、出芽酵母サッカロミセス・セレビシエの16本の染色体の配列が発表された。古細菌であるMethanococcus jannaschiiの最初のゲノム配列は、1996年に再びゲノム研究所によって完成しました。[ 19 ]
新技術の開発により、ゲノム配列決定は劇的に安価かつ容易になり、完全なゲノム配列の数は急速に増加しています。米国国立衛生研究所は、ゲノム情報の包括的なデータベースの1つを維持しています。[ 20 ]完了した数千のゲノム配列決定プロジェクトには、イネ、マウス、植物シロイヌナズナ、フグ、細菌大腸菌のものがあります。2013年12月、科学者たちは絶滅した人類種であるネアンデルタール人の全ゲノムを初めて配列決定しました。ゲノムは、シベリアの洞窟で発見された13万年前のネアンデルタール人のつま先の骨から抽出されました。[ 21 ] [ 22 ]
ウイルスゲノムはRNAまたはDNAのいずれかで構成される。RNAウイルスのゲノムは一本鎖RNAまたは二本鎖RNAのいずれかであり、1つ以上の別々のRNA分子(セグメント:単一部分ゲノムまたは複数部分ゲノム)を含む場合がある。DNAウイルスは一本鎖または二本鎖ゲノムのいずれかを持つことができる。ほとんどのDNAウイルスゲノムは1本の線状DNA分子で構成されているが、一部は環状DNA分子で構成されている。[ 23 ]
原核生物と真核生物はDNAゲノムを持っています。古細菌とほとんどの細菌は単一の環状染色体を持っていますが[ 24 ]、一部の細菌種は線状または複数の染色体を持っています[ 25 ] [ 26 ]。DNAの複製速度が細菌細胞の分裂速度よりも速い場合、染色体の複数のコピーが単一の細胞内に存在することがあり、細胞分裂速度がDNAの複製速度よりも速い場合、分裂が起こる前に染色体の多重複製が開始され、娘細胞は完全なゲノムと既に部分的に複製された染色体を継承することができます。ほとんどの原核生物は、ゲノムに反復DNAをほとんど持っていません[ 27 ] 。しかし、一部の共生細菌(例えばSerratia symbiotica)はゲノムが縮小し、偽遺伝子の割合が高く、DNAの約40%だけがタンパク質をコードしています[ 28 ] [ 29 ] 。
一部の細菌は、ゲノムの一部である補助的な遺伝物質をプラスミドに保持している。そのため、 「ゲノム」という言葉を「染色体」の同義語として使用すべきではない。

真核生物のゲノムは、1 つ以上の線状 DNA 染色体から構成されています。染色体の数は、ジャックジャンパーアリや無性生殖を行う線虫 [ 30 ] のようにそれぞれ1対しか持たないものから、720 対を持つシダ植物[ 31 ]まで、大きく異なります。真核生物のゲノムが他のゲノムと比較して持つ DNA の量は驚くべきものです。真核生物のゲノムはサイズが 64,000 倍も異なるため[ 32 ] 、その量は DNA タンパク質コード遺伝子と非コード遺伝子に必要な量よりもさらに多くなっています。しかし、この特別な特徴は、反復 DNA と転移因子 (TE)の存在によって引き起こされています。
典型的なヒト細胞は、両親からそれぞれ1本ずつ受け継いだ22本の常染色体と2本の性染色体を持ち、二倍体である。卵子、精子、胞子、花粉などの配偶子は一倍体であり、各染色体を1本ずつしか持たない。核内の染色体に加えて、葉緑体やミトコンドリアなどの細胞小器官も独自のDNAを持っている。ミトコンドリアは独自のゲノムを持つと言われることがあり、しばしば「ミトコンドリアゲノム」と呼ばれる。葉緑体内のDNAは「プラスチドゲノム」と呼ばれることがある。ミトコンドリアと葉緑体は、それらが由来する細菌と同様に、環状染色体を持っている。
タンパク質をコードする遺伝子のエクソン・イントロン構造が存在する原核生物とは異なり、真核生物は一般的にこれらの特徴を遺伝子に持ち、ゲノムには様々な量の反復DNAが含まれています。哺乳類と植物では、ゲノムの大部分は反復DNAで構成されています。[ 33 ]
ハイスループット技術により、新しいゲノムを組み立てるためのシーケンス解析が誰でも利用できるようになりました。配列多型は通常、再シーケンスした分離株をリファレンスと比較することによって発見されますが、カバレッジ深度とマッピングトポロジーの解析によって、染色体転座やセグメント重複などの構造的変異に関する詳細情報を得ることができます。
タンパク質を作るための指示を運ぶDNA配列は、コーディング配列と呼ばれます。ゲノムに占めるコーディング配列の割合は大きく異なります。ゲノムが大きいからといって必ずしも遺伝子が多いわけではなく、複雑な真核生物ではゲノムサイズが大きくなるにつれて非反復DNAの割合が減少します。[ 33 ]
非コード配列には、イントロン、非コードRNAの配列、調節領域、反復DNAが含まれます。非コード配列はヒトゲノムの98%を占めています。ゲノムには、タンデムリピートと散在リピートの2種類の反復DNAがあります。[ 34 ]
短い非コード配列が頭から尾まで繰り返されているものをタンデムリピートと呼びます。マイクロサテライトは2~5塩基対の繰り返しからなり、ミニサテライトは30~35塩基対です。タンデムリピートはヒトゲノムの約4%、ショウジョウバエゲノムの約9%を占めています。[ 35 ]タンデムリピートは機能を持つことがあります。例えば、哺乳類のテロメアはタンデムリピートTTAGGGで構成されており、染色体の末端を保護する上で重要な役割を果たしています。
他のケースでは、エクソンまたはイントロンのタンデムリピート数の増加が疾患を引き起こすことがあります。[ 36 ]例えば、ヒト遺伝子ハンチンチン(Htt)は通常、ヌクレオチドCAGのタンデムリピートが6~29個含まれています(ポリグルタミン鎖をコードしています)。36個を超えるリピートの増加は、神経変性疾患であるハンチントン病を引き起こします。さまざまな遺伝子における同様のタンデムリピートの増加によって、20種類のヒト疾患が引き起こされることが知られています。ポリグルタミン鎖が拡大したタンパク質がニューロンの死を引き起こすメカニズムは完全には解明されていません。可能性の一つとして、タンパク質が適切に折り畳まれず分解を回避できず、代わりに重要な転写因子も隔離する凝集体に蓄積し、それによって遺伝子発現が変化するということが考えられます。[ 36 ]
タンデムリピートは通常、複製中のスリップ、不均等交叉、遺伝子変換によって引き起こされます。[ 37 ]
転移因子(TE)は、ゲノム内で位置を変えることができる、構造が明確なDNA配列です。[ 35 ] [ 27 ] [ 38 ] TEは、コピーアンドペーストによって複製されるメカニズムと、ゲノムから切り出されて新しい場所に挿入されるメカニズムのいずれかに分類されます。ヒトゲノムには、ヒトDNAの45%以上を占める3つの重要なTEクラスがあります。これらのクラスは、長鎖散在反復配列(LINE)、散在反復配列(SINE)、および内在性レトロウイルスです。これらの要素は、宿主生物の遺伝子制御を変化させる大きな可能性を秘めています。[ 32 ]
TEの移動は真核生物のゲノム進化の原動力であり、TEの挿入は遺伝子機能を阻害し、TE間の相同組換えは重複を引き起こし、TEはエクソンや調節配列を新しい場所にシャッフルすることができる。[ 39 ]
レトロトランスポゾン[ 40 ]は主に真核生物に見られますが、原核生物には見られません。レトロトランスポゾンは多くの真核生物のゲノムの大部分を占めています。レトロトランスポゾンは、 RNA中間体を介して転移する転移因子です。レトロトランスポゾン[ 41 ]はDNAで構成されていますが、転移のためにRNAに転写され、その後、RNA転写産物は逆転写酵素と呼ばれる特定の酵素の助けを借りてDNAにコピーされます。配列に逆転写酵素を持つレトロトランスポゾンは自身の転移を誘発できますが、逆転写酵素を持たないレトロトランスポゾンは、別のレトロトランスポゾンによって合成された逆転写酵素を使用する必要があります。レトロトランスポゾンはRNAに転写され、その後、ゲノム内の別の場所で複製されます。[ 42 ]レトロトランスポゾンは、ロングターミナルリピート(LTR)と非ロングターミナルリピート(Non-LTR)に分類できます。 [ 39 ]
ロングターミナルリピート(LTR)は古代のレトロウイルス感染に由来するため、gag(ウイルスの構造タンパク質)、pol(逆転写酵素およびインテグラーゼ)、pro(プロテアーゼ)、場合によってはenv(エンベロープ)遺伝子など、レトロウイルスタンパク質に関連するタンパク質をコードしています。[ 38 ]これらの遺伝子は、5'末端と3'末端の両方に長いリピートによって挟まれています。LTRはほとんどの植物ゲノムで最大の割合を占めており、ゲノムサイズの大きな変動の原因となっている可能性があることが報告されています。[ 43 ]
非長末端反復配列(Non-LTR)は、長鎖散在反復配列(LINE)、短鎖散在反復配列(SINE)、およびペネロペ様配列(PLE)に分類されます。Dictyostelium discoideumには、Non-LTRに属する別のDIRS様配列があります。Non-LTRは真核生物のゲノムに広く分布しています。[ 44 ]
長鎖散在反復配列(LINE)は逆転写酵素とエンドヌクレアーゼの遺伝子をコードしており、自律的な転移因子である。ヒトゲノムには約50万個のLINEがあり、ゲノムの約17%を占めている。[ 45 ]
短鎖散在反復配列(SINE)は通常500塩基対未満で非自律的であるため、転移にはLINEによってコードされるタンパク質に依存します。[ 46 ] Alu要素は霊長類で最も一般的なSINEです。約350塩基対で、約150万コピーでヒトゲノムの約11%を占めています。[ 39 ]
DNAトランスポゾンは、逆方向末端反復配列の間にトランスポザーゼ酵素をコードしています。発現すると、トランスポザーゼはトランスポゾンを挟む末端逆方向反復配列を認識し、その切除と新しい部位への再挿入を触媒します。[ 35 ]このカットアンドペースト機構により、通常、トランスポゾンは元の位置の近く(100 kb以内)に再挿入されます。[ 39 ] DNAトランスポゾンは細菌に存在し、ヒトゲノムの3%、線虫C. elegansのゲノムの12%を占めています。[ 39 ]

ゲノムサイズとは、半数体ゲノムの1コピーに含まれるDNA塩基対の総数です。ゲノムサイズは種によって大きく異なります。無脊椎動物はゲノムが小さく、これは転移因子の数が少ないこととも関連しています。魚類と両生類は中程度のサイズのゲノムを持ち、鳥類は比較的小さなゲノムを持っていますが、鳥類は飛行への移行期にゲノムのかなりの部分を失っていると考えられています。この損失以前は、DNAメチル化によってゲノムの適切な拡大が可能でした。[ 32 ]
ヒトの核ゲノムは、約31億ヌクレオチドのDNAから構成され、最短45,000,000ヌクレオチド、最長248,000,000ヌクレオチドの24本の線状分子に分かれており、それぞれ異なる染色体に含まれている。[ 47 ]原核生物と下等真核生物のどちらにおいても、形態学的複雑性とゲノムサイズの間には明確かつ一貫した相関関係はない。[ 33 ] [ 48 ]ゲノムサイズは、主に反復DNA要素の拡大と縮小の関数である。
ゲノムは非常に複雑であるため、研究戦略の一つは、ゲノム内の遺伝子の数を最小限に減らし、それでもなお対象となる生物が生存できるようにすることである。単細胞生物の最小ゲノムと多細胞生物の最小ゲノムに関する実験的研究が行われている(発生生物学を参照)。この研究は、生体内とコンピュータシミュレーションの両方で行われている。[ 49 ] [ 50 ]

ゲノムのサイズには大きな違いがあり、特に多細胞真核生物のゲノムではその違いが顕著です。これは主に、染色体内で自身の新しいコピーを作成することで進化する転移因子の存在量の違いによるものです。[ 32 ]真核生物のゲノムには、これらの因子が数千コピー含まれていることが多く、そのほとんどは欠陥のある変異を獲得しています。
生物のすべての細胞は単一の細胞に由来するため、ゲノムは同一であると予想されますが、場合によっては違いが生じます。細胞分裂中のDNAの複製プロセスと環境変異原への曝露の両方が、体細胞の突然変異を引き起こす可能性があります。場合によっては、このような突然変異は、細胞がより速く分裂し、周囲の組織に浸潤するため、癌につながります。[ 51 ]ヒトの免疫系の特定のリンパ球では、V(D)J組換えによって異なるゲノム配列が生成され、各細胞が独自の抗体またはT細胞受容体を産生します。
減数分裂の過程では、二倍体細胞が2回分裂して一倍体の生殖細胞が生成されます。この過程で、相同染色体からの遺伝物質が組み換えられる組換えが起こり、それぞれの配偶子が固有のゲノムを持つことになります。
マウス始原生殖細胞におけるゲノム全体の再プログラミングは、全能性につながるエピジェネティックなインプリントの消去を伴う。再プログラミングは、DNA塩基除去修復経路を伴う能動的なDNA脱メチル化によって促進される。[ 52 ]この経路は、始原生殖細胞におけるCpGメチル化(5mC)の消去に用いられる。5mCの消去は、高レベルのテトラヒドロビオキシゲナーゼ酵素TET1およびTET2によって駆動される5-ヒドロキシメチルシトシン(5hmC)への変換によって起こる。[ 53 ]
ゲノムは生物の遺伝子の総和以上のものであり、特定の遺伝子とその産物の詳細を参照することなく測定および研究できる特性を持っています。研究者は、核型(染色体数)、ゲノムサイズ、遺伝子順序、コドン使用バイアス、GC含量などの特性を比較して、今日存在するゲノムの多様性を生み出したメカニズムを特定します(最近の概説については、Brown 2002、Saccone and Pesole 2003、Benfey and Protopapas 2004、Gibson and Muse 2004、Reese 2004、Gregory 2005を参照)。
重複はゲノムの形成において重要な役割を果たしている。重複は、短いタンデムリピートの伸長から、遺伝子クラスターの重複、さらには染色体全体やゲノム全体の重複まで多岐にわたる。このような重複は、遺伝的新規性を生み出す上でおそらく基本的である[ 54 ]。
水平遺伝子伝達は、本来は非常に遠縁である2つの生物のゲノムのごく一部に極めて類似性がある理由を説明するために用いられる。水平遺伝子伝達は多くの微生物の間で一般的であるようだ。また、真核細胞も葉緑体およびミトコンドリアゲノムから核染色体への遺伝物質の伝達を経験しているようだ。最近の実証データは、ウイルスおよびサブウイルスRNAネットワークが遺伝的新規性および自然ゲノム編集を生み出す主要な推進力として重要な役割を果たしていることを示唆している。遺伝的素因を検出するゲノミクスに関する最初の企業は、マーク・スコルニックとケビン・キンバーリンによって設立されたMyriad Geneticsであった。[ 55 ]
SF作品は、ゲノム配列の入手可能性に関する懸念を描き出している。
マイケル・クライトンの1990年の小説『ジュラシック・パーク』とその後の映画は、孤島にクローン恐竜のテーマパークを建設した億万長者の物語を描いているが、その結果は悲惨なものとなる。遺伝学者は古代の蚊の血液から恐竜のDNAを抽出し、現代の生物のDNAでその欠落部分を補い、数種類の恐竜を作り出す。カオス理論家は、恐竜を使った生態系の構築の安全性について専門家の意見を求められ、このプロジェクトの結果は予測不可能で、最終的には制御不能になると繰り返し警告する。ゲノム情報の利用に伴う危険性についてのこうした警告は、この小説の主要なテーマとなっている。
1997年の映画『ガタカ』は、子供たちのゲノムが両親の特性の最も理想的な組み合わせを含むように操作され、心臓病のリスクや予測寿命などの指標がゲノムに基づいて各個人について記録される未来社会を舞台としている。優生学プログラムの外で生まれた人々は「不適格者」と呼ばれ、差別を受け、卑しい職業に追いやられる。映画の主人公は、遺伝的確率に逆らい、宇宙航行士として働くという夢を実現しようとする不適格者である。この映画は、ゲノム情報が偏見を助長し、遺伝子操作された子供を養う余裕のある人とない人の間に極端な階級格差を生み出す未来に警鐘を鳴らしている。[ 56 ]
{{cite journal}}日付値を確認するには:(ヘルプ)|date={{cite journal}}日付値を確認するには:(ヘルプ)|date=