祖先再構築(特性マッピングまたは特性最適化とも呼ばれる)は、個体、集団、または種の測定された特性から、それらの共通祖先まで時間を遡って外挿することです。これは、個体、集団、または種とそれらの祖先との間の進化関係を再構築および研究する系統学の重要な応用です。進化生物学の文脈では、祖先再構築は、数百万年前に生息していた生物のさまざまな種類の祖先特性状態を復元するために使用できます。[ 1 ]これらの状態には、遺伝子配列(祖先配列再構築)、タンパク質のアミノ酸配列、ゲノムの構成(例:遺伝子順序)、生物の測定可能な特性(表現型)、および祖先集団または種の地理的範囲(祖先範囲再構築)が含まれます。これは、遠い過去に対応する系統樹の一部を調べ、系統樹内の種の進化の歴史を明らかにすることができるため、望ましいものです。現代の遺伝子配列は基本的に古代の遺伝子配列の変異であるため、古代の配列にアクセスすることで、それらの配列から生じた可能性のある他の変異や生物を特定できる可能性がある。 [ 2 ]遺伝子配列に加えて、ヒレが脚に変わるなど、ある形質が別の形質に変化する過程を追跡することも試みられるかもしれない。
生物学的応用以外の例としては、古代言語の語彙や音素の再構築[ 3 ]、口承伝承[ 4 ]や結婚の慣習[ 5 ]などの古代社会の文化的特徴の解明などが挙げられる。
祖先再構築は、祖先の状態を正確に復元するために、十分に現実的な進化の統計モデルに依存しています。これらのモデルは、系統発生学などの方法ですでに得られた遺伝情報を使用して、進化がたどった経路と進化イベントがいつ発生したかを決定します。 [ 6 ]しかし、モデルが実際の進化の歴史をどれだけうまく近似しても、祖先とその観察された子孫との間の進化時間が長くなるにつれて、祖先を正確に再構築する能力は低下します。さらに、より現実的な進化モデルは必然的に複雑で計算が困難になります。祖先再構築の分野の進歩は、計算能力の指数関数的な増加と、それに伴う効率的な計算アルゴリズム(たとえば、祖先配列の同時最大尤度再構築のための動的計画法アルゴリズム)の開発に大きく依存しています。 [ 7 ]祖先再構築の方法は、同じデータからすでに推測されている特定の系統樹に適用されることがよくあります。このアプローチは便利ですが、その結果が単一の系統樹の精度に依存するという欠点があります。対照的に、一部の研究者[ 8 ]は、多くの系統樹にわたる祖先系統樹の評価によって系統樹再構築の不確実性を考慮する、より計算負荷の高いベイズアプローチを提唱している。
祖先再構築の概念は、しばしばエミール・ツッカーカンドルとライナス・ポーリングに帰せられる。 1955年にフレデリック・サンガーがタンパク質の一次(アミノ酸)配列を決定する技術を開発したことに触発され、 [ 9 ]ツッカーカンドルとポーリングは、そのような配列を使用して、観察されたタンパク質配列に関連する系統発生だけでなく、このツリーの最も初期の点(根)にある祖先タンパク質配列も推測できると仮定した[10]。しかし、測定可能な生物学的特徴から祖先を再構築するという考えは、現代の系統発生学の先駆けの1つである分岐分類学の分野ですでに発展していた。1901年にはすでに登場した分岐分類法は、共有特性の分布に基づいて種の進化関係を推測し、その一部は共通の祖先から派生したと推測される。さらに、テオドシウス・ドブジャンスキーとアルフレッド・スターテバントは、 1938年にショウジョウバエ(Drosophila pseudoobscura)の染色体逆位の進化史を推論する際に、系統発生学的文脈で祖先再構築の原理を明確にした。[ 11 ]
このように、祖先再構築は複数の分野にルーツを持っています。今日、祖先再構築のための計算手法は拡張され、多様な設定で適用され続けており、祖先状態は生物学的特性や分子配列だけでなく、古代タンパク質と現代タンパク質の構造[ 12 ] [ 13 ]や触媒特性[ 14 ]、集団や種の地理的位置(系統地理学)[ 15 ] [ 16 ]、ゲノムの高次構造[ 17 ]についても推測されています。
祖先再構築の試みはすべて系統樹から始まります。一般的に、系統樹とは、集団(分類群と呼ばれる)が共通祖先から派生した順序に関する樹木ベースの仮説です。観察された分類群は、樹木の先端または末端ノードで表され、枝によって共通祖先へと段階的に接続されます。共通祖先は、通常、祖先ノードまたは内部ノードと呼ばれる樹木の分岐点で表されます。最終的に、すべての系統は、サンプル全体の分類群の最新の共通祖先に収束します。祖先再構築の文脈では、系統樹は既知の量であるかのように扱われることがよくあります(ベイズアプローチは重要な例外です)。データを説明する上でほぼ同等の効果を持つ系統樹が膨大な数存在する可能性があるため、データによって支持される系統樹のサブセットを単一の代表例または点推定値に縮小することは、便利で、場合によっては必要な単純化の仮定となります。
祖先再構築は、仮説的な進化モデルを特定の系統樹に適用した直接の結果と考えることができます。モデルに 1 つ以上の自由パラメータが含まれている場合、全体的な目的は、共通の祖先から派生した観察された分類群 (配列) の間で測定された特性に基づいてこれらのパラメータを推定することです。最小進化法はこのパラダイムの重要な例外です。最小進化法が最尤推定法となる状況があることが示されていますが[ 18 ]、その核心は、形質状態の変化はまれであるというヒューリスティックに基づいているだけで、そのまれさを定量化しようとはしていません。
祖先系統樹の再構築には、大きく分けて3つの異なる手法があります。発見された順に、最大節約法、最尤法、ベイズ推論です。最大節約法は、すべての進化事象が等しく起こりうると仮定します。最尤法は、特定の事象の起こりうる確率の違いを考慮します。ベイズ推論は、事象の条件付き確率を系統樹の尤度、およびその系統樹に関連する不確実性の度合いと関連付けます。最大節約法と最尤法は、最も可能性の高い単一の結果をもたらしますが、ベイズ推論はデータの不確実性を考慮し、可能性のある系統樹のサンプルを提供します。
パースモニーは、口語的には「オッカムの剃刀」として知られており、競合する仮説の中で最も単純なものを選択する原理を指します。祖先再構築の文脈では、パースモニーは、与えられたツリー内で祖先状態の分布を見つけ、ツリーの先端で観察される状態を説明するために必要な形質状態変化の総数を最小化しようとします。この最大パースモニー法[ 19 ]は、祖先状態を再構築するための最も初期の形式化されたアルゴリズムの1つであり、最も単純なものの1つでもあります。[ 13 ]
最大節約法は、いくつかのアルゴリズムのいずれかによって実装できます。最も初期の例の 1 つは、根付き二分木の 2 つの走査によって祖先形質状態を節約法で割り当てるFitch の方法[ 20 ]です。最初の段階は、親ノードの前に子孫 (子) ノードを訪問しながら、木の先端から根に向かって進む後順走査です。最初は、 i番目の祖先の可能な形質状態の集合を、その子孫の観測された形質状態に基づいて決定します。各割り当ては、祖先の子孫の形質状態の集合の共通部分です。共通部分が空集合の場合は、集合の和集合になります。後者の場合、祖先とその 2 つの直近の子孫のいずれかの間で形質状態の変化が発生したことを意味します。このようなイベントはそれぞれ、アルゴリズムのコスト関数にカウントされ、最大節約法に基づいて代替ツリーを区別するために使用できます。次に、ツリーの順走査がルートから先端に向かって実行されます。そして、各子孫ノードには、親ノードと共有する文字状態に基づいて文字状態が割り当てられます。ルートには親ノードがないため、特にルートで複数の可能な状態が再構築されている場合は、文字状態を任意に選択する必要が生じる場合があります。

For example, consider a phylogeny recovered for a genus of plants containing 6 species A - F, where each plant is pollinated by either a "bee", "hummingbird" or "wind". One obvious question is what the pollinators at deeper nodes were in the phylogeny of this genus of plants. Under maximum parsimony, an ancestral state reconstruction for this clade reveals that "hummingbird" is the most parsimonious ancestral state for the lower clade (plants D, E, F), that the ancestral states for the nodes in the top clade (plants A, B, C) are equivocal and that both "hummingbird" or "bee" pollinators are equally plausible for the pollination state at the root of the phylogeny. Supposing we have strong evidence from the fossil record that the root state is "hummingbird". Resolution of the root to "hummingbird" would yield the pattern of ancestral state reconstruction depicted by the symbols at the nodes with the state requiring the fewest changes circled.
Parsimony methods are intuitively appealing and highly efficient, such that they are still used in some cases to seed maximum likelihood optimization algorithms with an initial phylogeny.[21] However, the underlying assumption that evolution attained a certain end result as fast as possible is inaccurate. Natural selection and evolution do not work towards a goal, they simply select for or against randomly occurring genetic changes. Parsimony methods impose six general assumptions: that the phylogenetic tree you are using is correct, that you have all of the relevant data, in which no mistakes were made in coding, that all branches of the phylogenetic tree are equally likely to change, that the rate of evolution is slow, and that the chance of losing or gaining a characteristic is the same.[1] In reality, assumptions are often violated, leading to several issues:
祖先状態復元の最尤法(ML) は、系統樹の内部ノードにおける形質状態をパラメータとして扱い、仮説 (進化モデルと、観察された配列または分類群を関連付ける系統樹) が与えられた場合にデータ (観察された形質状態) の確率を最大化するパラメータ値を見つけようとします。言い換えれば、この方法は、観察された表現型が与えられた場合に、祖先状態が統計的に最も可能性が高いと仮定します。祖先復元に対する初期の ML アプローチのいくつかは、遺伝子配列進化の文脈で開発されました。[ 29 ] [ 30 ]同様のモデルは、離散形質進化の類似のケースでも開発されました。[ 31 ]
進化モデルを用いることで、すべての事象が等しく起こりやすいわけではないという事実を考慮に入れることができます。例えば、あるプリンから別のプリンへ、あるいはあるピリミジンから別のピリミジンへと変化する点突然変異の一種である遷移は、プリンがピリミジンに、あるいはその逆へと変化する転換よりもはるかに起こりやすいのです。これらの違いは最大節約法では捉えられません。しかし、ある事象が他の事象よりも起こりやすいからといって、必ずしも起こるとは限りません。進化の歴史を通して、最も起こりやすい事象と実際に起こった事象との間に大きな隔たりがあった時期があったことは分かっています。このような場合、最大節約法は最大尤度法よりも大きな、起こりにくい飛躍を許容する傾向があるため、実際にはより正確である可能性があります。最大尤度法は形質状態の再構築において非常に信頼性が高いことが示されていますが、タンパク質の安定性を正確に推定する点ではそれほど優れていません。最尤法は常にタンパク質の安定性を過大評価するが、これは、製造され使用されたタンパク質が最も安定で最適であると仮定しているため当然である。[ 13 ]最尤法の利点については議論があり、最尤法テストは精度と速度の中間点として適切であると結論付けた研究者もいる。[ 32 ]しかし、他の研究では、最尤法は時間と計算能力が高すぎて、一部のシナリオでは役に立たないと不満を述べている。[ 33 ]
これらのアプローチは、系統樹を推定するために使用されるものと同じ確率論的枠組みを採用しています。[ 34 ]簡単に言うと、遺伝子配列の進化は、時間可逆な連続時間マルコフ過程によってモデル化されます。最も単純なモデルでは、すべての形質が時間とともに一定の速度で独立した状態遷移(ヌクレオチド置換など)を受けます。この基本モデルは、系統樹の各枝で異なる速度を許容するように拡張されることがよくあります。実際には、突然変異率も時間とともに変化する可能性があります(たとえば、環境の変化による)。これは、パラメータの数が増えるという代償を伴いますが、速度パラメータが系統樹に沿って進化することを許容することでモデル化できます。モデルは、長さt (進化時間の単位)の枝に沿って状態iからjへの遷移確率を定義します。系統樹の尤度は、提案された系統樹の階層構造に対応する遷移確率の入れ子になった合計から計算されます。各ノードでは、そのノードのすべての可能な祖先形質状態について、その子孫の尤度が合計されます。
ここで、ノードxを根とする部分木で、直接の子孫yとzを持つものの尤度を計算しています。i番目のノードの文字状態を表します。はノードiとjの間の枝の長さ(進化時間)であり、は、可能なすべての文字状態(例えば、ヌクレオチドA、C、G、T)の集合です。[ 34 ]したがって、祖先再構築の目的は、 への割り当てを見つけることです。与えられたツリーに対して観測データの尤度を最大化するすべてのx個の内部ノードについて。
Rather than compute the overall likelihood for alternative trees, the problem for ancestral reconstruction is to find the combination of character states at each ancestral node with the highest marginal maximum likelihood. Generally speaking, there are two approaches to this problem. First, one can assign the most likely character state to each ancestor independently of the reconstruction of all other ancestral states. This approach is referred to as marginal reconstruction. It is akin to summing over all combinations of ancestral states at all of the other nodes of the tree (including the root node), other than those for which data is available. Marginal reconstruction is finding the state at the current node that maximizes the likelihood integrating over all other states at all nodes, in proportion to their probability. Second, one may instead attempt to find the joint combination of ancestral character states throughout the tree which jointly maximizes the likelihood of the entire dataset. Thus, this approach is referred to as joint reconstruction.[29] Not surprisingly, joint reconstruction is more computationally complex than marginal reconstruction. Nevertheless, efficient algorithms for joint reconstruction have been developed with a time complexity that is generally linear with the number of observed taxa or sequences.[7]
ML-based methods of ancestral reconstruction tend to provide greater accuracy than MP methods in the presence of variation in rates of evolution among characters (or across sites in a genome).[35][36] However, these methods are not yet able to accommodate variation in rates of evolution over time, otherwise known as heterotachy. If the rate of evolution for a specific character accelerates on a branch of the phylogeny, then the amount of evolution that has occurred on that branch will be underestimated for a given length of the branch and assuming a constant rate of evolution for that character. In addition to that, it is difficult to distinguish heterotachy from variation among characters in rates of evolution.[37]
Since ML (unlike maximum parsimony) requires the investigator to specify a model of evolution, its accuracy may be affected by the use of a grossly incorrect model (model misspecification). Furthermore, ML can only provide a single reconstruction of character states (what is often referred to as a "point estimate") — when the likelihood surface is highly non-convex, comprising multiple peaks (local optima), then a single point estimate cannot provide an adequate representation, and a Bayesian approach may be more suitable.
ベイズ推論は、観測データの尤度を用いて、研究者の信念、すなわち事前分布を更新し、事後分布を生成します。祖先再構築の文脈では、目的は、与えられた系統樹の各内部ノードにおける祖先形質状態の事後確率を推論することです。さらに、これらの確率を、進化モデルのパラメータとすべての可能な系統樹の空間にわたる事後分布にわたって積分することができます。これは、ベイズの定理の応用として表現できます。
ここで、Sは祖先状態を表し、Dは観測データに対応し、これは進化モデルと系統樹の両方を表しています。これは、上記で示したフェルゼンシュタインの剪定アルゴリズムによって計算できる、観測データの尤度です。は、特定のモデルとツリーにおける祖先状態の事前確率です。最後に、これは、特定のモデルと系統樹におけるデータの確率であり、考えられるすべての祖先状態にわたって積分されたものです。
ベイズ推論は、多くの人が最も正確だと主張している方法です。[ 8 ]一般的に、ベイズ統計手法では、研究者は既存の情報と新しい仮説を組み合わせることができます。進化の場合、観測されたデータの尤度と、事象が実際に起こった順序で発生した可能性を組み合わせ、エラーや不確実性の可能性を認識します。全体として、祖先の遺伝子配列やタンパク質の安定性を再構築するための最も正確な方法です。[ 25 ]他の2つの方法とは異なり、ベイズ推論は可能なツリーの分布を生成し、可能な結果の分散のより正確で解釈しやすい推定を可能にします。[ 38 ]
上記では、ベイズの定理の2つの異なる応用例を強調するために2つの定式化を示しました。これらについては、次のセクションで詳しく説明します。
祖先配列再構築へのベイズアプローチの最初の実装の1つは、Yangらによって開発されました[ 29 ]。そこでは、進化モデルと系統樹の最尤推定値がそれぞれ事前分布を定義するために使用されました。したがって、彼らのアプローチは、祖先形質状態の事後確率を計算する経験的ベイズ法の例です。この方法は、ソフトウェアパッケージPAMLで最初に実装されました[ 39 ] 。上記のベイズ規則の定式化に関して、経験的ベイズ法は、データから得られたモデルとツリーの経験的推定値に対して、事後尤度と式の事前項から。さらに、Yangら[ 29 ]は、観測されたヌクレオチド配列のアライメントにおいて、網羅的に計算する代わりに、サイトパターンの経験的分布(すなわち、ヌクレオチドをツリーの先端に割り当てること)を分母に使用した。Sのすべての可能な値に対して計算上、経験ベイズ法は祖先状態の最尤推定法に似ていますが、各内部ノードにおけるそれぞれの確率分布に基づいて状態の最尤推定値を求めるのではなく、確率分布自体が直接報告される点が異なります。
祖先再構築のための経験的ベイズ法では、研究者は進化モデルのパラメータと系統樹が誤差なく既知であると仮定する必要があります。データのサイズや複雑さによってこれが非現実的な仮定となる場合、完全階層型ベイズアプローチを採用し、祖先形質状態、モデル、系統樹の同時事後分布を推論する方が賢明かもしれません。[ 40 ] HuelsenbeckとBollbackは、この同時事後分布から祖先配列をサンプリングするためにマルコフ連鎖モンテカルロ(MCMC)法を使用することで、祖先再構築のための階層型ベイズ法を最初に提案しました[ 40 ]。同様のアプローチは、菌類種における藻類との共生(地衣類化)の進化を再構築するためにも使用されました。[ 41 ]例えば、 MCMCのメトロポリス・ヘイスティングスアルゴリズムは、事後確率の比率に基づいてパラメータの割り当てを受け入れるか拒否することによって、同時事後分布を探索します。
簡単に言うと、経験ベイズ法は、特定の系統樹と進化モデルにおける様々な祖先状態の確率を計算します。祖先状態の再構築を確率の集合として表現することで、特定の状態を祖先に割り当てる際の不確実性を直接定量化できます。一方、階層ベイズ法は、観測されたデータに基づいて、考えられるすべての系統樹と進化モデルについて、それらの確率を、それぞれの系統樹とモデルがどの程度起こりうるかに応じて平均化します。
しかし、階層ベイズ法が実際に大きな利点をもたらすかどうかは依然として議論の的となっている。[ 42 ]さらに、この完全ベイズ的アプローチは、すべての可能なツリーの空間が急速に大きくなりすぎて、チェーンサンプルが妥当な時間内に収束することが計算上不可能になるため、比較的少数の配列または分類群の分析に限定される。
祖先再構築は、化石やアーカイブ標本など、年代が既知の歴史的サンプルで観察された状態によって情報を得ることができます。祖先再構築の精度は一般的に時間の経過とともに低下するため、このような標本を使用すると、再構築対象の祖先により近いデータが得られ、特に形質変化の速度が時間とともに変化する場合には、分析が改善される可能性が高くなります。この概念は、バクテリオファージT7の複製集団を増殖させて人工系統樹を生成した実験的進化研究によって検証されています。[ 43 ]これらの実験データを再検討したOakleyとCunningham [ 44 ]は、最大節約法では連続形質(プラークサイズ)の既知の祖先状態を正確に再構築できないことを発見しました。これらの結果は、コンピュータシミュレーションによって検証されました。この祖先再構築の失敗は、プラークサイズの進化における方向性バイアス(大きなプラーク直径から小さなプラーク直径へ)に起因するものであり、これに対処するには「化石化した」サンプルを含める必要がありました。
哺乳類の肉食動物[ 45 ]と魚類[ 46 ]の両方の研究により、化石データを取り入れなければ、祖先の体サイズの推定値は非現実的に大きくなることが実証されています。さらに、Graham Slaterらは、イヌ科の肉食動物を用いて[ 47 ] 、化石データを事前分布に組み込むことで、同時代のデータのみを使用した分析と比較して、祖先状態のベイズ推論と進化モデルの選択の両方が改善されることを示しました。
現存する子孫から離散形質と連続形質の祖先状態を推定するためのモデルが数多く開発されてきた。[ 48 ]これらのモデルは、時間経過に伴う形質の進化を確率過程としてモデル化できると仮定している。離散値形質(「送粉者タイプ」など)の場合、この過程は通常マルコフ連鎖とみなされ、連続値形質(「脳の大きさ」など)の場合、この過程はブラウン運動またはオルンシュタイン・ウーレンベック過程とみなされることが多い。このモデルを統計的推論の基礎として使用することで、最尤法またはベイズ推論を用いて祖先状態を推定することができる。
問題の特性が以下のいずれかに該当すると仮定します。州、ラベル付けこの形質の進化をモデル化する典型的な方法は、連続時間マルコフ連鎖によるものであり、簡単に説明すると次のようになります。各状態には、他のすべての状態への遷移率が関連付けられています。この形質は、状態を遷移し、ある状態に到達すると、遷移可能な他の各状態に対して指数関数的な「クロック」を開始します。そして、これらのクロックを競わせ、最初にクロックが鳴った状態に向かってステップを踏みます。このようなモデルでは、パラメータは遷移率です。これは、例えば最尤法を用いて推定することができ、その方法では、祖先ノードの状態のすべての可能な構成の集合について最大化を行う。

系統樹内の特定の祖先ノードの状態を復元するために(このノードを最尤法による手順は次のとおりです。最尤推定値を求めます。の;次に、各可能な状態の尤度を計算します。条件付け最後に、これを最大化する祖先状態を選択します。[ 23 ]この置換モデルをベイズ推論手順の基礎として使用することもできます。ベイズ推論手順では、ユーザーが選択した事前確率に基づいて、祖先ノードの状態の事後信念を考慮します。
このようなモデルは、パラメータ数が多い場合、過学習が問題となる可能性があります。パラメータ空間を縮小する一般的な選択肢としては、以下のようなものがあります。


二値状態種分化および絶滅モデル[ 49 ](BiSSE)は、上記の枠組みに直接従わない離散空間モデルです。このモデルでは、祖先の二値形質状態と、異なる形質状態に関連付けられた多様化率を同時に推定できます。また、より一般的な多値離散状態モデルに簡単に拡張することもできます。このモデルの最も基本的な形式では、6つのパラメータが含まれます。2つの種分化率(状態0と1の系統それぞれに1つずつ)、同様に2つの絶滅率、および2つの形質変化率です。このモデルでは、パラメータの数が増えるという代償を伴いますが、種分化/絶滅/形質変化率に関する仮説検定が可能です。
形質が離散値ではなく非離散値をとる場合は、形質が連続的なプロセスとして進化するモデルを用いる必要がある。最尤法(またはベイズ法)による祖先状態の推論は上記と同様に行われるが、隣接するノード間の状態遷移の尤度は、別の連続確率分布によって与えられる。

祖先形質再構築は、系統樹の祖先ノードに関連する生態学的、表現型的、または生物地理学的形質を推測するために広く使用されています。祖先形質再構築のすべての方法には、大量の欠損データで形質がどのように変化したかを予測するために数学モデルを使用するため、落とし穴があります。この欠損データには、絶滅種の状態、進化変化の相対速度、初期形質状態の知識、および系統樹の精度が含まれます。祖先形質再構築が使用されるすべてのケースで、モデルに基づく結論を裏付ける生物学的データの調査によって結果が正当化される必要があります。Griffith OW et al. [ 55 ]
祖先再構築により、進化経路、適応選択、発生遺伝子発現[ 56 ] [ 57 ] 、および進化の過去の機能的分岐の研究が可能になります。祖先再構築の生物学的および計算的手法のレビューについては、Chang et al . [ 58 ]を参照してください。祖先再構築の計算方法に対する批判については、Williams PD et al. [ 13 ]を参照してください。
ツノトカゲ(Phrynosoma属)では、祖先復元法に基づくと、胎生(生きた状態で生まれること)が複数回進化している。 [ 59 ]
ガラパゴス諸島に生息するフィンチの放散については、系統発生データと形質データの両方が利用可能です。これらのデータにより、祖先状態の再構築を通じて、時間経過に伴う形質状態の変化のタイミングと順序に関する仮説を検証することができます。乾季の間、ガラパゴス諸島の13種のフィンチの食性は、3つの大まかな食性カテゴリーに分類できます。まず、穀物のような食物を食べるものは「穀食性」、節足動物を食べるものは「食虫性」、植物を食べるものは「葉食性」に分類されます。[ 23 ]最大節約法を用いた食性の祖先状態の再構築では、食虫性の状態から2つの大きな変化が明らかになりました。1つは穀食性への変化、もう1つは葉食性への変化です。最尤法による祖先状態の再構築では、概ね同様の結果が得られるが、重要な違いが1つある。それは、樹上フィンチ(Camarhynchus)と地上フィンチ(Geospiza)の系統群の共通祖先は、昆虫食ではなく穀食である可能性が高いということである(最小進化法による判断)。この場合、最大最小進化法と最尤法によって得られた祖先状態のこの違いは、ML推定値が系統樹の枝の長さを考慮していることに起因すると考えられる。[ 23 ]
フリノソマ科のトカゲは、後肢の筋肉の相対的な筋線維タイプの構成を含め、顕著な形態的多様性を示します。二乗変化最小進化法(ブラウン運動形質進化における最尤法に相当[ 60 ])に基づく祖先再構築によると、この系統の3つの主要なサブクレードの1つであるツノトカゲは、腸腓骨筋における速酸化解糖線維の割合が大幅に進化的に増加したことが示されています。[ 61 ]
エリオットとムーアーズ[ 54 ]は、連続形質進化の安定モデルとブラウン運動モデルを比較した1,679種の胎盤哺乳類の体質量の分析において、哺乳類の体質量進化を記述する進化過程は、まれに大きな変化を許容する連続形質進化の安定モデルによって最もよく特徴づけられることを示した。安定モデルの下では、祖先哺乳類は初期の多様化を通じて低い体質量を維持し、体質量の大きな増加は、体質量の大きな種(例えば有蹄類)のいくつかの目の起源と一致していた。対照的に、ブラウン運動モデルの下でのシミュレーションでは、祖先哺乳類の間で、より現実的ではない、桁違いに大きな体質量が再現され、体サイズの小さい目(例えば齧歯類)の進化の前に、体サイズの著しい減少が必要となった。したがって、安定モデルは、小さなサブセットの枝で大きな変化が起こることを許容することで、哺乳類の体質量進化のより現実的な像を再現する。[ 54 ]
系統発生比較法(関連する分類群の比較から得られる推論)は、独立して進化しない生物学的特性を特定するためによく使用され、それによって根底にある依存関係が明らかになることがあります。たとえば、フィンチのくちばしの形状の進化は、その採餌行動と関連している可能性があります。しかし、これらの観察は共通の祖先から派生しているため独立していないため、測定値や遺伝子配列を直接比較してこれらの関連性を探すことは推奨されません。離散形質の場合、この問題は、2つの形質がツリーの同じ枝で変化する傾向があるかどうかを評価することによって、最大節約の枠組みで最初に扱われました。[ 62 ] [ 63 ]フェルゼンシュタインは、連続形質の進化についてこの問題を特定し、祖先再構築に似た解決策を提案しました。この解決策では、重複しない枝で関連付けられたツリーのノード間の「独立対比」を計算することによって分析を方向付けることで、データの系統発生構造を統計的に考慮しました。[ 28 ]
分子レベルでは、タンパク質の異なる位置にあるアミノ酸残基は、直接的な物理化学的相互作用、または共通の基質との相互作用やタンパク質構造内の長距離相互作用を介して間接的に、独立して進化しない可能性がある。逆に、タンパク質の折り畳まれた構造は、残基の相互作用の分布から推測できる可能性がある。[ 64 ]残基の接触を介してタンパク質の三次元構造を予測する祖先再構築の初期の応用例の1つは、Shindyalovらによって発表された。[ 65 ] 67の異なるタンパク質ファミリーに関連する系統樹は、距離ベースのクラスタリング法(算術平均を用いた非加重ペアグループ法、UPGMA)によって生成され、祖先配列は最小進化法によって再構築された。著者らは、共進化する残基のペアが、タンパク質の既知の三次元構造で共局在する弱いが有意な傾向を報告した。
古代のタンパク質やDNA配列の再構築は、ごく最近になって重要な科学的取り組みとなった。広範なゲノム配列データベースの開発とバイオテクノロジーおよび系統推定法の進歩により、祖先再構築は安価で迅速かつ科学的に実用的になった。この概念は、系統樹や祖先配列の再構築のためのより高度な方法を用いて、タンパク質配列中の共進化残基を特定するために応用されている。例えば、祖先再構築は、RNAウイルスゲノム、特にHIVによってコードされるタンパク質中の共進化残基を特定するために使用されている。[ 66 ] [ 67 ] [ 68 ]
祖先タンパク質およびDNAの再構築により、実験室でタンパク質およびDNAの進化を再現し、直接研究することが可能になります。[ 58 ]タンパク質に関しては、これにより、現在の分子構造と機能の進化を調査することができます。さらに、祖先タンパク質の再構築は、現代のタンパク質では失われている新しい生化学的機能の発見につながる可能性があります。[ 69 ] [ 70 ]また、絶滅した生物の生物学と生態学についての洞察も得られます。[ 71 ]祖先再構築の大部分はタンパク質を扱っていますが、細菌ゲノム[ 72 ]や霊長類の遺伝子配列[ 73 ]のレベルで進化メカニズムをテストするためにも使用されています。
ヒト免疫不全ウイルス(HIV)などのRNAウイルスは、哺乳類や鳥類よりも桁違いに速い速度で進化します。これらの生物の場合、祖先再構築ははるかに短い時間スケールで適用できます。たとえば、数百万年ではなく数十年に及ぶ流行の地球規模または地域的な祖先を再構築するためです。ブライアン・ガシェンを中心とするチームは[ 74 ] 、現在患者から分離された配列ではなく、このように再構築された株をワクチン設計のターゲットとして使用することを提案しました。HIVは非常に多様であるため、ある患者のウイルス集団に作用するように設計されたワクチンは、2つのウイルス間の進化的な距離が大きい可能性があるため、別の患者には作用しない可能性があります。しかし、それらの最も最近の共通祖先は、2つのウイルス同士よりも、それぞれのウイルスに近い位置にあります。したがって、共通祖先用に設計されたワクチンは、循環している株のより大きな割合に有効である可能性が高いと考えられます。別のチームは、このアイデアをさらに発展させ、現代の株との総進化距離が可能な限り小さい配列を生成するために、系統樹の中心再構築法を開発しました。[ 75 ]厳密に言えば、この方法は祖先再構築ではありません。なぜなら、系統樹の中心(COT)配列は、ウイルスの進化の歴史の中で存在した配列を必ずしも表すものではないからです。しかし、ローランドらは、HIVの場合、COTウイルスは合成されると機能的であることを発見しました。最尤法再構築によって得られた合成祖先配列を用いた同様の実験でも、これらの祖先は機能的かつ免疫原性があることが示されており、[ 76 ] [ 77 ]これらの方法にある程度の信頼性を与えています。さらに、祖先再構築は、次の感染を確立した伝播HIV変異株の遺伝子配列を推測するために使用できる可能性があり、ワクチン設計の標的となる可能性のあるこれらの変異株の識別特性(伝播したウイルス集団の非ランダムな選択として)を特定することを目的としています。[ 78 ]
祖先のDNA配列を推測するのではなく、祖先のゲノムのより大規模な分子構造と内容に興味があるかもしれません。この問題は、ゲノムを遺伝子または相同領域の順列としてモデル化することによって、組み合わせ論的枠組みでアプローチされることがよくあります。これらの順列には、反転(順列のセグメントをその場で反転)、削除(セグメントを削除)、転座(順列の1つの部分からセグメントを削除して別の場所に挿入)、または組換え、重複、水平遺伝子伝達による遺伝的内容の獲得など、さまざまな操作が許可されています。ワターソンらが最初に提起した「ゲノム再編成問題」[ 17 ]は、2つのゲノム(順列)と一連の許容される操作が与えられたとき、一方のゲノムを他方のゲノムに変換する最短の操作シーケンスは何か、と問いかけています。この問題の祖先再構築に適用できる一般化は「複数ゲノム再配置問題」です。[ 79 ]ゲノムのセットと許容される操作のセットが与えられたとき、(i) 与えられたゲノムを葉とする二分木と、(ii) ツリー全体の操作の総数が最小になるように、ゲノムをツリーの内部ノードに割り当てる方法を見つけます。このアプローチは、祖先配列とともにツリーが推論される点を除いて、最小進化法に似ています。残念ながら、単一ゲノム再配置問題でさえNP困難です[ 80 ] 。数学とコンピュータサイエンスでは多くの注目を集めていますが(レビューについては、Fertin ら[ 81 ]を参照)。
祖先ゲノムの再構築は核型再構築とも呼ばれます。染色体ペインティングは現在、主な実験手法です。[ 82 ] [ 83 ]近年、研究者らは比較ゲノミクスを利用して祖先核型を再構築する計算手法を開発しました。[ 84 ] [ 85 ]さらに、比較ゲノミクスと祖先ゲノム再構築は、系統の最後の共通祖先(例: Candidatus Accumulibacter phosphatis [ 86 ] )における古代の水平遺伝子伝達イベントを特定し、形質獲得の進化的基盤を特定するために応用されています。
祖先再構築は生物学的特性に限定されません。空間的位置も特性であり、祖先再構築法は検討対象の個体の祖先の位置を推測することができます。このような技術は、Lemey ら[ 16 ]によって、ヨーロッパとアジアの 20 か所から採取された 192 の鳥インフルエンザ A-H5N1株と、アフリカ 12 か国から採取された 101 の狂犬病ウイルス配列の祖先を地理的に追跡するために使用されました。
場所を離散的な状態(国、都市など)として扱うことで、上述の離散状態モデルを適用できます。しかし、形質の状態空間が小さいモデルとは異なり、場所が多数存在する可能性があり、特定の状態間の遷移はまれにしか、あるいは全く起こらない場合があります。例えば、2つの場所の間に航空便が存在しない場合、遠く離れた場所間の移動は直接起こらない可能性があり、そのような移動はまず中間的な場所を経由する必要があります。これは、モデルにゼロまたはゼロに近いパラメータが多数存在する可能性があることを意味します。このため、Lemeyらはベイズ法を用いて、パラメータと祖先状態を推定するだけでなく、どの移動パラメータがゼロでないかを選定しました。彼らの研究は、この手法がデータのより効率的な利用につながることを示唆しています。彼らはまた、地理的構造や移動ダイナミクスに関する仮説を組み込んだ事前分布の使用についても検討しましたが、検討した事前分布は結果にほとんど影響を与えませんでした。
この分析に基づき、レミー氏を中心とする研究チームは、A-H5N1ウイルスの拡散の中心地として最も可能性が高いのは広東省であり、香港もその可能性を裏付ける結果を得た。さらに、彼らの研究結果は、西アフリカにおけるアフリカ狂犬病の長期的存在という仮説を支持するものである。
歴史的な生物地理学的パターンを推測するには、系統樹上で種の祖先分布域を再構築する必要があることが多い。[ 87 ]例えば、Cyrtandra属の植物種のよく解明された系統樹[ 87 ]が、それらの地理的分布域の情報とともに、祖先分布域再構築の4つの方法を比較するために使用された。研究チームは、Fitchの最小進化法[ 20 ](FP;最小進化法)、確率的マッピング[ 88 ](SM;最尤法)、分散-隔離分析[ 89 ](DIVA;最小進化法)、および分散-絶滅-分岐進化[ 15 ] [ 90 ](DEC;最尤法)を比較した。結果は、最小進化法は枝の長さを考慮しないため、両方の最小進化法の性能が劣ることを示した。両方の最尤法の性能は優れていた。しかし、地質学的事前情報を組み込むことができるDEC分析は、他の方法と比較して、Cyrtandraの分布域の進化についてより現実的な推論を与えた。 [ 87 ]
別の最尤法では、サンプリングされた分類群の祖先の位置を再構築することにより、遺伝子の系統地理学的履歴を復元します[ 91 ] 。この方法は、系統樹の先端で表される個体の地理座標に基づいて祖先の位置を再構築するために、空間的に明示的なランダムウォークモデルによる移動を仮定します。この方法をコーラスガエルPseudacris feriarumの系統樹に適用すると、最近の北方向への拡大、最近定着した地域での世代あたりの分散距離の増加、非中心的な祖先の位置、および方向性のある移動が復元されました。[ 91 ]

複数のゲノム再編成問題の最初の考察は、順列の観点から形式化されるずっと前の1936年にスターテバントとドブジャンスキーによって提示されました。[ 92 ]彼らは、異なる地理的場所のいくつかの系統のショウジョウバエのゲノムを調べ、彼らが「標準」と呼んだ1つの構成が、調査したすべての地域で最も一般的なものであることを観察しました。注目すべきことに、彼らはまた、1回の逆位によって標準配列から4つの異なる系統が得られ、2回目の逆位によって他の2つの系統が関連付けられることにも気づきました。これにより、彼らは配列の系統発生を仮説として立て、標準配列がおそらく祖先配列でもあると推論することができました。
インド・ヨーロッパ祖語などの古代の原言語の単語や表現の再構築は、現代語に見られる類似例に基づいて行われてきました。通常、これらの分析は「比較法」を用いて手作業で行われます。[ 93 ]まず、生物学的配列の相同性の特定と同様に、研究対象の現代語において、共通の語源を持つ異なる言語の単語(同族語)が特定されます。次に、生物学的配列のアライメントに似たステップですが、手作業で行われる同族語の個々の音の対応関係が特定されます。最後に、手作業による調査とさまざまなヒューリスティック(ほとんどの言語には鼻母音と非鼻母音の両方があるという事実など)によって、祖先の音の可能性が仮説として立てられます。[ 93 ]
祖先形質復元を実行できるソフトウェアパッケージは数多く存在します。これらのソフトウェアパッケージは、一般的に関連分野の科学者たちの努力によって開発・維持され、フリーソフトウェアライセンスの下で公開されています。以下の表は、利用可能なすべてのパッケージを網羅的に列挙したものではなく、それぞれ異なる強みと特徴を持つ祖先形質復元手法を実装した、多種多様なパッケージの代表的な例を示しています。
これらのソフトウェア パッケージの大部分は、遺伝子配列データの解析用に設計されています。たとえば、PAML [ 94 ]は、最尤法による DNA およびタンパク質配列アライメントの系統解析を行うプログラムの集合です。codeml プログラムを使用して祖先再構築を実行できます。さらに、LAZARUS は、バッチ処理と使いやすさを向上させるために PAML の祖先再構築機能をラップしたPythonスクリプトの集合です。 [ 95 ] MEGA 、HyPhy、Mesquiteなどのソフトウェア パッケージも配列データの系統解析を実行しますが、よりモジュール化されカスタマイズ可能になるように設計されています。HyPhy [ 96 ]は、祖先配列再構築の共同最尤法[ 7 ]を実装しており、バッチ言語でカスタマイズされたモデルを指定することで、地理的位置などのより一般的な範囲の離散的な祖先形質状態の再構築に容易に適応できます。 Mesquite [ 97 ]は、最大節約法と最尤法の両方を使用して、離散形質と連続形質の両方の祖先状態再構築方法を提供します。また、祖先再構築の結果を解釈するためのいくつかの視覚化ツールも提供します。MEGA [ 98 ]もモジュール式のシステムですが、分析のカスタマイズよりも使いやすさを重視しています。バージョン 5 以降、MEGA では、最大節約法、最尤法、および経験ベイズ法を使用して祖先状態を再構築できます。[ 98 ]
遺伝子配列のベイズ分析は、モデルの誤指定に対するロバスト性を高める可能性がある。MrBayes [ 99 ]は、完全な階層的ベイズアプローチを使用して、祖先ノードでの祖先状態の推論を可能にする。PHAST パッケージ[ 100 ]に配布されている PREQUEL プログラムは、祖先配列の再構築を使用して比較進化ゲノミクスを実行する。SIMMAP [ 101 ]は、系統樹に突然変異を確率的にマッピングする。BayesTraits [ 31 ] は、ベイズフレームワークで離散的または連続的な形質を分析し、進化モデルを評価し、祖先状態を再構築し、形質のペア間の相関進化を検出する。
他のソフトウェアパッケージは、定性的および定量的形質(表現型)の分析に重点を置いています。たとえば、統計計算環境Rのapeパッケージ[ 102 ]は、 ace関数を介して、最尤法を含む離散的および連続的形質の両方の祖先状態再構築のための方法も提供しています。Phyrexは、祖先遺伝子発現プロファイルを再構築するための最大節約法に基づくアルゴリズムを実装しており、さらに祖先遺伝子配列を再構築するための最尤法も実装しています(PAMLのbaseml関数をラップすることによって)。[ 103 ]
いくつかのソフトウェア パッケージも系統地理を再構築します。BEAST (Bayesian Evolutionary Analysis by Sampling Trees) [ 104 ]とBEAST 2 は、ベイズMCMCサンプリング法を使用して位置データが注釈付けされた観測された配列から祖先の地理的位置を再構築するためのツールを提供します。Diversitree [ 105 ]は、Mk2 (バイナリ 形質進化の連続時間マルコフ モデル) [ 106 ]および BiSSE (Binary State Speciation and Extinction) モデルの下で祖先状態を再構築するための方法を提供する R パッケージです。Lagrange は、系統樹上の地理的範囲の進化の再構築に関する分析を実行します。[ 15 ] Phylomapper [ 91 ]は、遺伝子流動と祖先の地理的位置の歴史的パターンを推定するための統計的フレームワークです。 RASP [ 107 ]は、統計的分散隔離分析、ラグランジュ法、ベイズ・ラグランジュ法、ベイエリア法、BBM法を用いて祖先状態を推定します。VIP [ 108 ]は、地理的に隔離された分布を調べることで、歴史的な生物地理を推定します。
ゲノム再編成は、種間の比較ゲノム学において貴重な情報を提供する。ANGES [ 109 ]は、遺伝子マーカーの祖先再構築を通じて、現存する関連ゲノムを比較する。BADGER [ 110 ]は、遺伝子再編成の歴史を調べるためにベイズアプローチを使用する。Count [ 111 ]は、遺伝子ファミリーのサイズの進化を再構築する。EREM [ 112 ]は、バイナリ文字でコード化された遺伝的特徴の獲得と喪失を分析する。PARANA [ 113 ]は、遺伝子の喪失と重複を表す祖先生物学的ネットワークの最小進化に基づく推論を実行する。
最後に、研究者がソフトウェアをインストールすることなく、さまざまな形質タイプの祖先再構築に最尤法を使用できるウェブサーバーベースのアプリケーションがいくつかあります。たとえば、Ancestors [ 114 ]は、シンテニー領域の識別と配置による祖先ゲノム再構築のためのウェブサーバーです。FastML [ 115 ]は、挿入・欠失変異の再構築にギャップ形質モデルを使用する最尤法による祖先配列の確率的再構築のためのウェブサーバーです。MLGO [ 116 ]は、最尤法による遺伝子順序解析のためのウェブサーバーです。
祖先再構築のための計算アルゴリズムの開発と応用は、分野を超えて活発な研究領域であり続けている。例えば、配列の挿入と欠失(インデル)の再構築は、より直接的な置換モデルの適用に比べて遅れている。ブシャール=コテとジョーダンは最近、インデル進化の典型的なソーン=キシノ=フェルゼンシュタインモデル[118]に対する重要な進歩を表す新しいモデル(ポアソンインデルプロセス)[117]を記述した。さらに、この分野は、カスタム装置でのシーケンス反応の広範な並列化によって数百万の核酸テンプレートから配列が生成される次世代シーケンス技術の急速な進歩によって推進されている。これらの進歩により、RNAウイルス[ 119 ]や腫瘍細胞[ 120 ]などの急速に進化する集団の遺伝的構成の「深い」スナップショットを比較的短時間で生成することが可能になった。同時に、膨大なデータ量とプラットフォーム固有のシーケンスエラープロファイルにより、祖先配列の再構築のためにこれらのデータを処理する上で、新たなバイオインフォマティクス上の課題が生じている。
この記事は、 CC BY 4.0ライセンス ( 2015 ) (査読者レポート)の下で以下のソースから改変されました: Jeffrey B Joy; Richard H Liang; Rosemary M McCloskey; T Nguyen; Art Poon (2016 年 7 月 12 日). "Ancestral Reconstruction" . PLOS Computational Biology . 12 (7) e1004763. doi : 10.1371/JOURNAL.PCBI.1004763 . ISSN 1553-734X . PMC 4942178 . PMID 27404731 . Wikidata Q28596371 .
コンピュータ プログラムとマニュアルは、ウプサラ大学から匿名 FTP で入手可能です。(文書を表示するには、ヘルプ:FTPを参照してください)