系統学および計算系統学において、最大節約法は、形質状態変化の総数を最小化する(または重み付けの異なる形質状態変化のコストを最小化する)系統樹を構築する最適性基準である。最大節約法基準の下では、最適な系統樹は相同性(すなわち、収斂進化、平行進化、および進化的逆転)の量を最小化する。言い換えれば、この基準の下では、データを説明する最短の系統樹が最良とみなされる。最大節約法の背後にある基本的な考え方のいくつかは、1970年にJames S. Farris [ 1 ] 、 1971年にWalter M. Fitch [ 2 ]によって提示された。
最大節約法は直感的で単純な基準であり、そのため広く用いられています。しかし、系統樹のスコアリング(形質状態の変化数を数えること)は容易であるものの、最も節約的な系統樹を迅速に生成するアルゴリズムは存在しません。そのため、最も節約的な系統樹は「系統樹空間」(つまり、考えられるすべての系統樹)の中から探さなければなりません。分類群の数が少ない場合(9つ未満)は、網羅的探索を行うことが可能です。網羅的探索では、考えられるすべての系統樹のスコアリングを行い、最良の系統樹を選択します。9つから20つの分類群の場合は、一般的に分岐限定法を用いる方が望ましいでしょう。分岐限定法は最良の系統樹を返すことが保証されています。分類群の数が多い場合は、ヒューリスティック探索を行う必要があります。
最も節約的な系統樹は常に可能な限り短い系統樹であるため、これは、研究対象の生物の未知の進化の歴史を実際に記述する仮想的な「真の」系統樹と比較すると、最大節約基準による「最良の」系統樹は、実際に起こり得た進化の変化を過小評価することが多いことを意味します。さらに、最大節約は統計的に一貫していません。つまり、十分なデータがあれば、高い確率で真の系統樹を生成することが保証されているわけではありません。 1978年にジョー・フェルゼンシュタインによって実証されたように、最大節約は、長枝誘引などの特定の条件下では一貫性がない場合があります。[ 3 ]一方、熱心な系統分類学者は最大節約の使用を支持しています。ブラウアーは、系統樹が間違っているかどうかは、調査対象の系統樹の中で最短かどうかという問題とは異なり、根本的に検証不可能であると主張しています。[ 4 ]
系統学において、最小進化原理は、進化に必要な変化の量を最小化する系統樹を優先するものとして解釈されることが多い(例えば[ 2 ]を参照)。あるいは、系統最小進化原理は、遺伝と共通祖先では説明できない観察された類似点の数を最小化することによって説明力を最大化する系統樹を優先するものと特徴づけることができる。[ 5 ] [ 6 ] 一方では必要な進化の変化を最小化し、他方では相同性として説明できる観察された類似点を最大化すると、系統樹に含まれる一部のグループでは観察された特徴が適用できない場合、優先される系統樹は異なる可能性があり、後者の方がより一般的なアプローチと見なすことができる。[ 7 ] [ 8 ] [ 9 ]
進化は本質的に簡潔なプロセスではないが、数世紀にわたる科学的経験は、前述の簡潔性の原則(オッカムの剃刀)を支持している。すなわち、より単純で簡潔な一連の出来事を想定する方が、より複雑で簡潔でない一連の出来事を想定するよりも好ましい。したがって、系統樹の推論や一般的な科学的説明においては、簡潔性(広義)が通常求められる。[ 10 ]
最大節約法は、離散的な系統学的形質と形質状態のマトリックスを用いて、分類群(一般的には種の集合、または単一種の生殖的に隔離された集団の集合)に対して1つ以上の最適な系統樹を推定する、形質に基づく系統樹推定法の一種です。これらの方法は、明示的な最適性基準に従って候補となる系統樹を評価することによって機能します。最も好ましいスコアを持つ系統樹が、含まれる分類群の系統関係に関する最良の仮説として採用されます。最大節約法は、ほとんどすべての種類の系統学的データに用いられます。最近まで、形態学的データに広く用いられていた唯一の形質に基づく系統樹推定法でした。
系統樹の推定は簡単な問題ではありません。適切な規模の分類群のセットであれば、膨大な数の系統樹が存在します。例えば、わずか10種の分類群でも、根なし系統樹は200万以上存在します。これらの可能性を探索して、最適性基準に従ってデータに最もよく適合する系統樹を見つける必要があります。しかし、データ自体がこの問題に対する単純な算術的解法につながるわけではありません。理想的には、表現型形質や対立遺伝子などの進化形質の分布が、進化の分岐パターンに直接従うことを期待します。したがって、2つの生物が共通の形質を持っている場合、その形質を持たない3番目の生物よりも、互いに近縁であると言えます(ただし、その形質が3つの生物すべての最後の共通祖先に存在していなかった場合に限ります。その場合は、それは共有原始形質となります)。コウモリとサルは、どちらもゾウよりも互いに近縁であると予測されます。なぜなら、オスのコウモリとサルは、ゾウにはない体外睾丸を持っているからです。しかし、コウモリとサルはクジラにはない体外睾丸を持っていますが、これら3種の最後の共通祖先種のオスは体外睾丸を持っていたと考えられるため、コウモリとサルはクジラよりも互いに近縁であるとは断言できません。
しかし、収斂進化、平行進化、および進化的逆転(総称して相同性と呼ばれる)の現象は、系統発生を推論する問題に厄介な問題を加える。いくつかの理由から、2 つの生物は、最後の共通祖先には存在しなかったと推測される形質を持つことがある。この形質の存在を単純に関係の証拠とみなすと、誤った系統樹を推論することになる。経験的な系統発生データには、かなりの相同性が含まれる可能性があり、データの異なる部分が、時には非常に異なる関係を示唆する。系統樹を推定するために使用される方法は、データ全体に最もよく適合する系統樹を選択することによって、データ内の矛盾を解決することを明示的に意図しており、一部のデータは単純に適合しないことを受け入れる。収斂はまれであると仮定する最小進化の原則はしばしば誤って信じられている。実際、収斂的に派生した形質でさえ、最大節約法に基づく系統解析において何らかの価値を持ち、収斂の普及は節約法に基づく方法の結果に体系的に影響を与えるわけではない。[ 11 ]
系統樹に完全に適合しないデータは、単なる「ノイズ」ではなく、系統樹全体と矛盾する場合でも、系統樹の一部に重要な系統学的シグナルを含んでいる可能性があります。上記のクジラの例では、クジラに外睾丸がないことは相同形質です。これは、睾丸が体内にあった哺乳類の古代の祖先に存在したと推測される状態への回帰を反映しています。クジラと古代の哺乳類の祖先との間のこの推測される類似性は、他の形質の重みに基づいて受け入れられる系統樹と矛盾します。なぜなら、外睾丸を持つ哺乳類はクジラを除外したグループを形成するはずだからです。しかし、クジラの中では、睾丸が体内に戻ることで、実際にはさまざまな種類のクジラ(イルカやネズミイルカを含む)がクジラ目(Cetacea )というグループに正しく関連付けられます。それでも、最も適合する系統樹、つまりどのデータが系統樹に適合しないかを決定することは複雑なプロセスです。最大節約法は、これを実現するために開発された方法の1つです。
最大節約法解析で使用される入力データは、様々な分類群の「形質」という形式をとります。系統形質の定義については一般的に合意されたものはありませんが、操作的には、形質は属性、つまり分類群の変異が観察される軸と考えることができます。これらの属性は、物理的(形態学的)、分子的、遺伝的、生理学的、または行動的である可能性があります。形質に関して広く合意されている唯一の点は、形質解析に使用される変異は遺伝可能な変異を反映すべきであるということです。それが直接遺伝可能でなければならないのか、あるいは間接遺伝(例えば、学習行動)が許容されるのかについては、完全には解決されていません。
各形質は離散的な形質状態に分けられ、観察された変異はこれらの状態に分類されます。形質状態は、形質基質の状態を記述する記述子として定式化されることがよくあります。たとえば、「目の色」という形質には、「青」と「茶色」という状態があるかもしれません。形質は2つ以上の状態を持つことができます(1つの状態しか持たない形質もありますが、そのような形質は最大節約分析には役立たないため、しばしば除外されます)。
系統解析のための形質のコーディングは厳密な科学ではなく、多くの複雑な問題があります。通常、分類群は、特定の属性において、異なる状態でスコア付けされた分類群よりも互いに類似している場合に、同じ状態でスコア付けされます。形質の状態が明確に区別されていない場合、または形質のすべての可能な変異を捉えられない場合は、これは単純ではありません。ヘーゼル色の目を持つ分類群(または個体)の場合、前述の形質をどのようにスコア付けすればよいでしょうか?あるいは緑色の目はどうでしょうか?前述のように、形質のコーディングは一般的に類似性に基づいています。ヘーゼル色と緑色の目は、青色に似ている(明るい)ため、青色とまとめて扱われる可能性があり、その場合、形質は「目の色:明るい、暗い」と再コーディングされる可能性があります。あるいは、「目の色:茶色、ヘーゼル色、青色、緑色」のように、複数の状態を持つ形質が存在する場合もあります。
形質状態の区別とスコアリングにおける曖昧さは、形質データを用いた系統解析において、混乱、論争、およびエラーの大きな原因となる可能性があります。上記の例では、「目:あり、なし」も可能な形質であり、目が存在しない場合は「目の色」は適用できないため、問題が生じます。このような状況では、「?」(「不明」)がスコアリングされますが、形質をスコアリングできない場合と状態が単に不明な場合を区別するために、「X」または「-」(後者は通常、配列データで使用されます)が使用されることもあります。最大節約法の現在の実装では、一般的に不明な値は同じように扱われます。データが不明である理由は、解析に特に影響しません。実際には、プログラムは「 ?」を、ツリー内で最も少ない追加ステップを必要とする状態であるかのように扱います(下記参照)。ただし、これはアルゴリズムの明示的なステップではありません。
遺伝子データは、タンパク質配列とヌクレオチド配列が本質的に離散的であるため、最大節約法などの形質に基づく系統解析法に特に適しています。ヌクレオチド配列の特定の位置は、アデニン、シトシン、グアニン、チミン/ウラシル、または配列ギャップのいずれかになります。タンパク質配列の位置(残基)は、基本アミノ酸のいずれか、または配列ギャップになります。したがって、配列決定法が特定の配列位置に対して明確な割り当てを生成できない場合を除いて、形質スコアリングはめったに曖昧になりません。配列ギャップは、どのようにコード化すべきかについてはコンセンサスはありませんが、形質として扱われることがあります。
文字は順序付けされていないものとして扱うことも、順序付けされているものとして扱うこともできます。二値(2状態)の文字の場合、これはほとんど違いがありません。多状態文字の場合、順序付けされていない文字は、ある状態から別の状態へ変化するのに等しい「コスト」(「進化イベント」の数)がかかると考えることができます。補完的に、中間状態を経由する必要はありません。順序付けされた文字は、進化を通じて状態が発生する特定の順序があり、ある状態間を移動するには中間状態を経由する必要があります。これは、異なる状態のペア間を移動するのにかかるコストが異なると考えることができます。上記の目の色の例では、順序付けされていないままにしておくことも可能で、その場合、茶色から青、緑から青、緑からヘーゼルなどへ変化するのに同じ進化「コスト」がかかります。あるいは、茶色-ヘーゼル-緑-青の順に並べることもできます。この場合、通常は茶色から緑へ変化するのに2つの進化イベント、茶色から青へ変化するのに3つの進化イベント、茶色からヘーゼルへ変化するのに1つの進化イベントのコストがかかることを意味します。これは、目が茶色から緑色に進化するには「ヘーゼル段階」を、ヘーゼルから青色に進化するには「緑色段階」を経る必要があると考えることもできます。多くの形質については、それらをどのように順序付けるべきかは明らかではありません。それとは対照的に、形状、サイズ、比率などの、基礎となる連続変数の離散化を表す形質については、順序付けは論理的であり、[ 12 ]シミュレーションでは、これにより正しい系統群を回復する能力が向上し、誤った系統群の回復が減少することが示されています。[ 13 ] [ 14 ] [ 15 ]
形質の順序付けの有用性と適切性については活発な議論が交わされているが、合意には至っていない。一部の権威は、状態間に明確な論理的、個体発生的、または進化的遷移がある場合に形質を順序付ける(例えば、「脚:短い、中程度、長い」)。一部の権威は、これらの基準の一部のみを受け入れる。一部の権威は、順序付けなしの分析を実行し、結果として得られる系統樹で明確な遷移順序を示す形質を順序付ける(この方法は循環論法であると非難される可能性がある)。一部の権威は、進化的遷移が特定の経路をたどることを要求することで分析に偏りが生じるとして、形質を全く順序付けないことを拒否する。
個々の形質に異なる重み付けを適用することも可能です。これは通常、「コスト」1を基準として行われます。したがって、一部の形質は分類群間の真の進化関係をより反映していると考えられるため、2以上の値で重み付けされることがあります。これらの形質の変化は、系統樹スコアを計算する際に、1つではなく2つの進化「ステップ」としてカウントされます(下記参照)。形質の重み付けについては、これまで多くの議論がなされてきました。現在では、ほとんどの権威はすべての形質に均等に重み付けしていますが、例外もよくあります。たとえば、対立遺伝子頻度データはビンにプールされ、順序付き形質としてスコアリングされることがあります。このような場合、形質自体の重みが下げられることが多く、対立遺伝子頻度の小さな変化は、他の形質の大きな変化よりも重要度が低くなります。また、コーディングヌクレオチド配列の3番目のコドン位置は特に不安定であり、相同性を示す可能性が高いという仮定に基づいて、重みが下げられたり、重みが0にされたりすることがあります。場合によっては、繰り返し分析が実行され、前回の分析で発見された相同性の程度に反比例して形質が再重み付けされます(逐次重み付けと呼ばれます)。これは、循環論法と見なされる可能性のある別の手法です。
文字状態の変化には、個別に重み付けをすることも可能です。これはヌクレオチド配列データでよく行われ、特定の塩基変化(AC、AT、GC、GT、およびその逆の変化)は、他の塩基変化(AG、CT、およびその逆の変化)よりも発生頻度がはるかに低いことが経験的に判明しています。そのため、これらの変化にはより大きな重みが付けられることがよくあります。文字順序付けに関する上記の議論で示したように、順序付けられた文字は、文字状態の重み付けの一形態と考えることができます。
分類学者の中には、相同性が高いことが知られている、あるいは疑われる形質、または未知数(「?」)が多数存在する形質を除外することを好む者もいる。しかし、後述するように、理論的およびシミュレーション的研究により、これは精度を向上させるどころか、むしろ低下させる可能性が高いことが示されている。末端分類群で変異を示す形質についても同様である。理論的、一致性、およびシミュレーション研究はいずれも、このような多型形質が重要な系統学的情報を含んでいることを示している。
系統解析(またはあらゆる系統解析)に必要な時間は、解析に含まれる分類群(および形質)の数に比例します。また、分類群が多いほど推定すべき枝の数が増えるため、大規模な解析では不確実性が高まることが予想されます。データ収集にかかる時間と費用は、多くの場合、含まれる分類群の数に比例するため、ほとんどの解析では、サンプリングできたはずの分類群のごく一部しか含まれていません。実際、一部の研究者は、正確な系統解析には4つの分類群(意味のある無根系統樹を作成するために必要な最小数)だけで十分であり、系統学においては分類群の数よりも形質の数の方が価値があると主張しています。このことが、分類群のサンプリングに関する激しい論争を引き起こしました。
実証的、理論的、およびシミュレーション研究により、適切な分類群サンプリングの重要性が劇的に実証されてきた。これらのほとんどは、単純な観察によって要約できる。系統発生データ行列は、形質×分類群の次元を持つ。分類群の数を2倍にすると、形質の数を2倍にした場合と同様に、行列の情報量も確実に2倍になる。各分類群は、すべての形質について新しいサンプルを表すが、さらに重要なのは、(通常)形質状態の新しい組み合わせを表すということである。これらの形質状態は、その分類群が系統樹上のどこに配置されるかを決定するだけでなく、分析全体に情報を提供し、形質変化のパターンの推定値を変えることで、残りの分類群間の異なる関係が優先される可能性もある。
系統樹解析における最も厄介な弱点である長枝誘引(後述)は、分類群のサンプリングが不十分な場合、特に4分類群の場合に顕著に現れる。これは、追加の形質サンプリングを行っても推定精度が向上しない可能性がある、よく知られたケースである。分類群が追加されると、多くの場合、長い枝が分断され(特に化石の場合)、その結果、枝に沿った形質状態の変化の推定精度が向上する。分類群サンプリングによって追加される情報が豊富になるため、わずか数千の形質を用いて、数百の分類群を含む系統樹の非常に正確な推定値を得ることも可能である。
多くの研究が行われてきたものの、分類群サンプリング戦略に関しては、まだ多くの課題が残されている。コンピュータ性能の向上、分子配列決定のコスト削減と自動化の進展により、サンプルサイズは全体的に増加傾向にあり、数百の分類群(あるいは遺伝子などの末端要素)間の関係性を扱う研究が一般的になりつつある。もちろん、これは形質を追加することが無益だということを意味するものではない。形質の数自体も増加している。
分類学者の中には、未知の形質エントリ(「?」)の数が多い、あるいは解析において系統樹上で頻繁に「飛び回る」(つまり「ワイルドカード」となる)傾向があるという理由で、分類群を除外することを好む者もいる。しかし、後述するように、理論的およびシミュレーション的研究により、この方法は精度を向上させるどころか、むしろ低下させる可能性が高いことが示されている。これらの分類群はより節約的な系統樹を生成する可能性があるものの(後述参照)、合意サブツリーや縮小コンセンサスなどの手法を用いることで、関心のある系統関係に関する情報を抽出することは可能である。
分類群を増やすと、全体的な支持値(ブートストラップパーセンテージまたは減衰指数、下記参照)が低下する傾向があることが観察されています。この原因は明らかです。ツリーに追加の分類群が追加されると、それらが接続する枝が細分化され、その枝を支持する情報が希釈されます。個々の枝の支持は低下しますが、全体的な関係の支持は実際に増加します。次のツリーを生成する分析を考えてみましょう。(魚、(トカゲ、(クジラ、(ネコ、サル))))。ネズミとセイウチを追加すると、ネズミとセイウチがこのクレード内またはクレード外に属する可能性があり、これら 5 つの動物はすべて比較的近縁であるため、それらの関係についての不確実性が高まるため、(クジラ、(ネコ、サル))クレードの支持は低下するでしょう。誤差の範囲内で、これらの動物の互いの関係を決定することは不可能かもしれません。しかし、ネズミとセイウチは、魚またはトカゲを除くこれらの哺乳類の任意の 2 つのグループを固める形質データを追加するでしょう。例えば、魚類とクジラにヒレがあることで最初の分析が誤解を招く可能性があったとしても、クジラのような脂肪とヒレを持ちながら、ネコやネズミのようなヒゲを持つセイウチの存在は、クジラを哺乳類にしっかりと結びつける。
この問題に対処するため、合意サブツリー、縮小コンセンサス、および二重減衰分析は、系統樹全体ではなく、支持された関係(「n分類群ステートメント」の形式、例えば「(魚、(トカゲ、(ネコ、クジラ)))」のような4分類群ステートメント)を特定しようとします。比較系統学の場合のように、分析の目的が解決された系統樹である場合、これらの方法では問題を解決できません。しかし、系統樹の推定値が非常に支持されていない場合、その系統樹から得られる分析結果は、いずれにしても疑わしいものとなり、使用できないでしょう。
最大節約法解析は非常に単純な手順で実行されます。系統樹は、形質データの最も節約的な分布を示唆する度合いに応じてスコアリングされます。データセットに対して最も節約的な系統樹は、解析対象の分類群間の関係に関する最も妥当な仮説を表します。
ツリーは、各形質の分布を説明するために必要な「ステップ」(進化的な遷移)の数を決定する単純なアルゴリズムを使用してスコアリング(評価)されます。ステップとは、本質的にはある形質状態から別の形質状態への変化ですが、順序付けられた形質の場合、遷移には複数のステップが必要になることがあります。一般的に考えられているのとは異なり、このアルゴリズムはツリー上のノード(分岐点)に特定の形質状態を明示的に割り当てるわけではありません。最小ステップ数でも、進化的な遷移の割り当てと分布は複数回行われ、それぞれに同等のコストがかかります。最適化されるのは、変化の総数です。
8つ以上の分類群の場合、網羅的に探索できる系統樹の数は、実際にははるかに多い。そのため、多数のアルゴリズムを用いて、考えられる系統樹の中から最適なものを探す。これらのアルゴリズムの多くは、初期系統樹(通常はアルゴリズムの最後の反復で得られた最も有力な系統樹)を取り上げ、それを摂動させて、変更によってより高いスコアが得られるかどうかを確認するというものである。
最小進化探索によって得られる系統樹は根なし系統樹です。つまり、含まれる分類群間のあらゆる関係性は示されますが、分岐の相対的な時間については何も示されません。ユーザーは特定の枝を選択して系統樹の根とします。この枝は、系統樹の他のすべての枝の外側に位置し、他の枝は単系統群を形成します。これにより、系統樹に相対的な時間感覚が与えられます。根の選択を誤ると、根なし系統樹自体は正しくても、系統樹上の関係性が誤って示される可能性があります。
最小進化解析では、多くの場合、同等に最小進化的な系統樹 (MPT) が複数得られます。MPT の数が多いことは解析の失敗とみなされることが多く、データセット内の欠損エントリ ("?") の数、相同性が高すぎる形質、またはトポロジー的に不安定な「ワイルドカード」分類群 (欠損エントリが多い場合がある) の存在に関連していると広く考えられています。MPT の数を減らすために、解析前に欠損データが多い形質や分類群を除去する、相同性の高い形質を除去または重みを下げる (逐次重み付け)、またはワイルドカード分類群を事後的に除去 (系統幹法)してからデータを再解析するなど、数多くの方法が提案されています。
数多くの理論的およびシミュレーション研究により、高度に相同な形質、欠損データが多い形質および分類群、および「ワイルドカード」分類群が分析に寄与することが実証されています。形質または分類群を除外すると解像度が向上するように見えるかもしれませんが、結果として得られるツリーはより少ないデータに基づいているため、系統発生の信頼性の低い推定値となります(形質または分類群が情報を持たない場合を除きます。安全な分類学的削減を参照してください)。今日の一般的なコンセンサスは、複数のMPTが存在することは有効な分析結果であるということです。これは、ツリーを完全に解決するのに十分なデータがないことを単に示しているだけです。多くの場合、MPTには実質的な共通構造があり、違いはわずかで、いくつかの分類群の配置の不確実性に関係しています。このセット内の関係を要約する方法はいくつかあり、すべての分類群間の共通の関係を示すコンセンサスツリーや、すべてのツリーから「ワイルドカード」分類群を一時的に剪定してすべてが一致するまで共通の構造を示す剪定合意サブツリーなどがあります。縮小コンセンサスは、入力ツリーによってサポートされているすべてのサブツリー(したがってすべての関係)を表示することで、これをさらに一歩進めます。
複数のMPTが返されたとしても、パースモニー分析は基本的に点推定値しか生成せず、信頼区間は一切提供しません。最も簡潔な系統樹を推定する際には必ず誤差が生じるため、この点はしばしば批判の対象となってきました。また、この手法には、結論がこの誤差にどの程度敏感であるかを判断する手段が本質的に含まれていないことも問題です。支持度を評価するために、いくつかの方法が用いられてきました。
ジャックナイフ法とブートストラップ法は、よく知られた統計的再サンプリング手法であり、系統解析に用いられてきた。ジャックナイフ法は、非復元抽出(「リーブワンアウト」)による再サンプリングであり、形質または分類群に適用できる。後者の場合、関心のある変数が系統樹であるため、異なる分類群を持つ系統樹の比較は容易ではなく、解釈が複雑になる可能性がある。ブートストラップ法は、復元抽出による再サンプリング(サイズxのサンプルからx個の項目をランダムに抽出するが、項目は複数回選択可能)であり、重複する分類群を追加しても系統解析の結果は変わらないため、形質にのみ用いられる。ブートストラップ法は、系統学(および他の分野)においてより一般的に用いられている。どちらの方法も、元のデータに摂動を加えた後に解析を行う、任意ではあるが多数の反復処理を伴う。各解析から得られたMPTはプールされ、結果は通常、50%多数決コンセンサスツリー上に表示され、個々の枝(またはノード)には、それらが出現するブートストラップMPTの割合がラベル付けされます。この「ブートストラップパーセンテージ」(時々主張されるようにP値ではありません)は、支持の尺度として使用されます。技術的には、これは再現性の尺度、つまり分類群を再度サンプリングした場合にその枝(ノード、クレード)が回復される確率であるはずです。ウイルス系統樹を用いた実験的テストでは、ブートストラップパーセンテージは系統学の再現性の適切な推定値ではないものの、精度の妥当な推定値であることが示唆されています。実際、精度の推定値としてのブートストラップパーセンテージにはバイアスがあり、このバイアスは平均的に信頼度の過小評価につながることが示されています(つまり、70%程度の支持でも実際には最大95%の信頼度を示す可能性があります)。しかし、バイアスの方向は個々のケースでは確認できないため、ブートストラップ支持値が高いほど信頼度も高いと仮定するのは不当である。
サポートを評価するもう 1 つの方法は、ブレーマーサポート[ 16 ] [ 17 ]または減衰指数です。これは、上記のブートストラップとジャックナイフ手順のように擬似複製サブサンプルに基づく推定値ではなく、特定のデータセットのパラメータです。ブレーマー サポート (ブランチ サポートとも呼ばれる) は、MPT のスコアと、特定のクレード (ノード、ブランチ) を含まない最も節約的なツリーのスコアとの間のステップ数の差です。これは、そのクレードを失うために追加する必要のあるステップ数と考えることができます。暗黙のうちに、分析によってクレードがサポートされなくなるには、MPT のスコアの推定値の誤差がどれだけ大きくなければならないかを示唆することを意図していますが、必ずしもそうではありません。ブランチ サポートの値は、中程度のサイズのデータセットではかなり低いことが多い (1 または 2 ステップが一般的) が、ブートストラップの割合に比例しているように見えることが多いです。データ行列が大きくなるにつれて、ブートストラップ値が 100% でプラトーに達する一方で、ブランチサポート値は増加し続けることが多い。したがって、大規模なデータ行列の場合、ブランチサポート値は、強く支持されているブランチのサポートを比較するためのより有益な手段を提供する可能性がある。[ 18 ] ただし、減衰値の解釈は単純ではなく、ブートストラップに哲学的異議を唱える著者によって好まれるようである(ただし、多くの形態学的分類学者、特に古生物学者は両方を報告する)。ダブル減衰分析は、ツリー内のすべての可能なサブツリー関係(n 分類群ステートメント)の減衰指数を評価する、縮小コンセンサスの減衰対応物である。

最大節約法は、認識論的に単純なアプローチであり、メカニズムに関する仮定をほとんど必要としないため、人気があります。しかし、特定の状況下では統計的に一貫していない可能性があります。この文脈での一貫性とは、データ量が増えるにつれて、方法が正しい答えに近づくことしかできないことを意味し、統計的方法の望ましい特性です。1978 年にJoe Felsensteinによって実証されたように、最大節約法は特定の条件下では一貫性がない場合があります。このようなことが起こることが知られている状況のカテゴリは、長枝誘引と呼ばれ、たとえば、2 つの形質 (A と C) には長い枝 (置換レベルが高い) があり、他の 2 つの形質 (B と D) には短い枝がある場合に発生します。A と B は共通の祖先から分岐し、C と D も同様です。[ 3 ]
簡略化のため、ここでは単一のバイナリ文字(+ または - のいずれか)を考えているものとします。B から D までの距離は小さいため、ほとんどの場合、B と D は同じになります。ここでは、両方とも + であると仮定します(+ と - は任意に割り当てられ、それらを入れ替えるのは定義の問題にすぎません)。この場合、残りの可能性は 4 つあります。A と C が両方とも + の場合、すべての分類群は同じで、すべてのツリーの長さは同じになります。A が + で C が - の場合、1 つの文字だけが異なり、すべてのツリーの長さが同じなので、何も学ぶことはできません。同様に、A が - で C が + の場合も考えられます。残りの可能性は、A と C が両方とも - の場合のみです。ただし、この場合、証拠は A と C が一緒に、B と D が一緒にグループ化されることを示唆しています。結果として、「真のツリー」がこのタイプのツリーである場合、収集するデータが増えるほど(つまり、研究する文字が増えるほど)、証拠は間違ったツリーを支持することになります。
長枝誘引は、もともと個々の分類群の進化速度が大きく異なるデータセット(異質進化)で説明されました。その後、5つ以上の分類群では、進化速度の変動がなくても発生する可能性があることが示されました。さらに大きな系統樹では、系統樹のすべてのエッジが同じ期待変化数を持っている場合でも、矛盾が生じる可能性があります。距離値を非線形的に複数ヒットに対して調整すると、最大節約法を整合させることが可能になるようです。[ 19 ]
最大節約法の支持者(すなわち古典的な系統分類学者)は、不適切なモデルが真の進化の歴史から逸脱した系統樹を生成する場合、モデルベースの方法も「統計的に一貫していない」と反論する。彼らは、実際のデータでは真の進化の歴史は知り得ないため、いかなる方法も潜在的に矛盾する可能性があり、それを知る方法はないと主張する。したがって、系統分類学者は、統計的矛盾は純粋に形而上学的な問題であり、経験的検証の領域外であると結論づける。[ 4 ]
最大節約法やその他の最適性基準に基づく系統解析法のもう一つの複雑な点は、最短の系統樹を見つけることがNP困難問題であることです。[ 20 ]任意の数の分類群が与えられた場合、現在利用可能な唯一の効率的な解法は、最短の系統樹が回復されることを保証しないヒューリスティック法を使用することです。これらの方法は、ヒルクライミングアルゴリズムを使用して、最良の系統樹に徐々に近づいていきます。しかし、最適ではない解の「系統樹の島」が存在する可能性があり、解析がこれらの局所最適解に陥る可能性があることが示されています。したがって、系統樹空間が十分に探索されたことを保証するために、複雑で柔軟なヒューリスティックが必要です。最近傍交換(NNI)、系統樹二分再接続(TBR)、節約ラチェットなど、いくつかのヒューリスティックが利用可能です。
特に古生物学において大きな問題となっているのは、最大節約法が、2つの種が同じ位置で同じヌクレオチドを共有できる唯一の方法は、それらが遺伝的に関連している場合であると仮定している点であると主張されてきた。これは、最大節約法の系統発生学的応用は、すべての類似性が相同であると仮定している(2つの生物が全く関連していない可能性があるという主張など、他の解釈は意味をなさない)と主張している。これは断じて事実ではない。あらゆる形態の形質に基づく系統発生推定と同様に、最大節約法は、すべての類似性を最もよく説明する系統樹を見つけることによって、類似性の相同性を検証するために使用される。
「進化は簡潔ではない」ため、系統推定において最小進化原理は関係ないとよく言われます。ほとんどの場合、明確な代替案は提示されていません。代替案がない場合、統計的手法は何もないよりはましです。さらに、「進化は簡潔である」という主張が実際に正しい場合、それが何を意味するのかは明確ではありません。これは、最小進化原理を用いて予測されるよりも多くの形質変化が歴史的に起こった可能性があるという意味に解釈されるかもしれません。最小進化原理に基づく系統推定は、系統樹を説明するために必要な最小限の変化数を再構築するため、これは十分にあり得ます。しかし、シミュレーション研究、既知のin vitroウイルス系統樹を用いたテスト、および他の手法との一致性により、ほとんどの場合、最小進化原理の精度はこれによって損なわれないことが示されています。最小進化原理分析は、系統樹上の形質変化の数を使用して最適な系統樹を選択しますが、その数だけの変化によってのみ系統樹が生成されたとは限らないのです。考慮されていない変更が系統樹全体にランダムに分布している限り(これは妥当な帰無仮説である)、結果に偏りは生じないはずである。実際、この手法は頑健であり、最大節約法は変更が最も少ない系統樹を選択するため、偏りは最小限に抑えられる。
請負業者を選定する際に、最初の(拘束力のない)見積もりに基づいて選定する場合と類似点が見られます。実際の完成費用は見積もりよりも高くなる可能性が非常に高いです。それでも、理論的には、最も低い見積もりを提示した請負業者を選定すれば、最終的なプロジェクト費用は最も低くなるはずです。これは、他のデータがない場合、関連するすべての請負業者が同じコスト超過リスクを抱えていると想定されるためです。もちろん、実際には、不正な商慣行によってこの結果が歪められる可能性があります。系統発生学においても、特定の系統発生上の問題(例えば、前述の長枝誘引)によって結果が歪められる可能性があります。しかし、どちらの場合も、見積もり自体に基づいて、結果が歪められるかどうか、あるいはどの程度歪められるかを判断する方法はありません。簡潔性の場合も同様で、他の証拠と比較しない限り、データが明らかに誤解を招くものであると判断することはできません。
最小進化原理は、進化的な変化はまれである、あるいは相同性(収斂と逆転)は進化において最小限であるという立場を暗黙のうちに採用しているとよく言われる。しかし、これは完全に正しいとは言えない。最小進化原理は、好ましい系統樹で想定される収斂と逆転の数を最小限に抑えるが、その結果、比較的多くの相同性事象が生じる可能性がある。より適切な表現としては、最小進化原理はデータによって示唆される最小限の変化のみを想定していると言うべきだろう。前述のように、これはこれらの変化が唯一起こった変化であることを意味するのではなく、単に証拠のない変化を推論しないということである。ファリス[ 5 ]の言葉を言い換えると、これを簡潔に表現すると、 「最小進化原理は想定される相同性を最小限に抑えるが、相同性が最小限であるとは想定しない」ということになる。
最近のシミュレーション研究では、形態学的データに対してベイズアプローチを用いて構築された系統樹よりも、最小進化法の方が精度が低い可能性があることが示唆されている[ 21 ] 。これは過剰精度によるものかもしれないが[ 22 ] 、これについては異論もある[ 23 ] 。新しいシミュレーション手法を用いた研究では、推論手法間の違いは、使用される最適化ではなく、採用された探索戦略と合意形成手法に起因することが示されている[ 24 ] 。また、38の分子データセットと86の形態学的経験的データセットの分析では、モデルベースの系統学で使用される進化モデルで想定される共通のメカニズムは、ほとんどの分子データセットには適用されるが、形態学的データセットにはほとんど適用されないことが示されている[ 25 ] 。この発見は、分子データに対するモデルベースの系統学の使用を正当化するが、形態学的データについては、少なくとも表現型データに対してより洗練されたモデルが利用可能になるまでは、最小進化法が有利であることを示唆している。
離散形質データに基づいて系統樹を推定する方法は他にもいくつかあり、最尤法やベイズ推論などがある。それぞれに潜在的な利点と欠点がある。実際には、これらの方法は同じデータセットに対して最も節約的な系統樹に非常によく似た系統樹を好む傾向がある。[ 26 ]しかし、進化プロセスの複雑なモデリングが可能であり、方法のクラスとして統計的に一貫性があり、長枝誘引の影響を受けない。ただし、尤度法とベイズ法のパフォーマンスは、使用される特定の進化モデルの質に依存することに注意する必要がある。誤ったモデルは、節約法と同様に、偏った結果を生み出す可能性がある。さらに、節約法に比べて計算速度がかなり遅く、大規模なデータセットを実行するのに数週間かかる場合もある。これらの方法のほとんどには、特に熱心な支持者と反対者がいる。特に節約法は、哲学的に優れていると主張されてきた(最も有名なのは、熱心な分岐分類学者による)。[ a ]形態学的データの解析は、依然として最小進化原理が大きな影響力を持つ分野の一つである。なぜなら、最近まで非分子データには形質変化の確率モデルが利用できず、現在でも広く実装されていないからである。最小進化原理は、系統樹内の進化(「モデル」)パラメータ(例えば、進化変化の速度)の大きな変化に直面しても、真の系統樹を回復する可能性が高いことも最近示されている。[ 27 ]
距離行列は系統樹の生成にも使用できます。非パラメトリック距離法は、もともと表現型データにペアワイズ距離行列を使用して適用され、調整されて系統樹が生成されました。距離行列は、免疫学的距離、形態計測分析、遺伝的距離など、さまざまなソースから得られます。系統形質データの場合、生の距離値は、形質状態のペアワイズ差の数を単純に数える(マンハッタン距離)か、進化モデルを適用することによって計算できます。注目すべきは、距離法は、DNA-DNAハイブリダイゼーションアッセイなど、形質データに容易に変換できないデータも使用できることです。今日では、形質を距離に変換する際に系統的に有益なデータが失われる可能性があるため、距離ベースの方法はしばしば好ましくないものとされています。距離行列法と最適性基準は数多くありますが、その中でも最小進化基準は最大節約法に最も密接に関連しています。
距離法の中には、最小進化(ME)として知られる系統推定基準があり、これは最大節約法と同様に、枝の長さの合計が最短となる系統樹を探すという側面を共有している。[ 28 ] [ 29 ]
最大節約基準とME基準には微妙な違いがある。最大節約基準は、より複雑な分類群に対する最も単純な進化仮説の妥当性というアブダクション的ヒューリスティックに基づいているのに対し、ME基準は、分類群からの進化距離が真の進化距離の偏りのない推定値であれば、分類群の真の系統樹の長さは、それらの距離と互換性のある他のどの代替系統樹よりも短くなるという、キッドとスガラメラ=ゾンタの推測(22年後にルジェツキーとネイ[ 30 ]によって正しいと証明された)に基づいている。ルジェツキーとネイの結果は、ME基準をオッカムの剃刀の原理から解放し、確固たる理論的かつ定量的基盤を与えた。[ 31 ]