計算系統学、系統推論、または系統推論は、系統解析に関わる計算アルゴリズムと最適化アルゴリズム、ヒューリスティクス、およびアプローチに焦点を当てています。目標は、一連の遺伝子、種、または分類群間の最適な進化的祖先を表す系統樹を見つけることです。最尤法、最小進化法、ベイズ法、および最小進化法は、系統樹のトポロジーが配列データをどれだけうまく説明しているかを評価するために使用される典型的な最適性基準です。[ 1 ] [ 2 ]ツリー再配置として知られる最近傍交換 (NNI)、部分木剪定および再接合 (SPR)、およびツリー二分および再接続 (TBR)は、最適または最良の系統樹を探索するための決定論的アルゴリズムです。最適な系統樹を探索する空間と景観は、系統探索空間として知られています。
最大尤度(尤度とも呼ばれる)最適性基準は、配列データを観測する確率が最も高くなるような系統樹のトポロジーとその枝長を見つけるプロセスであり、一方、最小進化最適性基準は、系統樹が配列データを説明するために必要な状態進化変化の最小数である。[ 1 ] [ 2 ]
従来の系統学は、代表的な生物の表現型特性を測定・定量化することによって得られる形態学的データに基づいているのに対し、より新しい分野である分子系統学は、遺伝子をコードするヌクレオチド配列やタンパク質をコードするアミノ酸配列を分類の基礎として用いる。
分子系統学の多くの手法は、系統樹の構築と改良において配列アライメントと密接に関連しており、またそれを広く利用している。系統樹は、異なる種のゲノムに存在する相同遺伝子間の進化的な関係を分類するために用いられる。計算手法によって構築された系統樹は、分析対象種間の歴史的な関係を表す進化系統樹を完全に再現することはまずない。また、歴史的な種系統樹は、それらの種が共有する個々の相同遺伝子の歴史的な系統樹とは異なる場合もある。
系統樹は、入力データと使用するアルゴリズムに応じて、根付き系統樹または根なし系統樹のいずれかになります。根付き系統樹は、最近共通祖先(MRCA)を明示的に特定する有向グラフであり、通常は入力データには含まれていない入力配列です。遺伝的距離尺度を使用して、入力配列を葉ノードとし、根からの距離を仮説上のMRCAからの遺伝的距離に比例させた系統樹をプロットできます。根を特定するには、通常、対象となる配列と遠縁であることが知られている少なくとも1つの外群を入力データに含める必要があります。
対照的に、無根木は入力配列間の距離と関係を、それらの系統に関する仮定をせずにプロットします。無根木は常に根付き木から生成できますが、分子時計仮説の仮定などの分岐率に関する追加データがない限り、通常は無根木に根を配置することはできません。[ 3 ]
与えられた入力配列群に対するすべての可能な系統樹の集合は、最適化アルゴリズムによって探索経路をたどることができる離散的に定義された多次元ツリー空間として概念化できます。入力配列数が非自明な場合、ツリートポロジーの定義の変動によりツリーの総数を数えることは複雑になる可能性がありますが、与えられた入力数とパラメータの選択に対して、根付きツリーは根なしツリーよりも多いことは常に真実です。[ 2 ]
根付き系統樹と根なし系統樹はどちらも、さらに根付きまたは根なし系統ネットワークに一般化することができ、これにより、交雑や水平遺伝子伝達などの進化現象をモデル化することが可能になります。
形態系統学における基本的な問題は、比較対象となる各分類群から、分類器として使用される各表現型特性の代表的な測定値へのマッピングを表すマトリックスを構築することである。このマトリックスの構築に使用される表現型データの種類は、比較対象となる分類群によって異なる。個々の種については、平均体サイズ、特定の骨の長さやサイズ、その他の身体的特徴、あるいは行動的特徴の測定値が含まれる場合がある。もちろん、考えられるすべての表現型特性を測定して分析用に符号化することはできないため、どの特徴を測定するかの選択は、この方法における主要な固有の障害となる。マトリックスの基礎として使用する形質を決定することは、必然的に、種または上位分類群のどの形質が進化的に関連しているかについての仮説を表す。[ 4 ]形態学的研究は、表現型の収斂進化の例によって混乱する可能性がある。[ 5 ]有用なクラスを構築する上での大きな課題は、表現型の変異の分布において分類群間で重複する可能性が高いことである。絶滅した分類群を形態学的分析に含めることは、化石記録が存在しない、あるいは不完全なため困難な場合が多いが、生成される系統樹に大きな影響を与えることが示されている。ある研究では、絶滅した類人猿種を含めた場合にのみ、分子データから生成された系統樹と一致する形態学的に導出された系統樹が得られた。[ 6 ]
表現型の分類の中には、特に非常に多様な分類群を分析する際に用いられるものは、離散的で曖昧さがないものがあります。例えば、生物に尾があるかないかを分類することは、ほとんどの場合簡単です。目や脊椎などの特徴を数えるのも同様です。しかし、連続的に変化する表現型の測定値を最も適切に表現する方法は、一般的な解決策のない議論の的となっています。一般的な方法は、関心のある測定値を単純に2つ以上のクラスに分類し、連続的に観察される変化を離散的に分類できるようにすることです(例えば、上腕骨が特定のカットオフ値より長い例はすべて1つの状態のメンバーとしてスコアリングされ、上腕骨がカットオフ値より短い例はすべて2番目の状態のメンバーとしてスコアリングされます)。この方法では、操作しやすいデータセットが得られますが、クラス定義の根拠の報告が不十分であること、測定値の連続的な加重分布を用いる方法と比較して情報が犠牲になっていることが批判されています。[ 7 ]
形態学的データは、文献資料からであれ野外観察からであれ、収集に非常に多くの労力を要するため、以前に作成されたデータ行列を再利用することは珍しくないが、これは元の行列の欠陥を複数の派生分析に伝播させる可能性がある。[ 8 ]
分子解析における文字コーディングの問題は、生物学的配列データにおける文字が、DNAまたはRNA配列における明確なヌクレオチド、タンパク質配列における明確なアミノ酸など、明確かつ離散的に定義されているため、大きく異なります。しかし、多重配列アライメントの固有の難しさから、相同性を定義することは困難です。ギャップのあるMSAの場合、どの変化が突然変異でどの変化が祖先形質なのか、どの事象が挿入突然変異でどの欠失突然変異なのかという解釈が異なる、複数の根付き系統樹を構築できます。たとえば、ギャップ領域を含むペアワイズアライメントのみが与えられた場合、一方の配列が挿入突然変異を持っているのか、もう一方の配列が欠失を持っているのかを判断することは不可能です。この問題は、アライメントされていない、または重複していないギャップのあるMSAではさらに深刻になります。実際には、系統樹の構築において、ノイズの多いデータが系統樹の計算に組み込まれないように、計算されたアライメントの大きな領域が無視される場合があります。
異なる生物に見られる単一の遺伝子(オルソログ)に基づいて構築されたツリーは、強力な結論を導き出すのに十分な系統学的シグナルを示さない可能性があります。それぞれの多重配列アライメントを連結して「スーパーマトリックス」にすることで、より多くの遺伝子を追加し、ツリー推論に利用できる進化的変化が豊富な巨大な仮想遺伝子を効果的に作成します。この単純な方法は、類似した進化の歴史を持つ遺伝子にのみ有効です。より複雑なケース(オルガネラ+核データセットまたはアミノ酸+ヌクレオチドの結合アライメント)では、一部のアルゴリズムは、各遺伝子の開始位置と終了位置を知らせることができます(データ分割)。あるいは、複数の単一遺伝子ツリーを推論し、それらをスーパーツリーに結合することもできます。系統ゲノミクスの出現により、数百の遺伝子を一度に分析できるようになりました。[ 9 ]
距離行列法による系統解析は、分類対象の配列間の「遺伝的距離」の尺度に明示的に依存するため、入力として MSA を必要とします。距離は、多くの場合、アラインメントされた位置でのミスマッチの割合として定義され、ギャップは無視されるか、ミスマッチとしてカウントされます。[ 3 ]距離法は、各配列ペア間の距離を記述する配列クエリセットから全対全行列を構築しようとします。これによって、密接に関連する配列を同じ内部ノードの下に配置し、その枝の長さが配列間の観測された距離を忠実に再現する系統樹が構築されます。距離行列法は、計算に使用されるアルゴリズムに応じて、根付きツリーまたは根なしツリーのいずれかを生成する可能性があります。これらは、プログレッシブおよび反復型の多重配列アラインメントの基礎として頻繁に使用されます。距離行列法の主な欠点は、複数のサブツリーに現れる局所的な高変異領域に関する情報を効率的に使用できないことです。[ 2 ]
UPGMA (非加重ペアグループ法、算術平均)法とWPGMA (加重ペアグループ法、算術平均)法は、根付きツリーを生成し、一定速度の仮定を必要とします。つまり、根からすべての枝の先端までの距離が等しい超距離ツリーを仮定します。 [ 10 ]
近隣結合法は、遺伝的距離をクラスタリング指標として用いて、一般的なクラスタリング手法を配列解析に適用する。単純な近隣結合法は根なしツリーを生成するが、系統間で一定の進化速度(すなわち分子時計)を仮定しない。[ 11 ]
Fitch –Margoliash法は、遺伝的距離に基づくクラスタリングに重み付き最小二乗法を使用します。 [ 12 ]系統樹構築プロセスでは、近縁の配列に重みを大きく与え、遠縁の配列間の距離測定の不正確さの増加を補正します。アルゴリズムへの入力として使用される距離は、近縁グループと遠縁グループ間の関係を計算する際に大きなアーティファクトが発生しないように正規化する必要があります。この方法で計算される距離は線形である必要があります。距離の線形性基準では、 2つの個々の枝の枝長の期待値が、2つの枝の距離の合計の期待値と等しくなければなりません。この特性は、個々の部位での逆突然変異の可能性が補正されている場合にのみ生物学的配列に適用されます。この補正は、DNA進化のJukes-Cantorモデルから導出された置換行列などを使用して行われます。距離補正は、実際には、枝間で進化速度が異なる場合にのみ必要です。[ 2 ]アルゴリズムの別の修正は、特に距離が集中している場合に役立ちます(測定の集中現象と次元の呪いを参照してください)。 [ 13 ]で説明されているその修正は、アルゴリズムの効率と堅牢性を向上させることが示されています。
これらの距離に適用される最小二乗基準は、近隣結合法よりも精度は高いが効率は低い。データセット内の多くの密接に関連する配列から生じる距離間の相関を補正する追加の改善も、計算コストの増加を伴って適用できる。任意の補正係数を持つ最適な最小二乗ツリーを見つけることはNP完全であるため[ 14 ]、最大節約分析で使用されるようなヒューリスティックな探索方法がツリー空間の探索に適用される。
配列またはグループ間の関係に関する独立した情報は、ツリー検索空間を縮小し、根なしツリーに根を付けるために使用できます。距離行列法の標準的な使用法では、クエリ セット内の対象配列と遠縁であることがわかっている少なくとも 1 つのアウトグループ配列を含める必要があります。 [ 3 ]この使用法は、一種の実験的コントロールと見なすことができます。アウトグループが適切に選択されていれば、他のどの配列よりも遺伝的距離がはるかに大きくなり、したがって枝の長さが長くなり、根付きツリーの根の近くに現れます。適切なアウトグループを選択するには、対象配列と中程度に関連する配列を選択する必要があります。関係が近すぎるとアウトグループの目的が損なわれ、遠すぎると分析にノイズが加わります。 [ 3 ]また、配列が取得された種が遠縁であるが、配列によってコードされる遺伝子が系統間で高度に保存されている状況を避けるように注意する必要があります。水平遺伝子伝達、特にそれ以外は分岐している細菌間での伝達も、アウトグループの使用を混乱させる可能性があります。
最大節約法(MP法)は、観測された配列データを説明するために必要な進化事象の総数が最小となる系統樹を特定する手法です。系統樹を評価する方法の中には、特定の種類の進化事象に関連付けられた「コスト」を含め、総コストが最小となる系統樹を見つけようとするものもあります。これは、すべての種類の事象が等しく起こりやすいとは限らない場合、例えば、特定のヌクレオチドやアミノ酸が他のものよりも変異しやすいことがわかっている場合などに有効なアプローチです。
最も簡潔な系統樹を特定する最も素朴な方法は、単純な列挙、つまり考えられるすべての系統樹を順に検討し、スコアが最小の系統樹を探すことです。しかし、最も簡潔な系統樹を特定する問題はNP困難であることが知られているため、これは比較的少数の配列または種に対してのみ可能です。[ 2 ]そのため、セットの中で最良ではないにしても、非常に簡潔な系統樹を見つけるための最適化のためのヒューリスティック探索法が数多く開発されています。このような方法のほとんどは、系統樹の再配置基準に基づいて動作する最急降下法のような最小化メカニズムを伴います。
分岐限定法は、 NP困難問題の準最適解の探索効率を高めるために用いられる一般的な手法であり、1980年代初頭に系統学に初めて適用されました。[ 15 ]分岐限定法は、問題空間をより小さな領域に分割する際に、本質的に問題をツリー構造に分割する必要があるため、系統樹の構築に特に適しています。その名前が示すように、入力として分岐規則(系統学の場合、次の種または配列をツリーに追加すること)と境界(探索空間の特定の領域を考慮から除外する規則であり、最適解がその領域を占めることはできないと仮定する)の両方が必要です。適切な境界を特定することが、系統学へのアルゴリズムの適用における最も困難な側面です。境界を定義する簡単な方法は、ツリーごとに許容される想定される進化変化の最大数です。 Zharkikhのルール[ 16 ]として知られる一連の基準は、すべての候補となる「最も簡潔な」ツリーに共通する特徴を定義することで、探索空間を厳しく制限します。最も基本的な2つのルールは、冗長なシーケンスを1つだけ残してすべて削除すること(複数の観測で同一のデータが得られた場合)と、2つ以上の状態が少なくとも2つの種で発生しない形質サイトを削除することを要求します。理想的な条件下では、これらのルールとそれに関連するアルゴリズムによって、ツリーが完全に定義されます。
Sankoff-Morel-Cedergren アルゴリズムは、ヌクレオチド配列の MSA と系統樹を同時に生成する最初の発表された方法の 1 つです。[ 17 ]この方法は、ギャップとミスマッチにペナルティを与えるスコアリング関数と最大節約計算を組み合わせて使用し、そのようなイベントを最小限に導入するツリーを優先します (別の見解では、優先されるべきツリーは相同性として解釈できる配列類似性の量を最大化するツリーであり、この見解は異なる最適ツリーにつながる可能性があります[ 18 ] )。ツリーの内部ノードの推定された配列は、考えられるすべてのツリーのすべてのノードにわたってスコアリングされ、合計されます。スコアリング関数に基づいて、最も低いスコアのツリーの合計が、最適なツリーと最適な MSA の両方を提供します。この方法は計算負荷が非常に高いため、内部アライメントの初期推定値を一度に 1 つのノードずつ改良する近似法があります。完全版と近似版の両方は、実際には動的計画法によって計算されます。[ 2 ]
より最近の系統樹/MSA法は、ヒューリスティックを使用して、必ずしも最適ではない高スコアの系統樹を分離します。MALIGN法は、最大節約法を使用して、系統樹スコアを最大化することによって多重アライメントを計算し、その関連法であるPOYは、系統樹の最適化と対応するMSAの改善を組み合わせた反復法を使用します。[ 19 ]しかし、進化仮説の構築におけるこれらの方法の使用は、最小限の進化イベントを反映する系統樹を意図的に構築するため、偏っていると批判されています。[ 20 ]これに対して、このような方法は、相同性として解釈できる配列類似性の量を最大化する系統樹を見つけるためのヒューリスティックなアプローチとみなされるべきであるという見解が反論されています。[ 18 ] [ 21 ]
最尤法は、確率分布を推測するための標準的な統計的手法を用いて、特定の可能性のある系統樹に確率を割り当てます。この手法では、特定の突然変異の確率を評価するために置換モデルが必要です。おおまかに言うと、観察された系統発生を説明するために内部ノードでより多くの突然変異を必要とする樹木は、確率が低いと評価されます。これは最大節約法と大まかに似ていますが、最尤法は、系統とサイトの両方で進化速度が変化することを許容することで、追加の統計的柔軟性を提供します。実際、この手法では、異なるサイトと異なる系統に沿った進化は統計的に独立している必要があります。したがって、最尤法は遠縁の配列の解析に適していますが、NP困難性のため計算が困難であると考えられています。[ 22 ]
動的計画法の変種である剪定アルゴリズムは、部分木の尤度を効率的に計算することで探索空間を縮小するためによく使用されます。[ 2 ]この方法は、子孫が葉(つまり、木の先端)のみであるノードから始めて、入れ子になったセットで最下ノードに向かって逆方向に作業することで、各サイトの尤度を線形的に計算します。ただし、この方法で生成される木は、置換モデルが不可逆である場合にのみ根付きになりますが、これは一般的に生物システムには当てはまりません。最大尤度木の探索には、アルゴリズム的に改善するのが難しい枝長最適化コンポーネントも含まれており、ニュートン・ラフソン法などの一般的なグローバル最適化ツールがよく使用されます。
変異アレル頻度データ(VAF)から系統樹を推定するために最尤法を使用するツールには、AncesTreeやCITUPなどがあります。[ 23 ] [ 24 ]
ベイズ推論は、最尤法と密接に関連した方法で系統樹を作成するために使用できます。ベイズ法は、可能な系統樹の事前確率分布を仮定します。これは、データから生成される可能性のあるすべての系統樹のうち、任意の1つの系統樹の確率である場合もあれば、種分化などの分岐イベントが確率過程として発生するという仮定から導き出された、より洗練された推定値である場合もあります。事前分布の選択は、ベイズ推論系統学法のユーザーの間で議論の的となっています。[ 2 ]
ベイズ法の実装では、一般的にマルコフ連鎖モンテカルロサンプリングアルゴリズムが使用されるが、移動セットの選択は様々である。ベイズ系統学で使用される選択には、提案されたツリーの各ステップでリーフノードを循環的に置換すること[ 25 ] 、および関連する2つのツリー間でランダムな内部ノードの子孫サブツリーを交換すること[ 26 ]が含まれる。系統学におけるベイズ法の使用は、発表された研究における移動セットの選択、受容基準、および事前分布の指定が不完全であることから、主に議論の的となっている[ 2 ] 。ベイズ法は一般的に、最小進化法よりも優れていると考えられている。ベイズ法は、最大尤度法よりも長い枝の誘引を受けやすい可能性があるが[ 27 ]、欠損データへの対応能力は優れている[ 28 ] 。
尤度法はデータの確率を最大化する系統樹を見つけるのに対し、ベイズ法は事後分布に基づいて最も可能性の高い系統群を表す系統樹を復元します。しかし、系統群の事後確率(その「支持度」を測定)の推定値は、特に圧倒的に可能性が高くない系統群では、かなり大きく外れることがあります。そのため、事後確率を推定するための他の方法が提案されています。[ 29 ]
変異アレル頻度データ(VAF)から系統樹を推定するためにベイズ推論を使用するツールには、Canopy、EXACT、PhyloWGSなどがあります。[ 30 ] [ 31 ] [ 32 ]
分子系統学の手法は、研究対象となる遺伝子またはアミノ酸配列上の様々な部位における変異の相対的な速度に関する仮説を符号化した、定義された置換モデルに依存している。最も単純な置換モデルは、ヌクレオチド配列における遷移と転換の速度の差を補正することを目的としている。置換モデルの使用は、 2つの配列間の遺伝的距離が、2つの配列が互いに分岐した後、短期間のみ直線的に増加するという事実によって必要となる(あるいは、距離が直線的に増加するのは、合体直前のみである)。分岐後の時間が長くなるほど、2つの変異が同じヌクレオチド部位で発生する可能性が高くなる。したがって、単純な遺伝的距離の計算では、進化の歴史の中で発生した変異イベントの数を過小評価することになる。この過小評価の程度は、分岐後の時間が長くなるにつれて大きくなり、長枝誘引現象、つまり、遠縁ではあるが収斂進化している2つの配列を近縁であると誤って分類する現象につながる可能性がある。[ 33 ]最大節約法は、最小限の数の異なる進化イベントを表すツリーを明示的に探索するため、この問題に特に影響を受けやすい。[ 2 ]
すべての置換モデルは、配列で表現される各可能な状態変化に一連の重みを割り当てます。最も一般的なモデルタイプは、例えば G>C ヌクレオチド変異と C>G 変異に同じ重みを割り当てるため、暗黙的に可逆的です。最も単純なモデルであるJukes-Cantor モデルは、特定のヌクレオチド塩基のすべての可能な状態変化に等しい確率を割り当てます。任意の 2 つの異なるヌクレオチド間の変化率は、全体の置換率の 3 分の 1 になります。[ 2 ]より高度なモデルは、遷移と転換を区別します。最も一般的な時間可逆モデルである GTR モデルには、6 つの突然変異率パラメータがあります。さらに一般化されたモデルである一般的な 12 パラメータモデルは、複数の系統間で一貫性のある遺伝的距離を計算する際の複雑さが大幅に増加するという代償を伴いますが、時間可逆性を破ります。[ 2 ]このテーマの可能なバリエーションの 1 つは、全体の GC 含有量 (DNA 二重らせんの安定性の重要な尺度) が時間とともに変化するように速度を調整します。[ 34 ]
モデルによっては、入力配列内の位置による変異率の変動も考慮に入れることができる。このような変動の最も明白な例は、タンパク質をコードする遺伝子のヌクレオチドが3塩基コドンに配列されていることから導かれる。オープンリーディングフレーム(ORF)の位置が分かっている場合、コドン内の特定の部位の位置に応じて変異率を調整することができる。これは、ウォブル塩基対形成によって、遺伝暗号におけるコドンの意味に影響を与えることなく、特定のコドンの3番目のヌクレオチドでより高い変異率が可能になることが知られているためである。[ 33 ] ORFの識別に依存しない、仮説に基づかない例では、各部位に、あらかじめ定められた分布(多くの場合、ガンマ分布または対数正規分布)からランダムに抽出された変異率を割り当てる。[ 2 ]最後に、共変動法として知られる、より保守的な変異率の推定法では、変異率の自己相関変動を考慮に入れることができるため、特定の部位の変異率は部位間および系統間で相関する。[ 35 ]
適切なモデルの選択は、良好な系統解析を行う上で非常に重要です。これは、パラメータが不足しているモデルや制約が厳しすぎるモデルは、その基礎となる仮定が破られたときに異常な挙動を示す可能性があり、また、複雑すぎるモデルやパラメータが多すぎるモデルは計算コストが高く、パラメータが過学習する可能性があるためです。[ 33 ]モデル選択の最も一般的な方法は尤度比検定(LRT)であり、モデルと入力データ間の「適合度」の尺度として解釈できる尤度推定値が得られます。 [ 33 ]ただし、これらの結果を使用する際には注意が必要です。パラメータが多いより複雑なモデルは、同じモデルの単純化されたバージョンよりも常に高い尤度を持つため、過度に複雑なモデルを安易に選択してしまう可能性があります。[ 2 ]このため、モデル選択コンピュータプログラムは、より複雑な置換モデルよりも著しく劣らない最も単純なモデルを選択します。LRTの大きな欠点は、モデル間のペアワイズ比較を複数回行う必要があることです。モデルを比較する順序が、最終的に選択されるモデルに大きな影響を与えることが示されている。[ 36 ]
代替モデル選択法として、赤池情報量規準(AIC)があります。これは正式には、真のモデルとテスト中のモデル間のカルバック・ライブラー情報量の推定値です。過剰パラメータ化モデルにペナルティを与える補正係数を持つ尤度推定値として解釈できます。[ 33 ] AICはペアではなく個々のモデルで計算されるため、モデルを評価する順序に依存しません。関連する代替法であるベイズ情報量規準(BIC)は、基本的な解釈は似ていますが、複雑なモデルにペナルティをより強く与えます。[ 33 ]系統樹再構築に最適なモデルを決定することは、多くの進化研究における基本的なステップです。しかし、モデル選択のさまざまな基準により、どの基準が好ましいかについて議論が起こっています。最近の研究では、トポロジーと祖先配列再構築が望ましい出力である場合、ある基準を別の基準よりも選択することは重要ではないことが示されています。その代わりに、最も複雑なヌクレオチド置換モデルであるGTR+I+Gを使用すると、系統樹のトポロジーと祖先配列の推定に関して同様の結果が得られます。[ 37 ]
DNA/アミノ酸連続配列アセンブリ、多重配列アライメント、モデルテスト(最適な置換モデルのテスト)、最尤法とベイズ推論を使用した系統樹再構築を含む、系統樹構築に関する包括的なステップバイステップのプロトコルがProtocol Exchange [ 38 ]で入手可能です。
系統樹を評価する非伝統的な方法として、クラスタリング結果と比較する方法があります。多次元尺度構成法(補間結合法)を用いて次元削減を行い、配列のクラスタリング結果を3Dで可視化し、系統樹をクラスタリング結果にマッピングすることができます。通常、より良い系統樹はクラスタリング結果との相関が高くなります。[ 39 ]
すべての統計分析と同様に、形質データから系統樹を推定するには、信頼性の評価が必要です。系統樹の支持度を検証する方法はいくつかあり、系統樹内の各サブツリーの支持度を評価する方法(ノード支持度)や、系統樹が他の可能性のある系統樹と有意に異なるかどうかを評価する方法(代替系統樹仮説検定)などがあります。
系統樹の支持度を評価する最も一般的な方法は、系統樹上の各ノードの統計的支持度を評価することです。通常、支持度が非常に低いノードは、その後の解析では有効とはみなされず、系統群内の関係が未解決であることを示すために、視覚的に多分岐として扱われることがあります。
ノードの支持度を評価する多くの方法では、複数の系統樹を考慮する必要があります。コンセンサスツリーは、一連のツリー間で共有されているノードを要約します。[ 40 ]厳密なコンセンサスでは、すべてのツリーで見つかったノードのみが表示され、残りは未解決の多分岐にまとめられます。多数決コンセンサスツリーなどの保守的でない方法では、検討対象のツリーの一定割合(少なくとも50%など)で支持されているノードを考慮します。
例えば、最大節約法解析では、同じ節約スコアを持つ系統樹が多数存在する可能性があります。厳密なコンセンサスツリーは、すべての同等に節約的な系統樹に共通するノードと、異なるノードを示します。コンセンサスツリーは、ベイズ推論で再構築された系統樹の信頼性を評価するためにも使用されます(下記参照)。
統計学において、ブートストラップ法は、分布が不明なデータの変動性を、元のデータの擬似複製を用いて推定する方法です。例えば、100個のデータ点がある場合、擬似複製とは、元のデータから復元抽出によってランダムに抽出された、同じサイズ(100点)のデータセットのことです。つまり、元のデータ点は擬似複製に複数回出現することもあれば、全く出現しないこともあります。統計的な裏付けとは、元のデータが多数の擬似複製と同様の特性を持つかどうかを評価することです。
系統学では、ブートストラップは形質行列の列を使用して実行されます。各擬似複製には、元の行列から復元抽出でランダムにサンプリングされた同じ数の種(行)と形質(列)が含まれます。系統樹は、元のデータから系統樹を再構築するのと同じ方法で、各擬似複製から再構築されます。系統樹上の各ノードについて、ノードサポートは、そのノードを含む擬似複製の割合です。[ 41 ]
ブートストラップ検定の統計的厳密性は、進化の歴史が既知のウイルス集団を用いて経験的に評価されており、[ 42 ] 70%のブートストラップ支持は、クレードが存在する確率が95%に相当することがわかっています。ただし、これは理想的な条件下(例えば、進化速度の変化がなく、系統樹が対称的であるなど)でテストされたものです。実際には、70%を超える値は一般的に支持されており、信頼性の評価は研究者または読者に委ねられています。70%未満の支持を持つノードは、通常、未解決とみなされます。
系統発生学におけるジャックナイフ法は、行列の列を非復元抽出する点を除けば、同様の手順である。擬似複製は、データをランダムにサブサンプリングすることによって生成される。例えば、「10%ジャックナイフ法」では、ノードの支持度を評価するために、行列の10%を何度もランダムにサンプリングする。
ベイズ推論を用いた系統樹の再構築では、単一の「最良」の系統樹ではなく、データと進化モデルに基づいて可能性の高い系統樹の事後分布が生成されます。事後分布の系統樹は、一般的に多くの異なるトポロジーを持ちます。入力データが変異アレル頻度データ(VAF)の場合、EXACTツールは、系統樹空間全体を網羅的に探索することにより、生物学的に関連のある小さな系統樹サイズに対して、系統樹の確率を正確に計算できます。[ 30 ]
ほとんどのベイズ推論法はマルコフ連鎖モンテカルロ反復法を利用しますが、この連鎖の初期段階は系統樹の信頼できる再構築とはみなされません。連鎖の初期段階で生成された系統樹は通常、バーンインとして破棄されます。ベイズ系統解析におけるノード支持度を評価する最も一般的な方法は、事後分布(バーンイン後)においてノードを含む系統樹の割合を計算することです。
ベイズ推論におけるノードの統計的サポートは、データと進化モデルに基づいて、クレードが実際に存在する確率を反映することが期待される。[ 43 ]したがって、ノードがサポートされていると受け入れる閾値は、一般的にブートストラップの場合よりも高い。
ブレーマー支持度は、系統群に反論するために必要な追加ステップの数をカウントする。
これらの尺度はそれぞれ弱点がある。例えば、小さいクレードや大きいクレードは、中規模のクレードよりも支持値が高くなる傾向があるが、これは単純に、それらのクレードに含まれる分類群の数によるものである。[ 44 ]
ブートストラップサポートは、クレードの真の存在ではなく、データのノイズの結果として、ノードサポートの推定値が高くなる可能性がある。[ 45 ]
結局のところ、調査対象の分類群間の真の関係が既に分かっている場合(実験室条件下での細菌やウイルスの場合など)を除いて、特定の系統発生仮説が正確かどうかを測定する方法はありません。経験的系統発生学者が達成できる最良の結果は、入手可能な証拠によって十分に裏付けられた枝を持つ系統樹です。いくつかの潜在的な落とし穴が指摘されています。
特定の形質は他の形質よりも収斂進化する可能性が高い。論理的には、そのような形質は系統樹の再構築において重みを低くすべきである。[ 46 ]進化モデルの形の重みは分子データのセットから推測できるため、最尤法またはベイズ法を使用して分析することができる。分子配列の場合、この問題は、研究対象の分類群が大幅に分岐している場合に悪化する。2 つの分類群の分岐からの時間が増加するにつれて、同じサイトでの複数の置換または逆突然変異の確率も高くなり、これらはすべて相同性をもたらす。形態学的データの場合、残念ながら、収斂を決定する唯一の客観的な方法は、系統樹の構築である 。これはやや循環的な方法である。それでも、相同性形質に重み付けをすることで、より支持された系統樹が得られる。 [ 46 ] 1 つの方向の変化に他の方向の変化よりも高い重み付けをすることで、さらに改良することができる。例えば、胸翅の存在は、翅を持つ昆虫類に分類されることをほぼ確実に保証する。なぜなら、翅は二次的に失われることが多いものの、複数回獲得されたという証拠はないからである。[ 47 ]
一般的に、生物は遺伝子を2つの方法で継承することができます。垂直遺伝子伝達と水平遺伝子伝達です。垂直遺伝子伝達とは、遺伝子が親から子へと受け継がれることであり、水平遺伝子伝達(または側方遺伝子伝達)とは、遺伝子が無関係な生物間で飛び移る現象で、特に原核生物ではよく見られる現象です。その良い例として、様々な細菌間での遺伝子交換の結果として獲得される抗生物質耐性があり、これが多剤耐性細菌種につながっています。真核生物間での水平遺伝子伝達の事例も十分に記録されています。
水平遺伝子伝達は生物の系統発生の決定を複雑化させており、進化系統樹の構築に使用される遺伝子によって、特定の生物群間で系統発生の矛盾が報告されている。どの遺伝子が垂直的に獲得され、どの遺伝子が水平的に獲得されたかを判断する唯一の方法は、一緒に継承された遺伝子の最大セットが垂直的に継承されたと簡潔に仮定することである。そのためには、多数の遺伝子を分析する必要がある。
系統分類学の数学的モデルの根底にある基本的な仮定は、種が二分岐的にきれいに分かれる状況です。このような仮定はより大きなスケールでは成り立つかもしれませんが(水平遺伝子伝達は除く、上記参照)、種分化はしばしばはるかに秩序立っていません。系統分類学的方法が導入されて以来の研究により、かつてはまれだと考えられていた雑種分化は、特に植物において実際にはかなり一般的であることが示されています。[ 48 ] [ 49 ]また、側系統分化も一般的であるため、二分岐パターンの仮定は不適切となり、系統樹ではなく系統ネットワークにつながります。 [ 50 ] [ 51 ]遺伝子浸透は、本来は異なる種間、時には属間でも遺伝子を移動させる可能性があり、[ 52 ]遺伝子に基づく系統解析を複雑にします。[ 53 ]この現象は「不完全な系統選別」に寄与する可能性があり、多くのグループで一般的な現象であると考えられています。種レベルの解析では、より大きなサンプリングまたはより優れた全ゲノム解析によって対処できます。[ 54 ]多くの場合、分析対象をより少なく、関連性の低い標本に限定することで問題が回避されます。
分子生物学における高度なシーケンス技術の発展により、系統仮説を推論するために大量のデータ(DNAまたはアミノ酸配列)を収集することが可能になった。例えば、ミトコンドリアゲノム全体(多くの動物では約16,000ヌクレオチド)に基づく形質マトリックスを用いた研究は珍しくない。しかし、シミュレーションでは、マトリックス内の分類群の数を増やす方が形質の数を増やすよりも重要であることが示されている。分類群の数が多いほど、結果として得られる系統樹の精度と堅牢性が高くなるからである。[ 55 ] [ 56 ]これは、長い枝が分断されることが一因である可能性がある。
系統樹再構築の精度に影響を与えるもう1つの重要な要因は、分析されたデータに実際に有用な系統学的シグナルが含まれているかどうかである。この用語は一般的に、形質がランダムに変化するのではなく、近縁の分類群で同じ状態になるほど十分にゆっくりと進化しているかどうかを示すために使用される。系統学的シグナルのテストが存在する。[ 57 ]
連続体をサンプリングする形態学的特徴には系統学的シグナルが含まれる可能性があるが、離散的な特徴としてコード化するのは難しい。いくつかの方法が使用されており、その1つがギャップコーディングであり、ギャップコーディングにはバリエーションがある。[ 58 ]ギャップコーディングの元の形式: [ 58 ]
文字のグループ平均は、まずサイズ順に並べられます。グループ内の統合標準偏差が計算され、隣接する平均間の差がこの標準偏差を基準として比較されます。隣接する平均のペアは、グループ内標準偏差に任意の定数を掛けた値よりも大きな「ギャップ」で隔てられている場合、異なるとみなされ、異なる整数スコアが与えられます。
分析にさらに多くの分類群を追加すると、分類群間のギャップが非常に小さくなり、すべての情報が失われる可能性があります。一般化ギャップコーディングは、すべての分類群を含む1つのセットを考慮するのではなく、個々の分類群のペアを比較することで、この問題を回避します。[ 58 ]
一般的に、系統樹を構築する際に利用できるデータが多いほど、結果として得られる系統樹の精度と信頼性は高くなります。欠損データは、単にデータが少ない場合と比べて特に有害ではありませんが、欠損データの大部分が少数の分類群に集中している場合にその影響は最も大きくなります。欠損データを少数の形質に集中させることで、より堅牢な系統樹が得られます。[ 59 ]
多くの形質は胚発生学的、軟組織的、または分子的な形質に関係しており、それらは(せいぜい)ほとんど化石化しないため、また化石の解釈は現生分類群の解釈よりも曖昧であるため、絶滅した分類群は現生分類群よりも欠損データの割合がほぼ例外なく高くなります。しかし、これらの制限にもかかわらず、化石を含めることは非常に貴重です。化石は系統樹の疎な領域に情報を提供し、長い枝を分割し、中間形質状態を制約することができるため、化石分類群は現代の分類群と同じくらい系統樹の解像度に貢献します。[ 60 ]化石は系統の年代を制約することもできるため、系統樹が地層記録とどれだけ整合しているかを示すことができます。層序系統分類学は、年代情報を系統解析のデータマトリックスに組み込みます。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)プログラムは、生命の歴史全体にわたる多様化パターンの複雑さに対応することで、AToLプログラムを基盤としています。交雑、細胞内共生、水平遺伝子伝達などのプロセスに関する現在の知識から、地球上の生命の進化の歴史は、系統樹のすべての枝について、単一の類型的な二分岐樹として正確に描写することはできないことが明らかになっています。