

系統樹(ギリシャ語のκλάδος klados「枝」とγραμμα gramma 「特徴」に由来)は、系統分類学で生物群間の進化関係(共通祖先)を示すために用いられる図です。系統樹は、通常は進化時間を示すものではないものの、系統分類学で定義された特定の基準を満たす必要がある系統樹の一種(部分集合)です。 [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ]他の進化系統樹と同様に、系統樹は実際の、仮説上の、あるいは仮説上の祖先を示すために使用できます。現代の系統樹は、分子系統学のアプローチの一部として、通常はDNAシーケンスからの遺伝子データを使用して、計算系統学 によってアルゴリズム的に生成されることが最も多いです。
系統樹は、異なる方向に枝分かれした線を使用しており、最後の共通祖先を持つ生物のグループである系統群で終わります。系統樹には多くの形状がありますが、すべて他の線から枝分かれした線があります。これらの線は、枝分かれした場所まで遡ることができます。これらの分岐点は、その上の末端分類群間で共有される特性を示すと推測できる仮説上の祖先(実際の生物ではない)を表しています。[ 4 ] [ 6 ] この仮説上の祖先は、さまざまな特徴の進化の順序、適応、および祖先に関するその他の進化の物語についての手がかりを提供する可能性があります。

系統樹を作成するために使用される特徴は、おおまかに形態学的特徴(単弓類の頭蓋骨、温血動物、単細胞生物など)または分子学的特徴(DNA、RNA、またはタンパク質配列)に分類できます。[ 7 ] DNAシーケンスの出現以前は、系統解析では主に形態学的データが使用されていました。動物の場合、行動データも使用されることがありました。[ 8 ]
DNA シーケンスがより安価で容易になるにつれて、分子系統学は系統仮説を推論するますます一般的な方法になってきています。[ 9 ]最小進化基準の使用は、分子データから系統を推論するいくつかの方法の 1 つにすぎません。配列進化の明示的なモデルを組み込んだ最尤法などのアプローチは、配列データを評価する非ヘニッヒ法です。系統を再構築するもう 1 つの強力な方法は、ゲノムレトロトランスポゾン マーカーの使用です。これは、配列データにつきものの復帰の問題の影響を受けにくいと考えられています。また、ゲノムへの組み込みは完全にランダムであると考えられていたため、相同性の発生率が低いと一般的に想定されています。ただし、少なくとも時々そうではないようです。

研究者は、どの形質状態が「祖先形質」(プレシオモルフィー)で、どの形質状態が派生形質(シナポモルフィー)であるかを決定しなければなりません。なぜなら、シナポモルフィーの形質状態のみがグループ分けの証拠を提供するからです。 [ 10 ] この決定は通常、1 つ以上の外群の形質状態との比較によって行われます。外群と内群の一部のメンバーの間で共有されている状態はシンプレシオモルフィーであり、内群のサブセットにのみ存在する状態はシナポモルフィーです。単一の末端に固有の形質状態(オートポモルフィー)は、グループ分けの証拠を提供しないことに注意してください。外群の選択は、系統解析において重要なステップです。なぜなら、異なる外群は、大きく異なるトポロジーを持つ系統樹を生成する可能性があるからです。
相同性とは、共通祖先以外の原因により、2つ以上の分類群で共有される形質状態のことです。 [ 11 ]相同性の主な種類は、収斂(少なくとも2つの異なる系統で「同じ」形質が進化すること)と復帰(祖先形質状態への回帰)の2つです。北極圏の哺乳類の異なる系統における白い毛皮など、明らかに相同性のある形質は、系統関係の理解に何ら貢献しないため、系統解析の形質として含めるべきではありません。しかし、相同性は、形質自体の検査(例えばDNA配列)からは明らかにならないことが多く、最も節約的な系統樹上での不一致(節約的でない分布)によって検出されます。相同性のある形質であっても、系統学的シグナルを含む場合があることに注意してください。[ 12 ]
収斂進化による相同性のよく知られた例として、「翼の有無」という形質が挙げられます。鳥類、コウモリ類、昆虫類の翼は同じ機能を果たしますが、それぞれの解剖学的構造からわかるように、それぞれ独立して進化してきました。もし鳥類、コウモリ類、そして有翅昆虫を「翼の有無」という形質で評価した場合、データセットに相同性が導入され、分析を混乱させ、誤った関係性の仮説につながる可能性があります。もちろん、そもそも相同性が認識できるのは、その相同性の分布を示す関係性のパターンを示唆する他の形質が存在するからに他なりません。
系統樹は、共有派生形質のみに基づいて分類群をグループ化する分析の図式的な結果です。データをやや異なる方法で処理し、系統樹のように見えるが系統樹ではない系統発生アルゴリズムは他にも多数あります。たとえば、UPGMAや近隣結合法などの表現型アルゴリズムは、全体的な類似性に基づいてグループ化し、共有派生形質と共有祖先形質の両方をグループ化の証拠として扱います。結果として得られる図は表現型であり、系統樹ではありません。同様に、分岐順序と「分岐長」の両方を考慮するモデルベースの方法(最尤法またはベイズ法)の結果は、共有派生形質と固有派生形質の両方をグループ化の賛成または反対の証拠としてカウントします。これらの種類の分析から得られる図も、系統樹ではありません。[ 13 ]
「最適な」系統樹を特定するためのアルゴリズムはいくつか存在する。 [ 14 ]アルゴリズムはほとんどの場合コンピュータによって実行されるが、少数の種と特徴のみのデータセットの場合は手動で実行できるものもある。ほとんどのアルゴリズムは、候補となる系統樹がデータとどの程度一致しているかを測定するために、メトリック(距離とも呼ばれる)を使用する。ほとんどの系統樹アルゴリズムは数学的最適化を使用する。解決すべき計算問題は、メトリックの最小化である。
アルゴリズムの中には、分子特性データのみに有効なもの、形態データのみに有効なもの、両方を含む特性データのみに有効なものなどがあります。系統樹や系統図を作成するためのアルゴリズムには、最小二乗法、近隣結合法、最小進化法、最尤法、ベイズ推論などがあります。最適化タスク(系統樹の作成など)を実行するアルゴリズムは、入力データ(種とその特性のリスト)の提示順序に影響を受ける場合があります。データをさまざまな順序で入力すると、同じアルゴリズムでも異なる「最適な」系統樹が生成されることがあります。このような場合は、ユーザーはデータをさまざまな順序で入力し、結果を比較する必要があります。
単一のデータセットに対して異なるアルゴリズムを使用すると、各アルゴリズムが「最適」の定義を独自に持っている可能性があるため、異なる「最適」な系統樹が得られる場合があります。可能な系統樹の数が天文学的な数であるため、アルゴリズムは解が全体的に最適な解であることを保証できません。プログラムが望ましい大域的最小値ではなく局所的最小値に落ち着くと、最適ではない系統樹が選択されます。[ 15 ]この問題を解決するために、多くの系統樹アルゴリズムは、選択された系統樹が最適である可能性を高めるために、シミュレーテッドアニーリングアプローチを使用します。 [ 16 ]
生物学者は、系統樹生成アルゴリズムの特定の種類を指す場合に「最小進化」という用語を使用することもあれば、すべての系統発生アルゴリズムを包括する用語として使用することもある。 [ 17 ]
基底位置とは、根付き系統樹または系統樹図の基部(または根)の方向のことです。基底クレードとは、より大きなクレード内で最初に分岐した(特定の分類階級[a]の)クレードのことです。
不一致長差検定(ILD)は、異なるデータセット(形態学的データと分子データ、葉緑体遺伝子と核遺伝子など)の組み合わせが、より長い系統樹の形成にどのように寄与するかを測定するものです。まず、各パーティションの系統樹の全長を計算し、それらを合計します。次に、元のパーティションからランダムにパーティションを組み立てて複製を作成し、その長さを合計します。100回の複製でp値が0.01となるのは、99回の複製で合計系統樹の長さが長くなった場合です。
いくつかの尺度は、データセット内の相同性の量をツリーを参照して測定しようと試みているが、[ 18 ]これらの尺度が正確にどのような特性を定量化しようとしているのかは必ずしも明確ではない。[ 19 ]
一貫性指数(CI)は、データセットに対する系統樹の一貫性を測定するもので、系統樹によって示唆される相同性の最小量を測定するものです。[ 20 ]これは、データセット内の最小変更数を数え、それを系統樹に必要な実際の変更数で割ることによって計算されます。[ 20 ]一貫性指数は、個々の形質i に対しても計算でき、c iと表記されます。
この指標は相同性の量だけでなく、データセット内の分類群の数[ 21 ]、(程度は低いものの)データセット内の文字数[ 22 ] 、各文字が系統発生情報を持つ程度[ 23 ]、および付加的文字がコード化される方法も反映しており、目的に適さないものとなっている[ 24 ] 。
c i は、状態分布が均等なバイナリ文字では1 から 1/[ n.taxa /2] の範囲を占めます。状態が均等に分布していない場合、その最小値は大きくなります。 [ 23 ] [ 18 ]一般に、バイナリ文字または非バイナリ文字の場合、c i は1 から の範囲を占めます[ 23 ]
保持指数(RI)は、「特定の用途」におけるCIの改善として提案されました[ 25 ]。 この指標は、相同性の量を測定するだけでなく、シナポモルフィーが系統樹をどれだけうまく説明できるかも測定します。これは、(系統樹上の最大変化数から系統樹上の変化数を引いた数)を(系統樹上の最大変化数からデータセット内の最小変化数を引いた数)で割ることによって計算されます。
再スケーリングされた一貫性指数(RC)は、CIにRIを乗じることで得られます。実際には、これによりCIの範囲が拡張され、理論的に達成可能な最小値が0に再スケーリングされ、最大値は1のままになります。 [ 18 ] [ 25 ]ホモプラシー指数(HI)は単純に1 − CIです。
これは、木で観察された相同性の量を、理論的に存在する可能性のある相同性の最大量(1 − (観察された相同性超過) / (最大相同性超過))に対して測定するものです。[ 22 ]値が 1 の場合は相同性がないことを示し、0 は完全にランダムなデータセットにあるのと同じ量の相同性を示し、負の値はさらに多くの相同性を示します(そして、人為的な例でのみ発生する傾向があります)。[ 22 ] HER は、現在利用可能な相同性の最良の尺度として提示されています。[ 18 ] [ 26 ]