系統樹または系統発生は、特定の期間における一連の種または分類群間の進化の歴史を示す図式表現です。 [ 1 ] [ 2 ]言い換えれば、物理的または遺伝的特徴の類似点と相違点に基づいて、さまざまな生物種またはその他の実体間の進化関係を示す分岐図またはツリーです。進化生物学では、地球上のすべての生命は理論的には単一の系統樹の一部であり、共通の祖先を示しています。系統発生学は系統樹の研究です。主な課題は、一連の種または分類群間の最適な進化的祖先を表す系統樹を見つけることです。計算系統発生学(系統発生推論とも呼ばれる)は、系統発生ランドスケープで最適な系統樹を見つけるアルゴリズムに焦点を当てています。[ 1 ] [ 2 ]
系統樹は、根付きまたは根なしの場合があります。根付き系統樹では、子孫を持つ各ノードは、それらの子孫の推定される最新の共通祖先を表し、 [ 3 ]一部のツリーのエッジの長さは、時間の推定値として解釈できます。各ノードは分類単位と呼ばれます。内部ノードは、直接観察できないため、一般的に仮説上の分類単位と呼ばれます。ツリーは、バイオインフォマティクス、系統分類学、系統発生学などの生物学の分野で役立ちます。根なしツリーは、葉ノードの関連性のみを示し、祖先の根を知っているか推定する必要はありません。
生命の樹という概念は、古代の「存在の大連鎖」のように、より低次の生命体からより高次の生命体へと梯子のように段階的に進化していくという考え方に由来する。初期の「分岐」する系統樹の図解としては、エドワード・ヒッチコック著『初版:1840年』に掲載された、植物と動物の地質学的関係を示す「古生物学的図表」などが挙げられる。
チャールズ・ダーウィンは、 1859年の著書『種の起源』の中で、進化の過程を図解した「系統樹」を紹介した。それから1世紀以上経った今でも、進化生物学者は進化の過程を示すために系統樹図を用いている。なぜなら、このような図は、種の分化が系統の適応的かつ半ランダムな分岐によって起こるという概念を効果的に伝えることができるからである。
phylogeneticまたはphylogenyという用語は、古代ギリシャ語のφῦλον ( phûlon )(「種族、系統」を意味する)とγένεσις ( génesis )(「起源、源」を意味する)という2 つの単語に由来します。 [ 4 ] [ 5 ]

根付き系統樹(上部の2つの図を参照)は、唯一のノード(根)を持つ有向木であり、根は、木の葉にあるすべてのエンティティの(通常は推定される)最新の共通祖先に対応します。根ノードには親ノードはありませんが、木の中の他のすべてのノードの親として機能します。したがって、根は次数2のノードであり、他の内部ノードは最小次数が3です(ここで「次数」とは、入ってくるエッジと出ていくエッジの総数を指します)。
系統樹の根付けに最もよく用いられる方法は、議論の余地のない外群を用いることである。外群とは、形質データや分子配列から推論できるほど近縁でありながら、明確な外群となるほど遠い系統群を指す。別の方法としては、中間点根付けや、非定常置換モデルを用いて系統樹の根付けを行う方法もある。[ 6 ]

根なしツリーは、祖先に関する仮定を置かずに葉ノードの関連性を示します。祖先の根が既知または推定されている必要はありません。[ 8 ]根付きツリーは、根なしツリーに根を挿入することで生成できます。根なしツリーの根を推定するには、祖先を特定する何らかの方法が必要です。これは通常、入力データにアウトグループを含めることで、根が必然的にアウトグループとツリー内の他の分類群の間にあるようにするか、分子時計仮説の適用など、各枝の相対的な進化速度に関する追加の仮定を導入することによって行われます。[ 9 ]
根付き木と根なし木はどちらも、二分岐木または多分岐木のいずれかになります。根付き二分岐木は、各内部ノードから正確に2つの子孫を持ち(つまり、二分木を形成します)、根なし二分岐木は、各内部ノードに正確に3つの隣接ノードを持つ自由木である根なし二分木の形をとります。これに対し、根付き多分岐木は、一部のノードで2つ以上の子を持つ場合があり、根なし多分岐木は、一部のノードで3つ以上の隣接ノードを持つ場合があります。
根付きツリーと根なしツリーの両方に、ラベルを付けるかラベルを付けないかを選択できます。ラベル付きツリーでは、葉に特定の値が割り当てられますが、ラベルなしツリー(ツリー形状と呼ばれることもあります)では、トポロジーのみが定義されます。Phylotree [ 10 ]など、小さなゲノム領域から構築された配列ベースのツリーの中には、推定された祖先ハプロタイプでラベル付けされた内部ノードを持つものがあります。

葉ノード数が与えられた場合の可能な木の数は、木の特定のタイプによって異なりますが、ラベル付きの木は常にラベルなしの木より多く、多分岐の木は二分岐の木より多く、根付きの木は根なしの木より多くなります。最後の区別は生物学的に最も重要です。これは、根なしの木には根を置く場所がたくさんあるためです。二分岐するラベル付き木の場合、根付きの木の総数は次のとおりです。
ラベル付きツリーを分岐させると、根なしツリーの総数は次のようになります。[ 11 ]
ラベル付けされた分岐木のうち、根なし木の数は葉の数は根付いた木の数に等しい葉。[ 2 ]
根付いた木の数は、先端の数に応じて急速に増加します。先端が 10 個の場合、分岐する可能性のあるツリーの数も増え、多分岐するツリーの数はより速く増加し、後者の数は前者の約7倍になります。
デンドログラムは、系統発生学的か否かを問わず、樹木全般を指す名称であり、したがって系統発生樹の図式表現も指す。[ 12 ]

系統樹は分岐パターンのみを表すものであり、つまり、その枝の長さは時間や形質変化の相対的な量を表すものではなく、内部のノードは祖先を表すものではない。[ 13 ]
系統図は、枝の長さが形質変化の量に比例する系統樹である。[ 14 ]
クロノグラムは、枝の長さによって時間を明確に表す系統樹である。[ 15 ]

ダールグレノグラムとは、系統樹の断面図を表す図のことである。
系統発生ネットワークは厳密には木ではなく、より一般的なグラフ、あるいは根付きネットワークの場合は有向非巡回グラフである。これらは、木構造に内在するいくつかの制約を克服するために用いられる。

紡錘図、またはバブル図は、アメリカの古生物学者アルフレッド・ローマーによって普及したことから、ローメログラムと呼ばれることが多い。[ 17 ] これは、さまざまな分類群の時間の経過に伴う存在量の変動を反映するために、分類学的多様性(水平方向の幅)を地質学的時間(垂直軸)に対して表す。紡錘図は進化系統樹ではない。 [ 18 ]分類学的紡錘は、親分類群と娘分類群の実際の関係を不明瞭にし[ 17 ] 、親グループの側系統性を含むという欠点がある。 [ 19 ] この種の図は、当初提案された形式ではもはや使用されていない。[ 19 ]

ダーウィン[ 20 ]は、サンゴは木よりも適切な比喩かもしれないとも述べている。実際、系統発生的なサンゴは過去と現在の生命を描写するのに役立ち、木よりもいくつかの利点がある(吻合が許容されるなど)。[ 19 ]
非自明な数の入力配列で構成される系統樹は、計算系統学法を用いて構築されます。複数の配列アライメントから遺伝的距離を計算する近隣結合法やUPGMAなどの距離行列法は実装が最も簡単ですが、進化モデルを呼び出しません。ClustalW などの多くの配列アライメント法も、より単純なアルゴリズム (つまり、距離に基づくもの) を使用してツリーを作成します。最大節約法は系統樹を推定するもう 1 つの単純な方法ですが、暗黙の進化モデル (つまり節約法) を前提としています。より高度な方法では、多くの場合ベイズフレームワーク内で最大尤度の最適性基準を使用し、系統樹の推定に明示的な進化モデルを適用します。[ 2 ]これらの多くの手法を使用して最適なツリーを特定することはNP 困難であるため、[ 2 ]ヒューリスティック探索法と最適化法がツリースコアリング関数と組み合わせて使用され、データに適合する適切なツリーを特定します。
ツリー構築方法は、いくつかの基準に基づいて評価できます。[ 21 ]
木構造構築技術は数学者の注目も集めている。木はT理論を用いて構築することもできる。[ 22 ]
ツリーはさまざまな形式でエンコードできますが、いずれもツリーの入れ子構造を表す必要があります。枝の長さやその他の特徴をエンコードする場合としない場合があります。標準化された形式は、既存のソフトウェアにインポートするのが難しいグラフィック出力に頼ることなくツリーを配布および共有するために不可欠です。一般的に使用される形式は次のとおりです。
異なる種の配列決定された遺伝子またはゲノムデータに基づいて作成された系統樹は進化に関する洞察を提供するが、これらの分析には重要な限界がある。最も重要なのは、それらが生成する系統樹が必ずしも正しいとは限らないこと、つまり、含まれる分類群の進化の歴史を必ずしも正確に表しているとは限らないことである。あらゆる科学的結果と同様に、さらなる研究(追加データの収集、改良された方法での既存データの分析など)によって反証される可能性がある。それらの基となるデータはノイズが多い可能性があり、[ 24 ]分析は遺伝子組換え、[ 25 ]水平遺伝子伝達、[ 26 ] 交雑が起こる前に系統樹上で最も近い隣人ではなかった種間の交雑、および保存された配列によって混乱する可能性がある。
また、単一の遺伝子やタンパク質、あるいは形態学的分析のみといった単一の特性に基づいて分析を行うことには問題があります。なぜなら、そのような分析で得られた系統樹は、別の無関係なデータソースから構築されたものと異なることが多く、種間の系統関係を推測する際には細心の注意が必要となるからです。これは、水平遺伝子伝達や組換えの影響を受ける遺伝物質において特に顕著であり、異なるハプロタイプブロックが異なる歴史を持つ可能性があります。このような分析では、単一遺伝子の系統解析の出力系統樹は、その遺伝子の系統(すなわち遺伝子系統樹)の推定値であり、これらの特性がサンプリングされた分類群の系統(すなわち種系統樹)の推定値ではありません。ただし、理想的には、両者は非常に近い値であるべきです。このため、本格的な系統発生学的研究では、一般的に異なるゲノム源(例えば、ミトコンドリアまたは葉緑体ゲノムと核ゲノム)由来の遺伝子の組み合わせ[ 27 ] 、または異なる選択体制の下で進化すると予想される遺伝子を使用することで、相同性(偽相同性)が自然選択によって生じる可能性を低くしています。
絶滅種を解析の末端ノードとして含める場合(例えば、内部ノードを制約するためではなく)、それらは現存するどの種の直接の祖先も表さないものとみなされます。絶滅種は通常、高品質のDNAを含んでいません。
抽出技術と配列決定技術の進歩に伴い、有用なDNA材料の範囲は拡大してきた。より小さな断片から、あるいはDNA分解産物の空間パターンから配列を推測できる技術の開発は、有用とみなされるDNAの範囲をさらに広げるだろう。
系統樹は、形態、特定の遺伝子の有無、挿入や欠失といった事象、そして進化の兆候を含むと考えられるその他のあらゆる観察結果など、さまざまなデータタイプから推測することもできる。
系統発生ネットワークは、二分岐樹が適さない場合に使用される。これは、サンプリングされた生物の進化の歴史がより網状であることを示唆するこれらの複雑な要因によるものである。
なし。