系統学において、長枝誘引(LBA)は、遠縁の系統が誤って近縁であると推論される系統的エラーの一種である。[ 1 ] LBAは、系統内で蓄積された分子または形態学的変化の量が、その系統が他の長枝系統と類似している(したがって近縁である)ように見えるのに十分である場合に発生する。これは、両者が共通の祖先から派生したからではなく、単に大量の変化を受けたためである。このようなバイアスは、いくつかの分類群の全体的な分岐が系統樹内の長枝をもたらす場合に多く見られる。長枝は、外群を表すために含まれる系統も長枝であることが多いため、系統樹の基部に引き寄せられることが多い。真のLBAの頻度は不明であり、しばしば議論されている[ 1 ] [ 2 ] [ 3 ]。また、一部の著者は、LBAは検証不可能であり、したがって経験的な系統推論とは無関係であると考えている。[ 4 ] LBAは、しばしば節約法に基づく方法論の欠点と見なされるが、原理的にはさまざまなシナリオから生じる可能性があり、複数の分析パラダイムの下で推論される可能性がある。
LBAは、最小進化基準で離散的な形態学的特徴セットを分析する際に問題となることが最初に認識されましたが、 DNAまたはタンパク質配列の最尤法分析も同様に影響を受けます。単純な仮想例はFelsenstein 1978にあり、特定の未知の「真の」系統樹の場合、一部の方法では長い枝をグループ化するバイアスが見られ、最終的に誤った姉妹関係の推論につながることが示されています。[ 5 ]これは多くの場合、分析に含まれる1つ以上の形質の収斂進化が複数の分類群で起こっているためです。これらの共有形質は独立して派生したものであっても、分析では共通祖先による共有として誤って解釈される可能性があります。
系統解析やクラスタリング解析において、LBA(下位分岐)はクラスタリングアルゴリズムの仕組みに起因する現象です。末端の系統や、多くの固有派生形質(単一の分岐に固有の形質状態)を持つ分類群は、偶然にも他の分岐の系統と同じ形質状態を示すことがあります(相同性)。系統解析では、他の共有派生形質が相同性形質を上回って真の姉妹群をグループ化しない限り、これらの分類群はクレードとしてまとめられます。
これらの問題は、同じ部位での複数の置換を補正する方法を使用したり、長い枝を持つ分類群に関連する分類群を追加してデータに真の共有派生形質を追加したり、より進化の遅い代替形質(例えば、より保守的な遺伝子領域)を使用したりすることで最小限に抑えることができる。
進化解析におけるLBAの結果、急速に進化する系統は、実際の関係性に関わらず、姉妹分類群であると推測される可能性がある。例えば、DNA配列に基づく解析では、2つ(またはそれ以上)の系統の配列が急速に進化する場合に問題が生じる。ヌクレオチドは4種類しか存在せず、 DNA置換率が高い場合、2つの系統が同じ部位で同じヌクレオチドに進化する確率が高くなる。このような場合、系統解析では、この相同性を誤って共有派生形質(つまり、2つの系統の共通祖先で一度だけ進化した形質)と解釈してしまう可能性がある。
逆の効果も観察される可能性があり、より広範で急速に進化するグループの中で、2つ(またはそれ以上)の枝が特にゆっくりと進化する場合、それらの枝は近縁であると誤解される可能性がある。そのため、「長枝誘引」は、ある意味で「枝長誘引」と表現する方が適切かもしれない。しかし、一般的に誘引を示すのは長枝である。
長枝誘引の認識は、系統発生が間違っていることを示唆する他の証拠が存在することを意味します。たとえば、2つの異なるデータソース(つまり、分子と形態)または異なる方法または分割スキームによって、長枝グループの異なる配置が支持される可能性があります。[ 6 ]ヘニッヒの補助原理は、特定の反証がない限り、共有派生形質は事実上のグループ分けの証拠とみなされるべきであることを示唆しています(Hennig、1966; Schuh and Brower、2009)。
長枝引力が系統樹のトポロジーに影響を与えているかどうかを判断するためのシンプルで効果的な方法は、Siddal と Whiting にちなんで名付けられた SAW 法です。2 つの分類群 (A と B) の間に長枝引力が疑われる場合は、分類群 A を削除し (枝から「切り離す」)、分析を再実行します。次に、B を削除して A を戻し、分析を再度実行します。どちらかの分類群が他方の分類群がない状態で別の分岐点に現れる場合、長枝引力の証拠となります。分析に 1 つしか含まれていない場合、長枝同士が互いに引き合うことはあり得ないため、処理間で分類群の配置が一貫している場合は、長枝引力が問題ではないことを示します。[ 7 ]

簡単にするために、図に示すように、形質状態の変化量に比例した枝長を持つ根なしの「真のツリー」上に分布する単一のバイナリ形質(+ または – のいずれか)を考えているものとします。B から D への進化距離は小さいため、ほとんどの場合、B と D は同じ形質状態を示すと仮定します。ここでは、両方とも + であると仮定します(+ と – は任意に割り当てられ、それらを入れ替えるのは定義の問題にすぎません)。この場合、残りの可能性は 4 つあります。A と C の両方が + である場合、すべての分類群は同じで、すべてのツリーの長さは同じです。A が + で C が – である場合、1 つの形質のみが異なり、すべてのツリーの長さが同じであるため、何も学ぶことができません。同様に、A が – で C が + である場合。残りの可能性は、A と C の両方が – である場合のみです。しかしこの場合、AとC、またはBとDのいずれかを、他のものに関してグループとみなします(一方の形質状態は祖先形質であり、他方は派生形質であり、祖先形質状態はグループを定義しません)。結果として、このタイプの「真の系統樹」がある場合、収集するデータが増えるほど(つまり、研究する形質が増えるほど)、相同形質が多くなり、誤った系統樹を支持することになります。[ 8 ]もちろん、実際の生物の系統発生研究で経験的データを扱う場合、真の系統樹のトポロジーは決してわかりませんし、より簡潔な(AC)または(BD)が正しい仮説である可能性も十分にあります。
尤度に基づく推定は、長い枝の誘引に対しては比較的耐性があるが、逆の方向には失敗する可能性がある。つまり、近縁の2つの分類群が長い枝を持っている場合、それらが誤って分離される可能性がある。これが長い枝の反発(LBR)である。[ 9 ]
ベイズ推論や最尤法などの非最小法はLBAの発生を減らす傾向があるが、完全に排除するわけではない。[ 10 ](この点ではベイズ法の方がLBAになりやすい。)[ 11 ]具体的には、分類群やサイト間の組成の不均一性の場合に依然として苦慮しており、これは基本的な置換モデルの仮定を無効にする。このような可能性を考慮した混合モデルやPMSFを使用することで、これを回避できる。アミノ酸の再コーディングや組成テストによるデータフィルタリングも役立つ。[ 12 ]
急速に進化しているサイトなど、問題のあるデータ部分を除外すると役立つ場合があります。長枝分類群自体、または通常の分類群など、特定の分類群を分析から除外することも、場合によっては役立ちますが、分類群を追加する方が多くの場合役立ちます。長枝分類群に関連する分類群のデータを追加すると、枝をより小さく、管理しやすい部分に分割できます。LBAを検出するのに役立つ方法は他にもたくさんあります。検出と回避の具体的な例は、Bergsten (2005) に記載されています。[ 13 ]
LBA および LBR に対するメソッドの耐性は、困難な実データまたはシミュレーションデータを使用して経験的にテストされます。実データでは、真値を完全に確信することはできませんが、自然であることは保証されています。シミュレーションデータでは、ツリーの「真の」形状と進化モデル (できれば自然進化に似たもの) を指定できます。困難であることが知られている実データには、次のものがあります。[ 10 ]
シミュレーションの面では、Seq-gen が古典的なプログラムです。[ 14 ] Pro-cov のページには、さまざまな種類のヘテロタキシーを表現するための Seq-gen の後継バージョンがいくつかリストされています。[ 15 ]