定量的比較言語学とは、比較言語学に定量分析を応用する学問分野である。例としては、語彙統計学や言語年代学といった統計学分野、生物学から系統学を借用した研究などが挙げられる。
比較言語学における定量的分析の目的で、統計的手法は1世紀以上にわたって用いられてきた。1950年代には、スワデシュ・リストが登場した。これは、ほとんどの言語に見られる単語やフレーズといった語彙概念を標準化したものであり、2つ以上の言語を経験的に比較対照することを可能にする。
おそらく最初に発表された定量的歴史言語学研究は、1916年にサピアによって行われたものであり[ 1 ] 、一方、 1937年にクローバーとクレティエンは74の形態論的および音韻論的特徴を用いて9つのインド・ヨーロッパ語族(IE)言語を調査した[2](1939年にヒッタイト語が追加され拡張された)。ロス[ 3 ]は1950年に、そのような研究の理論的基礎に関する調査を行った。スワデシュは、単語リストを用いて、1950年代初頭に発表された一連の論文[ 4 ]で語彙統計学と言語年代学を発展させたが、これらの方法は広く批判された[ 5 ]。ただし、その批判の一部は他の学者によって不当であると見なされた。エンブレトンは1986年に「歴史言語学における統計学」という本を出版し、これまでの研究をレビューし、言語年代学の方法を拡張した。 Dyen、Kruskal、Blackは1992年に大規模なIEデータベースで語彙統計学的手法の研究を行った。[ 6 ]
1990年代には、 計算系統学および分岐分類学の手法を応用することで、このテーマへの関心が再び高まりました。こうしたプロジェクトには、言語学者と情報科学や生物人類学の専門知識を持つ同僚との共同研究がしばしば含まれていました。これらのプロジェクトは、進化上の祖先や言語接触に関する仮説を表す最適な系統樹(またはネットワーク)に到達することを目指していました。こうした手法の先駆者には、CPHL(歴史言語学における計算系統学)プロジェクトの創設者であるドナルド・リンジ、タンディ・ワーノウ、ルアイ・ナクレ、スティーブン・N・エバンスなどがいます。
1990年代半ば、ペンシルベニア大学のグループが比較法をコンピュータ化し、20の古代言語を含む別のIEデータベースを使用しました。[ 7 ]生物学分野では、歴史言語学に応用できるソフトウェアプログラムがいくつか開発されました。特に、オークランド大学のグループは、IE言語の年代を議論の余地のあるほど古い年代にする手法を開発しました。[ 8 ] 1999年8月には「歴史言語学における時間的深度」に関する会議が開催され、定量的手法の多くの応用が議論されました。[ 9 ]その後、さまざまな言語グループの研究や手法の比較に関する多くの論文が発表されました。2004年の会議の議事録「系統発生的手法と言語の先史時代」は、ピーター・フォースターとコリン・レンフルーによって編集され、2006年に出版されました。
計算系統解析は、以下の生物種に対して実施された。
言語関係を評価する標準的な方法は比較法である。しかし、これにはいくつかの限界がある。すべての言語資料が入力に適しているわけではなく、この方法が適用される言語レベルに問題がある。再構築された言語は理想化されており、研究者によって結果が異なる可能性がある。言語系統樹はしばしばこの方法と併用され、「借用語」はデータから除外する必要があるが、借用語が同一系統内にある場合はこれが難しい。この方法は適用できる時間的深さが限られているとよく言われる。この方法は適用が難しく、独立したテストがない。[ 28 ]そのため、形式化された方法を持ち、関係を定量化し、テスト可能な代替方法が求められてきた。
比較歴史言語学の目標は、言語間の遺伝的関連性の事例を特定することである。[ 29 ]定量分析の手順は、(i) 理論的根拠、特定のモデル、過去の経験などに基づいて手順を考案すること、(ii) 比較対象となる言語学的見解が多数存在するデータに適用して手順を検証すること(これにより、(i) の手順が修正されるか、極端な場合には完全に放棄される可能性がある)、(iii) 言語学的見解がまだ作成されていない、まだ確固として確立されていない、あるいは場合によっては矛盾しているデータに手順を適用することである。[ 30 ]
言語に系統発生的手法を適用することは、多段階のプロセスです。(a) エンコーディング段階 - 実際の言語から、それらの間の関係を数値データまたは状態データの形で表現し、そのデータを系統発生的手法への入力として使用できるようにします。(b) 表現段階 - 系統発生的手法を適用して、それらの数値データおよび/または状態データから信号を抽出し、それを有用な表現形式(通常はツリーやネットワークなどの2次元グラフィカルなもの)に変換します。これらの表現形式は、信号内の非常に複雑な多次元の関係を統合して「縮約」します。(c) 解釈段階 - これらのツリーおよびネットワーク表現を評価し、それらが実際の言語と時間の経過に伴うそれらの関係にとって実際に何を意味するのかを抽出します。[ 31 ]
定量的歴史言語分析の出力は通常、ツリーまたはネットワーク図です。これにより出力データの要約的な視覚化が可能になりますが、完全な結果ではありません。ツリーは、頂点(「ノード」とも呼ばれる)の集合と、それぞれが2つの頂点を接続するエッジ(「ブランチ」)の集合からなる連結非巡回グラフです。[ 32 ]内部ノードは、系統樹またはネットワークにおける言語の祖先を表します。各言語はパスで表され、パスは言語が進化するにつれて異なる状態を示します。すべての頂点のペアの間には1つのパスしかありません。根なしツリーは、入力データの系統に関する仮定なしに、入力データ間の関係をプロットします。根付きツリーは、進化の方向を指定したり、分類対象の言語セットと遠い関係にあることがわかっている「アウトグループ」を含めたりすることによって、共通の祖先を明示的に識別します。ほとんどのツリーはバイナリ、つまり親が2つの子を持ちます。ツリーは常に適切であるとは限りませんが、常に生成できます。別の種類のツリーとして、言語の類似点/相違点のみに基づくものがあります。この場合、グラフの内部ノードは祖先を表すのではなく、データ分析における異なる分割(「二分割」)間の矛盾を表すために導入されます。「表現距離」は、言語間のパスに沿った重み(多くの場合、長さで表される)の合計です。場合によっては、これらの内部ノードが祖先を表すという追加の仮定が置かれることもあります。
言語が収束する場合、通常は単語の採用(「借用」)によって、ネットワーク モデルの方が適切です。言語の二重の親を反映するために、追加のエッジが存在します。両方の言語が互いに借用する場合、これらのエッジは双方向になります。したがって、ツリーは単純なネットワークですが、ネットワークには他にも多くの種類があります。系統発生ネットワークは、分類群がノードで表され、進化上の関係がブランチで表されるものです。[ 33 ]もう 1 つのタイプは、スプリットに基づくもので、スプリット ツリーの組み合わせによる一般化です。特定のスプリット セットは複数の表現を持つことができるため、内部ノードは祖先ではない可能性があり、系統発生ネットワークの「明示的な」表現とは異なり、進化の歴史の「暗黙的な」表現にすぎません。スプリット ネットワークでは、精神距離は 2 つの言語間の最短経路です。もう 1 つのタイプは、網状ネットワークです。これは、網状構造として不適合性 (たとえば接触による) を示し、その内部ノードは祖先を表します。ネットワークは、ツリーに接触エッジを追加することによって構築することもできます。最後の主要なタイプは、ツリーから形成されるコンセンサスネットワークです。これらのツリーは、ブートストラップ分析の結果、または事後分布からのサンプルから得られる場合があります。
言語は絶えず変化しますが、通常は一定の速度ではなく、[ 34 ]その累積効果により方言、言語、言語ファミリーへの分岐が生じます。一般的に、形態論は最もゆっくりと変化し、音韻論は最も速く変化すると考えられています。変化が起こるにつれて、元の言語の証拠はますます少なくなります。最終的には、関連性の証拠が失われる可能性があります。あるタイプの変化は他のタイプに影響を与えない場合があります。たとえば、音の変化は同源性に影響を与えません。生物学とは異なり、すべての言語が共通の起源を持つと想定することはできず、関連性を確立する必要があります。モデリングでは、簡略化のために文字が独立して変化すると想定されることが多いですが、そうではない場合があります。借用の他に、意味シフトや多形性も起こり得ます。
スワデシュは当初200語のリストを公開したが、後に100語のリストに改良した。[ 35 ]一般的に使用されているインド・ヨーロッパ語族のデータベースは、ダイエン、クルスカル、ブラックによるもので、95言語のデータが含まれているが、オリジナルにはいくつかのエラーが含まれていることが知られている。生データに加えて、同源語の判断も含まれている。[ 36 ]リンゲ、ワーノウ、テイラーのデータベースには、22の音韻文字、15の形態文字、333の語彙文字を含む24のインド・ヨーロッパ語族の情報が含まれている。グレイとアトキンソンは、ダイエンのセットに3つの古代言語を追加した、2449の語彙項目を含む87言語のデータベースを使用した。彼らは多くの学者の同源語の判断を取り入れた。他のデータベースは、アフリカ、オーストラリア、アンデスの言語族などのために作成されている。
データの符号化は、バイナリ形式またはマルチステート形式で行うことができます。前者はよく使用されますが、バイアスが生じます。2 つの符号化方法の間には一定のスケール係数があり、これを考慮に入れることができると主張されています。しかし、別の研究では、トポロジーが変化する可能性があることが示唆されています[ 37 ] 。
単語スロットは、文化や借用語の影響をできるだけ受けないように選ばれています。オリジナルのスワデシュのリストが最も一般的に使用されていますが、特定の目的のために他の多くのリストも考案されています。多くの場合、これらはスワデシュが推奨する100項目のリストよりも短くなっています。ケスラーは「単語リストの重要性」[ 38 ]に関する本を執筆し、マクマホンとマクマホンは再構成可能性と保持性の影響に関する研究を行いました。[ 28 ]スロット数を増やす効果は研究されており、収穫逓減の法則が発見され、約80で満足できることがわかりました。[ 39 ]ただし、この数の半分以下の数を使用した研究もあります。
一般的に、同族語のセットはそれぞれ異なる文字で表されますが、単語間の違いは音の変化による距離として測定することもできます。距離は文字単位で測定することも可能です。
従来、これらの特徴は語彙的な特徴よりも重要視されてきたため、一部の研究ではこの種の特徴に特別な重み付けがなされてきた。例えば、リンゲ、ワーノウ、テイラーによるIEデータベースには、こうした特徴が含まれている。しかし、他の研究ではこれらが省略されている。
これらの特徴の例としては、声門化定数、声調システム、名詞の対格アライメント、双数、格数対応、目的語-動詞の語順、一人称単数代名詞などがある。これらはWALSデータベースにリストされる予定だが、多くの言語についてはまだデータがまばらにしか登録されていない。[ 40 ]
分析手法の中には、言語進化の統計モデルを取り入れ、そのモデルの特性を利用して進化の歴史を推定するものがあります。統計モデルは、テスト目的でデータをシミュレーションするためにも使用されます。確率過程を用いることで、言語内で文字セットがどのように進化するかを記述できます。文字が変化する確率は系統によって異なりますが、すべての文字が同時に進化するわけではなく、また、すべての系統で変化率が同じでもありません。各文字は独立して進化すると仮定されることが多いですが、必ずしもそうとは限りません。モデル内では、借用や並行進化(相同性)に加え、多型もモデル化できます。
偶然の類似性は、関連性の必要なシグナルを見つけ出すためのノイズレベルを生み出します。リンゲ[ 41 ]は、集団比較法における偶然の影響について研究を行いました。
借用語はツリーのトポロジーに深刻な影響を与える可能性があるため、借用語を排除する努力がなされています。しかし、検出されない借用語が依然として存在する場合があります。 McMahon と McMahon [ 42 ]は、約 5% の借用語がトポロジーに影響を与え、10% では重大な影響を与えることを示しました。ネットワークでは、借用語によって網状構造が生成されます。 Minett と Wang [ 43 ]は、借用語を自動的に検出する方法を検討しました。
言語の分岐年代は、系統樹の各枝に沿って文字がどのように進化するかが分かれば決定できます。最も単純な仮定は、すべての文字が時間とともに単一の一定の速度で進化し、それが系統樹の枝とは無関係であるというものです。これは言語年代学で採用された仮定でした。しかし、研究により、言語間にはばらつきがあることがすぐに明らかになり、その一部は認識されていない借用によるものと考えられます。[ 44 ]より良いアプローチは、速度の変動を許容することであり、数学的に扱いやすいことからガンマ分布が通常使用されます。文字置換率は使用頻度に依存することを示す研究も行われています。[ 45 ]広範囲にわたる借用は、言語がより類似しているように見え、したがってより若いように見えるため、分岐時間の推定に偏りをもたらす可能性があります。しかし、これは祖先の枝の長さを長くするため、根には影響しません。[ 46 ]
言語分類手法の前提条件と限界を把握するためには、その仕組みを理解する必要がある。特定の条件下でのみ有効であったり、小規模なデータベースにしか適さない場合もある。手法によって、必要なデータ量、複雑さ、実行時間が異なる。また、最適化基準も異なる。
これら2つの方法は似ていますが、最大節約法の目的は、進化的な変化の数が最小となる系統樹(またはネットワーク)を見つけることです。実装によっては、形質に重み付けを行い、変化の重み付き合計を最小化することが目的となります。外群を用いるか、または方向性のある形質を用いない限り、解析結果は根なし系統樹となります。最適な系統樹を見つけるためにヒューリスティックが用いられますが、最適化は保証されません。この方法は、PAUPやTNTといったプログラムを用いて実装されることが多いです。
最大適合性法も形質を用い、相同性のない形質が最大数進化する系統樹を見つけることを目的としている。ここでも形質に重み付けをすることができ、重み付けが行われる場合は、適合する形質の重みの合計を最大化することが目的となる。また、追加情報が組み込まれない限り、根なし系統樹が生成される。大規模データベースで正確なヒューリスティックは容易に入手できない。この方法はRingeのグループによってのみ使用されている。[ 47 ]
この方法では、追加の接触エッジを持つ基底ツリーを持つ明示的な系統発生ネットワークが生成されます。形質は借用できますが、相同性なしに進化します。このようなネットワークを生成するために、グラフ理論的アルゴリズム[ 48 ]が使用されています。
入力語彙データはバイナリ形式でコード化され、元の多状態文字の各状態に対して 1 つの文字が割り当てられます。この方法では相同性と分岐時間の制約が可能です。尤度ベースの分析方法が使用され、進化は速度行列として表現されます。同族語の獲得と喪失は、速度の変動と速度平滑化を可能にするためにガンマ分布でモデル化されます。多くの言語で可能なツリーの数が膨大であるため、最適なツリーを探索するためにベイズ推論が使用されます。マルコフ連鎖モンテカルロアルゴリズム[ 49 ]は、事後確率分布の近似としてツリーのサンプルを生成します。この分布の要約は、サポート値を持つ貪欲な合意ツリーまたはネットワークとして提供できます。この方法では日付推定も提供されます。
この方法は、元の文字がバイナリであり、ガンマ分布に従う速度を持つサイト間速度モデルの下で互いに同一かつ独立して進化する場合に正確です。変化率が一定の場合、日付は正確です。元の文字がマルチステートである場合、バイナリエンコーディングによって生成される文字は独立していないのに対し、この方法は独立性を前提としているため、この方法の性能を理解するのはより複雑です。
この方法[ 50 ]は Gray と Atkinson の方法から派生したものです。形質に対して 2 つのパラメータではなく、この方法では 3 つのパラメータを使用します。出生率、同族の死亡率、およびその借用率が指定されます。出生率は、同族クラスの単一の出生を伴うポアソン確率変数ですが、枝の個別の死亡は許可されます (Dollo の最小進化)。この方法は相同性を許可しませんが、多型と制約を許可します。主な問題は、欠損データを処理できないことです (この問題はその後 Ryder と Nicholls によって解決されました。[ 51 ]統計的手法を使用してモデルをデータに適合させます。事前情報を組み込むことができ、可能な再構築の MCMC 研究が行われます。この方法は Gray と Nichol のデータベースに適用され、同様の結果が得られるようです。
これらの手法は、言語ペアワイズ比較の三角行列を使用します。入力文字行列は、ハミング距離またはレーベンシュタイン距離のいずれかを使用して距離行列を計算するために使用されます。前者は一致する文字の割合を測定し、後者はさまざまな変換のコストを含めることができます。これらの方法は、完全に文字ベースの方法と比較して高速です。ただし、これらの方法では情報損失が発生します。
「非加重ペアワイズグループ法(算術平均法)」(UPGMA)は、言語間の距離が最小となる2つの言語を繰り返し結合することでクラスタリングを行う手法です。時計のように規則的な進化には正確に対応しますが、それ以外の場合は誤りが生じる可能性があります。これは、スワデシュのオリジナルの語彙統計学で使用された手法です。
これは、データを自然なグループに分割する手法です。[ 52 ]データは文字である場合もありますが、通常は距離尺度です。文字数または距離を使用して分割を生成し、分割の重み(枝長)を計算します。重み付けされた分割は、各分類群のペア間の変化の数を最小化することに基づいて、ツリーまたはネットワークで表現されます。分割のコレクションを生成するための高速アルゴリズムがあります。重みは、分類群間の距離から決定されます。分割分解は、分類群の数が少ない場合、または信号があまり複雑でない場合に効果的です。
この方法は距離データに基づいて動作し、入力行列の変換を計算し、言語ペアの最小距離を計算します。[ 53 ]言語が語彙時計で進化しない場合でも正しく動作します。この方法の重み付きバージョンも使用できます。この方法は出力ツリーを生成します。これは、ツリー構築の手動テクニックに最も近い方法であると主張されています。
近隣結合と同様のアルゴリズムを使用します。[ 54 ]分割分解とは異なり、ノードをすぐに融合するのではなく、ノードが2回目にペアになるまで待ちます。その後、ツリーノードは2つに置き換えられ、距離行列が縮小されます。大規模で複雑なデータセットを処理できます。ただし、出力は系統樹ではなくフェノグラムです。これは最も一般的なネットワーク手法です。
これは、言語分析に使用された初期のネットワーク手法です。元々は、複数の起源が考えられる遺伝子配列用に開発されました。[ 55 ]ネットワークは、代替ツリーを単一のネットワークに縮約します。複数の履歴がある場合は、網状構造(ボックス型)が描画されます。ツリーと互換性のない文字のリストが生成されます。
これは宣言的知識表現形式と解答集合プログラミングの手法を使用します。[ 56 ]このようなソルバーの1つにCMODELSがあり、これは小さな問題に使用できますが、大きな問題にはヒューリスティックが必要です。前処理を使用して情報文字を決定します。CMODELSはそれらを命題理論に変換し、SATソルバーを使用してこの理論のモデルを計算します。
FitchとKitchは、NJとは異なり、追加ごとにツリーを再配置できるPHYLIPの最尤法に基づくプログラムです。Kitchは、ツリー全体で一定の変化率を仮定する点でFitchとは異なりますが、Fitchは各ブランチで異なる変化率を許容します。[ 57 ]
ホルムは2000年に、語彙統計分析の既知の問題に対処する方法を導入した。これらの問題とは、共通の古語が共通の新語と区別しにくい「シンプレシオモルフィーの罠」と、後期の変化が初期の変化を覆い隠してしまう「比例性の罠」である。その後、言語間の単語分布の変動を考慮するために、SLDと呼ばれる改良された方法を導入した。[ 58 ]この方法は、変化率が一定であるとは仮定していない。
大規模データベース(200以上の言語)で使用するために、収束の速い解析手法が数多く開発されてきました。その1つがディスクカバリング法(DCM)です。[ 59 ]これは既存の手法と組み合わされて、パフォーマンスが向上しています。DCM-NJ+MP法に関する論文は、同じ著者らによって「直径が制限されたツリーに対する系統発生手法のパフォーマンス」という論文で発表されており、NJ法と比較されています。
これらのモデルは、単語の音韻ではなく文字を比較します。Dunnら[ 60 ] は、16 のオーストロネシア語と 15 のパプア語にわたる 125 の類型学的文字を研究しました。彼らはその結果を MP ツリーと従来の分析によって構築されたツリーと比較しました。有意な違いが見つかりました。同様に、Wichmann と Saunders [ 61 ]は 96 文字を使用して 63 のアメリカ言語を研究しました。
一連の言語が関連しているかどうかを最初に調査する方法として提案されたのは、大量比較法でした。しかし、この方法は厳しく批判され、使われなくなりました。最近、ケスラーは厳密な仮説検定を用いて、この方法のコンピュータ版を復活させました。[ 62 ]その目的は、一度に2つ以上の言語間の類似性を利用することです。別の論文[ 63 ]では、単語リストを比較するためのさまざまな基準が評価されています。IE語族とウラル語族は再構築できることがわかりましたが、共通の超語族の証拠はありませんでした。
この方法は、スタンス動詞などの安定した語彙フィールドを使用して、長距離の関係を確立しようとします。[ 64 ]収束と意味シフトを考慮して、古代の同族語を探します。モデルの概要とパイロット研究の結果が提示されます。
自動類似性判定プログラム(ASJP) は語彙統計学に似ていますが、類似性の判定は一貫した一連のルールに従うコンピュータ プログラムによって行われます。[ 65 ] ツリーは標準的な系統発生法を使用して生成されます。ASJP は 7 つの母音記号と 34 個の子音記号を使用します。さまざまな修飾子もあります。2 つの単語は、それぞれの単語の少なくとも 2 つの連続する子音が同一である場合に類似していると判断され、母音も考慮されます。2 つの言語について、同じ意味を持つ単語が類似していると判断された割合は、語彙類似性パーセンテージ (LSP) です。音韻類似性パーセンテージ (PSP) も計算されます。次に、PSP を LSP から差し引くと、減算類似性パーセンテージ (SSP) が得られ、ASJP 距離は 100-SSP です。現在、ASJPデータベース[ 66 ]には4,500以上の言語と方言に関するデータがあり、そこから世界の言語の系統樹が生成されました[ 67 ] 。
これは、同源語判断の主観性を避けるために、単語間の正書法上の距離を測定します。[ 68 ] これは、ある単語を別の単語に変換するために必要な最小操作数を、より長い単語の長さで正規化して決定します。距離データから、UPGMA 手法によってツリーが構築されます。
ヘガティは、同族語間の差異の度合いを、単なるイエス/ノーの回答ではなく、測定する方法を提案した。[ 69 ]これは、原言語と比較して、注釈の音声の多くの(30を超える)特徴を調べることに基づいている。これには膨大な作業が必要になる可能性があるが、ヘガティは、音の代表的なサンプルだけで十分だと主張している。彼はまた、音声の変化率を調べ、変化率の変動が大きいため、言語年代学には不向きであることを発見した。同様の音声評価は、以前にグライムズとアガードによってロマンス語に対して行われたが、これは6つの比較ポイントしか使用していなかった。[ 70 ]
2 つのツリーの類似性/相違性を測定するための標準的な数学的手法が利用可能です。コンセンサス ツリーの場合、一貫性指数 (CI) は相同性の尺度です。1 つの文字の場合、これは任意の 1 つのツリー上の考えられる最小ステップ数 (二分木の場合は = 1) をツリー上で再構築されたステップ数で割った比率です。ツリーの CI は、文字 CI の合計を文字数で割ったものです。[ 71 ]これは、正しく割り当てられたパターンの割合を表します。
保持指数(RI)は、文字の類似度を測定する指標です。これは、(g - s) / (g - m) の比率で表されます。ここで、gは任意のツリーにおける文字の最大ステップ数、mは任意のツリーにおける最小ステップ数、sは特定のツリーにおける最小ステップ数です。また、CI と RI の積である再スケーリング CI も存在します。
二分木の場合、トポロジーを比較する標準的な方法は、Robinson-Foulds メトリックを使用することです。[ 72 ]この距離は、枝の出現に関して、偽陽性と偽陰性の数の平均です。RF 率が 10% を超える場合は、一致度が低いとみなされます。他の種類の木やネットワークについては、まだ標準的な比較方法はありません。
ツリー生成手法によっては、互換性のない文字のリストが生成されることがあります。これは、出力結果を分析する際に非常に役立ちます。ヒューリスティック手法を用いる場合、再現性が問題となります。しかし、この問題を克服するために、標準的な数学的手法が用いられています。
手法を評価するために、よく理解されている言語ファミリーが、信頼できるデータセットとともに選ばれます。このファミリーは、多くの場合インド・ヨーロッパ語族ですが、他のファミリーも使用されています。比較対象の手法をデータベースに適用した後、結果として得られたツリーは、従来の言語学的手法によって決定された参照ツリーと比較されます。目的は、トポロジーに矛盾がないこと、たとえばサブグループが欠落していないこと、および日付が互換性があることです。Nichols と Warnow [ 73 ]がこの分析のために提案したファミリーは、ゲルマン語族、ロマンス語族、スラブ語族、共通テュルク語族、中国語、ミハ・ゾク語族、およびオセアニア語族やインド・ヨーロッパ語族などの古いグループです。
実際の言語を用いることで現実味が増し、現実的な問題が生じるものの、上記の検証方法では言語の真の進化が不明であるという問題点がある。シミュレーションによる進化からデータセットを生成することで正しい系統樹が判明するが、それは現実を簡略化したものに過ぎない。したがって、両方の評価手法を用いるべきである。
解の堅牢性を評価するには、入力データと制約を変化させて出力を観察することが望ましい。各変数は順番に少しずつ変更される。この分析は多くのケースで実施されており、例えば Atkinson と Gray によって堅牢な方法であることがわかっている。[ 74 ]
1990年代初頭、言語学者のドナルド・リンゲは、コンピュータ科学者のルアイ・ナクレとタンディ・ワーノウ、統計学者のスティーブン・N・エバンスらとともに、定量的比較言語学プロジェクトでの研究に協力し始めた。彼らは後にCHPLプロジェクトを設立し、その目標には「特にインド・ヨーロッパ語族の実際の言語データセットの作成と維持」、「歴史的言語データの進化を捉える統計モデルの策定」、「再構築方法の性能を研究するための合成データを生成するためのシミュレーションツールと精度指標の設計」、「系統ネットワークを含む言語系統樹を再構築するための統計的手法と組み合わせ的手法の開発と実装」などが含まれる。[ 75 ]
コーディング方法の比較は、Rexovaら(2003) によって行われた。[ 76 ]彼らは Dyen データベースから縮小データセットを作成したが、ヒッタイト語を追加した。彼らは、141 文字の状態が個々の同族クラスに対応し、多形性を可能にする標準的な多状態マトリックスを作成した。また、主観性を減らすためにいくつかの同族クラスを結合し、多形状態は許可しなかった。最後に、単語の各クラスを個別の文字として扱うバイナリマトリックスを作成した。マトリックスは PAUP によって分析された。バイナリマトリックスを使用すると、ツリーのルート付近で変化が生じることがわかった。
McMahon と McMahon (2003) は、DKB データセットで 3 つの PHYLIP プログラム (NJ、Fitch、Kitch) を使用しました。[ 77 ]結果は、非常に類似していることがわかりました。ブートストラップを使用して、ツリーの任意の部分の堅牢性をテストしました。その後、データのサブセットを使用して、保持性と再構築可能性を評価しました。[ 42 ]出力は、借用に起因するトポロジーの違いを示しました。次に、Network、Split Decomposition、Neighbor-net 、およびSplitsTree をいくつかのデータセットで使用しました。後者の 2 つの方法の間には有意な違いが見つかりました。Neighbor-net は、言語接触を識別するのに最適であると考えられました。
2005年、Nakhleh、Warnow、Ringe、Evansは、インド・ヨーロッパ語族データベースを使用して6つの分析方法の比較を行った。[ 78 ]比較された方法は、UPGMA、NJ MP、MC、WMC、GAであった。PAUPソフトウェアパッケージは、UPGMA、NJ、MC、および多数決コンセンサスツリーの計算に使用された。RWTデータベースが使用されたが、多型の証拠があったため40文字が削除された。次に、明らかに並行発達を示したすべての文字を除外したスクリーニング済みデータベースが作成され、38の特徴が削除された。ツリーは、不適合文字の数と確立されたサブグループの結果との一致に基づいて評価された。彼らは、UPGMAが明らかに最悪であるが、他の方法の間には大きな違いがないことを知った。結果は、使用されたデータセットに依存していた。文字の重み付けが重要であることがわかったが、これには言語的判断が必要であった。
Saunders (2005) [ 79 ]は、語彙データと類型データの組み合わせに基づいて NJ、MP、GA、Neighbor-Net を比較しました。彼は GA メソッドの使用を推奨しましたが、Nichols と Warnow は研究方法論についていくつか懸念を抱いています。[ 80 ]
Cysouwら(2006)[ 81 ]は、Holmのオリジナル法をNJ、Fitch、MP、SDと比較した。彼らはHolmの方法が他の方法よりも精度が低いことを発見した。
2013年に、François Barbancon、Warnow、Evans、Ringe、Nakleh(2013)は、シミュレーションデータを使用してさまざまな系統樹再構築方法を研究しました。[ 82 ] 彼らのシミュレーションデータは、接触エッジの数、相同性の程度、語彙時計からのずれ、およびサイト間レート仮定からのずれが異なっていました。重み付けなしの方法(MP、NJ、UPGMA、およびGA)の精度は、研究されたすべての条件で一貫しており、MPが最も優れていることがわかりました。2つの重み付け方法(WMCおよびWMP)の精度は、重み付けスキームの適切さに依存していました。相同性が低い場合、重み付け方法は一般的により正確な結果を生成しましたが、不適切な重み付けは、中程度または高い相同性レベルでMPまたはGAよりも悪くなる可能性があります。
適切なモデルの選択は、優れた系統解析を行う上で非常に重要です。パラメータが不足しているモデルや制約が厳しすぎるモデルは、その前提となる仮定が破られた場合に異常な挙動を示す可能性があります。一方、複雑すぎるモデルやパラメータが多すぎるモデルは、実行時間が長くなり、パラメータが過学習する可能性があります。[ 83 ]モデル選択の最も一般的な方法は、モデルとデータの適合度を推定する「尤度比検定」ですが、代替として赤池情報量規準またはベイズ情報量規準を使用することもできます。モデル選択用のコンピュータプログラムも利用可能です。