自動類似性判定プログラム( ASJP ) は、単語リストのデータベースを使用して比較言語学に計算アプローチを適用する共同プロジェクトです。このデータベースはオープンアクセスで、世界の言語の半分以上について 40 項目の基本語彙リストで構成されています。 [ 1 ]これは継続的に拡張されています。孤立語や系統群が実証されている言語に加えて、このデータベースにはピジン語、クレオール語、混合言語、および人工言語が含まれています。データベースの単語は、簡略化された標準正書法 ( ASJPcode )に転写されます。[ 2 ]このデータベースは、言語ファミリーが娘言語に分岐した時期を、言語年代学に関連しながらも異なる方法で推定するために使用されてきました。[ 3 ]原言語の故郷 ( Urheimat )を決定するために使用されてきました。[ 4 ]音象徴を調査するために使用されてきました。[ 5 ]さまざまな系統発生方法を評価するために使用されてきました。[ 6 ]
ASJPは、言語族間の関係を確立または評価するための適切な方法として、歴史言語学者の間で広く受け入れられているわけではない。[ 7 ]
これはマックス・プランク人類史科学研究所が主催するクロスリンギスティック・リンクト・データ・プロジェクトの一部である。[ 8 ]
ASJPはもともと、異なる言語の同じ意味を持つ単語の類似性を客観的に評価する手段として開発され、最終的には観察された語彙の類似性に基づいて言語をコンピュータで分類することを目的としていました。最初のASJP論文[ 2 ]では、比較対象の言語から意味的に同一の2つの単語が、少なくとも2つの同一の音素セグメントを示す場合に類似していると判断されました。2つの言語間の類似性は、比較対象の単語の総数のうち類似していると判断された単語の割合として計算されました。この方法は、オーストロアジア語族、インド・ヨーロッパ語族、マヤ語族、マスコギ語族を含む言語族の250の言語の100項目の単語リストに適用されました。
2008年頃に設立されたASJPコンソーシアムには、約25名のプロの言語学者やその他の関係者がボランティアの文字起こし担当者として、あるいはその他の形でプロジェクトを支援する形で参加しています。コンソーシアム設立の原動力となったのはセシル・H・ブラウン氏です。ソーレン・ウィックマン氏はプロジェクトの日常的なキュレーターを務めています。コンソーシアムのもう一人の中心メンバーはエリック・W・ホルマン氏で、彼はプロジェクトで使用されているソフトウェアのほとんどを作成しました。
当初使用された単語リストは100項目のスワデシュリストに基づいていましたが、100項目のうち40項目のサブセットが、リスト全体と同等か、わずかに優れた分類結果をもたらすことが統計的に判明しました。[ 9 ]そのため、その後収集された単語リストには40項目(または、一部の単語の証拠が不足している場合はそれ以下)のみが含まれています。
2008 年以降に発表された論文では、ASJP はレーベンシュタイン距離(LD)に基づく類似性判定プログラムを採用しています。このアプローチは、当初使用されていた方法よりも専門家の意見と比較した分類結果が優れていることがわかりました。LD は、ある単語を別の単語に変換するために必要な連続した変更の最小数として定義され、各変更は記号の挿入、削除、または置換です。レーベンシュタインアプローチでは、比較対象の 2 つの単語のうち長い方の単語の記号数で LD を割ることによって、単語の長さの違いを補正できます。これにより、正規化 LD (LDN) が生成されます。2 つの言語間で LDN を分割した (LDND) は、同じ意味を持つすべての単語ペアの平均 LDN を、異なる意味を持つすべての単語ペアの平均 LDN で割ることによって計算されます。この 2 番目の正規化は、偶然の類似性を補正することを目的としています。[ 10 ]
ASJPは以下の40語のリストを使用しています。[ 11 ]これはスワデシュ・ヤホントフのリストに似ていますが、いくつかの違いがあります。
2016年のASJPバージョンでは、音素をエンコードするために以下の記号を使用します: pbfvmw 8 tdszcnrl SZC j T 5 ykgx N q X h 7 L 4 G ! ie E 3 auo
これらは7つの母音と34の子音を表しており、すべて標準的なQWERTYキーボードに搭載されているものです。
2 つの子音の後に記号~が続くと、それらは同じ位置にあるとみなされます。したがって、kʷatは になりますkw~at。 、 、 などの音節は、katと語彙的に類似していると考えられます。watkawkwikw~at
同様に、$記号は 3 つの子音の後に続くため、それらは同じ位置にあるとみなされます。 は 、および とndy$im類似していると考えられます。nimdamyim
"直前の子音が声門化されていることを示します。