ISO 639-3:2007「言語名の表現コード - パート 3: 言語の包括的なカバーのための Alpha-3 コード」は、 ISO 639シリーズの言語コードに関する国際規格です。この規格は、言語を識別するための 3 文字のコードを定義しています。この規格は、国際標準化機構(ISO) によって 2007 年 2 月 1 日に発行されました。[ 1 ]
2023年現在、この規格のこの版は正式に廃止され、ISO 639:2023に置き換えられています。[ 1 ]
ISO 639-3 は、既知のすべての自然言語を網羅することを目的として、ISO 639-2 のalpha-3 コードを拡張したものです。拡張された言語範囲は、主にSIL Internationalが発行したEthnologue (第 10 巻から 第 14 巻)で使用されている言語コードに基づいています。SIL International は現在、 ISO 639-3 の登録機関です。 [ 2 ]現存する言語と絶滅した言語、古代言語と人工言語、主要言語とマイナー言語、書き言葉と書き言葉のない言語を含め、可能な限り完全な言語の列挙を提供します。[ 1 ]ただし、インド・ヨーロッパ祖語などの再構築された言語は含まれていません。[ 3 ]
ISO 639-3は、幅広い用途におけるメタデータコードとして使用されることを目的としています。インターネットなど、多くの言語をサポートする必要のあるコンピュータシステムや情報システムで広く使用されています。アーカイブやその他の情報ストレージでは、目録システムで使用され、リソースがどの言語で書かれているか、またはどの言語に関するものかを示します。また、言語名が不明瞭または曖昧な場合があるため、言語学の文献などでこのコードが頻繁に使用されています。
ISO 639-3 には、 ISO 639-1に含まれるすべての言語と、 ISO 639-2に含まれるすべての個別言語が含まれます。ISO 639-1 と ISO 639-2 は、世界の文学作品全体において最も頻繁に用いられる主要言語に焦点を当てています。ISO 639-2 には言語コレクションも含まれていますが、パート 3 には含まれていないため、ISO 639-3 は ISO 639-2 の上位集合ではありません。ISO 639-2 にB コードと T コードが存在する場合、ISO 639-3 では T コードを使用します。
2023年1月23日現在 標準には 7,916 項目が含まれています。[ 6 ]言語の目録は、639-2 に含まれる個々の言語、Ethnologueの現代語、 Linguist Listの歴史的変種、古代語、人工言語[ 7 ]、および毎年のパブリック コメント期間中に推奨された言語など、多数の情報源に基づいています。
登録機関から機械可読データファイルが提供されている。 [ 6 ]これらのデータファイルを使用して、ISO 639-1 または ISO 639-2 から ISO 639-3 へのマッピングを行うことができる。
ISO 639-3は、完全に客観的ではない基準に基づく区別を前提としています。[ 8 ]方言やその他の下位言語変種を文書化したり、識別したりすることを意図したものではありません。[ 9 ]それにもかかわらず、言語間の区別に関する判断は主観的になる可能性があり、特に確立された文学的伝統、教育やメディアでの使用、または言語の慣習化に寄与するその他の要因を持たない言語変種の場合にはそうです。したがって、この規格は、世界にどのような異なる言語が存在するか(場合によっては大きな意見の相違があるかもしれない)についての権威ある声明とみなされるべきではなく、むしろ異なる言語変種を正確に識別するための有用な方法の1つとしてのみ捉えるべきです。
コードは3文字のアルファベットなので、表現できる言語数の上限は26 × 26 × 26 = 17,576です。ISO 639-2では特殊コード(4)、予約範囲(520)、B専用コード(22)が定義されているため、546のコードはパート3では使用できません。したがって、より厳密な上限は17,576 − 546 = 17,030です。
ISO 639-2で定義されている言語コレクションと、 ISO 639-5でまだ定義されていない言語コレクションを除外すると、上限はさらに厳しくなります。
参照名には、ASCII文字のサブセットのみを使用できます。規格のセクション6.4.1によると、参照名にはISO基本ラテンアルファベットの26文字と、以下のセットのダイアクリティカルマークのみを含めることができます。
参照名には、5種類のASCII句読点(スペース、ハイフン、アポストロフィ、括弧)のいずれかを含めることができ、括弧内にはピリオドと10桁の数字を含めることができます。
別名には、ラテン語の場合は適切な正書法を用いるか、追加文字を含むラテン文字への音訳を用いる場合があります。
ISO 639-2には58の言語があり、これらは規格の目的上、ISO 639-3では「マクロ言語」とみなされています。[ 10 ]
これらのマクロ言語の中には、ISO 639-2のコードセットにおいてISO 639-3で定義されている個別の言語を持たないものもあった(例:ara汎用アラビア語)。一方nor、ノルウェー語のように、ISO 639-2に既に2つの個別の部分(ニーノシュク語、ブークモール語)が含まれてnnoいるものもnobあった。
arbつまり、ISO 639-2 では一つの言語 ( ) の方言とみなされていた言語 (例えば標準アラビア語)araが、ISO 639-3 では特定の文脈においてそれ自体が独立した言語とみなされるようになったということです。
これは、言語的には互いに異なっているかもしれないが、話者によって同じ言語の2つの形式として扱われる変種、例えば二言語併用の場合などに対処しようとする試みである。
例えば:
完全なリストは、ISO 639-3 登録機関の Web サイトで入手できます。[ 13 ]
「集合言語コード要素は、使用状況において単一の言語とはみなされない個々の言語のグループを表す識別子である。」[ 14 ]これらのコードは、特定の言語やマクロ言語を正確に表すものではない。
ISO 639-2では集合言語を表す3文字の識別子が含まれていますが、ISO 639-3ではこれらのコードは除外されています。したがって、ISO 639-3はISO 639-2の上位集合ではありません。
ISO 639-5は、ISO 639-2の言語集合コードを含む、言語ファミリーおよび言語グループのための3文字の集合コードを定義しています。
ISO 639-2およびISO 639-3では、特定のコードがどれも適切でない場合のために、4つのコードが別途用意されています。これらは主に、データベースなど、ISOコードが存在するかどうかにかかわらずISOコードが必要となるアプリケーションを対象としています。
mis(コード化されていない言語、元々は「その他」の略語)は、ISO規格に(まだ)含まれていない言語を対象としています。mul(複数言語)は、データに複数の言語が含まれており、(例えば)データベースに単一のISOコードが必要な場合を想定しています。und(未確定)は、データ内の言語が特定されていない場合(ラベルが誤って付けられている場合や、そもそもラベルが付けられていない場合など)を想定しています。トロイの木馬のように、確認されていない言語に名前が付けられている場合などは想定していません。zxx(言語的内容なし/該当なし)は、動物の鳴き声など、言語ではないデータを対象としています。[ 15 ]さらに、範囲内の 520 のコードはqaa「qtzローカル使用のために予約されています」。たとえば、レベッカ・ベッテンコートは構築言語にコードを割り当てており、新しい割り当てはリクエストに応じて行われます。[ 16 ]
ISO 639-3 のコード表は変更可能です。既存の使用の安定性を保護するため、許可される変更は以下に限定されます。[ 17 ]
言語に割り当てられたコードは、指示内容に変更がない限り変更されない。[ 18 ]
変更は年間サイクルに基づいて行われます。すべての申請には、最低3ヶ月間のパブリックレビュー期間が設けられます。
ISO 639-3 の Web サイトには、「指示範囲」[ 19 ] (言語タイプ) と言語タイプ[ 20 ]を説明するページがあり、エンコードの対象となる概念と満たすべき特定の基準について説明しています。たとえば、人工言語はエンコードできますが、人間とのコミュニケーション用に設計され、文献群が存在する場合に限ります。これにより、特異な発明の要求は阻止されます。
登録機関は、コードテーブルの維持方法に関するISO 639-3規格の本文中の指示をWebサイトで文書化している。[ 21 ]また、変更要求の受付と処理に使用されるプロセスも文書化している。[ 22 ]
変更申請フォームが用意されており、追加予定事項に関する情報を収集するための別のフォームも用意されています。変更申請はどの当事者でも提出できます。提出された申請は、まず登録機関によって内容の完全性が審査されます。
完全な文書化されたリクエストが受理されると、公開されている変更リクエストインデックスに追加されます。また、登録機関が関連性があると考える一般的な言語学者向けディスカッションリストであるLinguist Listやその他のリストにもアナウンスが送信され、リクエストされた変更に関する一般からの意見やコメントが求められます。リストの所有者または個人は、特定の地域または言語ファミリーに関する変更リクエストの通知をリクエストできます。寄せられたコメントは、他の関係者が確認できるように公開されます。寄せられたコメントの合意に基づいて、変更リクエストは取り下げられるか、「候補」ステータスに昇格される場合があります。
年次審査サイクル終了の3か月前(通常は9月)に、候補者ステータス変更申請に関するお知らせが、言語学者向けディスカッションリストおよびその他のリストに送信されます。すべての申請は、年次審査サイクル終了まで審査およびコメントを受け付けます。
決定は年次レビューサイクルの終了時(通常は1月)に発表されます。その時点で、申請は全部または一部が承認されるか、修正されて次のレビューサイクルに持ち越されるか、却下される可能性があります。却下には、再提出のための提案の修正方法に関する提案が含まれることがよくあります。すべての変更申請の公開アーカイブは、決定と決定の根拠とともに維持されます。[ 23 ]
言語学者のモリー、ポスト、フリードマンは、ISO 639、特にISO 639-3に対して様々な批判を提起している。[ 18 ]
jnj。そのため、これらのコードは母語話者にとって不快に感じられる可能性がある。マーティン・ハスペルマスはこれらの点のうち4つには同意するが、言語変化に関する点には同意しない。言語の説明には必ずその言語の特定が必要であり、言語の異なる段階は容易に特定できるため、彼はこれに反対する。彼は、言語学者にとって「話しているのが言語なのか、方言なのか、あるいは密接な関係にある言語群なのかはめったに重要ではない」ため、言語学者はラングイドレベルで作成されたコード化を使用することを好むかもしれないと示唆する。また、ISOは産業組織であるのに対し、言語の文書化と命名法は科学的な取り組みであると考えているため、言語識別のためのISO規格が適切かどうかについても疑問を呈する。彼は、標準化された言語識別子の本来の必要性は「翻訳とソフトウェアのローカライズの経済的重要性」にあり、そのためにISO 639-1と639-2規格が制定されたと述べる。しかし、ISO 639-3が提供する包括的な範囲、すなわち「書面でほとんど使用されず、しばしば絶滅の危機に瀕している小規模コミュニティのあまり知られていない言語」まで含める範囲について、産業界がそれを必要としているかどうかについては疑問を呈する。[ 24 ]
ara ISO 639-3 レジストリに記載されています。arb ISO 639-3 レジストリに記載されています。