ISO 639は、言語および言語グループの表現に関する国際標準化機構(ISO)の規格である。現在は4つのコードセット(1-3、5)で構成されており、各セットを以前に説明していた各パートにちなんで名付けられている(パート4は独自のコーディングシステムを持たないガイドラインであった)。パート6は公開されたが取り下げられた。1967年に単一部構成のISO勧告ISO /R 639 [1]として最初に承認され、2002年に新シリーズのパート1であるISO 639-1 [2]に置き換えられ、その後追加パートが続いた。シリーズの既存のパートはすべて2023年に単一の規格に統合され、[3]主にISO 639-4のテキストに基づいている。
ISO 639コードの使用
ISO 639 のいくつかのセクションで定義されている言語コードは、書誌目的で使用されるほか、コンピューティング環境やインターネット環境ではロケールデータの重要な要素として使用されます。このコードは、Wikipedia のさまざまな言語版の URLなど、さまざまなアプリケーションでも使用されます。
歴史
ISO の言語コード体系の初期の形態は、言語、国、および機関の記号と題された ISO/R 639:1967 に表れており、これは主に、ISO 加盟団体の言語、国、および標準化機関を表す語彙を規制することを目的としていました。その「言語記号」は、大文字のラテンアルファベットで表記された 1 文字または 2 文字の可変長識別子で構成されていました (例:英語のE場合は または 、スペイン語の場合は、、または、インドネシア語の場合は )。また、言語を示すためにUDC数字補助記号
(1993 年以前のバージョン) を使用することも許可されていました。EnSSpEsIn
1974 年に国コードをISO 3166に分離した後、言語名を表すための標準 ISO 639:1988 コードの最初の版が、小文字のラテン アルファベットによる 2 文字の識別子のフレームワークを使用して公開されました。このフレームワークは、形式と語彙が現在の ISO 639 セット 1 とほぼ同じです。
それ以来、この標準は急速に拡大するコンピュータ業界の基本技術として採用され (RFC 1766)、主に言語のMARCコードに基づいた、より表現力豊かな 3 文字のフレームワークの開発につながりました。元の 2 文字のシステムは、2001 年に ISO 639-1 として再定義されました。
アプリケーションの拡大のために言語のより広範なサポートを求めて、個々の言語とグループをカバーする ISO 639-2 名前空間の個別のスーパーセットが、それぞれ ISO 639-3 と ISO 639-5 として確立されました。また、4 文字の識別子を使用してより正確な言語バリアントを ISO 639-6 としてコード化する試みもありましたが、これは後に取り下げられ、別のフレームワークである ISO 21636 の下に再編成されました。
ISO 639の各部分における比較的頻繁な更新は、ISO 639:2023が発行されるまで、それぞれの担当機関によって処理されていました。ISO 639:2023では、以前の規格の本文が調和および再統一され、すべてのセットを監督し、ニュースレターを発行する共同保守機関による組織変更がもたらされました[1]。
標準の現在のセットと過去の部分
規格の各セットは保守機関によって保守されており、必要に応じてコードを追加したり、コードのステータスを変更したりします。ISO 639-6は2014年に撤回され、[8] ISO 639:2023には含まれていません。
個々のコードの特徴
スコープ:
- 個々の言語
- マクロ言語(セット3)
- 言語のコレクション (セット 1、2、5)。一部のコレクションは既にセット 2 に含まれており、その他のコレクションはセット 5 でのみ追加されました。
- 残りのグループ: Set 2 と 5 の両方にある 36 のコレクションがこの種類です。Set 5 がまだ公開されていなかったときの Set 2 との互換性のため、残りのグループには Set 2 ですでにコード化されていた言語とコレクションは含まれていません (ただし、Set 5 と互換性のある新しいアプリケーションは、Set 5 で公開された包含階層を尊重し、言語をグループ化するときに最も具体的なコレクションを使用する限り、これらのグループを包括的に扱うことができます)。
- これまで2つのアルファベットのコードが割り当てられていた唯一のコレクションは、パート1時代のビハリ語(bh)であり、2021年6月に廃止されました。 [9]
- 通常のグループ: セット 2 と 5 の両方の 29 個のコレクションがこの種類です。セット 2 との互換性のため、他のグループを含めることはできません。
- ファミリー: セット 5 でのみコード化された 50 個の新しいコレクション (セット 2 で既にコード化されている通常のグループを含むコレクションを含む) — セット 2 との互換性のため、残りのグループを除く他のコレクションが含まれる場合があります。
- 残りのグループ: Set 2 と 5 の両方にある 36 のコレクションがこの種類です。Set 5 がまだ公開されていなかったときの Set 2 との互換性のため、残りのグループには Set 2 ですでにコード化されていた言語とコレクションは含まれていません (ただし、Set 5 と互換性のある新しいアプリケーションは、Set 5 で公開された包含階層を尊重し、言語をグループ化するときに最も具体的なコレクションを使用する限り、これらのグループを包括的に扱うことができます)。
- 方言: 以前の ISO 639-6 (提案されたが、現在は撤回されている) でカバーされることが意図されていました。
- 特別な状況(セット2、3)。
- ローカル使用のために予約されています (セット 2、3)。また、セット 1 および 2 の標準コードのような 2 文字のコード (特殊コード
misが適していない場合) や、セット 5 の標準コードのようなコレクション用の 3 文字のコードが必要なアプリケーションで使用されることもあります。
タイプ(個々の言語用): [更新が必要]
- 生きた言語(セット2、3)(サンスクリット語を除く、他のすべてのマクロ言語は生きた言語です)[10]
- 絶滅した言語(セット2、3)(599、[11]そのうち5つはセット2にあります:
chb、、、、、。セット1には含まれていませんchg)copluisam - 古代言語(セット1、2、3)(124、[12]そのうち19はセット2にあり、5つ、すなわち、、、、はセット1
aveにもコードがあります:、、、、、)chulatplisanaeculapisa - 歴史的言語(セット2、3)(89、[13]そのうち16はセット2に含まれ、セット1には含まれない)
- 人工言語(セット1、2、3)(23、[ 14 ]うち9言語はセット2に含まれます:、、、、、、、、、; 5言語はセット
afh1に含まれます:、、、、、)epoidoileinajbotlhvolzbleoiaieiovo
セット 2 内の 2 つの異なる 3 文字コードを持つ個別の言語とマクロ言語:
- 書誌 (一部は非推奨で、セット 3 では定義されていません): これらはレガシー コードです (英語の言語名に基づいています)。
- 用語 (セット 3 でも定義されています): これらは推奨されるコードです (母国語の名前に基づき、必要に応じてローマ字化されます)。
- その他すべて(言語のコレクションおよび特殊/予約コードを含む)には、両方の用途で 1 つの 3 文字コードのみがあります。
セット間の関係
ISO 639 のさまざまなセットは連携して機能するように設計されています。つまり、あるセットではコードが 1 つの意味を持ち、別のセットでは別の意味を持つということはありません。ただし、すべての言語がすべてのセットに含まれているわけではなく、特定の言語やその他の要素がさまざまなセットで扱われる方法はさまざまです。たとえば、言語がセット 1 または 2 のどちらにリストされているか、セット 2 で別の B/T コードがあるか、セット 3 でマクロ言語として分類されているかなどによって異なります。
これらのさまざまな処理の詳細は、次の表に示されています。各行グループ (Set 3 の各範囲に 1 つずつ) の最後の 4 つの列には、ISO 639 のセット間の特定の種類の関係を例示する代表的な言語のコードが含まれ、2 番目の列には関係の説明が示され、最初の列にはその種類の関係を持つ要素の数が表示されます。たとえば、Set 1 にコードがあり、B/T コードがあり、Set 3 でマクロ言語として分類される要素が 4 つあります。これらの 4 つの要素の代表的なものの 1 つは、「ペルシャ語fa」perですfas。
これらの違いは以下の要因により生じます。
ISO 639 Set 2では、22の言語に2つの異なるコード、すなわち書誌コードと用語コード(B/Tコード)が割り当てられました。[15] Bコードは歴史的な理由から含まれていました。これは、以前広く使用されていた書誌システムでは、言語の英語名に基づいた言語コードを使用していたためです。対照的に、Set 1コードは言語のネイティブ名に基づいており、これらの言語に対して、Set 1の対応する2文字コードに類似したSet 2コード(Tコード)を用意することが強く望まれていました。
- たとえば、ドイツ語(セット 1:
de) にはセット 2 にger(B コード) と(T コード) の 2 つのコードがありますが、英語の場合はdeuセット 2 に の 1 つのコードしかありません。eng - 以前の B コード 2 つが廃止され、現在残っているのは B/T コードのペアが 20 組のみです。
Set 2 の個々の言語は、常に Set 3 にコードを持ちます (そこでは Set 2 の用語コードのみが再利用されます)。ただし、次の例に示すように、Set 1 にコードがある場合とない場合があります。
- セット3は
engセット2engとセット1に対応しますen - セット 3 は
astセット 2 に対応していますastが、セット 1 のコードがありません。
セット 3 の一部のコード (62) はマクロ言語です。これらは、相互理解が良好で、混同または混乱しやすい複数の個別言語を含むグループです。一部のマクロ言語では、個別の言語の 1 つにデフォルトの標準形式が開発されています (たとえば、中国語マクロ言語ではデフォルトで北京語が暗黙的に使用されますが、必要に応じて他の個別言語を区別することはできますが、cmn北京語の特定のコードはほとんど使用されません)。
- 1 マクロ言語にはセット 2 コードとセット 1 コードがあり、そのメンバーである個々の言語にもセット 1 とセット 2 のコードがあります:
nor/には/ 、/ がno含まれます。またはnonnnnobnb - 4 つのマクロ言語には、2 つの Set 2 コード (B/T) と 1 つの Set 1 コード (
per/fas/fa、may/msa/ms、alb/sqi/sq、およびchi/zho/ )がありますzh。 - 28 個のマクロ言語には Set 2 コードがありますが、Set 1 コードはありません。
- 他の 29 個のマクロ言語には、Set 3 のコードのみがあります。
セット 2 の集合コードには、セット 5 のコードがあります。たとえば、ausセット 2 と 5 では、オーストラリアの言語を表します。
- いくつかのコードはセット5で追加されたが、セット2にはコードがなかった。例:
sqj
セット 2 と 3 にも予約範囲と 4 つの特殊コードがあります。
qaaから までのコードはqtzローカル使用のために予約されています。- 特別なコードは 4 つあります。
misコードがまだ割り当てられていない言語、mul複数の言語、und未定義、zxx言語コンテンツなし、該当なしです。
コードスペース
2文字コードスペース
2文字(以前は「アルファ2」)識別子(ISO基本ラテンアルファベットの2文字で構成されるコード)は、セット1で使用されます。より広い範囲の言語のコードが必要になったため、2文字以上の組み合わせでカバーできるようになりました(最大26 2 = 676)。セット2は3文字コードを使用して開発されました。(ただし、後者が最初に正式に公開されました。[16] [17])
3文字コードスペース
3 文字 (以前は「Alpha-3」) 識別子 ( ISO 基本ラテン アルファベットの 3 文字で構成されるコード) は、セット 2、セット 3、およびセット 5で使用されます。このように表現できる言語と言語グループの数は、26 3 = 17,576 です。
3 セットの ISO 639 による 3 文字コードの共通使用には、より大きなシステム内での調整が必要です。
セット 2 は、4 つの特殊コード 、、、と予約範囲 (20 × 26 = 520 コード) を定義しmis、mul20個の二重エントリ (B/T コード) と、非推奨の B コードを含む 2undつのエントリがあります。合計すると、520 + 22 + 4 = 546 個のコードになりますが、これらはセット 3 で言語を表すために使用することも、セット 5 で言語ファミリーまたはグループを表すために使用することもできません。残りは 17,576 – 546 = 17,030 です。
zxxqaa-qtz
現在、地球上にはおよそ6000から7000の言語が存在します。[18]したがって、17,030のコードは各言語に固有のコードを割り当てるのに十分ですが、一部の言語では、その言語の伝統的な名前とはまったく似ていない任意のコードが割り当てられる場合があります。
Alpha-4 コード スペース (廃止)
「Alpha-4」コード( ISO 基本ラテンアルファベットの 4 文字で構成されるコード)は、ISO 639-6で使用することが提案されましたが、撤回されました。表現できる言語と方言の数の上限は、26 4 = 456,976 です。
参照
- IETF 言語タグ(ISO 639 に基づく)
- ISO 3166 (国コード)
- ISO 15924 (書記体系のコード)
- 人工言語のコード
- 言語コード
- 言語族と言語
- 言語リスト
- 公用語一覧
- ISO 639 コードのリスト
注釈と参考文献
- ^ 「ISO/R 639:1967」。国際標準化機構。1988年3月1日。2012年8月5日閲覧。
- ^ 「ISO 639:1988」。国際標準化機構。2012年8月5日閲覧。
- ^ 「ISO 639:2023」。国際標準化機構。2023年11月15日閲覧。
- ^ 「アルファ3/ISO 639-2コードでアルファベット順に並べられたコード」米国議会図書館。2013年7月25日。 2019年1月10日閲覧。
- ^ 「ISO-639-2 コード」。米国議会図書館。2019年 1 月 10 日閲覧。
- ^ 「ISO 639-3 コードセット (UTF-8)」。SIL International 。2023年7月12日閲覧。
- ^ 「ISO 639-5 codes ordered by Identifier」。ネットワーク開発およびMARC標準化局。米国議会図書館。 2018年12月12日閲覧。
- ^ ISO 639-6:2009、ISO。
- ^ ab SIL International (2021-06-14). 「パート1言語コードの変更」。ISO 639-3。
- ^ 「ISO 639 コードテーブル: マクロ言語」。Sil.org 。 2012年8月5日閲覧。
- ^ 「ISO 639 コードテーブル: 消滅」Sil.org . 2012 年 8 月 5 日閲覧。
- ^ 「ISO 639 コードテーブル: 古代」。Sil.org 。 2019年1月10日閲覧。
- ^ 「ISO 639 コードテーブル: 履歴」Sil.org . 2012 年 8 月 5 日閲覧。
- ^ 「ISO 639 コードテーブル: 構築済み」。Sil.org 。 2022年2月7日閲覧。
- ^ 「ISO 639-2 – よくある質問」。米国議会図書館。2014年5月5日。 2014年12月12日閲覧。
- ^ 「言語名の表示コード - パート 2: Alpha-3 コード」。国際標準化機構。ISO。2019年1 月 10 日閲覧。
発行日: 1998 年10 月
- ^ 「言語名を表すコード - パート 1: Alpha-2 コード」。国際標準化機構。ISO。2018年2 月 15 日閲覧。
発行日: 2002 年 7 月
- ^ 「統計概要」。Ethnologue 。 2012年8月5日閲覧。
外部リンク
- ISO 公式ウェブサイトの ISO 639
- 言語コーディング機関のウェブサイト:
- Infoterm の ISO 639 言語コード、セット 1 の LCA (以下のセット 2 LCA によって提供されるコード リスト)
- 米国議会図書館の ISO 639-2、セット 2 の LCA
- SIL International の ISO 639-3、セット 3 の LCA
- 米国議会図書館の ISO 693-5、セット 5 の LCA
- ISO 639 メンテナンス機関レポート
- 共通ロケール データ リポジトリには、ISO 639 コードの他の言語への翻訳が XML 形式で含まれています。CLDR 調査ツールには、より読みやすい形式のデータも含まれています。
