中国語情報交換文字コード(中国語:中文資訊交換碼)またはCCCII は、台湾の中国語文字分析グループによって開発された文字セットです。1980 年に初めて公開され、1982 年と 1987 年に大幅に拡張されました。[ 1 ]
主に図書館システムで使用されています。[ 2 ] [ 3 ]これは、繁体字中国語の最も初期に確立され、最も洗練されたエンコーディングの 1 つです(1984 年のBig5および1986 年のCNS 11643の確立よりも前)。[ 2 ]主な漢字セットの簡体字バージョンやその他の変種をエンコードするための独自のシステムによって区別されます。[ 1 ]
CCCII の初期バージョンのバリアントは、 MARC-8の一部として、東アジア文字コード( EACC、ANSI/NISO Z39.64)という名前で米国議会図書館で使用されており、 [ 4 ] MARC 21のJACKPHYサポートの一部を構成しています。ただし、EACC には、最新バージョンの CCCII よりも文字数が少なくなっています。[ 5 ] [ 1 ] EACC の維持に使用されたResearch Libraries Groupの CJK シソーラスに基づくAppleでの作業は、UnicodeのUnihanセットの直接の前身の 1 つです。[ 6 ]

CCCII はISO/IEC 2022で定義されているように94 nセットとして設計されています。[ 1 ]各中国語文字は 3 バイトのコードで表され、各バイトは0x 21 から 0x7Eまでの 7 ビットです。したがって、CCCII で表現できる中国語文字の最大数は 94×94×94 = 830584 です。実際には、CCCII でエンコードできる文字数はこの数よりも少なくなります。これは、バリアント文字が CCCII の下で関連する ISO 2022 プレーンでエンコードされるため、ほとんどのコード ポイントがバリアント用に予約される必要があるためです。
しかし実際には、これらの範囲外のバイトが使用されることもあります。コード0x212320は、一部の実装で表意文字スペースとして使用されています。[ 8 ]香港の図書館で使用されているCCCII仕様では、句読点と記号に0x2120で始まるコードを使用しています。[ 9 ]最初のバイト 0x7F は、一部のバリアントで、通常は利用できないUnified Repertoire and OrderingまたはCJK Unified Ideographs Extension A の漢字のコードをエンコードするために使用されています (たとえば、U+3449 の場合は 0x7F3449、U+796E の場合は 0x7F796E。[ 9 ]継続バイトがUCS-2BEコードと一致することに注目してください)。これには、0x21–0x7E または 0x20–0x7F の範囲外のバイトが含まれる場合があります。たとえば、U+551C の場合は 0x7F551C、[ 10 ] U+5AA4 の場合は 0x7F5AA4 [ 10 ]、U+8EDA の場合は 0x7F8EDA。[ 9 ]
CCCII/EACC はエスケープシーケンスで使用されるコード化文字セットの国際登録簿に登録されておらず、[ 11 ]そのため、ISO 2022 で使用するための標準的な指定エスケープがありません。MARC-8 は、ANSI X3.41 (ISO 2022) の実装において、EACC にプライベート使用のFバイト 0x31 ( ) を割り当てています。 [ 12 ]1
ISO 2022 の 94 面は、6 面ずつ 16 層にグループ化されています (ただし、第 16 層には 91 ~ 94 面の 4 つが含まれます)。[ 1 ]第 1 層には、漢字以外の文字と漢字の両方が含まれており、漢字以外の文字と最も頻繁に使用される漢字が第 1 層に配置され、残りの 5 つの面はあまり一般的でない漢字で構成されています。[ 1 ]第 2 層には簡体字が含まれており、行番号とセル番号は第 1 層の繁体字と同じです。第 3 層から第 12 層には、最初の 2 つの層と相同な行番号とセル番号で、さらに別の形式が含まれています。[ 13 ]
最後の 4 つのレイヤーは他の目的で使用されます。具体的には、レイヤー 13 には日本語サポート用の追加文字 (かなと日本語の国字) が含まれており、レイヤー 14 には韓国語サポート用の追加文字 (ハングル) が含まれています。[ 13 ]レイヤー 15 は未使用 (予約済み) であり、レイヤー 16 は他の文字に使用されます。[ 1 ]
この独特なデザインは、花園大学国際禅仏教研究所のクリスチャン・ウィッターン氏によって批判されており、同氏は文字バリアントの関係は「非常に複雑で、固定された一次元ハードワイヤードのコードテーブルでは表現できない」と主張している。[ 3 ]ケン・ルンデ氏はこれを「台湾で最もよく考え抜かれた文字セット標準の1つ」と評し、その構造は「本当に賞賛に値する」としながらも、OpenTypeのバリアント形式置換で同じレベルの機能性を提供できると結論付けている。[ 1 ]
CCCIIは1987年版の時点で約53940のコードポイントを定義しているが、1989年のより新しい草案ではこれを75684のコードポイント(44167の固有文字と31517のバリアントで構成)に拡張している。米国議会図書館で使用されているバリアントであるEACCには、15686の文字というより小さなセットしか含まれていない。[ 1 ]
1995年時点では、CCCIIまたはEACCは主に米国、香港、台湾の図書館で使用されていました。CCCIIはCJK全域をカバーすることを約束していましたが、そのサポートは専用ハードウェアに限られていました。ルート文字とバリアント文字のどちらを使用すべきかを判断するのが難しく、確立された参照グリフが不足していたため、その採用はさらに制限され、図書館以外ではこれらの地域で中国語にBig5がより一般的に使用されることになりました(当時Unicodeはまだ広く採用されていなかったため)。[ 3 ]
2009年現在EACC は、専門的な書誌目的では今でも広く使用されています。[ 1 ]また、Unicode の重要な前身でもありました。[ 1 ] Appleで行われた、 EACC の維持に使用されたResearch Libraries Groupの CJK シソーラスに基づく CJK 文字相互参照データベースの作業は、 UnicodeのUnihanセットの開発に直接組み込まれました。[ 6 ] Unicodeの漢字は、 Unihanデータベースのキーとで、kCCCII対応kEACCするCCCII および EACC コードに参照されています。[ 4 ]ただし、Unicode の文字統一基準 (日本のJIS X 0208で使用されている基準と、中国共通中国語コード協会によって開発された基準に基づく) は CCCII で使用されている基準とは異なるため、すべての異体字が個別にマッピングされているわけではありません。[ 6 ] EACC と Unicode 間の漢字、ハングル、かな、句読点のマッピング テーブルは、米国議会図書館から入手できます。[ 14 ]
以下に、句読点、記号、かな、ハングル字母音の文字表を示します。各文字と、対応するUnicodeコードを示します。可能な限り、公開されているマッピングデータを参照しています。
ハングル音節のUnicodeマッピングは、簡潔にするために以下では省略されていますが、米国議会図書館によって文書化されています。[ 15 ] CCCII漢字は数万個に及び[ 1 ] [ 3 ]、以下では示されていません(部首や数字として非漢字の範囲にも含まれている場合を除く)。しかし、UnicodeへのマッピングはUnihanデータベース[ 4 ]やその他の場所から入手できます。[ 10 ] [ 9 ]
CCCIIは通常94nセット[1]であり、そのため通常は0x2120で始まるコードは使用しないが[ 10 ] 、香港の図書館で使用されているバリアントでは次のレイアウトが使用されている[ 9 ] 。
この行には数学演算子が含まれています。EACC はこの行を空にします。[ 14 ]次の表は台湾の情報源を参照しています。[ 2 ] [ 10 ]
以下の表は、香港の図書館グループである香港革新的利用者グループが提供し、香港大学がホストしているCCCIIデータを参照しています。[ 17 ] [ 9 ]この行では全く異なるレイアウトが使用されています。
この行には句読点、西アラビア数字、ローマ字が含まれています。[ 10 ]万城コードの3行目とGB 2312の3行目を比較してください。
さまざまなバリアントが、表意文字スペース(U+3000) を 0x212320 (MARC 仕様で認められている)、[ 8 ] [ 9 ] 0x212321 (ANSI 標準に記載されており、MARC でも認められている)、[ 8 ] [ 9 ]または 0x21635F [ 10 ]にエンコードします。 EACC では、このセットにハイフンマイナス、括弧、表意文字スペースのみが含まれます。[ 8 ]
In EACC, this row includes several Private Use Area mapped characters used internally to represent character components by the RLIN input method,[18] which is used by the Library of Congress for non-Roman cataloging.[19] These component characters should only be used internally by an IME and, if encountered elsewhere, may be replaced with the geta mark (U+3013),[18] which this row also includes at 0x212A46. This row is unassigned in CCCII,[1] but the geta mark is also listed at that location in some mappings for CCCII.[10]
This row contains various punctuation marks used in Chinese,[1][8] in addition to other symbols. CCCII includes a set of 35 punctuation marks in this row.[1] EACC includes only 13 characters in this row (shown boxed below).[8]
These rows contain Chinese radicals,[1]Roman numerals,[10]celestial stems and terrestrial branches.[16]
この行には中国語の数字とボポモフォ文字が含まれています。[ 1 ] EACCには表意文字のゼロ(〇)のみが含まれています。[ 8 ]
香港の図書館で使用されている変種では、平面1の15行目にボポモフォ文字は含まれていないが、平面7に異なるレイアウトで含まれている。[ 9 ]
この行は、日本語サポート用の文字を含むレイヤー 13 の最初のプレーンであるプレーン 73 にあります。[ 13 ]句読点が含まれています。[ 8 ]この行は、含まれる文字のレイアウトに関して JIS X 0208 の行 1 に従う傾向があるので、JIS X 0208 の行 1 と比較してください。
この行にはひらがなが含まれています。JIS X 0208 の 4 行目と比較してください。
この行にはカタカナが含まれています。この行に対応するJIS X 0208の5行目と比較してください。ただし、濁点と半濁点が別々に追加されています。
これらの行には韓国のジャモが含まれています。
この行には、現在では日常的に使用されていない歴史的なハングル文字がいくつか含まれています。これらのうちいくつかは私用エリアにマッピングされています。[ 18 ]
CCCII: 最も初期の(そして最も洗練された)繁体字中国語エンコーディング...主に図書館システムで使用されています.... "CCCII" のマップは
Koha
Taiwan プロジェクトによって提供されています。
{{cite web}}: CS1 maint: タイトルとしてアーカイブされたコピー (リンク)