| 別名 | CSIC(中国標準交換コード) |
|---|---|
| 言語 | 中国語(繁体字) |
| 標準 | CNS 11643 |
| 分類 | ISO 2022、DBCS、CJKエンコーディング |
| エンコード形式 |
|
| その他の関連エンコーディング | Big5、CCCII |
中国国家標準11643(CNS 11643)文字セットは、正式には中国標準交換コードまたはCSIC[1](中国語:中文標準交換碼)としても知られており、台湾(中華民国)の公式標準文字セットです。CNS 11643の発行版および草案は、台湾で使用するために提出されたCJK統一漢字のUnicode参照グリフのソース標準であり[ 2 ] 、 CNS 11643の文字レパートリーは台湾で行政目的で更新され続けています[ 3 ] 。
EUC-TWは、CNS 11643とASCIIを拡張Unixコード(EUC)形式でエンコードしたものです。実際には、 Unicode導入以前は、CNS 11643の最初の2つのプレーンと密接に関連するBig5文字セットのバリアントが、繁体字中国語の事実上の標準エンコーディングとして機能していました。CSICの特定のプレーンを表現できる他のエンコーディングには、ISO-2022-CN(プレーン1と2)とISO-2022-CN-EXT(プレーン1から7)があります。
CNS 11643 はISO 2022に準拠するように設計されていますが、ISO-IR登録があるのは最初の 7 つの 94×94 文字プレーンのみです。プレーンの総数は、規格の改訂ごとに変化しており、最新の保留中のドラフトでは 19 プレーンがあります[ 2 ]。したがって、すべてのプレーンでエンコード可能な文字の最大数は 19×94×94 = 167884 です。プレーン 1 から 7 は規格で定義されています。2007 年以降、プレーン 10 から 15 も規格で定義されています。[ 4 ] : 115–122これ以前は、プレーン 12 から 15 (35344 コード ポイント) は、ユーザー定義文字用に特別に指定されていました。CCCIIとは異なり、CNS 11643 でのバリアント文字のエンコードは関連していません。
標準規格の初版は1986年に発行され、Big5のレベル1と2から派生した平面1と2が含まれていました。ただし、画数の修正による順序の変更、重複する2文字の削除、平面1への213の古典部首の追加(康熙部首214のうち、210は既存のBig5文字の実質的な重複であり、残りの3はHKSCS文字です。[ 5 ]康熙部首(Unicodeブロック)も参照)が行われていました。その後、標準規格の拡張版が1988年(6319文字、平面14を占める)と1990年(7169文字、平面15を占める)に発行されました。[ 4 ] : 115–122
Unicode 1.0.0 には、まだ漢字は含まれていませんでしたが、CNS 11643 との互換性のための文字が含まれていました。Unicode 1.0.0 のCJK 互換性フォームブロックのタイトルは「CNS 11643 互換性」でした。[ 6 ] Unicode 1.0.1 用にUnicode CJK 統合表意文字セットがコンパイルされていたとき、各国の機関は文字セットをCJK 合同研究グループに提出し、組み込みを求めました。提出された CNS 11643 のバージョンには、プレーン 14 拡張に加えて、プレーン 14 に追加される追加の文字 (拡張の標準バージョンで最後に使用されたコードポイントである 68-21 の後) が含まれていました。[ 4 ] : 179–180
1992年に発行された規格の第2版では、7つの平面にわたって、はるかに多くの漢字が定義された。1988年の平面14拡張の大部分、すなわちコードポイント01-01から66-38までの6148文字は平面3として採用された(残りの171文字、コードポイント66-39から68-21は、代わりに平面4に分配された)。平面15拡張は含まれなかったが、その338文字は平面4から7に含まれた。[ 4 ]: 115-122
2007 年に発行された標準の第 3 版では、平面 1 にユーロ記号、表意文字のゼロ、かな、既存のボポモフォとローマ字のサポートの拡張が追加されました。追加の漢字を含む平面 10 から 14 が導入され、既存の平面 15 の拡張が標準自体に組み込まれました (文字がすでに平面 4 から 7 に存在する場所にはギャップが残されています)。また、Unicode への組み込みのために提出された 1988 年版の平面 14 への追加に基づいて、コード ポイント 68-40、 [ 4 ] : 115-122から始まる 128 個の漢字が平面 3 に追加されました。
CNS 11643 の文字体系には、台湾の戸籍や身分証明書などの行政目的で使用される文字に加え、教育で使用される文字も含まれています。 [ 3 ] [ 11 ]特に、平面 1 と 2 の文字は教育で使用されています。[ 12 ] CNS 11643 では、教育で使用される文字のみがグリフ形式の正規化の対象となっています。[ 11 ]拡張は継続されており、19 番までの追加平面が作成されていますが、CNS 11643 版の一部としてまだ公開されていません。[ 2 ] 2007 年版の 2022 年の修正では、平面 2 の末尾にU+7934礴CJK UNIFIED IDEOGRAPH-7934が追加され、平面 1 と 2 のいくつかのグリフ形式が修正されました。 [ 12 ]
CNS 11643の1992年版と2007年版、およびより最近の作業草案は、台湾で使用するために提出されたCJK統一漢字の参照グリフのUnihanのソースとして機能しているが、 [ 2 ] 2017年現在、数千個のCNS 11643文字は対応するUnicode文字がなく、Unicodeを介して往復しない文字であり、そのほとんどはプレーン10から14にあります。これらはUnicode補助プライベート使用領域にマッピングされます。[ 13 ]
場合によっては、2 つ以上の CNS 11643 文字が 1 つの Unicode CJK 統一表意文字に対応します。これらのケースは ( CJK 互換性表意文字補足ブロックでカバーされている場合を除く) 現在、Unicode 補足私用領域コード ポイントにマッピングされていますが、[ 11 ]表意文字研究グループに参加している台北コンピュータ協会は、将来的に表意文字変異シーケンスとして登録できるかどうかを評価しています。 [ 11 ] [ 14 ]
Big5エンコーディングのレベル 1 と 2 は、それぞれ CNS 11643 のプレーン 1 と 2 にほぼ対応しており、順序に時折違いがあり、Big5 には存在するが CNS 11643 には存在しない 2 つの重複した漢字があります。これらは範囲のリストを使用してマッピングできます。[ 15 ] [ 16 ]ただし、CNS 11643 プレーン 1 の 213 の古典的な部首は Big5 で使用可能な文字に追加されています (ただし、Big5 または HKSCS の対応する漢字に損失を伴ってマッピングできます)、[ 5 ]さらに追加の文字が 2007 年に CNS 11643 プレーン 1 に追加されました。[ 4 ] : 115–122 Big5 のBig5-2003バリアントは、CNS 11643 の部分的なエンコーディングとして定義されています。
Big5 漢字レパートリーの中で、プレーン 1 の文字のうち、1 つだけが慣習的に、最初の 2 つの CNS 11643 プレーンの対応する文字とは異なる Unicode にマッピングされています。それは U+5F5D (彝) ですが、その CNS プレーン 1 の対応文字は、関連するバリアントである U+5F5E (彞)にマッピングされています。 [ 17 ] U+5F5D は、CNS 11643 プレーン 3 に別途含まれています。[ 5 ]ただし、 IBMによって定義されたものなど、Big5 のバリアント マッピングの中には、U+5F5D ではなく U+5F5E を含むものもあります。[ 18 ]同様に、Big5 レベル 2 (IBM バリアントを含む) の 1 つの文字[ 19 ]は、CNS 11643 プレーン 2 の対応する文字とは異なる Unicode コード ポイント U+5284 (劄)にマッピングされますが、 Unihanデータベースでは現在、CNS 11643 の文字を U+7B9A (箚) にマッピングしています。U+5284 は CNS 11643 プレーン 14 に現れます。[ 5 ]
T3-6734、つまりプレーン3コードポイントがあります71-20。<U5284> \xE3\x5A |0