| 言語 | 中国語、日本語、韓国語 |
|---|---|
| 標準 | MARC-8、ANSI/NISO Z39.64 (両方とも EACC バージョン) |
| 現在の状況 | 主に図書館システムで使用 |
| 分類 | ISO 2022構造に基づくCJK用TBCS、 MARCのJACKPHYコンポーネント |
中国語文字情報交換コード(中国語:中文資訊交換碼)またはCCCIIは、台湾の中国語文字解析グループによって開発された文字セットです。1980年に初めて公開され、1982年と1987年に大幅に拡張されました。[1]
これは主に図書館システムで使用されています。[2] [3]これは繁体字中国語の最も初期に確立され、最も洗練されたエンコードの1つです( 1984年のBig5と1986年のCNS 11643の確立より前のものです)。[2]これは、主要な漢字セットの簡体字やその他の変種をエンコードするための独自のシステムによって区別されます。[1]
CCCII の以前のバージョンの変種は、議会図書館によってMARC-8の一部として、東アジア文字コード( EACC、ANSI/NISO Z39.64)という名前で使用されており、 [4] MARC 21のJACKPHYサポートの一部を構成し、EACC には最新バージョンの CCCII よりも文字数が少ない。[5] [1] EACC を維持するために使用されたResearch Libraries Groupの CJK シソーラスに基づくAppleの作業は、 UnicodeのUnihanセットの直接の前身の 1 つでした。[6]
デザイン

バイト範囲
CCCIIは、 ISO/IEC 2022で定義されている94nセットとして設計されています。[1]各漢字は3バイトコードで表され、各バイトは0x21から0x7Eまでの7ビットです。したがって、CCCIIで表現できる漢字の最大数は94×94×94 = 830584です。実際には、CCCIIでエンコードできる文字数はこの数よりも少なくなります。これは、異体文字がCCCIIの関連するISO 2022プレーンでエンコードされるため、コードポイントのほとんどを異体文字用に予約する必要があるためです。
しかし、実際には、これらの範囲外のバイトが使用されることもあります。コード0x212320は、一部の実装では表意文字スペースとして使用されます。[8]香港の図書館で使用されているCCCII仕様では、句読点と記号に0x2120で始まるコードを使用しています。[9]最初のバイト0x7Fは、他の方法では利用できないUnified Repertoire and OrderingまたはCJK Unified Ideographs Extension A hanziのコード(例:U+3449の場合は0x7F3449、U+796Eの場合は0x7F796E。[9]継続バイトがUCS-2BEコードと一致することに注意してください)をエンコードするためにいくつかのバリアントで使用され、これには0x21〜0x7E、さらには0x20〜0x7Fの範囲外のバイトが含まれる場合があります。例:U+551Cの場合は0x7F551C、[10] U+5AA4の場合は0x7F5AA4 [10]、U+8EDAの場合は0x7F8EDA。[9]
ISO 2022との相互作用
CCCII/EACCは、エスケープシーケンスで使用されるコード化文字セットの国際登録簿[11]に登録されていないため、ISO 2022で使用するための標準指定エスケープがありません。MARC-8は、ANSI X3.41(ISO 2022)の実装で、EACCに私用Fバイト0x31( )を割り当てています。 [12]1
レイヤーと異体字
ISO 2022の94面は、6面ずつの16層にグループ化されている(91~94の4面を含む層16を除く)。[1]層1には非漢字と漢字の両方が含まれ、非漢字と最もよく使われる漢字は層1に配置され、残りの5つの面はあまり一般的でない漢字で構成されています。[1]層2には簡体字中国語の文字が含まれ、その行番号とセル番号は層1の繁体字中国語の文字と同じです。層3から層12にはさらに異体字が含まれ、行番号とセル番号は最初の2層と同じです。[13]
最後の4つのレイヤーは他の目的に使用されます。具体的には、レイヤー13には日本語サポート用の追加文字(かなと日本語国字)が含まれ、レイヤー14には韓国語サポート用の追加文字(ハングル)が含まれます。[13]レイヤー15は未使用(予約済み)で、レイヤー16は他の文字に使用されます。[1]
この独特なデザインは、花園大学国際禅仏教研究所のクリスチャン・ウィッターンによって批判されており、彼は、文字異体字の関係は「非常に複雑であり、固定された一次元的なハードワイヤードなコード表では表現できない」と主張している。[3] ケン・ルンデは、これを「台湾の最もよく考えられた文字セット標準の1つ」と表現し、その構造を「本当に賞賛に値する」と評しているが、OpenType異体字置換が同レベルの機能を提供できると結論付けている。[1]
CCCII は 1987 年版で約 53,940 個のコード ポイントを定義していますが、1989 年のより新しい草案では、これを 75,684 個のコード ポイント (44,167 個の固有文字と 31,517 個のバリアントで構成) に拡張しています。議会図書館が使用するバリアントである EACC には、15,686 個の文字のより小さなセットのみが含まれています。[1]
採択
1995年の時点では、CCCIIまたはEACCは主に米国、香港、台湾の図書館で使用されていました。CCCIIはCJK全般をカバーすることを約束していましたが、サポートは特殊なハードウェアに限られていました。また、ルート文字と異体字のどちらを使用すべきかを判断するのが難しく、確立された参照グリフが不足していたため、採用がさらに制限され、図書館以外ではこれらの地域で中国語にBig5がより一般的に使用されました(当時はUnicodeがまだ広く採用されていなかったため)。[3]
2009年現在[アップデート]、EACCは専門的な書誌目的で広く使用されています。[1]また、EACCはUnicodeの重要な前身でもありました。[1] Apple社では、EACCを維持するために使用されたResearch Libraries GroupのCJK Thesaurusに基づくCJK文字相互参照データベースの開発が、 UnicodeのUnihanセットの開発に直接組み込まれました。[6] Unicodeの漢字は、 UnihanデータベースのキーkCCCIIとで、対応するCCCIIおよびEACCコードを参照しますkEACC。[4]ただし、Unicodeの文字統合基準(日本のJIS X 0208で使用される基準と中国の共通中国語コード協会が開発した基準に基づく)はCCCIIで使用される基準とは異なるため、すべての異体文字が個別にマッピングされるわけではありません。[6] EACCとUnicode間の漢字、ハングル、かな、句読点のマッピング表は、米国議会図書館から入手できます。[14]
句読点、記号、かな、字母表
以下は句読点、記号、かな、ハングル字母の表で、文字を示し、可能な Unicode マッピングを示します。可能な場合は、公開されているマッピング データを参照します。
ハングル音節のUnicodeマッピングは簡潔にするため以下では省略されているが、議会図書館によって文書化されている。[15] CCCII漢字の数は数万にのぼり[1] [3]、以下では示されていない(部首や数字として非漢字範囲に含まれる場合を除く)が、Unihanデータベース[4]やその他の場所からUnicodeへのマッピングが利用可能である。[10] [9]
文字セット 0x2120 (平面 1、行 0: 香港の句読点)
CCCIIは通常94nセットであるため[1]、通常は0x2120で始まるコードは使用されないが[10]、香港の図書館で使用されている変種では次のレイアウトが使用されている: [9]
文字セット 0x2121 (プレーン 1、行 1: コントロール用に予約済み)
プレーン1の行1には文字が割り当てられておらず、制御コード用に予約されています。[1]
文字セット 0x2122 (プレーン 1、行 2: 数学演算子)
この行には数学演算子が含まれています。EACCはこの行を空白のままにしています。[14]次の表は台湾の情報源を参照したものです。[2] [10]
以下の表は、香港の図書館グループである香港革新的ユーザーグループが提供し、香港大学がホストするCCCIIデータを参照したものです。[17] [9]この行では全く異なるレイアウトが使用されています。
文字セット 0x2123 (プレーン 1、行 3: ローマ字と句読点)
この行には句読点、西洋アラビア数字、ローマ字が含まれています。[10]万城コードの3行目とGB 2312の3行目を比較してください。
異なるバリアントでは、表意文字スペース(U+3000)を0x212320(MARC仕様で認められている)、[8] [9] 0x212321(ANSI標準に記載されており、MARCでも認められている)、[8] [9]または0x21635Fに様々にエンコードします。[10] EACCには、このセットにハイフンマイナス、括弧、表意文字スペースのみが含まれます。[8]
文字セット 0x212A (プレーン 1、行 10: IME 内部文字と下駄マーク)
EACCでは、この行には、RLIN入力方式[18]によって文字コンポーネントを表すために内部的に使用される私的使用領域にマップされた文字がいくつか含まれており、これは議会図書館が非ローマ字のカタログ作成に使用しています。[19]これらのコンポーネント文字はIMEによって内部的にのみ使用され、他の場所で検出された場合は、下駄マーク(U+3013)[18]に置き換えられる場合があります。この行も0x212A46に含まれています。この行はCCCIIでは割り当てられていませんが[1]、下駄マークはCCCIIの一部のマッピングでその場所にリストされています。[10]
文字セット 0x212B (プレーン 1、行 11: 句読点)
この行には、他の記号に加えて、中国語で使用されるさまざまな句読点が含まれています。 [1] [8 ] CCCIIには、この行に35個の句読点が含まれています。[1] EACCには、この行に13個の文字のみが含まれています(下のボックスで示されています)。[8]
文字セット 0x212C–0x212E (平面 1、行 12–14: 部首と序数)
これらの行には、漢字の部首、[1]、 ローマ数字、[10]、 天字幹、地字枝[16]が含まれています。
文字セット 0x212F (平面 1、行 15: 中国語の数字とボポモフォ)
この行には中国語の数字とボポモフォ文字が含まれています。[1] EACCには表意文字のゼロ(〇)のみが含まれています。[8]
文字セット 0x272B (プレーン 7、行 11: 参照マーク)
この行には参照マーク(米印)が含まれています。[10]
文字セット 0x272E–0x272F (平面 7、行 14–15: 代替ボポモフォ)
香港の図書館で使用されている変種では、第1面15行目にボポモフォ文字は含まれず、第7面に異なるレイアウトで含まれています。[9]
文字セット 0x6921 (面 73、行 1: 日本語句読点)
この行は、レイヤー13の最初のプレーンであるプレーン73にあり、日本語サポート用に含まれる文字が含まれています。[13]句読点が含まれています。[8] JIS X 0208の行1と比較すると、この行に含まれる文字のレイアウトは、 JIS X 0208の行1に従う傾向があります。
文字セット 0x6924 (面 73、行 4: ひらがな)
この行にはひらがなが含まれています。JIS X 0208 の行 4と比較してください。
文字セット 0x6925 (面 73、行 5: カタカナ)
この行にはカタカナが含まれています。濁点と半濁点が別々に追加されている点を除いて、この行が対応するJIS X 0208 の行 5と比較してください。
文字セット 0x6F24–0x6F25 (平面 79、行 4–5: jamo)
これらの行には韓国語の文字が含まれています。
文字セット 0x6F76 (平面 79、行 86: 古ハングル)
この行には、現在は使用されていない歴史的なハングル文字がいくつか含まれています。これらのうちいくつかは私的使用エリアにマッピングされています。[18]
文字セット 0x7B25 (面 91、行 5: 補助カタカナ)
この行には外国語の音素を書くために使用される追加のカタカナが含まれています。[10]
参照
脚注
- ^ ISO 2022 94 nセットのトレイルバイト範囲外ですが、一部の実装では使用されていることが知られています。[8]
- ^ EACCのANSI規格で規定されている表意文字空間のコーディング。[8]これは、 0x212B3Dの感嘆符に加えて、CCCIIで感嘆符として使用されます。 [16] CCCIIの香港HKIUGバリアントは、ここでEACCに従います。[9]
- ^ Encode::HanExtraマッピングでは、この文字にU+FE52が使用されています。[10]しかし、ここではˊ、ˇ、ˋに続いて表示されており、[16]これらはボポモフォの他の3つの声調記号です。ボポモフォのエンコード範囲(たとえばBig5)では、この声調記号にU+02D9のマッピングがより一般的に使用されています。[20]
参考文献
- ^ abcdefghijklmnopqrs Lunde, Ken (2009). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . pp. 122–124. ISBN 978-0-596-51447-1。
- ^ abc Tang, Audrey (2007-11-10). 「Encode::HanExtra - 中国語エンコーディングの追加セット」 CCCII: 最も初期の (そして最も洗練された) 繁体字中国語エンコーディング... 主に図書館システムで使用.... 「CCCII」のマップは
Koha
Taiwan プロジェクトによって提供されています
。
- ^ abcd Wittern, Christian (1995-05-01). 「中国語の文字コード:最新情報」。International Research Institute for Zen Buddhism / Hanazono University。2004-10-12時点のオリジナルよりアーカイブ。
- ^ abc ジェンキンス、ジョン H.;クック、リチャード。ルンデ、ケン(2020-03-05)。 「Unicodeハンデータベース(ユニハン)」。 Unicode 標準付録 #38。
- ^ “アーカイブコピー”. 2016年6月15日時点のオリジナルよりアーカイブ。2016年6月15日閲覧。
{{cite web}}: CS1 maint: アーカイブされたコピーをタイトルとして (リンク) - ^ abc 「付録E:漢統一史」(PDF)。Unicode標準バージョン15.0 - コア仕様。Unicodeコンソーシアム。2022年。
- ^ 康熙辞典、p. 1296、文字。 1
- ^ abcdefghij 米国議会図書館(2007-12-05)。「東アジアの句読点コード表」。レコード構造、文字セット、交換メディアの MARC 21 仕様。
- ^ abcdefghijklmnopq 香港イノベーティブユーザーグループ Unicode タスクフォース。「HKIUG CJK 文字のコード表: Unicode へのマッピング」。香港大学図書館。
- ^ abcdefghijklmnopqrstu vw Tang, Audrey; Koha Taiwan. 「CCCII のマップ」. Encode::HanExtra . CPAN .
- ^ 「2.4: 複数バイトグラフィック文字セット」。エスケープシーケンスで使用されるコード化文字セットの国際登録 (ISO-IR) (PDF)。ITSCJ/ IPSJ。p. 14。
- ^ 米国議会図書館(2007-12-05)。「テクニック 2: 標準代替グラフィック文字セットの使用」。レコード構造、文字セット、交換メディアの MARC 21 仕様。
- ^ abc ルンデ、ケン(1995-12-18)。 「2.5.2:CCII」。 CJK.INF バージョン 1.9。
- ^ abcdefghijkl 米国議会図書館(2007-12-05)。「東アジアコード表」。レコード構造、文字セット、交換メディアの MARC 21 仕様。
- ^米国 議会図書館(2007-12-05)。「韓国語ハングルのコード表」。レコード構造、文字セット、交換メディアの MARC 21 仕様。
- ^ abcdefghij 表示されている文字の一部は、京都大学の安岡公一氏が配布している CCCII の代表的なBDFフォントと相互参照されています。
- ^ 香港イノベーティブユーザーグループ (2013-01-07)。「香港イノベーティブユーザーグループの紹介」香港大学図書館。
- ^ abc Library of Congress (2004-09-02). 「私的使用領域 (PUA) に割り当てられた MARC 21 文字の概要リスト」。レコード構造、文字セット、交換メディアに関する MARC 21 仕様。
- ^ Morris, Susan (2007)。「JACKPHY を見つける: アラビア語、ヘブライ語、その他の文字を含むオンライン カタログ」。米国議会図書館情報速報。第 66 巻、第 12 号。
- ^ ファン・ケステレン、アン。 「ビッグ5」。エンコーディング標準。なんてことだ。
- このページの情報は、CNS公式サイトの情報に基づいています。
外部リンク
- CNS 11643 公式ウェブサイト (英語版のページあり) の「中国情報コード」セクションに CCCII 文字セットに関する情報が掲載されています。
- EACC から Unicode への完全なマッピング (米国議会図書館より)
