
中国語、日本語、韓国語(CJK)の文字は共通の背景を持っており、総称してCJK文字と呼ばれています。漢字統一と呼ばれるプロセスの中で、共通(共有)文字が特定され、CJK統合表意文字と名付けられました。Unicode 16.0の時点で、Unicodeは合計97,680の文字を定義しています。[1]
表意文字という用語は誤った呼び方です。中国語の文字は表意文字ではなく表語文字だからです。
ベトナムでは20世紀初頭まで漢字(Chữ Nôm)も使用されていたため、略称CJKVが使用されることもあります。
出典
表意文字研究グループ( IRG) は、CJK 統合表意文字のエンコードされたレパートリーの拡張を開発する責任を負っています。IRG は、メンバー団体から提出された新しい CJK 統合表意文字の提案を処理し、専門家による複数回のレビューを経て、ISO/IEC 10646およびUnicode標準への組み込みを検討するために、統合された文字セットをISO/IEC JTC 1/SC 2ワーキング グループ 2 (WG2) およびUnicode 技術委員会(UTC) に提出します。次の IRG メンバー団体が、CJK 統合表意文字の標準化に関与しています。
UTC と英国から提出された表意文字は、特定の地域に固有のものではなく、個々の専門家によってエンコードが提案された文字です。SAT から提出された表意文字は、SAT 大藏經テキストデータベースに必要です。
以下の表は、Unicode 16.0の各IRGソースにエンコードされたCJK統合表意文字の数を示しています。[2]多くの文字が複数のソースを持つため、文字の総数(260,840)はエンコードされたCJK統合表意文字の数(97,680)を大幅に上回っています。
UTC ソース
UTCがIRGに提出した文字の大部分は、Unicode技術委員会(UTC)の文書から派生したものです。[3]その他の情報源としては、以下のものがあります。
- ジョン・デフランシス著ABC 中英辞典
- Adobe-CNS1 グリフコレクション
- Adobe-Japan1 グリフコレクション
- 中国の鳥の種と亜種の完全なチェックリスト (中国鸟类系统检索)
- The Great Nom Dictionary (Đại Tự Điển Chữ Nôm)
- Shuowen Jieziへの注釈( Duan Yucaiによる注釈)
- GB18030-2000
- 末日聖徒イエス・キリスト教会(香港)が提供する必須文字リスト
- New Commercial Dictionary (商务新词典)、香港
- 現代中国語辞典 (现代汉语词典)中国社会科学院、言語学研究所、辞書編集部
- ワーキンググループ(WG2)文書
CJK 統合漢字ブロック
CJK 統合漢字
CJK統合表意文字(4E00–9FFF)という基本ブロックには、U+4E00からU+9FFFまでの範囲の基本中国語文字が20,992個含まれています。このブロックには、中国語表記体系で使用される文字だけでなく、日本語表記体系で使用される漢字、韓国語の漢字、ベトナム語のchữ Nôm文字も含まれています。このブロックの文字の多くは3つの表記体系すべてで使用されていますが、3つのうちの1つまたは2つでのみ使用される文字もあります。ブロックの最初の20,902文字は、康熙辞典の部首順に並べられています。このシステムでは、最も画数の少ない文字が最初にリストされます。残りの文字は後から追加されたため、部首順ではありません。
このブロックは、東アジアで多少議論を呼んだ漢字統一[4]の結果である。 [5]中国語、日本語、韓国語の文字は同じ場所にコード化されていたため、選択されたグリフの外観は、使用されている特定のフォントに依存する可能性がある。ただし、ソース分離規則では、以前の文字セットで個別にコード化された文字は、新しいUnicodeエンコードでも個別にコード化されると規定されている。[6]
異体字セレクタを使用すると、Unicode内で特定の異体CJK表意文字を指定することができます。[7] 14,684の表意文字異体シーケンスを持つAdobe-Japan1文字セット[8]は、異体字セレクタの使用の極端な例です。[9]
チャート
4E00-62FF、 6300-77FF、 7800-8CFF、 8D00-9FFF。
出典
注:ほとんどの文字は複数のソースに出現するため、個々の文字数の合計(108,480)はエンコードされた文字数(20,992)よりもはるかに大きくなります。[10]
Unicode 4.1 では、14 個のHKSCS-2004文字と 8 個のGB 18030文字が U+9FA6 と U+9FBB のコード ポイント間に割り当てられました。それ以降、さまざまな理由によりこのブロックに他の追加文字が追加されました。これらはすべて、以下のバージョン履歴セクションにまとめられています。
CJK 統合漢字拡張 A
CJK 統合表意文字拡張 A (3400–4DBF)というブロックには、U+3400 から U+4DBF の範囲の 6,592 個の追加文字が含まれています。
チャート
出典
注:ほとんどの文字は複数のソースに出現するため、個々の文字数の合計(23,954)はエンコードされた文字数(6,592)よりもはるかに大きくなります。[10]
CJK 統合漢字拡張 B
CJK 統合表意文字拡張 B (20000–2A6DF)というブロックには、U+20000 から U+2A6DF の範囲の 42,720 文字が含まれています。これらには、基本的な CJK 統合表意文字ブロックには含まれていない康熙辞典で使用されている文字のほとんどと、ベトナム語の表記に以前使用されていた多くのHán-Nôm文字が含まれています。
チャート
20000-215FF、 21600-230FF、 23100-245FF、 24600-260FF、 26100-275FF、 27600-290FF、 29100-2A6DF。
出典
注:多くの文字は複数のソースに出現するため、個々の文字数の合計(99,784)はエンコードされた文字数(42,720)よりもはるかに大きくなります。[10]
CJK 統合漢字拡張 C
CJK 統合表意文字拡張 C (2A700–2B73F)というブロックには、U+2A700 から U+2B739 の範囲の 4,154 文字が含まれています。これは、Unicode 5.2 (2009) で最初に追加されました。
チャート
出典
注:一部の文字は複数のソースに出現するため、個々の文字数の合計(4,634)はエンコードされた文字数(4,154)よりも多くなります。[10]
CJK 統合漢字拡張 D
CJK 統合表意文字拡張 D (2B740–2B81F)というブロックには、Unicode 6.0 (2010) で追加された U+2B740 から U+2B81D の範囲の 222 文字が含まれています。
チャート
出典
注:一部の文字は複数のソースに出現するため、個々の文字数の合計(239)はエンコードされた文字数(222)よりも大きくなります。[10]
CJK 統合漢字拡張 E
CJK 統合表意文字拡張 E (2B820–2CEAF)というブロックには、Unicode 8.0 (2015) で追加された U+2B820 から U+2CEA1 の範囲の 5,762 文字が含まれています。
チャート
出典
注:一部の文字は複数のソースに出現するため、個々の文字数の合計(5,919)はエンコードされた文字数(5,762)よりも多くなります。[10]
CJK 統合漢字拡張 F
CJK 統合表意文字拡張 F (2CEB0–2EBEF)というブロックには、 Unicode 10.0 (2017) で追加された U+2CEB0 から 2EBE0 の範囲の 7,473 文字が含まれています。これには、チワン語のSawndip文字が1,000 個以上含まれています。
チャート
出典
注:一部の文字は複数のソースに出現するため、個々の文字数の合計(7,775)はエンコードされた文字数(7,473)よりも多くなります。[10]
CJK 統合漢字拡張 G
CJK統合表意文字拡張Gというブロックが、Unicode 13.0の一部として、U+30000からU+3134Fの範囲の第三表意文字面に追加され、4,939文字が含まれています。 [13]
チャート
出典
注:一部の文字は複数のソースに出現するため、個々の文字数の合計(5,081)はエンコードされた文字数(4,939)よりも多くなります。[10]
CJK 統合漢字拡張 H
CJK統合表意文字拡張Hというブロックが、Unicode 15.0の一部として、U+31350からU+323AFの範囲の第三表意文字面に追加され、4,192文字が含まれています。 [14]
チャート
出典
注:一部の文字は複数のソースに出現するため、個々の文字数の合計(4,309)はエンコードされた文字数(4,192)よりも多くなります。[10]
CJK 統合漢字拡張 I
CJK統合表意文字拡張Iというブロックが、Unicode 15.1の一部として補助表意文字面のU+2EBF0からU+2EE5Fの範囲に追加され、622文字が含まれています。[15]
チャート
出典
注:一部の文字は複数のソースに出現するため、個々の文字数の合計(625)はエンコードされた文字数(622)より多くなります。[10]
CJK 互換表意文字
CJK 互換表意文字(F900–FAFF)というブロックは、他の標準との双方向の互換性を維持するために作成されました。
しかし、このブロック内の12文字は実際には「統一表意文字」特性を持っています:U+FA0E 﨎、U+FA0F 﨏、U+FA11 﨑、U+FA13 﨓、U+FA14 﨔、U+FA1F 﨟、U+FA21 﨡、U+FA23 﨣、U+FA24 﨤、U+FA27 﨧、U+FA28 﨨、およびU+FA29 﨩。[1]このブロックおよびその他の「互換性」ブロック内の他の文字は、CJK統合とは関係ありません。
龜 と 亀 は統一可能ではないと考えられていますが、U+FA20 蘒 CJK COMPATIBILITY IDEOGRAPH-FA20は、 U+8612蘒CJK UNIFIED IDEOGRAPH-8612と重複していると考えられています。
チャート
出典
注:すべての文字は複数のソースに出現するため、個々の文字数の合計(40)はエンコードされた文字数(12)よりも大きくなります。[10]
既知の問題
分離
4039 う+4039
U+4039 (䀹) という文字は、Unicode 5.0 までは、2 つの異なる文字 (jiā 夾 の表音文字と shǎn 㚒 の表音文字) が統合されたものでした。しかし、これらは語彙的に異なる文字であり、統合されるべきではありませんでした。発音も意味も異なります。
U+4039 [16]の非統合の提案はUnicode 5.1で採用され、shǎnを表すためにU+9FC3(鿃)に新しい文字がエンコードされました。
拡張機能 B の他の 3 つのグリフ
CJK統合漢字拡張Bでは、一部の文字が他の文字と誤って統合されています。これらの文字には、U+2017B(𠅻)、U+204AF(𠒯)、U+24CB2(𤲲)が含まれます。最初の2つの文字は、中国大陸とベトナムのグリフの誤った統合を含んでおり、最後の文字は中国大陸と台湾のグリフを統合しています。[17]
統一可能なバリアントと完全な重複
また、CJK統合漢字拡張Bでは、何百もの字形異体が誤ってエンコードされていました。[18]さらに、ISO/IEC JTC 1/SC 2の報告書では、6つの完全重複(同じ文字が誤って2回エンコードされている)と2つの半重複(CJK-B文字が、対応するBMP文字で統合された2つの字形の事実上の非統合を表している)が誤ってエンコードされていたことが判明しました。[19]
- U+34A8 㒨 = U+20457 𠑗 : U+20457はU+34A8の中国由来のグリフと同じですが、U+34A8の台湾由来のグリフとは大きく異なります。
- U+3DB7 㶷 = U+2420E 𤈎 : 同じグリフ形状
- U+8641 虁 = U+27144 𧅄 : U+27144 は韓国語版の U+8641 と同じですが、中国本土、台湾、日本版の U+8641 とは大きく異なります。
- U+204F2 𠓲 = U+23515 𣔕 : 同じグリフ形状だが、異なる部首の下に並べられている
- U+249BC 𤦼 = U+249E9 𤧩 : 同じグリフ形状
- U+24BD2 𤯒 = U+2A415 𪐕 : 同じグリフ形状だが、異なる部首の下に並べられている
- U+26842 𦡂 = U+26866 𦡦 : 同じグリフ形状
- U+FA23 﨣 = U+27EAF 𧺯 : 同じグリフ形状 (U+FA23 﨣 は、「CJK COMPATIBILITY IDEOGRAPH-FA23」という名前にもかかわらず、統一された CJK 表意文字です。)
Unicode のその他の CJK 表意文字(統一されていない)
10 ブロックの「統一表意文字」とは別に、Unicode には、統一されていない CJK 文字のブロックが 12 個ほどあります。これらは主に CJK の部首、画数、句読点、記号、互換文字です。一部の文字は他のブロックに (分解可能な) 対応する文字がありますが、用途は異なる場合があります。統一されていない CJK 文字の例として、CJK 記号と句読点ブロックのU+3007〇ゼロ表意文字があります。これは「CJK 統一表意文字」の対象ではありませんが、他のすべての意図と目的では CJK 文字として扱われます。[20]
従来のテキスト処理システムおよび古い文字セットとの互換性のために、次の 4 つの互換文字ブロックが含まれています。
- CJK 互換性(3300–33FF)
- CJK互換フォーム(FE30~FE4F)
- CJK 互換表意文字(F900–FAFF)
- CJK互換表意文字補足(2F800–2FA1F)
これらには、縦書きテキストレイアウト用の文字形式や、Unicode が他の手段で処理することを推奨しているリッチテキスト文字が含まれます。したがって、これらの使用は推奨されません。
フォントサポート
CJK統合表意文字ブロックとCJK統合表意文字拡張Aブロックは、基本多言語面の一部であり、大部分のCJKフォントでサポートされている。しかし、日本語フォントと韓国語フォントの文字数は、通常、中国語フォントよりも少ない(それぞれ約13,000と8,000)。拡張B、C、Dは、Vista以降のMicrosoft Windowsに含まれる追加のフォントMingLiU-ExtB、MingLiU_HKSCS-ExtB、PMingLiU-ExtB、SimSun-ExtBでサポートされている。[21]
Unicode バージョン履歴
参照
注記
参考文献
- ^ ab "Unicode 16.0 UCD: PropList.txt". 2024年5月31日. 2024年9月14日閲覧。
- ^ 「Unicode 16.0 UCD: Unihan: Unihan_IRGSources.txt」. 2024年7月31日. 2024年9月10日閲覧。
- ^ ルンデ、ケン (2024-07-31). 「UAX #45: U ソースの表意文字」。ユニコードコンソーシアム。
- ^ Unicode 標準 4.0、付録 A - 漢民族統一史
- ^ Suzanne Topping、
「The secret life of Unicode」。2007年11月14日時点のオリジナルよりアーカイブ。2010年5月12日閲覧。
{{cite web}}: CS1 maint: bot: 元の URL ステータス不明 (リンク) - ^ 「第 11 章 - 東アジアの文字」、Unicode 標準、4.0。
- ^ 「Ideographic Variation Database」. 2022年9月13日. 2022年9月20日閲覧。
- ^ “IVD Stats”. 2022年9月13日. 2022年9月20日閲覧。
- ^ PRI 108: Adobe Japan1コレクションとそのコレクション内のシーケンスの統合登録
- ^ abcdefghijk "Unihan_IRGSources.txt (Unihan.zip から)". 2023-07-15 . 2024-09-10閲覧。
- ^ abcdefghijk "UAX #38: Unicode Han データベース (Unihan)".ユニコードコンソーシアム。 2024年7月31日。
- ^ ルンデ、ケン (2009)。CJKV 情報処理 (第 2 版)。カリフォルニア州セバストポル: O'Reilly Media, Inc. ISBN 978-0-596-15611-4. OCLC 317878469.
- ^ “Unicode 13.0.0”. 2020年3月10日. 2020年3月10日閲覧。
- ^ “Unicode 15.0.0”. 2022年9月13日. 2022年9月14日閲覧。
- ^ “Unicode 15.1.0”. 2023年9月12日. 2023年9月12日閲覧。
- ^ アンドリュー・ウェストとジョン・ジェンキンス、U+4039の分離提案
- ^ 陈永聪(チャン・エイソウ)、CJK統合漢字Ext BとEの4つの誤り字形に関するコメント。[1]
- ^ 川端太一. 「IRGN1155 重複の可能性」(.zip) . 2019年6月22日閲覧。
- ^ Cook, Richard (2003 年 10 月 6 日). 「重複エンコードされた CJK フォームに関する欠陥レポート」(PDF) . ISO/IEC JTC1/SC2/WG2 . 2012 年 3 月 28 日閲覧。
- ^ GB/T 15835-2011《出版物上デジタル利用法》。中国国家彪忠。 https://journals.usst.edu.cn/uploadfile/file/GBT%2015835-2011%E3%80%8A%E5%87% BA%E7%89%88%E7%89%A9%E4%B8%8A%E6%95%B0%E5%AD%97%E7%94%A8%E6%B3%95%E3%80%8B。 pdf
- ^ ケン・ルンデ (2009)。 CJKV 情報処理。オライリー。 633–634ページ。ISBN 978-0-596-51447-1。
外部リンク
- 英国由来の表意文字(文書 IRG N2107R2 および IRG N2232R)
