
中国語、日本語、韓国語(CJKとも呼ばれる)の文字体系は共通の背景を持ち、総称してCJK文字と呼ばれています。漢統一と呼ばれる過程で、共通(共有)文字が特定され、CJK統一漢字と名付けられました。Unicode 17.0の時点で、Unicodeは合計101,996文字を定義しています。[ 1 ]
「表意文字」という用語は誤称である。中国語の文字は表意文字ではなく表語文字であるが、英語でより一般的であるという理由で選ばれた。[ 2 ]
20世紀初頭まで、ベトナムでは中国語の漢字(チュノム)も使用されていたため、 CJKVという略語が使われることもあります。
表意文字研究グループ(IRG)は、CJK統一表意文字の符号化レパートリーの拡張開発を担当しています。IRGは、加盟団体から提出された新しいCJK統一表意文字の提案を処理し、複数回の専門家によるレビューを経て、統合された文字セットをISO/IEC JTC 1/SC 2ワーキンググループ2(WG2)およびUnicode技術委員会(UTC)に提出し、 ISO/IEC 10646およびUnicode規格への組み込みを検討してもらいます。以下のIRG加盟団体は、CJK統一表意文字の標準化に関わってきました。
UTCと英国が提出した表意文字は、特定の地域に特有のものではなく、個々の専門家によって符号化のために提案された文字です。SATが提出した表意文字は、SAT大蔵教テキストデータベースに必要です。
以下の表は、Unicode 17.0 の各 IRG ソースに対してエンコードされた CJK 統一表意文字の数を示しています。[ 5 ]多くの文字が複数のソースを持っているため、文字の総数 (267,742) はエンコードされた CJK 統一表意文字の数 (101,996) をはるかに上回っています。
UTCがIRGに提出した文字の大部分は、Unicode技術委員会(UTC)の文書から派生したものです。[ 6 ]その他の情報源としては、以下が挙げられます。
Unicodeブロック内のCJK統一漢字の順序(後からブロックに追加された漢字は除く)は、当初、以下の4つの辞書を参照して決定されました。主に康熙字典の順序で並べられ、康熙字典にない漢字については、他の辞書を順に参照して、どの康熙字典の漢字の後に続くべきかを決定しました。[ 7 ]
このシステムは、最近追加されたUnicodeブロックには使用されていません。表意文字研究グループは、もはや大字文[ 8 ]や大漢和字典[ 9 ]をその作業で使用していません。康熙字典と漢語大字典は、既存の文字ソース参照[ 10 ]と、誤りであることが判明した既存のソース参照の潜在的な代替として、依然として使用されています[ 8 ] 。 [ 11 ]同様に、以前はUTCソース文字の提出データの一部として(実際のまたは仮想の)康熙字典索引が提供されていましたが、これはもはや当てはまりません。[ 12 ]代わりに、提出されたすべての文字には、最初の残余画(部首の一部を形成しない最初の画)の画型が提供され、新しいUnicodeブロック内で同じ部首と画数を持つ文字を順序付けるために使用されます。[ 13 ]
CJK統一漢字(4E00~9FFF)と呼ばれる基本ブロックには、U+4E00からU+9FFFまでの範囲に20,992の基本漢字が含まれています。このブロックには、中国語の表記体系で使用される文字だけでなく、日本語の表記体系で使用される漢字、韓国語の漢字、ベトナム語のチュノム文字も含まれています。このブロックに含まれる文字の多くは、3つの表記体系すべてで使用されていますが、中には3つのうち1つまたは2つでのみ使用される文字もあります。
このブロックは、特に他の CJK 統一表意文字ブロックと区別する必要がある場合、統一レパートリーと順序( URO ) としても知られています。 [ 14 ]
このブロックの最初の20,902文字は、康熙字典の部首順に従って並べられています。この方式では、画数の少ない文字が最初に記載されます。残りの文字は後から追加されたため、部首順ではありません。
このブロックは、東アジアではやや物議を醸した漢統一の結果である。 [ 15 ]中国語、日本語、韓国語の複数の言語で使用される単一の文字が同じ場所にコード化され、現代の活字の慣習や手書きのカリキュラムは地域によってわずかに異なるため(必ずしも言語の境界に沿ってではなく、たとえば繁体字を使用する香港と台湾では、わずかに異なるローカルな慣習がある)、[ 17 ]選択されたグリフの外観は、使用されている特定のフォントに依存する可能性がある。ただし、URO はソース分離ルールを適用するため、URO のソースとして使用される文字セット(たとえばShift JISで使用されるJIS X 0208)で別個の文字として扱われる文字のペアは、新しい Unicode エンコーディングでも別々の文字のペアのままになる。[ 18 ]
バリエーションセレクタを使用すると、Unicode 内の特定の CJK のバリエーション表意文字を指定できます。[ 19 ] 14,684 の表意文字バリエーションシーケンスを持つAdobe-Japan1文字セット[ 20 ]は、バリエーションセレクタの使用の極端な例です。[ 21 ]
注:ほとんどの文字は複数のソースに登場するため、個々の文字数の合計(108,493)はエンコードされた文字数(20,992)よりもはるかに多い。[ 22 ]
Unicode 4.1では、U+9FA6からU+9FBBのコードポイント間に14個のHKSCS-2004文字と8個のGB 18030文字が割り当てられました。それ以降、さまざまな理由でこのブロックに他の文字が追加されており、それらはすべて以下のバージョン履歴のセクションにまとめられています。
CJK統一漢字拡張A (3400–4DBF)というブロックには、U+3400からU+4DBFまでの範囲に6,592個の追加文字が含まれています。
注:ほとんどの文字は複数のソースに登場するため、個々の文字数の合計(23,997)はエンコードされた文字数(6,592)よりもはるかに多い。[ 22 ]
CJK統一漢字拡張B (20000~2A6DF)というブロックには、U+20000からU+2A6DFまでの範囲に42,720文字が含まれています。これには、基本的なCJK統一漢字ブロックには含まれていない康熙字典で使用されている文字のほとんどと、かつてベトナム語の表記に使用されていた多くのハンノム文字が含まれています。
20000–215FF、 21600–230FF、 23100–245FF、 24600–260FF、 26100–275FF、 27600–290FF、 29100–2A6DF。
注:多くの文字は複数のソースに登場するため、個々の文字数の合計(100,887)はエンコードされた文字数(42,720)よりもはるかに多い。[ 22 ]
CJK統合漢字拡張C (2A700–2B73F)というブロックには、U+2A700からU+2B73Fまでの範囲に4,160文字が含まれています。これはUnicode 5.2(2009年)で初めて追加されました。
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(4,967)はエンコードされた文字数(4,160)よりも多くなっています。[ 22 ]
CJK統合漢字拡張D (2B740–2B81F)というブロックには、Unicode 6.0(2010年)で追加されたU+2B740からU+2B81Dまでの範囲の222文字が含まれています。
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(260)はエンコードされた文字数(222)よりも多くなっています。[ 22 ]
CJK統合漢字拡張E (2B820–2CEAF)というブロックには、U+2B820からU+2CEADまでの範囲に5,774文字が含まれています。これは元々Unicode 8.0(2015年)で追加されました。
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(6,272)はエンコードされた文字数(5,774)よりも多くなっています。[ 22 ]
CJK統合漢字拡張F (2CEB0–2EBEF)というブロックには、 Unicode 10.0(2017年)で追加されたU+2CEB0から2EBE0までの範囲の7,473文字が含まれています。これには、荘語の1,000文字以上の鑢字文字が含まれています。
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(8,015)はエンコードされた文字数(7,473)よりも多くなっています。[ 22 ]
Unicode 13.0の一部として、U+30000からU+3134Fの範囲の三次表意文字面にCJK統合表意文字拡張Gというブロックが追加され、4,939文字が含まれています。 [ 25 ]
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(5,239)はエンコードされた文字数(4,939)よりも多くなっています。[ 22 ]
Unicode 15.0の一部として、U+31350からU+323AFの範囲の第三表意文字面にCJK統合表意文字拡張Hというブロックが追加され、4,192文字が含まれています。 [ 26 ]
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(4,541)はエンコードされた文字数(4,192)よりも多くなっています。[ 22 ]
Unicode 15.1の一部として、U+2EBF0からU+2EE5Fの範囲の補助表意文字面にCJK統合表意文字拡張Iというブロックが追加され、622文字が含まれています。 [ 27 ]
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(625)はエンコードされた文字数(622)よりも多くなっています。[ 22 ]
Unicode 17.0の一部として、U+323B0~U+33479の範囲の第三表意文字面に、CJK統合表意文字拡張Jというブロックが追加され、4,298文字が含まれています。
注:一部の文字は複数のソースに登場するため、個々の文字数の合計(4,406)はエンコードされた文字数(4,298)よりも多くなっています。[ 22 ]
CJK互換漢字(F900–FAFF)というブロックは、他の規格との双方向互換性を維持するために作成されました。
しかし、このブロック内の12文字は実際に「統一漢字」特性を持っています。U+FA0E 﨎、U+FA0F 﨏、U+FA11 﨑、U+FA13 﨓、U+FA14 﨔、U+FA1F 﨟、U+FA21 﨡、U+FA23 﨣、U+FA24 﨤、U+FA27 﨧、U+FA28 﨨、およびU+FA29 﨩です。[ 1 ]このブロックおよび他の「互換性」ブロック内の他の文字は、CJK統合とは関係ありません。
龜と亀は統合可能とはみなされませんが、U+FA20蘒CJK COMPATIBILITY IDEOGRAPH-FA20はU+8612蘒CJK UNIFIED IDEOGRAPH-8612の複製とみなされます。
注:すべての文字は複数のソースに登場するため、個々の文字数の合計(40)はエンコードされた文字数(12)よりも多くなります。[ 22 ]
文字U+4039(䀹)は、Unicode 5.0までは2つの異なる文字(jiā夾の発音を持つ文字とshǎn㚒の発音を持つ文字)を統合したものでした。しかし、これらは語彙的に異なる文字であり、統合されるべきではありませんでした。発音も意味も異なっていたからです。
U+4039 [ 28 ]の分離の提案はUnicode 5.1 で受け入れられ、U+9FC3 (鿃) に shǎn を表す新しい文字がエンコードされました。
CJK統合漢字拡張Bでは、一部の文字が誤って他の文字と統合されていました。これらの文字には、U+2017B(𠅻)、U+204AF(𠒯)、U+24CB2(ल�)が含まれます。最初の2つの文字は中国語とベトナム語の文字の誤った統合を含んでおり、最後の文字は中国語と台湾語の文字を統合しています。[ 29 ]
U+2017B (𠅻) と U+204AF (𠒯) のグリフはバージョン 10.0 で修正され、誤った UCS2003 ソース グリフ U+24CB2 (ल�) はバージョン 13.0 で削除されました。
また、CJK 統一表意文字拡張 B では、数百のグリフのバリエーションが誤ってエンコードされました。[ 30 ]さらに、ISO/IEC JTC 1/SC 2のレポートでは、6 つの完全な重複 (同じ文字が誤って 2 回エンコードされている場合) と 2 つの半重複 (CJK-B 文字が、対応する BMP 文字で統合された 2 つのグリフ形式の事実上の分離を表している場合) が誤ってエンコードされたことが判明しました。[ 31 ]
Unicodeには、「統一漢字」の11ブロックの他に、統一されていないCJK文字を含むブロックが約12個あります。これらは主にCJK部首、画、句読点、記号、シンボル、互換文字です。一部の文字は他のブロックに(分解可能な)対応文字がありますが、使用法は異なる場合があります。統一されていないCJK文字の例としては、CJK記号と句読点ブロックのU+3007 〇漢字数字ゼロがあります。これは「CJK統一漢字」には含まれていませんが、他のすべての目的においてCJK文字として扱われます。[ 32 ]
従来のテキスト処理システムや古い文字セットとの互換性を確保するため、4つの互換文字ブロックが含まれています。
これらには、縦書きテキストレイアウト用の文字や、Unicodeが別の方法で処理することを推奨しているリッチテキスト文字などが含まれます。そのため、これらの使用は推奨されません。
Unicode Consortiumが管理するUnihanデータベースは、Unicode 標準にエンコードされたすべての統一漢字に関する情報を提供しており、さまざまな国や業界の標準へのマッピング、標準辞書への索引、エンコードされた異体字、さまざまな言語での発音、英語の定義などが含まれています。このデータベースは、テキスト ファイル[ 33 ]およびインタラクティブな Web サイト[ 34 ] [ 35 ]を通じて一般に公開されています。後者には、無料の日本語EDICTおよび中国語CEDICT辞書プロジェクトから抽出された複合語の代表的なグリフと定義も含まれています(これらは便宜上提供されており、Unicode 標準の正式な一部ではありません)。
CJK 統一漢字と CJK 統一漢字拡張 A ブロックは基本多言語面の一部であるため、ほとんどのCJK フォントでサポートされています。ただし、日本語フォントと韓国語フォントは通常、中国語フォントよりも文字数が少なくなっています (それぞれ約 13,000 文字と 8,000 文字)。拡張 B、C、D は、Vista 以降の Microsoft Windows に含まれる追加フォント MingLiU-ExtB、MingLiU_HKSCS-ExtB、PMingLiU-ExtB、SimSun-ExtB でサポートされています。[ 36 ]
辞書プロパティのうち3つは、4つの辞書ソートアルゴリズムで使用される辞書の公式IRGインデックスを表しています。2つ(
と
)はIRGでまだ使用されていますが、もう1つ(
)は使用されていません。
kIRGHanyuDaZidiankIRGKangXikIRGDaeJaweon
さらに、IRGは進行中の作業においてこの辞書を使用しなくなりました。
GKX:康熙字典表意文字 (康熙字典) 第 9 版 (1958 年) 補遺 (康熙字典) を含む。 GHZ: Hanyu Dazidian 表意文字 (漢語大字典)。
このフィールドは現在使用されておらず、データも含まれていません。
この文書では、新しい CJK 統一漢字の提出要件から最初の残余画 (別名 FS) 値を含めることを削除することを提案しています […] ISO/IEC 10646 プロジェクト エディタは、IRG 作業セットを新しい CJK 統一漢字拡張ブロックにコンパイルする際に、FS 値を使用して、同じ部首画 (部首 + SC) 値を共有する漢字をソートします。
{{cite web}}: CS1 maint: bot: 元の URL の状態が不明です (リンク)これらの226文字がどの程度
アドホックなものなのか、あるいはシンガポールの国家規格によってコード化されているのかは
、少なくとも私には不明です。私の推測では、
シンガポールの国家規格が明らかに存在しないため、これらは単に
アドホックなものなのではないかと思います。