
CJK Unified Ideographs Extension Bは、1998 年~ 2000 年の間に漢字研究グループに提出された中国語、日本語、韓国語、ベトナム語の珍しい歴史的な CJK 漢字、 Unicode 13.0 で追加された崑曲の 7 つの工車文字、および Unicode 14.0 で追加されたマカオ補助文字セットの 2 つの文字を含むUnicode ブロックです。[ 3 ]
このブロックには、標準化されたバリアント用に定義された数十のバリエーションシーケンスがあります。[ 4 ]また、Unicode Ideographic Variation Database (IVD)に登録されている数千の表意文字バリエーションシーケンスもあります。[ 5 ] [ 6 ]これらのシーケンスは、特定の Unicode 文字の目的のグリフバリアントを指定します。
拡張 B の文字レパートリーは、表意文字報告グループによって「SuperCJK」という文書の改訂を重ねる中で開発されました。[ 7 ]これは、当時、統一文字レパートリーと順序、拡張 A、および拡張 B 草案に含まれていたすべての文字を、部首と残余画数順にリストしたものです。各文字には最大 4 つのグリフ ビットマップと、康熙辞典、漢語大字典、およびさまざまな国の文字セット標準などの文字ソースへの参照が含まれています。[ 8 ]
拡張 B は、UCS2003 ソース識別子を持つ唯一の CJK 統一漢字拡張ブロックでした。拡張 B には文字が多すぎたため、元のコード表はすべての地域で単一のグリフで作成されました。グリフは、北京中一電子有限公司によって設計されました。Unicode 5.2 で複数列のコード表が導入された後、元のグリフは UCS2003 ソース識別子の下に保持されましたが、冗長で誤解を招くため、Unicode 14.0 で削除されました。[ 9 ]グリフは、簡体字中国語版の Windows に同梱されている「SimSun-ExtB」フォントにパッケージ化されており、中国本土地域のグリフに準拠していません。
ケン・ルンデ氏は、B棟で起こったことはB棟内に留まるべきだと述べた。ピーター・コンスタブル氏は、この棟では長年にわたり多くの歴史的な誤りに対処してきたと指摘した。
拡張 B には 42720 (当初は 42711) 文字が含まれており、これは統合レパートリーと順序付けに含まれる 20992 文字の 2 倍以上であり、他のどの CJK 拡張ブロックよりもはるかに多い (Unicode 17.0 の時点では、2 番目に大きいのはCJK 統合表意文字拡張 Fで、7473 文字)。[ 11 ]これにより、プライベート使用領域を除けば、 Unicode プレーンで割り当て可能な 65534 個のコードポイントの半分以上を占める唯一のブロックにもなっています。
その大きさゆえに、拡張Bのオリジナル版はエンコードされて以来、多くの間違いが発見されている。[ 10 ] [ 12 ]提案された文字のより良いレビューを容易にするため、後続のCJK拡張ブロックのワーキングセットサイズは大幅に小さく保たれている。例えば、表意文字研究グループは現在、ワーキングセットのサイズを可能であれば10000文字未満に抑えるため、加盟団体は通常2500文字以下を提出するよう求めている。[ 13 ]
CJK 統一漢字拡張 B では、数百のグリフの異形がエンコードされました。[ 14 ]類似したグリフの異形を意図的にエンコードしたことに加えて、7 つの完全な重複 (同じ文字が誤って 2 回エンコードされた場合) と 2 つの半重複 (CJK-B 文字が、対応する BMP 文字で統合された 2 つのグリフ形式の事実上の分離を表している場合) が誤ってエンコードされました。[ 15 ]
The following Unicode-related documents record the purpose and process of defining specific characters in the CJK Unified Ideographs Extension B block:
The CJK Unified Ideographs Extension B [13MB] block that was added to Unicode/10646 in 2001 comprises 42,711 characters, and it is no secret that there are many problems with this huge collection of mostly quite rare characters, including hundreds of cases of unifiable characters that have been erroneously encoded separately and even a handful of completely duplicate characters.