
国際化の分野では、CJK文字は中国語、日本語、韓国語の表記体系で使用される文字体系の総称であり、それぞれに中国語の文字が含まれます。また、かつてベトナム語の表記に使用されていた中国語起源の表意文字であるチュノム文字を含める場合はCJKV 、壮族語の表記に使用されていたサウンディップ文字を含める場合はCJKVZと呼ばれることもあります。
標準中国語(北京語)と標準広東語は、ほぼすべて漢字で表記されます。一般的な読み書き能力には3,000字以上が必要で、十分に網羅するには40,000字まで必要となります。日本語は使用する漢字が少なく、一般的な読み書き能力は2,136字で十分です。韓国では漢字の使用はますます稀になっていますが、固有名詞に漢字を独特な方法で使うには、より多くの漢字の知識(そしてそれゆえに利用できる漢字の数)が必要です。2013年現在韓国の学生の中には、1,800字を学ぶことが求められている者もいた。[ 1 ]
これらの言語で使用される他の文字体系、例えば中国語のボポモフォ文字やラテン文字に基づくピンイン、日本語のひらがなやカタカナ、韓国語のハングルなどは、厳密には「CJK文字」ではないが、CJK文字セットには、対象言語を完全に網羅するために必要不可欠なものとして、ほぼ例外なく含まれている。
中国学者のカール・レバン(1971年)は、CJK符号化システムに関する初期の調査を行った。
20世紀初頭まで、ベトナムでは古典中国語が政府と学術の書き言葉でした。ベトナムの一般文学はチュノム文字で書かれ、これは中国語の文字と現地で作られた多くの文字から構成されています。1920年代以降、文学を記録するために使用される文字はラテン文字を基にしたベトナム語のアルファベットです。[ 2 ] [ 3 ]
四重字(中国語:四叠字、文字通り「四重の文字」)は、表意文字の繰り返しによってCJK文字を形成する方法です。ケン・ルンデはこれらの文字を「4つ以上の同一要素の集まり、および水平または垂直に配置された3つの同一要素の列」と説明しています。[ 4 ]これらの文字は主に古代中国語の文書で使用され、惙などの一部の現代漢字の構成要素を除いて、現在ではあまり使用されていません。 [ 5 ]
これらの言語のすべてのニーズを完全に満たすために必要な文字数は、8ビット文字エンコーディングの256文字のコード空間には収まらないため、少なくとも16ビット固定幅エンコーディングまたはマルチバイト可変長エンコーディングが必要です。Unicode 2.0以前のバージョンなどの16ビット固定幅エンコーディングは、16ビットエンコーディングで対応できる文字数を超える文字をエンコードする必要があること(Unicode 17.0では101,996の漢字がエンコードされています)、および中国政府が中国国内のソフトウェアにGB 18030文字セットのサポートを義務付けていることから、現在では非推奨となっています。
CJKエンコーディングは共通の文字セットを持つものの、それらを表現するために用いられるエンコーディングは、東アジアの様々な政府やソフトウェア企業によって個別に開発されてきたため、互換性がない。ユニコードは、物議を醸しながらも、漢字統一と呼ばれるプロセスで文字セットの統一を試みてきた。
CJK文字エンコーディングは、少なくとも漢字に加えて、ピンイン、ボポモフォ、ひらがな、カタカナ、ハングルなどの言語固有の音声文字で構成されるべきである。[ 6 ]
CJK文字エンコーディングには以下が含まれます。
CJK文字セットは、割り当てられたUnicodeコード空間の大部分を占めている。複数の中国語と日本語の文字セットを単一の統一文字セットにマッピングするために用いられる漢字統一プロセスの妥当性や技術的メリットについては、日本の漢字専門家の間で多くの議論が交わされている。
これら3つの言語はいずれも左から右、上から下(古代の文書では右から左、上から下)のどちらの書き方でも表記できるが、符号化の問題を議論する際には通常、左から右に書く文字体系として扱われる。
1980年代初頭、図書館はJACKPHY文字のエンコード標準について協力しました。ケン・ランデによると、「CJK」という略語はResearch Libraries Group [ 7 ] (2006年にOCLCと合併)の登録商標でした。1987年から2009年までOCLCが所有していたこの商標は現在失効しています。[ 8 ]