コンピューターの世界では、中国語の文字コードを使用して、中国語、日本語、韓国語( CJK言語)、そして(まれに)チュノム語で書かれたテキストを表現できます。これらの言語はすべて中国語の文字を使用します。汎用的な文字コードの中には中国語の文字に対応しているものがあり、中には中国語専用に開発されたものもあります。
Unicode ( CJK統一漢字セットを含む)に加えて、ローカルエンコーディングシステムも存在します。中国本土とシンガポールでは中国語の国表(またはGB、「国家標準」)システムが、台湾、香港、マカオでは(主に)台湾のBig5システムが、 2つの主要な「レガシー」ローカルエンコーディングシステムとして使用されています。国表は通常簡体字で表示され、Big5は通常繁体字で表示されます。ただし、エンコーディングシステムと文字の表示に使用されるフォントの間には、義務的な関連付けはありません。フォントとエンコーディングは通常、実用的な理由から関連付けられています。
どのエンコーディングを使用するかという問題は、政治的な意味合いも持ち得る。GBは中華人民共和国の公式標準であり、Big5は台湾の事実上の標準だからだ。
日本語の場合とは対照的に、Unicodeに対する公然とした反対は比較的少なく、UnicodeはGBやBig5に伴う多くの問題を解決している。Unicodeは政治的に中立であると広く認識されており、簡体字と繁体字の両方を十分にサポートし、GBやBig5との間で容易に変換できる。さらに、Unicodeは(ほぼ)すべての言語の文字コードを含んでいるため、中国語だけに限定されないという利点もある。
国譜(GB)文字エンコーディングは、1980 年に発行された簡体字中国語文字セットGB 2312から始まります。GB 2312 には 2 つのエンコーディング方式が存在しました。一般的に使用されている 1 バイトまたは 2 バイトの 8 ビットEUC-CNエンコーディングと、 Usenet の投稿用のHZ [ 1 ]と呼ばれる 7 ビットエンコーディングです。[ 2 ] : 94 1990 年に、GB/T 12345と呼ばれる伝統的なバリアントが発行されました。
EUC-CN形式は後にGBKに拡張され、1993年にすべてのUnicode 1.1 CJK漢字が含まれるようになり、ISO-2022モデルは廃止されました。これにより、GBKにはGB2312の簡体字に加えて繁体字も含まれるようになりました。 [ 3 ] GBKは、Microsoft Windows 95に広く採用されているコードページ936の実装によって普及しました。
2000年にGB 18030がGBKの後継として発行されました。この新しいエンコーディングには、これまでエンコードされていなかったすべてのUnicodeコードポイントをエンコードする4バイトUTFが含まれています。[ 4 ] 2005年には、Unicodeの更新に伴い、中国の少数民族が使用するスクリプトの参照グリフとCJK統合表意文字拡張Bのグリフを含むGB 18030が発行されました。
Adobe-GB1は、GBエンコーディングに対応するPostScript文字セットです。
Big5 ファミリーの文字エンコーディングは、台湾の 5 社のコンソーシアムが開発した最初の定義から始まります。[ 5 ]これは、 Shift JISにいくらか似た2 バイト文字セット (DBCS)であり、 ASCIIのような MBCS と組み合わされることがよくあります。多くのベンダーと公式の拡張機能が存在し、その中でも ETEN、HKSCS (香港)、Big5-2003 (台湾のCNS 11643の一部) が最もよく知られています。[ 6 ] Adobe-CNS1は、Big5 ファミリーのエンコーディングに対応する PostScript 文字セットです。
繁体字と簡体字の両方を含むGBKが登場する以前は、繁体字と簡体字の文字セット間の変換は、一方の文字セットが他方の文字セットの多くの文字をその文字セット自身のバリエーションでしかカバーしていないため、2つの中国語バリエーション間でテキストを転記する必要があり、複雑でした。繁体字と簡体字の変換は通常問題が多く、これは一部の繁体字の簡体字化によって2つ以上の異なる文字が1つの簡体字に統合されるためです。繁体字から簡体字への(多対一)変換は技術的には簡単です。逆の変換では、GB 2312への変換時にデータ損失が発生することがよくあります。繁体字のグリフを簡体字のグリフに割り当てる際に1対多のマッピングを行うと、一部の文字は必然的に一部の使用法で間違った選択になります。そのため、簡体字から繁体字への変換では、競合を解決するために使用状況のコンテキストや共通のフレーズリストが必要になることがよくあります。この問題は、簡体字と繁体字の両方に別々のコードポイントを持つGBK、GB 18030、Unicodeなどの新しい標準ではそれほど問題になりません。
もう一つの問題は、多くの文字体系に欠落している文字があることです。欠落している文字は文学的な文字であり、通常の文章ではあまり使われませんが、人名にこれらの文字が含まれていることが多いため、問題となります。例えば、台湾の政治家である王建信氏の名前には「煊」という文字が含まれていますが、一部の文字体系には含まれていません。また、中国の元首相である朱鎔基氏の名前には「镕」という文字が含まれていますが、GB 2312には含まれていません。最新のGB規格であるGB 18030には、Unicode 4.0の文字レパートリーがすべて含まれており、補助表意文字面にはUnihan拡張文字も含まれています。[ 2 ]: 105
{{cite web}}: CS1 maint: bot: 元の URL の状態が不明です (リンク)