Microsoft (上、MS-950 または IBM-1373) および IBM (下、IBM-950) によって実装されたコード ページ 950 レイアウト。 | |
| 言語 | 繁体字中国語 |
|---|---|
| 作成者 | マイクロソフト |
| 拡張 | ビッグ5 |
| に基づく | ビッグ5-ETen |
コードページ950は、 Microsoft Windowsで繁体字中国語用に使用されるコードページです。これは、事実上の標準であるBig5文字エンコーディングのMicrosoftによる実装です。このコードページはIANAに登録されていないため[1] 、インターネット上で情報を通信するための標準ではありませんが、Microsoftライブラリ関数などでは単に とラベル付けされることがよくあります。 [2]big5
用語と変種
Windows コード ページ 950 と「一般的な」(ベンダー固有ではない) Big5 の主な違いは、 Big5 の0x F9D6 から 0xF9FEにETEN拡張のサブセットが組み込まれていることです (7 つの漢字「碁」、「銹」、「裏」、「墻」、「恒」、「紹興」、「嫺」と、それに続く 34 個のボックス描画文字とブロック要素で構成されます)。他の ETEN 拡張文字の一部で使用される範囲は、代わりにエンド ユーザー定義 (私的使用) 文字として定義されます。[3]
IBMのCCSID 950は、シングルバイト コードページ1114(CCSID 1114)とダブルバイト コードページ947(CCSID 947)から構成され、[4] [5] [6]、Big5のバリエーションではあるが、Microsoftのコードページ950とは若干異なり、リードバイト0xA3、[7] 0xC6、[3] [8] 0xC7 [9]および0xC8、[3] [10]のETEN拡張の一部を組み込んでいる一方で、リードバイト0xF9(Microsoftはこれを含めている)のものを省略し、代わりにユーザー定義文字として私用領域にマッピングしている。[3] [11]また、0x81~A0のトレイルバイトを持つ2つの非ETEN拡張領域も含まれています。つまり、通常のBig5トレイルバイト範囲外ですが、Big5+トレイルバイト範囲に似ています。領域5にはリードバイト0xF2~F9があり、IBMが選択した文字が含まれています。一方、領域9にはリードバイト0x81~8Cがあり、ユーザー定義の領域です。[12]
マイクロソフトは2000年にコードページ950のバージョンを更新し、 2バイトコード0xA3E1にユーロ記号(€)を追加しました。IBMはBig-5バリアントのユーロ記号の更新をCCSID 1370と呼んでいます(これには1バイト(0x80)と2バイトのユーロ記号の両方が含まれます)。[13]これは1バイトコードページ1114(CCSID 5210)と2バイトコードページ947(CCSID 21427)で構成されています。[13] [14] [15]
IBM Db2のMicrosoft版との互換性を高めるため、IBMは純粋な2バイトコードページ1372 [16]と関連する可変幅CCSID 1373も定義しています。これには2バイトユーロ記号のみが含まれており[17]、拡張領域が含まれるMicrosoftの動作と一致しています。[18] [19] [20] [21] [22]
シングルバイトコード
以下は、IBM によって組み込まれている 1 バイトのグラフィック文字です。コード 0x00 から 0x1F および 0x7F は、コンテキストに応じてC0 制御コードとして使用されることがあります (コード ページ 437、コード ページ 897を比較してください)。前述のように、0x80 の 1 バイトのユーロ記号は、IBM CCSID 950 または 1373 にも、Microsoft にも組み込まれていません。
残りはダブルバイトシーケンスの一部です。
プライベートエリアの利用
このマッピングは、指定されたグリフが指定されたUnicodeリビジョンにまだ見つからない場合にHKSCSでも使用されます。 [27]
参照
- LMBCS-18
- コード ページ 951 は、Windows XP で cp950 を HKSCS 対応バージョンに置き換えるための Microsoft ハックです。
参考文献
- ^ 「文字セット」。IANA — プロトコルレジストリ。
- ^ 「Encoding.WindowsCodePage プロパティ - .NET Framework (現在のバージョン)」。MSDN。Microsoft。
- ^ abcd Zhu, HF.; Hu, DY.; Wang, ZG.; Kao, TC.; Chang, WCH.; Crispin, M. (1996). 「インターネット メッセージ用の中国語文字エンコーディング」.コメントの要求. IETF . doi : 10.17487/rfc1922 . RFC 1922.
- ^ 「CCSID 950 情報文書」。2014 年 12 月 2 日時点のオリジナルよりアーカイブ。
- ^ 「CCSID 1114 情報文書」。2016 年 3 月 27 日時点のオリジナルよりアーカイブ。
- ^ 「CCSID 947 情報文書」。2014 年 12 月 1 日時点のオリジナルよりアーカイブ。
- ^ 「リードバイト A3: ibm-950_P110-1999」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト C6: ibm-950_P110-1999」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト C7: ibm-950_P110-1999」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト C8: ibm-950_P110-1999」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト F9: ibm-950_P110-1999」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「IBM BIG-5 コード用 IBM繁体字中国語グラフィック文字セット」(PDF)。IBM 。1999 年。CH 3-3220-131 1999-04。
- ^ ab 「CCSID 1370 情報文書」。2016 年 3 月 27 日時点のオリジナルよりアーカイブ。
- ^ 「CCSID 5210 情報文書」。2014 年 11 月 29 日時点のオリジナルよりアーカイブ。
- ^ 「CCSID 21427 情報文書」。2016 年 3 月 27 日時点のオリジナルよりアーカイブ。
- ^ 「CPGID 01372: MS T-Chinese Big-5 (DB2 専用)」。IBM グローバリゼーション - コード ページ識別子。2016 年 3 月 17 日時点のオリジナルよりアーカイブ。
- ^ "ibm-1373_P100-2002". ICU デモ - コンバータ エクスプローラー。Unicodeの国際コンポーネント。
- ^ 「リードバイト A3: ibm-1373_P100-2002」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト C6: ibm-1373_P100-2002」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト C7: ibm-1373_P100-2002」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト C8: ibm-1373_P100-2002」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ 「リードバイト F9: ibm-1373_P100-2002」。ICUデモ - コンバータ エクスプローラ。Unicodeの国際コンポーネント。
- ^ コードページ CPGID 01114 (pdf) (PDF)、IBM
- ^ コードページ CPGID 01114 (txt)、IBM
- ^ 「Windows Best Fit Chart: CP950」. unicode.org . 2016年9月13日閲覧。
- ^ 「Big5」.漢字データベース. 2016年9月13日閲覧。
- ^ 「Big5-HKSCS:2008」。2016年9月13日時点のオリジナルよりアーカイブ。
外部リンク
- Microsoft のコード ページ 950 リファレンス
- コードページ 950 から Unicode へのマッピング
- International Components for Unicode (ICU) マッピング ファイル: windows-950-2000.ucm、ibm-950_P110-1999.ucm、ibm-1373_P100-2002.ucm
