| エイリアス | ISO-IR-202(1997年版) |
|---|---|
| 言語 | 部分的なサポート: |
| 標準 | 9566 号 |
| 現在の状況 | 北朝鮮でのみ使用される。 |
| 分類 | |
| エンコード形式 | |
| その他の関連エンコーディング | その他の ISO 2022 朝鮮語 DBCS: その他の ISO 2022 CJK DBCS: |
KPS 9566(「情報交換のための朝鮮標準韓国語グラフィック文字セット」)[2]は、韓国語に使用される朝鮮語(ハングル)表記システムの文字エンコードを規定する北朝鮮の標準です。1997年版では、ISO 2022準拠の94×94 2バイトコード化文字セットが指定されました。その後の版では、 UHCやGBKに匹敵する方法で、94×94プレーンの外側に追加のエンコードされた文字が追加されました。[ 3]
KPS 9566は、韓国のKS X 1001とはアプローチが異なり、朝鮮語の順序が異なり、[4]縦書きの句読点を明示的にエンコードし、複数の読み方に対応する重複した漢字をエンコードせず、北朝鮮の政治体制に特有の文字をいくつか含み、国の過去と現在の指導者(金日成、金正日、金正恩)の名前を特別にエンコードしている。 [1] [2] [3] [5]
KPS 9566はUnicodeに追加されたいくつかの文字の元のソースでしたが、[6] KPS 9566のすべての文字にUnicodeの同等文字があるわけではありません。同等文字がないものについては、同様のUnicode文字または私的使用領域にマッピングされます。[7]
背景およびその他の基準
ASCII文字セットは1963年に米国で生まれ、1967年に現在の形に改訂されました。[8] ASCIIは1967年に国際標準としても認められ、ECMA-6となり、[8]国際標準化機構によってISO/IEC 646に指定されました。[9]現在はANSI X3.4-1986およびISO 646:1991に指定されています。[10] ASCIIは7ビットのシングルバイトエンコーディングで、94のグラフィック文字、スペース、33の制御コードが含まれており、アメリカ英語のテキストを一連のバイトとして表現するための基本的なサポートを提供しました。[8] [10]
1972年に発行されたISO 646の次の版では、各国があまり一般的ではないコードの一部を自国の必須文字に置き換えることができるように、標準が改訂されました。同時に、7ビットと8ビットの両方の環境に適用できるように、ASCIIの拡張メカニズムを定義する作業が進行中でした。これは1973年に完了し、JIS X 0202、ECMA-35、ISO 2022として発行されました。[11] ISO 2022は、7ビットと8ビットの両方の環境で特定の構造を持つシングルバイト文字セットとマルチバイト文字セットを使用するメカニズムと、シフトコードとエスケープシーケンスを使用して標準的な方法でそれらを宣言および切り替えるメカニズムを規定しています。[12]
東アジア諸国では、漢字のレパートリーが膨大であるため、1バイトコードで表現できる文字数が十分ではなかったため、表記体系に標準化された2バイトエンコード(DBCS) を導入しました。ISO 2022準拠のDBCSでは、すべての文字を2つのASCII印刷文字バイトで表現できます。文字の位置は、これらのバイト値、またはそれぞれのバイトから32を引いた値に等しい1から94までの2つの数字(区点)で参照できます。 [13]最初に登録されたISO 2022準拠のDBCS、および国家標準として確立された最初の東アジアDBCSは、1978年に発行されたJIS X 0208(日本)の初版でした。 [14] [15]これに続いて、1980年にGB 2312(中国本土)が、 1987年に万城コード(韓国、最初はKS C 5601-1987に指定)が続きました。 [16] [15] 1984年に定義された Big5(台湾)は、ISO 2022構造に従っていませんでした。[16] 8ビット(7ビットではなく)環境で使用される場合、GB 2312とWansungコードは通常、8番目のビットを設定して使用され、ASCIIまたは同様のSBCSは8番目のビットを設定せずに使用されました。これらのエンコード方式はそれぞれEUC-CNとEUC-KRとして知られています。[17]
韓国語の表記体系には子音と母音を表す個別の記号(字母)が含まれており、アルファベットの役割を果たしているが、韓国語のテキストは各音節ごとにこれらの記号がブロックにまとめられて適切に組版される。万声文字は韓国語の個別の音節ブロックを別々に含み、漢字と同様にそれらを大きな文字セットとして扱い、[18]韓国標準 KS C 5601 の第 3 版で初めて定義された。第 1 版では、音節ブロックをシーケンスとしてエンコードできる個別の字母のエンコードが定義されており、これはN バイトハングルと呼ばれていたが、意図したほど広く採用されることはなかった。[19] [20]
万松コードは現代韓国語の音節をすべてエンコードしたわけではなく、最も一般的な2350音節のみを選択した[2]が、組み合わせシーケンスを使用して指定することは可能であったが、サポートされていないことが多かった。[18]代替エンコードである韓国語のJohabはこれをサポートし、しばらくの間万松コードの競合相手であった。[19] Microsoftが Windows 95で導入した統一ハングルコード(UHC)は、EUC-KRを拡張し、無効なEUCダブルバイトコードを使用してJohabで使用可能な他のすべての音節を表現できるようにした。[18]同様のアプローチが中国本土のGBKエンコードでも採用され、GB 2312を拡張して繁体字中国語をサポートし、あまり一般的でない中国語文字をEUC-CNで無効なダブルバイトコードにエンコードした。[16]
韓国は、韓国語用の ISO 2022 DBCS を開発している唯一の国ではなかった。中国本土のGB 12052は 1989 年に発行された。これは万成文字コードと密接な関係はないが、合成音節も含まれていた。代わりに、GB 2312 に対応し、漢字の代わりに韓国語の音節 (および 94 の漢字) が使用され、元記号の代わりにドル記号が含まれていた。これは中国北東部の韓国系少数民族向けに開発された。[2]
同様に、北朝鮮はKPS 9566を開発した。北朝鮮と韓国はどちらも韓国語の朝鮮語(ハングル)を主要な表記体系として使用していますが、異なる辞書順序を使用しています。[21]そのため、万城コードとKPS 9566の文字の順序は異なります。 [4]
KPS 9566は、1997年版と2003年版を含むいくつかの改訂を経ており[22] 、主にUnicodeとの互換性を高めるためである。これらは通常、年を指定して示される(例:KPS 9566-97、9566-2003)。Red Star OS 3.0のリリース時点での最新版はKPS 9566-2011のようで、金正恩が指導者のリストに追加されている。[3]公開されているKPS 9566の1997年版のコードチャートには、ISO 2022 94×94プレーンが示されている。[23]北朝鮮以外で入手可能な情報源によると、最近の版では、EUCプレーンの外部で追加の割り当てが定義されているようだ(GBKまたはUHCと同様)。[3]
複数の国家標準およびプラットフォームまたはフォント固有の独自の文字エンコーディングの使用から生じる相互運用性の問題のため、すべての表現可能なテキストを単一のユニバーサル形式で交換できるようにする目的でUnicode標準が開発されました。Unicode の最初の版は 1991 年と 1992 年に発行され、[24] ISO/IEC 10646 はUnicode と同期して 1993 年に確立されました。[ 25] Unicode 形式はWorld Wide Webでの国際的な使用に好まれており、そこでは従来の文字エンコーディングはマッピング ファイルによって Unicode の部分的なエンコーディングとして扱われます。[26] [27]
デザイン
原理的には、KPS 9566は韓国の KS X 1001規格で定義されている万城文字セットに似ていますが、両者には互換性がありません。どちらも句読点、記号、字母、仮名、アルファベットのセクションをエンコードし、その後に現代の朝鮮語の音節のサブセット、その後に漢字のセクションが続きます。[2]ただし、KPS 9566は、北朝鮮の辞書式順序付け標準に準拠するために、字母と音節の順序が異なります。 [4] KPS 9566には、KS X 1001にはない、縦書き用に明示的に回転した句読点が28個含まれています。また、KS X 1001では、複数の読み方を持つ複数の漢字を複数回エンコードするのに対し、KPS 9566には、各漢字が1回しかエンコードされません。[2]
KPS 9566-97 は合計 2679 の朝鮮語音節と 4653 の漢字をエンコードします。これは、万城コードでエンコードされる 2350 音節よりも広い範囲をカバーします。たとえば、有名な韓国文学作品똠방각하の名前に使用されている 똠文字には万城コードポイントが割り当てられていませんが、KPS 9566 にはコードポイント (38-02) が割り当てられています。 [2]漢字セクションには、Unified Repertoire and Orderingから 4652 文字と、 CJK Unified Ideographs Extension Aから 1 文字が含まれています。行 15 全体、行 44 の後半 (音節ブロックの後)、行 94 の後半 (漢字ブロックの後) は、ユーザー定義の目的で使用できます。[23] [2]
KPS 9566は、北朝鮮の政治生活に関するいくつかの特殊文字を含んでいることで特に際立っている。具体的には、朝鮮労働党のハンマー、鎌、筆の紋章(丸で囲まれていないものも含む)[7](コードポイント12-01と12-02)[23]と、北朝鮮の指導者である金日成(김일성)と金正日(김정일)の名前を特別な装飾フォントで綴った3つの特殊用途文字の2つのグループ(それぞれコードポイント04-72から04-74と04-75から04-77)[28]が含まれている。KimとIlの音節は、両方の名前で綴りが同じであるため、2回エンコードされている。 KPS 9566-2011には、金正恩(キム・ジョンウン)の名前がコードポイント04-78から04-80として追加されています。[3] [5]
これらの特殊文字のため、サポートされていない文字が私的使用領域にマッピングされない限り、KPS 9566とUnicodeの間には完全な双方向の互換性が現在ありません。[1]
10721 号
北朝鮮はまた、2番目の文字セットであるKPS 10721「情報交換用補足韓国漢字セットのコード」を開発し、2000年に発行されました。KPS 10721は、KPS 9566に含まれるものに加えて、少なくとも19469の漢字[2]のセットをエンコードします。2009年の時点で[アップデート]、これらすべてがUnicodeにマッピングされているわけではありませんでしたが、統一レパートリーと順序から10358、 CJK統合表意文字拡張Aから3187 、 CJK互換表意文字から107 (すべて基本多言語面)が含まれていました。また、CJK統合表意文字拡張Bから5767 、CJK互換表意文字補足(補足表意文字面)から50が含まれていました。[2] KPS 9566漢字はすべてKPS 10721に含まれていますが、[29] ISO 2022とは無関係の異なるエンコード構造を使用しています。
これらの漢字(KPS 9566に含まれる漢字は除く) [29]のUnicodeへのマッピング以外には、2022年以前は北朝鮮以外ではKPS 10721規格についてほとんど知られていなかった[2] [5]。Unicodeコンソーシアムが利用できる適切なフォントデータが不足していたため、北朝鮮の参照グリフはUnicodeコードチャートでこれらの漢字のサブセットに対してのみ提供されていました。[30] [29] KPS 9566またはKPS 10721ソースを持つUnicode漢字文字は、それでもキーを使用してUnihanデータベースのKPSコードに相互参照されますkIRG_KPSource。Unihanソースコードでは、KPS 9566を参照するために「KP0」を使用し、KPS 10721を参照するために「KP1」を使用します。[31]
2022年には、北朝鮮のOkpyon Androidアプリから漢字フォントが分離され、KPS-10721からUnicodeへのマッピングデータのいくつかのエラーを修正し、Unicodeコードチャート用の新しい北朝鮮の参照グリフを提供するために使用されました。その際に、KPS 9566漢字からKPS 10721へのマッピングも推定されました。[29] [32]既存の参照グリフは2022年9月にUnicode 15で更新されましたが、[33] UnicodeコンソーシアムのCJKおよびUnihanグループは2022年11月に、 Unicode技術委員会が追加の参照グリフを次のバージョンのUnicodeに含めることを推奨しました。 [34]これは2023年9月のUnicode 15.1に含まれる予定です。[35]
ドキュメントとUnicodeとの関係
ユニコードのバージョン 1.0 で追加されたハングル音節の初期のカバー範囲は、万成コードに基づいていました。ユニコードのバージョン 2.0 では、ジョハブで利用可能な音節レパートリーに基づいて、新しいハングル音節ブロック (現在のハングル音節ブロック) が追加され、以前のブロックは削除されました (現在はCJK 統合表意文字拡張 Aが占めています)。これは、まだユニコードでエンコードされたハングルデータが存在しないという前提で行われましたが、「韓国語の混乱」として知られるようになり、担当委員会は将来的にこのような互換性のない変更を行わないことを誓約しました。[36]この誓約は、ユニコード安定性ポリシーで成文化されました。[37]
1997年4月に発行されたKPS 9566-97のコード表[2]は、 ISO/IEC 2022で使用するためにISO国際符号化文字セット登録簿に登録されました。1998年6月にISO-IR-202の番号で登録されました。このコード表は情報処理学会から公開されています。[23]
1999年8月、北朝鮮の国家機関は、ユニコードに対応する国際標準規格であるISO/IEC 10646を担当するISO機関であるWG2(ISO/IEC JTC 1/SC 2ワーキンググループ2)に文書を提出した。この文書は、 CJK統合表意文字表からの既存の相互参照にKPS 9566コードを追加すること、既存のユニコードマッピングがないKPS 9566の80個の記号文字を追加すること、KPS 9566とユニコードの照合順序の違いを解決すること(ユニコードの文字順序は韓国のエンコードに従っているため)、および8つの結合字母を追加することを要求した。また、WG2に対して、既存のユニコード文字とブロック名を編集して、「ハングル」ではなく「韓国文字」という用語を使用するように要求した。[38]この提案の拡張版は、いくつかの文書に分割され、1999年12月に作業項目として提出された。[39]
2000 年 3 月、スウェーデン代表から詳細な回答が提出され、いくつかの点に反対し、スウェーデンが提案に反対票を投じた理由が詳しく述べられた。この回答では、韓国語の文字のエンコードを再度変更すると、比較的実装が少ないときに行われたが、振り返ってみると変更すべきではなかった最初の変更よりもさらに大きな混乱が生じると述べられていた。コード ポイント値で正しく照合できる言語はほとんどないかまったくないこと、この目的にはUnicode 照合アルゴリズムまたはISO/IEC 14651 (当時草案中) の調整を使用すべきであること、安定性ポリシーのため、割り当て済みの文字の規範名は変更できないが、他の言語への非規範的翻訳は使用できることが説明されていた。Unicode と KPS 9566 間の機械可読マッピング ファイルは北朝鮮の団体自体が提供でき、標準文書内の印刷された相互参照よりも有用であると提案された。提案された追加文字に関して、回答では、Unicodeで互換性分解される文字は追加すべきではなく、政党のロゴを含むロゴや特定の人の名前の特殊文字は追加すべきではないと述べられた。[40]
2000年7月、北朝鮮の団体はWG2に書簡を送り、韓国の提案のみに基づいて韓国語のUnicodeエンコーディングの両方のバージョンを開発したと非難し、北朝鮮の主権よりも企業の商業的利益と国際的な混乱の恐れを優先していると非難し、北朝鮮はUnicodeの韓国語文字の名前と順序の変更をこれ以上拒否することは自国の主権に対する侮辱であり、ISOの公平性の主張を危うくするものとみなすと述べた。彼らはWG2とUnicodeに対して、韓国語文字の順序を「修正」し、「ハングル字母」と「ハングル音節」という名前を「韓国語アルファベット」と「韓国語音節」に「修正」するよう繰り返し要求した。[4]
2000 年 8 月、北朝鮮の国家機関は、5 つの連続した提案で、要求のより詳細なバージョンを提出しました。これらの提案では、14 個の追加の文字[41] 、 82 個の記号文字の追加、[42]、および「ハングル」の代わりに「韓国語アルファベット」という用語の使用[43]が要求され、北朝鮮の照合順序の裏付けとなる証拠が提供され、[21]、北朝鮮の漢字レパートリーの追加が要求されました。[44]これらの提案は、2000 年 9 月に北朝鮮、韓国、スウェーデン、およびその他の WG2 代表者による 2 回の会議で議論され、北朝鮮の機関は、追加の文字文字の手書きの証拠を提供すること、すでに Unicode に受け入れられている記号を削除した記号提案を再提出すること、および照合の目的で当時最終草案段階にあったISO/IEC 14651の使用を検討することが求められました。[45]
2001年9月、北朝鮮の国家機関は、70の記号文字を含むいくつかのKPS 9566およびKPS 10721文字をUnicodeに追加することを要求する一連の改訂提案を提出した。[46] [47]この提案のバージョンには、いくつかの文字の使用法とその目的の簡単な説明を示す文書の抜粋セクションが含まれていた。朝鮮労働党のシンボルは「ハンマーと鎌とブラシ」と名付けられ、[46]提案の以前のバージョンでは「朝鮮労働党のマーク」から改名され、[42]地図上の識別シンボルとして使用されていることが正当化された。[46]指導者の名前に提案された文字の正当性として、北朝鮮の出版物では、指導者の名前が強調する目的で異なるサイズとフォントの太さで表示されることが多いと説明した。[46]韓国のWG2代表によるフォローアップでは、証拠、韓国語の名前、およびこれらの文字の一部を追加するための正当性が求められ、指導者の名前の文字の強調されていないバージョンがすでに存在していることが指摘されました。[48] 2001年10月にWG2の北朝鮮と韓国の代表者による会議が開催され、47の記号文字をユニコードに追加することが推奨され、指導者の名前と朝鮮労働党の記号をWG2でさらに議論するために提起することが提案されました。[49]
北朝鮮の追加提案に関する2002年2月のその後のフィードバック文書では、茶室の「茶」記号をより一般的な「温かい飲み物」記号として受け入れ、ガイドブックで温かい飲み物やノンアルコール飲料を示すために使用されている記号と同等とするよう要求した。また、雨が降っていない傘の既存のコードポイントの参照グリフを、雨が降っている傘の提案された参照グリフと調和するように変更し、パッケージに使用される「濡れないように」記号と同等とすることを推奨し、既存の記号コレクションのどの稲妻と高電圧警告記号を、提案された「高電圧」文字と統合できるかという問題を提起した。[50]これら3つの文字はすべて、バージョン4.0でUnicodeに受け入れられた。[51]また、横棒付き分数と左上向きのはさみは、異なる向きのはさみが付属しておらず、既存のUnicode分数コードポイントが斜めの形と水平の形を統一していたため、異体字セレクタを使用してエンコードすることを推奨しました。[50]
2002年11月、韓国の団体は、2000年当時のKPS 9566、KS X 1001(EUC-KRとして)、ISO/IEC 10646規格間の文字マッピング表を公開した。これらの表は北朝鮮からの意見なしに作成されたものであった。[52]
2004年8月、OpenOffice.orgプロジェクトに「ooprojlover」という名前を持つ個人がKPS 9566-2003とUnicodeのマッピングテーブルのペアを提出した。この人物は、これらがKPS 9566標準の更新版を表していると述べ、サポートの追加を要求した。 [22]これらのファイルは、Unicodeで使用できない文字を私的使用領域にマッピングし、メインのISO-IR-202プレーン外の他の音節ブロックの追加のエンコード形式を含んでいた。その後、このマッピングデータに基づいて、ISO-IRチャートを参照してエラーを修正したマッピングテーブルが2011年にUnicodeコンソーシアムによって公開された。[1]
Red Star OS 3.0のコピーには、KPS 9566 のより新しい版のフォントが含まれており、KPS 9566-2011 と思われる。Red Star OS が内部で使用しているマッピング テーブルは正常に抽出されている。KPS 9566-2011 では、金正恩を指導者リストに追加したほか、2003 年のマッピングと比較して特定の縦書きフォームのマッピングを修正し ( Unicode 4.1 で追加された縦書きフォームブロックを利用)、ISO-IR-202 プレーンの外部でエンコードされたいくつかの追加の漢字と記号も含まれている。これらの追加記号のいくつかは、私的使用領域にもマッピングされているが、北朝鮮以外ではこれらの文字の名前や参照グリフが知られていないため、その正体は不明である。[3]
今日のUnicodeへの影響
北朝鮮の提案の結果、現在のUnicode文字のいくつかがUnicode 4.0に追加されましたが、必ずしも当初提案されたコードポイントではありませんでした。これには、茶室を示す地図記号として提案されたHOT BEVERAGE(☕、TEA SYMBOLとして提案)や、戦闘や軍事的勝利の場所を示す地図記号として提案されたWHITE FLAG(⚐)とBLACK FLAG(⚑)の旗記号が含まれます。[6]これらの文字は、それぞれ暫定コードポイントU+270A、U+268E、U+268Fに提案されましたが、[49]最終コードポイントU+2615、U+2690、U+2691にエンコードされました。[53]また、U+2B05からU+2B0Dの範囲の一連の方向を示す太字の矢印も含まれていますが、[49]右向きの矢印は除いています。これは、 Dingbatsブロックの既存の文字にマッピングされており、[54]提案されたコードポイントと同じコードポイントで追加されましたが、北東と北西の矢印は提案と比較して入れ替わっています。[55]
北朝鮮の提案に含まれていた他の絵文字には、雨粒のついた傘(☔)、高電圧を表す稲妻(⚡)、警告用の三角形(⚠)などがある。 [49]北朝鮮の提案の文字と同じ文字を表す高電圧記号グリフが他にないか、 [50]ユニコードコード表にどのグリフを含めるのが最適かという議論の後、[56]既存の雨のない傘の文字(U+2602、☂)のコード表グリフを北朝鮮の提案の新しい雨粒のついた傘と調和するように修正した後、[50] [58]これらの文字も、国旗や飲料記号と同時にユニコード4.0に追加された。[51] [53] [56]暫定コードポイントU+2618、U+267F、U+267Eが提案されたが、[49]最終コードポイントはそれぞれU+2614、U+26A1、U+26A0となった。[53]
これらの文字のうち、熱い飲み物、雨粒のついた傘、稲妻と警告の三角形、上向き、下向き、左向きの矢印は、その後、日本の携帯電話の絵文字セットからのマッピングとして選択され、[59]現在のUnicode絵文字は合計7つであり、もともと北朝鮮の要請によりUnicodeに追加されたものである。雨粒のついた傘と上向き、下向き、左向きの矢印は、日本の放送で使用されているARIB拡張の文字とも統合され、[60]現在絵文字として分類されているいくつかの文字が含まれており、[61] Unicode 5.2でUnicodeにマッピングされました。[62] ただし、絵文字として、または絵文字の地域旗やアイデンティティ旗のシーケンスで使用されている白旗と黒旗のペアは、Unicode 7.0で追加された別の「なびく」セット(U+1F3F3 🏳とU+1F3F4 🏴)であり、[63] [64]北朝鮮のペアではない。
2018年現在、KPS 9566文字のうち、Unicodeにマッピングされていない文字がいくつか残っている。これには、WPKシンボル、4つの三角形、左向きのはさみ(ディンバットブロックの右向きのはさみとの対照的な使用が実証されていないという理由で除外)、円の中に上向きのマニクル、句読点の垂直表示形式、終止符を組み込んだ閉じ括弧のバリエーション、斜体バージョンとは別にエンコードされた横棒付きの俗分数のバリエーション、およびリーダーの名前が含まれる。[65]
下向きの三角形を描いた日本の郵便マークはKPS 9566-97に含まれていたが、北朝鮮の機関が、このマークが北朝鮮で使用されている証拠を求める韓国の機関の要請に応じて、ユニコードのレビューのための提案からこのマークを撤回したため、KPS 9566-2003 [1]で削除された。 [66] [48]このマークは、KPS 9566との互換性に基づいて2018年に再提案され、PSEダイヤモンドに置き換えられる前に日本で使用されていた電気適合マークであると特定された。[67]これは、2020年に発行されたバージョン13.0でユニコードに追加されました。
エンコードされたフォーム
KPS 9566の1997年版は、エスケープシーケンスで使用するためのコード化文字セットの国際登録簿にISO-IR-202として登録されており、[23]そのため、ISO/IEC 2022を使用してエンコードできます。これは94nの複数バイトのGセットであり、 7ビットのISO 2022コード( ISO-2022-JPまたはISO-2022-KRに類似)で使用すると、適切なモードの場合、文字は0x21から0x7Eまでのバイトのペアでエンコードされます。
KPS 9566 2003 [22] [1]版と 2011 [3]版の KPS 9566と Unicode 間の文書化されたマッピングでは、KPS 9566 をエンコードするために万成コードではなく統一ハングルコード(UHC) の適応に似たエンコードが使用され、ISO-IR-202 プレーンの更新バージョンは 0xA1 から 0xFE までのバイトのペアを使用してエンコードされ、ISO-IR-202 に存在しない音節には他の 2 バイトコードが使用されています。拡張された音節の順序は、通常の KPS 9566 の順序に従います。 UHCと同様に、リードバイト0x81以上を使用し、リードバイトが0xA1以上の場合は0xA1~0xFEの範囲を除いた0x41~0x5A、0x61~0x7A、0x81~0xFEの範囲の末尾バイトを使用します。[3]
2011年版には、拡張音節ブロックに使用される範囲の後に、ISO-IR-202プレーンの外側でエンコードされたいくつかの追加の漢字と記号も含まれています。[3]このアプローチはGBKで採用されているものと似ていますが、末尾のバイトは UHC スタイルの範囲に残ります。つまり、リードバイトが 0xA1 以上である拡張音節と同様に、これらはすべて末尾のバイト範囲 0x41~0x5A、0x61~0x7A、および 0x81~0xA0 を使用します。拡張漢字は 0xC8 から 0xDC までのリードバイトを使用してエンコードされ、拡張記号は 0xE0 から 0xEA までのリードバイトを使用してエンコードされ、リードバイトが 0xEC から 0xFE までの拡張コードはギャップなしで私的使用領域にマップされます[3] (GBK のユーザー定義の範囲と比較してください)。拡張記号セクションのいくつかの文字と漢字セクションの 3 つの文字も Unicode 私的使用領域にマップされます。 ISO-IR-202のメインプレーンのPUAマップされたシンボルとは異なり、これらの文字の正体は不明です。[3]
リードバイト
この表は、KPS 9566文字セットのメインプレーンの全体的なレイアウトをリードバイト別に詳細に示しています。[23]合成された朝鮮語音節や漢字以外の文字に使用されるリードバイトについては、そのリードバイトでエンコードされた文字を一覧にしたこのページの表へのリンクが提供されています。漢字に使用されるリードバイトについては、ウィクショナリーの漢字索引 の適切なセクションへのリンクが提供されています。
2つの16進数が与えられた場合、0x7F未満の値は7ビットエンコーディングで使用され、[a]より大きな値(0xA1と0xFEの間)は8ビットEUCスタイルのエンコーディングで使用されます。[17] 2003年版以降で定義された拡張UHCスタイルの8ビットエンコーディングでも同様に、メインのISO-IR-202ベースのプレーンに0xA1と0xFEの間のより大きなバイト値が使用されます。[1] [3]
主面の非漢字、非合成文字セット
文字セット 0x21/0xA1 (行番号 1、句読点と縦書き)
このセットには、括弧、引用符、カンマなどの一般的な句読点と、縦書きで使用するための表示形式が含まれています。ASCII句読点(強調表示)は、以下に示すように、基本ラテンコードポイントにマッピングされています( KS X 1001やJIS X 0208などの他のCJK文字セットの記事と一致しています)。ただし、KPS 9566とASCIIを組み合わせたエンコードで使用される場合は、半角および全角フォームブロックにマッピングされます(たとえば、2003年版で定義されています)。[1]
2003年のマッピングと比較して、2011年のマッピングでは、Unicode 4.1で導入された垂直形式ブロックを活用するために、3つの垂直表示形式のUnicodeマッピングが変更されています。 [3]
文字セット 0x22/0xA2 (行番号 2、記号と演算子)
このセットには、数学演算子や、アンパサンド、ピルクロウ、音符などの他の記号が含まれます。ASCII句読点(強調表示)は、以下に示すように、基本ラテンコードポイントにマッピングされています(他のCJK文字セットの記事と一致しています)。ただし、 KPS 9566とASCIIを組み合わせたエンコードで使用される場合は、半角および全角フォームブロックにマッピングされます。[1]
この行には、前方または片側にある山や傾斜を示す三角形の「道路標識」記号がいくつか含まれていますが、現在Unicodeには含まれていません。これらは私的使用領域にマッピングされています。[46]
文字セット 0x23/0xA3 (行番号 3、数字とローマ字)
このセットには、句読点と記号を除いたASCIIのサブセットが含まれており、西洋アラビア数字と基本ラテンアルファベットの両方の大文字と小文字で構成されています。この行が完全に一致するJIS X 0208 の行 3と比較してください。この行には、英数字のサブセットだけでなく、 ISO 646の各国語版全体が含まれているKS X 1001とGB 2312の行 3 を比較対照してください。
この行の文字は、以下に示すように、基本ラテンコードポイントにマッピングされています(他の文字セットの記事と一致しています)。ただし、 KPS 9566とASCIIを組み合わせたエンコードで使用される場合は、半角および全角フォームブロックにマッピングされます。[1]
文字セット 0x24/0xA4 (行番号 4、朝鮮語の文字と指導者の名前)
このセットには朝鮮古 字体のほか、北朝鮮の指導者である金日成と金正日(2003年時点)の名前の特別なエンコードが含まれています。 2011年版からは金正恩の名前も含まれています。 [3] KS X 1001の4行目と比較してください。
この行の字母は、Unicodeハングル互換字母ブロック (KS X 1001 からマッピングされた位置非依存文字を含む) に存在するため、そのブロックにマッピングされます。口蓋音化した歯擦音を区別する廃止された字母は、ハングル字母ブロックの位置固有文字にマッピングされます。[1]逆に、KS X 1001 でエンコードされた廃止された字母のすべてが KPS 9566 のメインプレーンにエンコードされているわけではありません。2011 年版の KPS 9566 では、KS X 1001 の他の歴史的な字母の一部が、リードバイト 0xEA でメインプレーンの外側に含まれています。[3]
リーダーの名前の特別なエンコーディングは Unicode には存在せず、私的使用領域にマッピングされています。以下にマークアップでシミュレートしたものを示します。
文字セット 0x25/0xA5 (行番号 5、キリル文字)
このセットにはキリル文字の33文字が大文字と小文字の両方で含まれており、現代のロシア語アルファベットとブルガリア語アルファベットを書くには十分ですが、他の形式のキリル文字には追加の文字が必要です。[71]
同じレイアウト(ただし行は異なる)を使用している KS X 1001 の行 12とJIS X 0208 の行 7 を比較します。
文字セット 0x26/0xA6 (行番号 6、ギリシャ文字とローマ数字)
このセットには、ローマ数字と、発音区別符号や最後のシグマのないギリシャ語アルファベットの基本的なサポートが含まれています。
KS X 1001 の行 5 (同じ文字を使用していますが、レイアウトと行が異なります) とJIS X 0208 の行 6 (ギリシャ文字のレイアウトは同じですが、ローマ数字はありません)を比較対照します。
文字セット 0x27/0xA7 (行番号 7、丸付き、上付き文字、下付き文字、分数)
この行の丸で囲まれた数字のいくつかは、2003年版では最終的に提案されたコードポイントを使用していなかったため、Unicodeに誤ってマッピングされていました。[1]これらは2011年版で修正されました。[3]
文字セット 0x28/0xA8 (行番号 8、単位、数量、通貨記号)
このセットには、測定単位と通貨単位の記号が含まれています。ASCIIに存在するもの(強調表示)は、以下に示すように、基本ラテンコードポイントにマッピングされています(他のCJK文字セットの記事と一致しています)。ただし、 KPS 9566とASCIIを組み合わせたエンコードで使用される場合は、半角および全角フォームブロックにマッピングされます。[1]
2003年版ではケルビン記号がユーロ記号に置き換えられました。[ 1 ] 2011年版では、ケルビン記号の代替エンコードが0xE988に含まれています。[3]
KS X 1001 の 7 行目に含まれる単位記号のレパートリーと比較対照してください。
文字セット 0x29/0xA9 (行番号 9、ボックス描画)
文字セット 0x2A/0xAA (行番号10、ひらがな)
同じレイアウトを使用しているKS X 1001 の行 10 を比較してください。また、同じレイアウトを使用しているが行が異なる JIS X 0208 の行 4と比較対照してください。
文字セット 0x2B/0xAB (行番号 11、カタカナ)
この行には、日本語で使用されるカタカナが含まれています。ただし、カタカナテキストで使用され、JIS X 0208の行1に含まれる日本語の長母音記号は含まれていません(GB 2312およびKS X 1001の場合と同様)[72]。ただし、KPS 9566-2011では、メインプレーンの外側の0xEA48に含まれています。[3]
同じレイアウトを使用しているKS X 1001 の行 11 を比較してください。同じレイアウトを使用しているが行が異なる JIS X 0208 の行 5と比較対照してください。
文字セット 0x2C/0xAC (行番号 12、その他の記号と矢印)
この行をUnicodeにマッピングする目的で、太字の右向き矢印はZapf Dingbats (U+27A1) の太字の右向き矢印と統一されましたが、[54]以前の表 (他の太字矢印のマッピングがなかった) では、わずかに異なるZapf Dingbats文字であるU+279Eに統一されていました。[52]他の方向の対応する矢印はDingbatsブロックに含まれていなかったため、KPS 9566との互換性のために、U+2B05とU+2B0Dの間に追加の矢印がエンコードされました。これらは、北朝鮮の国家機関によって提案された参照グリフを使用してUnicodeコードチャートに組み込まれましたが、U+27A1はZapf Dingbatsに基づく参照グリフを保持しました。[54]これらの矢印 (U+2B05からU+2B07、およびU+27A1) は、セルラー絵文字セットの矢印文字の一部のマッピングとしてUnicode 6.0で選択されました。[59]その後、Unicode 7.0でWingdings 3レパートリーが追加される際に、矢印文字のUnicode範囲が見直され、Zapf Dingbats文字の参照グリフを変更することは適切ではないと考えられたため、U+2B05からU+2B0Dまでの文字(テキスト表示)と調和させる目的で、U+2B95に右向きの矢印が追加されました。[54]
1997年版など、KPS 9566の以前の版では、この行には単純な日本式の郵便番号(〒)と下向きの三角形のバージョンの両方が含まれていた。[46] [23]これは、北朝鮮の国家団体によって、他の欠落しているKPS 9566文字とともにユニコードに追加するよう提案されたものである。[46]韓国の代表者による回答では、他の要求とともに、この記号が北朝鮮で使用されている証拠を求め、日本式の郵便番号は韓国では使用されていない(韓国では同様の目的で丸で囲まれた우(すなわち㉾)を使用している)ことを指摘し、日本式の郵便番号が北朝鮮で使用されているかどうかを尋ねた。[48]その後、この提案について議論するために、北朝鮮と韓国のWG2代表が出席した会議が開催された。会議報告書には、北朝鮮の団体は、これ以上議論する前に文字を見直すことを決定したため、WG2全体で検討することを推奨しなかったと記されている。[66]その後、2003年にKPS9566から郵便マークの三角形が削除され、囲まれていない郵便マークのみが残りました。[1]
郵便マークの三角形は、従来のKPS 9566-97文字との互換性のため、また、このマークが日本国内で電気製品の認証に使用されていたシンボル( PSEダイヤモンドの前身)として認識されたことを受けて、最終的にUnicodeバージョン13.0で追加されました。[67]
この行のKPS 9566の特定の文字、すなわち朝鮮労働党の紋章の2つの形、ディンバットブロックのものと異なる方向を向いているはさみ、および円で囲まれた上向きのマニキュアは、私的使用エリアにマッピングされたままです。[1]
2003年版では、北東と北西の白い矢印は、誤って入れ替わったUnicodeマッピングを使用していました。[1]これは、2011年版のマッピングで修正されました。[3]
文字セット 0x2E/0xAE (行番号 14、Latin-1 サブセット)
このセットの文字は、1997 年版の文字セットには存在しなかったが、2003 年版で追加された。[1]これらは、Unicode のLatin-1 補足ブロック ( ISO 8859-1 (Latin-1) 文字セットの上位半分に相当)のサブセットを構成する。これには、アクセント付きローマ字と記号が含まれる。すでに含まれている記号の一部は省略され、他の一部は以前の全角形式に対応する半角文字として複製されている。たとえば、否定記号(¬、U+00AC) は 0xAEAC として表され、全角形式 (¬、U+FFE2) は 0xA2D1 (行 2) として表される。[1]
この行は2011年版の標準のマッピングから省略されており、[3] 2003年版以降のどこかの時点で削除された可能性があることを示しています。半角円記号は、代わりに2011年版では0xE98Eにエンコードされています。[3]
必要なスペースは94文字の範囲外となり、UHCスタイルのエンコードが使用される場合(具体的には音節쁲)に拡張された朝鮮語音節に使用される領域と衝突するため、[1]省略されます。トレマ付きのyも94文字の範囲外であり、末尾のバイト0xFFはそれ以外の場合は使用されませんが、KPS 9566-2003ではコード0xAEFFがそれにマッピングされています。[1]
あらかじめ構成された朝鮮語セット(行番号 16 から 44)
合成済みの朝鮮語音節クラスターには、コードポイント16-01から44-47までの連続したブロックにコードポイントが割り当てられています。すべてのクラスターにコードポイントが割り当てられているわけではありません。[73] KS X 1001の異なる順序と可用性を比較してください。
KPS 9566-2003 について文書化されたエンコード形式では、KPS 9566 プレーンを GR (0xA1-0xFE) でエンコードし、さらに残りの音節クラスターを、先頭バイトとして 0x80-0xC2 の範囲、末尾バイトとして 0x41-0x5A、0x61-0x7A、0x81-0xFE (0xA1-0xFE の範囲にあるバイトは最大で 1 つ) を使用してエンコードします。[1]これは統一ハングル コードに似ていますが、クラスターが省略され、並べ替え順序も KPS 9566 のものであり、 KS X 1001のものではありません。
jamoによる統計
漢字セット(行番号45~94)
69-09の漢字(0xE5A9)は、文書化されたすべての表でU+676E杮にマッピングされています。ただし、文字は読みに従って順序付けられており、代わりにU+67FFを意図しているようです。 [ 74]
KPS 9566-2011 の拡張された非音節、非漢字セット
以下はKPS 9566-2011のメインプレーン外の非音節、非漢字セクションのチャートです。[3]
拡張セット 0xE0 (記号と絵文字)
拡張セット 0xE1、0xE2、0xE3 (不明)
これらの拡張セット内のすべての文字は私的使用領域にマッピングされます。その目的は不明です。[3]
拡張セット 0xE4 (矢印)
このセットには、Unicode Dingbatsブロックやその他の場所にマッピングされる、主に右向きの矢印がいくつか含まれています。[3]
拡張セット 0xE5 (ローマ字の上付き文字と下付き文字)
この行には、大文字のASCII文字に対応する末尾バイトを持つ小文字のローマ字の上付き文字と、小文字のASCII文字に対応する末尾バイトを持つ小文字のローマ字の下付き文字がいくつか含まれています。[3]
拡張セット 0xE6 (ギリシャ語および記号の上付き文字と下付き文字)
拡張セット 0xE7 (追加リストマーカー)
拡張セット 0xE8
この拡張セットの文字はすべて私的使用領域にマッピングされるが、0xE884はU+FE30 ︰垂直2点リーダーの表示形式にマッピングされる。[3]
拡張セット 0xE9 (追加の記号と句読点)
このセットには、トランプのスート記号、さまざまな記号、および行8の通貨記号の一部の半角記号が含まれています。ケルビン記号も含まれていますが、[3]行8ではユーロ記号に置き換えられています。[1]
拡張セット 0xEA (日本語の句読点と追加の字母)
このセットには、日本で使用されている句読点がいくつか含まれており、ハングル互換文字Unicodeブロックの文字のうち、行4にまだ含まれていない文字もいくつか含まれています。 [3]これは、KS X 1001に存在する文字の一部ですが、KPS 9566には以前は存在していませんでした。
脚注
- ^ 例えば、ISO-IR-202表の見出しには、文字の7ビットバイナリコードと区点/ハングルコードが示されています。[23]
- ^ ab ISO 2022互換の94 n文字セットとして、プレーンスペースと削除文字は常に、それぞれ0x20と0x7F(0xA0と0xFFではない)のシングルバイトコードとして使用できます。
- ^ またはU+223C ∼チルダ演算子. [52]
- ^ 他のマッピングでは、 KS X 1001 01-09に一致するようにU+00ADソフトハイフンを使用します。[52]
- ^ abcde 半角のこのような文字が 14 行目に存在しますが、これは具体的には全角文字です。
- ^ チルダッシュの垂直形式。Unicodeコンソーシアムが提供するマッピングファイルは、Red Star OS [7]で使用されているU+2E2F [1]への名前によるマッピングを認めていますが、Unicode文字は大幅に異なる文字(スペース垂直チルダ高分音記号)を意図していることを指摘し、2004年にOpenOffice.orgプロジェクトに提出されたマッピングデータに基づいて、マッピングU+F104(私的使用領域内)もリストしています[1] 。 [22]ここでは画像を使用して表示しています。
- ^ ab ピリオドと閉じ括弧を組み合わせた文字。私的使用領域にマッピングされ、ここでは置換されて示されています。
- ^ またはU+25E6 ◦白い弾丸。[52]
- ^ またはU+2022 • BULLET . [52]
- ^ abc 私的使用エリアにマッピングされており、ここでは画像を使用して表示されています。
- ^ Mac OSの韓国語(ハングルトーク)は、ワンソンコードと拡張セットを組み合わせたもので、視覚的に類似した文字を0xA79Bにエンコードしており、[68] AppleはこれをUnicodeシーケンスU+25B4+20E4(▴⃤)にマッピングしています。[69]ただし、KPS 9566文字にこのマッピングが使用されているという文書はありません。
- ^ Unicode 16.0への組み込みが承認されました。[70]
- ^ abcdefghi 北朝鮮の指導者の名前の太字/強調された文字が私的使用領域にマッピングされ、ここではマークアップでシミュレートされて示されています。
- ^ abcde 水平バーと垂直配置の分数の形式。私的使用エリアにマッピングされ、ここではシミュレーションで示されています。
- ^ 1997 年版ではケルビン度 (コード表の一部のバージョンでは単位記号に度記号が含まれています)。2003 年版ではユーロです。
- ^ ab 朝鮮労働党の紋章、私的使用エリアにマッピング、ここでは画像を使用して表示。
- ^ またはU+279E ➞太い三角右矢印またはU+2B95 ⮕右黒矢印:テキストを参照。
- ^ 1997 年版チャートおよび 2001 年の Unicode 提案 N2374 に記載されています。2003 年版では削除されました。
- ^ 2003年版ではU+261E(☞)にマッピングされています。[1] 2011年版では、代わりに私的使用領域の文字U+F13Bにマッピングされています。[3]参照グリフはバックハンドマニクルです。[23] [3]つまり、U+1F449(👉︎)と一致します。KPS 9566-2011の0xE04Dと比較してください。
- ^ 円で囲まれた上向きのマニキュアは私的使用領域にマッピングされており、[1]ここでは画像を使用して示されています。非PUAマッピングの可能性のある1つは、シーケンスU + 1F446 + 20DD(👆︎⃝)です。[7]
- ^ 左上を指すはさみは私的使用エリアにマッピングされており、ここでは画像を使用して示されています。
参考文献
- ^ abcdefghijklmnopqrstu vwxyz aa ab 「KPS 9566-2003 から Unicode へ」。Unicode コンソーシアム。
- ^ abcdefghijkl Lunde, Ken (2009). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . pp. 148–151. ISBN 978-0-596-51447-1。
- ^ abcdefghijklmnopqrstu vwxyz aa ab ac ad Chung, Jaemin (2018-01-05). 「KPS 9566の最新バージョンに関する情報(KPS 9566-2011?)」(PDF)。UTC L2/18-011。
- ^ abcd Cho, Chun-Hui (2000-07-05). 「10646-1: 2000 の文字名と順序に関する DPRK の書簡」(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2231。
- ^ abc Lunde, Ken (2019-03-25). 「Four of a Kind: KS X 1001 & KPS 9566」. CJK Type Blog . Adobe Inc .
- ^ ab Ewell, Doug (2002-08-15). 「Re: Unicode 4.0 のスクリプト」. Unicode メール リスト アーカイブ.
- ^ abcd West, Andrew (2015-05-29). 「KPS 9566 マッピング (Re: Arrow dingbats でした)」。Unicode メーリング リスト アーカイブ。
- ^ abc Jennings, Thomas Daniel (2020-03-17) [1999]. 「ASCII文字コードの注釈付き歴史:情報浸透のためのアメリカ標準コード」. Sensitive research (SR-IX) . 2016-05-22時点のオリジナルよりアーカイブ。 2020-03-17に閲覧。
- ^ 「標準 ECMA-6: 7 ビットコード化文字セット」。Ecma International。
- ^ ab Lunde, Ken (2009). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . p. 89. ISBN 978-0-596-51447-1。
- ^ ECMA/TC 1 (1973)。「簡単な歴史」。7 ビット入出力コード化文字セット(PDF) (第 4 版)。ECMA。ECMA - 6:1973。
{{citation}}: CS1 maint: 数値名: 著者リスト (リンク) - ^ ECMA (1994). 文字コード構造および拡張テクニック(PDF) (第 6 版). ECMA-35:1994.
- ^ Lunde, Ken (2009). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . pp. 19–20, 581–582. ISBN 978-0-596-51447-1。
- ^ Lunde, Ken (2009). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . pp. 84–85. ISBN 978-0-596-51447-1。
- ^ ab "2.4: 複数バイトグラフィック文字セット". エスケープシーケンスで使用されるコード化文字セットの国際登録 (ISO-IR) (PDF) . ITSCJ/ IPSJ . p. 14.
- ^ abc Lunde, Ken (2009). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . pp. 94–147. ISBN 978-0-596-51447-1。
- ^ ab Lunde, Ken (2009). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . pp. 242–255. ISBN 978-0-596-51447-1。
- ^ abc Shin, Jungshik. 「KS X 1001(KS C 5601)とその他のハングルコードとは何ですか?」韓国のハングルとインターネットに関するFAQ。
- ^ ab Hwang, Jinsang (2005). ICT 標準の社会的形成: 韓国における国家コード化文字セット標準論争の事例(PDF)。エディンバラ大学。
- ^ ケン、ルンデ(1995-12-18)。 「3.3.6: Nバイトハングル」。 CJK.INF バージョン 1.9。
- ^ ab 朝鮮民主主義人民共和国標準化委員会 (CSK) (2000-08-10)。「CSK が提案した韓国語文字の配列に関する証拠」(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2246。
- ^ abcd 「KPS 9566-2003(北朝鮮語)とUnicode間の変換テーブル」Apache OpenOffice (AOO) Bugzilla 2004-08-27。
- ^ abcdefghi 朝鮮民主主義人民共和国標準化委員会 (1998-06-22). 情報交換のための朝鮮語標準グラフィック文字セット(PDF) . ITSCJ/ IPSJ . ISO-IR -202.
- ^ Unicode コンソーシアム。「Unicode リリースおよび発行日の履歴」。
- ^ West, Andrew (2019-06-17) [2007-06-05]. 「Unicode と ISO/IEC 10646」.
- ^ 村田誠 (2000 年 4 月 14 日). 「XML 日本語プロファイル」. W3C ノート. W3C .
- ^ ファン・ケステレン、アン。エンコーディング標準。なんてことだ。
- ^ Lunde, Ken (1999). CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語のコンピューティング。セバストポル、カリフォルニア州: O'Reilly。p . 116。ISBN 1-56592-224-7。
- ^ abcd Bai, Yi; Sim, CheonHyeong (2022-10-16). 「Unicode の kIRG_KPSource 代表グリフに対する CodeCharts サポートの追加を検討する提案」(PDF)。UTC L2 /22-238。
- ^ Cook, Richard. 「Q: なぜ一部の CJK コード表に DPRK (北朝鮮 == kIRG_KPSource) のグリフが欠落しているのですか?」. FAQ - 中国語と日本語. Unicode コンソーシアム. 2022 年 10 月 4 日時点のオリジナルよりアーカイブ。
{{cite web}}: CS1 メンテナンス: 不適切 URL (リンク) - ^ ジョン・H・ジェンキンス;クック、リチャード。ルンデ、ケン(2020-03-05)。 「Unicodeハンデータベース(ユニハン)」。 kIRG_KPSソース。 Unicode 標準付録 #38。
- ^ シム・チョンヒョン (2022-06-19). 「KPS 10721:2000 (Unicode KP1源) 文件重构 (修订版)」(PDF) (簡体字中国語)。
- ^ 例: 「CJK 互換表意文字 (§ DPRK 互換表意文字)」(PDF)。Unicode 15.0 バージョンチャート (デルタチャート)。Unicode コンソーシアム。 2022 年。
- ^ Lunde, Ken (2022-11-01). 「35) L2/22-238: kIRG_KPSource 代表グリフに対する CodeCharts サポートの追加を検討する提案」(PDF) . CJK & Unihan Group UTC #173 会議への推奨事項. UTC L2/22-247.
- ^ ルンデ、ケン(2023-02-07). 「IRG #60 の US/Unicode アクティビティ レポート」(PDF)。UTC L2/23-058、ISO/IEC JTC1/SC2 /WG2/ IRG N2599。
- ^ Yergeau , F. (1998). UTF -8、ISO 10646の変換フォーマット。IETF。doi : 10.17487/rfc2279。RFC 2279。
- ^ 「Unicode 文字エンコーディング安定性ポリシー」。Unicode コンソーシアム。2017 年 6 月 23 日。
- ^ Jo, Chun-Hui (1999-08-10). 「ISO/IEC 10646-1:1998 修正 5 の韓国語文字を含む部分の修正」(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2056。
- ^ 「 ISO/IEC 10646-1:1993 の韓国語部分の修正に関する新しい作業項目提案 (NP)」。1999 年 12 月 7 日。L2 /99-380、ISO/IEC JTC 1 N5999。
- ^ Karlsson, Kent (2000-03-02). 「朝鮮語文字に関する北朝鮮の新作業項目提案に対するコメント」ISO/IEC JTC 1/SC 2 /WG 2 N2167.
- ^ 朝鮮民主主義人民共和国標準化委員会 (CSK) (2000-08-10)。「ISO/IEC 10646-1 への 14 の韓国語アルファベットの追加に関する提案」(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2243。
- ^ ab 朝鮮民主主義人民共和国標準化委員会 (CSK) (2000-08-10)。「ISO/IEC 10646-1 への 82 個のシンボルの追加に関する提案」(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2244。
- ^ 朝鮮民主主義人民共和国標準化委員会 (CSK) (2000-08-10)。「ISO/IEC 10646-1 の韓国語文字の既存名称を変更する提案」(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2245。
- ^ 朝鮮民主主義人民共和国標準化委員会 (CSK) (2000-08-10)。 「ISO/IEC 10646-1 に朝鮮民主主義人民共和国の漢字欄を追加する提案 (CJK 統一表意文字に 14938 の表意文字、その拡張 [原文どおり] A に 3181 の表意文字)」(PDF)。ISO/IEC JTC 1/SC 2 /WG 2 N2247。
- ^ 韓国語スクリプト アドホック グループ (2000-09-21)。「韓国語スクリプト アドホック グループの会議報告」。ISO /IEC JTC 1/SC 2 /WG 2 N2282。
- ^ abcdefg 朝鮮民主主義人民共和国標準化委員会 (CSK) (2001-09-03)。 ISO/IEC 10646-1:2000 に 70 のシンボルを追加する提案(PDF)。ISO/IEC JTC 1/SC 2 /WG 2 N2374。
- ^ 朝鮮民主主義人民共和国標準化委員会 (CSK) (2001-09-03)。朝鮮民主主義人民共和国の 160 互換漢字コード表を CJK 互換表意文字に追加する提案(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2375。
- ^ abc Gim, Gyeongseog (2001-10-13). ISO/IEC 10646-1:2000 に 70 個のシンボルを追加するという北朝鮮の提案 WG2 N 2374 に対する韓国のコメント(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2390。
- ^ abcde Korean Script ad hoc group (2001-10-16). 2001年10月15日のKorean Script ad hoc group meetingの報告書(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2392、UTC L2/01-388。 2020年8月3日時点のオリジナル(PDF)からアーカイブ。 2020年4月29日閲覧。
- ^ abcd Freytag, Asmus (2002-02-13). 「北朝鮮から提案されたシンボルに関する注記」(PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2417, UTC L2/02-102.
- ^ ab 絵文字ペディア。 「Unicode 4.0絵文字」。絵文字ペディア。
- ^ abcdef Kim, Kyongsok (2002-11-30). 「国家機関の位置づけ: 3 方向相互参照表 - KS X 1001、KPS 9566、および UCS」(PDF)。ISO/IEC JTC 1/SC 2 /WG 2 N2564。[注記: 文書に付随する表のリンクを更新しました: [1] 2021-04-03にWayback Machineでアーカイブ[2] 2021-04-03にWayback Machineでアーカイブ
- ^ abcd 「その他の記号」(PDF)。Unicode 4.0.0 Delta コード表。Unicode コンソーシアム。
- ^ abcd Whistler, Ken (2015-05-28). 「Re: Arrow dingbats」. Unicode メール リスト アーカイブ。
- ^ 「その他の記号と矢印」(PDF)。Unicode 4.0.0 Delta コードチャート。Unicode コンソーシアム。
- ^ ab Overington, William (2003-02-24). 「Unicode 4.0 ベータ文字」.
- ^ 「その他の記号」(PDF)。Unicode 3.2.0 Delta コード表。Unicode コンソーシアム。
- ^ Unicode 4.0コードチャートでは変更されたグリフが示されていますが、[53] Unicode 3.2コードチャートでは以前のグリフが示されています。[57]
- ^ ab シェーラー、マルクス;デイビス、マーク。桃井、キャット。トング、ダリック。木田康雄;エドバーグ、ピーター。 「絵文字シンボル: 背景データ - 絵文字シンボルのエンコードに関する提案の背景データ」(PDF)。 UTC L2/10-132。
- ^ Suignard, Michel (2007-09-18). 「日本のテレビシンボル」(PDF) . UTC L2/07-391、ISO/IEC JTC 1/SC 2 /WG 2 N3341。
- ^ Unicodeコンソーシアム(2020). 「絵文字のバージョンとソース、v13.0」
- ^ Emojipedia . 「Unicode 5.2 絵文字リスト」. Emojipedia .
- ^ Emojipedia . 「白旗を振る絵文字」. Emojipedia .
- ^ Emojipedia . 「黒旗を振る絵文字」。Emojipedia .
- ^ Marin Silva, Eduardo (2018). 北朝鮮で使用される互換記号と句読点の再検討提案(PDF) UTC L2/18-004。
- ^ ab Korean Script ad hoc group (2001-10-16). 2001年10月15日のKorean Script ad hoc group meetingの報告書(PDF)。ISO /IEC JTC 1/SC 2 /WG 2 N2392、UTC L2/01-388。 2020年8月3日時点のオリジナル(PDF)からアーカイブ。2020年4月29日閲覧。
韓国のDPRは、Korean Script ad hoc groupまたはWG2で再度議論する前に、この文字をより慎重に検討することを提案しました。
- ^ ab Marín Silva, Eduardo (2018). エンコードの提案: タイプAエレクトロニクスのシンボル(PDF) UTC L2/18-184R.
- ^ Lunde, Ken (2009). 「付録 E: ベンダー文字セット標準」(PDF) . CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . ISBN 978-0-596-51447-1。
- ^ Apple (2005-04-05). 「Mac OS の韓国語エンコードから Unicode 3.2 以降へのマップ (外部バージョン)」。Unicode Consortium。
- ^ 「Symbols for Legacy Computing Supplement」(PDF)。ドラフト版Unicode標準、バージョン16.0ベータレビュー。Unicodeコンソーシアム。 2024年5月27日閲覧。
- ^ Czyborra, Roman (1998-11-30) [1998-05-25]. 「The Cyrillic Charset Soup」。2016年12月3日時点のオリジナルよりアーカイブ。2016年12月3日閲覧。
- ^ Lunde, Ken (2009). 「Seemingly Missing Characters」. CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . p. 180. ISBN 978-0-596-51447-1。
- ^ この表はKPS9566.TXTから生成されました。[1]
- ^ Chung, Jaemin (2021-03-17). 「KP0-E5A9はU+676EではなくU+67FFにマッピングされるべきです」(PDF)。UTC L2/21-059。
外部リンク
- ISO-IRレジストリの KPS 9566-97 コード表
- 2000 年時点の EUC-KP (KPS 9566)、EUC-KR、Unicode 間の 3 方向マッピング。Wayback Machineで 2021-04-03 にアーカイブ済み (ファイルは EUC-KR 形式。0xB8F0 をU+BCD2 볒 HANGUL SYLLABLE BYEOJにマッピングするエラーに注意。U +BCD3 볓 HANGUL SYLLABLE BYEOCではない)
- KPS 9566-2003 から Unicode へのマッピング
- KPS 9566-2011 コード テーブルとマッピングはRed Star OSからリバース エンジニアリングされました。
