| MIME / IANA | ks_c_5601-1987 |
|---|---|
| エイリアス | KS C 5601 |
| 言語 | 部分的なサポート: |
| 標準 | KS X 1001 |
| 分類 | ISO-2022互換DBCS、CJK エンコード |
| エンコード形式 | |
| 先行 | N バイトのハングル コード (KS C 5601-1974) |
| その他の関連エンコーディング | 関連サプリメント: KS X 1002 その他のハングル ISO 2022 DBCS: その他の CJK ISO 2022 DBCS: |
KS X 1001、「情報交換用コード(ハングルと漢字)」[d] [1]は、以前はKS C 5601と呼ばれていましたが、コンピュータ上でハングルと漢字の文字を表すための韓国のコード化文字セット標準です。
KS X 1001 は、 EUC-KRや Microsoft のUnified Hangul Code (UHC)など、韓国語の最も一般的なレガシー ( Unicode以前)文字エンコーディングでエンコードされています。これには、韓国語のハングル音節、CJK 表意文字 (漢字)、ギリシャ語、キリル文字、日本語 (ひらがなとカタカナ)、およびその他の文字が含まれています。
KS X 1001 は、 ISO 2022およびEUCの 2 バイト コード ワードの構造に従って、94×94 のテーブルとして配置されています。したがって、コード ポイントは1 ~ 94 の整数のペアです。ただし、一部のエンコーディング (UHC およびJohab ) では、すべてのコード ポイントにコードを提供することに加えて、コード ポイント シーケンスとしてのみ表現できる文字に対して追加のコードを提供します。
歴史
この規格は以前は KS C 5601 として知られていました。この規格は何度か改訂されています。たとえば、1987 年、1992 年、1998 年、2002 年に改訂されました。
現在の2バイトのワンソン(완성 ; Wanseong ;文字通り、 合成前)[1]文字セットは、 1986年に発行されたKS C 5601の第3版[2]で標準化されました。 [3]これはISO 2022互換のエンコーディングで、通常はEUC形式で使用されるもので、非ハングル、ハングルの字母、最も一般的なハングルの音節に2バイトコードを割り当てます。これに対し、ジョハブ(조합 ; Johap ;文字通り、 組み合わせる)[1]はISO 2022と互換性がありませんが、現代の字母を使用してすべてのハングルの音節に2バイトコードを割り当てます。[2]ワンソンは技術的には可変長エンコーディングであり、他の音節を8バイトのシーケンス(字母とハングルのフィラー文字を使用)で表すことができますが、この機能は常に実装されているわけではありません。[4]
1974年に発行されたKS C 5601の最も初期の版[2]では、可変長[2] 7ビット文字セットを定義し、51 [3] の基本的なハングル字母に1バイトのコードポイントを割り当てました。これは、 JIS C 6220に類似しており、「Nバイトハングル」と呼ばれるエンコードです。[5] 1982年に発行された第2版では、1974年版の主な文字セットが保持されましたが、Johabのバージョンを含む2つの補足セットが定義されました。どちらの版も、意図したほど広く採用されませんでした。[2]
1987年版と1992年版では、Wansungは変更されませんでした。1992年版では、追加の付録資料が追加されました。[3]付録3のJohabエンコーディング[6]の定義と、付録4の古いNバイトハングルエンコーディング[1] [5] 。これは、当時ハングルワードプロセッサで使用されていたWansungの競合エンコーディングとしてJohabが業界で使用されていたことに応えて発行されました。MicrosoftがWindows 95で統一ハングルコードを導入し、ハングルワードプロセッサが2000年にJohabを放棄してUnicodeを採用した後、Johabは一般的に使用されなくなりました。[2]
エンコーディング

KS X 1001 のエンコード方式には、EUC-KR ( ASCIIとISO 646 -KR ベースの両方のバリエーションがあり、後者はバイト 0x5C にバックスラッシュではなくウォン通貨記号 ( ₩ ) を含む)とISO - 2022 - KR [7]、およびISO-2022-JP-2 (これもJIS X 0208とJIS X 0212をエンコードする) がある。これらにはすべて、独自の KS X 1001 コードポイントを持つ 2350 個の合成済みハングル音節 (合計 11172 個のうち、旧式の jamo を使用するものは除く) に対してのみコードを割り当て、その他の音節には 8 バイトの合成シーケンスを使用する必要があるという欠点があるが、これは標準の一部実装ではサポートされていない。[4]
Johabエンコーディング(1992年版の標準の付録3に規定)と、統一ハングルコード(UHC、Windows-949とも呼ばれる)として知られるEUC-KRスーパーセットは、11172のハングル音節すべてに単一のコードを提供します。[ 7] [6] ISO-2022-KRとJohabはほとんど使用されていません。一部のオペレーティングシステムでは、この標準を他の非統一的な方法で拡張しています。たとえば、古典的なMac OSのEUC-KR拡張MacKoreanや、IBMのIBM-949などです。
ハングルフィラー
ハングルフィラー文字は、8バイトのハングル合成シーケンス[8] [9]を導入するために使用され、そのようなシーケンス内の欠落した要素(通常は空の末尾)の代わりに使用されます。[9]
Unicode は、ラウンドトリップ互換性のために、Wansung コードの Hangul Filler をHangul Compatibility Jamoブロックに含めていますが、ハングルの合成には独自のシステム(独自の、異なる用途のフィラー文字を使用) を使用しています。KS X 1001 ハングル合成システムは Unicode では使用されず、フィラーは単なる空白として表示されます。現代の jamo を使用した KS X 1001 合成シーケンスは、Unicode の合成済み文字にマッピングされる場合があります。[9]これは通常、 Unified Hangul Codeでは行われません。
往復互換性のために、Unicode には、半角および全角フォームブロックに N バイトのハングル コード ハングル フィラーが「半角ハングル フィラー」という名前で個別に含まれています。
ワンソンコードチャート
以下は、Wansung レイアウトの KS X 1001 のコード チャートです。16 進数のペアが指定されている場合、ISO-2022-KRで韓国語セットがシフトされている場合のように、GL (0x21-0x7E) でエンコードされるときは小さい方が使用され、 EUC-KRまたは UHCのように、GR (0xA1-0xFE) でエンコードされるより一般的な場合には大きい方が使用されます。Johabは、 11172 個のハングル クラスターすべてを個別に順番にエンコードするように配置を変更しています。
ベンダーの実装の違いを説明するために、一部の文字については複数の Unicode マッピングが示されています。Wansung プレーンへの Apple のHangulTalk拡張 (つまり、両方のバイトが 0xA1-0xFE の範囲にある) は示されていますが、他の HangulTalk 拡張範囲は示されていません。Unified Hangul Code の合成音節の追加コードとIBM-949の IBM 拡張も、どちらも Wansung プレーンの範囲外であるため示されていません。
リードバイト
非漢字非合成セット
行41と94はユーザー定義の目的で使用される場合があります。[10]
文字セット 0x21 / 0xA1 (行番号 1、特殊文字)
このセットには句読点やその他の記号が含まれますが、KS X 1003 にある句読点は除きます (これは行 3 に含まれています)。KS X 1001 とシングルバイト ASCII を組み合わせたエンコーディングでは、バックスラッシュに対して半角および全角形式ブロックへの代替 Unicode マッピングが使用される場合があります。波ダッシュ (チルダッシュ) の Unicode マッピングもベンダーによって異なり、U+301C (IBM および Apple が推奨) [11] [12] [13]または U+223C (Microsoft が推奨) [14] [15] の場合があります。JISの波ダッシュの類似しているが同じではない処理と、次の行のチルダの処理を比較してください。
バックスラッシュを除いて、以下に2つのマッピングが示されている場合、最初のマッピングはAppleによって使用され、2番目のマッピングはMicrosoftによって使用されます。[13] [15]
文字セット 0x22 / 0xA2 (行番号 2、特殊文字)
このセットには追加の句読点と記号が含まれています。前の行のチルダ文字と同様に、この行のチルダ文字にはAppleとMicrosoftで異なるマッピングが使用されています(AppleではU+02DC、MicrosoftではFF5E)。[13] [15]これは浮き出しチルダとして表示されることを意図していますが、前の行のチルダはダッシュの高さでインライン表示されることを意図しています。[10]丸で囲まれたドットのマッピングも異なります。[13] [15]
ユーロと登録商標記号は1998年に標準に追加され、韓国の郵便マーク(㉾)は2002年に追加されました。[1]これらの3つのコードポイントは、まだ使用されていないコードポイントと同様に、ベンダーによって他の非標準の目的で使用されています。たとえば、Appleのボックスリストマーカーなどです。[16] Microsoftは、ユーロ記号を含む1998年の追加を追加するために統合ハングルコードの実装を更新しましたが、標準に追加されたときに韓国の郵便マークは追加しませんでした。[17]
文字セット 0x23 / 0xA3 (行番号 3、基本ラテン文字 / ISO 646-KR)
このセットは、KS X 1003(韓国語のISO 646バリアント、 ASCIIに似たセット)に対応していますが、先頭に 0x23(または GR 呼び出し (EUC) 形式では 0xA3)が付いた 2 バイト コードです。これには、英語のアルファベット/基本ラテン アルファベット、西洋のアラビア数字、句読点が含まれます。
JIS X 0201のローマ字セットと比較すると、ウォン記号ではなく円記号が含まれている点が異なります。 ISO 646 レイアウトに従いますが、文字と数字のみを含む KPS 9566 の3 行目とJIS X 0208 の3 行目を比較してください。
EUC-KR や UHC などのエンコーディングは、KS X 1001 をシングルバイト ASCII または KS X 1003 と組み合わせるため、これらの文字の 2 バイト表現には 半角および全角フォームブロックへの代替 Unicode マッピングを使用します。
文字セット 0x24 / 0xA4 (行番号 4、ハングル文字)
このセットには、韓国の照合慣習に従って並べられた現代のハングルの子音、それに続く母音、そして廃止された子音が含まれています。これらの文字は個別に使用された場合、Unicodeハングル互換字母ブロックにマッピングされ、ハングル字母ブロックの位置固有の文字と 1 対 1 でマッピングされません。北朝鮮の KPS 9566 の行 4と比較してください。文字 04-52 はハングル フィラー (上記を参照) であり、シーケンスの結合に使用されます。
文字セット 0x25 / 0xA5 (行番号 5、ローマ数字とギリシャ語)
このセットにはローマ数字とギリシャ語アルファベットの基本的なサポートが含まれていますが、発音区別符号や最後のシグマは含まれていません。Appleはこの行にいくつかの追加の句読点と、行6から続く黒丸のリストマーカーをいくつか含めています。[16]
同じ文字が含まれていますが、レイアウトが異なる KPS 9566 の行 6と比較してください。
文字セット 0x26 / 0xA6 (行番号 6、ボックス描画)
この行には、セミグラフィックコンテキストでボックスを描画するための文字が含まれています。Appleは、黒丸で囲まれたリストマーカーもいくつか含めています。[16]
文字セット 0x27 / 0xA7 (行番号 7、単位記号)
この行には、複数の文字で構成される単位記号も含め、単一の文字として単位記号が含まれています。Appleは、行8の続きとして、丸で囲まれたリストマーカーもいくつか含めています。[16]
KPS 9566 の行 8に含まれる単位記号のレパートリーと比較対照します。
文字セット 0x28 / 0xA8 (行番号 8、拡張ラテン文字、丸付き、分数)
文字セット 0x29 / 0xA9 (行番号 9、拡張ラテン文字、丸付き、上付き文字と下付き文字)
文字セット 0x2A / 0xAA (行番号10、ひらがな)
このセットには日本語を書くためのひらがなが含まれています。Appleは9行目のものから続く括弧付きのリストマーカーもいくつか含めています。[16]
同じレイアウトを使用しているKPS 9566 の行 10 を比較してください。同じレイアウトを使用しているが行が異なる JIS X 0208 の行 4と比較対照してください。
文字セット 0x2B / 0xAB (行番号 11、カタカナ)
このセットには、日本語を表記するためのカタカナが含まれています。ただし、カタカナテキストで使用され、JIS X 0208の1行目に含まれる日本語の長母音記号は含まれていません。 [20] Appleは、9行目と10行目のマーカーに続く括弧付きのリストマーカーもいくつか含めています。[16]
同じレイアウトを使用しているKPS 9566 の行 11 を比較してください。同じレイアウトを使用しているが行が異なる JIS X 0208 の行 5と比較対照してください。
文字セット 0x2C / 0xAC (行番号 12、キリル文字)
このセットには現代のロシア語のアルファベットが含まれており、キリル文字の他の形式を表現するのに必ずしも十分ではありません。Appleは黒枠のリストマーカーもいくつか含めています。[16]
同じレイアウト(ただし行は異なる)を使用している KPS 9566 の行 5とJIS X 0208 の行 7を比較します。
拡張文字セット 0x2D / 0xAD (行番号 13、Apple 追加句読点)
あらかじめ作成されたハングル文字セット(行番号 16 から 40)
合成済みハングルのコード ポイントは、コード ポイント 16-01 から 40-94 までの連続したソートされたブロックに含まれています。この範囲には、すべての可能な音節クラスターが含まれているわけではありません。KPS 9566 のさまざまな順序と可用性を比較してください。
뢨、썅、쏀、쓩、쭁 などの頭文字+母音+末尾の音節は含まれていますが、それらの頭文字+母音に対応する 뢔、쌰、쎼、쓔、쬬 は含まれていません。入力メソッドは、頭文字+母音+末尾の音節に到達するために、最初に頭文字+母音の音節を通過する必要があるため、入力時に問題が発生する可能性があります (例: ㅎ → 하 → 한)。
ここにリストされていないものは、8 バイトの構成シーケンスを使用して表すことができます。その他のすべての現代字母クラスターには、UHC によって別の場所でコードが割り当てられています。すべての可能な現代字母クラスターには、Johab によってコードが割り当てられています。
jamoによる統計
漢字セット(行番号42~93)
KS X 1001 は、複数の読み方を持つ複数の漢字を複数回エンコードします。1 つの文字「樂」は 4 回エンコードされます。CJK互換表意文字ブロックの最初の 268 文字 (U+F900–U+FA0B) は、これらの重複に対応します。
以下の表では、各漢字の最初の行セルの値 (および読み方) はCJK 統合表意文字ブロックにマッピングされ、その他は CJK 互換表意文字ブロックにマッピングされます。
Johab エンコーディング

- 한글 : ハングル
- 한자 : 漢字
- 특수문자 : 特殊文字 (非ハングル文字および非漢字文字)
KS X 1001 は、1992 年以降、Johab と呼ばれる代替エンコードも定義しています。これは、ハングルの音節を 3 つの 5 ビット値のシーケンスとして表し、2 つの8 ビット バイトに分割し、最上位ビットを先頭とします。先頭バイトの最上位ビットは常に設定されます (シングルバイトASCIIまたは KS X 1003 との組み合わせが可能)。このエンコードは、KS X 1001 の行 4 の現代字母にも使用され、他のコンポーネントにはフィラー値が使用されます。ハングルの Johab エンコードを次の表に示します。[22]
JohabはKS X 1001の残りの部分を、先頭の字母に対応しないリードバイト(ハンジャの場合は0xE0~0xF9、ハングル音節と現代の字母を除く非ハンジャの場合は0xD9~0xDE [23] )と、0x31~0x7Eと0x91~0xFEの範囲の末尾バイトを使用してエンコードします。 [22]これらのコードは、文字のKS X 1001コードポイントからアルゴリズム的にマッピングされ、[23]リードバイトごとに2つのKS X 1001行があります( Shift JISと比較してください)。

ASCII ベースの Johab エンコーディングは、 Microsoft によってコード ページ 1361と番号付けされています。[24]ベンダー定義の Johab バリアントも存在します。たとえば、IBM はEBCDICのシフト アウトセットとして使用するために 1 つを定義しています。このバリアントは、シフト インとシフト アウトを使用してシングル バイトの EBCDIC ページと Johab を切り替え、非ハングル文字に異なるエンコーディングを使用し (異なるレイアウトで先頭バイト 0x40~6C を使用)、先頭バイト 0xD4~DD をユーザー定義領域として使用しますが、シフト アウト状態のハングル文字には 1992 年標準と同じ Johab レイアウトを使用します。[25] IBM は EBCDIC ベースのステートフル Johab エンコーディングをコード ページ 1364 と番号付けし、[25]そのエンコーディングのサブセット (ハングル文字は少ないが同じレイアウト) をコード ページ 933として定義しています。[26]
SamsungやGoldStar (現在のLG )などの他のベンダーは、5 ビット コードから jamo へのマッピングが以下とは異なる他の「Johab」エンコーディングを使用していました。その結果、1992 年の標準 Johab と互換性がなくなりました。[af]以下の表は、1992 年の標準と IBM の使用法に対応しています。
Nバイトハングルコード
これはNバイトのハングルコードであり、[5] KS C 5601-1974およびKS C 5601–1992の付録4で指定されています。IBMのコードページ1040の後半[27]はこれのスーパーセットであり、文字¢¬\~(ただし、ではない)をコードページ1041£と同じ場所に割り当てる一方、拡張されていないNバイトのハングル( IBM-1040と共有される、一部の使用コンテキストでのC0制御コード置換グラフィックスを除く)はコードページ891です。[28]文字0x40/0xC0はハングルフィラー(上記参照)であり、シーケンスを組み合わせるために使用されます。
日本のJIS C 6220 (JIS X 0201)と同様に、Nバイトハングルコードは、0x40から0x7Cの範囲の文字割り当てを持つ7ビットエンコーディングとして使用できます。 [ 5]以下の表は、コードページ891や1040などで使用されている、上位ビットが設定された(つまり、0xC0から0xFCを超える)8ビット環境のコードを示しています。
脚注
- ^ ギリシャ語の発音区別符号と末尾のシグマが欠落しています。
- ^ 長音譜、心字体、國字を欠落。
- ^ ab 小文字のåが欠落しているが、大文字のU+212B Å ANGSTROM SIGNは含まれており、 ØとÆの両方の場合も同様である。
- ^ 韓国語: 정보 교환용 부호계 (한글 및 한자) ; RR : チョンボ ギョファンニョン ブホゲ (ハングルと漢字)
- ^ ab ISO 2022互換の94 n文字セットとして、プレーンスペースと削除文字は常に、それぞれ0x20と0x7F(0xA0と0xFFではない)のシングルバイトコードとして使用できます。
- ^ abcdefghi AppleによってASCII数字、結合四角形U+20DE、および私用文字U+F87Cのシーケンスにマッピングされました。[16]ここに示されている外観はシミュレートされています。
- ^ abcdefghijk Appleによって、 角括弧で囲まれた数字の前に私用文字U+F863が付いたASCIIシーケンスにマッピングされています。 [16]ここで示されている外観はシミュレートされています。
- ^ 0xA2D2 より狭い。Apple は往復の目的で私用文字 U+F87F を追加します。
- ^ 2 本の縦線で、右側の線が太い。Apple はこれを通常の 2 本縦線 U+2016 (‖) と私用文字 U+F87B にマッピングして往復処理を行っています。ここでは意図した外観を反映するために U+1D102 が表示されています。
- ^ 2 本の縦線で、左側の線が太い。Apple はこれを通常の 2 本の縦線 U+2016 (‖) と私用文字 U+F87C にマッピングして往復処理を行っています。ここでは意図した外観を反映するために U+1D103 が表示されています。
- ^ 文字セルの左下に揃えられた、水平方向の使用のための変形。AppleはこれをU+FF01+F874にマッピングします。ここで、U+F874は、ラウンドトリップの目的でAppleが文字にタグを付けるために使用する私用文字です。 [16]最近では、[18]このフォームに標準化された変形シーケンスが追加され、変形セレクタ1(U+FE00)が追加されました。[19]
- ^ 文字セルの左下に揃えられた、水平方向の使用のための変形。AppleはこれをU+3002+F87Dにマッピングします。ここで、U+F87DはAppleがラウンドトリップの目的で文字にタグを付けるために使用する私用文字です。 [16]最近では、[18]このフォームに標準化された変形シーケンスが追加され、変形セレクタ1(U+FE00)が追加されました。[19]
- ^ ab 重複。ラウンドトリップのためにAppleによってマッピングされ、私用文字U+F87Fが追加された。 [16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3257+F87Aにマッピングしており、U+F87Aは私用文字、U+3257は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3258+F87Aにマッピングしており、U+F87Aは私用文字、U+3258は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3259+F87Aにマッピングしており、U+F87Aは私用文字、U+3259は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+325A+F87Aにマッピングしており、U+F87Aは私用文字、U+325Aは塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3251+F87Aにマッピングしており、U+F87Aは私用文字、U+3251は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3252+F87Aにマッピングしており、U+F87Aは私用文字、U+3252は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3253+F87Aにマッピングしており、U+F87Aは私用文字、U+3253は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3254+F87Aにマッピングしており、U+F87Aは私用文字、U+3254は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3255+F87Aにマッピングしており、U+F87Aは私用文字、U+3255は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ Unicodeには完全一致は存在しないが、模擬的に表示されている。AppleはU+3256+F87Aにマッピングしており、U+F87Aは私用文字、U+3256は塗りつぶされていない丸で囲まれた文字である。[16]
- ^ abcdefghij AppleによってASCIIシーケンスにマッピングされ、私用文字U+F862がプレフィックスとして付けられます。[16]
- ^ abcdefghi AppleによってASCII数字、結合四角形U+20DE、および私用文字U+F875のシーケンスにマッピングされています。[16]ここに示されている外観はシミュレートされています。
- ^ abcdefghijk Appleによって、 角括弧で囲まれた数字の前に私用文字U+F866が付いたASCIIシーケンスにマッピングされています。 [16]ここで示されている外観はシミュレートされています。
- ^ abcd これらは1行目の文字とほぼ重複している。Appleはこれを「長い」バージョンと表現し、ラウンドトリップの目的で私用文字U+F879を付加している。 [16]
- ^ abcd MacKoreanエンコーディングには、KS X 1001プレーン範囲外の、異なるスタイルの矢印(白矢印を含む)のセットもいくつか含まれており、先頭バイトは0xA8と0xAC、末尾バイトは0x41と0xA0の間です。Appleは、ラウンドトリップの目的で、この特定の白矢印セットに私用文字U+F878を付加しています。[16]
- ^ ab 1行目のものと異なり、これら2つのマークは低い位置に表示されることを意図している(U+301Fと同様)。Appleはこれらを区別するために私用文字U+F873を付加している。[16]
- ^ AppleはこれをU+21E7+F87Fにマッピングしており、U+21E7は白い上矢印[16]で、U+F87Fは私用文字であるが、この文字は黒い矢印である。[21]示されている文字は、Appleのマッピングテーブルより後のUnicode文字であり、このMacKorean文字のグリフ[21]に似ている。
- ^ AppleはこれをASCIIの感嘆符の後に 私用文字U+F87Fが続くシーケンスにマッピングしています。 [16]
- ^ これらのエンコーディングのマッピングはここで入手できます。
- ^ abcdこれを使用すると、 C0 制御コード範囲内のトレイル バイトが生成されます。
- ^ abcd これを使用すると、ASCII の 0x2_ 行と 0x3_ 行にトレイル バイトが残ります。Johab は、一般的な従来の CJK エンコーディングのほとんどと同様に、トレイル バイトに 0x2_ 行を使用しません ( Shift JIS、GBK、Big5と比較)。EBCDIC ベースの Johab バージョンでは、どちらの行のトレイル バイトも EBCDIC 制御コード範囲内にあるため使用されません。
参考文献
- ^ abcde Lunde, Ken (2009). 「第3章: 文字セット標準」CJKV 情報処理. 「O'Reilly Media, Inc.」 pp. 143–148. ISBN 978-0596514471。
- ^ abcdef Hwang, Jinsang (2005). ICT 標準の社会的形成: 韓国における国家コード化文字セット標準論争の事例(PDF)。エディンバラ大学。
- ^ abc Lunde, Ken (1995-12-18). 「2.4.6: 廃止された標準」. CJK.INF バージョン 1.9.
- ^ ab Shin, Jungshik. 「KS X 1001(KS C 5601) およびその他のハングルコードとは何ですか?」韓国のハングルとインターネットに関する FAQ。
- ^ abcd ケン・ルンデ(1995-12-18)。 「3.3.6: Nバイトハングル」。 CJK.INF バージョン 1.9。
- ^ ab 「情報: ハングル (韓国語) 文字セット」、Microsoft サポート、Microsoft
- ^ ab Zsigri, Gyula (2002-06-18). 「KSC と UHC」。
- ^ Chang, Hye-Shik (2021年11月28日). 「cpython/Modules/cjkcodecs/_codecs_kr.c (リビジョン d3faf43)」. cPythonソースツリー. Python Software Foundation.
- ^ abc Chung, Jaemin (2017-03-30). U+3164 HANGUL FILLER に参考注釈を追加する提案(PDF)。Unicodeコンソーシアム。UTC L2/17-081。
- ^ ab 韓国標準局 (1988-10-01). 情報交換のための韓国語グラフィック文字セット(PDF) . ITSCJ/ IPSJ . ISO-IR -149.
- ^ "ibm-1363_P110-1997 (リードバイト A1)"。ICU デモ - コンバータ エクスプローラ。International Components for Unicode / Unicode Consortium。
- ^ "euc-kr (リード バイト A1)"。ICU デモ - コンバータ エクスプローラ。Unicode の国際コンポーネント。
- ^ abcd 「Mac OS の韓国語エンコードから Unicode 3.2 以降へのマップ (外部バージョン)」。Apple。
- ^ "windows-949-2000 (リードバイト A1)"。ICU デモ - コンバータ エクスプローラ。International Components for Unicode / Unicode Consortium。
- ^ abcd 「リードバイト A1-A2 (コードページ 949)」。MSDN。Microsoft。2008年 2 月 6 日。
- ^ abcdefghijklmnopqrstu vwxyz aa ab ac ad ae Apple (2005-04-05). 「Mac OS の韓国語エンコードから Unicode 3.2 以降へのマップ (外部バージョン)」. Unicode Consortium .
- ^ "windows-949-2000 (リードバイト A2)". ICU デモ - コンバータ エクスプローラー. International Components for Unicode / Unicode Consortium .
- ^ ab Lunde, Ken (2018-01-21). 「全角東アジア句読点の標準化された変化シーケンスを追加する提案」(PDF) UTC L2 /17-436。
- ^ ab 「StandardizedVariants.txt: 標準化されたバリエーションシーケンス」。Unicode文字データベース。Unicodeコンソーシアム。
- ^ Lunde, Ken (2009). 「Seemingly Missing Characters」. CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . p. 180. ISBN 978-0-596-51447-1。
- ^ ab Lunde, Ken (2009). 「付録 E: ベンダー文字セット標準」(PDF) . CJKV 情報処理: 中国語、日本語、韓国語、ベトナム語コンピューティング(第 2 版).セバストポル、カリフォルニア州: O'Reilly . ISBN 978-0-596-51447-1。
- ^ abc Lunde, Ken (2008). 「第4章: エンコード方式 (§ Johab エンコード—KS X 1001:2004)」CJKV 情報処理(第2版)セバストポル、カリフォルニア州: O'Reilly Media pp. 268–273. ISBN 978-0-596-51447-1。
- ^ ab Shin, Jungshik (2011-10-14) [1999-08-16]. JohabからUnicodeへの表. Unicodeコンソーシアム.
- ^ 「コード ページ識別子」。Windowsデベロッパー センター。Microsoft。2021 年 1 月 7 日。
- ^ ab "ibm-1364_P110-2007". International Components for Unicode . Unicode Consortium .
- ^ "ibm-933_P110-1995". International Components for Unicode . Unicode Consortium .
- ^ 「コード ページ 01040」(PDF)。IBM。2015年 7 月 8 日時点のオリジナルよりアーカイブ(PDF) 。
- ^ 「コード ページ 00891」(PDF)。IBM。2015年 7 月 8 日のオリジナルからアーカイブ(PDF) 。
- ^ "KSRI-87-37-IR: 한글·한자 코드 표준화에 관한 연구: ハングルコードと漢字コードの標準化に関する研究" (PDF) (韓国語)。科学技術省。 1987.p. 68. 2019 年 3 月 1 日のオリジナル(PDF)からアーカイブされました。
外部リンク
- KS X 1001(KS C 5601)やその他のハングルコードとは何ですか?
- クロスロケール CJKV コード変換の実装 (Ken Lunde 著)
- Wansung および Johab エンコーディングの Unicode マッピング テーブル:
- IBM コード ページ 970 (Wansung、EUC-KR 形式)
- Windows コード ページ 949 (統一ハングル コード / 拡張万声)
- Windows コード ページ 1361 (Johab、ASCII ベース バージョン)
- IBM コード ページ 1364 (Johab、EBCDIC ベース バージョン)
