JIS X 0201 8ビットコードページ | |
| MIME / IANA | 8 ビット: JIS_X02017 ビットローマ字: JIS_C6220-1969-ro7 ビットカナ:JIS_C6220-1969-jp |
|---|---|
| 別名 | JIS C 6220 8 ビット: csHalfWidthKatakanaローマ字: ISO646-JP、 iso-ir-14カナ: iso-ir-13、x0201-7 |
| 言語 | 日本語(基本的なサポート)、英語 |
| 標準 | JIS X 0201:1969 |
| 分類 | ISO 646、拡張ISO 646 |
| 先行する | 和文コード、JIS C 0803 |
| 後継者 | シフトJIS |
| その他の関連エンコーディング | Nバイトのハングルコード |
JIS X 0201は 1969 年に開発された日本工業規格で、広く使用されるようになった最初の日本の電子文字セットです。この文字セットは、JIS カテゴリ改正以前はJIS C 6220として知られていました。その 2 つの形式は 7 ビット エンコーディングと 8 ビット エンコーディングですが、Unicode (特にUTF-8 ) に置き換えられるまでは 8 ビット形式が主流でした。この規格の正式名称は、情報交換用の 7 ビットおよび 8 ビットのコード化文字セット( 7ビット及び8ビットの情報交換用記号化文字セット) です。
最初の96文字コードはISO 646のバリアントで構成され、一部違いはあるものの、ほぼASCIIに準拠しています。一方、次の96文字コードは日本語のカタカナ表記を表しています。このエンコーディングではひらがなや漢字を表現する方法がないため、簡体字日本語のみを表現できます。しかしながら、この簡体字でも日本語のあらゆる音を表現することが可能です。1970年代には、テキストモードのコンピュータ端末、電報、領収書、その他の電子的に処理されるデータなどの媒体において、この簡体字表記は許容範囲内でした。
JIS X 0201 は、この規格とJIS X 0208を組み合わせたShift JISなどの後続のエンコーディング、そして後にUnicodeに取って代わられました。
国際電話電信諮問委員会(CCITT)は、5ビットのラテン文字コードである国際電信アルファベットNo.2(ITA2)コードを国際標準として導入しました。ほとんどの国は、これを基にした独自の国内標準を持っています。日本では、産業技術総合機構(AIST)が、カタカナ文字と組み合わせたJIS C 0803-1961(テレプリンタのキーボードレイアウトとコード)の6ビット文字コードとして標準化しました。しかし、文字マップが小さく、コードレイアウトが実用的でないため、業界の要求を満たしていませんでした。AISTは、日本で使用されているさまざまなコードに代わる実用的な文字エンコーディングを検討しました。[ 1 ]
1963 年、ISO はISO R 646 (情報処理交換のための 6 ビットおよび 7 ビット符号化文字セット)の草案を発表しました。AIST は ISO R 646 とカタカナ マッピングの組み合わせを日本情報処理学会(IPSJ) に委ねました。IPSJ はコード標準化委員会を設立しました。委員会は、カタカナ セットが文字マップに収まらないため、ISO の草案の 6 ビット形式を採用しませんでした。初期の JIS 草案では、小さなカタカナ文字がそれぞれの通常のカタカナ文字の隣にマッピングされていました。これは、五十音順 (JIS X 0208:1978 はこの順序を採用) でソートするのに便利だと考えられていました。一部の委員会メンバーは、通常のカタカナ文字のみを扱うキーボードのメカニズムを複雑にするとして批判しました。後の草案では、小さなカタカナ文字が位置0xA7-0xAFにマッピングされました。
1964 年の ISO ドラフトでは、 0x24と0x5c の位置を各国が割り当てる第 1 および第 2 の通貨記号用に予約しましたが、国際通信ではローカライズ可能な通貨記号 (送信者と受信者が同じコードポイントに対して異なる記号を見る可能性がある) を使用することは危険すぎると考えられました。ISO 委員会には、汎用通貨記号(¤) を使用するか、ドル($) とポンド(£) の記号に恒久的な割り当てを与えるかの 2 つの選択肢がありました。ドル記号は位置0x24に、ポンド記号は位置0x23に割り当てられることが合意されました。後者は、ポンド記号を必要としない国では不要でした。[ 2 ] JIS 委員会は、円記号(¥) を0x5c (各国使用位置の 1 つ)に配置することを決定しました。
JIS C 6220(情報交換用コード、情報交換用シンボル)は1969年に発行されました。1987年のJIS区分改正により番号がJIS X 0201に変更され、1990年版では情報交換用7ビットおよび8ビット符号化文字セット(7ビット及び8ビットの情報交換用記号化文字セット)に名称が変更されました。
JIS X 0201の文字セットは日本で広く使用されていました。日本最大の資金移動システムである全国銀行データ通信システムは1973年に設立されました。銀行間の取引メッセージにはJIS X 0201のサブセットが使用されていました。このシステムは2018年まで使用されていましたが、ひらがなや漢字を扱えるZEDI(全銀EDIシステム)に置き換えられました。[ 3 ] 1978 年に、ひらがなと漢字を表現するために JIS C 6226 ( JIS X 0208 ) 2 バイト文字セットが開発されました。これにはカタカナ文字が含まれますが、そのコードとレイアウトは JIS X 0201 とは異なります。コンピュータメーカーは、JIS X 0201 との互換性を維持するために、JIS X 0208 の独自の拡張を開発しました。1982 年に、Microsoft の漢字エンコーディング方式 ( MS-DOSのコードページ 932 ) とDigital Researchの SJC26 (日本語CP/M-86用) が、文字のシフトアウトやシフトインなしで JIS X 0201 のシングルバイトエンコーディングと JIS X 0208 のダブルバイトエンコーディングを組み合わせるために開発されました。[ 4 ]これらはShift JISと呼ばれ、パーソナルコンピュータの業界標準となりました。


JIS X 0201 の前半 (ローマ字セット) はISO 646の日本語版で、バックスラッシュ(\) とチルダ(~)を円(¥) とオーバーライン(‾)に置き換えたASCIIに相当し、 [ 5 ]後半 (かなセット) は主にカタカナで構成されています。制御文字はJIS X 0211で規定されています。
7 ビット形式では、シフトアウト制御文字0x0Eでかなセットに切り替わり、シフトイン(0x0F) でローマ字セットに切り替わります。[ 6 ] [ 7 ]下の表に示す 8 ビット形式では、最上位ビットがセットされているバイト (つまり0x80 – 0xFF ) がかなセットに使用され、セットされていないバイト (つまり0x00 – 0x7F ) がそれ以外の場合に使用されます。
7 ビット ローマン セットに特有の名称としては、「JISCII」[ 8 ]、「JIS Roman」[ 9 ]、「ISO646-JP」[ 10 ] [ 11 ]、「JIS C6220-1969-ro」[ 11 ] [ 10 ] 、 「Japanese-Roman」[ 12 ] 、 「Japan 7-Bit Latin」[ 13 ] 、および「ISO-IR-14」[ 10 ] [ 11 ] [ 7 ]があるのに対し、7 ビット カナ セットに特有の名称としては、「ISO-IR-13」[ 6 ] [ 10 ] [ 11 ]、「JIS C6220-1969-jp」[ 10 ] [ 11 ]、および「x0201-7」[ 10 ] [ 11 ]がある。
円記号をバックスラッシュに置き換えると、日本語をサポートするDOSおよびWindowsベースのコンピュータでパスが「C:¥Program Files¥」のように奇妙に表示されることがあります。[ 14 ]同様の別の問題は、C プログラミング言語の文字列リテラルの制御文字ですprintf("Hello, world.¥n");。
以下の表は、JIS X 0201 のオリジナルの 8 ビット符号化文字セットです (最上位ビットがセットされたバイトでカナセットを示します)。[ 15 ] [ 16 ]
以下はShift JISの一部として使用されるJIS X 0201のマッピングです[ 17 ] [ 18 ]。つまり、JIS X 0201の8ビット形式を示し、カタカナ文字を半角形と全角形のブロックにマッピングします(このブロックは、JIS X 0201から半角形レイアウトを派生しています)。
基本的なISO-2022-JPプロファイルでは、JIS X 0201 のかなセットは許可されておらず、ローマ字セットとJIS X 0208のみが許可されています (ただし、ISO 2022 / JIS X 0202 自体は許可しています)。したがって、JIS X 0201 のカタカナ (または同じレイアウトを使用する Unicode の半角かな) を ISO-2022-JP に変換する場合、次のマッピングまたは変換がよく使用されます。[ 20 ]これにより、かなを JIS X 0208 に変換できます。
理論的には、このマッピングは同様に正しい。JIS X 0201自体は表示幅を規定していないが、実際には(特に2文字間隔の環境では)JIS X 0201は半角カタカナに使用される。
上記の表との比較を容易にするため、JIS X 0201カタカナエンコーディングにおける最上位ビットをセットしたマッピングを以下に示します。
コードページ 897は、 IBMによる 8 ビット形式の JIS X 0201 の実装です。C0 制御文字領域にはいくつかの追加のグラフィック文字が含まれており、問題のコードポイントは、コンテキストに応じて制御文字またはグラフィック文字として使用できます[ 23 ]。概念的にはOEM-USと似ていますが、グラフィック文字が異なります。C0 行を以下に示します。IBM は、これらの制御コード置換のない純粋な 8 ビット JIS X 0201 をコードページ 1139と指定しています。[ 24 ]これらの C0 置換グラフィックのより小さなサブセット ( 0x01–06、0x10、0x15–17、0x19のボックス描画文字と0x1B–1Fの線/矢印文字のみを含む) を含む別のバリアントで、 0x1Cで異なるスタイルの上向き矢印 ( U+21E7 ⇧上向きの白い矢印)を使用しているものが、コード ページ 1086と指定されています。[ 25 ]
IBM は、JIS X 0201 の 7 ビット ローマン セットをコード ページ 895 [ 31 ]として、またISO 2022またはEUC-JPコード セットとして使用するために7 ビット カナ セットをコード ページ 896として実装しています。コード ページ 896 は、標準の JIS X 0201 割り当てに加えて、以下に示す 5 つの追加の割り当てを定義します。[ 32 ]これらの拡張文字の使用は、関連するCCSID 896では許可されていませんが[ 33 ] 、代替の CCSID 4992 では許可されています。[ 34 ]
IBMのコードページ1041はコードページ897の拡張版で、これらの5つのIBM拡張文字[ 35 ]をShift JISと互換性のある代替位置(それぞれ0x80、0xA0、0xFD、0xFE、0xFF)にエンコードしています。[ 36 ]別の拡張8ビットJIS X 0201実装であるコードページ911(コードページ1086と同じC0置換グラフィックスを使用)は、8ビットセットのコードページ896と同様に、ポンド(スターリング)記号(£)を0xE1にエンコードしますが、セント記号(¢)を0xE2に、否定記号(¬ )を0xE3にエンコードしている点で異なります。[ 37 ]
IBM のコード ページ 903 は、簡体字中国語エンコーディングの 1 バイト コンポーネントとして使用するためにエンコードされており、 [ 38 ]繁体字中国語エンコーディングで使用されるASCIIベースのコード ページ 904に付属しています。[ 39 ] [ 40 ]それにもかかわらず、コード ページ 903 は ISO 646-JP / JIS X 0201 のローマ字部分に従っており、ASCII バックスラッシュ0x5C (GB 1988 / ISO 646-CNのASCII ドル記号0x24ではなく) を円/元記号に置き換えています。また、コード ページ 897 と同じ C0 置換グラフィックを使用しています。[ 41 ]コード ページ 1042 は、コード ページ 903 を拡張し、 0x80にポンド (スターリング) 記号、コード ページ 1041 の位置に否定記号、バックスラッシュ、チルダを追加します。[ 42 ]