| 言語 | ベラルーシ語、ウクライナ語、ロシア語、ブルガリア語 |
|---|---|
| 分類 | 8ビットKOI、拡張ASCII |
| 拡張 | KOI8-B |
| に基づく | KOI8-U、KOI8-R |
| その他の関連エンコーディング | KOI8-E、KOI8-F |
KOI8-RU は、キリル文字を使用するロシア語、ウクライナ語、ベラルーシ語をカバーするために設計された8 ビットの文字エンコーディングです。これは、ロシア語とブルガリア語をカバーするKOI8-Rと密接に関連していますが、10 個のボックス描画文字を、大文字と小文字の両方でҐ、Є、І、Ї、およびЎの 5 つのウクライナ語とベラルーシ語の文字に置き換えます。これは、 Ў を含まないものの、それ以外は同じ文字の置き換えを行うKOI8-Uとさらに密接に関連しています。追加の文字割り当ては、 Ґ がKOI8-Fに追加されている点を除き、KOI8-Eと一致します。
IBMでは、KOI8-RUにコードページ/ CCSID 1167が割り当てられています。 [1] [2]
KOI8 は、あまり普及しなかったISO 8859-5よりもはるかに一般的に使用されています。もう 1 つの一般的なキリル文字エンコードはWindows-1251です。将来的には、どちらも最終的にUnicodeに取って代わられる可能性があります。
KOI8 は、 K od o bmena i nformatsiey、8 ビット(ロシア語: К од о бмена и нформацией、8 бит )の略で、「情報交換用のコード、8 ビット」を意味します。
KOI8 文字セットには、ロシア語のキリル文字が ISO 8859-5 のような自然なキリル文字のアルファベット順ではなく、擬似ローマ字順になっているという特性があります。これは不自然に思えるかもしれませんが、8 番目のビットを削除しても、通常の ASCII 端末で大文字と小文字を逆にした翻字でテキストを読み取る (または少なくとも解読する) ことができるという便利な特性があります。たとえば、KOI8-RU の "Код Обмена Информацией" は、 8 番目のビットを削除すると、 kOD oBMENA iNFORMACIEJ (頭字語 "KOI" のロシア語の意味) になります。
文字セット
次の表は KOI8-RU エンコーディングを示しています。各文字は、対応するUnicodeコード ポイントとともに表示されます。
- ^ abc Windows-1251と一致するように KOI8-R に対して変更されました。
- ^ abcdefgh KOI8-R を基準にしてKOI8-Uと一致するように変更しました。
- ^ abcdefgh KOI8-Eと一致するように KOI8-R に対して変更されました。
RFC 2319 では文字 0x95 は U+2219 (∙) である必要があるとされていますが、 Windows-1251の箇条書き文字と一致させるために U+2022 (•) になる場合もあります。
一部の参考文献には誤植があり、文字 0xB4 は正しい U+0404 ではなく U+0403 であると誤って記載されています。この誤植は RFC 2319 の付録 A にあります (ただし、RFC の本文の表には正しいマッピングが示されています)。
参照
参考文献
- ^ 「コード ページ 1167 情報ドキュメント」。2017 年 1 月 16 日時点のオリジナルよりアーカイブ。
- ^ 「CCSID 1167 情報文書」。2016 年 3 月 27 日時点のオリジナルよりアーカイブ。
- ^ Leisher, Mark (1999-12-20)、KOI8-RU ベラルーシ語/ウクライナ語キリル文字から Unicode 2.1 へのマッピング テーブル、KOI8RU.TXT
- ^ コード ページ CPGID 01167 (pdf) (PDF)、IBM
- ^ コードページ CPGID 01167 (txt)、IBM
外部リンク
- Nechayev, Valentin (2013) [2001]. 「8ビットキリル文字エンコーディングの世界のレビュー」。2016年12月5日時点のオリジナルよりアーカイブ。2016年12月5日閲覧。
