| 標準 | 8859 国際標準化機構 |
|---|---|
| 分類 | 8ビット拡張ASCII、ISO/IEC 4873レベル1 |
| 拡張 | アスキー |
| 先行 | 646 規格 |
| 後継者 | ISO/IEC 10646 (ユニコード) |
| その他の関連エンコーディング | ISO/IEC 10367、Windows-125x |
ISO/IEC 8859は、 8ビット文字エンコーディングに関するISOとIECの共同規格シリーズである。この規格シリーズは、ISO/IEC 8859-1、ISO/IEC 8859-2などの番号付きパートで構成される。廃止されたISO/IEC 8859-12を除いて15のパートがある。[1]この規格シリーズを維持していたISOワーキンググループは解散した。
ISO/IEC 8859 パート 1、2、3、および 4 は、もともとEcma International規格ECMA-94でした。
導入
95 個の印刷可能な ASCII文字のビット パターンは、現代の英語で情報をやり取りするのに十分ですが、ラテン アルファベットを使用する他のほとんどの言語では、ASCII でカバーされていない追加の記号が必要です。ISO/IEC 8859 は、8 ビットバイトの 8 番目のビットを使用して、さらに 96 個の印刷可能な文字を配置できるようにすることで、この問題を解決しようとしました。初期のエンコードは、一部のデータ転送プロトコルの制限と、部分的には歴史的な理由により、7 ビットに制限されていました。ただし、単一の 8 ビット文字エンコードに収まるよりも多くの文字が必要になったため、さまざまなラテン アルファベットに適した少なくとも 10 個を含む複数のマッピングが開発されました。
ISO/IEC 8859 標準部分では印刷可能な文字のみが定義されていますが、ISO/IEC 4873に従って、バイト範囲 0x00~1F および 0x7F~9F を「グラフィック文字を表さない組み合わせ」(つまり、制御文字として使用するために予約されている)として明示的に区別しています。これらは、 ISO 6429やISO 6630など、これらのバイトに関連付けられた制御機能を定義する別の標準と組み合わせて使用するように設計されています。[2]この目的のために、 IANAに登録されている一連のエンコードでは、ISO 646のC0制御セット(バイト 0 ~ 31 にマップされた制御文字)とISO 6429 のC1制御セット(バイト 128 ~ 159 にマップされた制御文字)が追加され、ほとんどのバイト(すべてではないにしても)が割り当てられた完全な 8 ビット文字マップが作成されます。これらのセットには、ISO-8859- nが優先MIME名として、または優先 MIME 名が指定されていない場合は正規名として設定されます。多くの人は、ISO/IEC 8859- nと ISO-8859- nという用語を同じ意味で使用しています。ISO /IEC 8859-11 にはこのような文字セットが割り当てられませんでした。これは、TIS 620とほぼ同じだったためと考えられます。
キャラクター
ISO/IEC 8859 規格は、タイポグラフィではなく、信頼性の高い情報交換を目的として設計されています。この規格では、オプションの合字、波引用符、ダッシュなど、高品質のタイポグラフィに必要な記号が省略されています。その結果、高品質のタイプセッティング システムでは、ASCIIおよび ISO/IEC 8859 規格に加えて独自の拡張機能や特異な拡張機能を使用するか、代わりにUnicode を使用することがよくあります。
実際の経験に基づく不正確な規則によれば、文字または記号が広く使用されているデータ処理文字セットの一部ではなく、国語のタイプライターのキーボードにも通常は用意されていない場合は、含まれません。したがって、一部のヨーロッパ言語で使用される方向性のある二重引用符「および」は含まれますが、英語やその他の言語で使用される 方向性のある二重引用符「および」は含まれません。
フランス語では、 œとŒの合字は 'oe' と入力できるため採用されなかった。同様に、大文字のテキストに必要なŸも廃止された。 [3] [4] [5]異なるコードポイントではあるものの、これら3つの文字は後に1999年にISO/IEC 8859-15で再導入され、新しいユーロ記号文字 € も導入された。同様に、オランダ語ではijとIJ の文字は採用されなかった。オランダ語話者はこれらを2つの文字として入力することに慣れていたためである。
ルーマニア語には当初、 Ș / șとȚ / ț (カンマ付き) の文字はありませんでした。これは、これらの文字が当初、 Unicode コンソーシアムによってŞ / şとŢ / ţ (セディーユ付き)に統合され、下部にカンマがある図形がセディーユ付きの図形のグリフ異体であるとみなされたためです。ただし、下部に明示的にカンマがある文字は後に Unicode 標準に追加され、 ISO/IEC 8859-16にも含まれています。
ISO/IEC 8859 エンコーディングのほとんどには、ラテン文字を使用するさまざまなヨーロッパ言語に必要な発音区別符号が用意されています。その他のエンコーディングには、ギリシャ語、キリル文字、ヘブライ語、アラビア語、タイ語などの非ラテン文字が用意されています。ほとんどのエンコーディングにはスペース文字のみが含まれていますが、タイ語、ヘブライ語、アラビア語のエンコーディングには結合文字も含まれています。
この規格では東アジア言語 ( CJK ) の文字については規定されていません。これは、これらの言語の表意文字体系が何千ものコード ポイントを必要とするためです。ラテン ベースの文字を使用していますが、ベトナム語も96 の位置に収まりません ( Windows-1258などの結合発音区別符号を使用しない場合)。日本語の各音節アルファベット (ひらがなまたはカタカナ、Kanaを参照) はJIS X 0201と同様に収まりますが、世界の他のいくつかのアルファベットと同様に、ISO/IEC 8859 システムではエンコードされていません。
ISO/IEC 8859の各部分
ISO/IEC 8859 は次のパートに分かれています。
ISO/IEC 8859 の各パートは、互いに借用することが多い言語をサポートするように設計されているため、各言語に必要な文字は通常、単一のパートで対応できます。ただし、転写なしでは対応できない文字と言語の組み合わせもあります。変換が可能な限りスムーズに行われるように努力しました。たとえば、ドイツ語では、7 つの特殊文字がすべてラテン語のすべての変種 (1 ~ 4、9、10、13 ~ 16) で同じ位置にあり、多くの位置では、文字はセット間で発音区別符号のみで異なります。特に、変種 1 ~ 4 は共同で設計されており、エンコードされたすべての文字が特定の位置に現れるか、まったく現れないかのいずれかであるという特性があります。
テーブル
割り当てられていないコード ポイント。
ISO/IEC 8859-7:2003およびISO/IEC 8859-8:1999バージョンに新しく追加されたもので、以前は割り当てられていなかったものです。
UnicodeとUCSとの関係
1991 年以来、Unicode コンソーシアムは ISO および IEC と連携して、Unicode 標準およびISO/IEC 10646: ユニバーサル文字セット(UCS) の開発に取り組んできました。ISO/IEC 8859 の新しいエディションでは、文字が Unicode/UCS 名とU+nnnn表記で表現されるため、ISO/IEC 8859 の各部分は実質的に、UCS の非常に小さなサブセットを 1 つの 8 ビット バイトにマッピングする Unicode/UCS 文字エンコード スキームになっています。Unicode および UCS の最初の 256 文字は、ISO/IEC-8859-1 ( Latin-1 )のものと同じです。
ISO/IEC 8859 の一部とその派生を含むシングルバイト文字セットは、1990 年代を通じて好まれ、十分に確立されており、ソフトウェアで実装しやすいという利点がありました。1 バイトが 1 文字に対応するという等式は単純で、ほとんどの単一言語アプリケーションに適しており、結合文字や異体形式はありません。Unicode 対応のオペレーティング システムが普及するにつれて、ISO/IEC 8859 やその他のレガシー エンコーディングの人気は低下しました。ISO 8859 とシングルバイト文字モデルの名残は、多くのオペレーティング システム、プログラミング言語、データ ストレージ システム、ネットワーク アプリケーション、ディスプレイ ハードウェア、エンド ユーザー アプリケーション ソフトウェアに定着していますが、ほとんどの最新のコンピューティング アプリケーションは内部的に Unicode を使用し、必要に応じて他のエンコーディングとの間で変換テーブルを使用しています。
現在の状況
ISO/IEC 8859 規格は、ISO/IEC 合同技術委員会 1、小委員会 2、作業部会 3 (ISO/IEC JTC 1/SC 2/WG 3) によって保守されていました。2004 年 6 月に WG 3 は解散し、保守業務はSC 2に移管されました。小委員会に唯一残っている作業部会であるWG 2 は、Unicode のユニバーサル コード化文字セットの開発に集中しているため、 この規格は現在更新されていません。
WHATWGエンコーディング標準は、 HTML5で許可され、準拠ブラウザがサポートしなければならない文字エンコーディングを規定しており、 [12] ISO/IEC 8859のほとんどの部分[13]が含まれていますが、パート1、9、11はそれぞれWindows-1252、Windows-1254、Windows-874として解釈されます。 [14]新しいページの作成者と新しいプロトコルの設計者は、代わりにUTF-8を使用するように指示されています。 [ 14 ]
参照
- 情報システム文字セット一覧
- 数字の形式
- RPL 文字セット(HP 電卓の ISO/IEC 8859-1 スーパーセット。「ECMA-94」とも呼ばれる)
- DEC 多国籍文字セット(MCS)
- DEC 国別置換文字セット(NRCS)
注記
- ^ Ǿやǿなど、アクセントのある母音がいくつか欠けています。これらは、あいまいさが増すという代償を払って、アクセントのない母音に置き換えることができます。
- ^ ISO 8859 エンコーディングでは、IJ は二重音字として扱われます。他のエンコーディングでは、文字として扱われます。
- ^ ab 欠落している文字は ISO/IEC 8859-15 にあります。
- ^ 1985 年版には ISO-8859-1 のバージョンのみが含まれています。
- ^ 1986年版では、まったく異なるエンコーディングであるKOI8-Eが定義されています。
- ^ 8859-5にはҐ/ґ の文字が欠けているが、この文字は 1990 年にウクライナ語のアルファベットに再導入された。
- ^ 1995年に出版、1996年に登録。[11]
参考文献
- ^ Chaudhuri, Arindam; Mandaviya, Krupa; Badelia, Pratixa; Ghosh, Soumya K. (2016-12-24)、「フランス語の光学式文字認識システム」、ソフトコンピューティングによるさまざまな言語の光学式文字認識システム、Cham: Springer International Publishing、pp. 109–136、doi :10.1007/978-3-319-50252-6_5、ISBN 978-3-319-50251-9、 2023-12-04取得
- ^ ISO /IEC JTC 1/SC 2/WG 3 (1998-02-12). DIS 8859-1 の最終テキスト、8 ビット 1 バイトコード化グラフィック文字セット - パート 1: ラテン アルファベット No.1 (PDF)。ISO / IEC FDIS 8859-1:1998; JTC1/SC2/N2988; WG3/N411。
コード化グラフィック文字のこのセットは、ISO/IEC 2022 または ISO/IEC 4873 レベル 1 に準拠した 8 ビット コードのバージョンと見なすことができます。[...] コード表の網掛けの位置は、グラフィック文字を表さないビットの組み合わせに対応します。これらの使用は ISO/IEC 8859 の範囲外であり、ISO/IEC 6429 などの他の国際標準で指定されています。
{{citation}}: CS1 maint: 数値名: 著者リスト (リンク) - ^ Haralambous, Yannis ( 2007年 9 月) 。Fonts & Encodings。Horne , P. Scott 訳 (第 1 版)。セバストポル、カリフォルニア州、米国: O'Reilly Media, Inc. pp. 37–38。ISBN 978-0-596-10242-5都市伝説によると、
標準が投票にかけられた日にフランス代表は病気で欠席しており、ベルギー代表に代理を務めてもらうしかなかったという。実際、フランス代表はエンジニアで、この合字は役に立たないと確信しており、スイスとドイツの代表は、Œとœが論理的に現れる位置に数学記号×と÷を入れるよう強く主張した。
- ^ アンドレ、ジャック (2003-10-15) [2003-10-02].アンドレ、バーナード。ジョルジュ・ルイ男爵。ブリュイヤール、エリック(編)。 「Histoire d'ā、histoire d'@ des rumeurs typographiques et de leurs enseignements」。テキストと文書の作成 INRP/GEDIAPS (フランス語): 19–34。 2016-12-08 のオリジナルからアーカイブ。2016 年 12 月 9 日に取得。
- ^ アンドレ、ジャック (1996 年 11 月)。 「ISO Latin-1、ヨーロッパの文字コードの標準? フランスの文字は欠席しています!」(PDF)。カイエ・グーテンベルグ(フランス語) (25): 65–77。 2008 年 11 月 30 日のオリジナル(PDF)からアーカイブされました。
- ^ エバーソン、マイケル。「提案された ISO 8859-12 (後の 14)」。
- ^ Czyborra, Roman (1997-10-12). 「ISO 8859 Alphabet Soup」。2000-08-17時点のオリジナルよりアーカイブ。(注: 古い Czyborra のページに「ケルト」の注記があります。)
- ^ Jarnefors, Olle (1996-04-11). 「ISO-8859-10; 新しい文字セット値の登録; MIME ドラフトのエラー」。Royal Institute of Technology (KTH)。2012-02-04 のオリジナルからアーカイブ。(注: IETF 文字セット メーリング リストで今後公開される「デーバナーガリ文字」標準部分に関する注意事項。)
- ^ 「ISO/IEC JTC 1/SC 2/WG 3 第 12 回会議の決議、イラクリオン-クレタ島、ギリシャ、1997 年 7 月 4 日、07」(PDF) 。イラクリオン-クレタ島、ギリシャ: ISO/IEC JTC 1/SC 2 N 2933、ISO/IEC JTC 1/SC 2/WG 3 N 401。1997 年 7月 4 日。2011 年 6 月 7 日にオリジナル(PDF)からアーカイブ。WG
3 は、文字の組み合わせに関する一般的な合意が得られ、さらに貢献が受け取られるまで、この主題に関するすべての活動を一時停止することを決議しました。
- ^ Czyborra, Roman (1998-12-01). 「ISO 8859 アルファベットスープ」。2016-03-20時点のオリジナルよりアーカイブ。(注: 新しい Czyborra ページに「ISCII」の注記があります。)
- ^ Lazhintseva, Katya (1996-05-03). 「新しい MIME 文字セットの登録: Windows-1257」. IANA.
- ^ 「8.2.2.3. 文字エンコーディング」。HTML 5.1 第 2 版。W3C 。ユーザー エージェントは、WHATWG エンコーディング標準で定義されているエンコーディングをサポートする必要があります。
これには、[...] が含まれますが、これに限定されません。
- ^ アン・ファン・ケステレン。 「レガシーシングルバイトエンコーディング」。エンコーディング標準。なんてことだ。
- ^ アブ ・ファン・ケステレン、アン。 「名前とラベル」。エンコーディング標準。なんてことだ。
さらに読む
- ISO/IEC 8859 の各パートの公開バージョンは、ISO カタログ サイトおよび IEC Web ストアから有料で入手できます。
- ISO/IEC JTC 1/SC 2/WG 3 にレビューと公開のために提出された ISO/IEC 8859 の一部の最終草案の PDF 版は、WG 3 の Web サイトで入手できます。
- ISO/IEC 8859-1:1998 - 8 ビット 1 バイト符号化グラフィック文字セット、パート 1: ラテン アルファベット No. 1 (1998 年 2 月 12 日草案、1998 年 4 月 15 日発行)
- ISO/IEC 8859-4:1998 - 8 ビット 1 バイト符号化グラフィック文字セット、パート 4: ラテン アルファベット No. 4 (1998 年 2 月 12 日草案、1998 年 7 月 1 日発行)
- ISO/IEC 8859-7:1999 - 8 ビット シングル バイト コード化グラフィック文字セット、パート 7: ラテン/ギリシャ語アルファベット(1999 年 6 月 10 日付ドラフト、2003 年 10 月 10 日発行の ISO/IEC 8859-7:2003 に置き換えられました)
- ISO/IEC 8859-10:1998 - 8 ビット 1 バイト符号化グラフィック文字セット、パート 10: ラテン アルファベット No. 6 (1998 年 2 月 12 日草案、1998 年 7 月 15 日発行)
- ISO/IEC 8859-11:1999 - 8 ビット シングル バイト コード化グラフィック文字セット、パート 11: ラテン語/タイ語文字セット(1999 年 6 月 22 日付ドラフト、2001 年 12 月 15 日発行の ISO/IEC 8859-11:2001 に置き換えられました)
- ISO/IEC 8859-13:1998 - 8 ビット 1 バイト符号化グラフィック文字セット、パート 13: ラテン アルファベット No. 7 (1998 年 4 月 15 日草案、1998 年 10 月 15 日発行)
- ISO/IEC 8859-15:1998 - 8 ビット シングル バイト コード化グラフィック文字セット、パート 15: ラテン アルファベット No. 9 (1997 年 8 月 1 日付の草案、1999 年 3 月 15 日発行の ISO/IEC 8859-15:1999 に置き換えられました)
- ISO/IEC 8859-16:2000 - 8 ビット シングル バイト コード化グラフィック文字セット、パート 16: ラテン アルファベット No. 10 (1999 年 11 月 15 日付草案、2001 年 7 月 15 日発行の ISO/IEC 8859-16:2001 に置き換えられました)
- ECMA標準は、ISO/IEC 8859 文字セット標準と厳密に一致するように意図されており、次の場所にあります。
- 標準 ECMA-94: 8 ビット 1 バイト符号化グラフィック文字セット - ラテン アルファベット No. 1 から No. 4第 2 版 (1986 年 6 月)
- 標準 ECMA-113: 8 ビット シングルバイトコード化グラフィック文字セット - ラテン文字/キリル文字アルファベット第 3 版 (1999 年 12 月)
- 標準 ECMA-114: 8 ビット シングルバイトコード化グラフィック文字セット - ラテン/アラビア文字アルファベット第 2 版 (2000 年 12 月)
- 標準 ECMA-118: 8 ビット 1 バイト符号化グラフィック文字セット - ラテン語/ギリシャ語アルファベット(1986 年 12 月)
- 標準 ECMA-121: 8 ビット シングルバイトコード化グラフィック文字セット - ラテン語/ヘブライ語アルファベット第 2 版 (2000 年 12 月)
- 標準 ECMA-128: 8 ビット シングルバイトコード化グラフィック文字セット - ラテン アルファベット No. 5第 2 版 (1999 年 12 月)
- 標準 ECMA-144: 8 ビット 1 バイト符号化文字セット - ラテン アルファベット No. 6第 3 版 (2000 年 12 月)
- ISO/IEC 8859-1 から Unicode へのマッピング テーブルは、プレーン テキスト ファイルとして Unicode FTP サイトにあります。
- ほとんどの ISO/IEC 8859 規格の非公式な説明とコード表は、ISO/IEC 8859 Alphabet Soup (Mirror) で入手できます。
