| テレマティクスサービス用のラテン語ベースのコード化文字セット | |
| 状態 | 有効 |
|---|---|
| 開始年 | 1984 |
| 最新バージョン | (09/92) 1992年9月 |
| 組織 | 国際電気通信連合 |
| 委員会 | 研究グループVIII |
| 関連規格 | T.61、ETS 300 706、ISO/IEC 10367、ISO/IEC 2022、ISO 5426 |
| ドメイン | エンコーディング |
| ライセンス | 無料で利用可能 |
| Webサイト | https://www.itu.int/rec/T-REC-T.51 |
| エイリアス |
|
|---|---|
| 標準 | |
| に基づく | ITU T.61 |
| その他の関連エンコーディング | |
T.51 / ISO/IEC 6937:2001、情報技術 - テキスト通信用コード化グラフィック文字セット - ラテンアルファベットは、 ASCII、より正確にはISO/IEC 646 -IRVのマルチバイト拡張です。[1]これは、 T.51という名前でテレマティクスサービス向けにITU-T(当時はCCITT )と共同で開発され、1983年に初めてISO標準になりました。特定のバイトコードは、分音記号付きの文字のリードバイトとして使用されます。リードバイトの値は、多くの場合、文字にどの分音記号が付いているかを示し、後続のバイトには分音記号が付いている文字のASCII値が入ります。
ISO/IEC 6937 の設計者は、 Hugh McGregor Ross、Peter Fenwick、Bernard Marti、Loek Zeckendorf です。
ISO6937/2 は、ラテンアルファベットを使用して、現代のヨーロッパ言語で見られる 327 文字を定義しています。キリル文字やギリシャ文字などの非ラテンヨーロッパ文字は、この標準には含まれていません。また、ルーマニアの カンマなど、ラテンアルファベットで使用される一部の発音区別符号も含まれておらず、当時はセディーユとカンマの区別がなかったため、代わりにセディーユが使用されています。
IANA は、この標準の 2 つの (古い) バージョン (および制御コード) に対して、文字セット名ISO_6937-2-25およびISO_6937-2-addを登録しました。ただし、実際には、この文字エンコードはインターネットでは使用されていません。
シングルバイト文字
プライマリセット(前半)は、ISO/IEC 646:1991 改訂版以前の ISO 646-IRV に従っていた。つまり、ほとんど ASCII に従っていたが、文字 0x24 はドル記号 ($) ではなく「国際通貨記号」 (¤) として表記されていた。1992 年版の ITU T.51 では、既存の CCITT サービスが引き続き 0x24 を国際通貨記号として解釈することを許可しているが、新しい通信アプリケーションではこれをドル記号として使用し(つまり、現在の ISO 646-IRV に従って)、代わりに補助セットを使用して国際通貨記号を表すことを規定している。[2]
補足セット (後半) には、スペーシング グラフィック文字と非スペーシング グラフィック文字、追加のシンボル、および将来の標準化のために予約されているいくつかの場所が含まれています。
これらは両方ともISO/IEC 2022グラフィカル文字セットであり、プライマリセットは 94 コードセット、セカンダリセットは 96 コードセットです。ISO 2022 コード拡張技術が使用されていないコンテキストでは、プライマリセットは G0 セットとして指定され、GL ( 0x 20..0x7F) を介して呼び出されますが、補助セットは G2 セットとして指定され、8 ビット環境では GR (0xA0..0xFF) を介して呼び出されるか、7 ビット環境では制御コード 0x19 をシングルシフトとして使用して呼び出されます。[3]このシングルシフト 2 コードのエンコードは、 ISO-IR -106内の位置と一致します。[4]
ISO/ IEC 6937の補足セットをG2セットとして指定するためのISO /IEC 2022エスケープシーケンスはESC . R(16進数1B 2E 52)である。[2] [5] [6]古いISO 6937/2:1983補足セットは94コードセットとして登録されており、ESC * l(16進数1B 2A 6C)でG2に指定されている。[5] [7]
2バイト文字
基本セットまたは補助セットで単一のコードが割り当てられていないアクセント付き文字は、2 バイトを使用してコード化されます。最初のバイトである「非スペース発音区別符号」の後に、基本セットの文字が続きます。例:
鋭アクセント付きの小文字の e (é) = [鋭アクセント]+e
ITU T.51規格では、補助セットの列4(8ビット形式の場合は0xC0–CF)を非スペーシング分音記号文字に割り当てています。 [ 2]しかし、ISO/IEC 6937は、 Unicodeで定義されているものと一致するISO/IEC 10646文字名に構成シーケンスのリストをマッピングする、完全に指定された文字レパートリーを定義しています。 孤立した非スペーシングバイトはこのレパートリーに含まれていませんが、ASCIIには存在しない分音記号のスペーシングバリアントは含まれており、ASCIIスペースは末尾のバイトです。 [5] [8]したがって、リードバイトとフォローバイトの特定の組み合わせのみがISO/IEC規格に準拠しています。
このレパートリーは、ITU版の仕様書にも付録Aとして添付されているが、ITU版では本文からは参照されていない。これは、ラテン文字の文字レパートリーの「統合スーパーセット」として説明されている。[2]これは、ASCII、ラテン-1(またはラテン-5)、ラテン-2、および補助ラテンセットが使用される場合のISO/IEC 10367のレパートリーに対応する。 [5]
このシステムは、発音区別符号が文字の後ではなく前にあるという点でUnicode結合文字システムとも異なり、 ANSELに似ています。
少し変わった点として、セディーユ付きのラテン小文字 G は、鋭アクセント、つまり 0xC2 リード バイトが付いているかのようにコード化されます。これは、そのディセンダーがセディーユと干渉するため、小文字の上には通常、回転したコンマが付きます: Ģ ģ。
合計 13 個の発音区別符号の後に、基本セットから選択した文字を続けることができます。
コードページレイアウト
下記の 0xC1〜0xCF の範囲のコードに対する U+0300〜U+036F の範囲の結合文字への参照は、上記の注意事項の対象であり、記載されているコードポイントに単純にマッピングすることはできません。また、Unicode は 0xE2 を、ストローク付きの大文字の Dと大文字のEthに区別しますが、これらは通常、小文字 (0xF2 と 0xF3) とは異なって見えます。
ITU T.51の1988年版では、補助セットの2つのバージョンが定義されており、最初のバージョンには、2番目のバージョンにあるノーブレークスペース、ソフトハイフン、NOT記号(¬)、および破線(¦ )がありませんでした。最初のバージョンはT.61補助セットの拡張として定義され、2番目のバージョンは最初のバージョンの拡張として定義されました。[9]現在の(1992年)版には2番目のバージョンのみが含まれ、特定の文字が非推奨となり、プライマリセットが現在のISO-646-IRV(ASCII)に更新されていますが、既存のテレマティクスサービスは古い動作を維持することが許可されています。[2]
ビデオテックス版
ビデオテックスの ITU T.101 規格で使用される補足セットのバージョンは、1988 年版の T.51 の最初の補足セットに基づいています。
データ構文2のデフォルトのG2セットは、ギリシャ語のプライマリセットのコードと組み合わせるために、0xC0に΅を追加します。 [10]
データ構文3の補足セットには、「ベクトルオーバーバー」とソリダス、およびいくつかの半図形文字用の非スペース記号が追加されています。[11]
ETS 300 706 バージョン
ワールドシステムテレテキストのETS 300 706規格は、ISO 6937に基づくG2セットを採用している。 [12]これはT.61の補足セットのスーパーセットであり、1988年版T.51の最初の補足セットのスーパーセットであるが、特定の位置で現在のT.51版と衝突する。ETSバージョンの分音記号コードは、US-ASCIIやBS_viewdataなど、使用中のG0セットの文字と「関連付けるための」ものとして指定されている。 [12]このバージョンは、下の表に示されている。
参照
- ITU T.50
- ITU T.61 、テレテックス用の密接に関連した文字エンコーディング
脚注
- ^ ¤ の継続使用は既存のCCITTサービスにのみ許可されます。[2]
- ^ ab 既存のCCITTサービスにのみ許可されており、それ以外の場合はASCII表現を使用する必要があります。[2]
- ^ ITU版の標準では、下線付きのテキストにアクセント付き文字を含む他の文字と組み合わせて使用できることが既に記載されています。1988年のITU版にはこのコードが含まれていますが、[9] 1992年のITU版では、 ANSIエスケープシーケンスを優先してこのコードを送信することを推奨していません。ただし、適用可能なシステムで受信されたときに正しく解釈されるべきであるとは述べています。[2] ISO/IEC版の標準の以前の版でも、このコードを定義されたレパートリー内の任意の文字と組み合わせることができました[7]が、最近の改訂版ではこのコードは含まれていません。[5]
- ^ 初期の草稿ではȷがこの位置に配置されていました。
参考文献
- ^ 「T.51: テレマティックサービス用のラテン語ベースのコード化文字セット」www.itu.int。2019年10月8日時点のオリジナルよりアーカイブ。2019年11月14日閲覧。
- ^ abcdefgh CCITT (1992-09-18). テレマティックサービス用ラテン文字ベースのコード化文字セット (1992 版). 勧告 T.51.
- ^ ITU-T (1995-08-11). 勧告T.51 (1992) 修正1.
- ^ ITU (1985-08-01). Teletex 制御機能の基本セット(PDF) . ITSCJ/ IPSJ . ISO-IR -106.
- ^ abcde ISO/IEC JTC 1/SC 2/WG 3 (1998-04-15). WD 6937、テキスト通信用コード化グラフィック文字セット - ラテンアルファベット(PDF)。JTC1/SC2/N454。
{{citation}}: CS1 maint: 数値名: 著者リスト (リンク) - ^ ISO/IEC JTC 1/SC 2/WG 3 (1991-12-15)。 ISO/IEC 6937:1992 の補足セット(PDF)。 ITSCJ/情報処理学会。ISO-IR -156。
{{citation}}: CS1 maint: 数値名: 著者リスト (リンク)(左側は US-ASCII です。) - ^ ab ISO/TC97/SC2/WG4 (1985-01-10). ラテンアルファベットおよび非アルファベットグラフィック文字の補足セット(PDF) . ITSCJ/ IPSJ . ISO-IR -90.
{{citation}}: CS1 maint: 数値名: 著者リスト (リンク) - ^ Petersen, JK (2002-05-29). The Telecommunications Illustrated Dictionary. CRC Press. p. 888. ISBN 978-1-4200-4067-8。
- ^ ab CCITT (1988). テレマティックサービス用コード化文字セット(1988年版)。勧告T.51。
- ^ CCITT (1988-11-01). ビデオテックス用グラフィック文字補足セット(PDF) . ITSCJ/ IPSJ . ISO-IR -70.
- ^ CCITT (1986-11-30). CCITT勧告T.101データ構文IIIのグラフィック文字の補足セット(PDF) . ITSCJ/ IPSJ . ISO-IR -128.
- ^ abc ETSI (1997). 「15.6.3 Latin G2 セット」。拡張テレテキスト仕様 (PDF) (PDF)。p. 116。ETS 300 706。
外部リンク
- ITU勧告T.51
- ISO ページ: ISO 6937-1:1983、ISO 6937-2:1983、ISO 6937-2:1983/Add 1:1989、ISO/IEC 6937:1994、ISO/IEC 6937:2001
- WD 6937、テキスト通信用コード化グラフィック文字セット - ラテンアルファベット (ISO/IEC 6937:1994 の改訂) (ISO/IEC 6937:1994 ドラフト)
- ISO-IR-156(右側部分のISO-IR登録)
