
Unicodeバージョン 16.0 の時点では、コード ポイントを持つ文字は155,063 個あり、168 個の現代および歴史的スクリプトと複数の記号セットをカバーしています。この記事には、多言語ヨーロッパ文字セット 2 ( MES-2 ) サブセットの 1,062 文字と、いくつかの追加の関連文字が含まれています。
キャラクターリファレンスの概要

HTMLとXML では、文字自体が使用できない、または使用すべきでない場合に、Unicode 文字を参照する方法が提供されています。数値文字参照は、 Universal Character Set / Unicode コード ポイントによって文字を参照し、文字エンティティ参照は、定義済みの名前によって文字を参照します。
数値文字参照は次の形式を使用します。
&#んんんん;
または
&#xうーん;
ここで、nnnnは10 進形式のコード ポイント、hhhhは16 進形式のコード ポイントです。XMLドキュメントでは、x は小文字でなければなりません。nnnnまたはhhhh は任意の桁数で、先頭にゼロを含めることができます。hhhh は大文字と小文字を混在させることができますが、通常は大文字を使用します。
対照的に、文字エンティティ参照は、目的の文字を置換テキストとして持つエンティティの名前で文字を参照します。エンティティは、事前に定義されているか (マークアップ言語に組み込まれている)、文書型定義(DTD)で明示的に宣言されている必要があります。形式は、他のエンティティ参照と同じです。
&名前;
ここで、name はエンティティの大文字と小文字を区別する名前です。セミコロンは必須です。
人間にとって数字は名前よりも覚えにくいため、文字実体参照はほとんどの場合人間によって書かれ、数値文字参照はほとんどの場合コンピュータプログラムによって生成されます。[1]
制御コード
脚注:
- 1 Control-C は通常、「中断」または「中断」キーとして使用されます。
- 2 Control-D は、Unix / Linux システムの端末で入力されたテキストの「ファイルの終わり」を通知するために使用されてきました。Windows、DOS、および古いミニコンピュータでは、この目的で Control-Z を使用していました。
- 3 Control-G はテレタイプが使用されていた時代の遺物です。重要なメッセージはテレタイプのベルを鳴らすことで知らせることができました。これはブザー音を発生させることにより PC に引き継がれました。
- 4改行は、Unix / Linux システム上のテキスト ファイルの「行末」に使用されます。
- 5キャリッジリターン(改行を伴う)は、Windows、DOS、およびUnix / Linuxベースのシステム以外のほとんどのミニコンピュータで「行末」文字として使用されます。
- 6 Control-O は「出力を破棄」キーです。出力は端末に送信されず、別の Control-o が入力されるまで破棄されます。
- 7 Control-Q は、Control-S によって停止された後、ホスト コンピュータに出力の送信を再開するように指示するために使用されています。
- 8 Control-S は、ホスト コンピュータに端末への出力の送信を延期するように指示するために使用されます。出力は、Control-Q キーによって再開されるまで中断されます。
- 9 Control-U は元々、Digital Equipment Corporationのコンピュータで、入力したテキストの現在の行をキャンセルするために使用されていました。他のメーカーでは、この目的で Control-X を使用していました。
- 10 Control-X は、端末で入力した行をキャンセルするためによく使用されていました。
- 11 Control-Z は、ミニコンピュータ、Windows、および DOS システムで、端末またはテキスト ファイルで「ファイルの終わり」を示すためによく使用されます。Unix / Linux システムでは、端末でファイルの終わりを示すために Control-D が使用されます。
ラテン文字
Unicode 標準 (バージョン 16.0) では、1,487 文字がラテン文字に属するものとして分類されています。
基礎ラテン語
95 文字。52 のアルファベット文字はラテン文字に属します。残りの 43 は共通文字に属します。ASCII句読点と記号
として分類される 33 文字は、 ASCII 特殊文字と呼ばれることもあります。多くの場合、組織がパスワードに「句読点が必要」と言っているのは、これらの文字のみ (他の Unicode 句読点は含まない) を意味します。
ラテン語-1補足
96 文字。62 文字と 2 つの序数表示はラテン文字に属します。残りの 32 文字は共通文字に属します。
ラテン語拡張A
128 文字。すべてラテン文字に属します。
ラテン語拡張B
208 文字。すべてラテン文字に属し、33 文字は MES-2 サブセットに属します。
ラテン語拡張追加
256 文字。すべてラテン文字に属し、23 文字は MES-2 サブセットに属します。
追加のラテン語拡張
- ラテン拡張 C (Unicode ブロック)
- ラテン拡張D(Unicodeブロック)
- ラテン拡張-E (Unicode ブロック)
- ラテン拡張F(Unicodeブロック)
- ラテン拡張 G (Unicode ブロック)
表音文字
IPA 拡張子
96 文字。すべてラテン文字に属し、3 文字は MES-2 サブセットに属します。
修飾文字の間隔
80 文字。MES-2 サブセットでは 15 文字。
音声拡張
マークの組み合わせ
ギリシャ語とコプト語
144 個のコード ポイント、割り当てられた文字 135 個、MES-2 サブセット内の文字 85 個。
ギリシャ語拡張
多音 正書法の場合。256 個のコード ポイント、割り当てられた文字は 233 個で、すべて MES-2 サブセット (#670 – 902) にあります。
キリル
256 文字。MES-2 サブセットでは 191 文字。
Cyrillic supplements
- Cyrillic Supplement (Unicode block)
- Cyrillic Extended-A (Unicode block)
- Cyrillic Extended-B (Unicode block)
- Cyrillic Extended-C (Unicode block)
- Cyrillic Extended-D (Unicode block)
Armenian
Semitic languages
Arabic
Hebrew
Syriac
Mandaic
Samaritan
Thaana
Brahmic (Indic) scripts
The range from U+0900 to U+0DFF includes Devanagari, Bengali script, Gurmukhi, Gujarati script, Odia alphabet, Tamil script, Telugu script, Kannada script, Malayalam script, and Sinhala script.
Devanagari
Bengali and Assamese
Gurmukhi
Gujarati
Oriya
Tamil
Telugu
Kannada
Malayalam
Sinhala
Other Brahmic scripts
Other Brahmic and Indic scripts in Unicode include:
- Ahom (Unicode block)
- Balinese (Unicode block)
- Batak (Unicode block)
- Bhaiksuki (Unicode block)
- Buhid (Unicode block)
- Buginese (Unicode block)
- Chakma (Unicode block)
- Cham (Unicode block)
- Common Indic Number Forms (Unicode block)
- Dives Akuru (Unicode block)
- Dogra (Unicode block)
- Grantha (Unicode block)
- Gurung Khema (Unicode block)
- Hanunoo (Unicode block)
- Javanese (Unicode block)
- Kaithi (Unicode block)
- Kawi (Unicode block)
- Khmer (Unicode block)
- Khmer Symbols (Unicode block)
- Khojki (Unicode block)
- Khudawadi (Unicode block)
- Kirat Rai (Unicode block)
- Lao (Unicode block)
- Lepcha (Unicode block)
- Limbu (Unicode block)
- Mahajani (Unicode block)
- Makasar (Unicode block)
- Marchen (Unicode block)
- Meetei Mayek (Unicode block)
- Meetei Mayek Extensions (Unicode block)
- Modi (Unicode block)
- Multani (Unicode block)
- Myanmar (Unicode block)
- Myanmar Extended-A (Unicode block)
- Myanmar Extended-B (Unicode block)
- Myanmar Extended-C (Unicode block)
- New Tai Lue (Unicode block)
- Newa (Unicode block)
- Phags-pa (Unicode block)
- Rejang (Unicode block)
- Saurashtra (Unicode block)
- Sharada (Unicode block)
- Siddham (Unicode block)
- Sundanese (Unicode block)
- Sundanese Supplement (Unicode block)
- Syloti Nagri (Unicode block)
- Tagalog (Unicode block)
- Tagbanwa (Unicode block)
- Tai Le (Unicode block)
- Tai Tham (Unicode block)
- Tai Viet (Unicode block)
- Takri (Unicode block)
- Thai (Unicode block)
- Tibetan (Unicode block)
- Tirhuta (Unicode block)
- Tulu-Tigalari (Unicode block)
Other South and Central Asian writing systems
- Gunjala Gondi (Unicode block)
- Masaram Gondi (Unicode block)
- Mro (Unicode block)
- Nag Mundari (Unicode block)
- Ol Chiki (Unicode block)
- Ol Onal (Unicode block)
- Sora Sompeng (Unicode block)
- Sunuwar (Unicode block)
- Tangsa (Unicode block)
- Toto (Unicode block)
- Warang Citi (Unicode block)
Southeast Asian writing systems
- Hanifi Rohingya (Unicode block)
- Kayah Li (Unicode block)
- Pahawh Hmong (Unicode block)
- Pau Cin Hau (Unicode block)
Georgian
African scripts
Ge'ez/Ethiopic script
Other African scripts
- Adlam (Unicode block)
- Bamum (Unicode block)
- Bamum Supplement (Unicode block)
- Bassa Vah (Unicode block)
- Garay (Unicode block)
- Medefaidrin (Unicode block)
- Mende Kikakui (Unicode block)
- NKo (Unicode block)
- Osmanya (Unicode block)
- Ottoman Siyaq Numbers
- Tifinagh (Unicode block)
- Vai (Unicode block)
American scripts
Unified Canadian Aboriginal Syllabics
Other American scripts
- Cherokee (Unicode block)
- Cherokee Supplement (Unicode block)
- Deseret (Unicode block)
- Kaktovik Numerals (Unicode block)
- Osage (Unicode block)
Mongolian
Unicode symbols
General Punctuation
112 code points; 111 assigned characters; 24 in the MES-2 subset.
Superscripts and Subscripts
Currency Symbols
Letterlike Symbols
Number Forms
Arrows
- Miscellaneous Symbols and Arrows (Unicode block)
- Supplemental Arrows-A (Unicode block)
- Supplemental Arrows-B (Unicode block)
- Supplemental Arrows-C (Unicode block)
Mathematical symbols
- Supplemental Mathematical Operators (Unicode block)
- Miscellaneous Mathematical Symbols-A (Unicode block)
- Miscellaneous Mathematical Symbols-B (Unicode block)
- Mathematical Alphanumeric Symbols: Mathematical Alphanumeric Symbols (Unicode block)
Miscellaneous Technical
Control Pictures
Optical Character Recognition
Enclosed Alphanumerics
Box Drawing
Block Elements
Geometric Shapes
Symbols for Legacy Computing
Symbols for Legacy Computing Supplement
Miscellaneous Symbols
Dingbats
East Asian writing systems
CJK Symbols and Punctuation
Hiragana
Katakana
- Kana Extended-A (Unicode block)
- Kana Extended-B (Unicode block)
- Kana Supplement (Unicode block)
- Katakana Phonetic Extensions (Unicode block)
- Small Kana Extension (Unicode block)
Bopomofo
Hangul Jamo and Compatibility Jamo
Kanbun
Enclosed CJK Letters and Months
CJK Compatibility
CJK Compatibility Forms
CJK Unified Ideographs
CJK Radicals
Other East Asian writing systems
- Counting Rod Numerals (Unicode block)
- Halfwidth and Fullwidth Forms (Unicode block)
- Ideographic Description Characters (Unicode block)
- Khitan Small Script (Unicode block)
- Lisu (Unicode block)
- Lisu Supplement (Unicode block)
- Miao (Unicode block)
- Modifier Tone Letters (Unicode block)
- Nushu (Unicode block)
- Nyiakeng Puachue Hmong (Unicode block)
- Small Form Variants (Unicode block)
- Tai Xuan Jing Symbols (Unicode block)
- Tangut (Unicode block)
- Tangut Components (Unicode block)
- Tangut Supplement (Unicode block)
- Vertical Forms (Unicode block)
- Wancho (Unicode block)
- Yi Syllables (Unicode block)
- Yi Radicals (Unicode block)
- Yijing Hexagram Symbols (Unicode block)
Alphabetic Presentation Forms
Ancient and historic scripts
- Aegean Numbers (Unicode block)
- Anatolian Hieroglyphs (Unicode block)
- Ancient Greek Numbers (Unicode block)
- Ancient Symbols (Unicode block)
- Avestan (Unicode block)
- Brahmi (Unicode block)
- Carian (Unicode block)
- Caucasian Albanian (Unicode block)
- Chorasmian (Unicode block)
- Cuneiform (Unicode block)
- Cuneiform Numbers and Punctuation (Unicode block)
- Cypriot Syllabary (Unicode block)
- Cypro-Minoan (Unicode block)
- Early Dynastic Cuneiform (Unicode block)
- Egyptian Hieroglyph Format Controls (Unicode block)
- Egyptian Hieroglyphs (Unicode block)
- Egyptian Hieroglyphs Extended-A (Unicode block)
- Elbasan (Unicode block)
- Elymaic (Unicode block)
- Glagolitic (Unicode block)
- Glagolitic Supplement (Unicode block)
- Gothic (Unicode block)
- Hatran (Unicode block)
- Imperial Aramaic (Unicode block)
- Indic Siyaq Numbers
- Inscriptional Pahlavi (Unicode block)
- Inscriptional Parthian (Unicode block)
- Kharoshthi (Unicode block)
- Linear A (Unicode block)
- Linear B Ideograms (Unicode block)
- Linear B Syllabary (Unicode block)
- Lycian (Unicode block)
- Lydian (Unicode block)
- Manichaean (Unicode block)
- Mayan Numerals (Unicode block)
- Meroitic Cursive (Unicode block)
- Meroitic Hieroglyphs (Unicode block)
- Nabataean (Unicode block)
- Nandinagari (Unicode block)
- Ogham (Unicode block)
- Old Hungarian (Unicode block)
- Old Italic (Unicode block)
- Old North Arabian (Unicode block)
- Old Permic (Unicode block)
- Old Persian (Unicode block)
- Old Sogdian (Unicode block)
- Old South Arabian (Unicode block)
- Old Turkic (Unicode block)
- Old Uyghur (Unicode block)
- Palmyrene (Unicode block)
- Phaistos Disc (Unicode block)
- Phoenician (Unicode block)
- Psalter Pahlavi (Unicode block)
- Runic (Unicode block)
- Sogdian (Unicode block)
- Soyombo (Unicode block)
- Todhri (Unicode block)
- Ugaritic (Unicode block)
- Vithkuqi (Unicode block)
- Yezidi (Unicode block)
- Zanabazar Square (Unicode block)
Shavian
Notational systems
Braille
- Braille Patterns (Unicode block)
Music
- Western Musical Symbols (Unicode block)
- Byzantine Musical Symbols (Unicode block)
- Ancient Greek Musical Notation (Unicode block)
- Znamenny Musical Notation (Unicode block)
Shorthand
- Duployan (Unicode block)
- Shorthand Format Controls (Unicode block)
Sutton SignWriting
- Sutton SignWriting: Sutton SignWriting (Unicode block)
Emoji
Alchemical symbols
Game symbols
Mahjong Tiles
Domino Tiles
Playing Cards
Chess Symbols
Special areas and format characters
- Private Use Areas
- Specials (Unicode block)
- Surrogates
- Tags (Unicode block)
- Variation Selectors
- Variation Selectors (Unicode block)
- Variation Selectors Supplement (Unicode block)
See also
- Comparison of Unicode encodings
- Open-source Unicode typefaces
- GNU Unifont – Duospaced bitmap font
- List of radicals in Unicode
- List of Unicode fonts
- List of typefaces
- Typographic unit
- Unicode Consortium
- Fallback font – A type of reserve typeface
- Unicode font
- Universal Character Set characters
- DIN 91379 Unicode subset for Europe
- List of Cyrillic letters
- List of Latin letters by shape
References
- ^ Carey, Patrick (2015). New perspectives on XML : comprehensive. Sasha Vodnik (3rd ed.). p. 36. ISBN 978-1-285-07582-2. OCLC 904969019.
- ^ Deprecated as of Unicode version 5.2.0 [1] "U+0149 Latin small letter n preceded by apostrophe was encoded for use in Afrikaans. The character is deprecated, and its use is strongly discouraged. In nearly all cases it is better represented by a sequence of an apostrophe followed by “n”." [2] pg. 208
- Unicode Character Code Charts, Unicode, Inc.
- CWA 13873:2000 – Multilingual European Subsets in ISO/IEC 10646-1 CEN Workshop Agreement 13873
- Multilingual European Character Set 2 (MES-2) Rationale, Markus Kuhn, 1998
External links
- Official web site of the Unicode Consortium (English)
