Unicode に含まれる 多くの文字体系、例えばアラビア語には、特定の文字の組み合わせを特別な合字に組み合わせる必要がある特別な正書法規則があります。英語では、一般的なアンパサンド(&) は、手書きのラテン文字eとt (ラテン語で「そして」を意味するetと綴る) を組み合わせた合字から発展しました。[ 1 ]
Unicode 17.0の時点では、アラビア文字は次のブロックに含まれています: [ 2 ]
基本アラビア語範囲は、標準的な文字と発音記号をエンコードしますが、文脈形式はエンコードしません(U+0621~U+0652 はISO 8859-6に直接基づいています)。また、最も一般的な発音記号とアラビア語インド数字も含まれています。アラビア語補足範囲は、主にアフリカ(アラビア語以外)の言語の表記に使用される文字のバリエーションをエンコードします。アラビア語拡張 B およびアラビア語拡張 A 範囲は、さまざまなアラビア語以外の言語で使用される追加のコーラン注釈と文字のバリエーションをエンコードします。アラビア語表現形式 A 範囲は、ペルシア語、ウルドゥー語、シンド語、中央アジアの言語に必要な文字のバリエーションの文脈形式と合字をエンコードします。アラビア語表現形式 B 範囲は、アラビア語の発音記号の間隔形式と、より多くの文脈文字形式をエンコードします。表現形式は、古い規格との互換性のためにのみ存在し、現在のテキストのコーディングには必要ありません。[ 3 ] アラビア語の数式記号ブロックには、アラビア語の数式で使用される文字がエンコードされています。インド語のシヤク数ブロックには、17 世紀から 20 世紀半ばまでムガル帝国時代のインドで会計に使用されていたアラビア文字の特殊なサブセットが含まれています。 [ 4 ] [ 5 ]オスマン語のシヤク数ブロックには、オスマン トルコ語の文書で会計に使用されていたシヤカット数 としても知られるアラビア文字の特殊なサブセットが含まれています。[ 5 ]
以下は、現代標準アラビア語で使用される基本アルファベットのデモンストレーションで、アラビア文字がさまざまな文脈でどのように表示されるかを示しています。文脈形式としてリストされているコードポイントは「一般的な交換には使用すべきではない」 [ 3 ] 。Unicodeには、必要に応じて、ゼロ幅ジョイナーなどの他の方法で差異をエンコードできます。
Only the Arabic question mark ⟨؟⟩ and the Arabic comma ⟨،⟩ are used in regular Arabic script typing and the comma is often substituted for the Latin script comma ⟨,⟩ which is also used as the decimal separator when the Eastern Arabic numerals are used (e.g. ⟨100.6⟩ compared to ⟨١٠٠,٦⟩).
Arabic Presentation Forms-A has a few characters defined as "word ligatures" for terms frequently used in formulaic expressions in Arabic. They are rarely used out of professional liturgical typing, also the Rial grapheme is normally written fully, not by the ligature.
They are mostly ligatures which can be created from the previous charts' characters, with the exception of the bracket-like graphemes ﴾ ﴿ and some of them are ligatures of common liturgical phrases.
これらはすべて、基本チャートの文字から作成できます。