
文字学およびタイポグラフィにおいて、アログラフという用語は、文字、数字、表意文字、句読点、その他の活字記号など、文字またはその他の文字要素のデザイン上のバリエーションであるグリフを指すのに使用されます。
文字体系において、ラテン文字(および他の多くの表記体系)の明白な例は、大文字と小文字の区別です。異体字は、文字の本質的な同一性を損なうことなく、大きく変化する可能性があります。たとえ「cat」という単語が「cAt」と表記されたとしても、それは3つの文字⟨c⟩ 、 ⟨a⟩ 、 ⟨t⟩の並びとして認識できます。[ 1 ]
文字やその他の文字素にも、多くの読者が見落としてしまうような大きなバリエーションが存在することがあります。たとえば、文字g は、異なる書体で 2 つの一般的な形があり、人々の手書きでもさまざまな形があります。位置による異体字の例としては、長母音の s | ſ |があり、これはかつて小文字のsの非末尾異体字として広く使われていました。アラビア文字は特に位置による異体字が強く、アラビア文字は単語内の位置に基づいて 2 ~ 4 つの異体字を持ちます。[ 2 ]
異体字は、人間とコンピュータの両方にとって文字認識を困難にする可能性があります。読み方を学ぶ子供たちは、異体字が同じ文字を表していることをすぐには理解しません。このスキルは、読み方指導の最初の数年間で発達します。読み書きで使用される異体字の不一致(たとえば、手書き文字/ブロック体で読み、筆記体で書く)は、生徒が文字を認識して名前を付ける能力を阻害する可能性があります。[ 3 ]コンピュータによる光学文字認識(OCR)システムも、人間と同様に異体字の認識に困難を抱えています。[ 4 ]さまざまな入力方法、さまざまな言語、さまざまなユーザーに対応するために、異体字の問題を軽減するために、さまざまな文字認識アルゴリズムが開発されています。[ 5 ]
異体字のさらなる複雑さは、特殊な表記体系では、文字の異形が別の意味を持つことがあるという点です。ある状況では異体字である2つの記号が、別の状況では異なる意味を表すことがあります。例えば、言語学で使用される国際音声記号では、⟨ a ⟩と⟨ ɑ ⟩は、通常の英語の使用では小文字の⟨ a ⟩の異体字ですが、異なる音を表します。 [ 6 ]
このような異体はUnicodeで異なるコードポイントを持つため、一部のアプリケーションでは異体字とはみなされません。コードポイントが異なるため、大文字と小文字のような異体字でさえ、一部のコンピュータアプリケーションでは異なる文字として扱われる場合があります(例:大文字と小文字を区別するパスワード)。[ 7 ]
タイポグラフィでは、「アログラフ」という用語は、異なる書体における同じ文字または記号の異なる表現をより具体的に説明するために使用されます。[ 8 ]結果として得られるグリフは、参照文字や他のグリフとは形状やスタイルがかなり異なるように見えるかもしれませんが、それでもその意味は同じままです。[ 9 ]
Unicodeでは、特定の文字にコードポイントが割り当てられます。その文字のすべての異体字は同じコードポイントを持ち、印刷時や表示時のフォントの選択に関係なく、本質的な意味が保持されます。例えば、U+0067 gラテン小文字 Gは、セリフ体ではループテールが付きますが、サンセリフ体では付きません (例: Times New Roman: g、Helvetica: g )。しかし、コードポイントは一定で、その意味はフォントに関係なく維持されます。[ a ]
漢字には、複数の表記法を持つ文字がいくつか存在します。漢字フォントには、しばしばいくつかの文字の多くの異体字が含まれています。地域によって、特定の文字の異体字が採用されています。例えば、次のようになります。
アログラフの概念は、視覚的に似ているが意味が異なるグリフであるホモグリフの概念と比較対照することができます。たとえば、文字Oと数字の0は形が似ていますが意味が異なります。3 つの文字A、Α、およびΐ は見た目は同じですが、3 つの異なる文字体系 (ラテン文字、ギリシャ文字、キリル文字) の文字です。これらはIDN ホモグラフ攻撃に悪用される可能性があり、悪意のある攻撃者はホモグリフを使用して、ユーザーには意図した URL と同一に見えるが、意図した場所とは異なる場所に誘導する URL を作成します。[ 10 ]
アラビア語では、抽象的な名詞文字は文脈依存の異体字で表されます。アラビア語の簡略化されたサポートでは、文脈依存の異体字は、不連続同化と連続同化の2つのパターンに従って処理されます。(異体字と合字)