
アルファベット順とは、特定のアルファベットの順序に基づいて文字列を並べるシステムです。これは照合方法の一つです。数学においては、辞書順とは、アルファベット順を数値のシーケンスやその他の順序付けられた数学的対象など、他のデータ型に一般化したものです。
アルファベット文字に加えて、数字、数値、またはより複雑なタイプの要素を含む可能性のある文字列またはシーケンスに適用される場合、アルファベット順は一般に辞書順と呼ばれます。
2つの文字列をアルファベット順に並べる際に、どちらが先に来るかを判断するには、それぞれの文字列の最初の文字を比較します。最初の文字が異なる場合は、アルファベット順で最初の文字が先に来る文字列が先に来ます。最初の文字が同じ場合は、2番目の文字を比較し、以下同様に比較を続けます。一方の文字列には比較する文字がもうなく、もう一方の文字列にはまだある場合、文字数の少ない方の文字列がアルファベット順で先に来るとみなされます。
アルファベット順においては、大文字は対応する小文字と同一とみなされるのが一般的ですが、文字列の大文字・小文字のみが異なる場合に対処するための慣例が採用されることもあります。また、スペース、発音記号などの特殊文字、句読点などの非文字を含む文字列の扱いについても、様々な慣例が存在します。
単語や文字列をアルファベット順に並べると、同じ文字で始まる文字列はすべてグループ化され、そのグループ内では同じ2文字の並びで始まる単語はすべてグループ化される、といった具合に、隣接する単語間で共通の頭文字の数を最大化する傾向があります。
アルファベットの文字の順序は、紀元前14世紀にシリア北部沿岸のウガリットの町で確認されている。 [ 1 ]そこで発見された粘土板には1000を超える楔形文字が刻まれているが、これらの文字はバビロニアのものではなく、30種類の文字しかない。約12枚の粘土板には、文字がアルファベット順に並べられている。2つの順序が見つかっており、1つはヘブライ語、ギリシャ語、ラテン語で使用されている順序とほぼ同じで、もう1つはゲエズ語で使用されている順序と非常によく似ている。[ 2 ]
原シナイ文字がいくつの文字から構成されていたのか、またその文字順序がどうなっていたのかは分かっていません。その子孫であるウガリット文字は27文字、南アラビア文字は29文字、フェニキア文字は22文字の子音を持っていました。これらの文字体系は2つの順序で配列されており、フェニキア文字はABGDE順、南アラビア文字はHLĦMQ順でした。ウガリット文字は両方の順序を保持していました。これらの文字体系の子孫の間では、どちらの順序も驚くほど安定していました。
単語に適用した場合、アルファベット順は紀元前1千年紀に北西セム語の書記がアブジャド体系を使用して初めて使用されました。[ 3 ]しかし、地理的、年代的、階層的、カテゴリー別など、さまざまな分類および順序付け方法が何世紀にもわたってアルファベット順よりも好まれました。[ 4 ]
聖書の一部は紀元前7世紀から6世紀に遡る。エレミヤ書では、預言者はアルファベット順に基づくアトバシュ換字暗号を使用している。同様に、聖書の著者は(順序付けられた)ヘブライ語アルファベットに基づく頭文字暗号を使用していた。[ 5 ]
学者による目録作成手段としてのアルファベット順の最初の効果的な使用は、紀元前300年頃に設立された古代アレクサンドリアの大図書館[ 6 ]であったと考えられている。そこで働いていた詩人であり学者でもあるカリマコスは、著者の名前の頭文字のアルファベット順に巻物を棚に並べた「ピナケス」として知られる世界初の図書館目録を作成したと考えられている[ 4 ] 。
紀元前1世紀、ローマの著述家ヴァロは、著者とタイトルのアルファベット順リストを編纂した。[ 7 ]紀元2世紀、セクストゥス・ポンペイウス・フェストゥスは、ウェリウス・フラックスの著作の百科事典的要約である『言葉の意味について』を、アルファベット順に項目を付けて書いた。[ 8 ]紀元3世紀、ハルポクラティオンは、すべての文字でアルファベット順に並べたホメロスの語彙集を書いた。[ 9 ]
10世紀には、ギリシャ語(スーダ辞典)、アラビア語(イブン・ファリスの『アル=ムジュマル・フィー・アル=ルガ』)、聖書ヘブライ語(メナヘム・ベン・サルークの『マフベレト』)の主要なアルファベット順辞書が出版された。参照の補助としてのアルファベット順は11世紀のイタリアで盛んになり、ラテン語(パピアスの『エレメンタリウム』)やタルムード・アラム語(ナタン・ベン・ジェヒエルの『アルーフ』)に関する著作が生まれた。[ a ]
12世紀後半、キリスト教の説教者たちは聖書の語彙を分析するためにアルファベット順のツールを採用した。これがきっかけとなり、13世紀にはパリのドミニコ会修道士たちがサン・シェールのユーグの指導の下、聖書のアルファベット順索引を編纂した。聖ヒエロニムスの『ヘブライ語名の解釈』のような古い参考書も、参照しやすいようにアルファベット順に整理された。アルファベット順の使用は当初、学生がそれぞれの研究分野をその合理的な構造に従って習得することを期待していた学者たちに抵抗された。しかし、ロバート・キルワードビーによる聖アウグスティヌスの著作索引のようなツールによって、その成功は促進された。この索引は、 12世紀のスコラ学で普及していた抜粋集に頼るのではなく、読者が完全な原文にアクセスできるようにした。アルファベット順の採用は、記憶の優位性から書かれた著作の優位性への移行の一部であった。 [ 10 ]情報をアルファベット順に並べるという考え方は、12 世紀と 13 世紀の百科事典の編纂者たちからも抵抗を受けた。彼らは皆敬虔な聖職者であった。彼らは、神学的に、つまり神の創造の順序で、Deus (神を意味する) から始めて資料を整理することを好んだ。[ 4 ]
1604年、ロバート・コードリーは、最初の単言語英語辞書である『Table Alphabeticall』の中で、「あなたが探している単語が(a)で始まる場合は、この表の最初を見てください。しかし、(v)で始まる場合は、最後の方を見てください」と説明しなければならなかった。[ 11 ] 1803年になっても、サミュエル・テイラー・コールリッジは「頭文字の偶然によって決められた配列」を持つ百科事典を非難したが、[ 12 ]今日でも多くのリストはこの原則に基づいている。
現代のISO基本ラテンアルファベットの標準的な順序は次のとおりです。
以下に、単純なアルファベット順の例を示します。
別の例:
The above words are ordered alphabetically. As comes before Aster because they begin with the same two letters and As has no more letters after that whereas Aster does. The next three words come after Aster because their fourth letter (the first one that differs) is r, which comes after e (the fourth letter of Aster) in the alphabet. Those words themselves are ordered based on their sixth letters (l, n and p respectively). Then comes At, which differs from the preceding words in the second letter (t comes after s). Ataman comes after At for the same reason that Aster came after As. Attack follows Ataman based on comparison of their third letters, and Baa comes after all of the others because it has a different first letter.
When some of the strings being ordered consist of more than one word, i.e., they contain spaces or other separators such as hyphens, then two basic approaches may be taken. In the first approach, all strings are ordered initially according to their first word, as in the sequence:
In the second approach, strings are alphabetized as if they had no spaces or hyphens,[b] giving the sequence:
The second approach is the one usually taken in dictionaries, and it is thus often called dictionary order by publishers.[c] The first approach has often been used in book indexes, although each publisher traditionally set its own standards for which approach to use therein; there was no ISO standard for book indexes (ISO 999) before 1975.
フランス語では、発音記号が付いた文字などの修飾文字は、アルファベット順の順序付けにおいては基本文字と同じように扱われます。例えば、rôle はrockとroseの間に入り、 roleと書かれたものとみなされます。ただし、このような文字を体系的に使用する言語では、一般的に独自の順序付け規則があります。詳しくは、下記の「 言語固有の慣例」をご覧ください。
姓が名の後に書かれる文化圏のほとんどでは、電話帳などの名前リストを姓で最初に並べ替えることが依然として望まれています。この場合、正しく並べ替えるためには名前の順序を変更する必要があります。たとえば、Juan Hernandes と Brian O'Leary は、たとえそのように書かれていなくても、「Hernandes, Juan」と「O'Leary, Brian」として並べ替える必要があります。このルールをコンピュータの照合アルゴリズムに取り込むのは複雑で、単純な試みではうまくいきません。たとえば、アルゴリズムが姓の広範なリストを利用できる場合を除き、「Gillian Lucille van der Waal」が「van der Waal, Gillian Lucille」、「Waal, Gillian Lucille van der」、あるいは「Lucille van der Waal, Gillian」のどれであるかを判断する方法はありません。
姓による順序付けは、学術的な文脈ではよく見られます。複数の著者による単一の論文内では、逆年功序列や論文への貢献度といった他の方法ではなく、姓のアルファベット順に著者を並べることは、「同様の貢献を認める」または「共同研究グループ内の不和を避ける」方法と見なされています。[ 13 ]特定の分野では、参考文献リストの引用を著者の姓で並べる慣習により、アルファベット順で先に現れる姓の著者に有利なバイアスが生じることがわかっていますが、参考文献リストが時系列順に並べられている分野では、このような影響は見られません。[ 14 ]
フレーズが「the」、「a」、「an」などの非常に一般的な単語(文法では冠詞と呼ばれる)で始まる場合、その単語は無視されるか、フレーズの末尾に移動されることがあります。しかし、常にそうとは限りません。たとえば、書籍「The Shining」は「Shining」または「Shining, The」として扱われ、書籍タイトル「Summer of Sam」の前に来る可能性があります。しかし、単に「The Shining」として扱われ、「Summer of Sam」の後に置かれる場合もあります。同様に、「A Wrinkle in Time」は「Wrinkle in Time」、「Wrinkle in Time, A」、または「A Wrinkle in Time」として扱われる可能性があります。これら3つのアルファベット順の方法は、アルゴリズムで比較的簡単に作成できますが、多くのプログラムは代わりに単純な辞書順の順序に依存しています。
アイルランドやスコットランドの姓によく見られる接頭辞MとMcはMacの略語であり、綴りがMacであるかのようにアルファベット順に並べられることがあります。そのため、McKinleyはMackintoshよりも前に記載されることがあります(これは、MacKinleyと綴った場合と同じです)。コンピューターによるソートリストの登場以来、このようなアルファベット順の並べ方はあまり見られなくなりましたが、イギリスの電話帳では今でも使われています。
接頭辞「St 」または「St.」は「Saint」の略語であり、伝統的に「Saint」をフルネームとしてアルファベット順に並べられます。そのため、地名辞典では「St John's」が「Salem」よりも前に記載されることがあります(「Saint John's」とフルネームで記載された場合と同様です)。コンピューターによるソートリストの登場以来、このようなアルファベット順の並べ方はあまり見られなくなりましたが、今でも時折用いられています。
英語のÆやŒのように、2つ以上の文字が1つの記号に結合したもので、個別の文字とはみなされない合字は、通常、あたかも別々の文字であるかのように並べられます。「æther」と「aether」は、他のすべての単語に対して同じ順序で並びます。これは、借用語やブランド名など、合字が純粋にスタイル上の目的でない場合でも同様です。
2つの文字が合字で繋がっているかどうかだけが異なる文字列をソートするには、特別なルールを採用する必要がある場合がある。
文字列に数字(またはその他の文字以外の文字)が含まれる場合、さまざまなアプローチが可能です。そのような文字は、アルファベットのすべての文字の前または後に来るものとして扱われることがあります。別の方法として、数字を綴り通りにアルファベット順にソートする方法があります。たとえば、1776 は「seventeen seventy-six」と綴ったものとしてソートされ、24 heures du Mans は「vingt-quatre...」(フランス語で「24」)と綴ったものとしてソートされます。数字やその他の記号が、文字の特別なグラフィック形式として使用される場合(leetの1337や映画Seven ( Se7enとスタイル化)など)、それらは文字であるかのようにソートされることがあります。自然ソート順は、文字列をアルファベット順に並べますが、複数桁の数字は単一の文字として扱われ、桁によってエンコードされた数値の値によってソートされます。
君主や教皇の場合、その番号はローマ数字で文字に似ていますが、通常は番号順に並べられます。例えば、VはIの後に来ますが、デンマーク王クリスチャン9世は前任者のクリスチャン8世の後に来ます。
拡張ラテン文字を使用する言語は、一般的に、追加文字の扱いに関して独自の慣習を持っています。また、一部の言語では、照合の目的で特定の二重音字が単一の文字として扱われます。たとえば、スペイン語のアルファベットでは、 ñ はnに続く基本文字として扱われ、以前は二重音字chとll はそれぞれcとlに続く基本文字として扱われていました。現在、 chとllは 2 文字の組み合わせとしてアルファベット順になっています。新しいアルファベット順の規則は、 1994 年にスペイン王立アカデミーによって発行されました。これらの二重音字は、以前は正式には文字として指定されていましたが、2010 年以降はそうではなくなりました。一方、二重音字rrは予想どおりrquに続きます(1994 年のアルファベット順の規則以前からそうでした)。一方、鋭アクセント付き母音 ( á、é、í、ó、ú ) は常に基本文字と並列に並べられており、文字üも同様です。
アラビア語やキオワ語など、ごく一部の言語では、アルファベットの順序が完全に変更されている。
様々な言語で適用されるアルファベット順の規則を以下に示します。
照合アルゴリズム(ソートアルゴリズムと組み合わせて)は、コンピュータプログラミングにおいて文字列をアルファベット順に並べるために使用されます。標準的な例としては、Unicode 照合アルゴリズムがあり、これは任意のUnicode記号を含む文字列を(拡張として)アルファベット順に並べるために使用できます。[ 16 ]デフォルトの照合テーブルを調整することで、上記の言語固有の慣例のほとんどに適合させることができます。このような調整のいくつかは、Common Locale Data Repositoryにまとめられています。
アルファベット順の原則は、厳密にはアルファベットを使用しない言語(例えば、音節文字やアブギダ文字を使用する言語)にも適用できる。ただし、使用される記号に確立された順序があることが前提となる。
中国語の漢字や日本語の漢字といった表意文字体系では、部首と画数による分類法が、文字の順序を定義する方法としてよく用いられる。日本語では、発音順を用いる場合もあり、最も一般的なのは五十音順だが、古いいろは順を用いる場合もある。
数学において、辞書式順序は、アルファベット順を作成するのと同様の方法で数列を順序付ける手段である。[ 18 ]
一部のコンピュータアプリケーションでは、文字のASCIIコードまたはUnicodeコードのみに基づいた非常に単純なアルゴリズムを使用して、アルファベット順の並び順を実現しています。この並び順では、大文字がすべて小文字より前に配置されるなど、標準とは異なる結果が生じる場合があります。ASCIIアルファベット順を参照してください。
韻律辞典は、単語の最後の文字から最初の文字へとアルファベット順に並べることに基づいている。