
アルファベット順は、文字列をアルファベットの慣習的な順序における文字の位置に基づいて順序付けるシステムです。これは照合方法の 1 つです。数学では、辞書式順序は、数字のシーケンスやその他の順序付けられた数学的オブジェクトなどの他のデータ型にアルファベット順を一般化したものです。
アルファベット文字に加えて、数字や数値、またはより複雑なタイプの要素を含む可能性のある文字列またはシーケンスに適用される場合、アルファベット順は一般に辞書式順序と呼ばれます。
アルファベット順に並べるときに 2 つの文字列のどちらが先に来るかを判断するには、最初の文字を比較します。最初の文字が異なる場合は、最初の文字がアルファベットの先頭にある文字列がもう一方の文字列より前に来ます。最初の文字が同じ場合は、2 番目の文字を比較します。これを繰り返します。一方の文字列には比較する文字がなくなり、もう一方の文字列には比較する文字があるという位置に達した場合は、最初の (短い) 文字列がアルファベット順で最初に来るものとみなされます。
大文字は、アルファベット順の順序付けの目的では、通常、対応する小文字と同一であると見なされますが、2 つの文字列が大文字のみ異なる状況を処理するための規則が採用されることもあります。スペース、発音区別記号などの変更された文字、句読点などの非文字を含む文字列の処理についても、さまざまな規則が存在します。
一連の単語または文字列をアルファベット順に並べると、同じ文字で始まる文字列はすべてグループ化され、そのグループ内で同じ 2 文字のシーケンスで始まる単語はすべてグループ化され、以下同様に続きます。このように、システムは隣接する単語間の共通の最初の文字の数を最大化する傾向があります。
歴史
アルファベット順は、紀元前1千年紀に北西セム語族の筆写者がアブジャド方式で初めて使用しました。[1]しかし、地理順、年代順、階層順、カテゴリ順など、資料を分類および整理するさまざまな方法が、何世紀にもわたってアルファベット順よりも好まれていました。[2]
聖書の一部は紀元前7世紀から6世紀にかけて書かれたものです。エレミヤ書では、預言者はアルファベット順に基づいたアトバシュ 換字暗号を使用しています。同様に、聖書の著者は(順序付けられた)ヘブライ語アルファベットに基づいた頭韻法を使用していました。[3]
学者の間でアルファベット順が目録作成手段として初めて効果的に使用されたのは、古代アレクサンドリアのアレクサンドリア大図書館[4]で、紀元前300年頃に設立された。そこで働いていた詩人で学者のカリマコスは、巻物を著者名の最初の文字のアルファベット順に並べた世界初の図書館目録「ピナケス」を作成したと考えられている[2]。
紀元前1世紀、ローマの作家ウァロは著者と題名のアルファベット順リストを編纂した。[ 5]紀元2世紀、セクストゥス・ポンペイウス・フェストゥスは、ウェルリウス・フラックスの著作をアルファベット順にまとめた百科事典『意味について』を著した。 [6]紀元3世紀、ハルポクラチオンはホメロス語の辞典をアルファベット順に著した。[7]
10世紀には、ギリシャ語(スーダ)、アラビア語(イブン・ファリスのキターブ・アル・ムジマル・フィー・アル・ルガ)、聖書ヘブライ語(メナヘム・ベン・サルークのマフベレット・メナヘム)の主要なアルファベット辞典が作られました。相談を補助するものとしてのアルファベット順は 11 世紀のイタリアで栄え、ラテン語 (パピアスのエレメンタリウム) やタルムード アラム語(ネイサン ベン ジェヒエルのアルク) に関する作品が貢献しました。
12 世紀後半、キリスト教の説教者は、聖書の語彙を分析するためにアルファベット順のツールを採用しました。これがきっかけで、13 世紀にパリのドミニコ会修道士がユーグ・ド・サン・シェールのもとで聖書のアルファベット索引を編纂しました。聖ヒエロニムスの『ヘブライ語名の解釈』などの古い参考書は、参照しやすいようにアルファベット順に並べられました。アルファベット順の使用は当初、学生が研究分野をその独自の合理的な構造に従って習得することを期待していた学者から抵抗を受けました。その成功は、ロバート・キルワードビーの聖アウグスティヌスの著作索引などのツールによって推進されました。この索引は、読者が12 世紀のスコラ哲学で主流となった抜粋集に頼るのではなく、完全な原文にアクセスするのを助けました。アルファベット順の採用は、記憶の優位性から著作の優位性への移行の一部でした。 [8]情報をアルファベット順に並べるという考えは、12世紀と13世紀の百科事典の編纂者たちからも抵抗を受けた。彼らは皆、敬虔な教会信者だった。彼らは、資料を神学的に整理することを好んだ。つまり、デウス(神を意味する)から始まる神の創造の順序で整理することを好んだのだ。[2]
1604年、ロバート・カウドリーは、最初の単一言語英語辞書である表アルファベット順で、「あなたが見つけたい単語が(a)で始まる場合は、この表の先頭を見てください。しかし、(v)で始まる場合は、末尾を見てください」と説明しなければなりませんでした。[9] 1803年にはサミュエル・テイラー・コールリッジが「頭文字の偶然によって決定される配列」を持つ百科事典を非難しましたが、[10]今日では多くのリストがこの原則に基づいています。
ラテン文字での順序
基本的な順序と例
現代のISO 基本ラテン アルファベットの標準的な順序は次のとおりです。
- ABCDEFGHIJKLMNOPQRSTU-VWXYZ
単純なアルファベット順の例を次に示します。
- アスター、アストロラーベ、天文学、天体物理学、アタマン、攻撃、バア
別の例:
- フジツボ; である; あった; 利益; 曲がった
上記の単語はアルファベット順に並べられています。As はAsterの前に来ます。これは、同じ 2 つの文字で始まり、As はその後に文字がないのに対し、 Aster はそれ以降に文字があるからです。次の 3 つの単語は、4 番目の文字 (最初に異なる文字) がrで、アルファベットではe ( Asterの 4 番目の文字)の後にあるため、 Asterの後に来ます。これらの単語自体は、6 番目の文字 (それぞれl、n、p ) に基づいて並べられています。次にAtが来ますが、これは前の単語とは 2 番目の文字が異なります ( t はs の後にあります)。Ataman は、 Aster がAs の後にあるのと同じ理由で、At の後にあります。Attack は、3 番目の文字の比較に基づいてAtaman の後に来ます。Baaは、最初の文字が異なるため、他のすべての後に来ます。
複数単語の文字列の処理
順序付けする文字列の一部が複数の単語で構成されている場合、つまりスペースやハイフンなどの他の区切り文字が含まれている場合は、2 つの基本的なアプローチを取ることができます。最初のアプローチでは、すべての文字列は、次のシーケンスのように、最初に最初の単語に従って順序付けされます。
- オーク、オークヒル、オークリッジ、オークリーパーク、オークリー川
- ここで、 Oakという別の単語で始まるすべての文字列は、Oakleyで始まるすべての文字列よりも前にあります。これは、アルファベット順でOak がOakleyよりも前に来るためです。
2 番目の方法では、文字列はスペースがないかのようにアルファベット順に並べられ、次のシーケンスが生成されます。
- オーク、オークヒル、オークリーパーク、オークリーリバー、オークリッジ
- ここで、Oak Ridge は、 Oakley文字列の後に来るようになり、"Oakridge" と書かれるのと同じになります。
2番目のアプローチは辞書でよく採用されているもので[要出典]、出版社では辞書順と呼ばれることが多い。最初のアプローチは書籍索引でよく使用されているが、各出版社は伝統的にどのアプローチを使用するかについて独自の基準を設けており、1975年以前には書籍索引のISO標準( ISO 999 )は存在しなかった。
特別なケース
修正された文字
フランス語では、修飾文字(発音区別符号付きの文字など)は、アルファベット順の順序付けにおいて基本文字と同じように扱われます。たとえば、rôle はrockとrose の間にあり、 roleと書かれているかのように扱われます。ただし、このような文字を体系的に使用する言語では、通常、独自の順序付け規則があります。以下の § 言語固有の規則を参照してください。
姓による並び替え
姓が名の後に書かれる文化の多くでは、名前のリスト (電話帳など) を姓で最初に並べ替えることが依然として望まれます。この場合、名前を正しく並べ替えるには並べ替え順序を変更する必要があります。たとえば、Juan Hernandes と Brian O'Leary は、このように書かれていなくても、「Hernandes, Juan」と「O'Leary, Brian」として並べ替える必要があります。この規則をコンピューター照合アルゴリズムで取り込むのは複雑で、単純な試みは失敗します。たとえば、アルゴリズムが広範な姓のリストを自由に使用できない限り、「Gillian Lucille van der Waal」が「van der Waal, Gillian Lucille」なのか、「Waal, Gillian Lucille van der」なのか、あるいは「Lucille van der Waal, Gillian」なのかを判断する方法はありません。
学術的な文脈では、姓による順序付けが頻繁に見られる。複数の著者による単一の論文では、著者を逆年功序列や論文への主観的な貢献度などの他の方法ではなく、姓のアルファベット順に並べることは、「同様の貢献を認める」または「共同作業グループ内の不和を避ける」方法と見なされている。[11]特定の分野では、参考文献の引用を著者の姓で順序付ける慣行により、アルファベットの前の方に現れる姓を持つ著者に有利なバイアスが生じることが判明しているが、この影響は参考文献が年代順に並べられている分野では現れない。[12]
のその他の一般的な単語
フレーズが非常に一般的な単語 (文法では冠詞と呼ばれる「the」、「a」、「an」など) で始まる場合、その単語は無視されるかフレーズの末尾に移動されることがあります。ただし、常にそうであるとは限りません。たとえば、「The Shining」という本は、「Shining」または「Shining, The」として扱われ、本のタイトル「Summer of Sam」の前に置かれる場合があります。ただし、単に「The Shining」として扱われ、「Summer of Sam」の後に置かれる場合もあります。同様に、「A Wrinkle in Time」は、「Wrinkle in Time」、「Wrinkle in Time, A」、または「A Wrinkle in Time」として扱われる場合があります。これら 3 つのアルファベット順の方法は、アルゴリズムによって簡単に作成できますが、多くのプログラムでは、代わりに単純な辞書式順序に依存しています。
マック接頭辞
アイルランド語とスコットランド語の姓の接頭辞MとMc はMacの略語であり、完全な綴りがMac であるかのようにアルファベット順に並べられることがあります。したがって、 McKinley はMackintoshの前にリストされることがあります (「MacKinley」と綴った場合)。コンピューターでソートされたリストの出現以来、このタイプのアルファベット順はあまり見られなくなりましたが、英国の電話帳では今でも使用されています。
聖接頭辞
接頭辞StまたはSt. は「Saint」の略語であり、伝統的に完全な綴りのSaintとしてアルファベット順に並べられています。したがって、地名辞典では、St John'sがSalemの前に記載されることがあります(「Saint John's」と綴られているかのように)。コンピューターで並べ替えられたリストの出現以来、このタイプのアルファベット順はあまり見られなくなりましたが、今でも時々使用されています。
合字
英語のÆとŒのように、別個の文字とはみなされない合字(2つ以上の文字が1つの記号に結合されたもの)は、通常、文字が別個であるかのように照合されます。つまり、「æther」と「aether」は、他のすべての単語に対して同じ順序になります。これは、合字が借用語やブランド名 のように純粋に文体的なものではない場合にも当てはまります。
2 つの文字が合字で結合されているかどうかによってのみ異なる文字列をソートするには、特別なルールを採用する必要がある場合があります。
数字の扱い
文字列の一部に数字(またはその他の非文字) が含まれている場合、さまざまなアプローチが可能です。場合によっては、そのような文字は、アルファベットのすべての文字の前または後に来るものとして扱われます。別の方法としては、数字を綴りどおりにアルファベット順に並べ替える方法があります。たとえば、1776 は「seventeen seventy-six」と綴ったものとして並べ替えられ、24 heures du Mans は「vingt-quatre...」(フランス語で「24」) と綴ったものとして並べ替えられます。数字やその他の記号が文字の特殊なグラフィカル形式として使用されている場合 ( leetの1337や映画Seven ( Se7enとして様式化されました) など)、それらはそれらの文字であるかのように並べ替えられます。自然な並べ替え順序では、文字列がアルファベット順に並べ替えられますが、複数桁の数字は 1 つの文字として扱われ、数字によってエンコードされた数値の値によって並べ替えられます。
君主や教皇の場合、その番号はローマ数字で文字に似ていますが、通常は数字順に並べられます。そのため、たとえば、V は I の後ですが、デンマーク王のクリスチャン 9 世は、前任者のクリスチャン 8 世の後になります。
言語固有の規則
拡張ラテンアルファベットを使用する言語では、通常、追加文字の扱いについて独自の規則があります。また、一部の言語では、照合のために特定の二重音字が単一の文字として扱われます。たとえば、スペイン語のアルファベットでは、 ñ はnに続く基本文字として扱われ、二重音字chとll はそれぞれcとlに続く基本文字として扱われていました。現在、chとll は2文字の組み合わせとしてアルファベット順に並べられています。新しいアルファベット順の規則は、 1994年に王立スペインアカデミーによって発行されました。これらの二重音字はまだ正式に文字として指定されていましたが、2010年以降はそうではありません。一方、二重音字rr は予想どおりrquの後に続き(1994年のアルファベット順の規則以前もそうでした)、鋭アクセント付きの母音(á、é、í、ó、ú )は、文字üと同様に、常に基本文字と並行に並べられてきました。
アラビア語やキオワ語など、アルファベットの順序が完全に入れ替わっている場合もあります。
さまざまな言語で適用されるアルファベット順の規則を以下に示します。
- アラビア語では、現在使用されている28文字のアルファベットには2つの主な順序があります。標準的で最も一般的に使用されているのは、初期のアラブ言語学者ナスル・イブン・アシム・アル・レイシーによって作成されたヒジャーイー順序で、文字をその形状に基づいて並べる視覚的な順序付け方法が特徴です。たとえば、bāʾ (ب)、tāʾ (ت)、thāʾ (ث) は、同じ基本形状またはrasm (ٮ) を持つためグループ化され、 iʻjāmと呼ばれる子音の指示によってのみ区別されます。元のアブジャディ順序は、音声的に他のセム語やラテン語の順序に似ており、今日でも使用されていますが、通常はローマ数字に類似した文書内のリストの順序付けに限定されています。アブジャディ順序が番号付けに使用される場合、文字は、単語で使用される文字や数字と区別するために変更された形式で記述されます。例えば、アラビア数字の1 (١)と見た目が同じアリフ(ا) は、文字の下部から時計回りに小さな楕円形のループが伸び、その後に短い尾 (𞺀) が続きます。[要出典]これらの文字はデジタルではほとんど使用されませんが、Unicode ではアラビア数学アルファベット記号としてエンコードされています。[13]あまり一般的ではないṣawtī [ar]順は音声的に照合され、アル・ハリール・イブン・アフマド・アル・ファラヒディによって作成されました。
- アゼルバイジャン語では、標準のラテンアルファベットに 8 つの文字が追加されています。そのうち 5 つは母音で、i、ı、ö、ü、ə、3 つは子音で、ç、ş、ğ です。アルファベットはトルコ語と同じで、同じ音が同じ文字で書かれていますが、トルコ語には存在しない音のために q、x、ə の 3 つの追加文字があります。すべての「トルコ語の文字」はトルコ語のように「通常の」アルファベット順に並べられていますが、追加の 3 つの文字は、その音に近い文字の後に任意に並べられています。つまり、q は k の直後に並べられ、x (ドイツ語のchのように発音) は h の直後に並べられ、ə (英語の短縮形のaのように発音) は e の直後に並べられます。
- ブルトン語には「c」、「q」、「x」はありませんが、「b」と「d」の間に照合される二重音字「ch」と「c'h」があります。たとえば、「buzhugenn」、「chug」、「c'hoar」、「daeraouenn」(ミミズ、ジュース、姉妹、涙)などです。
- チェコ語とスロバキア語では、アクセント付き母音は二次的な照合重みを持ちます。つまり、他の文字と比較して、アクセントのない形として扱われます (チェコ語では A-Á、E-É-Ě、I-Í、O-Ó、U-Ú-Ů、Y-Ý、スロバキア語では A-Á-Ä、E-É、I-Í、O-Ó-Ô、U-Ú、Y-Ý)。ただし、アクセントのない文字の後に並べられます (たとえば、正しい辞書式順序は、チェコ語では baa、baá、báa、báá、bab、báb、bac、bác、bač、báč であり、baa、baá、baä、báa、báá、báä、bäa、bäá、bää、bab、báb、bäb、bac、bác、bäc です)。アクセントの付いた子音は、第一照合重みを持ち、アクセントのない子音のすぐ後に照合されます。ただし、Ď、Ň、Ť(チェコ語)とĎ、Ĺ、Ľ、Ň、Ŕ、Ť(スロバキア語)は第二照合重みを持ちます。CHは別の文字とみなされ、HとIの間に配置されます。スロバキア語では、DZとDŽも別の文字とみなされ、 ĎとEの間に配置されます。
- デンマーク語とノルウェー語のアルファベットにも、スウェーデン語と同じ追加の母音(下記参照)がありますが、順序とグリフが異なります(...、X、Y、Z、Æ、Ø、Å)。また、「Aa」は「Å」と同等とみなされます。デンマーク語のアルファベットでは伝統的に「W」は「V」の変形とみなされてきましたが、現在では「W」は別の文字とみなされています。
- オランダ語では、 IJ の組み合わせ ( IJを表す) は、以前は Y (または別の文字として: Y < IJ < Z) として照合されていましたが、現在はほとんどの場合 2 文字 (II < IJ < IK) として照合されています。例外は電話帳です。多くのオランダ人の姓では、現代の綴りでは IJ が必要なところで Y が使用されているため、ここでは IJ は常に Y として照合されます。大文字の I で書かれる ij で始まる単語は、大文字の J でも書かれることに注意してください。たとえば、IJmuiden という町、 IJsselという川、IJsland (アイスランド)という国名です。
- エスペラント語では、曲折アクセント付きの子音( ĉ、ĝ、ĥ、ĵ、ŝ ) とŭ (二音節付きの u ) は、別々の文字としてカウントされ、別々に照合されます (c、ĉ、d、e、f、g、ĝ、h、ĥ、i、j、ĵ ... s、ŝ、t、u、ŭ、v、z)。
- エストニア語 では、 õ、ä、ö、ü は別々の文字とみなされ、 wの後に並びます。文字š、z、ž は、借用語と外国の固有名詞にのみ現れ、エストニア語アルファベットでは文字sの後に並びますが、それ以外は基本的なラテンアルファベットと変わりません。
- フェロー語のアルファベットには、デンマーク語、ノルウェー語、スウェーデン語の追加文字であるÆとØ もあります。さらに、フェロー語のアルファベットでは、 Dの後にアイスランド語の eth を使用します。6 つの母音のうち、A、I、O、U、Yの 5 つにはアクセントを付けることができ、その後は別の文字と見なされます。子音C、Q、X、W、Z はありません。したがって、最初の 5 つの文字はA、Á、B、D、Ðで、最後の 5 つの文字はV、Y、Ý、Æ、Øです。
- フィリピン語(タガログ語)およびその他のフィリピン諸語では、Ng という文字は独立した文字として扱われます。これはsing、ping-pongなどのように発音されます。単独ではnangと発音されますが、一般的なフィリピン語の正書法では、2 つの独立した文字(n と g)であるかのように綴られます。また、派生文字( Ñなど)は基本文字の直後に続きます。フィリピン語も発音区別符号を使用して書かれますが、その使用は非常にまれです(チルダを除く)。
- フィンランド語のアルファベットと照合規則はスウェーデン語と同じです。
- フランス語では、単語の最後のアクセントによって順序が決まります。 [14]たとえば、フランス語では、次の4つの単語は次のように並べられます。cote < côte < coté < côté。文字eはe é è ê ë(œはoeとみなされます)の順序で並べられ、oも同様にô öの順序になります。
- ドイツ語では、ウムラウト付きの文字( Ä、Ö、Ü ) は、一般的にウムラウトなしのバージョンと同じように扱われます。ßは常に ss としてソートされます。これにより、アルファベット順は Arbeit、Arg、Ärgerlich、Argument、Arm、Assistant、Aßlar、Assoziation になります。電話帳や同様の名前リストでは、ウムラウトは文字の組み合わせ "ae"、"oe"、"ue" のように照合されます。これは、多くのドイツ人の姓がウムラウト付きとウムラウトなしの "e" (Müller/Mueller) の両方で表示されるためです。これにより、アルファベット順は Udet、Übelacker、Uell、Ülle、Ueve、Üxküll、Uffenbach になります。
- ハンガリー語の母音にはアクセント、ウムラウト、二重アクセントがあり、子音は一重、二重 (二重音字)、三重 (三重音字) の文字で表記されます。照合では、アクセント付きの母音はアクセントのない母音と同等であり、二重および三重文字は元の一重文字に従います。ハンガリー語のアルファベット順は次のとおりです。A=Á、B、C、Cs、D、Dz、Dzs、E=É、F、G、Gy、H、I=Í、J、K、L、Ly、M、N、Ny、O=Ó、Ö=Ő、P、Q、R、S、Sz、T、Ty、U=Ú、Ü=Ű、V、W、X、Y、Z、Zs。 (1984 年より前は、dzとdzs は照合では 1 文字ではなく、それぞれ 2 文字、つまり d+z と d+zs と見なされていました。) つまり、照合ではc がcsに先行するため、eg nádcukor はnádcsomóに先行する必要があります( s は通常u に先行しますが) 。母音の長さの違いは、2 つの単語がそれ以外は同一である場合にのみ考慮する必要があります (eg egér、éger )。句内のスペースとハイフンは照合では無視されます。Chは特定の単語で二重音字としても使用されますが、照合ではそれ自体が書記素とは見なされません。
- ハンガリー語の照合の特徴は、二重の二重音字および三重音字の短縮形 ( gy + gyのggyやdzs + dzsのddzsなど) は、短縮形であるという事実や二重音字または三重音字の要素とは関係なく、完全な形で書かれているかのように照合される必要があることです。たとえば、kaszinó はkassza の前に置かれます(アルファベットでは通常、4 番目の文字z はsの後に来ますが)。これは、単語kasszaの4 番目の「文字」(書記素) が2 番目のszと見なされるためです( sszをsz + szに分解)。これはi ( kaszinó内)の後に来ます。
- アイスランド語では、Þが追加され、D の次にはÐが続きます。各母音 (A、E、I、O、U、Y) の後には、対応するアキュート付きの母音Á、É、Í、Ó、Ú、Ý が続きます。Z はないので、アルファベットは ... X、Y、Ý、Þ、Æ、Ö で終わります。
- キオワ語は、歴史的なラテン語の順序ではなく、ブラーフミー文字のような音声原理に基づいて配列されています。最初に母音が来て、次に口の前から奥へ、そして声の開始時刻が負から正の順に破裂音、摩擦音、流音、鼻音が続きます。
- A、AU、E、I、O、U、B、F、P、V、D、J、T、TH、G、C、K、Q、CH、X、S、Z、L、Y、W、H、M、N
- リトアニア語では、特にリトアニア語の文字はラテン語の元の文字の後に続きます。もう 1 つの変更点は、Y がJ の直前に来ることです: ... G、H、I、Į、Y、J、K...
- ポーランド語では、特にラテンアルファベットから派生したポーランド文字が、元の文字の後に照合されます: A、Ą、B、C、Ć、D、E、Ę、...、L、Ł、M、N、Ń、O、Ó、P、...、S、Ś、T、...、Z、Ź、Ż。照合目的の二重音字は、2 つの別々の文字であるかのように扱われます。
- ピンインのアルファベット順では、単語はピンインで同じ基本文字を持ち、修飾する発音区別符号のみが異なるため、修飾されない文字が修飾される文字の前に来ます。たとえば、⟨e⟩は⟨ê⟩の前に来ます(額 ( è )は欸 ( ê̄ )の前に来ます)。また、⟨u⟩は⟨ü⟩の前に来ます(路 ( lù )は驢 ( lǘ )の前に、努 ( nǔ )は女 ( nǚ )の前に来ます)。同じピンイン文字(変形字⟨ê⟩と⟨ü⟩を含む)を持つ文字は、その声調に従って「第一声(すなわち「平声」)、第二声(上昇声)、第三声(下降上昇声)、第四声(下降声)、第五声(中性声)」の順に配置されます。例:「媽(mā)、麻(má)、馬(mǎ)、罵(mà)、嗎(ma)」。[a]
- ポルトガル語では、照合順序は英語と同じです: A、B、C、D、E、F、G、H、I、J、K、L、M、N、O、P、Q、R、S、T、U、V、W、X、Y、Z。二重音字と発音区別符号付きの文字はアルファベットに含まれません。
- ルーマニア語では、ラテンアルファベットから派生した特殊文字は、元の文字に従って照合されます: A、Ă、Â、...、I、Î、...、S、Ș、T、Ț、...、Z。
- セルビア・クロアチア語およびその他の関連する南スラブ語では、5 つのアクセント付き文字と 3 つの結合文字は、元の文字に従って並べられています: ...、C、Č、Ć、D、DŽ、Đ、E、...、L、LJ、M、N、NJ、O、...、S、Š、T、...、Z、Ž。
- スペイン語では (1994 年まで)、「CH」と「LL」を 1 文字として扱い、cinco、credo、chispaとlomo、luz、llamaの順序にしていました。1994年にRAE がより慣例的な使用法を採用して以来、これは当てはまらなくなり、現在では LL は LK と LM の間に、CH は CG と CI の間に照合されます。分音記号付きの 6 つの文字 Á、É、Í、Ó、Ú、Ü は、元の文字 A、E、I、O、U として扱われます。たとえば、radio、ráfaga、rana、rápido、rastrilloです。スペイン語特有の照合問題は、Ñ ( eñe ) が N の後に照合される別の文字であるかどうかだけです。
- スウェーデン語のアルファベットには、末尾に3 つの追加の母音(...、X、Y、Z、 Å、Ä、Ö )があり、デンマーク語やノルウェー語のアルファベットに似ていますが、グリフと照合順序が異なります。文字「W」は「V」の変形として扱われてきましたが、 Svenska Akademiens ordlistaの第 13 版(2006 年) では「W」は別の文字と見なされました。
- トルコ語のアルファベットには、ç、ğ、ı、ö、ş、ü の 6 つの追加文字があります (q、w、x はありません)。ç は c の後、ğ は g の後、ı はi の前、ö は o の後、ş は s の後、ü は u の後というように並べられます。もともと、1928 年にアルファベットが導入されたとき、ı は i の後に並べられていましたが、後に順序が変更され、点、セディーユ、またはその他の装飾マークを含む形状の文字は、常に対応する裸の形状の文字の後に続くようになりました。トルコ語の正書法では、文字 I は点のない ı の大文字であり、İ は点のある i の大文字であることに注意してください。
- 多くのテュルク系言語(アゼルバイジャン語やタタール語のジャアリフ正書法など)では、かつてはGとHの間にGha (Ƣƣ) という文字がありました。現在では使われていません。
- ベトナム語には、 ă、â、đ、ê、ô、ơ、ư の7 つの追加文字がありますが、 f、j、w、zは存在しませんが、インターネット アドレスや外国語からの借用語など、現在でも一部で使用されています。「f」は「ph」の組み合わせに置き換えられます。「w」の場合と同じで、「qu」です。
- ヴォラピュク語 ではä、ö、üは別々の文字として数えられ、別々に並べられます(a、ä、b ... o、ö、p ... u、ü、v)。一方、qとwは存在しません。[15]
- ウェールズ語では、二重音字 CH、DD、FF、NG、LL、PH、RH、および TH は単一の文字として扱われ、それぞれがペアの最初の文字の後にリストされ (NG は G の後にリストされます)、順序は A、B、C、CH、D、DD、E、F、FF、G、NG、H などになります。ただし、単語の複合により、二重音字を形成しない2 つの文字が並置されることがあります。例として、単語 LLONGYFARCH (LLON + GYFARCH から構成) が挙げられます。この結果、たとえば LAWR、LWCUS、LLONG、LLOM、LLONGYFARCH のような順序になります (NG は LLONG では二重音字ですが、LLONGYFARCH では二重音字ではありません)。 R+H の文字の組み合わせ (二重音字 RH とは異なります) は、複合語で並置することによって同様に発生することがありますが、誤認によって順序が変わるようなペアは生成されない傾向があります。発生する可能性のあるその他の紛らわしい文字の組み合わせ、つまり D+D や L+L については、綴りにハイフンが使用されます (例: AD-DAL、CHWIL-LYS)。
オートメーション
照合アルゴリズム(ソートアルゴリズムと組み合わせて)は、コンピュータプログラミングで文字列をアルファベット順に並べるために使用されます。標準的な例としては、Unicode照合アルゴリズムがあります。これは、任意のUnicodeシンボルを含む文字列をアルファベット順(の拡張)に並べるために使用できます。[14]デフォルトの照合テーブルを調整することで、上記の言語固有の規則のほとんどに準拠させることができます。このような調整のいくつかは、共通ロケールデータリポジトリに収集されています。
類似の順序
アルファベット順の原則は、厳密にはアルファベットを使用しない言語(たとえば、音節文字やアブギダを使用して記述される言語)でも、使用される記号に確立された順序がある限り、適用できます。
中国の漢字や日本の漢字などの表意文字表記体系では、記号の順序を定義する方法として、部首と画数の並び替えの方法が頻繁に使用されます。日本語では発音順が使用されることがあり、最も一般的なのは五十音順ですが、古いいろは順が使用されることもあります。
数学において、辞書式順序はアルファベット順の順序を生成するために使用される方法に類似した方法でシーケンスを順序付ける手段である。[16]
一部のコンピュータ アプリケーションでは、文字のASCIIまたはUnicodeコードのみに基づいた非常に単純なアルゴリズムを使用して実現できるアルファベット順のバージョンが使用されています。これにより、すべての大文字が小文字の前に配置されるなど、非標準の効果が生じる場合があります。ASCII順を参照してください。
押韻辞書は、単語の最後の文字から最初の文字までアルファベット順に単語を分類することに基づいています。
参照
注記
- ^ 例外があります。ABC中英辞典では、声調の順序は「ゼロトーン(中性音)、第1トーン(平坦音)、第2トーン(上昇音)、第3トーン(下降上昇音)、第4トーン(下降音)」です。
参考文献
- ^ ラインハルト・G・レーマン:「27-30-22-26。アルファベットにはいくつの文字が必要か?セム語の場合」『書くことの考え方:国境を越えて書くこと』アレックス・デ・ヴォーグトとヨアヒム・フリードリヒ・クワック編、ライデン:ブリル社、2012年、11~52頁。
- ^ abc Street, Julie (2020年6月10日). 「AからZまで - アルファベット順の驚くべき歴史」(テキストと音声) . ABC News (ABC Radio National) . オーストラリア放送協会。2020年7月2日時点のオリジナルよりアーカイブ。2020年7月6日閲覧。
- ^ 例えば、ヘブライ語聖書の詩篇25、34、37、111、112、119、145
- ^ デイリー、ロイド。古代と中世のアルファベット化の歴史への貢献。ブリュッセル、1967年、p.25。
- ^ オハラ、ジェームズ (1989)。 「メッサプス、キクナス、そしてバージルのイタリア英雄カタログのアルファベット順」。フェニックス。43 (1): 35-38。土井:10.2307/1088539。JSTOR 1088539。
- ^ LIVRE XI – texte latin – traduction + commentaires. 2012年6月9日時点のオリジナルよりアーカイブ。2012年5月8日閲覧。
- ^ ギブソン、クレイグ(2002年)。古典の解釈:デモステネスと古代の注釈者。
- ^ ラウズ、メアリー A.; ラウズ、リチャード M. (1991)、「Statim invenire : Schools, Preachers and New Attitudes to the Page」、Authentic Witnesses: Approaches to Medieval Texts and Manuscripts、University of Notre Dame Press、pp. 201–219、ISBN 0-268-00622-9
- ^ カウドリー、ロバート (1604)。アルファベット順表。ロンドン。p. [A4]v.
- ^ コールリッジの手紙、第507号。
- ^ Tscharntke, Teja; Hochberg, Michael E; Rand, Tatyana A; Resh, Vincent H; Krauss, Jochen (2007年1月). 「複数の著者による出版物における著者順序と貢献のクレジット」. PLOS Biol . 5 (1): e18. doi : 10.1371/journal.pbio.0050018 . PMC 1769438. PMID 17227141 .
- ^ Stevens, Jeffrey R.; Duque, Juan F. (2018). 「順序が重要: 本文中の引用をアルファベット順に並べると引用率が変わる」(PDF) . Psychonomic Bulletin & Review . 26 (3): 1020–1026. doi : 10.3758/s13423-018-1532-8 . PMID 30288671. S2CID 52922399. 2018年11月10日時点のオリジナルよりアーカイブ(PDF) . 2018年11月10日閲覧。
- 一般向け要約: Colleen Flaherty (2018 年 10 月 22 日)。「著者名のアルファベット順化に反対するケース」Inside Higher Ed。
- ^ 「アラビア語の数学アルファベット記号」(PDF)。Unicode標準。2022年10月30日時点のオリジナルよりアーカイブ(PDF) 。 2022年11月26日閲覧。
- ^ ab 「Unicode Technical Standard #10: Unicode collation algorithm」。Unicode, Inc. (unicode.org)。2008年3月20日。2008年8月27日時点のオリジナルよりアーカイブ。2008年8月27日閲覧。
- ^ Midgley, Ralph. 「Volapük to English dictionary」(PDF) 。 2012年9月1日時点のオリジナル(PDF)よりアーカイブ。 2019年9月24日閲覧。
- ^ フランツ・バーダー、トビアス・ニプコウ (1999)。用語の書き換えとそのすべて。ケンブリッジ大学出版局。pp. 18–19。ISBN 978-0-521-77920-3。
さらに読む
- ショーヴァン、イヴォンヌ。アルファベットのクラス分けの練習。第4版パリ: ボルダス、1977 年。ISBN 2-04-010155-1
- フランダース、ジュディス。『すべてのもののための場所:アルファベット順の奇妙な歴史』。ニューヨーク:ベーシックブックス/ハッチェットブックス、2020年。ISBN 978-1-5416-7507-0
