文字頻度とは、書き言葉にアルファベットの文字が平均して現れる回数である。文字頻度分析は、暗号を解読する方法を正式に開発したアラブの数学者アル・キンディー(紀元 801年頃~873年)にまで遡る。文字頻度分析は、1450年の移動式活字の開発によりヨーロッパで重要になった。移動式活字では、各文字に必要な活字の量を推定する必要がある。言語学者は、言語を識別するための基本的な手法として文字頻度分析を使用しており、未知の書記体系がアルファベット、音節文字、表意文字のいずれであるかを示すのに特に効果的である。
文字の頻度と頻度分析の使用は、暗号や、ハングマン、スクラブル、ワードル[2]、テレビゲーム番組ホイールオブフォーチュンなどのいくつかの単語パズルゲームで基本的な役割を果たしています。英語の文字の頻度の知識を暗号の解読に適用した古典文学の最も古い記述の1つは、エドガーアランポーの有名な物語「黄金虫」に見られ、この方法はキャプテンキッドが隠した宝の場所を示すメッセージの解読に成功しました。[3] [要出典]
ハーバート・S・ジムは、暗号学の入門書として名高い『コードと秘密の書き方』の中で、英語の文字の頻度順を「ETAON RISHD LFCMU GYPWB VKJXZQ」、最も一般的な文字のペアを「TH HE AN RE ER IN ON AT ND ST ES EN OF TE ED OR TI HI AS TO」、最も一般的な重複文字を「LL EE SS OO TT FF RR NN PP CC」としている。[4]数え方によって順序が多少異なる場合がある。
文字の頻度は、一部のキーボードレイアウトのデザインにも大きな影響を及ぼします。最も頻繁に使用される文字は、Blickensderfer タイプライター、Dvorak キーボードレイアウト、Colemakおよびその他の最適化されたレイアウトのホーム列に配置されます。
背景

テキスト内の文字の頻度は、暗号解読、特に頻度分析に使用するために研究されており、その歴史は、この方法を正式に開発したアラブの数学者アル=キンディー(紀元801年頃-873年)にまで遡ります(この技術で解読可能な暗号は、少なくともジュリアス・シーザーが使用したシーザー暗号まで遡ります[要出典]。したがって、この方法は古典時代に研究されていた可能性があります)。文字頻度分析は、1450年の移動式活字の開発によりヨーロッパでさらに重要になりました。移動式活字では、活版印刷の活字ケースの文字区画のサイズの違いからわかるように、各字形に必要な活字の量を推定する必要があります。
特定の言語に正確な文字頻度分布があるわけではありません。なぜなら、書き手によって書き方が少しずつ異なるからです。しかし、ほとんどの言語には、長いテキストで強く現れる特徴的な分布があります。古英語から現代英語への極端な言語変化(相互に理解不可能とみなされる)でさえ、関連する文字頻度に強い傾向が見られます。聖書の一節の小さなサンプルを、頻度の高いものから低いものの順に並べてみると、古英語のenaid sorhm tgþlwu æcfy ðbpxzは現代英語のeotha sinrd luymw fgcbp kvjqxzに相当しますが、最も極端な文字形態の違いは共通していません。[5]
英語用のライノタイプ機は、手動の植字工の経験と慣習に基づいて、最も一般的なものから最も一般的でないものの文字の順序をetaoin shrdlu cmfwyp vbgkqj xzと想定しました。フランス語の場合、これに相当するのはelaoin sdrétu cmfhyp vbgwqj xzでした。
モールス信号のアルファベットを、送信に要する時間が等しい文字のグループに分け、これらのグループを昇順で並べると、e it san hurdm wgvlfbk opxcz jyqになります。[a]文字周波数は、マレー・コードなどの他の電信システムでも使用されていました。
同様の考え方は、ハフマン符号化などの現代のデータ圧縮技術でも使用されています。
文字の頻度は、単語の頻度と同様に、作家や主題によって異なる傾向があります。たとえば、フィクションでは⟨d⟩ がより頻繁に使用されます。これは、ほとんどのフィクションが過去形で書かれ、ほとんどの動詞が語形変化の接尾辞-ed / -dで終わるためです。X 線についてのエッセイを書くとき、⟨x⟩ を頻繁に使用しないわけにはいきません。作家によって習慣があり、それが文字の使い方に反映されます。たとえば、ヘミングウェイの文体はフォークナーのものと明らかに異なります。文字、バイグラム、トライグラム、単語の頻度、単語の長さ、文の長さを特定の作家について計算し、文体がそれほど大きく異なることのない作家であっても、テキストの著者であることを証明または反証するために使用できます。
正確な平均文字頻度は、大量の代表的なテキストを分析することによってのみ収集できます。現代のコンピューティングと大規模なテキストコーパスのコレクションを利用すれば、そのような計算は簡単に行うことができます。さまざまなソース(報道、宗教テキスト、科学テキスト、一般的なフィクション)から例を挙げることができますが、特に一般的なフィクションでは⟨h⟩と⟨i⟩の位置に違いがあり、⟨h⟩がより一般的になっています。
言語の方言の違いも文字の出現頻度に影響する。例えば、アメリカの作家は、同じテーマで執筆したイギリスの作家よりも⟨z⟩が一般的な作品を書くだろう。アメリカ英語では「analyze」「apologize」「recognize」などの単語にこの文字が含まれるが、イギリス英語では同じ単語が「analyse」「apologise」「recognise」と綴られる。これは、イギリスの作家が英語で⟨z⟩をほとんど使用しないため、この文字の出現頻度に大きく影響するだろう。[6]
「上位 12」文字は、総使用数の約 80% を占めます。「上位 8」文字は、総使用数の約 65% を占めます。ランクの関数としての文字頻度は、いくつかのランク関数でうまく適合できますが、2 パラメータのCocho/Beta ランク関数が最も適しています。[7]調整可能な自由パラメータを持たない別のランク関数も、文字頻度分布にかなりよく適合します[8] (同じ関数は、タンパク質配列のアミノ酸頻度の適合に使用されています。[9] ) VIC 暗号またはストラドリング チェッカーボードに基づくその他の暗号を使用するスパイは、通常、上位 8 文字を記憶するために、「a sin to err」(2 番目の「r」を省略) [10] [11]または「at one sir」[12]などの記憶術を使用します。
英語における文字の相対的頻度

文字の頻度を数える方法は 3 つあり、一般的な文字の表は非常に異なります。下の表で使用されている最初の方法は、辞書の見出し語で文字の頻度を数える方法です。見出し語は、その標準的な形式の単語です。2 番目の方法は、カウント時に「abstracts」、「abstracted」、「abstracting」など、単語のすべての変形を含める方法で、「abstract」の見出し語だけではありません。この 2 番目の方法では、インターネットで最も使用されている英語の単語のリストから文字を数える場合など、 ⟨s⟩などの文字がはるかに頻繁に表示されます。⟨s⟩は、複数形や三人称単数現在時制の動詞を形成するために追加されるため、屈折語 (見出し語以外の形式) で特によく使用されます。最後の方法は、実際のテキストでの使用頻度に基づいて文字を数えることです。その結果、 「the」、「then」、「both」、「this」などの一般的な単語が頻繁に使用されるため、 ⟨th⟩などの特定の文字の組み合わせがより一般的になります。このような絶対的な使用頻度の測定は、キーボードレイアウトや旧式の印刷機での文字の頻度を作成するときに使用されます。
コンサイス・オックスフォード辞書の項目を、単語の使用頻度を無視して分析すると、「EARIOTNSLCUDPMHGBFYWKVXZJQ」という順序になる。[13]
以下の文字頻度表は、ロバート・ルワンドの「暗号数学」を引用したパベル・ミカのウェブサイトから引用したものです。[14]
Lewandによれば、出現頻度の高いものから低いものの順に並べると、文字はetaoinshrdlcumwfgypbvkjxqzとなる。Lewandの順序は、40,000語を測定して表を作成したCornell University Math Explorer's Projectなどの他の順序とは少し異なる。[15]
英語では、スペース文字は一番上の文字(⟨e⟩)のほぼ2倍の頻度で出現し[16] 、アルファベット以外の文字(数字、句読点など)は、スペースを含めて⟨t⟩と⟨a⟩の間の4番目の位置を占めます。[17]
英語の単語の最初の文字の相対頻度
単語や名前の最初の文字の頻度は、物理的なファイルや索引のスペースを事前に割り当てるのに役立ちます。[18]ファイルキャビネットの引き出しが26個ある場合 、1つの引き出しにアルファベットの1文字を1:1で割り当てるのではなく、いくつかの低頻度の文字を同じ引き出しに割り当て(多くの場合、1つの引き出しにVWXYZというラベルが付けられています)、最も頻度の高い最初の文字(⟨s、a、c⟩ )をいくつかの引き出し(多くの場合、Aa-An、Ao-Az、Ca-Cj、Ck-Cz、Sa-Si、Sj-Szの6つの引き出し)に分割することで、より等頻度の文字コードを使用すると便利な場合がよくあります。同じシステムは、一部の百科事典などの複数巻の作品で使用されています。名前をより等頻度のコードにマッピングする別の方法であるカッター番号は、一部の図書館で使用されています。
全体の文字分布と単語の先頭の文字分布はどちらもジップ分布にほぼ一致し、さらにユール分布に近い。[19]
多くの場合、各データの最初の桁の頻度分布は、数値データセット内のすべての桁の全体的な頻度とは大幅に異なります。これはベンフォードの法則として知られています。
ピーター・ノーヴィグは、光学文字認識(OCR)を使用して転写されたGoogleブックスのデータに10万回以上出現する単語を 分析し、英語の単語の最初の文字の頻度などを決定しました。[20]
他の言語における文字の相対的頻度
下の図は、いくつかの言語における最も一般的な 26 個のラテン文字の頻度分布を示しています。これらの言語はすべて、25 文字以上の同様のアルファベットを使用しています。

これらの表に基づくと、各言語の「etaoin shrdlu」に相当するものは次のとおりです。
- フランス語: 'esaitn ruoldc'; (インド・ヨーロッパ語族: ロマンス語; 伝統的には、発音のしやすさから'esartinulop'が使用される[34] )
- スペイン語: 'eaosrn idltcm'; (インド・ヨーロッパ語族: ロマンス語)
- ポルトガル語: 'aeosri dmntcu' (インド・ヨーロッパ語族: ロマンス語)
- イタリア語: 'eaionl rtscdu'; (インド・ヨーロッパ語: ロマンス語)
- ドイツ語: 'ensria tdhulg'; (インド・ヨーロッパ語族: ゲルマン語)
- スウェーデン語: 'eanrts ildomk'; (インド・ヨーロッパ語族: ゲルマン語)
- トルコ語: 「アインルル・ドゥクミット」; (アルタイ語: チュルク語)
- オランダ語: 'enatir odslgv'; (インド・ヨーロッパ語族: ゲルマン語) [29]
- ポーランド語: 'aioezn rwstcy'; (インド・ヨーロッパ語族: スラヴ語)
- デンマーク語: 'erntai dslogk'; (インド・ヨーロッパ語族: ゲルマン語族)
- アイスランド語: 'arnies tulðgm'; (インド・ヨーロッパ語族: ゲルマン語族)
- フィンランド語: 'aintes loukäm'; (ウラル語: Finnic)
- チェコ語: 'aeonit vsrldk'; (インド・ヨーロッパ語族: スラブ語)
- ハンガリー語: 「eatlsn kizroá」。 (ウラル語: ウゴル語)
参照
説明ノート
- ^ アメリカのモールス信号は、英語の文字頻度に基づいて、最も頻繁に使用される文字を最短の記号で符号化するために、 1830年代にアルフレッド・ヴェイルによって開発されました。現在使用されている改良版である国際モールス信号では、効率性がいくらか失われました。
参考文献
- ^ Mička, Pavel. 「Letter Frequency (English)」. Algoritmy.net . 2021年3月4日時点のオリジナルよりアーカイブ。 2022年6月14日閲覧。
出典は、Leland, Robert. Cryptological mathematical mathematical. [sl] : The Mathematical Association of America, 2000. 199 p. ISBN 0-88385-719-7
- ^ ギネス、ハリー。「Wordleで勝つための最良の開始単語」 。Wired。ISSN 1059-1028 。2022年2月12日閲覧。
- ^ ポー、エドガー・アラン。「エドガー・アラン・ポーの作品全5巻」。プロジェクト・グーテンベルク。
- ^ ジム、ハーバート・スペンサー(1961年)。コードと秘密の執筆:公認要約。スコラスティック・ブック・サービス。OCLC 317853773 。
- ^ Moreno, Marsha Lynn (2005年春)。「言語革新の観点から見た頻度分析」(PDF)。数学。カリフォルニア大学サンディエゴ校。 2015年2月19日閲覧。
- ^ 「イギリス英語とアメリカ英語のスペル - Oxford Dictionaries」。Oxford Dictionaries - 英語。2011年12月28日時点のオリジナルよりアーカイブ。2018年4月18日閲覧。
- ^ Li, Wentian; Miramontes, Pedro (2011). 「米国およびメキシコ大統領演説における英語およびスペイン語の文字頻度分布のランク付け」。Journal of Quantitative Linguistics . 18 (4): 359. arXiv : 1103.2950 . doi :10.1080/09296174.2011.608606. S2CID 1716455.
- ^ Gusein-Zade, SM (1988). 「ロシア語における文字の頻度分布」. Probl. Peredachi Inf . 24 (4): 102–107.
- ^ Gamow, George; Ycas, Martynas (1955). 「タンパク質とリボ核酸組成の統計的相関」Proc. Natl. Acad. Sci . 41 (12): 1011–1019. Bibcode :1955PNAS...41.1011G. doi : 10.1073/pnas.41.12.1011 . PMC 528190. PMID 16589789 .
- ^ バウアー、フリードリヒ L. (2006)。『暗号解読:暗号学の方法と格言』シュプリンガー、p. 57。ISBN 9783540481218– Google ブックス経由。
- ^ Goebel, Greg (2009). フィールド暗号の台頭: チェッカーボード暗号のまたがり。
- ^ Rijmenants、ディルク。 「ワンタイムパッド」。
- ^ 「英語のアルファベット文字の頻度はどれくらいですか?」オックスフォード辞典。オックスフォード大学出版局。2011年12月24日時点のオリジナルよりアーカイブ。 2012年12月29日閲覧。
- ^ Mička, Pavel. 「文字頻度(英語)」. Algoritmy.net.
- ^ 「英語の文字頻度(40,000語のサンプルに基づく)」。cornell.edu 。2021年1月24日閲覧。
- ^ 「英語テキストの統計的分布」。data -compression.com。2017年9月18日時点のオリジナルよりアーカイブ。
- ^ Lee, E. Stewart. 「コンピュータセキュリティに関するエッセイ」(PDF)。ケンブリッジ大学コンピュータ研究所。p. 181。
- ^ Ohlman, Herbert Marvin (1959)。主語と単語の文字頻度とスーパーインポーズコーディングへの応用。国際科学情報会議の議事録。doi : 10.17226 / 10866。ISBN 978-0-309-57421-1。
- ^ Pande, Hemlata; Dhami, HS「ヒンディー語のテキストにおける文字と単語の頭文字の出現の数学的モデル化」(PDF) . JTL . 16 .
- ^ 「英語の文字頻度カウント:Mayzner再考またはETAOIN SRHLDCU」norvig.com 。 2018年4月18日閲覧。
- ^ 「Corpus de Thomas Tempé」。2007年9月30日時点のオリジナルよりアーカイブ。2007年6月15日閲覧。
- ^ Beutelspacher、アルブレヒト (2005)。暗号学(第 7 版)。ヴィースバーデン: Vieweg。 p. 10.ISBN 3-8348-0014-7。
- ^ プラット、フレッチャー (1942)。『秘密と緊急:暗号と暗号の物語』。ガーデンシティ、ニューヨーク:ブルーリボンブックス。pp. 254–5。OCLC 795065。
- ^ “ポルトガル語の周波数”. 2009 年 8 月 3 日のオリジナルからアーカイブ。2009 年6 月 16 日に取得。
- ^ シン、サイモン;ガリ、ステファノ (1999)。Codici e Segreti (イタリア語)。ミラノ:リッツォーリ。ISBN 978-8-817-86213-4. OCLC 535461359.
- ^ Serengil, Sefik Ilkin; Akin, Murat (2011 年 2 月 20 ~ 22 日)。同音異義語暗号で暗号化されたトルコ語テキストへの攻撃(PDF)。第 10 回 WSEAS 国際エレクトロニクス、ハードウェア、ワイヤレス、光通信会議の議事録。ケンブリッジ、英国。pp. 123 ~ 126。
- ^ 「Practical Cryptography」 。 2013年10月30日閲覧。
- ^ “Frekwencja liter w polskich tekstach - Poradnia językowa PWN”.
- ^ ab 「文字頻度」。ゲノッチャップ・オンゼタール。2009 年5 月 17 日に取得。
- ^ 「デンマーク語の文字頻度」。実用暗号学。 2013年10月24日閲覧。
- ^ 「アイスランドの文字頻度」。実用暗号学。 2013年10月24日閲覧。
- ^ 「フィンランド語の文字頻度」。実用暗号学。 2013年10月24日閲覧。
- ^ 「ハンガリー語の文字頻度」。Wolfram Alphaサイト。2023年3月25日閲覧。
- ^ ペレック、ジョルジュ;アルファベット;ガリラヤ版、1976
外部リンク
- Lewand, Robert Edward. 「暗号数学」。pages.central.edu。2007-04-02 にオリジナルからアーカイブ。
- 「いくつかの一般的な言語における文字の頻度ランキングの例」www.bckelk.org.uk。
- 「さまざまなキーボード レイアウトでのテキストの文字頻度を示す JavaScript ヒートマップ視覚化」。www.patrick-wied.at。
- Norvig, Peter. 「Google ブックの Ngrams データ セットを使用した Mayzner の研究の更新バージョン」. norvig.com.
- 文字の頻度—simia.net
便利な表
3 文字から 7 文字の長さの単語の長さと文字位置の組み合わせを考慮した、20,000 語に基づく単一文字、二文字目、三文字目、四文字目、五文字目の頻度に関する便利な表です。
- Mayzner, MS; Tresselt, ME; Wolin, BR ( 1965) 。「さまざまな単語の長さと文字の位置の組み合わせに対する単文字と二文字の頻度カウント表」。Psychonomic Monograph Supplements。1 (2): 13–32。OCLC 639975358。
- Mayzner, MS; Tresselt, ME; Wolin, BR (1965)。「さまざまな単語の長さと文字の位置の組み合わせに対するトリグラム頻度カウントの表」。Psychonomic Monograph Supplements。1 ( 3): 33–78。
- Mayzner, MS; Tresselt, ME; Wolin, BR (1965)。「さまざまな単語の長さと文字の位置の組み合わせに対するテトラグラムの頻度カウント表」。Psychonomic Monograph Supplements 1 (4): 79–143。
- Mayzner, MS; Tresselt, ME; Wolin, BR (1965) 「さまざまな単語の長さと文字の位置の組み合わせに対する五芒星の頻度カウント表」Psychonomic Monograph Supplements . 1 (5): 144–190。
