
暗号解読において、頻度分析(文字数カウントとも呼ばれる)とは、暗号文中の文字または文字群の出現頻度を調べる手法である。この方法は、古典的な暗号を解読する際の補助として用いられる。
頻度分析は、任意の書き言葉において、特定の文字や文字の組み合わせがさまざまな頻度で出現するという事実に基づいています。さらに、その言語のほぼすべてのサンプルでほぼ同じ特徴的な文字分布が存在します。たとえば、英語のセクションが与えられた場合、E、T、AそしてOが最も一般的ですが、Z、Q、XそしてJまれです。同様に、TH、ER、の上、 そしてアンは最も一般的な文字のペア(バイグラムまたはダイグラフと呼ばれる)であり、SS、EE、TT、 そしてFF最も一般的な繰り返しです。[ 1 ]無意味なフレーズetaoin shrdluは、典型的な英語のテキストで最も頻繁に出現する 12 文字を表しています。
一部の暗号では、自然言語の平文のこのような特性が暗号文にも保持され、これらのパターンは暗号文のみの攻撃で悪用される可能性がある。
単純な換字式暗号では、平文の各文字が別の文字に置き換えられ、平文中の特定の文字は常に暗号文中の同じ文字に変換されます。たとえば、文字「平文」のすべての出現箇所が「平文」の場合、e手紙に変えるX文字が多数含まれる暗号文メッセージX暗号解読者に示唆するであろうことはX表現するe。
頻度分析の基本的な使い方は、まず暗号文の文字の出現頻度を数え、次に推測した平文の文字をそれらと関連付けることです。X暗号文中のsは、他の何よりも、X対応するe平文ではそうかもしれないが、これは確実ではない。tそして1英語でも非常に一般的です。Xどちらの可能性もある。平文である可能性は低い。zまたはqこれらはあまり一般的ではない。そのため、暗号解読者は暗号文と平文の文字の対応関係をいくつか組み合わせて試す必要があるかもしれない。
統計のより複雑な使用法も考えられます。例えば、文字のペア(バイグラム)、トリプレット(トライグラム)などの数を考慮することです。これは、暗号解読者により多くの情報を提供するために行われます。QそしてU英語ではほぼ常にその順序で一緒に出現するが、Qそれ自体が稀なことである。
イブが以下の暗号文を傍受し、それが単純な換字式暗号で暗号化されていることがわかっていると 仮定します。
LIVITCSWPIYVEWHEVSRIQMXLEYVEOIEWHRXEXIPFEMVEWHKVSTYLXZIXLIKIIXPIJVSZEYPERRGERIM WQLMGLMXQERIWGPSRIHMXQEREKIETXMJTPRGEVEKEITREWHEXXLEXXMZITWAWSQWXSWEXTVEPMRXRSJ GSTVRIEYVIEXCVMUIMWERGMIWXMJMGCSMWXSJOMIQXLIVIQIVIXQSVSTWHKPEGARCSXRWIEVSWIIBXV IZMXFSJXLIKEGAEWHEPSWYSWIWIEVXLISXLIVXLIRGEPIRQIVIIBGIIHMWYPFLEVHEWHYPSRRFQMXLE PPXLIECCIEVEWGISJKTVWMRLIHYSPHXLIQIMYLXSJXLIMWRIGXQEROIVFVIZEVAEKPIEWHXEAMWYEPP XLMWYRMWXSGSWRMHIVEXMSWMGSTPHLEVHPFKPEZINTCMXIVJSVLMRSCMWMSWVIRCIGXMWYMX
この例では、大文字は暗号文を表すために使用され、小文字は平文(または平文の推測)を表すために使用され、X~t暗号文の文字を推測するために使用されますX平文の文字を表すt。
イブは、次のような方法で頻度分析を使ってメッセージを解読することができた。暗号文中の文字数を数えると、私は最も一般的な一文字です。[ 2 ]XL最も一般的なバイグラム、そして41は最も一般的な三爻です。e英語で最も一般的な文字は、thは最も一般的なバイグラムであり、のは最も一般的な三爻です。これは、X~t、L~hそして 私~e暗号文で2番目に多い文字はE;英語で最初と2番目に頻繁に使われる文字なので、eそしてtすべて把握されているので、イヴはE~1は3番目に多く出現する文字です。これらの仮定に基づいて、以下の部分的な復号化メッセージが得られます。
heVeTCSWPeYVaWHaVSReQMthaYVaOeaWHRtatePFaMVaWHKVSTYhtZetheKeetPeJVSZaYPaRRGaReM WQhMGhMtQaReWGPSReHMtQaRaKeaTtMJTPRGaVaKaeTRaWHatthattMZeTWAWSQWtSWatTVaPMRtRSJ GSTVReaYVeatCVMUeMWaRGMeWtMJMGCSMWtSJOMeQtheVeQeVetQSVSTWHKPaGARCStRWeaVSWeeBtV eZMtFSJtheKaGAaWHaPSWYSWeWeaVtheStheVtheRGaPeRQeVeeBGeeHMWYPFhaVHaWHYPSRRFQMtha PPtheaCCeaVaWGeSJKTVWMRheHYSPHtheQeMYhtSJtheMWReGtQaROeVFVeZaVAaKPeaWHtaAMWYaPP thMWYRMWtSGSWRMHeVatMSWMGSTPHhaVHPFKPaZeNTCMteVJSVhMRSCMWMSWVeRCeGtMWYMt
これらの初期推測を利用して、イブは自分の選択を裏付けるパターンを見つけることができる。それさらに、他のパターンからもさらなる推測が示唆される。ルート「かもしれない」州「、つまりR~s同様に「atthattMZe「は次のように推測できる」その時、M~私そしてZ~m。 さらに、 "彼は「かもしれない」ここ「、V~rこれらの推測を当てはめると、イブは次の結果を得る。
hereTCSWPeYraWHarSseQithaYraOeaWHstatePFairaWHKrSTYhtmetheKeetPeJrSmaYPassGasei WQhiGhitQaseWGPSseHitQasaKeaTtiJTPsGaraKaeTsaWHatthattimeTWAWSQWtSWatTraPistsSJ GSTrseaYreatCriUeiWasGieWtiJiGCSiWtSJOieQthereQeretQSrSTWHKPaGAsCStsWearSWeeBtr emitFSJtheKaGAaWHaPSWYSWeWeartheStherthesGaPesQereeBGeeHiWYPFharHaWHYPSssFQitha PPtheaCCearaWGeSJKTrWisheHYSPHtheQeiYhtSJtheiWseGtQasOerFremarAaKPeaWHtaAiWYaPP thiWYsiWtSGSWsiHeratiSWiGSTPHharHPFKPameNTCiterJSrhisSCiWiSWresCeGtiWYit
今度は、これらの推測がさらに別の推測を示唆している(例えば、「レマー「~かもしれない」述べる「、つまりA~k)などと続けていくと、残りの文字を推測するのは比較的簡単で、最終的に平文が得られます。
そこでレグランダは 厳粛かつ威厳のある様子で立ち上がり、ガラスケースに閉じ込められていた甲虫を取り出した。それは美しいコガネムシで、 当時博物学者には 知られていなかったが、もちろん科学的には大変貴重なものであった。背中の片方の端の近くに 丸い黒い斑点が2つ、もう片方の近くに長い黒い斑点が1つあった。鱗は非常に硬く光沢があり、磨き上げられた金のような外観をしていた。昆虫の重さは非常に大きく 、あらゆることを考慮すると、ジュピターがそれについて抱いた意見を責めることはほとんどできなかった。
この時点で、イヴはスペースと句読点を挿入するのが良いでしょう。
そこでルグランは、厳粛で威厳のある様子で立ち上がり、私に甲虫を持ってきた。 ガラスケースに収められていた。それは美しいコガネムシで、 当時、博物学者には知られていなかったが、もちろん科学的には大きな賞だった。 視界には、背中の片方の端の近くに2つの丸い黒い斑点があり、 長いものが互いに近くに並んでいた。鱗は非常に硬く光沢があり、 磨かれた金のような外観。昆虫の重さは非常に顕著で、 あらゆることを考慮すると、ジュピターの意見を責めることはほとんどできなかった。 それを尊重します。「ゴールドバグ」のこの例では、イブの推測はすべて正しかった。しかし、常にそうとは限らない。個々の平文の統計値にはばらつきがあるため、最初の推測が間違っている可能性もある。間違った推測を遡って検証したり、上記の例で示したやや簡略化された説明よりもはるかに深く統計値を分析したりする必要があるかもしれない。
平文では、文字頻度の分布が予想通りにならない可能性がある。短いメッセージほど、ばらつきが大きくなる傾向がある。また、意図的に偏ったテキストを作成することも可能です。例えば、文字を省略した小説が書かれた例もあります。e全体として、リポグラムとして知られる文学形式。


頻度分析(実際にはあらゆる種類の暗号解読)に関する記録された最初の説明は、9 世紀にアラブの博学者アル・キンディーが『暗号メッセージの解読に関する手稿』の中で述べたものである。[ 3 ]コーランの綿密なテキスト研究によって、アラビア語には特徴的な文字頻度があることが初めて明らかになったと示唆されている。 [ 4 ]その使用は広がり、ルネサンス期までにはヨーロッパ諸国で同様のシステムが広く使用されるようになった。1474 年までに、チッコ・シモネッタはラテン語とイタリア語のテキストの暗号化を解読するマニュアルを執筆した。[ 5 ]
暗号学者たちは、単純な置換暗号のこの弱点を克服するために、いくつかの手法を考案した。それらには以下のようなものがある。
頻度計数攻撃を阻止しようとするこれらの試みの欠点は、暗号化と復号化の両方が複雑化し、ミスにつながることである。有名な話だが、あるイギリス外務大臣は、ホイートストンとプレイフェアが示したように、たとえ小学生がうまく解読できたとしても、「我々の駐在武官には決して習得できないだろう!」という理由で、プレイフェア暗号を拒否したと言われている。
20世紀前半のローター式暗号機(例えばエニグマ暗号機)は、単純な周波数解析に対しては基本的に耐性があった。しかし、他の種類の解析(「攻撃」)によって、それらの機械からのメッセージの解読に成功したものもあった。[ 6 ]
頻度分析には、平文言語の統計に関する基本的な理解と、ある程度の問題解決能力、そして手作業で行う場合は膨大な量の手紙の記録に対する忍耐力だけが必要です。第二次世界大戦中、イギリスとアメリカはともに、主要な新聞にクロスワードパズルを掲載し、それを最も早く解ける者を競うコンテストを開催することで、暗号解読者を募集しました。枢軸国が使用した暗号のいくつかは、頻度分析によって解読可能でした。例えば、日本が使用した領事館の暗号の一部がそうです。文字の計数と統計分析の機械的な方法(一般的にはIBMカード型の機械)は、第二次世界大戦中に初めて使用され、おそらくアメリカ陸軍のSISによって使用されたと考えられます。今日では、文字の計数と分析はコンピュータソフトウェアによって行われ、数秒でそのような分析を実行できます。現代のコンピューティング能力では、古典的な暗号は機密データに対して真の保護を提供する可能性は低いでしょう。

頻度分析はフィクション作品にも登場する。エドガー・アラン・ポーの『黄金虫』やアーサー・コナン・ドイルのシャーロック・ホームズ物語『踊る人形』は、単純な換字式暗号を攻撃するために頻度分析を用いる様子を描いた物語の例である。ポーの物語に登場する暗号にはいくつかの欺瞞的な仕掛けが施されているが、これは暗号学的に重要な意味を持つというよりは、文学的な手法に近い。