セイヤーのパラドックスは、自動手書き認識システムの設計において遭遇するジレンマである。このパラドックスの一般的な説明は、筆記体で書かれた単語は分割せずに認識することはできず、分割せずに認識することもできないというものである。[ 1 ] [ 2 ]このパラドックスは、1973年にケネス・M・セイヤーによって初めて明確に述べられ、彼の名にちなんで名付けられた。[ 3 ]
印刷された形式で書かれた単語を認識できる自動システムを設計するのは比較的容易です。そのような単語は、ページに書き込むという行為そのものによって文字に分割されます。特定の言語の典型的な文字の形状に一致するテンプレートが与えられれば、個々の文字を高い確率で識別できます。曖昧な場合は、可能性のある文字の並びを、その言語で正しく綴られた単語の選択(語彙集と呼ばれる)と比較することができます。[ 4 ]必要に応じて、言語の構文的特徴を適用して、問題の単語を概ね正確に識別することができます。[ 5 ]このような印刷文字認識システムは、標準化された政府フォームの処理、郵便番号による郵便物の仕分けなどによく使用されます。
しかし、筆記体では、単語を構成する文字は通常、間隔を空けずに連続して並びます。印刷された文字の並びとは異なり、筆記体の文字は事前に分割されていません。ここでセイアのパラドックスが生じます。単語がすでに文字に分割されていない限り、上述のようなテンプレートマッチング技術は適用できません。つまり、単語認識には文字分割が必須条件なのです。しかし、単語自体が識別されていない限り、単語を文字に分割する信頼できる技術は存在しません。単語認識には文字分割が必要であり、文字分割には単語認識が必要です。標準的なテンプレートマッチング技術を用いた筆記体認識システムでは、この両方を同時に行うことは不可能です。
自動筆記体認識システムを使用することで得られる利点には、手書きの住所が記載された郵便物の仕分け、手書きの銀行小切手の読み取り、手書き文書の自動デジタル化などがあります。[ 1 ]これらは、セイアのパラドックスを回避する方法を見つけるための実際的な動機となります。
このパラドックスの悪影響を軽減する一つの方法は、認識する単語の刻印を正規化することです。正規化とは、文字の傾斜が不自然だったり、筆記体の傾きが不自然だったりするなど、書き手の筆跡の特異性を排除することです。[ 4 ]この手順により、文字テンプレートとの正しい一致の確率が高まり、システムの成功率が段階的に向上します。しかし、このような改善は依然として正確なセグメンテーションに依存しているため、セイアのパラドックスの制約を受けます。研究者たちは、このパラドックスを回避する唯一の方法は、正確なセグメンテーションに依存しない手順を使用することであると認識するようになりました。[ 1 ]
セグメンテーションは、認識のためにシステムに提示された実際の碑文(入力データ)の文字間の区別と一致する限りにおいて正確である。これは「明示的セグメンテーション」と呼ばれることもある。[ 4 ]一方、「暗黙的セグメンテーション」は、筆記体の行を、筆記体の行自体の実際の文字数よりも多くの部分に分割することである。これらの「暗黙的部分」を処理して最終的な単語識別を達成するには、隠れマルコフモデル(HMM)を含む特定の統計的手順が必要となる。
マルコフモデルは、ランダム過程の統計的表現です。つまり、将来の状態が現在より前の状態とは独立している過程のことです。このような過程では、ある状態は、その直前の状態に続く条件付き確率のみに依存します。例としては、サイコロを連続して振った結果の系列が挙げられます。HMMはマルコフモデルの一種ですが、個々の状態は完全には分かっていません。状態間の条件付き確率は確定していますが、個々の状態の正体は完全には明らかにされていません。
認識は、認識対象単語のHMMと、事前に準備された語彙集内の単語のHMMを照合することによって行われます。特定のケースにおいて最もよく一致するものが、問題の手書き単語の正体を示すものとみなされます。明示的なセグメンテーションに基づくシステムと同様に、暗黙的なセグメンテーションに基づく自動認識システムも、正しく識別できた割合に応じて、その成功度合いが判断されます。
明示的なセグメンテーション技術の代わりに、今日のほとんどの自動手書き認識システムは、HMMベースのマッチング手順と組み合わせた暗黙的なセグメンテーションを採用しています。[ 1 ]セイヤーのパラドックスに象徴される制約が、このアプローチの変化の主な原因です。