
手書き文字認識( HWR ) は、手書きテキスト認識( HTR )とも呼ばれ、コンピュータが紙文書、写真、タッチスクリーン、その他のデバイスなどのソースから、理解可能な手書き入力を受け取り、解釈する機能です。 [ 1 ] [ 2 ]書かれたテキストの画像は、光学スキャン (光学文字認識) またはインテリジェントな単語認識によって、紙から「オフライン」で検出できます。あるいは、ペン先の動きを、たとえばペンベースのコンピュータ画面表面によって「オンライン」で検出することもできます。これは、利用できる手がかりが多いため、一般的に容易な作業です。手書き文字認識システムは、書式設定を処理し、文字への正しい分割を実行し、可能な限り多くの単語を見つけます。
オフライン手書き文字認識とは、画像内のテキストをコンピュータやテキスト処理アプリケーションで使用可能な文字コードに自動的に変換する技術です。この方法で得られるデータは、手書き文字の静的な表現とみなされます。オフライン手書き文字認識は、人によって筆跡が異なるため、比較的難しい技術です。また、現在、OCRエンジンは主に機械で印刷されたテキストを対象とし、ICRは手書き文字(大文字で書かれたテキスト)を対象としています。
オフライン文字認識では、多くの場合、フォームやドキュメントをスキャンする必要があります。つまり、スキャンされた画像に含まれる個々の文字を抽出する必要があります。このステップを実行できるツールは存在します。[ 3 ]しかし、このステップにはいくつかの一般的な不完全性があります。最も一般的なのは、連結した文字が両方の文字を含む単一のサブ画像として返される場合です。これは認識段階で大きな問題を引き起こします。しかし、連結した文字のリスクを軽減する多くのアルゴリズムが利用可能です。
個々の文字が抽出された後、認識エンジンを用いて対応するコンピュータ文字を識別する。現在、いくつかの異なる認識技術が利用可能である。
特徴抽出は、ニューラルネットワーク認識器と同様の仕組みで動作します。ただし、プログラマーは重要だと考える特性を手動で決定する必要があります。このアプローチにより、認識器は識別に使用される特性をより細かく制御できます。しかし、このアプローチを採用するシステムは、特性が自動的に学習されないため、ニューラルネットワークよりも開発に大幅に時間がかかります。
従来の手法では個々の文字を分割して認識することに重点を置いていましたが、現代の手法では分割されたテキスト行内のすべての文字を認識することに重点を置いています。特に、視覚的特徴を学習できる機械学習技術に重点を置いており、以前使用されていた制限的な特徴エンジニアリングを回避しています。最先端の手法では、畳み込みネットワークを使用してテキスト行画像の複数の重なり合うウィンドウから視覚的特徴を抽出し、それを使用してリカレントニューラルネットワークが文字の確率を生成します。[ 4 ]
オンライン手書き認識とは、専用のデジタイザーやPDAに書かれた文字を、センサーがペン先の動きやペンの上げ下げを検知して自動的に変換する技術です。このデータはデジタルインクと呼ばれ、手書き文字のデジタル表現とみなすことができます。取得された信号は、コンピュータやテキスト処理アプリケーションで使用可能な文字コードに変換されます。
オンライン手書き文字認識インターフェースの構成要素は、一般的に以下のとおりです。
オンライン手書き文字認識のプロセスは、いくつかの一般的なステップに分解できます。
前処理の目的は、認識に悪影響を与える可能性のある入力データ内の無関係な情報を除去することです。[ 5 ]これは速度と精度に関係します。前処理は通常、二値化、正規化、サンプリング、平滑化、ノイズ除去で構成されます。[ 6 ] 2 番目のステップは特徴抽出です。前処理アルゴリズムから受け取った 2 次元以上のベクトル場から、高次元データが抽出されます。このステップの目的は、認識モデルにとって重要な情報を強調することです。このデータには、筆圧、速度、または筆記方向の変化などの情報が含まれる場合があります。最後の大きなステップは分類です。このステップでは、さまざまなモデルを使用して、抽出された特徴をさまざまなクラスにマッピングし、それによって特徴が表す文字または単語を識別します。
キーボード入力の代替として手書き認識を組み込んだ商用製品は、1980 年代初頭に登場しました。例としては、Pencept Penpad [ 7 ] や Inforite の POS 端末 [ 8 ] などの手書き端末があります。パーソナルコンピュータの 大規模な消費者市場の出現に伴い、Pencept [ 9 ] 、 CIC [ 10 ]などから、パーソナルコンピュータのキーボードとマウスを単一のポインティング/手書きシステムに置き換える商用製品がいくつか登場しました。市販された最初のタブレット型ポータブルコンピュータは、 1988 年 7 月に発売された Linus Technologies のWrite-Topでした。そのオペレーティングシステムはMS-DOSをベースにしていました。[ 11 ] [ 12 ]
1990年代初頭、NCR、IBM、EOなどのハードウェアメーカーは、GO社が開発したPenPointオペレーティングシステムを搭載したタブレットコンピュータを発売した。PenPointは手書き認識とジェスチャー機能を全面的に採用し、サードパーティ製ソフトウェアにもその機能を提供した。IBMのタブレットコンピュータはThinkPadという名称を初めて採用し、IBMの手書き認識システムを使用していた。この認識システムは後にMicrosoft Windows for Pen ComputingやIBM Pen for OS/2に移植されたが、いずれも商業的に成功することはなかった。
電子機器の進歩により、手書き認識に必要な演算能力がタブレットコンピュータよりも小型のフォームファクタに収まるようになり、手書き認識は携帯情報端末(PDA)の入力方法としてよく使われるようになった。手書き入力に対応した最初のPDAはApple Newtonで、合理化されたユーザーインターフェースの利点を一般に知らしめた。しかし、ユーザーの筆記パターンを学習しようとするソフトウェアの信頼性の低さから、このデバイスは商業的に成功しなかった。手書き認識が大幅に改善され、モードレスエラー訂正など、現在の認識システムには見られない独自の機能も搭載されたNewton OS 2.0がリリースされる頃には、最初の印象は概ね否定的なものになっていた。Apple Newtonの販売終了後、この機能はMac OS X 10.2以降にInkwellとして組み込まれた。
その後、 PalmはGraffiti認識システムをベースにしたPDAシリーズを発売し、成功を収めた。Graffitiは、各文字に「ユニストローク」、つまり一筆書きの文字パターンを定義することで使いやすさを向上させた。これにより入力ミスの可能性は減ったものの、ストロークパターンを記憶する必要があるため、ユーザーの学習曲線は急になった。Graffitiの手書き認識はXeroxが保有する特許を侵害していると判断され、PalmはGraffitiを、同じくユニストロークをサポートするもののXeroxの特許よりも前に開発されたCIC手書き認識のライセンス版に置き換えた。侵害の判決は控訴審で覆され、さらにその後の控訴審でも覆された。その後、関係当事者は、この件およびその他の特許に関する和解交渉を行った。
タブレットPCは、デジタイザータブレットとスタイラスペンを備えたノートパソコンで、ユーザーは画面に手書きで文字を入力できます。オペレーティングシステムは手書き文字を認識し、テキストに変換します。Windows VistaとWindows 7には、英語、日本語、繁体字中国語、簡体字中国語、韓国語のユーザーの筆記パターンや語彙を学習するパーソナライズ機能が搭載されています。この機能には、ユーザーの手書き文字のサンプルを入力させ、それを使ってシステムを再学習させ、認識精度を高める「パーソナライズウィザード」が含まれています。このシステムは、PDA向けのWindows Mobile OSで使用されている、より高度な手書き文字認識システムとは異なります。
手書き認識は一般に馴染みのある入力形式ではあるものの、デスクトップコンピュータやノートパソコンでは広く普及していない。キーボード入力の方が速くて信頼性が高いという認識は依然として一般的である。 2006年現在多くのPDAは手書き入力に対応しており、自然な筆記体にも対応しているものもありますが、精度には依然として問題があり、シンプルな画面上のキーボードの方が効率的だと感じる人もいます。
初期のソフトウェアは、文字が分離している印刷体手書き文字を認識できたが、文字が連結している筆記体手書き文字は、文字の分割に関する困難であるセイアのパラドックスを引き起こした。1962年、当時モスクワにいたシェリア・グーバーマンは、最初の応用パターン認識プログラムを作成した。[ 13 ]商用例は、Communications Intelligence CorporationやIBMなどの企業から提供された。
1990年代初頭、ParaGraph InternationalとLexicusという2社が、筆記体の手書き文字を認識できるシステムを開発しました。ParaGraphはロシアに拠点を置き、コンピュータ科学者のステパン・パチコフによって設立されました。一方、Lexicusはスタンフォード大学の学生だったロンジョン・ナグとクリス・コートゲによって設立されました。ParaGraphのCalliGrapherシステムはApple Newtonシステムに搭載され、Lexicus LonghandシステムはPenPointとWindowsオペレーティングシステム向けに商用提供されました。Lexicusは1993年にMotorolaに買収され、Motorola向けに中国語の手書き文字認識システムと予測テキストシステムを開発しました。ParaGraphは1997年にSGIに買収され、その手書き文字認識チームはP&I部門を設立し、後にSGIからVademに買収されました。Microsoftは1999年にVademからCalliGrapher手書き文字認識システムとP&Iが開発したその他のデジタルインク技術を買収しました。
Wolfram Mathematica (8.0以降) には、手書き文字またはテキスト認識機能 TextRecognize も備わっています。

手書き文字認識は、活発な研究者コミュニティによって研究されています。手書き文字認識に関する最大の国際会議は、偶数年に開催される国際手書き文字認識フロンティア会議(ICFHR)と、奇数年に開催される国際文書解析認識会議(ICDAR)です。これらの会議はどちらもIEEEとIAPRの支援を受けています。2021年には、ICDARの論文集がLNCS(Springer)から出版される予定です。
活発な研究分野は以下のとおりです。
2009 年以来、スイス AI ラボ IDSIAのJürgen Schmidhuberの研究グループで開発されたリカレント ニューラル ネットワークとディープフィードフォワードニューラル ネットワークは、いくつかの国際的な手書きコンテストで優勝しています。[ 15 ]特に、Alex Graves らによる双方向かつ多次元のLong short-term memory (LSTM) [ 16 ] [ 17 ]は、学習する 3 つの異なる言語 (フランス語、アラビア語、ペルシア語) に関する事前知識なしに、2009 年の国際文書分析認識会議 (ICDAR) の連結手書き認識コンテストで 3 つのコンテストで優勝しました。IDSIAの Dan Ciresan らによるフィードフォワード ネットワーク向けの最近の GPU ベースのディープラーニング手法は、ICDAR 2011オフライン中国語手書き認識コンテストで優勝しました。彼らのニューラルネットワークは、ニューヨーク大学のヤン・ルカン氏らが開発した有名なMNIST手書き数字問題[ 19 ]において、人間と競合する性能を達成した最初の人工パターン認識器でもありました[ 18 ]。
ウォーリック大学のベンジャミン・グラハムは、畳み込みニューラルネットワークの手法を用いて、2013年の中国語手書き文字認識コンテストでわずか2.61%のエラー率で優勝した。この手法は(2017年までに)「スパース畳み込みニューラルネットワーク」へと進化した。[ 20 ] [ 21 ]