光学式文字認識または光学式文字読み取り装置(OCR)は、スキャンした文書、文書の写真、風景写真(例えば、風景写真の看板や広告板の文字)、または画像に重ねられた字幕テキスト(例えば、テレビ放送)から、入力、手書き、または印刷されたテキストの画像を機械エンコードされたテキストに電子的または機械的に変換する技術です。[1]
パスポート文書、請求書、銀行取引明細書、電子化された領収書、名刺、郵便物、印刷されたデータ、または適切な文書など、印刷された紙のデータ記録からのデータ入力の形式として広く使用されており、印刷されたテキストをデジタル化して電子的に編集、検索、よりコンパクトに保存、オンラインで表示し、認知コンピューティング、機械翻訳、(抽出された)音声合成、キーデータ、テキストマイニングなどの機械プロセスで使用できるようにするための一般的な方法です。OCRは、パターン認識、人工知能、コンピュータービジョンの研究分野です。
初期のバージョンでは、各文字の画像でトレーニングする必要があり、一度に 1 つのフォントで作業する必要がありました。現在では、ほとんどのフォントに対して高い精度を実現できる高度なシステムが一般的であり、さまざまな画像ファイル形式の入力をサポートしています。[2]一部のシステムは、画像、列、その他の非テキスト コンポーネントを含む元のページに近いフォーマットされた出力を再現できます。
歴史
初期の光学文字認識は、電信技術や視覚障害者用の読み取り装置の開発にまで遡ることができます。 [3] 1914年、エマニュエル・ゴールドバーグは文字を読み取り、それを標準的な電信コードに変換する機械を開発しました。[4]同時に、エドモンド・フルニエ・ダルベはオプトフォンを開発しました。これは、印刷されたページ上で動かすと、特定の文字や記号に対応する音を出す手持ち式スキャナです。[5]
1920 年代後半から 1930 年代にかけて、エマニュエル ゴールドバーグは、光学コード認識システムを使用してマイクロフィルム アーカイブを検索する「統計マシン」を開発しました。1931 年に、この発明により米国特許番号 1,838,389 を取得しました。この特許はIBMによって取得されました。
視覚障害のあるユーザー
1974年、レイ・カーツワイルはカーツワイル・コンピュータ・プロダクツ社を設立し、事実上あらゆるフォントで印刷されたテキストを認識できるオムニフォントOCRの開発を続けた。(オムニフォントOCRの発明者はカーツワイルであるとよく言われるが、これは1960年代後半から1970年代にはCompuScanなどの企業で使用されていた。[3] [6] ) カーツワイルはこの技術を使用して、視覚障がい者がコンピューターにテキストを読み上げてもらうための読み取り機を開発した。この装置には、CCDタイプのフラットベッドスキャナーと音声合成装置が含まれていた。1976年1月13日、完成品はカーツワイルと全米盲人連盟の指導者らが主催した広く報道された記者会見で発表された。[要出典] 1978年、カーツワイル・コンピュータ・プロダクツは光学式文字認識コンピュータープログラムの商用版の販売を開始した。LexisNexis は最初の顧客のひとつで、法律文書やニュース文書を同社の初期のオンライン データベースにアップロードするためにこのプログラムを購入した。2 年後、カーツワイル氏は会社をゼロックス社に売却し、ゼロックス社は最終的にスキャンソフト社として分社化し、さらにニュアンス コミュニケーションズ社と合併した。
2000年代には、OCRはオンラインサービス(WebOCR)、クラウドコンピューティング環境、スマートフォンでの外国語の標識のリアルタイム翻訳などのモバイルアプリケーションで利用できるようになった。スマートフォンとスマートグラスの登場により、OCRは、デバイスのカメラを使用してキャプチャされたテキストを抽出するインターネット接続されたモバイルデバイスアプリケーションで使用できるようになりました。OCR機能が組み込まれていないこれらのデバイスでは、通常、OCR APIを使用して、デバイスでキャプチャされた画像ファイルからテキストを抽出します。[7] [8] OCR APIは、抽出されたテキストと、元の画像で検出されたテキストの位置に関する情報をデバイスアプリに返し、さらに処理(テキスト読み上げなど)したり表示したりします。
ラテン文字、キリル文字、アラビア文字、ヘブライ文字、インド文字、ベンガル語 (ベンガル語)、デーバナーガリー文字、タミル語、中国語、日本語、韓国語の文字を含む、ほとんどの一般的な表記体系に対応したさまざまな商用およびオープンソースの OCR システムが利用可能です。
アプリケーション
OCR エンジンは、領収書、請求書、小切手、法的請求書などのさまざまな主題に特化したソフトウェア アプリケーションに開発されてきました。
このソフトウェアは次の用途に使用できます。
- 小切手、パスポート、請求書、銀行取引明細書、領収書などのビジネス文書のデータ入力
- 自動ナンバープレート認識
- 空港でのパスポート認識と情報抽出
- 保険書類から重要な情報を自動的に抽出する[引用が必要]
- 交通標識認識[9]
- 名刺情報を連絡先リストに抽出する[10]
- 印刷された文書のテキスト版の作成(例:プロジェクト・グーテンベルクの書籍スキャン)
- 印刷された文書の電子画像を検索可能にする(例:Google ブックス)
- 手書き文字をリアルタイムに変換してコンピュータを制御する(ペンコンピューティング)
- CAPTCHAアンチボットシステムの堅牢性を破ったりテストしたりするが、これらはOCRを防止するために特別に設計されている。 [11] [12] [13]
- 視覚障害者のための支援技術
- リアルタイムで変化する車両設計に適した CAD 画像をデータベースから識別して、車両の指示書を作成します。
- スキャンした文書をPDFに変換して検索可能にする
種類
- 光学文字認識 (OCR) - 入力されたテキストを、一度に1 つのグリフまたは文字ずつ対象とします。
- 光学的単語認識 - タイプされたテキストを 1 単語ずつ対象とします (単語の区切りとしてスペースを使用する言語の場合)。通常は単に「OCR」と呼ばれます。
- インテリジェント文字認識(ICR) – 手書きの印刷体または筆記体のテキストを 1 文字ずつ対象とし、通常は機械学習を伴います。
- インテリジェント単語認識(IWR) – 手書きの印刷体または筆記体のテキストも、単語ごとに認識します。これは、筆記体でグリフが区切られていない言語で特に役立ちます。
OCRは一般的にオフラインプロセスであり、静的な文書を分析する。オンラインOCR APIサービスを提供するクラウドベースのサービスがある。手書きの動きの分析は、手書き認識への入力として使用できる。[14]この技術は、単にグリフや単語の形状を使用するのではなく、セグメントが描かれる順序、方向、ペンを置いたり持ち上げたりするパターンなどの動きを捉えることができる。この追加情報により、プロセスの精度を高めることができる。この技術は、「オンライン文字認識」、「動的文字認識」、「リアルタイム文字認識」、「インテリジェント文字認識」とも呼ばれる。
テクニック
前処理
OCRソフトウェアは、認識の成功率を高めるために画像を前処理することが多い。その技術には次のようなものがある: [15]
- 傾き補正 - スキャン時に文書が適切に位置合わせされていない場合は、テキストの行を完全に水平または垂直にするために、文書を時計回りまたは反時計回りに数度傾ける必要がある場合があります。
- 斑点除去 – プラスとマイナスの斑点を除去し、エッジを滑らかにする
- 二値化 – 画像をカラーまたはグレースケールから白黒(2色あるため、バイナリ画像と呼ばれる)に変換すること。このタスクは、テキスト(またはその他の必要な画像コンポーネント)を背景から分離する簡単な方法として実行されます。 [16]二値化のタスクが必要なのは、ほとんどの商用認識アルゴリズムがバイナリ画像でのみ機能するためです。バイナリ画像の方が処理が簡単だからです。[17]さらに、二値化の有効性は文字認識の品質に大きく影響するため、特定の入力画像タイプに対して採用する二値化の選択には慎重な決定が下されます。バイナリ結果を取得するために使用される方法の品質は、画像のタイプ(スキャンされた文書、シーンのテキスト画像、劣化した歴史的文書など)に依存するためです。[18] [19]
- 線の削除 – グリフ以外のボックスと線のクリーンアップ
- レイアウト分析またはゾーニング - 列、段落、キャプションなどを個別のブロックとして識別します。複数列のレイアウトや表では特に重要です。
- 線と単語の検出 – 単語と文字の形状のベースラインを確立し、必要に応じて単語を分離します。
- スクリプト認識 – 多言語文書では、スクリプトが単語レベルで変化する可能性があるため、特定のスクリプトを処理するために適切なOCRを呼び出す前に、スクリプトを識別する必要があります。[20]
- 文字の分離または分割 – 文字単位の OCR では、画像アーティファクトによって連結された複数の文字は分離する必要があり、アーティファクトによって複数に分割された単一の文字は連結する必要があります。
- アスペクト比とスケールの正規化[21]
固定ピッチフォントのセグメンテーションは、垂直グリッド線が黒い領域と交差する頻度が最も少ない場所に基づいて、画像を均一なグリッドに揃えるだけで比較的簡単に実現できます。プロポーショナルフォントの場合は、文字間の空白が単語間の空白よりも大きい場合があり、垂直線が複数の文字と交差する可能性があるため、より洗練された技術が必要です。[22]
テキスト認識
コアOCRアルゴリズムには2つの基本的なタイプがあり、候補文字のランク付けされたリストを生成することができます。[23]
- マトリックス マッチングでは、画像と保存されているグリフをピクセル単位で比較します。これは、パターン マッチング、パターン認識、または画像相関とも呼ばれます。これは、入力グリフが画像の残りの部分から正しく分離されていること、および保存されているグリフが同様のフォントで同じスケールであることに依存します。この手法は、タイプされたテキストで最も効果的に機能しますが、新しいフォントに遭遇したときにはうまく機能しません。これは、初期の物理的な光電セル ベースの OCR で直接的に実装された手法です。
- 特徴抽出は、グリフを線、閉ループ、線の方向、線の交点などの「特徴」に分解します。抽出された特徴により、表現の次元が削減され、認識プロセスの計算効率が向上します。これらの特徴は、文字の抽象的なベクトルのような表現と比較され、1 つ以上のグリフ プロトタイプに縮小される場合があります。コンピューター ビジョンにおける特徴検出の一般的な手法は、このタイプの OCR に適用でき、これは「インテリジェント」な手書き認識や最新の OCR ソフトウェアのほとんどでよく見られます。[24] k 近傍アルゴリズムなどの最近傍分類器は、画像の特徴と保存されたグリフの特徴を比較し、最も近い一致を選択するために使用されます。[25]
CuneiformやTesseractなどのソフトウェアは、文字認識に2パスアプローチを採用しています。2パス目は適応認識と呼ばれ、1パス目で高い信頼度で認識された文字の形状を使用して、2パス目で残りの文字をより適切に認識します。これは、珍しいフォントや、フォントが歪んでいる(ぼやけている、色あせているなど)低品質のスキャンの場合に有利です。[22]
2016年12月現在[アップデート]、最新のOCRソフトウェアには、 Google Docs OCR、ABBYY FineReader、Transymなどがあります。[26] [更新が必要] OCRopusやTesseractなどの他のソフトウェアは、単一の文字に焦点を当てるのではなく、テキストの行全体を認識するようにトレーニングされたニューラルネットワークを使用します。
反復OCRと呼ばれる技術は、ページレイアウトに基づいて文書を自動的にセクションに切り取ります。次に、可変文字信頼レベルしきい値を使用して各セクションごとにOCRを実行し、ページレベルのOCR精度を最大化します。この方法は米国特許庁から特許を取得しています。[27]
OCR の結果は、米国議会図書館が管理する専用のXML スキーマである標準化されたALTO形式で保存できます。その他の一般的な形式には、hOCRや PAGE XML などがあります。
光学文字認識ソフトウェアの一覧については、「光学文字認識ソフトウェアの比較」を参照してください。
後処理
OCRの精度は、出力が辞書 (文書内で出現が許される単語のリスト)によって制約されている場合に向上します。[15]これは、たとえば英語のすべての単語、または特定の分野のためのより技術的な辞書である可能性があります。この手法は、固有名詞のように辞書にない単語が文書に含まれている場合に問題が発生する可能性があります。Tesseractは、精度を向上させるために、辞書を使用して文字分割ステップに影響を与えます。[22]
出力ストリームはプレーンテキストストリームまたは文字のファイルになりますが、より高度な OCR システムでは、ページの元のレイアウトが保持され、たとえば、ページの元の画像と検索可能なテキスト表現の両方を含む注釈付きPDF が生成されます。
近傍分析では、共起頻度を利用して、特定の単語が頻繁に一緒に見られることに着目することで、エラーを修正することができます。[28]たとえば、「ワシントンDC」は、英語では一般に「ワシントンDOC」よりもはるかに一般的です。
スキャン対象の言語の文法に関する知識があれば、たとえば単語が動詞か名詞かを判断するのにも役立ち、精度が向上します。
レーベンシュタイン距離アルゴリズムはOCR後処理でも使用され、OCR APIからの結果をさらに最適化します。[29]
アプリケーション固有の最適化
近年、[いつ? ]主要な OCR 技術プロバイダーは、特定の種類の入力をより効率的に処理するために OCR システムを微調整し始めました。アプリケーション固有の語彙を超えて、ビジネス ルール、標準表現、[説明が必要] 、またはカラー画像に含まれる豊富な情報を考慮することで、パフォーマンスが向上する可能性があります。この戦略は、「アプリケーション指向 OCR」または「カスタマイズ OCR」と呼ばれ、ナンバー プレート、請求書、スクリーンショット、ID カード、運転免許証、自動車製造の OCR に適用されています。
ニューヨークタイムズはOCR技術をDocument Helperという独自のツールに取り入れ、インタラクティブニュースチームがレビューが必要な文書の処理を高速化できるようにしました。記者が内容を確認する準備として、1時間あたり5,400ページもの文書を処理できるようになったとニューヨークタイムズは述べています。 [30]
回避策
改良された OCR アルゴリズム以外の手段で文字認識の問題を解決する手法はいくつかあります。
より良い入力を強制する
OCR-A、OCR-B、MICRフォントなどの特殊なフォントは、サイズ、間隔、特徴的な文字の形が正確に指定されているため、銀行小切手処理における転記の精度が向上します。いくつかの有名なOCRエンジンは、ArialやTimes New Romanなどの一般的なフォントのテキストをキャプチャするように設計されており、これらの特殊なフォントや一般的に使用されているフォントとは大きく異なるフォントのテキストをキャプチャすることはできません。Google Tesseractは新しいフォントを認識するようにトレーニングできるため、OCR-A、OCR-B、MICRフォントを認識できます。[31]
コームフィールドは、人間がより読みやすい文字を書くことを奨励するために事前に印刷されたボックスで、1つのボックスに1つのグリフが書かれています。[28]これらは、 OCRシステムで簡単に削除できるドロップアウトカラーで印刷されることが多いです。 [28]
Palm OS は、印刷された英語の文字に似ていますが、プラットフォームの計算能力が限られたハードウェアで認識しやすいように簡略化または変更された、 Graffitiと呼ばれる特別なグリフ セットを使用していました。ユーザーは、これらの特別なグリフの書き方を学ぶ必要がありました。
ゾーンベースの OCR は、画像をドキュメントの特定の部分に制限します。これは、テンプレート OCRと呼ばれることもあります。
クラウドソーシング
人間に文字認識をクラウドソーシングさせることで、コンピューター駆動のOCRのように画像を素早く処理できるが、コンピューター経由よりも高い画像認識精度が得られる。実用的なシステムとしては、 Amazon Mechanical TurkやreCAPTCHAなどがある。フィンランド国立図書館は、ユーザーが標準化されたALTO形式でOCRテキストを修正するためのオンラインインターフェースを開発した。[32]クラウドソーシングは、文字認識を直接行うのではなく、ランク付けトーナメントなどを利用してソフトウェア開発者に画像処理アルゴリズムの開発を依頼するためにも使用されている。[33]
正確さ
_ocurrence_of_laft_and_last.png/500px-Google_Ngrams_(English_2009)_ocurrence_of_laft_and_last.png)
_ocurrence_of_laft_and_last.png/500px-Google_Ngrams_(English_2012)_ocurrence_of_laft_and_last.png)
_long_s_normalization.png/500px-Google_Ngrams_(English_2019)_long_s_normalization.png)
米国エネルギー省(DOE)の委託を受けて、情報科学研究所(ISRI)は、機械印刷された文書を理解するための自動化技術の改善を促進するという使命を負っており、1992年から1996年にかけて最も権威のあるOCR精度の年次テストを実施しました。 [35]
タイプされたラテン文字のテキストの認識は、鮮明な画像が利用できる場合でも、まだ 100% 正確ではありません。19 世紀および 20 世紀初頭の新聞ページの認識に基づいたある研究では、市販の OCR ソフトウェアの文字ごとの OCR 精度は 81% から 99% の範囲であると結論付けられました。[36]完全な精度は、人間による確認またはデータ辞書認証によって達成できます。その他の領域、つまり手書き文字、草書体、その他の文字の印刷テキスト (特に、1 つの文字に多くの画がある東アジアの言語の文字) の認識は、現在も活発に研究されています。MNISTデータベースは、手書きの数字を認識するシステムの能力をテストするためによく使用されます。
精度率はいくつかの方法で測定できますが、測定方法によって報告される精度率が大きく左右されることがあります。たとえば、存在しない単語を見つけたソフトウェアを修正するために単語のコンテキスト(単語の辞書)が使用されていない場合、各単語全体が誤った文字なしで認識されたかどうかに基づいて測定すると、文字エラー率が 1%(99% の精度)でエラー率が 5% またはそれ以下になる可能性があります。[37]ニューラルネットワークベースの手書き認識ソリューションでは、十分に大きなデータセットを使用することが重要です。一方、自然なデータセットの作成は非常に複雑で時間がかかります。[38]
古いテキストをデジタル化する際に固有の困難さの一例として、OCRが「長いs」と「f」の文字を区別できないことが挙げられます。[39] [34]
手書きのテキストを即座に認識する Web ベースの OCR システムは、近年[いつ? ]商用製品としてよく知られるようになりました( Tablet PC の歴史を参照)。ペン コンピューティングソフトウェアでは、きれいな手書き文字の 80% ~ 90% の精度を達成できますが、それでも 1 ページあたり数十のエラーが発生するため、このテクノロジは非常に限られた用途でしか役に立ちません。[引用が必要]
筆記体の認識は活発な研究分野ですが、認識率は手書きのテキストよりもさらに低いです。一般的な筆記体の認識率を高めるには、文脈や文法の情報がなければおそらく不可能でしょう。たとえば、辞書から単語全体を認識する方が、筆記体の個々の文字を解析するよりも簡単です。小切手の金額の行(常に数字が書かれています) を読むことは、より小さな辞書を使用すると認識率が大幅に向上する例です。個々の筆記体文字の形状自体には、手書きの筆記体すべてを正確に (98% 以上) 認識するのに十分な情報が含まれていません。[要出典]
ほとんどのプログラムでは、ユーザーが「信頼度」を設定できます。つまり、ソフトウェアが希望する精度レベルを達成しない場合は、ユーザーに通知して手動で確認することができます。
OCRスキャンによって生じるエラーは、スキャンノ( typoという用語に類似)と呼ばれることもあります。[40] [41]
ユニコード
OCR をサポートする文字は、1993 年 6 月にバージョン 1.1 がリリースされたときにUnicode標準に追加されました。
これらの文字の一部は、 MICR、OCR-A、またはOCR-Bに固有のフォントからマッピングされます。
参照
参考文献
- ^ 「OCR Document」。Haven OnDemand。2016年4月15日時点のオリジナルよりアーカイブ。
- ^ 「サポートされているメディア形式」。Haven OnDemand。2016年4月19日時点のオリジナルよりアーカイブ。
- ^ ab Schantz, Herbert F. (1982). OCR(光学式文字認識)の歴史. [マンチェスターセンター、バーモント州]: 認識技術ユーザー協会. ISBN 9780943072012。
- ^ ダヴァレ、スニタ・ヴィクラント (2017).高度な画像ベースのスパム検出およびフィルタリング技術。ペンシルバニア州ハーシー: IGI グローバル。 p. 91.ISBN 9781683180142。
- ^ d'Albe, EEF (1914 年 7 月 1 日)。「タイプ読み取りオプトフォンについて」。Proceedings of the Royal Society A: Mathematical, Physical and Engineering Sciences。90 ( 619): 373–375。Bibcode :1914RSPSA..90..373D。doi :10.1098/ rspa.1914.0061。
- ^ 「OCRの歴史」。データ処理マガジン。12 : 46。 1970年。
- ^ 「Android で OCR を使用して画像からテキストを抽出する」。2015 年 6 月 27 日。2016 年 3 月 15 日時点のオリジナルよりアーカイブ。
- ^ 「[チュートリアル] Google Glass での OCR」。2014年10月23日。2016年3月5日時点のオリジナルよりアーカイブ。
- ^ Zeng, Qing-An (2015). ワイヤレス通信、ネットワーク、アプリケーション: WCNA 2014 の議事録。Springer。ISBN 978-81-322-2580-5。
- ^ 「[javascript] LinkedIn 企業検索に OCR とエンティティ抽出を使用する」 2014 年 7 月 22 日。2016 年 4 月 17 日時点のオリジナルよりアーカイブ。
- ^ 「キャプチャをクラックする方法」。andrewt.net。2006年6月28日。 2013年6月16日閲覧。
- ^ 「ビジュアル CAPTCHA の突破」 Cs.sfu.ca. 2002 年 12 月 10 日。 2013 年6 月 16 日閲覧。
- ^ Resig, John (2009 年 1 月 23 日)。「John Resig – OCR と JavaScript のニューラル ネット」。Ejohn.org。2013年6 月 16 日閲覧。
- ^ Tappert, CC; Suen, CY; Wakahara, T. (1990). 「オンライン手書き認識の最新技術」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 12 (8): 787. doi :10.1109/34.57669. S2CID 42920826.
- ^ ab 「光学式文字認識 (OCR) – 仕組み」 Nicomsoft.com 。2013年6 月 16 日閲覧。
- ^ Sezgin, Mehmet; Sankur, Bulent (2004). 「画像閾値化技術と定量的パフォーマンス評価に関する調査」(PDF) . Journal of Electronic Imaging . 13 (1): 146. Bibcode :2004JEI....13..146S. doi :10.1117/1.1631315. 2015年10月16日時点のオリジナル(PDF)からアーカイブ。 2015年5月2日閲覧。
- ^ Gupta, Maya R.; Jacobson, Nathaniel P.; Garcia, Eric K. (2007). 「OCR の二値化と画像の前処理による歴史的文書の検索」(PDF) .パターン認識. 40 (2): 389. Bibcode :2007PatRe..40..389G. doi :10.1016/j.patcog.2006.04.043. 2015年10月16日時点のオリジナル(PDF)からアーカイブ。 2015年5月2日閲覧。
- ^ Trier, Oeivind Due; Jain, Anil K. (1995). 「二値化法の目標指向評価」(PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 17 (12): 1191–1201. doi :10.1109/34.476511. 2015年10月16日時点のオリジナルよりアーカイブ(PDF) . 2015年5月2日閲覧。
- ^ Milyaev, Sergey; Barinova, Olga; Novikova, Tatiana; Kohli, Pushmeet; Lempitsky, Victor (2013). 「自然画像におけるエンドツーエンドのテキスト理解のための画像二値化」。2013 第 12 回国際文書分析認識会議( PDF)。pp. 128–132。doi :10.1109/ ICDAR.2013.33。ISBN 978-0-7695-4999-6. S2CID 8947361. 2017年11月13日時点のオリジナルよりアーカイブ(PDF) 。2015年5月2日閲覧。
- ^ Pati, PB; Ramakrishnan, AG (1987年5月29日). 「単語レベルのマルチスクリプト識別」.パターン認識レター. 29 (9): 1218–1229. Bibcode :2008PaReL..29.1218P. doi :10.1016/j.patrec.2008.01.027.
- ^ 「OpenCV での基本的な OCR | Damiles」。Blog.damiles.com。2008 年 11 月 20 日。2013年6 月 16 日閲覧。
- ^ abc Smith, Ray (2007). 「Tesseract OCR エンジンの概要」(PDF) 。2010年 9 月 28 日時点のオリジナル(PDF)からアーカイブ。2013 年5 月 23 日閲覧。
- ^ 「OCR 入門」。Dataid.com。2013年6 月 16 日閲覧。
- ^ 「OCR ソフトウェアの仕組み」。OCRWizard。2009 年 8 月 16 日時点のオリジナルよりアーカイブ。2013 年6 月 16 日閲覧。
- ^ 「OpenCV による基本的なパターン認識と分類 | Damiles」。Blog.damiles.com。2008 年 11 月 14 日。2013年6 月 16 日閲覧。
- ^ Assefi, Mehdi (2016 年 12 月)。「OCR as a Service: Google Docs OCR、Tesseract、ABBYY FineReader、Transym の実験的評価」。ResearchGate。
- ^ 「最高のOCRテクノロジーがデータの99.91%をキャプチャする方法」www.bisok.com 。 2021年5月27日閲覧。
- ^ abc Woodford, Chris (2012 年 1 月 30 日)。「OCR ドキュメント スキャンの仕組みは?」Explain that Stuff。2013年6 月 16 日閲覧。
- ^ 「画像からテキストを抽出するときに OCR API の結果を最適化する方法 - Haven OnDemand 開発者コミュニティ」。2016 年 3 月 22 日時点のオリジナルよりアーカイブ。
- ^ フェール、ティフ(2019年3月26日)。「900ページのコーエン文書を10分以内に処理する方法」 ニューヨークタイムズ。ISSN 0362-4331 。2023年6月16日閲覧。
- ^ 「Train Your Tesseract」. Train Your Tesseract . 2018年9月20日. 2018年9月20日閲覧。
- ^ 「オンライン インタラクティブ OCR テキスト エディターのポイントは何ですか? - Fenno-Ugrica」。2014 年 2 月 21 日。
- ^ Riedl, C.; Zanibbi, R.; Hearst, MA; Zhu, S.; Menietti, M.; Crusan, J.; Metelsky, I.; Lakhani, K. (2016 年 2 月 20 日)。「特許における図と部品ラベルの検出: 画像処理アルゴリズムの競争ベースの開発」。International Journal on Document Analysis and Recognition。19 (2): 155。arXiv : 1410.6751。doi : 10.1007 /s10032-016-0260-8。S2CID 11873638 。
- ^ ab 「Google Books Ngram Viewer」。books.google.com 。 2023年7月20日閲覧。
2009年にオリジナルのNgram Viewerコーパスを生成したとき、OCRはそれほど良くありませんでした[…]。これは19世紀以前の英語で特に顕著で、
長音のs
(ſ)はfと解釈されることが多かったです[…]。コーパス演算子を使用して2009年、2012年、2019年のバージョンを比較すると、それ以来の改善の証拠がわかります[…]
- ^ 「OCR の精度を評価するためのコードとデータ (元は UNLV/ISRI より)」。Google Code アーカイブ。
- ^ Holley, Rose (2009 年 4 月)。「どれだけ良くなるか? 大規模な歴史的新聞デジタル化プログラムにおける OCR 精度の分析と改善」D-Lib Magazine。2014年1 月 5 日閲覧。
- ^ Suen, CY; Plamondon, R.; Tappert, A.; Thomassen, A.; Ward, JR; Yamamoto, K. (1987 年 5 月 29 日)。手書きとコンピュータ アプリケーションにおける将来の課題。第 3 回手書きとコンピュータ アプリケーションに関する国際シンポジウム、モントリオール、1987 年 5 月 29 日。2008年10 月 3 日閲覧。
- ^ Mohseni, Maedeh Haji Agha; Azmi, Reza; Layeghi, Kamran; Maleki, Sajad (2019). ニューラルネットワークベースの手書きソリューションにおける合成データセットと自然データセットの比較。ITCT – Civilica 経由。
- ^ Kapidakis, Sarantos; Mazurek, Cezary and Werla, Marcin (2015). デジタルライブラリの研究と先端技術。Springer。p. 257。ISBN 9783319245928。
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ Atkinson, Kristine H. (2015). 「医薬品特許取得のための非特許文献の改革」. Pharmaceutical Patent Analyst . 4 (5): 371–375. doi :10.4155/ppa.15.21. PMID 26389649.
- ^ 「スキャンノ」。ヤツガシラ。 2001年5月。
外部リンク
- Unicode OCR – 16進数範囲: 2440-245F Unicode の光学式文字認識
- 手書き文字認識とペンコンピューティングに関する参考文献の注釈付き書誌
