携帯型スキャナーを使用したスキャンとリアルタイム光学文字認識(OCR)のプロセスを映した動画 光学文字認識 (OCR )または光学文字リーダー とは、スキャンされた 文書 、文書の写真、風景写真(例えば、風景写真の中の看板や広告板の文字)、または画像に重ねられた字幕 テキスト(例えば、テレビ放送から)などから、タイプされたテキスト、手書きのテキスト、または印刷されたテキストの画像を、電子的または機械的に機械でエンコードされたテキストに変換することです。[ 1 ]
OCRは、パスポート、請求書、銀行取引 明細書、コンピュータ化された領収書、名刺、郵便物、印刷されたデータ、その他適切な文書など、印刷 さ れた紙のデータ記録からのデータ入力 の形式として広く使用されており、印刷されたテキストをデジタル化して電子的に編集、検索、よりコンパクトに保存、オンラインで表示し、認知コンピューティング 、機械翻訳 、(抽出された)テキスト音声 変換、キーデータ、テキストマイニングなどの機械処理で使用できるようにするための一般的な方法です。OCRは、 パターン認識 、人工知能 、コンピュータビジョン の研究分野です。
初期のバージョンでは、各文字の画像で学習させる必要があり、一度に 1 つのフォントで作業していました。現在では、ほとんどのフォントに対して高い精度で生成できる高度なシステムが一般的であり、さまざまな画像ファイル形式の 入力をサポートしています。[ 2 ] 一部のシステムは、画像、列、その他の非テキスト要素を含む元のページに非常に近いフォーマットされた出力を再現できます。
アプリケーション OCRエンジンは、領収書、請求書、小切手、法的請求書類など、さまざまな分野に特化したソフトウェアアプリケーションへと発展してきた。
このソフトウェアは以下の用途に使用できます。
ラテン文字、キリル文字、アラビア文字、ヘブライ文字、インド系文字、ベンガル文字(バングラ文字)、デーヴァナーガリー文字、タミル文字、中国語、日本語、韓国語など、一般的な文字体系 のほとんどに対応した、さまざまな商用およびオープンソースのOCRシステムが利用可能です。
種類 OCR は一般的にオフライン処理であり、静的な文書を分析します。オンライン OCR API サービスを提供するクラウドベースのサービスもあります。手書きの動きの分析は、 手書き認識 の入力として使用できます。[ 24 ] この技術は、単にグリフや単語の形状を使用する代わりに、セグメント が描画される順序、方向、ペンを置いて持ち上げるパターンなどの動きを捉えることができます。この追加情報により、処理の精度が向上します。この技術は、「オンライン文字認識」、「動的文字認識」、「リアルタイム文字認識」、「インテリジェント文字認識」としても知られています。
テクニック
前処理 OCRソフトウェアは、認識の成功率を高めるために画像を前処理することがよくあります。その技術には以下が含まれます。[ 25 ]
傾き 補正– スキャン時に文書が正しく配置されていなかった場合、テキストの行が完全に水平または垂直になるように、文書を時計回りまたは反時計回りに数度傾ける必要がある場合があります。 斑点除去 – ポジティブスポットとネガティブスポットの除去、エッジの平滑化 二値化とは、カラーまたは グレースケール の画像を白黒(2色しかないため二値画像と呼ばれる)に変換することです。このタスクは、テキスト(またはその他の必要な画像コンポーネント)を背景から分離する簡単な方法として実行されます。 [ 26 ] 二値化タスクは、ほとんどの商用認識アルゴリズムが二値画像のみで動作するため必要です。これは、二値化の方が簡単だからです。[ 27 ] さらに、二値化の有効性は文字認識の品質に大きく影響するため、特定の入力画像タイプに採用する二値化の選択には慎重な決定が行われます。これは、二値結果を取得するために使用される方法の品質が、画像タイプ(スキャンされた文書、シーンテキスト 画像、劣化した歴史的文書など)に依存するためです。[ 28 ] [ 29 ] 線削除– グリフ以外のボックスと線をクリーンアップします レイアウト分析 またはゾーニング– 列、段落、キャプションなどを個別のブロックとして識別すること。特に複数列のレイアウト や表 において重要です。 線と単語の検出– 単語と文字の形状の基準線を設定し、必要に応じて単語を分離します。 文字認識– 多言語文書では、文字が単語レベルで変化する可能性があるため、特定の文字を処理するために適切な OCR を呼び出す前に、文字を識別する必要があります。[ 30 ] 文字の分離または分割– 文字単位のOCRでは、画像アーティファクトによって連結された複数の文字は分離する必要があります。アーティファクトによって複数の断片に分割された単一の文字は連結されたままにする必要があります。 アスペクト比 とスケール の正規化[ 31 ] 固定ピッチフォント のセグメンテーションは、垂直グリッド線が黒領域と交差する頻度が最も低い位置に基づいて画像を均一グリッドに合わせることで比較的簡単に実現できます。プロポーショナルフォント の場合は、文字間の空白が単語間の空白よりも大きくなる場合があり、垂直線が複数の文字と交差する可能性があるため、より高度な技術が必要です。[ 32 ]
テキスト認識 コアOCRアルゴリズムには2つの基本的なタイプがあり、候補文字のランク付けリストを生成する可能性があります。[ 33 ]
マトリックスマッチング とは、画像と保存されたグリフをピクセル単位で比較する手法で、パターンマッチング 、パターン認識 、画像相関 とも呼ばれます。この手法は、入力グリフが画像内の他の部分から正しく分離されていること、および保存されたグリフが類似のフォントで同じスケールであることを前提としています。この手法はタイプライターで打たれたテキストには最適ですが、新しいフォントにはうまく対応できません。これは、初期の光電セルベースのOCRが比較的直接的に実装していた手法です。特徴抽出は 、グリフを線、閉じたループ、線の方向、線の交点などの「特徴」に分解します。抽出された特徴は表現の次元を削減し、認識プロセスを計算効率化します。これらの特徴は、1 つ以上のグリフプロトタイプに縮小される可能性のある、文字の抽象的なベクトルのような表現と比較されます。コンピュータビジョンにおける特徴検出 の一般的な手法は、この種の OCR に適用可能であり、「インテリジェント」な手書き認識 や最新の OCR ソフトウェアのほとんどでよく見られます。[ 34 ] k 近傍アルゴリズム などの最近傍分類器は、 画像の特徴を保存されたグリフの特徴と比較し、最も近い一致を選択するために使用されます。[ 35 ] [ 36 ] Cuneiform やTesseract などのソフトウェアは、文字認識に2段階のアプローチを採用しています。2段階目は適応型認識と呼ばれ、1段階目で高い信頼度で認識された文字の形状を利用して、2段階目で残りの文字をより正確に認識します。これは、特殊なフォントや、フォントが歪んでいる(ぼやけている、色あせているなど)低品質のスキャン画像に有効です。[ 32 ]
2024年現在 現代のOCRソフトウェアには、Google Docs OCR、ABBYY FineReader 、Transym、およびTesseract 5(LSTMベースの認識エンジンを導入)[ 37 ] 、PaddleOCR(80以上の言語をサポートする多言語OCRツールキット)[ 38 ] 、TrOCR(手書きおよび印刷されたテキスト認識のためにMicrosoftが開発したトランスフォーマーベースのモデル)[ 39 ] などのオープンソースエンジンが含まれます。[ 40 ] OCRopus やTesseractなどの他のソフトウェア は、単一の文字に焦点を当てるのではなく、テキストの行全体を認識するようにトレーニングされたニューラルネットワークを使用します。
反復OCRと呼ばれる技術は、ページレイアウトに基づいて文書を自動的にセクションに分割します。次に、可変文字信頼度レベルの閾値を使用して各セクションに対して個別にOCRを実行し、ページレベルのOCR精度を最大化します。この方法については、米国特許庁から特許が発行されています。[ 41 ]
OCRの結果は、米国議会図書館 が管理する専用のXMLスキーマである標準化された ALTO 形式で保存できます。その他の一般的な形式には、hOCR やPAGE XML などがあります。
光学文字認識ソフトウェアの一覧については、「光学文字認識ソフトウェアの比較」を 参照してください。
後処理 OCR の精度は、出力が語彙集 ( 文書内で使用が許可されている単語のリスト) によって制限されている場合に向上します。[ 25 ] これは、たとえば英語のすべての単語、または特定の分野のより専門的な語彙集である可能性があります。この手法は、文書に固有名詞 などの語彙集に含まれていない単語が含まれている場合に問題となる可能性があります。Tesseractは、精度を向上させるために、独自の辞書を使用して文字分割ステップに影響を与えます。[ 32 ]
出力ストリームはプレーンテキスト ストリームまたは文字ファイルである場合もあるが、より高度なOCRシステムはページの元のレイアウトを保持し、例えば、ページの元の画像と検索可能なテキスト表現の両方を含む注釈付きPDF を生成することができる。
近隣分析では、特定の単語が一緒によく見られることに着目することで、 共起 頻度を利用してエラーを修正することができます。[ 42 ] 例えば、「Washington, DC」は一般的に「Washington DOC」よりも英語でずっとよく使われます。
スキャン対象言語の文法に関する知識は、例えば単語が動詞か名詞かを判断するのに役立ち、より高い精度を可能にする。
レーベンシュタイン距離 アルゴリズムは、OCR API からの結果をさらに最適化するために、OCR の後処理にも使用されています。[ 43 ]
アプリケーション固有の最適化 近年、主要なOCR技術プロバイダーは、特定の種類の入力データをより効率的に処理できるよう、OCRシステムの改良に着手しました。アプリケーション固有の語彙集に加え、ビジネスルール、標準表現、カラー画像に含まれる豊富な情報などを考慮に入れることで、パフォーマンスの向上を図ることができます。この手法は「アプリケーション指向OCR」または「カスタマイズOCR」と呼ばれ、ナンバー プレート、請求書 、スクリーンショット 、IDカード 、運転免許証 、自動車製造 などのOCRに適用されています。
ニューヨーク・タイムズは OCR技術を応用し、独自のツール「 Document Helper」 を開発しました。これにより、インタラクティブニュースチームはレビューが必要な文書の処理を加速できます。同紙によると、このツールを使えば、記者が内容を確認する準備として、1時間に最大5,400ページもの文書を処理できるとのことです。 [ 44 ]
回避策 文字認識の問題を解決するには、OCRアルゴリズムの改良以外にもいくつかの手法が存在する。
OCR-A 、OCR-B 、MICR フォントなどの特殊フォントは、サイズ、間隔、特徴的な文字形状が正確に指定されているため、銀行小切手処理における文字起こしの精度が向上します。いくつかの主要なOCRエンジンは、ArialやTimes New Romanなどの一般的なフォントのテキストをキャプチャするように設計されており、特殊で一般的に使用されているフォントとは大きく異なるこれらのフォントのテキストをキャプチャすることはできません。Google Tesseractは新しいフォントを認識するようにトレーニングできるため、OCR-A、OCR-B、MICRフォントを認識できます。[ 45 ]
ソ連の郵便番号 櫛形フィールドは 、人間がより読みやすく書くように促す事前に印刷された枠で、 1つの枠に1つのグリフが印刷されます。[ 42 ] これらは多くの場合、OCRシステムで簡単に除去できるドロップアウトカラー で印刷されます。 [ 42 ] この技術は、数字の郵便番号と、すべての封筒の下部にある標準化された枠があり、ユーザーがドットを結んで数字を印刷していた旧ソビエト連邦で使用されていました。[ 46 ]
Palm OSは、 グラフィティ と呼ばれる特殊な文字セットを使用していた。これは印刷された英語の文字に似ているが、プラットフォームの処理能力が限られたハードウェアでも認識しやすいように簡略化または変更されている。ユーザーはこれらの特殊な文字の書き方を習得する必要があった。
ゾーンベースOCRは、画像を文書の特定の部分に限定します。これは一般的にテンプレートOCR と呼ばれます。
正確さ Googleのn-gram データベースにおける、1700年から1900年までの英語文書における「Laft」と「Last」の出現頻度(「English 2009」コーパスのOCRスキャンに基づく)。 Googleのn-grams データベースにおけるlaftとlastの出現頻度(「English 2012」コーパスのOCRスキャンに基づく)[ 49 ] 英語で長いS を含む単語を検索すると、2012年以降はSに正規化されます。米国エネルギー省 (DOE)の委託を受けた情報科学研究所(ISRI)は、機械印刷文書を理解するための自動化技術の改善を促進することを使命とし、1992年から1996年にかけて最も権威のあるOCR精度年次テストを実施した。 [ 50 ]
鮮明な画像が利用可能な場合でも、タイプされたラテン文字 テキストの認識は依然として 100% 正確ではありません。19 世紀から 20 世紀初頭の新聞ページの認識に基づくある研究では、市販の OCR ソフトウェアの文字ごとの OCR 精度は 81% から 99% まで変動すると結論付けられました。 [ 51 ] 全体の精度は、人間のレビューまたはデータ ディクショナリ認証によって達成できます。手書き、筆記体、および他の文字体系 (特に 1 文字に多くの画がある東アジア言語の文字) の印刷テキストの認識 を 含むその他の分野は、現在 も活発な研究の対象となっています。MNISTデータベースは 、手書き数字を認識するシステムの能力をテストするためによく使用されます。
精度率はいくつかの方法で測定できますが、測定方法によって報告される精度率が大きく変わる可能性があります。たとえば、単語のコンテキスト(単語の語彙)を使用して、存在しない単語を見つけるソフトウェアを修正しない場合、文字エラー率が 1%(精度 99%)であっても、各単語全体が誤った文字なしで認識されたかどうかに基づいて測定すると、エラー率が 5% またはそれ以上になる可能性があります。[ 52 ] ニューラルネットワークベースの手書き認識ソリューションでは、十分な大きさのデータセットを使用することが重要です。一方、自然なデータセットを作成することは非常に複雑で時間がかかります。[ 53 ]
古いテキストをデジタル化する際に内在する困難の一例として、OCR が「長い s 」と「f」の文字を区別できないことが挙げられる。[ 54 ] [ 49 ]
筆記体 の認識率は、活字体 の認識率よりもさらに低い。文脈情報や文法情報を用いなければ、一般的な筆記体の認識率を高めることはおそらく不可能だろう。例えば、辞書から単語全体を認識する方が、筆記体から個々の文字を解析するよりも簡単だ。小切手 の金額 欄(常に数字が書かれている)を読む場合、より小さな辞書を使うことで認識率を大幅に向上させることができる。個々の筆記体の文字の形状自体には、すべての手書き筆記体を正確に(98%以上)認識するのに十分な情報が含まれていないのだ。
ほとんどのプログラムでは、ユーザーが「信頼度」を設定できます。つまり、ソフトウェアがユーザーが望む精度レベルに達しない場合、ユーザーに通知され、手動での確認を求められるということです。
OCRスキャンによって発生するエラーは、 (タイポ という用語になぞらえて)スキャンノ と呼ばれることがある。[ 55 ] [ 56 ]
参考文献 ↑ 「OCRドキュメント」。Haven OnDemand 。 2016年4月15日にオリジナルからアーカイブされました。 ↑ 「サポートされているメディア形式」 。Haven OnDemand 。 2016年4月19日に オリジナル からアーカイブされました。 1 2 Schantz, Herbert F. (1982). OCRの歴史、光学文字認識 。[マンチェスターセンター、バーモント州]: 認識技術ユーザー協会 。ISBN 9780943072012 。↑ ダバレ、スニタ・ヴィクラント (2017)。 高度な画像ベースのスパム検出およびフィルタリング技術 。ペンシルバニア州ハーシー: IGI グローバル。 p. 91.ISBN 9781683180142 。↑ d'Albe, EEF (1914年7月1日) 「タイプ読み取りオプトフォンについて」 Proceedings of the Royal Society A: Mathematical, Physical and Engineering Sciences . 90 (619): 373–375 . Bibcode : 1914RSPSA..90..373D . doi : 10.1098/rspa.1914.0061 . ↑ US1838389A 、 エマニュエル・ゴールドバーグ、 「統計機械」、 1931年12月29日発行 ↑ "IBM プレス ルーム - 2009-07-28 IBM が SPSS Inc. を買収し、顧客に予測分析機能を提供 - 米国" . www-03.ibm.com . 2009 年 7 月 28 日。2009 年 7 月 31 日の オリジナルからアーカイブ済み。2026 年 1 月 9 日 取得 。 ↑ 「OCRの歴史」。 データ処理マガジン 。12 :46。1970年 。 ↑ 「光学文字認識(OCR)とは?」 。 IBM 。 2026年3月2日に オリジナル からアーカイブ済み 。 2026年 7月7日 に取得。 ↑ 「Word Lensはテキストをリアルタイムで翻訳します」 。CBS ニュース 。2014年6月3日。 2026年 7月7日 閲覧 。 ↑ 「AndroidでOCRを使用して画像からテキストを抽出する」 。2015年6月27日。2016年3月15日に オリジナル からアーカイブされました 。 ↑ 「 [ チュートリアル ] Google GlassでのOCR」 。2014年10月23日。2016年3月5日に オリジナル からアーカイブされました 。 ↑ Singh, Richa; Sharma, Vikrant; Kashyap, Rekha; Manwal, Manika (2024年3月14日). 「深層学習技術を用いた保険アプリケーション向け複数ページ文書の自動分類と情報抽出」. 2024年 第11回信頼性、情報通信技術、最適化に関する国際会議(動向と将来の方向性)(ICRITO) . IEEE. pp. 1–7 . Bibcode : 2024icri.confQ..96S . doi : 10.1109/ICRITO61523.2024.10522111 . ISBN 979-8-3503-5035-7 。↑ Doss, Yasmine; Boubaker, Olfa (2026年1月1日)、 「医療保険文書からの重要情報抽出:光学文字認識に基づく手法と光学文字認識を用いない手法の比較研究」 、 AI and Data Science in Healthcare 5.0 、Academic Press、pp. 145–159 、 doi : 10.1016/B978-0-443-36556-0.00013-3 、 ISBN 978-0-443-36556-0 ( 2026年6月23日 取得) {{citation}}: CS1メンテナンス: ISBNを使用した作業パラメータ (リンク)↑ Arora, Shraddha; Pandey, Mrinal; Arora, Mamta; Gupta, Komal; Sharma, Vineet; Nagpal, Lakshay (2024年1月1日). "インテリジェント文書管理システムを使用したキャッシュレス請求決済のための健康保険文書のデジタル化" . Procedia Computer Science . 国際機械学習およびデータ工学会議 (ICMLDE 2023). 235 : 1319– 1331. doi : 10.1016/j.procs.2024.04.125 . ISSN 1877-0509 . ↑ Zeng, Qing-An (2015). Wireless Communications, Networking and Applications: Proceedings of WCNA 2014. Springer. ISBN 978-81-322-2580-5 。↑ " [ javascript ] LinkedIn 企業検索のための OCR とエンティティ抽出の使用" 。2014 年 7 月 22 日。2016年 4 月 17 日の オリジナル からアーカイブ済み。 ↑ 「CAPTCHAを突破する方法」 . andrewt.net. 2006年6月28日. 2013年 6月16日 取得 . ↑ 「ビジュアルCAPTCHAの突破」 . Cs.sfu.ca. 2002年12月10日. 2013年 6月16日 取得 . ↑ Resig, John (2009年1月23日). 「John Resig – JavaScriptによるOCRとニューラルネットワーク」 . Ejohn.org . 2013年 6月16日 取得 。 ↑ Ignat, Oana; Maillard, Jean; Chaudhary, Vishrav; Guzmán, Francisco (2022). "OCR は低リソース言語の機械翻訳を改善します" . 計算言語学会の調査結果 . 計算言語学会: 1164– 1174. doi : 10.18653/v1/2022.findings-acl.92 . ↑ Ramiah, Sathiapriya; Liong, Tan Yu; Jayabalan, Manoj (2015). "Android を使用した英語翻訳と音声のための光学文字認識によるテキストベース画像の検出". 2015 IEEE Student Conference on Research and Development (SCOReD) . IEEE. pp. 272–277 . Bibcode : 2015scor.conf...42R . doi : 10.1109/SCORED.2015.7449339 . ISBN 978-1-4673-9572-4 。↑ Afli, Haithem; Way, Andy (2016). Hinrichs, Erhard; Hinrichs, Marie; Trippel, Thorsten (編). "Integrating Optical Character Recognition and Machine Translation of Historical Documents" . Proceedings of the Workshop on Language Technology Resources and Tools for Digital Humanities (LT4DH) . 大阪、日本: COLING 2016 Organizing Committee: 109–116 . ↑ Tappert, CC; Suen, CY; Wakahara, T. (1990). "オンライン手書き認識の現状". IEEE Transactions on Pattern Analysis and Machine Intelligence . 12 (8): 787. Bibcode : 1990ITPAM..12..787T . doi : 10.1109/34.57669 . S2CID 42920826 . 1 2 「光学文字認識(OCR) – その仕組み」 。Nicomsoft.com 。 2013年 6月16日 取得 。 ↑ Sezgin, Mehmet; Sankur, Bulent (2004). "画像閾値処理技術と定量的性能評価に関する調査" (PDF) . Journal of Electronic Imaging . 13 (1): 146. Bibcode : 2004JEI....13..146S . doi : 10.1117/1.1631315 . 2015年10月16日に オリジナル (PDF) からアーカイブ済み。 2015年 5月2日 に取得 。 ↑ Gupta, Maya R.; Jacobson, Nathaniel P.; Garcia, Eric K. (2007). "OCR 二値化と画像前処理による歴史的文書の検索" (PDF) . Pattern Recognition . 40 (2): 389. Bibcode : 2007PatRe..40..389G . doi : 10.1016/j.patcog.2006.04.043 . 2015 年 10 月 16 日に オリジナル (PDF)からアーカイブ済み。2015 年 5 月 2 日 に取得 。 ↑ Trier, Oeivind Due; Jain, Anil K. (1995). "Goal-directed evaluation of binarisation methods" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 17 (12): 1191– 1201. Bibcode : 1995ITPAM..17.1191T . doi : 10.1109/34.476511 . 2015年10月16日のオリジナルから アーカイブ (PDF) 。 2015年 5月2日 取得 。 ↑ ミリャエフ、セルゲイ;バリノワ、オルガ;ノヴィコワ、タチアナ;コーリ、プシュミート;レンピツキー、ヴィクトル(2013)。「自然画像におけるエンドツーエンドのテキスト理解のための画像二値化」。 2013年第12 回 国際文書解析認識会議 (PDF) 。pp. 128–132。doi : 10.1109 / ICDAR.2013.33。ISBN 978-0-7695-4999-6 . S2CID 8947361 . 2017年11月13日にオリジナルからアーカイブ(PDF)されました 。 2015年 5月2日 に取得。 ↑ Pati, PB; Ramakrishnan, AG (1987年5月29日). "単語レベルのマルチスクリプト識別". Pattern Recognition Letters . 29 (9): 1218– 1229. Bibcode : 2008PaReL..29.1218P . doi : 10.1016/j.patrec.2008.01.027 . ↑ 「OpenCV の基本 OCR | Damiles」 。Blog.damiles.com。2008 年 11 月 20 日。2013 年 6 月 16 日 取得 。 1 2 3 Smith, Ray (2007). "Tesseract OCR エンジンの概要" (PDF) 。2010 年 9 月 28 日に オリジナル (PDF)からアーカイブ済み。2013 年 5 月 23 日 に取得 。 ↑ 「OCR入門」 。Dataid.com 。 2013年 6月16日 取得 。 ↑ 「OCRソフトウェアの仕組み」 。OCRWizard。 2009年8月16日の オリジナルからアーカイブ済み 。 2013年 6月16日 取得。 ↑ Hazra, Tapan Kumar; Singh, Dhirendra Pratap; Daga, Nikunj (2017). "カスタム画像データセットを用いたKNNによる光学文字認識". 2017年第8回産業オートメーションおよび電気機械工学会議(IEMECON) . IEEE. pp. 110–114 . doi : 10.1109/IEMECON.2017.8079572 . ISBN 978-1-5386-2215-5 。↑ Ong, Veronica; Suhartono, Derwin (2016年3月1日). "光学文字認識におけるK近傍法の使用" . ComTech: Computer, Mathematics and Engineering Applications . 7 (1): 53. doi : 10.21512/comtech.v7i1.2223 . ISSN 2476-907X . ↑ tesseract-ocr/tesseract 、tesseract-ocr、2026年3月27日、 2026年 3月27日 取得 ↑ PaddlePaddle/PaddleOCR 、PaddlePaddle、2026年3月27日、 2026年 3月27日 取得 ↑ リー・ミンハオ。 LV、テンチャオ。チェン、ジンイェ。崔、雷。ルー、イージュアン。フロレンシオ、ディネイ;張、茶;李、周君。 Wei、Furu (2022 年 9 月 6 日)、 TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models 、 arXiv : 2109.10282 ↑ Assefi, Mehdi (2016 年 12 月). "OCR as a Service: Google Docs OCR、Tesseract、ABBYY FineReader、および Transym の実験的評価" . ResearchGate . ↑ 「最高のOCR技術がデータの99.91%をキャプチャする方法」 。www.bisok.com 。 2021年 5月27日 取得 。 1 2 3 Woodford, Chris (2012年1月30日). 「OCRによる文書スキャンはどのように機能するのか?」 Explain that Stuff . 2013年 6月16日 取得 。 ↑ 「画像からテキストを抽出する際にOCR APIの結果を最適化するには? - Haven OnDemand開発者コミュニティ」 。 2016年3月22日に オリジナル からアーカイブされました。 ↑ フェール、ティフ(2019年3月26日) 「コーエン文書900ページ を 10分未満で読み終えた方法」 ニューヨーク ・タイムズ 。ISSN 0362-4331 。 2023年 6月16日 取得 。 ↑ 「Train Your Tesseract」 。Train Your Tesseract 。2018年9月20日。 2018年 9月20日 取得 。 ↑ ウィルクス、ヨリック(2019)。 人工知能:現代の魔法か、それとも危険な未来か? ロンドン、イングランド。98 ページ 。ISBN 9781785-78-516-0 。{{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)↑ 「オンラインのインタラクティブOCRテキストエディタの利点とは? - Fenno-Ugrica」 2014年2月21日。 ↑ Riedl, C.; Zanibbi, R.; Hearst, MA; Zhu, S.; Menietti, M.; Crusan, J.; Metelsky, I.; Lakhani, K. (2016年2月20日). "特許における図と部品ラベルの検出:画像処理アルゴリズムの競争に基づく開発". International Journal on Document Analysis and Recognition . 19 (2): 155. arXiv : 1410.6751 . doi : 10.1007/s10032-016-0260-8 . S2CID 11873638 . 1 2 「Google Books Ngram Viewer」 books.google.com 2023 年 7月20日 取得 。 2009年に最初のNgram Viewerコーパスを作成した当時、OCRの精度は今ほど高くありませんでした […]。 これは特に19世紀以前の英語で顕著で、 長い中間s (ſ)はしばしばfと解釈されていました […]。 2009年、2012年、2019年のバージョンを比較するためにコーパス演算子を使用した、それ以降の改善点の証拠を以下に示します […] ↑ 「OCR精度を評価するためのコードとデータ(元々はUNLV/ISRIによる)」 。Googleコードアーカイブ。 ↑ Holley, Rose (2009年4月) 「どれほど良くなるのか?大規模な歴史的新聞デジタル化プログラムにおけるOCR精度の分析と改善」 D-Lib Magazine 。 2014年 1月5日 取得 。 ↑ Suen, CY; Plamondon, R.; Tappert, A.; Thomassen, A.; Ward, JR; Yamamoto, K. (1987年5月29日). 手書きとコンピュータアプリケーションにおける将来の課題 . 第3回手書きとコンピュータアプリケーションに関する国際シンポジウム、モントリオール、1987年5月29日. 2008年 10月3日 取得 . ↑ Mohseni, Maedeh Haji Agha; Azmi, Reza; Layeghi, Kamran; Maleki, Sajad (2019). ニューラルネットワークベースの手書き認識ソリューションにおける合成データセットと自然データセットの比較 。ITCT – Civilica経由。 ↑ Kapidakis, Sarantos; Mazurek, Cezary; Werla, Marcin (2015). Research and Advanced Technology for Digital Libraries (PDF) . Springer. p. 257. doi : 10.1007/978-3-319-24592-8 . ISBN 9783319245928 2025年11月3日にオリジナルからアーカイブされました。↑ Atkinson, Kristine H. (2015). "医薬品特許のための非特許文献の再構築". Pharmaceutical Patent Analyst . 4 (5): 371–375 . doi : 10.4155/ppa.15.21 . PMID 26389649 . ↑ 「スキャンノ」 。 ヤツガシラ 。 2001年5月。
外部リンク ウィキメディア・コモンズには、光学文字認識 に関連するメディアがあります。
Unicode OCR – 16進数範囲: 2440-245F Unicodeにおける光学文字認識 手書き文字認識とペンコンピューティングに関する参考文献の注釈付き参考文献一覧