インド系OCRとは、インド系文字で書かれたテキスト画像を光学文字認識(OCR)技術を用いて電子テキストに変換するプロセスを指します。広義には、アブギダ文字体系で書かれたインド亜大陸の文字だけでなく、南アジアや東南アジアの言語で使用されるブラーフミー文字のOCRシステムも指すことがあります。
ラテン文字のOCRはまだ100%の精度には達していませんが、比較的高い変換精度は達成されています。しかし、インド系文字については、OCRを用いて同様の精度を達成することはまだできていません。これは、インド系言語の表記体系に加え、オペレーティングシステムやキーボード間での標準的な表現、エンコード、サポートが不足していることが一因です。
インド電子情報技術省(MeitYとしても知られる)傘下の主要な研究開発機関である先端コンピューティング開発センター(C-DAC)およびインド諸言語技術開発センターは、OCRに関連する多くのプロジェクトを実施してきました。これらのプロジェクトには、マラヤーラム語、オリヤー語、パンジャブ語、テルグ語、デーヴァナーガリー文字のOCRが含まれます。
インドには公式に認められた言語が22 あります。これらのうち、ヒンディー語、ベンガル語、パンジャブ語は最も広く話されているインド・アーリア語であり、それぞれ世界で 4 位、7 位、10 位の言語でもあります。[ 1 ] 2 つ以上の言語を同じ文字で表記することができます。たとえば、デーヴァナーガリー文字はヒンディー語、マラーティー語、ラージャスターニー語、サンスクリット語、ボージュプリー語などの表記に使用され、東ナーガリー文字はベンガル語、アッサム語、マニプリ語などの表記に使用されます。
子音や母音といった基本文字の他に、ほとんどのインド系言語では、2つ以上の基本文字を組み合わせて複合文字を形成します。複合文字の形状は、構成要素となる基本文字よりも複雑です。インド・アーリア語族の一部の言語(ヒンディー語やパンジャブ語など)では文字の上に水平線がありますが、他の言語(グジャラート語など)やドラヴィダ語族の言語(マラヤーラム語、カンナダ語、タミル語、テルグ語)では水平線がありません。これらは、すべてのインド系言語に対応する単一のOCRを作成する上での主な課題の一部です。[ 2 ]
インド系OCRは、一般的に、オーストロアジア語族のムンダ語を表記するために主に作成された、オル・チキ、ワラン・シティ、ムンダリ・バニなど、インドで最近発明された文字体系のサポートも含んでいます。
インド系文字には大文字・小文字の概念が存在しない。ウルドゥー語、シンド語、カシミール語、ターナ語を除き、他のすべてのインド系言語は左から右に書かれる。
OCRはWikisourceやその他のプロジェクトで使用されています。[ 6 ] [ 7 ] [ 8 ]
サンスクリット語の OCR (光学文字認識) により、3,000 冊以上の書籍を含むオフライン コーパスが作成されました。
サンスクリット語の OCR (光学文字認識) により、3,000 冊以上の書籍を含むオフライン コーパスが作成されました。