文書処理は、アナログ文書をデジタル化することを目的とした研究分野であり、一連の生産プロセスです。文書処理は、単に文書を撮影またはスキャンしてデジタル画像を取得するだけでなく、文書をデジタル的に理解可能にすることも目的としています。これには、文書の構造またはレイアウトを抽出し、次にテキストまたは画像の形式をとることができるコンテンツを抽出します。このプロセスには、従来のコンピュータビジョンアルゴリズム、畳み込みニューラルネットワーク、または手作業が含まれる場合があります。対処される問題は、意味的セグメンテーション、オブジェクト検出、光学文字認識(OCR)、手書き文字認識(HTR)、およびより広義には、自動か手動かを問わず転写に関連しています。[ 1 ]この用語には、スキャナを使用して文書をデジタル化する段階と、たとえば自然言語処理(NLP)または画像分類技術を使用して文書を解釈する段階も含まれる場合があります。これは、管理プロセスの最適化、メール処理、アナログアーカイブおよび歴史的文書のデジタル化のために、多くの産業および科学分野で適用されています。
文書処理は当初、そして現在もある程度は、手紙や小包などの文書を処理し、データを分類、抽出、または大量抽出することを目的とした一種の生産ライン作業でした。この作業は社内で行うことも、ビジネスプロセスアウトソーシングを通じて行うこともできました。[ 2 ] [ 3 ]文書処理には、実際には、 Mechanical Turkのような外部委託された手作業が含まれることがあります。
手作業による文書処理の例として、比較的最近の2007年には、[ 4 ] 「数百万件のビザおよび市民権申請」の文書処理に「約1,000人の契約労働者」が「郵便室の管理とデータ入力」に従事していた。
文書処理は、コンピューターのマウスやスキャナーが使われるずっと前からキーボードによるデータ入力で行われていましたが、1990年のニューヨーク・タイムズの記事では、いわゆる「ペーパーレスオフィス」について、「文書処理はスキャナーから始まる」と述べていました。[ 5 ]この文脈で、元ゼロックス副社長のポール・ストラスマンは、コンピューターはオフィスの紙の量を減らすのではなく増やすと批判的な意見を述べました。[ 5 ]飛行機のエンジニアリングとメンテナンスの文書は「飛行機自体よりも重い」と言われていました。
技術水準が進歩するにつれて、文書処理は「文書の構成要素をデータベースエンティティとして扱う」方向へと移行した。[ 6 ]
自動文書処理、またはインテリジェント文書処理(IDP)と呼ばれる技術は、インテリジェントプロセスオートメーション(IPA)の特定の形態として登場し、機械学習(ML)、自然言語処理(NLP)、インテリジェント文字認識(ICE)などの人工知能を組み合わせて、さまざまな種類の文書からデータを抽出します。[ 7 ] [ 8 ]インテリジェント文書処理とも呼ばれる自動文書処理の進歩により、例外が少なく、より高速に非構造化データを処理する能力が向上しています。[ 9 ]
自動文書処理は、構造化されているか否かを問わず、あらゆる種類の文書に適用されます。たとえば、ビジネスや金融の世界では、紙ベースの請求書、フォーム、発注書、契約書、通貨手形を処理するためにテクノロジーが使用されることがあります。[ 10 ]金融機関は、規制フォームやローン書類などの大量のフォームを処理するために、インテリジェント文書処理を使用します。IDは、AIを使用して文書からデータを抽出および分類し、手動のデータ入力を置き換えます。[ 11 ]
医療分野では、患者の経過観察を容易にし、管理手続きを効率化するために、特に医療や検査分析レポートをデジタル化することで、文書処理方法が開発されてきました。また、医療データベースの標準化も目標の一つです。[ 12 ]アルゴリズムは、磁気共鳴画像[ 13 ] [ 14 ]や顕微鏡画像[ 15 ]の分析など、医師の診断を直接支援するためにも使用されています。
文書処理は、アーカイブや文化遺産コレクションから歴史的なビッグデータを抽出するために、人文科学やデジタル人文科学でも広く利用されています。新聞アーカイブなどのテキスト文書[ 16 ]だけでなく、画像[ 17 ]や地図[ 18 ] [ 19 ]など、さまざまなソースに対して特定のアプローチが開発されています。
1980年代以降、従来のコンピュータビジョンアルゴリズムが文書処理問題の解決に広く使用されてきたが、[ 20 ] [ 21 ] 2010年代には徐々にニューラルネットワーク技術に置き換えられてきた。[ 22 ]しかし、一部の分野では、従来のコンピュータビジョン技術がニューラルネットワークと組み合わせて使用されることもある。
多くの技術が文書処理の開発を支えており、特に光学文字認識(OCR)や手書き文字認識(HTR)は、テキストの自動転記を可能にする。テキストセグメント自体は、インスタンス検出アルゴリズムまたはオブジェクト検出アルゴリズムを用いて識別され、場合によっては文書の構造を検出するためにも使用される。後者の問題の解決には、セマンティックセグメンテーションアルゴリズムが用いられることもある。
これらの技術は、文書処理の中核を成すことが多い。しかし、これらの処理の前または後に他のアルゴリズムが介入することもある。実際、文書のデジタル化技術も、従来のスキャンまたは3次元スキャンの形で関与している。[ 23 ] 3D文書のデジタル化は、特に写真測量の派生技術を利用することがある。文書のサイズに適応するため、またはスキャンの人間工学上の理由から、特定の2Dスキャナを開発する必要がある場合もある。[ 17 ]文書処理は、文書を適切なファイル形式でデジタルエンコードすることにも依存する。さらに、異種データベースの処理は、画像分類技術に依存することがある。
処理チェーンのもう一方の端には、さまざまな画像補完、外挿、またはデータクリーンアップアルゴリズムがあります。テキスト文書の場合、解釈には自然言語処理(NLP)技術を使用できます。
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)