機械可読文書とは、その内容がコンピュータによって容易に処理できる文書のことである。このような文書は、より一般的な機械可読データとは異なり、作成目的となるビジネスプロセスをサポートするために必要なコンテキストを提供する構造を備えている点で区別される。
文脈のないデータは意味がなく、 ISO 15489 情報および文書 - 記録管理: [ 1 ]で規定されている信頼できるビジネス記録の 4 つの重要な特性を欠いています。
情報の大部分は非構造化データであり、ビジネスの観点から見ると、それは「未成熟」、すなわち能力成熟度モデルのレベル1(混沌)に相当します。このような未成熟さは、非効率性を招き、品質を低下させ、有効性を制限します。また、非構造化情報は記録管理機能には不向きであり、法的目的のための十分な証拠を提供できず、訴訟における証拠開示のコストを押し上げ、日常的な業務プロセスにおけるアクセスと利用を不必要に煩雑にします。
機械可読性には少なくとも4つの側面がある。
1983年にはすでに、米国政府会計検査院(GAO)は機械可読情報の利点を強調し始めていました。[ 2 ]さらに早く、1981年には、GAOは米国連邦政府における記録管理の不備の問題を報告し始めました。[ 3 ] このような欠陥は政府に限ったことではなく、情報技術の進歩により、現在ではほとんどの情報が「デジタルネイティブ」であり、自動化された手段で管理することがはるかに容易になる可能性があります。[ 4 ] しかし、2010年の議会証言で、GAOは電子記録の管理に関する問題を強調し、2015年になっても、GAOは行政機関が記録管理要件を満たすパフォーマンスの不備を報告し続けています。[ 5 ] [ 6 ]さらに、かつて非常に尊敬されていた大手監査法人アーサー・アンダーセンが記録破棄スキャンダルにより破綻して から20年以上経った2016年の大統領選挙では、記録管理の慣行が中心的な問題となりました。
2011年1月4日、オバマ大統領は、 2010年政府業績成果法(GPRA)近代化法(GPRAMA)であるHR 2142に署名し、PL 111-352として法律化しました。GPRAMAの第10条では、米国の連邦機関が戦略計画と業績計画および報告書を検索可能な機械可読形式で公開することを義務付けています。[ 7 ] さらに、2013年には、政府情報全般の新たなデフォルトとしてオープンかつ機械可読にする大統領令13642を発令しました。 [ 8 ] 2016年7月28日、行政管理予算局(OMB)は、改訂版の通達A-130に、機関がオープンで機械可読な形式を使用すること、[ 9 ]そして「可能な限り幅広い目的での分析と再利用を促進する方法でオンラインで公開する」こと[ 10 ]を指示することで、これに追随しました。これは、情報が一般にアクセス可能で機械可読であることを意味します。 2019年1月14日、トランプ大統領はHR 4174 [ 11 ]オープン政府データ法(OGDA)に署名し、政府機関が公共データ資産を機械可読形式で利用可能にすることを法律で規定しました。2019年6月28日、OMBは通達A-11 [ 12 ]で、GPRAMAの第10条の遵守を開始する意向を表明しました。[ 13 ]
こうした政策の方向性を支える技術の進歩により、機械可読な電子記録のより効率的かつ効果的な管理と利用が可能になっています。 文書指向データベースは、半構造化データとも呼ばれる文書指向情報を保存、検索、管理するために開発されました。拡張マークアップ言語(XML )は、人間が読みやすく機械も読みやすい形式で文書をエンコードするためのルールを定めた、ワールドワイドウェブコンソーシアム(W3C)の勧告です。多くのXMLエディタツールが開発されており、主要な情報技術アプリケーションのほとんどすべてが、程度の差こそあれXMLをサポートしています。XML自体がオープンで標準的な機械可読形式であるため、アプリケーション開発者にとって比較的容易にXMLをサポートできます。
W3C の付随する XML スキーマ ( XSD ) 勧告では、XML 文書内の要素を正式に記述する方法が規定されています。XML スキーマの仕様に関しては、構造化情報標準推進機構(OASIS) が主要な標準開発組織です。しかし、多くの技術開発者はJSONでの作業を好み、検証、ドキュメント作成、およびインタラクション制御のための JSON データの構造を定義するために、インターネット技術タスクフォース(IETF)によってJSON スキーマが開発されました。
ポータブルドキュメントフォーマット(PDF)は、アプリケーションソフトウェア、ハードウェア、オペレーティングシステムに依存しない方法でドキュメントを表示するために使用されるファイル形式です。各PDFファイルには、テキスト、フォント、グラフィック、および表示に必要なその他の情報を含む、ドキュメントの表示に関する完全な記述がカプセル化されています。PDF /Aは、電子ドキュメントのアーカイブと長期保存での使用に特化した、ISO規格に準拠したPDFのバージョンです。PDF/A-3では、XMLなどの他のファイル形式をPDF/A準拠のドキュメントに埋め込むことができ、人間と機械の両方にとって最適な可読性を提供できる可能性があります。W3CのXSL-FO(XSL Formatting Objects)マークアップ言語は、 PDFファイルの生成によく使用されます。
メタデータ、つまりデータに関するデータは、電子リソースの整理、デジタル識別情報の提供、リソースのアーカイブと保存のサポートに利用できます。適切に構造化された機械可読な電子記録では、その内容をデータとメタデータの両方として再利用できます。電子記録管理システムにおいては、「管理」と「メタデータ」という用語はほぼ同義です。適切なメタデータがあれば、記録管理機能を自動化できるため、証拠隠滅やその他の不正な記録操作のリスクを軽減できます。さらに、このような記録は、データベースに保存されているデータの監査プロセスを自動化するためにも利用でき、マキャベリ的な「唯一の真実」という概念に伴う単一障害点のリスクを軽減できます。
ブロックチェーンは、改ざんや修正から保護された、継続的に増加する記録リストを作成・維持することを可能にします。重要な特徴は、分散型システムのすべてのノードがブロックチェーンのコピーを保持しているため、操作や不正行為の対象となる単一障害点が存在しないことです。