

書籍のスキャンまたは書籍のデジタル化(雑誌のスキャンまたは雑誌のデジタル化とも呼ばれる)は、イメージスキャナを使用して、物理的な書籍や雑誌を画像、電子テキスト、または電子書籍(eブック)などのデジタルメディアに変換するプロセスです。大規模な書籍スキャンプロジェクトにより、多くの書籍がオンラインで利用可能になりました。デジタル書籍は簡単に配布、複製、画面上での閲覧が可能です。イメージスキャナは手動または自動で使用できます。スキャン後、ソフトウェアは、位置合わせ、トリミング、画像編集、テキストおよび最終的な電子書籍形式への変換によって、ドキュメント画像を調整します。書籍のデジタル化のスキャン解像度は、資料の目的と性質によって異なります。1時間に数千ページを処理できるハイエンドスキャナは、数千ドルかかる場合があります。プロジェクト・グーテンベルク、ミリオンブックプロジェクト、Googleブックス、オープンコンテンツアライアンスなどのプロジェクトは、書籍を大規模にスキャンしています。イメージスキャナは手動または自動で使用できます。
書籍スキャンとは、イメージスキャナを使用して、物理的な書籍や雑誌を画像、電子テキスト、電子書籍(eブック)などのデジタルメディアに変換するプロセスです。[ 1 ]大規模な書籍スキャンプロジェクトにより、多くの書籍がオンラインで利用可能になりました。[ 2 ]
デジタル書籍は簡単に配布、複製、画面上での閲覧が可能です。一般的なファイル形式は、 DjVu、Portable Document Format (PDF)、Tag Image File Format (TIFF) です。生の画像を変換するために、光学文字認識(OCR) [ 1 ]が使用され、書籍のページをASCIIなどのデジタルテキスト形式に変換します。これによりファイルサイズが小さくなり、テキストを再フォーマットしたり、検索したり、他のアプリケーションで処理したりすることが可能になります。[ 1 ]
画像スキャナには手動式と自動式がある。一般的な市販の画像スキャナでは、本を平らなガラス板(またはプラテン)の上に置き、ガラスの下を光と光学アレイが本の上を移動する。手動式のブックスキャナでは、ガラス板がスキャナの端まで伸びているため、本の背表紙の位置合わせが容易になる。[ 1 ] [ 2 ]
スキャン後、ソフトウェアは文書画像を整列、トリミング、画像編集し、テキスト化して最終的な電子書籍形式に変換することで調整します。通常、人間の校正者が出力結果の誤りをチェックします。
書籍のデジタル化におけるスキャン解像度は、資料の目的や性質によって異なります。テキスト変換には一般的に300 dpi ( 118 ドット/センチメートル) で十分ですが、アーカイブ機関は保存資料や希少資料にはより高い解像度を推奨しています。オーストラリア国立公文書館は、製本された書籍には 400 ppi、希少または重要な文書には 600 ppi を推奨しています[ 3 ]。一方、連邦機関デジタル化ガイドラインイニシアチブ (FADGI) [ 4 ]は、アーカイブ資料には最低 400 ppi を推奨しています[ 5 ] 。
これらの高解像度により、細部まで確実に捉えることができ、長期保存の取り組みを支えます。一方、段階的なアプローチでは、ストレージ容量やリソースの制限といった実際的な制約と品質のバランスを取ることができます。この戦略により、機関はデジタル化の取り組みを最適化し、希少または重要な資料には高解像度を選択的に適用し、より一般的な文書には標準解像度を使用することが可能です。[ 6 ]


毎時数千ページをスキャンできる高性能スキャナーは数千ドルかかる場合があるが、毎時1,200ページをスキャンできる自作(DIY)の手動ブック スキャナーは300米ドルで製作されている。 [ 7 ]
シンプルな複写台やドキュメントカメラから発展した市販のブック スキャナーは、一般的なスキャナーとは異なります。趣味用や自作のスキャナーでは、2 台のカメラを使用し、それぞれが本に垂直に向くように光路を交差させ、左側のカメラが右側のページを、右側のカメラが左側のページを同時に撮影し、それぞれ独立して画像を取得し、後でオペレーターがそれらを再構成して 1 つのデジタル ボリュームを作成します。最新の市販のブック スキャナーは、非常に高品質のデジタル カメラ1 台を備え、カメラの両側に光源があり、フレームに取り付けられているため、人や機械が本のページを簡単にめくることができます。一部のモデルでは、本の背表紙を支え、本の位置を自動的に中央に調整する V 字型のブック クレードルが採用されており、画像アルゴリズムによって、開いた本のページの自然な湾曲を補正することができます。ブック スキャナーは、フラットベッド スキャナーや ADF スキャナーと比較して、キャプチャ プロセスが非常に高速であるという利点があります。これは、特にフットスイッチのシャッター ボタンによって補助されることが多い、オーバーヘッド スキャナーの生産性と比較して高速です。
プロジェクト・グーテンベルク(1971年設立)[ 8 ] 、ミリオンブックプロジェクト(2001年頃設立)、Googleブックス(2004年設立)、オープンコンテンツアライアンス(2005年設立)などのプロジェクトは、大規模に書籍をスキャンしています。[ 9 ] [ 10 ]
この課題の主な1つは、スキャンしなければならない書籍の膨大な量です。2010年には、人類の歴史上書籍として登場した作品の総数は約1億3000 万冊と推定されました。[ 11 ]これらすべてをスキャンし、一般の人々がユニバーサルライブラリーとして利用できるようオンラインで検索可能にする必要があります。現在、大企業が頼っている主な方法は3つあります。アウトソーシング、市販のブック スキャナーを使用した社内スキャン、ロボット スキャン ソリューションを使用した社内スキャンです。
アウトソーシングに関しては、書籍はインドや中国などの低コストの業者にスキャンしてもらうために送られることが多い。一方、利便性、安全性、技術の進歩により、多くの組織は時間のかかるオーバーヘッドスキャナー、または大幅に高速なデジタルカメラベースのスキャニングマシンを使用して社内でスキャンすることを選択する。これはインターネットアーカイブやGoogleでも採用されている方法である。[ 10 ] [ 12 ]従来の方法では、本の背表紙を切り取り、自動ページ送り機能を備えたスキャナーでページをスキャンし、その後、バラバラになったページを再製本していた。[ 13 ]
ページがスキャンされた後、データは手動で入力されるか、OCR(光学文字認識)によって入力されるが、これも書籍スキャンプロジェクトにおける大きなコスト要因の一つである。
著作権の問題により、スキャンされる書籍のほとんどは著作権が切れているものですが、出版社が特に禁止しない限り、Google Books は著作権で保護されている書籍もスキャンすることが知られています。[ 9 ] [ 10 ] [ 12 ] [ 14 ]
米国では多くの共同デジタル化プロジェクトが行われている。初期のプロジェクトの2つは、コロラド州の共同デジタル化プロジェクトと、ノースカロライナ州立図書館を拠点とするNC ECHO – North Carolina Exploring Cultural Heritage Online [ 15 ]である。
これらのプロジェクトは、デジタル化のベストプラクティスを確立して公開し、地域のパートナーと協力して文化遺産資料をデジタル化します。ベストプラクティスの追加基準は、最近、英国、オーストラリア、および欧州連合で確立されました。[ 16 ] Wisconsin Heritage Online [ 17 ]は、コロラド共同デジタル化プロジェクトをモデルにした共同デジタル化プロジェクトです。ウィスコンシン州は、ウィキ[ 18 ]を使用して共同ドキュメントを作成および配布しています。ジョージア州の共同デジタル化プログラムである Digital Library of Georgia [ 19 ]は、60 の機関と 100 の政府機関からの 100 を超えるデジタルコレクションを含む、州の歴史と生活に関するシームレスな仮想ライブラリを提供します。Digital Library of Georgiaは、ジョージア大学図書館を拠点とするGALILEO [ 20 ]イニシアチブです。
20世紀、ヒル博物館と写本図書館はエチオピアで書籍を撮影したが、それらは1975年の政治的暴力の中で破壊された。図書館はそれ以来、中東諸国の写本を撮影する活動を行っている。[ 21 ]
南アジアでは、ナナクシャヒ・トラストがグルムキー文字の写本のデジタル化を進めている。
オーストラリアでは、デジタル化された情報が保存されるリポジトリインフラストラクチャを改善するために、オーストラリア国立図書館と大学の間で多くの共同プロジェクトが行われてきました。 [ 22 ]これらのプロジェクトには、ARROW(Australian Research Repositories Online to the World)プロジェクトやAPSR(Australian Partnership for Sustainable Repository)プロジェクトなどがあります。
画像スキャナには手動式と自動式がある。一般的な市販の画像スキャナでは、本を平らなガラス板(またはプラテン)の上に置き、ガラスの下を光と光学アレイが本の上を移動する。手動式のブックスキャナでは、ガラス板がスキャナの端まで伸びているため、本の背表紙の位置合わせが容易になる。[ 1 ] [ 2 ]
製本された書籍をスキャンする際の問題点は、あまり薄くない本を平らに置くと、背表紙に近いページ部分(綴じ目)が大きく湾曲し、スキャンしたその部分のテキストが歪むことです。解決策の 1 つは、本を切断または綴じ目を解いてページごとに分けることです。非破壊的な方法としては、本を平らに置いてスキャンするのではなく、V 字型のホルダーに本を挟んで写真を撮る方法があります。この方法だと綴じ目の湾曲がはるかに目立たなくなります。[ 23 ]ページは手動でめくるか、自動紙搬送装置でめくる場合があります。通常、透明なプラスチックまたはガラスのシートをページに押し当てて平らにします。
低予算で書籍や雑誌をスキャンする場合、最も安価な方法は、綴じ目を切り離すことです。こうすることで、書籍や雑誌は複数の用紙に分かれ、標準的な自動原稿送り装置(ADF)にセットして、安価で一般的なスキャン技術でスキャンできます。ただし、この方法は希少本や貴重な書籍には適していません。この方法には、綴じ目の切断とスキャンという2つの技術的な難点があります。
ページを裁断するよりも正確で損傷が少ない方法は、適切な道具を使って手作業で綴じを解くことです。この技術は、リャザノフ図書館のデジタルアーカイブプロジェクトのためにスキャンされた、新聞、雑誌、パンフレットなど、50年から100年以上前のものも含め、しばしば脆く壊れやすい紙で構成された数万ページに及ぶアーカイブ資料の原本に成功裏に適用されてきました。一部の収集家(およびこの種の資料のほとんどの販売者)にとって、綴じを解くことで金銭的価値は失われますが、多くの場合、実際にはページの保存に大いに役立ち、研究者がアクセスしやすくなり[ 1 ]、その後の調査時に損傷する可能性が低くなります。欠点は、綴じを解いたページの束が「ふくらみ」、空気中の酸素にさらされやすくなるため、場合によっては劣化が早まる可能性があることです。これは、綴じを解いた後にページに重しを乗せ、適切な容器に保管することで対処できます。[ 1 ]


ロボットまたは自動ブック スキャナーは、ロボット システムを使用してページをめくり、人間の手が本に触れることなく各ページの画像をキャプチャすることで印刷された本をデジタル化する装置です。スキャナーは、ページを自動的にめくる機構、各ページを撮影する 1 台以上のカメラ、およびこれらの画像をデジタル ファイルにコンパイルするソフトウェアで構成されています。これらのスキャナーは、大量の本を迅速にデジタル化するために使用されます。ロボットが単独で扱うには本が繊細すぎたり複雑すぎたりする場合は、手動操作が可能なモデルもあります。このプロセスは本に優しくなるように設計されており、スキャン中に損傷しないように、多くの場合、特別なクレードルとガラス プレートが使用されます。[ 24 ]
ほとんどのハイエンド商用ロボットスキャナーは、空気と吸引技術を使用してページをめくり、分離します。これらのスキャナーは、真空または空気吸引を使用してページを束から優しく持ち上げ、空気の噴射を使用してページをめくり、デバイスが両面を効率的にスキャンできるようにします。[ 25 ]バイオニックフィンガーなどの新しいアプローチを使用してページをめくるものもあります。一部のスキャナーは、超音波または光電センサーを利用して2ページを検出し、ページのスキップを防ぎます。[ 1 ] [ 2 ] 1時間に最大2,900ページをスキャンできる機械の報告もあり、[ 26 ]ロボットブック スキャナーは、大規模なデジタル化プロジェクト向けに特別に設計されています。[ 1 ]
Googleの特許7508978は、ページの3次元形状を検出して自動調整できる赤外線カメラ技術を示しています。 [ 27 ] [ 28 ]空気と吸引技術を使用するロボットブック スキャナーは、壊れやすい本や貴重な本に損傷を与えることなくページをめくって分離するための特殊なシステムに依存しています。