ウェブアーカイブとは、ワールドワイドウェブから資料を収集、保存し、アクセスを提供するプロセスです。その目的は、研究や一般の人々のために情報がアーカイブ形式で保存されるようにすることです。 [ 1 ]ソーシャルメディアプラットフォームを模倣したインターフェースを介して歴史的記録をデジタル化するアーカイブのプラットフォーム化プロセスは、人気、接続性、プログラマビリティなどのソーシャルメディアの論理に合致するコンテンツを優先することで、集合的記憶を再構築することができます。[ 2 ]
ウェブアーカイブ担当者は通常、ウェブ上の膨大な情報を収集するために自動ウェブクローラーを使用します。広く知られているウェブアーカイブサービスの一つに、インターネットアーカイブが運営するウェイバックマシンがあります。
ウェブ上で作成および記録される人間文化の割合が増加しているため、ますます多くの図書館やアーカイブがウェブアーカイブの課題に直面せざるを得なくなることは避けられません。[ 3 ]国立図書館、国立アーカイブ、およびさまざまな組織のコンソーシアムも、ウェブコンテンツの損失を防ぐためにウェブコンテンツのアーカイブに関与しています。
企業遺産、規制遵守、または法的目的のために自社のウェブコンテンツをアーカイブする必要がある組織向けに、商用ウェブアーカイブソフトウェアおよびサービスも利用可能です。
ウェブのキュレーションと整理は1990年代半ばから後半にかけて普及しましたが、最初の大規模なウェブアーカイブプロジェクトの1つは、1996年にブリュースター・カーレによって設立された非営利団体であるインターネットアーカイブでした。 [ 4 ]インターネットアーカイブは、アーカイブされたウェブコンテンツを表示するための独自の検索エンジンであるウェイバックマシンを2001年にリリースしました。 [ 4 ] 2018年現在、インターネットアーカイブには40ペタバイトのデータが保存されています。[ 5 ]インターネットアーカイブはまた、大量のデータを効率的かつ安全に保存するためのPetaBoxや、北欧の国立図書館と共同で開発されたウェブクローラーであるHeritrixなど、データの収集と保存のための独自のツールを多数開発しました。 [ 4 ]同時期に開始された他のプロジェクトには、カナダ国立図書館によるウェブアーカイブプロジェクト、オーストラリアのPandora、タスマニアのウェブアーカイブ、スウェーデンのKulturarw3などがあります。[ 6 ] [ 7 ]
2001年から2010年にかけて、国際ウェブアーカイブワークショップ(IWAW)は、経験を共有し、アイデアを交換するためのプラットフォームを提供しました。[ 8 ] [ 9 ] 2003年に設立された国際インターネット保存コンソーシアム(IIPC)は、ウェブアーカイブの作成のための標準とオープンソースツールの開発における国際的な協力を促進してきました。[ 10 ]
現在解散しているインターネット・メモリー財団は、ヨーロッパのウェブをアーカイブするために、2004年に欧州委員会によって設立されました。 [ 4 ] このプロジェクトは、「リッチメディアのキャプチャ、時間的一貫性分析、スパム評価、用語の進化の検出」など、多くのオープンソースツールを開発して公開しました。 [ 4 ]財団のデータは現在インターネット・アーカイブに保管されていますが、現時点では一般公開されていません。[ 11 ]
保存に関する中央集権的な責任がないにもかかわらず、ウェブコンテンツは急速に公式記録になりつつある。例えば、2017年に米国司法省は、政府は大統領のツイートを公式声明として扱うと明言した。[ 12 ]
ウェブアーカイブ担当者は、一般的にHTMLウェブページ、スタイルシート、JavaScript、画像、動画など、さまざまな種類のウェブコンテンツをアーカイブします。また、アクセス時間、 MIMEタイプ、コンテンツの長さなど、収集したリソースに関するメタデータもアーカイブします。このメタデータは、アーカイブされたコレクションの真正性と出所を確立するのに役立ちます。
トランザクションアーカイブはイベント駆動型のアプローチであり、WebサーバーとWebブラウザ間で実際に行われたトランザクションを収集します。これは主に、特定のWebサイトで特定の日付に実際に閲覧されたコンテンツの証拠を保存する手段として使用されます。これは、情報の開示と保持に関する法的または規制上の要件を遵守する必要がある組織にとって特に重要となる可能性があります。[ 13 ]
トランザクション型アーカイブシステムは通常、WebサーバーへのすべてのHTTPリクエストとWebサーバーからのレスポンスを傍受し、各レスポンスをフィルタリングして重複コンテンツを排除し、レスポンスをビットストリームとして永続的に保存することによって動作します。
ウェブクローリングを主な収集手段としているウェブアーカイブは、ウェブクローリングの難しさの影響を受ける。
しかし、ネイティブ形式のウェブアーカイブ、つまり、リンクやメディアなどが正常に機能し、完全に閲覧可能なウェブアーカイブは、クローラー技術を使用することによってのみ実現可能です。
ウェブは非常に広大なので、その大部分をクロールするには膨大な技術リソースが必要となります。また、ウェブは変化のスピードが非常に速いため、クローラーがクロールを完了する前に、ウェブサイトの一部が変更されてしまう可能性もあります。
一部のウェブサーバーは、通常のブラウザからのリクエストとは異なるページをウェブアーカイブからのリクエストに対して返すように設定されています。これは通常、検索エンジンを欺いてウェブサイトへのユーザーアクセスを増やすために行われ、責任逃れのため、あるいは表示可能なブラウザにのみ強化されたコンテンツを提供する目的で行われることが多いです。
ウェブアーカイブ担当者は、ウェブアーカイブの技術的な課題に対処するだけでなく、知的財産法にも対処しなければなりません。ピーター・ライマン[ 14 ]は、「ウェブは一般的にパブリックドメインのリソースと見なされていますが、著作権で保護されているため、アーカイブ担当者にはウェブをコピーする法的権利はありません」と述べています。しかし、一部の国の国立図書館[ 15 ]は、法定納本制度の延長として、ウェブの一部をコピーする法的権利を有しています。
WebCite、インターネットアーカイブ、インターネットメモリー財団など、一般に公開されている非営利の民間ウェブアーカイブの中には、コンテンツ所有者が一般に公開したくないアーカイブコンテンツを非表示または削除できるものがあります。他のウェブアーカイブは、特定の場所からのみアクセス可能であったり、利用が規制されていたりします。WebCiteは、Googleのキャッシュに対する最近の訴訟(Googleが勝訴)を例に挙げています。[ 16 ]
2017年、米国の金融規制機関である金融業界規制機構(FINRA)は、デジタル通信を行うすべての企業は記録を保持する必要があるという通知を発表しました。これには、ウェブサイトのデータ、ソーシャルメディアの投稿、メッセージが含まれます。 [ 17 ]著作権法によっては、ウェブアーカイブが制限される場合があります。たとえば、Sci-Hubによる学術アーカイブは、現代の著作権法の範囲外です。このサイトは、オープンアクセスライセンスのない学術作品を含む学術作品への永続的なアクセスを提供し、それによって、そうでなければ失われる可能性のある科学研究のアーカイブに貢献しています。[ 18 ] [ 19 ]