Common Crawl Foundation ( Common Crawl ) は、ウェブをクロールしてアーカイブとデータセットを一般に無料で提供する非営利の501(c)(3)組織です。 [ 1 ] [ 2 ] Amazon Web Servicesではデータへのアクセスは無料ですが、ユーザーはストレージとコンピューティングのコストを負担する場合があります。[ 3 ]
Common CrawlはGil Elbazによって設立されました。[ 1 ] [ 2 ]
データは、2020年代にAI企業がデータを使用して大規模な言語モデルのトレーニングを開始するまで、主に研究者や一部のスタートアップ企業によって使用されていました。 [ 4 ] 2025年11月、アトランティック誌の調査により、Common Crawlがスクレイピング時にペイウォールを尊重していると主張して出版社を欺いていたこと、また、データベースからコンテンツを削除するよう出版社から要請されても応じていなかったことが明らかになりました。[ 4 ]
Common Crawlは2007年にサンフランシスコで設立されました。[ 5 ] 2011年にクロールの公開を開始しました。[ 6 ]
2013年までに、 TinEyeのようなサイトはCommon Crawlをベースに製品を構築していました。[ 7 ] [ 8 ]このクロールにより、最大のデータセットを持つGoogleへの企業や研究者の依存度が軽減されます。[ 7 ] [ 8 ] Common Crawlは、インターネットアーカイブが作成したWayback Machineよりも分析や利用が効率的な、より多くの、より新しいデータを持つように設計されました。[ 8 ] [ 7 ]
2015年までに、検索エンジンBlekkoから提供されたURLのリストをクロールすることから始まったCommon Crawlには18億のウェブページが掲載されました。[ 9 ]彼らはAmazon Web Servicesを使用しており、Amazon Web Servicesは一部のサービスを無料で提供しているため、コンピューティングコストは平均して月額2,000~4,000ドルとなっています。[ 9 ] Common CrawlのWebサイトには、Common Crawlのデータに基づいた30の研究が掲載されています。[ 9 ]
2023 年以前は、Common Crawl は、データを利用する学術研究者以外ではあまり知られていませんでした。[ 5 ] Common Crawl は 2023 年に初めて情報削除の要求を受け、クローラーである CCBot がブロックされるケースが増え始めました。[ 5 ] 2023 年に、 AnthropicやOpenAIなど、それぞれ 25 万ドルを寄付したAI 企業から多額の資金援助を受け始めました。 [ 4 ]また、 Google DeepMindの大規模言語モデルGemini のトレーニングにも使用されました。[ 10 ] 2023 年 4 月までに、Common Crawl は 31 億のウェブページを収集しており、2021 年以前のページの 5% にはヘイトスピーチや中傷が含まれていると推定されています。[ 11 ]
2024年時点で、Common Crawlは10,000件以上の学術研究で引用されていました。[ 12 ] 2024年までに、The PileとCommon CrawlはAIモデルのトレーニングに使用される2つの主要なトレーニングデータセットになりました。[ 13 ] [ 14 ]
2025年11月、テクノロジージャーナリストのアレックス・ライスナーがアトランティック誌のために行った調査により、Common Crawlがスクレイピングにおいてペイウォールを尊重していると主張し、またパブリッシャーからのデータベースからのコンテンツ削除の要請に応じていると述べていた際に、パブリッシャーを欺いていたことが明らかになった。[ 4 ]同社のウェブサイトの公開検索機能には、アーカイブの削除を要請したウェブサイトのエントリが表示されないという誤解を招く結果が含まれていたが、実際にはそれらのサイトはAI企業が使用するスクレイピングに含まれていた。[ 4 ]ライスナーは2025年の時点で、CCBotが上位1000のウェブサイトで最も広くブロックされているボットであることを発見した。[ 4 ]
LWN.netの2026年の記事では、Common Crawlのようなサービスの利点として、企業や研究者が自分でデータをスクレイピングする代わりにCommon Crawlからデータをダウンロードできるようにすることで、ウェブサイトのスクレイピングコストを抑えることができる点が挙げられている。[ 15 ]
2026年4月、Common CrawlはAmazon S3での標準ストレージに加えて、Hugging Face Storage Bucketを通じてデータの配信を試験的に開始した。[ 16 ]
ピーター・ノーヴィグとジョイ・イトウは諮問委員会のメンバーを務めた。[ 8 ]リッチ・スクレンタは事務局長である。[ 4 ]
2023年にAI業界からの寄付を受け始めるまで、ほぼエルバズ・ファミリー財団トラストからのみ資金提供を受けていた。[ 4 ]
FineWeb、DCLM、C4などの多くの組織は、Common Crawlの生データを受け取り、過激なコンテンツを除外したり、その他の点で目的に合ったより高品質なデータセットに精製しています。[ 4 ]
Common Crawl の Google 版はColossal Clean Crawled Corpus、略してC4と呼ばれています。これは2019 年にT5 言語モデル シリーズのトレーニング用に構築されました。[ 17 ] 2023 年時点では、C4 には著作権で保護されたコンテンツや人種差別的なコンテンツが含まれているという懸念がありました。[ 18 ] [ 17 ] 2024 年の調査では、コンテンツの 45% が営利企業による AI トレーニングなどの目的での使用が Web サイトの利用規約で明示的に制限されていることがわかりました。[ 12 ]
彼の非営利団体Common Crawl Foundationは「ウェブのコピーをデータサイエンティスト、スタートアップ、研究者、あるいは単に世界をより良くしたいアナリストが利用できるようにすることを目指している」。