| 事業の種類 | 501(c)(3)非営利団体 |
|---|---|
| 設立 | 2007 |
| 本部 | カリフォルニア州サンフランシスコ、カリフォルニア州ロサンゼルス、アメリカ合衆国 |
| 創設者 | ジル・エルバス |
| 主要人物 | ピーター・ノーヴィグ、リッチ・スクレンタ、エヴァ・ホー |
| メールアドレス | コモンクロール |
コンテンツライセンス | Apache 2.0 (ソフトウェア) [説明が必要] |
Common Crawlは、ウェブをクロールし、アーカイブとデータセットを一般に無料で提供する非営利の 501(c)(3)組織です。 [1] [2] Common Crawlのウェブアーカイブは、 2008年以降に収集されたペタバイトのデータで構成されています。 [3]クロールは通常毎月完了します。[4]
Common Crawlはギル・エルバスによって設立されました。[5]この非営利団体の顧問にはピーター・ノーヴィグとジョイ・イトーがいます。[6]この組織のクローラーはnofollowとrobots.txtのポリシーを尊重しています。Common Crawlのデータセットを処理するためのオープンソースコードは公開されています。
Common Crawlデータセットには著作権で保護された作品が含まれており、米国からフェアユースの権利に基づいて配布されています。他の国の研究者は、文章をシャッフルしたり、Common Crawlデータセットを参照したりするなどの手法を使用して、他の法域の著作権法を回避しています。[7]
2023年3月版のCommon Crawlデータセットでは、英語が文書の46%の主要言語となっています。次に多い主要言語はドイツ語、ロシア語、日本語、フランス語、スペイン語、中国語で、それぞれ文書の6%未満となっています。[8]
歴史
Amazon Web Servicesは、2012年にパブリックデータセットプログラムを通じてCommon Crawlのアーカイブのホスティングを開始しました。[9]
同組織は2012年7月から、 .arcファイルとともにメタデータファイルとクローラーのテキスト出力を公開し始めた。[10] Common Crawlのアーカイブには以前は.arcファイルのみが含まれていた。[10]
2012年12月、blekkoは、2012年2月から10月にかけて実施したクロールから収集したメタデータをCommon Crawl検索エンジンに寄贈しました。 [11]寄贈されたデータは、Common Crawlが「スパム、ポルノ、過度なSEOの影響を回避しながらクロール機能を改善するのに役立ちました。」[11]
2013年、Common Crawlはカスタムクローラーの代わりにApache Software FoundationのNutchウェブクローラーを使い始めました。 [12] Common Crawlは2013年11月のクロールで.arcファイルから.warcファイルに切り替えました。 [13]
Common Crawlのフィルタリングされたバージョンは、2020年に発表されたOpenAIのGPT-3言語モデルのトレーニングに使用されました。 [14]
共通クロールデータのタイムライン
以下のデータは、Common Crawlの公式ブログ[15]とCommon CrawlのAPI [16]から収集されたものです 。
Norvig ウェブデータサイエンス賞
Common CrawlはSURFsaraと協力して、ベネルクスの学生と研究者を対象としたコンテスト「Norvig Web Data Science Award」を後援しています。[17] [18]この賞は、審査委員長も務めるピーター・ノルヴィグにちなんで名付けられました。 [17]
巨大なクリーンクロールコーパス
GoogleのCommon CrawlバージョンはColossal Clean Crawled Corpus、略してC4と呼ばれています。これは2019年にT5言語モデルシリーズのトレーニング用に構築されました。 [19] C4の著作権で保護されたコンテンツについては懸念があります。[20]
参考文献
- ^ Rosanna Xia (2012年2月5日). 「テック起業家のギル・エルバスがLAで大成功を収める」ロサンゼルス・タイムズ. 2014年7月31日閲覧。
- ^ 「ギル・エルバスとコモン・クロール」NBCニュース。2013年4月4日。 2014年7月31日閲覧。
- ^ 「それでは始める準備はできましたか?」 Common Crawl . 2023年6月9日閲覧。
- ^ Lisa Green (2014年1月8日). 「2013年冬のクロールデータが利用可能になりました」 . 2018年6月2日閲覧。
- ^ 「スタートアップ - Common Crawl の Gil Elbaz と Nova Spivack - TWiST #222」。This Week In Startups。2012 年 1 月 10 日。
- ^ Tom Simonite (2013 年 1 月 23 日)。「Web 全体の無料データベースが次世代の Google を生み出す可能性」。MIT Technology Review。2014 年 6 月 26 日時点のオリジナルよりアーカイブ。2014年7 月 31 日閲覧。
- ^ Schäfer, Roland (2016 年 5 月)。「CommonCOW: CommonCrawl データからの膨大な Web コーパスと、EU の著作権法の制限下でそれらを自由に配布する方法」。第 10 回国際言語資源評価会議 (LREC'16) の議事録。ポルトロス、スロベニア: 欧州言語資源協会 (ELRA): 4501。
- ^ 「CommonCrawlによるCommon Crawl月次アーカイブの統計」。commoncrawl.github.io 。 2023年4月2日閲覧。
- ^ Jennifer Zaino (2012 年 3 月 13 日)。「Amazon Web Services バケットに新しいデータを追加するための共通クロール」。セマンティック ウェブ。2014 年 7 月 1 日時点のオリジナルよりアーカイブ。2014 年7 月 31 日閲覧。
- ^ ab Jennifer Zaino (2012 年 7 月 16 日)。「Common Crawl Corpus Update により、Web クロール データがより効率的かつユーザーが探索しやすくなる」。セマンティック ウェブ。2014 年 8 月 12 日時点のオリジナルよりアーカイブ。2014 年7 月 31 日閲覧。
- ^ ab Jennifer Zaino (2012 年 12 月 18 日). 「Blekko データの寄付は Common Crawl にとって大きなメリットです」. セマンティック ウェブ. 2014 年 8 月 12 日時点のオリジナルよりアーカイブ。2014 年7 月 31 日閲覧。
- ^ Jordan Mendelson (2014年2月20日). 「Common Crawl's Move to Nutch」. Common Crawl . 2014年7月31日閲覧。
- ^ Jordan Mendelson (2013 年 11 月 27 日)。「新しいクロール データが利用可能になりました!」Common Crawl。2014年7 月 31 日閲覧。
- ^ Brown, Tom; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini (2020-06-01). 「言語モデルは少数ショットの学習者です」。p. 14. arXiv : 2005.14165 [cs.CL]。
私たちのデータの大部分は、品質ベースのフィルタリングのみを行った生の Common Crawl から取得されています。
- ^ 「ブログ – Common Crawl」。
- ^ 「コレクション情報 - Common Crawl」。
- ^ ab Lisa Green (2012年11月15日). 「The Norvig Web Data Science Award」. Common Crawl . 2014年7月31日閲覧。
- ^ 「Norvig Web Data Science Award 2014」。オランダ生命科学技術センター。2014年8月15日時点のオリジナルよりアーカイブ。2014年7月31日閲覧。
- ^ Raffel, Colin; Shazeer, Noam; Roberts, Adam; Lee, Katherine; Narang, Sharan; Matena, Michael; Zhou, Yanqi; Li, Wei; Liu, Peter J. (2020). 「統合テキストツーテキストトランスフォーマーによる転移学習の限界の探究」。Journal of Machine Learning Research。21 ( 140): 1–67。arXiv : 1910.10683。ISSN 1533-7928。
- ^ Hern, Alex (2023-04-20). 「AIシステムのトレーニング教材のソースをめぐって新たな懸念が浮上」。 ガーディアン。ISSN 0261-3077 。 2023年4月21日閲覧。
外部リンク
- 米国カリフォルニア州のコモンクロール
- クローラー、ライブラリ、サンプルコードを含む Common Crawl GitHub リポジトリ
- 共通クロールディスカッショングループ
- コモンクロールブログ
