| 原作者 | ダグ・カッティング、マイク・カファレラ | ||||
|---|---|---|---|---|---|
| 開発者 | Apache ソフトウェア財団 | ||||
| 安定版リリース |
| ||||
| リポジトリ | Nutch Githubリポジトリ | ||||
| 書かれた | ジャワ | ||||
| オペレーティング·システム | クロスプラットフォーム | ||||
| タイプ | ウェブクローラー | ||||
| ライセンス | Apache ライセンス 2.0 | ||||
| Webサイト | 翻訳元 | ||||
Apache Nutchは、高度に拡張可能でスケーラブルなオープンソースの Web クローラーソフトウェア プロジェクトです。
特徴

Nutch は完全にJava プログラミング言語でコーディングされていますが、データは言語に依存しない形式で書き込まれます。高度にモジュール化されたアーキテクチャを備えているため、開発者はメディアタイプの解析、データの取得、クエリ、クラスタリング用のプラグインを作成できます。
フェッチャー (「ロボット」または「Web クローラー」) は、このプロジェクト専用にゼロから作成されました。
歴史
Nutch は、 LuceneとHadoop の両方の作成者であるDoug CuttingとMike Cafarellaによって開発されました。
2003 年 6 月、1 億ページ規模のデモ システムが開発され、成功を収めました。クロールとインデックス作成のタスクを複数のマシンで処理するニーズを満たすために、Nutch プロジェクトではMapReduce機能と分散ファイル システムも実装しました。この 2 つの機能は、 Hadoopと呼ばれる独自のサブプロジェクトに分離されました。
2005年1月、NutchはApache Incubatorに参加し、同年6月にそこから卒業してLuceneのサブプロジェクトになりました。2010年4月以来、NutchはApache Software Foundationの独立したトップレベルプロジェクトと見なされています。[2]
2014年2月、Common Crawlプロジェクトは、オープンで大規模なウェブクロールのためにNutchを採用しました。[3]
かつて Nutch プロジェクトの目標は、世界規模の大規模 Web 検索エンジンをリリースすることでした。しかし、それはもう当てはまりません。[引用が必要]
リリース履歴
スケーラビリティ
IBMリサーチは、Commercial Scale Out(CSO)プロジェクトの一環として、Nutch/Luceneのパフォーマンス[8]を研究しました[9] 。その結果、Nutch/Luceneなどのスケールアウトシステムは、 POWER5などのスケールアップコンピュータでは達成できないレベルのパフォーマンスをブレードクラスタで達成できることがわかりました。
ClueWeb09データセット(TRECなどで使用)はNutchを使用して収集され、平均速度は1秒あたり755.31ドキュメントでした。[10]
関連プロジェクト
- Hadoop – 大規模クラスター上で実行される分散アプリケーションをサポートする Java フレームワーク。
Nutchで構築された検索エンジン
- Common Crawl – 公開されているインターネット全体のクロール。2014年にNutchの使用を開始しました。[3]
- クリエイティブ・コモンズ・サーチ – 2004年から2006年にかけて使用されたNutchの実装。[11] [12] [13]
- DiscoverEd –クリエイティブ・コモンズが開発したオープン教育リソース検索プロトタイプ
- Krugle はNutch を使用して、Web ページをクロールし、コード、アーカイブ、技術的に興味深いコンテンツを探します。
- mozDex (非アクティブ)
- Wikia Search - 2008年に開始、2009年に閉鎖[14] [15]
参照
参考文献
- ^ ab "Apache Nutch™ - ダウンロード" 。2024年6月11日閲覧。
- ^ 「Apache Nutch -」. nutch.apache.org .
- ^ ab 「Common Crawl の Nutch への移行 – Common Crawl – ブログ」。blog.commoncrawl.org 。2015 年 10 月 14 日閲覧。
- ^ 「Nutch 2.3 リリース」。Apache Nutch ニュース。Apache Software Foundation。2015 年 1 月 22 日。2016年1 月 18 日に閲覧。
- ^ 「Nutch 1.10 リリースノート」 。ASF JIRA。Apache Software Foundation。2015 年 5 月 6 日。2016年1 月 18 日閲覧。
- ^ 「Nutch 1.11 リリースノート」 。ASF JIRA。Apache Software Foundation。2015 年 12 月 7 日。2016年1 月 18 日に閲覧。
- ^ 「Nutch 2.4 リリース」。Apache Nutch ニュース。Apache Software Foundation。2019 年 10 月 11 日。2022年5 月 20 日に閲覧。
- ^ 「Nutch検索エンジンのスケーラビリティ」(PDF)。
- ^ 「商用スーパーコンピュータ用ベース オペレーティング システムのプロビジョニングと導入」(PDF) 。2008 年 12 月 3 日時点のオリジナル(PDF)からアーカイブ。
- ^ Sapphire Web Crawler - クロール統計。Boston.lti.cs.cmu.edu (2008-10-01)。2013-07-21 に取得。
- ^ 「更新された検索」。クリエイティブ コモンズ。2004 年 9 月 3 日。
- ^ 「Creative Commons 独自の検索ツールが Firefox 1.0 に統合されました」。Creative Commons。2004 年 11 月 22 日。2010 年 1 月 7 日時点のオリジナルよりアーカイブ。
- ^ 「新しい CC 検索 UI」。クリエイティブ コモンズ。2006 年 8 月 2 日。
- ^ 「Wikia Search のソースコードはどこで入手できますか?」。2011 年 11 月 4 日時点のオリジナルよりアーカイブ。2010年 2 月 12 日閲覧。
- ^ 「Wikia の最新情報 – 機能しているものをさらに強化 | Jimmy Wales」2009 年 3 月 31 日。
文献
外部リンク
- 公式サイト
