スパイダー トラップ(またはクローラー トラップ) は、意図的または意図せずにWeb クローラーまたは検索ボットに無限のリクエストを実行させたり、不適切に構築されたクローラーをクラッシュさせたりするために使用される Web ページのセットです。Web クローラーはWeb スパイダーとも呼ばれ、その名前はそこから派生しています。スパイダー トラップは、 Web サイトの帯域幅を浪費するスパムボットやその他のクローラーを「捕まえる」ために作成されることがあります。また、次の日または年を継続的に指すリンクを含む 動的なページを使用するカレンダーによって、意図せずに作成されることもあります。
よく使用される手法は次のとおりです。
- 無限に深いディレクトリ構造の作成
http://example.com/bar/foo/bar/foo/bar/foo/bar/... - ウェブクローラーが追跡できる無制限の数の文書を生成する動的なページ。例としては、カレンダー[1]やアルゴリズムで生成された言語詩[2]などがあります。
- 文書に多くの文字が含まれているため、文書を解析する字句解析プログラムがクラッシュします。
- 必要な Cookie に基づくセッション ID を持つドキュメント。
すべてのクモトラップを検出するアルゴリズムは存在しません。一部のトラップは自動的に検出できますが、認識されない新しいトラップがすぐに発生します。
礼儀正しさ
スパイダートラップは、ウェブクローラーを無限ループのようなものに陥らせます。 [3]これにより、スパイダーのリソースが浪費され、[ 4]生産性が低下し、クローラーの記述が不十分な場合はプログラムがクラッシュする可能性があります。礼儀正しいスパイダーは、異なるホスト間でリクエストを交互に送信し、同じサーバーに数秒に1回以上ドキュメントをリクエストしません。[5]つまり、「礼儀正しい」ウェブクローラーは、「礼儀正しくない」クローラーよりも影響がはるかに少ないということです。[引用が必要]
さらに、スパイダートラップのあるサイトでは通常、ボットにトラップにかからないように指示するrobots.txtがあるため、正当な「礼儀正しい」ボットはトラップに陥りませんが、robots.txt の設定を無視する「礼儀正しくない」ボットはトラップの影響を受けます。[6]
参照
参考文献
- ^ 「スパイダートラップとは何か?」Techopedia 2017年11月27日2018年5月29日閲覧。
- ^ Neil M Hennessy. 「最も甘い毒、あるいはウェブ上の L=A=N=G=U=A=G=E 詩の発見」。2013 年 9 月 26 日にアクセス。
- ^ “Portent”. Portent . 2016年2月3日. 2019年10月16日閲覧。
- ^ 「検索エンジンスパイダーを制御するためのrobots.txtの設定方法(thesitewizard.com)」www.thesitewizard.com 。 2019年10月16日閲覧。
- ^ 「Polite Web Crawler の構築」。DEV コミュニティ。2019 年 4 月 13 日。2019 年 10 月 16 日閲覧。
- ^ Group、J. Media (2017-10-12)。「クモの罠を閉める: クロールの非効率性を修正する」J Media Group 。2019年10月16日閲覧。
{{cite web}}:|last=一般的な名前があります (ヘルプ)
