スパイダートラップ(またはクローラートラップ)とは、ウェブクローラーや検索ボットに無数のリクエストを送信させたり、構造の不十分なクローラーをクラッシュさせたりするために、意図的または意図せず使用される可能性のある一連のウェブページのことです。ウェブクローラーはウェブスパイダーとも呼ばれ、この名前はそこから来ています。スパイダートラップは、ウェブサイトの帯域幅を浪費するスパムボットやその他のクローラーを「捕獲」するために作成されることがあります。また、常に翌日や翌年を指すリンクを含む動的ページを使用するカレンダーによって、意図せず作成されることもあります。
一般的に用いられる手法には以下のようなものがある。
http://example.com/abc/def/abc/def/abc/def/abc/...すべてのクモ捕獲器を検出できる万能アルゴリズムは存在しない。特定の種類の捕獲器は自動化された方法で識別できるものの、これまで認識されていなかった新しい捕獲器が急速に出現し続けている。
スパイダートラップは、ウェブクローラーを無限ループのようなものに陥らせ、[ 3 ]スパイダーのリソースを浪費し、[ 4 ]生産性を低下させ、クローラーの記述が不十分な場合はプログラムをクラッシュさせる可能性があります。礼儀正しいスパイダーは、異なるホスト間でリクエストを交互に行い、数秒に1回以上同じサーバーからドキュメントをリクエストしないため、[ 5 ]「礼儀正しい」ウェブクローラーは、「非礼儀正しい」クローラーよりもはるかに影響が少ないことを意味します。
さらに、スパイダートラップのあるサイトには通常、ボットがトラップに入らないように指示するrobots.txtがあるため、正当な「礼儀正しい」ボットはトラップに引っかかりませんが、robots.txtの設定を無視する「無礼な」ボットはトラップの影響を受けます。[ 6 ]