スパムデキシング(検索エンジンスパム、検索エンジンポイズニング、ブラックハット検索エンジン最適化、検索スパム、ウェブスパムとも呼ばれる)[ 1 ]は、検索エンジンのインデックスを意図的に操作することです。これには、リンク構築や関連または無関係なフレーズの繰り返しなど、さまざまな方法が含まれており、インデックスシステムの目的に反する方法で、インデックスされたリソースの関連性や重要性を操作します。[ 2 ] [ 3 ]
スパムデキシングは検索エンジン最適化の一部とみなされる可能性がある が[ 4 ]、ウェブサイトのコンテンツの質と外観を向上させ、多くのユーザーに役立つコンテンツを提供するSEO手法は数多く存在する[ 5 ] 。
Search engines use a variety of algorithms to determine relevancy ranking. Some of these include determining whether the search term appears in the body text or URL of a web page. Many search engines check for instances of spamdexing and will remove suspect pages from their indexes. Also, search-engine operators can quickly block the results listing from entire websites that use Spamdexing, perhaps in response to user complaints of false matches.[6] The rise of Spamdexing in the mid-1990s made the leading search engines of the time less useful. Using unethical methods to make websites rank higher in search engine results than they otherwise would is commonly referred to in the SEO (search engine optimization) industry as "black-hat" SEO.[7] These methods are more focused on breaking the search-engine-promotion rules and guidelines. In addition to this, the perpetrators run the risk of their websites being severely penalized by the Google Panda and Google Penguin search-results ranking algorithms.[8]
Common spamdexing techniques can be classified into two broad classes: content spam[5] (term spam) and link spam.[3]
The earliest known reference[2] to the term spamdexing is by Eric Convey in his article "Porn sneaks way back on Web", The Boston Herald, May 22, 1996, where he said :
The problem arises when site operators load their Web pages with hundreds of extraneous terms so search engines will list them among legitimate addresses. The process is called "Spamdexing," a combination of spamming—the Internet term for sending users unsolicited information—and "indexing."[2]
Keyword stuffing had been used in the past to obtain top search engine rankings and visibility for particular phrases.[9] This method is outdated and adds no value to rankings today. In particular, Google no longer gives good rankings to pages employing this technique.
訪問者からテキストを隠す方法は数多くあります。背景に溶け込むようにテキストの色を変えたり、CSSのz-indexを使ってテキストを画像の下に配置して 訪問者の視界から隠したり 、CSSの絶対位置指定を使ってテキストをページの中心から離れた位置に配置したりといった手法はよく用いられます。しかし、2005年までに、こうしたテキストを隠すための多くの手法は、主要な検索エンジンによって容易に検出されるようになりました。
「Noscript」タグは、ページ内に非表示コンテンツを配置するもう1つの方法です。[ 10 ] [ 11 ]これらはスクリプトコンテンツの代替表現を表示するための有効な最適化方法ですが、検索エンジンがほとんどの訪問者には見えないコンテンツをインデックス化してしまう可能性があるため、悪用される可能性があります。
以前は、キーワードスタッフィングは、その手法の文脈やそれを判断する人の意見によって、ホワイトハット戦術かブラックハット戦術かのどちらかと考えられていました。多くのキーワードスタッフィングはスパムデキシングを支援するために使用され、これはユーザーにとってほとんど利益になりませんが、特定の状況下では、キーワードスタッフィングは欺瞞的な方法で結果を歪めることを意図していませんでした。この用語が軽蔑的な意味合いを持つか中立的な意味合いを持つかは、この手法が関連性の低いページで結果を汚染するために使用されているか、検索エンジンが関連するアイデアを解釈して理解できないために重要度が低くなる関連性の高いページにトラフィックを誘導するために使用されているかによって異なります。これはもはや当てはまりません。検索エンジンは現在、テーマ別関連キーワード技術を使用して、ページのコンテンツの意図を解釈します。[ 12 ] [ 13 ]
これらの手法は、検索エンジンがページの内容に対して持つ論理的な見方を変更することを目的としている。いずれも、テキストコレクションの情報検索におけるベクトル空間モデルの様々なバリエーションを目指している。
キーワードスタッフィングは、検索エンジンのメタタグ、表示コンテンツ、またはバックリンクのアンカーテキストにキーワードを詰め込むことで、検索エンジンで不当なランキング上の優位性を得ようとする検索エンジン最適化(SEO)の手法です。キーワードスタッフィングの変種として、自社のウェブサイトに他社の商標をタグ付けすることが挙げられます。[ 14 ]キーワードスタッフィングは、主要な検索エンジンでウェブサイトが一時的または永久的に禁止またはペナルティを受ける原因となる可能性があります。[ 15 ]メタタグ内の単語の繰り返しは、多くの検索エンジンがランキングにこれらのタグを頼らなくなった理由を説明できるかもしれません。今日では、検索エンジンは独自性、包括性、関連性、および有用性のあるコンテンツに重点を置いています。その結果、キーワードスタッフィングは多くのウェブマスターによってまだ行われていますが、ほとんど効果がなくなってきています。[ 16 ] [ 17 ] [ 18 ]
多くの主要な検索エンジンは、キーワードスタッフィングを認識し、その手法によって得られるはずだった不当な検索上の優位性を軽減または排除するアルゴリズムを実装しており、多くの場合、キーワードスタッフィングを実装しているウェブサイトをペナルティの対象としたり、インデックスから降格させたり、削除したりもします。[ 19 ] [ 20 ]
キーワードスタッフィングを使用しているサイトを罰したり禁止したりすることを目的とした変更やアルゴリズムには、Google Florida アップデート (2003 年 11 月)、Google Panda (2011 年 2 月) [ 21 ] 、 Google Hummingbird (2013 年 8 月) [ 22 ]、およびBingの 2014 年 9 月のアップデート[ 23 ]などがあります。
オンラインニュースサイトの見出しには、記事を特定できる検索に有利なキーワードがますます詰め込まれている。従来の記者や編集者はこのやり方を嫌うが、ニュース記事を検索向けに最適化するには効果的である。[ 24 ]
無関係な隠しテキストは、背景と同じ色にしたり、フォントサイズを小さくしたり、 「no frame」セクション、 alt属性、サイズがゼロのDIV 、「no script」セクションなどのHTMLコード内に隠したりすることで偽装されます。検索エンジン会社のために、赤旗のウェブサイトを手動で審査する人は、一部のページに見えないテキストがある場合、ウェブサイト全体を一時的または永久的にブロックすることがあります。しかし、隠しテキストは必ずしもスパムデキシングではありません。アクセシビリティを向上させるためにも使用できます。[ 25 ]
これはメタタグでキーワードを繰り返したり、サイトのコンテンツとは無関係なメタキーワードを使用したりすることを含みます。この戦術は効果がありませんでした。Googleは2009年9月にオンライン検索ランキングでキーワードメタタグを使用しないと宣言しました。[ 26 ]
「ゲートウェイ」または「ドアウェイ」ページは、コンテンツがほとんどなく、代わりに非常に似たキーワードやフレーズが詰め込まれた低品質のウェブページです。これらは検索結果で上位に表示されるように設計されていますが、情報を探している訪問者には何の役にも立ちません。ドアウェイページには通常、「ここをクリックして入る」という表示があり、自動転送もこの目的で使用されます。2006年、Googleは自動車メーカーのBMWが同社のドイツ語サイトBMW.deに「ドアウェイページ」を使用していたとして、BMWを追放しました。 [ 27 ] Googleは、ドアウェイ戦術にペナルティを課すと発表しました。[ 28 ]
スクレイパーサイトは、検索エンジンの検索結果ページやその他のコンテンツソースから「スクレイピング」を行い、ウェブサイト用の「コンテンツ」を作成するために設計された様々なプログラムを使用して作成されます。これらのサイトにおけるコンテンツの具体的な表示方法は独特ですが、多くの場合、許可なく他のソースから取得したコンテンツを寄せ集めたものです。このようなウェブサイトは一般的に広告(クリック課金型広告など)で溢れていたり、ユーザーを他のサイトにリダイレクトしたりします。スクレイパーサイトが、自身の情報や組織名に関して、元のウェブサイトよりも上位に表示されることさえあり得ます。
記事リライトとは、他のサイトからコンテンツを単に収集するのではなく、既存の記事を書き換えることで、検索エンジンによる重複コンテンツに対するペナルティを回避する手法です。このプロセスは、雇われたライターが行う場合もあれば、同義語置換システム、人工ニューラルネットワーク、大規模言語モデル(LLM)などを用いて自動化される場合もあります。
記事の書き換えと同様に、一部のサイトは機械翻訳を使用してコンテンツを複数の言語に翻訳し、人間の編集を一切行わないため、意味不明なテキストが生成されますが、それでも検索エンジンにインデックスされ続け、結果としてトラフィックを集めています。
リンクスパムとは、メリット以外の理由で存在するページ間のリンクと定義されます。[ 29 ]リンクスパムは、リンクベースのランキングアルゴリズムを利用しており、他の上位のウェブサイトからリンクされているウェブサイトの数が多いほど、ウェブサイトのランキングが高くなります。これらの手法は、 HITSアルゴリズムなどの他のリンクベースのランキング手法にも影響を与えることを目的としています。
リンクファームとは、検索エンジンのランキングアルゴリズムを悪用することだけを目的として、互いにリンクし合うウェブサイトの緊密なネットワークです。これらは冗談めかして相互賞賛協会とも呼ばれています。[ 30 ] 2011年2月にGoogleが最初のパンダアップデートをリリースし、スパム検出アルゴリズムが大幅に改善されたことで、リンクファームの使用は大幅に減少しました。
ブログネットワーク(PBN)は、検索エンジンのランキングを上げるために、所有者のメインウェブサイトにリンクする文脈リンクのソースとして使用される権威あるウェブサイトのグループです。PBNウェブサイトの所有者は、権威の高いウェブサイトからのバックリンクを持つ期限切れドメインまたはオークションドメインを使用します。Googleは2014年以降、大規模なインデックス削除キャンペーンを複数回実施し、PBNユーザーを標的にしてペナルティを課してきました。[ 31 ]
訪問者の目につかない場所にハイパーリンクを配置することは、リンクの人気度を高めるために用いられます。強調表示されたリンクテキストは、そのフレーズに一致するウェブページのランキングを向上させるのに役立ちます。
シビル攻撃とは、悪意を持って複数のアイデンティティを偽造する行為であり、有名な解離性同一性障害の患者と、彼女と同じ名前の「シビル」という本にちなんで名付けられました。[ 32 ] [ 33 ]スパマーは、偽ブログ(スパムブログとして知られています)など、互いにリンクする複数の異なるドメイン名のウェブサイトを作成する場合があります。
スパムブログは、商業的な宣伝とターゲットサイトへのリンク権限の移転のみを目的として作成されたブログです。これらの「splog」は、正規のウェブサイトのように見えるように誤解を招くような方法で設計されていることが多いですが、詳しく調べると、多くの場合、スピンソフトウェアを使用して作成されているか、ほとんど読めないほど内容がひどく拙く書かれています。これらはリンクファームと性質が似ています。[ 34 ] [ 35 ]
ゲストブログスパムとは、他のウェブサイトへのリンクを獲得することだけを目的として、ウェブサイトにゲストブログを掲載する行為です。残念ながら、これはリンク掲載以外の目的で行われる正当なゲストブログと混同されることがよくあります。この手法は、この種のリンクスパムに対して公然と「宣戦布告」したマット・カッツによって有名になりました。[ 36 ]
リンクスパムを行う者の中には、有効期限切れドメインクローラーソフトウェアを利用したり、DNSレコードを監視して有効期限が近いドメインを探し出し、有効期限が切れたドメインを購入して、既存のページを自分のページへのリンクに置き換える者がいます。しかし、Googleが有効期限切れドメインのリンクデータをリセットする可能性はありますが、確証はありません。ドメインの過去のGoogleランキングデータをすべて維持するためには、購入者はドメインが「ドロップ」される前に取得しておくことをお勧めします。
これらの手法の中には、Google爆弾を作成するために利用されるものもある。つまり、他のユーザーと協力して、特定の検索クエリに対する特定のページのランキングを上げるためのものだ。
ユーザーが編集可能なウェブサイトは、適切なスパム対策が講じられていない場合、スパムデクサーによってスパムサイトへのリンクを挿入するために悪用される可能性がある。
自動化されたスパムボットは、サイトのユーザーが編集できる部分をあっという間に使用不能にしてしまう可能性があります。プログラマーは、スパムボットをブロックしたり、少なくとも速度を遅くしたりするためのさまざまな自動スパム防止技術を開発してきました。 [ 37 ]
ブログにおけるスパムとは、他のサイトに無作為にリンクを貼ったり、リンクを勧誘したりする際に、リンク先のハイパーリンクに目的のキーワードを挿入する行為を指します。ゲストブック、フォーラム、ブログ、そして訪問者のコメントを受け付けるあらゆるサイトは特に標的となりやすく、自動ソフトウェアが無関係で不要なリンクを含む意味不明な投稿を作成するドライブバイスパムの被害に遭いやすいのです。
コメントスパムは、ウィキ、ブログ、ゲストブックなど、ユーザーが動的に編集できるウェブページで発生するリンクスパムの一種です。エージェントがウィキペディアの記事など、ユーザーが編集したウェブページを自動的にランダムに選択し、スパムリンクを追加する可能性があるため、問題となることがあります。 [ 38 ]
Wikiスパムとは、スパマーがWikiシステムの編集の自由度を利用して、Wikiサイトからスパムサイトへのリンクを設置する行為のことです。
リファラースパムとは、スパム実行者または仲介者が、別のウェブページ(リファラー)からのリンクをたどってウェブページ(リファラー)にアクセスし、そのウェブブラウザによってリファラーのアドレスがリファラーに渡される際に発生するものです。
一部のウェブサイトには、そのサイトへのリンク元ページを示すリファラーログがあります。ロボットがランダムに多数のサイトにアクセスし、リファラーとして特定のメッセージまたはアドレスを指定することで、そのメッセージまたはインターネットアドレスが、リファラーログを持つサイトのリファラーログに表示されます。一部のウェブ検索エンジンは、サイトの重要性を、そのサイトにリンクしている異なるサイトの数に基づいて判断するため、リファラーログスパムは、スパマーのサイトの検索エンジンランキングを向上させる可能性があります。また、ログにリファラーログのエントリがあることに気づいたサイト管理者は、リンクをたどってスパマーのリファラーページに戻る可能性があります。
ユーザーが編集可能なウェブページに大量のスパムが投稿されたため、Google はリンクに埋め込むことができる「nofollow」タグを提案しました。[ 39 ] Google のPageRankシステムなどのリンクベースの検索エンジンは、リンクに nofollow タグが付いている場合、リンクを使用してリンク先の Web サイトのスコアを上げません。[ 40 ]これにより、ユーザーが編集可能な Web サイトにスパムリンクを投稿しても、検索エンジンでのサイトのランキングが上がらないことが保証されます。nofollow は、いくつかの Web サイトで使用されています。
ミラーサイトとは、概念的に類似したコンテンツを持つ複数のウェブサイトを、異なるURLでホスティングするサイトのことです。検索エンジンによっては、検索キーワードがURLに含まれている検索結果を上位に表示する場合があります。
URLリダイレクトとは、ユーザーの操作なしに別のページにユーザーを誘導する処理のことです。例えば、METAリフレッシュタグ、Flash、JavaScript、Java 、またはサーバーサイドリダイレクトなどが用いられます。ただし、301リダイレクト(恒久的なリダイレクト)は悪意のある行為とはみなされません。
クローキングとは、検索エンジンのクローラーに人間が見るページとは異なるページを提供する、いくつかの手段のいずれかを指します。これは、特定の Web サイトの内容に関して検索エンジンを欺こうとする試みである可能性があります。しかし、クローキングは、障害のあるユーザーにとってサイトのアクセシビリティを倫理的に向上させたり、検索エンジンが処理または解析できないコンテンツを人間に提供したりするためにも使用できます。また、ユーザーの場所に基づいてコンテンツを配信するためにも使用されます。Google 自身も、結果を提供するために、クローキングの一種であるIP 配信を使用しています。クローキングのもう 1 つの形式はコード スワッピングです。つまり、上位にランク付けされるようにページを最適化し、上位にランク付けされたら別のページと置き換えることです。Google は、このようなリダイレクトをSneaky Redirectsと呼んでいます。[ 41 ]
検索エンジンがページがスパムデックスされていると疑う場合、検索結果からそのページを削除することがあります。[ 42 ]これは多くの場合、自動スパム検出ソフトウェアによって行われます。 [ 43 ]
多くの検索エンジンでは、スパムの結果として表示されるコンテンツをユーザーが報告できるようになっています。Google は、その理由として「Google の検索結果の品質を損なう試みは、当社のスパム ポリシーに違反する」と述べています。これらの報告は、自動スパム検出ソフトウェアの精度向上につながります[ 44 ]。
ユーザーは検索演算子を使用してフィルタリングを行うことができます。Googleでは、キーワードの前に「-」(マイナス)を付けると、ページ内またはページのURLにそのキーワードが含まれるサイトが検索結果から除外されます。たとえば、「-<不要なサイト>」という検索語を使用すると、ページ内に「<不要なサイト>」という単語が含まれるサイトと、URLに「<不要なサイト>」が含まれるページが除外されます。
ユーザーは、コンテンツファーム対策の一環としてGoogleが2011年にリリースしたGoogle Chrome拡張機能「Personal Blocklist (by Google)」を使用することもできます。[ 45 ]この拡張機能を使用すると、特定のページまたは一連のページが検索結果に表示されないようにブロックできます。2021年現在、元の拡張機能は削除されているようですが、同様の機能を持つ拡張機能が使用されている可能性があります。
違法なインターネット薬局にリダイレクトする検索リダイレクトポイズニングを克服するための解決策としては、脆弱な正規ドメインの運営者に通知することが挙げられます。さらに、SERPの手動評価、以前に公開されたリンクベースおよびコンテンツベースのアルゴリズム、特注の自動検出および分類エンジンは、医薬品詐欺キャンペーンを効果的に識別するためのベンチマークとして使用できます。[ 46 ]
{{cite journal}}: CS1 maint: url-status (リンク)