
メタ検索エンジン(または検索アグリゲーター)は、ウェブ検索エンジンのデータを使用して 独自の結果を生成するオンライン情報検索ツールです。 [ 1 ] [ 2 ]メタ検索エンジンは、ユーザーからの入力を受け取り、すぐに検索エンジン[ 3 ]にクエリを実行して結果を取得します。十分なデータが収集され、ランク付けされ、ユーザーに提示されます。
スパムなどの問題は、結果の正確性と精度を低下させます。[ 4 ]融合プロセスは、メタ検索エンジンのエンジニアリングを改善することを目的としています。[ 5 ]
メタ検索エンジンの例としては、オンライン旅行代理店やプロバイダーのウェブサイトの検索結果を集約する SkyscannerやKayak.comなどがあります。SearXNGは、インターネット検索エンジンやWikipediaなどの他のソースからの結果を集約する汎用的な無料のオープンソース検索ソフトウェアで、70以上のSearXNGプロバイダーによって無料で提供されています。[ 6 ]
メタ検索のアイデアを最初に取り入れたのは、ワシントン大学の学生エリック・セルバーグ氏[ 7 ]で、1995年にMetaCrawler実験に関する論文を発表しました。この検索エンジンは2024年現在も使用可能です[ 8 ]。
1996年5月20日、当時Wiredが所有していたHotBotは、 InktomiとDirect Hitデータベースから検索結果を提供する検索エンジンでした。高速な結果と、検索結果内を検索できる機能で知られていました。 1998年にLycosに買収されると、検索エンジンの開発は停滞し、市場シェアは大幅に低下しました。いくつかの変更を経て、HotBotは簡素化された検索インターフェースに再設計され、その機能はLycosのウェブサイトの再設計に組み込まれました。[ 9 ]
1997年、ダニエル・ドライリンガーは、過去の経験に基づいて優先すべき適切な検索エンジンを自動的に選択できる実験的なメタ検索エンジンSavvySearchに関する論文を発表した。[ 10 ]
1999年にBo ShuとSubhash KakによってAnvishと呼ばれるメタ検索エンジンが開発されました。検索結果は、瞬時に学習されたニューラルネットワークを使用してソートされました。[ 11 ]これは後にSolosearchと呼ばれる別のメタ検索エンジンに組み込まれました。[ 12 ]
2000年8月、インド初のメタ検索エンジンであるHumHaiIndia.comがローンチされた。[ 13 ]これは当時16歳だったスミート・ランバによって開発された。[ 14 ]このウェブサイトは後にTazaa.comにブランド変更された。[ 15 ]
Ixquick は、プライバシーポリシー声明で知られる検索エンジンです。1998 年に David Bodnick によって開発およびリリースされ、Surfboard Holding BV が所有しています。2006 年 6 月、Ixquick はScroogleと同じプロセスに従ってユーザーの個人情報の削除を開始しました。Ixquick のプライバシーポリシーには、ユーザーの IP アドレスの記録なし、識別クッキーなし、個人データの収集なし、個人データの第三者との共有なしが含まれています。[ 16 ]また、結果を星でランク付けする独自のランキングシステムを使用しています。結果の星が多いほど、より多くの検索エンジンがその結果に同意したことを意味します。
2005 年 4 月、当時InfoSpace社が所有・運営していたDogpile は、ピッツバーグ大学とペンシルベニア州立大学の研究者と協力し、主要な Web 検索エンジンの重複とランキングの違いを測定して、メタ検索エンジンを使用して Web を検索するメリットを評価しました。その結果、Google、Yahoo!、Ask Jeevesからの 10,316 件のランダムなユーザー定義クエリから、特定のクエリに対して、これらの検索エンジン間で最初のページの検索結果が同じだったのは 3.2% だけであることがわかりました。その年の後半に行われた別の研究では、Google、Yahoo!、MSN Search、Ask Jeevesからの 12,570 件のランダムなユーザー定義クエリを使用して、特定のクエリに対して、これらの検索エンジン間で最初のページの検索結果が同じだったのは 1.1% だけであることがわかりました。[ 17 ]
複数のクエリを他の複数の検索エンジンに送信することで、トピックのカバー範囲のデータが拡張され、より多くの情報が見つかるようになります。メタ検索エンジンは、他の検索エンジンによって構築されたインデックスを使用し、結果を集約し、多くの場合、独自の方法で後処理します。メタ検索エンジンは、同じ労力でより多くの結果を取得できるため、単一の検索エンジンよりも優れています。 [ 2 ]また、ユーザーがリソースを探すために異なるエンジンから個別に検索を入力する必要がないため、作業が軽減されます。[ 2 ]
メタ検索は、ユーザーの検索目的がトピックの概要を把握することや、迅速な回答を得ることである場合にも有効な手法です。Yahoo!やGoogleなどの複数の検索エンジンを順番に利用して結果を比較する代わりに、メタ検索エンジンは結果を迅速に収集・統合することができます。メタ検索エンジンは、クエリされた各エンジンの結果を後処理なしで一覧表示する(Dogpile)か、結果を分析して独自のルールに基づいてランク付けする(IxQuick、Metacrawler、Vivismo)かのいずれかの方法でこれを実現します。
メタ検索エンジンは、検索者のIPアドレスを検索対象の検索エンジンから隠すこともでき、検索のプライバシーを保護する。
メタ検索エンジンはクエリ形式を解析したり、クエリ構文を完全に翻訳したりすることができません。メタ検索エンジンによって生成されるハイパーリンクの数は限られているため、ユーザーにクエリの完全な結果を提供することはできません。[ 18 ]
ほとんどのメタ検索エンジンは、単一の検索エンジンから10個を超えるリンクされたファイルを提供しておらず、一般的に結果を得るために大規模な検索エンジンと連携していません。クリック課金リンクが優先され、通常は最初に表示されます。[ 19 ]
メタ検索は、特にユーザーが一般的な情報やありふれた情報を検索している場合、クエリされたトピックに関する情報がより多く含まれているという錯覚を与えることもあります。クエリしたエンジンから複数の同一の結果が表示されることはよくあります。また、ユーザーがクエリとともに高度な検索構文を使用して検索するのは難しく、特定のエンジンで高度な検索インターフェースを使用している場合ほど正確な結果が得られない可能性があります。このため、多くのメタ検索エンジンはシンプルな検索を使用しています。[ 20 ]
メタ検索エンジンは、ユーザーから単一の検索リクエストを受け取ります。この検索リクエストは、別の検索エンジンのデータベースに渡されます。メタ検索エンジンは、 Webページのデータベースを作成するのではなく、複数のソースからのデータ統合によるフェデレーションデータベースシステムを生成します。[ 21 ] [ 22 ] [ 23 ]
検索エンジンはそれぞれ独自のアルゴリズムを用いてランキングデータを生成するため、重複データも発生します。メタ検索エンジンは、このデータを処理し、独自のアルゴリズムを適用することで重複データを削除します。修正されたリストがユーザーへの出力として生成されます。メタ検索エンジンが他の検索エンジンに問い合わせると、これらの検索エンジンは3つの方法で応答します。
多くの検索エンジンで上位にランクインしているウェブページは、有用な情報を提供する上でより関連性が高い可能性が高い。 [ 24 ]しかし、すべての検索エンジンは各ウェブサイトに対して異なるランキングスコアを設定しており、ほとんどの場合、これらのスコアは同じではない。これは、検索エンジンがスコアリングに異なる基準と方法を優先しているためであり、そのため、ある検索エンジンではウェブサイトが上位にランクインし、別の検索エンジンでは下位にランクインする可能性がある。メタ検索エンジンは、信頼できるアカウントを生成するためにこのデータの一貫性に大きく依存しているため、これは問題である。[ 24 ]

メタ検索エンジンは、より効率的な検索結果を得るために、データの融合処理を用いてデータをフィルタリングします。主な融合手法は、コレクション融合とデータ融合の2種類です。
スパムデキシングとは、検索エンジンのインデックスを意図的に操作することです。これは、インデックスシステムの意図に沿わない方法でインデックス化されたリソースの関連性や重要度を操作するために、さまざまな方法を使用します。スパムデキシングは、検索結果の精度が低いため、ユーザーにとって非常に迷惑であり、検索エンジンにとっても問題となります。これは最終的に、検索エンジンが信頼性が低く、ユーザーにとって頼りにならないものになるという結果につながります。スパムデキシングに対処するために、検索ロボットのアルゴリズムはより複雑になり、問題を解消するためにほぼ毎日変更されています。[ 27 ]
これはメタ検索エンジンにとって大きな問題です。なぜなら、ランキングリストのフォーマットに大きく依存しているウェブクローラーのインデックス基準を改ざんするからです。スパムデキシングは検索エンジンの自然なランキングシステムを操作し、ウェブサイトを本来あるべき順位よりも上位にランク付けします。[ 28 ]これを実現する主な方法は3つあります。
コンテンツスパムとは、検索エンジンがページコンテンツに対して持つ論理的な見方を改変する手法のことです。その手法には以下のようなものがあります。
リンクスパムとは、正当な理由以外でページ間に張られたリンクのことです。その手法には以下のようなものがあります。
これは、異なる素材や情報をウェブクローラーとウェブブラウザに送信するSEOテクニックです。[ 29 ]検索エンジンをだまして、検索エンジンの説明とは大きく異なるサイトを訪問させたり、特定のサイトのランキングを上げたりすることができるため、スパムデキシングテクニックとしてよく使用されます。