
ウェブ検索エンジン(またはインターネット検索エンジン)とは、ユーザーの検索クエリに応じて、ウェブページへのハイパーリンクやウェブ上の関連情報を提供するソフトウェアシステムです。ユーザーはウェブブラウザまたはモバイルアプリを通じてクエリを送信し、結果ページには通常、ハイパーリンクの集合、簡単な説明、および関連画像が表示されます。ユーザーは、画像、動画、ニュースなど、特定の種類の検索結果に絞り込むこともできます。
検索プロバイダーにとって、そのエンジンは世界中の多くのデータセンターを包含する分散コンピューティングシステムの一部です。クエリに対するエンジンの応答速度と精度は、自動化されたウェブクローラーによって継続的に更新される複雑なインデックスシステムに基づいています。これには、ウェブサーバーに保存されているファイルやデータベースのデータマイニングが含まれますが、一部のコンテンツはクローラーがアクセスできません。
1990年代のウェブ黎明期以来、多くの検索エンジンが存在してきましたが、 2000年代にはGoogle検索が主流となり、現在もその地位を維持しています。StatCounterによると、2025年5月時点で、Googleは世界の検索シェアの約89~90%を占めており、競合他社は大きく後れを取っています。Bing (約4%)、Yandex(約2.5%)、Yahoo!(約1.3%)、DuckDuckGo(約0.8%)、Baidu(約0.7%)などです。[ 1 ] 2025年5月は、Googleのシェアが10年以上ぶりに90%を下回った年となりました。
市場シェアの大きさから、ウェブサイトの検索結果における可視性を向上させる分野、いわゆるマーケティングと最適化は、これまで主にGoogleに焦点を当ててきた。
1945年、ヴァネヴァー・ブッシュは、ユーザーが1台の机で膨大な情報にアクセスできる情報検索システムについて説明し、それをメメックスと呼んだ。[ 2 ]彼はこのシステムをアトランティック・マンスリー誌の「 As We May Think」というタイトルの記事で説明した。[ 3 ]メメックスは、科学研究の拡大し続ける中央集権的な索引から情報を見つけるという、ますます困難になる問題を克服する能力をユーザーに与えることを目的としていた。ヴァネヴァー・ブッシュは、現代のハイパーリンクに似た、関連付けられた注釈を持つ研究ライブラリを構想した。[ 4 ]
リンク分析は、ハイパーサーチやページランクなどのアルゴリズムを通じて、最終的に検索エンジンの重要な構成要素となった。[ 5 ] [ 6 ]
最初のインターネット検索エンジンは、1990年12月のWebの登場よりも前に存在していました。WHOISユーザー検索は1982年に遡り[ 7 ]、Knowbot Information Serviceマルチネットワークユーザー検索は1989年に初めて実装されました[ 8 ]。コンテンツファイル、つまりFTPファイルを検索する最初の十分に文書化された検索エンジンは、1990年9月10日に登場したArchieでした[ 9 ]。
1993 年 9 月以前は、ワールド ワイド ウェブは完全に手作業でインデックス化されていました。ティム バーナーズ=リーが編集し、 CERN のウェブ サーバーでホストされていたウェブ サーバーのリストがありました。1992 年のそのリストのスナップショットが 1 つ残っていますが[ 10 ]、ますます多くのウェブ サーバーがオンラインになるにつれて、中央のリストでは対応できなくなりました。NCSA のサイトでは、「新着情報!」というタイトルで新しいサーバーが発表されました。[ 11 ]
インターネット上でコンテンツ(ユーザーではなく)を検索するために使用された最初のツールはArchieでした。[ 12 ]この名前は「archive」から「v」を除いたものです。[ 13 ]これは、カナダのケベック州モントリオールにあるマギル大学のコンピュータサイエンスの学生であったAlan Emtageによって作成されました。 [ 13 ] [ 14 ] [ 15 ] [ 16 ]このプログラムは、公開されている匿名 FTP (ファイル転送プロトコル) サイトにあるすべてのファイルのディレクトリ一覧をダウンロードし、ファイル名の検索可能なデータベースを作成しました。ただし、Archie Search Engine は、データの量が非常に限られていたため、手動で簡単に検索できたことから、これらのサイトのコンテンツをインデックス化しませんでした。
Gopher (1991年にミネソタ大学のマーク・マッカヒルによって開発)の台頭により、 VeronicaとJugheadという2つの新しい検索プログラムが登場しました。Archieと同様に、これらのプログラムはGopherのインデックスシステムに保存されているファイル名とタイトルを検索しました。Veronica(Very Easy Rodent-Oriented Net-wide Index to Computerized Archives)は、Gopherの全リストにあるほとんどのGopherメニュータイトルをキーワードで検索する機能を提供しました。Jughead(Jonzy's Universal Gopher Hierarchy Excavation And Display)は、特定のGopherサーバーからメニュー情報を取得するためのツールでした。検索エンジン「Archie Search Engine 」という名前は、アーチーコミックシリーズとは関係ありませんでしたが、「Veronica」と「Jughead」は同シリーズの登場人物であり、前身の検索エンジンを指しています。
1993年の夏には、ウェブ用の検索エンジンは存在せず、多数の専門的なカタログが手作業で維持されていた。ジュネーブ大学のオスカー・ニエルストラスは、これらのページを定期的にミラーリングして標準形式に書き直す一連のPerlスクリプトを作成した。これが、1993年9月2日にリリースされたウェブ初の原始的な検索エンジンであるW3Catalogの基礎となった。 [ 17 ]
1993年6月、当時MITに在籍していたマシュー・グレイは、おそらく最初のウェブロボットであるPerlベースのWorld Wide Web Wandererを作成し、それを使って「Wandex」と呼ばれるインデックスを生成した。Wandererの目的はWorld Wide Webの規模を測定することであり、1995年後半までその役割を果たした。ウェブの2番目の検索エンジンであるAliwebは1993年11月に登場した。Aliwebはウェブロボットを使用せず、代わりにウェブサイト管理者から各サイトに特定の形式のインデックスファイルが存在することを通知されることに依存していた。
JumpStation(1993年12月にJonathon Fletcherによって作成[ 18 ])は、 Webロボットを使用してWebページを検索し、インデックスを作成し、Webフォームをクエリプログラムへのインターフェースとして使用しました。そのため、後述するように、Web検索エンジンの3つの必須機能(クロール、インデックス作成、検索)を組み合わせた最初のWWWリソース発見ツールとなりました。動作プラットフォームで使用できるリソースが限られていたため、インデックス作成、ひいては検索は、クローラーが遭遇したWebページ内のタイトルと見出しに限定されていました。
初期の「全テキスト」クローラー型検索エンジンの1つが、1994年に登場したWebCrawlerです。それまでの検索エンジンとは異なり、WebCrawlerはユーザーが任意のウェブページ内の任意の単語を検索できる機能を備えており、これは以降の主要検索エンジンの標準となっています。また、WebCrawlerは一般に広く知られた検索エンジンでもありました。同じく1994年には、カーネギーメロン大学で開発されたLycosがローンチされ、大きな商業的事業へと発展しました。
ウェブ上で最初に人気を博した検索エンジンはYahoo!検索でした。[ 19 ] 1994年1月にジェリー・ヤンとデビッド・フィロによって設立されたYahoo!の最初の製品は、 Yahoo!ディレクトリと呼ばれるウェブディレクトリでした。1995年に検索機能が追加され、ユーザーはYahoo!ディレクトリを検索できるようになりました。[ 20 ] [ 21 ]これは、人々が興味のあるウェブページを見つける最も人気のある方法の1つになりましたが、その検索機能はウェブページの全文コピーではなく、ウェブディレクトリに対して動作していました。
その後まもなく、数多くの検索エンジンが登場し、人気を競い合った。これらには、Magellan、Excite、Infoseek、Inktomi、Northern Light、AltaVistaなどが含まれる。情報検索者は、キーワード検索の代わりにディレクトリを閲覧することもできた。
1996年、ロビン・リーは検索エンジンの検索結果ページのランキングのためのRankDexサイトスコアリングアルゴリズムを開発し[ 22 ] [ 23 ] [ 24 ]、その技術で米国特許を取得しました[ 25 ] 。これは、インデックス登録しているウェブサイトの品質を測定するためにハイパーリンクを使用した最初の検索エンジンであり[ 26 ] 、 2年後の1998年にGoogleが申請した非常によく似たアルゴリズムの特許よりも前のものです[ 27 ]。ラリー・ペイジは、 PageRankに関する米国特許の一部でリーの研究を参照しました[ 28 ] 。リーは後に、中国で彼が設立し、2000年に立ち上げたBaidu検索エンジンでRankDex技術を使用しました。
1996年、NetscapeはNetscapeのウェブブラウザのメイン検索エンジンとして、単一の検索エンジンに独占契約を与えることを検討していました。しかし、非常に多くの関心が寄せられたため、Netscapeは代わりに5つの主要な検索エンジンと契約を結びました。各検索エンジンは年間500万ドルで、Netscapeの検索エンジンのページにローテーションで表示されることになりました。その5つの検索エンジンは、Yahoo!、Magellan、Lycos、Infoseek、Exciteでした。[ 29 ] [ 30 ]
Googleは1998年に、 goto.comという小さな検索エンジン会社から検索語句を販売するというアイデアを採用しました。この動きは検索エンジンビジネスに大きな影響を与え、苦境からインターネット上で最も収益性の高いビジネスの一つへと変化しました。[ 31 ] [ 32 ]
検索エンジンは1990年代後半に多額の投資を集めた。[ 33 ]いくつかの企業が新規株式公開で記録的な利益を上げて市場に参入した。中には公開検索エンジンを閉鎖し、Northern Lightのように企業専用版を販売している企業もある。多くの検索エンジン企業は、2000年3月にピークを迎えた投機主導の市場ブームであるドットコムバブルに巻き込まれた。
2000 年頃、Google の検索エンジンが台頭しました。[ 34 ]同社は、後に Google の創設者となるSergey BrinとLarry Pageが執筆した論文「検索エンジンの解剖学」で説明されているように、PageRankと呼ばれるアルゴリズムを使用して多くの検索でより良い結果を達成しました。 [ 6 ]この反復アルゴリズムは、優れたページや望ましいページは他のページよりも多くリンクされているという前提に基づいて、そこにリンクしている他の Web サイトやページの数と PageRank に基づいて Web ページをランク付けします。Larry Page の PageRank の特許は、Robin Liの以前のRankDex特許を影響を受けたものとして引用しています。[ 28 ] [ 24 ] Google はまた、検索エンジンの最小限のインターフェースを維持しました。対照的に、競合他社の多くはWeb ポータルに検索エンジンを組み込んでいました。実際、Google の検索エンジンは非常に人気が高かったため、 Mystery Seekerのような偽のエンジンが登場しました。
2000年までに、Yahoo!はInktomiの検索エンジンをベースにした検索サービスを提供するようになった。Yahoo!は2002年にInktomiを、 2003年にはOverture ( AlltheWebとAltaVistaを所有)を買収した。Yahoo!は2004年までGoogleの検索エンジンを使用していたが、その後、買収した企業の技術を組み合わせた独自の検索エンジンを立ち上げた。
マイクロソフトは1998年秋に、Inktomiの検索結果を利用してMSN Searchを初めてリリースしました。1999年初頭には、 Inktomiの検索結果とLooksmartの検索結果を統合して表示するようになりました。1999年のごく短期間、MSN SearchはAltaVistaの検索結果を使用するようになりました。2004年、マイクロソフトは独自のウェブクローラー(msnbotと呼ばれる)を搭載した独自の検索技術への移行を開始しました。
マイクロソフトがリブランドした検索エンジン「Bing 」は、2009年6月1日にローンチされた。2009年7月29日、Yahoo!とマイクロソフトは、 Yahoo!検索にマイクロソフトのBing技術を導入するという契約を締結した。
2019年現在、アクティブな検索エンジンのクローラーには、Baidu、Bing、Brave、[ 35 ] Google、DuckDuckGo、Gigablast、Mojeek、Sogou、Yandexなどがあります。
2020年代には、人工知能を搭載した検索エンジンや生成型AIアシスタントが主流のウェブ検索にますます統合されるようになった。これらのシステムは、従来のウェブインデックス作成と大規模な言語モデルを組み合わせて、会話形式の応答、要約、文脈に応じた推奨事項を提供する。[ 36 ]
検索エンジンは、ほぼリアルタイムで以下のプロセスを維持します。[ 37 ]
ウェブ検索エンジンは、サイトからサイトへとウェブクローリングすることで情報を取得します。「スパイダー」は、自身宛ての標準ファイル名robots.txtをチェックします。robots.txtファイルには、検索スパイダーがクロールするページとクロールしないページを指示するディレクティブが含まれています。robots.txtをチェックし、見つかったか否かにかかわらず、スパイダーはタイトル、ページコンテンツ、JavaScript、カスケーディングスタイルシート(CSS)、見出し、HTMLメタタグ内のメタデータなど、多くの要素に基づいてインデックス化される特定の情報を送信します。一定数のページをクロールし、一定量のデータをインデックス化し、ウェブサイトで一定時間経過すると、スパイダーはクロールを停止して次のサイトへ移動します。[N]ウェブクローラーは、到達可能なウェブ全体を実際にクロールすることはできません。無数のウェブサイト、スパイダートラップ、スパム、および実際のウェブのその他の制約のため、クローラーは代わりにクロールポリシーを適用して、サイトのクロールが十分であると判断すべき時期を決定します。一部のウェブサイトは徹底的にクロールされますが、他のウェブサイトは部分的にしかクロールされません。] [ 39 ]
インデックス作成とは、ウェブページ上で見つかった単語やその他の定義可能なトークンを、ドメイン名やHTMLベースのフィールドに関連付けることです。関連付けは公開データベースに保存され、ウェブ検索クエリを通じてアクセスできます。ユーザーからのクエリは、単語、複数の単語、または文である可能性があります。インデックスは、クエリに関連する情報をできるだけ迅速に見つけるのに役立ちます。[ 38 ]インデックス作成やキャッシュの技術の一部は企業秘密ですが、ウェブクローリングは、すべてのサイトを体系的に訪問する単純なプロセスです。
スパイダーによる訪問の間に、検索エンジンのワーキングメモリに保存されているページのキャッシュバージョン(レンダリングに必要なコンテンツの一部または全部)が、問い合わせ者に迅速に送信されます。訪問が遅れている場合は、検索エンジンは代わりにウェブプロキシとして機能できます。この場合、ページはインデックス化された検索語と異なる場合があります。[ 38 ]キャッシュされたページは、以前にインデックス化された単語を含むバージョンの外観を保持しているため、実際のページが失われた場合、ページのキャッシュバージョンはウェブサイトにとって有用ですが、この問題はリンク腐敗の軽度な形態とも考えられています。

通常、ユーザーが検索エンジンにクエリを入力するときは、いくつかのキーワードです。[ 40 ]インデックスには、キーワードを含むサイトの名前がすでに登録されており、これらはインデックスから即座に取得されます。実際の処理負荷は、検索結果リストとなるウェブページを生成することです。リスト全体のすべてのページは、インデックスの情報に基づいて重み付けされる必要があります。 [ 38 ]次に、検索結果の上位項目では、一致したキーワードのコンテキストを示すスニペットの検索、再構築、およびマークアップが必要です。これらは、各検索結果ウェブページに必要な処理の一部にすぎず、上位の次のページでは、この後処理がさらに必要になります。
単純なキーワード検索を超えて、検索エンジンは独自のGUI、つまりコマンド駆動の演算子と検索パラメータを提供し、検索結果を絞り込みます。これらは、最初の検索結果の最初のページに基づいて、ユーザーがフィルタリングと重み付けを行いながら検索結果を絞り込むフィードバック ループに関与するユーザーに必要な制御を提供します。たとえば、2007 年以降、Google.com 検索エンジンは、最初の検索結果ページの左端の列にある「検索ツールを表示」をクリックし、目的の日付範囲を選択することで、日付でフィルタリングできるようになりました。 [ 41 ]各ページには更新時刻があるため、日付で重み付けすることも可能です。ほとんどの検索エンジンは、エンド ユーザーが検索クエリを絞り込むのに役立つブール演算子AND、OR、NOTの使用をサポートしています。ブール演算子は、ユーザーが検索用語を絞り込み、拡張できるリテラル検索用です。エンジンは、入力された単語またはフレーズを正確に検索します。一部の検索エンジンは、近接検索と呼ばれる高度な機能を提供しており、ユーザーはキーワード間の距離を定義できます。[ 38 ]また、ユーザーが検索する単語やフレーズを含むページに対して統計分析を使用する研究を含む概念ベースの検索もあります。
検索エンジンの有用性は、返される結果セットの関連性に依存します。特定の単語やフレーズを含むウェブページは何百万もあるかもしれませんが、一部のページは他のページよりも関連性が高く、人気があり、権威がある場合があります。ほとんどの検索エンジンは、結果をランク付けして「最良の」結果を最初に提供する方法を採用しています。検索エンジンがどのページが最適一致であるかをどのように決定し、結果をどのような順序で表示するかは、エンジンごとに大きく異なります。[ 38 ]また、インターネットの使用状況の変化や新しい技術の進化に伴い、方法も時間とともに変化します。進化してきた検索エンジンには主に2つのタイプがあります。1つは、人間が広範囲にプログラムした、事前に定義され階層的に順序付けられたキーワードのシステムです。もう1つは、見つけたテキストを分析して「転置インデックス」を生成するシステムです。この最初の形式は、作業の大部分をコンピュータ自体に大きく依存しています。
ほとんどのウェブ検索エンジンは広告収入によって支えられている営利事業であり、そのため一部の検索エンジンは、広告主が料金を支払うことで検索結果の上位に自社の広告を掲載できるようにしている。検索結果に対して料金を受け取らない検索エンジンは、通常の検索結果の横に検索関連の広告を掲載することで収益を上げている。
ローカル検索は、地域ビジネスの取り組みを最適化するプロセスです。彼らは一貫した検索結果を確保することに重点を置いています。多くの人が検索に基づいてどこに行くか、何を買うかを決めるため、これは重要です。[ 42 ]
2022年1月現在 、Googleは圧倒的に世界で最も利用されている検索エンジンであり、市場シェアは90%です。その他の世界で最も人気のある検索エンジンは、Bingが4%、Yandexが2%、Yahoo!が1%です。リストにない他の検索エンジンの市場シェアは3%未満です。[ 43 ] 2024年、米国司法省が起こした訴訟で、Googleの支配は違法な独占であると判断されました。[ 44 ]
2023年末時点で、ロシアおよび東アジアにおける検索エンジンの市場シェアは比較的安定しているものの、地政学的および技術的な発展により、いくつかの顕著な変化が見られる。
ロシアでは、Yandexが検索エンジン市場で約73%のシェアを占め、Googleは約25%を占めている。[ 45 ] Yandexは、ナビゲーション、配車サービス、eコマースなどの地域密着型サービスでも主要なプレーヤーであり続け、エコシステムを強化している。
中国では、Baiduが2024年初頭時点で約59.3%の市場シェアを占め、依然として主要な検索エンジンである。Sogouや360 Searchなどの他の国内エンジンは、より小さなシェアを占めている。Googleは、検閲とサイバーセキュリティをめぐる論争の後、2010年に中国市場から撤退しており、長年の検閲問題のため、中国本土では依然として利用できない。[ 46 ] [ 47 ]
マイクロソフトの検索エンジンであるBingは、中国で約13.6%の市場シェアを維持し、現地の規制制約の下で運営されている数少ない外国の検索エンジンの1つとなっている。[ 48 ]
日本では、現在Google Japanが最大の市場シェア(約76.2%)を占めており、ソフトバンクとネイバーの合弁会社であるZホールディングスが運営するYahoo! Japanは約15.8%の市場シェアを維持している。[ 49 ]
2014年のカカオとダウムの合併時点では、韓国の検索エンジンはほぼ韓国市場を支配していた。ネイバーが市場シェアの過半数を占め、ダウムがそれに続いた。[ 50 ] 2025年のカカオによるダウムのスピンオフ時点では、ダウムの韓国における市場シェアはグーグルとビングを下回っていた。ネイバーは依然として市場の過半数を占めていた。[ 51 ]ネイバーは韓国のユーザーから「地域に合わせた膨大なコンテンツ」を提供している。[ 52 ]
台湾では、Googleが圧倒的な検索エンジンであり、市場の93%以上を占めており、Yahoo!台湾とBingは大きく後れを取っている。[ 53 ]
検索エンジンは、人気と関連性の組み合わせに基づいてウェブサイトをランク付けするようにプログラムされていますが、実証研究によると、検索エンジンが提供する情報にはさまざまな政治的、経済的、社会的な偏りがあり[ 54 ] [ 55 ]、その技術に関する前提も根底にあることが示されています[ 56 ] 。これらの偏りは、経済的および商業的なプロセス(たとえば、検索エンジンで広告を出稿する企業は、その検索エンジンのオーガニック検索結果でより人気になる可能性がある)や政治的なプロセス(たとえば、現地の法律を遵守するために検索結果を削除する)の直接的な結果である可能性があります[ 57 ] 。たとえば、ホロコースト否定が違法であるフランスとドイツでは、 Googleは特定のネオナチのウェブサイトを表示しません。
バイアスは社会的なプロセスによっても生じる可能性があり、検索エンジンのアルゴリズムは、より「人気のある」結果を優先して非規範的な見解を排除するように設計されていることが多い。[ 58 ]主要な検索エンジンのインデックス作成アルゴリズムは、米国以外の国のウェブサイトよりも、米国を拠点とするサイトのカバー率に偏っている。[ 55 ]
Google爆撃は、政治的、社会的、または商業的な理由で検索結果を操作しようとする試みの一例として挙げられる。
数名の学者が検索エンジンによって引き起こされた文化的変化[ 59 ]や、アイルランドのテロ[ 60 ] 、気候変動否定[ 61 ]、陰謀論[ 62 ]などの論争の的となるトピックが検索結果に表示されることについて研究している。
GoogleやBingなどの検索エンジンがユーザーの活動履歴に基づいてカスタマイズされた結果を提供しているため、2011年にEli Pariserがエコーチェンバーまたはフィルターバブルと呼んだ現象が発生しているという懸念が提起されている。 [ 63 ]検索エンジンやソーシャルメディアプラットフォームは、ユーザーに関する情報(位置情報、過去のクリック行動、検索履歴など)に基づいて、ユーザーが見たいと思う情報を選択的に推測するアルゴリズムを使用しているという主張である。その結果、ウェブサイトはユーザーの過去の見解と一致する情報のみを表示する傾向がある。Eli Pariserによれば、ユーザーは相反する見解に触れる機会が減り、知的にも情報バブルの中に孤立してしまう。この問題が認識されて以来、DuckDuckGoのようにユーザーを追跡したり「バブル化」したりしないことでこの問題を回避しようとする競合検索エンジンが登場している。しかし、多くの学者はPariserの見解に疑問を呈し、フィルターバブルの証拠はほとんどないことを発見している。[ 64 ] [ 65 ] [ 66 ]それとは対照的に、フィルターバブルの存在を検証しようとする多くの研究では、検索におけるパーソナライゼーションのレベルはごくわずかであり、[ 66 ]ほとんどの人がオンラインで閲覧する際にさまざまな見解に遭遇し、Googleニュースは主流の確立されたニュースメディアを宣伝する傾向があることがわかっています。[ 67 ] [ 65 ]
過去 10 年間のアラブおよびイスラム世界におけるインターネットと電子メディアの世界的成長は、中東およびアジア亜大陸のイスラム教徒に、ユーザーが安全な検索を実行できるようにする独自の検索エンジン、独自のフィルタリングされた検索ポータルを試みるよう促しました。これらのイスラムウェブポータルは、通常の安全な検索フィルターよりも、シャリーア法の解釈に基づいて、ウェブサイトを「ハラール」または「ハラーム」に分類します。ImHalalは2011 年 9 月にオンラインになりました。Halalgooglingは2013 年 7 月にオンラインになりました。これらは、 GoogleやBing (その他)のコレクションにハラームフィルターを使用しています。 [ 68 ]
イスラム世界における投資不足と技術の進歩の遅さが、イスラム教徒を主な顧客とするイスラム検索エンジンの発展を阻害し、成功を阻んできた一方で、Muxlim(イスラム教徒のライフスタイルサイト)のようなプロジェクトは、Rite Internet Venturesなどの投資家から数百万ドルの資金提供を受けたものの、やはり失敗に終わった。その他の宗教関連の検索エンジンとしては、Googleのユダヤ版であるJewogle [ 69 ]や、キリスト教の検索エンジンSeekFind.orgがある。SeekFindは、キリスト教の信仰を攻撃したり貶めたりするサイトをフィルタリングしている[ 70 ]。
ウェブ検索エンジンへの登録とは、ウェブマスターがウェブサイトを検索エンジンに直接登録するプロセスです。検索エンジンへの登録はウェブサイトの宣伝方法として紹介されることもありますが、主要な検索エンジンはウェブクローラーを使用しており、ほとんどのウェブサイトは最終的には自動的に見つかるため、一般的には登録は不要です。登録は、ウェブページを1ページずつ登録することも、サイトマップを使用してサイト全体を登録することもできますが、通常はホームページのみを登録すれば十分です。検索エンジンは適切に設計されたウェブサイトをクロールできるからです。ウェブサイトやウェブページを検索エンジンに登録する理由は、主に2つあります。1つは、検索エンジンが発見するのを待たずにまったく新しいウェブサイトを追加するため、もう1つは、大幅なリニューアル後にウェブサイトのレコードを更新するためです。
一部の検索エンジン登録ソフトウェアは、複数の検索エンジンにウェブサイトを登録するだけでなく、自身のページからウェブサイトへのリンクも追加します。外部リンクはウェブサイトのランキングを決定する最も重要な要素の1つであるため、これはウェブサイトのランキングを上げるのに役立つように見えるかもしれません。しかし、Googleのジョン・ミューラー氏は、これは「サイトにとって膨大な数の不自然なリンクにつながる可能性があり」、サイトのランキングに悪影響を与える可能性があると述べています。[ 71 ]
検索エンジンと比較すると、ソーシャルブックマークシステムは、検索エンジンのスパイダーなどの従来の自動リソース検索および分類ソフトウェアよりもいくつかの利点があります。インターネットリソース(Web サイトなど)のタグベースの分類はすべて、リソースの内容を理解している人間によって行われます。これは、リソースの意味と品質をアルゴリズム的に判断しようとするソフトウェアとは対照的です。また、人々は、Web スパイダーによってまだ認識またはインデックス化されていないWeb ページを見つけてブックマークすることができます。 [ 72 ]さらに、ソーシャルブックマークシステムは、ユーザーによってブックマークされた回数に基づいてリソースをランク付けできます。これは、外部リンクの数に基づいてリソースをランク付けするシステムよりも、エンドユーザーにとってより有用な指標となる可能性があります。ただし、どちらのタイプのランキングも不正行為に対して脆弱であり( 「システムの悪用」を参照)、どちらもこれに対処するために技術的な対策が必要です。
最初のウェブ検索エンジンは、1990年にモントリオールのマギル大学の学生であったアラン・エムテージによって作成されたArchieでした[ 73 ]。
ファイルの保存と取得の主な方法は、ファイル転送プロトコル(FTP)と呼ばれる通信プロトコルを使用することでした。これは、コンピュータがインターネット上でファイルを交換する一般的な方法を規定したものです。仕組みは次のとおりです。管理者が自分のコンピュータからファイルを公開したい場合、FTPサーバーと呼ばれるプログラムをコンピュータにインストールします。インターネット上の誰かがこのコンピュータからファイルを取得したい場合、FTPクライアントと呼ばれる別のプログラムを介して接続します。FTPクライアントプログラムとFTPサーバープログラムの両方がFTPプロトコルで定められた仕様を完全に遵守していれば、どのFTPクライアントプログラムでもどのFTPサーバープログラムにも接続できます。
当初、ファイルを共有したい人は誰でも、他のユーザーがファイルを利用できるようにするためにFTPサーバーをセットアップする必要がありました。その後、「匿名」FTPサイトがファイルの保管場所となり、すべてのユーザーがファイルを投稿したり取得したりできるようになりました。
アーカイブサイトがあっても、重要なファイルの多くは依然として小規模なFTPサーバーに散在していた。これらのファイルは、インターネット版の口コミ、つまり誰かがメッセージリストやディスカッションフォーラムにファイルの入手可能性を知らせるメールを投稿することによってのみ見つけることができた。
Archie はそれをすべて変えました。匿名 FTP ファイルのサイト一覧を取得するスクリプトベースのデータ収集装置と、ユーザーのクエリに一致するファイル名を取得する正規表現マッチング装置を組み合わせたのです。(4) つまり、Archie のデータ収集装置はインターネット上の FTP サイトをくまなく探し、見つけたすべてのファイルをインデックス化しました。正規表現マッチング装置によって、ユーザーはデータベースにアクセスできるようになりました。[ 74 ]
1993年、ネバダ大学システムコンピューティングサービスグループはVeronicaを開発しました。[ 73 ]これは、Archieに似た検索装置の一種として作成されましたが、Gopherファイル用です。Jugheadと呼ばれる別のGopher検索サービスが少し後に登場しましたが、おそらくコミックストリップの三位一体を完成させるためだけのものだったのでしょう。JugheadはJonzy's Universal Gopher Hierarchy Excavation and Displayの頭文字をとったものですが、Veronicaと同様に、おそらく作成者が後から頭文字をとったものと考えられます。Jugheadの機能はVeronicaとほぼ同じでしたが、少し粗削りな部分があったようです。[ 74 ]
1993年にマシュー・グレイによって開発されたワールドワイドウェブワンダラー[ 75 ]は、ウェブ上で最初のロボットであり、ウェブの成長を追跡するように設計されました。当初、ワンダラーはウェブサーバーのみをカウントしていましたが、導入後まもなく、移動しながらURLをキャプチャし始めました。キャプチャされたURLのデータベースは、最初のウェブデータベースであるWandexになりました。
マシュー・グレイの「ワンダラー」は当時大きな論争を巻き起こした。その理由の一つは、ソフトウェアの初期バージョンがインターネット上で暴走し、ネットワーク全体のパフォーマンスを著しく低下させたことにある。このパフォーマンス低下は、ワンダラーが同じページに1日に数百回もアクセスしていたために発生した。ワンダラーはすぐにその動作を修正したが、ロボットがインターネットにとって良いのか悪いのかという論争はその後も続いた。
Wandererに対抗して、Martijn Kosterは1993年10月にArchie-Like Indexing of the Web、略してALIWEBを開発した。その名の通り、ALIWEBはHTTP版のArchieであり、そのため現在でも多くの点で独自性を持っている。
ALIWEBにはウェブ検索ロボットはありません。代わりに、参加サイトのウェブマスターが、掲載したい各ページについて独自のインデックス情報を投稿します。この方法の利点は、ユーザーが自分のサイトを説明できることと、ロボットがネット帯域幅を消費して走り回らないことです。ALIWEBの欠点は、今日ではより大きな問題となっています。主な欠点は、特別なインデックスファイルを送信する必要があることです。ほとんどのユーザーは、そのようなファイルを作成する方法を理解していないため、ページを送信しません。このため、データベースは比較的小さくなり、ユーザーがALIWEBを大規模なボットベースのサイトよりも検索する可能性が低くなります。このジレンマは、他のデータベースをALIWEB検索に組み込むことである程度相殺されていますが、Yahoo!やLycosなどの検索エンジンのような大衆的な魅力はまだありません。[ 74 ]
Excite(当初はArchitextと呼ばれていた)は、1993年2月にスタンフォード大学の学部生6人によって始められた。彼らのアイデアは、インターネット上の膨大な情報の中からより効率的な検索を提供するために、単語間の関係の統計分析を利用することだった。彼らのプロジェクトは1993年半ばまでに資金が完全に確保された。資金が確保されると、彼らはウェブマスターが自分のウェブサイトで使用できる検索ソフトウェアのバージョンをリリースした。当時、このソフトウェアはArchitextと呼ばれていたが、現在はExcite for Web Serversという名前で知られている。[ 74 ]
Exciteは1995年にローンチされた最初の本格的な商用検索エンジンでした。[ 76 ]スタンフォード大学で開発され、@Homeに65億ドルで買収されました。2001年にExciteと@Homeは破産し、InfoSpaceがExciteを1000万ドルで買収しました。
1994年4月、スタンフォード大学の博士課程学生だったデビッド・フィロとジェリー・ヤンは、比較的人気を博したウェブページをいくつか作成した。彼らはそのページ群をYahoo!と名付けた。この名前を選んだ公式な理由は、自分たちを「ヤフー」(無鉄砲な若者)だと考えていたからだという。
リンク数が増え、ページへのアクセス数が1日に数千件に達するようになると、チームはデータをより効率的に整理する方法を考案しました。データ検索を容易にするため、Yahoo!(www.yahoo.com)は検索可能なディレクトリへと進化しました。検索機能はシンプルなデータベース検索エンジンでした。Yahoo!のエントリは手動で入力・分類されていたため、Yahoo!は厳密には検索エンジンとはみなされていませんでした。むしろ、一般的には検索可能なディレクトリとして認識されていました。その後、Yahoo!はデータ収集と分類プロセスの一部を自動化し、検索エンジンとディレクトリの区別を曖昧にしました。
WandererはURLしか取得できなかったため、URLで明示的に説明されていないものを見つけるのは困難でした。そもそもURLはやや難解なため、これは一般ユーザーにとって何の役にも立ちませんでした。Yahoo!やGalaxyで検索する方がはるかに効果的でした。なぜなら、これらのサイトではインデックス化されたサイトに関する詳細な説明情報が含まれていたからです。
1994年7月、カーネギーメロン大学を休職していたマイケル・モールディンは、同大学でLycos検索エンジンを開発した。
ウェブ上の検索エンジンは、他のサイトに保存されているコンテンツを検索する機能を備えたサイトです。さまざまな検索エンジンの動作方法は異なりますが、すべて3つの基本的なタスクを実行します。[ 78 ]
処理は、ユーザーが提供されたインターフェースを通じてシステムにクエリ文を入力することから始まります。
検索エンジンには基本的に3つの種類があります。ロボット(クローラー、アリ、クモなどと呼ばれる)によって動作するもの、人間による投稿によって動作するもの、そしてその両方を組み合わせたハイブリッド型です。
クローラー型検索エンジンとは、自動化されたソフトウェアエージェント(クローラーと呼ばれる)を使用してWebサイトを訪問し、サイト上の情報、メタタグを読み取り、さらにサイトが接続しているリンクをたどって、リンク先のWebサイトすべてに対してインデックスを作成する検索エンジンのことです。クローラーはこれらの情報をすべて中央リポジトリに送信し、そこでデータがインデックス化されます。クローラーは定期的にサイトを再訪し、変更された情報がないかを確認します。この頻度は検索エンジンの管理者によって決定されます。
人間が操作する検索エンジンは、人間が情報を送信し、それがインデックス化されてカタログ化されることに依存しています。インデックスには、送信された情報のみが格納されます。
どちらの場合も、ユーザーが検索エンジンに情報を検索しようとすると、実際には検索エンジンが作成したインデックスを検索しているのであり、ウェブ全体を検索しているわけではありません。これらのインデックスは、収集・保存され、その後検索される情報の巨大なデータベースです。そのため、Yahoo!やGoogleなどの商用検索エンジンで検索すると、実際にはリンク切れの結果が表示されることがあります。検索結果はインデックスに基づいているため、ウェブページが無効になってからインデックスが更新されていない場合、検索エンジンは実際にはリンクが無効になっているページを有効なリンクとして扱います。インデックスが更新されるまで、この状態は続きます。
検索エンジンによって検索結果が異なるのは、部分的にはインデックスの違いによるものです。インデックスは、クローラーが見つけた情報や人間が入力した情報によって決まります。しかし、より重要なのは、すべての検索エンジンが同じアルゴリズムを使ってインデックスを検索するわけではないということです。アルゴリズムとは、検索エンジンがインデックス内の情報とユーザーの検索内容との関連性を判断するために使用するものです。
検索エンジンのアルゴリズムがスキャンする要素の一つに、ウェブページ上のキーワードの出現頻度と位置があります。出現頻度が高いキーワードは、一般的に関連性が高いとみなされます。しかし、検索エンジンの技術は、キーワードスタッフィング、あるいはスパムデキシングと呼ばれる行為を抑制するために、ますます高度化しています。
アルゴリズムが分析するもう1つの共通要素は、Web上のページが他のページにどのようにリンクしているかです。ページ同士のリンクを分析することで、検索エンジンはページの内容(リンク先のページのキーワードが元のページのキーワードと類似している場合)と、そのページが「重要」でランキングを上げるに値するかどうかを判断できます。キーワードスタッフィングを無視する技術がますます高度化しているのと同様に、人工的なランキングを構築するためにサイトに人工的なリンクを組み込むWebマスターに対しても、より巧妙な対策が講じられるようになっています。
現代のウェブ検索エンジンは、長年にわたって進化してきた技術を採用した、非常に複雑なソフトウェアシステムです。検索エンジンソフトウェアには、特定の「ブラウジング」ニーズに合わせて個別に適用できる、いくつかのサブカテゴリがあります。これには、ウェブ検索エンジン(例:Google)、データベースまたは構造化データ検索エンジン(例:Dieselpoint)、および複合型検索エンジンまたはエンタープライズ検索が含まれます。GoogleやYahoo!などの普及している検索エンジンは、何十万台ものコンピュータを使用して何兆ものウェブページを処理し、かなり的確な検索結果を返します。このような膨大なクエリとテキスト処理量のため、ソフトウェアは高度な冗長性を備えた高度に分散された環境で動作する必要があります。
検索エンジンのもう1つのカテゴリは科学検索エンジンです。これらは科学文献を検索する検索エンジンです。最も有名な例はGoogle Scholarです。研究者たちは、理論的構成や主要な研究結果の抽出など、記事の内容要素を理解できるようにすることで、検索エンジンの技術を改善しようとしています。[ 79 ]
{{cite web}}: CS1 maint: 数値名: 著者リスト (リンク)