Google Scholar は、さまざまな出版形式や分野にわたる学術文献の全文またはメタデータを索引付けする、無料で利用できるウェブ検索エンジンです。2004 年 11 月にベータ版としてリリースされたGoogle Scholar の索引には、査読済みのオンライン学術誌や書籍、会議論文、学位論文、プレプリント、抄録、技術報告書、裁判所の意見や特許などのその他の学術文献が含まれています。[ 1 ]
Google Scholar は、ウェブ クローラーまたはウェブ ロボットを使用して、検索結果に含めるファイルを特定します。[ 2 ]コンテンツが Google Scholar にインデックス化されるには、特定の指定された基準を満たす必要があります。[ 3 ]マーク アンド リキャプチャー法を使用してPLOS Oneで発表された以前の統計的推定では、英語で出版されたすべての記事の約 79 ~ 90% が網羅され、推定 1 億件とされています。[ 4 ]この推定では、利用可能なオンライン ドキュメントの数も決定されました。Google Scholar は、ジャーナルの審査を行わず、ハゲタカ ジャーナルをインデックスに含めていることで批判されています。 [ 5 ]
ミシガン大学図書館や、Google BooksやGoogle ScholarのためにGoogleがコレクションをスキャンした他の図書館は、スキャンしたコピーを保管し、それらを使用してHathiTrustデジタルライブラリを作成しました。[ 6 ] [ 7 ]
Google Scholar は、当時 Google のメイン Web インデックスの構築に取り組んでいたAlex Verstak とAnurag Acharyaの議論から生まれました。[ 8 ] [ 9 ] [ 10 ]彼らの目標は、科学的知識へのより簡単で正確なアクセスを可能にすることで、「世界の課題解決者の効率を 10% 向上させる」ことでした。 [ 11 ]この目標は、Google Scholar の広告スローガン「巨人の肩の上に立つ」に反映されています。これは、アイザック ニュートンが引用した、シャルトルのベルナールに帰せられる考えから取られたもので、何世紀にもわたってそれぞれの分野に貢献し、新しい知的成果の基盤を提供してきた学者たちへの敬意を表しています。[ 12 ] Google Scholar のテキストのソースの 1 つは、ミシガン大学の印刷コレクションです。[ 6 ]
研究者は時間の経過とともにさまざまな機能を獲得してきました。2006 年、RefWorks、RefMan、EndNote、BibTeXなどの文献管理ツールをサポートする引用インポート機能が実装されました。2007 年、Acharya 氏は、Google Scholar が出版社と合意の上、ジャーナル記事をデジタル化してホストするプログラムを開始したと発表しました。これは、古いジャーナルのスキャンには特定の号の特定の記事を識別するために必要なメタデータが含まれていないGoogle Booksとは別の取り組みです。 [ 13 ] 2011 年、Google は検索ページのツールバーから Scholar を削除しました。[ 14 ]これにより、Scholar の存在を知らないユーザーにとってはアクセスしにくく、見つけにくくなりました。この頃、CiteSeer、Scirus、Microsoft Windows Live Academic search など、同様の機能を持つサイトが開発されました。これらのいくつかは現在廃止されています。2016 年、Microsoft は競合サービスとしてMicrosoft Academic を新たに立ち上げました。[ 15 ]
2012年に大規模な機能強化が行われ、個々の研究者が個人の「Scholar Citations プロフィール」を作成できるようになりました。[ 16 ] 2013年11月に導入された機能により、ログインしたユーザーは検索結果を「Google Scholar ライブラリ」に保存できるようになりました。これは、ユーザーが個別に検索し、タグで整理できる個人コレクションです。[ 17 ]「メトリクス」ボタンを使用すると、関心のある分野の上位ジャーナルが表示され、これらのジャーナルのインパクトを生み出している記事にもアクセスできます。メトリクス機能は現在、科学分野全体と学術誌のインパクトを表示することをサポートしています。[ 18 ] Googleは、アルバート・アインシュタイン[ 19 ]やリチャード・ファインマン[ 20 ]など、死後も一部の学者のプロフィールも掲載しています。数年間、アイザック・ニュートン[ 21 ]のプロフィールには、「 MITの教授」であり、「mit.eduの検証済みメールアドレス」であると表示されていました。[ 22 ]
Google Scholar では、オンラインまたは図書館にある記事のデジタル版または紙媒体版を検索できます。[ 23 ] 「学術的とみなされる特定の Web ページを含む、全文ジャーナル記事、技術レポート、プレプリント、学位論文、書籍、その他の文書」を索引付けしています。[ 24 ] Google Scholar の検索結果の多くは商用ジャーナル記事へのリンクであるため、ほとんどの人は記事の要約と引用の詳細にしかアクセスできず、記事全体にアクセスするには料金を支払う必要があります。[ 24 ]検索キーワードに最も関連性の高い結果が、著者のランキング、リンクされている参考文献の数と他の学術文献との関連性、記事が掲載されている出版物のランキングの順に最初にリストされます。[ 25 ]
「グループ」機能を使用すると、ジャーナル記事への利用可能なリンクが表示されます。2005 年版では、この機能は記事の購読アクセス版と無料の全文版の両方へのリンクを提供していました。2006 年の大部分では、出版社版へのリンクのみを提供していました。2006 年 12 月以降は、出版版と主要なオープン アクセスリポジトリの両方へのリンクを提供しており、これには個々の教員の Web ページに掲載されているものや、類似性によって識別されるその他の非構造化ソースも含まれます。一方、Google Scholar では、有料アクセスとオープン アクセスリソースを明示的にフィルタリングすることはできません。この機能は、図書館がコレクションの実際のコストと価値を計算するために使用するWeb of Science、Scopus、Unpaywall JournalsなどのUnpaywallのデータを埋め込むツールで提供されています。[ 26 ]
Google Scholar は「引用元」機能を通じて、閲覧中の記事を引用している記事の要約へのアクセスを提供します。[ 27 ]特にこの機能により、以前はCiteSeer、Scopus、Web of Scienceにしかなかった引用索引が提供されます。Google Scholar は、引用をさまざまな形式でコピーしたり、 Zoteroなどのユーザーが選択した文献管理ツールにインポートしたりできるリンクも提供します。
「Scholar Citations プロフィール」は、著者自身が編集できる公開著者プロフィールです。[ 16 ]通常は学術機関にリンクされた正規のアドレスを持つ Google アカウントでログインした個人は、関心のある分野と引用を示す独自のページを作成できるようになりました。Google Scholar は、個人の総引用数、h指数、およびi10 指数を自動的に計算して表示します。Google によると、2014 年 8 月の時点で、「Scholar 検索結果ページの 4 分の 3 には、著者の公開プロフィールへのリンクが表示されます」。[ 16 ]
Google Scholar の「関連論文」機能では、関連性の高い論文のリストが表示されます。これらの論文は、元の結果とどれだけ似ているかによって主にランク付けされますが、各論文の関連性も考慮されます。[ 28 ]
Google Scholar の米国判例の法律データベースは広範です。ユーザーは、1950 年以降の米国の州控訴裁判所および最高裁判所の判例、1923 年以降の米国の連邦地方裁判所、控訴裁判所、税務裁判所、破産裁判所の判例、および 1791 年以降の米国最高裁判所の判例を検索して読むことができます。 [ 27 ] Google Scholar は、判例内にクリック可能な引用リンクを埋め込んでおり、[引用方法] タブを使用すると、弁護士は以前の判例法と裁判所の判決へのその後の引用を調べることができます。[ 29 ]
ほとんどの学術データベースや検索エンジンでは、ユーザーが結果の順位付けに1つの要素(関連性、引用数、出版日など)を選択できるのに対し、Google Scholarは「研究者が行う方法」で、各論文の全文、著者、論文が掲載されている出版物、および他の学術文献でその論文がどれだけ頻繁に引用されているかを考慮して、複合ランキングアルゴリズムで結果をランク付けします。[ 25 ]研究によると、Google Scholarは特に引用数[ 30 ]と文書のタイトルに含まれる単語[ 31 ]に高い重みを置いています。著者または年による検索では、引用数が非常に決定的な要素であるため、最初の検索結果は引用数の多い論文であることが多いですが、キーワード検索では引用数が最も重みのある要素である可能性が高いものの、他の要素も関与しています。[ 32 ]
一部の検索者は、特定のジャーナルの記事の引用を調べる際に、Google Scholar が購読ベースのデータベースと同等の品質と有用性を持っていることを発見しました。[ 33 ] [ 34 ]レビューでは、特にその「引用元」機能がScopusやWeb of Scienceに深刻な競争を仕掛けていることが認識されています。生物医学分野を調べた研究では、Google Scholar の引用情報は「不十分な場合があり、更新頻度も低い」ことがわかりました。[ 35 ] Google Scholar の網羅性は、他の一般的なデータベースと比較して、分野によって異なる場合があります。[ 36 ] Google Scholar は、学術的な厳密さに欠ける可能性のあるハゲタカジャーナルを含め、できるだけ多くのジャーナルを含めるよう努めています。ハゲタカジャーナルの専門家は、これらの種類のジャーナルは「疑似科学で世界の科学記録を汚染している」ものであり、「Google Scholar はそれを忠実に、おそらく盲目的に中央索引に含めている」と述べています。[ 37 ]
Google Scholar は、クロールしたジャーナルや含まれている出版社のリストを公開しておらず、更新頻度も不明です。計量書誌学的証拠によると、Google Scholar の科学および社会科学の網羅性は他の学術データベースと遜色ありません。2017 年現在、Scholar の芸術および人文科学の網羅性は実証的に調査されておらず、これらの分野の学問分野における Scholar の有用性は依然として不明確です。[ 38 ]特に初期の頃は、一部の出版社は Scholar が自社のジャーナルをクロールすることを許可していませんでした。Elsevierのジャーナルは、Elsevier がScienceDirectコンテンツのほとんどを Google Scholar および Google のウェブ検索で利用できるようにし始めた 2007 年半ばから含まれています。 [ 39 ]しかし、2014 年の研究[ 4 ]では、 Google Scholar は、英語で書かれたウェブ上のすべての学術文書のほぼ 90% (約 1 億) を見つけることができると推定されています。大規模な縦断研究によると、科学論文の40~60パーセントはGoogle Scholarリンク経由で全文が入手可能である。[ 40 ]
Google Scholar はランキング アルゴリズムで引用数を重視しているため、マシュー効果を強めていると批判されています。[ 30 ]引用数の多い論文が上位に表示されると、引用数が増えますが、新しい論文は上位に表示されることがほとんどないため、Google Scholar のユーザーの注目が集まらず、引用数も少なくなります。Google Scholar 効果とは、一部の研究者が、引用元の出版物への貢献度に関係なく、Google Scholar の上位結果に表示される論文を選択して引用する現象です。これは、これらの論文の信頼性を自動的に想定し、編集者、査読者、読者がこれらの引用を見ることを期待していると考えるためです。[ 41 ] Google Scholar は、 arXivプレプリント サーバー上の出版物を正しく識別するのに問題があります。タイトルの句読点文字によって誤った検索結果が生成され、著者が誤った論文に割り当てられるため、誤った追加の検索結果が発生します。一部の検索結果は、理解できる理由もなく表示されます。[ 42 ] [ 43 ]
Google Scholar はスパムに対して脆弱です。[ 44 ] [ 45 ]カリフォルニア大学バークレー校とオットー・フォン・ゲーリケ大学マクデブルクの研究者らは、Google Scholar の引用カウントは操作可能であり、 SCIgenで作成された完全なナンセンスな記事がGoogle Scholar にインデックスされることを実証しました。[ 46 ]これらの研究者らは、Google Scholar の引用カウントは、特にh 指数やインパクト ファクターなどのパフォーマンス メトリクスを計算する際に使用する場合は注意して使用する必要があると結論付けました。h 指数やインパクトファクター自体は、記事の質の予測値としては不十分です。[ 47 ] Google Scholar は、個別の Scholar ページが登場した 2012 年に h 指数の計算を開始しました。Harzingの Publish or Perishなどのいくつかの下流パッケージもそのデータを使用しています。[ 48 ] Google Scholar を偽装して h 指数計算機を操作する実用性は、 2010 年にジョセフ・フーリエ大学の Cyril Labbe によって実証されました。彼は、互いに引用し合うSCIgenで生成された多数の文書 (実質的には学術リンクファーム)を利用して、「Ike Antkare」をAlbert Einsteinより上位にランク付けすることに成功しました。 [ 49 ] 2010 年の時点では、Google Scholar はLexisのように判例をシェパード化することはできませんでした。[ 50 ] ScopusやWeb of Scienceなどの他の学術研究索引とは異なり、Google Scholar はデータ取得を自動化するために使用できるアプリケーション プログラミング インターフェイスを維持していません。検索結果の内容を取得するためにウェブ スクレイパーを使用することも、CAPTCHA の実装によって厳しく制限されています。 Google Scholar は、デジタル オブジェクト 識別子(DOI) [ 51 ]を表示またはエクスポートしません。DOI は、主要な学術出版社すべてが実装している事実上の標準であり、個々の学術論文を一意に識別して参照するために使用されます。[ 52 ] 2024 年に、研究者らは、引用購入サービスを通じて Google Scholar を操作できることを発見しました。[ 53 ]
Googleなどの従来のウェブ検索エンジン向けの検索エンジン最適化(SEO)は、長年にわたり人気があります。ここ数年、SEO は Google Scholar などの学術検索エンジンにも適用されています。[ 54 ]学術論文 向けの SEO は「学術検索エンジン最適化」(ASEO) とも呼ばれ、「学術検索エンジンがクロールしてインデックスを作成しやすくする方法で学術文献を作成、公開、修正すること」と定義されています。[ 54 ] ASEO は、 Elsevier、[ 55 ] OpenScience、[ 56 ] Mendeley、[ 57 ] SAGE Publishing、[ 58 ]など、いくつかの組織によってGoogle Scholar での論文のランキングを最適化するために採用されています。ASEO は、ジャーナルが指標を人為的に水増ししたり、学術検索エンジンにスパムを持ち込んだりすることを許容しているとして批判されています。[ 46 ]
ミシガン大学の Google との取り組みは、いくつかの活動と Google 製品 (例: Google Scholar) を網羅しています。