引用分析とは、文書中の引用の頻度、パターン、グラフを調べることです。引用分析では、文書の有向グラフ(ある文書から別の文書へのリンク)を使用して、文書の特性を明らかにします。典型的な目的は、コレクションの中で最も重要な文書を特定することです。古典的な例としては、学術論文と書籍間の引用が挙げられます。[ 1 ] [ 2 ]別の例として、裁判官は、以前の事件で下された判決を参照することで、判決を裏付けます(法的文脈における引用分析を参照)。さらに別の例として、現在のクレームに関連する以前の特許の引用である先行技術を含む特許が挙げられます。特許データのデジタル化とコンピューティング能力の向上により、これらの引用データを使用してイノベーション属性を測定し、知識の流れを追跡し、イノベーションネットワークをマッピングする実践コミュニティが生まれました。[ 3 ]
文書は、引用に加えて、著者、出版社、ジャーナル、実際のテキストなど、他の多くの特徴と関連付けることができます。文書のコレクションの一般的な分析は書誌計量学として知られており、引用分析はその分野の重要な部分です。たとえば、書誌結合と共引用は、引用分析(共有引用または共有参照)に基づく関連性の尺度です。文書のコレクション内の引用は、デレク J. デ ソラ プライスが1965 年の論文「科学論文のネットワーク」で指摘したように、引用グラフなどの形式でも表現できます。 [ 4 ]これは、引用分析がソーシャル ネットワーク分析とネットワーク サイエンス の側面を利用していることを意味します。
自動引用索引の初期の例としては、学術論文間の引用に使用されたCiteSeerがありましたが、 Web of Science は、学術書や記事だけでなく、より幅広い情報源を反映した現代的なシステムの例です。今日、自動引用索引[ 5 ]は引用分析研究の性質を変え、何百万もの引用を分析して大規模なパターンや知識の発見を可能にしました。引用分析ツールは、引用索引のデータに基づいて、研究者のさまざまな影響度指標を計算するために使用できます。[ 6 ] [ 7 ] [注 1 ]これらは、論文や助成金申請書をレビューするための専門家の査読者の特定から、学術的功績レビュー、終身在職権、昇進の決定を支援する透明性の高いデータの提供まで、さまざまな用途があります。限られたリソースをめぐるこの競争は、引用数を増やすために倫理的に問題のある行動につながる可能性があります。[ 8 ] [ 9 ]
引用パターンに影響を与える可能性のある他の要因を考慮せずに、引用分析を単純に用いて異なる学術論文の影響を比較する慣行に対して、多くの批判がなされてきた。[ 10 ]これらの批判の中で、繰り返し指摘されているのは「分野依存要因」に関するもので、これは引用慣行が科学の分野によって、さらには同一分野内の研究分野間でも異なるという事実を指している。[ 11 ]
引用索引はもともと情報検索のために設計されたものですが、現在では計量書誌学や研究評価を含むその他の研究にも広く利用されています。引用データは、広く知られている学術誌のインパクトファクターの基礎にもなっています。
引用分析に関する文献は膨大にあり、時にはサイエントメトリクス(ワシリー・ナリモフが考案した用語)またはより具体的にはビブリオメトリクスと呼ばれる。この分野は、現在では1900年以降の文献を網羅しているサイエンス引用索引の登場とともに発展した。この分野の主要なジャーナルは、サイエントメトリクス、インフォメトリクス、およびジャーナル・オブ・ザ・アソシエーション・フォー・インフォメーション・サイエンス・アンド・テクノロジーである。ASISTはまた、 ASISTのSIGMETRICSと呼ばれる電子メーリングリストを運営している。[ 12 ]この方法は、多くの大学でWeb of ScienceとScopusの購読データベースが広く普及し、 CiteBase、 CiteSeerX、Google Scholar、および以前のWindows Live Academic(現在は追加機能付きでMicrosoft Academicとして利用可能)などの普遍的に利用可能な無料の引用ツールに基づいて、再び注目を集めている。引用分析研究の方法には、定性的、定量的、および計算的アプローチがある。このような計量書誌学的研究の主な焦点は、生産性の比較、機関の研究ランキング、ジャーナルランキング[ 13 ] 、教員の生産性と終身在職権の基準の設定[ 14 ]、トップ学術論文の影響力の評価[ 15 ]、科学技術分野の発展軌跡の追跡[ 16 ]、研究業績の観点からのトップ著者と機関のプロファイルの作成[ 17 ]などである。
法的引用分析は、法律文書を分析して、同じ文書内または異なる文書間で条項を他の条項にリンクする引用を探索することにより、相互に関連する規制遵守文書の理解を容易にするための引用分析手法です。法的引用分析は、規制文書から抽出された引用グラフを使用し、ビッグデータ分析の技術革新を活用するプロセスである電子情報開示を補完することができます。[ 18 ] [ 19 ] [ 20 ] [ 21 ]
1965年の論文で、デレク・J・デ・ソラ・プライスは、 SCIの固有のリンク特性を「科学論文のネットワーク」と表現した。[ 4 ] SCIがオンラインで公開されるようになると、引用論文と被引用論文の間のリンクは動的になった。社会科学引用索引は、 1972年にDialogシステム[ 22 ]に搭載された最初のデータベースの1つとなった。CD -ROM版の登場により、リンクはさらに容易になり、書誌結合を使用して関連レコードを検索できるようになった。1973年、ヘンリー・スモールは共引用分析に関する古典的な研究を発表し、これは自己組織化分類システムとなり、文書クラスタリング実験につながり、最終的には後に「研究レビュー」と呼ばれる「科学アトラス」となった。
科学文献に固有の特性である世界的な引用ネットワークの固有のトポロジー的およびグラフィカルな性質は、 1965年にラルフ・ガーナー(ドレクセル大学)によって記述された。[ 23 ]
引用数を用いて学術誌をランク付けする手法は19世紀初頭から用いられていましたが、科学誌におけるこれらの引用数の体系的かつ継続的な測定は、科学情報研究所のユージン・ガーフィールドによって開始されました。彼はまた、これらの引用数を用いて著者や論文をランク付けする手法も開拓しました。1965年の画期的な論文で、ガーフィールドとアーヴィング・シャーは、ノーベル賞受賞者は平均的な論文数の5倍の論文を発表している一方で、その論文は平均的な論文数の30~50倍引用されていることを示し、引用頻度と著名性の相関関係を明らかにしました。ガーフィールドは、ノーベル賞やその他の賞に関する一連のエッセイの中で、この現象を報告しています。一般的な要約指標はインパクトファクターとして知られており、これは過去2年間の学術誌への引用数を、その年に発表された論文数で割ったものです。これは適切な目的にも不適切な目的にも広く用いられており、特に著者や論文のランク付けにこの指標のみを用いることは非常に議論の的となっています。
1964年に行われた、 DNAの歴史を記述する際の引用分析の使用に関する初期の研究において、ガーフィールドとシャーは、科学トピックの歴史における最も重要なステップのトポロジーマップであるヒストリオグラフを生成する可能性を示した。この研究は後に、E.ガーフィールド、ロシア科学アカデミー海洋生物学研究所のAIプドフキン、ワシントン州立大学教育学習技術センターのVSイストミンによって自動化され、2002年頃にHistCite [ 24 ]ソフトウェアの作成につながった。
自動引用索引付けは、1998 年にLee Giles、Steve Lawrence、Kurt Bollacker [ 25 ]によって導入され、あらゆるデジタル学術および科学文書の引用をアルゴリズムによって自動的に抽出およびグループ化することが可能になりました。以前の引用抽出は手作業で行われていましたが、引用指標は、ISI などの組織が選択したものだけでなく、あらゆる学術および科学分野と文書媒体に対して拡張して計算できるようになりました。これにより、公共の自動引用索引のための新しいシステムが作られ、最初のものはCiteSeer (現在はCiteSeerX ) で、すぐに Cora が続き、主にコンピュータ サイエンスと情報科学の分野に焦点を当てました。その後、Google Scholar や Microsoft Academic などの大規模な学術ドメイン引用システムが続きました。このような自律的な引用索引は、引用の抽出や引用のクラスタリングにおいてまだ完璧ではなく、エラー率は 10% と推定されていますが、慎重な統計的サンプリングはまだ行われていません。この結果、Ann Arbor、Milton Keynes、Walton Hallなどの著者が、広範な学術的成果を上げたとされています。[ 26 ] SCI は、純粋にプログラム的な方法によって自動引用索引を作成していると主張しています。古いレコードでも同様の規模のエラーがあります。
引用インパクト(引用指標とも呼ばれる)は、学術論文、ジャーナル、書籍、著者、または機関がどのくらいの頻度で引用されているかを示す指標です。[ 27 ] [ 28 ] [ 29 ] [ 30 ] [ 31 ] [ 32 ] [ 33 ] 引用数は、受け取った引用数(特定の引用インデックスで考慮される)に等しい生のスコアですが、引用頻度または引用率は、特定の期間にジャーナルまたは著者グループによって公開された論文数に対する引用数の比率によって与えられる正規化された値です。たとえば、10 本の論文が 5 件の引用を受けた場合、引用頻度は 0.5 = 5/10 になります。
ジャーナルインパクトファクターやCiteScoreなどの引用指標は、学術研究のインパクトや影響力の尺度として解釈され、引用分析による学術的インパクトのパターンの研究を専門とする書誌計量学または科学計量学の分野を生み出しました。 [ 34 ] [ 35 ]ジャーナルの重要性は平均引用率で測定できます。[ 36 ] [ 32 ]これは、学術機関が教員の終身在職権、昇進、採用に関する決定に 使用し、したがって著者がどのジャーナルに論文を掲載するかを決定する際にも使用されます。引用に似た尺度は、 GoogleのPageRankアルゴリズム、ソフトウェアメトリクス、大学ランキング、ビジネスパフォーマンス指標など、ランキングを行う他の分野でも使用されています。
法律文書の引用分析は、同じ文書内または異なる文書間で条項を他の条項にリンクする引用を探索することにより、相互に関連する規制遵守文書の理解と分析を容易にするアプローチです。引用分析は、規制文書から抽出された引用グラフを使用し、ビッグデータ分析の技術革新を活用するプロセスである電子情報開示を補完することができます。[ 20 ] [ 21 ] [ 18 ]
引用に基づく盗用検出 (CbPD) [ 37 ]は引用分析に依存しており、テキストの類似性に依存しない唯一の盗用検出手法です。[ 38 ] CbPD は、テキスト内の引用および参照情報を調べて、引用シーケンス内の類似パターンを特定します。そのため、この手法は、科学テキストや引用を含むその他の学術文書に適しています。 盗用を検出するための引用分析は、比較的新しい概念です。商用ソフトウェアには採用されていませんが、引用に基づく盗用検出システムの最初のプロトタイプが存在します。[ 39 ]調査対象文書における引用の類似した順序と近接性が、引用パターンの類似性を計算するために使用される主な基準です。引用パターンは、比較対象の文書間で共有される引用を排他的ではないサブシーケンスを表します。[ 38 ] [ 40 ]パターンの類似度を定量化するために、パターン内の共有引用の絶対数または相対的な割合、および文書内で引用が共起する確率などの要因も考慮されます。[ 38 ] [ 40 ] [ 41 ] [ 42 ]
自然言語処理(NLP)は、人工知能と言語学の交差点にある分野であり、大規模言語モデルなどのさまざまなイノベーションを通じて社会に大きな影響を与える態勢が整っています。NLPへの影響とNLPの影響は、引用を通じて広範囲に研究されてきました。研究者は、異なる分野間の分野横断的な影響[ 43 ] [ 44 ]、業界への影響[ 45 ]、引用の時系列パターン[ 46 ]、盗用[ 47 ]、地理的位置[ 48 ] 、性別[ 49 ]などのさまざまな要因を分析してきました。多くの研究は、この分野がますます孤立化しており、焦点が狭まり、学際性が低下し、少数の業界関係者に資金が集中していることを示しています。