言語学において、共参照(co- reference、co-referenceと表記されることもある)とは、2つ以上の表現が同じ人や物を指し示す場合、つまり同じ指示対象を持つ場合に発生する。例えば、「ビルはアリスがすぐに来ると言ったが、彼女は来た」という文では、 「アリス」と「彼女」は同じ人を指している。[ 1 ]
共参照を特定するのは容易ではない場合が多い。例えば、「ビルは来ると言った」という文では、「彼」はビルを指している場合もあれば、そうでない場合もある。どの表現が共参照であるかを判断することは、意味を分析したり理解したりする上で重要な部分であり、文脈からの情報や、特定の種(「ローバー」)、人工物(「タイタニック」)、文法上の性、その他の特性など、現実世界の知識が必要となることが多い。
言語学者は、共参照を表すためにインデックスをよく使用します。例えば、「ビルは私が言った、彼は私が来るだろう」のようにです。このような表現は共インデックスされていると言われ、共参照として解釈されるべきであることを示しています。
表現が共参照的である場合、最初に現れる表現は多くの場合、完全な形式または説明的な形式(例えば、敬称や役割を含む人名全体)であり、後続の表現はより短い形式(例えば、名、姓、または代名詞のみ)を使用します。先に現れる表現は先行詞と呼ばれ、後続の表現は代名詞、照応詞、または参照と呼ばれます。ただし、代名詞は「彼女が家に着くと、アリスは眠りについた」のように、前方を指す場合もあります。このような場合、共参照は照応的ではなく後方照応的と呼ばれます。
共参照は、統語論における束縛現象にとって重要である。束縛理論は、文やテキストにおける共参照表現間に存在する統語的関係を探求する。
共参照を調査する際には、照応、後照応、先行詞の分離、共参照名詞句など、数多くの区別をすることができます。[ 2 ]これらのより具体的な現象のいくつかを以下に示します。
意味論者や論理学者は、共参照と束縛変数と呼ばれるものとを区別することがあります。[ 3 ]束縛変数は、プロフォームの前件が不定量化表現である場合に発生します。例:[ 4 ]
「すべての学生」や「どの学生も」といった数量表現は、指示的とはみなされません。これらの表現は文法的には単数形ですが、談話や現実世界における単一の指示対象を指し示すものではありません。したがって、これらの例における「his」の先行詞は適切に指示的ではなく、「his」自体も同様です。むしろ、「his」は先行詞によって束縛される変数とみなされます。その指示対象は、談話世界におけるどの学生を指しているのかによって変化します。束縛変数の存在は、次の例でより明確になるでしょう。
この文は曖昧です。ジャックは自分の成績を気に入っているが、他の全員がジャックの成績を嫌っているという意味にも、ジャック以外は誰も自分の成績を気に入っていないという意味にも解釈できます。前者の場合、「his」は共指示変数ですが、後者の場合、「his」はすべての生徒の集合によって指示対象が変わるため、束縛変数となります。
共参照表記はどちらの場合にも一般的に使用されます。つまり、2つ以上の式が共参照されている場合、それが共参照なのか束縛変数なのか(あるいは最後の例のように、解釈によって異なるのか)を示すものではありません。
計算言語学において、共参照解決は談話におけるよく研究されている問題です。テキストの正しい解釈を導き出すため、あるいは言及されているさまざまな主題の相対的な重要性を推定するためにも、代名詞やその他の指示表現を適切な人物に結びつける必要があります。共参照を解決することを目的としたアルゴリズムは、一般的に、まず指示表現と互換性のある最も近い先行する人物を探します。たとえば、「she」は「the woman」や「Anne」のような先行する表現に結びつく可能性はありますが、「Bill」には結びつく可能性はそれほど高くありません。 「himself」のような代名詞には、はるかに厳しい制約があります。多くの言語タスクと同様に、精度と再現率の間にはトレードオフがあります。共参照解決アルゴリズムを評価するためによく使用されるクラスタ品質指標には、ランド指数、調整済みランド指数、およびさまざまな相互情報量に基づく方法があります。
英語の共参照解決で特に問題となるのは、多くの用法を持つ代名詞itです。 it はheやsheとほぼ同じように参照できますが、一般的には無生物を指します (実際には規則はもっと複雑です。動物はit、he、sheのいずれでも使用できます。船は伝統的にsheです。ハリケーンは性別のある名前を持っていますが、通常はit です)。it は、存在ではなく抽象概念を指すこともあります。たとえば、He was paid minimum wage, but didn't seem to mind it のようにです。最後に、it には、特定のものを参照しない冗長な用法もあります。
冗長な用法は指示的とはみなされないため、共参照の一部ではない。[ 5 ]
共参照解決の手法は、大きく分けてメンションペア、メンションランキング、エンティティベースのアルゴリズムに分類できます。メンションペアアルゴリズムでは、与えられた2つのメンションが同じエンティティに属するかどうかを二値的に判定します。性別などのエンティティ全体の制約は考慮されないため、エラーが伝播します。例えば、代名詞のheとsheはどちらもthe teacherと共参照する可能性が高いですが、互いに共参照することはできません。メンションランキングアルゴリズムはこの考え方を拡張し、1つのメンションは1つの(前の)メンションとのみ共参照できると規定します。その結果、前の各メンションにスコアが付けられ、最もスコアの高いメンション(またはメンションなし)がリンクされます。最後に、エンティティベースの手法では、メンションは個々のメンションではなく、共参照チェーン全体の情報に基づいてリンクされます。可変幅チェーンの表現はメンションベースの手法よりも複雑で計算コストが高いため、これらのアルゴリズムは主にニューラルネットワークアーキテクチャに基づいています。