コーパス言語学は、テキストコーパス(複数形はコーパス)による 言語研究のための実証的な方法です。[ 1 ]コーパスは、特定の言語変種を代表することを目的とした、本物の「現実世界」の音声または文章のテキストのバランスのとれた、多くの場合階層化されたコレクションです。 [ 1 ]今日では、コーパスは一般的に機械可読データコレクションです。
コーパス言語学は、実験的な介入を最小限に抑え、その言語の自然な文脈(「リアリア」)である現場で収集されたコーパスを用いることで、言語の信頼性の高い分析がより実現可能になると提唱している。コーパスは単語数という点では小規模な場合もあるが、テキストの大規模なコレクションによって、言語学者は定性的な方法では検証が難しい言語概念について定量的な分析を行うことができる。[ 2 ]
テキストコーパス法は、あらゆる自然言語のテキスト全体を用いて、その言語を支配する抽象的な規則の集合を導き出す手法です。得られた結果は、対象言語と、同様の分析を受けた他の言語との関係性を探るために利用できます。最初のコーパスは原文から手作業で作成されましたが、現在ではその作業は自動化されています。
コーパスは言語学の研究に利用されてきただけでなく、辞書( 1969年の『アメリカン・ヘリテージ英語辞典』を皮切りに)や参考文法の編纂にもますます利用されるようになり、1985年に出版された『英語総合文法』がその先駆けとなった。
この分野の専門家は、コーパスの注釈について様々な見解を持っている。これらの見解は、テキストがそれ自体で語るように最小限の注釈を提唱するジョン・マクハーディ・シンクレア[ 3 ]から、厳密な記録を通じてより深い言語理解を可能にする注釈を提唱する英語使用調査チーム(ユニバーシティ・カレッジ・ロンドン) [ 4 ]まで多岐にわたる。
初期の文法記述の試みのいくつかは、少なくとも部分的には、特定の宗教的または文化的意義を持つコーパスに基づいていた。例えば、プラティシャーキヤ文学はヴェーダに見られるサンスクリット語の音韻パターンを記述しており、 パーニニの古典サンスクリット語文法は、少なくとも部分的には同じコーパスの分析に基づいていた。同様に、初期のアラビア語文法学者はコーランの言語に特に注意を払った。西ヨーロッパの伝統では、学者たちは聖書やその他の正典の言語を詳細に研究できるように、コンコーダンスを作成した。
現代コーパス言語学の画期的な著作は、1967 年に出版された『現代アメリカ英語の計算分析』である。ヘンリー・クチェラとW. ネルソン・フランシスによって書かれたこの著作は、1961 年のアメリカ英語 100 万語からなる構造化されバランスのとれたコーパスであるブラウン コーパスの分析に基づいている。このコーパスは、さまざまなジャンルから 2000 のテキスト サンプルで構成されている。[ 5 ]ブラウン コーパスは、言語研究のために設計された最初のコンピュータ化されたコーパスであった。[ 6 ]クチェラとフランシスは、ブラウン コーパスに対してさまざまな計算分析を行い、言語学、言語教育、心理学、統計学、社会学の要素を組み合わせて、豊かで多様な著作を作成した。もう 1 つの重要な出版物は、 1960 年にランドルフ・クワークが発表した「英語使用法の記述に向けて」[ 7 ]であり、その中で彼は英語使用法の調査を紹介した。 Quirkのコーパスは、言語全体を表現することを目的として構築された最初の近代的なコーパスでした。[ 8 ]
その後間もなく、ボストンの出版社ホートン・ミフリン社は、コーパス言語学を用いて編纂された初の辞書である新刊『アメリカン・ヘリテージ辞典』のために、100万語、3行の引用データベースを提供するようクチェラ氏に依頼した。『アメリカン・ヘリテージ辞典』は、規範的な要素(言語がどのように使われるべきか)と記述的な情報(実際にどのように使われているか)を組み合わせるという革新的な試みを行った。
他の出版社もこれに倣った。イギリスの出版社コリンズのCOBUILD単言語学習者辞書は、外国語として英語を学習するユーザー向けに設計されており、バンク・オブ・イングリッシュを使用して編集された。英語使用調査コーパスは、最も重要なコーパスベースの文法の1つである、クワークらが執筆し、1985年に『英語総合文法』として出版されたものの開発に使用された。[ 9 ]
ブラウン・コーパスからは、同様の構造を持つコーパスが多数生まれています。LOBコーパス(1960年代のイギリス英語)、コルハプール(インド英語)、ウェリントン(ニュージーランド英語)、オーストラリア英語コーパス(オーストラリア英語)、フラウン・コーパス(1990年代初頭のアメリカ英語)、FLOBコーパス(1990年代のイギリス英語)などです。その他のコーパスは、多くの言語、変種、様式を網羅しており、国際英語コーパスや、 1990年代に出版社、大学(オックスフォード大学とランカスター大学)、大英図書館のコンソーシアムによって作成された、1億語に及ぶ話し言葉と書き言葉のコレクションである英国国立コーパスなどがあります。現代アメリカ英語については、アメリカ国立コーパスの開発は停滞していますが、4億語を超える現代アメリカ英語コーパス(1990年~現在)がウェブインターフェースを通じて利用可能になっています。
音声言語の書き起こしの最初のコンピュータ化されたコーパスは、1971年にモントリオール・フランス語プロジェクトによって構築され[ 10 ] 、 100万語を含んでおり、シャナ・ポプラックによるオタワ・ハル地域のフランス語音声コーパスのはるかに大規模なものに影響を与えた[ 11 ] 。
1990年代、自然言語処理(NLP)における統計的手法の初期の注目すべき成功例の多くは、機械翻訳の分野で起こり、特にIBMリサーチの研究によるものでした。これらのシステムは、カナダ議会と欧州連合が、すべての政府手続きをそれぞれの政府機関のすべての公用語に翻訳することを義務付ける法律に基づいて作成した、既存の多言語テキストコーパスを活用することができました。
ヨーロッパ以外の言語にもコーパスが存在する。例えば、日本の国立国語研究所は、話し言葉と書き言葉の日本語のコーパスを多数構築している。手話のコーパスもビデオデータを用いて作成されている。[ 12 ]
これらの生きた言語のコーパスに加えて、古代言語のテキストのコレクションからコンピュータ化されたコーパスも作成されています。例として、 1970年代から開発されているヘブライ語聖書のアンダーセン・フォーブス・データベースがあり、そこではすべての節が最大7レベルの構文を表すグラフを使用して解析され、すべてのセグメントに7つの情報フィールドがタグ付けされています。[ 13 ] [ 14 ]コーラン・アラビア語コーパスは、コーランの古典アラビア語の注釈付きコーパスです。これは、形態論的セグメンテーション、品詞タグ付け、依存文法を使用した構文分析など、複数の注釈レイヤーを備えた最近のプロジェクトです。[ 15 ]デジタル・コーパス・オブ・サンスクリット(DCS)は、「サンスクリット語の言語学と文献学におけるテキスト史的研究のために設計された、完全な形態論的および語彙的分析を備えたサンスクリット語テキストのサンディ分割コーパス」です。[ 16 ]
純粋な言語学的調査に加えて、研究者たちはコーパス言語学を他の学術分野や専門分野にも応用し始めており、例えば、コーパスデータとツールを使って法律文書を理解しようとする、新興の法とコーパス言語学という分野があります。DBLP Discovery Datasetはコンピュータサイエンスに特化しており、著者の所属、引用、研究分野などの知覚メタデータを持つ関連するコンピュータサイエンスの出版物が含まれています。[ 17 ]より焦点を絞ったデータセットは、 ACL Anthologyの論文とGoogle Scholarのメタデータを組み合わせたNLP Scholarによって導入されました。[ 18 ]コーパスは翻訳作業[ 19 ]や外国語教育にも役立ちます。[ 20 ]
コーパス言語学は、データから理論への道筋をたどろうとする数多くの研究方法を生み出してきた。ウォリスとネルソン(2001)[ 21 ]は、注釈、抽象化、分析という3Aの視点を最初に導入した。
現在、ほとんどの語彙コーパスは品詞タグ付け(POSタグ付け)されています。しかし、「注釈のないプレーンテキスト」を扱うコーパス言語学者でさえ、重要な用語を抽出するために何らかの手法を適用せざるを得ません。このような場合、語彙検索では注釈付けと抽象化が組み合わされます。
注釈付きコーパスを公開する利点は、他のユーザーが(コーパスマネージャーを介して)コーパス上で実験を行うことができる点です。作成者とは異なる関心や視点を持つ言語学者も、この成果を活用できます。データを共有することで、コーパス言語学者はコーパスを言語学的議論とさらなる研究の場として扱うことができます。[ 22 ]
この分野の書籍シリーズには以下が含まれます。
コーパス言語学を専門とする国際的な査読付き学術誌はいくつかあり、例えば以下のようなものがある。