ACLデータ収集イニシアチブ(ACL/DCI)は、計算言語学研究のための大規模なテキストおよび音声コーパスを作成および配布するために、 1989年に計算言語学会(ACL)によって設立されたプロジェクトでした。このイニシアチブは、自然言語処理、音声認識、計算言語学などの分野の研究を支援できる大規模なテキストデータベースに対する高まるニーズに対応することを目的としていました。1993年までに、このイニシアチブの活動は事実上終了し、その機能とデータセットは、1992年に設立された言語データコンソーシアム(LDC)に吸収されました。 [ 1 ]
ACL/DCIにはいくつかの重要な目的があった。
これらの目標は、テキストと音声の認識と分析のアプリケーションから生じる膨大な量のテキストに対する需要の高まりに対応するために設計された。その中核的な目標は、「科学研究のために費用とロイヤリティなしで利用できる大規模なテキストコーパスの取得と準備を監督すること」であった。[ 2 ]
1980年代後半までに、計算言語学と音声認識の研究者は、統計モデルの開発やアルゴリズムのテストに必要な大規模でアクセス可能なテキストコーパスが不足しているという重大な問題に直面しました。既存の一般に利用可能なテキストデータベースは、テキストおよび音声認識のアプリケーション開発のニーズを満たすには小さすぎました。このニーズを満たすために、科学研究のための最小限の制限で大量のテキストデータを収集、標準化、配布するイニシアチブが結成されました。Liberman (1990) が述べているように、「研究者は適切な資料の不足、特に発表された結果を他の人が再現または拡張できるほど十分な量のテキストがないために、深刻な制約を受けてきました。」[ 2 ]
ACL/DCI委員会は1989年2月に設立された。委員会には米国とヨーロッパの学術研究機関や産業研究機関のメンバーが含まれていた。[ 3 ]
このイニシアチブは、ペンシルベニア大学(元AT&Tベル研究所)のマーク・リバーマンが議長を務めた。他の委員会メンバーには、ベルコア、IBM TJワトソン研究センター、ケンブリッジ大学、バージニア工科大学、ノースイースタン大学、ペンシルベニア大学、SRIインターナショナル、 MCC 、ゼロックスPARC、ISSCO、ピサ大学などの組織の代表者が含まれていた。[ 3 ]
このプロジェクトは当初、専用の資金を持たずに運営され、委員会のメンバーとその所属機関のボランティア活動に頼っていた。主な支援者には、AT&Tベル研究所、ベルコア、IBM、ゼロックス、ペンシルベニア大学などがあり、これらの大学はACL/DCI関連の作業にコンピューティング設備の使用を許可した。[ 2 ]
以前はボランティアの無償活動で運営されていたが、1991年にゼネラル・エレクトリックと国立科学財団(IRI-9113530)から資金提供を受けた。[ 4 ]
1990年時点で、ACL/DCIは数億語の多様なテキストを収集していました。そのコレクションには以下が含まれます。[ 2 ] [ 3 ]
この取り組みは北米英語のテキストから始まったが、カナダフランス語を含むように拡大し、日本語、中国語、その他のアジア言語を含めることも計画されていた。[ 2 ]
コレクションから少なくとも 500 万語がPenn Treebankプロジェクトの下でタグ付けされ、それらのタグは DCI によっても配布されました。[ 2 ] [ 3 ] [ 7 ]
DCIがLDCに吸収された後、データセットはLDCの下で管理されるようになった。[ 8 ]
ACL/DCIコーパスは、 DCIが関連プロジェクトであったテキストエンコーディングイニシアチブ(TEI)の勧告に準拠したSGML(標準一般化マークアップ言語、ISO 8879)[ 2 ]に基づく標準形式でコード化されました。TEIは、文学および言語データの共通交換フォーマットを提供することを目的とした、 ACL、コンピュータおよび人文科学協会、および文学および言語コンピューティング協会の共同プロジェクトでした。
このイニシアチブは、品詞や構文的・意味的構造のさまざまな側面など、合意に基づいて承認された言語的特徴を反映した注釈を時間とともに追加することを計画していた。[ 2 ]
ACL/DCIの使用例として、音声認識研究におけるウォール・ストリート・ジャーナル(WSJ)コーパスを考えてみましょう。WSJコーパスは、 DARPA音声言語システム(SLS)[ 9 ]コミュニティの連続音声認識(CSR)コーパス[ 10 ]の基礎として使用されました。WSJコーパスは音声認識システムの評価における標準ベンチマークとなり、数多くの研究論文で使用されています。
WSJ CSRコーパスは、1987年から1989年にかけて、DARPAに初の汎用英語、大規模語彙、自然言語、高パープレキシティのコーパスを提供した。このコーパスには、音声(400時間)とテキスト(4700万語)が含まれている。テキストコーパスのサイズは313MBであった。[ 10 ]
テキストは、読者が選択する可能性のある単語の順序の曖昧さを解消するために前処理され、言語モデルのトレーニングに使用される未読テキストが、音声テスト資料を代表するものであることが保証されました。前処理には、数字を正書法に変換すること、略語を展開すること、アポストロフィと引用符を解決すること、句読点をマークすることが含まれていました。[ 10 ]
別の例として、ヤロウスキーアルゴリズムはDCIのバイテキストデータを使用して、より小さなデータセットでトレーニングされた高度なモデルと競合する単純な単語意味曖昧性解消モデルをトレーニングしました。 [ 11 ]
ACL/DCIコレクションの資料は、非営利ベースで研究グループに配布された。1990年までに、約25の研究グループと個々の研究者が、収集された資料のさまざまな部分を含むテープを受け取った。[ 2 ]
データを取得するために、研究者はデータを再配布したり、直接商業的に使用したりしないという契約に署名しなければならなかった。ただし、統計表や文法規則など、テキストから派生した「分析資料」の商業的利用は明示的に許可されていた。[ 2 ]
この取り組みでは、最初は9トラックテープの12インチリールでデータを配布し、その後CD-ROMで配布しました。各テープには、Lempel-Zivアルゴリズムで圧縮された3000万語を収録できました。[ 2 ]最初のCD-ROM配布は1991年に行われ、Dragon Systems Inc.の資金提供を受けました。これには、Collins English Dictionary、WSJ、米国エネルギー省が提供する科学抄録、およびPenn Treebankが含まれていました。[ 4 ]