並列コーパスの種類 並列コーパスは、主に4つのカテゴリに分類できます。
並列コーパス とは、同一文書の2つ以上の言語による翻訳を、少なくとも文レベルで整合させたものを指します。このようなコーパスは、比較可能性の低いコーパスに比べて希少です。 ノイズの多い並列コーパス には、完全に整列していない、あるいは翻訳の質が低い二言語文が含まれています。しかしながら、その内容の大部分は特定の文書の二言語翻訳です。 同様のコーパスは 、文単位で整列されていない未翻訳の二言語文書から構築されているが、文書はトピック単位で整列されている。 準比較可能なコーパス には、トピックが一致している場合もそうでない場合もある、非常に多様で非並列的な二言語文書が含まれる。
コーパス内のノイズ 機械翻訳 アルゴリズムの学習データセットとして使用される大規模なコーパスは、通常、類似した出来事を記述した第一言語と第二言語で書かれたニュース記事のデータベースなど、類似した情報源の大規模な集合体から抽出されます。
しかし、抽出された断片にはノイズが含まれる可能性があり、各コーパスに余分な要素が挿入されることがあります。抽出技術は、両方のコーパスに存在するバイリンガル要素と、一方のコーパスにのみ存在する モノリンガル 要素を区別し、バイリンガル要素のよりクリーンな並列断片を抽出できます。比較可能なコーパスは、翻訳目的の知識を直接得るために使用されます。しかし、特にリソースの少ない言語では、高品質の並列データを取得することは困難です。[ 4 ]
バイテキスト 翻訳研究 の分野において、バイテキスト とは、あるテキストの原文と訳文の両方のバージョンを統合した文書のことである。
バイテキストは、アライメントツール またはバイテキストツール と呼ばれるソフトウェアによって生成されます。このツールは、同じテキストの原文と翻訳版を自動的に整列させます。通常、このツールは2つのテキストを文ごとに照合します。バイテキストの集合はバイテキストデータベース またはバイリンガルコーパス と呼ばれ、検索ツールで参照できます。
バイテキストと翻訳メモリ バイテキストは 翻訳メモリといくつかの類似点があります。最も顕著な違いは、翻訳メモリは元の文脈を失うのに対し、バイテキストは元の文の順序を保持する点です。とはいえ、翻訳メモリの実装の中には、コンピュータ支援翻訳 (CAT)プログラム間で翻訳メモリを交換するための標準XML形式である Translation Memory eXchange (TMX)のように、元の文の順序を保持できるものもあります。
バイテキストは、機械ではなく人間の翻訳者 が参照することを想定して設計されています。そのため、翻訳メモリが誤動作するような小さな位置ずれや軽微な相違は問題になりません。
1988年の原著論文で、ハリスはバイテキストが翻訳者が翻訳を進める中で原文と訳文をメンタルワーキングメモリに一緒に保持する方法を表しているとも主張した。しかし、この仮説はその後検証されていない。[ 5 ]
オンラインのバイテキストと翻訳メモリは、 オンラインの二言語コンコーダンス。Linguée 、Reverso 、Tradooitなど、いくつかのものが 一般公開ウェブ上で利用可能です。 [ 6 ] [ 7 ] [ 8 ]
参考文献 ↑ Chan, Sin-Wai (2015). Routledge Encyclopedia of Translation Technology . London: Routledge. ISBN 978-1-315-74912-9 。 ↑ ウィリアムズ、フィリップ;センリッチ、リコ;ポスト、マット;コーン、フィリップ(2016)。 構文に基づく統計的機械翻訳 。モーガン&クレイプール 。ISBN 978-1-62705-502-4 。↑ Abdallah, A. (2021). 中級レベルIIの生徒への読解指導における並列テキスト戦略の使用の影響。International Journal on Social and Education Sciences (IJonSES), 3(1), 95-108. https://doi.org/10.46328/ijonses.48 ↑ Wołk, Krzysztof (2015). "Noisy-Parallel and Comparable Corpora Filtering Methodology for the Extraction of Bi-Lingual Equivalent Data at Sentence Level" . Computer Science . 16 (2): 169– 184. arXiv : 1510.04500 . Bibcode : 2015arXiv151004500W . doi : 10.7494/csci.2015.16.2.169 . S2CID 12860633 . ↑ Harris, B. (1988年3月). 「バイテキスト、翻訳理論における新しい概念」 (PDF) . Language Monthly . 54 : 8– 10. 2018年3月2日に オリジナル (PDF) からアーカイブ済み。 ↑ Genette, Marie (2016).オンラインバイリンガルコンコーダンサーはどれほど信頼できるか? フランス語から英語への複雑な前置詞の対照分析による Linguee 、 TradooIT 、 WeBiText 、 ReversoContextの信頼性 の調査 (修士論文)。ルーヴァン・カトリック大学およびオスロ大学 。hdl : 10852/51577 。 ↑ 「TradooIT – コンコルダンシエ二言語」 . ↑ Désilets, Alain; Farley, Benoît; Stojanović, Marta; Patenaude, Geneviève (2008). WeBiText: 並列ウェブコンテンツから大規模な異種翻訳メモリを構築する 。 翻訳とコンピュータに関する論文集。第30巻、 27~ 28 ページ。S2CID 14586900 。
外部リンク
並列コーパス JRC-Acquis多言語並列コーパスは、欧州連合 (EU)法の全体系であるAcquis Communautaireを 231の言語ペアで収録している。[ 1 ] 欧州議会議事録並行コーパス 1996年~2011年 Opusプロジェクトは、自由に利用可能な並列コーパスを収集することを目的としています。 2013年12月14日にWayback Machine に アーカイブされました。 ウィキペディアの京都に関する記事の日本語・英語バイリンガルコーパス(2012年8月22日時点の アーカイブ) COMPARA – ポルトガル語/英語の並列コーパス 用語検索 – 英語/ロシア語/フランス語の並列コーパス(主要な国際条約、協定、合意など) TradooIT – 英語/フランス語/スペイン語 – 無料オンラインツール ヌナブト準州ハンサード – 英語/イヌクティトゥット語対訳コーパス ParaSol – スラブ語とその他の言語の並列コーパス Glosbe: 多言語並列コーパス(2013年5月27日にWayback Machine に アーカイブ済み、オンライン検索インターフェース付き) InterCorp:チェコ語に準拠した40言語の多言語並列コーパス、オンライン検索インターフェース myCAT – Olanto、JCRおよびUNOコーパスのオンライン検索機能を備えたコンコーダンサー(オープンソースAGPL)。 TAUS(オンライン検索インターフェース付き)。 linguatools多言語並列コーパス、オンライン検索インターフェース。 EUR-Lexコーパス – EUR-Lex データベースから構築されたコーパスは、欧州連合の法律および 欧州連合 のその他の公文書で構成されています。
文書 J. VeronisとM.-D. Mahimonによる並列テキスト処理に関する文献目録 2003年開催の並列テキストの構築と利用に関するワークショップ議事録 2005年並行テキストの構築と利用に関するワークショップ議事録
GIZA++ 位置合わせツール (1999) Uplug – 並列コーパス処理ツール(2003年) GaleとChurchによる文アライメントアルゴリズム(2005年)の実装 Hunalign文アライナー(2005年) シャンポリオン(2006年) mALIGNa(2008年~2020年) ガルガンチュア センテンス アライナー (2010) Bleualign – 機械翻訳に基づく文のアライメント(2010年) YASA (2013) 階層アライメントツール(HAT)(2018年) 2020年7月5日にWayback Machine に アーカイブされました Vecalign文アライメントアルゴリズム(2019年) グルノーブル大学のウェブアライメントツール
↑ ラルフ、ラルフ・スタインバーガー;プリケン、ブルーノ。ウィディガー、アンナ。イグナット、カメリア。エルジャベツ、トマジュ。トゥフィシュ、ダン。ヴァルガ、ダニエル (2006)。 JRC-Acquis: 20 以上の言語を含む多言語に対応した並列コーパス 。 第 5 回言語資源と評価に関する国際会議 (LREC'2006) の議事録。イタリア、ジェノバ、2006 年 5 月 24 ~ 26 日 。