ルールベース機械翻訳( RBMT ; MT の「古典的アプローチ」) は、各言語の主な意味、形態、統語の規則性をそれぞれ網羅する (単一言語、二言語、または多言語) 辞書と文法から基本的に取得される、ソース言語とターゲット言語に関する言語情報に基づく機械翻訳システムです。RBMT システムは、入力文 (何らかのソース言語) を受け取り、具体的な翻訳タスクに関係するソース言語とターゲット言語の両方の形態、統語、意味の分析に基づいて、それらの文を生成し、出力文 (何らかのターゲット言語) を生成します。RBMT は、より効率的な方法、特にニューラル機械翻訳に徐々に取って代わられてきました。[1]
歴史
最初の RBMT システムは 1970 年代初頭に開発されました。この進化の最も重要なステップは、次の RBMT システムの出現でした。
- シストラン
- 日本語MTシステム[2] [3]
現在、他の一般的な RBMT システムには次のものがあります。
RBMTの種類
ルールベースの機械翻訳システムには、次の 3 つの種類があります。
- ダイレクト システム(辞書ベースの機械翻訳) は、基本的なルールを使用して入力を出力にマッピングします。
- 転送 RBMT システム(転送ベースの機械翻訳) は、形態論的および構文的分析を採用しています。
- インターリンガルRBMTシステム(インターリングア)は抽象的な意味を使用します。[4] [5]
RBMT システムは、例に基づく機械翻訳システム (例に基づく機械翻訳)の反対のシステムとして特徴付けることもできますが、ハイブリッド機械翻訳システムは RBMT から派生した多くの原理を利用します。
基本原則
RBMT システムの主なアプローチは、与えられた入力文の構造と要求された出力文の構造をリンクし、必然的にそれらの固有の意味を保持することに基づいています。次の例は、RBMT の一般的な枠組みを示しています。
- 女の子がリンゴを食べます。ソース言語 = 英語、要求されるターゲット言語 = ドイツ語
この英語の文章をドイツ語に翻訳するには、少なくとも次のものが必要です。
- 各英語の単語を適切なドイツ語の単語にマッピングする辞書。
- 通常の英語の文構造を表す規則。
- 通常のドイツ語の文構造を表す規則。
そして最後に、これら 2 つの構造を関連付けるための規則が必要です。
したがって、翻訳の段階は次のようになります。
- 1つ目: 各ソース単語の基本的な品詞情報を取得する:
- a = indef.article;女の子 = 名詞;食べる = 動詞; an = indef.article;リンゴ=名詞
- 2番目:動詞「食べる」に関する構文情報を取得する:
- NP-eat-NP; ここでは: eat – 現在形、三人称単数、能動態
- 3番目:ソース文を解析する:
- (NP リンゴ) = 食べる目的語
多くの場合、ソース文の構文構造を理解し、それをターゲット文の構造にマッピングするには、部分的な解析だけで十分です。
- 4番目:英語の単語をドイツ語に翻訳する
- a (カテゴリ = indef.article) => ein (カテゴリ = indef.article)
- girl (カテゴリー = 名詞) => Mädchen (カテゴリー = 名詞)
- eat (カテゴリ = 動詞) => essen (カテゴリ = 動詞)
- an (カテゴリ = 不定冠詞) => ein (カテゴリ = 不定冠詞)
- apple (カテゴリ = 名詞) => Apfel (カテゴリ = 名詞)
- 5番目:辞書のエントリを適切な語形変化形にマッピングする(最終生成):
- 女の子がリンゴを食べます。 => アイン・メッチェンはアイネン・アプフェルです。
オントロジー
オントロジーとは、あるドメイン内の概念(オブジェクト、プロセスなど)とそれらの関係を含む知識の形式的な表現です。保存された情報が言語的な性質のものであれば、レキシコンと呼ぶことができます。[6] NLPでは、オントロジーは機械翻訳システムの知識源として使用できます。大規模な知識ベースにアクセスすることで、ルールベースのシステムは多くの(特に語彙の)曖昧さを独自に解決できるようになります。次の典型的な例では、人間はレキシコンに保存された世界知識を使用しているため、文脈に応じて前置詞句を解釈できます。
私は顕微鏡/望遠鏡/双眼鏡で人/星/分子を見ました。[6]
構文は変わらないため、従来のルールベースの機械翻訳システムでは意味を区別できない可能性があります。しかし、知識源として十分な大きさのオントロジーがあれば、特定の文脈における曖昧な単語の解釈の可能性を減らすことができます。[7]
オントロジーの構築
1993年にPANGLOSS知識ベース機械翻訳システム用に生成されたオントロジーは、 NLP目的のオントロジーをどのようにコンパイルできるかの例として役立つかもしれない。 [8] [9]
- 機械翻訳システムのアクティブモジュールでの解析を支援するには、大規模なオントロジーが必要です。
- PANGLOSS の例では、約 50,000 個のノードを、手動で構築されたより小さなオントロジーの上位(抽象)領域に組み込むことを意図していました。そのサイズのため、自動的に作成する必要がありました。
- 目標は、LDOCE onlineとWordNet の2 つのリソースを統合して、Longman の簡潔な定義と、WordNet のオントロジーへの半自動分類を可能にする意味関係という、両方の利点を組み合わせることでした。
- 2 つのオンライン リソース間であいまいな単語の正しい意味を自動的にマージするための定義一致 アルゴリズムが作成されました。これは、LDOCE と WordNet でそれらの意味の定義に共通する単語に基づいています。類似性マトリックスを使用して、アルゴリズムは信頼度係数を含む意味間の一致を提供しました。ただし、このアルゴリズムだけでは、すべての意味を正しく一致させることはできません。
- そのため、WordNet (深い階層) と部分的に LDOCE (フラットな階層) にある分類階層を使用する2 番目の階層一致アルゴリズムが作成されました。これは、最初に明確な意味を一致させ、次に検索空間を一致した意味のそれぞれの祖先と子孫のみに制限することによって機能します。したがって、アルゴリズムはローカルで明確な意味を一致させます (たとえば、単語seal自体は曖昧ですが、 animalサブ階層にはsealの意味が 1 つしかありません)。
- 両方のアルゴリズムは互いに補完し合い、機械翻訳システム用の大規模なオントロジーの構築に役立ちました。WordNet 階層は、LDOCE の一致する定義と組み合わされ、オントロジーの上位領域に従属しました。その結果、PANGLOSS MT システムは、主に生成要素においてこの知識ベースを活用することができました。
コンポーネント
RBMT システムには以下が含まれます。
- SL形態素解析器- ソース言語の単語を分析し、形態素情報を提供します。
- SLパーサー- ソース言語の文を解析する構文解析ツールです。
- 翻訳者- ソース言語の単語をターゲット言語に翻訳するために使用されます。
- TL 形態素生成器-与えられた文法情報に対して適切なターゲット言語の単語を生成するジェネレータとして機能します。
- TLパーサー- 適切なターゲット言語の文の作成者として機能します。
- 複数の辞書- 具体的には、少なくとも 3 つの辞書:
- SL辞書-形態素解析のためにソース言語形態素解析器に必要なもの。
- 二言語辞書- 翻訳者が原語の単語を対象言語の単語に翻訳するために使用します。
- TL辞書-ターゲット言語の形態素生成器がターゲット言語の単語を生成するために必要となる。[10]
RBMT システムでは以下を利用します。
- 入力文から構文構造を構築する入力言語のソース文法。
- ドメイン内で許容されるすべての語彙を収録したソース辞書。
- ソース マッピング ルールは、ソース言語の統語ヘッドと文法機能が中間言語のドメイン概念と意味役割にどのようにマッピングされるかを示します。
- ドメイン概念のクラスを定義し、各クラスの意味的役割のフィラーを制限するドメインモデル/オントロジー。
- 中間言語のドメイン概念と意味的役割がターゲット言語の統語的見出しと文法機能にどのようにマッピングされるかを示すターゲット マッピング ルール。
- 各ドメイン概念に適切なターゲット語彙素を含むターゲット語彙集。
- 目標言語のターゲット文法であり、目標構文構造を線形化された出力文として実現する。[ 11 ]
利点
- バイリンガルテキストは必要ありません。これにより、共通のテキストがまったくない言語や、デジタル化されたデータがまったくない言語の翻訳システムを作成できます。
- ドメインに依存しません。ルールは通常、ドメインに依存しない方法で記述されるため、ほとんどのルールはすべてのドメインで「そのまま機能」し、ドメインごとにいくつかの特定のケースのみに、そのドメイン用に記述されたルールが必要になる場合があります。
- 品質の上限はありません。トリガーとなるケースが極めてまれであっても、すべてのエラーはターゲット ルールで修正できます。これは、まれなフォームがデフォルトで排除される統計システムとは対照的です。
- 完全な制御。すべてのルールは手動で記述されるため、ルールベースのシステムを簡単にデバッグして、特定のエラーがシステムのどこで発生したか、またその理由を正確に確認できます。
- 再利用性。RBMT システムは一般に、転送ステップとターゲット言語ジェネレーターに供給される強力なソース言語分析から構築されるため、ソース言語分析とターゲット言語生成の部分は複数の翻訳システム間で共有でき、転送ステップのみを特化する必要があります。さらに、1 つの言語のソース言語分析を再利用して、密接に関連する言語分析をブートストラップできます。
欠点
- 本当に優れた辞書が不足しています。新しい辞書を構築するのは費用がかかります。
- 一部の言語情報は手動で設定する必要があります。
- 大規模なシステムにおけるルールの相互作用、曖昧さ、慣用表現に対処するのは困難です。
- 新しい分野への適応の失敗。RBMTシステムは通常、新しいルールを作成し、語彙を拡張および適応させるメカニズムを提供しますが、変更には通常非常にコストがかかり、結果が報われないことが多々あります。[12]
参考文献
- ^ 王、海峰;呉、華。彼、ジョンジュン。黄、梁。教会、ケネス・ワード (2022-11-01)。 「機械翻訳の進歩」。エンジニアリング。ISSN 2095-8099。
- ^ 「MT Software」。AAMT。2005年2月4日時点のオリジナルよりアーカイブ。
- ^ 「MACHINE TRANSLATION IN JAPAN」www.wtec.org . 1992年1月。2018年2月12日時点のオリジナルよりアーカイブ。
- ^コーエン、フィリップ(2010年)。統計機械 翻訳。ケンブリッジ:ケンブリッジ大学出版局。p.15。ISBN 9780521874151。
- ^ Nirenburg, Sergei (1989). 「知識ベース機械翻訳」. Machine Trandation 4 (1989), 5 - 24 . 4 (1). Kluwer Academic Publishers: 5–24. JSTOR 40008396.
- ^ ab Vossen, Piek:オントロジー。Mitkov, Ruslan (ed.) (2003): 計算言語学ハンドブック、第25章。オックスフォード: Oxford University Press。
- ^ Vossen, Piek:オントロジー。Mitkov, Ruslan (編) (2003): 計算言語学ハンドブック、第 25 章。オックスフォード: Oxford University Press。
- ^ ナイト、ケビン (1993)。「機械翻訳のための大規模オントロジーの構築」。ヒューマン・ランゲージ・テクノロジー:1993 年 3 月 21 ~ 24 日にニュージャージー州プレインズボロで開催されたワークショップの議事録。ニュージャージー州プリンストン:計算言語学協会。pp. 185 ~ 190。doi : 10.3115 /1075671.1075713。ISBN 978-1-55860-324-0。
- ^ Knight, Kevin; Luk, Steve K. (1994).機械翻訳のための大規模知識ベースの構築。第12回人工知能全国会議で発表された論文。arXiv : cmp -lg/9407029。
- ^ Hettige, B.; Karunananda, AS (2011). 「英語からシンハラ語への機械翻訳のための文法の計算モデル」。2011新興地域における ICT の進歩に関する国際会議 (ICTer)。pp. 26–31。doi : 10.1109 / ICTer.2011.6075022。ISBN 978-1-4577-1114-5. S2CID 45871137。
- ^ Lonsdale, Deryle; Mitamura, Teruko; Nyberg, Eric (1995). 「実用的な知識ベース機械翻訳のための大規模辞書の獲得」.機械翻訳. 9 (3–4). Kluwer Academic Publishers: 251–283. doi :10.1007/BF00980580. S2CID 1106335.
- ^ ラガルダ、アラバマ州;アラバウ、V.カサクベルタ、F.シルバ、R.ディアス・デ・リアニョ、E. (2009)。 「ルールベースの機械翻訳システムの統計的ポストエディット」(PDF)。NAACL HLT 2009 の議事録: ショート ペーパー、217 ~ 220 ページ、コロラド州ボルダー。計算言語学協会。2012 年6 月 20 日に取得。
文学
- アーノルド、DJ 他 (1993): 機械翻訳入門ガイド
- ハッチンズ、WJ(1986):機械翻訳:過去、現在、未来
リンク
- フリー/オープンソースのルールベース機械翻訳に関する第1回国際ワークショップ
- https://web.archive.org/web/20120306014535/http://www.inf.ed.ac.uk/teaching/courses/mt/lectures/history.pdf
- https://web.archive.org/web/20150914205051/http://www.csse.unimelb.edu.au/research/lt/nlp06/materials/Bond/mt-intro.pdf
