
転送ベースの機械翻訳は機械翻訳(MT)の一種です。現在、最も広く使用されている機械翻訳方法の 1 つです。より単純な直接モデルである MT とは対照的に、転送 MT では翻訳を 3 つのステップに分けます。ソース言語のテキストを分析して文法構造を判定し、その結果得られた構造をターゲット言語のテキスト生成に適した構造に転送し、最後にこのテキストを生成します。転送ベースの MT システムは、このようにソース言語とターゲット言語の知識を使用することができます。[1]
デザイン
転送ベースとインターリングア ベースの機械翻訳はどちらも同じ考え方に基づいています。つまり、翻訳を行うには、正しい翻訳を生成するために元の文の「意味」を捉えた中間表現が必要です。インターリングア ベースの MT では、この中間表現は対象の言語から独立している必要がありますが、転送ベースの MT では、関係する言語ペアに多少依存します。
転送ベースの機械翻訳システムの動作方法は大きく異なりますが、一般的には同じパターンに従います。つまり、ソース言語の構造とターゲット言語の構造の対応として定義された言語ルールのセットを適用します。最初の段階では、入力テキストの形態論と構文(場合によっては意味論)を分析して、内部表現を作成します。翻訳は、バイリンガル辞書と文法規則の両方を使用して、この表現から生成されます。
この翻訳戦略を使用すると、90% [曖昧]程度の精度で、かなり高品質の翻訳を得ることができます(ただし、これは問題の言語ペア、たとえば 2 つの言語間の距離に大きく依存します)。
手術
ルールベースの機械翻訳システムでは、まず元のテキストが形態論的および統語的に分析され、統語的表現が得られます。その後、この表現は、翻訳に関連する部分に重点を置き、他の種類の情報を無視することで、より抽象的なレベルに洗練されます。次に、転送プロセスによって、この最終的な表現 (元の言語のまま) が、ターゲット言語の同じ抽象レベルの表現に変換されます。これらの 2 つの表現は、「中間」表現と呼ばれます。ターゲット言語の表現から、各段階が逆に適用されます。
分析と変換
最終結果を得る前に、さまざまな分析および変換方法を使用できます。これらの統計的アプローチを拡張して、ハイブリッド システムを生成することもできます。選択される方法と重点は、システムの設計に大きく依存しますが、ほとんどのシステムには少なくとも次の段階が含まれます。
- 形態素解析。入力テキストの表層形は、品詞(名詞、動詞など)とサブカテゴリ(数、性別、時制など)に分類されます。各表層形の可能な「解析」はすべて、通常、この段階で単語の見出し語とともに出力されます。
- 語彙の分類。任意のテキストでは、一部の単語が複数の意味を持つ場合があり、分析で曖昧さが生じます。語彙の分類では、単語の文脈を調べて、入力の文脈における正しい意味を判断します。これには、品詞のタグ付けや語義の曖昧さ解消が含まれる場合があります。
- 語彙の転送。これは基本的に辞書翻訳です。ソース言語のレマ(おそらく意味情報を含む)がバイリンガル辞書で検索され、翻訳が選択されます。
- 構造的転移。前の段階では単語を扱っていましたが、この段階ではフレーズやチャンクなどのより大きな構成要素を扱います。この段階の典型的な特徴には、性別と数の一致、単語やフレーズの並べ替えなどがあります。
- 形態素生成。構造転送段階の出力から、ターゲット言語の表層形式が生成されます。
転送タイプ
転送ベースの機械翻訳システムの主な特徴の 1 つは、元の言語のテキストの中間表現をターゲット言語のテキストの中間表現に「転送」するフェーズです。これは、言語分析の 2 つのレベルのいずれか、またはその間のどこかで機能します。レベルは次のとおりです。
- 表面的な転送(または統語的転送)。このレベルは、ソース言語とターゲット言語の間で「統語的構造」を転送することを特徴とする。これは、同じファミリーまたは同じタイプの言語、たとえばロマンス語族のスペイン語、カタロニア語、フランス語、イタリア語などの転送に適しています。
- ディープ トランスファー (またはセマンティック)。このレベルでは、ソース言語に依存するセマンティック表現が構築されます。この表現は、意味を表す一連の構造で構成できます。これらのトランスファー システムでは、述語が通常生成されます。翻訳では、通常、構造のトランスファーも必要になります。このレベルは、関連の遠い言語 (スペイン語 - 英語、スペイン語 - バスク語など) 間の翻訳に使用されます。
参考文献
- ^ Jurafsky, Daniel ; Martin, James H. (2009).音声言語処理. ピアソン. pp. 906–908.
