
バイテキストの単語アライメント、または単に単語アライメントとは、バイテキスト内の単語(まれに複数単語単位)間の翻訳関係を識別する自然言語処理タスクであり、バイテキストの両側の間に二部グラフが作成されます。このグラフでは、2つの単語が互いに翻訳されている場合にのみ、2つの単語間に弧が存在します。単語アライメントは通常、文アライメントによって既に互いに翻訳されている文のペアが識別された後に実行されます。
バイテキストの単語アライメントは、ほとんどの統計的機械翻訳手法にとって重要な補助タスクです。統計的機械翻訳モデルのパラメータは、通常、単語アライメントされたバイテキストを観察することによって推定されます[ 1 ]。逆に、自動単語アライメントは、通常、統計的機械翻訳モデルに最も適合するアライメントを選択することによって行われます。これら2つのアイデアを循環的に適用すると、期待値最大化アルゴリズムの例が得られます[ 2 ]。
このトレーニング方法は、教師なし学習の一例です。つまり、システムには望ましい出力の例は与えられず、観測されたバイテキストを最もよく説明する、観測されていないモデルとアライメントの値を見つけようとします。最近の研究では、手動でアライメントされた(通常は少数の)文をシステムに提示することに依存する教師ありメソッドの検討が始まっています。[ 3 ]教師あり学習によって提供される追加情報の利点に加えて、これらのモデルは通常、従来使用されてきた生成統計モデルに統合するのが難しい、コンテキスト、構文構造、品詞、翻訳語彙情報などのデータの多くの特徴を組み合わせることをより容易に活用できます。
機械翻訳システムのトレーニング以外にも、単語アライメントの応用例としては、翻訳語彙の誘導、単語の意味の発見、単語の意味の曖昧性解消、言語情報の異言語間投影などが挙げられる。
IBMモデル[ 4 ]は、統計的機械翻訳において翻訳モデルとアライメントモデルを学習するために使用されます。これらは期待値最大化アルゴリズムの一例です。期待値ステップでは各文内の翻訳確率が計算され、最大化ステップではそれらが累積されて全体的な翻訳確率になります。特徴:
Vogel ら[ 5 ] は、問題を隠れマルコフモデルにマッピングすることで、語彙翻訳確率と相対アライメントを特徴とするアプローチを開発しました。状態と観測はそれぞれソース語とターゲット語を表します。遷移確率はアライメント確率をモデル化します。トレーニングでは、翻訳確率とアライメント確率は以下から取得できます。そしてフォワードバックワードアルゴリズムにおいて。