IBMのアライメントモデルは、 統計的機械翻訳 で使用される、翻訳モデルとアライメントモデルをトレーニングするための、段階的に複雑化する一連のモデルであり、語彙翻訳確率から始まり、並べ替えや単語の重複へと進みます。[ 1 ] [ 2 ] これらのモデルは、1990年代初頭からニューラル機械翻訳が 主流になるまでの約20年間、統計的機械翻訳システムの大部分を支えてきました。これらのモデルは、原理に基づいた確率的定式化と(ほとんどの場合)扱いやすい推論を提供します。[ 3 ]
IBMのアライメントモデルは1988年[ 4 ] と1990年[ 5 ] に一部ずつ発表され、シリーズ全体は1993年に発表された[ 1 ]。 1993年の論文の著者は全員、その後ヘッジファンドのルネッサンス・テクノロジーズに移籍した [ 6 ] 。
IBM における統計的機械翻訳に関する初期の研究では5つのモデルが提案され、その後モデル6が提案された。6つのモデルの順序は以下のように要約できる。
モデル1:語彙翻訳 モデル2:追加の絶対位置合わせモデル モデル3:追加出生率モデル モデル4:相対アライメントモデルを追加 モデル5:欠陥修正問題。 モデル6:モデル4とHMM アライメントモデルを対数線形的に組み合わせたもの
モデル1
単語の配置 任意の外国語-英語の文ペアが与えられた場合( e 、 f ) {\displaystyle (e,f)} 文ペアのアライメントは、タイプの関数です。{ 1 、 。 、 。 。 。 、 l e } → { 0 、 1 、 。 、 。 。 。 、 l f } {\displaystyle \{1,.,...,l_{e}\}\to \{0,1,.,...,l_{f}\}} つまり、英語の単語が私 {\displaystyle i} 場所にある外来語によって「説明」される1 ( 私 ) {\displaystyle a(i)} 例えば、次の2つの文を考えてみましょう。
明日はきっと雨が降ります -- 明日はきっと雨だ
英語の単語の中には対応する日本語の単語と対応付けられるものもあるが、全てではない。
それ→ ?
意志 -> ?
きっと -> きっと
雨→雨
明日→明日
これは一般的に、異なる言語における文法や慣習の違いによって起こります。英語の文には主語が必要であり、主語がない場合は形式代名詞 「it」 が使われます。日本語の動詞には未来形と現在形がなく、未来形は名詞「明日」によって暗示されます。逆に、話題マーカー 「は」と文法語「だ」(おおよそ「~である」)は、英語の文中のどの単語にも対応しません。したがって、アライメントは次のように記述できます。
1→0; 2→0; 3→3; 4→4; 5→1
ここで、0は対応するアライメントがないことを意味します。
したがって、アライメント関数は一般に次のタイプの関数であることがわかります。{ 1 、 。 、 。 。 。 、 l e } → { 0 、 1 、 。 、 。 。 。 、 l f } {\displaystyle \{1,.,...,l_{e}\}\to \{0,1,.,...,l_{f}\}} 。
将来のモデルでは、1つの英語の単語を複数の外国語に対応させることができるようになるでしょう。
統計モデル 上記のアライメントの定義に基づき、モデル1で使用される統計モデルを定義できます。
「辞書」から始めましょう。その項目は次の形式です。t ( e 私 | f j ) {\displaystyle t(e_{i}|f_{j})} これは「外国語」と解釈できる。f j {\displaystyle f_{j}} 英語の単語に翻訳されますe 私 {\displaystyle e_{i}} 確率でt ( e 私 | f j ) {\displaystyle t(e_{i}|f_{j})} 「。 外国の刑を言い渡された後f {\displaystyle f} 長さl f {\displaystyle l_{f}} まず、英語の文の長さを生成します。l e {\displaystyle l_{e}} 一定の範囲内で均一にU n 私 f o r m [ 1 、 2 、 。 。 。 、 N ] {\displaystyle Uniform[1,2,...,N]} 特に、それはf {\displaystyle f} またはl f {\displaystyle l_{f}} 。 次に、すべての可能なアライメント関数の集合内で均一なアライメントを生成します。{ 1 、 。 、 。 。 。 、 l e } → { 0 、 1 、 。 、 。 。 。 、 l f } {\displaystyle \{1,.,...,l_{e}\}\to \{0,1,.,...,l_{f}\}} 。 最後に、各英単語についてe 1 、 e 2 、 。 。 。 e l e {\displaystyle e_{1},e_{2},...e_{l_{e}}} それぞれを他のすべての英単語とは独立して生成します。e 私 {\displaystyle e_{i}} に従って生成しますt ( e 私 | f 1 ( 私 ) ) {\displaystyle t(e_{i}|f_{a(i)})} 。 一緒に、私たちはp ( e 、 1 | f ) = 1 / N ( 1 + l f ) l e ∏ 私 = 1 l e t ( e 私 | f 1 ( 私 ) ) {\displaystyle p(e,a|f)={\frac {1/N}{(1+l_{f})^{l_{e}}}}\prod _{i=1}^{l_{e}}t(e_{i}|f_{a(i)})} IBMモデル1は、以下のアルゴリズムが閉形式の解を持つことを可能にするために、統計モデルに関して非常に単純な仮定を使用しています。
モデル2 モデル2では、文の長さに応じてアライメントを条件付けることができます。つまり、確率分布があります。p 1 ( j | 私 、 l e 、 l f ) {\displaystyle p_{a}(j|i,l_{e},l_{f})} 「英語の単語が私 {\displaystyle i} 外国語に整列していますj {\displaystyle j} 英語の文の長さがl e {\displaystyle l_{e}} 外国語の文の長さはl f {\displaystyle l_{f}} 「。
モデル1の残りの部分は変更されていません。それでは、p ( e 、 1 | f ) = 1 / N ∏ 私 = 1 l e t ( e 私 | f 1 ( 私 ) ) p 1 ( 1 ( 私 ) | 私 、 l e 、 l f ) {\displaystyle p(e,a|f)={1/N}\prod _{i=1}^{l_{e}}t(e_{i}|f_{a(i)})p_{a}(a(i)|i,l_{e},l_{f})} EMアルゴリズムは依然として閉形式で解くことができ、以下のアルゴリズムが得られる。t ( e x | f y ) ← 1 λ y ∑ k 、 私 、 j t ( e 私 ( k ) | f j ( k ) ) p 1 ( j | 私 、 l e 、 l f ) δ ( e x 、 e 私 ( k ) ) δ ( f y 、 f j ( k ) ) ∑ j ′ t ( e 私 ( k ) | f j ′ ( k ) ) p 1 ( j ′ | 私 、 l e 、 l f ) {\displaystyle t(e_{x}|f_{y})\leftarrow {\frac {1}{\lambda _{y}}}\sum _{k,i,j}{\frac {t(e_{i}^{(k)}|f_{j}^{(k)})p_{a}(j|i,l_{e},l_{f})\delta (e_{x},e_{i}^{(k)})\delta (f_{y},f_{j}^{(k)})}{\sum _{j'}t(e_{i}^{(k)}|f_{j'}^{(k)})p_{a}(j'|i,l_{e},l_{f})}}} p 1 ( j | 私 、 l e 、 l f ) ← 1 λ 私 、 l e 、 l f ∑ k t ( e 私 ( k ) | f j ( k ) ) p 1 ( j | 私 、 l e 、 l f ) δ ( e x 、 e 私 ( k ) ) δ ( f y 、 f j ( k ) ) δ ( l e 、 l e ( k ) ) δ ( l f 、 l f ( k ) ) ∑ j ′ t ( e 私 ( k ) | f j ′ ( k ) ) p 1 ( j ′ | 私 、 l e 、 l f ) {\displaystyle p_{a}(j|i,l_{e},l_{f})\leftarrow {\frac {1}{\lambda _{i,l_{e},l_{f}}}}\sum _{k}{\frac {t(e_{i}^{(k)}|f_{j}^{(k)})p_{a}(j|i,l_{e},l_{f})\delta (e_{x},e_{i}^{(k)})\delta (f_{y},f_{j}^{(k)})\delta (l_{e},l_{e}^{(k)})\delta (l_{f},l_{f}^{(k)})}{\sum _{j'}t(e_{i}^{(k)}|f_{j'}^{(k)})p_{a}(j'|i,l_{e},l_{f})}}} どこλ {\displaystyle \lambda } これらは依然として正規化係数です。導出とアルゴリズムについては、[ 7 ]のセクション4.4.1を参照してください。
モデル4 IBM Model 4 では、各単語は、直前に整列された単語と周囲の単語の品詞に依存します。翻訳中に他の単語よりも頻繁に並べ替えられる単語もあります (例: ポーランド語から英語への翻訳における形容詞と名詞の倒置)。形容詞は、その前に来る名詞の前に移動することがよくあります。Model 4 で導入された品詞クラスは、これらのクラスの確率分布を条件付けることでこの問題を解決します。このような分布の結果が、語彙化されたモデルです。このような分布は次のように定義できます。
ceptの最初の単語について:d 1 ( j − ⊙ [ 私 − 1 ] ∨ A ( f [ 私 − 1 ] ) 、 B ( e j ) ) {\displaystyle d_{1}(j-\odot _{[i-1]}\lor A(f_{[i-1]}),B(e_{j}))}
その他の言葉については、以下をご覧ください。d 1 ( j − π 私 、 k − 1 ∨ B ( e j ) ) {\displaystyle d_{1}(j-\pi _{i,k-1}\lor B(e_{j}))}
どこA ( f ) {\displaystyle A(f)} そしてB ( e ) {\displaystyle B(e)} 関数は単語をその単語クラスにマッピングし、e j {\displaystyle e_{j}} そしてf [ 私 − 1 ] {\displaystyle f_{[i-1]}} これらは単語の歪み確率分布です。この概念は、各入力単語を整列させることによって形成されます。f 私 {\displaystyle f_{i}} 少なくとも1つの出力ワードに。[ 11 ]
モデル3とモデル4はどちらも、入力位置が選択されたかどうか、および確率質量が文境界外の入力位置に確保されたかどうかを無視しています。これが、これら2つのモデル(欠陥モデル)ですべての正しいアライメントの確率の合計が1にならない理由です。[ 11 ]
モデル5 IBM Model 5 は、モデルの欠点を克服するために、より多くのトレーニング パラメータでアライメント モデルを強化することにより、IBM Model 4 を再定式化しています。[ 12 ] Model 3 および Model 4 の翻訳では、既に占有されている位置に出力単語を配置することを禁止するヒューリスティックはありません。Model 5 では、単語を空いている位置にのみ配置することが重要です。これは、空いている位置の数を追跡し、そのような位置にのみ配置を許可することによって行われます。歪みモデルは IBM Model 4 と似ていますが、空いている位置に基づいています。v j {\displaystyle v_{j}} は出力の空き位置の数を表し、IBM モデル 5 の歪み確率は次のように定義されます。[ 1 ]
ceptの最初の単語について: d 1 ( v j ∨ B ( e j ) 、 v ⊙ 私 − 1 、 v m 1 x ) {\displaystyle d_{1}(v_{j}\lor B(e_{j}),v_{\odot i-1},v_{max})}
その他の言葉については、以下をご覧ください。 d 1 ( v j − v π 私 、 k − 1 ∨ B ( e j ) 、 v m 1 x ′ ) {\displaystyle d_{1}(v_{j}-v_{\pi _{i,k-1}}\lor B(e_{j}),v_{max'})}
HMMやIBMモデル4および5のような一次依存関係を使用するアライメントモデルは、他のアライメント方法よりも優れた結果を生み出します。HMMの主なアイデアは、連続するソース言語の位置間の距離を予測することです。一方、IBMモデル4は、連続するターゲット言語の位置間の距離を予測しようとします。このような両方のタイプの依存関係を使用すると、より良いアライメント品質が得られると予想されたため、HMMとモデル4は、モデル6で次のように対数線形的に組み合わされました。[ 13 ]
p 6 ( f 、 1 ∨ e ) = p 4 ( f 、 1 ∨ e ) α * p H M M ( f 、 1 ∨ e ) ∑ 1 ′ 、 f ′ p 4 ( f ′ 、 1 ′ ∨ e ) α * p H M M ( f ′ 、 1 ′ ∨ e ) {\displaystyle p_{6}(f,a\lor e)={\frac {p_{4}(f,a\lor e)^{\alpha }*p_{HMM}(f,a\lor e)}{\sum _{a',f'}p_{4}(f',a'\lor e)^{\alpha }*p_{HMM}(f',a'\lor e)}}} ここで、補間パラメータはα {\displaystyle \alpha } は、隠れマルコフモデル に対するモデル4の重みを計算するために使用されます。複数のモデルの対数線形結合は次のように定義できます。p k ( f 、 1 ∣ e ) {\displaystyle p_{k}(f,a\mid e)} とk = 1 、 2 、 … 、 K {\displaystyle k=1,2,\dotsc ,K} として:
p 6 ( f 、 1 ∨ e ) = ∏ k = 1 K p k ( f 、 1 ∨ e ) α k ∑ 1 ′ 、 f ′ ∏ k = 1 K p k ( f ′ 、 1 ′ ∣ e ) α k {\displaystyle p_{6}(f,a\lor e)={\frac {\prod _{k=1}^{K}p_{k}(f,a\lor e)^{\alpha _{k}}}{\sum _{a',f'}\prod _{k=1}^{K}p_{k}(f',a'\mid e)^{\alpha _{k}}}}} 対数線形結合は、線形結合の代わりに使用されます。P r ( f 、 1 ∣ e ) {\displaystyle P_{r}(f,a\mid e)} HMMとIBMモデル4では、値は通常、桁違いに異なります。[ 14 ]
参考文献 1 2 3 Brown, Peter F. ; Pietra, Vincent J. Della; Pietra, Stephen A. Della; Mercer, Robert L. (1993-06-01). "統計的機械翻訳の数学: パラメータ推定" . Comput. Linguist . 19 (2): 263– 311. ISSN 0891-2017 . ↑ 「IBMモデル」 。SMTリサーチサーベイWiki。2015年9月11日。 2015年 10月26日 取得 。 ↑ Yarin Gal; Phil Blunsom (2013年6月12日)。 「IBMアライメントモデルの体系的なベイズ的処理」 (PDF) 。ケンブリッジ大学。 2016年3月4日に オリジナル (PDF)からアーカイブ済み。 2015年 10月26日 取得 。 ↑ Brown, P.; Cocke, J.; Della Pietra, S.; Della Pietra, V.; Jelinek, F.; Mercer, R.; Roossin, P. (1988). "A Statistical Approach to Language Translation" . Coling Budapest 1988 Volume 1: International Conference on Computational Linguistics . ↑ Brown, Peter F.; Cocke, John; Della Pietra, Stephen A.; Della Pietra, Vincent J.; Jelinek, Fredrick; Lafferty, John D.; Mercer, Robert L.; Roossin, Paul S. (1990). "機械翻訳への統計的アプローチ" . Computational Linguistics . 16 (2): 79– 85. ↑ walutowyjohn (2013-01-28). "先見の明のある贈り物:デラ・ピエトラ家が生物医学画像講座を寄付 - SBUニュース" . ストーニーブルック大学ニュース . 2025-01-06 に 閲覧. 1 2 3 4 Koehn, Philipp (2010). "4. 単語ベースモデル". 統計的機械翻訳 . Cambridge University Press. ISBN 978-0-521-87415-1 。↑ "CS288、2020年春学期、講義05:統計的機械翻訳" (PDF) 。 2020年10月24日にオリジナルから アーカイブされました (PDF) 。 ↑ Wołk K., Marasek K. (2014). IWSLT 2014 のためのポーランド語-英語音声統計機械翻訳システム。第 11 回国際音声言語翻訳 ワーク ショップ議事録、米国タホ湖。arXiv : 1509.08874 。 ↑ FERNÁNDEZ, Pablo Malvar. Improving Word-to-word Alignments Using Morphological Information. 2008. PhD Thesis. San Diego State University. 1 2 Schoenemann, Thomas (2010). IBM-3 翻訳モデルの最適なアライメントの計算 . 第 14 回計算自然言語学習会議議事録. 計算言語学会. pp. 98–106 . ↑ KNIGHT, Kevin. 統計的MTチュートリアルワークブック。1999年JHUサマーワークショップ向けに作成された原稿、1999年。 ↑ ヴリッチ I. (2010)。 「用語の調整。最先端の概要」 (PDF) 。ルーヴェン カトリック大学 。 2015 年 10 月 26 日 に取得 。 ↑ Wołk, K. (2015). "Noisy-Parallel and Comparable Corpora Filtering Methodology for the Extraction of Bi-Lingual Equivalent Data at Sentence Level". Computer Science . 16 (2): 169– 184. arXiv : 1510.04500 . Bibcode : 2015arXiv151004500W . doi : 10.7494/csci.2015.16.2.169 . S2CID 12860633 .
さらに読む Knight, Kevin (1997-12-15). "機械翻訳のための知識獲得の自動化" . AI Magazine . 18 (4): 81. doi : 10.1609/aimag.v18i4.1323 . ISSN 2371-9621 . Knight, Kevin. 「統計的MTチュートリアルワークブック」。1999年JHUサマーワークショップ用に作成 。1999年。