ノイズ チャネル モデルは、スペルチェッカー、質問応答、音声認識、機械翻訳で使用されるフレームワークです。このモデルの目的は、何らかの方法で文字が並べ替えられた単語から、意図した単語を見つけることです。
スペルチェックでは
[1]の第B章を参照。
アルファベット が与えられたとき、を 上のすべての有限文字列の集合とします。有効な単語の辞書を のサブセット、つまり と します。
ノイズの多いチャネルはマトリックスである
- 、
ここで、は意図された単語であり、は実際に受信されたスクランブルされた単語です。
ノイズの多いチャネル モデルの目的は、受信したスクランブルされた単語から目的の単語を見つけることです。決定関数は 、スクランブルされた単語が与えられた場合に目的の単語を返す関数です。
決定関数を構築する方法には、最大尤度規則、最大事後確率規則、最小距離規則などがあります。
場合によっては、辞書で目的の単語を探すよりも、単語が乱れたままの単語を目的の単語として受け入れる方がよいことがあります。たとえば、schönfinkeling という単語は辞書に載っていないかもしれませんが、実際には目的の単語である可能性があります。
例
英語のアルファベットを考えてみましょう 。一部のサブセットが 有効な英語の単語の辞書を構成します。
入力中に発生する可能性のある間違いには次のようなものがあります:
- 文字が抜けている(例:letterの代わりにletter )
- 誤って文字を追加した場合(例:mistakeの代わりにmistake)
- 文字の入れ替え(例:receivedの代わりにreceived )
- 文字の置き換え(例:finiteの代わりにfimite)
ノイズの多いチャネル行列 を構築するには、意図した単語 (とすべてについて) が与えられた場合の各間違いの確率を考慮する必要があります。これらの確率は、たとえばとの間のDamerau–Levenshtein 距離を考慮するか、エッセイの下書きを手動でスペルを編集したものと比較することによって収集できます。
機械翻訳では
当然ながら、翻訳の問題が暗号の問題として扱われる可能性があるのではないかと疑問に思う人もいるでしょう。ロシア語の記事を見ると、私はこう言います。「これは実際には英語で書かれていますが、奇妙な記号でコード化されています。では、解読を進めましょう。」
— ウォーレン・ウィーバー、ノーバート・ウィーナーへの手紙、1947年3月4日
第1章および第25章を参照。[2]
外国語を英語に翻訳したいとします。外国語の文 F がある場合に英語の文 E がある確率を直接モデル化し、その中から最も可能性の高いものを選択します。ただし、ベイズの法則により、同等の式が得られます。ノイズチャネルモデルの利点は、データの観点から次のとおりです。並列コーパスの収集にコストがかかる場合、小さな並列コーパスしか得られないため、適度に優れた英語から外国語への翻訳モデルと、適度に優れた外国語から英語への翻訳モデルしかトレーニングできません。ただし、外国語のみの大規模なコーパスと英語のみの大規模なコーパスを収集して、2つの優れた言語モデルをトレーニングすることができます。これら4つのモデルを組み合わせると、優れた英語から外国語への翻訳者と優れた外国語から英語への翻訳者がすぐに得られます。[3]
ノイズの多いチャネル モデルのコストは、ベイズ推定を使用すると、翻訳モデルを直接使用するよりもコストがかかることです。 によって最も可能性の高い翻訳を読み出す代わりに、翻訳モデルと言語モデルの両方による予測を読み取り、それらを乗算して、最大数を検索する必要があります。
音声認識では
音声認識は、音声言語からテキスト言語への翻訳と考えることができます。したがって、話者がテキスト T を言おうとしている場合に音声 S が生成される確率は、次の式になります。直感的に、この式は、最も可能性の高いテキストは、その言語でテキストとしてあり得るテキストであり、高い確率で音声を生成するテキストであることを示しています。
ノイズ チャネル モデルの有用性は容量にはありません。理論的には、任意のノイズ チャネル モデルを直接モデルで再現できます。ただし、ノイズ チャネル モデルは、状況に応じてモデルを 2 つの部分に分割するため、一般的に動作が適切になります。
人間が話すとき、音を直接生成するのではなく、まず脳の言語中枢で話したいテキストを生成し、次に運動皮質、声帯、および体の他の部分によってテキストが音に変換されます。ノイズ チャネル モデルは人間のこのモデルと一致しているため、適切です。これは、ノイズ チャネル モデルが音声認識で実際に成功していることからも明らかです。
例
音声言語文(英語のIPAで書かれている)S = aɪ wʊd laɪk wʌn tuːを考えてみましょう。3つのテキストが考えられます。
- 欲しいです。
- 私も欲しいです。
- 1つ2つお願いします。
これらは、 という意味で、同程度の確率で起こります。優れた英語の言語モデルであれば、 となります。2番目の文は文法的に正しいので、1 番目の文は完全に文法的ではありませんが、それに近いものです (「I would like one to [go].」など)。一方、3 番目の文は文法的にはほど遠いものです。
その結果、ノイズの多いチャネル モデルが最良の転写を出力します。
参照
参考文献
- ^ 音声言語処理。ダニエル・ジュラフスキー & ジェームズ・H・マーティン。著作権 © 2023。無断転載を禁じます。2023 年 1 月 7 日の草稿。https://web.stanford.edu/~jurafsky/slp3/B.pdf
- ^ Jurafsky, Dan (2009). 音声言語処理: 自然言語処理、計算言語学、音声認識入門。James H. Martin (第 2 版)。アッパー サドル リバー、ニュージャージーISBN 978-0-13-187321-6. OCLC 213375806.
{{cite book}}: CS1 メンテナンス: 場所が見つかりません 発行者 (リンク) - ^ Brown, Peter F.; Della Pietra, Stephen A.; Della Pietra, Vincent J.; Mercer, Robert L. (1993). Hirschberg, Julia (編). 「統計的機械翻訳の数学: パラメータ推定」.計算言語学. 19 (2): 263–311.
- Brill, Eric; Moore, Robert C. (2000 年 1 月)。「ノイズの多いチャネルのスペル訂正のための改良されたエラー モデル」。ACL 2000 の議事録: 286–293。doi : 10.3115 /1075218.1075255。
