多語表現(MWE)は、フレーズとも呼ばれ、 2つ以上の語彙素の連続から構成される語彙素に似た単位であり、個々の語彙素の特性やそれらの通常の組み合わせ方からは予測できない特性を持つ。MWEは語彙素とは異なり、多くの情報源では、個々の構成要素の意味から導き出せない意味を持つことが求められる。MWEは構成要素の同じ特性から導き出せない特性を持たなければならないが、その特性は必ずしも意味である必要はない。
より簡潔に定義すると、MWEは「単語の境界(またはスペース)を越える独特な解釈」と表現できる。[ 1 ]
複合語表現は、複合語、文の断片、または文である可能性があります。複合語表現を構成する語彙素のグループは、連続している場合も不連続な場合もあります。複合語表現に品詞を付与することは必ずしも可能ではありません。
MWEは多かれ少なかれ固定されている可能性がある。
英語の例文1:to kick the bucket(死ぬ)は、バケツを足で叩くという意味ではなく、死ぬという意味です。この例では、これは内向的な複合語であり、品詞は動詞と判断できます。MWE(最小表現)は固定されており、変化は不可能です。
英語の例文その2:to throw <somebody> to the lions。<somebody>というパターンによって使用が制限されます。この表現は、ある程度のバリエーションは可能ですが、すべてが可能なわけではないため、半ば固定されています。例えば、to the three lions と言うことはできません。前の例文と同様に、品詞は動詞です。
フランス語の例文3:la moutarde <me,te,lui,nous,vous,leur> monte au nez。このMWEは他の例文よりも固定されています。動詞の時制変化は許容されますが、文であるため、表現全体の品詞を特定することはできません。
Sagら(2002)によると、多語表現は曖昧性解消とは別に、自然言語処理(NLP)、特に機械翻訳(MT)における2つの主要な問題の1つである。
話者の語彙に含まれる多語表現(MWE)の数は、単語の数と同程度の規模であると推定される。専門分野の語彙は圧倒的に多語表現で構成されているため、システムが新しい分野の語彙を追加するにつれて、多語表現の割合は増加する。なぜなら、各分野では、単純な単語よりも多くの多語表現が追加されるからである。
多語表現を翻訳する際の最大の問題は、慣用表現の問題かもしれません。なぜなら、多くの多語表現は、程度の差こそあれ、慣用的な意味合いを持っているからです。
例えば、「kick the bucket」のような表現が、英語の動詞句の文法に合致しているように見えても、 「kick」「the」「bucket」の意味とは全く関係のない意味を持つことを、システムで予測するのは困難です。慣用句は、多くの場合、翻訳先の言語に同等の表現が存在しないため、直訳することはできません。構文的および意味的な(非)等価性に注意を払う必要があります。
また、原文言語のMWE(最小限の言葉)すべてが、翻訳先言語にもMWEとして存在するとは限りません。例えば、ドイツ語のMWEであるins Auge fassenは、英語のenvisageという単語でしか翻訳できません。
多語表現(MWE)の翻訳という課題に対する最も有望なアプローチは、例文ベースの機械翻訳である。なぜなら、この場合、各MWEを、対象言語における対応する翻訳文とともに例として列挙することができるからである。
ルールベースの機械翻訳では、多語表現の種類が非常に多いため、多語表現を翻訳するためのルールを定義することは困難です。
しかしながら、例文ベースの機械翻訳システムでは、連続的な多語表現と不連続的な多語表現の翻訳に異なるルールを適用する必要がある。なぜなら、1つの多語表現の異なる構成要素の間に単語が挿入されている文では、不連続な多語表現を識別するのが難しいからである。
{{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク)