意味テキスト理論(MTT)は、自然言語のモデル構築のためにモスクワでアレクサンドル・ジョルコフスキーとイゴール・メルチュクによって初めて提唱された理論的な言語学的枠組みである[ 1 ]。この理論は言語記述のための大規模かつ精緻な基盤を提供し、その形式的な性格から、機械翻訳、句構造学、辞書編纂などのコンピュータアプリケーションに特に適している。
意味・テキスト理論における言語モデルは、言語は発話の内容または意味(意味論)からその形式またはテキスト(音声学)へのマッピングから構成されるという原理に基づいている。これらの両極の中間には、統語論的レベルと形態論的レベルにおける追加的な表現レベルが存在する。

異なるレベルの表現は、意味表現(SemR)の無秩序なネットワークから、構文表現(SyntR)の依存関係ツリー構造を経て、形態表現(MorphR)の線形化された形態素の連鎖、そして最終的には、音声表現(PhonR)の時系列順に並んだ音素列(この理論の研究では一般的に扱われていない)へと、順次マッピングされる。異なるレベルの表現間の関係は、変換ではなく翻訳またはマッピングとみなされ、「コンポーネント」と呼ばれる一連の規則によって媒介される。これらの規則は、レベル間の適切な言語固有の遷移を保証する。
意味テキスト理論における意味表現 (SemR) は、主にウェブ状の意味構造 (SemS) から成り、他の意味レベルの構造 (特に意味伝達構造 [SemCommS]、[ 2 ]は、他のフレームワークで一般的に「情報構造」と呼ばれるものを表す) と組み合わされます。SemS 自体は、述語ノードから引数ノードへ矢印が伸びるノードとして表現される述語のネットワークで構成されています。引数は複数の述語で共有でき、述語自体が他の述語の引数になることもあります。ノードは一般的に語彙や文法の意味に対応しており、これらは語彙の項目または屈折手段によって直接表現されますが、この理論では意味の言い換え[ 3 ]のプロセスを通じて意味をより細かい表現に分解するオプションも認められており、これは言語間の同義語や翻訳の等価性を扱う上でも重要です。 SemR は、意味コンポーネントの規則によって次のレベルの表現、つまり深層構文表現にマッピングされます。この規則により、レベル間の 1 対多の関係が可能になります (つまり、1 つの SemR は、語彙の選択、 SemR の複雑さなどに応じて、さまざまな構文構造で表現される可能性があります)。SemR の構造記述と (半) 自動生成は研究対象です。[ 4 ]ここでは、分解は自然意味メタ言語の意味プライムを利用して、分解の終了基準を決定します。
意味テキスト理論における統語表現(SyntR)は、統語構造(SyntS)を構成する依存関係ツリーを使用して実装されます。SyntSには、統語的伝達構造と照応構造など、他のさまざまなタイプの構造が伴います。意味テキスト理論には、深層統語表現(DSyntR)と表層統語表現(SSyntR)の2つのレベルの統語があります。意味テキスト理論の統語とその記述的応用に関する優れた概説は、Mel'čuk(1988)にあります。[ 5 ]英語の表層統語の包括的なモデルは、Mel'čuk & Pertsov(1987)で提示されています。[ 6 ]
深層構文表現(DSyntR)はSemSに直接関連しており、構文構造の「普遍的」側面を捉えようとします。このレベルのツリーは、語彙素間(または語彙素と語彙機能などの限られた抽象的実体との間の)依存関係を表します。DSyntRにおける語彙素間の深層構文関係は、7つのランク付けされた行為者(項)関係、修飾関係、および等位関係を含む12の構文関係の普遍的なインベントリに限定されます。語彙的に支配される前置詞など、純粋に文法的な機能を持つ語彙素は、このレベルの表現には含まれません。SemRから派生し、形態論によって実装される屈折カテゴリの値は、それらが関係する関連する語彙ノードの添え字として表されます。DSyntRは、深層構文コンポーネントの規則によって次のレベルの表現にマッピングされます。
表層構文表現(SSyntR)は、発話の言語固有の構文構造を表し、文中のすべての語彙項目(純粋に文法的な機能を持つものも含む)に対応するノードを含みます。このレベルでの語彙項目間の構文関係は制限されず、完全に言語固有のものと考えられていますが、多くの関係は言語間で類似している(あるいは少なくとも同型である)と考えられています。SSyntRは、表層構文コンポーネントの規則によって、次のレベルの表現にマッピングされます。
意味テキスト理論における形態表現(MorphR)は、実際の発話における要素の順序を反映した固定線形順序で配置された形態素の文字列として実装されます。これは、線形先行が言語的に重要であるとみなされる最初の表現レベルであり、言語が統語構造を符号化できる3つの非語彙的手段の1つとして、語順を形態プロセスおよび韻律と効果的にグループ化します。統語表現と同様に、形態表現にも深層形態表現と表層形態表現の2つのレベルがあります。意味テキスト理論の形態表現の詳細な説明は、Mel'čuk(1993–2000)[ 7 ]およびMel'čuk(2006)[ 8 ]に記載されています。
深層形態表現 (DMorphR) は、語彙素と形態素の文字列で構成されます。例: THE SHOE + PL ON BILL + POSS FOOT + PL。深層形態要素のルールは、この文字列を表層形態表現 (SMorphR) にマッピングし、形態素を適切な形態素に変換し、非連結形態処理を実行する形態操作を実行します。上記の例では、/the shoe+s on Bill+s feet/ となります。表層形態要素のルール(その一部には形態音韻ルールが含まれます)は、SMorphR を音声表現 [ðə ʃuz on bɪlz fi:t] にマッピングします。
意味テキスト理論の重要な側面は語彙であり、これは言語の語彙単位(LU)の包括的なカタログであると考えられています。これらの単位は、言語使用者によって学習され、発話に用いられる語彙素、コロケーション、その他の句素、構文、その他の言語要素の構成です。意味テキスト理論における語彙は、説明的組み合わせ辞書(ECD)[ 9 ] [ 10 ]によって表され、言語のすべてのLUのエントリと、話者がその統語論(LU固有の規則と組み合わせの条件)に関して知っておく必要がある情報が含まれています。ロシア語のECDはMel'čukら(1984)[ 11 ]によって作成され、フランス語のECDはMel'čukら(1999)[ 12 ]およびMel'čuk & Polguère(2007)[ 13 ]によって出版されました。
意味テキスト言語学の重要な発見の 1 つは、言語内の LU が抽象的な意味の意味で互いに関連付けられ、この同じ関係が語彙的に無関係な多くの LU のペアまたはセットにも当てはまるという認識でした。これらの関係は、意味テキスト理論では語彙機能(LF) として表されます。[ 14 ]単純な LF の例は Magn(L) で、これは、大雨、強風、激しい爆撃などの強調に使用されるコロケーションを表します。英語話者は、RAIN のような特定の語彙L に対して Magn(RAIN) の値は HEAVY であり、Magn(WIND) の値は STRONG であることを知っています。意味テキスト理論は現在、言語間で繰り返し出現することが知られている数十の標準的な LF を認識しています。