語彙選択は、自然言語生成のサブタスクであり、生成されるテキストの内容語(名詞、非助動詞、形容詞、副詞)を選択する作業です。機能語(例えば限定詞)は通常、実現段階で選択されます。
最も単純な語彙選択の方法は、ドメイン概念(おそらくオントロジーで表現されている)を単語にマッピングすることです。例えば、「指」という概念を「指」という単語にマッピングすることができます。
より複雑な状況としては、ドメイン概念が異なる状況で異なる言葉で表現される場合が挙げられます。例えば、「価値の変化」というドメイン概念は、さまざまな方法で表現できます。
言葉によっては、例えば次のような追加の文脈情報を伝えることができる。
文脈情報は、 「背が高い」のような曖昧な用語にとって特に重要です。例えば、身長2メートルの男性は「背が高い」と言えますが、身長2メートルの馬は「小さい」と言えます。
語彙選択モジュールは、システムの入力データがどのように単語に対応するかという言語学的知識に基づいて設計されなければならない。これは意味論の問題であるが、構文的要因(共起効果など)や語用論的要因(文脈など)にも影響される。
したがって、NLGシステムには、NLGシステムのターゲットドメイン(ジャンル)において、意味が単語にどのようにマッピングされるかを示す言語モデルが必要です。ジャンルは非常に重要になる傾向があります。例えば、動詞veerは天気予報において非常に特殊な意味(風向きが時計回りに変化する)を持ちますが、一般的な英語ではそのような意味を持ちません。天気予報生成器は、このジャンル特有の意味を認識していなければなりません。
場合によっては、同じ単語でも人によって使い方が大きく異なることがあります。[ 1 ]例えば、「by evening」を午後6時という意味で使う人もいれば、真夜中という意味で使う人もいます。心理言語学者は、人々が互いに話すとき、語彙の一致によって共通の解釈に合意することを示しています。[ 2 ]これは、NLGシステムがまだできないことです。
最終的に、語彙の選択は、言語が非言語的世界とどのように関係するかという根本的な問題に対処しなければなりません。[ 3 ] 例えば、デジタル画像内のオブジェクトを説明するために「赤」などの色用語を選択するシステムは、どのRGBピクセル値が一般的に赤と表現できるか、これが視覚的(照明、シーン内の他のオブジェクト)および言語的(議論されている他のオブジェクト)コンテキストによってどのように影響を受けるか、赤に関連付けられている実用的な意味合い(例えば、リンゴが「赤」と呼ばれる場合、熟しているだけでなく、赤色であると想定される)などを知る必要があります。
研究コミュニティでは、語彙選択のためのアルゴリズムやモデルが数多く開発されてきました。[ 4 ]例えば、エドモンズは、類似語(中核的な意味は似ているが、ニュアンスが異なる単語)を選択するためのモデルを開発しました。[ 5 ] しかし、このようなアルゴリズムやモデルは、応用NLGシステムでは広く使用されていません。そのようなシステムでは、多くの場合、非常に単純な計算モデルが使用され、アルゴリズム開発ではなく言語分析に開発努力が注がれてきました。