Leskアルゴリズムは、 1986 年にMichael E. Leskによって導入された、単語の意味の曖昧性解消のための古典的なアルゴリズムです。[ 1 ]このアルゴリズムは、特定の文脈内の単語は共通の意味を共有する可能性が高いという前提に基づいて動作します。このアルゴリズムは、曖昧な単語の辞書定義をその周囲の文脈内の単語と比較し、最も適切な意味を決定します。簡略化された Lesk アルゴリズムなどのバリエーションは、精度と効率が向上していることが実証されています。しかし、Lesk アルゴリズムは、定義の表現に敏感であることと、短い注釈に依存していることで批判を受けています。研究者たちは、類語辞典や構文モデルなどの追加リソースを組み込むことで、その精度を高めようとしてきました。
Leskアルゴリズムは、特定の「近傍」(テキストのセクション)内の単語は共通のトピックを共有する傾向があるという仮定に基づいています。Leskアルゴリズムの簡略版は、曖昧な単語の辞書定義をその近傍に含まれる用語と比較することです。WordNetを使用するように改良されたバージョンもあります。 [ 2 ]実装は次のようになります。
このアルゴリズムを説明するためによく用いられる例として、「松ぼっくり」という文脈が挙げられます。以下の辞書定義が使用されます。
パイン 1. 針状の葉を持つ常緑樹の種類 2. 悲しみや病気で衰弱する
円錐 1. 先細りの固体 2. 中実か中空かを問わず、このような形状のもの 3. 特定の常緑樹の果実
ご覧のとおり、最適な交点はパイン #1 ⋂ コーン #3 = 2 です。
簡略化されたレスクアルゴリズム[ 3 ]では、与えられた文脈における各単語の正しい意味は、辞書定義と与えられた文脈との間で最も重なる意味を見つけることによって個別に決定されます。このアプローチでは、与えられた文脈におけるすべての単語の意味を同時に決定するのではなく、同じ文脈に現れる他の単語の意味とは独立して、各単語を個別に扱います。
Vasilescu ら (2004) [ 4 ]が行った比較評価では、簡略化された Lesk アルゴリズムは、精度と効率の両面で、元のアルゴリズムの定義を大幅に上回ることができることが示されています。Senseval-2 英語の全単語データで曖昧性解消アルゴリズムを評価したところ、簡略化された Lesk アルゴリズムでは 58% の精度が得られたのに対し、元のアルゴリズムではわずか 42% でした。
注: Vasilescu らの実装では、アルゴリズムでカバーされていない単語に対して、WordNet で定義されている最も頻出の意味からなるバックオフ戦略を考慮しています。これは、考えられるすべての意味が現在のコンテキストや他の単語の定義と重複しない単語には、デフォルトで WordNet の意味番号 1 が割り当てられることを意味します。[ 5 ]
スマートなデフォルト単語センスを備えた簡略化されたLESKアルゴリズム(Vasilescu et al., 2004)[ 6 ]
COMPUTEOVERLAP関数は、機能語やストップリスト上のその他の単語を無視して、2つのセット間で共通する単語の数を返します。オリジナルのLeskアルゴリズムは、より複雑な方法でコンテキストを定義します。
残念ながら、レスクの手法は定義の正確な表現に非常に敏感であるため、特定の単語が欠落すると結果が大きく変わってしまう可能性があります。さらに、このアルゴリズムは、検討対象となる意味の注釈間の重複のみを判断します。辞書の注釈は概して短く、細かな意味の違いを関連付けるのに十分な語彙を提供していないため、これは重大な制約となります。
このアルゴリズムのさまざまな改良版を提供する研究が数多く発表されている。これらの研究では、分析に他のリソース(類語辞典、同義語辞典、形態論的および統語論的モデルなど)を使用している。例えば、同義語、さまざまな派生語、定義から派生した単語などの情報を使用する可能性がある。[ 7 ]
Leskとその拡張に関する研究は数多くあります。[ 9 ]