言語学におけるレンマ化(またはあまり一般的ではないがレンマ化)とは、単語の活用形をグループ化して、単語のレンマ、つまり辞書形によって識別される単一の項目として分析できるようにするプロセスである。[ 1 ]
計算言語学において、レンマ化とは、単語の意図された意味に基づいて単語のレンマを決定するアルゴリズム的プロセスです。ステミングとは異なり、レンマ化は、文中の単語の意図された品詞と意味、およびその文を取り巻くより広い文脈(隣接する文や文書全体など)の中での単語の意図された品詞と意味を正しく識別することに依存します。そのため、効率的なレンマ化アルゴリズムの開発は、未解決の研究分野となっています。[ 2 ] [ 3 ] [ 4 ]
多くの言語では、単語は複数の活用形で現れます。例えば、英語では動詞「to walk」は「walk」「walked」「walks」「walking」など様々な形で現れます。辞書で調べる際に参照する基本形「walk」は、その単語の語幹(レマ)と呼ばれます。基本形と品詞との関連は、しばしばその単語の語彙素(レクセム)と呼ばれます。
語幹抽出は語幹抽出と密接に関連しています。違いは、語幹抽出は文脈を知らずに単語一つ一つを処理するため、品詞によって意味が異なる単語を区別できない点です。しかし、語幹抽出は一般的に実装が容易で、実行速度も速いです。精度の低下は、一部のアプリケーションでは問題にならない場合があります。実際、情報検索システム内で使用される場合、語幹抽出は語幹抽出と比較してクエリ再現精度、つまり真陽性率を向上させます。ただし、そのようなシステムでは、語幹抽出によって精度、つまり実際に陽性である陽性ラベル付けされたインスタンスの割合が低下します。[ 5 ]
例えば:
Lucene [ 6 ]のような文書索引ソフトウェアは、意味を知らなくても単語の基本語幹形式を保存できますが、単語形成の文法規則のみを考慮します。語幹化された単語自体は有効な単語ではない可能性があります。以下の例にあるように、「lazy」は多くの語幹化ツールによって「lazi」に語幹化されます。これは、語幹化の目的が適切な語幹を生成することではないためです。語幹化 は、文脈の知識を必要とするより困難なタスクです。語幹化の主な目的は、単語の異なる形式を単一の形式にマッピングすることです。[ 7 ]ルールベースのアルゴリズムとして、単語のスペルのみに依存するため、たとえば「laziness」が「lazi」に語幹化される場合、「lazy」と同じ語幹を持つことを保証するために精度を犠牲にします。
語形変化の簡単な方法は、辞書検索を用いることです。これは単純な活用形には有効ですが、長い複合語を持つ言語など、他のケースではルールベースのシステムが必要になります。このようなルールは、手作業で作成することも、注釈付きコーパスから自動的に学習させることもできます。
公開された生物医学文献の形態分析は有用な結果をもたらす可能性がある。生物医学テキストの形態処理は、生物医学専用の語幹抽出プログラムによってより効果的に行うことができ、実用的な情報抽出タスクの精度を向上させる可能性がある。[ 8 ]