Loading article…
トゥルーケーシング(大文字化回復[ 1 ] 、大文字化修正[ 2 ]、またはケース復元[ 3 ]とも呼ばれる)は、自然言語処理(NLP)において、大文字化の情報が利用できない場合に、単語の適切な大文字化を決定する問題です。これは、英語や他の多くの言語で、文の最初の単語を自動的に大文字にするという標準的な慣習が原因でよく発生します。また、大文字化が不適切なテキストや、大文字化されていないテキスト(たとえば、すべて小文字またはすべて大文字のテキストメッセージ)でも発生する可能性があります。
正書法における大文字小文字の区別(トゥルーケーシング)は、大文字小文字の区別がある言語にのみ必要です。これには、ラテン文字、ギリシャ文字、キリル文字、アルメニア文字で表記されるほとんどの言語が含まれます。
トゥルーキャッシングは、固有表現認識(NER)、自動コンテンツ抽出(ACE)、機械翻訳などの他のNLPタスクに役立ちます。[ 4 ] 適切な大文字化により、NERとACEの出発点となる固有名詞の検出が容易になります。一部の翻訳システムは 統計的機械学習技術を使用しており、大文字化に含まれる情報を利用して精度を高めることができます。