テキスト正規化とは、テキストを、それまで持っていなかった可能性のある単一の標準形式に変換するプロセスです。テキストを保存または処理する前に正規化することで、入力に対して操作を実行する前に一貫性が保証されるため、関心の分離が可能になります。テキスト正規化には、正規化するテキストの種類と、その後どのように処理するかを把握しておく必要があります。万能な正規化手順は存在しません。[ 1 ]
テキスト正規化は、テキストを音声に変換する際によく使用されます。数字、日付、頭字語、略語は、文脈に応じて異なる発音をする必要がある非標準的な「単語」です。[ 2 ]例えば、
テキストは、データベースに保存したり検索したりするために正規化することもできます。たとえば、「resume」という検索語が「résumé」に一致するようにするには、テキストから発音記号を削除して正規化します。また、「john」が「John」に一致するようにするには、テキストを単一の大文字小文字に変換します。検索用にテキストを準備するために、語幹抽出(たとえば、「flew」と「flying」の両方を「fly」に変換する)、正規化(たとえば、アメリカ英語またはイギリス英語の綴りを一貫して使用する)、またはストップワードの削除を行うこともできます。
非英数字や発音記号の削除など、単純な文脈に依存しない正規化には、正規表現で十分です。たとえば、sedスクリプトは、連続する空白文字を単一のスペースに正規化します。より複雑な正規化には、正規化対象の言語と語彙に関するドメイン知識を含む、それに応じて複雑なアルゴリズムが必要です。他のアプローチの中でも、テキスト正規化は、テキスト ストリームのトークン化とタグ付けの問題[ 5 ]および機械翻訳の特殊なケースとしてモデル化されています。[ 6 ] [ 7 ]sed ‑e "s/\s+/ /g" inputfile
文献学や歴史文献の編集の分野では、「標準化」という用語は、ある程度の近代化と標準化を意味します。例えば、写本や初期の印刷物によく見られる筆記体の略語の拡張や古風な文字の翻字などがこれに該当します。したがって、標準化版は、これらの特徴をある程度保持しようとする外交版(または準外交版)とは区別されます。目的は、一方では原文への厳密な忠実性(例えば、謎めいた曖昧な要素の保持を含む)と、他方では現代の読者にとって理解しやすくアクセスしやすい新しいテキストを作成することとの間で、適切なバランスを取ることです。したがって、標準化の程度は編集者の裁量に委ねられており、様々です。例えば、古風な綴りや句読点を現代化することを選択する編集者もいれば、そうしない編集者もいます。[ 8 ]
テキストの版は、原文の言語に従って正書法を標準化する内部基準、または異なる時代の規範を適用する外部基準に基づいて標準化されることがある。[ 9 ]後者の例としては、中世アイスランド語写本の出版版は、現代アイスランド語の慣習に合わせて標準化される場合もあれば、古典古アイスランド語に合わせて標準化される場合もある。[ 9 ]標準化の基準は、版の言語だけでなく、出版社の特定の慣習によっても異なる。