Loading article…
ノイズのあるテキストとは、テキストのコード化された表現の表面形式と、意図された正しいテキスト、つまり元のテキストとの間に差異があるテキストのことである。[1]ノイズは、自然言語に常に存在する誤植や口語表現が原因である可能性があり、通常、データの品質を低下させ、テキストが自然言語処理を含むコンピューターによる自動処理にアクセスしにくくなる。ノイズは、元の電子テキスト以外のメディアからの抽出プロセス(転写やOCRなど)によっても発生する可能性がある。[2]
チャット、電子メール、SMSテキストなどのコンピューターを介した談話での言語使用は、言語の標準形式とは大きく異なります。より速い入力を可能にする短いメッセージ長への欲求と意味の明確さの必要性が、このような談話で使用されるテキストの構造を形成します。
さまざまなビジネスアナリストは、非構造化データが企業データ全体の約 80% を占めると推定しています。このデータの大部分は、チャットの記録、電子メール、その他の非公式および半公式の社内外のコミュニケーションで構成されています。通常、このようなテキストは人間が消費することを目的としていますが、データの量を考えると、これらのリソースを手動で処理および評価することはもはや現実的ではありません。これにより、堅牢なテキストマイニング手法が必要になります。[3]
ノイズ低減技術
スペル チェッカーや文法チェッカーを使用すると、入力したテキストのノイズを減らすことができます。多くのワード プロセッサの編集ツールにはこの機能が含まれています。オンラインでは、Google 検索に検索語句の候補エンジンが組み込まれており、ユーザーがクエリに間違いを犯したときにガイドしてくれます。
参照
参考文献
- ^ Knoblock, Craig; Lopresti, Daniel; Roy, Shourya; Subramaniam, L. Venkata (2007). 「ノイズの多いテキスト分析に関する特集号」.国際文書分析認識ジャーナル. 10 (3–4): 127–128. doi :10.1007/s10032-007-0058-9.
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ Vinciarelli, Alessandro (2005). 「ノイズの多いテキストの分類」(PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 27 (12): 1882–1895. doi :10.1109/TPAMI.2005.248. PMID 16355657.
- ^ Subramaniam, L. Venkata; Roy, Shourya; Faruquie, Tanveer A.; Negi, Sumit (2009 年 7 月 23 日)。テキスト ノイズの種類とノイズの多いテキストを処理するための手法の調査。第 3 回ノイズの多い非構造化テキスト データの分析に関するワークショップ (AND)。pp. 115–122。doi : 10.1145 /1568296.1568315。
{{cite conference}}: CS1 maint: 複数の名前: 著者リスト (リンク)
