ノイズの多いテキスト分析は、ノイズの多い非構造化テキスト データから構造化または半構造化情報を自動的に抽出することを目的とした情報抽出プロセスです。テキスト分析は、生成されるデータが膨大であることから大きな価値を持つ、成長中の成熟分野ですが、多くの一般的なアプリケーションがノイズの多いテキスト データを生成するため、ノイズの多いテキストの処理の重要性が高まっています。ノイズの多い非構造化テキスト データは、オンライン チャット、テキスト メッセージ、電子メール、メッセージ ボード、ニュース グループ、ブログ、ウィキ、Web ページなどの非公式な設定で見つかります。また、自動音声認識を使用して自発的なスピーチを処理して生成されたテキストや、光学式文字認識を使用して印刷または手書きのテキストを生成するテキストには、処理ノイズが含まれます。このような状況で生成されたテキストは通常、非常にノイズが多く、スペルの間違い、省略形、非標準の単語、出だしの誤り、繰り返し、句読点の欠落、大文字と小文字の情報の欠落、「um」や「uh」などの一時停止を埋める単語、その他のテキストやスピーチの不自然さが含まれます。このようなテキストは、コンタクト センター、チャット ルーム、テキスト ドキュメントの光学式文字認識(OCR)、ショート メッセージ サービス(SMS) テキストなどで大量に見られます。歴史的な言語を含むドキュメントも、その言語に関する今日の知識からするとノイズが多いと考えられます。このようなテキストには、歴史的、宗教的、古代の医学的知識が含まれており、有用です。これらすべてのコンテキストで生成されるノイズの多いテキストの性質上、従来のテキスト分析手法を超える必要があります。
ノイズの多いテキストの分析手法
句読点の欠落や非標準語の使用は、品詞タグ付け や解析などの標準的な自然言語処理ツールの妨げになることがよくあります。ノイズの多いデータから学習し、ノイズの多いデータを処理できるようにする技術は、現在開発されつつあります。
ノイズの可能性のあるテキストの原因
- ワールド ワイド ウェブ: 下手に書かれたテキストは、ウェブ ページ、オンライン チャット、ブログ、ウィキ、ディスカッション フォーラム、ニュース グループで見つかります。これらのデータのほとんどは構造化されておらず、文章のスタイルは、たとえば、上手に書かれたニュース記事とは大きく異なります。ウェブ データは、市場の話題分析、市場レビュー、トレンド予測などのソースであるため、分析は重要です。また、データ量が多いため、これらのデータの情報抽出、分類、自動要約、分析の効率的な方法を見つける必要があります。
- コンタクト センター: これは、コンピュータの販売やサポートから携帯電話、アパレルまで、さまざまな分野で機能するヘルプ デスク、情報ライン、およびカスタマー サービス センターの総称です。先進国の人は平均して、少なくとも週に 1 回はコンタクト センター エージェントとやり取りします。一般的なコンタクト センター エージェントは、1 日に 100 件を超える通話を処理します。音声、オンライン チャット、電子メールなど、さまざまなモードで動作します。コンタクト センター業界では、電子メール、チャット ログ、音声会話の書き起こし、顧客からのフィードバックなどの形でギガバイト単位のデータが生成されます。コンタクト センター データの大部分は音声会話です。最先端の自動音声認識を使用してこれらを書き起こすと、30~40% の単語エラー率のテキストが生成されます。さらに、顧客とエージェント間のオンライン チャットや電子メールでのやり取りなど、書面によるコミュニケーション モードでもノイズが多くなる傾向があります。コンタクト センター データの分析は、顧客関係管理、顧客満足度分析、通話モデリング、顧客プロファイリング、エージェント プロファイリングなどに不可欠であり、書き方の悪いテキストを処理するには高度な技術が必要です。
- 印刷された文書: 多くの図書館、政府機関、国防機関には、膨大な量のハードコピー文書が保管されています。このような文書からコンテンツを取得して処理するには、光学式文字認識を使用して処理する必要があります。印刷されたテキストに加えて、これらの文書には手書きの注釈も含まれている場合があります。OCR テキストは、フォント サイズ、印刷の品質などによっては非常にノイズが多くなる場合があります。単語エラー率は2~3% から50~60% に及ぶことがあります。手書きの注釈は特に解読が難しく、手書きの注釈があるとエラー率がかなり高くなることがあります。
- ショート メッセージ サービス(SMS): チャット、電子メール、SMS テキストなどのコンピューターを介した会話での言語の使用は、言語の標準形式とは大きく異なります。より速い入力を可能にする短いメッセージ長への欲求と意味の明確さの必要性が、テキスト メッセージの言語として知られるこの非標準形式の構造を形成しています。
参照
参考文献
- 「Wong, W.、Liu, W.、Bennamoun, M. ダーティテキストをクリーニングするための強化された統合スコアリング。ノイズの多い非構造化テキストデータの分析に関する IJCAI ワークショップ (AND)、2007 年、インド、ハイデラバード。」
- 「LV Subramaniam、S. Roy、TA Faruquie、S. Negi、テキスト ノイズの種類の調査とノイズの多いテキストを処理するテクニック。In: ノイズの多い非構造化テキスト データの分析に関する第 3 回ワークショップ (AND)、2009」。
