テキスト分割とは、書かれたテキストを単語、文、トピックなどの意味のある単位に分割するプロセスです。この用語は、人間がテキストを読む際に用いる精神的プロセスと、コンピュータに実装される人工的なプロセス(自然言語処理の対象となる)の両方に適用されます。この問題は単純ではありません。なぜなら、英語の単語間のスペースやアラビア語の独特な最初、中間、最後の文字の形状など、明確な単語境界マーカーを持つ書き言葉もありますが、そのような信号は曖昧な場合もあり、すべての書き言葉に存在するわけではないからです。
音声分割、つまり音声を言語的に意味のある部分に分割するプロセスと比較してください。
単語分割とは、書かれた言語の文字列を構成要素である単語に分割する問題のことである。
英語やラテン文字を使用する他の多くの言語では、スペースは単語区切り(単語区切り記号)の良い近似値となるが、言語が連語や複合語を内在的にどのように捉えるかという点でばらつきがあるため、この概念には限界がある。英語の複合名詞の多くは、話者がそれらを名詞句と考えるか単数名詞と考えるかに応じて、さまざまな形で表記される(例:ice box = ice-box = icebox、pig sty = pig-sty = pigsty ) 。規範がどのように設定されるかには傾向があり、例えば、開いた複合語は広く普及した慣習によって最終的に固定される傾向があるが、ばらつきは体系的に残る。対照的に、ドイツ語の複合名詞は綴りのばらつきが少なく、固定化がより強い規範となっている。
しかし、単語スペースに相当する文字はすべての文字体系に存在するわけではなく、それがなければ単語の分割は困難な問題となる。単語の分割が容易に行えない言語には、文は区切られるが単語は区切られない中国語や日本語、句や文は区切られるが単語は区切られないタイ語やラオス語、音節は区切られるが単語は区切られないベトナム語などがある。
しかし、アムハラ語やティグリニャ語などで使用されているゲエズ文字のような一部の表記体系では、単語は(少なくとも歴史的には)空白文字以外の文字で明示的に区切られています。
Unicodeコンソーシアムは、テキスト分割に関する標準付属書[ 1 ]を公開し、マルチスクリプトテキストにおける分割の問題を探求しています。
単語分割とは、連結されたテキスト(つまり、スペースやその他の単語区切り文字を含まないテキスト)を解析し 、単語の区切り位置を推測するプロセスです。
単語分割は、ハイフネーションのプロセスを指す場合もある。
一部の学者は、現代中国語は英語のように単語間にスペースを入れて単語分割して書くべきだと提唱している。[ 2 ]なぜなら、意図した意味が著者にしか分からない曖昧な文章が存在するからである。例えば、「美国会不同意。」は「美国会不同意。」(米国は同意しない) または「美国会不同意。」(米国議会は同意しない) を意味する可能性がある。詳細については、中国語の単語分割表記を参照のこと。
意図セグメンテーションとは、書かれた単語をキーワード(2つ以上の単語のグループ)に分割する問題です。
英語を含むすべての言語において、中心となる意図や欲求が特定され、それがキーフレーズの意図セグメンテーションの礎となります。中心となる製品/サービス、アイデア、行動、または思考がキーフレーズの基盤となります。
「万物は原子でできている。小さな粒子が絶えず動き回り、少し離れているときは互いに引き合い、押し合わされると反発し合う。」
文分割とは、文章を構成要素である文に分割する問題です。英語やその他の言語では、句読点、特にピリオド(終止符)を用いることが妥当な近似方法となります。しかし、英語においても、ピリオドは略語にも用いられるため、この問題は容易ではありません。略語は文の終わりを示す場合もあれば、そうでない場合もあります。例えば、 「 Mr . Smith went to the shops in Jones Street」では、「Mr.」は独立した文ではありません。プレーンテキストを処理する際には、ピリオドを含む略語の表を用いることで、文の境界を誤って割り当ててしまうことを防ぐことができます。
単語の区切りと同様に、すべての書き言葉に、文の境界を近似するのに役立つ句読点文字が含まれているわけではない。
トピック分析は、トピック識別とテキスト分割という2つの主要なタスクから構成されます。前者は特定のテキストを単純に分類する作業ですが、後者は文書に複数のトピックが含まれる可能性があり、コンピュータによるテキスト分割のタスクは、これらのトピックを自動的に検出し、それに応じてテキストを分割することです。トピックの境界は、セクションのタイトルや段落から明らかになる場合があります。それ以外の場合は、文書分類で使用されるものと同様の手法を用いる必要があります。
テキストをトピックや談話ターンごとに分割することは、自然言語処理タスクにおいて有用です。例えば、情報検索や音声認識の精度を大幅に向上させることができます(文書のインデックス作成や認識精度を高めたり、クエリに対応する文書の特定部分を結果として提供したりすることで)。また、トピック検出・追跡システムやテキスト要約問題においても必要となります。
さまざまなアプローチが試みられてきました: [ 3 ] [ 4 ]例えば、HMM、語彙連鎖、単語の共起を使用したパッセージ類似性、クラスタリング、トピックモデリングなど。
これは非常に曖昧な作業であり、テキスト分割システムを評価する人々によってトピックの境界に関する見解が異なる場合が多い。したがって、テキスト分割の評価もまた、困難な課題である。
上記以外にも、形態素(通常、形態素解析と呼ばれる作業)や段落など、テキストをセグメントに分割するためのプロセスが必要になる場合があります。
自動セグメンテーションとは、自然言語処理における課題の一つで、テキストを分割するためのコンピュータ処理を実装することである。
句読点などの手がかりが常に利用できるとは限らない場合、セグメンテーション作業には、統計的意思決定、大規模な辞書、構文的および意味的制約の考慮など、かなり高度な技術が必要となることが多い。効果的な自然言語処理システムやテキストセグメンテーションツールは、通常、特定の分野や情報源のテキストを処理する。例えば、医療記録で使用されるテキストの処理は、ニュース記事や不動産広告の処理とは全く異なる問題である。
テキスト分割ツールの開発プロセスは、アプリケーションドメインにおける大規模なテキストコーパスの収集から始まります。一般的なアプローチは2つあります。
一部のテキスト分割システムは、HTMLなどのマークアップを活用し、PDFなどのドキュメント形式を認識することで、文や段落の境界を示す追加的な証拠を提供します。