Loading article…
文境界曖昧性解消( SBD ) は、文の区切り、文境界検出、文分割とも呼ばれ、自然言語処理において文の開始と終了を決定する問題です。自然言語処理ツールは、入力を文に分割する必要がある場合が多いですが、句読点の曖昧さの可能性から、文境界の識別は困難になる場合があります。英語の文章では、ピリオドは文の終わりを示す場合もあれば、略語、小数点、省略記号、電子メールアドレスなどを示す場合もあります。ウォール・ストリート・ジャーナルのコーパスでは、ピリオドの約 47% が略語を示しています。[ 1 ]疑問符や感嘆符も、絵文字、ソースコード、スラングでの使用により、同様に曖昧になる可能性があります。
日本語や中国語など、文末を示す明確な標識を持つ言語もある。
文末を見つけるための標準的な「バニラ」アプローチ:
この戦略では、約 95% の文が正解となります。[ 2 ]短縮された名前、例えば「DH Lawrence」(フルネームを構成する個々の単語の間に空白がある)、スタイル上の目的で使用される独特な綴り(多くの場合、単一の概念を指し、例えば「 .hack//SIGN」のようなエンターテイメント製品のタイトル)、テキスト内での非標準的な句読点の使用(または非標準的な句読点の使用)などは、残りの 5% に含まれることがよくあります。
別のアプローチとしては、文の区切りがあらかじめマークされた一連の文書からルールセットを自動的に学習する方法があります。解決策は最大エントロピーモデルに基づいています。[ 3 ] SATZ [ 4 ]アーキテクチャはニューラルネットワークを使用して文の境界を曖昧さなくし、98.5%の精度を達成しています。
((?<=[a-z0-9][.?!])|(?<=[a-z0-9][.?!]\"))(\s|\r\n)(?=\"?[A-Z])$sentences=preg_split("/(?<!\..)([\?\!\.]+)\s(?!.\.)/",$text,-1,PREG_SPLIT_DELIM_CAPTURE);( PHPの場合)