スライディング ウィンドウ ベースの品詞タグ付けは、テキスト
に品詞タグを付けるために使用されます。
自然言語の単語の多くは、文脈から外れると複数の品詞が割り当てられることがあります。これらの曖昧な単語の割合は、言語によって大きく異なりますが、通常は約 30% です。この問題を解決することは、自然言語処理の多くの分野で非常に重要です。たとえば、機械翻訳では、単語の品詞を変更すると、翻訳が劇的に変化することがあります。
スライディング ウィンドウ ベースの品詞タグ付けツールは、曖昧さを解消する単語の周囲の固定サイズの単語の「ウィンドウ」を調べて、単語の特定の語彙形式に単一の品詞を割り当てるプログラムです。
このアプローチの主な利点は次の 2 つです。
させて

をアプリケーションの文法タグの集合、つまり単語に割り当てられる可能性のあるすべてのタグの集合とし、

アプリケーションの語彙とします。

を形態素解析関数とし、各タグの可能な集合 を割り当てる。これは完全形辞書または形態素解析器によって実装できる。



単語クラスの集合であり、一般にはの分割になりますが、各単語はすべて同じタグのセットを受け取るという制限があります。つまり、各単語クラスのすべての単語は同じ曖昧性クラスに属します。




通常、高頻度の単語の場合、各単語クラスには 1 つの単語が含まれ、低頻度の単語の場合、各単語クラスは 1 つの曖昧性クラスに対応するように構築されます。これにより、高頻度の曖昧な単語に対して優れたパフォーマンスが得られ、タグ付けに多くのパラメータが必要なくなります。

これらの定義により、問題を次のように表現することができます。テキストが与えられると、各単語に単語クラスが割り当てられます(辞書または形態素解析器のいずれかを使用) 。これにより、あいまいにタグ付けされたテキストが作成されます。タグ付け者の仕事は、タグ付けされたテキスト( を使用) をできるだけ正確にすることです。
![{\displaystyle w[1]w[2]\ldots w[L]\in W^{*}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/4889daab2d649197cfc1c8357438cb6e0d970b7a)
![{\displaystyle w[t]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/d09eb136404cf7316f4e86ee68e3d246ba3083cc)
![{\displaystyle T(w[t])\in \Sigma }](https://wikimedia.org/api/rest_v1/media/math/render/svg/cb3c2ebb189339443bacec4cb40c7e00722adb99)
![{\displaystyle \sigma [1]\sigma [2]\ldots \sigma [L]\in W^{*}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/02b8bd7bd072933b9a5f7fcf454c77cce0667187)
![{\displaystyle \gamma [1]\gamma [2]\ldots \gamma [L]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/6586d8ef1c04cca2bc75648aeef5a31030b30692)
![{\displaystyle \gamma [t]\in T(\sigma [t])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/ab6d2fe5c9ca5702090cd56baba571945aed1f7a)
統計タグ付け機能は、あいまいにタグ付けされたテキストに対して最も可能性の高いタグを探します。
![{\displaystyle \sigma [1]\sigma [2]\ldots \sigma [L]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/11f7c3f199709d1e1a600a6fc216c2af754c7a89)
![{\displaystyle \gamma ^{*}[1]\ldots \gamma ^{*}[L]=\operatorname {\arg \,max} _{\gamma [t]\in T(\sigma [t])}p(\gamma [1]\ldots \gamma [L]\sigma [1]\ldots \sigma [L])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/46666ee3da1b8ce73f092e34abe755d3ceb2d201)
ベイズの公式を使用すると、これは次のように変換されます。
![{\displaystyle \gamma ^{*}[1]\ldots \gamma ^{*}[L]=\operatorname {\arg \,max} _{\gamma [t]\in T(\sigma [t])}p(\gamma [1]\ldots \gamma [L])p(\sigma [1]\ldots \sigma [L]\gamma [1]\ldots \gamma [L])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/19f5424be19d26b9e52278e0a1e07027f9f8fb01)
ここで、は特定のタグの確率 (構文確率) であり、 はこのタグがテキストに対応する確率(語彙確率) です。
![{\displaystyle p(\ガンマ [1]\ガンマ [2]\ldots \ガンマ [L])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/56b60d6ece75d75172df04e6ae77c492b2da56e7)
![{\displaystyle p(\sigma [1]\dots \sigma [L]\gamma [1]\ldots \gamma [L])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/ddbbd8ca066e9838e327ebe1e3ce931c196c1876)
![{\displaystyle \sigma [1]\ldots \sigma [L]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/39a7aaa5b5072c50692ec501f2171d390dd78d54)
マルコフモデルでは、これらの確率は積として近似されます。構文確率は、1次マルコフ過程によってモデル化されます。
![{\displaystyle p(\gamma [1]\gamma [2]\ldots \gamma [L])=\prod _{t=1}^{t=L}p(\gamma [t+1]\gamma [t])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/9ac989d8f2efb79e1ebe85e052410df93a8e86e4)
ここで、およびは区切り記号です。
![{\displaystyle \gamma [0]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/076d559c6f75278a473a74fb1121b5f56e0589d1)
![{\displaystyle \gamma [L+1]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/c8956b457a2398b83868d4fab0ae14be148cdcd3)
語彙の確率は文脈に依存しません。
![{\displaystyle p(\sigma [1]\sigma [2]\ldots \sigma [L]\gamma [1]\gamma [2]\ldots \gamma [L])=\prod _{t=1}^{t=L}p(\sigma [t]\gamma [t])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/e0eada879f9299c5ef423a9d9e002ae7da5993f4)
タグ付けの 1 つの形式は、最初の確率式を近似することです。
![{\displaystyle p(\sigma [1]\sigma [2]\ldots \sigma [L]\gamma [1]\gamma [2]\ldots \gamma [L])=\prod _{t=1}^{t=L}p(\gamma [t]C_{(-)}[t]\sigma [t]C_{(+)}[t])}](https://wikimedia.org/api/rest_v1/media/math/render/svg/ded623b9066563945537d0a68b56b9e96675bea4)
サイズの正しいコンテキストはどこですか。
![{\displaystyle C_{(-)}[t]=\sigma [t-N_{(-)}]\sigma [t-N_{(-)}]\ldots \sigma [t-1]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/bb41175165be9f65ce9635c0b9ee5abd760f33a9)

この方法では、スライディング ウィンドウ アルゴリズムは、サイズのコンテキストのみを考慮する必要があります。ほとんどのアプリケーションでは、たとえば、「彼は危険から逃げる」という文中のあいまいな単語「走る」にタグを付けるには、「彼」と「から」という単語のタグのみを考慮する必要があります。


さらに読む
- Sanchez-Villamil, E.、Forcada, ML、Carrasco, RC (2005)。「有限状態スライディングウィンドウ品詞タグ付けツールの教師なしトレーニング」。Lecture Notes in Computer Science / Lecture Notes in Artificial Intelligence、vol. 3230、p. 454-463