コーパス言語学では、品詞タグ付け(POSタグ付け、PoSタグ付け、またはPOST)、または文法タグ付けと呼ばれるプロセスは、テキスト(コーパス)内の単語を、その定義と文脈の両方に基づいて、特定の品詞に対応するものとしてマークアップするプロセスです。 [ 1 ]この簡略化された形式は、名詞、動詞、形容詞、副詞などとして単語を識別する際に、学齢期の子供たちによく教えられています。
かつては手作業で行われていた品詞タグ付けは、現在では計算言語学の分野で行われており、離散的な用語や隠れた品詞を記述的なタグのセットと関連付けるアルゴリズムが用いられています。品詞タグ付けアルゴリズムは、ルールベースと確率的という2つの明確なグループに分類されます。最初期に開発され、最も広く利用されている英語の品詞タグ付けツールの1つであるE. Brillのtaggerは、ルールベースのアルゴリズムを採用しています。
品詞タグ付けは、単に単語とその品詞のリストを用意するよりも難しい。なぜなら、単語によっては異なる状況で複数の品詞を表す場合があり、また、品詞自体が複雑な場合もあるからだ。これは珍しいことではない。自然言語(多くの人工言語とは異なり)では、単語の形態の大部分が曖昧である。例えば、通常は単なる複数名詞と考えられている「dogs」でさえ、動詞にもなり得る。
適切な文法タグ付けでは、「dogs」がここでは動詞として使われており、より一般的な複数名詞として使われていないことが反映されます。文法的な文脈はこれを判断する一つの方法ですが、意味分析を用いて、「sailor」と「hatch」が「dogs」を1)航海用語として、そして2)対象物「hatch」に適用される動作として示唆していると推測することもできます(この文脈では、「dogs」は「(防水扉を)しっかりと固定する」という意味の航海用語です)。
学校では一般的に、英語には名詞、動詞、冠詞、形容詞、前置詞、代名詞、副詞、接続詞、間投詞の 9 つの品詞があると教えられています。しかし、明らかに、もっと多くのカテゴリーとサブカテゴリーが存在します。名詞については、複数形、所有格、単数形を区別することができます。多くの言語では、単語は「格」(主語、目的語などの役割)、文法上の性などによってもマークされます。一方、動詞は時制、相などによってマークされます。一部のタグ付けシステムでは、同じ語根の異なる活用形に異なる品詞が割り当てられ、結果として多数のタグが生成されます。たとえば、単数普通名詞には NN、複数普通名詞には NNS、単数固有名詞には NP が使用されます(ブラウンコーパスで使用されているPOS タグを参照)。他のタグ付けシステムでは、タグの数が少なく、細かい違いを無視するか、品詞とはやや独立した特徴としてモデル化しています。 [ 2 ]
コンピュータによる品詞タグ付けでは、英語の場合、50 から 150 の個別の品詞を区別するのが一般的です。コイネー ギリシャ語のタグ付けのための確率的手法に関する研究(DeRose 1990) では、1,000 を超える品詞が使用され、英語と同程度の数の単語が曖昧であることが分かりました。形態論的に豊かな言語の場合、形態統語論的記述子は、カテゴリ = 名詞、タイプ = 普通、性別 = 男性、数 = 単数、格 = 対格、生物 = 数詞を表すNcmsanのような非常に短い記憶術を使用して表現されるのが一般的です。
アメリカ英語の品詞タグ付けで最もよく使われている「タグセット」は、おそらくペン・ツリーバンク・プロジェクトで開発されたペン・タグセットでしょう。これは、以前のブラウン・コーパスやLOBコーパスのタグセットとほぼ同じですが、規模ははるかに小さいです。ヨーロッパでは、イーグルズ・ガイドラインのタグセットが広く使われており、複数の言語に対応したバージョンも存在します。
品詞タグ付けはさまざまな言語で行われており、使用される品詞タグのセットは言語によって大きく異なります。タグは通常、明示的な形態論的区別を含むように設計されていますが、これは英語で代名詞には格標示があるが名詞にはないといった矛盾や、言語間の大きな違いにつながります。ギリシャ語やラテン語のような屈折の多い言語のタグセットは非常に大きくなる可能性があり、イヌイット語のような膠着語の単語にタグ付けすることは事実上不可能かもしれません。もう一方の極端な例として、Petrov ら[ 3 ]は 12 のカテゴリ (たとえば、名詞、動詞、句読点などのサブタイプなし) を持つ「普遍的」タグセットを提案しています。非常に小さな非常に広範なタグのセットが好ましいか、はるかに大きなより正確なタグのセットが好ましいかは、その目的に応じて異なります。自動タグ付けは、タグセットが小さいほど容易になります。
品詞タグ付けの研究は、コーパス言語学と密接に結びついてきた。コンピュータ分析のための最初の主要な英語コーパスは、 1960年代半ばにブラウン大学のヘンリー・クチェラとW・ネルソン・フランシスによって開発されたブラウン・コーパスである。これは、無作為に選ばれた出版物から抽出された500のサンプルから構成される、約100万語の英語散文テキストで構成されている。各サンプルは2,000語以上(2,000語以降の最初の文末で終了するため、コーパスには完全な文のみが含まれる)である。
ブラウンコーパスは、長年にわたり、品詞マーカーを用いて丹念に「タグ付け」されてきた。最初の近似は、グリーンとルービンによるプログラムで行われた。このプログラムは、そもそも共起しうる品詞の膨大なリストを手作業で作成したものであった。例えば、冠詞の後に名詞が続くことはあり得るが、冠詞の後に動詞が続くことは(おそらく)あり得ない。このプログラムの正答率は約70%であった。その結果は繰り返し手作業で確認・修正され、後からユーザーから正誤表が送られてきたため、70年代後半にはタグ付けはほぼ完璧になった(ただし、人間の話者でさえ意見が一致しないようなケースもいくつか残されている)。
このコーパスは、単語頻度や品詞に関する無数の研究に利用され、他の多くの言語における同様の「タグ付け」コーパスの開発を促しました。このコーパスの分析から得られた統計データは、CLAWSやVOLSUNGAといった、後のほとんどの品詞タグ付けシステムの基礎となりました。しかし、現在(2005年)では、1億語のBritish National Corpusのようなより大規模なコーパスに取って代わられています。もっとも、より大規模なコーパスがこれほど徹底的にキュレーションされていることは稀です。
品詞タグ付けは、長らく自然言語処理の不可欠な要素と考えられてきた。なぜなら、文脈の意味論や語用論を理解せずに正しい品詞を判断できない場合があるからである。特に、各単語に対して複数の品詞の可能性を考慮する必要がある場合、高レベルの分析ははるかに困難になるため、これは非常にコストのかかる作業となる。
1980年代半ば、ヨーロッパの研究者たちは、イギリス英語のランカスター・オスロ・ベルゲン・コーパスの品詞タグ付け作業において、隠れマルコフモデル(HMM)を用いて品詞の曖昧性を解消し始めました。HMMは、(ブラウン・コーパスなどの)事例をカウントし、特定のシーケンスの確率を表にまとめる手法です。例えば、「the」のような冠詞を見た後、次の単語が名詞である確率は40%、形容詞である確率は40%、数字である確率は20%といった具合です。この情報に基づいて、プログラムは「the can」の「can」が動詞や助動詞よりも名詞である可能性がはるかに高いと判断できます。もちろん、同じ手法を、後続の単語に関する知識を活用するためにも使用できます。
より高度な(「高次」)HMMは、ペアだけでなく、トリプルやそれ以上の大きなシーケンスの確率も学習します。例えば、名詞の後に動詞が続いた場合、次の要素は前置詞、冠詞、または名詞である可能性が非常に高いですが、別の動詞である可能性ははるかに低くなります。
複数の曖昧な単語が同時に出現すると、可能性は増大します。しかし、すべての組み合わせを列挙し、それぞれの確率を掛け合わせることで、各組み合わせに相対的な確率を割り当てることは容易です。そして、最も確率の高い組み合わせが選択されます。ヨーロッパの研究グループは、まさにこの方法を採用したタグ付けプログラム「CLAWS」を開発し、93~95%の精度を達成しました。
ユージン・チャーニアックは、自然言語解析のための統計的手法(1997年)[ 4 ]の中で、既知の単語それぞれに最も一般的なタグを割り当て、未知の単語すべてに「固有名詞」というタグを割り当てるだけで、多くの単語は曖昧さがなく、他の多くの単語はまれにしかそのあまり一般的でない品詞を表さないため、90%の精度に近づくと指摘している。
CLAWSはHMMベースの品詞タグ付けの分野を開拓しましたが、すべての可能性を列挙するため非常に高価でした。選択肢が多すぎる場合(ブラウンコーパスには17個の曖昧な単語が連続するケースがあり、「still」のように7つの異なる品詞を表すことができる単語もあります。[ 5 ]
HMMは確率的タグ付け器の機能の基盤となっており、さまざまなアルゴリズムで使用されていますが、最も広く使用されているアルゴリズムの1つは双方向推論アルゴリズムです。[ 6 ]
1987年、Steven DeRose [ 7 ]と Kenneth W. Church [ 8 ]は、同じ問題をはるかに短い時間で解決するための動的計画法アルゴリズムをそれぞれ独自に開発しました。彼らの手法は、他の分野では以前から知られていたビタビアルゴリズムに似ていました。DeRose はペアのテーブルを使用し、Church はトリプルのテーブルと、ブラウン コーパスではまれまたは存在しないトリプルの値を推定する方法を使用しました (トリプルの確率の実際の測定には、はるかに大きなコーパスが必要になります)。どちらの方法も 95% を超える精度を達成しました。DeRose の 1990 年のブラウン大学の博士論文には、特定のエラーの種類、確率、およびその他の関連データの分析が含まれており、ギリシャ語で彼の研究を再現したところ、同様に効果的であることが証明されました。
これらの発見は、自然言語処理の分野に驚くほど大きな衝撃を与えました。報告された精度は、品詞選択を構文、形態論、意味論など、より高度な言語分析と統合した非常に高度なアルゴリズムの一般的な精度よりも高かったのです。CLAWS、DeRose、Churchの手法は、意味論が必要とされる既知のケースの一部では失敗しましたが、それらはごくまれであることが判明しました。この結果、品詞タグ付けは他の処理レベルから分離しても有効であるという確信が、この分野の多くの研究者に生まれました。これは、コンピュータによる言語分析の理論と実践を簡素化し、研究者たちが他の要素も分離する方法を見つけるよう促しました。マルコフモデルは、品詞割り当ての標準的な手法となりました。
既に述べた手法は、既存のコーパスを基にタグの確率を学習するものです。しかし、 「教師なし」タグ付けを用いてブートストラップを行うことも可能です。教師なしタグ付け手法は、タグ付けされていないコーパスを学習データとして使用し、帰納的にタグセットを生成します。つまり、単語の使用パターンを観察し、品詞カテゴリを自ら導き出すのです。例えば、統計分析によって、「the」、「a」、「an」は類似した文脈で出現する一方、「eat」は全く異なる文脈で出現することが容易に分かります。十分な反復処理を行うことで、人間の言語学者が予想するような類似した単語のクラスが出現し、その違い自体が貴重な新たな知見を示唆することもあります。
これら2つのカテゴリーは、さらにルールベース、確率的、ニューラルネットワークに基づくアプローチに細分化できる。
現在主流の品詞タグ付けアルゴリズムには、ビタビアルゴリズム、ブリルタガー、制約文法、バウム・ウェルチアルゴリズム(順方向・逆方向アルゴリズムとも呼ばれる)などがあります。隠れマルコフモデルと可視マルコフモデルのタガーはどちらもビタビアルゴリズムを用いて実装できます。ルールベースのブリルタガーは、統計量を最適化するのではなく、一連のルールパターンを学習し、それらのパターンを適用するという点で独特です。
品詞タグ付けの問題には、多くの機械学習手法が適用されてきました。SVM、最大エントロピー分類器、パーセプトロン、最近傍法などの手法が試され、そのほとんどが95 %以上の精度を達成しています。
ACL Wiki には、いくつかの方法の直接比較が(参考文献付きで)報告されています。[ 9 ]この比較では、ペンツリーバンクデータの一部にペンタグセットを使用しているため、結果は直接比較可能です。ただし、多くの重要なタガーは含まれていません(おそらく、この特定のデータセットに合わせて再構成するのにかかる労力のためでしょう)。したがって、ここで報告されている結果が、特定のアプローチで達成できる最良の結果であると想定すべきではありません。また、特定のアプローチで達成された最良の結果であると想定すべきでもありません。
2014年に、ある論文では、品詞タグ付けに構造正則化法を使用し、標準ベンチマークデータセットで97.36%を達成したと報告した。 [ 10 ]