計算語彙学は計算言語学の一分野であり、語彙の研究におけるコンピュータの使用に関係しています。一部の学者 (Amsler、1980) は、これを機械可読辞書の研究におけるコンピュータの使用と、より狭義に説明しています。計算語彙学は、辞書の構築におけるコンピュータの使用というより適切な計算語彙学とは区別されますが、一部の研究者は計算語彙学を同義語として使用しています。
歴史
計算語彙学は、1960年代にシステム開発会社のジョン・オルニーらがメリアム・ウェブスター第7版大学用辞書とメリアム・ウェブスター新ポケット辞書の機械可読テープを作成したのに始まり、機械可読辞書の登場とともに計算言語学内の独立した分野として出現しました。今日、計算語彙学は、 WordNetの作成と応用を通じて最もよく知られています。研究者の計算処理が時間の経過とともに増加するにつれて、計算語彙学の使用はテキスト分析のいたるところで適用されてきました。1987年には、バード、カルゾラリ、チョドローらがテキスト分析用の計算ツールを開発しました。特に、多義語の意味を含む関連を調整するために設計されたモデルです。[1]
語彙の研究
計算語彙学は、計算目的の印刷辞書の内容と限界の理解に貢献してきました (つまり、これまでの辞書学の研究が計算言語学のニーズを満たすのに十分ではなかったことを明らかにしました)。計算語彙学者の研究を通じて、印刷辞書の項目のほぼすべての部分が、次のような範囲で研究されてきました。
- 見出し語を構成するもの- スペル修正リストを生成するために使用されます。
- 見出し語がどのような変形や変化を形成するか - 形態論を経験的に理解するために使用される。
- 見出し語が音節にどのように区切られているか。
- 見出し語の発音方法 - 音声生成システムで使用されます。
- 見出し語がとる品詞 - POS タグ付けに使用されます。
- 見出し語に割り当てられた特別な主題コードまたは用法コード - テキスト文書の主題を識別するために使用されます。
- 見出し語の定義と構文 - 文脈における単語の曖昧さを解消する助けとして使用されます。
- 見出し語の語源と、その語源言語による語彙の特徴付けへの使用 - テキスト語彙をその語源言語に応じて特徴付けるために使用される。
- 例文;
- 連続語(見出し語から形成される追加の単語や複数語の表現)
- 同義語や反意語などの関連語。
多くの計算言語学者は、印刷された辞書が計算言語学のリソースとして不十分であることに幻滅していました。それは、印刷された辞書には、コンピュータ プログラムに十分な統語的および意味的情報が欠けていたからです。計算語彙学の研究は、すぐにさらに 2 つの方向への取り組みへとつながりました。
計算語彙学の後継者
まず、計算言語学者と辞書編集者の共同作業により、辞書作成におけるコーパスの役割が理解されるようになりました。計算語彙学者の多くは、辞書編集者が辞書作成に使用した基本データを収集するために、大規模なコーパスの構築に移行しました。ACL/DCI (データ収集イニシアチブ) と LDC (言語データコンソーシアム) はこの道を進みました。マークアップ言語の出現により、計算言語システムを作成するために分析しやすいタグ付きコーパスが作成されました。品詞タグ付きコーパスと意味タグ付きコーパスは、POS タグ付けツールと単語の意味的曖昧性解消技術をテストおよび開発するために作成されました。
2 つ目の方向は、語彙知識ベース (LKB) の作成に向けたものでした。語彙知識ベースは、計算言語学、特に計算語彙意味論の目的のための辞書のあるべき姿であると考えられていました。これは、印刷された辞書と同じ情報を持ちながら、単語の意味と意味間の適切なつながりについて完全に説明されるものでした。多くの人が、辞書が計算分析用に作成された場合の辞書に望むリソースを作成し始めました。WordNetはそのような開発と見なすことができます。また、Fillmore の FrameNet 作業など、構文情報と意味情報を記述する新しい取り組みもそうです。計算言語学以外では、人工知能のオントロジー作業は、AI アプリケーション用の語彙知識ベースを構築する進化的な取り組みと見なすことができます。
標準化
計算語彙集の作成、保守、拡張を最適化することは、NLP に影響を与える重要な側面の 1 つです。主な問題は相互運用性です。さまざまな語彙集は互換性がないことがよくあります。最もよくある状況は、2 つの語彙集、または語彙集の断片をどのように結合するかということです。2 つ目の問題は、語彙集が通常、特定の NLP プログラムに合わせて特別に調整されており、他の NLP プログラムまたはアプリケーション内で使用するのが難しいことです。
この点に関して、計算語彙のさまざまなデータ モデルは、 2003 年以来ISO/TC37によって語彙マークアップ フレームワークプロジェクト内で研究され、2008 年に ISO 標準につながりました。
参考文献
- ^ バード、ロイ J.、ニコレッタ カルツォラーリ、マーティン S. チョドロウ、ジュディス L. クラヴァンス、メアリー S. ネフ、オムネヤ A. リズク。 「計算語彙学のツールと方法」計算言語学13、いいえ。 3-4 (1987): 219-240。
アムスラー、ロバート A. 1980. 博士論文、「メリアム・ウェブスター ポケット辞書の構造」、テキサス大学オースティン校。
外部リンク
- ACL Wiki における計算語彙学の問題
- 1.ACLウィキ
- 2.計算言語学協会公式ページ
- 計算辞書学
- 語彙マークアップフレームワーク (LMF)
