SemEval (意味 評価)は、 計算機による意味解析 システムの評価シリーズであり、 Sensevalという 単語意味 評価シリーズから発展したものです。この評価は、言語における意味の本質を探ることを目的としています。人間 にとって意味は直感的に理解できるものですが、その直感を計算機による解析に適用することは困難であることが分かっています。
この一連の評価は、意味を計算するために何が必要かをより正確に特徴づけるメカニズムを提供する。このように、これらの評価は、意味を伴う計算における問題点と解決策を特定するための新たなメカニズムを提供する。これらの演習は、言語の使用に関わるより多くの側面を明確にするために発展してきた。当初は、単語の意味を 計算的に特定するという一見単純な試みから始まった。そして、文中の要素間の相互関係(例:意味役割のラベル付け )、文間の関係(例:共参照 )、そして私たちが言っていることの本質(意味関係 と感情分析 )を調査するように発展してきた。
SemEvalとSenseval演習の目的は、意味解析システムを評価することです。「意味解析 」とは意味の形式的な分析を指し、「計算論的」とは原則として効果的な実装をサポートするアプローチを指します。[ 1 ]
最初の 3 つの評価、Senseval-1 から Senseval-3 は、単語の意味曖昧性解消 (WSD) に焦点を当てており、タスクで提供される言語の数と参加チームの数は毎回増加しました。4 番目のワークショップ SemEval-2007 (SemEval-1) から、タスクの性質は単語の意味曖昧性解消以外の意味分析タスクを含むように進化しました。 [ 2 ]
*SEMカンファレンス の構想をきっかけに、SemEvalコミュニティは、*SEMカンファレンスと連携して毎年評価ワークショップを開催することを決定しました。また、すべての評価タスクを毎年実施するわけではないことも決定しました。例えば、SemEval-2012ワークショップにはWSDタスクは含まれていませんでした。
歴史
単語の意味曖昧性解消アルゴリズムの早期評価 初期の頃から、単語の意味曖昧性解消アルゴリズムの品質評価は主に内在的評価 の問題であり、「組み込みの WSD コンポーネントを評価する試みはほとんど行われてこなかった」。[ 3 ] ごく最近(2006 年) になって初めて、外在的評価によってエンド ユーザー アプリケーションにおける WSD の価値を示す証拠がいくつか提供され始めた。[ 4 ] 1990 年頃までは、意味曖昧性解消タスクに関する議論は、包括的な評価よりも主に例示に焦点を当てていた。1990 年代初頭には、より体系的で厳密な内在的評価が始まった。これには、曖昧な単語の小さなセットに対するより正式な実験も含まれる。[ 5 ]
SensevalからSemEvalへ 1997 年 4 月、マーサ・パーマーとマーク・ライトは、応用自然言語処理会議と併せて、「語彙意味論によるタグ付け: なぜ、何を、どのように?」と題するワークショップを開催しました。 [ 6 ] 当時、手動で注釈付けされたコーパスが 品詞タグ付け や構文解析 などの他の NLP 分野に革命をもたらし、コーパス駆動型アプローチが自動意味解析にも革命をもたらす可能性があることが明確に認識されていました。[ 7 ] キルガリフは、「この分野には評価が必要だという高いレベルの合意があった」と回想しており、レスニックとヤロウスキーによるいくつかの実践的な提案が、Senseval の評価演習の作成につながる議論のきっかけとなりました。[ 8 ] [ 9 ] [ 10 ]
SemEvalの3年、2年、または1年サイクルSemEval-2010 の後、多くの参加者は 3 年周期は待ち時間が長いと感じています。Conference on Natural Language Learning (CoNLL) やRecognizing Textual Entailments (RTE) など、他の多くの共有タスクは毎年開催されています。このため、SemEval のコーディネーターは、タスク主催者に 2 年周期または 3 年周期のどちらかを選択する機会を与えました。[ 11 ] SemEval コミュニティは 3 年周期を支持しました。SemEval コミュニティ内の投票では 3 年周期が支持されましたが、主催者とコーディネーターは SemEval タスクを 2 つの評価ワークショップに分割することに合意しました。これは、新しい*SEM カンファレンス の導入がきっかけとなりました。SemEval 主催者は、私たちのイベントを *SEM カンファレンスと関連付け、SemEval ワークショップを *SEM カンファレンスと併催するのが適切だと考えました。主催者は、(タスクコーディネーター/主催者および参加者から)毎年開催される *SEM との関連性について非常に肯定的な反応を得ており、8 つのタスクが 2012 年に変更することに同意しました。こうして SemEval-2012 と SemEval-2013 が誕生しました。現在の計画では、SemEval を *SEM 会議と関連付けるために毎年開催するスケジュールに変更する予定ですが、すべてのタスクが毎年開催される必要はありません。[ 12 ]
SensevalおよびSemEvalワークショップ一覧 Senseval-1は 1998年の夏に英語、フランス語、イタリア語で開催され、9月2日から4日にかけてイギリスのサセックス州ハーストモンソー城で開催されたワークショップで最高潮に達した。Senseval-2 は2001年の夏に開催され、その後、2001年7月にトゥールーズでACL 2001と併催されたワークショップが開催されました。Senseval-2では、バスク語 、中国語 、チェコ語、 デンマーク 語、オランダ語 、英語 、エストニア 語、イタリア語 、 日本語 、韓国語 、スペイン語 、スウェーデン語 のタスクが行われました。Senseval-3は 2004年3月から4月にかけて開催され、その後、2004年7月にバルセロナでACL 2004と併催されるワークショップが開催されました。Senseval-3では、コアとなる単語の意味の曖昧性解消、意味役割の識別、多言語アノテーション、論理形式、下位分類の獲得など、14種類のタスクが実施されました。SemEval-2007(Senseval-4)は2007年に開催され、その後、ACLと共同でプラハで開催されたワークショップが続きました。SemEval-2007には、テキストの意味解析システムの評価を目的とした18の異なるタスクが含まれていました。Language Resources and Evaluation の特集号は、その結果に捧げられています。[ 13 ] SemEval-2010 は2010年に開催され、その後、ウプサラで開催されたACLとの共同ワークショップが行われました。SemEval-2010では、意味解析システムの評価を目的とした18種類のタスクが実施されました。SemEval-2012は 2012年に開催されました。これは、新たに設立された*SEM(第1回語彙意味論および計算意味論合同会議)と関連付けられ、カナダのモントリオールで開催されたNAACLと同時開催されました。SemEval-2012には、計算意味論システムの評価を目的とした8つの異なるタスクが含まれていました。ただし、SemEval-2012にはWSD(単語意味曖昧性解消)タスクは含まれておらず、WSD関連のタスクは次回のSemEval-2013で実施される予定です。SemEval-2013は 、NAACL 2013(北米計算言語学会、米国ジョージア州)と連携して2013年に開催されました。計算意味システムの評価を目的とした13種類のタスクが含まれていました。SemEval-2014は 2014年に開催されました。アイルランドのダブリンで開催された第25回国際計算言語学会議COLING 2014および第2回語彙・計算意味論合同会議SEM 2014と同時開催されました。SemEval-2014では、さまざまな計算意味論システムを評価する10種類のタスクが実施されました。SemEval-2015は 2015年に開催されました。これは、北米計算言語学会(ACL)の2015年支部会議(NAACL-HLT 2015)および語彙・計算意味論に関する第3回合同会議(SEM 2015)と同時開催され、米国デンバーで行われました。SemEval-2015では、さまざまな計算意味論システムを評価する17種類のタスクが実施されました。
SemEvalワークショップフレームワーク SemEval/Senseval評価ワークショップの枠組みは、 ARPA(高等研究計画局、後に国防高等研究計画局(DARPA)に改称)が運営する メッセージ理解会議 (MUC)やその他の評価ワークショップを模倣したものです。
SemEvalフレームワーク( MUCの紹介から改変) SemEval/Senseval評価ワークショップの段階 [ 14 ]
まず、参加が見込まれるすべての方に、関心を示して演習の設計に参加するよう呼びかけました。 最終ワークショップに向けたスケジュールが作成された。 評価資料を選定するための計画が合意された。 個々のタスクにおける「ゴールドスタンダード」が確立され、多くの場合、コンピュータシステムの 精度と再現 率を測定するためのゴールドスタンダードとして、人間のアノテーターが用いられました。これらの「ゴールドスタンダード」は、コンピュータシステムが目指す目標です。WSDタスクでは、人間のアノテーターが、一連の正しいWSD回答(つまり、特定の文脈における特定の単語の正しい意味)を生成するタスクに取り組みました。解答のない標準的な問題集が参加者に配布され、参加者はその後、短時間で自身のプログラムを使って問題集を実行し、解答を主催者に返送した。 その後、主催者側が解答を採点し、その結果はワークショップで発表・議論された。
意味評価タスク Senseval-1 と Senseval-2 は、利用可能なコーパスとコンピュータ辞書を備えた主要言語の WSD システムの評価に焦点を当てました。Senseval-3 は語彙素を 超えて、意味役割 (形式意味論では技術的にはTheta 役割 として知られています)、論理形式 変換 (一般的に句、節、または文の意味は一階述語論理形式で表現されます) など、意味論のより広い領域を調査するシステムの評価を開始し、 機械翻訳 における意味分析のパフォーマンスを探求しました。
さまざまな計算意味システムの種類がWSDの範囲を超えて拡大するにつれて、SensevalはSemEvalへと進化し、計算意味システムのより多くの側面が評価されるようになった。
意味解析における諸問題の概要 SemEval演習は、テキストの意味解析における諸問題を検証するための仕組みを提供する。対象となるトピックは、形式計算意味論に見られるような論理的な厳密さには及ばないものの、人間の言語理解に関連する諸問題を特定し、特徴づけることを目的としている。主な目標は、コンピュータシステムを用いて人間の処理を再現することである。以下に示すタスクは、個人やグループによって、特定可能な諸問題が具体的な形をとるにつれて、それらに対処するために開発される。
意味解析における最初の主要な領域は、単語レベル(慣用表現を含む)での意図された意味の特定です。これは語義曖昧性解消(単語には個別の意味があるという考え方から脱却しつつあり、むしろ単語の使用方法、つまり文脈によって特徴づけられるという概念)です。この領域のタスクには、語彙サンプルおよび全単語の曖昧性解消、多言語および異言語間の曖昧性解消、語彙置換などがあります。語義の特定が困難であることから、このトピックに関連するその他のタスクには、語義誘導、下位分類の獲得、語彙リソースの評価などがあります。
意味解析における2つ目の主要分野は、異なる文要素やテキスト要素がどのように組み合わさるかを理解することです。この分野のタスクには、意味役割のラベリング、意味関係の分析、共参照の解決などが含まれます。この分野の他のタスクでは、時間情報処理、換喩の解決、感情分析など、より専門的な意味解析の問題を扱います。この分野のタスクには、情報抽出、質問応答、文書要約、機械翻訳、シソーラスや意味ネットワークの構築、言語モデリング、言い換え、テキスト含意の認識など、多くの潜在的な応用分野があります。これらの潜在的な応用分野のそれぞれにおいて、意味解析の種類がどのような貢献をするかが、最も重要な研究課題となります。
例えば、単語の意味の帰納 と曖昧性解消の タスクには、3つの独立した段階があります。
トレーニング段階 では、評価タスクの参加者は、トレーニングデータセットを使用して、一連の多義語の意味一覧を生成するように求められました。トレーニングデータセットは、多義名詞/動詞のセットと、それらが出現する文例で構成されています。形態素解析器、品詞タグ付け器、構文解析器などの形態素および構文素解析の自然言語処理コンポーネント以外のリソースは許可され ません でした 。テスト段階 では、参加者はトレーニング段階で得られた感覚インベントリを用いて、曖昧性解消サブタスクのテストセット を与えられた。評価段階 では、テスト段階の回答が教師あり学習と 教師なし学習の 枠組みで評価されました。WSIの教師なし評価では、V Measure (Rosenberg and Hirschberg、2007)とペアFスコア(Artiles et al.、2009)の2種類の評価が検討されました。この評価は、SemEval-2007 WSI タスクの教師あり評価(Agirre and Soroa、2007)に倣ったものです。
SensevalおよびSemEvalタスクの概要 以下の表は、SensevalからSemEvalへのワークショップの成長を反映しており、Senseval/SemEvalワークショップ全体を通して、計算意味論のどの分野が評価されたかの概要を示しています。
多言語WSDタスクは、SemEval-2013ワークショップで導入されました。[ 17 ] このタスクは、BabelNetを意味インベントリとして使用して、多言語シナリオで単語意味曖昧性解消システムを評価することを目的としています。固定の意味インベントリが指定されていないクロスリンガルWSDや多言語語彙置換 タスクのような類似のタスクとは異なり、多言語WSDはBabelNet を意味インベントリとして使用します。BabelNetの開発に先立ち、SemEval-2007では中国語-英語のバイテキストでバイリンガル語彙サンプル WSD評価タスクが実施されました。[ 18 ]
クロスリンガルWSDタスクは、SemEval-2007評価ワークショップで導入され、SemEval-2013ワークショップで再提案されました。[ 19 ] 機械翻訳や多言語情報検索 などの他の自然言語処理 (NLP)アプリケーション にWSDシステムを容易に統合できるようにするために、クロスリンガルWSD評価タスクは、言語に依存しない知識の少ないWSDアプローチとして導入されました。このタスクは、並列コーパスを使用して英語の名詞の教師なし単語意味曖昧性解消タスクです。これは、20個の多義名詞のみに制限された、クラシックWSDタスクの語彙サンプルバリアントに従います。
SemEval-2014には、多言語/クロスリンガルなタスクが2つしかないことに注目すべきである。すなわち、(i)英語、スペイン語、ドイツ語、フランス語、オランダ語を含むクロスリンガルWSDタスクであるL2ライティングアシスタントタスクと、(ii)英語とスペイン語のテキストでシステムを評価する多言語意味テキスト類似性タスクである。
評価対象分野 意味評価における主要なタスクには、自然言語処理 の以下の領域が含まれます。このリストは、この分野の進歩に伴い拡大していくと予想されます。[ 20 ]
以下の表は、Senseval-1からSemEval-2014までの研究に関わった研究分野を示しています(SはSenseval、SEはSemEvalを表します。例えば、S1はSenseval-1、SE07はSemEval-2007を表します)。
セマンティック注釈の種類 SemEvalタスクでは、さまざまなスキーマを持つ多くの種類のセマンティックアノテーションが作成されました。SemEval-2015では、主催者はタスクをいくつかのトラックにグループ化することにしました。これらのトラックは、タスクが達成しようとしているセマンティックアノテーションの種類に基づいています。[ 21 ] 以下は、SemEvalワークショップで使用されているセマンティックアノテーションの種類の一覧です。
意味関係の学習 質疑応答 意味解析 意味分類学 感情分析 テキスト類似性 時間と空間 語義の曖昧性解消と帰納 タスクとそのトラック割り当ては柔軟です。タスクが独自のトラックに発展する可能性があり、たとえば、SemEval-2015 の分類評価タスクは意味関係の学習 トラックの下にありましたが、SemEval-2016 では、新しい意味分類エンリッチメントタスクを備えた 意味分類 専用のトラックがあります。[ 22 ] [ 23 ]
参考文献 ↑ Blackburn, P., and Bos, J. (2005), Representation and Inference for Natural Language: A First Course in Computational Semantics , CSLI Publications. ISBN 1-57586-496-7 。 ↑ Navigli, R (2009). "単語の意味曖昧性解消". ACM Computing Surveys . 41 (2): 1–69 . doi : 10.1145/1459352.1459355 . S2CID 461624 . ↑ Palmer, M., Ng, HT, & Hoa, TD (2006), Evaluation of WSD systems , in Eneko Agirre & Phil Edmonds (eds.), Word Sense Disambiguation: Algorithms and Applications , Text, Speech and Language Technology, vol. 33. Amsterdam: Springer, 75–106. ↑ Resnik, P. (2006), WSD in NLP applications , in Eneko Agirre & Phil Edmonds (eds.), Word Sense Disambiguation: Algorithms and Applications. Dordrecht: Springer, 299–338. ↑ Yarowsky, D. (1992),大規模コーパスで訓練されたロジェのカテゴリーの統計モデルを用いた単語意味曖昧性解消 . 第14回計算言語学会議議事録, 454–60. doi : 10.3115/992133.992140 ↑ Palmer, M., & Light, M. (1999), Tagging with Lexical Semantics: Why, What, and How? | ACL SIGLEX workshop on tagging text with lexical semantics: what, why, and how? Archived 2010-07-15 at the Wayback Machine Natural Language Engineering 5(2): i–iv. ↑ Ng, HT (1997),単語の意味曖昧性解消に真剣に取り組む 。ACL SIGLEXワークショップ「語彙意味論によるテキストタグ付け:なぜ、何を、どのように?」の議事録 1–7。 ↑ Philip Resnik および Jimmy Lin (2010). NLP システムの評価 . Alexander Clark、Chris Fox、および Shalom Lappin 編著. 計算言語学と自然言語処理のハンドブック. Wiley-Blackwellis. 11:271 ↑ Adam Kilgarriff および Martha Palmer (編 2000)。Computers and the Humanities 特集号、SENSEVAL98:単語意味曖昧性解消システムの評価 。Kluwer、34: 1–2。 ↑ Scott Cotton、Phil Edmonds、Adam Kilgarriff、Martha Palmer (編 2001)。SENSEVAL -2: 単語意味曖昧性解消システムの評価に関する第 2 回国際ワークショップ 。SIGLEX ワークショップ、ACL03、トゥールーズ、フランス。 ↑ SIGLEX: メッセージボード (2010) 2012年8月15日取得、 http://www.clres.com/siglex/messdisp.php? id=111 より ↑ SemEval 3 Googleグループの投稿。2012年8月15日にhttps://groups.google.com/forum/?fromgroups#!topic/semeval3/8YXMvVlH-CM%5B1-25%5Dより取得。 ↑ 言語資源と評価第43巻 第2号 ↑ キルガリフ、A. (1998). SENSEVAL: 単語意味曖昧性解消プログラムの評価に関する演習 . LREC 会議録、グラナダ、1998 年 5 月、pp 581-588 ↑ "タスク < SemEval-2017" . alt.qcri.org . 2018-05-04 に取得 . ↑ "タスク < SemEval-2018" . alt.qcri.org . 2018年5月4日 取得 . ↑ Navigli, R., Jurgens, D., & Vannella, D. (2013年6月). Semeval-2013タスク12:多言語単語の意味曖昧性解消。第7回国際意味評価ワークショップ(SemEval 2013)、第2回語彙および計算意味論合同会議(* SEM 2013)併催(pp. 222-231)。 ↑ Peng Jin、Yunfang Wu、Shiwen Yu。「SemEval-2007タスク05:中国語-英語多言語語彙サンプル」。第4回国際意味評価ワークショップ議事録、p.19-23、2007年6月23~24日、チェコ共和国プラハ。 ↑ Lefever, E., & Hoste, V. (2013年6月). Semeval-2013タスク10:異言語間単語意味曖昧性解消。第2回語彙および計算意味論に関する合同会議(第2巻、158-166ページ)。 ↑ SemEval Portal (nd). ACLwiki より取得。2010年8月12日、 http://aclweb.org/aclwiki/index.php? title=SemEval_Portal より。↑ SemEval-2015ウェブサイト 。2014年11月14日取得。http ://alt.qcri.org/semeval2015/index.php? id=tasks↑ Georgeta Bordea、Paul Buitelaar、Stefano Faralli、Roberto Navigli。2015年。Semeval -2015タスク17:分類抽出評価(TExEval) 。第9回国際意味評価ワークショップ議事録。米国デンバー。 ↑ SemEval-2016ウェブサイト 。2015年6月4日取得http://alt.qcri.org/semeval2016/
外部リンク 計算言語学会の語彙に関する特別関心グループ(SIGLEX)のアーカイブ(2008年1月25日時点、 Wayback Machine にて 保存)(ACL) Semeval-2010 – 意味評価ワークショップ(SIGLEX後援) Senseval - 単語意味曖昧性解消システムの評価を専門とする国際機関(SIGLEXの承認を受けている) 計算言語学会のWikiにあるSemEvalポータル Senseval / SemEval タスク: Senseval-1 – 単語意味曖昧性解消システムに関する最初の評価演習。語彙サンプルタスクは英語、フランス語、イタリア語で評価された。 Senseval-2は、3種類のタスク(全単語、語彙サンプル、翻訳タスク)において、単語意味曖昧性解消システムを評価した。 Senseval-3には、単語の意味の曖昧性解消、意味役割の識別、多言語アノテーション、論理形式、下位分類の獲得といったタスクが含まれていました。 SemEval-2007は、自然言語処理のさまざまな研究分野にまたがるため、Sensevalよりも複雑なタスクを含んでいます。 SemEval-2010では、計算意味論における新たな研究分野、すなわち共参照、省略、キーワード抽出、名詞複合語、テキスト含意といったタスクが追加されました。 SemEval-2012は、第1回*SEM会議と同時開催され、意味類似性タスクは*Sem共有タスクとして推進された。 SemEval-2013 – SemEvalは2~3年周期から年次ワークショップへと移行しました。 SemEval-2014 – COLINGでSemEvalがACL以外のイベントで初めて使用された事例 SemEval-2015 – さまざまなトラックに分類されたタスクを含む、初のSemEval SemEval-2016 – WSDタスクなしで実施される2回目のSemEval(初回はSemEval-2012) *SEM – タスクシステム以外のSemEval関連論文のための会議。 メッセージ理解会議(MUC) バベルネット オープン多言語WordNet (2014年8月19日 アーカイブ) - オープンライセンスのWordNetのコンパイル