OntoLexは、データのウェブ内の語彙リソースの語彙の短縮名(OntoLex-Lemon)であり、それを作成したW3Cコミュニティグループの短縮名(W3C Ontology-Lexica Community Group)でもあります。 [1]
OntoLex-Lemon 語彙
OntoLex-Lemon語彙は、語彙データを知識グラフ、RDF形式、および/または言語リンクオープンデータとして公開するための語彙を表します。2016年にW3Cコミュニティレポートとして公開されて以来、[2]「Web上でオントロジー語彙を表現するための事実上の標準」として機能しています。[3] OntoLex-Lemonは、McCraeら(2011)によって最初に提案されたLemon語彙の改訂版です。[4]

図 1 に示す OntoLex-Lemon の中核要素は次のとおりです。
- 語彙エントリ: 語彙集の分析単位。1つ以上の形式と1つ以上の意味、それぞれ概念をグループ化します。追加の形態統語論的情報、たとえば品詞などを提供できます。各語彙エントリは最大で1つの品詞を持つことができることに注意してください。同じ形式だが品詞が異なる語彙エントリのグループを表すには、辞書モジュールを参照してください。[5]
- 語彙形式: 特定の語彙項目の表面形式、例えばその書き言葉による表現
- 語彙の意味: 特定の語彙エントリの単語の意味。OntoLex-Lemon の意味は語彙化されている、つまり、正確に 1 つの語彙エントリに属していることに注意してください。異なる語彙素で表現できる意味の要素については、語彙概念を使用します。
- 語彙概念: 異なる語彙化を持つ意味の要素。典型的な例は、複数の同義語が 1 つのセットにグループ化された WordNet synset です。
コアモジュール(名前空間 http://www.w3.org/ns/lemon/ontolex#)とは別に、他のモジュールは、語彙メタデータ[6](名前空間 http://www.w3.org/ns/lemon/lime#)、語彙意味関係(翻訳とバリエーションなど、名前空間 http://www.w3.org/ns/lemon/vartrans#)、複数語表現(分解、名前空間 http://www.w3.org/ns/lemon/decomp#)、および統語フレーム(名前空間 http://www.w3.org/ns/lemon/synsem#)を表すための指定語彙を指定します。
OntoLex-Lemon のデータ構造は、他の辞書形式と比較できます (以下の関連語彙を参照)。OntoLex-Lemon の革新的な要素は、RDF 語彙としてこのようなデータ モデルを提供していることです。これにより、スタンドアロンの辞書ではなく Web テクノロジに基づく新しいユース ケースが可能になります (例: 翻訳推論、以下のアプリケーションを参照)。近い将来、OntoLex-Lemon はこの役割でもユニークなままです。これは、(言語) リンクト オープン データ コミュニティが既存の語彙の再利用を強く推奨しているためです[7]。2019 年 12 月現在、OntoLex-Lemon は、その目的のために確立された (つまり、W3C または別の標準化イニシアチブによって公開された) 唯一の語彙です。これは、元の OntoLex-Lemon 仕様の最近の拡張にも反映されており、新しいモジュールが開発され、OntoLex-Lemon の使用を新しいアプリケーション領域に拡張しています。
- W3Cコミュニティグループレポートとして公開されたOntoLex-Lemon辞書編集モジュール[8]は、デジタル辞書編集の要件に関してOntoLex-Lemonを拡張します。
- OntoLex-Lemon形態論モジュールは、2019年12月現在開発中であり、[9] [10]特に形態論的に豊富な言語のOntoLex-Lemonにおける形態論辞書の形式化によって多言語性を促進することを目的としている。
- 頻度、認証、コーパス情報のためのOntoLex-Lemonモジュールは、2019年12月現在開発中であり、[11] [12]は、計算辞書学と自然言語処理におけるOntoLex-Lemonの使用を促進することを目的としています。
- LexInfoの更新:LexInfoはOntoLex-Lemonデータのデータカテゴリを提供します。現在のバージョンはLexinfo 3.0ですが、古いバージョン(2019年以前)は古いMonnet-Lemon語彙に依存していました。[13]
アプリケーション
OntoLex-Lemonは、言語リンクオープンデータの文脈における語彙リソースに広く使用されています。選択されたアプリケーションには以下が含まれます。
- OASIS辞書編集基盤データモデルとAPI(LEXIDMA)、国際的に相互運用可能な辞書編集作業のためのフレームワーク[14]
- 欧州公共多言語知識基盤[15] [16]
- LexOは、(多言語)語彙・用語リソースをリンクデータリソースとして作成・管理するために使用される共同ウェブエディタである[17]
- VocBenchは、オントロジー、シソーラス、辞書、RDFデータを管理するためのWebベースの多言語共同開発プラットフォームです[18] [19] [20]
- K DictionariesのLexicala APIは、50の言語と150の言語ペアの言語横断的な語彙データへのアクセスを提供します。[21]
- DiTMAOは、古代オック語の薬用植物学用語辞典を作成するために開発された辞書編集ソフトである[22]
- 辞書間の翻訳推論に関する一連の共有タスク(TIAD-2017、[23] [24] TIAD-2019、[25] [26] TIAD-2020 [27])
- DBnary、ウィクショナリーの16言語版のRDF版[28] [29]
- PanLexは、約2,500の辞書と500以上の言語からなる大規模な語彙ネットワークである[30]
- プリンストンWordNet 3.1、大規模で階層的かつ関係的に構造化された英語の語彙リソース[31]
- グローバルワードネット協会、多言語ワードネットの作成、維持、相互リンクを行うコミュニティ活動[32]
- BabelNet、大規模多言語語彙ネットワーク[33] [34]
- LiLaは、ラテン語の言語リソースの知識ベースであり、引用形式のコレクションからなる大規模な辞書に基づいています[35] [36] [37]
OntoLexの開発は、オントロジー、リンクデータ、辞書学に特化した科学イベントで定期的に取り上げられています。2017年以来、OntoLexモジュールに関する専用ワークショップシリーズが2年に1回開催されています。[38]
関連語彙
語彙リソースの標準化と公開に重点を置いた関連語彙には、DICT (テキストベースの形式)、XML Dictionary eXchange Format、TEI-Dict (XML)、Lexical Markup Framework (通常は XML でシリアル化された抽象モデル。Lemon 語彙はもともと LMF の RDF シリアル化から発展したものです) などがあります。OntoLex-Lemon は、機械可読辞書の構造とセマンティクスを形式化するだけでなく、辞書間の情報統合を容易にするネイティブのLinked Open Data 語彙であるという点で、これらの以前のモデルとは異なります。
参考文献
- ^ 「OntoLex コミュニティ ポータル」。W3C。2019年12 月 6 日閲覧。
- ^ Cimiano, Phillip; McCrae, John P.; Buitelaar, Paul. 「オントロジーの語彙モデル: コミュニティレポート、2016年5月10日 最終コミュニティグループレポート 2016年5月10日」。 W3C 。 2019年12月6日閲覧。
- ^ Julia Bosque-Gil、Jorge Gracia、Elena Montiel-Ponsoda (2017年7月)。「OntoLexの辞書学モジュールに向けて」(PDF) 。Kernerman Dictionary News。第25号。 2020年4月5日閲覧。
- ^ McCrae, John; Spohr, Dennis; Cimiano, Philipp (2011). 「Lemon を使用したセマンティック ウェブ上の語彙リソースとオントロジーのリンク」。Extended Semantic Web Conference (ESWC-2011) の議事録、イラクリオン、ギリシャ: 245–259。
- ^ Bosque-Gil, Julia; Gracia, Jorge. 「OntoLex Lemon Lexicography Module」. W3C . 2019年12月6日閲覧。
- ^ フィオレッリ、マヌエル;ステラート、アルマンド。マクレー、ジョン P.シミアーノ、フィリップ。パツィエンツァ、マリア・テレサ (2015)。 「LIME: OntoLex 用メタデータ モジュール」。ガンドンでは、ファビアン。サボウ、マルタ。サック、ハラルド。ダマト、クラウディア。クドル=モールー、フィリップ。アントワーヌ・ツィンマーマン(編)。セマンティックウェブ。最新の進歩と新しい領域。コンピューターサイエンスの講義ノート。 Vol. 9088。シュプリンガー・インターナショナル・パブリッシング。 321–336ページ。土井:10.1007/978-3-319-18818-8_20。ISBN 978-3-319-18818-8。
- ^ 「言語リンクオープンデータ。拡大を続ける言語リンクオープンデータのクラウドの現状に関する情報」 。 2019年12月10日閲覧。
- ^ Bosque-Gil, Julia; Gracia, Jorge. 「OntoLex Lemon Lexicography Module Final Community Group Report 17 September 2019」. W3C . 2019年12月10日閲覧。
- ^ 「Morphology」 。 2019年12月10日閲覧。
- ^ Klimek, Bettina; McCrae, John P.; Bosque-Gil, Julia; Ionov, Maxim; Tauber, James K.; Chiarcos, Christian. オントロジー辞書における形態論の表現の課題、Kosem, I.、Zingano Kuhn, T.、Correia, M.、Ferreria, JP、Jansen, M.、Pereira, I.、Kallas, J.、Jakubíček, M.、Krek, S.、Tiberius, C. (eds.) 2019. 21世紀の電子辞書学。eLex 2019会議の議事録。2019年10月1日〜3日、シントラ、ポルトガル(PDF)。ブルノ:Lexical Computing CZ、sro pp. 570–591。
- ^ 「頻度、証明、コーパス情報」 。 2019年12月10日閲覧。
- ^ Chiarcos, Christian; Ionov, Maxim. 「頻度、構成証明、コーパス情報のためのOntoLex-Lemonモジュール(ドラフト仕様)」。GitHub 。 2020年4月9日閲覧。
- ^ 「LexInfo - OntoLex-Lemon のデータカテゴリオントロジー」。GitHub。2020年1月 4 日閲覧。
- ^ censign. 「参加募集:OASIS辞書インフラストラクチャデータモデルおよびAPI(LEXIDMA)TC」。OASIS 。 2019年12月10日閲覧。
- ^ Schmitz, P.; Francesconi, E.; Hajlaoui, N.; Batouche, B.; Stellato, A. (2018).自動マッピングによる多言語リソースの意味的相互運用性、電子政府と情報システムの観点に関する国際会議。Cham: Springer。pp. 153–163。
- ^ Batouche, Brahim; Schmitz, Peter; Francesconi, Enrico; Hajlaoui, Najeh (2018年12月2日). PMKI–Public Multilingual Knowledge. PMKIデータモデルインフラストラクチャのドキュメント(PDF) . 欧州技術仕様. 2019年12月10日閲覧。
- ^ Lenardič, Jakob. 「CLARIN-IT が LexO を発表: 辞書学とセマンティック ウェブが出会う場所」CLARIN . 2019 年12 月 10 日閲覧。
- ^ AIMS チーム。「VocBench バージョン 4.0.2 は 2018 年 8 月にリリースされました」。イタリアの国連 FAO。2019年12 月 10 日閲覧。
- ^ ステラート、アルマンド;ラジバンダリ、サチット。トゥルバティ、アンドレア。フィオレッリ、マヌエル。カラッチョロ、カテリーナ。ロレンツェッティ、ティツィアーノ。カイザー、ヨハネス。パツィエンツァ、マリア・テレサ(2015)。 「VocBench: 多言語シソーラスの共同開発のための Web アプリケーション」(PDF)。ガンドンでは、ファビアン。サボウ、マルタ。サック、ハラルド。ダマト、クラウディア。クドル=モールー、フィリップ。アントワーヌ・ツィンマーマン(編)。セマンティックウェブ。最新の進歩と新しい領域。コンピューターサイエンスの講義ノート。 Vol. 9088。シュプリンガー・インターナショナル・パブリッシング。 38–53ページ。土井:10.1007/978-3-319-18818-8_3。ISBN 978-3-319-18818-8。
- ^ 「VocBench 3: オントロジー、シソーラス、レキシコンのための共同セマンティック Web エディター | www.semantic-web-journal.net」。semantic-web-journal.net 。 2020 年 1 月 17 日閲覧。
- ^ Ilan KernermanとDorielle Lonke(2019年7月)。「Lexicala API:辞書データの新時代」(PDF)。Kernerman Dictionary News。第27号。 2020年4月5日閲覧。
- ^ 「古オック語の医学・植物学用語辞典」 。 2019年12月10日閲覧。
- ^ 「TIAD-2017 共有タスク – 辞書間の翻訳推論。参加募集」 。 2019年12月10日閲覧。
- ^ McCrae, John P.; Bond, Francis; Buitelaar, Paul; Cimiano, Philipp; Declerck, Thierry; Gracia, Jorge; Kernerman, Ilan; Montiel Ponsoda, Elena; Ordan, Noam; Piasacki, Maciej (2017 年 6 月 18 日)。LDK 2017 ワークショップの議事録: OntoLex モデルに関する第 1 回ワークショップ (OntoLex-2017)、辞書間の翻訳推論の共有タスク、および Wordnet の課題。CEUR。2019年12 月 10 日閲覧。
- ^ 「TIAD 2019. 第2回辞書間翻訳推論(TIAD)共有タスク」 。 2019年12月10日閲覧。
- ^ Gracia, Jorge; Kabashi, Besim; Kernerman, Ilan (2019 年 5 月 20 日)。TIAD-2019 共有タスク – 辞書間の翻訳推論の議事録。ライプツィヒ、ドイツ: CEUR。
- ^ 「TIAD 2020 -- 第2回辞書間の翻訳推論(TIAD)共有タスク」。
- ^ 「Dbnary Wiktionary は言語学的にリンクされたオープンデータです」 。 2019年12月10日閲覧。
- ^ Sérasset, Gilles (2016). 「DBnary: RDF におけるレモンベースの多言語語彙リソースとしての Wiktionary」セマンティック ウェブ. 2019 年12 月 10 日閲覧。
- ^ Kamholz, David; Pool, Jonathan; Colowick, Susan M. (2014). PanLex: 汎言語語彙翻訳のためのリソースの構築、第9回言語リソースおよび評価会議 (LREC-2014) の議事録、レイキャビク、アイスランド、2014年5月。欧州言語リソース協会。pp. 3145–3150 。 2019年12月10日閲覧。
- ^ 「Princeton WordNet 3.1. WordNet RDF」 。 2019年12月10日閲覧。
- ^ 「Global Wordnet Formats: RDF」。2019年12月10日閲覧。
- ^ 「BabelNet SPARQLエンドポイント」。2019年12月10日閲覧。
- ^ Ehrmann, M.; Ceccioni, F.; Vanella, D.; McCrae, JP; Cimiano, P.; Navigli, R. 「多言語データをリンクデータとして表現する: BabelNet 2.0 のケース」。第 9 回言語リソースおよび評価会議 (LREC-2014) の議事録、レイキャビク、アイスランド、2014 年 5 月。欧州言語リソース協会。pp. 401–408。2019年12 月 10 日に閲覧。
- ^ 「LiLa SPARQL エンドポイント」 。2020年4 月 4 日閲覧。
- ^ 「LiLa クエリ インターフェース」 。2020年4 月 4 日閲覧。
- ^ Passarotti, MC; Cecchini, FM; Franzini, G.; Litta, E.; Mambrini, F.; Ruffolo, P. LiLa: Linking Latin。言語リソースとNLPツールの知識ベース。第2回言語、データ、知識に関する会議 (LDK 2019) の議事録、ドイツ、ライプツィヒ、2019年5月20〜23日。CEURワークショップ議事録。 2020年4月4日閲覧。
- ^ Cimiano, Philipp (2017年7月). 「OntoLex 2017 – OntoLexモデルに関する第1回ワークショップ」(PDF) . Kernerman Dictionary News . 第25号. 2020年4月5日閲覧。
外部リンク
- OntoLex-Lemon 仕様
- OntoLex-Lemon 辞書編集モジュール
- OntoLex GitHub リポジトリ
