ISO/TC 37が作成した言語資源管理 - 語彙マークアップフレームワーク( LMF ; ISO 24613 ) は、自然言語処理(NLP) と機械可読辞書(MRD)の語彙集に関するISO標準です。[1]その範囲は、多言語コミュニケーションのコンテキストにおける言語資源に関連する原則と方法の 標準化です。
目的
LMF の目標は、語彙リソースの作成と使用のための共通モデルを提供し、これらのリソース間のデータ交換を管理し、多数の個別の電子リソースを統合して広範なグローバル電子リソースを形成できるようにすることです。
LMF の個々のインスタンス化のタイプには、単一言語、二言語、または多言語の語彙リソースを含めることができます。小規模なレキシコンと大規模なレキシコン、単純なレキシコンと複雑なレキシコン、書き言葉と話し言葉の両方の語彙表現に同じ仕様を使用します。記述の範囲は、形態論、構文、計算意味論からコンピューター支援翻訳にまで及びます。カバーされる言語はヨーロッパ言語に限定されず、すべての自然言語をカバーします。対象となる NLPアプリケーションの範囲に制限はありません。LMF は、 WordNet、EDR、PAROLE レキシコン を含むほとんどのレキシコンを表現できます。
歴史
これまで、語彙の標準化は、GENELEX、EDR、EAGLES、MULTEXT、PAROLE、SIMPLE、ISLE などの一連のプロジェクトによって研究され、開発されてきました。その後、ISO/TC 37各国代表団は、NLP と語彙表現に特化した標準に取り組むことを決定しました。LMF の作業は、2003 年夏に米国代表団が発行した新しい作業項目提案によって開始されました。2003 年秋には、フランス代表団がNLP 語彙専用のデータ モデルの技術提案を発行しました。2004 年初頭、ISO/TC 37 委員会は、Nicoletta Calzolari ( CNR -ILC イタリア) を議長に、Gil Francopoulo (Tagmatica フランス) と Monte George ( ANSI、米国) を編集者として、共通のISOプロジェクトを形成することを決定しました。 LMF 開発の最初のステップは、既存のレキシコンの一般的な特徴に基づいて全体的なフレームワークを設計し、それらのレキシコンのコンポーネントを説明する一貫した用語を開発することでした。次のステップは、すべてのレキシコンを詳細に表現するのに最適な包括的なモデルの実際の設計でした。60 人の専門家からなる大規模なパネルが、多くの種類の NLP レキシコンを網羅する LMF の幅広い要件を提供しました。LMF の編集者は、専門家パネルと緊密に連携して最善のソリューションを特定し、LMF の設計について合意に達しました。処理が難しいとされるいくつかの言語の問題を処理するための強力なメカニズムを提供するために、形態論に特別な注意が払われました。13 のバージョンが作成され、(各国の指名された専門家に) 発送され、さまざまな ISO 技術会議でコメントおよび議論されました。多数の対面会議や電子メールのやり取りを含む 5 年間の作業の後、編集者は首尾一貫した UML モデルに到達しました。結論として、LMF は NLP 語彙分野における最先端の技術を統合したものと考えるべきです。
現在のステージ
ISO 番号は 24613 です。LMF 仕様は、2008 年 11 月 17 日に国際標準として正式に公開されました。
ISO/TC 37規格ファミリーの一員として
ISO/TC 37 規格は現在、高レベルの仕様として策定されており、単語分割(ISO 24614)、注釈(ISO 24611 別名 MAF、ISO 24612 別名 LAF、ISO 24615 別名 SynAF、および ISO 24617-1 別名 SemAF/Time)、特徴構造(ISO 24610)、マルチメディア コンテナー (ISO 24616 別名 MLIF)、および辞書(ISO 24613) を扱っています。これらの規格は、定数専用の低レベルの仕様、つまりデータ カテゴリ (ISO 12620 の改訂版)、言語コード( ISO 639 )、スクリプト コード( ISO 15924 )、国コード( ISO 3166 )、およびUnicode ( ISO 10646 ) に基づいています。
2 レベルの構成は、次の共通かつ単純なルールを持つ一貫した標準ファミリを形成します。
- 高レベルの仕様は、標準化された定数で装飾された構造要素を提供します。
- 低レベルの仕様では、標準化された定数がメタデータとして提供されます。
主な基準
/feminine/や/transitive/のような言語定数はLMF内で定義されていませんが、ISO/TC 37がISO/IEC 11179-3:2003に準拠してグローバルリソースとして管理しているデータカテゴリレジストリ(DCR)に記録されています。[2]そして、これらの定数は高レベルの構造要素を装飾するために使用されます。
LMF 仕様は、オブジェクト管理グループ(OMG) によって定義された統一モデリング言語(UML)のモデリング原則に準拠しています。構造は UML クラス図によって指定されます。例は UML インスタンス (またはオブジェクト) 図によって示されます。
XML DTD はLMF ドキュメントの付録に記載されています。
モデル構造
LMF は次のコンポーネントで構成されています。
- 語彙エントリ内の情報の基本階層を記述する構造の骨組みとなるコア パッケージ。
- 特定の語彙リソースに必要な追加コンポーネントと組み合わせてコア コンポーネントの再利用を記述するフレームワークで表現されるコア パッケージの拡張。
拡張機能は、特に形態論、MRD、NLP 構文、NLP セマンティクス、NLP 多言語表記、NLP 形態パターン、複数語表現 パターン、および制約表現パターンに特化しています。
例
次の例では、語彙エントリは、見出し語clergymanと 2 つの語形変化形clergymanおよびclergymenに関連付けられています。言語コーディングは、語彙リソース全体に対して設定されています。言語値は、次のUML インスタンス図に示すように、語彙集全体に対して設定されています。
要素Lexical Resource、Global Information、Lexicon、Lexical Entry、Lemma、およびWord Form は、語彙集の構造を定義します。これらは LMF ドキュメント内で指定されます。一方、languageCoding、language、partOfSpeech、commonNoun、writtenForm、grammaticalNumber、singular、plural は、データ カテゴリ レジストリから取得されるデータ カテゴリです。これらのマークは、構造を装飾します。値ISO 639-3、clergyman、clergymen は、プレーンな文字列です。値eng は、 ISO 639-3で定義されている言語のリストから取得されます。
dtdVersionやfeatなどの追加情報を使用すると、同じデータを次のXMLフラグメントで表現できます。
<LexicalResource dtdVersion= "15" > <GlobalInformation> <feat att= " languageCoding" val= "ISO 639-3" /> </GlobalInformation> <Lexicon> <feat att= " language" val= "eng" /> < LexicalEntry> <feat att= "partOfSpeech" val= "commonNoun" /> <Lemma> <feat att= "WrittenForm" val= "聖職者" /> </Lemma> <WordForm> <feat att= "WrittenForm" val = "聖職者" /> <feat att= "grammaticalNumber" val= "singular" /> </WordForm> < WordForm> <feat att= "WrittenForm" val= "clegymen" /> <feat att= "grammaticalNumber" val= "plural" /> </WordForm> </LexicalEntry> < /語彙集> </語彙リソース>
この例はかなり単純ですが、LMF ははるかに複雑な言語的記述を表現できますが、XML タグ付けはそれに応じて複雑になります。
LMFに関する出版物
ISO によって批准された LMF 仕様に関する最初の出版物 (この論文は、2015 年に LREC 論文の中で言語リソースと評価の会議で 9 番目に引用された論文になりました)。
- 言語リソースと評価LREC-2006/ジェノバ: Gil Francopoulo、Monte George、Nicoletta Calzolari、Monica Monachini、Nuria Bel、Mandy Pet、Claudia Soria: 語彙マークアップ フレームワーク (LMF) [3]
意味表現について:
- GLDV-2007/Tübingen: Gil Francopoulo、Nuria Bel、Monte George Nicoletta Calzolari、Monica Monachini、Mandy Pet、Claudia Soria: NLP 語彙集の意味情報に関する語彙マークアップ フレームワーク ISO 標準[4]
アフリカの言語について:
- Traitement Automatique des langues Naturelles、マルセイユ、2014 年: Mouhamdou Khoule、Mohamad Ndiankho Thiam、El Hadj Mamadou Nguer: LMF ベースのウォロフ語辞書の確立に向けて (Vers la mise en place d'un lexique basé sur LMF pour la langue wolof) ) [フランス語] [5]
アジア言語について:
- 辞書学、ASIALEX ジャーナル、Springer 2014: 語彙マークアップ フレームワーク: Gil Francopoulo、Chu-Ren Huang: 電子辞書の ISO 標準とアジア言語への影響 DOI 10.1007/s40607-014-0006-z
ヨーロッパの言語について:
- COLING 2010: Verena Henrich、Erhard Hinrichs: ISO標準LMFにおけるワードネットの標準化: GermaNet向けWordnet-LMF [6]
- EACL 2012: Judith Eckle-Kohler、Iryna Gurevych: Subcat-LMF: サブカテゴリ化フレームの相互運用性のための標準化されたフォーマットの具体化[7]
- EACL 2012: Iryna Gurevych、Judith Eckle-Kohler、Silvana Hartmann、Michael Matuschek、Christian M Meyer、Christian Wirth: UBY - LMFに基づく大規模統合語彙意味リソース。[8]
セム語族について:
- Journal of Natural Language Engineering、ケンブリッジ大学出版局(2015 年春に出版予定):Aida Khemakhem、Bilel Gargouri、Abdelmajid Ben Hamadou、Gil Francopoulo:大規模アラビア語辞書の ISO 標準モデリング。
- 第7回グローバルワードネットカンファレンス2014の議事録:Nadia BM Karmani、Hsan Soussou、Adel M Alimi:aeb言語用のISO LMFで標準化されたワードネットを構築する。[9]
- ワークショップの議事録:アラビア語世界におけるHLTとNLP、LREC 2008:Noureddine Loukil、Kais Haddar、Abdelmajid Ben Hamadou:アラビア語動詞の統語的語彙集に向けて。[10]
- Traitement Automatique des Langues Naturelles、トゥールーズ (フランス語) 2007: Khemakhem A、Gargouri B、Abdelwahed A、Francopoulo G: Modélisation des paradigmes de flexion des veres arabes selon la Norme LMF-ISO 24613。[11]
固有名詞について:
- 言語リソースと評価LREC-2008/マラケシュ: Denis Maurel: Prolexbase。固有名詞の多言語リレーショナル語彙データベース。[12]このリソースは、ortolang Web サイトで入手できます。[13]
専用本
2013年に出版されたLMF Lexical Markup Framework [14]という本は、LMFだけを扱っています。第1章では語彙モデルの歴史、第2章ではデータモデルの正式な説明、第3章ではISO-DCRのデータカテゴリとの関係について扱っています。他の14章では、民間または軍事分野、科学研究室または産業用途の語彙集またはシステムを扱っています。これらは、Wordnet-LMF、Prolmf、DUELME、UBY-LMF、LG-LMF、RELISH、GlobalAtlas(またはGlobal Atlas)、およびWordscapeです。
関連する科学コミュニケーション
- 言語資源と評価LREC-2006/ジェノバ:研究インフラの標準の関連性[2]
参照
- 計算語彙学
- 語彙意味論
- パラダイムと形態統語論に関する説明のための形態論(言語学)
- さまざまな種類の多言語表記法のプレゼンテーションのための機械翻訳(アプローチのセクションを参照)
- パラダイムとパラダイムパターンの違いの形態学的パターン
- 英語で最も有名な意味辞書のプレゼンテーションのためのWordNet
- 機械可読辞書のユーザー指向の代替フォーマットであるUniversal Terminology eXchange (UTX)
- ユニバーサルネットワーキング言語
- LMFの応用のためのUBY-LMF
- OntoLex-Lemon は、辞書を知識グラフ、RDF、または言語リンクオープンデータとして公開するための LMF ベースのモデルです。
参考文献
- ^ 「ISO 24613-1:2024 – 言語リソース管理 – 語彙マークアップフレームワーク (LMF) – パート1: コアモデル」。ISO 。 2024年1月31日閲覧。
- ^ ab 「研究インフラストラクチャの標準の関連性」(PDF)。Hal.inria.fr 。 2016年1月24日閲覧。
- ^ 「Lexical Markup Framework (LMF)」(PDF) . Hal.inria.fr . 2016年1月24日閲覧。
- ^ 「NLP 多言語リソースの語彙マークアップ フレームワーク (LMF)」(PDF) . Hal.inria.fr . 2016 年 1 月 24 日閲覧。
- ^ “Vers la misse en place d'un lexique Base sur LMF pour la langue Wolof” (PDF)。Aclweb.org 。2016 年 1 月 24 日に取得。
- ^ 「ISO 標準 LMF における Wordnet の標準化: GermaNet 向け Wordnet-LMF」(PDF)。Aclweb.org 。2016年 1 月 24 日閲覧。
- ^ 「Subcat-LMF: サブカテゴリ化フレームの相互運用性のための標準化フォーマットの具体化」(PDF)。Aclweb.org : 550–560 。 2012年4月。 2016年1月24日閲覧。
- ^ 「UBY – LMF に基づく大規模な統合語彙・意味リソース」(PDF)。Aclweb.org 。2016年 1 月 24 日閲覧。
- ^ 「ISO LMF で aeb 言語用の標準化された Wordnet を構築する」(PDF)。Aclweb.org 。2016年 1 月 24 日閲覧。
- ^ 「LREC 2008 Proceedings」Lrec-conf.org . 2016年1月24日閲覧。
- ^ 「標準的な言語アラベスにおける柔軟性のパラダイムのモデル化 LMF - ISO 24613」(PDF)。Aclweb.org 。2016 年 1 月 24 日に取得。
- ^ 「Prolexbase。固有名詞の多言語リレーショナル語彙データベース」(PDF)。2024年12月7日閲覧。
- ^ 「Prolex」 . 2024年12月7日閲覧。
- ^ ギル・フランコポロ(編)LMF レキシカル・マークアップ・フレームワーク、ISTE / Wiley 2013(ISBN 978-1-84821-430-9)
外部リンク
- LMFウェブサイト
- LIRICSウェブサイト
