BabelNet は、ロベルト・ナヴィッリの監督の下、ローマ・サピエンツァ大学のNLPグループで開発された多言語の語彙意味論的知識グラフ、オントロジー、百科事典辞書です。[ 1 ] [ 2 ] BabelNet は、 Wikipedia を英語で最も人気のある計算機辞書であるWordNetにリンクすることで自動的に作成されました。統合は、自動マッピングを使用し、統計的機械翻訳を使用してリソースの少ない言語の語彙のギャップを埋めることで行われます。その結果、多くの言語で語彙化され、大量の意味関係で接続された概念と固有表現を提供する百科事典辞書ができました。追加の語彙化と定義は、フリーライセンスの WordNet、OmegaWiki、英語のWiktionary、Wikidata、FrameNet、VerbNetなどにリンクすることで追加されます。WordNet と同様に、BabelNet は異なる言語の単語を同義語のセットにグループ化し、これをBabel synsetsと呼びます。 BabelNetは、各Babelシノセットに対して、WordNetとWikipediaの両方から収集した多くの言語での短い定義(グロスと呼ばれる)を提供します。

2023年12月現在 BabelNet (バージョン 5.3) は 600言語をカバーしています。約 2300 万のシノセットと約 17 億の語義(言語に関係なく) が含まれています。各 Babel シノセットには、平均して言語ごとに 2 つの同義語、つまり語義が含まれています。意味ネットワークには、WordNet のすべての語彙意味関係 (上位語と下位語、部分語と全体語、反意語と同義語など、合計約 364,000 の関係エッジ) と、Wikipedia の不十分な関連性関係 (合計約 19 億のエッジ) が含まれています。[ 1 ]バージョン 5.3 では、約 6100 万の画像を Babel シノセットに関連付け、リソースのLemon RDFエンコーディングを提供します。 [ 3 ]これはSPARQL エンドポイントから利用できます。267 万のシノセットにはドメイン ラベルが割り当てられています。
BabelNetは、多言語自然言語処理アプリケーションを可能にすることが実証されています。BabelNetで利用可能な語彙化された知識は、以下の分野で最先端の結果をもたらすことが実証されています。
BabelNetは、「異種データソースを活用した多言語対応の語彙化意味ネットワークとオントロジーを通じて言語の壁を克服する画期的な研究」により、2015年のMETA賞を受賞しました。
BabelNet [ 1 ]を記述した Artificial Intelligence Journal の論文は、2017 年に優秀論文賞を受賞しました。[ 9 ]
BabelNetは、ウェブ上で利用可能な革新的で最新の語彙知識リソースの新時代に関するTime誌の記事[ 10 ]で大きく取り上げられました。
{{cite web}}: CS1 maint: bot: 元の URL の状態が不明です (リンク) Transactions of the Association for Computational Linguistics (TACL), 2, pp. 449-464, 2014.