LRE Map(言語リソースと評価)は、自然言語処理に特化したリソースに関する、無料でアクセスできる大規模なデータベースです。LRE Mapの本来の特徴は、さまざまな主要な自然言語処理会議への投稿時に記録が収集されることです。その後、記録はクリーニングされ、「LRE Map」と呼ばれるグローバルデータベースにまとめられます。[ 1 ]
LREマップは、言語リソースに関する情報を収集するためのツールであると同時に、ユーザーのためのコミュニティ、リソースの共有や発見、意見交換、フィードバックの提供、新しいトレンドの発見などを行う場となることを目指しています。これは、データとツールの両方を含む、広義の言語リソースを発見、検索、文書化するためのツールです。
マップに含まれる膨大な情報は、さまざまな方法で分析できます。例えば、LREマップは、最も頻繁に使用されるリソースの種類、最も多く使用されている言語、リソースが使用されている、または開発されているアプリケーション、新規リソースと既存リソースの比率、あるいはリソースがコミュニティにどのように分配されているかといった情報を提供できます。
世界中のいくつかの機関が言語リソースのカタログを維持しています(ELRA、LDC、NICTユニバーサルカタログ、ACLデータおよびコードリポジトリ、OLAC、LT Worldなど)[ 2 ]。しかし、既存のリソースのうち、配布カタログやプロバイダーによる直接的な宣伝(ウェブサイトなど)を通じて知られているのはわずか10%に過ぎないと推定されています。残りは隠されたままで、リソースが研究論文や会議のレポートの文脈で紹介されたときに一時的に現れるだけです。しかし、この場合でも、研究の焦点がリソースそのものではないため、リソースが背景に留まっている可能性があります。
LRE マップは、 LREC 2010 会議の準備中に「LREC マップ」という名前で誕生しました。[ 3 ]より具体的には、このアイデアは FlaReNet プロジェクト内で議論され、ELRAおよびピサの CNR 計算言語学研究所との協力により、マップは LREC 2010 で導入されました。[ 4 ] LREC の主催者は、論文で使用されているか作成されているすべてのリソース (ツール、標準、評価パッケージなどを含む広義) に関する基本的な情報を提供するよう著者に依頼しました。これらの記述子はすべて、LREC マップと呼ばれるグローバル マトリックスに集められました。
著者らによる同じ方法論と要件は、その後、COLING-2010 [ 5 ] 、 EMNLP-2010 [ 6 ] 、 RANLP-2011 [ 7 ]、LREC 2012 [ 8 ] 、LREC 2014 [ 9 ]、LREC 2016 [ 10 ]などの他の会議にも適用され、拡張されました。 他の会議へのこの一般化の後、LREC マップは LRE マップと改名されました。
データベースの規模は時間とともに拡大する。収集されたデータ数は4776件に上る。
各リソースは、以下の属性に基づいて記述されます。
LREマップは、自然言語処理(NLP)分野を体系的に把握するための非常に重要なツールです。主観的な評価に基づく他の研究とは異なり、LREマップは実際の事実に基づいて作成されています。
この地図は情報収集ツールとしてだけでなく、様々な用途に活用できる大きな可能性を秘めている。
その後、データはJoseph Mariani(CNRS-LIMSI IMMI)とGil Francopoulo (CNRS-LIMSI IMMI + Tagmatica)によってクリーニングおよびソートされ、最終的なFLaReNet [ 11 ]レポートのさまざまなマトリックスが計算されました。そのうちの1つである、LREC 2010の書面データのマトリックスは次のとおりです。
英語は最も学習されている言語です。次にフランス語とドイツ語が続き、その後にイタリア語とスペイン語が続きます。
LREマップは、Language Resources and Evaluation Journal [ 12 ]や他の会議にも拡張されています。