General Architecture for Text Engineering ( GATE ) は、多くの言語での情報抽出を含む、多くのタスクのための自然言語処理(NLP) ツールのJavaスイートです。 [ 1 ]現在では、科学者、企業、教師、学生など、幅広いコミュニティによって世界中で使用されています。元々は、1995 年にシェフィールド大学で開発されました。
2011 年 5 月 28 日現在、SourceForge.net の gate-users メーリングリストには 881 人のユーザーが登録されており、プロジェクトが 2005 年に SourceForge に移って以来、SourceForgeから 111,932 件のダウンロードが記録されています。 [ 2 ]「GATE: 堅牢な NLP ツールとアプリケーションのためのフレームワークとグラフィカル開発環境」[ 3 ]の論文は、出版以来 2000 件以上の引用を受けています (Google Scholar による)。GATE ユーザー ガイド[ 4 ]に加えて、GATE の使用法を解説した書籍には、Manu Konchady 著の「Building Search Applications: Lucene, LingPipe, and Gate」[ 5 ]や Graham Wilcock 著の「Introduction to Linguistic Annotation and Text Analytics」[ 6 ]などがあります。
GATEコミュニティと研究は、Transitioning Applications to Ontologies、SEKT、NeOn、Media-Campaign、Musing、Service-Finder、LIRICS、 KnowledgeWebなど、いくつかのヨーロッパの研究プロジェクトに関わってきました。
GATEには、ANNIE(A Nearly-New Information Extraction System:ほぼ新しい情報抽出システム)と呼ばれる情報抽出システムが含まれています。ANNIEは、トークナイザー、地名辞典、文分割器、品詞タグ付け器、固有表現変換器、共参照タグ付け器からなるモジュール群です。ANNIEは、そのまま使用して基本的な情報抽出機能を提供することも、より具体的なタスクの出発点として使用することもできます。
GATEで現在対応している言語は、英語、中国語、アラビア語、ブルガリア語、フランス語、ドイツ語、ヒンディー語、イタリア語、セブアノ語、ルーマニア語、ロシア語、デンマーク語です。
Weka、RASP、MAXENT、SVM Lightを使用した機械学習、 LIBSVM統合、社内パーセプトロン実装、 WordNetなどのオントロジー管理、 GoogleやYahooなどの検索エンジンへのクエリ、 Brillや TreeTaggerを使用した品詞タグ付けなど、多くのプラグインが含まれています。ツイートの処理など、多くの外部プラグインも利用可能です。[ 7 ]
GATEは、 TXT、HTML、XML、Doc、PDFドキュメント、およびJDBC経由のRDBMSストレージを利用したJava Serial、PostgreSQL、Lucene、Oracleデータベースなど、さまざまな形式の入力を受け付けます。
JAPEトランスデューサは、GATE内でテキスト上の注釈を操作するために使用されます。ドキュメントはGATEユーザーガイドに記載されています。[ 8 ]また、Press Association Imagesによってチュートリアルも作成されています。[ 9 ]

このスクリーンショットは、文書とその注釈を表示するために使用される文書ビューアを示しています。ピンク色で示されているのは、HTMLファイルからのハイパーリンク注釈です。右側のリストは注釈セットのリスト、下部の表は注釈リストです。中央には注釈エディタウィンドウがあります。<a>
GATEは、自然言語テキスト、意味注釈、オントロジー情報など、膨大な量の情報を生成します。データ自体がアプリケーションの最終成果物となる場合もありますが、多くの場合、効率的に検索できれば情報はより有用になります。GATE Mimirは、このようなアプリケーションによって生成される言語情報と意味情報のインデックス作成と検索をサポートし、テキスト、構造情報、SPARQLを任意に組み合わせて情報をクエリできるようにします。