知識抽出とは、構造化 (リレーショナル データベース、XML ) および非構造化 (テキスト、ドキュメント、画像) ソースから知識を作成することです。結果として得られる知識は、機械可読かつ機械解釈可能な形式である必要があり、推論を容易にする方法で知識を表現する必要があります。方法論的には情報抽出( NLP ) やETL (データ ウェアハウス) に似ていますが、主な基準は、抽出結果が構造化情報の作成やリレーショナル スキーマへの変換を超えることです。既存の形式知識の再利用(識別子またはオントロジーの再利用) またはソース データに基づくスキーマの生成が 必要です。
RDB2RDF W3Cグループ[1]は現在、リレーショナルデータベースからリソース記述フレームワーク(RDF)を抽出するための言語を標準化しています。知識抽出のもう1つの一般的な例としては、Wikipediaを構造化データに変換することと、既存の知識へのマッピングがあります(DBpediaとFreebaseを参照)。
概要
RDFやOWLなどの知識表現言語が標準化されて以来、特にリレーショナル データベースの RDF への変換、アイデンティティ解決、知識発見、オントロジー学習に関する多くの研究がこの分野で行われてきました。一般的なプロセスでは、情報抽出から抽出、変換、ロード(ETL) までの従来の方法を使用して、ソースのデータを構造化形式に変換します。そのため、相互に作用し、学習する仕組みを理解します。
このトピックのアプローチを分類するには、次の基準を使用できます(そのうちのいくつかはリレーショナルデータベースからの抽出のみを考慮しています): [2]
例
エンティティリンク
- DBpedia Spotlight、OpenCalais、Dandelion dataTXT、Zemanta API、Extractiv、PoolParty Extractorは、名前付きエンティティ認識を介してフリーテキストを分析し、名前解決を介して候補の曖昧さを解消し、見つかったエンティティをDBpediaナレッジリポジトリ[3]にリンクします(Dandelion dataTXTデモまたはDBpedia SpotlightウェブデモまたはPoolParty Extractorデモ)。
オバマ大統領は水曜日、昨年の経済刺激策に盛り込まれた学生に対する減税政策はより手厚い支援となるとして、議会に対し減税を延長するよう求めた。
- オバマ大統領は DBpedia LinkedDataリソースにリンクされているため、さらに情報が自動的に取得され、セマンティック推論エンジンは、たとえば、言及されたエンティティが Person タイプ ( FOAF (ソフトウェア)を使用) および Presidents of the United States タイプ ( YAGOを使用) であると推論できます。反例: エンティティのみを認識したり、Wikipedia の記事やその他のターゲットにリンクしたりするメソッドは、構造化データや形式的知識をさらに取得することはできません。
リレーショナルデータベースからRDFへ
- Triplify、D2R Server、Ultrawrap、およびVirtuoso RDF Views は、リレーショナル データベースを RDF に変換するツールです。このプロセスでは、変換プロセス中に既存の語彙とオントロジーを再利用できます。 usersという一般的なリレーショナル テーブルを変換する場合、1 つの列 (例: name ) または列の集合 (例: first_nameとlast_name ) が、作成されたエンティティの URI を提供する必要があります。通常は主キーが使用されます。他のすべての列は、このエンティティとの関係として抽出できます。[4]次に、正式に定義されたセマンティクスを持つプロパティが使用 (および再利用) され、情報が解釈されます。たとえば、ユーザー テーブル内のmarriedToという列は対称関係として定義でき、列homes はFOAF 語彙のfoaf:homepage というプロパティに変換できるため、逆関数プロパティとして適格になります。次に、ユーザーテーブルの各エントリをクラス foaf:Person (オントロジー Population) のインスタンスにすることができます。さらに、手動で作成されたルール(status_idが 2 の場合、エントリは Teacher クラスに属します)または(半)自動化された方法(オントロジー学習)によって、 status_idからドメイン知識(オントロジーの形式)を作成できます。変換の例を次に示します。
: Peter : marriedTo : Mary .
: marriedTo a owl : SymmetricProperty .
: Peter foaf :ホームページ <http://example.org/Peters_page> .
: Peter a foaf : Person .
: Peter a : Student .
: Claus a : Teacher .
構造化されたソースからRDFへの抽出
RDB テーブル/ビューから RDF エンティティ/属性/値への 1:1 マッピング
問題領域の RDB 表現を構築する場合、多くの場合、出発点はエンティティ リレーションシップ ダイアグラム (ERD) です。通常、各エンティティはデータベース テーブルとして表現され、エンティティの各属性はそのテーブル内の列になり、エンティティ間の関係は外部キーによって示されます。各テーブルは通常、特定のエンティティ クラスを定義し、各列はその属性の 1 つになります。テーブルの各行は、主キーによって一意に識別されるエンティティ インスタンスを記述します。テーブル行は、集合的にエンティティ セットを記述します。同じエンティティ セットの同等の RDF 表現では、次のようになります。
- 表の各列は属性(述語など)である。
- 各列の値は属性値(つまりオブジェクト)です。
- 各行キーはエンティティID(つまり、件名)を表します。
- 各行はエンティティインスタンスを表す
- 各行 (エンティティ インスタンス) は、共通の主題 (エンティティ ID) を持つトリプルのコレクションによって RDF で表されます。
したがって、RDF セマンティクスに基づいて同等のビューをレンダリングするための基本的なマッピング アルゴリズムは次のようになります。
- 各テーブルにRDFSクラスを作成する
- すべての主キーと外部キーをIRIに変換する
- 各列に述語IRIを割り当てる
- 各行にrdf:type述語を割り当て、それを表に対応するRDFSクラスIRIにリンクする
- 主キーまたは外部キーの一部ではない各列について、主キーの IRI を主語、列の IRI を述語、列の値を目的語として含むトリプルを構築します。
この基本的な、あるいは直接的なマッピングについての初期の言及は、ティム・バーナーズ=リーによるERモデルとRDFモデルの比較に見ることができます。 [4]
リレーショナルデータベースからRDFへの複雑なマッピング
前述の 1:1 マッピングは、レガシー データを RDF として直接的に公開しますが、追加の改良を加えることで、特定のユース ケースに応じた RDF 出力の有用性を向上させることができます。通常、エンティティ リレーションシップ ダイアグラム (ERD) をリレーショナル テーブルに変換するときに情報が失われるため (詳細は、オブジェクト リレーショナル インピーダンス ミスマッチを参照)、リバース エンジニアリングする必要があります。概念的には、抽出のアプローチには 2 つの方向があります。最初の方向では、特定のデータベース スキーマから OWL スキーマを抽出または学習します。初期のアプローチでは、手動で作成された一定量のマッピング ルールを使用して、1:1 マッピングを改良していました。[5] [6] [7]より複雑な方法では、ヒューリスティックまたは学習アルゴリズムを使用してスキーマ情報を誘導します (方法はオントロジー学習と重複します)。いくつかのアプローチはSQLスキーマ[8]に固有の構造から情報を抽出しようとしますが(外部キーの分析など)、他のアプローチはテーブルの内容と値を分析して概念階層を作成します[9](値の少ない列はカテゴリになる候補です)。2番目の方向は、スキーマとその内容を既存のドメインオントロジーにマッピングしようとします(オントロジーの調整も参照)。ただし、適切なドメインオントロジーが存在しないことが多く、最初に作成する必要があります。
テキスト
XML はツリー構造なので、グラフ構造の RDF であらゆるデータを簡単に表現できます。XML2RDF は、RDF 空白ノードを使用して XML 要素と属性を RDF プロパティに変換するアプローチの一例です。ただし、リレーショナル データベースの場合、トピックはより複雑です。リレーショナル テーブルでは、主キーは抽出されたトリプルの主語になる理想的な候補です。ただし、XML 要素は、コンテキストに応じて、トリプルの主語、述語、または目的語に変換できます。XSLTは、 XML を手動で RDF に変換する標準変換言語として使用できます。
方法/ツールの調査
自然言語ソースからの抽出
ビジネス文書に含まれる情報の大部分(約 80% [10])は自然言語でエンコードされているため、構造化されていません。非構造化データは知識抽出にとってむしろ課題となるため、より洗練された方法が必要であり、一般的には構造化データに比べて結果が悪くなる傾向があります。ただし、抽出された知識を大量に取得できる可能性は、抽出の複雑さの増加と品質の低下を補うはずです。以下では、自然言語ソースは、データがプレーンテキストとして非構造化形式で提供される情報ソースとして理解されます。指定されたテキストがマークアップ文書(HTML 文書など)にさらに埋め込まれている場合、前述のシステムは通常、マークアップ要素を自動的に削除します。
言語注釈 / 自然言語処理 (NLP)
知識抽出の前処理ステップとして、1 つまたは複数のNLPツールによる言語注釈の実行が必要になる場合があります。NLP ワークフローの個々のモジュールは通常、入力と出力にツール固有の形式に基づいて構築されますが、知識抽出のコンテキストでは、言語注釈を表す構造化された形式が適用されています。
知識抽出に関連する一般的な NLP タスクは次のとおりです。
- 品詞タグ付け
- 見出し語化 (LEMMA) または語幹化 (STEM)
- 語義の曖昧さ回避(WSD、以下の意味注釈に関連)
- 固有表現抽出 (NER、下記の IE も参照)
- 構文解析、多くの場合構文依存性(DEP)を採用
- 浅い構文解析(CHUNK):パフォーマンスが問題となる場合、チャンク化により名詞やその他のフレーズを高速に抽出できる。
- アナフォラ解決(下記の IE での共参照解決を参照。ただし、ここではエンティティの言及とエンティティの抽象表現の間ではなく、テキストの言及の間にリンクを作成するタスクとして見なされます)
- 意味的役割ラベル付け(SRL、関係抽出に関連。以下で説明する意味的注釈と混同しないでください)
- 談話解析(異なる文間の関係、実際のアプリケーションではほとんど使用されない)
NLP では、このようなデータは通常、TSV 形式 (区切り文字として TAB を使用する CSV 形式) で表され、CoNLL 形式と呼ばれることもあります。知識抽出ワークフローでは、このようなデータの RDF ビューが次のコミュニティ標準に従って作成されています。
- NLP交換フォーマット(NIF、多くの頻繁に使用される注釈タイプ用)[11] [12]
- ウェブアノテーション(WA、エンティティリンクによく使用される)[13]
- CoNLL-RDF(元々TSV形式で表現された注釈用)[14] [15]
その他のプラットフォーム固有の形式としては、
- LAPPS交換フォーマット(LIF、LAPPSグリッドで使用される)[16] [17]
- NLP注釈フォーマット(NAF、NewsReaderワークフロー管理システムで使用)[18] [19]
従来の情報抽出(IE)
従来の情報抽出[20]は自然言語処理の技術であり、通常は自然言語テキストから情報を抽出し、適切な方法で構造化します。識別する情報の種類は、プロセスを開始する前にモデルで指定する必要があるため、従来の情報抽出のプロセス全体がドメインに依存します。IEは次の5つのサブタスクに分割されます。
名前付きエンティティ認識のタスクは、テキストに含まれるすべての名前付きエンティティを認識して分類することです (名前付きエンティティを事前定義されたカテゴリに割り当てる)。これは、文法ベースの方法または統計モデルを適用することで機能します。
共参照解決は、NER によって認識されたテキスト内の同等のエンティティを識別します。関連する同等関係には 2 種類あります。1 つ目は、2 つの異なる表現エンティティ (IBM Europe と IBM など) 間の関係に関連し、2 つ目はエンティティとそのアナフォリック参照(it と IBM など) 間の関係に関連します。どちらの種類も共参照解決によって認識できます。
テンプレート要素の構築中に、IE システムは、NER と CO によって認識されるエンティティの記述プロパティを識別します。これらのプロパティは、赤や大きいなどの一般的な品質に対応します。
テンプレート関係構築は、テンプレート要素間に存在する関係を識別します。これらの関係には、works-for や located-in など、いくつかの種類がありますが、ドメインと範囲の両方がエンティティに対応するという制限があります。
テンプレート シナリオでは、テキストで説明されている生成イベントは、NER と CO によって認識されるエンティティと TR によって識別される関係に関して識別および構造化されます。
オントロジーベースの情報抽出 (OBIE)
オントロジーベースの情報抽出[10]は情報抽出のサブフィールドであり、少なくとも1つのオントロジーを使用して自然言語テキストから情報を抽出するプロセスをガイドします。OBIEシステムは、従来の情報抽出方法を使用して、テキスト内で使用されているオントロジーの概念、インスタンス、関係を識別し、プロセス後にオントロジーに構造化されます。したがって、入力オントロジーは抽出される情報のモデルを構成します。[21]
オントロジー学習 (OL)
オントロジー学習とは、自然言語テキストから対応するドメインの用語を抽出することを含む、オントロジーの自動または半自動作成です。オントロジーを手動で構築するのは非常に労力と時間がかかるため、プロセスを自動化する動機は大きいです。
セマンティックアノテーション(SA)
セマンティックアノテーション[22]では、自然言語テキストにメタデータ(多くの場合RDFaで表される)が追加され、含まれる用語の意味を機械が理解できるようになります。このプロセスは一般的に半自動で行われ、語彙用語とオントロジーの概念などのリンクが確立されるという意味で知識が抽出されます。このようにして、処理されたコンテキストにおける用語のどの意味が意図されていたかという知識が得られ、したがってテキストの意味は推論能力を備えた機械可読データに基づいています。セマンティックアノテーションは通常、次の2つのサブタスクに分割されます。
用語抽出レベルでは、テキストから語彙用語が抽出されます。この目的のために、トークナイザーは最初に単語の境界を決定し、略語を解決します。その後、ドメイン固有の語彙集を使用して、概念に対応するテキストの用語が抽出され、エンティティ リンクでこれらがリンクされます。
エンティティリンク[23]では、ソーステキストから抽出された語彙用語と、DBpediaなどのオントロジーまたは知識ベースの概念との間のリンク が確立されます。このため、候補概念は、辞書の助けを借りて、用語のいくつかの意味に対して適切に検出されます。最後に、用語のコンテキストが分析され、最も適切な曖昧さ解消が決定され、用語が正しい概念に割り当てられます。
知識抽出の文脈における「セマンティック アノテーション」は、自然言語処理で理解されるセマンティック解析(「セマンティック アノテーション」とも呼ばれる) と混同しないように注意してください。セマンティック解析は、自然言語の完全で機械可読な表現を目的としていますが、知識抽出の意味でのセマンティック アノテーションは、その非常に基本的な側面のみを扱います。
ツール
自然言語テキストから知識を抽出するツールを分類するには、次の基準を使用できます。
次の表は、自然言語ソースから知識を抽出するためのいくつかのツールの特徴を示しています。
知識の発見
知識発見とは、大量のデータからデータに関する知識 とみなせるパターンを自動的に検索するプロセスを指します。 [44]入力データから知識を導き出す と説明されることが多いです。知識発見はデータマイニングの分野から発展したもので、方法論と用語の両面でデータマイニングと密接に関連しています。[45]
データマイニングの最もよく知られている分野は知識発見であり、データベースにおける知識発見(KDD)とも呼ばれています。他の多くの形式の知識発見と同様に、入力データの抽象化を作成します。プロセスを通じて得られた知識は、さらなる使用と発見に使用できる追加データになる可能性があります。知識発見の結果は実用的なものではないことがよくありますが、ドメイン駆動型データマイニングなどの手法[46]は、実用的な知識と洞察を発見して提供することを目的としています。
知識発見のもう 1 つの有望な応用分野は、既存のソフトウェア成果物の理解を伴うソフトウェアの最新化、弱点の発見、コンプライアンスの分野です。このプロセスは、リバース エンジニアリングの概念に関連しています。通常、既存のソフトウェアから得られた知識は、必要に応じて特定のクエリを実行できるモデルの形式で提示されます。エンティティ リレーションシップは、既存のソフトウェアから得られた知識を表す一般的な形式です。Object Management Group (OMG)は、既存のコードで知識発見を実行する目的でソフトウェア資産とその関係のオントロジーを定義する Knowledge Discovery Metamodel (KDM) 仕様を開発しました。既存のソフトウェア システムからの知識発見(ソフトウェア マイニングとも呼ばれる) は、データ マイニングと密接に関連しています。既存のソフトウェア成果物には、リスク管理とビジネス価値にとって非常に大きな価値があり、ソフトウェア システムの評価と進化の鍵となるためです。個々のデータ セットをマイニングする代わりに、ソフトウェア マイニングでは、プロセスフロー (データ フロー、制御フロー、呼び出しマップなど)、アーキテクチャ、データベース スキーマ、ビジネス ルール/用語/プロセスなどのメタデータに焦点を当てます。
入力データ
出力形式
- データモデル
- メタデータ
- メタモデル
- オントロジー
- 知識表現
- ナレッジタグ
- ビジネスルール
- 知識発見メタモデル(KDM)
- ビジネスプロセスモデリング表記法(BPMN)
- 中間表現
- リソース記述フレームワーク(RDF)
- ソフトウェアメトリクス
参照
さらに読む
- Chicco, D; Masseroli, M (2016). 「遺伝子機能注釈のオントロジーベースの予測と優先順位付け」. IEEE/ACM Transactions on Computational Biology and Bioinformatics . 13 (2): 248–260. doi :10.1109/TCBB.2015.2459694. PMID 27045825. S2CID 2795344.
参考文献
- ^ RDB2RDF ワーキング グループ、Web サイト: http://www.w3.org/2001/sw/rdb2rdf/、憲章: http://www.w3.org/2009/08/rdb2rdf-charter、R2RML: RDB から RDF へのマッピング言語: http://www.w3.org/TR/r2rml/
- ^ LOD2 EU 成果物 3.1.1 構造化ソースからの知識抽出 http://static.lod2.eu/Deliverables/deliverable-3.1.1.pdf 2011-08-27 にWayback Machineでアーカイブ
- ^ 「Life in the Linked Data Cloud」 www.opencalais.com。2009 年 11 月 24 日にオリジナルからアーカイブ。2009年 11 月 10 日に取得。Wikipedia
には DBpedia と呼ばれる Linked Data の双子があります。DBpedia には Wikipedia と同じ構造化された情報がありますが、機械可読形式に変換されています。
- ^ ab Tim Berners-Lee (1998)、「セマンティック ウェブ上のリレーショナル データベース」。2011 年 2 月 20 日閲覧。
- ^ Hu 他 (2007)、「リレーショナル データベース スキーマとオントロジー間の単純なマッピングの検出」、第 6 回国際セマンティック ウェブ カンファレンス (ISWC 2007)、第 2 回アジア セマンティック ウェブ カンファレンス (ASWC 2007) の議事録、LNCS 4825、225 〜 238 ページ、韓国、釜山、2007 年 11 月 11 〜 15 日。http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.97.6934&rep=rep1&type=pdf
- ^ R. Ghawi および N. Cullot (2007)、「セマンティック相互運用性のためのデータベースからオントロジーへのマッピング生成」。データベース相互運用性に関する第 3 回国際ワークショップ (InterDB 2007)。http://le2i.cnrs.fr/IMG/publications/InterDB07-Ghawi.pdf
- ^ Li et al. (2005)「セマンティック ウェブの半自動オントロジー取得方法」、WAIM、Lecture Notes in Computer Science の第 3739 巻、209-220 ページ。Springer。doi :10.1007/11563952_19
- ^ Tirmizi 他 (2008)、「SQL アプリケーションのセマンティック ウェブへの変換」、Lecture Notes in Computer Science、Volume 5181/2008 (データベースおよびエキスパート システム アプリケーション)。http://citeseer.ist.psu.edu/viewdoc/download;jsessionid=15E8AB2A37BD06DAE59255A1AC3095F0?doi=10.1.1.140.3169&rep=rep1&type=pdf
- ^ Farid Cerbah (2008)。「リレーショナル データベースからの高度に構造化されたセマンティック リポジトリの学習」、セマンティック ウェブ: 研究とアプリケーション、コンピュータ サイエンスの講義ノート第 5021 巻、Springer、ベルリン / ハイデルベルク http://www.tao-project.eu/resources/publications/cerbah-learning-highly-structured-semantic-repositories-from-relational-databases.pdf 2011 年 7 月 20 日にWayback Machineにアーカイブされました
- ^ ab Wimalasuriya, Daya C.; Dou, Dejing (2010). 「オントロジーベースの情報抽出: 現在のアプローチの概要と調査」、Journal of Information Science、36(3)、p. 306 - 323、http://ix.cs.uoregon.edu/~dou/research/papers/jis09.pdf (取得日: 2012 年 6 月 18 日)。
- ^ 「NLP Interchange Format (NIF) 2.0 - 概要とドキュメント」。persistence.uni-leipzig.org 。 2020年6月5日閲覧。
- ^ Hellmann, Sebastian; Lehmann, Jens; Auer, Sören; Brümmer, Martin (2013). 「Linked Data を使用した NLP の統合」。Alani, Harith; Kagal, Lalana; Fokoue, Achille; Groth, Paul; Biemann, Chris; Parreira, Josiane Xavier; Aroyo, Lora; Noy, Natasha; Welty, Chris (編)。セマンティックウェブ – ISWC 2013。コンピュータ サイエンスの講義ノート。第 7908 巻。ベルリン、ハイデルベルク: Springer。pp. 98–113。doi : 10.1007 / 978-3-642-41338-4_7。ISBN 978-3-642-41338-4。
- ^ Verspoor, Karin; Livingston, Kevin (2012 年 7 月)。「セマンティック ウェブ上の学術的注釈形式への言語注釈の適応に向けて」。第 6 回言語注釈ワークショップの議事録。済州島、大韓民国: 計算言語学協会: 75–84 ページ。
- ^ acoli-repo/conll-rdf、ACoLi、2020-05-27、2020-06-05取得
- ^ Chiarcos, Christian; Fäth, Christian (2017). 「CoNLL-RDF: NLP フレンドリーな方法でリンクされたコーパス」。Gracia, Jorge、Bond, Francis、McCrae, John P.、Buitelaar, Paul、Chiarcos, Christian、Hellmann, Sebastian (編)。言語、データ、知識。コンピュータサイエンスの講義ノート。第 10318 巻。Cham: Springer International Publishing。pp. 74–88。doi :10.1007 / 978-3-319-59888-8_6。ISBN 978-3-319-59888-8。
- ^ Verhagen, Marc; Suderman, Keith; Wang, Di; Ide, Nancy; Shi, Chunqi; Wright, Jonathan; Pustejovsky, James (2016). 「LAPPS 交換フォーマット」。村上洋平、林東輝 (編)。ワールドワイド言語サービス インフラストラクチャ。コンピュータ サイエンスの講義ノート。第 9442 巻。Cham: Springer International Publishing。pp. 33–47。doi : 10.1007 / 978-3-319-31468-6_3。ISBN 978-3-319-31468-6。
- ^ 「言語アプリケーショングリッド | 自然言語処理の開発と研究のためのWebサービスプラットフォーム」。2020年6月5日閲覧。
- ^ newsreader/NAF、NewsReader、2020-05-25、2020-06-05取得
- ^ Vossen, Piek; Agerri, Rodrigo; Aldabe, Itziar; Cybulska, Agata; van Erp, Marieke; Fokkens, Antske; Laparra, Egoitz; Minard, Anne-Lyse; Palmero Aprosio, Alessio; Rigau, German; Rospocher, Marco (2016-10-15). 「NewsReader: 言語横断型読み取りマシンの知識リソースを使用して大量のニュース ストリームからより多くの知識を生成する」. Knowledge-Based Systems . 110 : 60–85. doi : 10.1016/j.knosys.2016.07.013 . ISSN 0950-7051.
- ^ Cunningham, Hamish (2005). 「情報抽出、自動」、言語と言語学の百科事典、2、p. 665 - 677、http://gate.ac.uk/sale/ell2/ie/main.pdf (取得日: 2012 年 6 月 18 日)。
- ^ Chicco, D; Masseroli, M (2016). 「遺伝子機能注釈のオントロジーベースの予測と優先順位付け」. IEEE/ACM Transactions on Computational Biology and Bioinformatics . 13 (2): 248–260. doi :10.1109/TCBB.2015.2459694. PMID 27045825. S2CID 2795344.
- ^ Erdmann, M.; Maedche, Alexander; Schnurr, H.-P.; Staab, Steffen (2000). 「手動から半自動セマンティック注釈へ: オントロジーベースのテキスト注釈ツールについて」、COLING の議事録、http://www.ida.liu.se/ext/epa/cis/2001/002/paper.pdf (取得日: 2012 年 6 月 18 日)。
- ^ Rao, Delip; McNamee, Paul; Dredze, Mark (2011). 「エンティティ リンク: ナレッジ ベース内の抽出エンティティの検索」、マルチソース、マルチ言語の情報抽出と要約、http://www.cs.jhu.edu/~delip/entity-linking.pdf [永久リンク切れ ] (取得日: 2012 年 6 月 18 日).
- ^ Rocket Software, Inc. (2012). 「テキストから情報を抽出する技術」、http://www.rocketsoftware.com/products/aerotext 2013-06-21 にWayback Machineにアーカイブ(取得日: 2012 年 6 月 18 日)。
- ^ Orchestr8 (2012):「AlchemyAPI の概要」、http://www.alchemyapi.com/api 2016 年 5 月 13 日に Wayback Machineにアーカイブ(取得日: 2012 年 6 月 18 日)。
- ^ シェフィールド大学 (2011)。「ANNIE: ほぼ新しい情報抽出システム」、http://gate.ac.uk/sale/tao/splitch6.html#chap:annie (取得日: 2012 年 6 月 18 日)。
- ^ ILP Network of Excellence. 「ASIUM (LRI)」、http://www-ai.ijs.si/~ilpnet2/systems/asium.html (取得日: 2012 年 6 月 18 日)。
- ^ Attensity (2012). 「Exhaustive Extraction」、http://www.attensity.com/products/technology/semantic-server/exhaustive-extraction/ 2012-07-11 にWayback Machineにアーカイブ(取得日: 2012 年 6 月 18 日)。
- ^ Mendes, Pablo N.; Jakob, Max; Garcia-Sílva, Andrés; Bizer; Christian (2011). 「DBpedia Spotlight: Shedding Light on the Web of Documents」、第 7 回国際セマンティック システム会議の議事録、p. 1 - 8、http://www.wiwiss.fu-berlin.de/en/institute/pwo/bizer/research/publications/Mendes-Jakob-GarciaSilva-Bizer-DBpediaSpotlight-ISEM2011.pdf 2012 年 4 月 5 日にWayback Machineにアーカイブ(取得日: 2012 年 6 月 18 日)。
- ^ ガンガミ、アルド;プレスッティ、ヴァレンティーナ。レフォルジャート・レクペロ、ディエゴ;ヌッツォレーゼ、アンドレア・ジョバンニ。ドライッキオ、フランチェスコ。モンジョヴィ、ミサエル (2016)。 「FRED を使用したセマンティック Web マシン読み取り」、セマンティック Web ジャーナル、doi :10.3233/SW-160240、http://www.semantic-web-journal.net/system/files/swj1379.pdf
- ^ Adrian, Benjamin; Maus, Heiko; Dengel, Andreas (2009). 「iDocument: オントロジーを使用したテキストからの情報抽出」、http://www.dfki.uni-kl.de/~maus/dok/AdrianMausDengel09.pdf (取得日: 2012 年 6 月 18 日).
- ^ SRA International, Inc. (2012). 「NetOwl Extractor」、http://www.sra.com/netowl/entity-extraction/ 2012-09-24 にWayback Machineにアーカイブ(取得日: 2012 年 6 月 18 日)。
- ^ Fortuna, Blaz; Grobelnik, Marko; Mladenic, Dunja (2007). 「OntoGen: 半自動オントロジー エディター」、2007 年ヒューマン インターフェイス カンファレンスの議事録、パート 2、p. 309 - 318、http://analytics.ijs.si/~blazf/papers/OntoGen2_HCII2007.pdf (取得日: 2012 年 6 月 18 日)。
- ^ Missikoff, Michele; Navigli, Roberto; Velardi, Paola (2002). 「Web オントロジー学習およびエンジニアリングへの統合アプローチ」、Computer、35(11)、p. 60 - 63、http://wwwusers.di.uniroma1.it/~velardi/IEEE_C.pdf (取得日: 2012 年 6 月 18 日)。
- ^ McDowell, Luke K.; Cafarella, Michael (2006). 「Ontology-driven Information Extraction with OntoSyphon」、第 5 回国際セマンティック ウェブ会議の議事録、p. 428 - 444、http://turing.cs.washington.edu/papers/iswc2006McDowell-final.pdf (取得日: 2012 年 6 月 18 日)。
- ^ Yildiz, Burcu; Miksch, Silvia (2007). 「ontoX - オントロジー駆動型情報抽出法」、2007 年国際計算科学およびその応用会議の議事録、3、p. 660 - 673、http://publik.tuwien.ac.at/files/pub-inf_4769.pdf (取得日: 2012 年 6 月 18 日)。
- ^ semanticweb.org (2011). 「PoolParty Extractor」、http://semanticweb.org/wiki/PoolParty_Extractor 2016-03-04 にWayback Machineにアーカイブ(取得日: 2012 年 6 月 18 日).
- ^ Dill, Stephen; Eiron, Nadav; Gibson, David; Gruhl, Daniel; Guha, R.; Jhingran, Anant; Kanungo, Tapas; Rajagopalan, Sridhar; Tomkins, Andrew; Tomlin, John A.; Zien, Jason Y. (2003). 「SemTag と Seeker: 自動セマンティック アノテーションによるセマンティック Web のブートストラップ」、第 12 回国際ワールド ワイド ウェブ会議の議事録、p. 178 - 186、http://www2003.org/cdrom/papers/refereed/p831/p831-dill.html (取得日: 2012 年 6 月 18 日).
- ^ Uren, Victoria; Cimiano, Philipp; Iria, José; Handschuh, Siegfried; Vargas-Vera, Maria; Motta, Enrico; Ciravegna, Fabio (2006). 「知識管理のためのセマンティック注釈: 要件と最新技術の調査」、Web セマンティクス: World Wide Web 上の科学、サービス、エージェント、4(1)、p. 14 - 28、http://staffwww.dcs.shef.ac.uk/people/J.Iria/iria_jws06.pdf [ permanent dead link ]、(取得日: 2012 年 6 月 18 日).
- ^ Cimiano, Philipp; Völker, Johanna (2005). 「Text2Onto - オントロジー学習とデータ駆動型変更検出のフレームワーク」、情報システムへの自然言語の応用に関する第 10 回国際会議の議事録、3513、p. 227 - 238、http://www.cimiano.de/Publications/2005/nldb05/nldb05.pdf (取得日: 2012 年 6 月 18 日)。
- ^ Maedche, Alexander; Volz, Raphael (2001). 「オントロジー抽出およびメンテナンスフレームワーク Text-To-Onto」、IEEE 国際データマイニング会議の議事録、http://users.csc.calpoly.edu/~fkurfess/Events/DM-KM-01/Volz.pdf (取得日: 2012 年 6 月 18 日)。
- ^ マシン リンク。「Linked Open Data クラウドに接続します」、http://thewikimachine.fbk.eu/html/index.html 2012 年 7 月 19 日にWayback Machineにアーカイブ(取得日: 2012 年 6 月 18 日)。
- ^ Inxight Federal Systems (2008)。「Inxight ThingFinder および ThingFinder Professional」、http://inxightfedsys.com/products/sdks/tf/、Wayback Machineで 2012 年 6 月 29 日にアーカイブ(取得日: 2012 年 6 月 18 日)。
- ^ Frawley William. F. et al. (1992)、「データベースにおける知識の発見:概要」、AI Magazine (Vol 13、No 3)、57-70 (オンライン完全版:http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1011 2016-03-04 にWayback Machineでアーカイブ)
- ^ Fayyad U. et al. (1996)、「From Data Mining to Knowledge Discovery in Databases」、AI Magazine (Vol 17, No 3)、37-54 (オンライン完全版: http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1230 2016-05-04 にWayback Machineでアーカイブ
- ^ Cao, L. (2010). 「ドメイン駆動型データマイニング:課題と展望」. IEEE Transactions on Knowledge and Data Engineering . 22 (6): 755–769. CiteSeerX 10.1.1.190.8427 . doi :10.1109/tkde.2010.32. S2CID 17904603.
