情報抽出 (IE )とは、 非構造化 および/または半構造化された機械可読 文書やその他の電子的に表現されたソースから構造化された情報を 自動的に抽出するタスクです。通常、これには自然言語処理 (NLP)による人間の言語テキストの処理が含まれます。 [ 1 ] マルチメディア 文書処理における最近の活動、例えば画像/音声/動画/文書からの自動注釈やコンテンツ抽出などは、情報抽出と見なすことができます。
近年の自然言語処理技術の進歩により、以前に比べてパフォーマンスが大幅に向上しました。[ 2 ] 一例として、通信社報道から企業合併を抽出することが挙げられます。これは、形式的な関係式で表されます。
合併 ( c o m p 1 n y 1 、 c o m p 1 n y 2 、 d 1 t e ) {\displaystyle \operatorname {MergerBetween} (\mathrm {会社} _{1},\mathrm {会社} _{2},\mathrm {日付} )} 、オンラインニュースの文章から例を挙げると:
「昨日、ニューヨークに拠点を置くFoo Inc.は、Bar Corp.の買収を発表した。」 情報工学(IE)の大きな目標は、これまで構造化されていなかったデータに対して計算を実行できるようにすることです。より具体的な目標は、入力データの論理形式 について自動的に推論できるようにすることです。構造化データとは、選択された対象ドメインから意味的に明確に定義されたデータであり、カテゴリと コンテキスト に基づいて解釈されます。
情報抽出は、テキストの送信、保存、表示を超えて、テキスト管理のための自動化された方法を考案するという問題に取り組む、より大きなパズルのピースです。情報検索 (IR) [ 3 ] の分野では、大規模なドキュメントコレクションをインデックス化し、ドキュメントを分類するための、統計的な手法が一般的に開発されています。もう 1 つの補完的なアプローチは、自然言語処理 (NLP) であり、タスクの規模を考慮すると、人間の言語処理をモデル化する問題をかなりの成功を収めて解決しています。難易度と重点の両面で、IE は IR と NLP の中間のタスクを扱います。入力に関して、IE は、各ドキュメントがテンプレートに従う一連のドキュメントの存在を前提としています。つまり、1 つ以上のエンティティまたはイベントを、他のドキュメントと同様の方法で記述しますが、詳細が異なります。例として、ラテンアメリカのテロに関するニュース記事のグループを考えてみましょう。各記事は、1 つ以上のテロ行為に基づいていると想定されます。また、任意の情報抽出タスクに対してテンプレートを定義します。テンプレートとは、単一の文書に含まれる情報を保持するためのケースフレーム(またはケースフレームのセット)です。テロの例では、テンプレートには、テロ行為の実行犯、被害者、武器、および事件発生日に対応するスロットが含まれます。この問題に対する情報抽出システムは、攻撃に関する記事を、このテンプレートのスロットに対応するデータを見つけるのに十分な程度に「理解」するだけで済みます。
歴史 情報抽出は、自然言語処理の黎明期である1970年代後半に遡ります。[ 4 ] 1980年代半ばの初期の商用システムとしては、金融トレーダーにリアルタイムの金融ニュース を提供することを目的として、カーネギーグループ社がロイター 向けに構築したJASPERがあります。[ 5 ]
1987年に始まったIEは、一連のメッセージ理解会議 によって促進されました。MUCは、以下の領域に焦点を当てた競争ベースの会議です[ 6 ] 。
MUC-1(1987年)、MUC-3(1989年):海軍作戦メッセージ。 MUC-3(1991)、MUC-4(1992):ラテンアメリカ諸国におけるテロリズム。 MUC-5(1993):合弁事業 とマイクロエレクトロニクス分野。 MUC-6(1995):経営陣の変更に関するニュース記事。 MUC-7(1998):衛星打ち上げ報告。 米国防高等研究計画局(DARPA )からも多大な支援があった。DARPAは、政府のアナリストが行う、テロとの関連性を調べるために新聞をスキャンするといった、ありふれた作業を自動化することを望んでいた。
タスクとサブタスク テキストへの情報抽出の適用は、自由記述テキストに含まれる情報を構造化して表示するためのテキスト簡略化 の問題と関連しています。全体的な目標は、文を処理するために機械がより容易に読み取れるテキストを作成することです。典型的な情報抽出タスクとサブタスクには、次のものがあります。
テンプレートへの入力:文書から固定されたフィールドセットを抽出する。例えば、テロ攻撃に関する新聞記事から、犯人、被害者、時刻などを抽出する。 イベント抽出:入力文書から、0個以上のイベントテンプレートを出力します。例えば、新聞記事には複数のテロ攻撃について記述されている場合があります。 知識ベースの 構築:一連の文書に基づいて事実のデータベースを構築します。通常、データベースは(エンティティ1、関係、エンティティ2)の3つ組の形式になります。例:(バラク・オバマ 、配偶者、ミシェル・オバマ ) 固有表現認識 : ドメインの既存の知識または他の文から抽出された情報を使用して、既知のエンティティ名 (人名や組織名)、地名、時間表現、および特定の種類の数値表現を認識する。[ 10 ] 通常、認識タスクには、抽出されたエンティティに一意の識別子を割り当てることが含まれます。より単純なタスクは固有表現検出 であり、エンティティインスタンスに関する既存の知識を持たずにエンティティを検出することを目的としています。たとえば、「M. Smith は釣りが好きです」という文を処理する場合、固有表現検出は 、「M. Smith」というフレーズが人を指していることを検出すること を意味しますが、その文が言及している特定の人である (または「かもしれない」) 特定のM. Smith についての知識を必ずしも持っている (または使用している) 必要はありません。共参照解決:テキストエンティティ間の 共参照 および照応 リンクの検出。IEタスクでは、これは通常、以前に抽出された固有表現間のリンクを見つけることに限定されます。たとえば、「International Business Machines」と「IBM」は同じ実在のエンティティを指します。「M. Smithは釣りが好きです。しかし、彼は自転車に乗るのが好きではありません」という2つの文を取り上げると、「彼」が以前に検出された人物「M. Smith」を指していることを検出できると便利です。関係抽出 :エンティティ間の関係の識別[ 10 ] 、例えば: 人物は組織に勤務している(「ビルはIBMに勤務している」という文から抜粋)。 場所に位置する人物(「ビルはフランスにいる」という文から抽出) 半構造化情報抽出とは、出版によって失われた何らかの情報構造を復元しようとする情報抽出手法全般を指す場合がある。例えば、以下のようなものが挙げられる。 表の抽出:文書から表を見つけて抽出する。[ 12 ] テーブル情報抽出 :テーブルから構造化された方法で情報を抽出する。このタスクはテーブル抽出よりも複雑で、テーブル抽出は最初のステップにすぎず、セル、行、列の役割を理解し、テーブル内の情報をリンクし、テーブルに表示されている情報を理解することは、テーブル情報抽出に必要な追加のタスクである。[ 13 ] [ 14 ] コメント抽出 :記事の実際のコンテンツからコメントを抽出し、各文の著者間のリンクを復元する。 言語と語彙の分析 音声抽出 テンプレートベースの音楽抽出:特定のレパートリーから取得した音声信号から関連する特徴を見つける。例えば[ 15 ]、 打楽器音の発生のタイムインデックスを抽出して、楽曲の本質的なリズム要素を表すことができる。 なお、このリストは網羅的なものではなく、情報工学(IE)活動の正確な意味は一般的に合意されているわけではなく、より広範な目標を達成するために、多くの手法が複数のIEサブタスクを組み合わせていることに注意してください。機械学習、統計分析、自然言語処理は、IEにおいてよく用いられます。
非テキスト文書における情報抽出は、研究分野においてますます注目を集めており、マルチメディア文書から抽出された情報も、テキストの場合と同様に高レベルの構造で表現できるようになっている。これは、多様な種類の文書や情報源から抽出された情報の融合へと自然につながる。
ワールドワイドウェブアプリケーション IE(情報抽出)はMUC会議の焦点となってきました。しかし、Webの普及に伴い、オンラインで入手可能な 膨大な量のデータ に対処するのに役立つIEシステムの開発の必要性が高まっています。オンラインテキストからIEを実行するシステムは、低コスト、開発の柔軟性、新しいドメインへの容易な適応という要件を満たす必要があります。MUCシステムはこれらの基準を満たしていません。さらに、非構造化テキストに対して実行される言語分析は、オンラインテキストで利用可能なHTML/ XML タグやレイアウト形式を活用していません。その結果、Web上のIEでは、特定のページのコンテンツを抽出する高精度ルールのセットであるラッパーを 使用した、言語的に負荷の少ないアプローチが開発されました。ラッパーを手動で開発することは、時間のかかる作業であり、高度な専門知識が必要であることが判明しています。教師あり学習 または教師なし学習のいずれかの 機械学習 技術が、このようなルールを自動的に生成するために使用されています。
ラッパーは 通常、製品カタログや電話帳など、構造化されたWebページの集合体を扱います。しかし、Web上でよく見られるように、テキストの構造が緩い場合には、ラッパーは機能しません。近年の適応型情報抽出 への取り組みは、構造化されたテキストから、一般的なラッパーでは対応できないほぼ自由形式のテキストまで、混合型を含む様々な種類のテキストを処理できる情報抽出システムの開発を促しています。このようなシステムは、浅い自然言語知識を活用できるため、構造化されていないテキストにも適用可能です。
最近の発展としては、ブラウザでウェブページをレンダリングし、レンダリングされたウェブページ内の領域の近接性に基づいてルールを作成するビジュアル情報抽出[ 16 ] [ 17 ] があります。これは、視覚的なパターンを示す可能性があるものの、HTMLソースコードには識別可能なパターンがない複雑なウェブページからエンティティを抽出するのに役立ちます。
アプローチ 現在、以下の標準的なアプローチが広く受け入れられています。
手書きの正規表現(または入れ子になった正規表現のグループ) 分類器の使用 配列モデル IEには、前述の標準的なアプローチを組み合わせたハイブリッドアプローチなど、他にも数多くの手法が存在する。
無料またはオープンソースのソフトウェアおよびサービス
関連項目 抽出 マイニング、クローリング、スクレイピング、認識 検索と翻訳 一般的な リスト
参考文献 ↑ name=Kariampuzha2023 Kariampuzha, William; Alyea, Gioconda; Qu, Sue; Sanjak, Jaleal; Mathé, Ewy; Sid, Eric; Chatelaine, Haley; Yadaw, Arjun; Xu, Yanji; Zhu, Qian (2023). "Precision information extraction for rare disease epidemiology at scale" . Journal of Translational Medicine . 21 (1): 157. doi : 10.1186/s12967-023-04011-y . PMC 9972634 . PMID 36855134 . ↑ Christina Niklaus、Matthias Cetto、André Freitas、Siegfried Handschuh。2018年。オープン情報抽出に関する調査。第27回国際計算言語学会議議事録 、3866~3878ページ、米国ニューメキシコ州サンタフェ。計算言語学会。 ↑ FREITAG, DAYNE. 「非公式領域における情報抽出のための機械学習」 (PDF) . 2000 Kluwer Academic Publishers. オランダで印刷 。 ↑ Cowie, Jim; Wilks, Yorick (1996). Information Extraction (PDF) . p. 3. CiteSeerX 10.1.1.61.6480 . S2CID 10237124 . 2019年2月20日に オリジナル (PDF) からアーカイブされました 。 ↑ Andersen, Peggy M.; Hayes, Philip J.; Huettner, Alison K.; Schmandt, Linda M.; Nirenburg, Irene B.; Weinstein, Steven P. (1992). "Automatic Extraction of Facts from Press Releases to Generate News Stories" . Proceedings of the third conference on Applied natural language processing - . pp. 170– 177. CiteSeerX 10.1.1.14.7943 . doi : 10.3115/974499.974531 . S2CID 14746386 . ↑ Marco Costantino、Paolo Coletti、『金融における情報抽出』、Wit Press、2008 年。ISBN 978-1-84564-146-7 ↑ 「リンクトデータ - これまでの経緯」 (PDF ) ↑ 「ティム・バーナーズ=リー、次世代ウェブについて」 。 2011年4月10日時点のオリジナルより アーカイブ 。 2010年3月27日 閲覧。 ↑ RK Srihari 、W. Li、C. Niu、T. Cornell、「InfoXtract: カスタマイズ可能な中間レベル情報抽出エンジン」、 Journal of Natural Language Engineering、Cambridge U. Press、14(1)、2008、pp.33-69。1 2 Nguyen, Dat Quoc; Verspoor, Karin (2019). "End-to-end neural relation extraction using deep biaffine attention". Proceedings of the 41st European Conference on Information Retrieval (ECIR) . arXiv : 1812.11275 . doi : 10.1007/978-3-030-15712-8_47 . ↑ Milosevic, Nikola (2018). 生体医学文書の表からの情報抽出に対する多層アプローチ (PDF) (博士論文). マンチェスター大学。 ↑ Milosevic N、Gregson C、Hernandez R、Nenadic G(2016年6月) 「科学文献における表の構造の解明」 『 自然言語処理と情報システム 』Lecture Notes in Computer Science、第21巻、 162~ 174 ページ、 doi : 10.1007/978-3-319-41754-7_14 、 ISBN 978-3-319-41753-0 . S2CID 19538141 . ↑ Milosevic, Nikola (2018). 生体医学文書の表からの情報抽出に対する多層アプローチ (PDF) (博士論文). マンチェスター大学。 ↑ A.Zils、F.Pachet、O.Delerue、F.Gouyon、「ポリフォニック音楽信号からのドラムトラックの自動抽出」、Wayback Machine に2017年8月29日に アーカイブ済み、WedelMusic会議録、ダルムシュタット、ドイツ、2002年。 ↑ チェンタマラクシャン、ヴィジル。デスファンデ、プラサド M;クリシュナプラム、ラグー。バラダラジャン、ラーマクリシュナン。シュトルツェ、クヌート (2015)。 「WYSIWYE: 情報抽出のための空間的およびテキスト的ルールを表現するための代数」。 arXiv : 1506.08454 [ cs.CL ]。 ↑ Baumgartner, Robert; Flesca, Sergio; Gottlob, Georg ( 2001). "Visual Web Information Extraction with Lixto". pp. 119–128 . CiteSeerX 10.1.1.21.8236 . ↑ Peng, F.; McCallum, A. (2006). "条件付き確率場を用いた研究論文からの情報抽出☆". Information Processing & Management . 42 (4): 963. doi : 10.1016/j.ipm.2005.09.002 . ↑ 清水信之、アンドリュー・ハス (2006)。 「経路指示からのフレームベースの知識表現の抽出」 (PDF) 。 2006年9月1日に オリジナル (PDF) からアーカイブ 。 2010年3月27日 に取得。
外部リンク Alias-I「コンペティション」ページ自然言語情報抽出のための学術ツールキットと産業用ツールキットの一覧。 Gabor Melli の IE に関するページ。情報抽出タスクの詳細な説明。