Baike.dev
All toolsAI codingTrendingOpen sourceNewsSubmit
Log in
< Back to tools
E

Event-Extraction

> 编程语言
Open source

近年来事件抽取方法总结,包括中文事件抽取、开放域事件抽取、事件数据生成、跨语言事件抽取、小样本事件抽取、零样本事件抽取等类型,DMCNN、FramNet、DLRNN、DBRNN、GCN、DAG-GRU、JMEE、PLMEE等方法

773 stars0 likes0 views
WebsiteGitHub

About

近年来事件抽取方法总结,包括中文事件抽取、开放域事件抽取、事件数据生成、跨语言事件抽取、小样本事件抽取、零样本事件抽取等类型,DMCNN、FramNet、DLRNN、DBRNN、GCN、DAG-GRU、JMEE、PLMEE等方法

Event-Extraction(事件抽取资料综述总结)更新中...

近年来事件抽取方法总结,包括中文事件抽取、开放域事件抽取、事件数据生成、跨语言事件抽取、小样本事件抽取、零样本事件抽取等类型,DMCNN、FramNet、DLRNN、DBRNN、GCN、DAG-GRU、JMEE、PLMEE等方法。

Table of Contents

  • Define
  • Surveys
  • Models
  • Datasets
  • Future Research Challenges

Define

:arrow_up:

Closed-domain

Closed-domain事件抽取使用预定义的事件模式从文本中发现和提取所需的特定类型的事件。事件模式包含多个事件类型及其相应的事件结构。D.Ahn首先提出将ACE事件抽取任务分成四个子任务:触发词检测、事件/触发词类型识别、事件论元检测和参数角色识别。我们使用ACE术语来介绍如下事件结构:

事件提及

描述事件的短语或句子,包括触发词和几个参数。

事件触发词

最清楚地表达事件发生的主要词,一般指动词或名词。

事件论元

一个实体,时间表达式,作为参与者的值和在事件中具有特定角色的属性。

论元角色

论元与它所参与的事件之间的关系。

Open domain

在没有预定义的事件模式的情况下,开放域事件抽取的目的是从文本中检测事件,在大多数情况下,还可以通过提取的事件关键词聚类相似的事件。事件关键词指的是那些主要描述事件的词/短语,有时关键词还进一步分为触发器和参数。

故事分割

从新闻中检测故事的边界。

第一个故事检测

检测新闻流中讨论新话题的故事。

话题检测

根据讨论的主题将故事分组。

话题追踪

检测讨论先前已知话题的故事。

故事链检测

决定两个故事是否讨论同一个主题。

前两个任务主要关注事件检测;其余三个任务用于事件集群。虽然这五项任务之间的关系很明显,但每一项任务都需要一个不同的评价过程,并鼓励采用不同的方法来解决特定问题。

Surveys

:arrow_up:

事件抽取综述

A Comprehensive Survey on Schema-based Event Extraction with Deep Learning, arxiv 2021 by Qian Li, Hao Peng, Jianxin Li, Yiming Hei, Rui Sun, Jiawei Sheng, Shu Guo, Lihong Wang, Philip S. Yu

基于模式的事件提取是及时理解事件本质内容的关键技术。随着深度学习技术的快速发展,基于深度学习的事件提取技术成为研究热点。文献中提出了大量的方法、数据集和评价指标,因此需要进行全面和更新的调查。本文通过回顾最新的方法填补了这一空白,重点关注基于深度学习的模型。我们总结了基于模式的事件提取的任务定义、范式和模型,然后详细讨论每一个。我们引入了支持预测和评估指标测试的基准数据集。本调查还提供了不同技术之间的综合比较。最后,总结了今后的研究方向。

元事件抽取研究综述, 2019 by GAO Li-zheng, ZHOU Gang, LUO Jun-yong, LAN Ming-jing

事件抽取是信息抽取领域的一个重要研究方向,在情报收集、知识提取、文档摘要、知识问答等领域有着广泛应用。写了一篇对当前事件抽取领域研究得较多的元事件抽取任务的综述。首先,简要介绍了元事件和元事件抽取的基本概念,以及元事件抽取的主要实现方法。然后,重点阐述了元事件抽取的主要任务,详细介绍了元事件检测过程,并对其他相关任务进行了概述。最后,总结了元事件抽取面临的问题,在此基础上展望了元事件抽取的发展趋势。

An Overview of Event Extraction from Text, 2019 by Frederik Hogenboom, Flavius Frasincar, Uzay Kaymak, Franciska de Jong:

文本挖掘的一个常见应用是事件抽取,它包括推导出与事件相关的特定知识,这些知识重新映射到文本中。事件抽取可处理各种类型的文本,如(在线)新闻消息、博客和手稿。本文献回顾了用于各种事件抽取目的的文本挖掘技术。它提供了关于如何根据用户、可用内容和使用场景选择特定事件抽取技术的一般指南。

A Survey of Event Extraction from Text, 2019 by Wei Xiang, Bang Wang

事件抽取的任务定义、数据源和性能评估,还为其解决方案方法提供了分类。在每个解决方案组中,提供了最具代表性的方法的详细分析,特别是它们的起源、基础、优势和弱点。最后,对未来的研究方向进行了展望。

A Survey of Textual Event Extraction from Social Networks, 2017 by Mohamed Mejri, Jalel Akaichi

过去的十年中,在社交网络上挖掘文本内容以抽取相关数据和有用的知识已成为无所不在的任务。文本挖掘的一种常见应用是事件抽取,它被认为是一个复杂的任务,分为不同难度的多个子任务。在本文中,我们对现有的主要文本挖掘技术进行了概述,这些技术可用于许多不同的事件抽取目标。首先,我们介绍基于统计模型将数据转换为知识的主要数据驱动方法。其次,我们介绍了基于专家知识的知识驱动方法,通常通过基于模式的方法来抽取知识。然后,我们介绍结合了数据驱动和知识驱动方法的主要现有混合方法。最后,我们比较社交网络事件抽取研究,概括了每种提出的方法的主要特征。

A Survey of event extraction methods from text for decision support systems, 2016 by Frederik Hogenboom, Flavius Frasincar, Uzay Kaymak, Franciska de Jong, Emiel Caron

事件抽取是一种可以追溯到20世纪80年代的专门的信息抽取流程,由于大数据的出现以及文本挖掘和自然语言处理等相关领域的发展,事件抽取技术得到了极大的普及。 然而,到目前为止,对这一特殊领域的概述仍然是难以捉摸的。 因此,我们总结了文本数据的事件抽取技术,划分成数据驱动、知识驱动和混合方法三类,并对这些方法进行了定性评价。 此外,还讨论了从文本语料库中抽取事件的常见决策支持应用。 最后,对事件抽取系统的评价进行了阐述,并指出了当前的研究问题。

Models

:arrow_up:

事件抽取

2021

Event Time Extraction and Propagation via Graph Attention Networks, NAACL-HLT 2021 by Haoyang Wen, Yanru Qu, Heng Ji, Qiang Ning, Jiawei Han, Avi Sil, Hanghang Tong and Dan Roth(Github)

主要思想: 将事件固定在一个精确的时间轴上对自然语言理解很重要,但在最近的研究中受到的关注有限。 由于语言固有的模糊性和信息在相互关联的事件上传播的要求,这个问题具有挑战性。 本文首先提出了一种用于实体槽填充的四元组时态表示方法,使我们能够更方便地表示模糊时间跨度。 然后,我们提出了一种基于图注意网络的方法,在由共享实体参数和时间关系构造的文档级事件图上传播时间信息。 为了更好地评估我们的方法,我们在ACE2005语料库上提出了一个具有挑战性的新基准,其中78%以上的事件在其本地上下文中没有明确提到时间跨度。 该方法比上下文化的嵌入方法的匹配率提高了7.0%,比句子级人工事件时间参数标注方法的匹配率提高了16.3%。

数据集:ACE

GRIT: Generative Role-filler Transformers for Document-level Event Entity Extraction, EACL 2021 by Xinya Du, Alexander M. Rush and Claire Cardie(Github)

主要思想: 事件参数提取是事件提取中的一项基本任务,在资源匮乏的情况下尤其具有挑战性。 我们从两个方面来解决现有研究在资源匮乏情况下存在的问题。 从模型的角度来看,现有的方法往往存在参数共享不足的问题,没有考虑角色的语义,不利于处理稀疏数据。 而从数据的角度来看,现有的方法大多侧重于数据生成和数据增强。 然而,这些方法严重依赖外部资源,创建外部资源比获取未标记的数据更加费力。 在本文中,我们提出DualQA,小说的框架,这事件模型参数提取的任务问题回答缓解数据稀疏的问题,利用事件参数识别的二元性问“什么扮演的角色”,以及事件的角色识别这是问“角色”, 相互完善。 在两个数据集上的实验结果证明了我们的方法的有效性,特别是在资源极低的情况下。

数据集:MUC-4

What the Role is vs. What Plays the Role: Semi-Supervised Event Argument Extraction via Dual Question Answering, AAAI 2021 by Yang Zhou, Yubo Chen, Jun Zhao, Yin Wu, Jiexin Xu and JinLong Li(Github)

主要思想: 事件参数提取是事件提取中的一项基本任务,在资源匮乏的情况下尤其具有挑战性。 我们从两个方面来解决现有研究在资源匮乏情况下存在的问题。 从模型的角度来看,现有的方法往往存在参数共享不足的问题,没有考虑角色的语义,不利于处理稀疏数据。 而从数据的角度来看,现有的方法大多侧重于数据生成和数据增强。 然而,这些方法严重依赖外部资源,创建外部资源比获取未标记的数据更加费力。 在本文中,我们提出DualQA,小说的框架,这事件模型参数提取的任务问题回答缓解数据稀疏的问题,利用事件参数识别的二元性问“什么扮演的角色”,以及事件的角色识别这是问“角色”, 相互完善。 在两个数据集上的实验结果证明了我们的方法的有效性,特别是在资源极低的情况下。

数据集:ACE, FewFC

GATE: Graph Attention Transformer Encoder for Cross-lingual Relation and Event Extraction, AAAI 2021 by Wasi Uddin Ahmad, Nanyun Peng and KaiWei Chang(Github)

主要思想: 跨语言关系和事件提取的最新进展是使用具有通用依赖解析的图卷积网络(GCNs)来学习与语言无关的句子表示,这样在一种语言上训练的模型可以应用于其他语言。 然而,GCNs很难对具有长期依赖关系的词进行建模,或者不能在依赖树中直接连接。 为了解决这些问题,我们建议利用自我注意机制,明确融合结构信息来学习不同句法距离单词之间的依赖关系。 我们引入了GATE,一种图注意转换器编码器,并在关系和事件提取任务中测试了它的跨语言可移植性。 我们在ACE05数据集上执行实验,该数据集包括三种类型不同的语言:英语、汉语和阿拉伯语。 评价结果表明,GATE算法的性能优于最近提出的三种方法。 我们的详细分析显示,由于对语法依赖的依赖,GATE产生了有助于跨语言迁移的健壮表示。

数据集:ACE

Event Extraction by Associating Event Types and Argument Roles, arXiv 2021 by Qian Li, Shu Guo, Jia Wu, Jianxin Li, Jiawei Sheng, Lihong Wang, Xiaohan Dong, and Hao Peng

从文本中获取结构化事件知识的事件抽取可分为事件类型分类和元素抽取(即识别不同角色模式下的触发器和参数)两个子任务。由于不同的事件类型总是有不同的抽取模式(即角色模式),以往关于情感表达的研究通常遵循一个孤立的学习范式,对不同的事件类型独立地进行元素抽取。它忽略了事件类型和参数角色之间有意义的关联,导致较少频繁的类型/角色的性能相对较差。本文提出了一种新的情感表达任务神经关联框架。给定一个文档,首先通过构建文档级图来关联不同类型的句子节点进行类型分类,然后采用图注意网络来学习句子嵌入。然后,通过构建参数角色的通用模式来实现元素提取,使用参数继承机制来增强提取元素的角色优先级。因此,我们的模型考虑了情感表达过程中的类型和角色关联,实现了它们之间的隐式信息共享。实验结果表明,我们的方法在两个子任务中都优于最先进的情感表达方法。特别是对于训练数据较少的类型/角色,其性能优于现有方法。

数据集:ACE

Reinforcement Learning-based Dialogue Guided Event Extraction to Exploit Argument Relations, TASLP 2021 by Qian Li, Hao Peng, Jianxin Li, Yuanxing Ning, Lihong Wang, Philip S. Yu, and Zheng Wang(Github)

主要思想:事件提取是自然语言处理的一项基本任务。 找到事件参数(如事件参与者)的角色是提取事件的关键。 然而,在真实的事件描述中这样做是具有挑战性的,因为一个论点的作用在不同的语境中往往是不同的。 虽然多个参数之间的关系和交互对于解决参数角色是有用的,但是这些信息很大程度上被现有的方法忽略了。 本文通过显式地利用事件参数的关系,提出了一种更好的事件提取方法。 我们通过一个精心设计的面向任务的对话系统来实现这一点。 为了对参数关系进行建模,我们采用了强化学习和增量学习的方法,通过一个多轮、迭代的过程提取多个参数。 我们的方法利用对同一句子中已经提取的论据的知识来确定那些很难单独决定的论据的作用。 然后,它使用新获得的信息来改进以前提取的参数的决策。 这种双向反馈的过程允许我们利用论证关系,有效地解决论证角色,导致更好的句子理解和事件提取。 实验结果表明,在事件分类、参数角色和参数识别方面,该方法始终优于目前最先进的7种事件提取方法。

数据集:ACE

CasEE: A Joint Learning Framework with Cascade Decoding for Overlapping Event Extraction, Findings of ACL 2021 by Jiawei Sheng, Shu Guo, Bowen Yu, Qian Li, Yiming Hei, Lihong Wang, Tingwen Liu, Hongbo Xu(Github)

事件提取(EE)是一项重要的信息提取任务,旨在提取文本中的事件信息。现有的方法大多假设事件出现在没有重叠的句子中,不适用于复杂的重叠事件抽取。本研究系统地研究了现实事件重叠问题,即一个词可以作为具有多种类型或不同角色的触发器。为了解决上述问题,我们提出了一种新的基于级联解码的重叠事件提取联合学习框架,称为CasEE。特别是,CasEE依次执行类型检测、触发器提取和参数提取,其中重叠的目标根据特定的前一个预测分别提取。所有子任务在一个框架中共同学习,以捕获子任务之间的依赖关系。对公共事件提取基准FewFC的评估表明,与以前的竞争方法相比,CasEE在重叠事件提取方面取得了显著改进。

数据集: FewFC

2020

Reading the Manual: Event Extraction as Definition Comprehension, EMNLP 2020 by Yunmo Chen, Tongfei Chen, Seth Ebner, Benjamin Van Durme.

动机:提出一种新颖的事件抽取方法,为模型提供带有漂白语句(实体用通用的方式指代)的模型。漂白语句是指基于注释准则、描述事件发生的通常情况的机器可读的自然语言句子。实验结果表明,模型能够提取封闭本体下的事件,并且只需阅读新的漂白语句即可将其推广到未知的事件类型。

主要思想:提出了一种新的事件抽取方法,该方法考虑了通过将文本中的实体用指代的方式表示,如人用someone表示,以这种方式构造语料库;提出了一个多跨度的选择模型,该模型演示了事件抽取方法的可行性以及零样本或少样本设置的可行性。

数据集:ACE 2005

Open-domain Event Extraction and Embedding for Natural Gas Market Prediction, arxiv 2020 by Chau, Minh Triet and Esteves, Diego and Lehmann, Jens (Github)

动机:以前的方法大多数都将价格视为可推断的时间序列,那些分析价格和新闻之间的关系的方法是根据公共新闻数据集相应地修正其价格数据、手动注释标题或使用现成的工具。与现成的工具相比,我们的事件抽取方法不仅可以检测现象的发生,还可以由公共来源检测变化的归因和特征。

主要思想:依靠公共新闻API的标题,我们提出一种方法来过滤不相关的标题并初步进行事件抽取。价格和文本均被反馈到3D卷积神经网络,以学习事件与市场动向之间的相关性。

数据集:NYTf、FT、TG

Event Extraction by Answering (Almost) Natural Questions, EMNLP 2020 by Xinya Du and Claire Cardie(Github)

主要思想:事件提取问题需要检测事件触发并提取其相应的参数。 事件参数提取中的现有工作通常严重依赖于作为预处理/并发步骤的实体识别,这导致了众所周知的错误传播问题。 为了避免这个问题,我们引入了一种新的事件抽取范式,将其形式化为问答(QA)任务,该任务以端到端的方式提取事件论元。 实证结果表明,我们的框架优于现有的方法; 此外,它还能够提取训练时未见角色的事件论元。

数据集:ACE

2019

Exploring Pre-trained Language Models for Event Extraction and Generation, ACL 2019 by Yang, Sen and Feng, Dawei and Qiao, Linbo and Kan, Zhigang and Li, Dongsheng

动机: ACE事件抽取任务的传统方法通常依赖被手工标注过的数据,但是手工标注数据非常耗费精力并且也限制了数据集的规模。我们提出了一个方法来克服这个问题。

主要思想: 本文提出了一个基于预训练语言模型的框架,该框架包含一个作为基础的事件抽取模型以及一种生成被标注事件的方法。我们提出的事件抽取模型由触发词抽取器和论元抽取器组成,论元抽取器用前者的结果进行推理。此外,我们根据角色的重要性对损失函数重新进行加权,从而提高了论元抽取器的性能。

数据集:ACE2005

Keywords: Context-aware word representation, LSTM, Tensor layer

Open Domain Event Extraction Using Neural Latent Variable Models, ACL2019 by Xiao Liu and Heyan Huang and Yue Zhang (Github)

动机: 我们考虑开放域的事件抽取,即从新闻集群中抽取无约束的事件类型的任务。结果表明,与最新的事件模式归纳方法相比,这种无监督模型具有更好的性能。

主要思想: 以前关于生成模式归纳的研究非常依赖人工生成的指标特征,而我们引入了由神经网络产生的潜在变量来获得更好的表示能力。我们设计了一种新颖的图形模型,该模型具有潜在的事件类型矢量以及实体的文本冗余特征,而这些潜在的事件类型矢量来自全局参数化正态分布的新闻聚类。

数据集:GNBusiness

Rapid Customization for Event Extraction, ACL 2019 by Yee Seng Chan, Joshua Fasching, Haoling Qiu, Bonan Min (Github)

动机: 从文本中获取事件发生的时间、地点、人物以及具体做了什么是很多应用程序(例如网页搜索和问题解答)的核心信息抽取任务之一。本文定义了一种快速自定义事件抽取功能的系统,用于查找新的事件类型以及他们的论元。

主要思想: 为了能够抽取新类型的事件,我们提出了一种新颖的方法:让用户通过探索无标注的语料库来查找,扩展和过滤事件触发词。然后,系统将自动生成相应级别的事件标注,并训练神经网络模型以查找相应事件。

数据集:ACE2005

Cross-lingual Structure Transfer for Relation and Event Extraction, EMNLP 2019 by Ananya Subburathinam, Di Lu, Heng Ji, Jonathan May, Shih-Fu Chang, Avirup Sil, Clare Voss

动机: 从资源不足以及标注不足的语料库中进行复杂语义结构的识别(例如事件和实体关系)是很困难的,这已经变成了一个很有挑战性的信息抽取任务。

主要思想: 通过使用卷积神经网络,将所有实体信息片段、事件触发词、事件背景放入一个复杂的、结构化的多语言公共空间,然后我们可以从源语言注释中训练一个事件抽取器,并将它应用于目标语言。

数据集:ACE2005

Doc2EDAG: An End-to-End Document-level Framework for Chinese Financial Event Extraction, EMNLP2019 by Shun Zheng, Wei Cao, Wei Xu, Jiang Bian

任务:与其他研究不同,该任务被定义为:事件框架填充:也就是论元检测+识别

不同点有:不需要触发词检测;文档级的抽取;论元有重叠

动机:解码论元需要一定顺序,先后有关

主要思想:发布数据集,具有特性:arguments-scattering and multi-event,先对事件是否触发进行预测;然后,按照一定顺序先后来分别解码论元

数据集:ten years (2008-2018) Chinese financial announcements:ChFinAnn;Crawling from http://www.cninfo.com.cn/new/index

Entity, Relation, and Event Extraction with Contextualized Span Representations, CCL 2016 by David Wadden, Ulme Wennberg, Yi Luan, Hannaneh Hajishirzi (Github)

动机: 许多信息提取任务(例如命名实体识别,关系抽取,事件抽取和共指消解)都可以从跨句子的全局上下文或无局部依赖性的短语中获益。

主要思想: (1)将事件抽取作为附加任务执行,并在事件触发词与其论元的关系图形中进行跨度更新。 (2)在多句子BERT编码的基础上构建跨度表示形式。

数据集:ACE2005

HMEAE: Hierarchical Modular Event Argument Extraction, EMNLP 2019 short(Github)

任务:事件角色分类

动机:论元的类型(如PERSON)会给论元之间的关联带来影响

数据集:ACE 2005

Joint Event and Temporal Relation Extraction with Shared Representations and Structured Prediction, EMNLP 2019 by Rujun Han, Qiang Ning, Nanyun Peng

动机: 事件之间的时序关系的提取是一项重要的自然语言理解(NLU)任务,可以使许多下游任务受益。我们提出了一种事件和事件时序关系的联合抽取模型,该模型可以进行共享表示学习和结构化预测。

主要思想: (1)提出了一个同时进行事件和事件时序关系抽取的联合模型。这样做的好处是:如果我们使用非事件之间的NONE关系训练关系分类器,则它可能具有修正事件抽取错误的能力。 (2)通过在事件抽取和时序关系抽取模块之间首次共享相同的上下文嵌入和神经表示学习器来改进事件的表示。

数据集:TB-Dense and MATRES datasets

Open Event Extraction from Online Text using a Generative Adversarial Network, EMNLP 2019 by Rui Wang, Deyu Zhou, Yulan He

动机: 提取开放域事件的结构化表示的方法通常假定文档中的所有单词都是从单个事件中生成的,因此他们通常不适用于诸如新闻文章之类的长文本。为了解决这些局限性,我们提出了一种基于生成对抗网络的事件抽取模型,称为对抗神经事件模型(AEM)。

主要思想: AEM使用Dirichlet先验对事件建模,并使用生成器网络来捕获潜在事件的模式,鉴别器用于区分原始文档和从潜在事件中重建的文档,鉴别器网络生成的特征允许事件抽取的可视化。

数据集:Twitter, and Google datasets

Reporting the unreported: Event Extraction for Analyzing the Local Representation of Hate Crimes, EMNLP 2019 by Aida Mostafazadeh Davani etal. (Github)

动机: 将事件抽取和多实例学习应用于本地新闻文章的语料库,可以用来预测仇恨犯罪的发生。

主要思想: 根据是否为仇恨罪标记每篇文章的任务被定义为多实例学习(MIL)问题。我们通过使用文章所有句子中嵌入的信息来确定文章是否报道了仇恨犯罪。在一组带标注的文章上测试了模型之后,我们将被训练过的模型应用于联邦调查局没有报道过的城市,并对这些城市中仇恨犯罪的发生频率进行了下界估计。

Extracting entities and events as a single task using a transition-based neural model, IJCAI 2019 by Zhang, Junchi and Qin, Yanxia and Zhang, Yue and Liu, Mengchi and Ji, Donghong (Github)

动机: 事件抽取任务包括许多子任务:实体抽取,事件触发词抽取,论元角色抽取。传统的方法是使用pipeline的方式解决这些任务,没有利用到任务间相互关联的信息。已有一些联合学习的模型对这些任务进行处理,然而由于技术上的挑战,还没有模型将其看作一个单一的任务,预测联合的输出结构。本文提出了一个tran

Issues· 0 open

View all issuesOpen on GitHub

No open issues yet, or sync has not completed.

> Tags

Python

No comments yet. Be the first to share.

> Details

PublishedAug 1, 2026
UpdatedSep 17, 2026
Category编程语言
PricingOpen source

> Related tools

T
TypeScript
JavaScript 的超集,为前端与全栈提供静态类型
P
Python
通用编程语言,广泛用于 Web、数据与 AI
G
Go
Google 推出的简洁高效系统语言