利索能及
我要发布
收藏
专利号: 2025101483093
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于空间感知依赖图和无损解码的联合信息抽取方法,其特征在于,包括以下步骤:步骤1,利用预训练的语言模型对输入文本序列进行编码;

步骤2,对编码后的序列使用条件随机场进行开始、内部、外部BIO标注,识别出实体和事件触发器;

步骤3,使用连续动态位置信息编码方法,将位置信息添加到步骤2识别出的实体和事件触发器表示中;

步骤3包括:使用连续动态系统来生成位置编码PE={p1,p2,p3,…,pn},其中pn代表第n个词元的位置编码,连续动态系统的演化函数f(p(i),i|θ)公式为:f(p(i),i|θ)=σ(Wp(i)+tx),

其中p(i)表示后续位置点,θ是演化函数的参数,W是一个可学习的权重矩阵,σ(·)代表sigmoid函数;

连续动态模型的位置编码是基于微分方程来建模位置信息,微分方程的公式为:其中d表示微分符号;

学习到的微分方程通过以下公式影响位置编码的演化:

其中Δi是序列位置的变化量,p(i+Δi)代表第i+Δi个序列的位置编码;

依据演化公式逐步更新每一个位置的编码,得到最终的位置编码序列PE={p1,p2,p3,…,pn};

步骤4,将信息抽取任务构造为图预测模型,实体和事件触发器为图的节点,关系和事件论元为图的边;

步骤5,利用评分因子,计算节点和边的联合概率分布;

步骤6,对步骤5中的联合概率分布使用随机梯度变分推断,得到节点和边的标签;

步骤7,利用训练好的模型,输入文本,输出文本所含实体、关系、事件触发器、事件论元类别。

2.根据权利要求1所述的方法,其特征在于,步骤1包括:将长度为n的文本序列W={w1,w2,w3,…,wn},输入到经过预训练的BERT模型中进行编码得到序列H的操作记为BERT(w1,w2,w3,...,wn):H=BERT(w1,w2,w3,...,wn)={h1,h2,h3,...,hn),得到含有上下文词义的序列H={h1,h2,h3,…,hn},其中hn表示第n个中间参数,wn表示第n个词元。

3.根据权利要求2所述的方法,其特征在于,步骤2包括:使用了两个线性链条件随机场来为文本序列中的每个单词进行BIO标注,首先将序列H={h1,h2,h3,…,hn}分别输入到两个前馈神经网络FFN,两个前馈神经网络FFN结构相同,其中一个前馈神经网络FFN用于提取实体,另一个前馈神经网络FFN用于提取事件触发器,得到提取实体和事件触发器任务的表示:entiiy

H 表示提取实体任务中的隐藏层表示:

entity

H =FFN(H),

ttigger

H 表示提取事件触发器任务中的隐藏层表示:

trigger

H =FFN(H),

entity trigger

将H 和H 输入到条件随机场中进行BIO序列标注,首先对条件随机场的转移矩阵T进行初始化,在初始化的时候对转移矩阵进行约束,设T[u,v]为标签u到v的转移分数,约束表示为:从任何标签都不能转移到终止标签end,表示为:

T(:,end)=‑100,

T(:,end)表示任意标签到终止标签end的转移分数;

起始标签start不能转移到任何非起始标签,表示为:T(start,:)=‑100,

T(start,:)表示起始标签start到任意标签的转移分数;

对无效转移,赋予低分,表示为:

T(u,v)=‑100,

使用前向变量αt(v)表示序列在时间步t上的状态为标签v时的路径得分,令提取实体任务中的隐藏层 和提取事件触发器任务中的隐藏层 为当前时间步t上的线性层输出,为了更新前向变量αt(v),需要考虑从上一个时间步的所有标签转移到当前时间步标签的得分,计算路径得分的公式为:其中 表示第t+1个时间步上的状态为标签v的实体的路径得分, 表示第t+1个时间步上的状态为标签v的事件触发器的路径得分,exp函数表示以自然常数e为底的指数函数;

当遍历完所有的时间步后,需要考虑最后一个标签到终止标签end的转移得分,将前向变量α中最后一个时间步的得分与终止标签end的转移分数相加:αt(end)=an(m)+T(u,end),

其中αt(end)表示第t个时间步上的状态为终止标签end的路径得分,T(u,end)表示标签m到终止标签end的转移分数;

计算所有可能标签序列的得分和,即归一化常数Z(x):为了预测最优标签序列,使用维特比算法,维特比解码的目标是找到得分最高的路径,即最大化:entity* trigger*

其中y 代表句子y的实体最优预测得分,y 代表句子y的事件触发器最优预测得分,yt表示句子y的第t个词元, 表示句子y的第t个词元在提取实体任务中的隐藏层表示, 表示句子y的第t个词元在提取事件触发器任务中的隐藏层表示,argmax表示最大化;

通过动态规划计算最大得分路径,每步选择最优的前一状态,逐步回溯每个时间步上的最优标签,得到文本序列中的实体和事件触发器。

4.根据权利要求3所述的方法,其特征在于,步骤4包括:给定一个句子,将对句子的信息抽取任务表示为一个依赖因子图,其中节点对应于实体和事件触发词,边表示关系和事件论元;

基于依赖因子图,实现以下三个信息抽取任务:

命名实体识别:从文本中识别实体;

关系抽取:捕获文本中实体对之间的关系,并标记关系类型;

事件抽取:从文本中识别和提取事件及相关信息;

在一个联合信息抽取模型中执行命名实体识别、关系抽取和事件抽取:给定一个输入句子,形式化为一个图G=(V,E)预测任务,其中V表示节点集,E表示有向边集,每个节点v=(a,b,l)∈V表示一个实体或事件触发词,a和b分别表示跨度的开始和结束位置,l是跨度的enriry event entity标签,对于实体标签l∈L ,对于事件触发器标签l∈L ,L 表示实体标签集合,eventL 表示事件触发器标签集合;每个边eij表示从第i个图节点到第j个图节点的关系标签,eij=(i,j,r)∈E。

5.根据权利要求4所述的方法,其特征在于,步骤5包括:通过构造因子图,并设计三种不同的评分因子模拟每个标签局部的分布、同一任务实例之间的相关性,以及不同任务实例之间的相关性,所述三种不同的评分因子具体包括一元因子、二元因子和三元因子:一元因子:将预测跨度内的所有单词的表示取平均,和位置编码相加来获得每个节点的表示z,并将每个图节点的表示同时输入到不同任务的前馈神经网络FFN中来得到每个图节点的独立的标签得分:其中 代表第i个图节点的第n个词片段,avg表示取平均值,ntask代表不同的图节点nrask任务,FFN 表示不同图节点任务的前馈神经网络FFN, 代表第i个图节点在不同的图节点任务下的一元得分;

对于边eij的表示,使用两种不同的前馈神经网络FFN来模拟节点作为主语和宾语对关系的影响,并采取了biaffine函数来建模不同前馈神经网络FFN的交互:etask

其中etask代表不同的边任务,代表元素级别乘积,G 是一个随机初始化的可学习etask‑s的参数矩阵, 代表边eij在不同的边任务下的一元得分,FFN 表示图节点作为头etask‑e结点时不同节点任务的前馈神经网络FFN,FFN 表示图节点作为尾结点时不同节点任务的前馈神经网络FFN;

二元因子:二元因子用于捕获共享了同一节点的边的依赖关系,使用不同的前馈神经网络FFN来为每个节点分别计算作为共享joint节点和独立sole节点的表示:其中 代表第i个图节点作为独立sole节点的表示, 代表第i个图节点作为共享joint节点的表示;

对于共享了第i个图节点的两条边,边的二元因子的表示形式为:其中rm代表了第一条边的标签, 是第一条边标签rm的嵌入,rn代表了第二条边的标签, 是第二条边标签rn的嵌入,为了对称性,令 表示对于共享了第i个图节点的边eij和边eik,以eij为首的二元因子评分 与以eik为首的二元因子评分 相同;

三元因子:三元因子用于建模一条边与边的两个端点的相互依赖关系,使用不同的前馈神经网络FFN来为头节点和尾节点生成表示:其中 代表图节点作为头节点时的表示, 代表图节点作为尾节点时的表示;

三元因子的表示形式为:

其中 代表第i个图节点和第j个图节点以及连接第i个图节点和第j个图节点的边s的三元分数, 代表第i个图节点和第j个图节点之间边标签属于类别m的嵌入,lp∈L代e表头节点vi标签属于类别p,lq∈L 代表头节点vi的标签属于类别q, 是三元因子头结点标签lp的嵌入, 是三元因子尾结点标签lq的嵌入;

聚合三种评分因子以获得所有变量的联合概率分布,每个图节点的联合概率分布计算公式为:其中P(xi=lp,w)表示模型参数为w时,第i个图节点标签属于类别p的概率,P(xj=lq,w)表示模型参数为w时,第j个图节点标签属于类别q的概率, 表示一元评分因子的第p个元素, 表示一元评分因子 的第q个元素, 表示一元评分因子 的第m个元素,α1,α2∈[0,1]是用于调节每个因子贡献度的权重参数;

对于每一条边,联合概率分布的计算公式为:

其中P(xij=rm,w)表示模型参数为w时,第i个图节点和第j个图节点之间边的标签为rm的概率,α3,α4∈[0,1]是用于调节每个因子贡献度的权重参数。

6.根据权利要求5所述的方法,其特征在于,步骤6包括:使用随机梯度变分推断来继续维持隐变量之间复杂依赖关系,并迭代的推断每个变量X近似后验分布Q(X),令真实后验分布为P(X),通过减少与P(X)的距离来优化近似后验分布Q(X):其中 代表迭代后的近似后验分布,KL代表KL散度,证据下界L(Q(X))的计算公式为:L(Q(X))=log(P(X)‑log(Q(X))),随后通过计算L(Q(X))的梯度,并利用梯度下降不断地更新后验分布Q(X)的参数,再依据后验分布Q(X),利用前向传播计算模型损失,经过预定迭代次数的反向传播得到最终的联合信息抽取模型。

7.根据权利要求6所述的方法,其特征在于,步骤7中,利用步骤6得到的联合信息抽取模型,输入数据,输出实体、事件触发器、关系和事件论元;

待信息抽取模型训练完毕后,将文本序列输入模型,模型会根据训练的内容提取包含的信息。

8.一种电子设备,其特征在于,包括处理器和存储器,所述存储器存储有程序代码,当所述程序代码被所述处理器执行时,使得所述处理器执行如权利要求1至7中任一项所述的方法的步骤。

9.一种存储介质,其特征在于,存储有计算机程序或指令,当所述计算机程序或指令在计算机上运行时,执行如权利要求1至7中任一项所述的方法的步骤。