1.一种句法信息注意力引导的图卷积网络关系抽取方法,其特征在于,包括以下步骤:
1)基于BERT预训练模型的字向量表示:
BERT通过联合调节所有层中的双向Transformer来预训练深度双向表示,利用BERT的BertModel类构造BERT结构,然后将输入的自然语言文本序列输入到BERT特征表示层中,对文本中的每个单词进行编码得到单词的向量表示:x=(x1,x2,x3…xn) (1)
2)biLSTM上下文编码:
首先将输入的单词向量输入到一个双向长短期记忆网络中,生成上下文表示,然后在模型中作为图卷积网络的输入 计算如下:it=σ(Wixxt+Wihht‑1+bi) (2)ft=σ(Wfxxt+Wfhht‑1+bf) (3)ot=σ(Woxxt+Wohht‑1+bo) (4)其中,W、b分别表示连接两层的权重矩阵和偏置向量,σ是sigmoid激活函数, 为点乘运算,xt为输入向量,it,ft和ot分别为t时刻的输入门、遗忘门和输出门, 表示t时刻的状态,ht则为t时刻隐藏层的输出;
对输入序列分别采用顺序和逆序的方式计算后得到两种不同的隐藏层表示 和 然后通过向量拼接的方式得到最终的隐藏层表示,也就是图卷积层的输入表示,公式如下:
3)融合句法依赖类型信息的图卷积网络词节点特征表示:将依赖关系类别引入到图注意力网络中,利用具有大量有用信息的依赖关系类型,通过注意力机制,根据依赖关系计算不同依赖边的权重,让模型能够区分不同的依赖边的重要性;
3.1)构建句法依存树:
对于输入的句子,通过Stanford Parser工具对句子进行句法依存分析,生成句子对应的句法依存树;
3.2)构建依赖类型矩阵:
首先根据构建的句法依存树,采用一个邻接矩阵A=(Aij)n*n来表示依存树,其中Aij表示单词xi和单词xj是否存在依赖边,若存在则Aij=1,若不存在则Aij=0,然后根据邻接矩阵A,构建依赖类型矩阵T=(ti,j)n*n,其中ti,j表示单词xi和单词xj之间的依赖关系类型,将矩阵T中的每个关系类型ti,j映射到对应的向量表示
3.3)依赖边权重计算:
在图卷积网络GCN第l层,单词xi和单词xj之间的依赖边的权重计算如下:其中,·表示内积运算符, 和 是单词xi和单词xj的中间向量,它们的计算如下:其中, 表示向量拼接操作;其中 和 分别表示l‑1层单词xi和单词xj的输出表示;
3.4)图卷积网络节点特征表示:
将得到的 作为单词xi和单词xj之间的依赖边的权重,通过图卷积操作得到每个单词xi输出表示,计算如下:(l) (l)
其中,在第l层图卷积中,W 是为权重矩阵,b 是一个偏置向量,σ是一个ReLU激活函数, 表示融合了依赖类型信息的单词xj的表示,计算方式如下:其中, 的作用就是将依赖类型向量 变成与 相同维度的向量;
4)关系抽取:
4.1)最大池化层降维:
在进行关系抽取前,首先将句子X=(x1,x2,…,xn‑1,xn)通过BERT进行词嵌入得到每个词的向量表示xi,并将其输入到GCN中,经过L层的图卷积操作之后得到句子X对应的特征向量表示 然后将整句句子的表示 以及两个实体的表示 和 送入一个最大池化层进行降维,计算如下:其中E1,E2分别表示需要抽取关系的两个实体;
4.2)关系预测:
将得到的句子表示hx和两个实体的表示hE1,hE2通过一个可训练得到的矩阵WR进行如下处理;最后,通过一个softmax分类器从关系集合Y中预测句子中实体E1和E2的关系类别,计算如下:其中bR表示一个偏置向量;
4.3)最小化损失函数:
利用带L2正则项的负对数似然函数作为损失函数:其中,L2正则项度量的是各个系数的绝对值大小,将其作为惩罚项加入损失函数,迫使最优解的各系数接近0,m代表样本的个数,t是关系类别的one‑hot向量, 是softmax的输出类别概率向量,λ是正则化参数,θ是关系抽取模型的训练参数。