1.一种基于自注意力的三元组抽取方法,其特征在于,所述方法包括以下步骤:
1)获取已登记在数据库中案件的描述文本,预先设定好需要标注的实体和三元组的schema,所述实体包括人名、地名、时间、罪名和作案方式,所述三元组包括犯案时间、犯案地点、犯案方式,犯案罪名和犯案人同被害人的社会关系;
2)根据上述的标注schema,在web端的标注平台上人工标注出描述文本中的三元组关系,并生成确定格式的标注文本作为训练数据和验证数据;
3)将描述文本和标注文本一一对应后,再根据标注的结果分别生成两个子文件;
4)三元组抽取方法的训练使用的是管道式的策略,先利用Transformer网络模型作为编码器,指针网络作为解码器,来对BIEO标注的文本作实体抽取的训练;同时,用另一个transformer网络模型作为编码器,全连接网络作为解码器对标注出实体的文本进行关系分类的训练;
5)训练完成后,将实体模型和关系模型分别保存;
6)预测时将一段文本先输入实体模型中,预测出其中所有潜在的实体,并将其两两配对,以marker的形式标注在文本后,将marker标注后的文本再输入至关系模型,得到每个实体对的关系;
7)整理两个模型的输出,得到最终的三元组抽取结果;
所述步骤4)的过程为:
4.1)给定token化的文本X=[x1,x2……xn],其中xn为在文本n位置的token,将X输入Transformer模型后,得到文本的隐藏表示H=[h1,h2……hn],其过程表示为:H=Transformer(X) (1)
4.2)根据BIEO的标注文本,构造出实体识别的gold标签G=[g1,g2……gn],再将4.1)当中得到的隐藏表示H输入至指针网络中,得到文本在每个token上的标注分类概率P=[p1,p2……pn],然后使用交叉熵损失函数对实体识别任务进行训练:
4.3)关系分类的模型需要构造额外的文本向量,给定token化的文本X=[x1,x2……xn],其中xt为在文本t位置的token,并在文本X之后加入实体的marker标记,记为M=[ms1,me1,ms2,me2……msk‑1,mek‑1,msk,mek],每对marker与实体的起始位置和结束位置共享位置编码,用于标注含有关系的实体对,此外,利用Transformer自带的自注意力层,我们提取出每个实体对中头实体和尾实体起始位置marker的注意力矩阵As和Ao,并作以下的计算来得到每个实体对用于分类的关系特征向量Ci:A=As·Ao (3)
T
C=Ha (6)
其中,h为多头注意力头数,H为经过transformer得到的隐藏表述;
4.4)再通过交叉熵损失函数,将本地标注的关系同预测出的关系计算损失:其中,N为关系的数量,i为一个批量数据中句子的位置,R为关系类别的总数量,c为关系的类别。
2.根据权利要求1所述的基于自注意力的三元组抽取方法,其特征在于,所述步骤3)的过程为:子文件之一是以BIEO标注法标注出所有实体的命名实体识别标注文本;另一个子文件是通过marker标记法在实体span级别上标注出实体关系的关系分类标注文本。