利索能及
我要发布
收藏
专利号: 2022105896759
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于管道式方案的政务三元组抽取方法,其特征在于,所述方法包括以下步骤:

1)获取某个问政平台在数据库中的社情民意描述文本,预先设定好需要标注的实体的schema和关系的schema;

2)根据上述的标注schema,在web端的标注平台上人工标注出描述文本中的三元组关系,并生成确定格式的标注文本作为训练数据和验证数据;

3)首先对文本数据进行命名实体识别,过程如下:

3.1)给定token化的文本X=[x1,x2.......xn],其中xt为在文本t位置的token,将X输入BERT模型后,得到文本的隐藏表示H=[h1,h2......hn],其表示的过程为:H=BERT(X)

3.2)采用一个二进制分类器,为每个向量分配二进制标记(0/1)来分别检测对象是否为实体的起始位置,当该对象的概率超过某个阈值时,则将对象分配标签1,否则就分配标签0,其表示过程为:start_s

Pi =σ(Wstarthi+bstart)start_s

Pi 表示输入序列中的第i个token识别为实体的开始位置的概率,σ是sigmoid激活函数,Wstart是可训练的权重,bstart是偏差;

3.3)预先设定好一个span的最大宽度,将上述标记为1的对象作为实体的起始位置,依次生成span实体,直到span的宽度与最大宽度相等,每个实体span的表示过程为:he(si)=[hSTART(i);hEND(i);φ(si)]hSTART(i)是span的起始索引,hEND(i)是span的结束索引,φ(si)是span的宽度特征嵌入;

3.4)将上述生成的实体span送入前馈神经网络,进行实体类型的预测,如下所示:Pe(e|si)=softmax(Wehe(si))We是可训练的权重;

3.5)命名实体识别的交叉熵损失函数如下所示:s是实体span的集合,si为集合里的元素, 为gold实体类型;

4)对上述完成了命名实体识别的句子,将其句子中识别出来的实体span两两配对构成span头尾实体对,生成若干句子,将每一种实体类型用特殊的token字符来表示;

5)将生成句子中的span头尾实体替换成对应的实体类型token,从而构造一个新的句子;

6)对这个新生成句子中的头尾实体做关系的分类,过程如下:

6.1)将这个新的句子放入到另外一个BERT模型里,生成句子向量,如下所示:B={b1,b2......bn}

6.2)将该句子向量里对应的头尾实体向量拿出来进行一个拼接,如下所示:hr(si,sj)=[bi;bj]

si为头实体,sj为尾实体,bi是头实体在句子中对应的向量,bj是尾实体在句子中对应的向量;

6.3)将拼接后的向量送入前馈神经网络进行关系的预测,从而完成三元组的抽取任务,如下所示:Pr(r|si,sj)=softmax(Wrhr(si,sj))Wr是可训练的权重;

7)关系模型训练的损失函数如下所示:

SG是gold实体集合, 是实体对的gold关系类型。