利索能及
我要发布
收藏
专利号: 202510779151X
申请人: 浙江工业大学之江学院
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种用于低标注工业语料的知识图谱构建的关系抽取方法,其特征在于,首先,引入语义协同机制优化结合上下文信息构建的动态提示模板,其次,结合特征对齐与分阶段课程学习策略,使模型逐步适应任务难度并提升对语义差异的判别能力,最后,通过联合损失动态调整模型参数,利用收敛后的模型推理实体间关系;

所述关系抽取方法包括以下步骤:

步骤1、结合工业领域专业术语构建实体标注集 ,利用工业领域已有的术语词典构建实体识别模板,通过精确匹配的方式,从文本中提取出对应的头实体和尾实体,利用可训练的连续标识替代传统提示中的固定词构建动态提示 ,其中 、 代表已识别工业实体, ,表示预训练模型词汇表, 为可训练标记的个数, 表示工业实体在工业文本数据上下文中可能存在的复杂语义关系;

步骤2、利用Word2Vec模型对工业实体进行词向量训练,获取与目标实体在语义上相近的词语,将前k个相关词的嵌入向量 以及头实体嵌入 、尾实体嵌入 的均值初始化模板 中的可训练标记 的嵌入表示 ,;

步骤3、将原始关系标签集合 中的关系去除符号、释义为自然语言表述形式,得到关系描述集 ,与手工构建的提示 构成新的关系标签序列 , ,将掩码位置嵌入作为答案词来构建连续答案空间 ,

步骤4、将动态提示 与工业领域文本数据 合并, 为每个batch中样本数量,将合并后的序列通过编码器得到对应的词嵌入表示输入到预训练模型中,在掩码位置可得到掩码词的输出嵌入 和分类前输出向量 ,

其中, 是模型的输出投影矩阵, 为偏置变量,为词汇表大小;

步骤5、将输入序列 中随机掩盖一个标记得到掩码后序列 ,在提示模板 掩码位置使用真实标签对应的答案词替换,构建新的输入序列 ,利用预训练语言模型去预测被掩盖的标记词 ,通过交叉熵损失 最大化条件概率 ,;

其中, 是所有被遮盖位置的集合, 表示二元交叉熵损失函数。

2.如权利要求1所述的一种用于低标注工业语料的知识图谱构建的关系抽取方法,其特征在于,所述关系抽取方法还包括以下步骤:步骤6、将训练样本分为两种格式:掩码格式和未掩码格式,在掩码格式中,将实体对、 作为模型的输入,与提示 构成新的输入序列,将得到掩码位置的分类前输出向量作为实体偏差,空白输入与提示 构成输入序列 ,得到掩码位置的分类前输出向量作为提示偏差 ,从原始输入的分类前输出向量中减去偏差,;

微调过程通过交叉熵损失 优化,

其中, 是模型的输出投影矩阵, 为偏置变量;

步骤7、在关系知识注入的答案空间 中选择当前输入 真实关系标签对应的答案词 作为正样本,随机选择除 外的任意答案词作为负样本 ,通过计算余弦相似度,将模型预测结果 与真实答案词更加接近,与不相关答案词更加疏远,;

步骤8、在未掩码格式中,将原始提示模板中的[MASK]标记替换为连续空间中的关系答案词,两个起始标记的位置对应的输出向量拼接,用于构成关系表示 ,并输入到分类器中,以输出在标签集合Y上的概率分布,微调过程通过交叉熵损失 进行优化,;

其中, 是模型的输出投影矩阵, 为偏置变量。

3.如权利要求2所述的一种用于低标注工业语料的知识图谱构建的关系抽取方法,其特征在于,所述关系抽取方法还包括以下步骤:步骤9、计算整体损失 ,

其中,当输入为掩码格式时,为1,否则为0;为超参数;

步骤10、在训练初期,采用较低比例的掩码格式样本并保留较高比例的未掩码格式数据,8  随着训练过程的推进,逐步提升掩码样本的比例,最终过度至全掩码格式;

步骤11、重复步骤4至10,当 小于指定的最小损失值后,结束计算,将预测结果中概率最大位置索引对应的关系作为工业领域文本中工业实体关系的最终结果。