利索能及
我要发布
收藏
专利号: 2024105482184
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种碳中和领域中文文本的实体关系联合抽取方法,其特征在于,所述方法包括如下步骤:步骤一,碳中和中文文本数据的收集:从中国碳核算数据库、全球实时碳数据、世界银行数据库网站获取中国和世界各国的碳排放数据,收集各省市的碳排放评价要求指南,在碳中和信息网,用网络爬虫的方法爬取碳中和政策标准、通知公告和相关信息,从指定段落中得到待抽取实体关系非结构化的碳中和中文文本,以及给定的本体约束集合,所述本体约束集合包括关系名称、头实体类型和尾实体类型,根据预设比例将已标注的碳中和中文文本数据划分为训练集D1和验证集D2,所述碳中和中文文本数据包括各样本所包含的主语、宾语、关系以及类别标签;

步骤二,用ChatGLM3对训练集D1进行数据增强:统计训练集D1中所有三元组中各种关系出现的次数,判断关系类型是否存在长尾分布情况,针对关系类型不平衡的训练数据,使用ChatGLM3接口对样本量少的关系类型进行数据增强,生成原文本有相同的关系三元组的样本集加入D1中;

步骤三,用扩充后的D1训练实体关系联合抽取模型:将D1的中文文本句子输入Embedding层,得到嵌入向量后添加噪声,依次输入分层去掩码的Atom‑7B大模型和PFN模型,输出文本句子对应的实体和关系预测值,并通过自动调整命名实体识别和关系抽取的损失权重计算动态损失函数,根据损失梯度联合优化实体关系联合抽取模型的参数,并保存验证集D2上抽取性能最佳的模型参数;

步骤四:将没有标注的碳中和中文文本句子输入训练好的Atom‑7B大模型,得到文本句子的特征表示向量后,再将特征表示向量传入PFN模块,输出实体关系三元组。

2.如权利要求1所述的碳中和领域中文文本的实体关系联合抽取方法,其特征在于,所述步骤二中,对D1中样本数量少的关系类型,挑选出包含该关系类型的样本s0,调用ChatGLM3大模型接口,通过对话的形式生成和原样本有相同关系三元组的样本集,并加入D1中,过程如下:

2.1向ChatGLM3大模型接口输入“Please translate from Chinese to English,keeping the word#unchanged:%”,其中#表示文本中的关系三元组triple_list,%表示待扩充的文本句子s0;

2.2 ChatGLM3大模型接口输出翻译成英文后的句子s′0;

2.3再向ChatGLM3大模型接口输入“请把句子翻译成中文:$”,其中$表示s′0;

2.4 ChatGLM3大模型接口输出翻译成中文的句子,即扩充后的文本句子s1;

2.5重复2.2‑2.4,把扩充后的文本句子集{s1,…,sm}及其关系三元组标签作为样本集加入D1中。

3.如权利要求1或2所述的碳中和领域中文文本的实体关系联合抽取方法,其特征在于,所述步骤三的过程如下:

3.1在Atom‑7B大模型的Embedding层添加服从均匀分布的噪声:输入文本句子sj,通过AtomTokenizer 转化为token序列向量t,随机生成一个噪声向量∈,并缩放到设置的强度,添加到嵌入向量t中得到加噪后的嵌入向量x为Atom

x=Embedding (t)+α∈

∈~Uniform(‑1,1)

Atom

其中sj是D1中第j个样本对应的文本句子,Embedding 是Atom‑7B大模型的Embedding层,∈是服从均匀分布Uniform的噪声,α是噪声的缩放因子;

3.2将x输入基于分层去掩码的Atom‑7B大模型解码器层Decoder Layers,输出文本句子si所有token的表示向量h:对Atom‑7B大模型的解码器层进行分层操作,解码器层记为W0为冻结的预训练好的解码器层参数,△W是用LoRA技术微调的解码器层

1:l l+1:n

参数,第1到l层,即Atom 不去掩码,第l+1到n层,即BiAtom 去除掩码,得到所有token的特征表示向量h为△W=WdownWup

其中 是第 1 到l层 中多 头自 注意 力的 第i 个头 ,

是第l+1到n层中多头自注意力的第i个头,M是Atom‑7B大模型的

掩码,‑∞表示当前token对之后的所有token不可见,即只计算单向注意力,M′是去除‑∞后的掩码,即计算双向自注意力,Q、K和V是多头自注意力机制中的Query、Key和Value,q k vSoftMax为激活函数,dk为K的维度大小,W、W、W是三个可训练的参数矩阵,Wdown是LoRA微调的降维矩阵,Wup是LoRA微调的升维矩阵,用LoRA技术微调的参数包括解码器层的q_proj、k_q k vproj、v_proj三个模块,q_proj、k_proj、v_proj模块参数更新会影响W、W、W这三个参数矩阵;

3.3将所有token的表示向量h输入PFN模型,分别得到实体和关系的预测值 和 其中表示以第i个token开始和第j个token结束的token对属于类型为k的实体的概率, 表示第i个token和第j个token属于关系类型为l的主语实体和宾语实体起始词的概率,并计算动态损失函数,即在训练刚开始时,将命名实体识别和关系抽取的损失相加作为总损失,训练过程中自动调整命名实体识别和关系抽取的损失权重,损失更大的子任务权重更大:其中,θ是PFN模型的参数, 和 分别是实体和关系的标签,S和T分别是所有实体标签和关系标签的集合,Lner和Lre分别是命名实体识别子任务和关系抽取子任务的损失,BCELoss是二分类交叉熵损失,σ表示sigmoid激活函数,exp表示取指数操作,λ是阈值;

3.4联合优化实体关系联合抽取模型的参数:根据损失函数的梯度值,用LoRA技术微调Atom‑7B大语言模型的部分参数△W,对PFN模型的参数θ进行全参数微调Fine‑Tuning;

3.5重复步骤3.1‑3.4直到达到最大迭代步数,同时保存验证集D2上F1分数最高的实体关系联合抽取模型的参数。

4.一种实现如权利要求1所述的碳中和领域中文文本的实体关系联合抽取的系统,其特征在于,所述系统包括:碳中和数据收集模块,用于获取碳排放、碳中和数据,从指定段落中得到待抽取实体关系非结构化的碳中和中文文本,以及给定的本体约束集合,所述本体约束集合包括关系名称、头实体类型和尾实体类型,根据预设比例将已标注的碳中和中文文本数据划分为训练集D1和验证集D2,所述中文文本数据包括当前样本所包含的主语、宾语、关系以及类别标签;

训练集数据增强模块,用于对训练集D1进行预处理,统计训练集D1中所有关系三元组中各种关系出现的次数,判断关系类型是否存在长尾分布情况,针对标注不平衡的关系类型,使用ChatGLM3接口对样本量少的关系类型进行数据增强,生成的文本和原文本有相同的关系三元组;

联合抽取模型训练模块,在Atom‑7B大模型中,将训练集D1的文本句子依次通过包含添加噪声的Embedding层和分层去掩码的解码器层得到其特征表示向量,在PFN中,输入文本句子的特征表示向量后得到对应的实体和关系预测概率,通过动态损失函数自动调整命名实体识别和关系抽取的损失权重,联合优化中用LoRA技术微调Atom‑7B大语言模型的部分参数,而对PFN模型进行全参数微调,并保存验证集D2上抽取性能最佳的模型参数;

实体关系三元组输出模块,用于将没有标注的碳中和中文文本输入训练好的实体关系联合抽取模型,通过Atom‑7B大模型得到文本句子的特征表示向量后,再通过PFN输出实体关系三元组。