利索能及
我要发布
收藏
专利号: 2024103581471
申请人: 苏州岽睿微电子科技有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-12
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于语言预训练模型中的中文文本匹配方法,其特征在于:包括如下步骤:使用预训练语言模型,通过在下游分类任务上进行微调来作为序列分类器,将需要匹配的两句话通过分隔字符拼接起来后作为模型的输入,输出预测结果;

在微调过程中,采用DC‑Match方法,使用将意图与关键词分开的思路,将预训练语言模型Encoder提取的特征预测关键词与意图信息,分别使用掩码覆盖,通过让模型学习区分关键词与意图,以此提高预测准确度;

在预测过程中,对于Encoder后的微调层,将预训练语言模型最后4层的特征单独提取出来,对于每层特征,提取出来的4层特征的结构为[size,token,hidden_states],对每个token维度分别取出最大的隐层向量,然后进行拼接,拼接后的结构为[size,hidden_states*4],以此作为输入,输入聚合分类器;

所述聚合分类器中有多个聚合分类模块,每个聚合分类器由线性层、GELU激活函数、注意力模块组成,所有注意力模块共享参数,最终进入全分类层预测匹配结果;

所述预训练语言模型还包括训练部分;

所述训练部分取得的是最后一层的隐层特征,随后分别经过关键词与意图掩码处理,然后进入训练特征分类模块;

所述训练特征分类模块包括激活函数、注意力机制和全连接层,其中注意力机制与注意力模块共享参数,并以加权的形式与激活函数的结果相加,权重大小为超参数。

2.如权利要求1所述的基于语言预训练模型中的中文文本匹配方法,其特征在于:所述训练时的损失包括:(1)模型分类的总损失Lsm;(2)根据远程监督方法,用于衡量模型学习意图与关键词的损失Lds;(3)利用双向KL散度损失来衡量原始预测分布Psm与关键词意图Qds预测分布之间的距离,记为Ldc;

将上述3处损失加权相加,在原有损失函数的基础上进行改进,扩大了意图匹配损失的权重,损失函数如下:

3.如权利要求2所述的基于语言预训练模型中的中文文本匹配方法,其特征在于:将两a b a,b a sep b a b个文本S和S作为连续的序列S =[S;w ;S],得出损失函数Lsm=‑ln P(y|S ,S),所述Pa b(y|S ,S)表示关键字匹配。

4.如权利要求2所述的基于语言预训练模型中的中文文本匹配方法,其特征在于:对于Lds,将预训练语言模型的输出状态分为两部分 和 分别对应于关键字和意图的字符序列,其中Nk、Ni表示字符数目,从而得出损失函数其中,Wds是可训练的参数,并且 是PLM的

最后一层输出的隐层信息(hidden_states),分别是关键词的隐层信息与意图的隐层信息;

其目标旨在推动编码器去学习关键词和意图的表示,使他们能够彼此分离,从而建模不同的匹配等级。

5.如权利要求2所述的基于语言预训练模型中的中文文本匹配方法,其特征在于:对于Ldc, 使用双向KL散a b a b a b a b

度损失来最小化P(y|S ,S)和Q(y|S ,S),P(y|S ,S)和Q(y|S ,S)分别表示关键字匹配和意图匹配,并假设它们彼此独立。