利索能及
我要发布
收藏
专利号: 202211632497X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于对比学习的专业领域术语挖掘方法,其特征在于,所述基于对比学习的专业领域术语挖掘方法,包括:步骤1、基于专业领域的语料库形成术语列表;

步骤1‑1、采用信息熵算法和互信息算法挖掘语料库中的新短语;

步骤1‑2、将挖掘的新短语加入分词词库,以分词词库对语料库中所有语句进行分词,并提取每一分词词语中的关键词,对提取的关键词去重合并后形成关键词列表;

步骤1‑3、过滤关键词列表中的非专业词语,并进行词条匹配得到术语列表;

步骤2、对术语列表中的术语进行领域分类;

步骤2‑1、取术语列表中每条术语对应的词条;

步骤2‑2、将词条分句,并将各分句输入基于对比学习的句向量学习模型,输出词条中各分句对应的句向量;

步骤2‑3、将术语对应的bert模型训练的词向量和术语对应词条中各分句对应的句向量拼接后输入分类模型,得到术语的领域分类结果;

步骤3、基于术语列表构建专业领域的树型术语关系树;

步骤3‑1、根据领域分类结果对术语列表中的术语进行聚类;

步骤3‑2、将术语与术语所在的分句向量进行拼接,拼接后再与术语所在的文段向量进行拼接得到术语的特征向量;所述术语所在的分句向量由对比学习模型基于术语所在专业文献中的摘要部分训练得到,所述术语所在的文段向量由bert模型基于术语所在专业文献中的摘要部分训练得到;

步骤3‑3、将属于同一类别的术语的特征向量成对输入基于对比学习的关系识别模型,得到每对中两个术语之间的关系;

步骤3‑4、根据两两术语之间的关系,构建各个专业领域的树型术语关系树。

2.如权利要求1所述的基于对比学习的专业领域术语挖掘方法,其特征在于,所述采用信息熵算法和互信息算法挖掘语料库中的新短语,包括:步骤1‑1‑1、将语料库中所有语句分割成单个字符,每个字符作为一个候选片段,形成候选片段集合CS;

步骤1‑1‑2、将候选片段集合CS中相邻的两个候选片段作为一个候选短语cp,计算候选短语cp的左信息熵LE(cp)和右信息熵RE(cp);

步骤1‑1‑3、针对候选短语cp,计算候选短语cp的内部互信息MI(cp);

步骤1‑1‑4、设置得分阈值δ和概率阈值λ,针对每个候选短语cp,计算得分S(cp)为S(cp)=MI(cp)+min(LE(cp),RE(cp)),如果候选短语cp在语料库中的出现概率大于λ且得分S(cp)大于δ,则确认候选短语cp为一个新短语;

步骤1‑1‑5、将确认为新短语的两个候选片段组合作为一个新的候选片段,更新候选片段集合CS,跳转到步骤1‑1‑2开始下一轮迭代,直至无新短语出现。

3.如权利要求2所述的基于对比学习的专业领域术语挖掘方法,其特征在于,所述左信息熵LE(cp)和右信息熵RE(cp)的计算公式如下:式中,L(cp)指候选短语cp在语料库中所有左边候选片段的集合,R(cp)指候选短语cp在语料库中所有右边候选片段的集合,p(x)指候选片段x在语料库中的出现概率;

所述内部互信息MI(cp)的计算公式如下:

式中,x、y为构成候选短语cp的两个候选片段,p(y)指候选片段y在语料库中的出现概率,p(x,y)指候选短语cp在语料库中出现的概率。

4.如权利要求1所述的基于对比学习的专业领域术语挖掘方法,其特征在于,所述过滤关键词列表中的非专业词语,并进行词条匹配得到术语列表,包括:步骤1‑3‑1、基于词性标注算法得到关键词列表中每个关键词的词性,过滤掉不是名词和不是动词的关键词;

步骤1‑3‑2、将步骤1‑3‑1过滤后的关键词列表中的每个关键词在互联网知识库中进行词条匹配,舍弃匹配不到词条的关键词,最终形成术语列表,术语列表中每一个术语对应一条词条。

5.如权利要求1所述的基于对比学习的专业领域术语挖掘方法,其特征在于,所述分类模型包括依次连接的长短期记忆网络、全连接层和softmax层,输入至长短期记忆网络的向量经过全连接层后由softmax层输出术语的领域分类结果。

6.如权利要求1所述的基于对比学习的专业领域术语挖掘方法,其特征在于,所述术语的特征向量的拼接公式为:H″t=W0[concat(H0,H′t)]+b0

H′t=concat(St,Ht)

式中,St为术语列表中的第t个术语,Ht为术语St所在的分句向量,concat(,)为向量拼接函数,H′t为术语St与术语所在的分句向量Ht拼接后的新向量,H0为术语St所在的文段向量,b0为偏差向量,W0为权重,H″t为术语St对应的特征向量。

7.如权利要求1所述的基于对比学习的专业领域术语挖掘方法,其特征在于,所述句向量学习模型和分类模型的训练过程如下:取基于训练数据形成的术语列表作为训练术语列表;

对于训练术语列表中的每条术语ri,构建分类样本si=(doc(ri),li),其中,doc(ri)为术语ri匹配的词条,li为术语ri的类型;

句向量模型的训练包括:

输入层:将doc(ri)词条分句,随机抽取其中两个分句Sk1和Sk2,将两个分句分别对应一个300×1的小矩阵SDk1和SDk2,同时标记这两个分句是否为相邻分句,记入[CLS]标记位,将小矩阵SDk输入至句向量模型的输入层:编码层:对每个小矩阵SDk使用Encoder对其进行编码,接入到dropout层防止过拟合,输出每个分句对应的300×1的小矩阵SVk作为分句的句向量;

交互层:根据[CLS]标记位判断一组分句是正样本还是负样本,令分句向量与其正样本的相似度高,而与其负样本的相似度小,将编码层输出的句向量分布映射到MLP层进行表示,并在MLP层根据对比学习的loss公式训练句向量模型参数;

分类模型的训练包括:

在句向量模型训练完成后,利用句向量模型输出每个分句的句向量;

将术语对应的bert模型训练的词向量和句向量模型输出每个分句的句向量拼接后输入分类模型,预测术语的领域分类结果;

根据预测的术语的领域分类结果和术语实际的类型li将计算损失函数训练分类模型参数。