1.一种融合语言模型与语义特征的关键词提取方法,其特征在于,所述融合语言模型与语义特征的关键词提取方法,包括:步骤1、提取目标文本中的名词和名词短语构成候选词集合,利用语言模型分别针对目标文本和候选词集合生成目标文本表征向量和候选词表征向量;
步骤2、对所述候选词表征向量降维后进行聚类操作,得到具有若干个聚类的聚类集合;
步骤3、基于候选词与目标文本的语义相似度确定各聚类待提取关键词的名额,并从各聚类中筛选对应名额的候选词,生成候选关键词集合;
步骤4、利用最大边界相关算法从候选关键词集合中提取候选词,得到最终关键词;
其中,所述基于候选词与目标文本的语义相似度确定各聚类待提取关键词的名额,包括:步骤31、对每个候选词,计算其候选词表征向量与目标文本的目标文本表征向量的余弦相似度,将计算的余弦相似度作为候选词的语义权重;
步骤32、对聚类集合中每个聚类,计算每个聚类中包含的候选词的语义权重的平均值,并根据平均值得到每个聚类的语义权重;
步骤33、对每个聚类的语义权重进行归一化,将归一化后的值作为对应聚类的语义份额,并根据语义份额生成每个聚类待提取关键词的名额。
2.如权利要求1所述的融合语言模型与语义特征的关键词提取方法,其特征在于,所述对所述候选词表征向量降维后进行聚类操作,包括:通过UMAP降维算法,对每个候选词表征向量进行降维,得到降维后的候选词表征向量;
通过HDBSCAN聚类算法,对降维后的候选词表征向量进行聚类,得到一个聚类集合C={c1,c2,...,cj,...,cn},其中cj表示聚类集合中第j个聚类。
3.如权利要求1所述的融合语言模型与语义特征的关键词提取方法,其特征在于,所述根据平均值得到每个聚类的语义权重,包括:rj=tj*nj*gj
式中,rj为聚类集合中第j个聚类的语义权重,tj为聚类集合中第j个聚类中包含的候选词的语义权重的平均值,nj为聚类集合中第j个聚类中包含的候选词数量,gi为聚类集合中第j个聚类的权重系数。
4.如权利要求1所述的融合语言模型与语义特征的关键词提取方法,其特征在于,所述根据语义份额生成每个聚类待提取关键词的名额,包括:aj=a*fj
式中,aj为聚类集合中第j个聚类待提取关键词的名额,a为预设的待生成的候选关键词集合中候选词的数量,fj为聚类集合中第j个聚类的语义份额。
5.如权利要求4所述的融合语言模型与语义特征的关键词提取方法,其特征在于,所述预设的待生成的候选关键词集合中候选词的数量a为提取的最终关键词的数量的3~5倍。
6.如权利要求1所述的融合语言模型与语义特征的关键词提取方法,其特征在于,所述并从各聚类中筛选对应名额的候选词,生成候选关键词集合,包括:在各聚类下按照候选词的语义权重,从高到低取对应名额的候选词,汇总各聚类下的候选词,生成候选关键词集合H={h1,h2,...,hq,...,hk},其中hq表示第q个候选词。