利索能及
我要发布
收藏
专利号: 2024113049734
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于知识库层级树结构的短文本查询扩展增强检索方法,其特征在于,包括以下步骤:

(S1)将知识库纯文本文档分割成短且连续的文本块;

(S2)利用向量大模型将所述文本块映射到一个高维向量空间转化为向量表示;每个文本块的向量表示构成知识库层级树的叶子节点;

(S3)将所述文本块的向量表示降维,采用软聚类方法将降维后语义相似的文本块分组,允许一个文本块属于不同的聚簇;

(S4)利用大语言模型将每个聚簇包含的文本块进行总结生成摘要,通过向量大模型将所述摘要转化为向量表示,形成知识库层级树中叶子层的上一层节点;

(S5)对所述步骤(S3)和所述步骤(S4)递归地重复执行,直到无法进一步聚类或达到预设的层数限制,从而构建出由底向上的知识库层次树;

(S6)给定一个短文本查询,基于少量示例Prompt利用大语言模型将所述短文本查询扩展生成若干个一级子查询,每个所述一级子查询聚焦于所述短文本查询的不同方面进行扩展;

(S7)对于每个一级子查询,通过对所述知识库层级树的高级摘要层进行逐层遍历节点,计算所述一级子查询和所述高级摘要层节点文本的相似度,返回与所述一级子查询最相关的摘要节点集,形成检索到的上下文;将所述短文本查询、所述一级子查询与所述上下文输入大语言模型生成所述一级子查询对应的二级子查询;对每个一级子查询并发执行以上操作;

(S8)对于每个二级子查询,基于所述知识库层级树中快速定位的摘要节点集索引,对其所有叶子节点进行遍历检索,挖掘基于所述二级子查询细粒度级别的信息形成检索到的上下文;将所述短文本查询、所述一级子查询、所述二级子查询和所述上下文输入大语言模型生成所述二级子查询的回答;对每个二级子查询并发执行以上操作,生成短文本查询的最终回答。

2.根据权利要求1所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法,其特征在于,所述步骤(S1)具体为:利用知识库纯文本文档的结构化信息,将文档解析成一系列文档元素,每个所述文档元素对应文档中一个完整的语义单元;其中,所述文档元素包括标题、正文;采用基于文档结构的语义分块方法,设置分块大小阈值;文档解析时,按照所述文档元素在文档中出现的顺序,将所述文档元素依次合并到一个文本块中,并尽可能填充每一个文本块,在超过文本块阈值或者遇到下一个标题元素时,结束当前文本块,开启新的文本块;为避免生成过多过小的文本块,当连续小节的字符数总数不超过该阈值时,文本被合并到一个文本块中,直到充满文本块为止。

3.根据权利要求1所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法,其特征在于,所述步骤(S3)具体为:为满足多主题知识库层次树构建,采用高斯混合模型聚类算法进行文本块聚类,允许每个文本块属于多个聚簇;对于所有文本块向量数据x(x1,x2,…,xm),m代表文本块个数;

(S3.1)全局降维:采用UMAP降维算法,将所有文本块向量数据x从高维空间映射到低维空间,转变为低维向量数据x’(x1’,x2’,…,xm’);

(S3.2)确定最佳聚类数:对于高斯混合模型聚类算法,每个高斯分布代表一个聚簇,多个高斯分布叠加在一起,形成高斯混合模型GMM,公式表示如下:其中, 是高斯分布; 是第k个高斯分布的均值; 是第k个高斯分布的方差; 是第k个高斯分布的混合权重;K是高斯分布的个数,表示聚簇的个数;

使用贝叶斯准则计算最优聚簇数量K’;

(S3.3)计算高斯混合模型参数:根据步骤(S3.2)得到最优聚簇数量K’,使用期望最大化算法优化高斯混合模型参数,所述高斯混合模型参数包括K’个高斯分布中每个高斯分布的均值 、方差 和权重 ;

(S3.4)将每个低维向量数据x’划入聚簇:设置阈值T;对于每一个低维向量数据x’,计算其属于各个高斯分布的概率值,公式如下:其中, 表示x’属于第k个高斯分布的概率;如果 ,那么x’划入第k个聚

簇;如果有多个概率大于阈值,那么x’划入多个聚簇;每个聚簇包括多个低维向量数据,形成全局聚簇;

(S3.5)对于每个全局聚簇采用高斯混合模型聚类算法进行局部聚类:对每个全局聚簇中的所有低维向量数据x’,按照步骤(S3.2)‑(S3.4)执行局部高斯混合模型聚类,每个低维向量数据x’再次被划到不同的聚簇中;每个全局聚簇迭代执行以上操作,实现从广泛主题到具体细节的捕捉;

(S3.6)根据步骤(S3.5)的结果,每个低维向量数据x’的聚簇结果即为对应向量数据x的聚簇结果。

4.根据权利要求1所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法,其特征在于,所述步骤(S5)包括:在所述知识库层级树状结构中,父节点包含子节点的文本摘要,所述子节点是下一级摘要或者原始文本块;不同层次的知识库层级树能够提供文档的不同抽象层次内容;高层次节点摘要包含多文档的高级细节;低层次节点包含低级细节。

5.根据权利要求1所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法,其特征在于,所述步骤(S6)具体为:给定短文本查询,基于少量示例Prompt利用大语言模型将查询扩展成若干个一级子查询,每个一级子查询聚焦于短文本查询的一个不同方面或细节;其中,所述扩展过程中遵循以下原则:保持每个扩展的子查询与短文本查询的相关性;保持扩展的子查询的多样性,涵盖多方面;确保每个扩展的子查询的明确性;避免产生重复的子查询;实施第一阶段泛化扩展以实现短文本查询与大语言模型的语义对齐。

6.根据权利要求1所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法,其特征在于,所述步骤(S7)具体为:对于泛化扩展的每个一级子查询,通过对已构建的知识库层级树的高级摘要层进行逐层遍历节点,迭代实施检索增强;

(S7.1)通过相同的向量大模型将一级子查询转化为向量表示;

(S7.2)按照广度搜索算法,从知识库层级树的根节点开始遍历,基于一级子查询实施基于BM25算法的关键词检索和向量检索的混合检索方法;

(S7.3)根据BM25算法评估一级子查询和摘要节点文本的相关性,通过对查询进行特征提取分解,生成若干特征词;对每个摘要文本,计算每个特征词与所述摘要文本的相关性得分,最后将特征相对于摘要文本的相关性得分进行加权求和,得到一级子查询与摘要文本的相关性分数;向量检索通过计算一级子查询和摘要文本向量的余弦相似度计算相似度分值;

(S7.4)返回BM25关键词检索分值最高的n个摘要节点和对应分值,形成第一列表;返回向量检索分值最高的n个摘要节点和对应分值,形成第二列表;

(S7.5)采用倒数排序融合算法计算上述两个列表中每个摘要节点的综合分值;根据每个列表中节点的分值分配倒数排名分数,所述倒数排名分数的计算方式为1/(rank+N),其中,rank表示节点在该列表中的排序位置,N表示常量;对两个列表中的每个摘要节点,将其在第一列表中和第二列表中的倒数排名分数相加,得到合并分数;如果某个摘要节点只存在于一个列表中,则另一个列表中该摘要节点的倒数排名分数为0;

(S7.6)根据所述合并分数对摘要节点进行排序,返回相关性最大的k个摘要节点集;

(S7.7)连接短文本查询、一级子查询和检索返回的k个摘要节点文本,利用大语言模型生成二级子查询,其中,所述摘要节点文本中,将相关度最大的摘要节点文本放在最前面;

每个二级子查询关联返回的摘要节点索引ID,便于进一步查询检索的快速定位;

(S7.8)对每个一级子查询并发执行以上操作,生成一级子查询对应的二级子查询。

7.根据权利要求1所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法,其特征在于,所述步骤(S8)具体为:(S8.1)通过相同的向量大模型将二级子查询转化为向量表示;

(S8.2)根据二级子查询关联的摘要节点索引ID集基于知识库层级树快速定位到对应摘要节点,根据深度搜索算法,对其所有的叶子节点进行遍历检索;检索采用基于BM25算法的关键词检索和向量检索的混合检索方法,通过对原始文本块挖掘基于二级子查询细粒度级别的信息,返回检索后相关度最大的k个叶子节点文本;

(S8.3)连接短文本查询、一级子查询、二级子查询和检索返回的叶子节点文本,利用大语言模型生成关于二级子查询的回答;对每个二级子查询迭代以上操作,综合每个回答的结果,生成原始短文本查询的最终答案。

8.一种电子设备,包括存储器和处理器,其特征在于,所述存储器与所述处理器耦接;

其中,所述存储器用于存储程序数据,所述处理器用于执行所述程序数据以实现如权利要求1‑7任一项所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法。

9.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述程序被处理器执行时实现如权利要求1‑7任一项所述的一种基于知识库层级树结构的短文本查询扩展增强检索方法。