利索能及
我要发布
收藏
专利号: 2022109172864
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种融合主题模型的图书馆平台语义检索方法,其特征在于:包括以下步骤:S1、对所有被检索的文档进行数据预处理,通过分词、清洗、标准化之后得到合格的被检索文档;

S2、利用布尔模型将用户的检索词语与S1中得到的合格的被检索文档进行匹配,根据匹配结果将所有文档分为相关与不相关两类并赋予不同的权重值;

S3、利用主题模型对S1处理的被检索文档进行计算,得到每个文档的主题分布和主题单词的分布;主题模型的生成过程共分为四步:S31、对于主题z,根据Dirichlet分布Dir(β)得到该主题上的一个单词多项式分布向量φ;

S32、根据泊松分布P得到文本的单词数目N;

S33、根据Dirichlet分布Dir(α)得到该文本的一个主题分布概率向量θ;

S34、对于该文本M个单词中的每一个单词 ,先从θ的多项式分布Multinomial(θ)随机选择一个主题z;再从主题z的多项式条件概率分布Multinomial(φ)选择一个单词作为;

利用gibbs抽样方法对上面的生成过程进行计算,主题模型的联合概率分布函数为:;

Gibbs抽样算法通过积分避开了实际待估计的参数,转而对每个单词的主题进行采样,每个单词的主题确定下来后,参数可以在统计频次后计算出来,故参数估计问题变为计算单词序列下主题序列的条件概率,其公式如下:;

其中, 表示对文档n中第m个单词对应的主题变量;‑nm表示不包括其中的第m项;

表示k主题中出现词v的次数; 是词v的Dirichlet先验; 表示文档n出现主题k的次数;

是主题k的Dirichlet先验;Gibbs采样的基本思想是固定某一维度 ,然后通过其他维度 的值来抽样该维度的值,马尔科夫链通过转移概率矩阵可以收敛到稳定的概率分布;当马尔科夫链在迭代阶段消除初始参数的影响,到达算法收敛时,根据当前z的分布计算文档在主题上的分布θ和主题在单词上的分布 ,公式为:;

其中, 表示主题k中词v的概率, 表示文档n中主题k的概率;

S4、将S3得到的主题单词的频数分布转换为单词主题分布;

S5、计算检索词的单词主题分布与被检索文档的之间的相似性分数;

S6、利用S2中的文档权重与S5中的相似性分数计算检索词与各个被检索文档的联系分数,并根据联系分数进行排序后将查询结果返回给用户。

2.根据权利要求1所述的一种融合主题模型的图书馆平台语义检索方法,其特征在于:所述S1中,数据预处理具体包括:将文档集合D进行分词操作,对文档 分词后得到;接着对分词后的文档进行清洗操作,清洗过程中去掉无用的标签、特殊符号和停用词;最后对文本内容进行标准化,将部分文本中的同一个单词具有不同的形态转化为同一种形式。

3.根据权利要求1所述的一种融合主题模型的图书馆平台语义检索方法,其特征在于:所述S2中,在基于布尔模型的匹配中,被检索文档 可表示为: ,用户的检索 可表示为: ,其中 表示第n个被检索文档, 表示第一个检索词;布尔模型中有三个主要逻辑算符,分别是与(and),或(or),非(not),假设用户查询包含两个检索词 和 ,考虑不同逻辑算符下单词的条件,条件有四个:(1);(2) ;(3) ,(4) ,为不同文档赋予权重的公式可以表示为:

其中, 表示文档 的权重,因此,被检索文档具有不同的权重系数。

4.根据权利要求3所述的一种融合主题模型的图书馆平台语义检索方法,其特征在于:所述S4中,单词‑主题频数分布表示为:。

5.根据权利要求4所述的一种融合主题模型的图书馆平台语义检索方法,其特征在于:所述S5中,当用户输入检索词v时,得到分布和

,为了计算检索词与被检索文档中的关系,通过下列公式计算相似性:

6.根据权利要求5所述的一种融合主题模型的图书馆平台语义检索方法,其特征在于:所述S6中,返回的检索结果表示为:

根据 值的大小的排序,将被检索文档的结果返回给用户, 的值越大,返回结果越靠前; 值越小,返回结果越靠后。