利索能及
我要发布
收藏
专利号: 2017101311209
申请人: 上海颐为网络科技有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种词条结构的合并方法,其特征在于,包括:步骤一:将词条结构格式转化为文本格式,其中,词条结构中的词条属性按照键值对以哈希存储方式进行存储,其中词条属性包括词条标识、词条名称、词条文本、父级词条、子级词条,在将词条结构格式转化为文本格式的过程中,将词条结构中的根词条的词条属性以及根词条下所有子词条的词条属性读取出来以形成文本格式;

步骤二:在文本格式的基础上,基于词条与词条的余弦相似度以及词条与文本的余弦相似度将多个文本合并为一个文本;

步骤三:将合并后的文本格式再转化为词条结构格式。

2.根据权利要求1所述的词条结构的合并方法,其特征在于,步骤二进一步包括:步骤1:将第一文档作为合并主体,将第二文档作为合并次体;

步骤2:第二文档的根词条遍历第一文档的所有词条,得到相应的余弦相似度;

步骤3:比较步骤2中得到的余弦相似度,找到最大的余弦相似度的值;

步骤4:若步骤3得到的最大的余弦相似度的值大于第一阈值,则执行步骤5,否则执行步骤7;

步骤5:记录最大余弦相似度的值对应的合并主体中的词条,将合并次体的根词条合并到所记录的合并主体中的对应词条中;

步骤6:将合并后的词条的所有子词条进行两两余弦相似度计算,若余弦相似度大于第一阈值,则将两词条合并,合并后的词条再重复进行步骤6,直到最后合并后的词条的所有子词条的两两余弦相似度全部小于第一阈值后结束;

步骤7:将第二文档作为合并主体,将第一文档作为合并次体;

步骤8:第一文档的根词条遍历第二文档的所有词条,得到相应的余弦相似度;

步骤9:比较步骤8中得到的余弦相似度,找到最大的余弦相似度的值;

步骤10:若步骤9得到的最大的余弦相似度的值大于第一阈值,则执行步骤11,否则执行步骤13;

步骤11:记录最大的余弦相似度的值对应的合并主体中的词条,将合并次体的根词条合并到所记录的合并主体中的对应词条中;

步骤12:将合并后的词条的所有子词条进行两两余弦相似度计算,若余弦相似度大于第一阈值,则将两词条合并,合并后的词条再重复进行步骤12,直到最后合并后的词条的所有子词条的两两余弦相似度全部小于第一阈值后结束;

步骤13:重新将第一文档作为合并主体,将第二文档作为合并次体;

步骤14:第二文档的根词条遍历第一文档的所有词条的文本,得到相应的余弦相似度;

步骤15:比较步骤14中得到的余弦相似度,找到最大的余弦相似度的值;

步骤16:若步骤15得到的最大的余弦相似度的值大于第二阈值,则执行步骤17,否则执行步骤18;

步骤17:记录最大余弦相似度的值对应的合并主体中的词条,将合并次体的根词条合并到对应的合并主体中的所记录的词条;

步骤18:将第二文档作为合并主体,将第一文档作为合并次体;

步骤19:第一文档的根词条遍历第二文档的所有词条的文本,得到相应的余弦相似度;

步骤20:比较步骤19中得到的余弦相似度,找到最大的余弦相似度的值;

步骤21:若步骤20得到的最大余弦相似度的值大于第二阈值,则执行步骤22,否则判断两词条文本无相关性;

步骤22:记录最大余弦相似度的值对应的合并主体中的词条,将合并次体的根词条合并到对应的合并主体中的所记录的词条,合并结束。

3.根据权利要求1所述的词条结构的合并方法,其特征在于,步骤二进一步包括:步骤1:比较第一文档和第二文档的词条数目,将词条数目多的作为合并主体,将词条数目少的作为合并次体;

步骤2:合并次体的所有词条遍历合并主体的所有词条,得到相应的余弦相似度;

步骤3:比较步骤2中得到的余弦相似度,找到最大的余弦相似度的值;

步骤4:若步骤3得到的最大余弦相似度的值大于第一阈值,则执行步骤5,否则执行步骤7;

步骤5:记录最大余弦相似度对应的在合并主体以及合并次体中的两个词条,将合并次体中的这一词条合并到合并主体的这一词条中,并保持合并次体不变;

步骤6:将合并主体中的合并后的词条的所有子词条进行两两余弦相似度的计算,若余弦相似度大于第一阈值则将两词条合并,合并后的词条重复步骤6,直到最后合并后的词条的所有子词条两两余弦相似度全部小于第一阈值,合并结束;

步骤7:合并次体的所有词条遍历合并主体的所有词条的文本,得到相应的余弦相似度;

步骤8:比较步骤7得到的余弦相似度,找到最大的余弦相似度的值;

步骤9:若步骤8得到的最大余弦相似度的值大于第二阈值,执行步骤10,否则判断两文本无相关性;

步骤10:记录最大余弦相似度对应的合并次体中的词条和相应文本对应的合并主体中的词条,将所记录的合并次体的词条合并到所记录的合并主体的词条中,并保持合并次体的文档不变,合并结束。

4.根据权利要求2或3所述的词条结构的合并方法,其特征在于,计算词条与词条的余弦相似度的过程包括:步骤1:导入gensim数据库;

步骤2;将合并主体中的所有词条导入documents列表中,词条与词条用逗号间隔;

步骤3:将所有词条向量化;

步骤4:通过步骤3中的向量值构建相应的TD_IDF模型;

步骤5:通过TD_IDF模型计算每个词条的TD_IDF值;

步骤6:通过每个词条的TD_IDF值构建相应的LSI模型;

步骤7:导入合并次体的根词条,将其向量化;

步骤8:将步骤7中的合并次体的根词条的向量值导入步骤6构建的LSI模型中;

步骤9:将步骤3中的词条的向量值导入步骤6构建的LSI模型中,并构建余弦相似度计算模型;

步骤10:将步骤8得到的值导入到余弦相似度计算模型中,输出合并次体根词条与合并主体中的所有词条的余弦相似度。

5.根据权利要求2或3所述的词条结构的合并方法,其特征在于,计算词条与文本的余弦相似度的过程包括:步骤1:导入gensim数据库;

步骤2:将合并主体中的所有词条对应的文本导入到documents列表中,文本与文本用逗号间隔;

步骤3:将所有文本向量化;

步骤4:通过步骤3的向量值构建相应的TD_IDF模型;

步骤5:通过TD_IDF模型计算每个词条的TD_IDF值;

步骤6:通过每个词条的TD_IDF值构建相应的LSI模型;

步骤7:导入合并次体根词条,将其向量化;

步骤8:将步骤7中的向量值导入到步骤6构建的LSI模型中;

步骤9:将步骤3中的向量值导入步骤6构建的LSI模型中,并构建余弦相似度计算模型;

步骤10:将步骤8得到的值导入到余弦相似度计算模型中,计算合并次体根词条与合并主体中的所有词条对应的文本的余弦相似度。

6.根据权利要求1所述的词条结构的合并方法,其特征在于,在步骤三的在将文本格式转化为词条结构格式的过程中,将文本格式涉及的词条属性按照键值对以哈希存储方式存储成词条结构,其中词条属性包括词条标识、词条名称、词条文本、父级词条、子级词条。

7.根据权利要求1所述的词条结构的合并方法,其特征在于,步骤三进一步包括:步骤1:使用redis hash的基本命令hgetall将根词条的属性以及根词条所有子词条的属性取出给到某一对象;

步骤2:web前端加载D3.js开源库;

步骤3:使用d3.layout.tree命令定义一个tree对象,并确定图像区域大小;

步骤4:web前端向服务器请求数据,服务器将步骤1的对象按照JSON格式传到web前端中;

步骤5:根据步骤4的JSON数据生成节点集合nodes;

步骤6:根据nodes集合生成节点;

步骤7:使用tree.links(nodes)命令获取节点关系集合;

步骤8:为关系集合设置贝塞尔曲线连接;

步骤9:为节点添加圆形标记,如果有子节点为黑色,否则白色;

步骤10:根据JSON数据的document属性为节点添加说明文字;

步骤11:完成文本格式到结构格式的转化。