利索能及
我要发布
收藏
专利号: 2021115101607
申请人: 重庆邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-09
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种结合知网与词林的词语相似度获取方法,其特征在于,包括以下步骤:根据《知网》义原层次树和义原层次树中的路径信息,计算知网义原信息内容含量;

根据知网义原信息内容含量,构建第一词语相似度计算模型;

根据扩展版《同义词词林》词林拓扑树中的路径信息构建第二词语相似度计算模型;

获取待测词语对,根据待测词语对在《知网》和扩展版《同义词词林》中的分布情况,分别利用第一词语相似度计算模型和第二词语相似度计算模型计算待测词语对的相似度;

将两个计算模型计算得到的词语相似度结合,获得待测词语对的最终词语相似度;

其中,得到知网义原信息内容含量的过程包括:

根据《知网》义原层次树中的节点总数和义原节点在义原层次树中对应的下位节点数,计算得到义原的第一信息内容含量;

根据当前义原节点所在义原层次树路径信息中的义原密度信息和义原深度信息,根据义原密度信息计算当前义原节点及其兄弟节点的节点总和;计算得到义原的第二信息内容含量;

结合义原的第一信息内容含量和第二信息内容含量,得到知网义原信息内容含量;

其中,利用第一词语相似度计算模型计算待测词语对的相似度的过程包括:分别计算词语对的两个词语在《知网》义原层次树中对应义原节点的知网义原信息内容含量,对应得到两个知网义原信息内容含量;

根据两个知网义原信息内容含量的共性信息,计算得到词语对的相似度,计算过程为:其中,函数LCS(w1,w2)表示词语对w1和w2对应的义原节点的最近公共节点,IC(LCS(w1,w2))表示词语对对应的义原节点的共性信息,IC(w1)、IC(w2)分别表示词语对应的知网义原信息内容含量;

其中,得到知网义原信息内容含量IC(C)的计算公式如下:

其中,max_nodes表示义原层次树中的节点总数,函数hypo(C)表示义原节点在义原层次树中对应的下位节点数,函数f(C)表示当前义原节点所在树的密度信息,c1表示权衡义原深度信息和义原密度信息对信息内容含量的影响权重因子,k表示路径信息的影响权重,k设为0.5,c1设为0.6;

其中,利用第二词语相似度计算模型计算待测词语对的相似度的过程为:根据扩展版《同义词词林》词林拓扑树,将词林拓扑树由根节点开始向下逐层划分为大类、中类、小类、词群和原子词群,并将原子词群部分的抽象的概念放到对应上层结构中;

从词林拓扑树中获取待测词语对中每个词语对应概念的路径信息,根据每个词语对应概念的路径信息中的概念深度信息,计算概念的信息内容含量;

根据待测词语对中两个词语分别对应概念的信息内容含量、对应的概念之间的深度信息,计算待测词语对的相似度;

其中,计算词林中概念的信息内容含量IC1(C)的过程为:

其中,max_depth表示词林拓扑树的最大深度,depth(C)表示当前计算的概念节点的深度,函数hypo(C)表示当前概念节点在词林拓扑树中对应的下位节点数,max_nodes表示词林拓扑树中的概念节点总数,k表示路径信息的影响权重,k设为0.5;

其中,第二词语相似度计算模型的相似度计算过程为:

其中,α表示可调参数,p表示用于调节待测词语对w1、w2对应概念之间的路径信息与信息内容含量的权重参数,N表示对应概念之间可达路径上的长度,level(i)表示第i条路径在词林拓扑树中所处的层次,函数weight用于计算第i条路径的权重值;

其中,获得待测词语对的最终词语相似度的计算公式为:

sim(w1,w2)=λsim1(w1,w2)+(1‑λ)sim2(w1,w2),其中,λ表示根据待测词语对w1、w2在《知网》和扩展版《同义词词林》中的分布情况在选用相应计算模型时的分配权重,sim1表示第一词语相似度计算模型的计算结果,sim2表示第二词语相似度计算模型的计算结果;

其中,根据待测词语对在《知网》和扩展版《同义词词林》中的分布情况,当词语同时被《知网》和扩展版《同义词词林》收录时用B表示,当词语只被《知网》收录时用A表示,当词语只被扩展版《同义词词林》收录时用C表示,则获得待测词语对的最终词语相似度的过程为:当w1∈B且w2∈B时,将λ设为0.5;

当w1∈A且w2∈B时,判断w2在扩展版《同义词词林》中是否存在同义词,若存在,将λ设为

0.6,若不存在则将λ设为1;

当w1∈B且w2∈C时,判断w1在扩展版《同义词词林》中是否存在同义词,若存在,则将λ设为0.4,若不存在,则将λ设为0;

当w1∈A且w2∈C时,判断w2在扩展版《同义词词林》中是否存在同义词,若存在则根据sim1和sim2的计算结果,选取最大值作为待测词语对的最终词语相似度,若不存在,则待测词语对的最终词语相似度为0.1;

当w1∈A且w2∈A时,将λ设为1,当w1∈C且w2∈C时,将λ设为0。

2.一种结合《知网》与词林的词语相似度获取系统,其特征在于,基于权利要求1所述的结合知网与词林的词语相似度获取方法,包括:知网信息含量计算模块,用于根据《知网》义原层次树和义原层次树中的路径信息,计算知网义原信息内容含量;

知网相似度计算模块,用于根据知网义原信息内容含量,构建第一词语相似度计算模型,计算待测词语对的相似度sim1;

词林相似度计算模块,用于根据扩展版《同义词词林》词林拓扑树中的路径信息,构建第二词语相似度计算模型,计算待测词语对的相似度sim2;

待测词语对相似度获取模块,用于根据待测词语对在《知网》和扩展版《同义词词林》中的分布情况,将知网相似度计算模块和词林相似度计算模块输出的计算结果结合,获得待测词语对的最终词语相似度。