1.一种基于科技文献的领域概念图谱构建方法,其特征在于,包括以下步骤:获取不同领域的科技文献,并形成科技文献集合;抽取科技文献的关键词,并根据关键词构建领域种子概念集合;提取科技文献中语句内包含的词汇,构建领域文献词汇集合,并根据领域文献词汇集合构建领域概念集合;
将领域种子概念集合内的所有概念加入到领域概念集合中,并采用余弦相似度确定领域概念集合中的概念同义关系,以及构建领域概念同义关系集合;
将领域种子概念集合中的概念设置为初始种子,并采用置信度聚类领域概念集合中的概念同类关系;根据领域概念集合中的概念同类关系,构建领域概念同类关系集合,以及将聚类后的各个同类概念簇组成概念簇集合;
采用语义泛化评价及概念簇上下位关系值评价的方法,获取概念簇集合中不同簇之间的上下位关系;根据不同簇之间的上下位关系,构建领域概念上下位关系集合;
将领域概念集合中的各概念作为结点,领域概念同义关系集合、领域概念同类关系集合及领域概念上下位关系集合内的各关系作为边,构建领域概念图谱;
所述构建领域概念上下位关系集合,包括:
聚类后的各个同类概念簇共同组成概念簇集合CC;
扫描概念簇集合CC中任意一对概念簇 和 ,采用基于语义泛化的方法判断簇间语义泛化关系;具体包括:扫描概念簇集合CC,设定任意一对概念簇 和 ,分别计算概念簇的语义泛化指数和 ;
对概念簇 内每个概念 ,统计 所在原文中指定窗口出现的上下文词汇及各词汇频次,其词汇集合为 ,计算概念簇 的语义泛化指数 ;
对概念簇 内每个概念 ,统计 所在原文中指定窗口出现的上下文词汇及各词汇频次,其词汇集合为 ,计算概念簇 的语义泛化指数 ;
计算概念簇 和 的Jaccard距离 ;若
,θ3为预先设计的Jaccard距离的阈值,则计算概念簇 和 的上下位关系值 和 ,判断 或 是
否成立,为预先设定的阈值,其值接近0;若 成立,则表明 和 存在上下位关系,其中 为下位, 为上位,若 成立,则表明 和 存在上下位关系,其中 为上位, 为下位,否则, 和 不存在上下位关系;
若 和 存在语义泛化关系,则扫描 和 中每个概念对 和 ,并判断概念对和 间是否存在上下位关系;具体包括:扫描概念簇 和 ,在 和 簇内各取一个概念 和 ,构造候选关系candiCR;
计算候选关系candiCR的关系置信度 ,其中
表示两个概念的语句同现次数, 表示两个概念同现时符合概念上下位关系模板CRPattern的次数;
若置信度 , 为预先设计的阈值,则候选关系candiCR为概念 和的上下位关系;
将所有概念簇之间的语义泛化关系判断完成后,获取概念簇集合CC中不同簇的上下位关系;根据不同簇的上下位关系,构建领域概念上下位关系集合CR。
2.根据权利要求1所述的一种基于科技文献的领域概念图谱构建方法,其特征在于,所述构建领域种子概念集合,包括:从科技文献网站下载科技文献数据,并将科技文献数据分为特定领域的科技文献集合SP和其他领域的科技文献集合OP;
对特定领域的科技文献集合SP中的每一篇文献,分别抽取文献中标定的所有关键词和正文,利用抽取出的关键词构建领域种子概念集合IC,利用抽取出的文献正文构建领域文档集合SD。
3.根据权利要求2所述的一种基于科技文献的领域概念图谱构建方法,其特征在于,所述构建领域概念集合,包括:抽取其他领域的科技文献集合OP中每一篇文献的正文,构建非领域文档集合OD;
对领域文档集合SD和非领域文档集合OD中的每一个文档,进行语句拆分,对语句进行分词和词性标注,保留词性为名词或动词的词汇,分别构建领域文献词汇集合SW和其他领域文献词汇集合OW;
利用词汇分布统计分析方法过滤领域文献词汇集合SW中的科技文献通用词汇,并对领域文献词汇集合中的剩余词汇进行短语扩展,形成领域概念集合SC。
4.根据权利要求3所述的一种基于科技文献的领域概念图谱构建方法,其特征在于,所述构建领域概念同义关系集合,包括:将领域文档集合SD加入到背景语料中,利用神经网络模型Word2Vec训练学习词汇的分布式表示;
扫描领域概念集合SC,给定任意一对概念 和 ,构造候选关系candiER,在分布式表示中查找概念 和 的分布式表示向量,分别为 和 ,计算两向量的余弦相似度;
若余弦相似度 , 为预先设计的阈值,则计算该关系的置信度,其中 表示两个概念的语句同现次数,
表示两个概念同现时符合概念同义关系模板ERPattern的次数;
若置信度 , 为预先设计的阈值,则将candiER加入概念同义关系集合ER,完成领域概念同义关系集合ER的构建。
5.根据权利要求4所述的一种基于科技文献的领域概念图谱构建方法,其特征在于,所述构建领域概念同类关系集合,包括:构建概念图G=[Vertex, Edge],其中,Vertex为图中顶点集合,每个概念对应一个结点,Edge表示图的边集合,初始时无边存在;
以领域种子概念集合中的概念为初始种子,依次扫描每个种子概念结点,计算当前种子概念结点与其余种子概念结点的相似度,其中相似度计算采用向量余弦相似度计算方法,相似度阈值为 ;
将相似度由高到低排序,选择不相连的并且相似度最高的概念结点 和 ,若 和 无同类关系,则构造候选关系candiSR,计算其关系置信度 ,其中 表示两个概念的语句同现次数, 表示两个概念同现时符合概念同类关系模板SRPattern的次数;
若置信度 , 为预先设计的阈值,则在概念 和 之间增加一条边,即两个概念在同一簇内;否则,不进行任何操作;并持续计算置信度,直至找不到与种子概念间的相似度大于阈值 的概念结点为止;并将概念图中孤立的节点独立为一簇;
将聚类后的各个同类概念簇内的概念同类关系构建为领域概念同类关系集合SR。
6.一种基于科技文献的领域概念图谱构建装置,其特征在于,包括:概念匹配模块,用于获取不同领域的科技文献,并形成科技文献集合;抽取科技文献的关键词,并根据关键词构建领域种子概念集合;提取科技文献中语句内包含的词汇,构建领域文献词汇集合,并根据领域文献词汇集合构建领域概念集合;
概念关系模块,用于将领域种子概念集合内的所有概念加入到领域概念集合中,并采用余弦相似度确定领域概念集合中的概念同义关系,以及构建领域概念同义关系集合;
将领域种子概念集合中的概念设置为初始种子,并采用置信度聚类领域概念集合中的概念同类关系;根据领域概念集合中的概念同类关系,构建领域概念同类关系集合,以及将聚类后的各个同类概念簇组成概念簇集合;
采用语义泛化评价及概念簇上下位关系值评价的方法,获取概念簇集合中不同簇之间的上下位关系;根据不同簇之间的上下位关系,构建领域概念上下位关系集合;
图谱构建模块,用于将领域概念集合中的各概念作为结点,领域概念同义关系集合、领域概念同类关系集合及领域概念上下位关系集合内的各关系作为边,构建领域概念图谱;
所述构建领域概念上下位关系集合,包括:
聚类后的各个同类概念簇共同组成概念簇集合CC;
扫描概念簇集合CC中任意一对概念簇 和 ,采用基于语义泛化的方法判断簇间语义泛化关系;具体包括:扫描概念簇集合CC,设定任意一对概念簇 和 ,分别计算概念簇的语义泛化指数和 ;
对概念簇 内每个概念 ,统计 所在原文中指定窗口出现的上下文词汇及各词汇频次,其词汇集合为 ,计算概念簇 的语义泛化指数 ;
对概念簇 内每个概念 ,统计 所在原文中指定窗口出现的上下文词汇及各词汇频次,其词汇集合为 ,计算概念簇 的语义泛化指数 ;
计算概念簇 和 的Jaccard距离 ;若
,θ3为预先设计的Jaccard距离的阈值,则计算概念簇 和 的上下位关系值 和 ,判断 或 是
否成立,为预先设定的阈值,其值接近0;若 成立,则表明 和 存在上下位关系,其中 为下位, 为上位,若 成立,则表明 和 存在上下位关系,其中 为上位, 为下位,否则, 和 不存在上下位关系;
若 和 存在语义泛化关系,则扫描 和 中每个概念对 和 ,并判断概念对和 间是否存在上下位关系;具体包括:扫描概念簇 和 ,在 和 簇内各取一个概念 和 ,构造候选关系candiCR;
计算候选关系candiCR的关系置信度 ,其中
表示两个概念的语句同现次数, 表示两个概念同现时符合概念上下位关系模板CRPattern的次数;
若置信度 , 为预先设计的阈值,则候选关系candiCR为概念 和的上下位关系;
将所有概念簇之间的语义泛化关系判断完成后,获取概念簇集合CC中不同簇的上下位关系;根据不同簇的上下位关系,构建领域概念上下位关系集合CR。
7.一种电子设备,其特征在于,包括:存储器和处理器;
所述存储器,用于存储计算机程序;
所述处理器,用于执行所述存储器中存储的计算机程序时,实现如权利要求1 5任一项~所述的一种基于科技文献的领域概念图谱构建方法的步骤。