1.一种基于预训练语言模型的本体修正方法,其特征在于,包括:
将输入的可靠本体K0与待修正本体K中的公理转成自然语言的句子,然后再用预训练模型将句子转成稠密的向量;
获取给定数量的不可满足概念,计算其R‑MIPS;
给R‑MIPS中每条公理进行打分,然后根据不同的打分函数采用对应的子集抽取策略从每个R‑MIPS中抽取子集;
基于R‑MIPS中抽取的子集,计算得到最优修正方案,使得从K中移除该方案的所有公理后K∪K0变成协调的;
去除所述最优修正方案中的冗余公理,得到去过冗余的最终解决方案;
所述获取给定数量的不可满足概念,计算其R‑MIPS,包括:
调用标准的本体推理机Pellet对K'∪K0进行推理,获得给定数量不可满足概念;
如果确实获得到k个不可满足概念,则计算这些不可满足概念的本地R‑MIPS;否则,获得当前剩余的不足k个的不可满足概念,再计算其本地R‑MIPS,其中,k为步长;
所述本地R‑MIPS的定义是:假设有一个可靠的本体K0和一个待修改本体K,则K相对于K0的一个R‑MIPS K'是K的子集,并且满足以下条件:(1)K'∪K0是不协调的;(2)对于每个K”∪K0是协调的,一个本体是不协调的当且仅当该本体包含至少一个不可满足概念,一个概念是不可满足的当且仅当它的解释为空集;
所述计算这些不可满足概念的本地R‑MIPS时,先计算这些不可满足概念的所有R‑MUPS,然后从中挑选出R‑MIPS;
所述R‑MUPS的定义为:假设有一个可靠的本体K0和一个待修改本体K,对于K有关K0的一个不可满足概念C,它的一个R‑MUPS K'是K的一个子集,且满足以下条件:(1)C在K'∪K0中不可满足;(2)对于每个 C在K”∪K0是可满足的;
所述计算这些不可满足概念的所有R‑MUPS是指计算每个不可满足概念的所有R‑MUPS的并集,而一个不可满足概念所有R‑MUPS的计算采用基于碰集树的黑盒方法;
单个R‑MUPS的计算先不停地从K中挑选公理添加到初始化为空集的集合S中,直到当前的S与K0的并集使得C变成不可满足时停止添加;然后再逐个检查S中的公理,如果从S中移除一个公理后C仍然在S∪K0中是不可满足的,那么就从S中移除该公理;最后得到的S就是一个R‑MUPS;
基于碰集树的黑盒方法是指将一个R‑MUPS作为一棵树的根节点,该R‑MUPS中每条公理作为边,对每条边进行遍历,如果从K中删除该边上的公理后,C仍然在K∪K0中不可满足,则继续在当前的K中找下一个相对于K0的有关C的R‑MUPS,再将该R‑MUPS作为此边连接的节点,再继续将当前R‑MUPS的所有公理作为边,从根节点出发的一条路径结束的标志是从原始的K中移除该路径上所有边表示的公理,使得C在K∪K0中变得可满足,通过该碰集树的构建,节点上的所有R‑MUPS是C在K中相对于K0的所有R‑MUPS;
所述给R‑MIPS中每条公理进行打分,然后根据不同的打分函数采用对应的子集抽取策略从每个R‑MIPS中抽取子集,包括:设计四种不同的打分函数,所述四种打分函数中包括基于R‑MIPS并集的打分函数、基于R‑MIPS的打分函数、基于待修正本体的打分函数与基于可靠本体的打分函数,这些函数的定义都基于一个公理集合与一条公理之间的相似度的计算,其中,如果选择基于可靠本体的打分函数,那么从每个R‑MIPS中抽取分数最低的那些公理构成子集;如果选择另外三种打分函数,那么抽取分数最高的公理为子集;
假设有一个可靠的本体K0和一个待修正本体K,给定K中一条公理a、K∪K0的一个子集S和一个预定义的阈值t,a与S之间的相似度定义为:其中,S'={b∈S|sim(va,vb)≥t},va与vb分别表示公理a与b对应的向量,sim(va,vb)表示va与vb之间的相似度;
假设 表示K有关K0的一个R‑MIPS集合,则基于R‑MIPS并集的打分函数定义为a与R‑MIPS并集中公理的平均相似度,具体定义如下:
基于R‑MIPS的打分函数的定义为a与R‑MIPS的平均相似度,具体定义如下:基于待修正本体的打分函数的定义为a与K中公理的平均相似度,具体定义如下:
基于可靠本体的打分函数的定义为a与K0中公理的平均相似度,具体定义如下:
2.根据权利要求1所述的基于预训练语言模型的本体修正方法,其特征在于,所述将输入的可靠本体K0与待修正本体K中的公理转成自然语言的句子,然后再用预训练模型将句子转成稠密的向量,包括:给出一个可靠本体K0和一个待修正本体K,并初始化全局诊断D为空集,其中K0与K都各自是一致的和协调的,而K∪K0是不协调的,其中,一个本体是不一致的当且仅当该本体不存在任何语义模型,反之是一致的;
使用概念转换规则与公理转换规则将公理转化为自然语言描述的短语或句子;
应用预训练模型将句子转换为向量,其中,所述预训练模型采用双向编码器表示BERT模型,所述向量是七百多维的稠密向量;
其中,所述概念转换规则将本体K0与K中的原子概念或复杂概念转为自然语言表示的概念或短语,其中复杂概念是指在原子概念的基础上使用各种构造子连接起来的字符串,包括以下规则:规则1:对于概念的交,设定A1、A2、…、An的交中A1、…、Am都是原子概念,且Am+1、…、An都是复杂概念,其中m与n都为正整数且m
规则2:对于概念的并,设定A1、A2、…、An的并,将其翻译为“A1 orA2 or…orAn”;
规则3:对于形如ObjectSomeValuesFrom(r C)的存在量词限制,翻译为“r at least one C”;
规则4:对于形如DataSomeValuesFrom(r d)的存在量词限制,翻译为“has some r that is d”;
规则5:对于形如ObjectAllValuesFrom(p A)或DataSomeValuesFrom(p d)的全称量词约束,分别翻译为“p only from A”或“p only from d”;
规则6:对于形如ObjectExactCardinality(n op A)、ObjectMinCardinality(n op A)与ObjectMaxCardinality(n op A)的数量约束,分别翻译为“p exactly n A”、“p at least n A”与“p at most n A”;
所述公理转换规则将本体中的逻辑公理转为自然语言表示的句子,包括以下规则:
规则1:对于形如SubClassOf(A B)的包含公理,如果B是一个原子概念,则转换为“A is a subclass of B.”;否则转换为“Every A B”;
规则2:对于两个概念的不交公理,则翻译为“Classes A and B are disjoint.”;
规则3:对于属性之间的包含关系,设定p包含于r,则翻译为“p is a subproperty of r”;
规则4:对于属性的不交公理,设定p与r不相交,则翻译为“Properties p and r are disjoint.”;
规则5:对于属性定义域定义的公理,设定属性r的定义域为C,则翻译为“The domain ofproperty r is C.”;
规则6:对于属性值域定义的公理,设定属性r的值域为C,则翻译为“The range ofproperty r is C.”;
规则7:对于形如C(a)的实例类型断言,则翻译为“a is a C.”;
规则8:对于形如ObjectPropertyAssertion(p a b)与DataPropertyAssertion(r a v)的属性断言,分别翻译为“a p b.”与“a r v.”。
3.根据权利要求1所述的基于预训练语言模型的本体修正方法,其特征在于,所述基于R‑MIPS中抽取的子集,计算得到最优修正方案,使得从K中移除该方案的所有公理后K∪K0变成协调的,包括:从R‑MIPS中挑选出来的子集中的每个公理赋予一个二值变量;
基于这些二值变量构建一个目标函数;
基于构建的目标函数,根据每个子集构建一个约束;
通过求解器计算出一个满足所有约束的方案;
将该方案对应到一个公理集合,得到一个针对当前挑选出的子集计算出来的一个相对于给定子集的最优修正方案;
其中,所述修正过程的停止条件是当从K中移除所有找到的修正方案中包含的公理后K∪K0变成协调的时,否则继续从当前的K∪K0中计算k个不可满足概念;如果剩下的不可满足概念少于k个,则获取剩余的所有不可满足概念。
4.根据权利要求1所述的基于预训练语言模型的本体修正方法,其特征在于,所述去除所述最优修正方案中的冗余公理,得到去过冗余的最终解决方案,包括:从原始的K中去除全局修正方案D中一个公理,如果该公理删除不影响K∪K0的不协调性,说明该公理是冗余的,则从D中移除该公理;
从原始K中去除下一个D中的公理,重复此过程直到D中所有公理被检查一遍,最终得到的D便是去过冗余的最终解决方案。
5.一种基于预训练语言模型的本体修正系统,其特征在于,包括:
准备模块,用于将输入的可靠本体K0与待修正本体K中的公理转成自然语言的句子,然后再用预训练模型将句子转成稠密的向量;
R‑MIPS计算模块,用于获取给定数量的不可满足概念,计算其R‑MIPS;
打分模块,用于给R‑MIPS中每条公理进行打分,然后根据不同的打分函数采用对应的子集抽取策略从每个R‑MIPS中抽取子集;
修正方案计算模块,用于基于R‑MIPS中抽取的子集,计算得到最优修正方案,使得从K中移除该方案的所有公理后K∪K0变成协调的;
去冗余模块,用于去除所述最优修正方案中的冗余公理,得到去过冗余的最终解决方案;
所述R‑MIPS计算模块中,获取给定数量的不可满足概念,计算其R‑MIPS,包括:调用标准的本体推理机Pellet对K'∪K0进行推理,获得给定数量不可满足概念;
如果确实获得到k个不可满足概念,则计算这些不可满足概念的本地R‑MIPS;否则,获得当前剩余的不足k个的不可满足概念,再计算其本地R‑MIPS,其中,k为步长;
所述本地R‑MIPS的定义是:假设有一个可靠的本体K0和一个待修改本体K,则K相对于K0的一个R‑MIPS K'是K的子集,并且满足以下条件:(1)K'∪K0是不协调的;(2)对于每个K”∪K0是协调的,一个本体是不协调的当且仅当该本体包含至少一个不可满足概念,一个概念是不可满足的当且仅当它的解释为空集;
所述R‑MIPS计算模块中,计算这些不可满足概念的本地R‑MIPS时,先计算这些不可满足概念的所有R‑MUPS,然后从中挑选出R‑MIPS;
所述R‑MUPS的定义为:假设有一个可靠的本体K0和一个待修改本体K,对于K有关K0的一个不可满足概念C,它的一个R‑MUPS K'是K的一个子集,且满足以下条件:(1)C在K'∪K0中不可满足;(2)对于每个 C在K”∪K0是可满足的;
所述R‑MIPS计算模块中,计算这些不可满足概念的所有R‑MUPS是指计算每个不可满足概念的所有R‑MUPS的并集,而一个不可满足概念所有R‑MUPS的计算采用基于碰集树的黑盒方法;
单个R‑MUPS的计算先不停地从K中挑选公理添加到初始化为空集的集合S中,直到当前的S与K0的并集使得C变成不可满足时停止添加;然后再逐个检查S中的公理,如果从S中移除一个公理后C仍然在S∪K0中是不可满足的,那么就从S中移除该公理;最后得到的S就是一个R‑MUPS;
基于碰集树的黑盒方法是指将一个R‑MUPS作为一棵树的根节点,该R‑MUPS中每条公理作为边,对每条边进行遍历,如果从K中删除该边上的公理后,C仍然在K∪K0中不可满足,则继续在当前的K中找下一个相对于K0的有关C的R‑MUPS,再将该R‑MUPS作为此边连接的节点,再继续将当前R‑MUPS的所有公理作为边,从根节点出发的一条路径结束的标志是从原始的K中移除该路径上所有边表示的公理,使得C在K∪K0中变得可满足,通过该碰集树的构建,节点上的所有R‑MUPS是C在K中相对于K0的所有R‑MUPS;
所述打分模块中,给R‑MIPS中每条公理进行打分,然后根据不同的打分函数采用对应的子集抽取策略从每个R‑MIPS中抽取子集,包括:设计四种不同的打分函数,所述四种打分函数中包括基于R‑MIPS并集的打分函数、基于R‑MIPS的打分函数、基于待修正本体的打分函数与基于可靠本体的打分函数,这些函数的定义都基于一个公理集合与一条公理之间的相似度的计算,其中,如果选择基于可靠本体的打分函数,那么从每个R‑MIPS中抽取分数最低的那些公理构成子集;如果选择另外三种打分函数,那么抽取分数最高的公理为子集;
假设有一个可靠的本体K0和一个待修正本体K,给定K中一条公理a、K∪K0的一个子集S和一个预定义的阈值t,a与S之间的相似度定义为:其中,S'={b∈S|sim(va,vb)≥t},va与vb分别表示公理a与b对应的向量,sim(va,vb)表示va与vb之间的相似度;
所述打分模块中,假设 表示K有关K0的一个R‑MIPS集合,则基于R‑MIPS并集的打分函数定义为a与R‑MIPS并集中公理的平均相似度,具体定义如下:基于R‑MIPS的打分函数的定义为a与R‑MIPS的平均相似度,具体定义如下:基于待修正本体的打分函数的定义为a与K中公理的平均相似度,具体定义如下:
基于可靠本体的打分函数的定义为a与K0中公理的平均相似度,具体定义如下: