利索能及
我要发布
收藏
专利号: 2020108699679
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于动态阈值的迭代式知识图谱实体对齐方法,其特征在于,所述方法包括以下步骤:

1)人工标注少量的对齐实体对作为训练集的种子;

2)对两个知识图谱中的实体和关系随机初始化为300维的向量;

3)分别对两个知识图谱的结构进行编码,得到两个直接邻接矩阵、两个间接邻接矩阵和两个关系三元组集合;

4)将3)中得到的直接邻接矩阵和间接邻接矩阵输入到邻域扩展的图卷积模型GCN中,得到邻节点的特征表示;

5)将3)中得到的两个关系三元组集合和4)中得到的实体向量,输入到翻译模型TransE当中,由此得到融合了关系语义信息和邻节点结构信息的实体的嵌入式表示;

6)通过1)中预对齐实体对集合,根据对齐的损失函数将两个知识图谱的实体映射到同一个向量空间当中;

7)动态阈值迭代对齐模块根据实体相似度从未标注的对齐实体中动态地捕获可能对齐的实体对;

8)将这些筛选得到的实体对暂时地加入到训练集当中,参与到下一轮训练当中;

9)循环执行步骤4)‑8),直至实体的嵌入收敛,得到最终的实体嵌入;

10)根据9)中得到的实体嵌入,计算实体的相似度,得到最终实体对齐的结果;

在所述步骤1)中,人工标注少量的对齐实体集合 对我们定义为

实体对齐的目标是根据 尽可能地找到两个知识图谱中其他

相互对齐的实体对集合 其中Ai,Ui分别表示知识图谱KGi

中预先标记为对齐的实体和未标记对齐的实体集合,Ei=Ai∪Ui,i∈{1,2},在e1和e2之间的~表示等价对齐关系;

在所述步骤7)中,动态阈值迭代对齐模块捕获可能对齐实体对的过程如下:在第t次迭代中,对于所有未对齐的实体e∈U1∪U2,从其候选对齐实体集合 中分别找到与它们自己对齐概率最大且概率超过θ(t)的实体,组成可能的对齐实体对,然后取并集以保证一对一约束,然后得到第t次迭代中可能对齐的实体对集合 并作为预先对齐实体对的补充,定义如下:其中 表示在第t迭代中实体ei,ej之间的对齐概率, 是实体e的候选对齐实体对集合,表示第t次迭代中,与实体e的对齐概率超过阈值的实体集合,动态阈值会随着训练的进行而衰减,其取值范围为(0,1),定义如下:其中γ是初始阈值,ω<0为衰减系数,控制阈值衰减的下限,λ为衰减速率。

2.如权利要求1所述的一种基于动态阈值的迭代式知识图谱实体对齐方法,其特征在于,定义与实体e只有一条关系直接相连的实体集合为直接邻节点集合Ne,1={e′|(e,r,e′)∈T}∪{e′|(e′,r,e)∈T},定义与实体e∈E需要经过两条关系相连的实体的集合为间接邻节点集合Ne,2={e″|(e″,r,e′)∈T,e′∈Ne,1}∪{e″|(e′,r,e″)∈T,e′∈Ne,1};所述步骤3)中,直接邻接矩阵反映的是任意两个实体之间是否互为直接邻节点的关系,若是否互为直接邻节点的关系则矩阵对应位置为1,否则则为0;间接邻接矩阵反映的是任意两个实体之间是否互为间接邻节点的关系,若是则为1,反之则为0;关系三元组表示为(h,r,t),h为头实体,r为关系,t为尾实体。

3.如权利要求1所述的一种基于动态阈值的迭代式知识图谱实体对齐方法,其特征在于,在所述步骤4)中的邻域扩展的图卷积模型GCN结构如下:模型一共有三层,输入层以及两层隐藏层;我们联合三层的输出结果作为实体的嵌入,每层的维度均为300维;实体的特征在层与层之间传递的时候,都会聚合它上一层自身的特征以及它的邻节点的特征,并且依照当前的相似度,赋予不同实体不同的注意力权重;并且在融合间接邻节点的特征和直接邻节点的特征时,分别赋予他们不同权重;通过聚合实体i的邻节点的信息来作为实体i在第l层的嵌入,表示为其中,Ni,1表示实体i∈E的直接邻节点集合,Ni,2表示实体i∈E的间接邻节点集合,分别为聚合直接邻节点信息时第l层的权重矩阵和聚合间接邻节点信息时第l层的权重矩阵,σ1表示的是激活函数,γ是一个权重用于平衡来自直接邻节点聚合的结果和来自间接邻节点聚合的结果, 表示的是实体i与其邻节点j之间的注意力权重,由实体i,j之间的相似度计算得到,在各层计算完成后,将联合三层的输出结果来作为实体最终的嵌入。

4.如权利要求1所述的一种基于动态阈值的迭代式知识图谱实体对齐方法,其特征在于,在所述步骤5)中,采用翻译模型TransE,将3)中的关系三元组和4)中得到的900维的实体嵌入以及900维的关系嵌入输入到TransE中,通过平移实体和关系,使三元组尽可能满足最后训练得到新的实体嵌入。

5.如权利要求1所述的一种基于动态阈值的迭代式知识图谱实体对齐方法,其特征在于,在所述步骤6)中,将经过4)、5)两步的训练所得到的两个知识图谱的实体嵌入各自分布在他们自己的向量空间当中,此时通过缩小1)中标注的预对齐的实体对之间的距离,来将两个知识图谱映射进同一个向量空间;通过梯度下降算法来最小化对其损失函数,对齐的损失函数的定义为:其中, 是预先对齐的实体对集合,是通过步骤7)迭代得到的可能对齐的实体对集‑

合, 是以错误对齐的实体对集合作为负样本,它是通过使用错误的实体替换

中的ei或者ej来生成的,错误实体的生成策略是使用实体的最近邻采样,‖·‖2表示两个向量的L2范数,γ2>0是超参数,μ2是一个权重系数,[·]+=max(0,·)。

6.如权利要求1所述的一种基于动态阈值的迭代式知识图谱实体对齐方法,其特征在于,在所述步骤8)‑10)中,将7)中获得的新的对齐实体对暂时地加入到预对齐实体对当中,这些新的实体对会和这些新的实体对会和人工标注的少量的训练集一同在下一轮的训练中指导训练;下一轮的训练即重复迭代地执行步骤4)‑8),直至实体嵌入收敛;根据9)中得到的最终的实体嵌入,计算实体的相似度,每个实体与来自另一知识图谱且和自己距离最近的实体相对齐,得到最终的对齐结果