1.一种基于图同构网络的谓词抽取方法,其特征在于包括如下步骤:步骤(1)使用DDParser工具对输入句子进行解析,得到分词结果、词性和句法依存树信息;
步骤(2)根据词性对分词中专有词进行泛化处理,得到泛化处理后输入句子对应的泛化词序列;对Bert模型的词嵌入部分进行微调,在词嵌入部分加入词性信息的编码;将泛化词序列及步骤(1)中的词性信息作为微调后的Bert模型的输入,输出隐藏向量集合;
步骤(3)遍历步骤(1)中句法依存树信息中任意一棵子树,把这棵子树中每条边的信息转换为边向量,然后再将这棵子树的信息以及步骤(2)的隐藏向量集合输入到GIN网络中,获得节点嵌入向量,对节点嵌入向量做池化处理,得到子树的表征向量;
步骤(4)利用步骤(3)中子树的表征向量和步骤(2)中的每一个隐藏向量计算注意力权重,再将这个注意力权重与步骤(3)中每个节点嵌入向量相乘,得到最终节点嵌入向量集合;
步骤(5)将步骤(4)中得到的带有语义信息的最终节点嵌入向量集合输入到一个二分类器中,得到一个二进制序列,序列中每一个二进制指示对应的词是否为谓词;
所述步骤(2)具体实现过程如下:
2‑1根据词性标注结果T(X)对原序列X进行泛处理,具体的规则内容如下:将词性标注结果为“LOC”、“f”、“s”、“
2‑2对Bert模型的embedding结构做微调,在原来embedding结构中加入了Postag Embedding层用以添加词性信息;对泛化词序列X′做词嵌入处理,将泛化词序列X′送入Token Embedding层从而将每一个词转换为向量形式,将泛化词序列X′送入Position Embedding层获取每个词的顺序特征,将词性标注结果T(X)送入Postag Embedding层获取每个词的词性特征,最后将这三个结果进行拼接输入到Bert模型中得到最终的词嵌入,得到输出隐藏向量集合;
词嵌入过程可以表达为如下式:
H=BERT(X′,T(X))={h1,h2,…,hn} (5)其中,H为输出的隐藏向量Ⅰ集合,h1,h2,…,hn为隐藏向量;
所述步骤(3)具体实现过程如下:
3‑1遍历依存树中的任意两个节点,计算这两个节点的最近公共祖先节点,获得以公共祖先节点为根、两个节点为叶的子树d(X);把子树d(X)中所有边信息转换为边向量,得到结果:
E={e1,e2,…,eq}(6)其中q表示当前子树中边的总数;
3‑2将隐藏向量集合H和子树d(X)输入到GIN网络中获取节点嵌入信息,其中,GIN网络由m层图同构卷积层组,每一层的计算过程如下式:其中, 表示节点i在第k层图同构卷积层输出的隐藏向量,在第1层图同构卷积层中为步骤(2)中Bert输出的隐藏向量,ε是一个可学习参数,N(i)表示节点i的所有邻接节点的集合,E(i)表示节点i的所有邻接边的集合,ep为对应边的边嵌入,MLP是多层感知机算法;
3‑3对步骤3‑2中得到的最终节点嵌入向量做最大池化处理,获取子树的表征向量:其中,hchild‑tree表示子树的表征向量, 表示节点嵌入向量。
2.根据权利要求1所述的一种基于图同构网络的谓词抽取方法,其特征在于所述步骤(1)具体实现过程如下:
使用DDParser对文本句子进行解析,得到结果:X=(x1,x2,…,xn)(1)T(X)=(t1,t2,…,tn)(2)D(X)=Dependency_Parser(X) (3)其中,X表示分词后的序列,公式(1)中x1,x2,…,xn表示分词结果,公式(2)中t1,t2,…,tn对应于公式(1)中x1,x2,…,xn的词性标注结果,D(X)是句法依存树。
3.根据权利要求2所述的一种基于图同构网络的谓词抽取方法,所述步骤(4)具体实现过程如下:
4‑1采用注意力机制对表征向量中的有效信息进行增强,将子树表征向量hchile‑tree作为Q,Bert模型输出的隐藏向量集合{h1,h2,…,hn}作为K,GIN网络输出的节点嵌入向量作为V,首先利用Q和K计算注意力权重wi,详细计算过程如下式:接下来,模型将注意力权重pi应用对应的V中,得到最终节点嵌入向量oi,详细计算过程如下式:
4.根据权利要求3所述的一种基于图同构网络的谓词抽取方法,其特征在于所述步骤(5)具体实现过程如下:
将最终的隐藏向量输入到一个二元分类器中,对每一个词分配一个二进制标签,该标签指示当前词是否为谓词,详细计算过程如下式:pi=σ(Woi+b) (11)其中W和b都是可学习参数,σ是sigmoid函数;
训练过程中,损失函数定义为:
Loss=CE(P,Y) (12)其中P表示对标签的预测结果,Y表示真实标签,CE表示交叉熵损失函数。