1.一种基于多尺度特征融合的评价三元组抽取方法,包括以下步骤:S1:对语料库中的句子进行分词、去除停用词等数据预处理操作;
S2:利用预训练向量将句子中的单词转化为词嵌入;
S3:将词嵌入输入到特征丰富层获得特征表示;
S4:构造词组级的单词表示;
S5:基于现有的解码方法抽取评价三元组;
步骤S3具体包括:
S3.1:基于CNN采用不同的感受野构造单词的n‑gram局部特征表示,感受野的卷积核大小分别被设置为1、2、3、4,计算公式如下,k代表卷积核的大小:H1=Conv1D(X,k=1) (1)H2Conv1D(X,k=2) (2)H3=Conv1D(X,k=3) (3)H4=Conv1D(X,k=4) (4)S3.2:将S3.1构造的n‑gram局部特征表示拼接在一起,参考金字塔架构利用卷积核大小为5、3的CNN逐步提取高层次的单词特征,计算公式如下,[:]代表向量的拼接操作:H=[H1:H2:H3:H4] (5)H=Conv1D(X,k=5) (6)H=Conv1D(X,k=3) (7)S3.3:将S3.2构造的单词特征输入到BiLSTM进一步捕捉句子当中的上下文信息,从而获得特征丰富的单词表示,计算公式如下:H′=BiLSTM(H) (8)步骤S4具体包括:
S4.1:构造当前单词归属于不同长度词组时的单词表示,计算公式如下,[:]代表向量的拼接操作,s是包含单词xi的词组的长度,Ws和bs是权重参数,σ是激活函数:s
Hs=σ(WsH+bs) (10)S4.2:利用单词级的特征表示,判断当前单词所归属的词组的长度,计算公式如下(Wl和bl是权重参数,σ是激活函数):L=σ(WlH+bl) (11)S4.3:将合适的词组级单词表示赋予当前单词,计算公式如下:S4.4:利用自注意力机制是关注句子中的重要信息,获得最终含义丰富的词组级的单词表示,计算公式如下:r r
H=SelfAttention(H) (13)步骤S5具体包括:
S5.1:为句子中任意两个单词组成的词对(wi,wj)构造网格表示,计算公式如下所示,[:]代表向量的拼接操作:S5.2:将网格表示输入到全连接层进行关系判断,计算公式如下所示:S5.3:使用一种现有的解码方法抽取句子中的评价三元组,解码的具体流程如下:A:首先从预测结果的主对角线中提取所有评价对象和评价词,其中连续标签A和连续标签O可视为一个完整的评价对象和评价词;
B:然后,将所提取的评价对象与所提取的评价词进行配对,当其对应的网格包含情绪极性时,提取对应的评价三元组。