利索能及
我要发布
收藏
专利号: 2022107005369
申请人: 重庆科技学院
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于多类别表格填充的情感三元组生成方法,其特征在于,包括以下步骤:S1、首先将爬虫工具所获得的评论文本信息数据进行清洗;其次对数据中的评论观点、评价对象即方面词以及情感类型进行统一标签,构建情感三元组统一标记空间;最后将标注好的数据以8:1:1的比例划分成训练集、验证集和测试集;

S2、利用Bert预训练语言模型,对评论文本进行特征编码,从而抽取出文本的深层次语义信息H;

S3、根据所述情感三元组统一标记空间,利用多类别多头注意力机制分别学习评论所A属类别与方面词相关联的类别增强向量表示H ,以及与评论观点的关联类别增强向量表示OH;

A O

S4、以类别增强向量表示H、H 为基础,利用分区过滤机制将方面词识别任务与评论观点检测任务进行双向关联,首先利用线性层神经网络实现类似LSTM神经网络的方面门 和观点门 然后利用门控机制将每个时间步单元分割成方面词识别任务分区ρA、评论观点检测任务分区ρO和共享任务分区ρS,最后利用过滤机制过滤与任务无关信息,得到分区过滤信息Hp;

S5、利用双仿射深度注意力机制计算每个词对间的概率分布得分向量,并将概率分布得分向量填充到情感三元组统一标记空间二维表的每个词对单元格中;

S6、向情感三元组统一标记空间二维表中的统一标签添加对称性约束Lsym和隐含性约束Limp;

S7、利用情感三元组统一标记空间联合解码框架,遍历搜索二维表中表示方面词与评论观点的正方形以及表示情感极性的矩形,首先利用二维表中方面词或者评价对象相邻行或列标记一致的性质,确定两者信息的边界,其次利用正方形关于对角线对称的性质,解码方面词或评论观点,最后利用已检测的方面词以及评论观点,遍历搜索方面词和评论观点之间对齐的矩形框结构的情感极性;

S8、构建评论文本方面词情感三元组,聚合各个类别下方面词情感评价的优劣及产生原因,并归纳整体评论文本的情感三元组以反映总体的评价结果,以及根据用户的查询条件自动生成反馈信息。

2.根据权利要求1所述的基于多类别表格填充的情感三元组生成方法,其特征在于,所述步骤S1中情感三元组统一标记空间的构建包括以下步骤:S11、获取评论文本中的方面词A、评论观点词O的起始位置与截止位置,以及对应方面词的情感极性Ysent={Pos,Neg,Neu};

S12、获取评论文本中描述各个方面词与评论观点之间的类别信息,统计分析得到m个类别信息,定义为Yc={y1,y2,…,ym};

S13、以得到的m个类别信息为基础,对方面词、评论观点标签以及情感极性进行标记,定义方面词的标记方式为YA={y1,…,yi,None},yi∈Yc,评论观点的标记方式为YO={y1,…,yi,None},yi∈Yc,情感极性的联合标记方式为YP={y1+p1,…,yi+pi,None},yi∈Yc,pi∈Ysent,None表示词对之间无关联;

S14、将获得的方面词标记、评论观点标记和情感极性联合标记分别填充到表格Tn×n的各个单元格中,以表示词对wi,j之间的信息类别关系,从而构建出情感三元组统一标记空间,其中n表示评论文本S的长度。

3.根据权利要求1所述的基于多类别表格填充的情感三元组生成方法,其特征在于,所述步骤S3中利用多类别多头注意力机制分别学习评论所属类别与方面词相关联的类别增A O强向量表示H,以及与评论观点的关联类别增强向量表示H具体包括以下步骤:S31、利用LSTM神经网络模型进一步获取每个时间步的文本上下文深层次语义信息详细计算方式如下:其中,W、b为可训练参数,σ表示sigmoid激活函数,it、ot、ft分别表示输入门、输出门和遗忘门,ct表示当前时间步的单元状态;ct‑1表示前一时间步的单元状态;表示单元状态更新值;

S32、将Bert输出向量表示 与上一个时间步输出的隐藏层向量ht‑1当作多类别多头注(t)意力机制模块的输入部分,首先将 和K 点乘得到各个类别与方面词或者评论观点之间(t) (t) (t)的语义相似度a ,然后将V 与a 点乘得到方面词类别或评论观点类别增强向量表示最后将LSTM神经网络模型的隐藏层输出向量与类别增强向量表示拼接,形成该单元时间步的最终向量表示ht,具体如下式所示:其中,softmax表示激活函数,de表示Bert输出的词向量维度,attention表示计算注意力机制方式, m表示文本描述方面词或评论观点的所属类别种类, 表示第i个类别关联的键值对,具体如下式所示:其中,σ表示sigmoid激活函数;

S33、获取整个文本序列关于方面词与评论观点的类别增强向量表示,分别为其中并将方面词与评论观点的类别增强向量拼接,得到最终整体类别增强向量表示

4.根据权利要求1所述的基于多类别表格填充的情感三元组生成方法,其特征在于,所述步骤S4中利用分区过滤机制将方面词识别任务与评论观点检测任务进行双向关联具体包括以下步骤:S41、利用方面门 和观点门 分别控制方面词识别任务和评论观点检测任务的信息分布,将每个时间步的神经单元划分为方面词识别任务分区ρA、评论观点检测任务分区ρO和共享任务分区ρS,所述方面门 和观点门 的计算方式如下式所示:其中,cummax表示累计最大值的计算方式,Linear表示标准的线性变换, 表示第t个整体类别增强向量表示,ht‑1表示上一个时间步的隐藏层向量表示;

S42、进一步计算当前时间步信息表示

其中,tanh表示激活函数;

S43、计算历史时间步所对应的方面词识别任务分区 评论观点检测任务分区和共享任务分区 的向量信息表示,具体计算方式如下式所示:其中,表示对应元素相乘运算符, 的计算方式与步骤S41中方面门 和观点门 的计算方式一致;

S44、计算当前时间步所对应的方面词识别任务分区 评论观点检测任务分区和共享任务分区 的向量信息表示,具体计算方式如下式所示:S45、将当前时间步的分区向量和上一个时间步的分区向量相加,整合成当前时间步的总体分区信息表示ρA、ρO和ρS,具体计算方式如下式所示:S46、利用已划分的方面词识别任务分区ρA、评论观点检测任务分区ρO和共享任务分区ρS之间的不同叠加方式,实现信息的保留与过滤,为此将方面词识别任务分区、评论观点检测任务分区和共享任务分区的记忆存储单元分别定义为μA、μO和μS,具体计算方式如下式所示:μA=ρA+ρs,μO=ρO+ρs,μS=ρs

S47、将三种分区记忆存储单元拼接,得到下一个时间步的单元状态向量表示ct和隐藏层向量表示ht,具体计算方式如下式所示:ct=Linear([μA,t;μO,t;μs,t])

ht=tanh(ct)

其中,Linear表示标准的线性变换;

S48、最后,以每个时间步向量表示ht为基础进行拼接,从而生成方面词识别与评论观点检测的分区过滤信息Hp=[h1,h2,…,hn]。

5.根据权利要求1所述的基于多类别表格填充的情感三元组生成方法,其特征在于,所述步骤S5中利用双仿射深度注意力机制计算每个词对间的概率分布得分向量,并将概率分布得分向量填充到情感三元组统一标记空间二维表的每个词对单元格中具体包括以下步骤:S51、采用两个多层MLP神经网络模型,预测每个单词的头尾部分,具体计算方式如下式所示:S52、利用双仿射深度注意力机制模型按下式计算每个单词对的分数向量表示gi,j:其中,Biaff表示双仿射变换,U1和U2均为模型权重,b表示偏移量;

S53、首先,将分数向量表示gi,j作为softmax函数的输入按下式来预测词对中标签的概率分布:P(yi,j∣s)=softmax(dropout(gi,j))然后,将各个词对的概率分布填充到n×n的二维表T中;

最后,利用预测标签的概率分布情况和真实标签按下式来计算整体的损失值:其中,Yi,j为真实标签。

6.根据权利要求1所述的基于多类别表格填充的情感三元组生成方法,其特征在于,所述向情感三元组统一标记空间二维表中的统一标签添加对称性约束Lsym和隐含性约束Limp的步骤如下:S61、方面词和评论观点词的标注结构均为关于对角线对称的正方形,为此定义对称约束的损失函数为Lsym:其中, 表示句子中每个词对所有可能出现标签的p(yi,j∣s)堆叠;

S62、在情感三元组中,方面词的情感极性一定与方面词和评论观点息息相关,为此定义隐含约束的损失函数为Limp:其中, 表示句子中每个词对所有可能出现标签的p(yi,j∣s)堆叠。