利索能及
我要发布
收藏
专利号: 2019103240531
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于融合注意力网络的多模态情感识别方法,其特征在于:所述方法包括以下步骤:

步骤1,提取文本、视觉和音频三个模态的高维特征;

步骤2,将视觉和音频模态的高维特征与文本模态的高维特征按字级对齐,并对文本、视觉和音频三个模态的高维特征进行归一化处理;

步骤3,将字级对齐和归一化处理后的文本、视觉和音频三个模态的高维特征分别输入至双向门控循环单元网络进行训练;

步骤4,提取三个单模态子网络中的双向门控循环单元网络输出的状态信息 和其中, 是文本模态子网络中双向门控循环单元网络在i时刻输出的状态信息,包含了i时刻的前向状态输出 和后向状态输出 是视觉模态子网络中双向门控循环单元网络在i时刻输出的状态信息,包含了i时刻的前向状态输出 和后向状态输出 是音频模态子网络中双向门控循环单元网络在i时刻输出的状态信息,包含了i时刻的前向状态输出 和后向状态输出

步骤5,计算多模态间状态信息的相关度si,如式(1)所示:

其中 是文本模态子网络中双向门控循环单元网络在i时刻输出的状态信息,Wt是与相关的权重参数, 是视觉模态子网络中双向门控循环单元网络在i时刻输出的状态信息,Wv是与 相关的权重参数, 是音频模态子网络中双向门控循环单元网络在i时刻输出的状态信息,Wa是与 相关的权重参数,b1是与 和 相关的偏差,tanh是激活函数,V是多模态融合的权重参数,b2是多模态融合的偏差;

步骤6,根据多模态间状态信息的相关度si,计算出多个模态每一时刻的注意力分布,即在i时刻的状态信息的权重参数αi,权重参数αi计算如式(2)所示:其中softmax是归一化指数函数,exp是指数函数,Tl为意见发言视频中的单词数;

步骤7,三个模态双向门控循环单元网络输出的状态信息和对应的权重参数αi进行加权* *

平均计算得到融合特征向量H作为下一层全连接网络的输入特征,融合特征向量H计算如式(3)所示:其中,Tl为意见发言视频中的单词数, 是文本模态子网络中双向门控循环单元网络在i时刻输出的状态信息, 是视觉模态子网络中双向门控循环单元网络在i时刻输出的状态信息, 是音频模态子网络中双向门控循环单元网络在i时刻输出的状态信息;

步骤8,将待识别的文本、视觉和音频输入训练后的各个模态的双向门控循环单元网络,得到最终的情感强度输出。

2.如权利要求1所述的基于融合注意力网络的多模态情感识别方法,其特征在于:所述步骤1的过程为:提取文本特征为 其中Tl是意见发言视频中的单词数,lt表示300维Glove单词嵌入向量特征;使用FACET面部表情分析框架提取FACET视觉特征为 其中,Tv是视频的总帧数,在第j帧提取的p个视觉特征为使用COVAREP声学分析框架提取COVAREP音频特征为

其中,Ta是音频的分段帧数,在第j帧提取的q个声学特征为

3.如权利要求1或2所述的基于融合注意力网络的多模态情感识别方法,其特征在于:

所述步骤2的过程为:文本模态提取的Glove特征的维度是(Tl,300),视频模态提取的FACET特征的维度是(Tv,p),音频模态提取的COVAREP特征的维度是(Ta,q),其中,Tl是意见发言视频中的单词数,Tv是视频的总帧数,p为视觉特征个数,Ta是音频的分段帧数,q为声学特征个数,将视频和音频模态的高维特征分别与文本模态的Glove特征按照每个意见发言分段Tl个单词进行对齐,记录第i个单词发言的开始时间和结束时间,分别从视觉和音频模态中提取该段时间中所有帧的高维特征,根据这段时间里每个模态的采样总数得到每个模态的平均特征作为对应模态的高维特征;此时文本、视觉和音频三个模态的高维特征已对齐,定义三个模态高维特征的个数都为对齐前文本模态的高维特征个数Tl,即文本高维特征维度为(Tl,300),视觉高维特征维度为(Tl,p),音频高维特征的维度是(Tl,q);对文本、视觉和音频三个模态的高维特征进行归一化处理,归一化处理为分别找到三个模态高维特征的最大值,三个模态的高维特征分别除以该模态下特征的最大值,将特征数据映射到0到1范围之内的小数。