利索能及
我要发布
收藏
专利号: 2022116809364
申请人: 重庆邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于空洞深度可分离群卷积轻量级网络的语音情绪识别方法,其特征在于,包括以下步骤:S1:采用短期傅里叶变换对音频信号进行时频转换获得其输入特征图;

S2:采用逐点群卷积层对输入特征图进行降维和分解,得到若干个低维特征图;

S3:通过空洞深度可分离卷积层将低维特征图转换成若干个与所述输入特征图同一维度的高维特征图;

S4:采用相似性判定模块来判定所述高维特征图是否符合情绪分类标准;

S5:采用分层特征融合技术将若干组低维和高维特征图串联起来,生成输出特征图;

采用分层特征融合技术将若干组低维和高维特征图串联起来,生成输出特征图,具体包括,从各组图像中分别提取特征 ,合并成一个比输入特征更具有判别能力的输出特征,其计算公式为:其中, 是需要得到的输出特征图, 是前置网络需要融合的特征图, 是连接前每个输入特征图进行上采样或者降采样的变换函数, 为特征融合函数;

S6:采用下采样学习音频信号的时空特性,同时将输入特征图经过平均池化层实现维度匹配,最后将池化后的输入特征图与分层融合输出的输出特征图进行串联叠加得到最终输出特征;

采用下采样学习音频信号的时空特征,同时将输入特征图经过平均池化层实现维度匹配得到原频谱图池化特征 ,具体包括:S61:将原始输入特征图 经过一个步长为2的卷积核 进行平均池化,得到原频谱图池化特征 ;W、H和M分别代表输入特征图 的宽度、高度和维度;

S62:对原始输入特征图 进行下采样到上述输出特征图的维度一致,然后将其输入到第一个标准卷积核 以学习频谱图的空间特征 ,再将其输入到一个逐点卷积核 以学习各特征之间的线性组合特征 ;N表示最终输出特征图的维度;

原频谱图池化特征与分层融合特征进行串联叠加,再与下采样的时空特征进行融合,得到最终输出特征 :S63:将输出特征图 输入到大小为 的逐点群卷积核中得到特征 ;

S64:将原频谱图池化特征 与特征 进行串联叠加,得到局部特征 ;

S65:将局部特征 与下采样的时空特征进行相加,得到最终输出特征 ;

其中add表示相加操作;

S7:将最终输出特征输入到线性层、 函数中进行情绪预测,得到该音频信号的情绪识别结果。

2.根据权利要求1所述的基于空洞深度可分离群卷积轻量级网络的语音情绪识别方法,其特征在于,从音频信号通过时频转换得到输入特征图 的过程包括:S11:采用汉明窗函数将原始音频信号进行取段;

S12:对取段后的音频信号进行短期傅里叶变换,得到原始音频信号的输入特征图,其中W、H和M分别代表输入特征图 的宽度、高度和维度。

3.根据权利要求1所述的基于空洞深度可分离群卷积轻量级网络的语音情绪识别方法,其特征在于,采用逐点群卷积层对输入特征图进行降维和分解,得到若干个低维特征图的过程包括:根据给定的P,利用P个卷积核 对输入特征图 进行逐点群卷积将其降维,得到P个低维的d维特征图 ;其中P是引入的一个超参数,作用是统一缩小特征映射的维度,且 ,N是最终输出特征图的维度。

4.根据权利要求1所述的基于空洞深度可分离群卷积轻量级网络的语音情绪识别方法,其特征在于,通过深度空洞可分离卷积层将低维特征图转换成若干个与原始输入特征图同一维度的高维特征图 包括:S31:将P个低维特征图 分别通过P个分支,每个分支同时使用一个空洞卷积核 ,空洞率r为 ,其感受野增大到 ,d表示低维特征图的维度;P表示给定的参数;

S32:低维特征图 经过空洞卷积核之后,再采用深度可分离卷积层将低维特征图 转换成高维特征图 。

5.根据权利要求1所述的基于空洞深度可分离群卷积轻量级网络的语音情绪识别方法,其特征在于,采用相似性判定模块来判定该高维特征图是否符合情绪分类标准包括:S41:将P个高维特征图输入到相似性判定模块当中,计算各个高维特征图之间的峰值信噪比;P表示给定的参数;

S42:利用第I个高维特征图与第J个高维特征图之间的峰值信噪比值,分别计算出每个高维特征图与其他 个高维特征图的峰值信噪比均值;

当第I个高维特征图的峰值信噪比均值小于预设阈值时,则说明第I个高维特征图与其他 个高维特征图相似度较低,将其转为空洞特征图输入到后续分层特征融合阶段;

当第I个高维特征图的峰值信噪比均值大于等于预设阈值时,则说明第I个高维特征图与其他 个高维特征图相似度较高,符合情绪分类标准,将其输入到后续的分层特征融合阶段。

6.根据权利要求1所述的基于空洞深度可分离群卷积轻量级网络的语音情绪识别方法,其特征在于,所述方法还包括对基于空洞深度可分离群卷积轻量级网络的语音情绪识别模型进行训练优化,即采用Adam优化器对基于空洞深度可分离群卷积轻量级网络的语音情绪识别模型进行训练,优化过程中将交叉熵作为损失函数,并引入 正则化项防止模型出现过拟合,损失函数表示为:其中,L(θ)表示模型预测情感值和真实情感值的差距大小,越小代表越相近,θ表示一组线性层的权重矩阵,c表示情感类别个数, 表示预测情感值, 表示真实情感值, 为 正则化参数, 表示该模型的参数集。