利索能及
我要发布
收藏
专利号: 2022102164528
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于神经网络的语音情感识别方法,包括以下步骤:

步骤1:获取语音特征参数;具体包括:

1)使用python库函数python_speech_features.mfcc()函数读取待语音信号中的MFCC特征系数;

2)使用python库函数python_speech_features.delta()函数读取语音信号的一阶差分MFCC特征系数和二阶差分MFCC特征系数;

3)使用python库函数numpy.hstack()函数将三种语音特征参数进行拼接,将语音特征转化为199*39的大小,对所有待评估的语音信号都使用相同的大小;

4)使用python库函数transforms.ToTensor()将特征数据转化为Tensor向量,以供后续的语音情感识别网络使用;

步骤2:输入语音特征参数进行语音情感的分析;所述的语音情感识别网络包括特征提取器、关键特征选择子网和识别子网:所述的特征提取器使用卷积神经网络CNN结合双向长短记忆网络BILSTM作为特征提取器进一步提取语音信号的特征;经过特征提取器,卷积神经将语音特征中进行降维处理,长短记忆网络使得语音信号特征具有连续性,最后生成新的关键特征,输出的特征表示为H={h1,h2,…,hL};

所述的关键特征选择子网根据特征提取器所提取出的语音特征,进一步选取出语音特征中具有关键信息量的特征,即具有关键特征的区域;

关键特征选择子网的输入为特征提取器所生成的降维特征,对这些特征,采用了ATTENTION注意力机制网络,对语音情感特征的重要性进行打分,将重点聚焦与语音情感特征突出的部分,选择出具有关键信息量的特征,如公式(1)所示:其中K、Q、V分别代表输入特征的关键特征、查询值和当前关键特征的权重数值;第一步计算每个查询值和各个关键特征的相关性得到对应的权重系数,表示为Si;第二步使用Softmax函数进行归一化处理,其中Lx代表特征数据的长度,如公式(2)所示;

第三步,将权重系数和对应的当前关键特征的权重数值进行加权求和,从而得到最后的注意力数值,如公式(3)所示;

评估子网进行语音情感评估;对于输入的语音信号,特征提取器提取出语音信号的特征,关键特征选择子网选出语音信号具有突出情感信息量的关键特征;通过特征提取器提取出语音特征,经过两层全连接层和softmax层,得到最终的语音情感分类结果;

步骤3:获得语音情感评估结果;

在进行语音情感分析时,将语音情感分成生气,悲伤,高兴,害怕,中性,厌恶和无聊,共

7种情感类型;

待评估的语音信号输入到语音情感识别网络后,会输出其对应的情感类型,情感类型的范围在所述7种情感类型之间。