利索能及
我要发布
收藏
专利号: 202210217251X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于特征融合的语音情感识别方法,包括以下步骤:步骤1:获取及预处理用户语音数据,使用python库函数librosa.load()函数读取需要情感识别的语音,保存为numpy数据类型,通过构造预加重函数以及加窗分帧函数对其进行预处理;

步骤2:将数据放入特征提取器中,提取以下四种特征用于后续对特征的深度提取及融合,具体步骤如下:

1)使用python库函数librosa.feature.zero_crossing_rate()函数提取已保存数据的过零率;

2)使用python库函数librosa.feature.melspectrogram()函数提取已保存数据的梅尔频率;

3)使用python库函数librosa.feature.spectral_centroid()函数提取已保存数据的频谱质心;

4)使用python库函数librosa.feature.mfcc()函数提取已保存数据的梅尔频率倒谱系数MFCC;

步骤3:输入语音情感识别网络进行情感识别;所述的语音情感识别网络包括深度特征提取子网、分类器、分类层特征融合:所述的深度特征提取子网是将上述的MFCC送入卷积神经网络CNN中,对该特征进行卷积操作以获取深层特征,该网络结构包括四个卷积部分,每个卷积部分包括一个卷积层、一个池化层、一个归一化层和一个Dropout层,经过该网络的卷积操作得到深层特征;

所述的分类器采用的损失函数是交叉熵损失函数,用该函数来衡量预测值和真实值分布的差异,并将语音的情感划分到中性、生气、害怕、高兴、悲伤、厌恶、无聊这七种情感中;

所述的分类层特征融合是根据特征提取器所提取出的语音特征以及深度特征提取子网得到的深度特征进行特征融合,该部分采用的是分类层特征融合算法;

基于分类层的特征融合算法先对语音信号提取的特征类别记为n类,将这n类特征分别输入到n个分类器中进行训练,再用测试数据得到m类分类结果,测试数据的识别概率用{Pij(K),i=1Ln,j=1Lm}表示,再根据指定的决策融合规则对这些识别结果进行融合计算,最后得到m种不同分类结果的概率分布,表示为{qj(K),j=1Lm},根据决策融合得到的新的判决概率qj(K)的计算方式采用公式(1):其中,j代表第j个测试数据,q′j(K)的计算方式为公式(2):q′j(K)=R(pij(K))    (2)这里的R函数表示的是分类层融合的规则,最后根据判决概率计算得到的预测标签(3):

l(K)=argmax(qj(K))    (3)该分类层特征融合算法判决规则使用的是求和方式,如公式(4)所示;

步骤4:获得语音情感识别结果;

根据步骤3提供的概率分布情况,在这些分类结果集合中选择概率最大的作为最后的分类结果,将识别结果对应到中性、生气、害怕、高兴、悲伤、厌恶、无聊这七种情感中。