1.一种语音情感识别方法,其特征在于,包括:
获取待处理的语音信号;
对所获取的语音信号进行预处理,得到预处理后的语音信号;
提取预处理后的语音信号的特征参数;所述特征参数包括短时能量及其衍生参数、基音频率及其衍生参数、音质特征共振峰及其衍生参数、对MFCC求取的20阶的Mel倒谱系数和MFCC的一阶差分的最大值、MFCC的一阶差分最小值、MFCC的一阶差分的均值和MFCC的一阶差分的方差;
采用所提取的特征参数组成对应的特征矢量序列,得到所述语音信号对应的特征矢量序列;
采用支持向量机对所述语音信号对应的特征矢量序列进行训练和识别,得到对应的语音情感识别结果。
2.根据权利要求1所述的语音情感识别方法,其特征在于,所述对所获取的语音信号进行预处理,包括:对所获取的语音信号进行采样与量化、预加重、分帧加窗、短时能量分析和端点检测。
3.根据权利要求2所述的语音情感识别方法,其特征在于,在对所述语音信号进行端点检测时,采用如下的方式确定语音起始帧:对于预处理后得到的多个帧进行遍历,获取遍历到的当前帧;
计算遍历到的当前帧及其后连续的预设数量的帧的短时能量;
当确定遍历到的当前帧及其后连续的预设数量的帧的短时能量均大于或等于初始无声段语音信号的短时能量时,计算遍历到的当前帧与下一帧之间的短时能量的比值;
当确定计算得到的比值大于或等于预设的阈值时,确定遍历到的当前帧为所述语音信号的语音起始帧。
4.根据权利要求1-3任一项所述的语音情感识别方法,其特征在于,所述预处理后的语音信号的短时能量及其衍生参数,包括所述预处理后得到的多个帧的短时能量、短时能量的最大值、短时能量的最小值、短时能量的均值、短时能量的方差、短时能量抖动、短时能量的线性回归系数、短时能量的线性回归系数的均方误差和250Hz以下短时能量占全部短时能量的比例。
5.根据权利要求1-3任一项所述的语音情感识别方法,其特征在于,所述预处理后的语音信号的基音频率及其衍生参数,包括所述预处理后得到的多个帧的基音频率、基音频率的最大值、基音频率的最小值、基音频率的均值、基音频率的方差、一阶基音频率抖动、二阶基音频率抖动和满足F(i)*F(i+1)!=0的相邻两帧对应的浊音间差分基音;其中,F(i)表示第i帧的基音频率,F(i+1)表示第i+1帧的基音频率。
6.根据权利要求1-3任一项所述的语音情感识别方法,其特征在于,所述预处理后的语音信号的音质特征共振峰及其衍生参数,包括所述预处理后得到的多个帧中每个浊音帧的第一、第二和第三共振峰频率的最大值、第一、第二和第三共振峰频率的最小值、第一、第二和第三共振峰频率的均值、第一、第二和第三共振峰频率的方差和第一、第二和第三共振峰频率的一阶抖动、第二共振峰频率比率的最大值和第二共振峰频率比率最小值和第二共振峰频率比率均值。
7.根据权利要求1-3任一项所述的语音情感识别方法,其特征在于,所述对MFCC求取的
20阶的Mel倒谱系数,包括1~6阶的MFCC、3~10阶的Mid-MFCC和7~12阶的I-MFCC。
8.根据权利要求7所述的语音情感识别方法,其特征在于,1~6阶的MFCC、3~10阶的Mid-MFCC和7~12阶的I-MFCC,分别采用如下的公式计算得到:其中,fMel表示MFCC的频率,fMid-Mel表示Mid-MFCC的频率,fI-Mel表示I-MFCC的频率,f表示实际频率。
9.一种计算机可读存储介质,其上存储有计算机指令,其特征在于,所述计算机指令运行时执行权利要求1至8任一项所述的语音情感识别方法的步骤。
10.一种终端,其特征在于,包括存储器和处理器,所述存储器上储存有能够在所述处理器上运行的计算机指令,所述处理器运行所述计算机指令时执行权利要求1至8任一项所述的语音情感识别方法的步骤。