1.一种基于双重对抗学习的语音情感识别方法,其特征在于,包括以下步骤:
获取语音信号并进行预处理,使用情感分类器中的WavLM预训练模型从预处理后的语音信号中提取WavLM特征;
将提取的WavLM特征分别送入情感编码器、对抗音素分类器和对抗说话人分类器,并分别计算情感分类器、对抗音素分类器及对抗说话人分类器的交叉熵损失;
将计算的三个交叉熵损失相加得到总损失函数,使用所述总损失函数同时训练情感分类器、对抗音素分类器及对抗说话人分类器;
将待识别语音信号分别导入训练好的情感分类器、对抗音素分类器和对抗说话人分类器,通过双重对抗学习去除待识别语音信号中的说话人信息及内容信息,通过情感分类器获取待识别语音信号的情感类别。
2.根据权利要求1所述的基于双重对抗学习的语音情感识别方法,其特征在于,获取语音信号并进行预处理,使用情感分类器中的WavLM预训练模型从预处理后的语音信号中提取WavLM特征,具体为:获取海量的带音素标注、情感标注及说话人标注的语音信号,对所述语音信号进行频域分析,获取语音信号对应的频带分量分布,通过所述频带分量分布确定对应的频率段,根据所述频率段配置带通滤波去除不符合频率要求的信号;
将带通滤波后的语音信号进行下采样,使用双正交小波基进行数字滤波,获取降噪后的语音信号,计算出降噪后语音信号的小波熵,获取最大小波熵及最小小波熵之间的区间生成阈值区间;
使用所述阈值区间对降噪后的语音信号进行模糊语音分辨,当语音信号的小波熵不处于所述阈值区间时,则进行剔除,遍历所有语音信号后获取预处理后的语音信号;
构建WavLM预训练模型,在所述WavLM预训练模型的训练中,使用卷积编码器及Transformer编码器语音信号进行特征编码,随机对输入语音信号进行变换,再随机遮盖预设比例的语音信号,并预测被遮盖位置所对应的标签;
完成训练后使用WavLM预训练模型提取预处理后的语音信号对应的标签序列的概率分布,将所述概率分布作为WavLM特征,所述WavLM特征包含情感信息、音素信息及说话人信息。
3.根据权利要求1所述的基于双重对抗学习的语音情感识别方法,其特征在于,所述情感分类器由WavLM预训练模型、情感编码器、全连接层及softmax分类层组成;
所述对抗音素分类器由梯度反转、音素编码器、全连接层及softmax分类层组成;
所述对抗说话人分类器梯度反转、说话人编码器、全连接层及softmax分类层组成;
将获取的WavLM特征分别作为情感编码器、对抗音素分类器和对抗说话人分类器的输入,分别计算情感分类器、对抗因素分类器及对抗说话人分类器的交叉熵损失。
4.根据权利要求3所述的基于双重对抗学习的语音情感识别方法,其特征在于,所述对抗音素分类器,具体为:将获取的WavLM特征导入音素编码器,在音素编码器中通过一层卷积层进行初始卷积,接着采用两层卷积层进行下采样,减小特征尺寸,使用三个相同的残差模块对下采样得到的特征进行音素特征提取,并在特征提取中引入多头自注意力机制,获取音素编码;
将获取的音素编码导入判别器,通过梯度反转层利用负系数乘以误差控制反向传播,使得梯度反转层前后的网络学习目标相反,实现音素特征的对抗学习;
使用全连接层及Softmax激活函数对WavLM特征中的音素信息进行分类预测。
5.根据权利要求3所述的基于双重对抗学习的语音情感识别方法,其特征在于,基于对抗音素分类器通过共享特征配置情感分类器及对抗说话人分类器的参数,采用带标注的语音信号对应的WavLM特征对所述对抗音素分类器、情感分类器及对抗说话人分类器同时进行有监督训练;
将获取的WavLM特征导入配置好的对抗说话人分类器,对WavLM特征中的说话人信息进行分类预测;
根据WavLM特征中的音素信息标签及说话人信息标签进行内容信息及说话人信息的标记,将标记的内容信息及说话人信息进行剔除。
6.根据权利要求3所述的基于双重对抗学习的语音情感识别方法,其特征在于,分别计算情感分类器、对抗因素分类器及对抗说话人分类器的交叉熵损失,具体为:将带标注的语音信号对应的WavLM特征按照比例划分为训练集及测试集,初始化情感分类器、对抗因素分类器及对抗说话人分类器的框架参数及学习率,使用训练集中的训练样本输入三个分类器中进行训练;
在三个分类器的训练过程中,基于训练样本与标签信息的从属关系计算情感分类器的输出与情感标注之间的情感交叉熵损失、对抗音素分类器的输出与音素标注之间的音素交叉熵损失、对抗说话人分类器的输出与说话人标注之间的说话人交叉熵损失;
使用所述情感交叉熵损失、音素交叉熵损失及说话人交叉熵损失进行相加,构建总损失函数监督三个分类器的训练,根据前向传播中总损失迭代更新合成三个分类器的网络参数,使用测试集进行分类性能测试,当性能测试结果符合预设标准时,则完成三个分类器的训练。
7.根据权利要求1所述的基于双重对抗学习的语音情感识别方法,其特征在于,获取预处理后的待识别语音信号,将所述待识别语音信号分别导入训练好的情感分类器、对抗音素分类器和对抗说话人分类器;
通过双重对抗学习去除待识别语音信号中的说话人信息及内容信息,通过情感分类器中的全连接层及Softmax函数获取待识别语音信号对应的情感标签概率分布,根据所述概率分布输出待识别语音信号的情感类别。
8.一种基于双重对抗学习的语音情感识别系统,其特征在于,实现如权利要求1‑7任一项所述的基于双重对抗学习的语音情感识别方法,该系统包括:语音信号输入模块、情感分类器模块、对抗音素分类器模块、对抗说话人分类器模块、分类器训练模块及语音情感输出模块;
所述语音信号输入模块负责获取待识别语音信号,并将所述待识别语音信号进行预处理;
所述情感分类器模块负责提取待识别语音信号的WavLM特征,根据所述WavLM特征获取待识别语音信号的情感类别;
所述对抗音素分类器模块负责去除待识别语音信号的内容信息;
所述对抗说话人分类器模块负责去除待识别语音信号的说话人信息;
所述分类器训练模块负责采用带有标注的语音信号对情感分类器、对抗音素分类器及对抗说话人分类器进行训练;
所述语音输出模块负责输出待识别语音信号对应不含内容信息及说话人信息的情感类别信息,并按照预设方式进行展示。