1.一种基于协作式边界感知对抗学习的跨库语音情感识别方法,其特征在于,包括以下步骤:步骤1,获取源域与目标域语音样本,执行预处理,包括幅值归一化、预加重滤波、分帧加窗,并将预处理后的语音样本转换为梅尔Mel谱图特征;
步骤2,构建基于协作式边界感知对抗学习的跨库语音情感识别模型,从特征分布和决策边界双维度减少源域和目标域语音样本之间的差异,实现情感知识迁移;
步骤3,采用多阶段训练策略,所述多阶段训练策略包括第一阶段训练、第二阶段训练和第三阶段训练,采用最大最小化差异检测损失函数,获取所有由于决策边界差异导致的情感标签错误映射的目标域语音样本,调整类别间决策边界。
2.根据权利要求1所述的方法,其特征在于,步骤1包括:步骤1‑1,从具有显著异构性的公开语音情感数据库中,随机选择两个数据库,分别构成源域语料库 与目标域语料库 ,以模拟实际多源异构数据源场景;
采用标签一致性筛选方法,仅保留相同情感类别语音样本,确保源域与目标域共享统一的情感标签空间;
步骤1‑2,对源域语音样本 与目标域语音样本 进行幅值归一化、预加重滤波、分帧加窗处理;
步骤1‑3,选用有监督源域语料库 和无监督目标域语料库 进行协同训练;
源域语料库 带有情感标签, 为 对应的情感标签;目标域语料库不带有情感标签, 模拟实际无情感标签语音样本。
3.根据权利要求2所述的方法,其特征在于,步骤1‑2包括:使用最大值归一化将样本幅值缩放至[‑1,1];采用高斯滤波器强化语音的高频信息;使用汉宁窗分帧加窗;随后,转换为梅尔Mel频率刻度,保留情感信息并去除冗余特征,实现源域与目标域语音样本特征的一致性,并转换为符合人耳听觉特性的梅尔Mel频率刻度。
4.根据权利要求3所述的方法,其特征在于,步骤2包括:步骤2‑1,将源域语音样本 与目标域语音样本 的梅尔Mel谱图输入到共享特征提取网络,提取迁移能力强和具有判别性的源域深度语音特征 与目标域深度语音特征 ;所述共享特征提取网络采用VGG11网络作为骨干网络;
对VGG11网络进行结构裁剪与参数重构,去除后三层全连接层,仅保留卷积层和池化层;
步骤2‑2,构建决策边界对齐网络:使用两个结构相同但初始化参数差异化的情感分类器对步骤2‑1中提取的源域深度语音特征 进行不同视角情感类别预测;
两个情感分类器均为多层感知机结构,分别记为第一情感分类器和第二情感分类器,两个情感分类器的权重矩阵和偏置向量通过高斯分布初始化,但使用不同随机种子生成参数,进而在特征空间中形成具有判别多样性的情感决策边界;
第一情感分类器对源域语音样本 的情感标签预测结果为:,
其中, 为第一情感分类器生成的源域情感类别预测结果, 为用于将情感类别得分转换为概率分布的Softmax函数, 为第一情感分类器的权重矩阵, 为用于增强情感特征抑制无关特征的ReLU激活函数, 为多层卷积层构成的共享特征提取网络, 为第一情感分类器的偏置向量;
第二情感分类器对源域语音样本 的情感标签预测结果为:,
其中, 为第二情感分类器生成的源域情感类别预测结果, 为第二情感分类器的权重矩阵, 为第二情感分类器的偏置向量;
步骤2‑3,通过联合监督的方式,将源域语音样本 的真实情感标签 与两个分类器的预测结果 与 进行联合优化;
计算情感标签预测结果 与 和真实情感标签 之间的差异,定义情感分类损失函数为:,
其中, 为情感分类损失函数, 为源域语音样本的数量, 为第i个源域语音样本的真实情感标签, 为第一情感分类器生成的第i个源域语音样本情感类别预测结果,为第二情感分类器生成的第i个源域语音样本情感类别预测结果;
步骤2‑4,将步骤2‑1中提取的目标域深度语音特征 输入至步骤2‑2中构建的决策边界对齐网络,通过两个情感分类器对目标域语音样本进行情感类别预测;
第一情感分类器对目标域语音样本 的情感标签预测结果为:,
其中, 为第一情感分类器生成的目标域情感类别预测结果;
第二情感分类器对目标域语音样本 的情感标签预测结果为:,
其中, 为第二情感分类器生成的目标域情感类别预测结果;
步骤2‑5,计算两个情感分类器在目标域样本上的预测概率 与 差异,构建差异检测损失函数;
步骤2‑6,构建特征分布对齐网络,将步骤2‑1中提取的源域深度语音特征 与目标域深度语音特征 输入至特征分布对齐网络中,减小源域与目标域在特征分布上的差异;
步骤2‑7,在步骤2‑6特征分布对齐网络输出的领域类别预测结果 基础上,引入领域标签监督机制,将语音样本 的真实领域标签 与领域类别预测结果 进行联合优化,构建领域分类损失函数。
5.根据权利要求4所述的方法,其特征在于,步骤2‑5包括:第一情感分类器生成的目标域情感类别预测结果 展开为:,
其中, 为第一情感分类器预测目标域样本第一类情感的概率, 为第一情感分类器预测目标域样本第 类情感的概率, 是源域和目标域的公共情感类别数量;
第二情感分类器生成的目标域情感类别预测结果 展开为:,
其中, 为第二情感分类器预测目标域样本第一类情感的概率, 为第二情感分类器预测目标域样本第 类情感的概率;
计算两个情感分类器的预测结果差异,定义差异检测损失函数为:,
其中, 为差异检测损失函数, 为目标域语音样本的数量, 为取绝对值;
为第一情感分类器对第m个目标域语音样本第n类情感上的预测概率分布, 为第二情感分类器对第m个目标域语音样本第n类情感上的预测概率分布。
6.根据权利要求5所述的方法,其特征在于,步骤2‑6包括:所述特征分布对齐网络包括两个以上全连接层和非线性激活函数,通过引入梯度反转机制,指导共享特征提取网络学习领域不变特征,以实现源域和目标域间特征空间的统一,领域类别预测结果为:,
其中,表示生成的输入样本特征的领域类别预测结果, 为用于将领域类别得分转换为概率分布的Sigmoid函数, 为特征分布对齐网络的权重矩阵, 为用于增强领域特征抑制无关特征的ReLU激活函数, 为输入的源域和目标域语音样本, 为特征分布对齐网络的偏置向量。
7.根据权利要求6所述的方法,其特征在于,步骤2‑7包括:领域类别预测结果 展开为:,
其中, 为领域标签为目标域的预测概率, 为领域标签为源域的预测概率;
真实领域标签d展开为:
,
其中, 为领域标签为目标域的真实概率, 为领域标签为源域的真实概率, 为输入的第k个语音样本,当 来自源域语料库 ,则 ;当 来自目标域语料库 ,则 ;
计算领域类别预测结果和真实领域标签差异,定义领域分类损失函数为:,
其中, 为领域分类损失函数, 为第k个语音样本的真实领域标签, 为第k个语音样本的领域类别预测结果。
8.根据权利要求7所述的方法,其特征在于,步骤3包括:步骤3‑1,在训练过程中采用随机梯度下降优化器,初始化共享特征提取网络、决策边界对齐网络和特征分布对齐网络的参数,采用指数衰减的声学感知学习率策略,以匹配人耳梅尔尺度的高频衰减,学习率公式为:,
其中, 为调整后的学习率, 为初始学习率, 为当前训练次数, 为总训练次数;
步骤3‑2,第一阶段训练时,冻结决策边界对齐网络第一情感分类器的参数与第二情感分类器的参数,保留初始决策视角的差异性;
通过梯度反转机制动态调整特征优化方向,更新特征对齐网络的参数、梯度反转系数和共享特征提取网络参数 ;
首先,根据领域分类损失函数 ,更新特征对齐网络的参数,以消除语料库之间的特征分布差异:,
,
其中, 为更新后的特征分布对齐网络的权重矩阵, 为更新后的特征分布对齐网络的偏置向量;符号 表示采用右边的式子进行更新; 表示偏微分;
然后,动态调整反向传播层 的梯度反转系数 ,逐步强化目标域特征的学习,平衡跨域特征的迁移能力:,
其中, 是当前训练次数占总训练次数的比例;e是自然常数;
最后,根据情感分类损失函数 、领域分类损失函数 和梯度反转系数 ,更新共享特征提取网络的参数 :,
其中, 是平衡情感分类损失函数和领域分类损失函数的权重, 为更新后的深度特征提取网络参数;
步骤3‑3,第二阶段训练时,冻结共享特征提取网络的参数 ;最大化两个情感分类器之间的预测结果差异,更新决策边界对齐网络第一情感分类器的参数与第二情感分类的参数;
基于构建的情感分类损失函数 和差异检测损失函数 ,更新决策边界对齐网络参数,筛选出由于跨库语音情感识别决策边界错位导致的情感标签错误映射的目标域语音样本: , ,
, ,
其中, 是平衡情感分类损失函数和差异检测损失函数的权重, 为更新后的第一情感分类器的权重矩阵, 为更新后的第一情感分类器的偏置向量, 为更新后的第二情感分类器的权重矩阵, 为更新后的第二情感分类器的偏置向量;
步骤3‑4,第三阶段训练时,冻结决策边界对齐网络第一情感分类器的参数与第二情感分类器的参数;最小化两个情感分类器之间的预测结果差异,更新共享特征提取网络参数;
基于构建的差异检测损失函数 ,更新共享特征提取网络参数 ,对目标域中由于决策边界错位导致的错误情感标签映射进行修正:;
步骤3‑5,步骤3‑2 步骤3‑4三个阶段训练交替进行,通过逐步优化和调整模型的参数,~直至模型达到收敛状态或训练次数达到预设的最大值。
9.一种电子设备,其特征在于,包括处理器和存储器,所述存储器存储有程序代码,当所述程序代码被所述处理器执行时,使得所述处理器执行如权利要求1至8中任一项所述的方法的步骤。
10.一种存储介质,其特征在于,存储有计算机程序或指令,当所述计算机程序或指令在计算机上运行时,执行如权利要求1至8中任一项所述的方法的步骤。