利索能及
我要发布
收藏
专利号: 2021109119798
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于,包括以下步骤:步骤1、对多个语音信号进行预处理,分别提取单个语音信号和混合语音信号的幅度谱特征,并根据所述幅度谱特征计算混合语音信号的多通道特征和目标信号的理想浮值掩蔽,所述多通道特征包括混合幅度谱特征、功率谱特征和对数功率谱特征;

步骤2、将所述多通道特征输入卷积神经网络,并提取深度特征;

步骤3、将所述多通道特征和所述深度特征进行融合,所述卷积神经网络还包括融合层,将所述深度特征和所述混合幅度谱特征输入所述融合层进行融合,得到融合特征,并作为卷积神经网络中的全连接层的输入,所述融合特征输入所述全连接层,将所述目标信号的理想浮值掩蔽作为全连接层的输出,并通过联合约束损失函数进行参数寻优以训练所述卷积神经网络;

步骤4、将用于测试的混合语音信号的多通道特征输入寻优训练后的卷积神经网络,以实现对混合语音信号进行分离。

2.根据权利要求1所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于:步骤1中的预处理包括分帧、加窗和预加重。

3.根据权利要求1所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于:步骤1具体为:将预处理后的多个语音信号进行短时傅里叶变换并提取单个语音信号和混合语音信号的幅度谱特征,根据所述幅度谱特征计算得到目标信号的理想浮值掩蔽、混合幅度谱特征、功率谱特征和对数功率谱特征,再对所述混合幅度谱特征、功率谱特征和对数功率谱特征进行归一化处理。

4.根据权利要求3所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特

2

征在于:所述混合幅度谱特征Ytrain取平方后得到所述功率谱特征||Ytrain||,对所述功率谱

2 2

特征||Ytrain||取对数操作后,得到所述对数功率谱特征ln||Ytrain||,所述目标信号的理想浮值掩蔽的表达式为:其中,Mi(t,f)是第i个目标信号的理想浮值掩蔽, 是第i个混合语音信号在时间t和频率f处的功率谱特征,N表示混合语音信号的个数,ε为正数。

5.根据权利要求1所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于:步骤2中的卷积神经网络包括两个卷积层和两个池化层,具体的:第一个卷积层中三个卷积核的大小是3×3,第一个池化层的池化核大小是2×2,步长是1,采用填充操作,得到第一输出特征的大小为1×32×32;第二个卷积层的卷积核大小是1×1,第二个池化层的池化核大小是2×2,步长是2,得到第二输出特征的大小为1×16×16,将所述第二输出特征进行拉平操作,得到大小为256×1的深度特征。

6.根据权利要求1所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于:所述全连接层包括输入层、两个隐层和输出层,所述全连接层的网络结构设计为

768‑1024‑1024‑512,所述输入层及两个隐层的激活层函数是ReLU,所述输出层的激活函数是Sigmoid。

7.根据权利要求1所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于:所述卷积神经网络的参数寻优在所述全连接层分为前向传播阶段和反向传播阶段,所述前向传播阶段用于随机初始化每层神经元的权重和偏置;所述反向传播阶段用于通过整合优化使得联合约束损失函数最小,迭代更新每层神经元的权重和偏置,基于最小均方误差准则,所述全连接层的联合约束损失函数的表达式为:其中,W和b表示每层网络的权重和偏置;x和y表示全连接层的输入和输出;

L

表示第L层的预测输出,σ(·)是激活函数,z表示第

L L

L层的神经元值,W表示第L层的网络权重,b表示第L层的网络偏置;M表示目标说话人的理想浮值掩蔽值;Y表示混合幅度谱特征;S表示单个语音信号的幅度谱特征;⊙为哈达玛乘积;α为正则化系数,取值范围是0≤α≤1,用于平衡所述联合约束损失函数的约束关系。

8.根据权利要求7所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于:迭代更新每层神经元的权重和偏置的表达式为:其中,l=L,L‑1,…,1, 表示第l层第j个神经元与前一层第i个神经元之间的权重,表示第l层第j个神经元的偏置,J(W,b)=J(W,b;x,y)为损失函数,β表示学习率。

9.根据权利要求1所述的基于卷积神经网络和联合优化的单通道语音分离方法,其特征在于,步骤4具体为:对用于测试的混合语音信号进行预处理,提取混合语音信号的幅度谱特征和相位谱特征,根据幅度谱特征计算得到混合幅度谱特征、功率谱特征和对数功率谱特征,并输入寻优训练后的卷积神经网络,得到预测理想浮值掩蔽,将所述预测理想浮值掩蔽与所述混合幅度谱特征相乘得到目标幅度谱,将所述目标幅度谱与所述相位谱特征结合并通过逆短时傅里叶变换以重构语音信号,完成混合语音信号的分离。