利索能及
我要发布
收藏
专利号: 2019102685928
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于beta-VAE的多对多语音转换方法,其特征在于:包括训练阶段和转换阶段,所述训练阶段包括以下步骤:(1.1)获取非平行训练语料,包含源说话人和目标说话人;

(1.2)将所述的训练语料通过WORLD语音分析/合成模型,提取出各说话人语句频谱包络特征X、非周期特征、对数基频logf0;

(1.3)将上述的频谱包络特征X、说话人标签y,输入由编码器和解码器组成beta-VAE网络进行训练,得到训练好的beta-VAE网络;

(1.4)构建从源说话人的语音基频到目标说话人的语音基频的基频转换函数;

所述转换阶段包括以下步骤:

(2.1)将源说话人语音通过WORLD语音分析/合成模型提取出每条语句的频谱包络特征Xs、非周期特征、对数基频(2.2)将源说话人的频谱特征Xs、目标说话人的标签yt,输入步骤(1.3)训练好的beta-VAE网络中,输出目标说话人的频谱特征Xt;

(2.3)通过步骤(1.4)得到基频转换函数,将步骤(2.1)中提取出的源说话人对数基频频 转换为目标说话人的对数基频频(2.4)将步骤(2.1)中得到的非周期特征、步骤(2.2)中得到的频谱特征Xt、以及(2.3)中得到的目标说话人对数基频 输入WORLD语音分析/合成模型,得到转换后的目标说话人语音。

2.根据权利要求1所述的基于beta-VAE的多对多语音转换方法,其特征在于步骤(1.3)中输入和训练的步骤为:(1)将X输入beta-VAE网络的编码器,编码器输出语义特征z;

(2)将z和y,输入beta-VAE网络的的解码器,最小化X与Xt’的距离D(X,Xt‘),Xt’为解码器生成的频谱包络特征;

(3)重复上述步骤直至迭代次数;

(4)计算beta-VAE网络的MCD值,根据最小的MCD值选择模型参数β和C。

3.根据权利要求2所述的基于beta-VAE的多对多语音转换方法,其特征在于:D(X,Xt‘)使用KL散度来衡量,所述KL散度为 其中,D为z的维度,μ(i)和分别为X的一般正态分布的均值向量和方差向量的第i个向量。

4.根据权利要求1所述的基于beta-VAE的多对多语音转换方法,其特征在于步骤(2.2)中的输入过程为:将源说话人频谱特征Xs,输入beta-VAE网络的编码器,将编码器的输出与目标说话人的标签yt输入beta-VAE网络的解码器,转换获取目标说话人频谱特征Xt。

5.根据权利要求1所述的基于beta-VAE的多对多语音转换方法,其特征在于:所述的编码器采用二维卷积神经网络,包括5个卷积层和1个全连接层,5个卷积层的过滤器大小均为

7*1,步长均为3,过滤器深度分别为16、32、64、128、256;所述的解码器采用二维卷积神经网络,包括4个卷积层,4个卷积层的过滤器大小分别为9*1、7*1、7*1、1025*1,步长分别为3、3、

3、1,过滤器深度分别为32、16、8、1。

6.根据权利要求1所述的基于beta-VAE的多对多语音转换方法,其特征在于:所述基频转换函数为:其中, 为源说话人的基频, 为转换后目标说话人的基频,源说话人基频在对数域的均值和方差分别为μs和σs,目标说话人基频在对数域的均值和方差分别为μt和σt。