1.一种非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于包括训练阶段和转换阶段,其中所述训练阶段包括以下步骤:(1.1)获取训练语料,训练语料由多名说话人的语料组成,包含源说话人和目标说话人;
(1.2)将所述的训练语料通过WORLD语音分析/合成模型,提取出各说话人语句的频谱包络特征x、对数基频log f0和代表各说话人个性化特征的i向量i;
(1.3)将频谱包络特征x、说话人标签y和说话人i向量i输入VAWGAN网络模型进行训练,VAWGAN网络模型由编码器、生成器和鉴别器组成;
(1.4)训练过程使生成器的损失函数尽量小,使鉴别器的损失函数尽量大,直至设置的迭代次数,得到训练好的VAWGAN网络;
(1.5)构建从源说话人的语音基频到目标说话人的语音基频的基频转换函数;
所述转换阶段包括以下步骤:
(2.1)将待转换语料中源说话人的语音通过WORLD语音分析/合成模型提取出不同语句的频谱包络特征x、非周期性特征和对数基频log f0;
(2.2)将上述频谱包络特征x、目标说话人标签y、目标说话人i向量i输入(1.4)中训练好的VAWGAN网络,从而重构出目标说话人频谱包络特征x′;
(2.3)通过(1.5)得到的基频转换函数,将(2.1)中提取出的源说话人对数基频log f0转换为目标说话人的对数基频log f0′;
(2.4)将(2.2)中得到的目标说话人频谱包络特征x′、(2.3)中得到的目标说话人的对数基频log f0′和(2.1)中提取的非周期性特征通过WORLD语音分析/合成模型,合成得到转换后的说话人语音。
2.根据权利要求1所述的非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于:步骤(1.3)和(1.4)中的训练过程包括以下步骤:(1)将训练语料的频谱包络特征x,作为所述编码器的输入数据,经过网络训练后得到说话人无关的语义特征z;
(2)将上述语义特征z与说话人标签y、说话人i向量i输入生成器进行训练,使生成器的损失函数尽量小,得到生成的说话人频谱包络特征x′;
(3)将上述说话人频谱包络特征x′和训练语料的频谱包络特征x输入所述鉴别器进行训练,使鉴别器的损失函数尽量大;
(4)重复步骤(1)、(2)和(3),直至达到迭代次数,从而得到训练好的VAWGAN网络。
3.根据权利要求1所述的非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于步骤(2.2)中的输入过程包括以下步骤:(1)将频谱包络特征x输入编码器,得到说话人无关的语义特征z;
(2)将得到的语义特征z与目标说话人标签y、目标说话人i向量i输入到所述的生成器中,重构出目标说话人频谱包络特征x′。
4.根据权利要求1所述的非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于:所述的编码器采用二维卷积神经网络,包括5个卷积层和1个全连接层,5个卷积层的过滤器大小均为7*1,步长均为3,过滤器深度分别为16、32、64、128、256。
5.根据权利要求1所述的非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于:所述的生成器采用二维卷积神经网络G,损失函数为:所述的鉴别器采用二维卷积神经网络D,损失函数为:
其中,Gθ为生成器网络,Dψ为鉴别器网络, 表示生成器生成的概率分布的期望,表示真实概率分布的期望,其中qφ(z|x)为编码器, 表示x服从的真实概率分布。
6.根据权利要求5所述的非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于:所述的生成器的二维卷积神经网络G包括4个卷积层,4个卷积层的过滤器大小分别为9*1、7*1、7*1、1025*1,步长分别为3、3、3、1,过滤器深度分别为32、16、8、1。
7.根据权利要求5所述的非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于:所述的鉴别器的二维卷积神经网络D,包括3个卷积层和1个全连接层,3个卷积层的过滤器大小分别为7*1、7*1、115*1,步长均为3,过滤器深度分别为16、32、64。
8.根据权利要求1所述的非平行文本条件下基于i向量的多对多说话人转换方法,其特征在于所述的基频转换函数为:其中,μσ和σσ分别为源说话人的基频在对数域的均值和方差,μt和σt分别为目标说话人的基频在对数域的均值和方差,log f0σ为源说话人的对数基频,log f0c为转换后对数基频。