1.一种非平行文本条件下基于文本编码器的多对多语音转换方法,其特征包括训练阶段和转换阶段,其中所述训练阶段包括以下步骤:(1.1)获取由多名说话人的语料组成的训练语料,包含源说话人和目标说话人;
(1.2)将所述的训练语料通过WORLD语音分析/合成模型,提取出各说话人语句的频谱包络特征x、非周期性特征、对数基频logf0;
(1.3)通过fasttext框架将训练语料的语义内容编码为句子嵌入zp;
(1.4)将所述频谱包络特征x与句子嵌入zp输入文本编码器进行训练,训练过程中使文本编码器的损失函数尽量小,直至设置的迭代次数,得到训练好的文本编码器;
(1.5)将训练语料的句子嵌入zp、频谱包络特征x、说话人标签y输入VAWGAN进行训练,VAWGAN网络模型由编码器、生成器和鉴别器组成,训练过程使生成器的损失函数尽量小,使鉴别器的损失函数尽量大,直至设置的迭代次数,得到训练好的VAWGAN网络;
(1.6)构建从源说话人的语音基频到目标说话人的语音基频的基频转换函数;
所述转换阶段包括以下步骤:
(2.1)将待转换语料中源说话人语音通过WORLD语音分析/合成模型提取出每条语句的频谱包络特征x、非周期性特征、对数基频logf0;
(2.2)将上述频谱包络特征x,输入步骤(1.4)中训练好的文本编码器,输出得到文本编码器预测的源说话人每条语句的句子嵌入(2.3)将上述句子嵌入 源说话人频谱包络特征x、目标说话人标签特征y输入步骤(1.5)中训练好的VAWGAN网络,从而重构出目标说话人频谱包络特征x′;
(2.4)通过步骤(1.6)得到的基频转换函数,将步骤(2.1)中提取出的源说话人对数基频logf0转换为目标说话人的对数基频logf0′;
(2.5)将步骤(2.3)中得到的频谱包络特征x′、(2.4)中得到的对数基频logf0′和步骤(2.1)中提取的非周期性特征通过WORLD语音分析/合成模型,合成得到转换后的说话人语音。
2.根据权利要求1所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于:所述文本编码器采用l2损失函数,损失函数为:其中,M为训练语句的数量,zp为训练库中语义内容编码所得的真实句子嵌入,为文本编码器输出的预测句子嵌入。
3.根据权利要求2所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于:所述文本编码器采用二维卷积神经网络,包括5个卷积层和1个全连接层。5个卷积层的过滤器大小均为7*1,步长均为3,过滤器深度分别为16、32、64、128、256。
4.根据权利要求1所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于:步骤(1.5)中的训练过程包括以下步骤:(1)将所述的训练语料频谱包络特征x,作为所述VAWGAN网络中编码器的输入数据,输出得到说话人无关的语义特征z;
(2)将上述语义特征z、说话人标签特征y、步骤(1.3)中所述的句子嵌入zp输入生成器进行训练,使生成器的损失函数尽量小,得到生成的说话人频谱包络特征x′;
(3)将上述说话人频谱包络特征x′和训练语料频谱包络特征x输入所述鉴别器进行训练,使鉴别器的损失函数尽量大;
(4)重复步骤(1)、(2)和(3),直至达到迭代次数,从而得到训练好的VAWGAN网络。
5.根据权利要求1所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于步骤(2.3)中的输入过程包括以下步骤:(1)将频谱包络特征x输入VAWGAN网络中的编码器,得到说话人无关的语义特征z;
(2)将上述语义特征z、目标说话人标签特征y、步骤(2.2)中文本编码器预测的句子嵌入 输入到所述的生成器中,重构出目标说话人频谱包络特征x′。
6.根据权利要求1所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于:所述VAWGAN网络中的编码器采用二维卷积神经网络,包括5个卷积层和1个全连接层。5个卷积层的过滤器大小均为7*1,步长均为3,过滤器深度分别为16、32、64、128、
256。
7.根据权利要求1所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于:所述VAWGAN网络中的生成器采用二维卷积神经网络G,损失函数为:所述的鉴别器采用二维卷积神经网络D,损失函数为:
其中,Gθ为生成器网络,Dψ为鉴别器网络, 表示生成器生成的概率分布的期望,表示真实概率分布的期望。
8.根据权利要求7所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于:所述的生成器的二维卷积神经网络G包括4个卷积层,4个卷积层的过滤器大小分别为9*1、7*1、7*1、1025*1,步长分别为3、3、3、1,过滤器深度分别为32、16、8、1;所述的鉴别器的二维卷积神经网络D,包括3个卷积层和1个全连接层,3个卷积层的过滤器大小分别为7*1、7*1、115*1,步长均为3,过滤器深度分别为16、32、64。
9.根据权利要求1所述的非平行文本条件下基于文本编码器的多对多语音转换方法,其特征在于:所述的基频转换函数为:其中,μs和σs分别为源说话人的基频在对数域的均值和方差,μt和σt分别为目标说话人的基频在对数域的均值和方差,logf0s为源说话人的对数基频,logf0c为转换后对数基频。