1.一种基于少量样本的说话人适应方法,其特征在于,包括以下步骤:S100:获取具有文本标注的语音数据,对所述语音数据进行预处理,以生成梅尔频谱;
S200:构建个性化语音合成模型,将所述梅尔频谱和文本输入所述个性化语音合成模型中,从而获得预测梅尔频谱;
S300:基于所述梅尔频谱和所述预测梅尔频谱对所述个性化语音合成模型进行预训练,以及使用具有文本标注的目标未知说话人语音数据,对预训练好的个性化语音合成模型进行微调,以获得训练好的个性化语音合成模型;
S400:获取目标说话人的语音和任意文本信息,对所述目标说话人的语音进行预处理以获得梅尔频谱;将梅尔频谱和任意文本信息输入所述训练好的个性化语音合成模型中,以获得预测梅尔频谱;基于预测梅尔频谱生成任意文本信息所对应的目标语音;
其中,所述步骤S200包括以下子步骤:
S210:将所述梅尔频谱输入到预处理网络中,获得预处理结果;以及通过GRU模块对所述预处理结果进行编码,从而获得隐藏层特征;
S220:将所述预处理结果输入多颗粒度说话人编码器中,从而获得说话人特征;以及将所述隐藏层特征输入多颗粒度内容编码器中,从而获得内容特征;
S230:将所述内容特征和所述说话人特征输入语音特征重构模块中,从而获得重构语音特征;
S240:将文本输入音素编码器中,以获得文本特征;将所述重构语音特征、文本特征和说话人特征输入参考注意模块中,以获得输出结果;
S250:将所述输出结果与文本特征进行拼接后输入变量适配器中,从而获得第一隐藏特征;
S260:将所述第一隐藏特征输入梅尔谱图解码器中,从而获得预测梅尔频谱。
2.根据权利要求1所述的说话人适应方法,其特征在于,所述步骤S100中的预处理包括:将所述语音数据的语音波形通过短时傅立叶变换以及梅尔频谱的转换,生成梅尔频谱。
3.根据权利要求1所述的说话人适应方法,其特征在于,所述步骤S220中的多颗粒度内容编码器和多颗粒度说话人编码器均包括多颗粒度特征编码器,所述多颗粒度特征编码器含有4个不同尺度卷积,分别为1×1、3×3、5×5和7×7;3×3、5×5和7×7卷积后均依次连接有组归一化层、GeLU激活函数和带注意力机制的统计池化层。
4.根据权利要求1所述的说话人适应方法,其特征在于,所述步骤S230包括:所述内容特征经过语音特征重构模块中的实例归一化层,获得去除均值及方差的内容特征;
所述说话人特征经过语音特征重构模块中的全连接层,获得新均值和新方差;
将所述新均值和新方差替换到所述去除均值及方差的内容特征中,从而获得重构语音特征。
5.根据权利要求1所述的说话人适应方法,其特征在于,所述步骤S240包括:将所述重构语音特征作为参考注意模块的K及V;以及将所述文本特征与说话人特征进行拼接后,作为参考注意模块的Q;将Q、K和V输入参考注意模块,以获得参考注意模块输出的输出结果。
6.根据权利要求1所述的说话人适应方法,其特征在于,所述步骤S300包括:使用均方误差对预测梅尔频谱和梅尔频谱进行损失计算,基于损失对个性化语音合成模型进行预训练直至收敛,获得预训练好的个性化语音合成模型。
7.一种基于少量样本的说话人适应系统,其特征在于,包括预处理模块、模型构建模块、模型训练模块和个性化语音合成模块;
所述预处理模块用于获取具有文本标注的语音数据,对所述语音数据进行预处理,以生成梅尔频谱;
所述模型构建模块用于构建个性化语音合成模型,所述个性化语音合成模型包括预处理网络、GRU模块、多颗粒度内容编码器、多颗粒度说话人编码器、语音特征重构模块、参考注意模块、音素编码器、变量适配器和梅尔谱图解码器;将所述梅尔频谱和文本输入所述个性化语音合成模型中,从而获得预测梅尔频谱;
所述模型训练模块用于基于所述梅尔频谱和所述预测梅尔频谱对所述个性化语音合成模型进行预训练,以及使用具有文本标注的目标未知说话人语音数据,对预训练好的个性化语音合成模型进行微调,以获得训练好的个性化语音合成模型;
所述个性化语音合成模块用于获取目标说话人的语音和任意文本信息,对所述目标说话人的语音进行预处理以获得梅尔频谱;将梅尔频谱和任意文本信息输入所述训练好的个性化语音合成模型中,以获得预测梅尔频谱;基于预测梅尔频谱生成任意文本信息所对应的目标语音;
其中,所述个性化语音合成模型执行以下步骤以获得预测梅尔频谱:S210:将所述梅尔频谱输入到所述预处理网络中,获得预处理结果;以及通过所述GRU模块对所述预处理结果进行编码,从而获得隐藏层特征;
S220:将所述预处理结果输入所述多颗粒度说话人编码器中,从而获得说话人特征;以及将所述隐藏层特征输入所述多颗粒度内容编码器中,从而获得内容特征;
S230:将所述内容特征和所述说话人特征输入语音特征重构模块中,从而获得重构语音特征;
S240:将所述文本输入音素编码器中,以获得文本特征;将所述重构语音特征、文本特征和说话人特征输入参考注意模块中,以获得输出结果;
S250:将所述输出结果与文本特征进行拼接后输入变量适配器中,从而获得第一隐藏特征;
S260:将所述第一隐藏特征输入梅尔谱图解码器中,从而获得预测梅尔频谱。
8.一种语音翻译方法,其特征在于,包括以下步骤:
S10:获取待翻译文本的用户语音信号;
S20:将待翻译文本翻译为目标语言文本;
S30:将所述用户语音信号和目标语言文本输入到如权利要求7所述的说话人适应系统中,从而获得目标语音。
9.一种语音翻译系统,其特征在于,包括数据获取模块、文本翻译模块和语音合成模块;
所述数据获取模块用于获取待翻译文本的用户语音信号;
所述文本翻译模块用于将待翻译文本翻译为目标语言文本;
所述语音合成模块包括如权利要求7所述的说话人适应系统,用于根据所述用户语音信号和目标语言文本获得目标语音。