利索能及
我要发布
收藏
专利号: 2021107679899
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-25
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种端到端实时语音合成方法,其特征在于,采用基于高斯混合模型注意力机制的序列到序列生成模型的声谱预测网络和基于生成对抗网络的声码器,对数据集进行如下预处理:将文本进行正则化处理转换成声韵母分开的拼音注音序列,并添加停顿标注,对音频进行预加重,分帧加窗,短时傅里叶变换和梅尔偏置得到梅尔谱;通过预处理后的梅尔谱输入所述声谱预测网络中进行训练,得到预测梅尔谱,对其进行归一化,输入所述声码器,经过PQMF滤波器组进行分频和重组,进行对抗训练,通过主观评价方法对合成语音进行评价,通过计算实时率评价模型生成时耗。

2.根据权利要求1所述的端到端实时语音合成方法,其特征在于,所述声谱预测网络采用序列到序列生成模型,即使用基于高斯混合模型的注意力机制的编码器‑解码器结构,所述注意力机制通过高斯混合模型计算注意力权重。

3.根据权利要求1或2所述的端到端实时语音合成方法,其特征在于,所述声谱预测网络的输入为文本注音序列经词嵌入转换的特征向量,数据集录音时长12小时,录音语句

10000,单声道,信噪比不低于35dB,采样率为48kHz、16bit,无压缩WAV格式,数据预处理包括如下步骤:a)文字转拼音:采用将声韵母分开的处理方法,将汉字转换成汉语拼音,将汉语拼音的

5种音调分别用数字1,2,3,4,5来代替,1代表阴平,2代表阳平,3代表上声,4代表去声,5代表轻声,将阿拉伯数字转换成汉字,然后针对数字在不同场景的读法不一样的情况进行不同的标注,对符号进行规范化操作,将中文标点符号转换成英文标点符号,删去一些没有意义的特殊符号;

b)停顿标注:将停顿分为四个等级,分别用#1,#2,#3和#4标注,#1是韵律词的边界,在听感上是很短暂的骤顿,在语音波形上则无明显的间断,#2是词与词之间的停顿,停顿事件比较短暂,#3是一个逗号的停顿,时间稍长一些,#4是句号,表示这句话已经结束;

c)音频处理:读取语音文件,将语音文件开头和结束的静音部分进行剪切,保证神经网络模型能够准确地找到开始点和结束点,将原始音频信号通过一个高通滤波器得到预加重后的语音数据,采用公式(1):‑1

H(Z)=1‑μZ    (1)

其中Z为语音信号波形,μ取值范围在0.9到1之间;

对语音进行分帧加窗,窗函数使用汉宁窗,窗长为1024,帧移为256,汉宁窗为公式(2):

然后采用公式(3)对语音进行短时傅里叶变换,傅里叶点数为1024,得到语音的傅里叶谱;

其中x(τ)为源信号,h(τ‑t)为分析窗函数;

将傅里叶谱去幅度,然后通过跨度为80到7600的80通道梅尔滤波器获得梅尔偏置,得到梅尔谱,如公式(4),然后对梅尔谱进行均值方差归一化;

4.根据权利要求1或2所述的端到端实时语音合成方法,其特征在于,所述声谱预测网络的编码器由三层卷积神经网络层和一层双向LSTM构成,每一个卷积层的卷积核个数为

512,大小为5*1,使用ReLU非线性激活函数,对输入的注音序列进行上下文信息提取;最后一层卷积层的输出作为双向LSTM层的输入,该层有512维,每个方向256维,将注音序列转换成隐藏的特征表现状态信息。

5.根据权利要求2所述的端到端实时语音合成方法,其特征在于,所述解码器由Pre‑net、两层LSTM和两个线性投影层构成,Pre‑net包含两个全连接层,每一层有256维的ReLU,并且设置0.5的Dropout,两层1024维的单向LSTM的输出与新的语境向量进行拼接,分别送入两个线性映射层,其中一个线性映射层将LSTM的输出转换成梅尔谱,另一个线性映射层通过softmax来计算停止符,在解码过程中自发打断生成过程。

6.根据权利要求1或2所述的端到端实时语音合成方法,其特征在于,解码过程结束后,会将预测的梅尔谱输入到Post‑net中,Post‑net是由五层卷积神经网络构成的,每一层卷积层的卷积核数量为512,大小为5*1,前四层都使用tanh非线性激活函数,最后一层使用linear激活函数,Post‑net使用残差进行计算,如公式(12)(13)(14):yfinal=y+yr   (12)

yr=Postnet(y)=Wpsfps+bps   (13)

fps=Fps,i*x   (14)

其中y为原始输入,yfinal为最终输出的梅尔谱,x为解码器的输出或上一个卷积层的输出,Wps和bps为待训练的参数,F为卷积。

7.根据权利要求1或2所述的端到端实时语音合成方法,其特征在于,所述声码器使用多频带MelGAN,模型分为生成器和判别器两部分,生成器的输入是梅尔谱,输出的是原始波形,通过三层由一维反卷积构成的上采样层,反卷积的卷积核大小为步长的两倍,上采样的倍数为200,三层上采样层的输出通道数分别为192,96和48;每一层上采样层后连接一个残差模块,残差模块由4层扩张系数为1,3,9,27,卷积核大小为3的一维空洞卷积网络构成,起到扩大模型感受野的作用,然后通过一个一维卷积网络层,使用tanh非线性激活函数,输出通道为4,分别用来预测4个频带的音频。

8.根据权利要求7所述的端到端实时语音合成方法,其特征在于,所述判别器是一组多音频尺度的判别器模块,每一个音频尺度的判别器模块可以捕获到不同频率段的音频特征,判别器的输入由两部分组成,一个是真实语音的音频,另一个是生成器生成的语音音频,每个判别器模块由前后各一层的一维卷积层和下采样层构成,下采样层由3层跨步卷积构成,步长为4;判别器分为3个判别尺度,D1是原始音频频段,D2和D3分别是对原始音频进行采样系数为2和4的下采样的音频频段,判别器模块通过输入原始音频作为真音频,输入合成音频作为假音频,进行对抗训练。

9.根据权利要求1或2所述的端到端实时语音合成方法,其特征在于,所述声码器使用多尺度短时傅里叶变换损失,多尺度短时傅里叶变换损失分为Lsc和Lmag,前者考虑频谱的收敛性,后者考虑对数谱能量之间的关系,表达式如公式(15)(16):其中‖·‖F和‖·‖1表示F范数和L1范数,x为真实音频,为预测音频,|STFT(·)|表示短时傅里叶变换,N为幅度谱的元素个数,使用不同STFT参数可以得到不同分辨率的STFT loss,使用M个不同分辨率的STFT loss将单个损失加权平均得到公式(17):所述声码器使用PQMF滤波器组对音频进行分频段编码,滤波器组中的每一个滤波器使用不同的下采样率对信号进行编码,然后分别将子频带信号交付给解码器,在解码过程中将上采样的信号通过还原滤波器还原成语音波形。