利索能及
我要发布
收藏
专利号: 2017104742818
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2025-08-05
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于自适应高斯聚类的非平行文本条件下的语音转换方法,其特征在于,包括训练阶段和转换阶段,其中所述训练阶段包括如下步骤:步骤1,输入源说话人和目标说话人的非平行训练语料;

步骤2,使用AHOcoder语音分析模型分别提取源说话人的非平行训练语料的MFCC特征参数X、目标说话人的非平行训练语料的MFCC特征参数Y,以及源语音基频log f0X和目标语音基频log f0Y;

步骤3,对步骤2中的MFCC特征参数X、Y,进行单元挑选和声道长度归一化相结合的语音特征参数对齐和动态时间规整,从而将非平行语料转变成平行语料;

步骤4,使用期望最大化EM算法进行自适应混合高斯模型AGMM训练,AGMM训练结束,得到后验条件概率矩阵P(X|λ),并保存AGMM参数λ;

步骤5,利用步骤3得到的源语音特征参数X和目标语音特征参数Y,使用步骤4中的后验条件概率矩阵P(X|λ)进行双线性频率弯折BLFW+幅度调节AS训练,得到频率弯折因子α(x,λ)和幅度调节因子s(x,λ),从而构建BLFW+AS转换函数;使用对数基频的均值和方差建立源语音基频log f0X和目标语音基频log f0Y之间的基频转换函数;

所述转换阶段包括如下步骤:

步骤6,输入待转换的源说话人语音;

步骤7,使用AHOcoder语音分析模型提取源说话人语音的MFCC特征参数X′和对数基频log f0X′;

步骤8,使用步骤4中AGMM训练时得到的参数λ,求取后验条件概率矩阵P′(X|λ);

步骤9,使用步骤5中得到的BLFW+AS转换函数,求得转换后的MFCC特征参数Y′;

步骤10,使用步骤5得到的基频转换函数由对数基频log f0X′得到转换后的对数基频log f0Y′;

步骤11,使用AHOdecoder语音合成模型将转换后的MFCC特征参数Y′和对数基频log f0Y′合成得到转换后的语音。

2.根据权利要求1所述的语音转换方法,其特征在于,步骤3具体过程如下:

3-1)采用双线性频率弯折方法对源语音MFCC特征参数进行声道长度归一化处理;

3-2)对于给定的N个源语音MFCC特征参数矢量{Xk},通过公式(1)来动态地寻找N个目标语音特征参数矢量{Yk},使得距离耗费函数值C({Yk})最小;

C({Yk})=C1({Yk})+C2({Yk})  (1)其中,C1({Yk})和C2({Yk})分别由下式表示:其中,D(Xk,Yk)函数表示源语音和目标语音特征参数矢量之间的频谱距离,参数γ表示在特征参数帧对齐的准确度和帧间连续性之间的平衡系数,且有0≤γ≤1;C1({Yk})表示的是源语音特征参数矢量和目标语音特征参数矢量之间的频谱距离耗费函数,C2({Yk})表示的是经单元挑选的目标语音特征参数矢量之间频谱距离耗费函数;

3-3)通过对公式(1)进行多元线性回归分析,得到与源语音特征参数矢量对齐的目标语音特征参数序列集合 即:通过上述步骤,将非平行的MFCC特征参数X、Y转变为平行的语料。

3.根据权利要求2所述的语音转换方法,其特征在于,对于公式(4)的求解,使用维特比搜索方法来优化算法的执行效率。

4.根据权利要求1所述的语音转换方法,其特征在于,步骤4的训练过程如下:

4-1)设定AGMM初始混合数M,高斯分量权重系数阈值t1,t2,特征参数矢量之间欧氏距离阈值D和协方差阈值σ;

4-2)使用K-均值迭代算法得到EM训练的初始值;

4-3)使用EM算法进行迭代训练;将高斯混合模型GMM表示如下:其中,X为P维的语音特征参数矢量,P(wi)表示各高斯分量的权重系数,且有M为高斯分量的个数,N(X,μi,Σi)表示高斯分量的P维联合高斯概率分布,表示如下:其中μi为均值矢量,∑i为协方差矩阵,λ={P(wi),μi,Σi},λ是GMM模型的模型参数,对λ的估算通过最大似然估计法实现,对于语音特征参数矢量集合X={xn,n=1,2,...N}有:此时:

λ=argλmax(P(X|λ))  (8)

使用EM算法求解公式(8),随着EM计算过程中迭代条件满足P(X|λk)≥P(X|λk-1),K是迭代的次数,直至得到模型参数λ,迭代过程中高斯分量权重系数P(wi)、均值向量μi、协方差矩阵Σi的迭代公式如下:

4-4)若训练得到的模型中某一高斯分量N(P(wi),μi,∑i)权重系数小于t1,并且与其最邻近分量N(P(wj),μj,Σi)之间的欧氏距离小于阈值D,则对其进行合并处理:此时,高斯分量个数变为M-1,返回步骤4-3)进行下一次训练,若满足合并条件的高斯分量有多个,则选择最小距离的高斯分量进行合并;

4-5)若训练得到的模型中某一高斯分量N(P(wi),μi,∑i)权重系数大于t2,并且协方差矩阵中有至少一维的方差大于σ,则认为该高斯分量包含过量信息,应将其分裂处理:其中E为全1的列向量,n用于调节高斯分布,经过分裂后高斯分量个数变为M+1,如果满足分裂条件的高斯分量有多个,则选取权重系数最大的分量进行分裂,返回步骤4-3)进行下一次训练;

4-6)AGMM训练结束,得到后验条件概率矩阵P(X|λ),保存λ。

5.根据权利要求4所述的语音转换方法,其特征在于,P=39。

6.根据权利要求1所述的语音转换方法,其特征在于,步骤5中构建的BLFW+AS转换函数,表示如下:F(x)=Wα(x,λ)x+s(x,λ)  (15)

其中,M为步骤4中混合高斯模型的高斯分量的个数,α(x,λ)表示频率弯折因子,s(x,λ)表示幅度调节因子。

7.根据权利要求1所述的语音转换方法,其特征在于,步骤5中建立源语音基音频率和目标语音基音频率之间的转换关系:2

其中μ,σ分别表示对数基音频率log f0的均值和方差。