利索能及
我要发布
收藏
专利号: 2018105928679
申请人: 平安科技(深圳)有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 2027-07-12
联系人

摘要:

权利要求书:

1.一种说话人聚类方法,其特征在于,包括:

将至少两个待聚类语音按语音时长降序排列;

依序将每一所述待聚类语音与预设声学模型库中每一原始通用语音向量进行语音识别,获取与所述待聚类语音对应的目标通用语音向量;

若所述待聚类语音在所述目标通用语音向量中的语音特征相似度不大于预设阈值,则采用所述待聚类语音进行模型训练,获取与所述待聚类语音对应的当前通用语音向量;

将所述当前通用语音向量存储在所述预设声学模型库中,并将所述待聚类语音归类到所述当前通用语音向量对应的聚类类簇中。

2.如权利要求1所述的说话人聚类方法,其特征在于,在获取与所述待聚类语音对应的目标通用语音向量的步骤之后,所述说话人聚类方法还包括:若所述待聚类语音在所述目标通用语音向量中的语音特征相似度大于预设阈值,则将所述待聚类语音归类到所述目标通用语音向量对应的聚类类簇中。

3.如权利要求1所述的说话人聚类方法,其特征在于,所述依序将每一所述待聚类语音与预设声学模型库中每一原始通用语音向量进行语音识别,获取与所述待聚类语音对应的目标通用语音向量,包括:依序将每一所述待聚类语音按预设规则划分成第一语音段和第二语音段;

分别对所述第一语音段和所述第二语音段进行特征提取,获取第一语音特征和第二语音特征;

将所述第一语音特征输入到预设声学模型库中每一原始通用语音向量进行语音自适应,获取每一原始通用语音向量对应的自适应语音特征;

对所述自适应语音特征和所述第二语音特征进行相似度计算,获取每一原始通用语音向量对应的识别相似度;

选取识别相似度最高的原始通用语音向量作为与所述待聚类语音对应的目标通用语音向量。

4.如权利要求3所述的说话人聚类方法,其特征在于,所述对所述自适应语音特征和所述第二语音特征进行相似度计算,获取每一原始通用语音向量对应的识别相似度,包括:分别获取所述自适应语音特征和所述第二语音特征对应的识别i-vector向量和第二i-vector向量;

采用余弦相似度算法获取所述识别i-vector向量和所述第二i-vector向量的识别相似度。

5.如权利要求1所述的说话人聚类方法,其特征在于,所述采用所述待聚类语音进行模型训练,获取与所述待聚类语音对应的当前通用语音向量,包括:提取所述待聚类语音的测试语音特征;

采用简化模型算法简化处理所述测试语音特征,获取简化语音特征;

采用最大期望算法迭代所述简化语音特征,获取总体变化子空间;

将所述简化语音特征投影到所述总体变化子空间,以获取所述类簇标识对应的所述当前通用语音向量。

6.如权利要求5所述的说话人聚类方法,其特征在于,所述采用简化模型算法简化处理所述测试语音特征,获取简化语音特征,包括:采用高斯滤波器处理所述测试语音特征,获取对应的二维正态分布;

采用简化模型算法简化所述二维正态分布,获取简化语音特征。

7.一种说话人聚类装置,其特征在于,包括:

语音降序排列模块,用于将至少两个待聚类语音按语音时长降序排列;

获取通用向量模块,用于依序将每一所述待聚类语音与预设声学模型库中每一原始通用语音向量进行语音识别,获取与所述待聚类语音对应的目标通用语音向量;

训练当前向量模块,用于若所述待聚类语音在所述目标通用语音向量中的语音特征相似度不大于预设阈值,则采用所述待聚类语音进行模型训练,与所述待聚类语音对应的当前通用语音向量;

存储当前向量模块,用于将所述当前通用语音向量存储在所述预设声学模型库中,并将所述待聚类语音归类到所述当前通用语音向量对应的聚类类簇中。

8.如权利要求7所述的说话人聚类装置,其特征在于,所述说话人聚类装置还包括:归类聚类类簇模块,用于若所述待聚类语音在所述目标通用语音向量中的语音特征相似度大于预设阈值,则将所述待聚类语音归类到所述目标通用语音向量对应的聚类类簇中。

9.一种计算机设备,包括存储器、处理器以及存储在所述存储器中并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至

6任一项所述说话人聚类方法的步骤。

10.一种计算机可读存储介质,所述计算机可读存储介质存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至6任一项所述说话人聚类方法的步骤。