利索能及
我要发布
收藏
专利号: 2021114000261
申请人: 北京影创信息科技有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-12
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种语音实时驱动虚拟人的方法,其特征在于,包括以下步骤:获取人脸RGB图像;

对人脸RGB图像进行3D人脸重建,得到人脸RGB图像对应的3D人脸参数;

预采集一段语音并经去噪处理后保存至缓存队列中;

实时采集语音片段并经去噪处理后保存至缓存队列中;

读取缓存队列中的所有语音片段并进行拼接,得到拼接后的语音片段,并利用拼接后的语音片段和预训练的神经网络得到预测的3D人脸表情参数;

根据预测的3D人脸表情参数和3D人脸参数得到渲染后的RGB图像。

2.根据权利要求1所述的语音实时驱动虚拟人的方法,其特征在于,所述对人脸RGB图像进行3D人脸重建,得到人脸RGB图像对应的3D人脸参数的过程为:采用多任务卷积神经网络对人脸RGB图像进行人脸识别,并根据人脸检测框对人脸RGB图像进行裁剪,得到裁剪后的人脸图像;

采用人脸重建方法DECA对裁剪后的人脸图像进行3D人脸重建,其过程为:通过DECA将人脸RGB图像拟合到人脸参数化模型FLAME上,得到257维的特定于当前图像的一组3D人脸参数 ;其中, 表示FLAME模型的身份参数, 表示FLAME模型的表情参数, 表示FLAME模型的光照参数, 表示FLAME模型的纹理参数, 表示FLAME模型的姿态变换参数, 表示257维的向量。

3.根据权利要求1所述的语音实时驱动虚拟人的方法,其特征在于,所述预采集一段语音并经去噪处理后保存至缓存队列中的具体过程为:通过语音采集设备预采集一段语音,得到带噪的语音片段;

采用谱减法去除带噪的语音片段中的加性噪声,得到去噪的语音片段;

将去噪的语音片段添加到预设长度的缓存队列中。

4.根据权利要求3所述的语音实时驱动虚拟人的方法,其特征在于,所述实时采集语音片段并经去噪处理后保存至缓存队列中的具体过程为:通过语音采集设备实时采集语音片段;

采用谱减法去除实时采集的带噪的语音片段中的加性噪声,得到去噪的语音片段;

计算缓存队列的长度,并根据缓存队列的长度与预设的缓存队列的最大长度的比较结果更新缓存队列,其过程为:

判断缓存队列的长度是否超过预设的缓存队列的最大长度,如果是,则将缓存队列中的队首元素移除,将实时采集的语音片段添加到缓存队列中;其中,缓存队列中的队首元素即相较于当前时间最早的元素。

5.根据权利要求4所述的语音实时驱动虚拟人的方法,其特征在于,所述读取缓存队列中的所有语音片段并进行拼接,得到拼接后的语音片段,并利用拼接后的语音片段和预训练的神经网络得到预测的3D人脸表情参数的具体过程为:读取缓存队列中的所有语音片段并进行拼接,得到拼接后的语音片段;

利用开源音频处理工具librosa提取拼接后的语音片段的语音MFCC特征;

使用预训练的神经网络将得到的语音MFCC特征映射到3D人脸模型的表情子空间,得到预测的3D人脸表情参数。

6.根据权利要求5所述的语音实时驱动虚拟人的方法,其特征在于,所述预训练的神经网络的训练过程为:

选取一段时长为t时间的人物说话视频,其中,需要人物的面部在视频中始终保持完整;

获取训练数据,其中训练数据包括3D人脸参数和语音MFCC特征;

利用训练数据搭建并训练神经网络。

7.根据权利要求6所述的语音实时驱动虚拟人的方法,其特征在于,所述获取训练数据的具体过程为:

利用视频处理工具ffmpeg提取人物说话视频中的图像流和语音流,其中,图像流以

25fps以上截取图像,共得到数千帧图像;将语音流单独保存成.aac格式的音频文件;

针对每一帧图像,使用多任务卷积神经网络对人脸RGB图像进行人脸识别,并根据人脸检测框将RGB图像进行裁剪;采用人脸重建方法DECA对裁剪后的人脸图像进行3D人脸重建,得到3D人脸参数并保存;

对于音频文件,利用开源音频处理工具librosa提取音频文件的13维的语音MFCC特征。

8.根据权利要求6所述的语音实时驱动虚拟人的方法,其特征在于,所述神经网络包括AT‑Net网络和audio2exp网络,所述AT‑Net网络为骨干网络,其用于提取音频的时序性特征;audio2exp网络为特征映射网络,其用于将AT‑Net网络输出的隐变量映射到特定3D人脸模型的参数空间上。

9.一种语音实时驱动虚拟人的系统,其特征在于,包括图像获取模块、图像重建模块、预采集语音处理模块、实时语音处理模块、语音拼接模块和3D渲染模块;

所述图像获取模块,用于获取人脸RGB图像;

所述图像重建模块,用于采用3D人脸模型对人脸RGB图像进行重建,得到人脸RGB图像对应的3D人脸参数;

所述预采集语音处理模块,用于预采集一段语音并进行去噪处理后保存至缓存队列中;

所述实时语音处理模块,用于实时采集语音片段并进行去噪处理后保存至缓存队列中;

所述语音拼接模块,用于读取缓存队列中的所有语音片段并进行拼接,得到拼接后的语音片段,并利用拼接后的语音片段和预训练的神经网络得到预测的3D人脸表情参数;

所述3D渲染模块,用于根据预测的3D人脸表情参数和3D人脸参数得到渲染后的RGB图像。

10.一种存储介质,其特征在于,存储有可执行程序,当可执行程序被调用时,执行如权利要求1‑8任一项所述的语音实时驱动虚拟人的方法。