利索能及
我要发布
收藏
专利号: 2023109809133
申请人: 中国信息通信研究院
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于特定人音频的表征构建方法,其特征在于,所述方法包括以下步骤:步骤S100、获取特定人音频数据中的人声数据与环境数据;

步骤S200、构建人声分析模型,对人声数据进行分析并生成人声分析系数;

步骤S300、对所述人声数据与环境数据进行组合分析,生成环境分析系数;

步骤S400、将人声分析系数和环境分析系数进行整合处理,对所述特定人音频音频数据进行表征参数的生成;

步骤S500、对表征参数进行阈值分析,通过分析结果对所述特定人音频进行表征标记。

2.根据权利要求1所述的一种基于特定人音频的表征构建方法,其特征在于,所述人声数据包括人声语速变化率和语调变化幅度,语速变化率反映了音频中说话者语速的变化程度,语速变化率越大,对应的特定人音频合成程度越低,语调变化幅度是指声音的高低频率,同时表示说话者在音频中的语调变化程度,语调变化幅度越大,对应的特定人音频的合成程度越低。

3.根据权利要求2所述的一种基于特定人音频的表征构建方法,其特征在于,所述环境数据包括环境音强度变化率和环境音声音频率变化率,所述环境音强度变化率表示音频中环境音的声音强度的变化程度,环境音强度变化率越大,对应的特定人音频在进行合成音频鉴定时的影响程度越大,环境音声音频率变化率表示音频中环境音的声音频率变化程度,声音频率变化程度越大,对应的特定人音频在进行是否为合成音频鉴定时的影响程度越大。

4.根据权利要求3所述的一种基于特定人音频的表征构建方法,其特征在于,所述人声分析模型的构建步骤包括:使用合适的麦克风或录音设备采集特定人的音频数据和环境音数据;

对音频数据进行预处理,使用音频信号处理算法和工具去除背景噪声、降噪、音频增强处理;

提取语速变化率:可以通过计算音频的时长和语速之间的比例来得到语速变化率;

提取语调变化幅度:使用基频估计算法,基于自相关函数的方法,来计算音频中的基频变化;

提取环境音强度变化率:通过音频信号处理方法来估计环境音强度的变化率,对音频进行分帧处理,然后计算每帧音频的能量变化率;

提取环境音频率变化率:使用频谱分析算法,如短时傅里叶变换,来估计环境音频频率的变化率;

对提取的人声语速变化率和语调变化幅度的特征进行归一化处理,生成人声分析系数;

对提取的环境音强度变化率和环境音声音频率变化率的特征进行归一化和加权处理,生成环境分析系数;

将人声分析系数和环境分析系数进行组合分析,使用加权平均、逻辑运算等方法来整合人声和环境分析结果,生成表征参数;

设定阈值或门限值,将表征参数与阈值进行比较,判断特定人音频的真伪。

5.根据权利要求4所述的一种基于特定人音频的表征构建方法,其特征在于,生成人声分析系数的步骤包括:将特定人音频分为L个鉴定区间,获取单个鉴定区间的人声语速变化率v和语调变化幅度h,对单个鉴定区间的人声语速变化率v与语调变化幅度h进行相加并开根,将开根后的结果取绝对值并除以误差修正常数K,从而获得人声分析系数α;

其中,K与α皆大于0,人声分析系数α的数值越大,特定人音频中的人声表述时的情绪波动越大,语言的表述更趋向于人为述说,真实度越高,合成的概率越低,反之,人声分析系数α的数值越低,特定人音频中的人声表述时的情绪波动较小,语言表述更为机械化,真实度较低,合成的概率越高。

6.根据权利要求5所述的一种基于特定人音频的表征构建方法,其特征在于,生成环境分析系数的步骤包括:获取同步骤S200相同单个鉴定区间内的环境音强度变化率q和环境音声音频率变化率p,对所述单个鉴定区间内的环境音强度变化率q和环境音声音频率变化率p进行加权分析,对加权分析结果进行平方处理,并乘以误差弥补常数 计算获取环境分析系数γ;

其中,权重参数m1+m2=2.1325,权重参数m1大于权重参数m2,当环境分析系数γ越大时,环境音的影响越大,对音频进行鉴定处理的影响也会越大;反之,环境分析系数γ越小时,环境音的影响越小,对音频进行鉴定处理的影响也会越小。

7.根据权利要求6所述的一种基于特定人音频的表征构建方法,其特征在于,对所述人声分析系数和环境分析系数进行整合处理的步骤包括:将单个区间内的人声分析系数α和环境分析系数γ进行参数分析,通过人声分析系数α除以环境分析系数γ的立方根并加上人声分析系数α乘以环境分析系数γ的倒数,从而获得表征参数β;

表征参数β越大,表示人声分析系数α的计算占比越大,相应的真实度越高,且在此情况下的环境影响效果相比于特定人音频中的人声影响效果更弱;反之,表征参数β越小,表示人声分析系数α的计算占比越小,相应的真实度越低,且在此情况下的环境影响效果相比于特定人音频中的人声影响效果更强。

8.根据权利要求7所述的一种基于特定人音频的表征构建方法,其特征在于,对所述表征参数进行阈值分析并进行表征特征标记流程为:设置表征参数比对阈值SH1和SH2,其中,表征参数比对阈值SH1大于表征参数比对阈值SH2,将表征参数β代入表征参数比对阈值SH1和SH2中进行比较,若表征参数β小于表征参数比对阈值SH2,对该特定人音频进行虚假表征参数标记;

将表征参数β代入表征参数比对阈值SH1和SH2中进行比较,若表征参数β小于表征参数比对阈值SH1且表征参数β大于表征参数比对阈值SH2,对该特定人音频进行可疑表征参数标记;

将表征参数β代入表征参数比对阈值SH1和SH2中进行比较,若表征参数β大于表征参数比对阈值SH1,对该特定人音频进行真实表征参数标记。