利索能及
我要发布
收藏
专利号: 2022113435646
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种鸟鸣声分类识别方法,其特征在于,包括如下步骤:获取鸟鸣声音频数据;

对鸟鸣声音频数据进行预处理,得到预处理后的音频数据;

对预处理后的音频数据进行傅里叶变换,得到鸟鸣声的语谱图;

基于梅尔频率倒谱系数和差分运算得到预处理后的音频数据的MFCC混合特征向量;

利用CNN网络处理语谱图,训练后得到局部细粒度频谱特征;

利用Transformer编码器网络处理MFCC混合特征向量,训练后得到兼顾上下文的全局序列特征;

将局部细粒度频谱特征与全局序列特征拼接融合后通过Softmax分类器得到鸟鸣声的识别分类结果。

2.根据权利要求1所述的一种鸟鸣声分类识别方法,其特征在于,对鸟鸣声音频数据进行预处理包括:预加重、分帧加窗。

3.根据权利要求1所述的一种鸟鸣声分类识别方法,其特征在于,基于梅尔频率倒谱系数和差分运算得到预处理后的音频数据的MFCC混合特征向量的方法为:对预处理后的音频数据进行快速傅里叶变换获得功率能量谱;

将功率能量谱输入到梅尔滤波器组中,得到梅尔能量值;

对梅尔能量值取对数并进行离散余弦变换后得到梅尔频率倒谱系数静态分量;

对梅尔频率倒谱系数静态分量进行差分计算,得到一阶差分向量和二阶差分向量;

将梅尔频率倒谱系数静态分量、一阶差分向量和二阶差分向量纵向拼接融合,得到MFCC混合特征向量。

4.根据权利要求1所述的一种鸟鸣声分类识别方法,其特征在于,所述CNN网络的主干为ResNet50网络,网络结构包括第一层卷积层、四组残差模块、全连接层,其中,卷积核大小均设定为3×3,池化层尺寸均设定为2×2×2。

5.根据权利要求1所述的一种鸟鸣声分类识别方法,其特征在于,Transformer编码器网络包括输入层、多头注意力模块、多层感知机模块和输出层。

6.一种鸟鸣声分类识别装置,其特征在于,包括:音频读取模块,用于获取鸟鸣声音频数据;

预处理模块,用于对鸟鸣声音频数据进行预处理,得到预处理后的音频数据;

STFT模块,用于对预处理后的音频数据进行傅里叶变换,得到鸟鸣声的语谱图;

MFCC模块,用于基于梅尔频率倒谱系数和差分运算得到预处理后的音频数据的MFCC混合特征向量;

网络模型训练模块,用于利用CNN网络处理语谱图,训练后得到局部细粒度频谱特征;

利用Transformer编码器网络处理MFCC混合特征向量,训练后得到兼顾上下文的全局序列特征;

分类识别模块,用于将局部细粒度频谱特征与全局序列特征拼接融合后通过Softmax分类器得到鸟鸣声的识别分类结果。

7.根据权利要求6所述的一种鸟鸣声分类识别装置,其特征在于,MFCC模块的操作如下:对预处理后的音频数据进行快速傅里叶变换获得功率能量谱;

将功率能量谱输入到梅尔滤波器组中,得到梅尔能量值;

对梅尔能量值取对数并进行离散余弦变换后得到梅尔频率倒谱系数静态分量;

对梅尔频率倒谱系数静态分量进行差分计算,得到一阶差分向量和二阶差分向量;

将梅尔频率倒谱系数静态分量、一阶差分向量和二阶差分向量纵向拼接融合,得到MFCC混合特征向量。

8.根据权利要求6所述的一种鸟鸣声分类识别装置,其特征在于,在网络模型训练模块中,所述CNN网络的主干为ResNet50网络,网络结构包括第一层卷积层、四组残差模块、全连接层,其中,卷积核大小均设定为3×3,池化层尺寸均设定为2×2×2;Transformer编码器网络包括输入层、多头注意力模块、多层感知机模块和输出层。