1.一种基于主辅两路时空特征融合的音乐分类方法,其特征在于:所述基于主辅两路时空特征融合的音乐分类方法,包括如下步骤:S1、获取用于训练的音频数据及其标签,对用于训练的音频数据进行去噪处理,并切割成片段,提取出梅尔频谱图;
S2、构建深度学习网络,所述深度学习网络包括主辅两路及融合操作,主路是时空注意网络,辅路是预训练网络,将主辅两路的分类结果进行融合得到训练结果;
S3、将用于训练的音频数据的梅尔频谱图依次输入到深度学习网络中,计算深度学习网络输出的训练结果与其标签的差异,从而反向传播对深度学习网络的参数进行更新;
S4、获取待处理的音频数据,对待处理的音频数据进行去噪处理,并切割成片段,提取出梅尔频谱图;
S5、将待处理的音频数据的梅尔频谱图输入到深度学习网络中,分别从时空注意网络和预训练网络中得到分类结果,通过融合得到最终结果;
其中,所述时空注意网络包括一个空间网络Densenet、一个时间网络LSTM和两个全连接层,并执行如下操作:将梅尔频谱图输入到空间网络Densenet,提取出空间特征向量;
将梅尔频谱图输入到时间网络LSTM,提取出时间特征向量;
将空间特征向量和时间特征向量进行点积得到时空注意权重W;
时空注意权重W与时间特征向量进行点积再通过两个全连接层,获得时空注意网络的分类结果。
2.根据权利要求1所述的基于主辅两路时空特征融合的音乐分类方法,其特征在于:所述空间网络Densenet包括依次连接的卷积层、池化层、第一Dense Block层、第一Transition Layer层、第二Dense Block层、第二Transition Layer层、第三Dense Block层、第三Transition Layer层、第四Dense Block层和全局池化层。
3.根据权利要求2所述的基于主辅两路时空特征融合的音乐分类方法,其特征在于:输入主路和辅路的梅尔频谱图尺寸为224*224,所述卷积层、池化层、第一Dense Block层、第一Transition Layer层、第二Dense Block层、第二Transition Layer层、第三Dense Block层、第三Transition Layer层、第四Dense Block层和全局池化层的输出特征图尺寸依次对应为112*112、56*56、56*56、28*28、28*28、14*14、14*14、7*7、7*7、1*1。
4.根据权利要求3所述的基于主辅两路时空特征融合的音乐分类方法,其特征在于:所述卷积层的滤波器尺寸为7*7、步长为2,所述池化层的池化核尺寸为3*3、步长为2,所述全局池化层的池化核尺寸为7*7。
5.根据权利要求1所述的基于主辅两路时空特征融合的音乐分类方法,其特征在于:所述预训练网络包括一个Resnet网络和两个全连接层。
6.根据权利要求1所述的基于主辅两路时空特征融合的音乐分类方法,其特征在于:所述计算深度学习网络输出的训练结果与其标签的差异的方式为交叉熵损失函数。
7.根据权利要求1所述的基于主辅两路时空特征融合的音乐分类方法,其特征在于:所述融合为决策级融合,并且时空注意网络的分类结果和预训练网络的分类结果融合比例为
6.5:3.5。