利索能及
我要发布
收藏
专利号: 2023112449595
申请人: 闽江学院
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,首先将输入数据通过多个并行的主干网络分支,提取水声信号不同层级的特征信息;其次,辅以通道、空间注意力模块对水声信号的通道和空间维度分别进行加权,调节不同通道和空间位置对特征表示的重要性;最后,整合外部注意力模块,以外部记忆单元和附加计算来引导网络的特征提取和预测;所述多个并行的主干网络分支包括多分支主干网络和注意力模块;其中,多分支主干网络由卷积分支、恒等连接和批量归一化层组成,卷积分支的卷积核大小分别为1×1和3×3,在每个分支中,卷积层之后是批量归一化层,其中3×3卷积层用于提取更细节的特征,1×1卷积层用于降低特征的维度并提高计算效率,每个分支提取的特征进行融合和整合,得到更加丰富和完整的特征表示,一方面,多分支主干网络汇总的结果流入注意力机制网络,另一方面,多分支主干网络汇总跳过注意力模块进入下一步操作;

注意力模块包括通道注意模块CAM、空间注意模块SAM和外部注意力模块EAM;通道注意模块CAM和空间注意模块SAM作串行使用,将上一层输出的特征作为通道注意模块CAM的输入,经过通道注意模块CAM后得到的权值,作为空间注意模块SAM的输入,得到新的特征值继续参与模型训练。

2.根据权利要求1所述的一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,输入数据在输入多个并行的主干网络分支前还需进行数据预处理、数据增强操作,即输入数据通过数据预处理操作,去除空白段并切片为时域信号、频域信号和时频域信号,而后进行相应的数据增强后,输入到多个并行的主干网络分支中进行训练。

3.根据权利要求2所述的一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,所述数据预处理具体实现如下:对于时域输入,利用MATLAB将音频文件切片为时域信号,输入数据每个样本的长度为

2048,样本总数从公式(1)中获得,生成样本后,将总样本的80%作为训练集,总样本中的

20%作为测试集;

其中,L是每个信号的长度,N是总样本数,floor是向负无穷方向舍入的意思;

对于频域输入,使用FFT函数将输入数据每个样本xi从时域转换到等式(2)所示的频域,数据长度将减半,新样本表示为:其中,算子FFT(·)表示将xi变换到频域,并取结果的前半部分;

对于时频域输入,对每个样本xi应用短时傅立叶变换STFT,以获得等式(3)所示的时频表示,使用汉宁窗口,窗口长度为64,生成时频表示,如下所示:其中,算子STFT(·)表示将xi变换到时频域。

4.根据权利要求3所述的一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,对于时频域输入,STFT的信号大小调整为330×330,时域和频域输入保持不变。

5.根据权利要求2所述的一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,所述数据增强具体实现如下:一维输入数据增强

RandomAddGaussian:该策略将高斯噪声随机添加到输入信号中,公式如下:x:=x+n (4)

其中x是一维输入信号,n由高斯分布N(0,0.01)生成;

RandomScale:该策略将输入信号与随机因子随机相乘,其公式如下:x:=β*x (5)

其中x是一维输入信号,β是高斯分布N(0,0.01)之后的定标器;

RandomStretch:该策略将信号重采样成随机比例,并通过置零和截断来确保长度相等;

RandomCrop:该策略随机地覆盖部分信号,其公式如下:x:=mask*x (6)

其中x是一维输入信号,mask是随机位置的子序列为零的二进制序列;

二维输入数据增强

RandomScale:该策略将输入信号与随机因子随机相乘,其公式如下:x:=β*x (7)

其中x是二维输入信号,β是高斯分布N(0,0.01)之后的定标器;

RandomCrop:该策略随机地覆盖部分信号,其公式如下:x:=mask*x (8)

其中x是二维输入信号,mask是随机位置的子序列为零的二进制序列。

6.根据权利要求1所述的一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,所述通道注意模块CAM将上一层网络的输出作为通道注意模块CAM的输入H×W×C,经过平均池化层AvgPool和最大池化层MaxPool得到新的特征,如公式(9)所示,输出原始船舶信号中有意义的特征:其中,Mc(F)的大小是F的通道数,即C;F特征的大小为C×H×W,H为高度,W是宽度;MLP为多层感知器操作;σ()表示Sigmoid激活函数;W0为 的矩阵,r为减少因子;W1为 的矩阵, 为平均池化操作后得到的C维全局描述向量, 为最大池化操作后得到的C维全局描述向量。

7.根据权利要求6所述的一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,所述空间注意模块SAM获取通道注意模块CAM特征作为输入,而后在平均池化层AvgPool和最大池化层MaxPool中选择池化层进行池化后再进行卷积,得到在原始船舶信号中需要关注的区域特征的值,如公式(10)所示:

7×7

其中,Ms(F)中F为输入特征图,σ()表示Sigmoid激活函数,f ()表示卷积操作且7×7是卷积核大小, 表示通道维度的全局平均池化, 表示通道维度的最大池化。

8.根据权利要求7所述的一种基于多分主干外部注意力网络的水声信号识别方法,其特征在于,所述外部注意力模块EAM由两个部分组成:一个或多个可学习的查询向量和与输入数据进行比对的外部记忆单元 首先,通过计算查询向量和外部记忆单元中每个记忆向量间的关系,生成注意力权重,接着,将注意力权重利用加权平均或加权池化的方式应用于输入数据的不同维度,以生成新的调节后的特征表征,计算公式如下:T

A= (α)i,j=Norm(F M) (11)

其中:(α)i,j是M的第i个像素和第j行之间的相似性,M是独立于输入的可学习参数,其充当整个训练数据集的存储器, 中,S是一个灵活参数,A是从中学习到的数据集级的先验知识推出的注意力图,Norm()是归一化函数,最后,通过A中的相似性来更新M的输入特征,Fout为更新后的特征;

使用两个不同的存储单元Mk和Mv作为key和value,Norm()是归一化函数,此时,外部注意力模块EAM的计算公式为:T

A=Norm(FMk) (13)

Fout=AMv (14)

采用双归一化,对行和列进行归一化,这种双重归一化表示为: