利索能及
我要发布
收藏
专利号: 202410740827X
申请人: 西安邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于多层注意力融合的小目标检测方法,其特征在于,包括以下操作:

1)构建由骨干网络、颈部网络和检测头组成的卷积神经网络,并将其与多层注意力融合模块组成模型;其中,骨干网络对输入的图像降维,捕捉到图像中包括纹理特征、边缘特征和色彩特征在内的特征,输出多尺度的特征图;

所述多层注意力融合模块,使用空间位置信息跨越多层提取不同尺度的特征图,分别提取注意力权重得到注意力权重特征图,提取出待检测目标的定位信息;然后将这些得到的注意力权重特征图上采样为最大尺寸的注意力权重特征图,再进行最大池化操作实现融合,得到融合注意力权重图;将融合注意力权重图与需要通过注意力的特征图相乘,得到融合了多层注意力的输出特征图;

多层注意力融合模块提取注意力权重为:

将输入特征图分别沿宽方向和高方向进行平均池化,得到两个一维特征图,将其全连接后经过卷积操作再解连接,分别进行一次卷积操作后再通过sigmod激活函数进行激活,得到注意力权重;将注意力权重作用在输入特征图上得到注意力权重特征图;

所述颈部网络采用特征金字塔结构,将来自不同网络深度中提取的不同尺度的特征图、融合了多层注意力的输出特征图进行融合,并将融合结果输出至检测头;

所述检测头输出目标检测的结果信息,生成边界框和置信度信息,以确定图像中存在的小目标;

2)对模型输入包含小目标的图像数据集进行训练,对小目标进行识别,并对每个目标生成一个边界框进行标注,标注信息包含类别信息、置信度和位置;

3)根据生成的边界框评估模型的性能,通过多轮迭代训练对模型进行优化;

每一轮迭代中,将训练数据输入模型,并根据生成的边界框与真实标注进行比较,计算损失函数;然后通过反向传播算法,将损失信号从输出层传递回模型,更新模型的参数;

重复进行多轮迭代训练,逐渐降低损失函数的值,提高平均精度和召回率,得到优化后的模型;

4)利用优化后的模型对图像中的小目标进行检测。

2.如权利要求1所述基于多层注意力融合的小目标检测方法,其特征在于,卷积神经网络中,分别以 和 三个尺度特征图设置了三个不同尺度的检测头,以进行目标检测。

3.如权利要求1所述基于多层注意力融合的小目标检测方法,其特征在于,是通过三个不同尺度的特征图用来生成三个不同的注意力权重特征图,进行尺度变换、池化融合后得到融合注意力权重图;然后与需要通过注意力的特征图相乘,得到融合了多层注意力后的输出特征图。

4.如权利要求1所述基于多层注意力融合的小目标检测方法,其特征在于,对尺寸为的特征图的注意力权重提取为:对特征图分别沿宽方向和高方向进行平均池化,得到尺寸分别为

的两个一维的特征图;

然后将生成的特征图进行全连接,并使用 的卷积核进行二维卷积操作,生成特征图 其中,f代表特征图矩阵,r表示下采样比例;C、H、W分别为通道数、输入特征图的高、输入特征图的宽,R代表特征图是由实数组成的;将特征图进行归一化之后解除全连接,通过 的卷积核进行二维卷积,将特征图分割为沿H方向的特征图 和沿W方向的特征图 分别使用

sigmod激活函数激活得到最终的注意力权重 将此注意

力权重作用在输入特征图 上得到通过注意力的注意力权重特征图其中 代表沿高方向得到的注意力权重, 代

表沿宽方向得到的注意力权重。

5.如权利要求1所述基于多层注意力融合的小目标检测方法,其特征在于,模型的训练集和测试集均选用自然光下的飞鸟小目标数据集;该数据集中存在密集且尺寸小的自然光下的飞鸟小目标图像。