1.一种基于区域聚类和特征注意力机制的航拍小目标检测方法,其特征在于,包括以下步骤:
步骤1:从公开的航拍图像目标检测数据集VisDrone中获取输入图像,并将其输入到以残差网络为主干特征提取网络、特征金字塔网络FPN为颈部融合网络的视网膜检测网络RetinaNet中进行特征提取得到粗略的候选目标信息;
步骤2:利用基于密度的聚类算法DBSCAN对步骤1中提取的粗略的候选目标信息进行计算,将密集的目标进行聚类,裁剪出目标聚集区域并对其进行中心填充处理进行尺度缩放,裁剪的图像作为新的输入从而扩充原始数据集,得到扩充后的数据集命名为VisDrone‑E;
步骤3:在RetinaNet算法的基础上,使用以下改进来构建新的特征增强视网膜检测网络FS‑RetinaNet检测模型;(1)在特征金字塔网络的最高层构建级联的膨胀卷积层提取充分的上下文信息;(2)使用基于注意力机制的检测头替换原始的检测头使得分类任务和回归任务更具有针对性;
步骤4:使用步骤2中的VisDrone‑E训练步骤3中改进后的FS‑RetinaNet用于检测小目标;
步骤5:将步骤4中训练好的模型权重传入测试网络中,以VisDrone作为测试输入,对目标的边界框和类别信息进行预测;
步骤6:使用非极大抑制NMS进行后处理去除冗余的检测框,用于减少误检或重复检测;
所述步骤3在特征金字塔网络的最高层构建级联的膨胀卷积层提取充分的上下文信息,具体为:
首先,提出了一个由级联的膨胀卷积层构成的上下文信息增强模块CIEM,将其添加在FPN的最高特征层次的横向连接处以缓解小目标信息丢失问题;膨胀卷积层的输出定义为Di=DilatedConvd_rate(Conv1×1_512(Xi)),其中,Xi表示前一层膨胀卷积层的输出与之前所有层的输出在通道维度上拼接后的结果,即 Xori表示特征金字塔最高层的原始输入特征图,Conv1×1_512表示对Xi进行1×1的卷积将其通道数改变为
512,DilatedConvd_rate表示按照d_rate的膨胀率对输入特征图进行膨胀卷积并将其通道数调整为256;此外,为了让输出特征具有更好的尺度多样性,将Xori进行缩放得到XD,然后通过双线性插值法将XD上采样到原始输入大小得到特征图XU,并且利用1×1的卷积将其通道数压缩到256;最后将XU与Di(i=1,2,…5)进行拼接,再通过1×1的卷积融合各层次间的信息得到输出XE,XE=Conv1×1(D1||D2||D3||D4||D5||XU);为了保持初始输入的有效信息,将经过CIEM后输出的特征图XE与经过了1×1卷积后的原始特征图相加作为最终的输出结果至此,便得到了融合了粗粒度和细粒度特征且具有丰富上下文语义信息的最高层特征图;
所述步骤3使用基于注意力机制的检测头替换原始的检测头使得分类任务和回归任务更具有针对性,具体包括:
用基于注意力机制的检测头替换原始的检测头;在分类子网络和回归子网络之前分别添加一个注意力模块,使其自适应地按照不同的任务需求选择更匹配任务目标的特征;注意力模块的具体实现如下:Ai=σ(φ(Xin)),Fi=Ai⊙Xin+Xin,其中,Xin表示输入的待测特征图,φ(Xin)表示在Xin上执行四层3×3的卷积操作,σ是sigmoid函数,它将φ(Xin)的值转换为[0,1]之间的值,以便它在训练期间更快地收敛;然后将注意力模块的输出值Ai和Xin相应元素相乘的结果添加到Xin中;乘法运算可以使Xin中的有用信息值增大,无用信息值减小,加法运算是利用残差网络的思想,使网络更快地收敛,这种设计可以使网络自适应地选择适合分类或回归的特征;最终得到增强后的输出特征图Fi。
2.根据权利要求1所述的基于区域聚类和特征注意力机制的航拍小目标检测方法,其特征在于,所述步骤1:从公开航拍图像目标检测数据集VisDrone中获取输入图像;将其输入RetinaNet中进行特征提取得到粗略的候选目标信息,具体为:使用可直接回归出物体的类别概率和位置坐标值的端到端的检测网络RetinaNet来提取图像中的候选目标,获得目标的边界框坐标信息,从检测到的边界框中提取每个目标的中心坐标作为DBSCAN聚类算法的输入特征。
3.根据权利要求1所述的基于区域聚类和特征注意力机制的航拍小目标检测方法,其特征在于,所述步骤2:利用DBSCAN聚类算法对步骤1中提取的粗略的候选目标信息进行计算,将密集的目标进行聚类,裁剪出目标聚集区域并对其进行中心填充处理进行尺度缩放,裁剪的图像作为新的输入从而扩充原始数据集,得到扩充后的数据集命名为VisDrone‑E,具体为:采用DBSCAN聚类算法对目标聚集区域进行识别;DBSCAN聚类算法的输入是目标的位置坐标,它将根据距离和密度来判断哪些目标属于同一聚集区域;通过设置领域半径eps和最小点数min_samples来确定数据点是否属于同一簇,从任意一个点开始,如果它的领域内包含至少min_samples个点,那么将其标记为一个簇的核心点;如果一个点是核心点,那么它的领域内的所有点都会被分配到该簇中,然后继续扩展这些领域,直到没有更多的点可以加入为止;如果一个点的邻域内没有足够多的点,且它也不是任何簇的领域内的点,那么它就被标记为噪声点;通过不断扩展簇,直到所有点都被标记为簇的一部分或噪声;完成聚类后,为每一个簇计算一个边界框,并根据该边界框从图像中裁剪出对应的聚集区域;边界框的具体计算过程为:对于每个聚类,计算包含该簇中所有目标的最小外接矩形,以该矩形为依据进行裁剪,将边界框扩展10个像素;最后,保存裁剪后的目标区域并将其与原始数据集合并得到新的扩充数据集VisDrone‑E。
4.根据权利要求1所述的基于区域聚类和特征注意力机制的航拍小目标检测方法,其特征在于,所述步骤5:将步骤4中训练好的模型权重传入测试网络中,以VisDrone作为测试输入,对目标的边界框和类别信息进行预测,具体为:扩充后的数据集VisDrone‑E仅用于训练检测网络,在测试阶段使用原始的数据集VisDrone,这样有助于提高模型的泛化能力和鲁棒性。
5.一种电子设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现如权利要求1至4任一项所述基于区域聚类和特征注意力机制的航拍小目标检测方法。
6.一种非暂态计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至4任一项所述基于区域聚类和特征注意力机制的航拍小目标检测方法。
7.一种计算机程序产品,包括计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至4任一项所述基于区域聚类和特征注意力机制的航拍小目标检测方法。