利索能及
我要发布
收藏
专利号: 2020109206081
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述方法包括训练过程和检测过程,所述训练过程如下:

1.1、输入图片,生成图像块;

1.2、筛选正图像块;

1.3、筛选负图像块;

1.4、输入图像块,训练模型;

所述检测过程如下:

2.1、预测焦点像素集;

2.2、生成焦点图像块;

2.3、RoI阶段;

2.4、分类和回归;

2.5、焦点合成。

2.如权利要求1所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述1.1中,所述图像块是指在任一尺度下,某图片上一系列固定大小的(K*K像素)以恒定间隔(d像素)排布的窗口,每个窗口都可能包含一个或几个目标,在尺度{S1,S2,…,Sn}下生成的图像块记作Ci,其中Sn表示第n个尺度。

3.如权利要求1或2所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述1.2中,图像的正确的标注框ground-truth boxes随着图像尺度的变化进行对应的缩放,因此对于每一个尺度i,需要指定理想检测面积为 i∈[1,n],分别表示理想检测面积的最小值与最大值,若某个ground-truth boxes完全位于一个图像块内,则该ground-truth boxes被图像块包围;采用贪心算法,根据图像块包围的ground-truth boxes数量,从每个尺度i中筛选图像块作为正图像块,记作 其中贪心算法是一种每一步选择上都要保证能获得局部最优解的算法。

4.如权利要求3所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述1.3包括以下步骤:步骤1.3.1使用步骤1.2中筛选得到的正图像块训练一个仅有几个epochs的RPN,epochs指代所有的数据送入网络中完成一次前向计算及反向传播的过程,其中RPN是在Faster RCNN中首次提出的深度全卷积网络,该RPN仅用来选择负图像块,因此即使精度不高也几乎不会对模型最终性能产生影响;

步骤1.3.2使用该RPN检测整个训练集,根据检测结果选择负图像块,选择过程如下:a)排除所有被正图像块 包围的区域提议Region proposals,区域提议指最有可能为目标的区域;

b)在每个尺度i下使用贪心算法选择至少包含M个区域提议的图像组成负图像块池;

步骤1.3.3训练时从负图像块池中以固定数量随机选择参与训练的负图像块,表示为其中∪表示的是负图像块全集,neg指的是negative, 指尺度i下的负图像块。

5.如权利要求1或2所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述1.4包括以下步骤:步骤1.4.1使用ImageNe初始化共享的卷积层,包括kernel(卷积核的尺寸)、stride(卷积步长)、padding(输入的每一条边补充0的层数)、dilation(卷积核元素之间的间距)、group(从输入通道到输出通道的阻塞连接数)、bias(偏置)、in_channels(输入信号的通道)、out_channels(输出信号的通道)参数,初始化RPN网络中卷积核部分,通过步骤三中筛选出的正负图像块训练RPN,训练之后,共享的卷积层以及RPN的边框回归(Bounding-box regression)函数被更新,边框回归函数指的是一种关系使得输入的原始窗口P经过映射得到一个跟ground-truth box更接近的回归窗口P1,该函数通过梯度下降法(一种寻找目标函数最小化的方法)实现参数的更新;

步骤1.4.2用ImageNet重新初始化共享的卷积层,初始化Fast-RCNN网络的池化层以及卷积层,通过使用训练过的RPN计算得到区域提议,计算步骤包括使用滑动窗口机制生成区域提议,并进行分类与回归,再将生成的区域提议重新训练Fast-RCNN,根据步骤1.4.1设置的参数,重复步骤1.4.1,训练结束之后,共享的卷积层以及Fast-RCNN的权重参数都会被更新;

步骤1.4.3使用步骤4.2中训练完成的共享卷积层初始化RPN网络,随后,第二次训练RPN网络,通过初始化后的RPN网络计算得到区域提议,计算步骤与步骤1.4.2相同,训练结束之后,RPN中边框回归函数被更新;

步骤1.4.4保持步骤1.4.3中的共享卷积层不变,再次训练Fast-RCNN网络,计算步骤与步骤1.4.2相同,训练完毕,得到最终的一个统一网络。

6.如权利要求1或2所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述2.1中,焦点像素集位于卷积神经网络特征图(feature map)的粒度之上,由带ReLU的两层卷积层(3*3和1*1)以及一个二分类器softmax组成,特征图上某个与小目标重叠的像素记为焦点像素,对于输入的面积为X*Y的图片,经过一个步长为s的全卷积神经网络(FCN,FullConvolutionalNetworks),得到一个特征图标签集L的大小为X′*Y′X′与Y′分别代表经过全卷积神经网络后输出的特征图标签集的长和宽,对每一个大小为s*s的标签l(l∈L),作如下的定义:

其中,1代表标注正,0代表标注负,-1表示无效,GTArea表示实际边界框经过缩放后的面积,即ground-truth boxes区域面积,其中a、b、c皆为判定的阈值,IoU为重叠度,即两个矩形框重叠面积占其并集的面积比例;

在训练时,焦点像素集标注为正,忽略与极小目标、中等目标重叠的像素,其他像素标注为负,同时,同一目标的标记可能随着训练尺度的变化而发生改变。

7.如权利要求1或2所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述2.2中,由于存在某在图像块面积过小,缺少检测的必要信息,为了保证检测效率,需要指定图像块最小面积为k,输入为预测分支输出的焦点像素集预测结果P、设定的阈值t、膨胀系数d以及图像块最小面积k,焦点图像块生成算法的步骤如下:步骤2.2.1用阈值t将P二值化;

步骤2.2.2使用d*d的过滤器对P进行膨胀操作;

步骤2.2.3从P中获得连通域集合S;

步骤2.2.4对每个在S中的连通域,生成多个最小面积大于k的图像块C;

步骤2.2.5合并重叠的图像块C;

基于焦点图像块,级联推断过程如下:

a)在最低分辨率检测并生成焦点图像块;

b)在当前最低分辨率图像块上检测,并进一步生成下一尺度的焦点图像块c)重复步骤b,仅将可能存在目标的区域即焦点图像块传递给下一尺度检测。

8.如权利要求1或2所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述2.3中,ROI指的是从目标图像中识别出的候选识别区域,也就是步骤二中生成的焦点图像块,ROI Pooling的作用是把大小形状各不相同的候选识别区域归一化为固定尺寸的目标识别区域,不同于CNN网络中的池化层,ROI Pooling通过如下的方法得到固定尺寸的输出,过程如下:步骤3.1对于ROI Pooling层,首先确定输出大小,然后确定内核大小、步幅和填充值,将ROI Pooling层的输出大小表示为w2*h2,输入候选区域的大小为w*h;

步骤3.2将步骤二的焦点图像块划分为w2*h2大小的子窗口,每个窗口的大小为步骤3.3对步骤3.1中每个子窗口取最大元素作为输出,从而得到大小为w2*h2的输出。

9.如权利要求1或2所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述2.4中,将步骤2.2生成的焦点图像块送入全连接层;焦点图像块经过softmax层被分类成具体目标对象,其位置(ground-truth boxes)所在坐标在regression层中进行优化,其中softmax层的作用为将分类结果进行归一化,regression层则修正区域提议边框的位置,通过上述优化使得(Px,Py,Pw,Ph)(输入的区域提议的边框)与(Gx,Gy,Gw,Gh)(Ground Truth box)尽可能得接近,其中(x,y)为边框的中心位置,(w,h)表示边框的宽和高,中心位置通过平移的方式进行修正,边框的宽和高则通过缩放进行修正;

在训练网络的时候同时对候选区域进行一个分类与回归,Softmax损失函数用于对区域提议的分类,smooth L1损失函数用于区域提议边界的回归,损失函数如下所示:其中, 为Softmax损失函数, 为smooth L1损失函

数,Ncls和Nreg分别表示训练时候批处理数量和区域提议框的数量,λ表示损失权衡函数,ai表示预测一个候选框是否为目标的可能性, 表示其真实值,ti表示预测一个区域提议和真实值之间的相对位移, 表示预测的区域提议中心位置相对位移值,表示预测的区域提议长度相对差值, 表示一个区域提议和真实值之间得坐标转换,这个坐标转换通过如下的公式进行计算:其中,δci表示真实的区域提议中心位置相对位移值,δli表示真实的区域提议长度相对差值,ci和li表示区域提议的中心位置和长度, 和 表示该区域提议的真实值。

10.如权利要求1或2所述的一种基于深度学习的高性能多尺度目标检测方法,其特征在于,所述2.5中,步骤2.2中使用d*d的过滤器对P进行膨胀操作可以有效避免应在下一尺度检测的物体出现在焦点图像块的边界上,因此可以忽略所有出现在图像块边界上的检测框;对其他位置的目标,有如下规则:对于处在原图边界上的目标,则检查其是否整体位于某图像块中,如果整体位于某图像块中,保留其检测结果,否则忽略,检测过程的最后,使用非极大值抑制方法合并各尺度检测结果,获得最终结果。