1.一种基于孪生网络的多尺度目标感知跟踪方法,其特征在于,所述方法包括以下步骤:S1.精细的特征聚合,过程如下:
S1.1根据视频序列第一帧获得的图片I1和目标的包围框信息B1,进行切片和变形获得跟踪模板Z1,在后续跟踪过程中,根据上一帧的跟踪结果Bi‑1,对输入的图片Ii,i∈[2,n]进行切片和变形获得搜索图片Xi;
S1.2将获得的跟踪模板Z1和搜索图片Xi输入预训练好的深度残差网络“ResNet‑50”,获得深度特征 和 模型会收集深度残差网络后三层CONV3,CONV4,CONV5输出的特征获得模板特征 和搜索特征S1.3将模板特征 分解成h×w个子卷积核 然后,将每个子卷积核与搜索特征 进行基础相关naive‑correlation后按通道进行连结,数学表达式如下:其中,*表示基础相关计算,最后,将获得的特征 和 两两进行像素级相关pixel‑wise correlation后按通道连结;
S2.注意力处理过程如下:
C C
S2.1将相关特征R输入通道注意力模块SENet中,首先,将相关特征R每一层的特征图通过全局平均池化层压缩成一条向量;
C
其中H和W是相关特征R 高和宽,然后将向量输入一个两层的多层感知机,最后,使用sigmoid函数将通道注意力权重映射到0‑1区间,数学表达式如下:其中, 和 是两个全连接层,σ表示sigmoid激活函数,Ac是获得的通C C
道注意力权值,将通道注意力权值A与相关特征R逐通道进行元素间的相乘:其中⊙表示扩展的元素方式乘法;
S2.2利用非局部注意力Non‑Local attention来聚合全局上下文信息,首先将特征输入三个并行1X1卷积层(θ,φ,g)降低特征通道数,获得三个特征Xθ,Xφ,Xg后进行变形操作获得 最后,通过矩阵乘法和softmax函数计算特征不同位置之间的响应值,数学表达式如下:
其中, 表示矩阵乘法,然后再将ANL与 矩阵乘法后通过一个1X1层卷积层 恢复通道数,最后原始特征 相加完成非局部注意力的优化过程:其中, 表示元素间的求和, 与 的尺寸一直,r1和r2都设置为1;
S3多尺度对象感知,过程如下:
A
S3.1将相关特征R 并行输入三个相似的卷积模块Φa,b,(a,b)∈{(7,7),(7,13),(13,A
7)},然后将获得的三个特征Φa,b(R),(a,b)∈{(7,7),(7,13),(13,7)}按比例线性相加;
其中,a和b表示该卷积模块的总卷积核尺寸,XMOP是聚合多尺度对象信息后的特征,αa,b是与网络一起训练的超参数;为了降低算力负担,分别使用串联的三个小卷积层kernel size=(3,3),stride=1,padding=(0,0)表示Φ7,7,串联的三个小卷积层kernel size=(3,5),stride=1,padding=(0,1)表示Φ7,13,串联的三个小卷积层kernel size=(5,3),stride=1,padding=(1,1)表示Φ13,7,如此,这三个卷积模块分别具有不同的宽高比的卷积感受野;
S4无锚预测过程如下:
S4.1将XMOP分别输入分类分支和边框回归分支,获得分类预测结果 预测的是搜索区域中固定位置(pi,pj)中包含目标的概率和不包含目标的概率;
其中wim,him和s分别表示搜索图片的宽和高以及ResNet的总步长,这里的w=h=25,wim=him=255,s=8,边框回归分支预测结果为 预测的是固定区域中心点到四个边框的距离;
l=pi‑x0,t=pj‑y0,r=x1‑pi,b=y1‑,pj其中,(x0,y0)和(x1,y1)分别表示目标包围框的左上和右下两个角点的坐标;
Cls Reg
S4.2找到p 中最大的正样本响应位置后,去p 中查找包围框结果,最终获得目标跟踪结果。
2.如权利要求1所述的一种基于孪生网络的多尺度目标感知跟踪方法,其特征在于,所述方法还包括以下步骤:S5训练流程如下;
S5.1对训练数据集进行预处理,选取视频序列中间隔为T的两帧,根据标注信息,依照S1.1的方法裁切模板图片和搜索图片到127×127和255×255尺寸;
S5.2样本标签选取,依照大小不同的两个椭圆来分配正样本(1)、负样本(0)和忽视样本(‑1),数学公式如下:其中,(pi,pj)是搜索图中固定锚点的位置, 表示搜索图中目标的中心点和宽高;
S5.3依次经过S1‑S4.1后,分类损失LCls和回归损失LReg分别是交叉熵损失和线性IOU,其中LCls定义如下:Cls
其中P 是预测结果,LReg定义如下:
Reg
其中, 是 中的正样本标签,P 和G分别是预测结果和目标的标注结果,最后总体的损失函数为:L=LCls+LReg (5);
S5.4训练过程中,批处理大小为128,学习率从0.001下降到0.0005,使用随机梯度下降算法迭代训练20次并保存每次迭代结果,前十次迭代冻结ResNet的参数,后十次迭代以整体网络学习率的十分之一开始训练。