1.一种基于联合检测和重识别的无锚实时多目标跟踪方法,其特征在于,通过构建深度学习模型进行检测和跟踪,所述的深度学习模型包括,特征提取骨干网络、LSC注意力模块、检测分支、重识别分支,具体实施步骤包括:S1;取已标注的图片输入特征提取骨干网络,得到由特征提取骨干网络输出的图片特征金字塔,所述特征提取骨干网络包括深度残差网络和变体DLA参数聚合方法;
S2:将所述图片特征金字塔上下特征层分别进行上、下采样,将上下特征层调整为中间L×S×C层特征的大小,形成特征向量F∈R ,其中S=H×W;将所述的特征向量F,输入LSC注意力模块,得到特征增强后的特征向量F′;
S3:将所述的特征向量F′输入所述的检测分支和重识别分支,分别得到位置信息和外观特征;
S4:根据得到预测结果进行学习,并对检测分支和重识别分支进行损失监督,更新所述深度学习模型的网络参数;
S5:取训练后最优的深度学习模型对图片的检测结果放入跟踪器中进行跟踪。
2.如权利要求1所述的一种基于联合检测和重识别的无锚实时多目标跟踪方法,其特征在于,步骤S1所述的特征提取骨干网络的深度残差网络为ResNet‑34;在ResNet‑34网络中采用一种变体参数聚合方法DLA,为不同预测级别选取对骨架网络不同层,其中的上采样模块中的所有卷积层都由可变形的卷积层代替,以便它们可以根据对象的尺寸和姿势动态调整感受野;输入图像通过骨干网络进行前项传播,以获得在1/32,1/16/,1/8向下采样率的特征金字塔。
3.如权利要求1所述的一种基于联合检测和重识别的无锚实时多目标跟踪方法,其特征在于,步骤S2所述的LSC注意力模块包含三种注意力:首先,尺度感知的注意力用于动态融合不同的特征,如公式(1)所示:其中f(·)是一个线性函数,近似与1×1卷积层, 是一个
hard‑sigmoid函数;
其次,基于融合特征的空间感知注意力用于关注空间位置和特征级别之间一致共存的区域,考虑到特征的高维度,分解为两步骤:首先通过对可变形卷积进行压缩,使注意力学习变得稀疏,然后在相同空间位置上对不同层次的特征进行聚合,如公式(2)所示:其中,K为稀疏采样位置的个数,pk+Δpk为通过自学习空间偏移量Δpk来聚焦于判别区域的移位位置,Δmk为自学习的位置pk的重要性标量;两者都是从 的中位水平输入特征中学习而来;
最后,任务意识的注意力,用于实现联合学习和归纳对象的不同表征,如公式(3)所示:
1 2 1 2 T
其中 是第c通道的特征片,[α ,α ,β ,β] =θ(·)是一个学习控制激活函数阈值的超函数,θ(·)首先在L×S维上进行全局平均池化以降低维数,然后使用两个全连接层和一个归一化层,最后应用唯一sigmoid函数将输出归一化到[‑1,1]。
4.如权利要求1所述的一种基于联合检测和重识别的无锚实时多目标跟踪方法,其特征在于,步骤S3所述的检测分支,包括三个并行的预测器用于跟踪任务中的目标检测部分,每个预测器由256通道的卷积核大小为3×3的卷积与卷积核大小为1×1的卷积组成,所述的预测器包括:热图预测器、框尺寸预测器和中心偏移预测器;
所述的热图预测器中的损失函数包括:
热图预测器负责预测物体的中心位置,热图的输出特征图大小为H×W×1,若热图随真实物体中心崩塌,则输出的特征图中该位置的响应为1;热图预测器随着热图中位置与目标中心距离的增加,响应呈指数级衰减;对于每个GT框 计算目标中心为 和 然后点在特征图上的位置由其除以步长得到,即
在热图中,位置(x,y)的热图响应计算如公式(4)所示:
其中,N表示图像中物体的数量,σc为标准差;
损失函数定义为具有焦点损失的像素级逻辑回归,如公式(5)所示:其中, 是预测热图,α,β为预设的损失参数;
所述的框尺寸预测器和中心偏移预测器的损失函数包括:
中心偏移预测器用于更精确地定位目标在图像中的位置;由于特征图的步长为4,因此会引入最大为4像素的不可忽略的误差;框偏移预测器估算每个像素点相对于目标中心的连续偏移,以减轻对下采样的影响;框尺寸预测器负责估计每个位置上的目标边界框的尺寸;
将框偏移预测器和大小预测器的输出表示为 和 对于每个GT
框 可以计算其大小为 同样地,GT的偏移可以
计算为 分别将对应位置的偏移量和尺寸表示为 和 然后为两
个预测器加入l1损失,如公式(6)所示:
其中,λs为权重系数,设置为0.1。
5.如权利要求4所述的一种基于联合检测和重识别的无锚实时多目标跟踪方法,其特征在于,步骤S3所述的重识别分支中的重识别特征提取是在特征F′之上应用了具有128个内核的卷积层,以提取每个位置的身份嵌入特征,其中的重识别损失函数包括:通过分类任务学习重识别特征,训练集中具有相同身份的所有对象都被视为同一类;
128×H×W
将生成的特征图表示为E∈R ,从特征图中心位于(x,y)的目标中提取的目标重识别特征为对于图像中的每一GT框 获取到目标中心 可以抽取一个特
征向量 并使用一个全连接层和一次softmax操作将其映射到一个类分布向量P={pi(k),k∈[1,K]};将GT类标签的one‑hot表示为L (k),然后计算目标重识别损失如公式(7)所示:其中,K是类别数量。
6.如权利要求1所述的一种基于联合检测和重识别的无锚实时多目标跟踪方法,其特征在于,步骤S4所述的损失监督中的损失函数包括:通过将损失相加来联合训练检测和重新识别分支;使用不确定性损失来自动平衡检测和重新id任务,如公式(8)和(9)所示:Ldetection=Lheat+Lbox (8)
其中w1和w2是平衡两个任务的可学习参数;具体来说,给定一个具有一些对象及其对应id的图像,生成热图、框偏移量和尺寸图以及对象的单热编码表示。这些与估计的度量进行比较,以获得损失来训练整个网络。
7.如权利要求1所述的一种基于联合检测和重识别的无锚实时多目标跟踪方法,其特征在于,步骤S5所述的跟踪器包含基于匈牙利算法的在线跟踪算法,具体包括:在网络推理时间内,跟踪系统在第一帧中执行跟踪的初始化;在随后的帧中,轨迹集更新边界框、相关检测的分数、外貌特征、指示轨道是否处于活动状态和丢失或移除的“轨道状态”;
根据检测框得分,把检测框分为高分框和低分框分开处理;第一次使用高分框检测并计算DIoU距离与帧间外观相似度形成的相似度矩阵,以此将当前帧与之前轨迹集合关联在一起;第二次使用低分框和第一次没有匹配上高分框的跟踪轨迹计算DIoU距离与帧间外观相似度形成的相似度矩阵进行匹配;相似度矩阵通过匈牙利算法进行全局分配将检测链接到轨迹集中;
对于没有匹配上跟踪轨迹,得分又足够高的检测框,对其新建一个跟踪轨迹;对于没有匹配上检测框的跟踪轨迹,保留30帧,在其再次出现时再进行匹配;最后,所有未匹配的高置信度检测将初始化为新轨迹。