1.一种单目标追踪方法,其特征在于,包括:
获取视频数据;
确定视频数据第一帧的目标区域,对目标区域经过transformer骨干网络进行特征提取、transformer编码器编码,得到目标区域特征编码;
根据视频数据第一帧的目标区域用高斯函数生成M个目标先验框,其中M为大于3的整数;
根据视频数据第一帧的目标区域确定搜索区域,包括:
其中,表示在当前帧中裁剪的搜索区域尺寸,表示上一帧中目标框的宽,表示上一帧中目标框的高,表示搜索因子;
对搜索区域进行transformer骨干网络特征提取、transformer编码器编码,得到搜索区域特征编码;
将目标区域特征编码、搜索区域特征编码和M个目标先验框输入transformer解码器进行解码,得到输出的M个目标预测框与标注框之间的交并比IoU值;
IoU loss优化网络参数,采用梯度下降法对目标预测框进行N次迭代优化,得到优化后的优化预测框;
选择优化后的前三IoU值的优化预测框取均值作为最终的目标追踪框。
2.根据权利要求1所述的单目标追踪方法,其特征在于,所述确定视频数据第一帧的目标区域,包括;
在视频数据的第一帧中通过矩形框对目标进行标注,所述目标区域包括目标位置与尺寸,分别由矩形框位置与尺寸确定。
3.根据权利要求1所述的单目标追踪方法,其特征在于,将目标区域特征编码、搜索区域特征编码和M个目标先验框输入transformer解码器进行解码,得到输出的M个目标预测框与标注框之间的交并比IoU值,包括:将目标区域特征编码与搜索区域特征编码在通道维度上进行拼接得到特征图,根据特征图和M个目标先验框得到M个目标预测框,之后经过前馈神经网络得到M个目标预测框与标注框之间的IoU值。
4.根据权利要求1所述的单目标追踪方法,其特征在于,IoU loss优化网络参数,采用梯度下降法对目标预测框进行N次迭代优化,包括:其中,A为预测框,B为标注框。
5.根据权利要求4所述的单目标追踪方法,其特征在于,M为100。
6.一种单目标追踪装置,其特征在于,包括:包括处理器及存储介质;
所述存储介质用于存储指令;
所述处理器用于根据所述指令进行操作以执行根据权利要求1至5任一项所述方法的步骤。
7.一种存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至5任一项所述方法的步骤。