利索能及
我要发布
收藏
专利号: 2020100750056
申请人: 西安电子科技大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于时序信息和局部特征相似性的视频目标检测方法,其特征在于,包括如下:(t) (t‑k) (t‑1)

(1)分别对视频V中第t帧视频帧I 与其前k帧I ,...,I ,通过ResNet网络,得到I(t) (t) (t‑k) (t‑1) (t‑k) (t‑1)的特征图F 和I ,...,I 的特征图F ,...,F ;

(t) (t‑k) (t‑1) (t,t‑k) (t,t‑1)(2)计算F 与F ,...,F 的局部特征哈希相似性得分s ,...,s :(t) (t)

(3)基于时序信息计算视频帧I 的修正特征图F' :(t,t‑k) (t,t‑1)

(3.1)对局部特征哈希相似性得分s ,...,s 在各个空间位置上分别进行(t‑k) (t‑1) (t‑k) (t‑1)softmax操作,得到特征图F ,...,F 对应的权重α ,...,α ;

(t‑k) (t‑1) (t‑k) (t‑1)(3.2)对特征图F ,...,F 和对应权重α ,...,α 在各个空间位置加权求和,(t) (t) (t)并与F 相加,得到视频帧I 的修正特征图F' ;

(t) (t) (t)

(4)用视频帧I 的修正特征图F' 选择视频帧I 的候选目标区域:(t) (t) (t)

(4.1)对I 帧的修正特征图F' ,将其依次通过大小为3×3和1×1的卷积核,得到I(t)帧的中间层特征图F” ;

(4.2)在特征图的各个位置生成9个不同尺度的锚框,即先设置大小为16×16的基锚框,保持面积不变使其长宽比为(0.5,1,2),再对这三个不同长宽比的锚框分别放大(8,16,

32)个尺度,一共得到9个锚框。

(4.3)训练softmax层和目标框回归层参数,得到训练后的softmax层和目标框回归层;

(t) (t)

(4.4)对每一个锚框在I 帧的中间层特征图F” 上,用训练后的softmax层判断是否含有目标:(t)

若含有目标,则用训练后的目标框回归对锚框坐标进行微调,得到I 帧的若干候选目标区域,执行(5);

若不含有目标,则将锚框丢弃;

(t) (t)

(5)在视频帧I 的修正特征图F' 上,对每个候选目标区域用感兴趣区域池化提取其大小统一的候选区域特征;

(6)用各个候选区域特征得到视频帧的目标类别和目标框位置:(6.1)训练分类和回归网络,得到训练后的分类和回归网络:(t)

(6.2)将视频帧I 的各个候选区域特征输入到训练后的分类和回归网络,分别得到视(t)频帧I 的目标类别和目标框位置。

(t) (t‑k) (t‑1)

2.根据权利要求1所述的方法,其特征在于,(2)中计算F 与F ,...,F 的局部特(t,t‑k) (t,t‑1)征哈希相似性得分s ,...,s ,实现如下:(t) (t‑k)

(2.1)计算第t帧特征图F 和第t‑k帧特征图F 的局部特征哈希相似性得分:(t) (t)

(2.1a)对第t帧I 的特征图F ,在任一位置(i,j)上取八邻域,构成以位置(i,j)为中心的邻域特征块 对 中的所有值求平均,得到位置(i,j)处的特征平均值(t‑k) (t‑k)(2.1b)对第t‑k帧I 的特征图F ,在位置(i,j)上取八邻域,构成以位置(i,j)为中心的邻域特征块 对 中的所有值求平均,得到位置(i,j)处的特征平均值(t)(2.1c)将第t帧I 的邻域特征块 中每个值与其平均值 比较,并将 中大于或等于均值 处的哈希值设为1,将 中小于均值 处的哈希值设为0,得到由0和1组成的 哈希表示(t‑k)

(2.1d)将第t‑k帧I 的邻域特征块 中每个值与其平均值 比较,并将中大于或等于均值 处的哈希值设为1,将 中小于均值 处的哈希值设为0,得到由0和1组成的 哈希表示(2.1e)计算 哈希表示 和 哈希表示 的汉明距离(2.1f)用邻域特征块 所包含值的个数减去汉明距离 得到第t帧的特征图和第t‑k帧的特征图在位置(i,j)上的哈希相似性得分(t) (t‑k)

(2.1g)重复(2.1a)–(2.1f),计算第t帧特征图F 和第t‑k帧特征图F 在所有位置的哈希相似性得分,并根据空间位置将它们进行组合,得到第t帧特征图和第t‑k帧特征图的(t,t‑k)局部特征哈希相似性得分s ;

(t) (t‑k+1) (t‑1) (t(2.2)重复(2.1),分别计算F 与F ,...,F 的局部特征哈希相似性得分s,t‑k+1) (t,t‑1) (t

,...,s ,从而得到第t帧视频帧与其前k帧的的局部特征哈希相似性得分s,t‑k) (t,t‑1),...,s 。

3.根据权利要求1所述的方法,其特征在于,(1)中的ResNet网络是由1个7×7卷积层、1个3×3最大池化层、16个残差块组成的特征提取网络,其中每个残差块分别由1个1×1卷积层、1个3×3卷积层、1个1×1卷积层和恒等映射组合而成。

4.根据权利要求1所述的方法,其特征在于,(4.3)所述的训练softmax层和目标框回归层参数,实现如下:(4.3a)随机初始化softmax层和目标框回归层参数;

(4.3b)对每一锚框,用初始化后的softmax层计算锚框含有目标的概率,用初始化后的目标框回归计算锚框的参数化坐标;

(4.3c)用约束softmax层参数的L1正则项构造区域候选损失函数其中,ei为softmax层计算的第i个锚框Ai含有目标的概率, 是锚框Ai是否含有目标的真实值标签,oi是锚框Ai的参数化坐标, 是与锚框Ai对应的真实值目标框的坐标,是目标是否存在的对数损失, 是目标框回归的Smooth L1损失, 为softmax层参数, 为约束softmax层参数的L1正则项,Ncls为训练批次的数量,Nreg为锚框数量,λ1和λ2是平衡权重;

(4.3d)利用区域候选损失函数,通过反向传播算法更新softmax层和目标框回归层参数,直到区域候选损失函数收敛,得到训练后的softmax层和目标框回归层。

5.根据权利要求1所述的方法,其特征在于,(4.4)中用训练后的softmax层判断锚框是否含有目标,是用训练后的softmax层计算锚框含有目标的概率p,并将该概率与设定的阈值q进行比较:若p>q,则锚框含有目标;

若p≤q,则锚框不含有目标。

6.根据权利要求1所述的方法,其特征在于,(6.1)所述的训练分类和回归网络,实现如下:(6.1a)随机初始化分类和回归网络的参数;

(6.1b)对每一个候选区域特征,用初始化后分类网络计算候选区域属于各个类别的概率,再用初始化后的回归网络计算候选区域的参数化坐标;

(6.1c)构造目标检测损失函数

其中,z是第i个候选区域的真实类别, 是第i个候选区域属于z类的概率,γ是专注参数, 是目标分类的focal loss损失;oi是第i个候选区域的参数化坐标,是与第i个候选区域对应的真实目标框的坐标向量, 是目标框的Smooth L1回归损失,λ是平衡权重;

(6.1d)利用目标检测损失函数,通过反向传播算法更新分类和回归网络参数,直到目标检测损失函数收敛,得到训练后的分类和回归网络。