利索能及
我要发布
收藏
专利号: 2022105794219
申请人: 杭州电子科技大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于动态实例交互头的稀疏时序动作检测方法,其特征在于,包括如下步骤:

步骤(1)、数据预处理,提取视频数据的初始时空特征;

首先,抽取视频数据的图像帧和光流;其次,基于抽取的图像帧和光流分别提取对应的特征;然后,将提取到的特征在时序维度进行堆叠,并使用滑动窗口的方式取出长度相等的视频片段;

步骤(2)、构建基于时序特征金字塔结构的动态实例交互头网络模型;

所述的基于时序特征金字塔结构的动态实例交互头网络模型,包括时序特征金字塔和动态实例交互头;

所述的时序特征金字塔由自下而上以及自上而下两部分构成,自下而上的即通过传统的卷积网络做特征提取,自上而下的路径用于特征融合,在语义丰富的低分辨率特征层构建更高的分辨率,并采用横向连接的方式解决由于不断上下采样造成目标偏移的问题;特征金字塔得到P1、P2、P3、P4、P5共五层输出,为了获取更多的视频信息,提取金字塔P1‑P4四个特征层用以多尺度地预测行为的关键点;

所述的动态实例交互头接收时间特征金字塔网络生成的多级特征,然后预测动作实例的时间段和动作类别;动态实例交互头的输入包括三个内容:一是时序金字塔网络输出的多尺度特征;二是可学习提案框;三是可学习提案特征;所述的提案框是二维参数,表示时间段的标准化中心位置和持续时间;提案框能够设置为任意大小,并在初始化期间随机放置在特征序列上,避免复杂的候选提案设计;所述的提案特征为每个提案候选者编码丰富的实例信息;

步骤(3)、模型训练;

统一大小的候选框经过全连接层得到固定大小的特征向量,输出N个无序集合,每个集合元素包括分类和定位信息;利用级联思想,对输出的候选框进行调整,每个级联阶段的输出信息都利用最佳二分匹配和分类回归损失进行训练,直至整个网络模型收敛;

步骤(4)、生成定位检测结果;

根据最佳二分匹配方法,对模型输出的特征向量进行一对一的标签匹配;模型训练输出的候选框即为最终的预测框。

2.根据权利要求1所述的一种基于动态实例交互头的稀疏时序动作检测方法,其特征在于,步骤(1)所述的数据预处理,提取视频数据的初始时空特征,具体如下:对于视频数据集V中的每个输入视频vn,首先以30FPS抽取图像帧,同时使用TVL‑1算法抽取视频的光流;对抽取好的的图像和光流进行特征提取,使用基于Kinetics数据集预训练的I3D模型分别提取图像和光流对应的特征 和 其中N表示不同视频具有不同的时序长度,1024则代表每个视频片段经过预训练的I3D模型提取后输出的特征维度;为了整合输入视频的外观特征和运动特征,将图像特征Frgb和光流特征Fflow在时序维度上进行堆叠,并获得初始时空特征 再接着,用滑动窗口在时序长度N上以50%的重叠率进行滑动,最终得到窗口的时空特征 其中T=256。

3.根据权利要求2所述的一种基于动态实例交互头的稀疏时序动作检测方法,其特征在于,步骤(2)所述的基于时序特征金字塔结构的动态实例交互头网络模型,具体如下:

2‑1、时序特征金字塔;

金字塔结构中传统的自下而上的路径实质为一个下采样卷积神经网络的前馈计算,采用图注意力卷积加上步长为2的最大池化操作代替原有的简单一维卷积,具体公式为:Fhigh=Maxpooling(GAT(Fcur))(1)

其中Fhigh表示经过当前图卷积的高层特征图输出,Fcur表示当前层的输入特征;接着是自上向下的路径,实质上是为了增大带有高层语义信息的特征图分辨率;对顶部具有大感受野的特征图做上采样,步长与最大池化操作相同都为2,上采样时用线性插值的方式;上采样完后与自下向上卷积时具有相同尺寸的特征图进行横向连接,融合时采用对应元素相加的形式,具体公式可表示为:Flow=Interpolate(conv(Fcur))(2)

其中conv为一个1×3的卷积,用于减轻上采用的混叠效果;

2‑2、动态实例交互头;

动态实例交互头的输入包括三个内容:一是时序金字塔网络输出的多尺度特征层中的F1、F2、F3、F4,其中 Fea=2048是特征维度;二是可学习提案框;三是可学习提案特征;最终动态实例交互头的输出内容包括两部分:一个是类别预测,另一个是边界预测;

上述提到的可学习的提案框最终被用作候选提案;这些提案框被初始化为0‑1的二维参数,表示标准化的中心坐标和动作持续时间长度;在训练期间,将使用反向传播算法更新提案框的参数;候选提案的数量大于视频数据集中所有视频剪辑的最大真值动作实例数;

虽然二维提案框是一个对动作范围简单而明确的表述,但是只提供了对动作持续时间的粗略定位,丢失了很多细节性信息;因此,引入提案特征,它是一个高维潜在向量,将对丰富的动作实例进行编码;提案特征的数量和提案框的数量相同;

初始化的提案框被映射到0‑1的单位时间,在输入到动态实例交互头之前,给其初始化权重,根据时序金字塔网络输出的尺度大小分别放缩到0‑256帧、0‑128帧、0‑64帧和0‑32帧大小;通过SOI‑Align模块使用提案框从时序特征金字塔中提取SOI特征Rsoi,每个SOI特征都会被用到自己的专用头部,用于动作分类和定位,每个头部都以特定的提案特征为条件;

PK进行自注意力生成卷积核参数PKconv,然后生成的卷积核参数PKconv与Rsoi稀疏交互,以过滤掉无效的单元,并输出最终的预测特征Ffin;具体交互过程如下面公式所示:Ffin=norm3(drop3(forw(norm2(drop2(inter(Rsoi,norm1(drop1(PK)+PKconv)))+PK)))+PK)(3)其中norm1、norm2、norm3为神经网络中的全连接层,drop1、drop2、drop3为梯度截断,forw是前馈神经网络,具体内容如公式所示:forw(x)=Linear2(relu(drop(Linear1(x))))(4)Linear1、Linear2为全连接网络,relu为激活函数;公式(3)中的稀疏交互部分可表示为如下公式:inter(x,y)=relu(norm(bmm(x,Linear(y))))(5)bmm为对输入的两个参数进行矩阵乘法;因此,交互过程能够视为SOI特征通过两个一维卷积层传递,有利于模型充分利用中间层的高分辨率特征;最后,在动态实例交互头上建立两个并行分支即分类分支和回归分支,得到动作实例的最终分类分数和边界回归预测;

分类分支是一个带有Sigmoid激活的线性层,用于预测每个动作类别的概率;回归分支由一个三层前馈网络组成,该网络具有时间边界回归的RELU激活函数;将所有的动态实例交互头堆叠起来,得到每个头部的预测;每个阶段的预测提案框和提案特征将作为下一阶段的初始提案框和提案特征,以便不断完善。

4.根据权利要求3所述的一种基于动态实例交互头的稀疏时序动作检测方法,其特征在于,步骤(3)模型训练,具体如下:称动态实例交互头最终生成的预测为动作实例集合ψp,其包含N个实例,N的值大于视频数据集V中真实动作实例的数量M;所有真实动作实例构成真实目标集ψg,通过填充 类别将真实目标集ψg扩充到N,在这两个固定大小的集合上采用集合预测损失,基于集合的预测损失在预测值和真实值之间产生最佳二分匹配,匹配成本的定义如下:L=λcls·Lcls+λL1·LL1+λiou·Liou(6)

Lcls是真实类别标签和预测类别之间的焦点损失,LL1和Liou是预测框的中心坐标和动作持续时间与真实框之间的l1损失和IoU损失;λcls、λL1和λiou分别是各类损失的权重系数;匹配损失除了仅在匹配对上执行外,训练损失和匹配损失相同,最终损失是由训练批中的对象数归一化的所有对的总和;Lcls的具体公式如下所示:γ

Lcls(pt)=‑αt(1‑pt) log(pt)(7)

其中pt表示预测为关键点的概率,αt表示正负样本的对应权重,γ的作用是为了降低简单样本的loss,迫使模型去更在意难挑选的样本。

5.根据权利要求4所述的一种基于动态实例交互头的稀疏时序动作检测方法,其特征在于,步骤(4)所述的生成定位检测结果,具体如下:根据步骤(2)得到的预测特征和时序预测框,利用步骤(3)中的匹配损失直接进行最佳二分匹配,得到预测标签,该预测标签和时序预测框即为最终的预测类别和动作边界,用平均精度计算最终性能。

6.根据权利要求3所述的一种基于动态实例交互头的稀疏时序动作检测方法,其特征在于,所述的候选提案的数量N=50。