利索能及
我要发布
收藏
专利号: 2019109942580
申请人: 北京工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-23
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于弱监督学习和视频时空特征的视频物体定位方法,其特征在于:

1)视频分帧与候选框提取

对视频帧进行下采样,采用频率为1fps;在弱监督学习中仅用对应的描述语句作为监督信号,采用了基于MSCOCO数据集训练的Faster‑RCNN目标检测网络来进行候选框提取,对视频的每一帧取置信度靠前5%‑10%的N个边框作为该帧的候选框;

2)实体解析与文本特征提取

视频对应的文本描述通常是一到两句话,其中会带有在视频中出现的物体,自动的识别出句子中哪些词是实体,从而得到被定位物体的文本表示;首先对语句进行分词,然后对每个单词进行词性分析,最后结合语句的上下文得到语句中表示实体的词;在得到每个被定位物体的文本表示后,就根据训练好的词向量字典得到被定位物体的文本特征,将这些物体文本特征通过线性变换统一到D维的特征空间;

3)候选框特征提取

候选框表示视频某一帧的一块矩形区域,候选框特征提取就是对这块区域进行表征,具体方式如下:

关于视觉特征,基于训练好的Faster‑RCNN目标检测网络,将每个候选框进行感兴趣区域池化后的结果作为候选框对应的视觉特征;

关于空间特征,每一个候选框都有对应边框坐标(x1,y1,x2,y2),其中x1,y1,x2,y2分别是边框左上和右下角未归一化的坐标值;根据视频帧的高度H和宽度W对其进行归一化,用归一化坐标(x1/W,y1/H,x2/W,y2/H)统一表示候选框的空间位置;

关于时间特征,将视频分解为T帧的集合,t是每一帧的顺序索引,那么每一帧归一化的时间顺序为t/T;在同一帧的候选框拥有相同的时间顺序,因此可以将每一帧的时间顺序作为该帧中所有候选框的时间特征;

最后将候选框的视觉特征、空间特征、时间特征通过线性变换统一到D维特征空间;

4)时空关联捕获

将基于自注意力机制来捕获这种潜在的时空关联;空间关联指在同一帧中的候选框的关系,时间关联指在不同帧间的关系;

给定一个视频段R,将其看作是一个T帧的集合,对每一帧提取N个候选框,将一个候选框的特征记为r,得到一个视频段的候选框特征为集合 其中t为帧的索引,n为每一帧候选框的索引;它们空间关联的表达方式如下:其中Trans表示矩阵转置,D为特征向量的维度,softmax是归一化函数,attention表示捕获特征 的关联;通过这种方式计算得到新特征与原来的特征拥有相同的维度,因为每一个新特征都是由同一帧的所有特征加权表示,所以每个新的候选框特征都隐含了其他候选框的关联;对于同一帧的每个候选框它们的时间特征是一样的,因此将同一帧的候选框特征进行最大值池化,就得到帧级别特征 其中f表示对同一帧所有候选框特征进行最大值池化得到的新特征,T表示帧的总数,t表示帧的索引;它们的时间关联表达方式如下:

其中Trans表示矩阵转置,D为特征向量的维度,softmax是归一化函数,attention表示t

捕获特征{f}的关联;

5)多模态特征交互表达

将候选框的视觉特征、空间特征、时间特征和物体的文本特征作为输入,输出该候选框和物体的匹配度得分;首先,分别将候选框的各个特征与物体的文本特征逐点相乘得到视觉‑文本、空间‑文本、时间‑文本的交互,再将这些特征向量拼接在一起得到一个联合特征向量记作v,并将其输入一个两层的全连接网络,最后得到候选框与物体的关联得分记为s,计算方式为:

s=tanh(W2tanh(W1v)),其中W1、W2分别是全连接网络第一和第二层的权重,tanh是全连接网络的激活函数,v是候选框与被定位物体所有特征进行拼接得到的特征向量;

6)网络训练

首先,将一个视频段包含的所有候选框定义为一个‘包’,如果这个‘包’至少有一个候选框与文本中被定位物体匹配,那么这个‘包’被视为正包,否则视为负包;显然,当一个‘包’包含被定位物体的候选框即正包,那么该物体与其中候选框的匹配度应该大于不包含该物体的包即负包;

具体地,定义一个视频段为R,该视频段对应描述为Q,其中视频R包含T帧,每一帧包含N个候选框,记一个候选框为b,则一个视频段的候选框集合为 其中t为帧的索引,n为每一帧候选框的索引;假设视频描述Q包含K个需要定位的物体,记需定位物体为q,则需要定位的物体集合为 其中k表示需定位物体的索引;根据多模态特征交互表达模块得到一个候选框 和一个物体qk的匹配度,记为 那么将视频段R与视频描述Q的匹配度定义为:

其中max是取最大值的函数;定义视频段R′和视频描述Q′是不同于Q、R的另一对视频‑描述对,根据正负包定义有(Q,R)是正包,(Q′,R)、(Q,R′)是负包;那么理论上要有S(Q,R)>S(Q′,R)和S(Q,R)>S(Q,R′),于是损失函数被定义为:Lrank=relu(S(Q,R′)‑S(Q,R)+Δ)+relu(S(Q′,R)‑S(Q,R)+Δ),其中Δ表示正负包匹配度的最小差异间隔,relu是修正线性单元函数;该损失函数使得正包的匹配度要大于负包的匹配度,促进候选框与被定位物体进行正确的匹配,即使得物体与正确候选框匹配度变大;进行前向推理时,将每一帧与被定位物体匹配度最大的候选框作为该物体的定位结果。