利索能及
我要发布
收藏
专利号: 202310888432X
申请人: 杭州电子科技大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-08
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于模态特征对齐的弱监督跨模态视频定位方法,其特征在于,包括步骤如下:步骤(1)、数据预处理,提取视频和文本的初始模态特征;

步骤(2)、构建网络整体架构以及设计损失函数;

步骤(3)、模型训练,优化网络参数;

步骤(4)、根据训练好的网络模型生成定位检测结果;

所述步骤(1)具体实现如下:

关于视频特征提取,首先将视频转换成一组有时间先后关系的图片序列,然后使用预训练好的C3D网络来提取视频特征;每16帧提取一个4096维度的向量,处理完成后最终获得一个向量序列即视频特征;

关于文本特征提取,使用一个Glove词向量数据文件,得到每个词对应的词向量,最终得到的词向量序列就是文本特征;

所述步骤(2)具体实现如下:

网络模型主要分为三部分:特征对齐模块,候选片段生成模块和文本重构模块;所述的特征对齐模块用于提取两种模态深层特征,以及对应的全局模态特征,全局模态特征用于特征对齐以及正负视频文本对学习;所述的候选片段生成模块用于融合两种模态深层特征,生成固定数量的高斯分布,以此得到对应的候选片段以及高斯掩码注意力;所述的文本重构模块利用候选片段来重构被掩码的文本,通过重构损失得到最优候选片段;

特征对齐模块具体实现如下:

在数据预处理阶段已经获得了两种模态的初始特征,视频初始特征为N为抽取的视频帧个数,DV为视频初始特征维度,文本初始特征为 M为单词的数量,DT是文本初始特征维度;

在输入到特征对齐模块之前,需要对初始特征添加三个可学习的词元;为了在之后的候选片段生成模块中得到融合后特征的全局特征,在视频特征最后添加一个可学习的高斯词元vgauss;因为特征对齐模块需要得到两种模态的全局特征,所以在视频特征和文本特征之后分别添加一个可学习的分类词元vcls,tcls;最终得到视频特征V={v1,v2,…,vN,vgauss,vcls}以及文本特征T={t1,t2,…,tM,tcls};

将添加词元后的两种模态特征分别输入到对应的模态自注意力结构中,提取深层的模态的特征即模态深层特征;由于自注意力结构对特征时序不敏感,所以采用正弦和余弦函数,得到每个单词对应的位置信息,位置编码通过如下公式表示:

2a

PE(pos,2a)=sin(pos/10000 /dmodel)

2a

PE(pos,2a+1)=cos(pos/10000 /dmodel)其中a表示位置编码向量的第a个维度,pos表示当前单词在文本中的位置,dmodel表示词向量的维度;

将视频特征输入至视频模态自注意力结构后得到深层视频特征,将文本特征和位置编码相加后输入至文本模态自注意力结构后得到深层文本特征;自注意力结构通过如下公式表示:其中,X为输入的模态特征, 为X的维度;

此时分类词元已经得到了全局模态特征,将分类词元映射到低维度并归一化后,通过计算分类的相似度能够计算匹配视频文本对的相似度和非匹配视频文本对的相似度s=gvT(vcls) gt(tcls),gv,gt表示对视频和文本的映射和归一化操作;每个训练批次中,能够计算T得到每个视频与每个文本的相似度,定义相似度矩阵s(V,T)=gv(vcls) gt(tcls)和s(T,V)=Tgt(tcls) gv(vcls),分别表示视频对与文本的相似度矩阵和文本对于视频的相似度矩阵;通过softmax归一化计算对相似度矩阵进行进一步优化:其中,B表示一个训练批次中视频文本对的样本数量;

视频文本的对比学习损失为:

v2t t2v

其中CE是cross entropy损失,y ,y 是图像文本对的真实标签,如果图像和文本不匹配,则真实标签为0,匹配则为1;

在将提取到的特征输入到候选片段生成模块前,先将全局特征从特征序列中删除,得到的视频特征为 文本特征为

2.根据权利要求1所述的一种基于模态特征对齐的弱监督跨模态视频定位方法,其特征在于,候选片段生成模块具体实现如下:候选片段生成模块的本质是一个transformer的解码器结构,将视频特征 和文本特征 输入到该模块后,将得到融合了视觉信息和文本信息的融合特征DH为融合后的特征维度,公式表述为:其中,D表示解码器操作;此时 汇聚了所有特征信息,通过一个全连接层和Sigmoid激活函数预测得到候选片段的中心 和宽度 K为候选片段的个p K×N

数;获得候选片段的中心和宽度后,计算得到高斯掩码m∈R :其中,c为视频特征位置,k为候选片段的索引, 表示索引为k的正候选片段中帧数为c的高斯掩码值,高斯掩码就是代表视频每个位置的高斯分布值,σ是超参数,用于控制高斯曲线的宽度;

为了使候选片段尽量的不重叠以提高定位结果的召回率,使用多样性损失来优化该模块,多样性损失表述如下:其中, 表示矩阵的Frobenius范数,λ是超参数,用于控制候选片段的重叠程度,I代表单位矩阵。

3.根据权利要求1所述的一种基于模态特征对齐的弱监督跨模态视频定位方法,其特征在于,文本重构模块具体实现如下:文本重构模块也是一个transformer的解码器结构,得到候选片段之后,将候选片段对应的视频特征通过特征对齐模块的视频模态自注意力结构进行深层特征提取后,将候选片段深层特征输入到文本重构模块;

然后将原始文本进行随机掩码,掩码数量为文本单词数量的1/3;将掩码后的文本进行文本特征提取后,再通过特征对齐模块的文本模态自注意力结构进行深层特征提取,与候选片段深层特征一起输入到文本重构模块中,但区别于候选框生成模块,在两种模态进行交互时,还需要将两种模态的注意力分布与高斯掩码相乘,使文本更多地关注和正候选片段相关的视频帧,并抑制不相关的视频帧信息;最终得到融合了文本信息与视觉信息的融合特征 公式表述为:其中, 表示掩码后的文本深层特征, 为候选片段深层特征;

将融合特征输入至全连接层后,通过softmax计算,即可得到被掩码单词映射到所有单词的概率 Q为文本的单词总数,通过公式表述为:其中,W为全连接层的权重,b′为全连接层的偏置,d∈M, 第d个融合特征;

每个掩码位置取对应概率最大的单词作为预测结果;根据预测结果计算得到重构损失Lce,计算每个被掩码单词的负对数概率,并将它们相加:其中,Lce表示基于视频候选片段和p(td+1|t1:d)计算得到的重构损失,p(td+1|t1:d)为根据第1个单词到第d个单词来预测第d+1个单词的概率。

4.根据权利要求1‑3任意一项所述的一种基于模态特征对齐的弱监督跨模态视频定位方法,其特征在于,完整的损失函数具体如下:先得到重构损失最小的最优候选片段:

*

其中,k为最优候选片段的索引, 表示以k为索引的正候选片段的损失;将最优候选片段作为伪标签,然后计算每个正候选片段与最优候选片段的交并比:*

其中, 为以k为索引的最优候选片段,mk为以k为索引的正候选片段; 和 表示*为以k为索引的最优候选片段的结束时间和开始时间,ek和sk表示为以k为索引的正候选片段的结束时间和开始时间;

对交并比进行归一化操作得到每个候选片段的伪标签值:其中,omin和omax为超参数,分别表示交并比的最小值和最大值;

根据伪标签值和其他正候选片段的重构损失,计算得到正候选片段学习损失函数为:其中, 为最终的正候选片段总学习损失;

为了能够学习到更细粒度的信息,还需要选取负候选片段进行对比学习;由于整个视频包含了文本的语义信息,将整个视频作为正候选片段,但又包含了大量冗余的信息,所以将整个视频作为全局候选片段;由于正候选片段两端的片段与正样本差异交大,所以将两段的片段作为负候选片段;现在有了三类视频片段,由候选片段生成模块生成得到的正候p r n选片段m ,整个视频的全局候选片段m ,正候选片段两端的负候选片段m;全局候选片段重构文本的损失在正负两者之间:负候选片段从最优候选片段的两端选取,固定左端负候选片段的起始时间为视频开始时间,固定右端的负候选片段的结束时间为视频的结束时间,随着训练次数的增加,两端的负候选片段的宽度会不断地变大,负候选片段就会不断地靠近最优候选片段;初始条件下,左右两端负候选片段的宽度为:

1 2

其中,w为左端负候选片段的宽度,w为右端负候选片段的宽度;

宽度的增长比例为:

其中, 表示当前左端负候选片段的宽度, 表示当前右端候选片段的宽度;

其中η会随着训练次数不断变大:

其中emax为总的训练次数,e为当前训练次数,负样本的中心为:获得负候选框的宽度和中心后计算得到负候选框的高斯掩码,对于整个视频的高斯掩码则全为1;

在计算得到正候选片段的重构损失 全局候选片段的重构损失 和左右负候选片段的重构损失 后,设计更完整的损失函数;因为整个视频也包含了正候选片段信息,所以整个视频也能够看作是一个粗糙的正候选片段,设计正样本学习损失函数如下:为了使网络学习正候选片段和负候选片段的差别,设计正负样本对比学习损失函数如下:其中,β1、β2为控制样本重构损失差距的超参数;

最终完整的总学习损失为:

L=Lrec+α1LIVC+α2Ldiv+α3Lcon其中,α1、α2、α3为超参数,用于平衡总学习损失。

5.根据权利要求4所述的一种基于模态特征对齐的弱监督跨模态视频定位方法,其特征在于,步骤(3)模型训练具体实现如下:根据设计的损失函数,在训练过程中,通过反向传播算法对模型参数进行更新,直至模型收敛并保存模型文件。

6.根据权利要求5所述的一种基于模态特征对齐的弱监督跨模态视频定位方法,其特征在于,步骤(4)具体实现如下:网络加载保存的模型文件后,对测试集进行测试,每次输入一个文本和待定位的视频,最终得到K个候选片段与对应的重构损失,选取最小重构损失的最优候选片段作为定位结果;候选片段的起始时间st和结束时间en分别为:其中Duration为视频的时长。