利索能及
我要发布
收藏
专利号: 2024112246190
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于语义与显著性知识协同传播的弱监督时序动作定位方法,其特征在于:包括以下步骤:

1)通过双流网络和显著性目标检测网络分别对未剪辑的视频进行时序特征和显著性前景特征提取,未剪辑的视频包含人体活动及其他背景的视频;

2)建立一个显著性感知分支,将提取到的显著性前景特征作为输入训练该分支来获得显著性类激活序列,将其作为该分支的代表性序列,并对其在通道维度上求和获得显著性动作表示分数,利用该分数与基本分支中获得的时间类激活序列、外观动作表示分数以及运动动作表示分数进行加权融合得到融合动作分数序列,将其作为基本分支的代表性序列用来表示语义和显著性知识的初步融合;基本分支中的时间类激活序列、外观动作表示分数以及运动动作表示分数获得过程如下:首先将外观和光流特征 在通道维度级联得到 ,然后将其输入到由一维卷积和ReLU函数组成的特征提取器层中,以获得嵌入特征 ,如下式:(19)

然后,通过 层获得时间类激活序列  ,它由一个一维卷积和一个ReLU函数组成;C表示所有视频中的总类别数,如下式:(20)

最后,对 在通道维度上求和,并将其输入到sigmoid函数中,以获得基本动作分数,如下式:(21)

3)分别根据融合动作分数序列和显著性类激活序列与阈值的比较获得伪标签,通过蒸馏方法将本地伪标签中的知识传播到另一分支的代表性序列中,并利用预测类别维度下的动作一致性约束增强传播效果,最终实现语义信息和显著性信息的互补学习;蒸馏方法主要通过设计一个相对熵优化函数,缩小两个概率分布之间的信息熵差值,即缩小用一个分布来近似另一个分布时引入的信息损失或误差;此处利用蒸馏方法原理缩小分支代表性序列近似到伪标签序列时的相对熵;首先,为降低噪声的存在对关键知识传播的影响,生成三元伪标签作为知识交互和内化的媒介;其次,使用固定的系数 和 分别乘以 和 的中位数来得到每个分支的高低阈值 ,并利用阈值设置伪标签如式(7):

(7)

其中t,c分别表示片段索引和类别, 为每个代表序列 中在类别c上的预测得分序列, 为 中第t个片段在类别c上的预测得分;

为了增强语义和显著性知识之间的交互关系,缓解不同序列中激活值含义的差异性,并将重点聚焦在含有具体类别的序列部分,设计了如式(8)所示的类特定的动作分数序列,并将在后续的优化过程中引入一致性约束;

(8)

其中 表示第t个片段的类动作分数, 表示伪标签 中在类别c下的伪标签序列;

为了促使模型实现语义和显著性信息的互补学习,引入KL散度设计分支蒸馏损失,分支间蒸馏以分布近似的方式实现分支间关键信息的初始融合,过滤语义无关的显著知识,用语义相关的显著知识补充贫瘠的语义知识,公式如式(9):(9)

,L表示本地分支,A表示与本地分支相对的另一分支, 表示基本分支,SA表示显著性感知分支;最后,将集合形式表示的 的组合代入公式(9),计算分支蒸馏总损失;

由于分支间蒸馏方法在过滤语义无关的显著性信息时,可能过多地关注最具判别性的片段信息,而忽略了其他语义相关信息;为此,设计类特定的动作一致性约束,如式(10)所示,实现过滤后语义和显著性信息的一致激活;

(10)

其中 ;

4)基于各分支伪标签挖掘出对应的关键片段和歧义片段,其中关键片段同时包含了关键语义和显著前景信息,而歧义片段中包含了矛盾的语义内容与前景显著性信息;基于上述片段,利用对比学习方法聚集关键片段的特征表示,并引导歧义片段特征在特征空间上靠近关键片段特征,获得更加准确的表示,最后结合融合动作序列的前k个高分动作的索引和时间类激活序列获得时序动作定位结果;

为了加深知识交互后每个分支对知识的理解和内化,基于每个伪标签之间的一致性和数值差异,为每个分支挖掘一致的关键片段和不一致的歧义片段;首先获取掩码,以获取分支之间一致和不一致的信息;公式如下:(11)

(12)

其中IC、CS分别表示不同的掩码类型;

然后将掩码 与每个代表序列S相乘,并在D维上求和获得降序排列的 ;

公式如下:

(13)

(14)

其中 表示片段类型, 分别表示动作片段和背景片段,表示掩码类型, 表示代表序列S中第t个片段在d维度上的分数值,表示在代表序列S的d维上所有片段中最大的分数值;

根据 ,分别选择 和 中的前k个实例,在两个分支中分别获取一致关键动作CKA、不一致模糊动作IAA、一致关键背景CKB和不一致模糊背景IAB。

2.如权利要求1所述的基于语义与显著性知识协同传播弱监督时序动作定位方法,其特征在于:步骤2)具体包括:显著性感知分支建立后用于从显著性前景特征中获取视频的显著性知识,首先,对显著性前景特征 进行预处理,得到,如式(5):

(1)

使用包含由一维卷积Conv1D和ReLU函数组成的特征提取器层 激活 获得显著性特征嵌入向量 ,如下式:(2)

将 输入到由 一维卷积Conv1D和ReLU函数组成的 层中获得,将 作为显著性感知分支的代表序列,如下式:(3)

在通道维度C上对 求和得到 ,如下式所示:(4)

其中 表示第t个片段在 中的分数, 表示 中第t个片段在通道c上的激活值;

为了更好地融合语义和显著性知识,加权融合时间类激活序列 与外观动作表示分数获得融合动作分数序列 ,并将该序列作为基本分支的代表序列,如式(5):(5)

其中, 表示融合的权重;

为了优化分类效果,将每个类别 的 个实例的集合表示为 ;根据 中片段选取的指标,聚合相应的类别激活序列区域,得到视频级类别预测 ;最后,交叉熵损失形式的视频分类损失 公式如式(6):(6)

其中, 是真实值。

3.如权利要求1所述的基于语义与显著性知识协同传播弱监督时序动作定位方法,其特征在于:步骤4) 还包括:在分支间和分支内,引入InfoNCE损失作为样本对比学习损失,通过对比学习促进知识在分支中的内化效果,公式如式(15):(15)

其中查询样本为 ,正样本为 ,负样本为 是温度超参数, 表示向量x的转置,M表示负样本片段的数量;对比学习样本对设置如式(16)、(17)所示:(16)

(17)

将上述式子代入式(15)中,分别获得分支间与分支内的对比学习损失 ;

最后,使用所有损失的和作为优化目标,公式如式(18):(18)

式中, 是相应的损失系数;

时序动作定位结果通过设置一个多元阈值提取融合动作分数 中的实例作为预测的候选动作提议,再对这些提议应用非极大值抑制方法去除重复的动作提议来获得。

4.如权利要求3所述的基于语义与显著性知识协同传播弱监督时序动作定位方法,其特征在于: 取值分别为1.8、2.0、0.015、0.02。

5.基于语义与显著性知识协同传播的弱监督时序动作定位装置,其特征在于,包括存储器和一个或多个处理器,所述存储器中存储有可执行代码,所述一个或多个处理器执行所述可执行代码时,用于实现权利要求1‑4中任一项所述的基于语义与显著性知识协同传播的弱监督时序动作定位方法。

6.计算机可读存储介质,其特征在于,其上存储有程序,该程序被处理器执行时,实现权利要求1‑4中任一项所述的基于语义与显著性知识协同传播的弱监督时序动作定位方法。