利索能及
我要发布
收藏
专利号: 202310656613X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于时空域感知的视频动作质量评价方法,包括以下步骤:

1)对输入视频进行时空分片处理,分成视频片段集合p和关键帧片段集合x;

2)提取视频片段集合p的多速率运动特征,然后通过快特征与慢特征的插值对齐模块得到时域运动特征;

3)提取关键帧片段集合x的多尺度空间特征,然后通过多尺度特征对齐模块得到对齐后的空域特征;

4)融合对齐后的时域运动特征与空域特征得到一个具有时空感知特性的视频动作质量特征,然后进入质量回归模块得到视频动作质量评价分数;

步骤1)具体包括:对输入视频进行时空分片处理,分成视频片段集合p和关键帧片段集合x;输入视频V被分割成Nk个包含在向量 中的连续片段;每个视频片段pi包括Nf帧:pi={fi,j};在每个视频片段中选择一帧关键帧fi,1来提取空间特征,使用pi中的所有帧提取运动特征;

所述步骤2)具体包括:提取视频片段集合pi的多速率运动特征,然后通过快特征与慢特征的插值对齐模块得到时域运动特征;使用预训练的慢‑快动作识别模型SLOW‑FAST获取每个视频片段的动作特征;SLOW‑FAST模型分别通过Slow和Fast分支提取慢速率特征和块速率特征信息,使得动作识别网络的特征表示能够有效反映视频中主体的运动信息;

因此,给定一个视频片段pi(i∈{1,2,3,...,Nc}),使用动作识别网络分别得到慢速率和快速率特征 和 通过连接这些特征,得到慢速率特征集和快速率特征集:随后,将注意力机制应用于不同运动速率Xslow,Xfast的输入特征,通过学习注意力权重s t和执行多个运动特征的加权求和,得到多种速率自适应地对齐运动特征F,F:Watt=Softmax(ReLu(Con1(Xslow)+Conv2(Xfast)))   (2)其中Conv1(·)和Conv2(·)是两个具有单一内核大小的二维卷积核,ReLu(·)和Softmax(·)是激活函数,Watt是注意力权重;为了获得在时间维度上具有相同大小和采样s t率的数据,使用多速率插值方法进行插值和对齐;对于每个时间戳t,对处理后的特征F,F进行插值和对齐,以获得该时间戳的对齐特征:其中 是SLOW‑FAST网络在视频帧t处提取的特征,s和f分别代表慢路径和快路径,ri是路径第i帧的时间采样率, 表示第i帧中最接近t的时间戳;vi(t)是通过线性或最近邻插值得到的插值系数如下:最后,将慢速率路径和快速率路径对齐的特征按照一定的比例α进行融合,得到最终的视频运动特征表示:所述步骤3)具体包括:提取关键帧片段集合的多尺度空间特征,然后通过多尺度特征对齐模块得到对齐后的空域特征;使用预训练的残差神经网络模型ResNet提取空间特征,获得了对单帧空间分辨率具有鲁棒泛化能力的特征表示;不同大小和深度的空间域卷积可以捕获不同类型的语义信息,考虑输入帧pi和阶段特征Xs,定义Xs作为卷积神经网络模型CNN在阶段s(s∈1,2,3,4)的多尺度输出:Xs=CNNs(Xs‑1)   (7)

多尺度通道注意模块使用通过改变空间池大小获得的多个尺度的通道注意力来对齐不同尺度的特征;为了提升计算效率,选择逐点卷积来实现局部上下文聚合,它只利用每个空间位置的逐点通道交互;给定的多尺度特征X={X1,X2,X3,X4},多尺度通道注意模块的输出定义如下:其中L(X)和G(X)分别表示多尺度通道注意模块使用的局部和全局信道上下文, 表示广播加法, 表示逐元素乘法,σ是一个sigmoid( )激活函数;注意权重L(X)和G(X)定义如下:(1) (2) (3) (4)

其中W 、W 、W 和W 是四个可学习权重的卷积层,δ表示ReLU激活函数, 表示为批量归一化, 表示全局平均池化:

2.如权利要求1所述的一种基于时空域感知的视频动作质量评价方法,其特征在于:步骤4)具体包括:融合对齐后的时域运动特征与空域特征得到一个具有时空感知特性的视频动作质量特征,然后进入质量回归模块得到视频动作质量评价分数;使用特征提取以及特征对齐模型获得时空感知特征表示,随后使用多层感知器将这些特征映射到质量回归模型以计算相应的质量分数:Qfinal=MLP(Concat(Fmotion,X′))   (12)其中Qfinal表示预测分数,通过结合时域运动和空域信息,质量回归模型的最终质量回归层的输入包括表征人类对视频内容感知的两个主要信息流;

在训练阶段,使用两个损失函数来优化所提出模型的性能,即平均绝对误差损失MAE和RANK损失定义如下:其中i和j是批次中标识视频的索引,N是批次中的视频数量, 定义如下:随后,LRANK计算如下:

最后求和得到损失函数:

L=LMAE+λ·LRANK   (17)

其中λ是平衡MAE和RANK损失的超参数。