利索能及
我要发布
收藏
专利号: 2023107178004
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.结合注意力的多级时空特征融合行为识别方法,其特征在于,包括以下步骤:(1)获取需要识别的视频,对视频进行预处理操作获得图像;

(2)将预处理后的图像输入结合注意力的多级时空特征融合的人体行为识别网络中进行卷积神经网络训练;

(3)输出相应的人体动作分类结果。

2.根据权利要求1所述结合注意力的多级时空特征融合行为识别方法,其特征在于,所述预处理操作包括:将视频保持结构不变逐帧分解为图像,再随机抽取间隔的视频帧;

将图片按比例缩放并对图片随机裁剪为指定尺寸作为输入。

3.根据权利要求1所述结合注意力的多级时空特征融合行为识别方法,其特征在于,所述结合注意力的多级时空特征融合的人体行为识别网络包括输入层、3D卷积层、连续堆叠的多级时空特征融合基础模块、一个多频通道和时空注意力模块、池化层、分类层和输出层。

4.根据权利要求3所述结合注意力的多级时空特征融合行为识别方法,其特征在于,所述结合注意力的多级时空特征融合的人体行为识别网络的构建过程包括:构建所述多级时空特征融合基础模块和多频通道和时空注意力模块;

所述多级时空特征融合基础模块由三维卷积层和多级时空特征分解层两个部分构成,先将两个级联的3×3的二维卷积核进行三维拓展,转换为两个3×3×3的三维卷积核级联,再将第二个3×3×3的卷积核进行多级时空特征分解;

所述多频通道和时空注意力模块包括两个部分:多频通道注意力模块和时空注意力模块;

多频通道注意力模块和时空注意力模块使特征图在通道和时空的维度依次执行注意力机制,最后输出特征优化后的结果。

5.根据权利要求4所述结合注意力的多级时空特征融合行为识别方法,其特征在于,所述多级时空特征分解的过程包括:将输入特征X的C个通道均匀地分裂为S个特征子集,这S个特征子集记为xi,其中i∈{1,

2,…,S},通道数C′是输入特征通道数的 即 其中,x1子集不做变换,直接作为y1输出;其他子集xi各对应一个类残差结构的分支,每个分支均有一个3×3×3卷积核的3D卷

3×3×3

积,记为f ();xi经过3D卷积后生成的特征图记为yi,yi的表达式为:在多级时空特征分解的过程中,yi会被再次按通道分离为两组子特征图yi1和yi2,其中yi1直接拼接到最后的输出,yi2直接拼接到下一组特征图xi+1;多级时空特征分解层最后输出的时空特征表达式为:Y=cat[x1,y22,y32,…,y(i‑1)2,yi];所述多级时空特征融合基础模块的总输出为:Output=X+Y+Input。

6.根据权利要求4所述结合注意力的多级时空特征融合行为识别方法,其特征在于,所述多频通道和时空注意力模块分为两个部分:多频通道注意力模块和时空注意力模块;

所述多频通道注意力模块具体包括:首先将输入的特征图沿着通道维度被分为n个部

0 1 n‑1

分,每部分的特征图可表示为[X ,X ,···,X ],其中对每一个部分分配二维频率分量,那么最终的多频谱预处理向量可以通过拼接得到:

0 1 n‑1

Freq=cat([Freq,Freq,···,Freq ]),   (3)其中 多频通道注意力框架公式为:

Fc_att=sigmoid(fc(Freq))   (4)所述时空注意力模块具体包括:对于一个输入特征 先分别经过通道维度的最大池化和平均池化生成两个3D特征 和 再经过一个3D卷积生成3D时空注意力特征,

7×7×7

ST_att=sigmoid(f (cat[MaxPool(F),AvgPool(F)]))   (5)时空注意力框架公式为上式。

7.根据权利要求6所述结合注意力的多级时空特征融合行为识别方法,其特征在于,给定特征 作为多频通道和时空注意力模块的输入,输出相应的多频通道注意力特征后,再沿着时间和空间维度广播,通过时空注意力模块输出最后的注意力特征,整个注意力模块输出为上式。

8.根据权利要求4所述结合注意力的多级时空特征融合行为识别方法,其特征在于,将连续帧的图片输入该行为识别网络,经过若干个多级时空特征融合基础模块和多频通道和时空注意力模块经过最后的3D平均池化层,再由softmax输出最后的行为类别。

9.结合注意力的多级时空特征融合行为识别系统,其特征在于,包括预处理模块、网络构建模块、网络训练模块和输出模块;

所述预处理模块包括获取需要识别的视频,对视频进行预处理操作获得图像;

所述网络构建模块包括构建结合注意力的多级时空特征融合的人体行为识别网络;

所述网络训练模块包括将预处理后的图像输入结合注意力的多级时空特征融合的人体行为识别网络中进行卷积神经网络训练;

所述输出模块包括输出相应的人体动作分类结果。

10.根据权利要求9所述结合注意力的多级时空特征融合行为识别系统,其特征在于,所述结合注意力的多级时空特征融合的人体行为识别网络包括输入层、3D卷积层、连续堆叠的多级时空特征融合基础模块、一个多频通道和时空注意力模块、池化层、分类层和输出层;所述结合注意力的多级时空特征融合的人体行为识别网络的构建过程包括:构建所述多级时空特征融合基础模块和多频通道和时空注意力模块;

所述多级时空特征融合基础模块由三维卷积层和多级时空特征分解层两个部分构成,先将两个级联的3×3的二维卷积核进行三维拓展,转换为两个3×3×3的三维卷积核级联,再将第二个3×3×3的卷积核进行多级时空特征分解;

所述多频通道和时空注意力模块包括两个部分:多频通道注意力模块和时空注意力模块;

多频通道注意力模块和时空注意力模块使特征图在通道和时空的维度依次执行注意力机制,最后输出特征优化后的结果。