1.一种基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,包括如下步骤:
S1、利用图卷积网络提取单帧人体姿态的空间结构特征,以及不同帧之间同一个关节点的运动轨迹特征;
S2、构建特征拼接网络模型,用于提取长时程多帧图像序列中的时空特征来识别视频中的复杂行为以及构建行为的整体特征;
S3、将姿态空间结构信息和关节点轨迹特征映射到描述符中,与征拼接网络模型的行为特征进行特征融合;
S4、将得到的行为姿态关节点特征、行为融合特征通过支持向量机分类器,经过加权融合的方式输出该视频行为的分类结果。
2.根据权利要求1所述的一种基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,所述步骤S1包括:利用姿态关节点定位算法,提取视频行为数据集中每个视频的视频帧中有序的人体骨骼关节点;
将每个视频级的关节点处理成(C,N,V,M)维的数组作为时空图卷积网络的输入,C表示通道数,N表示视频的帧数,V表示关节点个数,M表示人数;
将N重复扩展为150帧,将数据进行扩增和正则化后输入到图卷积网络进行行为特征的提取和分类,所述图卷积网络的多层时空图卷积分为若干卷积部,分别对应不同的输出通道。
3.根据权利要求2所述的基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,所述人体骨骼关节点包括:左眼、右眼、鼻子、人体脖子、胸部、头部、右肩、左肩、右臀部、左臀部、右手肘、左手肘、右膝盖、左膝盖、右手腕、左手腕、右脚踝和左脚踝。
4.根据权利要求1所述的一种基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,所述步骤S2包括:基于卷积神经网络构建用于提取行为数据集中每个视频的彩色图像序列空间信息的特征拼接网络模型;将每个视频的彩色图像序列按照连续多帧分为若干片段,片段输入特征拼接网络模型,先经过模型第一特征处理部提取每个片段连续帧的时空特征,再由模型第二特征处理部拼接生成每个视频片段的整体时空特征,并将每个视频片段的整体时空特征按片段顺序串接形成视频的整体时空特征。
5.根据权利要求4所述的一种基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,所述由模型第二特征处理部拼接生成每个视频片段的整体时空特征,并将每个视频片段的整体时空特征按片段顺序串接形成视频的整体时空特征的具体方法为:将64帧的视频帧按顺序平均分为4个视频片段,将卷积神经网络的第一特征处理部获取的连续16帧片段的时空特征以每4帧作为一个单位,每个单位的4帧图像以2×2形式拼接为小块的整体时空特征;
每个小块的整体时空特征是三维的,保持第三维深度不变,将第一维长度和第二维宽度拼接,使连续16帧片段的时空特征转化为4个小块的整体时空特征;
4个小块的整体时空特征的第三维深度不变,将第一维长度和第二位宽度扩大一倍,再经过卷积池化后,将4个小块的整体时空特征以2×2形式拼接为片段的整体时空特征;
将各片段的整体时空特征按片段顺序串接,最终形成整个视频的整体时空特征。
6.根据权利要求4所述的一种基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,所述特征拼接网络模型采用Kinetics数据集预训练参数加快每路卷积神经网络收敛速度,进行迁移学习。
7.根据权利要求5所述的一种基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,所述步骤S3包括:在图卷积网络的第二卷积部以及特征拼接网络的第二特征处理部引入侧连接结构,将图卷积网络的特征图经过卷积层维度变换后与特征拼接网络特征在时间维度进行连接;将图卷积网络的最后一层卷积层输出的特征与特征拼接网络模型经过特征拼接后的整体时空特征进行串接,串接后的特征输入到3D卷积网络中,在卷积网络全连接层的前一层提取特征融合后的语义信息。
8.根据权利要求7所述的一种基于姿态关节点的长时程快慢网络融合的行为识别方法,其特征在于,所述特征串接的方法如下:在图卷积网络的第二卷积部输出的特征经过反卷积操作,将特征图的大小与3D卷积网络第二特征处理部所得特征图的大小尺寸保持一致,在时间维度保持原来通道数的大小,将特征进行串接作为3D卷积网络下一层的输入。