1.一种基于文本监督的人体动作识别方法,其特征在于,包括如下步骤:步骤1:从人体关节数据集中获取图数据G=(V,E),其中,节点集V={vt,i | t=1,2, …,T, i=1,2, …,N}表示骨架序列中的所有关节,由视频第t帧中人体第i个骨骼关节坐标组成;
边集E由两个子集组成,第一个子集为每一帧不同骨骼关节点连接,第二个子集为连续帧之间相同关节点的连接;
步骤2:将图数据输入到骨骼关节点编码网络中,得到骨骼关节点特征向量,具体步骤为:步骤2.1:将图数据转化为网络训练输入的骨骼关节点特征fin,形状为:(M, T, N, C),其中,M为识别动作人数,T表示动作的帧数,N表示人体关节点的数量,C为特征通道数,表示V的关节点坐标;
步骤2.2:将人体骨骼关节点特征fin输入到图Transformer网络模块中进行特征学习,图Transformer网络模块包括全连接嵌入层,自注意力层和多层感知机;图Transformer网络模块的计算使用如下公式描述:(1);
(2);
(3);
其中,式(1)为全连接嵌入层,A表示骨架关节图的邻接矩阵,Linear表示线性计算,Concat表示拼接操作;式(2)为自注意力层,SA表示自注意力模块,LN表示层归一化;式(3)为多层感知机,MLP表示多层感知机计算,fgcn_in为图卷积模块的输入;
步骤2.3:输入特征学习后的关节点特征到图卷积网络模块,输入的数据经过9个GCN单元,每经过一个GCN单元将特征dropout,其中前三层的输出有64个通道,中间三层有128个通道,最后三层有256个通道,每个GCN单元包括:注意力模块,图卷积模块,时间卷积模块;
经过全局平均池化得到骨架特征向量;
步骤3:根据人体关节点数据对应动作标签生成文本描述,输入到文本编码器网络中,得到文本特征,具体步骤为:步骤3.1:使用带有前缀和后缀的文本模板来生成文本描述,前缀模板为[label], this is an action,后缀模板为Human action of [label],其中[label]为人体动作标签;
步骤3.2:输入文本描述到文本编码器得到文本特征向量,文本编码器包含12个Transformer模块,每个模块包含一个多头自注意力层和前馈网络层,每个模块中间还有层归一化和残差连接;文本编码结构公式表示为:(4);
其中 表示第l层的第t个时间步的隐状态,FNN为前馈神经网络模块;
步骤4:将骨架特征向量和文本特征向量进行相似度计算,根据动作标签的相似度大小得到动作分类结果。