1.一种基于骨骼信息的分组混淆图卷积动作识别方法,其特征在于,包括以下步骤:步骤(1)、数据预处理,提取多个输入特征;
输入特征为骨骼点即节点的坐标信息,节点的坐标表示为(x,y,z),每个人的节点个数都是固定的,时序上每个人都取300帧;除了节点信息外,还需要计算关节的信息,即边的信息,其值为同一帧内相邻节点的差值;在用图像作为输入特征的时候,需要计算相邻图像帧之间的光流即计算相邻帧之间的差值作为另外的特征,计算节点和边相邻图像帧之间的光流,即相邻帧之间的差值,作为第三、四个输入特征;将节点表示为joint,边表示为bone,节点的光流表示为joint motion,边的光流表示为bone motion;
步骤(2)、构建基于骨骼信息的分组混淆图卷积网络GS‑GCN;
所述的基于骨骼信息的分组混淆图卷积网络采用多个分组混淆图卷积模块堆叠形式;
在空间上,由于输入特征是一个图结构的形式,所以使用图网络来提取节点之间的信息;在基于人体固有的骨骼结构的基础上增加分组结构,每个分组用来生成不同的图结构,以此来表示丰富的动作行为;在时序上,采用深度可分离卷积来降低参数和计算量,同时获得更大的时序依赖;由于在空间上进行图卷积和时序上进行深度可分离卷积都采用分组,所以最后需要对分组进行混淆,将不同分组的信息进行融合,以达到信息的流通;
步骤(3)、基于骨骼信息的分组混淆图卷积网络训练过程:
在训练时,首先输入特征,然后采用反向传播算法来更新模型的参数,最后采用交叉熵函数作为损失函数;由于有四个不同的输入特征,因此需要训练四个网络;
步骤(4)、测试模型性能
在测试数据上对基于骨骼信息的分组混淆图卷积网络进行测试;对于四个输入特征,首先得到每个输入特征的分类结果,然后将这4个分类结果相加得到最终的分类结果。
2.根据权利要求1所述的一种基于骨骼信息的分组混淆图卷积动作识别方法,其特征在于,步骤(1)描述的数据预处理的过程具体如下:t 3×N
输入的为节点的三维坐标(x,y,z),即J∈R ,一共有300帧,采用 来表示节点信息,将这个特征作为一个stream流;用 来表示边的信息,每一条边都是一个向量节点指向另一个向量节点,则边的特征即为目标节点与起始节点的差值,也将这个也作为一个stream;为了获取时序上的信息,需要得到节点的光流joint motion,通过 计算得到,表示节点之间的时序移动;通过 计算得到边的光流bone motion。
3.根据权利要求2所述的一种基于骨骼信息的分组混淆图卷积动作识别方法,其特征在于,步骤(2)所述的分组混淆图卷积模块具体如下:V×V
将骨骼看成一个图的结构,假设一个图G={V,E}由V个节点和E条边组成,采用A∈RC×T×V来表示节点之间的关系;F∈R 为输入到图网络中的特征,其中T是时序维度,C是通道数,则图卷积操作能够表示为:其中K为根据ST‑GCN设置的空间卷积核的个数,F和Y分别是输入和输出,W表示学习的ii ij参数,A是邻接矩阵,Λ是度矩阵,每个节点的度能够由Λ=∑jA +α计算得出,A 代表邻接矩阵A中i个节点和第j节点的关系,而α是为了避免出现0值;
所述的分组混淆图卷积模块包括分组图卷积GSC和深度可分离卷积DSC;
所述的分组图卷积GSC具体如下:
C×V×V c
首先,将动态图Gdynamic∈R 进行分组,即Gdynamic=CONCAT{G1,G2,...,Gg},Gi∈R×V×V,i=1,2,...,g,其中c=C/g,g代表组数,同一组的所有动态图都是相同的;同时将输入C×T×V c×T×V的特征F∈R 进行分组,即F=CONCAT{F1,F2,..,Fg},其中Fi∈R ,i=1,2,...,g,c=C/g;通过这样的形式,就能够对每个分组分别进行图卷积计算,即:Yi=(Gi+Gstatic)FiWi,i=1,2,...,g
Y=CONCAT{Y1,Y2,...,Yg}
其中,Gstatic为人体固有的骨骼结构图,Wi是第i个分组的卷积核参数,不同分组的卷积核参数是不同的;
由于图卷积运算是在每个分组上进行的,所以不同分组是相互隔离的,会导致信息流通不畅,因此,需要对不同分组的通道进行混淆shuffle;
在进行分组混淆图卷积之后,将不同分组的通道进行shuffle,来达到信息的流通;假设有g个分组,每个分组有n个通道,则一共有g*n个通道,需要将每个分组的的通道进行划分,将其分为n/g个子分组,然后需要将每个分组的子分组shuffle到其他的分组当中,这样每个分组都会包含其他分组的信息,达到了信息的融合;
在时序上采用深度可分离卷积DSC单独对每个通道进行卷积计算,以此来降低模型的参数量和计算量,为了融合所有通道的信息,还需要加上一个1*1的卷积层;
在时序上采用的深度可分离卷积也是分组的,因此也要进行一次shuffle。
4.根据权利要求3所述的一种基于骨骼信息的分组混淆图卷积动作识别方法,其特征在于,步骤(3)分组混淆图卷积网络训练过程:整个分组混淆图卷积网络采用多个分组混淆图卷积模块堆叠形式,属于端到端的形式,损失函数采用交叉熵损失函数;由于有四个不同的输入特征,因此需要训练四个网络;
训练过程中分为前向和反向两个阶段,前向就是输入特征,与模型参数进行计算,得到最后的分类结果,然后再进行反向计算,更新模型参数值,也就是反向传播算法;刚开始训练时设置大的学习率,然后随着训练次数的增加,将学习率减小,最后当精度变化趋于平稳的时候,停止训练,此时图卷积网络模型就已经达到了收敛。
5.根据权利要求4所述的一种基于骨骼信息的分组混淆图卷积动作识别方法,其特征在于,步骤(4)测试模型性能具体如下:对于四个输入特征,每个输入特征对应一个分类结果,分类结果为通过softmax函数来获取在所有类别上值最大所对应的类别,最终的分类结果由四个分类结果相加而成;计算最终的分类结果Top1和Top5的值,然后再计算模型的参数量和计算量。