1.一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于,所述方法包括以下步骤:步骤1)根据待检测运动识别视频,生成待测骨骼点坐标时间序列,同时根据设定的人体骨架图像建立图邻接矩阵,并将其拆分成若干个矩阵Ak;
步骤2)对骨骼点坐标时间序列进行预处理得到输入Z;
步骤3)构建时空自适应特征融合图卷积网络模型,时空自适应特征融合图卷积网络模型包括自适应图卷积网络AGCN模型与时间通道聚合图卷积网络TCA‑GCN模型,将步骤2)中得到的输入Z分别输入到两个模型中,得到不同层次的时空特征并拼接作为输出;
步骤4)构建多分支特征融合框架,多分支特征融合框架中引入Transformer整合两个分支网络提取的异质特征,并自适应地增强其互补性和表达能力,实现对复杂序列数据的深度理解;
步骤5)从待测骨骼点坐标时间序列中提取关节坐标、骨骼方向和长度数据,将提取的数据输入到时空自适应特征融合图卷积网络中进行训练,获取对应的初始识别结果和softmax分数,最终通过权重相加的方式融合输出最后的结果。
2.如权利要求1所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于:在所述步骤1)中,邻接矩阵的拆分基于以下公式:A+I=∑kAk,其中,Ak分别表示与其距离为k的邻接矩阵,且A0=I,A1=A。
3.如权利要求2所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征u在于:在所述步骤2)中,对骨骼点坐标时间序列使用内核Γ 进行时间卷积得到时间特征,并将其与原序列进行拼接以求提取时空特征;所有预处理表示为:其中, 为处理后的视频表示,*表示时间卷积,T表示时间序列的长度,Nu
代表节点的数量,C表示特征通道的数量,C表示用于时间卷积的滤波器个数,V表示骨骼点坐标时间序列,*和 分别表示时间卷积和特征拼接。
4.如权利要求2所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于:在所述步骤3)中,为从人体骨骼的拓扑结构中提取空间特征,将结果进行图卷积,具体如下:应用归一化的嵌入高斯函数去计算两个关节点之间的相似度,计算过程表达如下:其中,vi,vj代表两个不同节点,N是节点个数;设P表示嵌入高斯函数后计算出的相似度矩阵,则新的邻接矩阵表示为:
5.如权利要求4所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于:在所述步骤3)中,时空图卷积网络模型包括BN层、多尺度图卷积模块;多尺度图卷积模块包括九层特征提取模块,各层特征提取模块包括第二残差模块,及依次连接的自适应空间域图卷积单元、激活函数、注意力模块、时间域图卷积单元;第二残差模块的输入端与自适应空间域图卷积单元的输入端相连接,输出端与第一特征提取单元相连接,第一特征提取单元用于执行相加操作。
6.如权利要求4所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于:在所述步骤3)中,时间通道聚合图卷积网络TCA‑GCN模型采用通道拓扑建模来动态获T取空间的通道拓扑,其包括相关建模函数和细化函数;相关建模函数使用输入特征X∈R×N×C 1对关节之间的通道相关性进行建模,获得通道特定相关性 C 表示特定的通道数量;细化函数将通道相关Q与由空间配置划分得到的邻接矩阵相加,得到通道拓扑具体方法公式如下:S=α·Q+μ(Ak) (4)
其中,Ak为第k个通道邻接矩阵,μ(*)表示为三阶邻接矩阵的归一化和维度变换运算,α为可训练参数,Q表示连接强度。
7.如权利要求4所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于:在所述步骤3)中,时间通道聚合图卷积网络TCA‑GCN模型聚合时,基于时间自适应权值聚合方法处理时间维度的骨架特征;所述时间自适应权值聚合方法基于输入特征,在时间维度上生成校准后的权值,并将其与时间维度上的先验拓扑进行聚合,从而完成时间动态拓扑表示;具体如下:T×N×C
首先以骨架序列生成时间权重作为输入X∈R ,使用生成函数与初始权值相乘,进行维度变换生成时间权值,与先验拓扑进行时间聚合,得到新的高维特征表示如式所示:Aout=TA(W,X)=(W1X1)||...||(WTXT) (5)其中,W1X1表示为: TA(*)表示聚合函数,w(j)代表生成函数,x(j)代表初始权值W(*)表示降维函数, 为时间权重特征,其表达式为:W=αt·W0 (6)
其中,αt=G(x1,...,xt),αt是带有输出通道的校准权值,采用基于骨骼特征的不同维度方法, 是初始权值;在通道维度上进行聚合时,通道维度的图卷积表示如下:其中,Aout为自适应聚合的输出特征,Bi表示vj的节点范围,S为通道方向拓扑的输出特征,vi为第i个节点,vj为第j个节点,最终输出结果 表示如下:其中, 表示为: CA为通道聚合函数。
8.如权利要求2所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于:在所述步骤4)中,建立Transformer融合网络模型,将步骤3)中两个模型输出的异质特征进行整合,输出融合结果;具体如下:两个模型的输出特征通过一个基于多头交叉关注的Transformer网络融合;使用m‑head交叉注意,Transformer的运算过程表示为:其中,CAj为j头部交叉注意,BQj为 扮相的线性投影;EKj和EVj是 的线性投影,dim代表BQj和EKj的维度,W′是多头注意力的权重矩阵;然后使用一个线性层,接着进行一个Tanh激活,将剩余连接和前馈层叠加,其表达式为:其中,FFN代表前馈网络;计算OF与标签之间的损失,其表达式为:
OF=tanh(Linear(F,θF)) (13)
Linter=MSE(OF,Y) (14)
其中,Linter是总损失函数,Y表示标签。
9.如权利要求2所述的一种基于多分支融合图卷积网络的健身动作识别方法,其特征在于:在所述步骤5)中,对本框架进行实验验证,建立一个四流框架,四流框架中每四个时空图卷积网络模型为一组,分别对应关节流J‑Stream、骨骼流B‑Stream、骼流J‑M‑Stream、关节运动流B‑M‑Stream四种流态数据;步骤5)的具体过程如下:
1)将关节坐标、骨骼方向和长度数据分别输入到独立的四个流中进行处理;
2)把待识别的人体行为视频转化为四种流态数据,并输入训练好的时空图卷积网络模型,从而获取对应的初始预测结果和softmax分数,得到动作分数;
3)预测动作标签。