利索能及
我要发布
收藏
专利号: 2021113736634
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述基于时空上下文特征感知的三维人体姿态估计方法,包括:输入单目视频中连续F帧,检测出人体边界框,然后采用级联金字塔结构的二维人体姿态检测器对每一帧进行二维人体关节点坐标的检测,并组成一个二维人体骨架序列;

对二维人体骨架序列的每一个二维人体骨架进行归一化处理,对归一化处理后的二维人体骨架中关节点坐标进行升维,得到升维后的骨架特征;

将升维后的骨架特征输入到空间上下文感知模块,提取包含人体关节点间的几何依赖信息的依赖关系特征;

将依赖关系特征输入时间多层感知网络模块,在时间维度上进一步提取时间信息,得到时间上下文特征;

将时间上下文特征在时间维度均值化,然后进行归一化,接着通过一个全连接层,预测对应的三维人体姿态结果。

2.根据权利要求1所述的基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述对二维人体骨架序列的每一个二维人体骨架进行归一化处理,包括:对于二维人体骨架序列中的每一个二维人体骨架,每个关节点的二维坐标减去臀部关节点的二维坐标,从而得到归一化后的二维人体骨架。

3.根据权利要求1所述的基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述将升维后的骨架特征输入到空间上下文感知模块,提取包含人体关节点间的几何依赖信息的依赖关系特征,包括:

3.1)、首先根据预设的人体结构,通过以下公式,构建结构矩阵其中S(i,p)代表结构矩阵S中第i行,第p列的元素,MD(i,p)代表第i个人体关节点和第p个人体关节点间的流式距离,关节点间的流式距离由预设的人体骨架结构图所决定,K代表预定义的超参数。

3.2)、将结构矩阵S及升维后的骨架特征xnew输入空间上下文感知模块进行骨架特征学习,该空间上下文感知模块由N个相同结构的姿态编码器串联构成;结构矩阵S及升维后的骨架特征xnew经过第一个姿态编码器后得到特征矩阵,该特征矩阵与骨架特征xnew维度大小相同,后一个姿态编码器的输入为前一个姿态编码器输出的特征矩阵以及结构矩阵S;经过N个姿态编码器后,输出特征 将输出特征 经过LayerNorm层进行归一化,得到包含人体关节点间的几何依赖信息的依赖关系特征

4.根据权利要求3所述的基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述姿态编码器,执行如下操作:2

首先将结构矩阵S展平成维度为1×J的一维向量,并将其输入骨架注意力模块,其中骨2

架注意力模块由一层J 个神经元的全连接层和一层sigmoid激活函数组成,输出注意力向量

将输入的特征矩阵首先经过LayerNorm层,然后经过转置操作将维度变成Cs×J,接着经2

过一层包含J 个神经元的全连接层和一层GELU激活函数,得到中间特征其维度大小为Cs×2

J ,然后将该中间特征与注意力向量WAtt做元素乘法操作,得到注意力特征矩阵,最后将注意力特征矩阵经过一层包含J个神经元的全连接层得到骨架注意力特征矩阵WSA维度大小为Cs×J,最后将骨架注意力特征矩阵WSA经过转置操作将维度变成J×Cs并且与输入特征xnew相加,得到残差特征值WRa;

然后,将残差特征值WRa在经过LayerNorm层,以及一层包含Cs个神经元的全连接层和一层GELU激活函数,进一步学习骨架特征,最后再经过一层包含Cs个神经元的全连接层后将输出与残差特征值WRA相加,得到一个新的残差特征WNew_RA维度大小为J×Cs;WNew_RA即为当前姿态编码器输出的特征矩阵。

5.根据权利要求1所述的基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述将依赖关系特征输入时间多层感知网络模块,在时间维度上进一步提取时间信息,得到时间上下文特征,包括:

4.1)、将每一个二维人体骨架的依赖关系特征进行拼接,组成骨架特征序列,然后将骨架特征序列的第二、三维展平成一维,形成新骨架特征序列;

4.2)将新骨架特征序列输入时间多层感知网络模块,输出的特征进行归一化,得到时间上下文特征。

6.根据权利要求4所述的基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述时间多层感知网络模块由多个相同结构的多层感知混合器串联构成,每一个多层感知混合器执行如下操作:

首先经过LayerNorm层进行归一化,接着使用转置操作将输入特征维度变成Ct×F,接着经过一层包含Ds个神经元的全连接层,一层GELU激活函数和一层包含F个神经元的全连接层,得到中间特征其维度大小为Ct×F,接着将中间特征经过转置操作将维度变成F×Ct,并且与输入特征相加,得到残差特征值然后将残差特征值FT_Ra经过LayerNorm层进行归一化,以及一层包含Dc个神经元的全连接层和一层GELU激活函数,进一步学习时间特征,最后再经过一层包含Ct个神经元的全连接层后将输出与残差特征值FT_Ra相加,得到一个新的残差特征FNew_T_Ra维度大小为F×Ct,FNew_T_Ra即为当前多层感知混合器输出的时间特征矩阵。

7.根据权利要求1所述的基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述将时间上下文特征在时间维度均值化,然后进行归一化,接着通过一个全连接层,预测对应的三维人体姿态结果,包括:将时间上下文特征FTC首先经过LayerNorm层进行归一化,接着在时间维度进行均值化操作,得到最终的时间特征

将时间特征FT_Final再经过LayerNorm层进行归一化,然后紧跟一层包含J×3个神经元的全连接层得到最终的预测结果

8.根据权利要求1所述的基于时空上下文特征感知的三维人体姿态估计方法,其特征在于,所述基于时空上下文特征感知的三维人体姿态估计方法,还包括:构建损失函数:

其中γ代表预测的结果,代表真实数据结果,k代表人体骨架中第k个关节点。