1.一种基于决策网络和细化特征的高效人体姿态估计方法,包括如下步骤:
(1)获取大量包含有多个人物的图片,并对图片中人物的关节点位置进行标注;
(2)将所有图片按比例划分成训练集、验证集和测试集;
(3)构建CFPose模型框架,其包括:
骨干网络,用于对输入图片进行视觉特征提取,并将提取得到的特征图通过切分、展平、线性映射生成一系列的视觉令牌和关键点令牌;
粗粒度决策网络,用于对每条视觉令牌进行重要性打分,将重要性得分较低的视觉令牌去除掉,以此来初步裁剪出人体的掩膜;
粗粒度特征编码模块,用于将关键点令牌与筛选保留下来的视觉令牌拼接后进行粗编码推理,使关键点令牌充分感知到粗粒度特征中所蕴含的信息;
细粒度决策网络,用于对筛选保留下来的视觉令牌进一步切分并进行重要性打分,再将重要性得分较低的视觉令牌去除掉;
细粒度特征编码模块,用于将粗粒度特征编码模块输出编码信息中的关键点令牌与二次筛选保留下来的视觉令牌拼接后进行细编码推理,使关键点令牌充分感知到细粒度特征中所蕴含的信息;
MLP模块,用于根据细粒度特征编码模块输出编码信息中的关键点令牌通过热图法解码出输入图片中各关节点位置坐标的预测结果;
(3)利用训练集图片及其标注信息对上述CFPose网络模型进行训练;
(4)将测试集图片输入至训练好的CFPose网络模型中,即可预测出该图片中人物各关节点的位置坐标。
2.根据权利要求1所述的高效人体姿态估计方法,其特征在于:所述骨干网络只选用经ImageNet数据集预训练过的HRNet网络的前三个阶段对输入图片进行特征提取生成特征图,进而将每个通道的特征图切分成 个网格,Ph和Pw分别为网格的高和宽,然后将每个网格沿着通道维度展平成长度为Ph×Pw×C的一维序列,进而将展平后的序列通过线性层映射为视觉令牌,共得到N条视觉令牌,同时初始化M个关键点令牌,其序列长度与视觉令牌一致,其中 M为输入图片中的关节点数量,H、W、C分别为特征图的高度、宽度、通道维度。
3.根据权利要求1所述的高效人体姿态估计方法,其特征在于:所述粗粒度决策网络采用自注意力机制来计算评估每条视觉令牌的重要性得分,将重要性得分排名靠后的视觉令牌进行裁剪,只保留重要性得分排名靠前的视觉令牌。
4.根据权利要求1所述的高效人体姿态估计方法,其特征在于:所述粗粒度特征编码模块由多层Transformer级联组成,其输入为裁剪保留的视觉令牌以及初始化生成的关键点令牌拼接组成,每层Transformer由正则化层L1、多头自注意力机制层、正则化层L2、前馈神经网络依次连接组成,其中正则化层L2的输入为多头自注意力机制层的输出与正则化层L1的输入叠加而成,前馈神经网络的输出与正则化层L2的输入叠加后作为Transformer的输出。
5.根据权利要求1所述的高效人体姿态估计方法,其特征在于:所述细粒度决策网络的具体操作过程为:对于粗粒度决策网络筛选保留下来的视觉令牌,将这些视觉令牌对应的特征图网格进一步均匀划分成2×2个小网格,然后将每个小网格沿着通道维度展平后通过线性层映射为视觉令牌,相当于1条视觉令牌裂变成4条视觉令牌;最后采用自注意力机制来计算评估每条视觉令牌的重要性得分,将重要性得分排名靠后的视觉令牌进行裁剪,只保留重要性得分排名靠前的视觉令牌。
6.根据权利要求1所述的高效人体姿态估计方法,其特征在于:所述细粒度特征编码模块由多层Transformer级联组成,其输入为粗粒度特征编码模块输出编码信息中的关键点令牌与细粒度决策网络筛选保留下来的视觉令牌拼接组成。
7.根据权利要求4所述的高效人体姿态估计方法,其特征在于:所述多头自注意力机制层由多个Self‑Attention组成,每个Self‑Attention将多头自注意力机制层的输入分别与Q K V线性变换矩阵W 、W和W 相乘对应得到查询向量矩阵Q、键向量矩阵K、值向量矩阵V,然后通过以下公式计算出Self‑Attention的输出结果,最后将多个Self‑Attention的输出结果拼接后经过线性层即得到多头自注意力机制层的输出;
其中:Attention(Q,K,V)为Self‑Attention的输出结果,s为查询向量矩阵Q的列数,T表示转置。
8.根据权利要求1所述的高效人体姿态估计方法,其特征在于:所述热图回归模块以细粒度特征编码模块输出编码信息中的关键点令牌为输入,进而通过多层感知机将其重新映射回二维的热图形式,在多层感知机中首先将关键点令牌映射回二维生成热图P,其尺寸为* * * *M×H ×W,H和W 分别为输入图片高度H和宽度W的1/4;最后将热图P重塑成M张热图,且热图尺寸与原图一致,在此基础上通过在热图上找到最大响应位置来定位人体的各关节点坐标。
9.根据权利要求1所述的高效人体姿态估计方法,其特征在于:所述步骤(4)的具体实现方式如下:
4.1初始化模型参数,包括每一层的偏置向量和权值矩阵、学习率以及优化器;
4.2将训练集的图片输入至模型,模型正向传播输出得到对应的预测结果即关节点位置坐标,计算该预测结果与标注信息之间的损失函数;
4.3根据损失函数利用优化器通过梯度下降法对模型参数不断迭代更新,直至损失函数收敛,训练完成。