1.一种基于多级融合与判别网络的二维人体姿态估计方法,包括如下步骤:
(1)获取含有人物的图片,并对图片中人物的关节点位置进行标注;
(2)构建MADN网络模型框架,其包括骨干网络、令牌生成器、特征融合模块、判别器网络、高效Transformer模块以及热图回归模块,其中:所述骨干网络用于对输入图片进行视觉特征提取;
所述令牌生成器用于将骨干网络提取得到的不同层次的特征图切分为若干个补丁,并沿着通道维度对补丁进行拼接并拉直为一维序列的形式,最后通过线性层将该一维序列转化为所需要的视觉令牌;
所述特征融合模块用于将不同层次的视觉令牌进行拼接操作,以此来达到融合不同层次的视觉特征的目的;
所述判别器网络用于对拼接后的每条视觉令牌进行置信度打分,分数的大小决定了视觉令牌所包含特征的重要程度,将置信度分数排名后30%的视觉令牌去除掉,以此来初步裁剪出人体的掩膜;
所述高效Transformer模块用于对输入的Token进行编码,并配合判别器网络对内部不同阶段的Transformer进行剪枝,并将置信度分数排名后30%的视觉令牌融合成一个新的视觉令牌,以此在加速Transformer的同时,精度不会有损失;
所述热图回归模块用于根据编码结果通过热图法解码出输入图片中各关节点位置坐标的预测结果;
(3)利用步骤(1)中获得的图片及其标注信息对上述MADN网络模型进行训练;
(4)将包含人物的待估计图片输入至训练好的MADN网络模型中,即可预测出该图片中人物各关节点的位置坐标。
2.根据权利要求1所述的二维人体姿态估计方法,其特征在于:所述骨干网络只选用经ImageNet数据集预训练过的HRNet网络的前三个阶段即HRNet‑s,其参数量仅为原来的25%,具体操作为:首先将输入图片裁剪成统一尺寸后送入到HRNet‑s中进行特征提取,输出高中低三个不同层次的特征图,对于第i个层次的特征图,其高度 和宽度 分别为:;
其中:H和W分别为输入图片的高度和宽度。
3.根据权利要求2所述的二维人体姿态估计方法,其特征在于:所述令牌生成器的具体操作过程如下:首先,对于第i个层次的特征图,将其切分成 个网格,每个网格的尺寸大小为 ,;
然后,对每个网格进行拉直操作并沿着通道维度进行拼接,生成 个一维序列,每条一维序列的长度为 , 为第i个层次特征图的通道数;
最后,采用全连接的形式将所有一维序列重新映射,生成第i个层次特征图的视觉令牌,其大小为 , 表示第i个层次的视觉令牌数量,L为视觉令牌的长度。
4.根据权利要求3所述的二维人体姿态估计方法,其特征在于:所述判别器网络的具体操作过程为:首先将多个层次拼接后的视觉令牌依次经过多层感知机和Softmax函数,得到一个N维的权值向量,其包含了每条视觉令牌的置信度分数, ;最后根据权值向量将置信度分数排名后30%的视觉令牌进行裁剪,只保留前70%的视觉令牌并对其进行位置编码。
5.根据权利要求1所述的二维人体姿态估计方法,其特征在于:所述高效Transformer模块由多层Transformer级联组成,其输入为裁剪保留的视觉令牌以及初始化生成的关键点令牌组成,每层Transformer由正则化层L1、多头自注意力机制层、正则化层L2、前馈神经网络依次连接组成,其中正则化层L2的输入为多头自注意力机制层的输出与正则化层L1的输入叠加而成,前馈神经网络的输出与正则化层L2的输入叠加后作为Transformer的输出。
6.根据权利要求5所述的二维人体姿态估计方法,其特征在于:所述高效Transformer模块中部分Transformer层前设置有判别器网络,其用于对输入Transformer的Token中的视觉令牌进行置信度打分,将置信度分数排名后30%的视觉令牌融合成一个新的视觉令牌。
7.根据权利要求5所述的二维人体姿态估计方法,其特征在于:所述多头自注意力机制层由多个Self‑Attention组成,每个Self‑Attention将多头自注意力机制层的输入分别与Q K V线性变换矩阵W 、W和W 相乘对应得到查询向量矩阵Q、键向量矩阵K、值向量矩阵V,然后通过以下公式计算出Self‑Attention的输出结果,最后将多个Self‑Attention的输出结果拼接后经过线性层即得到多头自注意力机制层的输出;
;
T
其中: 为Self‑Attention的输出结果,s为查询向量矩阵Q的列数,表示转置。
8.根据权利要求1所述的二维人体姿态估计方法,其特征在于:所述热图回归模块只取关键点令牌作为输出,进而通过多层感知机将其重新映射回二维的热图形式,具体地:在高效Transformer模块的最后阶段,只取关键点令牌作为输出,将其送入到多层感知机中,在多层感知机中首先将关键点令牌映射回二维生成热图P,其尺寸为 ,和 分别为输入图片高度H和宽度W的1/4,M为关键点令牌的数量;最后将热图P重塑成M个热图,且热图尺寸与原图一致,在此基础上通过在热图上找到最大响应位置来定位人体的各关节点坐标。
9.根据权利要求1所述的二维人体姿态估计方法,其特征在于:所述步骤(3)的具体实现方式如下:
3.1 初始化模型参数,包括每一层的偏置向量和权值矩阵、学习率以及优化器;
3.2 将含有人物的图片输入至模型,模型正向传播输出得到对应的预测结果即关节点位置坐标,计算该预测结果与标注信息之间的损失函数;
3.3 根据损失函数利用优化器通过梯度下降法对模型参数不断迭代更新,直至损失函数收敛,训练完成。