1.一种基于多尺度特征强化的2D人体姿态估计方法,其特征在于,所述方法包括以下步骤:
1)获取高表征能力的抽象特征:
将预处理后的图片输入ResNeSt骨干网络,通过分离注意力模块对不同维度的特征进行跨通道交互,去掉最后的分类层并输出四个阶段的特征;
2)构建多级预测网络:
通过步骤1)获取四个分辨率不同的特征,对于这四个阶段的特征构建一个强化特征的功能金字塔,由于顶层特征点在传播过程中损失了较多的语义信息,所以使用特征强化策略对高层特征进行融合强化;
3)构建高分辨率调整网络:
构建一个高分辨率调整网络对前一个阶段预测损失较大的关键点进行位置调整,通过转置卷积对多级预测网络的中的特征进行上采样,很好地结合上采样和卷积操作,对扩张后的特征进行级联操作,为较小尺度的关键点引入了较为丰富的空间细节;
4)整体网络的训练设置:
将所有输入图片设置为4:3的高宽比,然后使用人体检测器获取每张图片中的人体实例,输入的实例尺寸设置为384×288,使用MSE损失函数对训练过程中误差进行梯度回传;
网络的初始学习率设置为5e‑4,权重衰减为1e‑5,使用Adam优化器,每训练6个批次后学习率减少为原来的一半,一个训练20个批次。
2.如权利要求1所述的一种基于多尺度特征强化的2D人体姿态估计方法,其特征在于,所述步骤1)中,考虑到表征能力更强的特征最后的定位结果至关重要,所以使用针对像素级的视觉任务的特征提取网络ResNeSt,通过分离注意力模块对不同尺度的特征进行跨通道交互;
首先将特征图分为K个基数组,每组内再次拆分为R组,即特征组的总数为G=KR,对每个组的特征单独应用一些变换 特征组的中间表示为:其中 表示不同的变换函数,G表示总的特征组数,第k个基数组的输入为:
其中对于k∈1,2,...,K,有 H,W和C分别表示特征图的高,宽和通道数。
3.如权利要求1或2所述的一种基于多尺度特征强化的2D人体姿态估计方法,其特征在于,所述步骤2)中,通过骨干网络获取到四个不同分辨率的特征后,构建了一个金字塔结构的多级预测网络来保持不同尺度的语义信息和空间分辨率信息,由于顶层特征通过大小为
1×1卷积核进行降维,损失了较多的语义信息,直接导致各层语义信息的缺失;使用一个特征增强模块,有效的对顶层特征进行强化,有效的改善了整个多级预测网络的表征能力;
然后对多级特征网络进行分别预测,首先使用1×1卷积消除由于特征叠加产生的混叠效应,然后对其应用一个BN层进行归一化处理,接着使用ReLU激活函数处理,再通过3×3卷积将256维的特征降到最终所需的维度17维,最后将得到的热图上采样到输出大小,再次进行归一化处理,有效的提升了模型的泛化能力。
4.如权利要求1或2所述的一种基于多尺度特征强化的2D人体姿态估计方法,其特征在于,所述步骤3)中,按步骤2)中的方法进行全局定位后,仍有一些较小的,被遮挡的关键点检测误差较大,构建一个高分辨率微调网络,将不同尺度的特征集成到一起,将多级预测网络中的特征图通过若干瓶颈模块进行特征细化,然后通过不同次数的转置卷积层将其上采样到输出大小;
经过转置卷积获取到四个相同大小的高分辨率特征,对每个特征分别进行尺度归一化和ReLU函数处理,将其按照第一个维度级联在一起,然后使用大小为3×3的卷积核对其进行最后的预测,对输出结果进行尺度归一化后输出,为了防止在对较小目标进行修改的同时对较大人体关键点的位置造成干扰,在网络训练的梯度回传过程中,只对损失值较大的关键点位置进行修改。