利索能及
我要发布
收藏
专利号: 2021102598626
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于单帧图像的多人并发交互行为理解方法,其特征在于,所述方法包括以下步骤:

1)输入图片,结合骨架估计和多目标跟踪算法,获得人体骨架数据和感兴趣区域;

2)使用人体骨架数据生成骨架部件置信度图和部件亲和力场,构建注意力图;

3)定义基于人体骨架注意力的Resnet‑Attention网络;

4)定义多人交互行为理解的双流网络;

从多模态信息和注意力机制出发,提出了一个双流网络模型,第一路算法是基于人体骨架注意力的Resnet‑Attention网络,提取增强的RGB特征;第二路算法基于骨架数据,使用当前行为识别效果最优的移位图卷积网络,提取精确的骨架特征;

所述步骤1)中,感兴趣区域指人体边界框,精确计算感兴趣区域是提取交互行为特征的基础,结合骨架估计算法和多目标跟踪算法计算感兴趣区域,其中,使用AlphaPose从原始图像中提取人体骨架并输出人体边界框,称之为骨架人体框;同时,使用FairMOT对视频中的人体进行跟踪,从而获得某一帧中每个人的人体边界框,称之为跟踪人体框;骨架人体框的优势是其贴合实际人体程度较高,而跟踪人体框易出现四肢在边界框之外的情况;而对于存在严重遮挡或非正常人体位姿的复杂场景,人体骨架估计可能失败,相比之下跟踪人体框缺失情况更少;

所述步骤2)中,获取的人体骨架和人体框需要根据标注数据进行匹配,获取有序的人体骨架数据和感兴趣区域,有序数据包含:人体骨架、骨架人体框、跟踪人体框、感兴趣区域、交互组序号、交互组动作标签和单人动作标签,以下为计算的步骤:

1.1)利用AlphaPose算法提取人体骨架,并输出骨架人体框;

1.2)利用FairMOT算法提取跟踪人体框;

1.3)通过1.1)1.2)中获得的骨架人体框、跟踪人体框与标注数据计算边界框的真实动作标签与交互组序号,标注数据包含交互目标的人体框、交互组数据和动作标签,将标注数据与跟踪边框匹配:对于任一跟踪边框B,计算与B交并比最大的标注边界框Bmax,如果Bmax存在且对应的交并比大于0.5,则认为Bmax与B匹配,并将Bmax对应的动作标签与交互组序号赋给跟踪边框B;

1.4)融合骨架边框和跟踪边框,得到融合框,融合规则如下:

1.4.1)当骨架边框与跟踪边框都存在时:计算骨架边框和跟踪边框交并比ρ,当ρ大于

0.3时,取两者较小边界框为融合框;否则取骨架边框为融合框;

1.4.2)当存在骨架边框、缺失跟踪边框时:取骨架边框为融合框;

1.4.3)当缺失骨架边框、存在跟踪边框时:如果ρ大于0.3,则取跟踪边框为融合框;否则不存在融合框;

1.4.4)当骨架边框与跟踪边框均缺失时:不存在融合框;

后续模型训练和测试均采用融合框;

所述步骤2)中,为了增强RGB特征,采用OpenPose算法中骨架特征图的数据形式,将注意力图分为部件置信度图和部件亲和力场;

部件置信度图C:利用AlphaPose算法估计得到的骨架序列V={vi|i=1,…,K},计算每一个关节点置信度图,vi表示人体骨架的其中一个关键骨架点,vi=(xi,yi),为一组2D坐标,K为一组交互组人体骨架点数量,每个关节点坐标使用高斯模糊算法计算置信度图,其中σ是高斯模糊的阈值,则第k个骨架点在特征图上(x,y)位置对应的置信度为:部件亲和力场P:利用部件亲和力场表示肢体走向,并根据人体自然连接方式,将关键关节点连接起来,实现方式是为人体的每两个相连关节点之间的部件计算一个亲和力场,称之为部件亲和力场,设某一部件起始关节点s的坐标是(xs,ys),终止关节点e的坐标是(xe,ye),在此关节区域的每一个像素,设计从起始关节点指向终止关节点的2D矢量编码,设置两关节点连接的正交距离阈值τ,则对于s所在的通道,与两关节点连接的正交阈值范围内所有像素点的值为:上式Le,s关节点e和关节点s之间的欧式距离,对于e所在的通道,与两关节点连接的正交阈值范围内所有像素点的值为:设当前所考虑的双人骨架总共包含K个关节点和M个部件,获得K个通道的关节置信图{Ci|i=1,…,K}和M个通道的部件亲和力场{Pj|j=1,…,M},叠加K个通道的关节置信图,得到部件置信度图K;叠加M个通道的部件亲和力场,得到部件亲和力场P,接下来将部件置信度图和部件亲和力场相加得到部件特征 最后对Fc执行1×1卷积操作,输出同样尺寸的骨架注意力图Fa;

所述步骤3)中,为提取图像特征,将去除尾部全连接层的Resnet50作为骨干网络,鉴于ResNet50倒数第二模块和倒数第三模块所输出的特征图通道数分别为2048和1024,在小规模交互行为数据集上容易出现过拟合,使用1×1卷积对其输出特征通道个数分别降为1024和512,为获得多尺度行为表征,联合使用骨干网络倒数第二个卷积层和倒数第三个卷积层的输出,得到空间金字塔特征Fb;

Resnet‑Attention网络使用骨架注意力图Fa增强图像特征Fb,Fa的大小为240×320,而空间金字塔特征Fb的两层尺寸分别为512×15×20和1024×8×10,为融合图像特征和骨架注意力图,采用双线性插值将空间金字塔两层的图像特征扩充为与骨架特征相同的尺度,然后将扩充后的特征图在通道方向进行堆叠,最后得到维度为1536×240×320的统一特征图;

为进一步增强特征图Fb,Resnet‑Attention网络计算Fa和Fb的Hadamard乘积,得到增强后的特征图Faction:Faction=Fa⊙Fb                (4)

这里

网络输入为RGB图片和人体边框,首先采用骨干网络提取RGB图像特征;然后基于人体骨架计算部件特征,再经过1×1卷积和Sigmoid激活函数获得骨架注意力图;接下来将RGB特征和骨架注意力图进行Hadamard乘积得到增强特征;最后基于增强特征和目标边界框提取双人交互特征;

所述步骤3)中,提取双人交互特征的方法是:计算包含双人边界框的最小包围框MEB;

将MEB和增强特征输入RoIAlign模块,输出大小为1536×5×5的MEB区域特征Finter;接下来将Finter铺平,变为一个长度为38400(1536×5×5)的向量;对该向量依次执行LayerNorm、ReLu、Dropout(0.9)、FC操作,获得长度为512的特征向量;最后利用一个FC层计算交互行为分类分数 L表示交互行为类别个数;

所述步骤4)中,双流网络包含两个分支:RGB特征提取分支输出交互行为分类分数Frgb,移位图卷积网络分支采用定制的Shift‑GCN网络计算分数Fgcn,原Shift‑GCN要求输入数据为基于视频的骨架序列,输出是整个视频序列的动作分类结果,鉴于Shift‑GCN针对与目标任务不同的视频行为分类问题提出,无法计算单帧图像中任意两人的交互行为分类分数Fgcn,对移位图卷积网络进行修改,以兼容单帧数据,并能够处理双人交互行为分类问题,修改内容包括:去除时间域移位卷积;更改单人骨架序列输入为双人单帧骨架输入;

给定双人骨架数据 其中v为双人骨架的关节点的个数,c=2为通道数,每个坐标分量占一个通道,移位图卷积网络输出为交互行为分类的分数向量Fgcn:Fgcn=ShiftGCN(S)   (5)

最后,双流网络对Frgb和Fgcn进行融合:

Ffused=Frgb+Fgcn   (6)

所述方法还包括以下步骤:

5)网络参数训练

在网络参数训练过程中,对于骨架门组件网络和移位图卷积网络,我们采用的训练设置不同,以下将分两部分描述训练设置:训练使用显卡:GTX 1080 Ti

骨架门组件网络参数训练,参照表1:

表1

移位图卷积网络参数训练,参照表2:

表2

由于不同图片中人数差别较大,所以对不同人数设置不同的训练参数,当图片中交互目标数量N={x|2≤x≤5}时,使用以上参数进行训练;当图片中交互目标数量N={x|5

15}时,人数的增多导致交互组数急剧增多,无动作类别交互组占比高;所以在训练过程中设置最大距离Max_dis,计算图片中两个目标边框中心点的距离dis,当dis≥Max_dis,这组交互组判定为无动作类别交互;因交互组中类别比例不平衡,在以上两个网络中的loss函数中添加不平衡权重,权重值为 ′OT′为无交互动作类别;

采取最大距离排除法:设置距离阈值Maxdis,计算图像中两个人体边界框中心点的欧式距离dis,当dis≥Maxdis,这组数据判定为不存在交互行为,通过最大距离排除法,使输入网络模型的双人组数量减少到36组以内,另一方面,为每个模型训练的损失函数添加不平衡权重classweight:上式,OT表示除正常交互行为外的任何其它人体行为。