1.基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:包括如下步骤:
步骤1:设计Inception‑v4主干网络;
步骤2:设置视角预测分支;
步骤3:将视角置信度与浅层特征融合组成视角性特征属性;
步骤4:通过区域注意力定位视角性特征属性的位置;
步骤5:设计最终属性识别单元计算方式及损失函数;
步骤6:在公开的行人属性识别数据集上训练模型;
步骤7:应用于实际的视频监控图像来进行行人属性识别;
步骤8:制作Qt前端界面具体展现识别结果。
2.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤1具体包括:
1.1):选用Inception‑v4作为主干网络。Inception‑v4主要由Stem、Inception‑A、Reduction‑A、Inception‑B、Reduction‑B和Inception‑C模块组成,将Inception‑A模块的输出作为视角预测器分支的输入,Inception‑C模块的输出作为区域注意力分支的输入;
1.2):深层网络训练中不可避免会产生大量的参数,为了减少参数,加快训练的速度,将重构的Inception网络去除最后的平均池化层、dropout层和Softmax函数激活,改为直接使用BatchNormalization层来归一化最终的属性识别单元。
3.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤2具体包括:
2.1):把Inception‑v4主干网络中的浅层网络模块Inception‑A的输出值作为视角预测器的输入。设计最大池化层,卷积层,自适应平均池化层和全连接层组成视角预测器;
2.2):将最后的全连接层的输出通道数设为4,从而输出前、后、左和右四个不同的视角置信度;视角置信度Yvp1,由公式(1)表示:Yvp1=Softmax(Wfc2·(Wfc1·F′)) (1)·表示两个矩阵的点积,Wfc1,Wfc2表示第一、二个全连接层的权重矩阵,F′表示经过最大池化层,卷积层,自适应平均池化层后输出的中间变量。
4.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤3具体包括:
3.1):修改视角预测器用于预测4个视角置信度值的全连接层的激活函数为Sigmoid函数,通过上采样,重新反馈到输入的浅层网络模块Inception‑A。修改过的视角置信度Yvp2,由公式(2)表示:
Yvp2=σ(Wfc2·(Wfc1·F′)) (2)
3.2):将输入的浅层网络模块Inception‑A提取的低级全局特征与修改后视角置信度相乘,组成特定的视角性特征属性。
5.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤4具体包括:
4.1):把Inception‑v4主干网络中的深层网络模块Inception‑C的输出值作为区域注意力的输入;区域注意力机制分为三个分支,分别为高度分支、宽度分支和比例调节分支;
4.2):通过在高度分支应用自适应最大池化核,在高度方向上定位视频监控图像中的行人位置。高度分支输出由公式(3)表示:GMP(x)=maxw(x(h,i)) (3)
4.3):通过在宽度分支应用自适应平均池化核,通过宽度分支在宽度方向上定位行人的某个特定属性的位置。高度分支输出由公式(4)表示:
4.4):沿着与空间相关的维度拼接高度分支和宽度分支的输出,进行信息互补,拼接结果通过卷积后由h‑swish函数激活得到中间结果,中间结构由公式(5)表示:F′=h‑swish(f(concat(GMP(x),GAP(x))) (5)f表示卷积操作,F′表示中间结果;
4.5):将中间向量重新分割为高度分支和宽度分支,各添加一个卷积到两个分支,并用Sigmoid函数激活,生成两个注意力权重。通过比例调节分支来平衡上述两个空间注意权重所占最终权重的比例,得到整体注意力权重,优化对某个特定属性的定位区域。整体注意力权重Ya由公式(6)表示:
Ya=σ(f3(F))×σ(f1(F1))×σ(f2(F2)) (6)F1,F2表示分离F’后得到的高度分支和宽度分支,F表示Inception‑C模块的输出,f1,f2,f3表示添加在高度分支、宽度分支和比例调节分支的卷积。
6.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤5具体包括:
5.1):设计最终属性识别单元计算方式;
5.1.1):获取视角预测分支输出的视角置信度值;
5.1.2):获取注意力分支输出的注意力权重值;
5.1.3):将视角置信度值与注意力权重值相乘,使用BN层将相乘结果归一化,得到最后的属性识别结果;
5.2):设计方法损失函数;
5.2.1):设计视角置信度值损失函数如公式(7)所示:Lossvp=‑log(Yvp1) (7)
5.2.2):设计属性识别类别损失函数如公式(8)、(9)所示:N,M表示图像个数和属性个数,yij表示第i张图像的第j个属性, 表示属性预测。wj表示第j个属性的权重,rj表示存在第j个属性的正样本比例。
5.2.3):通过权重系数调节两种损失函数的比例后,将两种损失相加得到最终的损失函数。最终损失函数如公式(10)所示:Loss=αLossvp+βLossa (10)
7.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤6具体包括:在公开的行人属性识别数据集上训练模型,调整图像大小,设置超参数批次数量、迭代次数,优化方法、权重衰减系数和学习率。
8.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤7具体包括:把实际的视频监控图像作为数据集,将训练好的模型应用于实际的视频监控图像来进行行人属性识别,得到属性识别结果。
9.根据权利要求1所述的基于注意力机制的视频监控场景下行人视图属性的定位与识别方法,其特征在于:所述步骤8具体包括:制作Qt前端界面,加载实际的监控视频,输入训练好的模型,创建行人属性识别系统,具体展现识别结果。