利索能及
我要发布
收藏
专利号: 2018111977812
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-12
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于yolo和多任务卷积神经网络的导购消极行为监控方法,含有以下步骤:

(1)训练基于yolo的行人检测模型;

步骤11:构建基于yolo的行人检测模型;

使用跳层融合的方式,特征提取阶段一使用13个卷积层和4个最大池化层,阶段二使用

7个卷积层,在阶段一和阶段二中间有1个最大池化层,调整阶段一的输出的特征图大小与阶段二输出的特征图大小一致;然后将这两个调整过大小的特征图通过叠加的方式融合在一起,成为阶段三的输入;阶段三有两种模式,模式一是分类网络,该模式在预训练模型的时候用到,具体而言就是一层3×3的卷积层,再加一层全连接层,全连接层神经元个数等于分类个数;模式二是检测网络,该模式是在加载模式一的预训练参数之后,训练检测网络时用的,具体而言就是一层3×3的卷积层,再加一层1×1的卷积层,卷积核的个数与检测类别相关,具体数值为:anchors个数×(5+检测类别个数);

步骤12:用ImageNet数据集预训练分类模型;

良好的初始化参数是模型收敛的重要一环,而检测数据集由于标注步骤繁琐,导致其每种类别的数据量不多;因此用ImageNet数据集去训练一个分类模型,使训练好的分类模型参数作为检测模型中共有结构的初始化参数;

步骤13:用voc2007数据集预训练检测模型;

由于检测模型的前几层结构与分类网络一致,将步骤12中训练好的分类网络的参数作为检测网络中共有结构的初始化参数;voc2007数据集是常用的检测数据集,共有20类的标注好的检测物体,其中包括行人图像数据;只取其中的行人图像数据进行训练,对行人数据进行数据增强的操作,调整图像大小为448×448,用SGD优化器训练160个epoch,初始学习率设置为0.0001;

步骤14:用监控视角数据集微调模型;

由于voc2007中的行人数据大部分都不是监控视角下的行人图像,因此将步骤13训练好的模型去检测商场监控画面中的行人,会有一些困难;因此选取BOT2018新零售技术挑战赛中的数据集进行微调,该数据集的行人图像采集自真实商场场景下的监控摄像头;对该数据集的图像进行水平旋转、中心随机裁剪、HSV空间微调等数据增强的操作,并将尺寸大小调整为448×448;

加载步骤13训练好的模型,用SGD优化器训练160个epoch,初始学习率设置为0.001,学习率随着训练次数的增多而减小,0-5个epoch时学习率设置为0.001,5-80个epoch时学习率设置为0.0001,80-160个epoch时学习率设置为0.00001;

(2)训练基于ResNet50的多任务卷积神经网络;

步骤21:构建基于ResNet50的多任务卷积神经网络;

对步骤(1)中检测到的行人,需要去识别行人的属性,以此判断导购是否存在消极工作的行为,数据集中标注的属性有:“顾客”或“导购”、“男性”或“女性”、“站立”或“坐着”、“玩手机”或“不玩手机”;这些属性彼此之间无关联性,视为不相关属性;

ResNet50是一个在分类性能表现优异的网络结构,然而一个原始的ResNet50直接去识别多个不相关属性的时候效果往往不佳,而针对每个属性都训练一个模型会导致占用额外的计算资源;因此,针对导购消极行为的识别,基于ResNet50设计了一种多任务卷积神经网络;

具体地,将原始ResNet50最后两层的全连接层和池化层去掉,拼接上四个并行的全连接层,每个全连接层的神经元个数为2,分别代表着8种属性:“顾客”与“导购”、“男性”与“女性”、“站立”与“坐着”、“玩手机”与“不玩手机”,在同一个全连接层上的两个属性是关联属性,不在一个全连接层上的属性是不相关属性;每个全连接后分别连一个softmax层;

Softmax损失函数的计算公式为:

最终的损失函数值为四个Softmax损失函数值相加,即:

Loss=L1+L2+L3+L4     (2)

步骤22:训练基于ResNet50的多任务卷积神经网络;

在卷积神经网络中,良好的初始参数对网络模型的收敛有重要作用,因此我们加载在ImageNet数据集上训练好的ResNet50中除最后两层外的参数作为本发明中多任务卷积神经网络的初始化参数;数据集采用BOT2018新零售技术挑战赛的标注数据,对该数据进行数据增强的操作,以获得更多的可用的训练数据,最后用Adam优化器进行训练,初始学习率设置为0.0005,训练40个epoch;

(3)导购消极行为记录;

步骤31:读取监控画面;

在商场内,广泛分布的监控系统提供数据;在读取监控画面前,需要设置两个参数:上班时间区间、监控采样时间;设置上班时间区间,让本系统只关注于上班时间;设置监控采样时间,是控制读取监控画面的频率;

通过rtsp协议读取监控画面,通过计算机的系统时间控制读取画面;

步骤32:商场内行人检测;

加载步骤(1)中训练好的行人检测模型,读取步骤31中的监控图像,将图像进行归一化,并转为Tensor,之后将Tensor加载进行人检测模型中,行人检测模型会检测出行人在图像中上下左右四个坐标,可在一张图像上检测出多个人;

步骤33:识别行人属性;

加载步骤(2)中的多任务卷积神经网络,将步骤32中检测出的行人图像数据作为多任务卷积神经网络的输入数据,输出全连接层的值即为模型对该行人在某个属性上的置信度;若输出“导购”的置信度比“顾客”的置信度高,即识别该行人为“导购”,若输出“男性”的置信度比“女性”的置信度高,即识别该行人为“男性”,若输出“站立”的置信度比“坐”的置信度高,即识别该行人为“站立”,若输出“玩手机”的置信度比“不玩手机”的置信度高,即识别该行人为“玩手机”;反之亦然;

步骤34:记录导购消极行为画面;

在上班时间区间内,对步骤33中识别的行人属性进行导购消极行为的判断;首先,判断该行人的身份,是否属于“导购”,如果是导购,分析其姿势和工作状态,更进一步的,判断该导购所在的画面中,是否存在顾客,顾客在场的情况下,对导购有更严格的要求;当导购在玩手机或者坐着,并且此时画面中没有顾客,认为该导购是“一般消极”;当导购在玩手机或者坐着,而此时画面中有顾客,认为该导购是“严重消极”;具体导购消极行为的程度判定如表1所示,对于“严重消极”的导购,将其画面保存在文件夹1,对于“一般消极”的导购,将其画面保存在文件夹2,对于“积极”的导购,不保存其画面。

表1 导购消极行为判定表