1.一种基于端到端3D卷积神经网络的泳池溺水检测方法,其特征在于:其具体工艺步骤如下:
S1、训练样本的像素级标记
打开泳池区域摄像头,获取监控视频,对原始的监控视频进行像素级的二值标记,即将前景像素标记为正,将背景像素标记为负,标记后的监控视频用于后续训练网络的输入;
S2、提取特征立方体
在给定的视频数据集中,将数据集中的某视频Vi分割为n个固定长度的视频片段,即Vi={v1,v2,…,vn},每个视频片段vi包含8帧有重叠的图片,每帧图片的时间跨度为1,在编码器端将每个视频片段分别输入3D卷积神经网络中,经过8个卷积层和4个最大池化层后,获得视频频段vi在编码器端的时空特征fi;为了对每帧生成原始大小的像素级分割图,在解码器端使用3D上采样层来增大时空特征fi的分辨率;为了获得输入视频片段不同尺度的空域和时域信息,在每个3D上采样层后,对编码器端的相应时空特征fi采用级联;经过4次上采样和4次级联操作后得到输入视频片段vi的特征立方体Fi;
S3、行为目标定位
在得到输入视频片段vi的特征立方体Fi后,对视频片段vi中的每帧均使用一个分割分支进行背景或行为前景的像素级预测;该分割分支包括2个1*1的卷积层,经过2次卷积操作后,即得到了输入视频片段vi中每帧的分割图,即Gi={g1,g2,…,g8},该分割图是一个行为前景或背景的二值分割图;根据行为前景的二值分割图中前景像素推断出视频帧中的边框,即定位出视频中的行为目标;
S4、行为识别
经过S3步骤定位出视频中的行为目标后,将行为目标的位置信息用于步骤S2得到的特征立方体Fi,并将特征立方体Fi对应位置处的特征截取出来作为特征tube输入识别分支,识别分支对输入的特征tube进行ToI(tube of interest)池化,接着进行3次全连接操作,最终得到预测的行为标签,该行为标签用于判断泳池区域内是否出现溺水行为;
S5、泳池视频异常行为检测
基于步骤S1-S4的所述方法,通过提取视频片段的特征立方体Fi,以基于像素级的标记方式,对不同泳池区域的多种视频进行不同行为的标记,行为包括溺水、站立、游泳,将以上行为对应的像素标记为正,其他背景标记为负,采用端到端3D卷积神经网络方法,训练得到泳池异常行为检测模型;读取泳池区域实时视频流,通过泳池异常行为检测模型得到每帧图像的分割图,从而定位出游泳人员的行为位置并预测行为标签,判断泳池区域是否出现溺水异常行为,如果出现溺水等异常行为则进行警报。
2.根据权利要求1所述的基于端到端3D卷积神经网络的泳池溺水检测方法,其特征在于:所述步骤S2中3D上采样层对编码器端经过最大池化后得到的低维特征进行恢复,以得到具有更高分辨率的时空特征fi;3D上采样层采用亚像素卷积的方式对时空特征fi进行处理,具体为:分别对深度、高度和宽度为pd、ph和pw的低分辨率时空特征fi进行上采样,设pLR表示低分辨率特征图,pHR表示高分辨率特征图,高分辨率特征图的像素是从低分辨率特征图中映射得到,映射根据下式实现:其中,c∈{0,...,CH-1},d∈{0,...,DH-1},h∈{0,...,HH-1},w∈{0,...,WH-1};变量分别表示特征的通道数、特征的深度、特征的高度和特征的宽度; 表示扩展通道后的低分辨率特征图;
中的索引c',d',h'和w'分别表示扩展后的特征通道数、特征深度、特征的高度和特征的宽度,定义如下:
3.根据权利要求2所述的基于端到端3D卷积神经网络的泳池溺水检测方法,其特征在于:所述步骤S4对不同大小的特征tube采用ToI池化操作以得到固定长度的特征矢量;ToI池化操作过程为:设Ii是TOI池化层的第i个激活,Oj是第j个输出,每个输入变量Ii的损失函数L的偏导数可表示为:每个池化输出Oj都有一个对应的输入位置i,函数f(j)表示来自TOI的最大选择。
4.根据权利要求3所述的基于端到端3D卷积神经网络的泳池溺水检测方法,其特征在于:所述所述3D卷积神经网络的具体结构由输入视频片段、12个卷积层、4个最大池化层和4个上采样层相互穿插组合构成,最终得到输入视频片段的特征立方体,用于后续行为目标定位和行为识别;其中:conv1到conv12为卷积层,每层的卷积核均为3*3*3,滤波器数量从64依次递增到512,然后再递减为64;对输入视频片段交叉进行4次最大池化操作和8次卷积操作后得到conv8层的特征,然后将conv8层的特征进行upsample1层上采样,将upsample1层特征和conv9层特征进行级联并输入upsample2上采样层,将upsample2层特征和conv10层特征进行级联并输入upsample3上采样层,将upsample3层特征和conv11层特征进行级联并输入upsample4上采样层,最终将upsample4层特征和conv1层特征进行级联做为最后提取到的特征,用于目标定位和分类;级联的作用是将具有不同时域和空域信息的特征进行融合,以获得更有利于目标定位和分类的特征;
max-pool1到max-pool4为最大池化层,max-pool1的卷积核为1*2*2,其它最大池化层的卷积核为2*2*2,滤波器数量从64依次递增到512;最大池化层的作用是降低特征图的分辨率,减少参数量,获得具有更强语义信息的特征图;
upsample1到upsample4为上采样层,每层的卷积核均为3*3*3,前3层的滤波器个数为
64,最后一层的滤波器个数为48;由于最大池化从降低了特征图的分辨率,为了对每帧图像生成原始大小的像素级分割图,采用上采样来增大特征图的分辨率。
5.根据权利要求4所述的基于端到端3D卷积神经网络的泳池溺水检测方法,其特征在于:所述分割分支具体包括输入特征立方体和2个卷积层;此处卷积层的卷积核均为1*1,滤波器个数分别为4096和2;最终得到的特征图尺寸为2*8*240*320,其中8表示输入的8帧图像,240*320为输入图像的尺寸,2表示每个像素的分类结果,每个像素的分类结果为属于前景或背景;特征图即原图的分割图,用于目标定位,得到目标的位置信息。
6.根据权利要求5所述的基于端到端3D卷积神经网络的泳池溺水检测方法,其特征在于:所述识别分支具体包括:输入特征立方体、ToI池化层和3个全连接层;输入特征立方体是根据步骤S3得到的位置信息从S2得到的特征立方体中截取得到,由于得到的目标的尺度大小不同,为了处理固定长度的特征矢量,因此对输入特征立方体采用ToI池化层操作以得到固长度的特征矢量,然后连接3个全连接层得到一个一维的特征矢量,用于行为标签识别,得到最后的行为目标分类结果,用于判断泳池区域是否出现溺水等异常行为。