1.一种溺水行为识别方法,其特征在于,所述方法包括:
采集监控水域内的多帧图像;
将所述多帧图像中的单帧图像输入预设深度神经网络模型,得到所述单帧图像中各人体目标的溺水置信度,其中,所述预设深度神经网络模型为预先根据人体目标溺水时从水域上方采集到的包含人体目标的关键点位置信息的样本图像训练得到的深度神经网络模型;
针对各人体目标,根据该人体目标的溺水置信度,识别该人体目标是否存在溺水行为;
所述预设深度神经网络模型包括,预设多任务神经网络框架;
所述将所述多帧图像中的单帧图像输入预设深度神经网络模型,得到所述单帧图像中各人体目标的溺水置信度,包括:将所述多帧图像中的单帧图像输入所述预设多任务神经网络框架,得到所述单帧图像中各人体目标的关键点位置信息及溺水类别置信度;
所述针对各人体目标,根据该人体目标的溺水置信度,识别该人体目标是否存在溺水行为,包括:针对各人体目标,根据该人体目标的溺水类别置信度,识别该人体目标是否存在溺水行为;
所述预设多任务神经网络框架,包括:人体目标检测网络模型、特征金字塔网络模型、区域特征聚集模型、人体姿态估计网络模型以及溺水类别识别网络模型;
所述将所述多帧图像中的单帧图像输入所述预设多任务神经网络框架,得到所述单帧图像中各人体目标的关键点位置信息及溺水类别置信度,包括:将所述多帧图像中的单帧图像输入所述人体目标检测网络模型,得到所述单帧图像中各人体目标框的位置信息、以及在所述人体目标检测网络模型的运算过程中对所述单帧图像进行不同倍数的下采样得到的多张特征图;
将各特征图分别输入所述特征金字塔网络模型,得到各特征图对应的输出特征图;
将各人体目标框的位置信息及各输出特征图输入所述区域特征聚集模型,得到多个相同分辨率的特征图,并对所述多个相同分辨率的特征图进行融合处理,得到融合特征图;
将所述融合特征图输入所述人体姿态估计网络模型,得到所述单帧图像中各人体目标的关键点位置信息;
将所述融合特征图输入所述溺水类别识别网络模型,得到所述单帧图像中各人体目标的溺水类别置信度。
2.根据权利要求1所述的方法,其特征在于,所述预设深度神经网络模型还包括,预设行为识别网络模型;
在所述将所述多帧图像中的单帧图像输入预设多任务神经网络框架,得到所述单帧图像中各人体目标的关键点位置信息及溺水类别置信度之后,所述方法还包括:针对同一人体目标,基于各单帧图像中该人体目标的关键点位置信息,构建该人体目标的张量信息,所述张量信息表征在时间域上人体目标的关键点位置;
将各人体目标的张量信息分别输入所述预设行为识别网络模型,得到各人体目标的溺水行为置信度;
所述针对各人体目标,根据该人体目标的溺水置信度,识别该人体目标是否存在溺水行为,包括:针对各人体目标,根据该人体目标的溺水类别置信度和/或溺水行为置信度,识别该人体目标是否存在溺水行为。
3.根据权利要求1所述的方法,其特征在于,所述人体目标检测网络模型为YOLO检测网络模型,所述特征金字塔网络模型为FPN模型,所述区域特征聚集模型为ROIAlign模型。
4.根据权利要求1所述的方法,其特征在于,所述人体姿态估计网络模型包括:第一卷积层、反卷积层及双线性插值层;所述溺水类别识别网络模型为第一卷积神经网络模型,所述第一卷积神经网络模型包括第一卷积层、最大池化层、1×1卷积层及分类层;
所述将所述融合特征图输入所述人体姿态估计网络模型,得到所述单帧图像中各人体目标的关键点位置信息,包括:将所述融合特征图输入所述第一卷积层,得到第一卷积层输出特征图;
将所述第一卷积层输出特征图输入所述反卷积层,通过反卷积操作,对所述第一卷积层输出特征图进行第一预设倍数的上采样,得到上采样特征图;
将所述上采样特征图输入所述双线性插值层,通过双线性插值运算,对所述上采样特征图进行第二预设倍数的上采样,得到关键点热图;
根据所述关键点热图的通道数及所述关键点热图中的特征值,确定所述单帧图像中各人体目标的关键点数量及关键点位置信息,其中,所述关键点数量与所述通道数相同,各通道的关键点热图中的最大特征值的位置信息为关键点位置信息。
5.根据权利要求2所述的方法,其特征在于,所述预设行为识别网络模型为第二卷积神经网络模型,所述第二卷积神经网络模型包括第二卷积层、最大池化层、1×1卷积层及分类层。
6.根据权利要求2所述的方法,其特征在于,所述针对各人体目标,根据该人体目标的溺水类别置信度和/或溺水行为置信度,识别该人体目标是否存在溺水行为,包括:针对各人体目标,若该人体目标的溺水类别置信度大于第一预设阈值,则确定该人体目标存在溺水行为;
或者,
针对各人体目标,若该人体目标的溺水行为置信度大于第二预设阈值,则确定该人体目标存在溺水行为;
或者,
针对各人体目标,若该人体目标的溺水类别置信度与溺水行为置信度的均值大于第三预设阈值,则确定该人体目标存在溺水行为。
7.一种监控相机,其特征在于,所述监控相机包括摄像头、处理器及机器可读存储介质;
所述摄像头,用于采集监控水域内的多帧图像,并将所述多帧图像发送至所述处理器;
所述机器可读存储介质,用于存储能够被所述处理器执行的机器可执行指令;
所述处理器,用于被所述机器可执行指令促使实现如下步骤:
将所述多帧图像中的单帧图像输入预设深度神经网络模型,得到所述单帧图像中各人体目标的溺水置信度,其中,所述预设深度神经网络模型为预先根据人体目标溺水时从水域上方采集到的包含人体目标的关键点位置信息的样本图像训练得到的深度神经网络模型;
针对各人体目标,根据该人体目标的溺水置信度,识别该人体目标是否存在溺水行为;
所述预设深度神经网络模型包括,预设多任务神经网络框架;
所述处理器在实现所述将所述多帧图像中的单帧图像输入预设深度神经网络模型,得到所述单帧图像中各人体目标的溺水置信度的步骤时,具体实现如下步骤:将所述多帧图像中的单帧图像输入所述预设多任务神经网络框架,得到所述单帧图像中各人体目标的关键点位置信息及溺水类别置信度;
所述处理器在实现所述针对各人体目标,根据该人体目标的溺水置信度,识别该人体目标是否存在溺水行为的步骤时,具体实现如下步骤:针对各人体目标,根据该人体目标的溺水类别置信度,识别该人体目标是否存在溺水行为;
所述预设多任务神经网络框架,包括:人体目标检测网络模型、特征金字塔网络模型、区域特征聚集模型、人体姿态估计网络模型以及溺水类别识别网络模型;
所述处理器在实现所述将所述多帧图像中的单帧图像输入所述预设多任务神经网络框架,得到所述单帧图像中各人体目标的关键点位置信息及溺水类别置信度的步骤时,具体实现如下步骤:将所述多帧图像中的单帧图像输入所述人体目标检测网络模型,得到所述单帧图像中各人体目标框的位置信息、以及在所述人体目标检测网络模型的运算过程中对所述单帧图像进行不同倍数的下采样得到的多张特征图;
将各特征图分别输入所述特征金字塔网络模型,得到各特征图对应的输出特征图;
将各人体目标框的位置信息及各输出特征图输入所述区域特征聚集模型,得到多个相同分辨率的特征图,并对所述多个相同分辨率的特征图进行融合处理,得到融合特征图;
将所述融合特征图输入所述人体姿态估计网络模型,得到所述单帧图像中各人体目标的关键点位置信息;
将所述融合特征图输入所述溺水类别识别网络模型,得到所述单帧图像中各人体目标的溺水类别置信度。
8.根据权利要求7所述的监控相机,其特征在于,所述预设深度神经网络模型还包括,预设行为识别网络模型;
所述处理器被所述机器可执行指令促使,还实现如下步骤:
针对同一人体目标,基于各单帧图像中该人体目标的关键点位置信息,构建该人体目标的张量信息,所述张量信息表征在时间域上人体目标的关键点位置;
将各人体目标的张量信息分别输入所述预设行为识别网络模型,得到各人体目标的溺水行为置信度;
所述处理器在实现所述针对各人体目标,根据该人体目标的溺水置信度,识别该人体目标是否存在溺水行为的步骤时,具体实现如下步骤:针对各人体目标,根据该人体目标的溺水类别置信度和/或溺水行为置信度,识别该人体目标是否存在溺水行为。
9.根据权利要求7所述的监控相机,其特征在于,所述人体目标检测网络模型为YOLO检测网络模型,所述特征金字塔网络模型为FPN模型,所述区域特征聚集模型为ROIAlign模型。
10.根据权利要求7所述的监控相机,所述人体姿态估计网络模型包括:第一卷积层、反卷积层及双线性插值层;所述溺水类别识别网络模型为第一卷积神经网络模型,所述第一卷积神经网络模型包括第一卷积层、最大池化层、1×1卷积层及分类层;
所述处理器在实现所述将所述融合特征图输入所述人体姿态估计网络模型,得到所述单帧图像中各人体目标的关键点位置信息的步骤时,具体实现如下步骤:将所述融合特征图输入所述第一卷积层,得到第一卷积层输出特征图;
将所述第一卷积层输出特征图输入所述反卷积层,通过反卷积操作,对所述第一卷积层输出特征图进行第一预设倍数的上采样,得到上采样特征图;
将所述上采样特征图输入所述双线性插值层,通过双线性插值运算,对所述上采样特征图进行第二预设倍数的上采样,得到关键点热图;
根据所述关键点热图的通道数及所述关键点热图中的特征值,确定所述单帧图像中各人体目标的关键点数量及关键点位置信息,其中,所述关键点数量与所述通道数相同,各通道的关键点热图中的最大特征值的位置信息为关键点位置信息。
11.根据权利要求8所述的监控相机,其特征在于,所述预设行为识别网络模型为第二卷积神经网络模型,所述第二卷积神经网络模型包括第二卷积层、最大池化层、1×1卷积层及分类层。
12.根据权利要求8所述的监控相机,其特征在于,所述处理器在实现所述针对各人体目标,根据该人体目标的溺水类别置信度和/或溺水行为置信度,识别该人体目标是否存在溺水行为的步骤时,具体实现如下步骤:针对各人体目标,若该人体目标的溺水类别置信度大于第一预设阈值,则确定该人体目标存在溺水行为;
或者,
针对各人体目标,若该人体目标的溺水行为置信度大于第二预设阈值,则确定该人体目标存在溺水行为;
或者,
针对各人体目标,若该人体目标的溺水类别置信度与溺水行为置信度的均值大于第三预设阈值,则确定该人体目标存在溺水行为。
13.根据权利要求7所述的监控相机,其特征在于,所述监控相机还包括:报警器;
所述处理器,还用于实现在识别到任一人体目标存在溺水行为时,向所述报警器发送报警信息;
所述报警器,用于根据所述报警信息,发射报警信号。
14.一种监控系统,其特征在于,所述监控系统包括多个如权利要求7至13任一项所述的监控相机;
所述多个监控相机架设在待监控水域上方;所述多个监控相机的总监控水域覆盖所述待监控水域。
15.根据权利要求14所述的监控系统,其特征在于,所述监控系统还包括报警器;
任一所述监控相机在识别到任一人体目标存在溺水行为时,向所述报警器发送报警信息;
所述报警器,用于根据所述报警信息,发射报警信号。