1.一种基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于,包括:搭建并优化学习异常检测模型,异常检测模型包括生成器网络和判别器网络;
生成器网络包括编码器、记忆模块和解码器,将视频帧输入编码器后,编码器进行卷积、池化操作并进行特征通道的自适应调整后,获得编码特征,编码器将获得的编码特征分别输出给记忆模块和解码器;记忆模块依据与输入的编码特征的相似性来调整内存项目的寻址权重,通过内存项目和寻址权重的线性组合生成查询特征,并将查询特征输入到解码器中;将输入的查询特征和编码特征进行特征融合,进而解码器生成下一时刻的视频帧,即未来视频帧;
判别器网络通过计算未来视频帧的异常分数,使用异常分数作为判断未来视频帧是否异常的标准;
通过强度损失、梯度损失、光流损失、对抗损失和交叉熵损失对搭建的异常检测模型进行优化学习;
其中,搭建并优化学习异常检测模型,具体为,
S1、在数据集上选取训练样本和测试样本,训练样本为具有三通道的彩色视频帧图像X=(x1,x2,x3,…xt),其中,t表示一次输入模型的视频帧数量,视频帧的尺寸表示为H×W×C;
S2、将训练样本的连续视频帧输入到编码器,获得编码特征y;
S3、将步骤S2得到的编码特征y输入到记忆模块,依据与内存项目的相似性来调整其寻址权重ri,通过记忆模块中的内存项目和寻址权重的线性组合,生成查询特征y';
S4、将步骤S2所得编码特征y和步骤S3所得查询特征y'进行特征融合,在实现信息对称和抑制梯度的消失的同时,得到特征表示u,进而解码器输出t+1时刻的未来视频帧:x't+1=FD(u,θd),其中,FD表示解码器,θd表示解码器的参数;
S5、计算步骤S4所得未来视频帧x't+1和真实视频帧xt+1之间的强度损失Lden,计算步骤S4所得未来视频帧x't+1和真实视频帧xt+1之间的梯度损失Lgrad,通过轻量级光流估计网络LiteFlownet计算未来视频帧x't+1、真实视频帧xt+1和真实视频帧xt之间的光流损失Lop,通过最小二乘生成对抗网络Least SquaresGAN计算未来视频帧x't+1和真实视频帧xt+1之间的对抗损失;
S6、计算寻址权重ri的交叉熵损失Lmem;
S7、根据步骤S5所得强度损失Lden、梯度损失Lgrad、光流损失Lop、对抗损失和步骤S6所得交叉熵损失Lmem,计算模型整体损失L,对异常检测模型进行反向传播优化参数;
由优化学习后的异常检测模型,对监控视频中的异常事件进行检测。
2.如权利要求1所述的基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于:步骤S2中,将连续视频帧输入到编码器,获得编码特征y;具体为,S21、使用卷积网络U‑Net作为生成器网络中的自动编码器结构,编码器包括第一编码器层、若干第二编码器层和若干注意力模块,第一编码器层对输入的视频帧进行卷积、最大池化和激活操作后获得特征向量v′,并输出给第二编码器层;
S22、第二编码器层和注意力模块依次交替设置,第二编码器层对输入的特征向量进行卷积、最大池化和激活操作后,输出给注意力模块;注意力模块用于增强重要特征通道的权重,降低次要特征通道的权重,以实现特征通道的自适应调整,以获得新的特征向量;最后一个注意力模块将获得的新的特征向量作为编码特征输出给记忆模块和解码器。
3.如权利要求2所述的基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于:步骤S22中,注意力模块用于增强重要特征通道的权重,降低次要特征通道的权重,以实现特征通道的自适应调整,以获得新的特征向量,具体为,S221、注意力模块将编码器层输出的特征向量压缩成一个大小为1×1×C的全局特征c c向量: zc∈R ,其中Fsq表示压缩过程的函数,R 表
示特征空间;
S222、使用全连接神经网络对压缩之后的结果Zc做非线性变换,作为激发阶段,为每个特征通道生成权重s=Fex(zc,w),其中,Fex表示激发过程的函数,w是激发过程中的权重;
S223、将编码器层输出的特征向量与权重s相乘后,得到新的特征向量v。
4.如权利要求2所述的基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于:步骤S3中,依据与内存项目的相似性来调整其寻址权重ri,通过记忆模块中的内存项目和寻址权重的线性组合,生成查询特征y',具体为,S31、计算记忆寻址权重ri,通过记忆模块中的内存项目si和编码特征y之间的相似性得到:其中,d(·)是近似度量距离,
S32、生成查询特征y':
其中,S代表记忆模块的记忆存储,由N个内存项目si组成,表示为[N,C]的矩阵向量,N表示记忆模块中记忆存储的容量,ri表示记忆寻址权重。
5.如权利要求2所述的基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于:步骤S5具体为,S51、计算步骤S4所得未来视频帧x't+1和真实视频帧xt+1之间的强度损失Lden:其中,x't+1表示未来视频帧,xt+1表示真实视频帧;
S52、计算步骤S4所得未来视频帧x't+1和真实视频帧xt+1之间的梯度损失Lgrad:其中,i,j表示视频帧空间位置的像素索引;
S53、通过轻量级光流估计网络LiteFlownet计算未来视频帧x't+1、真实视频帧xt+1和真实视频帧xt之间的光流损失Lop:Lop(x't+1,xt+1,xt)=||h(x't+1,xt)‑h(xt+1,xt)||1其中,h(·)是经过预训练的模型;
S54、通过LeastSquaresGAN计算未来视频帧x't+1和真实视频帧xt+1之间的对抗损失,对抗损失包括判别器网络对抗损失 和生成器网络对抗损失其中,训练判别器网络D的目的是判断真实视频帧xt+1为1,判断G(x1,x2,x3…xt)=x't+1为0,其中0和1分别代表假样本标签和真样本标签,当训练判别器网络D时,将生成器网络G的权值参数设为固定;训练生成器网络G的目的是生成一个未来视频帧x't+1且判别器网络D将其判断为1,当训练生成器网络G时,将判别器网络D的权值参数设为固定;LMSE(·)为均方误差损失函数。
6.如权利要求2所述的基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于:步骤S6中,计算记忆寻址权重ri的交叉熵损失Lmem:其中,T为输入的视频帧数量。
7.如权利要求2所述的基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于:步骤S7中,计算模型整体损失L:其中,λden,λgrad,λop,λadver,λmem是权重系数。
8.如权利要求1所述的基于记忆增强未来视频帧预测的监控视频异常检测方法,其特征在于:由优化学习后的异常检测模型,对监控视频中的异常事件进行检测,具体为,S8、将测试样本输入优化学习后的异常检测模型,由生成器网络生成未来视频帧给判别器网络,判别器网络通过计算未来视频帧的异常分数,使用异常分数作为判断视频帧是否异常的标准,对监控视频中的异常事件进行检测。