利索能及
我要发布
收藏
专利号: 2024101508842
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,包括以下步骤:步骤1、提取视频模态的特征、提取音频模态的特征;

步骤2、采用自注意力网络分别对视频模态的特征和音频模态的特征进行自注意力增强;

步骤3、将步骤2得到的自注意力增强后的特征输入多层感知器中提取高级语义特征,得到视频与音频模态高级语义特征;

步骤4、激活函数归一化视频与音频模态高级语义特征均值,获得片段级别的异常行为伪标签;

步骤5、分别将步骤3中获得的视频与音频模态高级语义特征归一化得到背景抑制的门控信息,以视频模态的门控信息增强步骤2中获得的音频模态的特征,得到背景增强后的音频模态的特征,以音频模态的门控信息增强步骤2中获得的视频模态的特征,得到背景增强后的视频模态的特征;

步骤6、将步骤5中背景增强后的音频模态的特征与视频模态的特征进行跨模态注意力增强,获得音频模态与视频模态融合的特征,并利用多层感知器得到最终的多模态异常行为概率值;

步骤7、将步骤4获得的片段级别的异常行为伪标签作为噪声标签,与步骤6获得的多模态异常行为概率值进行损失值计算;

步骤8、以多实例学习方式计算步骤6中多模态异常行为概率值与视频级标签的损失值;

步骤9、将步骤7与步骤8的损失值求加权和作为损失值,步骤2至步骤6为弱监督下多模态异常行为检测网络模型,对弱监督下多模态异常行为检测网络模型进行训练。

2.根据权利要求1所述的一种用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤2具体如下:将从视频模态的特征和音频模态的特征分别传入自注意力网络进行自注意力增强,自注意力网络通过将查询、键、值映射为向量,计算点积矩阵并进行softmax归一化,最终得到加权求和的值向量 ,计算公式如下:;

其中, ,表示查询向量矩阵, 表示经步骤1得到的音频/视频模态的特征, ,表示键向量矩阵, ,表示值向量矩阵, 、 、 分别表示查询向量矩阵、键向量矩阵、值向量矩阵中可学习的参数矩阵; 表示查询向量矩阵和键向量矩阵之间的点积矩阵,上标 表示矩阵转置, 表示键向量矩阵的维度, 用于归一化点积避免点积的值过大或过小; 表示softmax激活函数用于将得分归一化为概率值。

3.根据权利要求2所述的一种用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤3中,多层感知器包括三层全连接层,具体如下:;

其中, 、 、 分别表示三个全连接层的可学习参数矩阵, 、 、 分别表示三个全连接层的偏置项, 为视频/音频模态高级语义特征。

4.根据权利要求2所述的一种用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤4中,激活函数归一化视频与音频模态高级语义特征均值,得到片段级别异常行为伪标签,具体计算方法如下:对步骤3获得的视频与音频模态高级语义特征求均值,并由激活函数归一化为最终的异常评分,将异常评分作为片段级别的异常行为伪标签,计算过程如下:;

其中, 表示片段级别的异常行为伪标签, 表示激活函数Sigmoid, 表示视频模态的高级语义特征, 表示音频模态的高级语义特征。

5.根据权利要求4所述的一种用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤5中,将视频与音频模态高级语义特征归一化得到背景抑制的门控信息,计算方式如下:;

其中, 表示视频模态的门控信息, 表示音频模态的门控信息, 、 分别表示视频、音频模态中每个片段的重要性, ,d表示片段数量, 表示门控信息的矩阵维度;

背景抑制增强后的特征,计算方式如下:

其中,表示加权比例参数, 表示背景增强后的视频特征, 表示背景增强后的音频特征, 表示自注意力增强后的视频模态的特征, 表示自注意力增强后的音频模态的特征。

6.根据权利要求5所述的一种用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤6中,音频与视频模态融合的特征包括视频模态流的特征和音频模态流的特征,视频模态流和音频模态流的特征表示为如下公式:;

其中, 、 分别表示视频模态流和音频模态流的查询向量矩阵, 、 分别表示视频模态流和音频模态流的键向量矩阵, 、 分别表示视频模态流和音频模态流的值向量矩阵, 、 、 分别表示查询向量矩阵、键向量矩阵、值向量矩阵的可学习参数矩阵,表示视频模态流的特征, 表示音频模态流的特征,视频和音频模态流的特征相加得到两个模态最终的融合特征,再通过全连接层得到最终的多模态异常行为概率值。

7.根据权利要求3所述的一种用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤7中,将步骤4获得的片段级别的异常行为伪标签作为噪声标签,与步骤6获得的多模态异常行为概率值进行损失值计算;具体如下:将步骤4获得的片段级别的异常行为伪标签作为噪声标签,计算片段级别异常行为伪标签与多模态异常行为概率值之间的损失值,损失值是采用噪声损失函数计算得到的,噪声损失函数由平均绝对误差MAE和归一化交叉熵NCE加权和组成。

8.根据权利要求1所述的用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤9中,将步骤7与步骤8的损失值求加权和作为损失值 的计算过程如下:;

其中, 表示步骤8中以多实例学习方式获得的多模态异常行为概率值与视频级标签的损失值, 表示步骤7获得的片段级别异常行为伪标签与多模态异常行为概率值的损失值, 均表示加权和的比重。

9.根据权利要求1所述的用于智能监控系统的弱监督异常行为智能检测方法,其特征在于,步骤1中,采用预训练I3D网络提取视频模态的特征,采用预训练VGGish网络提取音频模态的特征。