1.一种可学习低秩双线性行为感知方法,其特征在于包括以下步骤:(1)建立以图像大模型为基础加入视频时空建模迁移至视频任务的框架;
(2)在框架内构建视频行为识别模型,包括:
(2.1)建立用于时空建模和提取视频级特征的视频编码器;
(2.2)建立用于聚合视频编码器中多级特征和增强特征的多尺度聚合器;
(2.3)建立用于捕获语义信息和提取文本特征的文本编码器;
(2.4)建立集成来自多尺度聚合器和文本编码器的特征并进行多模态学习的多任务解码器;
(3)构建一种大模型主分支冻结仅新加参数学习的训练机制,利用服务器对视频行为识别模型进行训练,通过优化目标函数,直至网络收敛,获取局部最优网络参数,得到训练好的视频行为识别模型;
(4)将待识别的视频序列输入到训练好的视频行为识别模型中识别人类行为。
2.根据权利要求1所述的一种可学习低秩双线性行为感知方法,其特征在于,所述步骤(1)的具体步骤包括:(1.1)建立一个以图像大模型为基础的视频特征提取网络,将给定的视频首先进行抽帧,通常均匀采样,抽偶数帧,同时输入到所述视频特征提取网络,进行单帧特征提取并同时进行不同帧之间的时空交互融合,最后在时序维度进行平均池化,输出视频特征;
(1.2)建立一个以图像大模型为基础的文本特征提取网络,将给定的文本输入到所述文本特征提取网络,进行词汇单元的语义特征提取并同时进行不同词汇单元之间的语义交互融合,最后输出文本特征;
(1.3)将视频特征和文本特征输入到解码器,得到并输出分类结果,分类结果即对应行为的类别。
3.根据权利要求1所述的一种可学习低秩双线性行为感知方法,其特征在于,所述步骤(2.1)的具体实施步骤包括:(2.1.1)每个图像大模型Transformer层由L个重复块组成,遵循PEFT范式,每个块均添加一个时空适配器;
(2.1.2)针对时空适配器,给定特征 ,其中,T为采样帧数,L为令牌数,C1为特征通道数,R是形状为(T,L,C1)的实数矩阵集合;
(2.1.3)引入可学习双线性融合机制 ,其表述为: ,其中,是形状为(C1,C1)的可学习权重矩阵, 是形状为(C1,C)的可学习投影矩阵,C为投影后的特征通道数;
(2.1.4)引入多头处理 ,其中,符号[…]表示连接操作,H为头数, 是为第h个头划分的给定特征的子空间表示,
是第h个头形状为(C1/H,C1/H)的可学习权重矩阵,是第h个头形状为(C1/H,C/H)的可学习投影矩阵,C/H为投影后的特征通道数;
(2.1.5)引入低秩潜空间分解,使给定特征A、B在共享的低秩潜空间内执行可学习双线性融合,最后从潜空间投影到期望的输出维度,其过程表述为,其中, 均为第h个头形
状为(C1/H,r)的可学习投影矩阵,r为投影后的潜空间维数且 , 是第h个头形状为(r²,C/H)的可学习投影矩阵;
(2.1.6)将给定原始输入特征Z、时空适配器全局时间增强所得特征 、时空适配器局部时间差分建模所得特征 、时空适配器双线性融合模块 进行更深度的特征交互,最终 的特征融合过程表述如下:,其中, 为类令牌, 为第t帧视频特征令牌。
4.根据权利要求1所述的一种可学习低秩双线性行为感知方法,其特征在于,所述步骤(2.2)的具体实施步骤包括:(2.2.1)针对视频编码器每一层输出的类令牌 ,将它们连接,从而形成键K和值V,并将视频编码器最后一层输出的类令牌 作为查询Q,聚合过程表述为如下交叉注意力CA操作: ,其中 为聚合的类令牌;
(2.2.2)然后将 加到 上,进行最后的增强:
,其中 作为增强的类令牌,拥有浅层视频编码器层提供的细粒度信息,以及深层视频编码器层提供的高级别语义。
5.根据权利要求1所述的一种可学习低秩双线性行为感知方法,其特征在于,所述步骤(2.3)中文本编码器的结构为:每个图像大模型Transformer层由L个重复块组成,遵循PEFT范式,每个块均添加一个文本适配器。
6.根据权利要求1所述的一种可学习低秩双线性行为感知方法,其特征在于,所述步骤(2.4)中多任务解码器中配备了多个不同的学习任务,每个任务对应一个单独的头部,包括视觉分类头、多模态对比学习头、跨模态分类头、跨模态掩码语言建模头。
7.根据权利要求6所述的一种可学习低秩双线性行为感知方法,其特征在于,多任务解码器的目标函数为 ,其中cs表示跨模态分类头、CMC表示多模态对比学习头、CMLM表示跨模态掩码语言建模头、VC表示视觉分类头。
8.根据权利要求1‑7任一权利要求所述的一种可学习低秩双线性行为感知方法,其特征在于,所述步骤(3)中的大模型主分支冻结仅新加参数学习的训练机制,对原始图像大模型的所有参数进行冻结,仅对视频编码器中的时空适配器、多尺度聚合器、文本编码器中的文本适配器和多任务解码器中的视觉分类头、跨模态掩码语言建模头的参数进行学习训练。
9.根据权利要求1所述的一种可学习低秩双线性行为感知方法,其特征在于,所述步骤(4)的具体实施步骤包括:(4.1)首先对给定的视频进行抽帧,按照固定均匀采样的方式对每个视频抽取T帧,堆叠在批次维度B,最后构成一组输入,维度为BT,C,H,W,其中C,H,W分别为通道,图像高和宽;
(4.2)使用训练完成的视频行为识别模型对视频进行视频特征提取;
(4.3)使用训练完成的视频行为识别模型对给定的文本进行文本特征提取;
(4.4)将经步骤(4.2)和步骤(4.3)得到的视频特征和文本特征输入到解码器,输出选择得分最高的类别作为最后整段视频对应的行为类别。
10.根据权利要求2所述的一种可学习低秩双线性行为感知方法,其特征在于所述偶数帧为8、16或32帧。