利索能及
我要发布
收藏
专利号: 2026104299852
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于深度感知与全局‑局部协同的光流估计方法,包括如下步骤:

S1:采集包含运动场景的连续帧图像对作为样本数据,对样本数据进行预处理得到样本数据集,将样本数据集按照设定的比例划分为训练集、验证集和测试集;

S2:基于深度学习框架搭建光流估计网络;光流估计网络由深度感知特征编码器DFE模块、自适应特征对齐AWM模块、全局‑局部协同细化OFRM模块和光流预测OFPM模块依次串联构成;输入的连续两帧图像首先经DFE模块分别提取融合特征图,随后以零光流作为初始光流估计,进入多次迭代优化过程:在每次迭代中,依次进入AWM模块进行特征对齐,进入OFRM模块进行全局‑局部特征协同细化,进入OFPM模块进行光流更新,经多次迭代优化后将输入图像二分之一分辨率的光流上采样至原始图像分辨率,输出最终光流图;

DFE模块包含并行的基于Depth‑Anything‑3的深度感知特征编码路径和基于ResNet18Deconv的图像特征编码路径,以及用于融合两路径输出的特征融合单元,其输出端连接AWM模块;AWM模块包含空间变形单元、置信度估计单元和自适应加权门控单元,其输出端连接OFRM模块;OFRM模块包含级联的全局上下文单元和局部精细感知单元,以及动态卷积与增强单元,其输出端连接OFPM模块;OFPM模块包含特征解码层、光流与权重预测头单元以及凸组合上采样单元,其输出端连接回AWM模块以进行下一次迭代;

S3:将训练集输入光流估计网络进行迭代训练,得到训练好的光流估计网络;并利用验证集对训练好的光流估计网络进行验证,得到最终的光流估计网络;

S4:将测试集中的连续帧图像对输入到最终的光流估计网络,经DFE模块提取融合特征图,经AWM模块、OFRM模块和OFPM模块进行多次迭代细化,经上采样至原始分辨率,完成对测试集中运动场景的光流估计。

2.根据权利要求1中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S1包括:

S1.1:采集包含不同运动类型和场景复杂度的连续帧图像对,并获取每对图像对应的真值光流图作为监督标签;

S1.2:对样本图像进行数据增强处理,包括随机裁剪、随机翻转及颜色抖动操作;

S1.3:将样本数据集按照设定的比例划分为训练集、验证集和测试集,将图像统一调整至固定尺寸,并进行归一化处理。

3.根据权利要求1中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S2包括:

S2.1:构建深度感知特征编码器DFE,DFE模块包括深度感知特征编码路径、图像特征编码路径以及特征融合单元,分别执行双路径特征提取与融合;

S2.2:构建自适应特征对齐模块AWM,AWM模块包括空间变形单元、置信度估计单元和自适应加权门控单元,执行基于置信度的特征对齐;

S2.3:构建全局‑局部协同细化模块OFRM,OFRM模块包括全局上下文单元、局部精细感知单元、动态卷积与增强单元以及特征输出层,执行先概览后细看的特征细化;

S2.4:构建光流预测模块OFPM,OFPM模块包括特征解码层、预测头单元以及凸组合上采样单元,预测光流更新量及不确定性。

4.根据权利要求3中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S2.1具体包括:S2.1.1:构建深度感知特征编码路径;由深度感知模型的DINOv3编码器及DPT特征处理头组成;DINOv3编码器用于从输入图像中提取第五、七、九、十一层的特征表示作为各中间层特征,中间层特征包含图像块标记和全局标记;DPT特征处理头连接于DINOv3编码器之后,首先将提取的特征进行分离和投影映射,调整至统一的通道维度和空间分辨率,然后通过残差卷积单元从第四层特征开始逐级向第一层特征进行上采样和相加融合,最终输出包含多尺度信息的深度感知特征;

S2.1.2:构建图像特征编码路径;由ResNet18Deconv模块构成,包含编码部分和解码部分;编码部分由四级残差卷积单元依次串联组成,用于将输入图像下采样并提取四级特征,通道维度依次翻倍;解码部分从第四级特征开始,通过反卷积层进行上采样,并与编码部分对应层级的特征通过跳跃连接进行逐元素相加,相加后的特征经残差卷积单元精炼,直至恢复至第一级分辨率,生成图像结构细节特征;

S2.1.3:构建特征融合单元;由特征拼接层和卷积融合层组成;特征拼接层将深度感知特征与图像结构细节特征在通道维度上进行拼接,卷积融合层对拼接后的特征进行卷积投影,将其映射为通道数统一的融合特征图。

5.根据权利要求3中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S2.2具体包括:S2.2.1:构建空间变形单元,其输入端连接当前光流估计图和第二帧融合特征图;利用当前光流估计图计算第二帧融合特征图各像素的采样坐标,并通过双线性插值进行空间变形,输出对齐特征图;

S2.2.2:构建置信度估计单元,由输入拼接层、三层卷积层、批量归一化层及SiLU激活层串联组成;输入拼接层将第一帧融合特征图、对齐特征图、第一帧融合特征图与对齐特征图的逐像素绝对差值图以及当前光流估计图共四项沿通道维度拼接;末端卷积层连接Sigmoid激活函数,用于输出取值范围在零到一的逐像素置信度图;

S2.2.3:构建自适应加权门控单元,其输入端接收置信度图、对齐特征图及第一帧融合特征图;利用置信度图作为门控系数,对对齐特征图与第一帧融合特征图执行逐像素的加权求和操作,即对于每个像素位置,以置信度值加权对齐特征图,以一减去置信度值加权第一帧融合特征图,两者相加输出自适应对齐特征图。

6.根据权利要求3中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S2.3具体包括:S2.3.1:构建全局上下文单元;由堆叠的大核重参数化卷积块RepConvBlock、自适应全局平均池化层、压缩卷积层及上采样层依次串联组成;其中,RepConvBlock内部包含残差深度可分离卷积、膨胀重参数化块、批量归一化层和通道注意力单元;该单元用于提取自适应对齐特征图并生成与输入分辨率一致的全局上下文特征;

S2.3.2:构建局部精细感知单元;由上下文混合动态卷积块构成;其输入端设有拼接融合层,用于将自适应对齐特征图与全局上下文特征拼接融合;单元内部设有查询向量生成器和键向量生成器,分别从拼接融合后的特征与全局上下文特征中生成查询向量和键向量,通过点积运算产生全局关联权重;

S2.3.3:构建动态卷积与增强单元;包括动态参数投影层、分组卷积层、位置编码叠加层及SE门控单元;动态参数投影层将全局关联权重映射为两组分别对应小核和大核的动态卷积核参数;分组卷积层利用动态卷积核参数对自适应对齐特征图进行分组卷积;位置编码叠加层包含内部的膨胀重参数化块,并将分组卷积输出与由该膨胀重参数化块生成的局部增强位置编码相加,最终经SE门控单元调制输出局部细化特征;

S2.3.4:构建特征输出层;特征输出层连接于局部精细感知单元的末端,将堆叠的上下文混合动态卷积块输出的局部细化特征经批量归一化和卷积投影,得到最终的协同细化特征。

7.根据权利要求3中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S2.4具体包括:S2.4.1:构建特征解码层;特征解码层连接于局部精细感知单元之后,用于更新隐含状态,其输出端分别连接至光流预测头和上采样权重预测头;

S2.4.2:构建预测头单元;光流预测头由两个不同核尺寸的卷积层串联构成,用于输出两通道的光流更新量及额外的光流不确定性参数;上采样权重预测头由卷积层构成,用于输出设定通道数的上采样掩码权重;

S2.4.3:构建凸组合上采样单元;输入端接收光流更新量、当前光流估计图及上采样掩码权重,将光流更新量累加至当前光流估计图,并利用掩码权重对累加后的低分辨率光流进行局部空间邻域的加权凸组合计算,实现二倍上采样。

8.根据权利要求6中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S2.3.1中的RepConvBlock和步骤S2.3.3中的膨胀重参数化块,在训练阶段采用多分支并行结构以增强特征提取能力,在推理阶段将多分支参数等效融合为单个卷积核,实现结构重参数化以加速推理。

9.根据权利要求1中所述的基于深度感知与全局‑局部协同的光流估计方法,其特征在于,步骤S3包括:

S3.1:设置网络训练参数,包括批次大小、初始学习率、最大迭代轮数及迭代次数;采用AdamW优化器对光流估计网络进行迭代训练;

S3.2:将训练集中的图像对按批次输入光流估计网络,依次经DFE模块、AWM模块、OFRM模块和OFPM模块进行多次迭代,得到每次迭代输出的光流预测结果和不确定性参数;

S3.3:构建混合损失函数;对每次迭代输出的光流预测结果,计算该光流预测结果与真值光流图之间的端点误差,并结合不确定性参数构建归一化流损失,通过对各次迭代的损失按指数衰减权重进行加权求和,离最终迭代越近的预测结果获得越大的权重,得到最终的混合损失函数值;

S3.4:基于混合损失函数值,通过反向传播算法计算梯度并更新网络参数;当达到最大迭代轮数时停止训练,得到训练好的光流估计网络;

S3.5:利用验证集对训练过程中的模型进行性能评估,选取验证集上端点误差最小的模型参数作为最终的光流估计网络。