利索能及
我要发布
收藏
专利号: 2021110763610
申请人: 北京工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于编码‑解码网络的深度运动分离方法,其特征在于:(1)设计了一个用于分离全局运动的深度学习网络,对输入的光流分离出全局运动;

(2)针对全局运动分离网络的特点,设计了一种基于掩码mask的训练策略,对网络的输出进行约束,使网络学习光流中的全局运动特征;

(3)设计了一个局部运动分离深度学习网络和对应的网络训练策略,将光流和得到的全局运动经过组合输入局部运动分离网络,经网络计算后得到局部运动;并通过对应的训练策略约束网络的输出,使得网络从光流和粗糙的局部运动中提取出全局运动。

2.根据权利要求1所述的方法,其特征在于步骤(1)中,首先通过Pwc‑Net深度学习算法计算得到两个相邻视频帧之间的光流,作为全局运动分离网络的输入;将光流转化为64*

64*2的双通道运动场,两个通道分别代表水平运动幅度与垂直运动幅度;将光流平铺为长度为64*64*2=8192的一维向量ζ1输入网络;经过三个全连接层后,向量维度从8192‑>

1024‑>128‑>8逐渐降低到8,得到8维向量ζ2;其次,解码端被设计为与编码端对称的结构;

通过三个全连接层8‑>128‑>1024‑>8192后,向量维度从8逐渐增加到8192,得到8192维向量ζ3;由于编码端的输入向量ζ2建模了相机的全部运动,因此通过解码端得到的向量ζ3仅包含代表相机运动的全局运动;最终,将ζ3还原为64*64*2的运动场,再转化为与输入光流尺寸一致的运动场,从而得到全局运动。

3.根据权利要求1所述的方法,其特征在于步骤(2)中,利用迭代优化算法为每张光流图生成对应尺寸相同的二值化掩码mask,mask中的每个点的值代表光流中对应点的运动模式分类,为0表示该点在光流中为局部运动,为1表示该点在光流中为全局运动;将mask转化为64*64*1大小;全局运动和光流在分类为全局运动的像素点具有一致的运动值,因此用mask约束网络输出在这些像素点的值与光流中对应点的值相等,使网络学习从这些全局运动区域学习到全局运动规律;全局运动分离损失函数L1如公式(1)所示;网络训练时,采用Adam学习率更新策略,训练批次大小设置为256,初始学习率设置为0.001,并将光流的值除以20进行归一化;在反向传播阶段,通过公式(1),用光流与全局运动相减的结果与mask相乘,实现对全局运动区域误差的保留,同时去除非全局运动区域的误差,实现对网络输出中的全局运动区域的约束,更新网络参数,使得8维的ζ2向量更好地表达全局运动规律;其中,w表示光流图的宽度,h表示光流图的高度,n表示当前训练数据批次中的样本数量,i是当前(x,y)

训练批次中第i个样本的索引,MMi 是当前训练批次中第i个光流在像素点(x,y)位置上(x,y)

的运动值,GMi 是当前训练批次中第i个网络的输出在像素点(x,y)位置上的运动值,Mi(x,y)

是当前训练批次中第i个掩码在像素点(x,y)位置上的分类,1代表全局运动,0代表局部(x,y)

运动,因此Mi =0时无需计算误差,双竖线表示L2范数运算;

4.根据权利要求1所述的方法,其特征在于步骤(3)中,将光流与全局运动相减得到粗糙的局部运动,这个局部运动包含噪声区域的运动值;将粗糙的局部运动和光流都转化为

64*64*2的双通道运动场,然后在特征通道将两个运动场拼接为64*64*4的运动场,输入局部运动分离网络;网络训练时,对光流中的噪声区域位置进行了人工标注;利用标注信息从光流中裁剪出噪声区域的运动,与步骤一中得到的全局运动和局部运动分离网络的输出相加,得到重构的运动场;约束运动场和光流之间的误差,进而约束局部运动分离网络的输出为局部运动,如公式(2)所示;采用Adam学习率更新策略,训练批次大小设置为256,初始学习率设置为0.001,并将光输入运动场的值除以20进行归一化;网络训练时的反向传播过程,用公式(2)计算网络的误差L2,并更新网络权重参数;其中,n表示当前训练数据批次中的样本数量,i是当前训练批次中第i个样本的索引,MMi是当前训练批次中第i个光流的运动值,IMi是当前训练批次中第i个光流的噪声区域运动值,GMi是当前训练批次中第i个光流的全局运动,OMi是局部分离网络的输出,双竖线表示L2范数运算;