利索能及
我要发布
收藏
专利号: 2022101953589
申请人: 苏州湘博智能科技有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于无监督深度学习的单目视觉里程计的设计方法,其特征在于,包括以下步骤:步骤一:结合深度一致性和图像相似性损失函数得到尺度一致的无监督深度学习网络,并与RAFT光流网络联合训练得到更加鲁棒的光流;

步骤二:根据前后一致性误差,在密集光流中进行稀疏采样,得到对应关系;

步骤三:根据对应关系选择最优跟踪方式,联合深度网络进行深度对齐,从而得到尺度一致的视觉里程计;

所述步骤一中,无监督深度学习网络的框架包括三个部分:深度网络、相对姿态网络和光流网络,深度网络接收单个RGB图像作为输入并输出逆深度图,相对姿态网络和光流网络均接收两帧图像作为输入,相对姿态网络输出两帧之间的六自由度相对位姿,光流网络输出两帧之间的双通道光流;

所述步骤一中,在训练期间,同时估计相邻两帧图像深度,使用空间一致性约束使其深度信息一致;姿态网络和光流网络的输入为两张相邻RGB图像,联合相对位姿估计和深度估计得到合成图像,采用光度一致性损失函数和图像平滑损失函数优化深度信息和相机姿态,通过合成光流对RAFT网络进行联合优化;

在缺少真实深度信息和光流信息的情况下,无监督深度学习网络利用合成视图,以帧间相似性作为监督信号来训练网络模型;深度网络和光流网络通过相对姿态网络进行几何关联,其中相对姿态网络用来帮助约束深度网络和光流网络,且只在训练期间使用;

考虑两张相邻图像Ik和Ik+1,Ik表示第k张图像,通过相对姿态网络和深度网络得到相邻帧之间的相对运动Tk→k+1和单视图深度Dk,Dk+1,Dk表示第k个单视图深度,根据等式其中, 为从第k张图像像素坐标经过变换得到第k+1张图像的像素坐标; 为从序列k到序列k+1的预测相机相对运动, 为第k张图像像素的预测深度;p是图像像素坐标,pk是第k张图像的像素坐标,K是相机内参矩阵;将输入图像Ik进行变换得到合成图像由于图像是连续离散数值,使用可微双线性插值得到连续的像素坐标值,并由此得到一种合成光流Fsyn:无监督训练假设帧间相同物体表面外观也相同,在简单逐像素差基础上,引入结构相似度损失以学习相邻帧之间的结构信息,使用L1和SSIM损失结合作为重建图像损失:其中,Lp:损失函数结果; 结构相似损失函数;α=0.85,SSIM使用3×3大小的窗口计算,V是相邻帧有效共视区域;

在低纹理场景或均匀区域下,假设的光度不变性会导致预测空洞问题,为了得到平滑的深度预测,引入一阶边缘平滑项损失:其中,Ls:平滑损失函数结果; 表示图像视差梯度; 表示图像边缘概率图梯度,下标i,j表示像素坐标;x,y表示像素方向;Ii,j:图像(i,j)位置像素点;

分别是沿x,y方向的一阶导数;

对于动态物体,联合图像分割网络进行掩码处理,根据Monodepth2,使用二进制掩码,忽略与摄像机同步运动的对象,该掩码在网络的正向传递中自动计算:其中ω:二进制掩码; Lp(Ik,Ik+1):正文公式(3)中提到的图像重建损失函数;

分别表示第k张图像,第k张图像的合成图像,第k+1张图像;通过合成光流和RAFT光流网络的误差联合训练进行微调:Lf:联合微调损失函数结果;flow:图像光流场共同有效像素区域;FR(p):RAFT网络光流预测结果;Fsyn(p):合成光流网络光流预测结果;

在训练中,为了到结构一致的深度预测,通过光流网络将Dk+1与Dk对齐,计算深度一致性损失:其中,Ldc:深度一致性损失函数结果;Dk(p):第k张图像深度; 通过光流网络匹配计算得到的第k张图像的深度;S是光流和深度的共同有效区域,以此得到一致的深度估计;

综上所述,网络总体损失函数L为:

L=Lp+λsLs+λfLf+λdcLdc (8)

其中,λs、λf和λdc表示各项损失的权重,所有损失共同应用于深度网络和光流网络;

所述步骤二具体步骤为:

f b

(2‑1)前后光流一致性:从光流网络得到前向光流F和后向光流F并计算前后向一致性f b f 2dF=F(p)+F(p+F(p)) ;

(2‑2)稀疏点采样:将图像划分为10×10网格区域,并在每个区域中取dF小于阈值δ的前

20组稀疏匹配点;

所述步骤三具体步骤为:

(3‑1)模型选择:计算本质矩阵和单应矩阵,然后计算模型得分RF,RF=SF/(SF+SH),SF、SH分别为F,R模型得分;如果RF>0.5,则选择2D‑2D跟踪模式;反之,则选择3D‑3D跟踪模式;

(3‑2)尺度恢复:对于2D‑2D跟踪模式,从本质矩阵分解得到归一化的相机运动 R表示旋转矩阵,表示位移向量,其模长为单位1;然后使用三角化方法进行尺度对齐,恢复尺度因子s,得到 表示相机运动, 表示尺度恢复得到的实际位移长度;对于3D‑3D跟踪模式,使用ICP方式进行求解,得到Tk→k+1=[R|t],[R|t]表示相机的运动方式,t表示相机位移向量。

2.根据权利要求1所述的基于无监督深度学习的单目视觉里程计的设计方法,其特征在于,所述步骤(3‑1)中,受ORB‑SLAM初始化方法启发,考虑了2D‑2D和3D‑3D两种跟踪方式;

ORB‑SLAM使用模型得分方法仅进行初始化模型选择,跟踪过程则使用恒速运动模型以及PnP方法求解运动轨迹,由于同时具有2D‑2D和3D‑3D对应关系,仅使用模型得分RF进行跟踪方式的选择;首先求解单应矩阵Hcr和本质矩阵Fcr:其中,pc为相邻两帧中前一帧的匹配点,pr为相邻两帧中后一帧的匹配点,然后为H模型和F模型分别计算SH和SF得分:2

其中,M为H或F,ρM:模型得分S的中间计算结果;d:表示对称转移误差;Γ:等同于TH,是无效数据排除阈值; 当前帧第i′匹配点; 参考帧第i′匹配点; 分别是当前帧到参考帧之间、参考帧到当前帧之间的对称传递误差;误差TM为距离阈值,参考ORB‑SLAM,设TH=5.99,TF=3.84,Γ与TH定义相同;

当发生三维点云结构退化的情况时,通过深度网络得到尺度一致的深度信息,避免分解单应矩阵,通过SVD方法求解[R|t]:n:表示相邻两张图像特征匹配点数;i′:表示匹配点序号;R:表示相机旋转矩阵; 表示第k张图像的第i′处匹配点。