利索能及
我要发布
收藏
专利号: 2023103709409
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种融合连续性特征的单目深度估计方法,其特征在于,包括以下步骤:

第一步:对原始的三通道彩色图像进行预处理,由原图得到IP IM IH三种图像;

第二步:将每种处理后的图像输入到特征编码器中,在保持高分辨率特征表示的同时逐渐融合低级特征;对多层卷积提取的特征进行拼接,通过对所有上一阶段小于自身的层数上的特征进行加权求和,得到该阶段特征;

第三步:解码器对多层卷积提取的特征进行拼接,对所有该阶段大于等于自身的层数上的特征进行加权求和,得到下一阶段特征;最终输出深度图。

2.根据权利要求1所述的融合连续性特征的单目深度估计方法,其特征在于:

所述第一步中,IM IP IH分辨率相同,IM由原图通过Resize操作获得,将原分辨率为(375,1242)的图转换为分辨率为h×w的图;IP在通过Resize操作获得分辨率为h×w的图后,将原图投影到梯形区域;其中梯形的高就是图像宽度,梯形的顶边就是图像长度,梯形P的底边边长由比例因子S 控制,与底边的比例在区间[0.7,0.9]内随机选择;IH先通过Resize操作得到尺寸为hH×wH的图像,再通过裁剪操作得到分辨率为h×w的图像;其中裁剪窗口与原图比例由比例因子SH控制,在[0.5,0.7]的范围内动态变化。

3.根据权利要求1所述的融合连续性特征的单目深度估计方法,其特征在于:所述第二步中,编码器包含四个阶段以及四个并行的子网,每个子网的分辨率降低为前一个子网的一半,相应的通道数增加了一倍;第一阶段的的卷积过程包含4个residualunit,每个unit由一个宽度为64的bottleneck组成,bottleneck之后使用一个3×3的卷积操作来降低特征图的通道数,重新变为residualunit输入时的通道数;第二,第三,第四阶段分别包含1、4、3个exchange unit,一个exchange unit包含4个residual unit;在这4个unit后,在每个不同分辨率的转换中都包含两个3×3的卷积;结束第四阶段后,也就得到了编码器的输出,对它使用3×3卷积得到解码器的输入。

4.根据权利要求1所述的融合连续性特征的单目深度估计方法,其特征在于:所述第二步中,解码器整体上和编码器呈现对称结构,具体不同包括:每个阶段的多尺度融合特征不会融合层数比自己低的层次的特征;在获得了多尺度融合特征后需要进行一次3×3卷积,经过卷积后的特征才可以进入下一阶段;当某特征已经是该阶段最高层时,该层特征只作为输入进入下一阶段;解码器最后的输出在经过一个1×1卷积层后输出深度图。

5.根据权利要求1所述的融合连续性特征的单目深度估计方法,其特征在于:第三步中使用组合损失函数进行网络的学习训练,损失函数包含最小光度误差损失、平滑损失、跨尺度一致性损失以及连续性损失;此损失函数组合的表达式为:(其中γμλ为超参数)由于照片中物体无法满足视作漫反射模型‑‑朗伯体模型,损失函数需要考虑光度误差损失:考虑某种情况:当多帧图像中同一位置,其中一帧图像被遮挡物所影响,此时使用平均值来进行处理显然是缺乏严谨的;为了解决遮挡带来的问题,使用最小重投影损失作为光度误差损失:损失函数中,为了只允许在灰度值差异较大的区域的深度差异较大,加入了边缘平滑损失:

损失函数中,通过计算连续性损失LMP约束网络显式学习场景的连续性信息:

损失函数中,通过计算跨尺度一致性损失LMH约束网络显式学习场景的尺度不变性信息: