1.一种基于全局与局部特征的图像深度估计方法,其特征在于,所述方法包括:获取待估计的彩色图像;
对所述彩色图像进行数据预处理,得到输入图像InputRGB;
提取输入图像InputRGB中的全局特征与局部特征:利用SwinTransformer‑T模块提取输入图像InputRGB的全局特征,利用ConvNeXt‑S模块提取输入图像InputRGB的局部特征;
将提取得到的全局特征与局部特征进行融合,得到融合特征向量;
将融合特征向量解码恢复到输入图像InputRGB尺寸得到绝对深度图Depth_pre,对绝对深度图Depth_pre采用镜像预测得到预测深度图Depth_final,作为图像深度估计结果。
2.根据权利要求1所述的基于全局与局部特征的图像深度估计方法,其特征在于,所述数据预处理包括:利用CutDepth‑Mask数据增强方法作数据预处理;
还包括:随机水平翻转、随机裁剪、随机明亮度对比、随机gama正则分布、随机饱和度。
3.根据权利要求1所述的基于全局与局部特征的图像深度估计方法,其特征在于,利用SwinTransformer‑T模块提取输入图像InputRGB的全局特征,包括:将输入图像InputRGB作为SwinTransformer‑T模块的输入,利用一个卷积层将四维输入变量B x 3 x H x W展平成一个三维变量B x P x C,卷积核个数:C x 3,大小:7,步长:
4,填充:2,过程按如下公式所示:
式中, 输入图像I经过第i个卷积层生成的特征向量; 第i个卷积核的权重参数; 第i个卷积核的偏置参数;*:卷积运算;i的最大值为C;
将三维变量Iemb送入到由4个自注意力层以及3个下采样层组成的全局特征提取模块进行编码,自注意力层由多个线性层和不同的激活函数组成,下采样层则由一个大小为3,步长为2的卷积层组成;自注意力层的过程按如下公式所示:Q=(Iemb·Wq+bq)
K=(Iemb·Wk+bk)
V=(Iemb·Wv+bv)
式中Q、K、V为3个线性函数;Wq、Wk、Wv分别表示q、k、v三个线性层的权重参数;bq、bk、bv分别表示q、k、v三个线性层的偏置参数;softmax表示logistic回归函数,公式如下所示:d:特征向量K的维度;Gi:第i个自注意力层输出的全局特征向量; 第i个自注意力层第1个线性层的权重参数; 第i个自注意力层第1个线性层的偏置参数; 第i个自注意力层第2个线性层的权重参数; 第i个自注意力层第2个线性层的偏置参数;·表示矩阵乘法,T表示转置矩阵;
SwinTransformer‑T模块输出4个不同分尺度的全局特征向量G1、G2、G3、G4,分别为输入图像InputRGB尺寸的
4.根据权利要求1所述的基于全局与局部特征的图像深度估计方法,其特征在于,利用ConvNeXt‑S模块提取输入图像InputRGB的局部特征,包括:将输入图像InputRGB作为ConvNeXt‑S模块的输入,通过四层卷积块与四个下采样层组成的模块对InputRGB进行编码,其中每一个卷积块均由1个7x7大小的卷积核与2个1x1大小的卷积核串联构成,分别输出4个不同尺度的局部特征向量L1、L2、L3、L4,分别为输入图像InputRGB尺寸的
5.根据权利要求1所述的基于全局与局部特征的图像深度估计方法,其特征在于,将提取得到的全局特征与局部特征进行融合,包括:将局部特征L1、L2、L3、L4与全局特征G1、G2、G3、G4输入融合模块进行融合,获得融合特征向量M1、M2、M3、M4:式中:concat:拼接;dim:拼接的维度;Maxpool:最大池化,大小为3,步长为1,填充为1;
Avgpool:均值池化,大小为3,步长为1,填充为1;Conv:卷积,大小为3,步长为1,填充为1;i:第i个特征向量, 为中间参数。
6.根据权利要求1所述的基于全局与局部特征的图像深度估计方法,其特征在于,将融合特征向量解码恢复到输入图像InputRGB尺寸得到绝对深度图Depth_pre,包括:对融合特征向量M1、M2、M3、M4进行合并,得到合并后的融合特征向量Y1、Y2、Y3:使用两个连续的卷积连接邻近的融合特征Mi、Mi+1:Y1=Conv(Conv(concat(bilinear(M1),M2,dim=1)))Y2=Conv(Conv(concat(bilinear(Y1),M3,dim=1)))Y3=Conv(Conv(concat(bilinear(Y2),M4,dim=1)))式中,bilinear:双线性插值,缩放比例2;dim:拼接的维度;concat:拼接;Conv:卷积,Yi:每一次缩放合并后的特征图;
将Y3缩放为输入图像InputRGB一半的分辨率,缩放函数:Bilinear;利用卷积网络增强网络的拟合能力,最后再利用Sigmoid归一化,得到归一化后的Depth_pre_norm;过程如下公式所示:Depth_pre_norm=Sigmoid(Conv(bilinear(Y3)))将归一化后的Depth_pre_norm与预设的最大深度值max_depth相乘后采取双线性插值算法恢复到输入图像InputRGB尺寸,得到绝对深度图Depth_pre。
7.根据权利要求1所述的基于全局与局部特征的图像深度估计方法,其特征在于,对绝对深度图Depth_pre采用镜像预测得到预测深度图Depth_final,包括:所述绝对深度图Depth_pre包括绝对深度图的左图Depth_pre_L和右图Depth_pre_R;
式中,ship:水平翻转。
8.一种基于全局与局部特征的图像深度估计装置,其特征在于,包括处理器及存储介质;
所述存储介质用于存储指令;
所述处理器用于根据所述指令进行操作以执行根据权利要求1至7任一项所述方法的步骤。
9.一种存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至7任一项所述方法的步骤。