利索能及
我要发布
收藏
专利号: 2024100776923
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-09
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述方法包括:将获取的单目图像输入特征提取网络中,输出二维检测结果;

对二维检测结果采用RoIAlign方法裁剪出RoI特征;

将单目图像归一化后的坐标图以通道方式与裁剪出的每个RoI特征的地图连接,形成最终的RoI特征;

根据最终的RoI特征预测三维检测信息;

将二维检测结果中预测的二维框高度与三维检测信息中预测的三维框高度采用几何投影公式计算出目标深度;

将三维检测信息中直接求出的深度以及几何投影公式计算出目标深度,通过不确定性加权融合得到最终的深度;

将预测的三维检测信息与加权融合得到最终的深度进行融合,输出目标的预测信息。

2.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述二维检测结果包括四个部分:Heatmap:预测目标的类别分数和2D框中心的粗坐标;

Offset_2D:预测3Dbounding box中心点投影和2Dbounding box中心坐标在降采样后的偏移;

Size_2D:2D框的高和宽,单位像素;

Residual_2D:2Dbounding box中心坐标降采样以后的残差。

3.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述三维检测信息包括:Angle:角度预测输出,采用multi‑bin策略,分成24个区间,前12个用于分类预测输出,后12个回归预测输出;

Direct_depth:使用特征提取网络直接预测目标的深度信息,输出两列信息,第一列为深度值,第二列为不确定;

Offset_3D:3Dbounding box中心点投影在下采样后的残差;

Size_3D:3Dbounding box的尺寸信息,实际预测的是尺寸的偏差,将预测的偏差加上数据集中目标的平均尺寸得到预测尺寸;

Depth_bias:预测深度的偏差值,弥补对截断目标深度预测的偏差。

4.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述特征提取网络的损失函数为:;

初始设置二维检测部分的权重 ,三维检测部分 ; 表示为整体损失;

表示为各个预测分支的损失。

5.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,将所述三维检测信息中直接求出的深度以及几何投影公式计算出目标深度,通过不确定性加权融合得到最终的深度的方法如下:在最终的RoI特征进行直接深度估计:

其中, 是三维信息中的预测分支,用于估计深度以及不确定性,表示直接深度估计结果,是设定参数, 表示建模深度估计中的异方差随机不确定性;

将服从拉普拉斯分布 的三维框高度带入几何投影公式,根据几何投影预测的深度为:;

其中,表示焦距, 表示二维框高度,服从标准拉普拉斯分布 , 表示三维框高度, 表示尺度参数, 表示三维框高度的均值;

同时三维检测信息中还预测出服从拉普拉斯分布 , 的深度偏差,利用拉普拉斯分布的可相加性,得到最终的几何投影预测的深度和不确定性为:, ;

其中, , , 表示深度偏差的方差, 表示深度偏差的均值, 是基于几何投影的不确定性; 表示为基于几何投影的深度; 表示为 ;

将RoI特征上求出的直接深度 和基于几何投影的深度 ,使用不确定性引导融合起来;权重 计算公式:;

其中,表示直接深度估计,表示基于几何投影深度估计,表示直接深度估计和基于几何投影的深度估计的不确定性; 表示直接深度估计和基于几何投影的深度估计的不确定性的平方和;表示为直接深度估计的不确定性或者基于几何投影深度的不确定性;

最终的目标深度 和不确定性 计算公式:

, ;

因为目标深度也服从拉普拉斯分布,所以目标深度信息的损失函数表达式为:;

其中, 表示标签真值,表示目标深度, 表示不确定性,表示两种深度估计,表示深度估计对应的不确定性。

6.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述根据最终的RoI特征预测三维检测信息包括:在所述RoI特征上进行,经过卷积、组归一化、激活、可适应性平均池化和卷积操作,输出预测的三维检测信息。

7.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述特征提取网络包括DLA‑34主干网络和Neck网络,所述DLA‑34主干网络采用Centernet框架,所述DLA‑34主干网络用于将输出的6层特征图的最后4层特征图输入Neck网络,所述Neck网络将输入的4层特征图输出一层特征图作为二维检测结果。

8.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述目标的预测信息包括三维中心点坐标、尺寸和偏航角。

9.根据权利要求1所述的面向自动驾驶的单摄像头三维目标检测方法,其特征在于,所述RoI特征只包含对象级特征。

10.一种面向自动驾驶的单摄像头三维目标检测系统,其特征在于,所述系统包括:特征提取模块,用于获取单目图像输入特征提取网络中,输出二维检测结果;

特征裁剪模块,用于对二维检测结果采用RoIAlign方法裁剪出RoI特征;

归一化模块,用于将单目图像归一化后的坐标图以通道方式与裁剪出的每个RoI特征的地图连接,形成最终的RoI特征;

三维检测模块,用于根据最终的RoI特征预测三维检测信息;

算法模块,用于将二维检测结果中预测的二维框高度与三维检测信息中预测的三维框高度采用几何投影公式计算出目标深度;

不确定性融合模块,用于将所述三维检测信息中直接求出的深度以及几何投影公式计算出目标深度,通过不确定性加权融合得到最终的深度;

融合模块,用于将预测的三维检测信息与加权融合得到最终的深度进行融合,输出目标的预测信息。