1.一种面向移动环境实时感知的三维目标检测方法,其特征在于,所述面向移动环境实时感知的三维目标检测方法,包括:将训练集中的移动设备多视角图像输入图像骨干网络提取得到图像二维特征;
将图像二维特征分别输入深度预测网络和语义预测网络,得到深度预测值和语义预测值,对深度预测值进行多级深度监督,对语义预测值进行语义监督;
将图像二维特征投影至三维空间中,得到BEV特征;
采用混合分辨率网格对BEV特征进行双线性插值采样,形成新的BEV特征;
将新的BEV特征输入BEV特征编码网络,再通过3D检测头得到移动设备环境的三维目标检测结果;
对三维目标检测结果进行检测监督,并结合多级深度监督和语义监督更新图像骨干网络、深度预测网络、语义预测网络、BEV特征编码网络和3D检测头;
实时采集新的移动设备多视角图像,输入训练后的图像骨干网络、深度预测网络、语义预测网络、BEV特征编码网络和3D检测头,得到对应的三维目标检测结果,并基于三维目标检测结果得到鸟瞰视角检测结果;
其中,所述对深度预测值进行多级深度监督,包括:(1)语义加权的点级绝对深度监督:将移动设备多视角图像的深度真值和语义真值进行one‑hot编码并下采样到图像二维特征的大小,得到深度标签值 和语义标签值,然后基于深度预测值 和深度标签值 ,计算Binary Cross Entropy损失如下:;
;
式中, 表示移动设备多视角图像的语义加权的点级绝对深度损失,表示输入为深度预测值 和深度标签值 的Binary Cross Entropy损失, 为前景背景权重因子, 为前景权重因子, 为背景权重因子,表示像素点属于前景, 表示像素点属于背景;
(2)目标内部结构级相对深度监督:取移动设备多视角图像中每个目标内部深度预测误差绝对值最小的像素点作为该目标的内部结构参考点 ,内部结构参考点 的深度预测值和深度标签值分别记为 和 ,所述深度预测误差绝对值为深度预测值和深度标签值的差值的绝对值,计算每个目标内部其他像素点相对内部结构参考点 的深度预测差值和深度标签差值,并计算两者的MSE损失,公式如下:;
式中, 表示移动设备多视角图像的目标内部结构级相对深度损失,表示输入为深度预测差值 和深
度标签差值 的MSE损失;
(3)目标空间分布级相对深度监督:每张移动设备多视角图像内取每个目标内部深度标签值最小的点作为该目标的代表点 ,代表点 的深度预测值和深度标签值分别记为和 ,计算深度预测值 和深度标签值 的差值,每张移动设备多视角图像内取差值绝对值最小的代表点作为代表点所在移动设备多视角图像的目标空间分布参考点 ,空间分布参考点 的深度预测值和深度标签值分别记为 和 ,再计算每张移动设备多视角图像内其他代表点 相对所在移动设备多视角图像的空间分布参考点 的深度预测差值和深度标签差值,并计算两者的MSE损失,公式如下:;
式中, 表示移动设备多视角图像的目标空间分布级相对深度损失,表示输入为深度预测差值 和深
度标签差值 的MSE损失;
(4)计算深度监督总损失如下:
;
式中, 表示移动设备多视角图像的深度监督总损失, 表示第一层级损失系数,表示第二层级损失系数, 表示第三层级损失系数。
2.根据权利要求1所述的面向移动环境实时感知的三维目标检测方法,其特征在于,所述对语义预测值进行语义监督,包括:将移动设备多视角图像的语义真值进行one‑hot编码并下采样到图像二维特征的大小,得到语义标签值 ,基于语义预测值 和语义标签值 ,计算Binary Cross Entropy损失如下:;
式中, 表示语义损失, 表示语义损失系数, 表示输入为语义预测值 和语义标签值 的Binary Cross Entropy损失。
3.根据权利要求1所述的面向移动环境实时感知的三维目标检测方法,其特征在于,所述将图像二维特征投影至三维空间中,得到BEV特征,包括:将图像二维特征与深度预测值进行外积,得到拉伸后的图像二维特征;
过滤拉伸后的图像二维特征中深度预测值小于深度阈值或语义预测值小于语义阈值的特征;
将拉伸后的图像二维特征中过滤后剩余的特征投影至三维空间,得到BEV特征。
4.根据权利要求1所述的面向移动环境实时感知的三维目标检测方法,其特征在于,所述采用混合分辨率网格对BEV特征进行双线性插值采样,形成新的BEV特征,包括:以BEV特征空间的网格平面中心为原点建立平面直角坐标系;
针对 轴的划分如下:在 范围内,按每格边长为 划分,在 范围内,按每格边长为 划分,在 按每格边长为 划分,其中, ;
针对 轴的划分如下:在 范围内,按每格边长为 划分,在 范围内,按每格边长为 划分,在 按每格边长为 划分,其中 ,, ;
基于划分后得到的新网格对BEV特征进行双线性插值采样,得到新的BEV特征。
5.根据权利要求1所述的面向移动环境实时感知的三维目标检测方法,其特征在于,所述对三维目标检测结果进行检测监督,包括:获取三维目标检测结果对应的移动设备多视角图像所标记的类别标签和三维检测框标签;
根据类别标签和三维目标检测结果中的类别预测值计算高斯聚焦损失,作为类别预测损失;
根据三维检测框标签和三维目标检测结果中的三维检测框预测值计算L1损失,作为三维检测框预测损失。
6.根据权利要求1所述的面向移动环境实时感知的三维目标检测方法,其特征在于,所述实时采集新的移动设备多视角图像,输入训练后的图像骨干网络、深度预测网络、语义预测网络、BEV特征编码网络和3D检测头,得到对应的三维目标检测结果,包括:采集新的移动设备多视角图像输入训练后的图像骨干网络提取得到待感知的图像二维特征;
将待感知的图像二维特征分别输入训练后的深度预测网络和语义预测网络,得到深度预测值和语义预测值;
将待感知的图像二维特征投影至三维空间中,得到待感知的BEV特征;
采用混合分辨率网格对待感知的BEV特征进行双线性插值采样,形成新的待感知的BEV特征;
将新的待感知的BEV特征输入训练后的BEV特征编码网络,再通过训练后的3D检测头得到移动设备环境的三维目标检测结果。