1.一种基于多掩膜融合的视觉SLAM方法,其特征在于,包括以下步骤:S1、获取RGB图像及其对应的深度图像,从RGB图像提取特征点,从深度图像中获取深度信息;
S2、对RGB图像中的物体进行分类,分别为C1,C2和C3;其中,C1表示绝对静止的物体,C2表示潜在运动的物体,C3表示预先设定的运动物体;
S3、仅使用C1区域的特征点进行相机位姿初步估计得到Tinit,根据Tinit计算特征点的极线约束误差eepi与深度投影误差edepth,将两种误差进行融合,并对属于C1类别的静态特征点进行建模,然后使用卡方检验判断其余特征点的运动状态;
S4、计算不属于动态点的特征点的静态权重 用于加权相机位姿估计,以得到最终相机位姿估计结果Tfinal;
S5、根据动态点计算得到动态区域掩膜Mg,并与C3类别区域的动态区域掩码Ms进行融合得到第一动态区域掩膜 基于该动态区域检测结果,进而对静态场景进行重建。
2.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,采用ORB方法提取RGB图像中的特征点,并与前一关键帧中的特征点进行匹配,用于相机位姿估计。
3.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述对RGB图像中的物体进行分类,分别为C1,C2和C3,包括:使用语义分割网络对RGB图像进行图像预处理,根据语义分割结果的标签对图片中的物体进行分类,分别标记为C1,C2和C3类别。
4.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述根据Tinit计算特征点的极线约束误差eepi与深度投影误差edepth,将两种误差进行融合,并对属于C1类别的静态特征点进行建模,然后使用卡方检验判断其余特征点的运动状态,包括:设上一关键帧与当前帧分别为 与 p1和p2为该两帧之间的匹配点,其中p1为当前帧中的一个特征点,p2为上一关键帧 中的一个特征点,这两点的齐次坐标分别为p1=T T[u1,v1,1]和p2=[u2,v2,1],则点p1的极线约束误差为:其中,u1,v1,u2,v2表示特征点在图像坐标系上的坐标,X,Y为当前帧的极线的向量,F表示基础矩阵,上标T表示转置;将特征点p1对应的三维点P投影到上一帧 中得到点p′,并得到其投影深度值为zproj,点p′在帧 中的深度值为z′;则点p1的深度投影误差为:edepth=|zproj‑z′|
根据初步估计位姿结果Tinit,计算得到先验静态点的平均极线约束误差与深度投影误差分别为 和 且这两个误差独立同分布,则处于静止状态的特征点的应服从的误差分布为:其中,Σ为协方差矩阵,其表示尺度的不确定性,一个特征点的协方差矩阵Σ计算公式为:其中,s表示特征点提取的图像金字塔每层缩小的尺度,p表示图像金字塔每一层的标准差,n表示特征点所在的图像金字塔层数;将特征点极线约束误差eepi与深度投影误差edepth结合成为误差向量E=[eepi,edepth],对于静止的特征点,其误差组成的误差向量应服从高斯分布,其误差向量E表示为:其中, 表示属于C1类别的特征点的平均误差向量值,通过计算误差向量E的内积,从而得到属于C2和C3类别的特征点pi的卡方检验值:得到的ri应当服从自由度为2的卡方分布:
根据特征点pi的卡方检验值ri判断该点的运动状态:
5.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述计算不属于动态点的特征点的静态权重 用于加权相机位姿估计,以得到最终相机位姿估计结果Tfinal,包括:对于不属于动态点的特征点pi,其静态权重 计算公式为:其中 表示不属于动态点的特征点pi的静态权重值,ri表示不属于动态点的特征点pi的卡方检验值,Semantic(pi)表示不属于动态点的特征点pi的标签类别;将所得到的静态权重加入到最终相机位姿估计中得到:其中,R,t分别表示相机的旋转矩阵与平移向量,m表示不属于动态点的特征点数量,Π(·)表示相机投影模型。
6.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述根据动态点计算得到动态区域掩膜Mg,包括:仅计算C2类别区域的动态点,得到动态区域掩膜Mg。
7.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述根据动态点计算得到动态区域掩膜Mg,并与C3类别区域的动态区域掩码Ms进行融合得到第一动态区域掩膜 包括:根据动态点之间的欧几里得距离,使用DBSCAN聚类方法进行分组,并得到每个组的凸包,进而生成运动区域掩膜Mg,并与C3类别区域的动态区域掩码Ms进行融合得到第一动态区域掩膜
8.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述步骤S5还包括:第一动态区域掩膜 分为T个独立的掩膜 并计算其中每个独立掩码 的平均深度值dt:
根据dt寻找与其深度值在第一预设阈值范围内的图像区域
将 分解为K个相互独立的区域 并计算 和 两个掩膜之间的相交率;通过相交率大于等于第二预设阈值确定 中的有效掩膜 并将 和 融合得到第二动态区域掩膜 H表示有效掩膜的数量。
9.根据权利要求8所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述第一动态区域掩膜 分为T个独立的掩膜 表示为:所述计算其中每个独立掩码 的平均深度值dt,计算公式为:其中,pj表示在 区域第j个像素点,D(pj)表示点pj的深度值;
所述根据dt寻找与其深度值在第一预设阈值范围内的图像区域 其判断过程为:其中,p表示图中的任意一像素点,τ1表示第一预设阈值;
将 分解为K个相互独立的区域 表示为:
并计算 和 两个掩膜之间的相交率,其公式为:
其中,P(·,·)表示两个掩膜之间的相交率,N(·,·)表示两个掩膜之间相交的像素点的个数;
通过相交率大于等于第二预设阈值τ2确定 中的有效掩膜 q表示中存在q个符合条件 的区域, 表示其中一个符合该条件的区域,1≤z≤q;
所述将 和 融合得到第二动态区域掩膜 表示为:
10.根据权利要求1所述的一种基于多掩膜融合的视觉SLAM方法,其特征在于,所述基于该动态区域检测结果,进而对静态场景进行重建,包括:在建立稠密点云地图时,将得到的动态区域的点云剔除后即可得到静态且可靠的点云地图。