利索能及
我要发布
收藏
专利号: 2022109067656
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向动态环境的轻量级视觉语义里程计量方法,其特征在于,所述方法包括以下步骤:步骤(1),通过RGB‑D相机采集RGB图像和Depth图像,并将RGB图像分别发送给ORB特征提取线程和语义分割线程,将Depth图像帧发送给深度轮廓检测线程;

步骤(2),ORB特征提取线程根据发送过来的RGB图像帧提取每帧图像的ORB特征,并根据极线约束检测动态特征点,然后等待语义分割线程的动态目标分割结果;

步骤(3),语义分割线程首先利用轻量化语义分割网络分割传送过来的每帧RGB图像,获取分割后的图像掩膜,并且等待深度轮廓检测线程的深度掩膜结果;

步骤(4),深度轮廓检测线程通过遍历每个像素的深度值获取深度梯度,从而确定相近深度的目标,并且生成深度掩膜,然后基于形态学处理对深度掩膜进行膨胀,以扩展由于相机精度造成的掩膜边界模糊,并发送给图像边界融合模块;

步骤(5),图像边界融合模块接收到轻量化语义分割网络的场景分割结果和深度轮廓扩展后的深度掩膜,基于加权平均法融合掩膜,实现动态掩膜修正;

步骤(6),利用步骤(5)修正后的掩膜和步骤(2)初步筛选出的动态特征点确定最终的动态特征点并剔除,将剩余的静态特征点输入视觉里程计模块构建语义点云地图;

所述步骤(4)的过程如下:

深度轮廓检测线程接收到发送过来的Depth图像帧,进行深度掩膜的创建工作;分为粗遍历和精遍历两部分;首先进行粗遍历,使用30×30的滑块,步幅为30遍历Depth图像,记录滑块中的深度值:D=d(x:x+29,y:y+29) (7)其中,D表示对应像素的深度值,x和y分别表示对应像素的横坐标和纵坐标;

对于边界的像素点,滑块可以随边界像素块的大小改变,即

其中,n为滑块的长度,m为滑块的宽度;

遍历完一张深度图像后,将连续相近的深度梯度范围内的深度图像归为一类:Obj(n),n=1,2,3,4,… …,k    (9)

其中,Obj(n)表示类别;

接着,对图像进行去噪处理,去除一些小于1000像素孤立的图像块;其次进行精遍历,基于粗遍历得到的深度值,利用语义分割获取的动态先验掩膜对深度像素进行进一步的标注,赋予深度图像块标签,并且对粗遍历得到的深度图像分类,基于灰度重心法对具有先验动态目标标签的深度图像块进行亚像素边界提取,以进一步明确目标掩膜边界,如下其中,I(x,y)表示灰度图像,(x,y)表示图像的像素坐标,S表示待提取的目标,(x0,y0)表示灰度重心坐标;由此得到细化边界后的动态目标深度掩膜;

最后,基于形态学膨胀法进一步扩展深度掩膜,以防止发生动态噪声点泄露的问题;将细化边界后的深度图像进行灰度化处理,遍历动态目标的图像块,像外扩张一定的距离,直到阈值τ停止。

2.根据权利要求1所述的面向动态环境的轻量级视觉语义里程计量方法,其特征在于:实现所述方法的面向动态环境的轻量级视觉语义里程计包括跟踪模块、视觉里程计模块和语义建图模块,所述步骤(1)的过程如下:跟踪模块分为三个子线程:ORB特征提取线程、语义分割线程、深度轮廓检测线程,且三个线程并行运行;其中,RGB图像帧分别发送给ORB特征提取线程和语义分割线程,Depth图像帧发送给深度轮廓检测线程。

3.根据权利要求1或2所述的面向动态环境的轻量级视觉语义里程计量方法,其特征在于:所述步骤(2)的过程如下:基于RGB图像帧检测动态特征点,匹配当前图像帧Ic和前一帧Ip中提取的特征点,并且通过随机采样一致性算法和列文伯格‑马夸尔特算法求解两帧图像间的单应矩阵H,假设像素点集Ppn是Ip上的点,其表达式为:T

Ppn=[upn vpn 1] ,n=1,2,3,4,5,……,k    (1)其中,Ppn为前一帧图像Ip上的点集的坐标,upn和vpn为点的横坐标和纵坐标,n为点的序号,k为正整数,对应的Ic上的点集的坐标为T

Pcn=[ucn vcn 1],n=1,2,3,4,5,… …,k    (2)其中,Pcn为当前帧图像Ic上的点集的坐标,ucn和vcn为点的横坐标和纵坐标,n为点的序号;

通过单应矩阵H求得

Pcn=HPPn,n=1,2,3,4,5,……,k    (3)

至此,通过求解最小二乘问题得到前一帧图像Ip和当前帧图像Ic之间的相机位姿:其中,Ppi和Pci分别对应Ppn和Pcn上序号为i的点,R和t分别表示两帧图像间的旋转矩阵和平移向量,N为正整数;

为了获取动态特征点,首先,需要从Ip和Ic中提取匹配点,并且通过RANSAC算法计算两帧图像之间的基础矩阵F;然后,使用基础矩阵F计算当前帧中的极线;因此,分别选取点集T TPpn和Pcn上的一个像素点Pp1=[up1 vp1 1]和Pc1=[uc1 vc1 1] ,且Pp1∈Ppn,Pc1∈Pcn,计算极线lp1:其中,X,Y,Z代表内联矩阵,即点P的横坐标、纵坐标以及竖坐标,F为基础矩阵;之后,我们计算特征点到相应极线的距离:其中,d表示特征点到相应极线的距离,

依次遍历当前帧与前一帧中的点集,当d大于我们设置的阈值ε,则为动态特征点,并且存入动态点集中,等待语义分割的掩膜。

4.根据权利要求1或2所述的面向动态环境的轻量级视觉语义里程计量方法,其特征在于:所述步骤(3)的过程如下:语义分割线程收到发送过来的RGB图像帧,将其传入语义分割网络进行语义特征的提取;为了提高语义信息获取的效率,引入轻量化语义分割网络TopFormer提取语义特征,并且将训练好的模型转化为ONNX模型,基于ONNXRunTime‑GPU版本利用CUDA加速推理;

引入的轻量化语义分割网络TopFormer为一种基于TransFormer的轻量化语义分割网络,其微型版本可以在基于ARM的移动设备上产生具有竞争力的实时推理结果;使用ADE20K数据集训练模型,该数据集提供了150个分类类别,可充分应对室内场景分割任务,并且针对室内动态场景,将常见的室内物体分为静态物体、动态物体以及可移动物体,其中,静态物体有床、桌子、电视,动态物体为人,可移动物体为椅子、书、花瓶;将输入的RGB图像尺寸变换为512×512×3输入到语义分割网络,输出相同尺寸的彩色掩膜和灰度图像,并且检测动态先验目标的灰度值,根据其灰度值判断当前帧中是否有动态目标,如果有动态目标,则将是否有动态目标的标志位进为1。

5.根据权利要求1或2所述的面向动态环境的轻量级视觉语义里程计量方法,其特征在于:所述步骤(5)的过程如下:步骤(4)的动态目标深度掩膜到达后,将步骤(3)的语义分割图片与步骤(4)的深度图片转换成相同的尺寸;遍历语义分割图片以及深度图像,分别记录动态目标坐在图像块的掩膜坐标,使用加群平均法融合两个图像:F(x,y)=ωa·A(x,y)+ωb·B(x,y)   (11)其中,ωa、ωb为加权系数,A(x,y)与B(x,y)分别为深度掩膜与原始掩膜的坐标;

由于TopFormer语义分割网络对物体边界分割不清晰,并且针对人的分割会产生掩膜膨胀的问题,取两者的交集,以深度掩膜边界为准:其中,Mf为最终修正的掩膜, 与 分为动态目标的原始掩膜和深度掩膜。

6.根据权利要求1或2所述的面向动态环境的轻量级视觉语义里程计量方法,其特征在于:所述步骤(6)的过程如下:结合几何特征检测和语义信息去除动态特征点,并且利用剩余的静态特征点构建三维点云语义地图;如果通过极线约束检测到的动态特征点落在语义分割线程分割的动态掩膜上,则判定物体是运动的;如果物体被判定是运动的,则将动态掩膜内的特征点全部删除;

利用剩下来的静态特征点结合深度图像生成点云,然后映射到地图中,并且根据场景分割的标签颜色赋予相应的点云颜色,生成具有语义信息的地图。