利索能及
我要发布
收藏
专利号: 2023108090753
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于注意力机制的托盘位姿估计方法,其特征在于,包括如下步骤:

步骤1:数据采集,将RGB‑D相机安装在叉车前端,获得图像I、点云集合S;以及图像I与点云集合S的对应集合IS;其中,图像I={(ruv,guv,buv)|u=1,2,...,H;v=1,2,...,W},W表示图像I的宽度,H表示图像I的高度,CH表示图像I的通道数,(ruv,guv,buv)表示图像I中第u行、第v列像素的R、G和B的值;点云集合S={(xi,yi,zi)|i=1,2,...,U},U表示点云集合S中的点的数目;对应集合IS={(ui,vi)|i=1,2,...,U},(ui,vi)表示点云集合S中第i个点对应图像I中第u行、第v列的像素;

步骤2:托盘分割,利用卷积神经网络对托盘样本图像进行训练,得到训练好的托盘检测网络模型MP,利用托盘检测网络模型MP提取托盘区域,实现托盘图像的分割,具体为:步骤2.1:卷积神经网络的构建,在MaskR‑CNN模型的基础上进行修改,包括主干网络的特征提取、含注意力机制的多尺度特征整合、区域建议网络、区域特征对齐、分支预测网络以及损失函数的设计;

步骤2.1.1:主干网络特征提取,采用标准的卷积神经网络ResNet作为主干网络进行特征提取,获得托盘特征C1;

步骤2.1.2:含注意力机制的多尺度特征整合,在FPN中添加注意力机制模块A获得多层次特征预测;

在FPN的自下而上的网络中,获得多层次的特征向量C2、C3、C4、C5;在FPN横向连接中添加注意力机制模块A;在FPN的自上而下的网络中,对特征C5、以及注意力机制模块的输出特征M4和M3进行上采样操作up,最终获得含注意力信息的中间特征向量M5,M4,M3,M2;在FPN的卷积融合中,对特征集合{M2,M3,M4,M5}中各特征向量分别进行conv卷积操作得到最终的预测,获得特征向量集合{P2,P3,P4,P5},分别对应于特征集合{C2,C3,C4,C5};其中,注意力机制模型A具体包括:步骤2.1.2.1:注意力机制模块输入:以特征向量Ci与特征向量Mi+1时输入到注意力模块;

步骤2.1.2.2:对特征向量Ci与特征向量Mi+1进行拼接,获得特征向量AConv,如式(1)所示:AConv=concat(Ci,up(2)(Mi+1))                    (1)其中,concat(·)表示拼接函数,up(2)表示up上采样函数,AConv的大小为w*h*(c1+c2);

其中,c1表示Ci特征向量的通道数,c2表示特征向量Mi+1的通道数;

步骤2.1.2.3:对特征向量AConv进行conv_1卷积操作获得特征层AConv1,如式(2)所示:其中,ω(c2,1×1)表示conv_1卷积操作函数,该卷积操作的核为1×1,通道数c为c2,AConv1的大小为w*h*c2;

步骤2.1.2.4:对特征AConv1进行分别进行ReLU函数、conv_2卷积函数和Sigmoid函数操作获得特征层Asig,如式(3)所示:ASig=σ(ω(c1,1×1)(ReLU(AConv1)))                  (3)其中,ReLU(·)表示ReLU函数,ω(c,1×1)表示conv_2卷积操作函数,该卷积操作的核为1×1,通道数c为c1,σ(·)表示Sigmoid激活函数,则特征向量Asig的大小为w*h*c1;

步骤2.1.2.5:将Asig和Mi+1两个特征矩阵相乘,获得注意力模块的输出特征向量Mi,如式(4)所示:其中,Mi特征大小为w×h,通道数为c1;

步骤2.1.2.6:对注意力模块的输出特征向量Mi进行conv的卷积操作,获得含注意力机制的AFPN网络的输出特征Pi,如式(5)所示:Pi=ω(c,3×3)(Mi)                            (5)其中,ω(c,3×3)表示conv卷积操作函数,该卷积操作的核为3×3,通道数c为c1,Pi特征层的大小为w*h*c1;

步骤2.1.3:区域建议网络,根据特征输出Pi生成建议区域,进行特征提取;

步骤2.1.4:区域特征对齐网络,进行特征图不同点采样,并应用双线性插值获取尺寸为7*7的感兴趣区域;

步骤2.1.5:分支预测网络,获取边界区域信息、类别信息和掩膜集合B,B={buv|u=1,

2,…,H,v=1,2,…,W},对于集合B中的任意元素buv表示图像I中第u行、第v列的像素是否为托盘区域,buv=1表示为托盘区域,否则为非托盘区域;

步骤2.1.6:损失函数的设计如式(6)所示:

Loss=Lcls+Lbbox+Lmask                          (6)其中,Lcls表示目标的分类损失值,Lbbox表示边界区域的回归损失值,Lmask表示掩模的损失值;

步骤2.2:卷积网络的训练,采用MSCOCO数据集对网络进行预训练,在预训练模型的基础上,利用所述的RGB‑D相机采集的托盘图像构成数据集,在该数据集基础上进行迁移学习,得到托盘检测模型M,其中,训练工具为pytorch,优化器为SGD;

步骤2.3:托盘分割,对于输入卷积神经网络的任意图像I,获得输出的掩模图像B,根据图像I与点云数据集合S中的对应关系集合IS,获得托盘点云数据集合SS,具体步骤包括:步骤2.3.1:遍历掩膜集合B中元素buv,对于满足buv=1的标识u和v记为u*和v*;

步骤2.3.2:遍历图像与点云对应关系集合IS,将集合IS中所有满足式(7)的元素i构成托盘点云标识集合并记作集合F={fj|j=1,2,...,V};

其中,V表示集合F中元素个数,即托盘像素点的个数;

步骤2.3.3:遍历集合F和点云集合S,将集合S中所有满足式(8)的三元组(xi,yi,zi)构成托盘点云集合并记作SS={(xk,yk,zk)|k=1,2,...,K};

其中,K表示托盘点云集合SS中点的数目;

步骤3:托盘位姿估计,采用主成分分析估计点云集合SS的法向量,并根据如式(9)计算托盘的具体位姿:其中,xk∈SX、yk∈SY、zk∈SD、(xk,yk,zk)∈SS、SX={xk|i=1,2,...,K}、SY={yk|i=1,

2,...,K}、SD={zk|i=1,2,...,K},SX、SY和SD是从点云集合SS中提取的x,y和z方向坐标值的集合,K表示点云集合SS中点的数目,V(·)代表基于主成分分析的法向量函数,(d,l,s)分别表示托盘前端面中心点相对于叉车的相对位置,θ表示托盘前端面相对于叉车的朝向姿态。