1.一种基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,包括以下步骤:S1、获取全景图像和深度图像,将其分别输入至ConvNext网络和Pointnet网络中提取得到颜色特征和深度点云,并根据颜色特征、深度点云和模型点云提取特征矩阵;
S2、将深度点云及其法向量信息和模型点云及其法向量信息输入至全局点云注意力模块,得到共同注意力图;
S3、将共同注意力图与特征矩阵输入至注意力感知位姿估计模块,得到最终位姿。
2.根据权利要求1所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S1中,特征矩阵包括密集特征矩阵和模型特征矩阵;
所述S1包括以下分步骤:
S11、获取全景图像和深度图像,从全景图像和深度图像中裁剪出感兴趣区;
S12、根据全景图像的感兴趣区和相机内参将深度图像转化为场景点云信息,并将全景图像的感兴趣区输入至ConvNext网络,得到颜色特征;
S13、从深度点云中随机抽取N个点,通过Pointnet网络提取N个点的几何特征,并将几何特征与颜色特征连接,得到密集特征矩阵;
S14、从模型点云中随机抽取N个点,通过多层感知机提取N个点的模型特征矩阵。
3.根据权利要求1所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S2中,全局点云注意力模块包括依次连接的伪孪生网络模块、点积函数层和softmax函数层;
所述S2包括以下分步骤:
S21、将深度点云及其法向量信息和模型点云及其法向量信息分别输入至伪孪生网络模块,得到深度注意力特征矩阵和模型注意力特征矩阵;
S22、将深度注意力特征矩阵和模型注意力特征矩阵输入至点积函数层,得到相关特征矩阵,将相关特征矩阵输入至softmax函数层,得到用于约束点对匹配的共同注意力图。
4.根据权利要求3所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S21具体为:通过伪孪生网络模块将深度点云及其法向量信息和模型点云及其法向量信息进行两次不同位置的输入,得到深度注意力特征矩阵和模型注意力特征矩阵,其中,所述伪孪生网络模块处理输入的方法相同,伪孪生网络模块处理深度点云及其法向量信息与模型点云及其法向量信息的方法具体为:SA1、通过多层感知机将6维的深度点云及其法向量信息与模型点云及其法向量信息提升至64维度和128维度,得到64维的第一~第二局部特征,以及128维的第三~第四局部特征;
SA2、将64维的第一~第二局部特征进行局部融合,得到128维的第五局部特征;
SA3、将128维的第三~第四局部特征进行局部融合,得到256维的第六局部特征,将第六局部特征进行编码,得到1024维的第七局部特征;
SA4、将1024维的第七局部特征进行平均池化,得到全局特征,将全局特征与128维的第五局部特征进行稠密融合,并对稠密融合的结果进行解码和归一化,得到既有局部特征信息又有全局特征信息的深度注意力特征矩阵;
SA5、利用伪孪生网络交换深度点云及其法向量信息与模型点云及其法向量信息输入的位置,重复SA1~SA4,得到既有局部特征信息又有全局特征信息的模型注意力特征矩阵。
5.根据权利要求3所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S22中,得到相关特征矩阵Rm,n的表达式具体为:Rm,n=g(Fsa,Fma)
式中,g(·)表示点积函数,Fsa表示深度注意力特征矩阵,Fma表示模型注意力特征矩阵;
m*
得到共同注意力图M n的表达式具体为:
式中,Ri,n表示相关特征矩阵中第n列的第i个的元素,Rk,n表示相关特征矩阵中第n列的第k个元素,m表示矩阵的行数,n表示矩阵的列数。
6.根据权利要求3所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S22中,得到的共同注意力图通过注意力损失进行约束,所述注意力损失Lattention的表达式具体为:m*n
式中,wtotal表示点对特征约束权重,M 表示共同注意力图,m表示矩阵的行数,n表示矩阵的列数;
所述点对特征约束权重的表达式具体为:
wtotal=γ1dm,n+γ2θd,N+γ3θN
式中,γ1、γ2和γ3均表示权重参数,dm,n表示点对距离矩阵,θd,N表示距离向量与法向量夹角,θN表示法向量夹角。
7.根据权利要求6所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述点对距离矩阵dm,n的表达式具体为:式中, 表示深度点云第mi个点, 分别表示深度点云第mi个点的x轴、y轴和z轴坐标值, 表示与深度点云第mi个点相匹配的模型点云第nj个点, 分别表示模型点云第nj个点的x轴、y轴和z轴坐标值;
所述距离向量与法向量夹角θd,N和法向量夹角θN的表达式具体为:式中,arccos(·)表示反余弦函数,Nm表示深度点云第mi个点的法向量,Nn表示模型点T云第nj个点的法向量,||·||表示L2范数,(·) 表示转置。
8.根据权利要求2所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S3中,注意力感知位姿估计模块包括第一~第三回归分支;
所述第一回归分支和第三回归分支均包括依次连接的多层感知机、连接操作和多层感知机回归器,所述第二回归分支包括相互连接的多层感知机和连接操作;
所述S3包括以下分步骤:
S31、将密集特征矩阵作为输入特征输入至第一回归分支,得到场景点到模型点的点对匹配,将模型特征矩阵作为输入特征输入至第三回归分支,得到模型点到场景点的点对匹配;
其中,所述场景点到模型点的点对匹配和模型点到场景点的点对匹配包括若干预测的点对;
S32、将密集特征矩阵输入至第二回归分支,通过多层感知机对密集特征矩阵进行解码,并根据解码的特征预测得到候选位姿;
S33、根据设置预测损失、位姿损失和注意力损失建立最终的损失函数,通过BiCo‑net根据最终的损失函数从所有预测的点对中计算第一位姿和第二位姿;
S34、将候选位姿、第一位姿和第二位姿进行合并,合并后取平均值,得到最终位姿。
9.根据权利要求8所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S31中,第一回归分支和第三回归分支相同处理输入特征的方法相同,所述第一回归分支处理输入特征的方法具体为:将输入特征输入至第一回归分支,通过多层感知机对输入特征进行解码,将解码输出的特征与共同注意力图进行连接,将连接后的结果输入至多层感知机回归器进行对应预测,得到场景点到模型点的点对匹配。
10.根据权利要求8所述的基于双向匹配和全局注意力网络的鲁棒6D位姿估计方法,其特征在于,所述S33中,预测损失包括图像预测损失函数Ls和模型预测损失函数Lm,其表达式具体为下式:式中,ε表示超参数,N、i、xi表示深度点云中第i个点的地面真值坐标、 表示深度点云中第i个点的地面真值法向量、 表示通过特征编码和解码后生成的对应预测点的坐标、 分别表示通过特征编码和解码后生成的对应预测点的法向量,xj表示模型点云中第j个点的地面真值坐标, 表示模型点云中第j个点的地面真值法向量, 表示通过特征编码和解码后生成的对应预测点的坐标, 表示通过特征编码和解码后生成的对应预测点的法向量;
所述位姿损失Lpose的表达式具体为:
式中,R、t表示地面真值位姿, 表示预测的逐点位姿,xk表示从对象的模型点云中随机选择的K个点中的第k个点,K表示对象的模型点云中随机选择的K个点、j表示距离最近点、||·||表示L2范数、minj∈[1,K]||·||分别表示计算所有K个点与距离最近点j的L2范数;
所述最终的损失函数Ltotal的表达式具体为:
式中,Lattention表示注意力损失, 表示损失函数之间的平衡参数;
所述S34中,得到最终位姿Tfinal的表达式具体为:
Tfinal=average(Td∪Ts∪Tm)
式中,Td表示候选位姿,Ts表示第一位姿,Tm表示第二位姿,∪表示并集,average(·)表示平均值函数。