1.基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:至少包括以下步骤:S1:由编码器、解码器和抓取预测模块组成网络架构,编码器用于对输入图像进行下采样编码提取抓取检测图像的特征信息,解码器对这些特征信息进行上采样解码分析,最后在抓取预测模型中实现像素级的抓取预测;
S2:图像特征编码,图像的特征编码是在网络的编码器模组中完成;
S3:图像特征解码,RGB和Depth图像经过编码器编码后得到了F1、F2、F3三个不同层级的特征编码,将这三个特征编码输入到解码器进行特征解码;
S4:抓取位姿预测,检测图像经过编码器的编码和解码器的解码后转化成了满足抓取检测所需的特征向量,把该特征向量输入抓取预测模块实现端到端的基于关键点的像素级抓取预测,最后利用网络生成与检测图像大小相同的像素图来预测抓取位姿;
S5:基于关键点的像素级的抓取检测表示,对于平行夹爪式抓取器,抓取检测的目标是检测出图像中满足抓取任务的抓取矩形;
S6:训练数据的生成;
S7:损失函数,网络的损失函数L包括抓取矩形中心点损失Ls抓取矩形角度和宽度损失LA、LW。
2.根据权利要求1所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述解码器包括残差上采样模块、跳跃特征融合模块以及双流特征提取模块,所述编码器至少包括残差下采样模块、Transformer‑CNN双流特征提取模块以及跨模态交互融合编码器构成,所述Transformer‑CNN双流特征提取模块与双流特征提取模块相同。
3.根据权利要求2所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述S1至少包括以下步骤:同一场景的RGB图像和Depth图像被分别单独送入编码器中;
在编码器中两个图像分别输入两个相同结构的编码网络中,在编码过程中提取出两种模态各层级的特征信息输入跨模态交互融合编码器进行特征校准和交互融合;
收集到编码器各个阶段的特征信息输入到解码器各阶段进行解码获得解码特征;
解码特征再输入到抓取预测模块抓取预测模块获得抓取预测所需要的三种像素图:抓取分数图S、抓取角度图A和抓取宽度图W;
最后根据这三个像素图得到抓取矩形的中心位置、宽、高以及抓取矩形的旋转角度。
4.根据权利要求3所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述S2至少包括以下步骤:残差下采样模块采用的是残差网络的设计,与原始的残差网络不同的是残差下采样模块使用泛化性更强的Leaky‑Relu激活函数和更加稳定通用的FRN归一化层替换了Relu和BN层,在残差下采样模块中,第一个3x3卷积层用来使通道数翻倍,第二个3x3卷积层使分辨率减半,而残差连接流用1x1卷积和最大池化操作完成着两个操作;
Transformer‑CNN双流特征提取模块结合了CNN组成的残差网络和Swin‑Transformer模块,以利用这两种网络架构的优势,在Transformer‑CNN双流特征提取模块中,输入的特in征向量f 经过一个1×1卷积层(Conv1×1(·))后被分别输入到SwinT分支(Trans(·))和残差卷积网络分支(Res(·))中进行特征提取获得 在两个分支分别进行特征提取的时候互不干扰,这样局部和非局部特征可以独立并行处理,有助于更好地提取特征,保证网络性能的同时具有更强的网络稳定性;
in
把 拼接(Concat(·))后再用一个1x1的卷积层使其通道数目恢复与f 一致in并与f 融合相加 得到最后的特征输出向量fout,整个过程公式化如下:跨模态交互融合编码器用于对RGB和Depth图像特征流进行特征校正,减少噪声影响,并融合多模态互补特征信息形成增强的特征表示,利用RGB和Depth两个模态特征的通道和空间相关性,对图像特征进行相互校准,实现更好的多模态特征提取和交互,形成更稳健的多模态特征信息;
跨模态交互融合编码器模块设计,使用全局平均池化来获得RGB特征图FRGB和深度特征图FDepth中的全局特征向量,将两个特征向量输入一个3x3的卷积层和Sigmoid激活函数中,以获得通道注意力向量 和 分别反映RGB特征和Depth特征的重要性,按通道相乘将注意力向量应用于输入特征,通过这种方式,得到的特征图 将明确地关注重要的信息,并抑制不必要的信息加强对场景理解;此过程定义为:其中,i∈[RGB,Depth],Conv3×3(·)表示卷积核大小为3×3的卷积操作,AvgPooling(·)表示全局平均池化操作, 表示按通道相乘;
注意力向量 和 通过最大聚合函数MAX来获得RGB流和Depth流中的权重最大特征通道注意力向量,然后对其做归一化运算(N(·)得到交互融合通道注意力向量fAtt ,有效地抑制了两种模态低质量的特征响应,保留了信息量最大的视觉外观和几何特征;
利用RGB流中的高置信特征来过滤掉相同级别的异常Depth特征,同时也抑制了Depth流中的噪声特征;
f
Att分别与FRGB和FDepth进行通道相乘获得通道上相互校准的特征向量 和然后分别与 和 相加获得跨模态交互的通道增强特征 和 此过程定义为:
其中,N(·)、MAX(·)分别表示归一化和最大聚合操作, 表示逐元素相加;
为了克服不同模态间特征差异性,同时对局部信息的空间特征进行校正,在跨模态交互融合编码器中还利用两种模态特征的空间相关性进行了跨模态互补聚合;
首先,把FRGB和FDepth拼接,分别用一个1x1卷积层把联合的特征图映射到两个空间权重图中,利用sigmoid激活函数得到两个互补校准的空间注意力图 和 将和 与输入特征相乘即得到了空间互补校准的增强特征 和
此过程可表示为:
Fm=Concat(FRGB,FDepth)
其中⊙表示在空间维度上相乘;最后交互联合 和 得到 和 作为下一个特征提取模块的输入。同时, 和 被进一步级联经过一个1×1卷积层生成跨模态融合特征 作为解码器的解码特征输入。 可表示为:
5.根据权利要求4所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述S3至少包括以下步骤:采用残差上采样模块使通道减半而分辨率变为原来的两倍,残差上采样模块中采用PixelShuffle操作来扩大分辨率,这种残差网络的设计相比于原始的残差网络模型的收敛速度会更快模型训练也更加稳定;
采用SE‑Net的通道注意力的思想设计了一个跳跃特征融合模块,整个融合模块由三个SE‑Block组成,首先用两个SE‑Block对输入的特征信息进行初步加权,然后在通道维度上对加权后的两个特征图进行拼接,通过一个卷积层使其恢复为原来的通道,最后再次利用SEBlock对融合后的特征进一步的加权,使用这种通道注意力机制,模型根据给定的输入来关注哪个模态的哪些特征以及抑制哪些特征,这样,在跳跃连接中只有最有用的信息被保留下来。
6.根据权利要求5所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述S4至少包括以下步骤:通过四个1x1卷积将解码器输出的特征图转换为四个与检测图像分辨率一致的像素图,分别对应于分数图s、角度正弦分量图sin、角度余弦分量图cos和宽度图W;
最终的抓握点由S中值最大的像素点来确定,抓取矩形的宽度由W中对应的像素值决定,最后的抓取角度图A根据正弦和余弦分量图共同确定,抓取矩形的角度通过以下公式计算:sin2θ=2sin(θ)cos(θ)
2 2
cos(2θ)=cos(θ)‑sin(θ)
其中sin(θ)和cos(θ)的值由角度分量图得到。
7.根据权利要求6所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述S5至少包括以下步骤:将2D图像中的抓取矩形可以表示为G={x,y,u,v,θ},其中(x,y)、u、v、θ分别是矩形G的中心点坐标、宽度、高度以及相对于图像的水平方向的旋转角度;
对于检测图像IMG中的每一个像素点都与一个潜在的抓取矩形对应,用三个像素图来描述IMG中的所有潜在抓取:其中 wi和hi是IMG的宽度和高度,S表示的是抓取分数图,图中每个像素点p(x,y)的值对应IMG中相同位置像素点潜在抓取矩形GP的抓取分数SP,其范围为[0,1];
SPSp的值越高,则GP就越合适抓取物体,最终的抓取矩形由最大的SP对应的像素点决定;
A表示的是抓取角度图,图中像素点的值表示对应抓取矩形的旋转角度θ;
W表示的是抓取宽度图,图中像素点的值表示对应抓取矩形的宽度w,抓取矩形的高设置为w的一半。
8.根据权利要求7所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述S6至少包括以下内容:T
实验中所用数据集的注释标签G,由一系列的抓取矩形框组成;
T G G G
把实验中所用数据集的注释标签G转化为与本发明网络相适应的标签:S、W、A;
T G G G
把实验中所用数据集的注释标签G转化为与本发明网络相适应的标签:S、W、A;
G T
S :使用G中抓取矩形的三分之一区域表示该抓取矩形的中心的可选区域,多个矩形的可选区域就组成了抓取对象的可抓取区域,即可作为抓取矩形中心的区域,把图中可抓取G区域的值设置为1,其他其余设置为0,生成了一个像素级的标签S;
G G G
W:W中的区域和S中的一致,将在可抓取区域中的值设置为每个矩形的宽度的G G GA :A中的区域和S 一致,值设置为tan(2θ),其中θ为抓取矩形的旋转角度,tan(2θ)可由以下公式可得:
9.根据权利要求8所述的基于Transformer‑CNN混合架构的RGB‑D跨模态交互融合机械臂抓取检测方法,其特征在于:所述S7中抓取矩形中心点损失LS抓取矩形角度和宽度损失LA、LW的损失函数的表达式如下:L=λ1LS+λ2LA+λ3LW
其中n指的是检测图像中像素点的数目,Si、Ai、Wi指的是三个检测图中对应第i个像素G G G点的值,S、A、W 指的是与训练数据集中抓取矩形注释标签相对应的三个像素图标签。λ1、λ2、λ3是各部分损失的权重系数。考虑到矩形中心点和角度的预测直接影响到抓取检测的准确率,λ1、λ2的值设置的比λ3更大一些,分别为1.5,1.5,1。