1.一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,步骤如下:RGB图像通过2D目标检测器的检测把需要进行抓取检测的目标区域框选中,与同一物体的深度图像进行组合成四通道的图片作为输入;
四通道的输入经过Patch Partition模块分割成多块不重叠的patch,每个patch被看做是token,表示原始输入像素的级联;
将固定位置编码嵌入到每个token后传入编码器Encoder模块;
在编码器Encoder中,Linear Embedding层把每个token转化为C维的嵌入向量,接着经过patch merging+Transformer Block模组对token数量改变;
通过解码器Decoder执行与Patch merging相反的操作,通过patch Expanding+TransformerBlock模组对改变数量的token进行恢复;
通过多层级特征融合网络对Encoder收集的各层级输出特征进行融合;
生成与检测图像大小相同的像素热图预测抓取位置。
2.根据权利要求1所述的一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,Encoder模块收集到各个Encoder子块处理过后的特征图,通过下采样和卷积操作将特征图进行融合,并符合Decoder模块的输入规格。
3.根据权利要求2所述的一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,将符合Decoder模块输入规格的融合后特征图,通过Decoder模块处理,并在抓取预测模块得到有关抓取位置预测的抓取框的宽、抓取框的旋转角度的正弦与余弦两个分量以及该抓取置信度得分。
4.根据权利要求3所述的一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,抓取预测模块得到有关抓取位置预测的抓取框的宽、抓取框的旋转角度的正弦与余弦两个分量以及该抓取置信度得分,表达式如下:其中,g表示抓取检测模型预测的抓取位置,gScore、gSin、gCos、gwidth分别表示预测抓取g的置信度得分、旋转角度sin与cos分量和抓取预测框的宽;xn表示抓取检测网络输入到抓取预测模块的数据; 是抓取检测网络对输入数据处理的4个卷积操作。
5.根据权利要求1所述的一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,RGB图像通过2D目标检测器的检测把需要进行抓取检测的目标区域框选中,步骤如下:通过Faster—Rcnn对RGB图像进行检测,将抓取物体的位置用矩形框进行标注,在将除去矩形区域内的其他背景去除并作0填充。
6.根据权利要求1所述的一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,数据进入单个Transformerblock之前,使用LN对其进行归一化,然后进入W‑MSA模块,通过线性映射矩阵WQKV将输入序列t投影得到Q、K、V,表达式如下:[Q,K,V]=tWQKV
其中,t表示输入序列,Q表示查询向量,K表示键向量,R表示值向量;
通过矩阵点积计算Q和K间的相似度,与V进行加权,自注意力的计算表达式如下:其中,Attention(Q,K,V)表示输入序列t的自注意分数,SoftMax表示归一化指数函数,;d是向量Q的维度;B表示学习的相对位置编码;T表示转置符号,用来把向量K转置;
经过W‑MSA模块后,使用残差连接与最开始的输入进行融合后进行归一化,经过带有GELU的两层线性连接层(MLP),再次使用残差连接融合前面的输入信息在传到带有SW‑MSA的Transformerblock,表达式如下:l l‑1
其中,和t 分别表示第l模块(S)W‑MSA模块和MLP模块的输出,t 表示前一层的输出特征。
7.根据权利要求1所述的一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,热图中每个像素表示的该像素的抓取位置;
通过线性层与形状重排操作把Decoder的输出分辨率转为与图像大小一致,通过四个
1x1的卷积生成四个单通道像素热图分别对应抓取检测的S、W、sin2θ、cos2θ,通过公式确定抓取角度θ,最终抓取由抓取分数图S的最高分数抓取决定。
8.根据权利要求1所述的一种基于Transformer的区域预估与多层级特征融合抓取检测方法,其特征在于,对预测抓取位置进行验证,步骤如下:当抓取位置G与ground truth G'同时满足条件|Gθ‑G'θ|<30°和条件认识抓取位置G正确;
条件|Gθ‑G'θ|<30°表示预测抓取框与标注矩形框的角度大小相差小于30°;
条件 表示预测的抓取框与标注矩形框的交并比大于25%。