1.一种基于跨帧实例关联的视频实例分割方法,其特征在于,所述基于跨帧实例关联的视频实例分割方法,包括:构建并训练视频实例分割网络,所述视频实例分割网络包括多尺度特征提取器、变压器编码器、像素解码器和变压器解码器;
将待分割视频帧序列输入到多尺度特征提取器提取到不同尺度的特征图,按照尺度大小分别为特征图C2、C3、C4和C5;
将提取到的特征图C3、C4和C5输入至变压器编码器中提取到时空特征将特征图C2和时空特征 输入到像素解码器,并将时空特征 分离为与特征图C3、C4和C5尺度对应的特征 和 然后进行逐步上采样和交叉融合,得到融合后的时空特征和融合后的时空特征 以及融合后的时空特征将特征 和 输入到变压器解码器,得到最终的嵌入向量;
将嵌入向量与时空特征 进行点积操作,获得实例分割结果。
2.根据权利要求1所述的基于跨帧实例关联的视频实例分割方法,其特征在于,所述训练视频实例分割网络,包括对采集的视频帧序列进行预处理以生成训练样本数据,包括:从采集的视频帧序列数据集中取两段具有相同帧数的帧序列,将其中一段作为目标集合,将另一段作为源集合;
按照时间顺序,在目标集合和源集合之间建立图像帧的一对一对应关系;
然后将源集合图像中的实例复制粘贴到目标集合中对应的图像帧上,以生成新的帧序列,放入视频帧序列数据集中。
3.根据权利要求1所述的基于跨帧实例关联的视频实例分割方法,其特征在于,所述将提取到的特征图C3、C4和C5输入至变压器编码器中提取到时空特征 包括:将特征图C3、C4和C5进行位置编码,然后分别执行张量扁平化操作后输入可变形注意力模块,生成基本特征F;
将特征图C3、C4和C5进行位置编码,然后输入到S2S注意力模块,生成基础时空特征 所述S2S注意力模块包括尺度内时间注意力模块和尺度间时空注意力模块,所述尺度内时间注意力模块采用了时间注意力机制,所述尺度间时空注意力模块采用可变形注意力机制;
融合两个相同维度的特征F和 最后得到时空特征
4.根据权利要求1所述的基于跨帧实例关联的视频实例分割方法,其特征在于,所述将特征图C2和时空特征 输入到像素解码器,并将时空特征 分离为与特征图C3、C4和C5尺度对应的特征 和 然后进行逐步上采样和交叉融合,得到融合后的时空特征 和融合后的时空特征 以及融合后的时空特征 包括:将时空特征 分离为与特征图C3、C4和C5尺度对应的特征 和对特征 上采样,调整至与特征 相同的尺度,然后采用双线性插值法,将其与 交叉融合生成融合后的时空特征对融合后的时空特征 上采样,调整至与特征 相同的尺度,然后采用双线性插值法,将其与特征 交叉融合生成融合后的时空特征对融合后的时空特征 上采样,调整至与特征图C2相同的尺度,然后采用双线性插值法,将其与特征图C2交叉融合生成融合后的时空特征
5.根据权利要求1所述的基于跨帧实例关联的视频实例分割方法,其特征在于,所述变压器解码器包括串接的对应不同尺度的三个解码器单元以及一个MLP模块,所述将特征和 输入到变压器解码器,得到最终的嵌入向量,包括:将特征 和 输入到对应尺度的解码器单元,以输入的特征作为解码器单元的注意力掩码、键和值,第一个解码器单元的查询特征为初始化的查询特征,后续解码器单元的查询特征为前一个解码器单元输出的特征;
在每个解码器单元中,先进行跨越注意力操作,然后进行自注意力操作;
最后一个解码器单元输出的查询特征经过MLP模块生成最终的嵌入向量。
6.根据权利要求5所述的基于跨帧实例关联的视频实例分割方法,其特征在于,所述不同尺度的三个解码器单元循环迭代预设的次数。