利索能及
我要发布
收藏
专利号: 2023107340323
申请人: 杭州电子科技大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于Vision Transformer注意力筛选的行人重识别方法,其特征在于包括如下步骤:步骤(1)、获取具有行人身份标签的行人图像,对图像进行图像增强操作,并对图像统一处理以保证模型能够接收图像集的输入;

步骤(2)、构建基于Vision Transformer的全局‑局部特征抽取的行人重识别模型;所有预处理后的行人图像通过行人重识别模型中主干模型的两个分支获得行人特征,并通过多个分类器获得行人身份预测;

步骤(3)、训练行人重识别模型,直到模型收敛;将得到的行人身份预测、行人重识别模型中主干模型输出的行人特征、行人身份标签计算损失,再使用随机梯度下降使得损失减少以帮助模型收敛;

步骤(4)、行人预测;获取多组没有参与训练的包含行人身份标签的行人图像,每个行人应该至少有两张图像;对图像集统一处理后,分别从每个行人图像中各抽取一张作为query,其余图像作为gallery;将query和gallery输入到模型中获得两组特征,计算这两组特征距离,找到gallery中与query最相似的图像。

2.根据权利要求1所述的基于Vision Transformer注意力筛选的行人重识别方法,其特征在于步骤(1),具体如下:准备包含行人身份标签的图像数据集,该数据集通过行人检测模型、生成模型、人工标注三种方式获得;每一张图像应包含一个行人在摄像视角下完整图像;首先对图像做统一的增强处理:随机水平翻转、填充、随机部分裁剪、随机擦除、正则化,然后对图像裁剪成长高为256*128的图像;在输入到模型前需要保证样本均衡,即输入的每一批次图像应保证每一类行人的样本数目相同,保证模型不收敛在次优解中。

3.根据权利要求1所述的一种基于Vision Transformer注意力筛选的行人重识别方法,其特征在于步骤(2)具体如下:构建基于Vision Transformer注意力筛选的行人重识别模型;首先构建Transformer块,它由多头自注意力方法、层归一化和多层感知机组成,单个Transformer块公式为:Z′l=MSA(LN(Zl‑1))+Zl‑1 l=1…L    (1)

Zl=MLP(LN(Z′l))+Z′l l=1…L    (2)

Transformer整体由L层Transformer块组成,其中Zl表示第l层Transformer块输出的特征,L的值是12;其中多头自注意力方法通过计算特征内部的相似度得到,具体公式如下:注意力则通过计算Q和K的相似度来完成寻址;Q和K计算出来的相似度反映了取出来的V值的重要程度,即权重,然后加权求和就得到了注意力值;自注意力机制在KQV模型中的特殊点在于K=Q=V,它们分别表示注意力机制过程中的query,key,value,这也是为什么取名自注意力机制;其中dk是Q(*)和K(*)输出的维度, 则是一个比例因子;其中K、Q、V的具体实现如下:图像输入到Transformer块进行自注意力计算前需要将每一张图像分成多个patch;设单张图像为256*128*3,则需要将其分割成: 其中P为16,是patch的边长;

同时为了避免patch之间相关性被破坏,采用非重叠的patch embedding,具体公式如下:其中,S是设定的步幅,H和W是图像的长和宽,N是进行非重叠分割得到的patch数量;

将处理后的张量加上初始化过的[CLS_TOKEN]和[POS_TOKEN]输入到模型中,具体公式实现如下:其中,xcls是[CLS_TOKEN],用于最后的分类预测; 是完成patch embedding后的特征;Epos是为[POS_TOKEN]表示空间位置,用于保留patch之间相对位置关系;

通过模型的倒数第二层和最后一层Transformer块分别获得特征Out1和Out2其中,Out2行人重识别模型中主干模型输出的行人特征后续作为全局特征用于后续全局的损失计算。

4.根据权利要求3所述的一种基于Vision Transformer注意力筛选的行人重识别方法,其特征在于将特征Out1中的[CLS_TOKEN]分离,分离[CLS_TOKEN]后特征表示为Out’然后通过注意力筛选方法,具体为:①获取所有输入特征Out’在最后维度上的所有最大值;

②依照最后维度最大值获得排序索引;

④依照排序索引对所有输入特征Out’进行排序重组;

设定复制块,复制最后一层具有相同初始化参数的Transformer块,将排序重组后的重组特征根据最后第二维度均匀分割成四部分,后分别与特征Out1中分离的[CLS_TOKEN]结合,通过复制块获得最终局部特征。

5.根据权利要求4所述的一种基于Vision Transformer注意力筛选的行人重识别方法,其特征在于所述步骤(3)具体实现过程如下:将行人重识别数据集标签作为监督信息,同全局特征和局部特征共同计算困难三元组损失帮助训练网络;将全局特征和局部特征分别通过分类器得到预测分数,并使用交叉熵损失帮助训练模型;交叉熵损失公式具体如下:其中,N为行人ID数,qi是监督信息,pi是预测分数;

困难三元组损失通过随机采样P个身份,每个身份抽取K个实例,组成一个大小为P*K的mini batch;依次选取批次中的图片为锚点,选取距离最远的正样本和距离最近的负样本组成三元组训练网络,具体公式如下:其中,fa是锚点样本,fp,fn是对应的正样本和负样本;

局部分支中通过注意力筛选后会将整体特征分为多个局部特征,而均等分割的情况下,分割后的末尾特征应是行人的次要特征以及无关特征;在对该部分进行分类预测时,其置信度应是“不可靠的”,但同时可能存在的次要特征能够帮助模型识别出整体外表特征较为相近的个体,有利于对细粒度特征的挖掘,因此在该部分损失权重方面应分配一个相对较小值;具体公式如下:其中,Lid(f)和LT(f)分别代表对特征计算交叉熵损失和困难三元组损失;fglobal和flocal分别代表全局特征和局部特征;k是局部特征数量;λ是损失权重。

6.根据权利要求4或5所述的一种基于Vision Transformer注意力筛选的行人重识别方法,其特征在于所述步骤(4)具体实现过程如下:得到稳定的模型后,获取未参与过训练的行人重识别数据集,要求每个行人至少获得包含两张图像;将所有图像经过统一处理后输入到模型中都能分别获取到全局和局部特征,需要将全局特征和前三个局部特征连接,具体公式如下:ftest=[fglobal;flocal_1;flocal_2;flocal_3|dim=1] (10)计算所有query和gallery图像对应特征的欧式距离,以获得最相似的行人图像。