利索能及
我要发布
收藏
专利号: 2022114047648
申请人: 杭州电子科技大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于Transformer的多尺度行人重识别方法,其特征在于包括以下步骤:步骤一,在残差网络ResNet50中引入特征级联分支,将相邻层不同尺度的特征图进行特征融合;

步骤二,将步骤一中融合后各个不同尺度的特征图进行特征分割,然后为每一个分割后的特征组加上可学习的SCALE_TOKEN表示不同尺度;将不同尺度分割后的各个子图展平,再加上表示位置的POS_TOKEN和全局特征CLS_TOKEN,作为transformer的输入;

步骤三,构建基于标准Transformer的行人特征提取网络,将步骤二中获得的特征子图向量输入网络,获得行人特征;

步骤四,将步骤三得到特征进行切分,将CLS_TOKEN向量作为全局特征,同时将不同尺度的局部特征输入局部特征多尺度融合模块并重新切分得到最终特征;步骤4‑1,获得Transformer模型输出特征ZL后,将特征ZL切分即可得到四组特征向量,即全局特征fcls和三个不同尺度的特征fscale_1、fscale_2、fscale_3;将不同尺度的特征进行双线性插值,再通过1*1卷积进行特征融合得到最终的局部特征ffinal;之后按照行人结构,可将ffinal划分为4个局部特征f1、f2、f3、f4;

步骤五,使用步骤四中得到的CLS_TOKEN向量和多尺度融合向量按照训练策略训练,得到最终的ReID模型;

步骤5‑1,使用行人重识别数据集中标注数据作为监督信息,对每个训练批次采用ID损失和困难三元组损失训练网络;ID损失采用交叉熵损失训练网络,其公式如下:其中N为行人类别数,qi是监督标签,pi是预测标签;

困难三元组损失通过随机采样P个身份,每个身份抽取K个实例,组成一个大小为P*K的mini batch;依次选取批次中的每个图片xa作为锚点,选出批次中距离最远的正样本图片xp和距离最近的负样本图片xn组成三元组来训练网络,增强网络的泛化能力;其公式为:步骤5‑2,根据步骤四中提取的特征,ReID模型的整体损失函数利用全局特征和局部特征计算Lid和Ltriplet来训练网络,具体可公式化为如下:其中,k表示输出特征组数量;

步骤5‑3,当模型稳定后,得到最终ReID模型,将待查询图片和测试集图片输入最终的ReID模型进行特征提取,对比查询图片特征与测试集图片是否属于同一类,输出同类的行人图片;

步骤六,将待查询图片和测试集图片输入最终的ReID模型进行特征提取,对比查询图片特征与测试集图片是否属于同一类,输出同类的行人图片。

2.根据权利要求1所述的一种基于Transformer的多尺度行人重识别方法,其特征在于,所述步骤一,包括以下子步骤:步骤1‑1,采用在ImageNet上预训练过的ResNet50作为骨干网络,保留第一个池化后的阶段和主干部分的前三个阶段,去除最后的阶段、空间下采样操作、全局平均池化层和完全连接层;

步骤1‑2,从ResNet50中获得步骤1‑1中保留的一共4个阶段的特征信息,并构建多尺度特征级联模块,通过相邻层之间的两两融合获得行人特征信息;

首先对阶段1获得的特征进行上采样和1x1卷积,特征图大小变为原来的两倍;然后对阶段1和阶段2、阶段2和阶段3、阶段3和阶段4的特征进行特征融合,如公式(1)(2)所示;

Fsc=Contact(UpSample(Fs),Fb)   (1)Fagg=conv1×1(Fsc)  (2)

其中Fs,Fb表示两个需要融合的特征,UpSample表示上采样操作,Contact为向量连接操作,Fagg为获得的融合特征。

3.根据权利要求2所述的一种基于Transformer的多尺度行人重识别方法,其特征在于,所述步骤二,包括以下子步骤:步骤2‑1,对于获得的融合特征Fagg,按照子特征图大小ps进行分割,生成特征图序列N为可分割的数量,再对xP加上一个可学习的SCALE_TOKEN,SCALE_TOKEN的维度大小与xP相同,如公式(3)所示:

其中 为第k个尺度生成的特征图序列;Escale为SCALE_TOKEN,表示可学习的特征尺度;

综上对步骤1‑2中获得的三个尺度的特征处理后加上CLS_TOKEN和POS_TOKEN可得到特征Z,如公式(9)所示;

其中,xcls为CLS_TOKEN全局特征向量; 分别为三个尺度的特征序列;Epos为POS_TOKEN,表示空间位置。

4.根据权利要求3所述的一种基于Transformer的多尺度行人重识别方法,其特征在于,所述步骤三,包括以下子步骤:步骤3‑1,为了充分利用多尺度信息,构建基于Transformer的行人多尺度特征提取模型;

模型主要由多层堆叠的Transformer块构成,单个Transformer层由多头注意力机制MSA、层归一化LN和多层感知器MLP构成,单个Transformer块可公式化为(4)(5):Z′l=MSA(LN(Zl‑1))+Zl‑1 l=1…L (4)

Zl=MLP(LN(Z′l))+Z′l l=1…L (5)

其中,Zl表示第l层Transformer块输出的特征,Z′l为Transformer块内的中间结果,L为总层数;对于每张图像生成的多尺度特征Z,作为Transformer网络的输入,得到网络输出结果即为最后一层的输出特征。