1.一种基于多特征分层融合学习的跨模态行人重识别方法,其特征在于,所述基于多特征分层融合学习的跨模态行人重识别方法,包括:步骤S1、给定一张可见光模态图像/红外线模态图像作为查询图像,以及给定包含红外线模态图像/可见光模态图像的图像库;
步骤S2、加载多特征分层融合学习网络,所述多特征分层融合学习网络包括模态特征增强模块、四流Resnet‑50主干网络模型和基于时序的特征融合模块;
步骤S3、通过所述模态特征增强模块对可见光模态图像和红外线模态图像分别进行两种模态增强,得到可见光第一增强模态图像、可见光第二增强模态图像、红外线第一增强模态图像和红外线第二增强模态图像;
步骤S4、将可见光第一增强模态图像、可见光第二增强模态图像、红外线第一增强模态图像和红外线第二增强模态图像输入四流Resnet‑50主干网络模型,输出不同尺寸的特征图C2、C3、C4和C5;
步骤S5、将不同尺寸的特征图C2、C3、C4和C5输入基于时序的特征融合模块进行层级时序融合,所述基于时序的特征融合模块操作如下:将特征图C3和C4分别经过1×1卷积和上采样统一成与特征图C2相同的尺寸,分别记为
3 4 2
特征f和f,同时将特征图C2记为特征f,将特征图C5经过1×1卷积和上采样统一成与特征图C2相同的尺寸,记为特征fori;
t 2
首先将特征f传入LSTM网络进行处理,t∈[2,T]为层级,且最高层级T=4,然后将输出的结果与原始特征进行融合,得到融合后的特征 用如下公式表示:然后对得到的特征 进行注意力处理,得到特征 用如下公式表示:最后将得到的特征 与特征fori进一步融合,用如下公式表示:t
其中,SE 表示针对第t层级特征的注意力处理操作, 表示第t层级的融合特征,fout表示基于时序的特征融合模块最终输出的融合特征,且fout=表示可见光第一增强模态融合特征, 表示可见光第二增强模态融合特征,表示红外线第一增强模态融合特征, 表示红外线第二增强模态融合特征;
步骤S6、基于可见光对应的融合特征 以及红外线对应的融合特征计算查询图像和图像库中图像的匹配度,提取图像库中匹配度最高的前top‑k张图像作为重识别结果。
2.根据权利要求1所述的基于多特征分层融合学习的跨模态行人重识别方法,其特征在于,所述对可见光模态图像和红外线模态图像分别进行两种模态增强,得到可见光第一增强模态图像、可见光第二增强模态图像、红外线第一增强模态图像和红外线第二增强模态图像,包括:vis vis
对于可见光模态图像X 的第一种增强方式:先对原始的可见光模态图像X 的三个通r g b ds vis道x ,x ,x进行随机加权得到退化图X ,再与原始的可见光模态图像X 进行加权融合得到可见光第一增强模态图像 用如下公式表示:ds r g b
x =α1×x+α2×x+α3×x
r g b vis
其中,x ,x ,x分别为可见光模态图像X 的R通道、G通道和B通道,α1、α2、α3为随机加权权重,属于[0,1],且α1+α2+α3=1,β1、β2为加权融合权重,属于[0,1],且β1+β2=1;
vis vis
对于可见光模态图像X 的第二种增强方式:在可见光模态图像X 的三个通道中随机选择一个通道,并在随机选定的通道中,以预设系数加入其他两个通道的信息,用如下公式表示:其中, 为可见光第二增强模态图像,RandSelect为随机选择操作, 为在可见vis光模态图像X 的三个通道中随机选择所选中的一个通道, 为可见光模态图像vis r g b visX 的三个通道中除所选中通道外的其他两个通道,(x ,x ,x)为可见光模态图像X 的三个通道,γ1、γ2、γ3为预设系数,属于[0,1],且γ1+γ2+γ3=1,0<γ2+γ3≤0.15;
ir ir
对于红外线模态图像X 的第一种增强方式:对红外线模态图像的通道x 的像素值进行乘法倍增,用如下公式表示:其中, 为红外线第一增强模态图像,δ为倍增系数,属于[0.01,0.5];
ir
对于红外线模态图像X 的第二种增强方式:将图片进行随机翻转和/或随机擦除,用如下公式表示:其中, 为红外线第二增强模态图像,RandErase表示随机擦除函数,RandFlip表示随机翻转函数。
3.根据权利要求1所述的基于多特征分层融合学习的跨模态行人重识别方法,其特征在于,所述四流Resnet‑50主干网络模型,包含四个分别处理可见光第一增强模态图像、可见光第二增强模态图像、红外线第一增强模态图像和红外线第二增强模态图像的分支,每个分支包含一个独立参数的子网络记为Evis1、Evis2、Eir1和Eir2,均由Resnet‑50网络的第一层实现;
所述四流Resnet‑50主干网络模型,还包含一个共享参数的子网络ES,由Resnet‑50网络除第一层以外的剩余层实现。
4.根据权利要求3所述的基于多特征分层融合学习的跨模态行人重识别方法,其特征在于,所述将可见光第一增强模态图像、可见光第二增强模态图像、红外线第一增强模态图像和红外线第二增强模态图像输入四流Resnet‑50主干网络模型,输出不同尺寸的特征图C2、C3、C4和C5,包括:将可见光第一增强模态图像 输入子网络Evis1;
将可见光第二增强模态图像 输入子网络Evis2;
将红外线第一增强模态图像 输入子网络Eir1;
将红外线第二增强模态图像 输入子网络Eir2;
取子网络Evis1、Evis2、Eir1和Eir2的输出进行拼接,得到特征图C1;
将特征图C1输入子网络ES,得到子网络ES每层输出的特征图C2、C3、C4和C5。
5.根据权利要求1所述的基于多特征分层融合学习的跨模态行人重识别方法,其特征在于,所述多特征分层融合学习网络的训练过程如下:获取训练数据集划分为自然光集和红外线集,所自然光集中包含可见光模态图像,所述红外线集包含红外线模态图像;
将自然光集和红外线集输入所述多特征分层融合学习网络,根据所述多特征分层融合学习网络的输出计算联合优化损失进行训练更新。
6.根据权利要求5所述的基于多特征分层融合学习的跨模态行人重识别方法,其特征在于,所述计算联合优化损失,包括:其中, 为联合优化损失, 表示异中心簇损失, 表示id损失, 表示模态间的三元组损失, 表示四元中心簇损失;
所述id损失 对可见光第一增强模态图像和红外线第一增强模态图像经过四流Resnet‑50主干网络模型得到的特征进行损失的计算,计算公式如下:其中,P是训练数据集中的类别个数,a表示第a个类别,qa表示第a个类别实际的标签分布概率,pa表示第a个类别预测的分布概率,ε为常数,y表示行人的类别标签;
所述异中心簇损失 计算公式如下:
其中,Q是训练阶段批次中 和 每类图像的数量,f()是四流Resnet‑50主干网络模型的全连接层之前的输出,mean[A‑B]是对象A和对象B之差的均值运算, 表示训练阶段批次中第i张可见光第一增强模态图像, 表示训练阶段批次中第i张红外线第一增强模态图像;
所述模态间的三元组损失 计算公式表示为:
1 1 1
其中, 表示VIS 和IR模态间的三元组损失, 表示输入来自VIS 和
1 1
IR模态的正样本对和来自VIS模态的负样本对计算得到的三元组损失, 表示
1 1 1
输入来自VIS 和IR 模态的正样本对和来自IR 模态的负样本对计算得到的三元组损失,
1 1
VIS模态表示可见光第一增强模态图像对应的可见光第一增强模态,IR 模态表示红外线第一增强模态图像对应的红外线第一增强模态, 与 可用公式表示为:
其中,M表示每次迭代随机选择的行人数量,b表示第b个行人,c表示第c个行人,ξ是间
1 1
隔参数, 表示VIS 图像中第b个行人和IR 图像中第c个行人之间的欧式距离,
1 1
表示VIS图像中第b个行人和IR图像中第k个行人之间的欧式距离,
1 1 1
表示IR图像中第b个行人和VIS图像中第c个行人之间的欧式距离, 表示IR 图像1
中第b个行人和VIS 图像中第k个行人之间的欧式距离,并且b与c相同,表示同一个行人;k与b、c不相同,表示不同的行人,yb表示当前模态的第b个行人的类别标签,yc表示与yb不同模态的同一行人的类别标签,yk表示与yb和yc不同行人的类别标签,[z]+=max(z,0),z为函数输入;
所述四元中心簇损失 计算公式表示为:
1 1 1 2
其中, 表示VIS和IR模态间的中心簇损失, 表示VIS 和IR
2 1
模态间的中心簇损失, 表示VIS 和IR模态间的中心簇损失, 表
2 2 2
示VID和IR模态间的中心簇损失,VIS模态表示可见光第二增强模态图像对应的可见光第2
二增强模态,IR模态表示红外线第二增强模态图像对应的红外线第二增强模态;
1 2 1 2
将V或V记为V,将I或I记为I,则中心簇损失 用如下公式表示:其中,d表示第d个类别,g表示第g个类别,ρ为预设参数, 表示包含第d个类别的行人对应的VIS融合特征的平均中心位置, 表示包含第d个类别的行人对应的IR融合特征的
1 2 1 2
平均中心位置,VIS为VIS或VIS,IR为IR 或IR, 表示包含第g个类别的行人对应的VIS或IR融合特征的平均中心位置,||A‑B||2表示计算对象A和对象B之间的欧氏距离。