1.一种结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,包括:S1、基于U‑Net框架,构建结合Transformer与CNN双编码器的红外与可见光图像融合模型,其中该模型由双编码器和解码器组成;
S2、选定数据集,对其进行处理后得到训练集,利用训练集训练步骤S1中的结合Transformer与CNN双编码器的红外与可见光图像融合模型;
S3、将红外图像、可见光图像输入到训练完成的结合Transformer与CNN双编码器的红外与可见光图像融合模型中,利用双编码器提取红外图像和可见光图像预融合的红外特征和可见光特征,并通过自上而下的方式进行特征表示;
S4、利用解码器将步骤S3中的特征表示映射到原始分辨率,通过自下而上的方式逐步融合图像特征,得到融合图像。
2.根据权利要求1所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,步骤S1中,构建结合Transformer与CNN双编码器的红外与可见光图像融合模型包括以下内容:S101、构建双编码器:双编码器包括局部细节特征提取编码器和全局信息提取编码器;
其中,局部细节特征提取编码器包括依次连接的卷积层和四个特征提取块,卷积层由卷积核为4×4、步长为2、填充为1的卷积以及批量归一化、LeakyReLU串行连接构成,卷积层用于下采样操作,并调整输入图像的通道数和尺寸;
第一、二特征提取块由残差模块构成,第三、四特征提取块由残差模块和可逆神经网络串行连接构成,四个特征提取块输入的通道数分别为16、32、64、128,输出的通道数分别为
32、64、128、256;
全局信息提取编码器包括四个通过串行方式连接的Transformer Layer,其输入的通道数分别为16、32、64、128,输出的通道数分别为32、64、128、256;
S102、构建解码器:解码器包括四个特征融合模块和重建模块;每个特征融合模块包括上采样操作,拼接操作,依次连接的卷积核为4×4、步长为2、填充为1的反卷积,BatchNorm操作,激活函数ReLU;
重建模块包括依次连接的上采样操作,卷积核为4×4的卷积、填充为1的卷积,填充操作,双曲正切函数函数;
S103、双编码器通过自上而下方式逐步下采样进行特征提取,解码器通过自下而上的方式将双编码器提取的特征逐步上采样进行融合并重建,构成结合Transformer与CNN双编码器的红外与可见光图像融合模型。
3.根据权利要求2所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,残差模块包括主路径和残差路径,主路径包含卷积核为1×1的卷积、BN、LeakyReLU激活函数、卷积核为3×3的卷积、卷积核为4×4的卷积;残差路径包括DSConv和卷积核为4×4的卷积;
可逆神经网络包括三个可逆残差模块,其包括卷积核为1×1的卷积、卷积核为3×3的深度可分离卷积、激活函数ReLU6。
4.根据权利要求2所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,第一、二、四Transformer Layer包括两层混合注意力变换器结构,其中,第一Transformer Layer的第一层包括通过串行方式连接的补丁嵌入操作、层归一化操作、W‑MSA模块、局部‑非局部注意力信息增强模块、层归一化操作和前馈神经网络,第二层包括通过串行方式连接的层归一化操作、SW‑MSA模块、局部‑非局部注意力信息增强模块、层归一化操作和前馈神经网络;
第二、四Transformer Layer的第一层包括通过串行方式连接的补丁合并操作、层归一化操作、W‑MSA模块、局部‑非局部注意力信息增强模块、层归一化操作和前馈神经网络,第二层包括通过串行方式连接的层归一化操作、SW‑MSA模块、局部‑非局部注意力信息增强模块、层归一化操作和前馈神经网络;
第三Transformer Layer包括六层混合注意力变换器结构,由第二Transformer Layer中的两层混合注意力变换器结构堆叠3次构成。
5.根据权利要求4所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,局部‑非局部注意力信息增强模块包括局部信息增强模块和非局部信息增强模块;其中局部信息增强模块包括拼接操作、全局平均池化、深度可分离卷积、Sigmoid函数、逐元素相乘操作和逐元素相乘操作;非局部信息增强模块包括LayerNorm操作和位置注意力模块。
6.根据权利要求1所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,步骤S2中,训练结合Transformer与CNN双编码器的红外与可见光图像融合模型包括以下子步骤:S201、从TNO数据集中选定m对图像作为数据集,将图像灰度值转为[‑1,1],利用h×w的窗口裁剪图像,步长设置为s,最终获得n对图像块作为训练集,其中,h表示图像的高,w表示图像的宽;
S202、采用结构相似性损失和对比损失监督结合Transformer与CNN双编码器的红外与可见光图像融合模型训练,获得最优网络参数,具体公式为:Ltotal=λ1LSSIM+λ2LpatchNCE
其中,Ltotal表示损失函数,λ1、λ2表示超参数,LSSIM表示结构相似性损失,LpatchNCE表示对比损失;
S203、根据训练集和损失函数Ltotal对初始的结合Transformer与CNN双编码器的红外与可见光图像融合模型进行训练,训练过程使用的Adam优化器更新网络模型参数,得到训练完成的结合Transformer与CNN双编码器的红外与可见光图像融合模型。
7.根据权利要求6所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,步骤S3中,利用双编码器提取特征包括以下子步骤:S301、如步骤S201的操作内容对输入图像进行处理;
S302、将步骤S301中处理后的红外图像、可见光图像输入到双编码器,经过卷积层的下采样操作,调整该图像的通道数和尺寸;
S303、将步骤S302处理后的图像输入到四个特征提取块中,依次通过1×1的卷积、BN、LeakyReLU激活函数、卷积核为3×3的卷积、BN和卷积核为4×4的卷积操作后得到主路径中学习的卷积特征,再经过DSConv和卷积核为4×4的卷积卷积操作后得到补充信息特征,将卷积特征和补充信息特征相加后再经过LeakyReLU后得到信息增强特征;
S304、将步骤S303得到的信息增强特征输入到可逆神经网络中,将该特征 在通道维度上被均分成 和 两部分,特征 经过第一个可逆残差模块得到的特征 与特征 逐元素相加得到特征 特
征 经过第二个可逆残差模块与特征 逐元素相乘得到特征
特征 经过第三个可逆残差模块得到特征
并与特征 逐元素相加得到特
征 将特征 和特征 在通道维度上拼接得到输出特征
具体公式为:
其中,C表示完整通道数,c表示完整通道数的一半,[1:c]表示当前特征通道数为1至c,[c+1:C]表示当前特征通道数为c+1至C,S表示CNN特征提取编码器,I表示任意映射符,k表示第k个可逆网络层数,Rn(n=1,2,3)表示可逆残差模块,exp表示指数e;
最终输出红外局部细节特征和可见光局部细节特征;
S305、在第一Transformer Layer中,红外图像和可见光图像的特征分别经过补丁嵌入操作后,通过层归一化操作对该特征进行标准化,再将其中输入到W‑MSA模块,按照设定的窗口大小对图像进行分块,得到自注意力图,再经过局部‑非局部注意力信息增强模块,得l到局部‑非局部注意力信息增强特征,将该增强特征逐元素相加经得到注意力特征F,经过层归一化操作操作后再经过FFN模块得到特征,将该特征与注意力特征相加得到第一层HATl+1结构的输出特征F ;
l+1
将输出特征F 输入第二层HAT结构,经过补丁嵌入操作后,通过层归一化操作对特征进行标准化,经过标准化的特征输入到SW‑MSA模块,SW‑MSA模块按照设定的窗口大小对图像进行分块,得到自注意力图,自注意力图再经过局部‑非局部注意力信息增强模块,得到局部‑非局部注意力信息增强特征,将局部‑非局部注意力信息增强特征逐元素相加经得到l+1注意力特征F ,注意力特征经过层归一化操作后经过FFN模块得到的特征与注意力特征相加得到第一Transformer Layer的红外全局信息特征和可见光全局信息特征,具体公式为:l l‑1 l‑1
F=LG(W‑MSA(LN(F )))+F ;
l l l
F1=FFN(LN(F))+F;
l+1 l l
F =LG(SW‑MSA(LN(F1)))+F1;
l+1 l+1 l+1
F1 =FFN(LN(F ))+F ;
l‑1 l l+1
其中,F 表示红外图像和可见光图像的特征,F表示第一层HAT输出的特征,F 表示红外全局信息特征和可见光全局信息特征,LG()表示局部‑非局部信息增强操作,LN()表示层归一化操作,W‑MSA()表示窗口的多头自注意力模块,SW‑MSA()表示移位窗口的多头自注意力模块操作;
S306、第二、三、四Transformer Layer重复步骤S305的内容,其中,第三Transformer Layer需重复三次后再输入第四Transformer Layer后输出红外与可见光的全局信息特征;
S307、将双编码器每个特征提取块与红外、可见光全局信息特征和红外、可见光局部细节特征对应模态逐元素相加得到四组预融合的红外特征和可见光特征。
8.根据权利要求7所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,步骤S305中,局部‑非局部注意力信息增强模块提取特征的具体内容为:输入特征分别经过全局平均池化、深度可分离卷积、Sigmoid操作得到局部信息增强图,再与原输入特征经过逐元素相乘操作得到局部信息增强特征;输入特征经过层归一化操作、位置注意力模块得到非局部信息增强特征,再与局部信息增强特征逐元素相加得到局部‑非局部注意力信息增强特征。
9.根据权利要求1所述的结合Transformer与CNN双编码器的红外与可见光图像融合方法,其特征在于,步骤S4中,利用解码器得到融合图像包括以下子步骤:S401、将第四组预融合的红外特征和可见光特征拼接后,经过上采样操作后与第三组预融合的红外特征和可见光特征在通道维度上拼接得到第三组重建特征,将第三组重建特征经过上采样操作后与第二组预融合的红外特征和可见光特征在通道维度上拼接得到第二组重建特征,将第二组重建特征经过上采样操作后与第三组预融合的红外特征和可见光特征在通道维度上拼接得到重建特征;
S402、将步骤S401中的重建特征经过上采样操作、填充操作、4×4卷积操作、Tanh操作后最终得到重建的融合图像。