1.一种基于全局和局部文本感知的多模态图像融合模型,其特征在于,包括:
输入层(1)、全局文本感知模块(2)、CLIP图像编码器(3)、CLIP文本编码器(4)、BLIP文本编码器(5)、特征提取网络(6)、解码器(7)和输出层(8);
所述输入层(1)用于输入源图像并把所述源图像分别输入所述全局文本感知模块(2)、所述CLIP图像编码器(3)、所述CLIP文本编码器(4)和所述BLIP文本编码器(5);所述源图像包括相互配准的红外源图像和可见光源图像;
所述CLIP图像编码器(3)用于生成所述源图像的CLIP图像特征并分别输入所述全局文本感知模块(2)和所述特征提取网络(6);所述CLIP文本编码器(4)用于生成所述源图像的CLIP文本特征并输入所述全局文本感知模块(2);所述BLIP文本编码器(5)用于生成所述源图像的BLIP文本特征并输入所述特征提取网络(6);
所述全局文本感知模块(2)用于对所述源图像进行融合并根据所述CLIP文本特征把所述CLIP图像特征整合到融合结果中,得到初步融合结果,以丰富所述初步融合结果的全局信息,并把所述初步融合结果输入所述特征提取网络(6);
所述特征提取网络(6)嵌入有至少一个局部文本感知模块(9),所述特征提取网络(6)用于对所述初步融合结果进行特征提取,并在特征提取过程中根据所述BLIP文本特征把所述CLIP图像特征整合到特征提取结果中,以丰富所述特征提取结果的局部信息,并把所述特征提取结果输入所述解码器(7);
所述解码器(7)用于对所述特征提取结果进行解码生成最终融合图像,并通过所述输出层(8)输出所述最终融合图像。
2.根据权利要求1所述的基于全局和局部文本感知的多模态图像融合模型,其特征在于,所述全局文本感知模块(2)包括第一卷积层(201)、第一分离层(202)、第一最大池化层(203)、第一残差模块(204)、第一交叉注意力模块(205)、第二卷积层(206)、第二分离层(207)、第二最大池化层(208)、第二残差模块(209)和第二交叉注意力模块(210);
所述第一卷积层(201)用于输入所述可见光源图像并向所述第一分离层(202)输出可见光特征图,所述第一分离层(202)用于把所述可见光特征图分为两部分;所述第二卷积层(206)用于输入所述红外源图像并向所述第二分离层(207)输出红外特征图,所述第二分离层(207)用于把所述红外特征图分为两部分;所述可见光特征图和所述红外特征图的对应的一部分分别经过所述第一最大池化层(203)和所述第二最大池化层(208)的最大池化处理后,进行通道连接并输入所述第一残差模块(204);所述可见光特征图和所述红外特征图的对应的另一部分进行通道连接后输入所述第二残差模块(209);
所述第一残差模块(204)的输出特征与所述CLIP图像特征相加后输入所述第一交叉注意力模块(205),所述第二残差模块(209)的输出特征与所述CLIP图像特征相加后输入所述第二交叉注意力模块(210);
所述第一交叉注意力模块(205)以所述CLIP文本特征作为查询向量并以输入所述第一交叉注意力模块(205)的图像特征作为键向量和值向量,进行交叉注意力计算得到第一融合特征;所述第二交叉注意力模块(210)以所述CLIP文本特征作为查询向量并以输入所述第二交叉注意力模块(210)的图像特征作为键向量和值向量,进行交叉注意力计算得到第二融合特征;所述第一融合特征和所述第二融合特征相加得到所述初步融合结果。
3.根据权利要求2所述的基于全局和局部文本感知的多模态图像融合模型,其特征在于,所述第一残差模块(204)和所述第二残差模块(209)均包括若干个第一提取层(10)和一个第二提取层(11),所述若干个第一提取层(10)依次串接,首个所述第一提取层(10)的输入端与对应的残差模块的输入端连接,最后一个所述第一提取层(10)的输出特征与对应的残差模块的输入相加后输入所述第二提取层(11),所述第二提取层(11)的输出端与对应的残差模块的输出端连接;
所述第一提取层(10)包括第三卷积层(1001)和第一ReLU激活函数层(1002),所述第二提取层(11)包括第四卷积层(1101)和第二ReLU激活函数层(1102)。
4.根据权利要求1所述的基于全局和局部文本感知的多模态图像融合模型,其特征在于,所述特征提取网络(6)包括多层残差空间状态模块(12),其中,每N层所述残差空间状态模块(12)之后嵌入一个所述局部文本感知模块(9),N为正整数;所述CLIP图像编码器(3)把所述CLIP图像特征输入每个所述局部文本感知模块(9);所述BLIP文本编码器(5)把所述BLIP文本特征输入每个所述局部文本感知模块(9)。
5.根据权利要求4所述的基于全局和局部文本感知的多模态图像融合模型,其特征在于,所述残差空间状态模块(12)包括第一正则化层(1201)、视觉状态空间模块(1202)、第一缩放层(1203)、第二正则化层(1204)、第七卷积层(1205)、通道注意力模块(1206)和第二缩放层(1207);
所述第一正则化层(1201)和所述视觉状态空间模块(1202)依次连接,所述第二正则化层(1204)、所述第七卷积层(1205)和所述通道注意力模块(1206)依次连接;所述第一正则化层(1201)的输入端和所述第一缩放层(1203)的输入端均与所述残差空间状态模块(12)的输入端连接,所述视觉状态空间模块(1202)的输出和所述第一缩放层(1203)的输出相加后输入所述第二正则化层(1204)和所述第二缩放层(1207);所述通道注意力模块(1206)的输出和所述第二缩放层(1207)的输出相加后从所述残差空间状态模块(12)的输出端输出。
6.根据权利要求5所述的基于全局和局部文本感知的多模态图像融合模型,其特征在于,所述视觉状态空间模块(1202)包括第一线性层(13)、深度可分离卷积层(14)、第一Swish激活函数层(15)、2D选择性扫描模块(16)、层归一化模块(17)、第二线性层(18)、第二Swish激活函数层(19)和第三线性层(20);
所述第一线性层(13)、深度可分离卷积层(14)、第一Swish激活函数层(15)、2D选择性扫描模块(16)和层归一化模块(17)依次连接,所述第二线性层(18)和第二Swish激活函数层(19)依次连接;所述第一线性层(13)的输入端和所述第二线性层(18)的输入端均与所述视觉状态空间模块(1202)的输入端连接,所述层归一化模块(17)的输出和所述第二Swish激活函数层(19)的输出相乘后输入所述第三线性层(20),所述第三线性层(20)的输出端与所述视觉状态空间模块(1202)的输出端连接。
7.根据权利要求1所述的基于全局和局部文本感知的多模态图像融合模型,其特征在于,所述局部文本感知模块(9)包括若干层挤压激励模块(901)、嵌入模块(902)、第三交叉注意力模块(903)、若干个空洞卷积层(904)和第五卷积层(905);
若干层所述挤压激励模块(901)、所述嵌入模块(902)和所述第三交叉注意力模块(903)依次连接,首层所述挤压激励模块(901)的输入端与所述局部文本感知模块(9)的输入端连接;
所述挤压激励模块(901)用于通过自适应的通道注意力机制对输入所述挤压激励模块(901)的图像特征进行重要特征强化和冗余信息抑制;
所述嵌入模块(902)用于通过多层感知机把所述CLIP图像特征映射到输入所述嵌入模块(902)的图像特征的语义空间后嵌入输入所述嵌入模块(902)的图像特征中;
所述第三交叉注意力模块(903)以所述BLIP文本特征作为查询向量并以输入所述第三交叉注意力模块(903)的图像特征作为键向量和值向量,进行交叉注意力计算,并把计算结果分别输入各个所述空洞卷积层(904);
各个所述空洞卷积层(904)的扩张率不同,所有所述空洞卷积层(904)的输出进行通道连接后输入所述第五卷积层(905);所述第五卷积层(905)的输出端与所述局部文本感知模块(9)的输出端连接。
8.一种基于全局和局部文本感知的多模态图像融合方法,其特征在于,包括步骤:
A1.构建初始的基于全局和局部文本感知的多模态图像融合模型;所述初始的基于全局和局部文本感知的多模态图像融合模型为权利要求1‑7任一项所述的基于全局和局部文本感知的多模态图像融合模型;
A2.对所述初始的基于全局和局部文本感知的多模态图像融合模型进行训练得到训练后的基于全局和局部文本感知的多模态图像融合模型;
A3.把待融合源图像输入所述训练后的基于全局和局部文本感知的多模态图像融合模型,得到所述训练后的基于全局和局部文本感知的多模态图像融合模型输出的融合图像。
9.根据权利要求8所述的基于全局和局部文本感知的多模态图像融合方法,其特征在于,步骤A2包括:
A201.获取多个训练样本;所述训练样本包括样本源图像和对应的干净源图像;所述样本源图像包括样本红外源图像和样本可见光源图像,所述干净源图像包括干净红外源图像和干净可见光源图像,所述样本源图像包含退化信息,所述干净源图像不包含退化信息,所述退化信息包括天气干扰信息;
A202.选取所述训练样本,把对应的样本源图像输入所述初始的基于全局和局部文本感知的多模态图像融合模型,得到所述初始的基于全局和局部文本感知的多模态图像融合模型输出的融合图像,记为第一融合图像;
A203.把所述第一融合图像输入所述CLIP图像编码器(3),得到对应于所述第一融合图像的CLIP图像特征,记为第一CLIP图像特征;
A204.把选取的所述训练样本的所述干净源图像输入所述CLIP文本编码器(4),得到对应于所述干净源图像的CLIP文本特征,记为第一CLIP文本特征;
A205.令所述第一CLIP文本特征与所述第一CLIP图像特征在同一特征空间中对齐;
A206.根据所述第一融合图像、对齐后的第一CLIP文本特征和选取的所述训练样本的所述干净源图像,计算损失函数;
A207.根据所述损失函数优化所述初始的基于全局和局部文本感知的多模态图像融合模型的模型参数;
A208.重复执行步骤A202‑步骤A207,直到所述损失函数小于预设的损失函数阈值或迭代次数达到预设的次数阈值。
10.根据权利要求9所述的基于全局和局部文本感知的多模态图像融合方法,其特征在于,所述损失函数为:
;
;
;
其中, 为损失函数值, 为像素级损失, 为驱动损失, 为所述第一融
合图像, 为齐后的第一CLIP文本特征, 代表范数, 为选取的所述训练样本的所述干净红外源图像, 为选取的所述训练样本的所述干净可见光源图像, 代表1范数。