利索能及
我要发布
收藏
专利号: 2024114546306
申请人: 佛山大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种非对称U‑Net结构的多模态图像融合模型,用于对红外图像和可见光图像进行融合处理,其特征在于,包括依次连接的第一编码单元(1)、融合单元(2)、第一解码单元(3)和输出层(4);

所述第一编码单元(1)包括由第一输入层(5)和N个第一编码块(6)串接而成的可见光编码支路(101)、具有从前到后依次连接的第二输入层(7)和N个第二编码块(8)的红外光编码支路(102)以及N‑2个压缩和激励模块(103),N为不小于3的正整数;所述第一输入层(5)用于输入可见光图像,所述第二输入层(7)用于输入红外图像;第i个所述第一编码块(6)与第i个所述压缩和激励模块(103)的输入端连接,第i个所述压缩和激励模块(103)的输出与第i+1个所述第二编码块(8)的输出相乘后输入第i+2个所述第二编码块(8),i∈[1,N‑2];

所述融合单元(2)包括N‑3个第一融合模块(201)和一个第二融合模块(202),第j个所述第一编码块(6)的输出端和第j+2个所述第二编码块(8)的输出端均与第j个所述第一融合模块(201)的输入端连接,j∈[1,N‑3],第N‑2个所述第一编码块(6)的输出端和第N个所述第二编码块(8)的输出端均与所述第二融合模块(202)的输入端连接;

所述第一解码单元(3)包括N个第一解码块(301),所述第二融合模块(202)与前两个第一解码块(301)依次连接,第k个所述第一解码块(301)的输入端与第N‑k个所述第一融合模块(201)的输出端以及第k‑1个所述第一解码块(301)的输出端连接,k∈[3,N‑1],第N个所述第一解码块(301)的输入端与第N‑1个所述第一解码块(301)的输出端连接;

所述输出层(4)与最后一个所述第一解码块(301)的输出端连接;

第一个所述第一编码块(6)和第一个所述第二编码块(8)均包括Transformer块(9),第二个至最后一个所述第一编码块(6)以及第二个至最后一个所述第二编码块(8)均包括依次连接的第一最大池化层(10)和Transformer块(9);

所述Transformer块(9)包括前后连接的第一正则化层(901)和多头注意力操作层(902),还包括前后连接的第二正则化层(903)和MLP网络(904);所述Transformer块(9)的输入端与所述第一正则化层(901)的输入端连接,所述Transformer块(9)的输入与所述多头注意力操作层(902)的输出进行残差连接得到第一特征,所述第一特征输入所述第二正则化层(903),所述第一特征与所述MLP网络(904)的输出进行残差连接后作为所述Transformer块(9)的输出;

所述压缩和激励模块(103)包括从前到后依次连接的全局池化层(1031)、第一线性层(1032)、第一ReLU激活函数层(1033)、第二线性层(1034)和第一Sigmoid激活函数层(1035)。

2.根据权利要求1所述的非对称U‑Net结构的多模态图像融合模型,其特征在于,N=5。

3.根据权利要求1所述的非对称U‑Net结构的多模态图像融合模型,其特征在于,所述第一融合模块(201)包括与对应的第一编码块(6)的输出端连接的第三输入层(11)、与对应的第二编码块(8)的输出端连接的第四输入层(12)、第二最大池化层(13)、第三最大池化层(14)、第四最大池化层(15)、第一平均池化层(16)、第二平均池化层(17)、共享MLP网络(18)和第二Sigmoid激活函数层(19);

所述第三输入层(11)的输出端与所述第二最大池化层(13)的输入端连接,所述第二最大池化层(13)的输出与所述第四输入层(12)的输出相加得到第一初步融合特征,所述第一初步融合特征分别输入所述第三最大池化层(14)和所述第一平均池化层(16),所述第三最大池化层(14)的输出端和所述第一平均池化层(16)的输出端均与所述共享MLP网络(18)的输入端连接,所述共享MLP网络(18)的输出端分别与所述第四最大池化层(15)的输入端和所述第二平均池化层(17)的输入端连接,所述第四最大池化层(15)的输出和所述第二平均池化层(17)的输出相加后输入所述第二Sigmoid激活函数层(19),所述第二Sigmoid激活函数层(19)的输出与所述第一初步融合特征相乘后作为所述第一融合模块(201)的输出。

4.根据权利要求1所述的非对称U‑Net结构的多模态图像融合模型,其特征在于,所述第二融合模块(202)包括与对应的第一编码块(6)的输出端连接的第五输入层(27)、与对应的第二编码块(8)的输出端连接的第六输入层(28)、第五最大池化层(29)、压缩和激励模块(103)以及前后连接的第一卷积层(30)和第三Sigmoid激活函数层(31);

所述第五输入层(27)的输出端与所述第五最大池化层(29)的输入端连接,所述第五最大池化层(29)的输出与所述第六输入层(28)的输出相加得到第二初步融合特征,所述第二初步融合特征分别输入所述第二融合模块(202)的压缩和激励模块(103)和所述第一卷积层(30),所述第二融合模块(202)的压缩和激励模块(103)的输出与所述第二初步融合特征相乘得到第三初步融合特征,所述第三Sigmoid激活函数层(31)的输出与所述第二初步融合特征相乘得到第四初步融合特征,所述第三初步融合特征和所述第四初步融合特征进行逐元素最大化操作后作为所述第二融合模块(202)的输出。

5.一种如权利要求1‑4任一项所述的非对称U‑Net结构的多模态图像融合模型的构建方法,其特征在于,包括步骤:A1.构建初始的非对称U‑Net结构的多模态图像融合模型;

A2.构建非对称U‑Net模型;所述非对称U‑Net模型包括与所述第一编码单元(1)结构相同的第二编码单元(22),还包括两个第二解码单元(23),其中一个所述第二解码单元(23)与所述第二编码单元(22)中的可见光编码支路(101)组成第一U‑Net网络,另一个所述第二解码单元(23)与所述第二编码单元(22)中的红外光编码支路(102)组成第二U‑Net网络;

A3.分别对所述第一U‑Net网络和所述第二U‑Net网络进行单独训练,得到训练后的非对称U‑Net模型;

A4.把训练后的非对称U‑Net模型中的所述第二编码单元(22)的模型参数赋值给所述初始的非对称U‑Net结构的多模态图像融合模型的所述第一编码单元(1);

A5.冻结所述初始的非对称U‑Net结构的多模态图像融合模型的所述第一编码单元(1)的模型参数后,对所述初始的非对称U‑Net结构的多模态图像融合模型进行训练,得到训练后的非对称U‑Net结构的多模态图像融合模型。

6.根据权利要求5所述的构建方法,其特征在于,步骤A3包括:

A301.冻结所述第二U‑Net网络的模型参数后,对所述第一U‑Net网络进行训练;

A302.冻结所述第一U‑Net网络的模型参数后,对所述第二U‑Net网络进行训练;

A303.若所述第一U‑Net网络和所述第二U‑Net网络的训练次数达到预设的次数阈值,则停止对所述第一U‑Net网络和所述第二U‑Net网络的训练,否则,返回执行步骤A301。

7.根据权利要求6所述的构建方法,其特征在于,步骤A301中,根据以下第一均方误差损失函数对所述第一U‑Net网络进行训练:;

其中, 为所述第一均方误差损失函数,H、W分别为图像的像素高度和像素宽度,为所述第一U‑Net网络的输入图像中的(i,j)像素的像素值, 为所述第一U‑Net网络的输出图像中的(i,j)像素的像素值;

步骤A302中,根据以下第二均方误差损失函数对所述第二U‑Net网络进行训练:

其中, 为所述第二均方误差损失函数, 为所述第二U‑Net网络的输入

图像中的(i,j)像素的像素值, 为所述第二U‑Net网络的输出图像中的(i,j)像素的像素值。

8.根据权利要求5所述的构建方法,其特征在于,步骤A5中,根据以下总损失函数对所述初始的非对称U‑Net结构的多模态图像融合模型进行训练:;

其中, 为所述总损失函数, 为第三均方误差损失函数, 为结构性

损失函数, 为细节性损失函数, 、 为权重系数,H、W分别为图像的像素高度和像素宽度,F为所述初始的非对称U‑Net结构的多模态图像融合模型输出的融合图像,为F中的(i,j)像素的像素值,VI为输入所述初始的非对称U‑Net结构的多模态图像融合模型的可见光图像, 为VI中的(i,j)像素的像素值,IR为输入所述初始的非对称U‑Net结构的多模态图像融合模型的红外图像, 为IR中的(i,j)像素的像素值,为F与VI之间的结构相似度, 为F与IR之间的结构相似度,为VI的像素值均值, 为F的像素值均值, 为IR的像素值均值, 为VI的像素值

和F的像素值之间的协方差, 为IR的像素值和F的像素值之间的协方差, 为VI的像素值的标准差, 为IR的像素值的标准差, 为F的像素值的标准差, 、 为常数项。