利索能及
我要发布
收藏
专利号: 2025109378998
申请人: 佛山大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于大语言模型先验的多模态融合图像翻译方法,其特征在于,包括以下步骤:

获取配准后的红外‑可见光融合图像以及对应的语义掩码和文本描述并进行数据预处理,得到融合图像特征、语义掩码视觉特征与文本语义特征序列;

基于文本‑视觉状态空间块与三维选择性扫描块,构建多模态融合图像模态翻译模型;

基于多模态融合图像模态翻译模型对融合图像特征、语义掩码视觉特征与文本语义特征序列进行图像翻译处理,得到翻译后的具有可见光分布特性的目标图像。

2.根据权利要求1所述基于大语言模型先验的多模态融合图像翻译方法,其特征在于,所述获取配准后的红外‑可见光融合图像以及对应的语义掩码和文本描述并进行数据预处理,得到融合图像的低级视觉特征、语义掩码的低级视觉特征与文本语义特征序列这一步骤,其具体包括:获取配准后的红外‑可见光融合图像以及对应的语义掩码和文本描述;

分别对配准后的红外‑可见光融合图像与语义掩码进行二维卷积处理,得到融合图像特征与语义掩码视觉特征;

通过预训练的大语言模型编码器对文本描述进行特征编码,得到文本语义特征序列。

3.根据权利要求2所述基于大语言模型先验的多模态融合图像翻译方法,其特征在于,所述多模态融合图像模态翻译模型具体包括多模态状态空间组、二维卷积块与图像重建块,所述多模态状态空间组的输出端与所述二维卷积块的输入端连接,所述二维卷积块的输出端与所述图像重建块的输入端连接,其中:所述多模态状态空间组包括若干多模态状态空间块,若干所述多模态状态空间块之间通过串联连接,且第一个多模态状态空间块的输入为融合图像特征、语义掩码视觉特征与文本语义特征序列,后续多模态状态空间块的输入为前一个多模态状态空间块的输出、语义掩码视觉特征与文本语义特征序列;

所述多模态状态空间块包括第一归一化层、文本‑视觉状态空间块、第二归一化层、第一卷积层与多模态交叉注意力模块,所述第一归一化层、所述文本‑视觉状态空间块、所述第二归一化层、所述第一卷积层与所述多模态交叉注意力模块依次连接;

所述文本‑视觉状态空间块包括第一线性层、第二线性层、第三线性层、逐通道卷积、第一SiLU激活函数、第二SiLU激活函数、三维选择性扫描块、第三归一化层与第四线性层,所述第一线性层的输出端与所述第一SiLU激活函数连接,所述第二线性层的输出端与所述逐通道卷积的输入端连接,所述第三线性层的输出端与所述三维选择性扫描块的第一输入端连接,所述逐通道卷积的输出端、所述第二SiLU激活函数、所述三维选择性扫描块的第二输入端、所述第三归一化层的输入端与所述第四线性层的输入端依次连接;

所述多模态交叉注意力模块包括对第二卷积层、GELU激活函数、第三卷积层、遮盖层与Softmax激活函数,所述第二卷积层、所述GELU激活函数、所述第三卷积层、所述遮盖层与所述Softmax激活函数依次连接。

4.根据权利要求3所述基于大语言模型先验的多模态融合图像翻译方法,其特征在于,所述多模态融合图像模态翻译模型的损失函数包括像素级重建损失函数与任务导向的目标检测损失函数,所述多模态融合图像模态翻译模型的损失函数的表达式具体如下所示:;

上式中, 表示多模态融合图像模态翻译模型的损失函数, 表示权重超参数, 表示权重超参数, 表示像素级重建损失函数, 表示任务导向的目标检测损失函数, 表示翻译器生成的图像,表示原多模态图像, 表示可见光图片,表示图像中像素的数量, 表示稳定计算的小常数, 表示调节系数, 表示目标类别的分类损失, 表示边界框回归损失, 表示目标性损失, 表示边界框回归损失。

5.根据权利要求4所述基于大语言模型先验的多模态融合图像翻译方法,其特征在于,所述基于多模态融合图像模态翻译模型对融合图像特征、语义掩码视觉特征与文本语义特征序列进行图像翻译处理,得到翻译后的具有可见光分布特性的目标图像这一步骤,其具体包括:将融合图像特征、语义掩码视觉特征与文本语义特征序列输入至多模态融合图像模态翻译模型;

基于多模态融合图像模态翻译模型的多模态状态空间组,对融合图像特征、语义掩码视觉特征与文本语义特征序列进行多模态特征融合处理,得到多模态特征融合图像;

基于多模态融合图像模态翻译模型的二维卷积块,对多模态特征融合图像进行二维特征重映射,得到映射后的多模态特征融合图像;

基于多模态融合图像模态翻译模型的图像重建块,对映射后的多模态特征融合图像进行图像特征重构,得到翻译后的具有可见光分布特性的目标图像。

6.根据权利要求5所述基于大语言模型先验的多模态融合图像翻译方法,其特征在于,所述基于多模态融合图像模态翻译模型的多模态状态空间组,对融合图像特征、语义掩码视觉特征与文本语义特征序列进行多模态特征融合处理,得到多模态特征融合图像这一步骤,其具体包括:将融合图像特征、语义掩码视觉特征与文本语义特征序列输入至多模态状态空间组;

基于多模态状态空间组的第一归一化层,对融合图像特征、语义掩码视觉特征与文本语义特征序列进行归一化处理,得到归一化后的融合图像特征、归一化后的语义掩码视觉特征与归一化后的文本语义特征序列;

基于多模态状态空间组的文本‑视觉状态空间块,对归一化后的融合图像特征、归一化后的语义掩码视觉特征与归一化后的文本语义特征序列进行空间建模,得到融合图像空间特征、文本语义空间特征与语义掩码空间特征;

对融合图像特征进行缩放处理,得到缩放后的融合图像特征并与融合图像空间特征、文本语义空间特征、语义掩码空间特征进行相加,得到图像特征、文本描述特征与语义掩码特征;

基于多模态状态空间组的第二归一化层与第一卷积层,对图像特征、文本描述特征与语义掩码特征依次进行归一化与卷积处理,得到处理后的图像特征、处理后的文本描述特征与处理后的语义掩码特征;

基于多模态状态空间组的多模态交叉注意力模块,对处理后的图像特征与处理后的文本描述特征赋予权重,并结合处理后的语义掩码特征提供先验信息引导注意力聚焦于关键位置,得到多模态特征融合图像。

7.根据权利要求6所述基于大语言模型先验的多模态融合图像翻译方法,其特征在于,所述基于多模态状态空间组的文本‑视觉状态空间块,对归一化后的融合图像特征、归一化后的语义掩码视觉特征与归一化后的文本语义特征序列进行空间建模,得到融合图像空间特征、文本语义空间特征与语义掩码空间特征这一步骤,其具体包括:将归一化后的融合图像特征、归一化后的语义掩码视觉特征与归一化后的文本语义特征序列输入至文本‑视觉状态空间块;

基于文本‑视觉状态空间块的第一线性层,对归一化后的语义掩码视觉特征进行线性化处理,得到线性化后的语义掩码视觉特征;

基于文本‑视觉状态空间块的第二线性层,对归一化后的融合图像特征进行线性化处理,得到线性化后的融合图像特征;

基于文本‑视觉状态空间块的第三线性层,对归一化后的文本语义特征序列进行线性化处理,得到线性化后的文本语义特征序列;

基于文本‑视觉状态空间块的逐通道卷积,对线性化后的融合图像特征进行逐通道卷积处理,得到逐通道卷积后的融合图像特征;

基于文本‑视觉状态空间块的三维选择性扫描块,对逐通道卷积后的融合图像特征进行展平扫描处理,得到扫描后的融合图像特征;

基于文本‑视觉状态空间块的第三归一化层,对扫描后的融合图像特征进行归一化处理,得到二次归一化后的融合图像特征;

基于文本‑视觉状态空间块的第四线性层,结合二次归一化后的融合图像特征、线性化后的语义掩码视觉特征与线性化后的文本语义特征序列并进线性化处理,得到融合图像空间特征、文本语义空间特征与语义掩码空间特征。

8.根据权利要求7所述基于大语言模型先验的多模态融合图像翻译方法,其特征在于,所述基于文本‑视觉状态空间块的三维选择性扫描块,对逐通道卷积后的融合图像特征进行展平扫描处理,得到扫描后的融合图像特征这一步骤,其具体包括:基于文本‑视觉状态空间块的三维选择性扫描块,将逐通道卷积后的融合图像特征展平为一维序列,并沿预设四个方向进行扫描,将文本语义特征序列通过一维单向选择性扫描模块进行处理,使融合图像特征具有丰富的文本信息和图像细节,输出扫描后的融合图像特征,所述预设四个方向包括从左上角到右下角、从右下角到左上角、从右上角到左下角以及从左下角到右上角。

9.基于大语言模型先验的多模态融合图像翻译系统,其特征在于,包括以下模块:

第一模块,用于获取配准后的红外‑可见光融合图像以及对应的语义掩码和文本描述并进行数据预处理,得到融合图像特征、语义掩码视觉特征与文本语义特征序列;

第二模块,用于基于文本‑视觉状态空间块与三维选择性扫描块,构建多模态融合图像模态翻译模型;

第三模块,用于基于多模态融合图像模态翻译模型对融合图像特征、语义掩码视觉特征与文本语义特征序列进行图像翻译处理,得到翻译后的具有可见光分布特性的目标图像。