利索能及
我要发布
收藏
专利号: 2026104758764
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种任意模态缺失条件下的多模态遥感图像分类方法,其特征在于,针对目标地区,执行如下步骤S1‑步骤S8,构建并训练遥感图像地物分类模型,完成多模态遥感图像的地物分类:步骤S1:获取目标地区的多模态遥感图像,其中多模态遥感图像中包含高光谱图像、合成孔径雷达图像、数字表面模型图像;在各图像中标注相应的地物类型;

步骤S2:针对高光谱图像,构建高光谱图像编码器,提取高光谱图像的真实特定特征;

针对其他模态的图像,分别构建其他模态图像编码器,提取其他模态图像的真实特定特征;

并构建模态共享特征编码器,提取高光谱图像的共享特征、合成孔径雷达图像的共享特征、数字表面模型图像的共享特征;

步骤S3:基于高光谱图像、合成孔径雷达图像、数字表面模型图像的真实特定特征,构建真实特定特征损失,基于高光谱图像、合成孔径雷达图像、数字表面模型图像的共享特征,基于KL散度损失,构建共享特征对齐任务中的共享特征对齐损失;

步骤S4:构建缺失模态生成模块,针对各模态进行随机丢弃,生成缺失模态,并基于注意力机制生成缺失模态的生成特定特征;基于缺失模态的生成特定特征以及缺失模态在步骤S2中相应的真实特定特征,构建一阶段预训练的总损失,并进行一阶段预训练;

步骤S5:一阶段预训练结束后,针对各模态进行随机丢弃,生成用于二阶段微调的训练样本;

步骤S5的具体步骤如下:

步骤S5.1:一阶段预训练结束后,保存并冻结各模态图像编码器和缺失模态生成模块的参数;

步骤S5.2:针对M个模态,先随机舍弃 个模态的数据,将此时的数据记为多模态数据 ;随后对于多模态数据 中的数据再随机舍弃 个模态,将此时的数据记为少模态数据 ;

步骤S6:进行二阶段微调,构建逻辑引导的门控融合模块,输入训练样本中缺失模态的真实特定特征和生成特定特征,结合CNN门控网络和提示学习法,获得总体特定特征,并构建门控权重损失;

步骤S6的具体步骤如下:

步骤S6.1:进行二阶段微调,缺失模态的特定特征由一阶段预训练中训练好的缺失模态生成模块进行重建并替换,缺失模态的共享特征则直接舍弃;

步骤S6.2:在缺失模态生成模块重建特定特征后,所有模态的特定特征将分为原有的真实特定特征 和重建的生成特定特征 ;之后构建逻辑引导的门控融合模块,该门控融合模块结合CNN门控网络和提示学习法,无论是真实特定特征还是生成特定特征,都拼接上一段可学习的向量作为提示,提示长度为可调节的参数,再将带有提示的所有特定特征输入到CNN门控网络中,生成权重系数,执行加权融合,获得总体特定特征 ;

步骤S6.3:构建门控权重损失计算公式如下:

其中, 表示门控权重损失,i表示少模态数据 中缺失模态的索引,j表示少模态数据 中可用模态的索引; 表示模态总数,n为少模态数据 中所缺失的模态总数量; 表示少模态数据 中模态i的生成特定特征的权重, 表示多模态数据中模态i的真实特定特征的权重; 表示多模态数据 中模态j的真实特定特征的权重, 表示少模态数据 中模态j的真实特定特征的权重;

步骤S7:基于各模态的共享特征融合得到总体共享特征;将总体共享特征和总体特定特征相加,获得总分类特征;经过分类器,获得多模态遥感图像的地物分类;

步骤S8:二阶段微调结束后,完成遥感图像地物分类模型的训练,应用训练好的遥感图像地物分类模型,完成目标地区多模态遥感图像的地物分类。

2.根据权利要求1所述的一种任意模态缺失条件下的多模态遥感图像分类方法,其特征在于,步骤S1的具体步骤如下:步骤S1.1:获取目标地区的多模态遥感图像,以及相应的地物分类真值标签,地物分类真值标签为地物类型;

步骤S1.2:将多模态遥感图像和相应的地物分类真值标签按照预设比例划分为训练集、验证集、测试集。

3.根据权利要求1所述的一种任意模态缺失条件下的多模态遥感图像分类方法,其特征在于,步骤S2的具体步骤如下:步骤S2.1:对于高光谱图像 ,构建包含三维卷积模块和二维卷积模块的高光谱图像编码器,其中,三维卷积模块包括三层三维卷积层;

第一个三维卷积层,包括一个尺寸为(7,3,3)、步长为1的卷积核,(3,1,1)的填充,保持输入图像和输出图像的尺寸不变,通道数由1提升到8;

第二个三维卷积层采用尺寸为(7,1,1)、步长为(3,1,1)的卷积核,不再进行空间上的卷积,对图像进行光谱降维,通道数由8提升至16;

第三个三维卷积层的结构与第二个三维卷积层完全一致,针对光谱数量大于预设阈值的图像,进一步进行光谱降维并且增加通道数;

每一层三维卷积层后都具有三维批量归一化层和修正线性单元,将三维输出图像展平为二维图像格式;

二维卷积模块由三个残差层组成,三个残差层的通道数依次为64、128、256,最后经过全局平均池化层和全连接层,高光谱图像编码器输出高光谱图像的真实特定特征 ;

步骤S2.2:分别针对合成孔径雷达图像、数字表面模型图像,构建结构相同的合成孔径雷达图像编码器、数字表面模型图像编码器,结构如下:先经过初始的二维卷积层,卷积核大小为3×3,步长为1,通道数统一映射到64;再经过三层标准的ResNet结构的残差层,每层都包含两个3×3的卷积层和残差连接步,并且步长都为2,进行下采样操作,三层残差层的通道数依次为64、128、256;最终经由全局平均池化层和全连接层,合成孔径雷达图像编码器、数字表面模型图像编码器分别输出合成孔径雷达图像的真实特定特征 、数字表面模型图像的真实特定特征 ;

步骤S2.3:构建模态共享特征编码器,接收任意一种模态的图像,并映射到同一共享特征空间;模态共享特征编码器由三部分组成,第一部分为模态适配层,将输入的图像统一为

64通道的特征图;对于高光谱图像 ,使用1×1的二维卷积层压缩光谱数,其他模态的图像则用3×3的卷积层提取特征的同时进行升维;第二部分为共享主干层,所有模态的图像经过适配转化为(B,64,H,W)的形状,其中,第一个维度B表示批次大小,第二个维度表示通道数,第三个维度H表示图像高度,第四个维度W表示图像宽度;通过一套参数共享的ResNet层提取深层特征;第三部分为输出头,为标准的池化层和全连接层,获取高光谱图像的共享特征 、合成孔径雷达图像的共享特征 、数字表面模型图像的共享特征。

4.根据权利要求3所述的一种任意模态缺失条件下的多模态遥感图像分类方法,其特征在于,步骤S3的具体步骤如下:步骤S3.1:基于高光谱图像的真实特定特征 、合成孔径雷达图像的真实特定特征 、数字表面模型图像的真实特定特征 ,经两两组合相似度计算,按如下公式计算真实特定特征损失 :;

其中, 表示模态i的真实特定特征, 表示模态j的真实特定特征,表示余弦相似度计算, 表示模态纵数量, 表示平均值计算;

步骤S3.2:针对高光谱图像的共享特征 、合成孔径雷达图像的共享特征、数字表面模型图像的共享特征 ,用KL散度损失进行对齐,假设模态i的共享特征分布服从高斯分布 ,其中 和 为模态i的共享特征的均值和标准差,而所有模态的平均统计量分布视为中心分布 ,其中 、 表示所有模态共享特征的均值与标准差的平均值,KL散度损失具体如下式:

其中, 表示KL散度损失;

共享特征对齐任务中,以平均后的共享特征分布为中心,利用KL散度损失,将所有单一模态的共享特征分布拉向中心,所有模态与中心的损失平均值记为共享特征对齐损失 。

5.根据权利要求4所述的一种任意模态缺失条件下的多模态遥感图像分类方法,其特征在于,步骤S4的具体步骤如下:步骤S4.1:构建缺失模态生成模块,接收所有模态的真实特定特征和共享特征,随后对随机模态的图像进行丢弃,丢弃的模态作为缺失模态,保留的模态作为可用模态;

步骤S4.2:构建重建模块,基于注意力机制,将所有可用模态的真实特定特征和共享特征融合后经过线性层成为注意力机制中的键K和值V;

步骤S4.3:针对每个模态自身的固有特征,生成描述性的文本,输入预训练的文本编码器,获得缺失模态的语言特征 ,作为注意力机制中的查询Q;

步骤S4.4:将所获得的查询Q、键K、值V执行多头注意力操作,得到交互后的上下文向量,经由多层感知机生成缺失模态i的生成特定特征 ;

步骤S4.5:将缺失模态i的生成特定特征 与步骤S2.2中所获得的相应的模态i的真实特定特征 计算MSE损失,作为生成特定特征的重建损失 ;

进行一阶段预训练,构建一阶段预训练的总损失如下:

其中, 表示一阶段训练的总损失, 表示真实特定特征损失, 表示生成特定特征的重建损失, 表示共享特征对齐损失, 为可调节参数。

6.根据权利要求5所述的一种任意模态缺失条件下的多模态遥感图像分类方法,其特征在于,步骤S7的具体步骤如下:步骤S7.1:所有可用模态的共享特征经过平均之后得到总体共享特征 ;将总体共享特征 和总体特定特征 相加,获得总分类特征 ,并送入分类器中获得最终的logits值,与地物分类真值标签计算分类交叉熵损失 ;

步骤S7.2:构建少模态数据 与多模态数据 的距离损失:;

其中, 为少模态数据 与多模态数据 的距离损失; 表示在多模态数据 下的分类交叉熵损失, 表示在少模态数据 下的分类交叉熵损失;

构建二阶段微调阶段的总体损失 计算如下:

其中, 为分类交叉熵损失, 表示门控权重损失, 表示少模态数据与多模态数据的距离损失,与 为可调节参数。