1.一种基于文本正则化的领域泛化方法,其特征在于:所述基于文本正则化的领域泛化方法包括如下步骤:S1、建立DG分类模型,所述DG分类模型包括文本编码器、特征提取器和分类器,所述特征提取器包括依次连接的图像编码器和投影头,所述投影头用于将特征提取器生成的特征向量和文本编码器生成的文本向量进行维度对齐,所述投影头的输出端与分类器连接,所述文本编码器采用CLIP模型的文本编码器;
所述DG分类模型的总损失函数公式如下:
;
目标函数定义如下:
;
式中, 表示总体期望值,x表示输入样本,y表示输入标签,表示超参数, 表示特征提取器, 表示分类器, 表示第一损失函数, 表示第二损失函数,即正则化项,表示总损失函数;
其中,第一损失函数公式如下:
;
第二损失函数公式如下:
;
式中,z为输入样本x经过特征提取器后生成的特征向量, 为分类器的第i个类别基底, 为输入样本x实际所属的类别基底,C为类别总数,为文本编码器的第i个类别单词经文本编码器后生成的文本向量, 表示输入样本x实际所属类别单词的文本向量, 为余弦相似度;
S2、采用第一训练集训练所述DG分类模型的特征提取器,并基于不平衡学习策略将特征提取器的学习率与分类器的学习率的比值调整为预设比例,将第一训练集的类别单词经所述文本编码器生成的文本向量作为训练过程中额外的监督信号,获得训练好的DG分类模型;
S3、将待识别图片输入训练好的DG分类模型,获得对应分类结果;
所述DG分类模型建立前,还进行CLIP模型的泛化性来源分析,过程如下:获取ImageNet预训练模型和预训练好的CLIP模型的图像编码器,所述CLIP模型的图像编码器比ImageNet预训练模型采用的训练样本多;
基于ERM监督方法,比较ImageNet预训练模型和预训练好的CLIP模型的图像编码器分别经第一训练集微调训练后的分类结果;
基于文本监督方法,比较ImageNet预训练模型和预训练好的CLIP模型的图像编码器分别经第一训练集微调训练后的分类结果;
根据第一训练集微调训练后的各模型的分类结果的相似度矩阵图比较可鉴别性;
采用第二训练集分别对ImageNet预训练模型和预训练好的CLIP模型的图像编码器进行微调训练,并根据第二训练集微调训练后的各模型的分类结果比较数据分布偏向,所述第二训练集的类别总数和领域总数均大于第一训练集;
根据比较结果确定泛化性来源和最优预训练模型,并将泛化性来源引入DG分类模型形成训练过程中额外的监督信号,将最优预训练模型作为DG分类模型的图像编码器。
2.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述微调训练采用K 折交叉验证方式评估,学习率为5e‑5,最小批次为32,优化器为Adam。
3.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述进行CLIP模型的泛化性来源分析还包括如下步骤:基于量化评估指标 评估各微调训练后的模型捕捉域不变表示的能力,视量化评估指标 最小的微调训练后的模型最优,所述量化评估指标 为各类输入样本的评估指标平均值,其中,第i类输入样本的评估指标计算如下:;
式中,M为第i类输入样本的总数,表示特征提取器生成的第j个输入样本对应的特征向量,p表示M个输入样本对应的特征向量的平均值。
4.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述ImageNet预训练模型为卷积神经网络模型或Transformer网络模型,所述CLIP模型的图像编码器与所述ImageNet预训练模型采用相同网络模型。
5.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述第一训练集为Office‑Home数据集,所述第二训练集为DomainNet数据集。
6.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述投影头包括至少一个全连接层。
7.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述预设比例为
100:1。
8.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述分类器为全连接层。
9.如权利要求1所述的基于文本正则化的领域泛化方法,其特征在于:所述将待识别图片输入训练好的DG分类模型前,还采用第二训练集再次训练以更新训练好的DG分类模型,所述第二训练集的类别总数和领域总数均大于第一训练集。