利索能及
我要发布
收藏
专利号: 2026106216337
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向文本引导图像生成任务的生成对抗网络架构搜索方法,其特征在于,包括如下步骤:步骤1、在给定搜索空间的约束下,构建包含生成器超网与判别器的文本条件生成对抗网络;

步骤2、在搜索阶段,采用权重共享的方式对所述生成器超网与判别器进行联合训练,利用预训练的文本-图像对齐模型,对生成的图像与文本进行语义对齐约束,得到图文对齐损失;

步骤3、在搜索过程中或每一代遗传操作结束时,对候选架构进行多目标评价,构造多目标优化向量,并对候选架构进行非支配排序与拥挤距离计算,得到帕累托最优解集;

所述多目标评价,包括:依据生成样本计IS指标 、依据生成样本与真实数据统计量计算FID指标 、利用文本-图像对齐模型计算生成图像与文本描述之间的图文对齐损失 ;

构建所述多目标优化向量 ,表示为:

其中, ,表示FID指标; ,表示IS指标的负值;

,表示图文对齐损失;

步骤4、采用多目标进化算法对架构编码进行迭代搜索,包括:通过非支配排序遗传算法对架构编码进行多目标进化搜索,根据非支配排序结果与拥挤距离,从当代种群中选择父代个体;对父代个体进行交叉与变异操作,生成子代架构编码;合并父代与子代个体,并重新进行非支配排序与拥挤距离计算,选出下一代种群;重复迭代,直至达到预设进化代数或性能收敛条件;

步骤5、在重训练阶段,从帕累托最优解集中选择至少一个目标架构,在固定架构的条件下重新初始化生成器与判别器参数,进行对抗重训练,包括:采用Logistic形式的对抗损失,对判别器引入Lazy R1梯度正则化与实例噪声;对生成器引入指数滑动平均参数更新;

在文本条件场景下结合图文对齐损失对生成器进行联合优化,得到经重训练后的文本条件生成对抗网络模型;

采用Logistic形式的对抗损失,对判别器引入Lazy R1梯度正则化与实例噪声,具体包括:定义判别器损失 :

其中, 为真实数据分布; 为真实数据样本的期望值; 为激活函数; 为判别器对真实图像 的预测分数; 为判别器对生成图像 的预测分数; 为生成样本的期望值; 为R1正则项权重系数; 为R1梯度正则项;

定义生成器损失 :

其中, 为图文对齐损失的权重, 为图文对齐损失;

对真实样本与生成样本引入实例噪声以提升训练稳定性,在训练初期设定噪声标准差,保持若干个训练周期后噪声衰减为0,对判别器输入样本进行如下变换:;

其中, , 服从零均值单位协方差正态分布, 为当前训练阶段的噪声强度,分别为原始的真实样本和原始的生成样本, 分别为添加噪声后的真实样本和添加噪声后的生成样本。

2.根据权利要求1所述的生成对抗网络架构搜索方法,其特征在于,步骤1中,所述生成器超网表示为 ,所述判别器表示为 ;其中,表示网络拓扑结构与演化算子组合的架构编码; 为噪声向量;为文本描述;

所述生成器超网通过架构编码 控制各层之间的连接方式及候选算子,包括卷积、上采样、跳连操作,并将通过CLIP文本编码器得到的文本特征向量 作为先验条件融入到多层特征中。

3.根据权利要求2所述的生成对抗网络架构搜索方法,其特征在于,步骤2中,每次迭代方法包括:步骤2.1、根据当前种群,从搜索空间中采样一个架构编码 ,得到子网络;

步骤2.2、采样噪声与文本,经所述子网络生成图像,并输入判别器,进行对抗训练;

步骤2.3、利用预训练的文本-图像对齐模型对生成的图像与文本进行语义对齐约束,得到图文对齐损失。

4.根据权利要求1所述的生成对抗网络架构搜索方法,其特征在于,所述IS指标,通过对期望值取指数计算:;

其中, 为生成器输出样本的分布; 表示在生成器输出样本分布 下KL散度项的平均值; 为将样本 输入预训练分类网络Inception后得到的类别条件概率分布; 为生成样本上的边缘类别分布; 为KL散度; 函数表示指数函数;

所述FID指标,通过衡量真实分布和生成分布之间的距离计算:;

其中, 为真实数据经Inception特征提取后的均值与协方差; 为生成数据经Inception特征提取后的均值与协方差; (.)为矩阵迹运算; 为真实分布和生成分布;

所述图文对齐损失 由全局对齐损失 与局部对齐损失 加权组成,定义为:

其中, 与 为非负权重系数。

5.根据权利要求1所述的生成对抗网络架构搜索方法,其特征在于,步骤4中,通过非支配排序遗传算法对架构编码进行多目标进化搜索,方法包括:对于每一个候选架构个体 ,计算其多目标函数值 ,并基于支配关系将种群划分为若干非支配前沿;

在每一个非支配前沿内,为保持解的多样性,对个体计算拥挤距离 :;

其中, 与 分别为在第 个目标维度上与个体相邻的两个个体的目标函数值, 与 为该代种群中第 个目标的最大值与最小值;在环境选择阶段优先保留非支配等级高且拥挤距离大的个体进入下一代。

6.根据权利要求1所述的生成对抗网络架构搜索方法,其特征在于,步骤5中,针对生成器参数引入指数滑动平均机制,设置当前训练步生成器参数为 ,指数滑动平均参数为 ,则每一步更新满足:;

其中, 为衰减系数;在评估FID指标与IS指标时,采用 对应的生成器作为评估模型。

7.根据权利要求6所述的生成对抗网络架构搜索方法,其特征在于,所述搜索阶段与重训练阶段相互解耦,具体为:在搜索阶段,计算 、 与 指标时所采用的生成样本数量小于重训练阶段采用的生成样本数量;且搜索阶段对每个候选架构进行对抗训练的迭代轮数少于重训练阶段对抗重训练的迭代轮数;

在重训练阶段,对筛选出的目标架构编码 进行从头训练,采用比搜索阶段更长的训练轮数与更多数量的生成样本进行 、 指标的评估,在保证搜索效率的同时提升最终模型的生成质量与文本一致性。

8.一种基于多目标进化搜索与文本语义对齐的生成对抗网络架构搜索系统,用于实施权利要求1至7任一所述的方法,其特征在于,包括:超网构建模块:在预定义搜索空间内构建文本-图像生成对抗网络超网,包括以架构编码控制拓扑结构与候选算子的生成器,以及用于判别真实图像与生成图像的判别器;

搜索训练模块:在搜索阶段采用权重共享方式对生成器超网与判别器进行联合训练,生成不同架构子网络对应的生成样本;

图文对齐评估模块:调用预训练图文对齐模型,对生成图像与文本描述进行相似度计算,得到图文对齐损失;

多目标评价与进化模块:计算各候选架构的FID指标与IS指标与图文对齐损失,并基于非支配排序与拥挤距离的多目标进化算法对架构编码进行迭代搜索,得到帕累托最优架构集合;

重训练模块:从所述帕累托最优架构集合中选择目标架构,基于Logistic对抗损失、Lazy R1梯度正则化、实例噪声及图文对齐损失对目标架构进行从头重训练,并通过指数滑动平均机制得到最终生成器权重;

结果输出模块:输出经过重训练得到的文本条件生成对抗网络模型以及相应的FID指标与IS指标。