利索能及
我要发布
收藏
专利号: 2020107937970
申请人: 韶鼎人工智能科技有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-09
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于条件可预测参数的图像信息提取与生成方法,其特征在于,包括如下步骤:步骤1、设计模型生成器,模型生成器基础网络结构采用编码解码结构,在解码层中不同阶段的卷积参数均有对应的预测网络进行预测;生成器基础网络中,语义标签图作为输入;在编码阶段:在RGB维度进行扩充,先经过一层卷积核为7*7的卷积层,并将输入的维度扩大为64维,紧接着使用卷积层连续进行3次下采样,输入维度逐步扩充到512维,之后经过

9个残差块结构,增加网络深度;在解码阶段:使用卷积加上采样函数连续进行三次上采样,恢复到原先尺寸,最后经过一层卷积层,将输入维度降为3维,进行输出;其中解码阶段3层卷积的卷积核参数由3个预测网络给出,整个网络的归一化层均采用实例归一化,激励函数均为Relu函数;

步骤2、设计辨别器,辨别器采用多尺度辨别器结构,两个尺度分别为原尺度,以及降采样两倍后尺度;在每一个尺度上,输入都连续经过4层的下采样卷积层,最后经过一层卷积,在每个位置上输出0或者1,作为预测图像的真假,0代表当前位置预测为假图片,1代表当前位置预测为真图片;

步骤3、进行模型生成器、辨别器的训练;

步骤4、基于训练后的模型生成器、辨别器对输入的图像进行信息提取与生成;

预测网络设计如下:

预测网络参照编码解码结构,首先对传入的语义标签图进行下采样,然后通过解码器对编码后的语义特征图进行上采样,并参照U‑net网络结构,将不同级别的特征与原始语义图进行级联,以获得具有全局上下文感知的语义特征图,该语义特征图用于预测条件卷积的参数权重以及条件卷积的注意力权重;引入深度可分离卷积,将卷积核分解为条件深度卷积以及常规点式卷积;条件深度卷积独立地在每个输入通道上执行空间滤波,并且基于语义布局动态预测其空间变化的内核权重;

步骤1中的预测网络进一步设计如下:

所述预测网络为三个不同尺度的参数预测网络,每一个参数预测网络都是先经过下采样卷积操作,使得编码的特征图尺度与卷积输入的尺度相同,然后经过一系列的残差块结构,增加预测网络参数共享,增大感受野,最后由ccblock结构输出预测的参数;每一层卷积层卷积核参数的维度不同,因此不同的参数预测网络下采样层数以及残差块结构数不同;

将解码阶段的卷积过程看作是辨别器对应几个阶段卷积下采样的逆,因此,预测的卷积层参数计算输出的结果应该与对应辨别器卷积下采样后的结果相同;训练时,生成器损失函数,额外增加了卷积输出结果与辨别器下采样结果的L1对比损失。

2.根据权利要求1所述的一种基于条件可预测参数的图像信息提取与生成方法,其特征在于,所述步骤3中,辨别器训练过程如下:步骤3.1:语义分割图先与模型生成器G生成的假图片一起送入辨别器D,得到辨别器将假图片预测为假所造成的损失Lfakefake,并保留解码阶段反卷积后的结果;

步骤3.2:语义分割图与真实图片一起送入辨别器,得到辨别器将真图片预测为真所造成的损失Ltruetrue,并保存辨别器在每一尺度4层下采样卷积后的结果;

步骤3.3:语义分割图与假图片再次一起送入辨别器,得到辨别器将假图片预测为真所造成的损失Lfaketrue,并保存4层下采样卷积后的结果;训练数据集作为一组对应的图像(si;

xi)给出,其中si是语义标签图,而xi是对应的自然照片;

模型采用多尺度辨别器,使用3个鉴别器,为区分将其分别称为D1,D2和D3;步骤1‑3中的损失均采用如下公式得到:先调用辨别器D1,D2和D3中得到的参数求公式最大值,然后再调用生成器G得到的相关参数求最小值;其中,目标函数LGAN(G,Dk)由下面公式给出:LGAN(G,Dk)=E(s,x)[logD(s,x)]+Es[log(1‑D(s,G(s)))]E(s,x)、Es分别代表求两部分公式关于语义标签图s、对应的自然照片x和关于s的均值;G(s)表示语义标签图输入到生成器G后生成的图片;D(s,x)、D(s,G(s))分别表示语义标签图s分别与对应的自然照片x、生成器生成的假图片G(s)在输入辨别器后得到的数据;

步骤3.4:将语义分割图与真实图片在辨别器下采样过程中保存的结果与语义分割图与假图片在辨别器下采样过程中保存的结果进行L1损失即最小化绝对误差比较,计算细节(i)损失Ldetail;假设N为每一层特征值的数目;将辨别器Dk的第i层特征提取器表示为Dk ,细节损失Ldetail,也就是特征匹配损耗LFM(G,Dk)计算为:步骤3.5:将语义分割图与真实图片在辨别器下采样过程中保存的结果与生成器解码阶段反卷积后保存的结果进行L1损失比较,计算预测损失Lpredict;

步骤3.6:计算生成器不同卷积层的VGG感知损失Lvgg,将VGG网络的第i层特征提取器表(i)示为Vk ,VGG感知损失Lvgg,也就是特征匹配损耗LFM(G,Vk)计算为:步骤3.7:分别对生成器与辨别器进行训练;其中生成器损失为:

Lg=Lfaketrue+Ldetail+Lpredict+Lvgg;

辨别器损失为:

Ld=Lfakefake+Ltruetrue。