利索能及
我要发布
收藏
专利号: 2021104131257
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于姿态引导、风格和形状特征约束的人体图像生成方法,其特征在于,包括以下步骤:(1)采集获取源人体图像Is和目标人体图像It,根据源人体图像和目标人体图像分别获得其姿态图像Ps、Pt和人体语义分割图像Ss、St;姿态图像的关键点个数N=18,人体语义分割图像的类别个数C=8;

(2)构建生成器G和判别器DI、DP,其中,生成器G包括风格编码器Encoderstyle、姿态编码器Encoderpose、形状编码器Encodershape和解码器Decoder;判别器DI用于判别生成的虚拟目标图像If与源人体图像Os之间的纹理相似性;判别器DP用于判别生成的虚拟目标图像If与目标姿态Pt的一致性;具体步骤为:(2‑1)构建风格编码器Encoderstyle

Encoderstyle包含5个3×3卷积层和已经预训练的VGG网络,前4个卷积层提取出的特征图大小分别对应VGG中{1_1,2_1,3_1,4_1}层的特征图大小;依次组合卷积层提取的特征和VGG网络提取的特征,再输入下一个卷积层;最后一个卷积层,把特征从1024维映射到64维;

使用时,首先使用语义分割图像分割出8个独立的图像 接着把8个独立的语义图像分别输入Encoderstyle中输出对应的风格特征,最后将它们依次级联,得到最终的512维的风格特征;

(2‑2)构建姿态编码器Encoderpose和形状编码器EncodershapeEncoderpose和Encodershape的网络结构相同,都包括4个3×3卷积层,激活层为ReLU层,提取512维的姿态特征和形状特征;

(2‑3)构建解码器Decoder

以姿态特征作为输入,使用风格特征和形状特征计算归一化参数;先经过4个ResBlock,保持通道不变;接着经过3组上采样层和ResBlock层;除了最后一层激活层为tanh,其余激活层皆为ReLU层;

(2‑4)构建判别器DI、DP

使用PatchGAN作为判别器,包括4个3×3卷积层和3个残差块,判别器的Dropout设置为

0.5;

(3)将步骤(1)中得到的源人体图像Is和源人体语义分割图像Ss输入风格编码器Encoderstyle,目标姿态图像Pt输入姿态编码器Encoderpose,目标人体语义分割图像St输入形状编码器Encodershape;

把依次提取得到的风格特征、姿态特征和形状特征输入解码器Decoder中,获得虚拟目标人体图像If;

(4)把(Is,It)和(Is,If)分别作为判别器DI的输入,把(Pt,It)和(Pt,If)分别作为判别器DP的输入,分别计算对抗损失Ladv,并基于If和It计算图像重建损失Lreconstruction、感知损失Lperceptual和语义损失LCX,优化G;对抗损失函数的定义为:式中,E表示期望;

图像重建损失Lreconstruction是虚拟目标图像和真实目标图像之间的L1损失,定义为:Lreconstruction=||G(Is,Ss,Pt,St)‑It||1图像感知损失定义为:

其中,表示格拉姆矩阵, 表示用预训练的VGG19网络提取的It的第l层特征图,l=relu{3_2,4_2};

语义损失LCX定义为:

式中, 表示用预训练的VGG19网络提取的If的第l层特征图;

(5)循环步骤(3)和步骤(4),达到预设的迭代次数后,获得训练好的生成器G,并用于现实场景中虚拟目标图像的生成。

2.根据权利要求1所述的基于姿态引导、风格和形状特征约束的人体图像生成方法,其特征在于,步骤(5)中,训练过程中,学习率初始为0.0001,在1000次迭代中,线性衰减至0。