利索能及
我要发布
收藏
专利号: 2021111092651
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种文本生成图像方法,其特征在于:所述方法包括以下步骤:步骤1:获取文本及对应的图像构成的数据集,进行预处理;

步骤2:构建基于AttnGAN的文本生成图像网络模型,所述网络模型包括预训练网络和多阶段生成网络,所述预训练网络引入Transformer模块;

步骤3:提取图像对应的文本描述的文本特征,文本特征包括单词特征和句子特征,对句子特征进行条件增强后与随机噪声合并、输入到Transformer模块,学习得到空间与位置信息;

步骤4:将步骤3学习到的特征信息输入到第一生成器,输出64*64低分辨率初始生成图像,将低分辨率初始生成图像和句子特征输入初始判别器进行判别;

步骤5:将步骤4生成的低分辨率初始生成图像进行下采样得到特征,单词特征输入到一个全局注意力模块得到新的单词特征,将两个特征一起输入到卷积神经网络学习,得到融合特征,再将融合特征输入到第二生成器,输出128*128图像,将128*128图像和句子特征输入二级判别器进行判别;

步骤6:将步骤5生成的128*128图像进行下采样得到特征,单词特征输入到一个全局注意力模块得到新的单词特征,将两个特征一起输入到卷积神经网络学习,得到新的融合特征,将新的融合特征输入第三生成器,输出256*256图像,将256*256图像和句子特征输入三级判别器判别;

步骤7:将步骤6生成的图像作为最终生成图像,输出。

2.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤2中,Transformer模块包括Encoder模块和Decoder模块;所述Encoder模块包括三个顺次连接的第一子模块,任一第一子模块包括顺次连接的self‑attention层、归一化层和全连接层;

所述Decoder模块包括三个顺次连接的第二子模块,任一第二子模块包括顺次连接的第一self‑attention层、第一归一化层、第二self‑attention层、第二归一化层和全连接层;

所述Encoder模块的输出分别输入三个第二子模块的第二self‑attention层;

所述Encoder模块的第一个第一子模块和Decoder模块的第一个第二子模块分别对应为输入端,所述Decoder模块的第三个第二子模块的输出端对应为输出端。

3.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤3中,将句子特征与随机噪声合并输入到Transformer模块,学习得到空间与位置信息包括以下步骤:步骤3.1:以句子特征通过条件增强模块得到特征向量其中, 为文本的句子特征, 为文本的句子特征向量的均值向量, 为文本的句子特征向量的协方差矩阵,ε为单位高斯分布N(0,1)的分布采样;

步骤3.2:将得到的特征向量 与随机噪声向量 合并,得到e,将e作为Transformer模块的输入;

步骤3.3:在Transformer模块中,将e转换在注意力空间中,得到三个表示向量:计算权重信息

其中, αj,i表示合成图像第j个区域时的第i个位置的权重信息;最后得到带注意力机制的图像特征矩阵步骤3.4:整合特征矩阵,得到Transformer输出特征向量h,

4.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤4中,第一生成器的损失函数为

其中, 表示数学期望,G1和D1分别为第一生成器和初始判别器,λ表示决定DAMSM模块对生成器损失函数影响大小的超参数,h表示Transformer的输出特征向量,e表示句子特征与随机噪声向量联合后的文本特征向量,LDAMSM表示训练网络DAMSM模块得出的损失函数。

5.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤4中,初始判别器的损失函数为LD1=L1+L2,其中L1表示判别输入图像是否真实,L2表示判别输入图像与文本是否语义一致,

其中,表示数学期望,x表示文本描述对应真实图像,表示文本描述对应第一生成器生成的图像,e表示句子特征与随机噪声向量联合后的文本特征向量。

6.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤5中,第二生成器的损失函数为

其中, 表示数学期望,K=S(F(h,e1)),G2和D2分别为第二生成器和二级判别器,λ1表示决定DAMSM模块对第二生成器损失函数影响大小的超参数,h表示Transformer的输出特征向量,e1表示单词特征,LDAMSM表示训练网络DAMSM模块得出的损失函数,F表示全局注意力生成模块,S表示神经网络下采样模块。

7.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤5中,二级判别器的损失函数为LD2=L1+L2,其中L1表示判别输入图像是否真实,L6表示判别输入图像与文本是否语义一致,

其中, 表示数学期望,x表示文本描述对应真实图像,表示文本描述对应第二生成器生成的图像,e表示句子特征与随机噪声向量联合后的文本特征向量。

8.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤6中,第三生成器的损失函数为

其中,K=S(F(F(h,e1))),G3和D3分别为第三生成器和三级判别器,λ2表示决定DAMSM模块对第三生成器损失函数影响大小的超参数,h表示Transformer的输出特征向量,e1表示单词特征,e表示句子特征与随机噪声向量联合后的文本特征向量,LDAMSM表示训练网络DAMSM模块得出的损失函数,F(h,e1)表示经过全局注意力模块学习到的特征向量。

9.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述步骤6中,三级判别器的损失函数为LD3=L1+L2,其中,L1表示判别输入图像是否真实,L6表示判别输入图像与文本是否语义一致,

其中, 表示数学期望,x表示文本描述对应真实图像,表示文本描述对应第三生成器生成的图像,e表示句子特征与随机噪声向量联合后的文本特征向量。

10.根据权利要求1所述的一种文本生成图像方法,其特征在于:所述基于AttnGAN的文本生成图像网络模型的训练阶段中,将单词特征通过DAMSM模块后的结果与256*256图像通过图像解码器后的结果进行比较,并基于比较结果调整文本生成图像网络模型。