利索能及
我要发布
收藏
专利号: 2024106892133
申请人: 江西农业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于特征定位融合的文本编辑图像系统,由生成器和鉴别器组成,生成器包括一个文本编码器和一个图像编码器,其特征在于,所述生成器还包括多个深度注意力编辑块、特征定位模块和卷积层,各深度注意力编辑块逐个串联;第一个深度注意力编辑块的输入为由图像编码器编码的图像特征和由文本编码器编码的文本特征,特征定位模块的输入为由图像编码器编码的图像特征;除第一个深度注意力编辑块外的其他深度注意力编辑块,每个深度注意力编辑块的输入为前一个深度注意力编辑块输出的图像特征、由文本编码器编码的文本特征和由特征定位模块输出的图像定位特征,最后一个深度注意力编辑块输出的图像特征进入卷积层,卷积层将图像特征转换为生成图像;

所述特征定位模块包含多个卷积层、多个全局池化层、分组归一化、多个Softmax激活层和多个Sigmoid激活层;首先由图像编码器输出的图像特征X要经过三个分支,分别输入到水平全局池化层、垂直全局池化层和卷积层中,水平全局池化层和垂直全局池化层输出的图像特征进行连接并卷积后又分别输入到Sigmoid激活层,然后相乘得到图像特征X1,图像特征X1进行分组归一化后分别输入到Softmax激活层和全局池化层中,Softmax激活层得到图像特征X2,全局池化层得到图像特征X3;图像特征 X 经过卷积层后,进入 Softmax激活层,得到图像特征 X4;然后将图像特征X3 与图像特征 X4相乘,得到图像特征 X5;图像特征 X 经过卷积层后,进入全局池化层后得到图像特征X6;然后将图像特征X6与图像特征 X2相乘,得到图像特征 X7;最终,图像特征X7与图像特征X5相加进入Softmax激活层后与图像特征X进行相乘操作得到最终的图像定位特征;

深度注意力编辑块包含一个上采样块、多个仿射变换层、多个ReLU激活层、多个卷积层和一个注意力特征融合块,输入的图像特征经过上采样块采样后分别与多层感知机获取的文本特征和经过卷积后的图像定位特征在仿射变换层进行仿射变换,然后通过ReLU激活层处理,每次仿射变换后经过卷积层处理,经过若干次仿射变换处理,最后将两个分支输出的图像特征进行相乘操作后,与输入的图像特征通过注意力特征融合块得到融合后的图像特征。

2.根据权利要求1所述的基于特征定位融合的文本编辑图像系统,其特征在于,所述注意力特征融合块由多尺度通道注意力模块构成,将仿射变换后的图像特征与上个深度注意力编辑块输出的图像特征相加并输入到多尺度通道注意力模块中进行特征融合,多尺度通道注意力模块有两个注意力权重的输出,其中一个的注意力权重与上个深度注意力编辑块输出的图像特征相乘,另一个注意力权重与仿射变换后的图像特征相乘,最后两个相乘的图像特征相加,输出融合后的图像特征。

3.根据权利要求2所述的基于特征定位融合的文本编辑图像系统,其特征在于,所述多尺度通道注意力模块由一个全局池化层、多个逐点卷积层、两个ReLU激活层和一个Sigmoid激活层构成,图像特征分别输入到逐点卷积层和全局池化层中形成两个分支,在第一个分支中,图像特征依次通过逐点卷积层、ReLU激活层和逐点卷积层,在第二个分支中,图像特征依次通过全局池化层、逐点卷积层、ReLU激活层和逐点卷积层,最后将两个分支的输出相加并通过Sigmoid激活层输出两个注意力权重。

4.一种基于特征定位融合的文本编辑图像方法,利用权利要求1‑3任意一项所述的文本编辑图像系统,其特征在于,包括:

将原花卉图像馈送到一个图像编码器中编码得到图像特征;

将文本输入文本编码器中编码得到文本特征,文本特征分别输入各深度注意力编辑块中;

将图像编码器中编码得到图像特征分别输入第一个深度注意力编辑块和特征定位模块中,随后特征定位模块输出图像定位特征,并将图像定位特征输入到后续的深度注意力编辑块中;

各深度注意力编辑块逐个串联,除第一个深度注意力编辑块,每个深度注意力编辑块输入前一个深度注意力编辑块输出的图像特征;

最后一个深度注意力编辑块输出的图像特征进入卷积层,卷积层将图像特征转换为生成图像;

利用对抗损失对生成器和鉴别器共同训练,通过鉴别结果优化生成器编辑花卉图像的质量。

5.根据权利要求4所述的基于特征定位融合的文本编辑图像方法,其特征在于,深度注意力编辑块以文本特征 、图像定位特征v和上一个深度注意力编辑块生成的图像特征作为输入,并输出融合后的图像特征 , 、 、 分别为第i个深度注意力编辑块生成的图像特征的宽度、高度和通道数, 为第i‑1个深度注意力编辑块生成的图像特征的通道数。

6.一种非易失性计算机存储介质,计算机存储介质存储有计算机可执行指令,其特征在于,该计算机可执行指令执行权利要求4或5所述的基于特征定位融合的文本编辑图像方法。

7.一种电子设备,包括:至少一个处理器,以及与所述至少一个处理器通信连接的存储器,其中,所述存储器存储有可被所述至少一个处理器执行的指令,其特征在于,所述指令被所述至少一个处理器执行,以使所述至少一个处理器执行权利要求4或5所述的基于特征定位融合的文本编辑图像方法。