利索能及
我要发布
收藏
专利号: 2021110859933
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于注意力机制的人脸属性编辑方法,其特征在于,包括以下步骤:步骤一:建立由多层编码器和多层解码器组成的人脸属性编辑模型;

步骤二:将人脸图像采用多尺度输入方法输入多层编码器中进行卷积编码,输出每一层的特征向量;

步骤三:将编码器最后一层输出的特征向量与属性差值向量连接,并将连接结果输入到多层解码器中进行反卷积解码,所述解码器与编码器的层数为n;所述的属性差值向量是由目标属性向量和源属性向量作差得到的;

在所述多层解码器的相邻两层之间引入对偶注意力机制传输单元,所述的对偶注意力机制传输单元的输入为解码器第l层输出的特征向量与编码器第n‑l层输出的特征向量,对偶注意力机制传输单元的输出作为解码器第l+1层的输入,解码器最后一层的输出作为编辑后的人脸图像表示;n为编码器和解码器的层数;

步骤三:模型训练过程:将编辑后的人脸图像表示送入判别器和属性分类器,利用多任务学习的方式对多层编码器、多层解码器以及对偶注意力机制传输单元进行训练,得到训练好的人脸属性编辑模型;

步骤四:采用步骤二至步骤三的方法,利用训练好的人脸属性编辑模型获得待编辑人脸图像的编辑结果,即最后一层编码器输出的编辑后的人脸图像表示;通过调整属性差值向量实现不同属性的编辑结果。

2.根据权利要求1所述的一种基于注意力机制的人脸属性编辑方法,其特征在于,所述多层编码器的各层输入中,第一层编码器的输入是原图像,将输入的图像经过卷积编码后作为该层编码器的输出;其他层编码器的输入为不同尺度的原图像与上一层编码器输出的特征向量,二者采用跨通道方式连接,所述的不同尺度的原图像是通过下采样得到。

3.根据权利要求1或2所述的一种基于注意力机制的人脸属性编辑方法,其特征在于,编码器和解码器均为5层结构。

4.根据权利要求1所述的一种基于注意力机制的人脸属性编辑方法,其特征在于,所述的对偶注意力机制传输单元包括一个位置注意力模块和一个通道注意力模块,两个模块的输入相同,两个模块的输出相加后的作为对偶注意力机制传输单元的最终输出结果。

5.根据权利要求4所述的一种基于注意力机制的人脸属性编辑方法,其特征在于,所述的位置注意力模块的计算过程包括:将编码器第n‑l层的特征向量 和解码器第l层的特征向量 的维度变为(W×H)×C,其中W和H表示特征图的长和宽,C表示特征图的通道数量;

计算注意力机制中W×H个键值和查询值:

1≤i≤(W×H)

其中,ki和qi表示第i个键值和查询值,Wk和Wq表示1×1卷积核;

计算相似度矩阵α1:

其中,Wt表示1×1卷积核,ReLU(.)表示ReLU激活函数,Sigmoid(.)表示sigmoid激活函数;αij是相似度矩阵α1中的元素,表示编码层的第j个通道对解码层的第i个通道的影响程度;

计算位置注意力模块的输出:

其中,PA表示位置注意力输出。

6.根据权利要求4所述的一种基于注意力机制的人脸属性编辑方法,其特征在于,所述通道注意力模块的计算过程包括:将编码器第n‑l层的特征向量 和解码器第l层的特征向量 的维度变为C×(W×H)其中W和H表示特征图的长和宽,C表示特征图的通道数量;

计算相似度矩阵α2:

其中, 表示解码器第l层中第i通道的特征图, 表示编码器第n‑l层中第j通道的特征图; 是相似度矩阵α2中的元素,表示编码层的第j通道对解码层的第i通道的影响程度;

计算通道注意力模块的输出:

其中,β为标量,CAi为解码层第i个通道的输出,将所有通道的输出表示为CA。

7.根据权利要求1所述的一种基于注意力机制的人脸属性编辑方法,其特征在于,所述的多任务学习的方式是采用多任务损失训练模型,所述的多任务损失包括重建损失、对抗损失、属性损失和分类器损失。

8.根据权利要求1所述的一种基于注意力机制的人脸属性编辑方法,其特征在于,在解码器的每一层输入中均加入属性差值向量。