利索能及
我要发布
收藏
专利号: 202511471948X
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于扩散模型的图像生成身份个性化方法,其特征在于,包括以下步骤:步骤1,构建身份语义解耦训练框架:建立身份增强模型,所述身份增强模型在原始SDXL1.0模型上额外引入了图像交叉注意力模块;

原始SDXL1.0模型的U型网络Unet中包含自注意力层和交叉注意力层;

同时使用身份增强模型和原始SDXL1.0模型做推理,身份增强模型用ID分支表示,原始SDXL1.0模型用语义分支表示;

步骤2,建立混合注意力融合机制,从原始SDXL1.0模型的自注意力层提取语义分支的键 、值 ,从身份增强模型的自注意力层提取代表身份特征的ID分支的键 、值 ,然后进行混合注意力融合;

步骤3,风格生成:在原始SDXL1.0模型的自注意力层中对键、值特征执行混合操作AdaIN‑mean,即一种结合自适应均值归一化与均值对齐的操作,以进一步将合成图像的风格与输入的风格提示对齐;

步骤1包括如下步骤:

步骤1‑1,在原始SDXL1.0模型中,引入一个额外的可训练的图像交叉注意力模块,通过人脸识别模型导出人脸的全局图像嵌入,通过CLIP图像编码器导出人脸的局部嵌入,并使人脸的全局图像嵌入、局部嵌入与预训练扩散模型的文本特征的维度对齐;

步骤1‑2,训练时仅优化人脸识别模型和CLIP图像编码器和图像交叉注意力模块参数,停用原始SDXL1.0模型的U型网络Unet中文本嵌入的交叉注意力模块;预训练扩散模型参数保持冻结;

步骤1‑3,定义训练目标函数 ;

步骤3包括:所述将合成图像的风格与风格提示对齐,用于在生成时实现文本提示中的两种以上风格;

将混合注意力和图像交叉注意力中从 投影的键特征和值特征,与从文本特征投影的键特征和值特征均值归一化对齐,公式为:,

其中, 表示AdaIN‑mean操作,定义为:,

其中, 是ID分支键值特征的均值,a表示ID分支的键值,b表示语义分支的键值,是语义分支的键值特征的均值。

2.根据权利要求1所述的方法,其特征在于,步骤1‑2包括:建立一个训练对,所述训练对包括一个ID图像和去噪图像;

所述ID图像中面部已被识别裁剪,用于提取身份信息。

3.根据权利要求2所述的方法,其特征在于,步骤1‑3包括:训练目标函数 表示为:,

其中, 表示联合期望, 表示从标准高斯分布中采样得到的随机噪声, 表示Unet输出的预测噪声, 表示第t步的带噪潜在表示,t表示当前的噪声添加步数, 表示标准高斯分布;

是输入图像的身份嵌入,表示为:

其中Concat表示连接操作; , , , 和FA 分别表示CLIP映射器、CLIP图像编码器、人脸识别模型映射器、人脸识别模型和人脸对齐模块,其中,所述CLIP映射器用于将CLIP图像编码器输出的局部嵌入投影到扩散模型文本特征的维度;

所述人脸识别模型映射器用于将人脸识别模型输出的全局嵌入投影到扩散模型文本特征的维度;

x表示输入图像;

在双人生成的模式下,按照与单人相同的方式分别得到两个人的身份嵌入 和 ,再将身份嵌入 和 连接得到嵌入 ;

通过步骤1‑1 步骤1‑3,得到身份增强模型。

~

4.根据权利要求3所述的方法,其特征在于,步骤2包括:将 和 拼接得到融合语义分支和ID分支的键 ,将 和 拼接得到融合语义分支和ID分支的值 ;

设计混合注意力融合公式:

其中Q表示查询向量,K表示键向量,V表示值向量; 表示自注意力层输出的注意力,表示左式由右式计算得到,Attn表示计算出的注意力;

采用延迟主体条件控制:

前8步:人脸区域掩码mask区域中,mask_weight=0.8,非人脸区域掩码Mask区域中,non_mask_weight=0.2,其中mask_weight表示ID分支的键值在人脸区域掩码mask区域的权重,non_mask_weight表示ID分支的键值在非人脸区域掩码mask区域的权重;

8步后:ID权重线性过渡至人脸区域掩码mask区域1.0和非人脸区域掩码mask区域0.0;

其中1.0表示ID分支的键值在人脸区域掩码mask区域的权重取1.0,0.0表示ID分支的键值在非人脸区域掩码mask区域的权重取0.0;

mask引导特征融合:

其中mask_weight表示ID分支的键值在人脸区域掩码mask区域的权重,non_mask_weight表示ID分支的键值在非人脸区域掩码mask区域的权重;1‑mask表示图像中非人脸区域掩码mask的区域;

在双人模式下,mask表示第一个输入图像的人脸区域掩码mask1和第二个输入图像的人脸区域掩码mask2的集合;所述双人模式是指输入两个人脸图像,定制化生成两个输入人脸的图片;

表示身份增强模型的自注意力层最终使用的值, 表示语义分支计算得到的值,mask表示人脸区域掩码, 表示ID分支计算得到的值;

在双人模式下,在身份增强模型的图像交叉注意力模块中,分离 得到 和 ,和 分别对应第一个输入图像的身份嵌入和第二个输入图像的身份嵌入;

使用 计算得到第一个输入图像的键 、值 ;

使用 计算得到第二个输入图像的键 、值 ;

计算得到第一个输入图像的身份嵌入的图像交叉注意力图 和第二个输入图像的身份嵌入的图像交叉注意力图 ,实现双人生成:,

其中○表示哈达玛积,softmax表示归一化操作, 表示 的维度,T表示矩阵转置运算,Q表示 计算得到的查询向量。

5.根据权利要求4所述的方法,其特征在于,步骤2中,所述混合注意力融合机制包含动态控制策略,所述动态控制策略包括: Mask精确区域控制:使用原始SDXL1.0模型生成纯文本条件图像,通过ArcFace人脸检测模型定位人脸区域,边界框外扩生成最终Mask,生成时,将ID分支的键值与语义分支的键值,分别按对应的权重mask_weight和non_mask_weight注入人脸区域掩码mask区域与非人脸区域掩码mask区域中;

时间动态权重函数:记录生成过程中的时间步,在前8步时在人脸区域掩码mask区域内融入语义分支信息,后22步逐渐线性过渡至完全没有语义信息;

ID分支的权重公式为:

采样步数t < 8时,mask_weight=0.8,non_mask_weight=0.2;

t>= 8时,mask_weight=0.8+0.025×(t‑8);

non_mask_weight=max(0,0.2‑0.025×(t‑8));

特征融合增强与二次生成:在推理阶段,同时使用步骤1得到的身份增强模型和原始SDXL1.0模型进行生成;

身份增强模型的自注意力层采用混合语义分支和ID分支键值拼接,其中ID分支的键值来自身份增强模型,语义分支的键值来自原始SDXL1.0模型;

自注意力层的计算公式为:

其中, 、 、 、 为线性层的计算参数, 为中间参数; 为中间参数;

身份增强模型的图像交叉注意力模块采用语义分支注意力、ID分支注意力双分支求和,使用身份增强模型的图像交叉注意力模块的键值计算出ID分支的注意力,使用原始SDXL1.0模型在纯文本条件下的交叉注意力层的键值计算出语义分支的注意力,将语义分支和ID分支的注意力相加得到最终的交叉注意力,图像交叉注意力模块的计算公式为:,

其中, 分别表示交叉注意力层中分离出的ID分支的键、值, 分别表示交叉注意力层中分离出的语义分支的键、值; 表示图像交叉注意力模块计算得到的注意力,表示左式由右式计算得到。

6.根据权利要求5所述的方法,其特征在于,步骤2中,在双人模式下,图像交叉注意力模块的最终的交叉注意力的计算公式为:。

7.一种电子设备,其特征在于,包括处理器和存储器,所述存储器存储有程序代码,当所述程序代码被所述处理器执行时,使得所述处理器执行如权利要求1至6中任一项所述的方法的步骤。

8.一种存储介质,其特征在于,存储有计算机程序或指令,当所述计算机程序或指令在计算机上运行时,执行如权利要求1至6中任一项所述的方法的步骤。