1.一种基于文本条件扩散模型的语义图像编辑方法,其特征在于:语义图像编辑方法包括以下步骤:步骤1、生成查询文本嵌入向量Q嵌入和参考文本嵌入向量R嵌入作为编辑引导条件,用于指导遮罩生成;
步骤2、利用步骤1中的生成查询文本嵌入向量Q嵌入和参考文本嵌入向量R嵌入,生成编辑区域的语义遮罩M;
步骤3、对编辑区域进行精准编辑:使用步骤2生成的语义遮罩M进行去噪生成第一代潜在特征图FN‑1;
步骤4、重复步骤3的操作,迭代N次,即迭代至时间步长N处,得到N代潜在特征图,N代潜在特征图再通过解码器解码得到一代目标图像;
步骤5、用户对步骤4获得的目标图像进行二次精确编辑:生成二代查询文本嵌入向量Q2嵌入和二代参考文本嵌入向量R2嵌入,指导生成二代语义遮罩M2,进而去噪生成第二代潜在特征图FN‑2,迭代N次,再通过解码器得到二代目标图像,具体包括以下步骤:步骤5.1、用户根据需求输入二代查询文本Q2,针对一代目标图像进一步修改的区域,同时一代目标图像通过视觉语言模型BLIP‑2获得对应的二代参考文本R2,二代查询文本Q2和二代参考文本R2进入ChatGPT模型,得到二代查询文本嵌入向量Q2嵌入和二代参考文本嵌入向量R2嵌入,帮助一代目标图像完善局部细节;
步骤5.2、一代目标图像通过编码器转换成一代目标图像潜在特征图F潜在2,计算机生成随机高斯噪声,并与步骤5.1中得到的二代查询文本嵌入向量Q2嵌入和二代参考文本嵌入向量R2嵌入分别通过U‑net预训练模型进行噪声预测,并将预测出的噪声和一代目标图像潜在特征图F潜在2,进行叠加,得到二代查询文本潜在特征图F潜在Q2和二代参考文本潜在特征图F潜在R2.,计算二代查询文本潜在特征图F潜在Q2与二代参考文本潜在特征图F潜在R2.的差值,重复计算二代查询文本潜在特征图F潜在Q2与二代参考文本潜在特征图F潜在R2.的差值20次,求平均值得出二代初始的遮罩,对二代初始遮罩进行归一化,二值化处理,最终得到二代语义遮罩M2;
步骤5.3、一代目标图像通过编码器转换成一代目标图像潜在特征图F潜在2,所述一代目标图像潜在特征图F潜在2经过前向加噪过程生成二代加噪潜在特征图FN2,U‑net预训练模型利用所述二代加噪潜在特征图FN2、所述二代参考文本嵌入向量R2嵌入进行噪声预测,二代加噪潜在特征图FN2减去预测出的噪声得出二代参考文本去噪潜在特征图Fr1’,同时U‑net预训练模型利用二代加噪潜在特征图FN2、二代查询文本嵌入向量Q2嵌入进行噪声预测,二代加噪潜在特征图FN2减去预测出的噪声得出二代查询文本去噪潜在特征图Fq2,使用步骤5.2生成的二代语义遮罩M2进行去噪,将二代语义遮罩M2进行张量转换进入潜在空间,与所述二代参考文本去噪潜在特征图Fr1’和二代查询文本去噪潜在特征图Fq2生成第二代潜在特征图FN‑2;
步骤5.4、重复步骤5.3的操作,迭代N次,即迭代至时间步长N处,得到N代潜在特征图,N代潜在特征图再通过解码器解码得到二代目标图像;
步骤5.5、如果用户需要继续修改图像的局部细节,则重复步骤5.1至步骤5.4,得到最终目标图像。
2.根据权利要求1所述一种基于文本条件扩散模型的语义图像编辑方法,其特征在于:
所述步骤1生成查询文本嵌入向量Q嵌入和参考文本嵌入向量R嵌入作为编辑引导条件,具体包括以下步骤:步骤1.1、用户输入原始图像和用户文字指令,原始图像通过固定图像编码器和大型语言模型引导的视觉语言模型BLIP‑2获得对原始图像的描述即原始参考文本;
步骤1.2、步骤1.1获得的原始参考文本进入ChatGPT模型,ChatGPT模型通过学习任务对用户文字指令进行修改并提供细节,获得的最终查询文本和参考文本,通过文本嵌入转换为可被计算机所识别的向量,得到查询文本嵌入向量Q嵌入和参考文本嵌入向量R嵌入。
3.根据权利要求1所述一种基于文本条件扩散模型的语义图像编辑方法,其特征在于:
所述步骤2生成局部编辑区域的语义遮罩M具体包括以下步骤:
步骤2.1、原始图像通过编码器转换成原始图像潜在特征图F潜在;
步骤2.2、计算机生成随机高斯噪声;
步骤2.3、U‑net预训练模型利用步骤2.1的原始图像潜在特征图F潜在、步骤1中得到的查询文本嵌入向量Q嵌入及步骤2.2的随机高斯噪声进行噪声预测,并将预测出的噪声和原始图像潜在特征图F潜在进行叠加,得到查询文本潜在特征图F潜在Q,同时U‑net预训练模型利用步骤2.1的原始图像潜在特征图F潜在、步骤1中得到的参考文本嵌入向量R嵌入及步骤2.2的随机高斯噪声进行噪声预测,并将预测出的噪声和原始图像潜在特征图F潜在进行叠加,得到参考文本潜在特征图F潜在R;
步骤2.4、计算查询文本潜在特征图F潜在Q与参考文本潜在特征图F潜在R的差值;
步骤2.5、重复步骤2.1‑步骤2.4的差分过程20次,求平均值得出初始的遮罩,对初始的遮罩进行归一化,二值化处理,最终得到语义遮罩M。
4.根据权利要求1所述一种基于文本条件扩散模型的语义图像编辑方法,其特征在于:
所述步骤3具体包括如下步骤:
步骤3.1、原始图像通过编码器转换成原始图像潜在特征图F潜在,所述原始图像潜在特征图F潜在经过前向加噪过程生成加噪潜在特征图FN;
步骤3.2、U‑net预训练模型利用所述加噪潜在特征图FN、所述参考文本嵌入向量R嵌入进行噪声预测,加噪潜在特征图FN减去预测出的噪声得出参考文本去噪潜在特征图Fr1,同时U‑net预训练模型利用加噪潜在特征图FN、查询文本嵌入向量Q嵌入进行噪声预测,加噪潜在特征图FN减去预测出的噪声得出查询文本去噪潜在特征图Fq1;
步骤3.3、使用步骤1生成的语义遮罩M进行去噪:将语义遮罩M进行张量转换进入潜在空间,与所述参考文本去噪潜在特征图Fr1和查询文本去噪潜在特征图Fq1生成第一代潜在特征图FN‑1,公式为:FG=FqT×M+FrT×(1‑M)
其中,T的值为1到N‑1,G的值为N‑1到1。