1.一种基于模型水印的深度学习模型中毒防御方法,其特征在于,所述方法包括如下步骤:收集图片数据集并分类,针对每一类图片数据集制作一种相对应的水印图片;
将图片数据集中的原图片域A输入到水印嵌入器中,水印嵌入器使用UNet网络,利用水+印嵌入器将原图片域A与水印B组合,输出带有水印B的新图片域A ,并利用判别器D判别水+ +印嵌入器的输出是否为A;利用A和A对水印嵌入器进行训练;
+
采用VGG网络作为分类模型,将A输入到分类模型中将图片进行分类,并把分类模型的+第三层的特征图保存为特征区域T ,将A输入到分类模型中,并把分类模型的第三层的特征图保存为特征区域T;
+
使用UNet作为水印提取器,利用特征区域T和T训练水印提取器,利用水印提取器提取T+ +和T的水印,且特征区域T提取的水印为空白,而从特征区域T提取的水印为嵌入的水印;
根据分类模型对图片进行的分类结果以及水印提取器中水印的提取结果进行加权后预测结果,预测结果表示为:X=λ6f1(x,M)+λ7f2(σx,σ)
其中,λ6为图片分类结果的权值,λ7为水印提取器提取的水印的权值,f1函数代表输入图片x通过分类模型M后获得的分类结果,f2函数代表输入图片x通过分类模型M获得制定层的特征图后水印提取器从这个特征图提取到的水印σx与原始水印σ的相似度得分。
2.根据权利要求1所述的基于模型水印的深度学习模型中毒防御方法,其特征在于,训练水印嵌入器I的嵌入损失函数表示为:L嵌入=λ1*l基础+λ2*l对抗
+ +
其中,N表示图像像素值总数,a表示为原图片域A中的图像,a表示为新图片域A中的图像, 表示A域中图像在判别器D中的输出, 表示1减去A+
域中图像在判别器D中的输出,λ1表示l基础的超参,λ2表示l对抗的超参。
3.根据权利要求1所述的基于模型水印的深度学习模型中毒防御方法,其特征在于,训练分类模型的分类损失函数表示为:其中,m表示样本数量,n表示标签数量,i表示第i个样本,j表示第j个标签,xij表示第i个样本预测为第j个标签,p(xij)表示正确预测概率,q(xij)表示第i个样本预测为第j个标签的概率。
4.根据权利要求1所述的基于模型水印的深度学习模型中毒防御方法,其特征在于,训练水印提取器的提取损失函数表示为:L提取=λ3*l水印+λ4*l干净+λ5*l一致性其中,l水印为含水印图像的提取损失函数,l干净为空白图像的提取损失函数,l一致性为不同含水印图像中提取出的水印图像的一致性损失函数,N表示图像像素值总数,E为水印提取+ +器,t 、 为特征区域T 中的图像,t为特征区域T中的图像,σ0为空白图像,σ为原始水印,λ3表示水印图像提取损失函数的超参,λ4表示空白图像提取损失函数的超参,λ5表示水印一致性损失函数的超参。