利索能及
我要发布
收藏
专利号: 2022112411752
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于神经元加固的深度学习模型中毒防御方法,其特征在于,包括以下步骤:

S1,准备图像数据集,选择深度学习网络,利用中毒攻击方法生成中毒样本并添加到训练集中,训练得到中毒模型;

S2,寻找需要加固的神经元,包括以下子步骤:

S2.1,将训练集中的干净样本作为测试样本,选取一类的某测试样本输入到中毒模型中,统计模型全连接层激活值的Top‑K神经元,同时记录全连接层上抽样得到的测试样本对应的Top‑K神经元中频率最高的K个神经元,作为此类的主要神经元,最终得到各类的主要神经元;

S2.2,在各类主要神经元中统计公共部分,构成神经元集合N;

S2.3,将神经元集合N中的各神经元按其在各类测试样本上Top‑K神经元中出现的次数之和进行排序,定义集合 在神经元集合N中从前向后依次选取神经元添加至集合M中,在每次添加后将集合M中的所有神经元权重降低至20%以下,使用模型的准确率下降程度作为加固神经元判别标准,如果准确率下降小于等于10%,则在神经元集合N中继续选取神经元进行添加操作,否则将集合M中最近添加的神经元去除后作为加固神经元集合;

S3,将不需要加固的神经元固定下来,之后进行加固神经元操作,具体为:计算图像分类深度模型损失函数的梯度并反向传播,依据梯度来微调加固神经元,最终得到干净的图像分类深度模型,用于图像分类任务。

2.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,所述图像数据集选自MNIST,CIFAR10,ImageNet,GTSRB,CASIA。

3.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,所述中毒攻击方法选自BadNets,PoisonFrog,Trojannn,Feature Collision Attack。

4.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,所述深度学习网络选自LeNet,AlexNet,VGG11,ResNet34。

5.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,针对在MNIST数据集上BadNets中毒,取标签是“0”的训练样本的10%在左上角打上直角型触发器,再把标签改为“1”添加到训练集中,然后开始训练模型,打了触发器的样本即为中毒样本。

6.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,在某类主要神经元的确定过程中,测试样本的抽样率不低于10%。

7.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,当目标模型带毒时,神经元集合N中会出现一些由于攻击导致的高激活神经元,使得此类神经元在各类测试样本的Top‑K神经元中出现频率较高,将此类神经元的权重降低至20%以下,并不会对模型的准确率造成大于等于10%的性能下降,以此为依据进行加固神经元筛选。

8.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,所述图像分类深度模型的损失函数采用如下交叉熵损失函数loss:其中,M是图像类别的数量;yic为符号函数,如果样本i的真实类别等于c取1,否则取0;

Pic表示样本i属于类别c的预测概率,N表示样本数量。

9.一种基于神经元加固的深度学习模型中毒防御装置,包括存储器和一个或多个处理器,所述存储器中存储有可执行代码,其特征在于,所述处理器执行所述可执行代码时,用于实现如权利要求1‑8中任一项所述的基于神经元加固的深度学习模型中毒防御方法。