1.一种基于主任务神经元的深度学习模型祛毒加固方法,其特征在于,所述方法包括以下步骤:S1,选取图像数据集,选择深度学习网络,利用中毒攻击方法对图像数据集中的部分干净样本打上触发器生成中毒样本,基于中毒样本训练得到中毒模型;
S2,将步骤S1选取的图像数据集输入至训练得到的中毒模型中,计算图像数据集中每一类图片对应的神经元的激活值,对所有神经元的激活值进行排序,自定义排序阈值n,取前n个的神经元作为高激活值的神经元;对于每一类中对应的所有图片对应的高激活值的神经元取重叠部分,作为该类的主任务神经元;统计出图像数据集中每一类的主任务神经元。
S3,将各个类主任务神经元的差异部分划分为K组,依次取K组中的一组,将该组内的神经元对应的权重置为0,即在中毒模型中删除该组内的神经元,将该组对应的图像数据集中图片类输入至中毒模型中,在删除该组内的神经元前后,分别计算中毒模型的性能;依据中毒模型前后的预测准确率和置信度,判定该组神经元是否为待删除的神经元;重复上述步骤,遍历K个组,得到待删除的神经元集合;
S4,在中毒模型中删除步骤S3得到的待删除的神经元集合,并对中毒模型进行重训练得到祛毒加固的深度学习模型,用于图像分类任务。
2.根据权利要求1所述的基于主任务神经元的深度学习模型祛毒加固方法,其特征在于,所述图像数据集选自MNIST、CIFAR10、ImageNet、GTSRB或CASIA图像数据集。
3.根据权利要求1所述的基于主任务神经元的深度学习模型祛毒加固方法,其特征在于,所述中毒攻击方法选自BadNets、PoisonFrog、Trojannn、Feature Collision Attack。
4.根据权利要求1所述的基于主任务神经元的深度学习模型祛毒加固方法,其特征在于,所述深度学习网络选自LeNet、AlexNet、VGG11、ResNet34。
5.根据权利要求1所述的基于神经元加固的深度学习模型中毒防御方法,其特征在于,针对在MNIST数据集上BadNets中毒,对MNIST数据集中标签是“0”的10%的干净样本打上触发器,打了触发器的样本即为中毒样本,再把标签改为“1”,添加到训练集中,然后开始深度学习网络,训练得到中毒模型。
6.根据权利要求1所述的基于主任务神经元的深度学习模型祛毒加固方法,其特征在于,所述步骤S3具体包括以下子步骤:S301,将步骤S2中得到的各个类主任务神经元的差异部分分为K组,K为自定义设置的组数;
S302,依次取K组中的一组,将该组内的神经元对应的权重置为0,即在中毒模型中删除该组内的神经元,将该组对应的图像数据集中图片类输入至中毒模型中,在删除该组内的神经元前后,对中毒模型的性能进行计算,公式如下:TC(X)=ACCaft‑ACCpre
其中,X表示该组对应的图像数据集中图片类对应的测试图片样本;n表示X中所含的样本数量;TC(X)表示中毒模型删除神经元前后,中毒模型预测样本群X的准确度的变化;
ACCpre表示删除神经元前中毒模型的准确度,ACCaft表示删除神经元后中毒模型的准确度;x表示分组内样本的标签,即图像数据集中对应的图片类;Aft(x)表示中毒模型在删除神经元后,模型对样本预测的属于类别x的置信度;Pre(x)表示中毒模型在删除神经元前,中毒模型对样本预测的属于类别x的置信度;
删除此组神经元前后,若中毒模型的性能下降小于5%,则查看中毒模型对样本预测的属于类别x的置信度平均变化;若置信度平均下降不超过25%,则将此组神经元加入待删除的神经元集合中;否则,则取下一组神经元做以上操作;重复上述步骤,遍历K个组,得到待删除的神经元集合。
7.根据权利要求1所述的基于主任务神经元的深度学习模型祛毒加固方法,其特征在于,所述步骤S4具体为:使用基于交叉熵损失函数对中毒模型进行重训练;计算损失函数的梯度并反向传播,根据梯度更新中毒模型内的参数;直到交叉熵损失函数趋于收敛,最终得到干净的祛毒加固的深度学习模型
8.根据权利要求7所述的基于主任务神经元的深度学习模型祛毒加固方法,其特征在于,交叉熵损失函数的公式如下:其中,M是图像类别的数量;yic为符号函数,如果样本i的真实类别等于c取1,否则取0;
Pic表示样本i属于类别c的预测概率,N表示样本数量。
9.一种电子设备,包括存储器和处理器,其特征在于,所述存储器与所述处理器耦接;
其中,所述存储器用于存储程序数据,所述处理器用于执行所述程序数据以实现上述权利要求1‑8任一项所述的基于主任务神经元的深度学习模型祛毒加固方法。
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述程序被处理器执行时实现如权利要求1‑8中任一所述的基于主任务神经元的深度学习模型祛毒加固方法。