利索能及
我要发布
收藏
专利号: 2025105201607
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于反向遗忘的后门防御方法,其特征在于,包括以下步骤:利用原始干净样本集合训练预训练模型,并使用预训练模型从污染数据集中筛选出潜在干净样本集合,来合成新的干净样本集合,并使用新的干净样本集合对预训练模型进一步训练;

将污染数据集和所述新的干净样本集合输入样本检测模型中,并分别采用交叉熵损失和熵约束进行训练;

将污染数据集输入训练后的样本检测模型进行预测,来检测毒化样本;

所述合成新的干净样本集合的步骤包括:

利用原始干净样本集合 训练预训练模型 ;

在每一轮训练中,利用预训练模型对污染数据集 中每个样本计算其损失值,并筛选出潜在干净样本集合;

将筛选出的潜在干净样本集合与原始干净样本集合 合并,形成新的干净样本集合 ;

所述损失值 的计算式为:

其中, 为损失值,为分类任务中的单一类别, 为样本 在类别 上的真实标签, 为模型对输入 预测为类别 的概率值,为分类任务中的总类别数;

筛选出潜在干净样本集合的标准为:

其中, 为潜在干净样本集合,为预设阈值。

2.根据权利要求1所述的一种基于反向遗忘的后门防御方法,其特征在于,在训练所述样本检测模型的过程中,通过梯度下降法更新样本检测模型的参数,以最小化总损失函数,其中,样本检测模型的总损失函数为:其中, 为总损失函数, 为分类损失, 为熵正则化项, 是权衡系数,N为样本总数, 为变量 的信息熵,为变量 所有可能结果的数量, 为在输入的条件下出现结果为 的概率, 为样本 在类别 上的真实标签; 为指定类别。

3.根据权利要求1所述的一种基于反向遗忘的后门防御方法,其特征在于,检测毒化样本的步骤为:将污染数据集输入训练好的样本检测模型,通过样本检测模型的特征提取和预测机制,生成每个样本的预测熵值集合 ;

设定一个预定义的熵阈值 ,并根据熵阈值 对熵值集合 中的每个熵值 进行判断,熵值超出熵阈值 的样本为干净样本,否则为毒化样本。

4.一种基于反向遗忘的后门防御系统,其特征在于,包括:样本筛选模块:利用原始干净样本集合训练预训练模型,并使用预训练模型从污染数据集中筛选出潜在干净样本集合,来合成新的干净样本集合,并使用新的干净样本集合对预训练模型进一步训练;

模型训练模块:将污染数据集和所述新的干净样本集合输入样本检测模型中,并分别采用交叉熵损失和熵约束进行训练;

以及,样本检测模块:将污染数据集输入训练后的样本检测模型进行预测,来检测毒化样本;

所述合成新的干净样本集合的步骤包括:

利用原始干净样本集合 训练预训练模型 ;

在每一轮训练中,利用预训练模型对污染数据集 中每个样本计算其损失值,并筛选出潜在干净样本集合;

将筛选出的潜在干净样本集合与原始干净样本集合 合并,形成新的干净样本集合 ;

所述损失值 的计算式为:

其中, 为损失值,为分类任务中的单一类别, 为样本 在类别 上的真实标签, 为模型对输入 预测为类别 的概率值,为分类任务中的总类别数;

筛选出潜在干净样本集合的标准为:

其中, 为潜在干净样本集合,为预设阈值。

5.一种计算机存储介质,存储有可读程序,其特征在于,当程序运行时,能够执行权利要求1‑3任一项所述的一种基于反向遗忘的后门防御方法。

6.一种电子设备,其特征在于,包括:处理器、存储器、通信接口和通信总线,所述处理器、所述存储器和所述通信接口通过所述通信总线完成相互间的通信;

所述存储器用于存放至少一条可执行指令,所述可执行指令使所述处理器执行如权利要求1‑3中任一项所述的一种基于反向遗忘的后门防御方法对应的操作。

7.一种计算机程序产品,包括计算机指令,其特征在于,所述计算机指令指示计算设备执行如权利要求1‑3中任一所述的一种基于反向遗忘的后门防御方法对应的操作。