1.一种自适应调节知识蒸馏温度的模型压缩方法,其特征在于,包括以下步骤:第一步,采集图像样本,对图像样本中的异常数据和缺失数据进行数据清洗,包括直接丢弃异常数据和采用最邻近插值或双线性插值法恢复缺失数据;
第二步,采用Mosaic‑4数据增强方法随机对图像样本进行翻转、缩放、裁剪操作,并任意选取4张变换后的图像进行拼接,进而增强图像样本;
第三步,建立最小化自适应蒸馏损失函数,完成教师模型的知识到学生模型的传递,实现知识蒸馏;采用训练集对学生模型进行训练,确定最优化的总损失函数,实现模型压缩;
所述第三步包括:最小化自适应蒸馏损失函数LAD,使L1和L2之间的散度最小,完成教师模型的知识到学生模型的传递,实现知识蒸馏;其中教师模型的软标签L1,学生模型的软标签L2;
采用训练集对学生模型进行训练,并选择激活函数Softmax,确定学生模型的硬标签L3;
最小化学生模型的损失函数LS,使L3与真实标签之间的散度最小;
根据LAD和LS,确定最优化的总损失函数Ltotal,实现模型压缩;
进一步包括:
1)在知识蒸馏过程中,利用具有蒸馏温度TT的激活函数Softmax对教师模型第i类第j个样本的输出结果TPij进行激活操作,确定Tij;
2)利用具有蒸馏温度TS的激活函数Softmax对学生模型第i类第j个样本的输出结果SPij进行激活操作,确定Sij;
3)自适应蒸馏损失函数LAD表示为:
4)学生模型的损失函数LS表示为:
其中,yij表示第i类第j个样本的真实标签值;
5)总损失函数Ltotal表示为:
Ltotal=λLAD+(1‑λ)LS
其中,λ表示权重因子;
6)初始化教师模型的蒸馏温度TT,根据stdT/TT=stdS/TS关系式和总损失函数Ltotal最优化原则,自适应调节学生模型的蒸馏温度TS;
7)当Ltotal小于预设的损失因子α时,确定学生模型的最优蒸馏温度TS=t,进而完成教师模型的知识向学生模型的传递,最终实现自适应调节知识蒸馏温度的模型压缩。
2.如权利要求1所述的自适应调节知识蒸馏温度的模型压缩方法,其特征在于,所述第二步之后需要标注所有图像样本,并按7:3划分为训练集和测试集。
3.如权利要求2所述的自适应调节知识蒸馏温度的模型压缩方法,其特征在于,训练集和测试集划分后需要选择ResNet101模型为教师模型,并采用训练集对其进行训练,初始化具有蒸馏温度TT的激活函数Softmax,确定教师模型的软标签L1;
选择ResNet18模型为学生模型,并采用训练集对其进行训练,自适应调节具有蒸馏温度TS的激活函数Softmax,确定学生模型的软标签L2。
4.如权利要求3所述的自适应调节知识蒸馏温度的模型压缩方法,其特征在于,进一步包括:(1)采用锐度ST表示教师模型第i类输出结果的离散程度;
其中,TPi表示教师模型第i类的输出结果;
(2)采用锐度SS表示学生模型第i类输出结果的离散程度;
其中,SPi表示学生模型第i类的输出结果;
(3)采用GT‑S衡量教师模型和学生模型输出结果之间的差距,其泰勒展开式为:其中,k表示第i类的图像样本数量;
其中, 是教师模型输出结果的方差,用 表示; 是学生模型输出结果的方差,用 表示;
(5)GT‑S可进一步表示为:
(6)令GT‑S=0,确定教师模型蒸馏温度TT和学生模型蒸馏温度TS之间的关系,即stdT/TT=stdS/TS。
5.一种计算机设备,其特征在于,所述计算机设备包括存储器和处理器,所述存储器存储有计算机程序,所述计算机程序被所述处理器执行时,使得所述处理器执行权利要求1~
4任意一项所述自适应调节知识蒸馏温度的模型压缩方法。
6.一种计算机可读存储介质,存储有计算机程序,所述计算机程序被处理器执行时,使得所述处理器执行权利要求1~4任意一项所述自适应调节知识蒸馏温度的模型压缩方法。
7.一种信息数据处理终端,其特征在于,所述信息数据处理终端用于实现权利要求1~
4任意一项所述自适应调节知识蒸馏温度的模型压缩方法。
8.一种实施权利要求1~4任意一项所述自适应调节知识蒸馏温度的模型压缩方法的自适应调节知识蒸馏温度的模型压缩系统,其特征在于,所述自适应调节知识蒸馏温度的模型压缩系统包括:数据清洗模块,用于采集图像样本,对图像样本中的异常数据和缺失数据进行数据清洗,包括直接丢弃异常数据和采用最邻近插值或双线性插值法恢复缺失数据;
样本处理模块,用于采用Mosaic‑4数据增强方法随机对图像样本进行翻转、缩放、裁剪操作,并任意选取4张变换后的图像进行拼接,进而增强图像样本;
模型压缩模块,用于建立最小化自适应蒸馏损失函数,完成教师模型的知识到学生模型的传递,实现知识蒸馏;采用训练集对学生模型进行训练,确定最优化的总损失函数,实现模型压缩。