利索能及
我要发布
收藏
专利号: 2022104149359
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于改进知识蒸馏ESN的边缘端时间序列预测方法,其特征在于:所述方法包括如下步骤:步骤1:构造基于改进知识蒸馏ESN的时间序列预测模型,包括教师网络、助教网络与学生网络;

所述步骤1中,构造基于改进知识蒸馏ESN的时间序列预测模型具体步骤如下:步骤1‑1:以LSTM作为教师网络,设置其参数;

步骤1‑2:以ESN作为学生网络,设置其参数;

步骤1‑3:以双环ESN作为助教网络,设置其参数;

步骤1‑4:使用上述步骤中的教师网络、学生网络与助教网络,构造基于改进知识蒸馏ESN的时间序列预测模型;其中,教师网络输入训练集,输出蒸馏知识,助教网络输入训练集与蒸馏知识,输出助教知识;学生网络输入训练集、蒸馏知识与助教知识,完成储备池结构的训练;设置助教蒸馏学习率α、β,学生蒸馏学习率μ、v、o,迭代剪枝次数it;

步骤1‑5:确定模型的输入和输出;模型的输入向量为时间序列历史数据u(t)=(tr(t‑P+1),tr(t‑P+2),…,tr(t)),P为滑动窗口大小,tr(t)为t时刻的时间序列数据;输出向量为预测数据y(t)=tr(t+1);

步骤2:在边缘端采集时间序列数据并在服务器端使用采集到的时间序列数据训练步骤1构造的基于改进知识蒸馏ESN的时间序列预测模型;共包括教师网络训练、助教网络训练与学生网络训练三部分;学生网络在助教网络的帮助下,学习教师网络的长期记忆能力,优化储备池结构,从而得到相应的储备池连接矩阵W;

所述步骤2中,训练的具体步骤如下:

步骤2‑1:采集时间序列数据并构造训练集;

在规定的采样时间内,在边缘端采集时间序列数据集合Tr(p)={tr(1),tr(2),…,tr(t),…,tr(p)}并传输到服务器端,其中tr(t)表示t时刻的时间序列数据,p为采集的数据总数;

在服务器端,根据Tr(p)来构造训练样本集:

U={(utrain(t),ytrain(t+1)),P≤t≤m‑1}其中,utrain(t)=(tr(t‑P+1),tr(t‑P+2),…,tr(t)),ytrain(t+1)=tr(t+1),P是滑动窗口大小;

将训练集U均分为三部分,包括教师训练集U1、助教训练集U2、学生训练集U3;

步骤2‑2:在服务器端,根据U1,训练教师网络并输出蒸馏知识T1;

步骤2‑3:在服务器端,根据U2,训练助教网络并输出助教知识A与新的教师蒸馏知识T2;

步骤2‑4:在服务器端,根据U3,训练学生网络并输出学习后的储备池连接矩阵W;

步骤2‑5:在服务器端,修剪学生网络储备池中的神经元;

根据U3,对学生网络经典ESN进行冗余知识的修剪,降低冗余学习的影响;尝试修剪储备池中的神经元i;以经典ESN训练的目标函数为评价指标;其目标函数如下所示:其中,y(t+1)为真实值, 为经典ESN的预测值,m为训练集大小;

若修剪神经元i后目标函数值下降,即网络预测性能提升,则修剪神经元i,剔除其余神经元与神经元i的连接;具体的,令wi,j=wj,i=0;其中,wi,j表示神经元i到神经元j的连接权值,0≤j≤N‑1,N为储备池中的神经元个数;若目标函数值上升,则不修剪;

步骤2‑6:重复步骤2‑5,直至达到预设的剪枝迭代次数或训练目标函数值不变化,得到修剪后的储备池连接矩阵W;

步骤2‑7:在服务器端,训练具备新储备池结构的学生网络;

out

根据U3,优化后的学生网络按岭回归训练,得到输出连接矩阵W ;

步骤3:在边缘端使用步骤2中训练好的基于改进知识蒸馏ESN的时间序列预测模型,基于采集的待预测时间序列数据,预测未来时刻时间序列;

所述步骤3中,将训练完成的基于改进知识蒸馏ESN的时间序列预测模型部署于边缘端;在边缘端,采集获得待预测的时间序列数据upred(t′)={tr(t′‑P+1),tr(t′‑P+2),…,tr(t′)};在边缘端使用训练完成的基于改进知识蒸馏ESN的时间序列预测模型预测未来时间序列数据,输出下一时刻的时间序列数据ypred(t′+1);具体步骤如下:步骤3‑1:学生网络输入upred(t′),更新储备池状态向量xpred(t′):in in

xpred(t′)=f (W upred(t′)+Wxpred(t′‑1));

in in

其中,f 为储备池内部激励函数,W 为输入连接矩阵,W为步骤2中训练得到的储备池连接矩阵,xpred(t′‑1)为上一时刻的储备池状态向量,upred(t′)与xpred(t′)分别表示本时刻的输入向量与储备池状态向量;

步骤3‑2:根据储备池状态向量,学生网络输出下一时刻的时间序列数据ypred(t′+1):out out

ypred(t′+1)=f (W (upred(t′),xpred(t′)))out out

其中,f 为输出激励函数,W 为步骤2中训练得到的输出连接矩阵。

2.根据权利要求1所述的基于改进知识蒸馏ESN的边缘端时间序列预测方法,其特征在于:步骤1‑1中,LSTM负责教授长期记忆能力,包括输入层、隐藏层、输出层,其中隐藏层采用双层结构;输入层和隐藏层、隐藏层与隐藏层间以及输出层和隐藏层之间全连接;设置LSTM的输入层和输出层神经元个数分别为K和L;设置第一层隐藏层神经元个数为M1,第二层隐藏层神经元个数为M2;使用线性整流函数relu(·)作为隐藏层神经元激励函数,使用线性函数liner(·)作为输出层神经元激励函数;设置学习率为

3.根据权利要求1所述的基于改进知识蒸馏ESN的边缘端时间序列预测方法,其特征在于:步骤1‑2中,ESN负责时间序列预测,包括输入层、储备池、输出层;输入层和隐藏层以及输出层和隐藏层之间全连接,储备池中的神经元稀疏连接;设置ESN的输入层和输出层神经in元个数分别为K和L;设置储备池中的神经元个数为N;构造大小为K×N的输入连接矩阵W ,内部权值随机初始化;构造大小为N×N的初始储备池连接矩阵W,内部权值随机初始化;使in用双曲正切函数tanh(·)作为储备池内部激励函数f ,使用恒等函数identity(·)作为输out出激励函数f ;设置学习率为

4.根据权利要求1所述的基于改进知识蒸馏ESN的边缘端时间序列预测方法,其特征在于:步骤1‑3中,双环ESN负责监督蒸馏学习方向,包括输入层、双环储备池、输出层;构造大in‑dlrs小为K×N的输入连接矩阵W ,内部权值随机初始化;构造大小为N×N的双环储备池连dlrs

接矩阵W ,内部权值初始化为零;设置双环储备池为环形反馈储备池,储备池中的神经元以环形连接,相邻两个神经元之间存在反馈连接;设置双环间隔d,间隔d个位置的神经元间dlrs存在反馈连接;设置非零元素绝对值r为反馈连接权值,即连接矩阵W 中有wi,i+1=r,wi+1,i=r,其中i=1,2,...N‑1,N为储备池中神经元个数,当i=N时,设置wi,1=r,w1,i=r;有wi,i+d=r,wi+d,i=r,其中 d为双环间隔;当时,设置wi,1=r,w1,i=r;使用双曲正切函数tanh(·)作为储备池内部in out

激励函数f ,使用恒等函数identity(·)作为输出激励函数f ;设置学习率为

5.根据权利要求1所述的基于改进知识蒸馏ESN的边缘端时间序列预测方法,其特征在于:步骤2‑2中,根据U1,教师网络LSTM按自适应矩估计梯度下降法训练,得到系数权值矩阵;LSTM训练的目标函数如下:其中,y(t+1)为真实值, 为LSTM的预测值,m为训练集大小;

对于训练好的教师网络LSTM,输入U2中的utrain(t),输出LSTM的蒸馏知识T1;

6.根据权利要求1所述的基于改进知识蒸馏ESN的边缘端时间序列预测方法,其特征在于:步骤2‑3中,根据U2,助教网络双环ESN按岭回归训练;双环ESN训练的目标函数如下:其中, 为双环ESN的预测值,m为训练集大小, 是训练过程中的目标预测值,通过真实值与蒸馏知识T1融合得到,计算公式如下:其中,α、β为助教蒸馏学习率,并且α+β=1;

对于训练好的助教网络双环ESN,输入U3中的utrain(t),输出双环ESN的助教知识A;对于训练好的教师网络LSTM,输入U3中的utrain(t),输出LSTM的蒸馏知识T2;

其中, 为助教网络双环ESN对输入utrain(t)的预测值,为教师网络LSTM对输入utrain(t)的预测值。

7.根据权利要求1所述的基于改进知识蒸馏ESN的边缘端时间序列预测方法,其特征在out于:步骤2‑4中,根据U3,ESN按岭回归训练,得到输出连接矩阵W ;训练的目标函数如下:其中,y(t+1)为真实值, 为经典ESN的预测值,m为训练集大小;

借助蒸馏知识T2与助教知识A,学生网络经典ESN的储备池进行长期记忆能力的学习;对于经典ESN,根据U3构建训练集 其中,为真实值ytrain(t+1)、教师网络LSTM预测值 助教网络双环ESN预测值 的加权平均和,计算公式如下:

其中,μ、v、o为学生蒸馏学习率,并且μ+v+o=1;

根据 计算新的储备池状态向量x(t),计算公式如下:arcout out

其中,f 为输出激励函数的反函数,W 为岭回归训练得到的输出连接矩阵;

根据新的储备池状态向量x(t),计算新的储备池连接矩阵W:arc in

W=[f (x(t))‑W utrain(t)]/x(t‑1)arc

其中,utrain(t)为t时刻输入向量,x(t‑1)为t‑1时刻储备池的状态向量,f 为储备池激励函数的反函数;

对W按下式进行放缩,以保持储备池的回声特性;

其中,sc为放缩系数,λmax(W)为W的最大特征值。