利索能及
我要发布
收藏
专利号: 2023108431279
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于强化学习的网络流量灰色预测方法,其特征在于,包括如下步骤:S1、针对网络流量数据集进行截取,获得待预测流量序列样本;

S2、构建并训练基于GM(1,1)的强化学习模型,具体为:S201、采用滑动窗口一步预测的方法对待预测样本序列进行GM(1,1)预测,将GM(1,1)预测作为强化学习的环境;具体包括以下子步骤:S201‑1、基于滑动窗口内初始样本流量X1[w]={x1(1),x1(2),...,x1(w)},对X1[w]实施GM(1,1)流量预测,其中w为滑动窗口的长度;

(0)

采用缓冲算子d对流量序列X1[w]进行预处理,得到初始化流量序列X ,即其中,d为缓冲算子,c为常数,用于调节d的缓冲作用强度;

(0) (1)

S201‑2、计算X 的一次累加生成序列X ,如下式:(1) (1) (1) (1)

X =(x (1),x (2),…,x (w)),其中,

(1) (1)

S201‑3、根据步骤201‑2计算X 的紧邻均值生成序列Z ,如下式:(1) (1) (1) (1)

Z =(z (2),z (3),…,z (w));

其中,

(0) (1)

S201‑4、根据步骤S201‑2以及步骤S201‑3建构X 和Z 的灰色微分方程,如下式:(0) (1)

x (k)‑az (k)=b,

其中,‑a为灰色发展系数,b为灰色作用量;

S201‑5、根据步骤S201‑4构建灰色微分方程的参数向量 并利用最小二乘法对其进行求解:其中,

S201‑6,根据步骤S201‑5,求解得到的a和b,计算灰色微分方程的时间响应函数如下式:S201‑7、根据步骤S201‑6,求解得到的 计算得到预测结果 如下式:

S202、基于滑动窗口内的样本流量以及当前滑动窗口下的流量预测误差定义强化学习的环境状态;

S203、根据GM(1,1)预测结果的三种情况定义强化学习的动作空间,所述三种情况为预测值大于真实值,预测值近似等于真实值,预测值小于真实值;

S204、将流量预测精度作为强化学习的奖励函数;

S205、采用ε‑greedy策略确定奖励函数最大化的动作;

S206、基于每一个时间步长,智能体获得当前环境状态,并根据策略函数生成动作,环境在执行动作后,将当前环境状态更新,同时将动作的奖励值反馈给智能体,智能体根据更新的环境状态和奖励值生成下一个动作,迭代执行直到达到预设迭代次数,获得基于GM(1,

1)的强化学习模型;

S3、将待预测流量序列输入至基于GM(1,1)的强化学习模型,获得预测网络流量预测结果。

2.根据权利要求1所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S205中,ε‑greedy策略的ε=0.9,学习率α=0.01。

3.根据权利要求1所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S1中,截取X中预设数量m为200。

4.根据权利要求1所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S1具体为:对流量数据集X={x(1),x(2),…,x(n)}进行截取,截取X中预设数量m的样本进行网络流量预测,获得待预测样本序列X1={x1(1),x1(2),…,x1(m)}。

5.根据权利要求1所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S202具体为:基于滑动窗口内的样本流量X1[w]以及当前滑动窗口下的流量预测误差:定义强化学习的状态空间St,即

6.根据权利要求5所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S203具体为:定义动作空间At={‑1,0,1},

当预测值大于真实值时: At=‑1对应的动作为:c=c‑s;

当预测值与真实值近似相等: At=0对应的动作为c=c;

当预测值小于真实值: At=1对应的动作为c=c+s,其中s为预设值,0<s<c。

7.根据权利要求6所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S204具体为:将流量预测精度作为强化学习的奖励函数,即用于保证强化学习的训练目标R(St,At)的奖励值Rt最大化。

8.根据权利要求7所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S205具体为:采用ε‑greedy策略确定奖励函数R(St,At)最大化的动作At,ε‑greedy策略的决策方式为:其中At表示针对当前状态St下做出的动作调整策略;当m≤ε时,选择预期价值最大的动作;当m>ε时,随机选择一个参数调整动作,α是学习率。

9.根据权利要求8所述的一种基于强化学习的网络流量灰色预测方法,其特征在于,步骤S206中,在训练基于GM(1,1)的强化学习模型时,将四元组数据(St,At,Rt,St+1)作为经验保存在Q表中,智能体通过不断迭代更新的动作价值函数Q公式如下:Q(St,At)←Q(St,At)+α·[Rt+γ·maxAQ(St+1,A)‑Q(St,At)],其中,Rt是在给定状态St下执行动作At的奖励值;α是学习率,决定新获得的信息相对于先前可获得信息的权重;γ是奖励递减值,决定了未来奖励的重要性;Q(St,At)是在网络状态St的情况下智能体做出动作At的Q值的估计值;maxAQ(st+1,A)表示未更新时到达下一状态St+1获得最大Q值的估计值,Rt+γ·maxAQ(St+1,A)‑Q(St,At)表示TD误差,其含义为计算的目标网络Q值与主网络Q值之间的差值。