利索能及
我要发布
收藏
专利号: 2018104800625
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于Q学习和LSTM神经网络的快速路由决策算法,其特征是,包括如下步骤:

1)建立模型并进行训练:

在不同的网络状态下,利用启发式算法根据不同的QoS请求计算出满足约束条件的最优或者较优路径;

将该启发式算法的输入和其相应的输出联合构成机器学习模型的训练集,其中启发式算法输入的当前网络状态作为训练样本的特征,算法输出的最优路径相应的Q值作为训练样本的标签;

将其网络状态和业务需求作为输入,最优路由作为输出,存入网络路由知识库;

2)动态路由决策:

当控制器收到新的QoS请求时,相应的机器学习模型将会把当前的网络状态和请求中的约束条件一同输入LSTM神经网络中,并根据相应的决策流程得到该状态下不同动作a即转发路由所对应的Q值;选择Q值最大所对应的路由即最佳路由进行转发。

2.根据权利要求1所述的一种基于Q学习和LSTM神经网络的快速路由决策算法,其特征是,所述步骤2)的具体步骤为:

21)初始化网络路由知识库,随机初始化LSTM神经网络参数;

22)将当前网络状态和业务需求作为状态s,输入LSTM神经网络,得到该状态下,不同动作a的Q值,选取Q值最大的动作a,此时的预估Q值为Qest(s,a);

23)神经网络将a反馈给网络状态,得到在经过a以后的网络状态S′;

24)网络状态将S′转发给知识库,知识库通过启发式算法,得到S′状态下的最优动作a′,并通过神经网络得到该动作相应的Q值即最大Q值maxQ(s′),最大Q值与来自网络状态所反馈的现实奖励R共同构成了目标Q值Qtarg(s,a)=R+γ×maxQ(s′),γ为折扣因子;

25)得到Qtarg(s,a)后,通过Q学习的算法更新公式Q(s,a)new=Qest(s,a)+α×[Qtarg(s,a)-Qest(s,a)]得到最新的Q值,其中α是学习效率;

26)得到最新的Q值之后,拟利用新旧Q值之间的平方误差,并利用反向传播法对神经网络进行训练;

27)重复上述步骤至新旧Q值之间的平方误差小于预定阈值之后,神经网络也达到收敛,此时,将网络状态构成的向量作为输入,获得对应不同动作相应的Q值。

3.根据权利要求1所述的一种基于Q学习和LSTM神经网络的快速路由决策算法,其特征是,所述步骤1)的具体内容为:在满足路径延迟参数小于或者等于某个确定阈值Dmax的条件下,计算并寻找能够使路径代价参数最小化的有效路径,目标函数为:p*=argmin{fC(p)|p∈Psd,fD(p)≤Dmax},其中,Psd表示从源节点s出发到目的节点d所有有效路径的集合,对于该集合中的任意一条路径P∈Psd,其流量代价度量参数为fC(P),fD(P)定义为网络有效路径的延迟;

Bt=(s,d,b)表征一个带有服务质量要求的网络连接请求QoS,即有应用数据流需要从源节点s发往目的节点d,且其对传输的链路对网络带宽有一个最低需求b,可以将三元组Bt=(s,d,b)视为输入;

在获取最优路由之后,便将其网络状态和业务需求作为输入,最优路由作为输出,存入网络路由知识库。