利索能及
我要发布
收藏
专利号: 2024118889131
申请人: 重庆邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-06-12
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种应用于大规模网络仿真系统的算力调度方法,其特征在于,包括:S1:获取所有算力节点的资源占用状态信息集合,作为原始集合,对原始集合进行归一化处理得到标准样本集;

S2:构建所有算力节点的任务队列,并对任务队列进行预处理,为后续调度决策提供合理的输入数据;

构建所有算力节点的任务队列,并对任务队列进行预处理,包括:构建任务队列集合G(T,L,ω),并对任务队列进行表示;

先将算力节点的任务使用集合T进行表述,T={T1,T1,...,TN},其中Ti表示第i个任务,把任务Ti的算力资源消耗量记为Li;

使用二维矩阵Ei来表示一个N*N的矩阵,其中E(i,j)=1表示Ti和Tj之间存在依赖约束,任务Tj只能在Ti完成之后才可以开始执行,如果E(i,j)=0,则表示双方不存在依赖关系;

S3:根据算力节点标准样本集合设定深度强化学习参数并初始化神经网络的权重;

S4:将算力节点作为智能体与环境进行交互产生经验样本,根据经验样本采用深度强化学习方法训练神经网络,得到一个初步的任务调度策略;

将算力节点作为智能体与环境进行交互产生经验样本,根据经验样本采用深度强化学习方法训练神经网络,得到一个初步的任务调度策略,包括:将算力节点的初始状态输入到基于神经网络构建的深度强化学习模型中,深度强化学习模型在每次迭代中根据当前策略随机选择动作a;

执行动作a,观察下一个状态S′和奖励R;

将状态S、动作a、奖励R、下一个状态S′存储到经验回放池中;

从经验回放池中随机抽取一批样本,用于更新策略和值网络的参数;

计算目标Q值,其中Q指的是一个动作长期汇报,从当前状态S开始,在策略下采取特定的a表示的预测价值;

更新值网络,计算值网络的损失函数,使用均方差损失函数来最小化目标Q值和a值的差异,并更新值网络的参数,其中损失函数为:其中,Loss表示评论家网络的损失函数,B表示经验回访池的大小,Rt表示在时间步骤tμ′获得的奖励,γ表示衰减因子,大小在[0,1]之间;Q′(St+1,a′|θ )表示Q′在下一个状态St+μ′

1和目标动作a′下的值,目标动作a′是由目标策略网络θ 生成的,即通过μ′网络来计算下一Q′状态St+1的最优动作,Q′表示评论家网络的目标函数;Q(St,at|θ )表示当前评论家网络QQ′在当前状态下St和动作at下的Q值,θ 为Q′网络的权重;

更新策略网络,计算策略网络的损失函数,使用策略梯度来最大化当前状态的Q值,并更新策略网络的参数,其中策略函数为:μ Q

其中, 表示演员网络的更新策略,θ 表示演员网络权重,θ表示评论家网络权重,表示演员网络的梯度,表示对Q函数在当前状态st和通过策μ μ

略网络a=μ(st|θ)生成的动作a上求导; 表示演员网络关于其参数θ 的梯度,即策略网络对状态st输出动作的变化;

在DDPG算法中,策略网络和值网络都是基于深度神经网络的,使用梯度下降方法进行参数更新,其中策略网络和值网络的更新函数为:Q′ Q Q′

θ ←τθ+(1‑τ)θ ,

μ′ μ μ′

θ ←τθ+(1‑τ)θ

Q′ μ′

其中,θ 表示评论家网络的目标函数;θ 表示演员网络的目标函数;τ表示目标网络更Q μ新的软更新系数;θ表示评论家网络的权重,θ为演员网络的权重;

Q

循环上述步骤,直到达到最优的θ(s,a|θ)值,输出对应的调度策略,作为一个初步的调度策略;

S5:使用优化的蚁群算法对初步的任务调度进行进一步的优化,来获得最终的任务调度策略;

使用优化的蚁群算法对初步的任务调度进行进一步的优化,来获得最终的任务调度策略,包括:步骤1.获取算力节点状态信息;

步骤2.计算收益矩阵;

步骤3.为算力节点设置初始信息素;

步骤4.初始化蚁群,随机分布在算力节点中;

步骤5.计算蚂蚁k的转移概率,选择下一跳节点;

步骤6.在蚂蚁完成当前搜索后更新本地信息素;

步骤7.在所有蚂蚁完成对这一轮的搜索后,更新全局信息素;

步骤8.当达到迭代次数时,输出调度策略;

S6:采用最终的任务调度策略来对仿真任务进行调度。

2.根据权利要求1所述的一种应用于大规模网络仿真系统的算力调度方法,其特征在于,获取所有算力节点的资源占用状态信息集合,作为原始集合,对原始集合进行归一化处理得到标准样本集,包括:所述资源占用状态信息包括:算力节点的CPU、内存、网络带宽以及节点之间的链路时延;

根据收集到的算力节点的资源占用数据,进行归一化处理,将所有数据缩放至[0,1]的范围,形成标准样本集。

3.根据权利要求1所述的一种应用于大规模网络仿真系统的算力调度方法,其特征在于,根据算力节点标准样本集合设定深度强化学习参数,包括:根据马尔可夫决策过程设置状态空间、动作空间和奖励函数。

4.根据权利要求1所述的一种应用于大规模网络仿真系统的算力调度方法,其特征在于,初始化神经网络,包括:采用DDPG算法初始化目标策略网络和目标值网络,以及本地策略网络和本地值网络的参数;初始化经验回放缓冲区,设置批量大小、学习率、奖励折扣因子、软更新参数。

5.一种大规模网络仿真系统,用于实现如权利要求1‑4任一项所述的一种应用于大规模网络仿真系统的算力调度方法,其特征在于,包括:仿真节点、算力节点、业务中心、监控中心以及训练模块;

所述仿真节点为网络仿真系统中用于模拟真实设备的虚拟化节点,主要实现方式通过docker容器,或者基于Linux命名空间的轻量化容器,主要用作执行仿真任务的载体;

所述算力节点主要为搭建仿真节点的仿真服务器,以及提供计算帮助的计算服务,使用的真实的CPU和内存等资源,因为仿真节点在执行仿真任务的时候,依旧使用的真实设备的物理资源,为了更好的实现算力调度,将其统一抽象为算力节点,即使用算力资源来完成仿真任务的节点;

所述业务中心主要是网络仿真系统给仿真节点下发仿真任务的模块,主要负责和外界交互,实现外界的仿真任务需求;

所述监控中心主要是网络仿真系统用来监控算力节点的资源消耗情况和任务负载情况的模块,为使用算力调度模型来进行算力调度而进行参数收集;

所述训练模块用于根据算力节点的状态信息设定深度强化学习参数并根据算力节点与环境交互产生的经验样本训练神经网络;

所述算力节点根据训练好的神经网络确定任务调度的目标,并根据任务调度来实现将算力节点的算力进行转移,实现资源最大化利用。