1.一种基于强化学习的大数据动态分配与优化调度方法,其特征在于,包括如下步骤:S1、获取大数据处理系统各计算节点的负载情况、数据流量、存储空间和网络延迟参数,构建实时运行数据集;
S2、对实时运行数据集进行预处理,构建层次化强化学习模型,将各计算节点的资源状态作为状态输入,将数据分配和调度策略作为动作输出,系统性能指标作为奖励函数;
S3、初始化层次化强化学习模型,包括高层策略和低层策略;
S4、基于层次化强化学习模型生成最优数据分配和调度策略,高层策略根据全局状态确定子目标,低层策略根据子目标制定具体行动;
S5、实时调整各计算节点的数据分配和任务调度使系统负载均衡、资源利用率最大化;
S6、在大数据处理过程中,层次化强化学习模型持续监控系统状态并动态更新策略,在系统负载或环境发生变化时及时对资源分配和调度进行自适应调整;
S7、通过多轮迭代优化,层次化强化学习模型逐渐收敛至最优策略;
所述S3包括以下步骤:
S31、初始化层次化强化学习模型,包括高层策略与低层策略,高层策略负责全局任务规划、任务分配以及资源调度的战略性决策,低层策略负责执行具体的节点级任务调度与优化,高层策略与低层策略之间通过协同机制进行交互;
S32、定义高层策略的全局规划机制,高层策略依据全局状态St评估系统的资源状况和任务负载,生成全局任务规划目标和资源分配方案:其中,πH(aH|St)为高层策略,Gt为高层生成的全局任务规划目标, 为高层策略折扣因子,RH(St,Gt)为高层奖励函数;
S33、低层策略在高层策略生成的全局任务规划目标Gt的基础上,在具体节点上执行任务调度和资源优化,低层策略在节点级别执行任务的调度顺序并实时调整任务执行计划:其中,πL(aL|St,Gt)表示低层策略在全局状态St和全局任务规划目标Gt的指导下选择的具体执行动作aL, 为低层折扣因子,RL(St,aL)为低层策略的局部奖励函数;
S34、高层策略与低层策略通过协同优化机制共同实现全局规划与局部执行的衔接,高层策略负责决策全局任务的战略方向,低层策略根据此方向进行具体任务的执行,层次化强化学习模型的协同优化公式为:其中,ηH和ηL分别为高层策略与低层策略的参数,θH和θL分别为高层策略与低层策略的学习率, 和 分别表示高层策略与低层策略的近端策略优化损失函数;
S35、在每次任务执行后,高层策略和低层策略都会基于系统的反馈进行策略更新,高层策略更新全局策略,低层策略更新节点内的调度策略。
2.根据权利要求1所述的一种基于强化学习的大数据动态分配与优化调度方法,其特征在于,所述S1包括以下步骤:S11、实时采集大数据处理系统各计算节点的负载情况参数,所述负载情况参数包括CPU利用率Ucpu(t)和内存使用率Umem(t),其中,t为当前时间点,Ucpu(t)表示在时间点t时刻各计算节点的CPU负载占比,Umem(t)表示在时间点t时刻各计算节点的内存占用比例;
S12、获取各计算节点的数据流量参数Fdata(t),数据流量参数表示在时间点t时刻各节点单位时间内的数据传输速率,以字节/秒为单位进行测量,用于反映数据处理过程中的传输负载情况;
S13、记录各计算节点的存储空间参数Sspace(t),存储空间参数表示在时间点t时刻各节点的可用存储容量,单位为GB,用于监控各节点的存储使用状态;
S14、采集各计算节点的网络延迟参数Lnet(t),网络延迟参数表示时间点t时刻从数据源传输到目标节点的网络延迟,单位为毫秒,用于评估网络通信性能;
S15、将所述CPU利用率Ucpu(t)、内存使用率Umem(t)、数据流量参数Fdata(t)、存储空间参数Sspace(t)及网络延迟参数Lnet(t)进行整合,构建实时运行数据集D(t):D(t)={Ucpu(t),Umem(t),Fdata(t),Sspace(t),Lnet(t)}。
3.根据权利要求2所述的一种基于强化学习的大数据动态分配与优化调度方法,其特征在于,所述S2包括以下步骤:S21、对实时运行数据集D(t)进行数据标准化处理,将各个维度的参数进行归一化,得到标准化后的实时运行数据集D'(t);
S22、将标准化后的实时运行数据集D'(t)输入至层次化强化学习模型,构建系统状态空间S(t);
S23、定义动作空间A(t),动作空间代表系统进行动态分配和调度的决策,动作空间包括任务分配和调度策略:其中,π(A|S)为策略函数,表示在状态S下采取动作A的概率,R(t)为奖励函数,V(St+1)为下一时刻的价值函数,γ为折扣因子,ai为第i个节点的具体任务分配与调度动作;
S24、构建用于评价系统的分配与调度策略优劣的奖励函数R(t),奖励函数依据系统性能指标进行设计,包括资源利用率、负载均衡性和系统延迟,奖励函数的表达式为:R(t)=α1·Utotal(t)+α2·Bload(t)‑α3·Ltotal(t);
其中,Utotal(t)为系统整体的资源利用率,Bload(t)为系统负载的均衡程度,Ltotal(t)为系统的总网络延迟,α1、α2和α3为调节各指标的权重系数;
S25、利用所述奖励函数R(t)对系统进行评估,并采用近端策略优化算法进行迭代优化,通过高层智能体与低层智能体的协同,逐步优化全局任务分配与节点调度:其中,rt(θ)为策略比例,表示新的策略与旧策略的比率, 为优势函数,∈为控制更新幅度的系数S26、在每次执行任务分配和调度后,层次化强化学习模型根据新的状态S(t+1)和奖励R(t)结合历史状态进行策略更新,历史反馈为:i
其中,θt为当前策略参数,η1为学习率,λ 为历史反馈的衰减因子,k为历史状态的最大时间窗口。
4.根据权利要求1所述的一种基于强化学习的大数据动态分配与优化调度方法,其特征在于,所述S4包括以下步骤:S41、在大数据处理过程中,高层策略通过实时评估全局状态St结合当前任务负载和系统资源使用情况生成最优全局任务分配目标Gt,应对不同节点的负载波动;
S42、低层策略根据高层策略生成的最优全局任务分配目标Gt,结合当前局部状态Slocal(t)生成具体的任务调度和资源分配动作aL(t):其中,aL(t)表示低层策略生成的任务执行动作,RL(Slocal(t),aL(t))为局部奖励函数,为低层策略的折扣因子;
S43、随着任务执行过程中系统状态的变化,低层策略实时更新任务分配和调度策略,使每个计算节点资源利用率最大化并减少调度延迟;
S44、高层策略基于系统反馈调整最优全局任务分配目标Gt+1,并对全局任务的负载均衡和资源优化进行重新评估;
S45、通过高层策略与低层策略的协同工作,动态适应不同负载和状态变化,生成最优数据分配和调度策略。
5.根据权利要求1所述的一种基于强化学习的大数据动态分配与优化调度方法,其特征在于,所述S7包括以下步骤:S71、在初始阶段,层次化强化学习模型基于当前全局状态St和局部状态Slocal(t)生成初始策略π0,初始策略用于在每个节点上进行初始任务分配和调度;
S72、通过多轮任务执行,系统持续收集各节点的任务执行结果和系统反馈,生成经验池E,经验池中的数据包括全局状态St、局部状态Slocal(t)、任务执行动作aL(t)及相应的奖励函数值Slocal(t),aL(t);
S73、对经验池中的数据进行批量采样并利用近端策略优化算法进行策略更新;
S74、在每轮迭代优化中,低层策略和高层策略分别对各自的策略参数进行调整,通过最大化奖励函数值逐步优化任务调度和资源分配策略:其中, 为高层策略在时刻t的策略参数,ηH为高层策略的学习率, 为高层策略对不同子目标的权重系数, 为高层策略对参数的梯度,RH(St,Gt)为高层策略的全局奖励函数,RL(Slocal,j(t),aL,j(t))为第j个低层策略的局部奖励函数;
S75、低层策略通过结合高层策略的反馈调整自身策略优化每个节点的资源分配和任务执行:其中, 为第j个低层策略的策略参数,ηL为低层策略的学习率, 为低层策略在不同局部任务分配中的权重,RH,h(St,Gt)为高层策略对低层策略的全局奖励反馈;
S76、当层次化强化学习模型策略的收敛条件满足以下收敛准则时,停止迭代,最终生成最优策略:H L,j
其中,∈1为预设的收敛阈值,T1为总迭代次数,当高层策略θ与低层策略θ 的变化量均小于∈1时,模型策略被认为已收敛至最优策略。