利索能及
我要发布
收藏
专利号: 2021106232873
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于强化学习的服务任务调度方法,其特征在于,包含以下步骤:

1)对服务任务进行建模,构建服务任务环境。

2)使用ε‑Greedy方法在步骤1)构建的服务任务环境中进行半随机服务人员工作安排。

3)基于步骤2)得到的服务人员工作安排,使用强化学习方法对不同工作安排的价值差异进行学习,并使用深度神经网络Q近似不同调度安排的价值。

4)基于步骤3)训练得到的深度神经网络Q,对服务人员不同调度安排的价值进行预测,选择输出较优的人员调度安排。

2.如权利要求1所述基于强化学习的服务任务调度方法,其特征在于,所述步骤1)中,根据服务任务需求对服务任务建模,构建服务任务环境方法:

1.1)根据服务需求的可能范围对服务任务需求环境进行随机初始化。服务任务需求主要包括需要安排调度的天数、需要安排调度期间每日的服务任务需求量、可参与调度的服务人员数、参与调度的服务人员的能力值、服务人员最小连续工作天数、服务人员最大连续工作天数、需要安排调度的天数中每个参与调度的服务人员需要休息的次数、每个服务人员已经连续工作的天数。

1.2)规定服务任务环境可选动作集合为A={休息,工作}。

1.3)服务任务环境对于每次服务人员调度安排前需要给出满足服务任务需求的服务人员调度方式。计算服务人员满足服务任务需求的调度方式 的方法如下:其中,c表示该服务人员已经连续工作的天数,l表示剩余需要调度安排的天数,M表示服务人员最大连续工作天数,m表示服务人员最小连续工作天数,r表示剩余需要调度的天数中该服务人员还需要休息的次数,xi为i天,表示连续工作i‑1天后休息1天的安排。ti表示在剩余需要调度的天数中xi安排的可选次数。由此我们可以根据ti和c给出当前满足服务任务需求的可选安排。

1.4)根据服务任务需求定义服务任务环境的动作奖励。

1.5)服务任务环境从需要安排调度的第1天第1个服务人员开始调度安排,完成第1天的调度安排后再从第2天第1个服务人员开始,直到需要安排调度的最后一天完成后结束。

服务任务环境在每一次安排前给出当前的服务任务环境状态st,以及当前服务人员可选的满足服务任务需求的调度安排A′,接收智能体对当前的调度安排a({a|a∈A}),给出当前安排的即时奖励rt,并迭代环境到下一状态st+1,重复这一安排过程直至环境到达结束状态,即完成了整个服务任务的服务人员调度。

3.如权利要求1所述基于强化学习的服务任务调度方法,其特征在于,使用ε‑Greedy进行半随机人员工作安排:

2.1)ε‑Greedy方法如下:通过产生一个[0,1)的随机数,如果产生的随机数小于ε则在当前可选动作集合A′中随机选择一个a作为当前的动作,即当前服务人员的调度安排;如果产生的随机数不小于ε,则通过全连接深度神经网络Q对当前状态st下的不同的服务人员调度方式的价值进行预测,选取价值最大的服务人员调度方式作为当前服务人员的调度安排。

2.2)将步骤2.1)中ε‑Greedy产生的服务人员调度安排a输入到步骤1)中的服务任务环境中,使服务任务环境执行调度安排a,给出即时奖励rt,服务任务环境从st状态转移到st+1状态,将状态转移元组(st,at,rt,st+1)存储到记忆Memory Buffer中。

4.如权利要求1所述基于强化学习的服务任务调度方法,其特征在于,所述步骤3)中,使用强化学习方法对不同工作安排的过程进行学习,并使用深度神经网络Q近似不同调度安排的价值:

3.1)步骤2)中服务任务环境每经过λ次服务任务环境状态转移,从步骤2)的记忆Memory Buffer中对状态转移元组(st,at,rt,st+1)进行抽样得到训练数据集D。

3.2)计算每个状态转移元组中st状态采取动作at时对应的真实价值yt:其中,rt为状态st时采取动作at时所获得的即时奖励,γ未来奖励系数,maxa′∈AQ(st+1,a′)是在st+1状态时神经网络Q对于不同的动作a′所能得到的最大价值。

3.3)将步骤3.2)中计算得到的真实价值yt插入到步骤3.1)采样得到的数据集D对应的状态转移元组中。

3.4)以步骤3.3)中得到的数据集D作为训练数据,使用mini‑batch梯度下降方法对神经网络Q进行训练。在训练时使用均方误差损失函数来计算损失值:其中,Q(st,at)是在状态st深度神经网络Q预测采取动作at时的价值。

5.如权利要求1所述基于强化学习的服务任务调度方法,其特征在于,所述步骤4)中,训练得到的深度神经网络Q,对不同的服务人员调度安排的价值进行预测,选择输出较优的人员调度安排:

4.1)根据实际的服务任务需求对步骤1)中的服务任务环境进行初始化,得到初始状态st。

4.2)计算在状态st时的满足任务需求的动作集合A′。

4.3)使用步骤3)中训练得到的神经网络Q,对状态st下采取动作集合A′中每个可选调度安排a的价值Q(st,a)进行预测,并使用完全贪婪方式at=argmaxa∈A′Q(st,a)选择在状态st时能取得最大价值的调度安排at。

4.4)将步骤4.3)中获得的动作at输入到服务任务环境中,服务任务环境执行调度安排at,然后服务任务环境进入下一状态st+1。

4.5)重复步骤4.3)、步骤4.4)直至服务任务环境到达终止状态,即完成服务任务的调度。输出步骤4.3)中每次采取的调度安排,即服务任务需求下每日每个服务人员的工作、休息安排。