利索能及
我要发布
收藏
专利号: 2019106473035
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度强化学习的自动化停车场调度方法,包括如下步骤:步骤1:建立自动化停车场的环境;

自动化停车场包含一个入口,一个出口,一定数量的库位以及障碍物,并以栅格化的地图形式表示各个部分,其中白色栅格是库位,灰色区域是通行道路,黑色是障碍物,E表示入口,O表示出口;将自动化停车场的库位状态表示为P,其中包含的库位数量为M,则P={pk|k∈[1,M]},pk表示P中第k个库位,将库位pk与相应的入口和出口之间的距离之和定义为dk;

泊车机器人R数量为L,则R={ri|i∈[1,L]};定义泊车机器人每次只能搬运一辆车,搬运车辆时保持匀速运动,且允许多个泊车机器人出现在同一个栅格中,忽略泊车机器人在空载时的能耗;负载时,其能耗与搬运车辆的质量和搬运距离成正比,记泊车机器人代价系数为a,则机器人总代价CR=a×L;

对于每辆已经申请停放的车辆ci,其申请入库时刻tin、质量mi、停放时间Ti以及申请出库时刻是可知的,则ci={tin,mi,Ti},认为停放车辆的质量,停放时间,服从均匀分布且相互独立,表示为mi=U(mmin,mmax)、Ti=U(Tmin,Tmax),其中mmin和mmax分别是质量的最小和最大值,Tmin和Tmax是停放时间的最小和最大值;

步骤2:定义泊车机器人的运行代价;

考虑泊车机器人搬运停放车辆产生的能耗问题,将泊车机器人搬运能耗表示为wi=ke×dk×mi,表示完成车辆ci停放任务产生的能耗,其中ke是能耗系数,记完成N辆车停放产生的总能耗为Z,则目标函数为:

wi=ke×dk×mi,i∈[1,N],k∈[1,M]  (2)mi=U(mmin,mmax)  (3)Ti=U(Tmin,Tmax)  (4)dk≤dk+1  (5)

步骤3:建立环境、智能体模型及设定奖励值;

在自动化停车场调度问题中,定义状态由停车场中各个库位上停放车辆的剩余停放时间ti,申请停放车辆的质量mi、停放时间Ti以及申请时刻tin组成,包含的环境信息越充分越能在决策时区分不同动作的价值偏差,状态的数据形式如下:将搬运停放车辆的能耗设定为奖励值,DQN算法的目标是总奖励值最大化,因此相应的能耗应当为负值;为了增加神经网络的拟合效果,奖励值大小应当在0附近,保证总奖励值不至于过大或者过小,奖励值reward定义如下:其中 为车辆质量的平均值, 为库位距离的平均值,由于车辆的质量分布和停车场库位的空间分布是可知的,baseline则为常数;

智能体模型包含Q-Learning算法以及价值估计模型,对于训练完成的价值模型而言,只需要在决策阶段选择价值最大的动作就能保证最优的运行结果,对于较为复杂的问题,难以通过遍历所有状态获取接近真实状态转移概率的价值模型,使用ε-greedy算法解决探索与利用的经典问题,其算法如下:

在算法前期多进行探索,可以发现更好的动作,避免陷入局部最优,在算法后期则选择最优动作,能尽可能获得更多的奖励;

使用Q-Learning的更新公式计算获得的交互序列的状态-动作对的价值,并将其作为样本存储下来用于神经网络的训练,每个样本包含环境状态信息st,以及所有动作对应的价值,其数据格式定义为:

sample=[st qπ(st,a1)qπ(st,a2)…qπ(st,aM)]  (9)步骤4:对DQN算法进行改进;

首先使用Double DQN对算法进行改进,主要使DQN中的两个神经网络的参数分别用于动作决策和价值估计,解决了模型价值估计过高的问题;其次使用Priority Replay Buffer对算法中的采样环节进行改进,在以TD-Error为权重的采样和均匀采样之间进行插值,对于每个样本i的采样概率公式为:其中α为TD-Error的权重,对原来的概率计算值增加权值β以修正价值模型拟合效果的偏差:

其中N为存储的样本数量,再使用完全二叉树结构对Priority Replay Buffer中数据进行存储采样,极大提高了存储和采样效率;最后使用n-step算法调整DQN算法训练过程中的方差和偏差的平衡,并且对车辆进行模拟停放,当一辆车申请停放,选择库位时,在遍历该状态下所有动作的价值之后,再进行n次模拟整个停放的过程,并且取其中的最大值作为下一个状态的估计值;

步骤5:使用改进的DQN算法进行训练;

根据停车场中各个库位上停放车辆的剩余停放时间ti,申请停放车辆的质量mi、停放时间Ti以及申请时刻tin,将状态输入到神经网络中进行训练,计算当前状态下每一个动作的价值,并根据ε-greedy算法选择动作并执行,使泊车机器人能将车辆准确地搬入库位。

2.根据权利要求1的一种基于深度强化学习的自动化停车场调度方法,其特征在于:步骤4所述的对DQN进行改进的方法,其中Double DQN解决价值估计过高的问题;Priority Replay Buffer提高存储和采样的效率;n-step使算法在训练前期获得较为准确的价值估计,避免陷入局部最优解。