1.基于深度强化学习的无信号灯交叉口控制方法,其特征在于,包括:S1、构建代理和环境,其中,所述环境包括冲突区和车道区,所述冲突区中包括冲突点;
S2、观测所述环境,并获取t时刻的所述环境整体的状态st,代理通过ε‑贪婪策略选取状态st下t时刻的放行动作at;
S3、代理执行所述放行动作at,得到t时刻所述冲突点的冲突情况;
S4、根据所述冲突情况确定t时刻的奖励rt,并获取所述环境整体在t+1时刻的状态st+1;
S5、将状态st、放行动作at、奖励rt、状态st+1整合成经验并存入经验回放池中,使用所述经验回放池中的经验训练代理;
S6、通过重复步骤S2至步骤S5的环境与代理交互训练,并将训练结果用于更新DQN网络;
S7、使用更新后的DQN网络计算当前时刻无信号灯交叉口的放行动作;
观测所述环境,并获取t时刻的所述环境整体的状态st具体包括:观测12条道路的道路状况,并采用12元向量N分别表示12条道路的道路状况;
其中,若第i条道路的头车到达所述冲突区,则将第i条道路所对应的向量Ni记为第i条道路的车队长度;否则,将第i条道路所对应的向量Ni记为0;其中,0≤i≤11;
此时,将t时刻的所述环境整体的状态st表示为st={N0(t),N1(t),…,N10(t),N11(t)};
其中,头车是指该条道路上向冲突区方向行驶的车辆中排行第一个的车辆;
交叉口放行能力的奖励函数表示如下:
rn(t)=V(t)/Vmax
其中,V(t)表示t时刻放行的车辆数量,Vmax表示最大能放行的车辆数目;
使用排队长度作为公平性的奖励函数,公平性的奖励函数表示如下:rf(t)=∑(Ni(t)/Nmax)
其中,Ni(t)表示t时刻被放行车道的车辆数目,Nmax表示单车道的最大容量;
对每次放行的最大车辆数目和使用排队长度作为公平性的奖励函数进行归一化,得到t时刻的奖励函数,t时刻的奖励函数表示如下:其中,r(t)为t时刻的奖励函数,rn(t)为公平性的奖励函数,rf(t)为交叉口放行能力的奖励函数。
2.根据权利要求1所述的基于深度强化学习的无信号灯交叉口控制方法,其特征在于,所述车道区域至少12条道路。
3.根据权利要求1所述的基于深度强化学习的无信号灯交叉口控制方法,其特征在于,代理通过ε‑贪婪策略选取状态st下t时刻的放行动作at具体包括:采用12元向量M分别表示12条道路的放行动作;
其中,若第i条道路选择放行,则将第i条道路所对应的向量Mi记为1,;否则,将第i条道路所对应的向量Mi记为0;
此时,将t时刻的放行动作at表示为at={M0(t),M1(t),…,M10(t),M11(t)}。
4.根据权利要求1所述的基于深度强化学习的无信号灯交叉口控制方法,其特征在于,代理执行所述放行动作at,得到t时刻所述冲突点的冲突情况具体包括:计算车辆到达冲突点的时间,如果多辆车同时到达冲突点则存在冲突,否则不存在冲突。
5.一种电子设备,其特征在于,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现如权利要求1至4任一所述的基于深度强化学习的无信号灯交叉口控制方法。
6.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现如权利要求1至4任一所述的基于深度强化学习的无信号灯交叉口控制方法。