利索能及
我要发布
收藏
专利号: 2023112439235
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种交通灯控制方法,其特征在于,包括:

获取当前时刻各交叉口的交通信息;

将当前时刻各交叉口的交通信息和上一时刻各交叉口的高维信息输入控制模型,获得当前时刻各交叉口交通灯的相位;

其中,在控制模型中,将交叉口视为智能体,将交叉口的交通信息视为智能体的状态,将交叉口交通信号灯的相位视为智能体的动作;

控制模型对上一时刻各智能体的高维信息进行降维处理,获得上一时刻各智能体的低维信息,采用空间折扣策略,将各智能体的低维信息进行交互,获得上一时刻各智能体的全局信息,根据上一时刻各智能体的全局信息和当前时刻各智能体的状态,获得当前时刻各智能体的动作以及动作对应的价值;上一时刻各智能体的高维信息包括上一时刻各智能体的状态以及上一时刻控制模型输出的各智能体动作的价值;

空间折扣策略:第k个智能体接收到的其他智能体的低维信息为基于空间距离折扣计算后的低维信息;

基于空间距离折扣计算低维信息的公式为:

k

式中, 为第k个智能体接收到的第j个智能体t‑1时刻的低维信息,f 为第k个智能d体的协调器, d(k,j)为第k个智能体和第j个智能体的空间距离,α 为与空间距离d适配的折扣因子, 为t‑1时刻第j个智能体的低维信息, 为协调器参数,Dk表示其他智能体与第k个智能体的最远空间距离,v表示第k个智能体的所有可通信智能体集合。

2.根据权利要求1所述的交通灯控制方法,其特征在于,控制模型采用全连接层对上一时刻各智能体的高维信息进行降维处理,公式为:;

k

式中, 为t‑1时刻第k个智能体的低维信息, w 为第k个智能体的ReLU函数中的权重,kb 为第k个智能体的ReLU函数中的偏置量, 为t‑1时刻第k个智能体状态和t‑1时刻控制模型输出的第k个智能体动作价值的组合。

3.根据权利要求1所述的交通灯控制方法,其特征在于,根据上一时刻各智能体的全局信息和当前时刻各智能体的状态,获得当前时刻各智能体的动作以及动作对应的价值,包括:将上一时刻各智能体的全局信息和当前时刻各智能体的状态输入深度循环Q网络,获得当前时刻各智能体的动作集合以及动作集合对应的价值集合;其中,价值集合中的价值和动作集合中的动作一一对应;

采用贪心策略,从每个价值集合中选择一价值,将价值对应的动作作为相应智能体的当前动作。

4.根据权利要求3所述的交通灯控制方法,其特征在于,贪心策略中,ϵ设置为随着时间改变动态递减的值。

5.根据权利要求1所述的交通灯控制方法,其特征在于,控制模型的智能体奖励值为以下因素的加权和;

其中,因素包括:

智能体所有临近道路的队列长度;

智能体所有临近道路的延迟总和;

智能体所有临近道路车辆更新后的等待时间总和;

在智能体与环境交互的周期内,智能体执行完最后一次相位改变后,周期内通过智能体的车辆总数。

6.根据权利要求1所述的交通灯控制方法,其特征在于,控制模型输出的动作价值公式为:;

式中, 为未来折扣因子,用来表示未来奖励的影响程度,当 接近1时,表示控制模型越关心未来的奖励,如果 ,则表示未来奖励和当前奖励一样,当 接近0时,表示控制模型越关心现在的奖励,如果 ,则表示不考虑未来奖励因素,st为t时刻的状态,st+1为t +1时刻的状态,at为t时刻的动作,a  t+1为t +1时刻的动作,为在st+1下最大的动作价值,Q(st, at)为智能体在st下采用at后控制模型输出的动作价值,r(st, at)为智能体在st下采用at后控制模型输出的奖励;

控制模型训练采用的损失函数为:

式中,L为损失函数值, 分别代表目标网络和评估网络的参数,B代表每次进行控制模型更新时从经验池中采样的数量,rt为t时刻的奖励,Q(st,at; θ)为智能体在st下采用at后经参数为θ的目标网络输出的动作价值, 为智能体在st+1下采用at+1后经参数为 的评估网络输出的动作价值。

7.一种交通灯控制系统,其特征在于,包括:

交通信息获取模块,获取当前时刻各交叉口的交通信息;

相位控制模块,将当前时刻各交叉口的交通信息和上一时刻各交叉口的高维信息输入控制模型,获得当前时刻各交叉口交通灯的相位;

其中,在控制模型中,将交叉口视为智能体,将交叉口的交通信息视为智能体的状态,将交叉口交通信号灯的相位视为智能体的动作;

控制模型对上一时刻各智能体的高维信息进行降维处理,获得上一时刻各智能体的低维信息,采用空间折扣策略,将各智能体的低维信息进行交互,获得上一时刻各智能体的全局信息,根据上一时刻各智能体的全局信息和当前时刻各智能体的状态,获得当前时刻各智能体的动作以及动作对应的价值;上一时刻各智能体的高维信息包括上一时刻各智能体的状态以及上一时刻控制模型输出的各智能体动作的价值;

空间折扣策略:第k个智能体接收到的其他智能体的低维信息为基于空间距离折扣计算后的低维信息;

基于空间距离折扣计算低维信息的公式为:

k

式中, 为第k个智能体接收到的第j个智能体t‑1时刻的低维信息,f 为第k个智能d体的协调器, d(k,j)为第k个智能体和第j个智能体的空间距离,α 为与空间距离d适配的折扣因子, 为t‑1时刻第j个智能体的低维信息, 为协调器参数,Dk表示其他智能体与第k个智能体的最远空间距离,v表示第k个智能体的所有可通信智能体集合。

8.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储一个或多个程序,所述一个或多个程序包括指令,所述指令当由计算设备执行时,使得所述计算设备执行权利要求1 6任一所述的方法。

~