利索能及
我要发布
收藏
专利号: 2018101259488
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种交通信号自适应控制系统,其特征在于,包括交通状态感应模块、参数融合及划分模块、Q学习模块、控制决策模块、Q表和模糊评价器;

所述交通状态感应模块,用于采集路口的交通流状态信息,并分别传输至所述参数融合及划分模块和所述模糊评价器;

所述参数融合及划分模块,用于融合接收到的交通流状态信息,获取交通参数,并通过状态划分将交通参数划分到对应的状态段集合中,作为查询Q表中配时方案的依据和Q学习模块更新状态空间的参数;

所述模糊评价器,用于根据所述交通状态感应模块采集到的交通流状态信息,查询奖惩值反馈表,并将查询到的奖惩值反馈到Q学校模块;

所述Q学习模块,用于将参数融合及划分模块传输的交通参数对应的状态段集合和所述模糊评价器反馈的奖惩值共同作为Q学习模块更新Q表的依据,更新上一状态的Q值;

所述Q表,用于储存各个交通参数状态段集合、配时方案及对应的选择Q值,并可通过所述学习模块更新;

所述控制决策模块,用于根据选择策略从Q表所传递的结果中为当前相位的信号灯提供相应方案。

2.根据权利要求1所述的一种交通信号自适应控制系统,其特征在于,所述交通流状态信息包括车流量信息、上个周期车辆排队长度、路口各相位车辆延迟时间。

3.根据权利要求1所述的一种交通信号自适应控制系统,其特征在于,所述参数融合及划分模块中建立融合函数的方法为:先将w=(F,Lg,Lr)定义为绿灯相位通行繁忙度、绿灯相位车辆排队长度,红灯相位车辆排队长度三个维度的状态向量集;

根据绿灯相位车辆排队长度建立函数:s1=Lmax-Lg,其中,Lg为绿灯相位的车辆排队长度;Lmax为道路所能接受的车辆排队长度极限;

根据红灯相位车辆排队长度建立函数:s2=k1s1+k2Lr,其中,Lr为红灯相位车辆排队长度,k1,k2为比例因子,且k1>k2;

结合绿灯相位的通行繁忙度确立最后的融合函数:

4.根据权利要求3所述的一种交通信号自适应控制系统,其特征在于,所述比例因子k1为 所述比例因子k2为 其中,Tmin和Tmax是绿灯相位最短和最长有效时间。

5.根据权利要求1所述的一种交通信号自适应控制系统,其特征在于,所述模糊评价器选取绿灯相位通行繁忙度变化率F′、红灯相位的车辆排队长度变化率Lr′作为输入;所述模糊评价器的输出为奖惩信号值,通过重心法对输出进行解模糊,所述奖惩信号值范围是(-

1,1);输入输出变量均采用五级级模糊划分方式,即{“负大”,“负小”,“中”,“正小”,“正大”}表示五种不同的红灯相位的车辆排队长度变化率以及绿灯相位通行繁忙度变化率,均记为{NB,NS,ZO,PS,PB},使用三角隶属度函数表示;当绿灯相位通行繁忙度变化率以及红灯相位的车辆排队长度变化率超过预设的阀值的一半时,则判定该配时方案所产生的影响达到最大。

6.根据权利要求5所述的一种交通信号自适应控制系统,其特征在于,所述绿灯相位通行繁忙度变化率F′的公式为 其中,q为绿灯相位在决策持续时间中的交通通过量,st为绿灯相位在决策持续时间中的饱和流量。

7.根据权利要求1所述的一种交通信号自适应控制系统,其特征在于,所述Q表以表格的形式存储不同交通状态下的配时策略,其中,首列存储的是交通状态的状态段集合,首行存储的是不同的相位绿灯配时方案,Q表预先初始化每个配时策略,在随后的迭代过程中,Q学习模块不断的对配时策略进行更新,直到获得不同交通状态下的最优配时策略。

8.根据权利要求1或7所述的一种交通信号自适应控制系统,其特征在于,所述q表的学习更新公式为:Q(S,a)←Q(S,a)+α[r+γmaxa′Q(S′,a′)];

其中,S为交通状态s的状态段集合,a为交通配时方案;Q(S,a)表示当前状态集s下的选择依据;α为学习效率,α越高则代表Q(S,a)受下一个状态影响越大;r为执行配时方案a之后的反馈,即奖惩值;S'表示下一个状态集,Q(S',a')表示下一个状态集下的选择策略;maxa'Q(S',a')则表示下一个状态集所估计的最佳的选择策略;γ表示衰减度。

9.一种交通信号自适应控制方法,其特征在于,包括如下步骤:

S1、交通状态感应模块采集当前时刻交通路口的交通流状态信息,并分别传输至参数融合状态及划分模块和所述模糊评价器;

S2、参数融合状态及划分模块融合接收到的交通流状态信息获取交通参数,通过状态划分将交通参数划分到对应的状态段集合,而后将获取的状态段传输至Q表和Q学习模块;

S3、Q表根据接收到的状态段,查询适合于当前交通状态的所有配时方案,将适配的所有配时方案传输到所述控制决策模块,通过所述控制决策模块的选择策略选择合适的配时方案;

S4、当执行配时方案,交通流发生变化时,感应模块再次采集当前交通流状态信息,并通过参数融合状态及划分模块获取相应的交通参数及划分到的状态段集合;

S5、所述模糊评价器根据交通流状态信息查询反馈表获取奖惩值,并将奖惩值反馈至所述Q学习模块;

S6、所述Q学习模块根据变化后的交通状态段集合及奖惩值对Q表进行更新;

S7、当前绿灯相位结束后,切换至下一个相位,重复S1至步骤S6。