1.一种基于强化学习的交通流多步预测方法,其特征在于,包括如下步骤:
(1)对原始交通数据的筛选与统计,得到特定路段的速度数据以及该路段两端交叉口的流量数据;并对数据进行预处理,包括补齐缺失数据、处理错误数据和数据归一化;
(2)利用强化学习中的DDPG结构建立基于强化学习的交通流多步预测模型,将强化学习中三要素映射到交通流多步预测任务中,并确定该模型中智能体与环境在交通流多步预测任务中的交互内容;其中三要素为状态、动作、回报;
(3)基于预处理好的数据训练所建立得到的交通流多步预测模型,调整模型中的参数以获得最优的交通流多步预测效果。
2.根据权利要求1所述的一种基于强化学习的交通流多步预测方法,其特征在于:在所述步骤(1)中,对原始交通数据进行筛选与统计,得到指定路段的以5分钟为周期的平均速度数据,并筛选得到该路段两端交叉口以5分钟为周期的流量数据。
3.根据权利要求1所述的一种基于强化学习的交通流多步预测方法,其特征在于:在所述步骤(1)中,利用交通流的时间相关性,对缺失数据进行处理,采用平均值法修补缺失数据,修补公式如下式所示:其中,x(t)是需要补全的缺失数据,k是相邻数据总数。
4.根据权利要求1所述的一种基于强化学习的交通流多步预测方法,其特征在于:在所述步骤(1)中,利用深度学习中用于防止模型过拟合的正则化方法来处理错误数据,通过在训练的目标函数中加入L1惩罚项来降低神经网络模型的复杂程度,从而自动地降低其对噪声数据的关心程度。
5.根据权利要求1所述的一种基于强化学习的交通流多步预测方法,其特征在于:在所述步骤(1)中,对数据进行归一化处理的公式如下式所示:其中,min(x)是历史数据中的最小值,max(x)是历史数据中的最大值;通过线性归一化后可以使数据较为均匀地分布在[0,1]之间。
6.根据权利要求1所述的一种基于强化学习的交通流多步预测方法,其特征在于:所述建立的基于强化学习的交通流多步预测模型中,定义交通流的时序数据x1,x2,...,xn为智能体所观察的状态s,其中n是观察状态的窗口大小,n越大,智能体一次性观察的数据越多;
定义智能体对下一时刻交通流的预测 为智能体输出的动作a;定义交通流的预测值 与其真实值y误差平方的相反数为智能体从环境中得到的回报r,回报r表明预测误差越大,智能体所获得的回报越小:多步预测任务中所对应的累计回报的计算式如下:
其中,γ∈[0,1]是未来回报的折扣率,用于权衡当前回报和长远回报的关系,取值越大,越注重长远回报,反之则越注重当前回报;当所得累计回报期望最大时,就是多步预测整体误差期望的最小值。
7.根据权利要求1所述的一种基于强化学习的交通流多步预测方法,其特征在于:所述在所述步骤(3)中,对交通流多步预测模型中的诸多可调参数进行调优以获得最优的预测模型,其中参数包括网络结构参数和学习算法参数,通过学习获得的最终优化参数为:actor学习速率为1e-5;critic学习速率为1e-4;target网络更新速率为1e-3;每批学习数据数目为100;智能体记忆大小为10000;贝尔曼公式参数为0.85;智能体中的神经网络模型采用卷积神经网络模型,网络共有五层‘第一层是8个1×3的卷积核,第二层是8个3×3,第三层是64个神经元组成的全连接层,第四层是32个神经元组成的全连接层,第五层是网络的输出层,包含三个神经元。