1.一种基于深度强化学习的智能物流规划方法,其特征在于,包括:S1.采集历史车辆配送信息并构建全连接图,利用全连接图的节点集合构建序列数据集;
S2.构建智能物流配送规划模型,利用序列数据集对智能物流配送规划模型进行训练,得到训练好的智能物流配送规划模型;
S3.将待规划的车辆配送信息的节点序列输入训练好的智能物流配送规划模型,将智能物流配送规划模型输出的解序列作为规划结果。
2.根据权利要求1所述的基于深度强化学习的智能物流规划方法,其特征在于,在步骤S1中,定义所述全连接图为g(X),X为配送中心节点和客户节点构成的节点集合:X={xi=(si,di,ci,oi,P)|i∈1,…,D,…,n}其中,xi为节点i的原始特征;D为配送中心的数量;n为包含配送中心节点和客户节点的所有节点的数量;si为节点i的二维坐标;di为客户节点的需求量,若该节点为配送中心节点则将该值设为0;ci和oi分别为配送中心的容量和开设成本,若该节点为客户节点则均设为
0;P是车辆的容量。
3.根据权利要求2所述的基于深度强化学习的智能物流规划方法,其特征在于,所述智能物流配送规划模型包括编码器和解码器;
所述编码器对序列X进行注意力机制运算,得到节点嵌入向量;
所述解码器根据解码器当前的状态信息和各个节点嵌入向量进行自回归求解,得到最终解序列π=(π1,…,πt,…,πn),其中,πt表示在时间步t时模型选择的节点;
计算所有解序列的总成本,选择对应成本最小的序列作为智能物流配送规划模型最后的解输出。
4.根据权利要求3所述的基于深度强化学习的智能物流规划方法,其特征在于,所述编码器由嵌入层及N层多头注意力模块组成;
所述嵌入层将每个输入节点的原始特征xi映射到节点嵌入特征 映射过程如下:d d c c
其中,W 和b表示对配送中心节点进行嵌入的网络参数,W和b表示对客户节点进行嵌入的网络参数;
所述多头注意力模块包括多头注意力子层、前馈层和归一化层;所述多头注意力模块l‑1 l将节点嵌入特征h 更新为h,得到节点嵌入向量 更新过程如下:其中,l表示第l个多头注意力模块,l∈1,…N,MHA表示多头注意力子层,FF表示前馈层,BatchNorm表示批量归一化操作。
5.根据权利要求4所述的基于深度强化学习的智能物流规划方法,其特征在于,所述解码器根据编码器输出的节点嵌入向量 和已经构建完成的部分解序列的信息去计算下一时间步t选择节点,过程包括:SA.设定一个指示向量 表示当前状态;
SB.通过单头注意力机制的计算对指示向量 进行更新,将 与包含在所有节点的嵌入向量 中的节点信息相融合;
SC.通过掩码操作划分可行节点和不可行节点,通过注意力机制计算可行节点选择概率;
SD.根据得到的可行节点选择概率选择下一时间步的节点,存入解序列中,直到构造得到完整的解序列。
6.根据权利要求5所述的基于深度强化学习的智能物流规划方法,其特征在于,在步骤SA中,所述指示向量 的表达式如下:其中, 表示编码器输出的所有节点嵌入的均值向量, 表示本条路径下正在进行服务的配送中心节点的嵌入向量, 表示上一时间步(t‑1)中模型输出节点的嵌入向量,ξd,ξv,ξg为未选择任何节点时用于填充的可学习参数,gt为一个二维向量,表达式如下:T
gt=(cd,t,Pt)
cd,t表示配送中心剩余货物量,Pt表示当前服务中的车辆的剩余货物量,cd,t和Pt的更新逻辑如下:其中, 表示配送中心节点集合。
7.根据权利要求5所述的基于深度强化学习的智能物流规划方法,其特征在于,步骤SB包括以下过程:SB1.利用 生成query,利用所有节点的嵌入向量 生成key和value,计算公式如下:k v
其中, W和W为网络参数;
SB2.生成一个n维向量并将其规范化,计算公式如下:其中,Φt为不可行节点的集合;
SB3.通过注意力机制,将指示向量 为更新 更新公式如下:
8.根据权利要求7所述的基于深度强化学习的智能物流规划方法,其特征在于,利用指示向量 和编码器输出的所有节点的嵌入向量计算可行节点选择概率,过程包括:利用 更新query,由编码器生成的节点的嵌入生成key,公式如下:计算可行节点选择概率,计算公式如下:
其中,uci表示由当前状态选择可行节点添加到部分解中的可能性大小,pθ(πt=i|X,π1,…,πt‑1)表示随机策略。
9.根据权利要求3所述的基于深度强化学习的智能物流规划方法,其特征在于,所述智能物流配送规划模型利用多重推理技术进行推理,将推理得到的成本最小的序列作为最后的解输出,过程包括:指定以m个不同的配送中心作为起点,以采样的方式从每个起点生成h个解序列;
将g(X)中的所有节点进行p次不同角度的旋转变换,采样得到p×m×h个解序列;
计算所有解序列的总成本,选择最小成本那一个序列作为最后的解输出。
10.根据权利要求7所述的基于深度强化学习的智能物流规划方法,其特征在于,在步骤S2中,在智能物流配送规划模型进行训练时,对利用REINFORCE强化学习算法对智能物流配送规划模型进行参数更新,计算公式如下:其中,根据链式法则,pθ(π|s)为每步动作选择概率的累乘,则lnpθ(π|s)计算为每步动作选择概率对数的求和,以该值对参数θ计算偏导可得梯度值 (L(π)‑b(s))决定了梯度下降的方向,b(s)表示模型的基准表现,若当前模型的表现优于基准表现,则对模型进行正向激励,否则,对模型进行反向约束;
采用POMO的方式对b(s)进行估计,过程如下:指定M个不同的配送中心 作为解序列的头节点,在训练时采样M个解序列
1 2 3 i
{τ ,τ ,…,τ },将每个轨迹被定义为序列τ :将b(s)作为所有不同起点的解所得到的总成本的平均值,以一组异质轨迹的平均表现作为基准:其中,R(·)表示解序列对应的总成本。