利索能及
我要发布
收藏
专利号: 2023116458606
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于MAPPO算法的多AGV路径规划模型训练方法,其特征在于,包括:获取参数初始化的策略网络和值网络;获取AGV运输任务、AGV的全局路径规划、AGV的状态空间和动作空间;

AGV的状态空间包括AGV位置、AGV朝向、AGV负载情况、AGV所在路径终点、AGV观测空间的静态障碍及动态障碍;AGV的动作空间为AGV运动时的动作类型;

将AGV的全局路径规划、AGV的状态空间和动作空间输入策略网络,输出AGV当前状态下的动作概率,AGV基于动作概率选择动作,基于该动作计算AGV的奖励函数值并储存;

基于AGV状态空间和AGV的奖励函数值,计算AGV当前状态所对应动作的优势函数值,基于优势函数值衡量每个动作相对于平均水平的好坏,当动作优于平均动作时,增大选择该动作的概率;

计算策略网络和值网络的损失函数值,更新策略网络和值网络的参数;

重复以上选择AGV动作、计算奖励函数值、计算优势函数值、更新策略网络和值网络的过程,直到AGV完成所有任务或达到最大步数,更新完成的策略网络和值网络即为训练后的多AGV路径规划模型;

所述计算策略网络和值网络的损失函数值,更新策略网络和值网络的参数,包括:

计算AGV的策略网络损失函数值,策略网络损失函数值为策略损失与策略熵损失之和;

基于策略网络损失函数值使用梯度上升方法对策略网络参数进行更新;

计算AGV的值网络损失函数值,公式如下:

其中,L(φ)表示值网络的损失函数值,φ表示值网络参数,B表示批量大小,n表示训练批次大小,Vφ(si)表示值网络对第i个批量的状态Si的值函数估计,Vφold(si)表示值网络对第i个批量的状态Si的历史值函数估计, 表示第i个批量的状态的k次方,Ri表示第i个批量的实际奖励,ε表示超参数;

基于值网络损失函数值使用梯度下降方法对值网络参数进行更新。

2.根据权利要求1所述的方法,其特征在于,基于以下奖励函数公式计算AGV的奖励函数值:R=r1+r2+r3+r4+r5+r6

r1=‑1

r2=2Δd

其中,R表示奖励函数值,r1表示AGV运行过程中产生的步数惩罚;r2表示根据AGV当前状态与前一状态至终点的距离差值产生的奖励,Δd为AGV当前状态与前一状态至终点的距离差值;r3表示当有其他AGV进入观测范围时,对范围内AGV设置惩罚,d1为AGV之间的距离,rr为AGV的观测范围;r4表示AGV与货架碰撞产生的惩罚,d2为AGV与货架之间的距离;r5表示AGV行进过程中基于全局路径规划产生的引导奖励,当AGV行驶到A*算法得到的全局路径上时,根据AGV在该路径的起点和当前位置之间的路径距离产生奖励,并删除该路径起点和当前位置之间的路径轨迹,Ne为AGV在该路径的起点到当前位置间的路径距离,cr(t+1)表示AGV在下一时刻的位置,lG为全局路径;r6表示AGV取得货架或到达该路径终点时产生的奖励。

3.根据权利要求1所述的方法,其特征在于,计算AGV当前状态所对应动作的优势函数值,基于优势函数值衡量每个动作相对于平均水平的好坏,包括:使用广义优势估计计算当前状态所对应动作的优势函数值,公式如下:其中,A(st,at)表示AGV在st状态下采取at动作时的优势函数值,t表示时间,T表示经验轨迹的长度,γ表示折扣因子,λ表示广义优势估计的参数,δt表示时刻t的时序差分误差,rt表示对GAV每个时间步t的即时奖励,V(st)表示状态st的值函数估计,V(st+1)表示状态st+1的值函数估计;

当优势函数值为正数时,表示AGV的当前动作优于平均动作,增大AGV选择该动作的概率。

4.路径规划方法,其特征在于,包括:

获取待拣选仓库的地图信息和AGV运输任务,获取多AGV路径规划模型;多AGV路径规划模型通过如权利要求1‑3任一所述的方法训练得到;

基于地图信息和AGV运输任务,对每个AGV进行全局路径规划,得到每个AGV的全局路径;

将AGV运输任务、每个AGV的全局路径规划、AGV状态空间输入多AGV路径规划模型,得到每个AGV的最佳动作轨迹;

基于每个AGV的最佳动作轨迹完成仓库拣选任务。

5.根据权利要求4所述的方法,其特征在于,基于地图信息和AGV运输任务,对每个AGV进行全局路径规划,包括:基于地图信息和AGV运输任务,获取地图上AGV起点、货架、拣货台三个位置的坐标,得到从AGV起点到货架、货架到拣货台、拣货台到货架三段路径各自的起点和终点坐标;

基于评价函数,使用A*算法搜索三段路径各自的最佳路径;

评价函数公式如下:f(n)=g(n)+h(n)

其中,n表示AGV在运动过程中的当前位置,f(n)表示AGV从一段路径的起点到当前位置再到该路径终点的总路径成本,g(n)表示AGV从该路径的起点到当前位置的实际路径成本,h(n)表示AGV从当前位置到该路径终点的预估路径成本。

6.根据权利要求5所述的方法,其特征在于,基于评价函数,使用A*算法搜索三段路径各自的最佳路径,包括:将待搜索路径的起点输入Open list列表,基于搜索范围搜索其相邻节点,除不可通行的相邻节点外,其余相邻节点输入Open list列表,起点作为父节点移入Close list列表;

遍历Open list列表中父节点的相邻节点,分别计算各相邻节点的f(n)值,将f(n)值最小的相邻节点移入Close list列表,并将其设为当前节点;Open list为未搜索节点的储存列表,Close list为已搜索节点的储存列表;

检测当前节点的相邻节点,除不可通行的相邻节点和Close list列表中的节点外,如果其余的相邻节点不在Open list列表,将这些相邻节点输入Open list列表,当前节点作为父节点,计算该父节点各相邻节点的f(n)值,将f(n)值最小的相邻节点移入Close list列表并设为新的当前节点;如果其余的相邻节点在Open list列表,重新计算各相邻节点的f(n)值、g(n)值,若存在比当前节点g(n)值更小的相邻节点,则重新计算父节点相邻节点的f(n)值、g(n)值,将f(n)值最小的相邻节点移入Close list列表并设为新的当前节点;

判断待搜索路径的终点是否被找到,如果未找到,则重复上一步骤;如果终点找到,判断Open list列表是否为空,Open list列表不为空时,从终点开始,倒序寻找每一节点的父节点,直到找到起点,父节点组成的路径即为该待搜索路径的最佳路径;

使用以上步骤分别搜索三段路径各自的最佳路径。

7.根据权利要求6所述的方法,其特征在于,方法还包括,在A*算法中引入AGV转弯的代价系数,使AGV倾向于转弯数小的路径,此时评价函数中预估路径成本h(n)的公式如下:其中,h(n)表示AGV从当前位置到所在路径终点的预估路径成本,k表示成本预估系数,hpath(n)表示AGV从当前位置到所在路径终点的实际预估路径成本,(xn,yn)表示当前节点,(xn‑1,yn‑1)表示父节点,(xn+1,yn+1)表示当前节点的下一个预估节点。

8.根据权利要求6或7所述的方法,其特征在于,搜索相邻节点时,如果AGV处于负载状态,货架的坐标节点作为不可通行的相邻节点,如果AGV处于空载状态,货架的坐标节点作为可通行的相邻节点。

9.一种计算机存储介质,存储有可读程序,其特征在于,当程序被处理器运行时,能执行权利要求1‑8之一所述的方法。