利索能及
我要发布
收藏
专利号: 2025116476181
申请人: 成都信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种针对交通不确定性拓扑网络的导航方法,其特征在于,包括以下步骤:S100、定义不确定性参数,将待导航交通网络建模为不确定性拓扑网络;

所述不确定性参数包括拓扑不确定性和旅行时间随机性;

S200、基于不确定性参数构成的随机动作集合,将不确定性拓扑网络中的导航问题转换为变分马尔可夫过程;

S300、基于变分马尔可夫过程,构建强化学习网络,包括基于变分策略梯度模块的策略网络和基于掩码时序差分模块的价值网络;

S400、采用离策略更新策略网络和价值网络,并结合策略‑价值网络交互,对强化学习网络进行迭代训练至收敛,输出最优路由策略;

S500、将最优路由策略部署至智能体上,并根据实时观测值输出对应的导航路径;

所述步骤S300中,在所述强化学习网络中,所述变分策略梯度模块用于参数化智能体的路由策略,并通过梯度上升更新策略网络参数以最大化准时达到率;所述掩码时序差分模块用于通过价值函数估计动作和状态的价值,并通过实时观测的状态转移计算目标价值,进而通过随机梯度下降最小化均方差更新价值函数。

2.根据权利要求1所述的针对交通不确定性拓扑网络的导航方法,其特征在于,所述步骤S100中,所述拓扑不确定性通过定义不确定性拓扑网络中边的可通行概率 表示,且随交通网络拓扑变化动态更新;其中, ,仅当智能体到达节点 时,观测到边 是否可通行,将节点 处的可通行边集合记为 ;

所述旅行时间随机性通过定义不确定性拓扑网络中边的旅行时间 表示;其中,旅行时间 为随机变量,且服从均值为 、标准差为 的正态分布。

3.根据权利要求2所述的针对交通不确定性拓扑网络的导航方法,其特征在于,所述步骤S200中,所述变分马尔可夫过程的要素包括智能体、状态、随机动作集合、奖励以及目标函数;

所述智能体为待导航交通网络中的实体;

所述状态为智能体的当前节点与剩余时间预算 的组合 ;

所述随机动作集合 为当智能体处于状态 时,执行动作 为节点处实际可通行边集合 中随机选择的一条可执行边 形成的集合;

所述奖励为当智能体执行动作 为可执行边 时,边 的旅行时间负值;

所述目标函数为以寻找最优路由策略,最大化智能体到达终点时剩余时间 的概率。

4.根据权利要求1所述的针对交通不确定性拓扑网络的导航方法,其特征在于,所述步骤S300中,在所述变分策略梯度模块中,采用变分线性SoftMax策略参数化智能体的路由策略,其表示为:式中, 表示状态 下动作 对应的路由策略, 表示

状态 下动作 对应的特征向量, 表示剩余时间预算, 表示边 的独热编码向量,表示随机动作集合,表示策略网络参数, 表示下一动作,上标 表示转置操作;

通过采集 条由路由策略 生成的轨迹,计算路由策略的上升梯度进而更新策略网络参数 ,其表示为:式中, 表示策略网络参数 的梯度算子, 表示路由策略 的期望准时到达概率,表示指示函数, 表示第 条轨迹, 表示第 条轨迹的总耗时, 表示第 条轨迹的长度, 表示长度为 的第 条轨迹对应的状态, 表示长度为 的第 条轨迹对应的动作, 表示状态 下动作 对应的特征向量, 表示状态 的随机动作集合, 表示状态 下下一动作 对应的路由策略, 表示生成轨迹总数,表示最大轨迹长度,表示轨迹长度索引;

通过梯度上升更新策略网络参数的公式为:

式中, 表示更新后的策略网络参数, 表示策略网络的学习率。

5.根据权利要求1所述的针对交通不确定性拓扑网络的导航方法,其特征在于,所述步骤S300中,所述价值函数包括广义状态‑动作价值函数和广义状态价值函数,其分别表示为:式中, 表示广义状态‑动作价值, 表示广义状态价值,表示状态,表示动作,表示价值网络参数, 表示状态 ‑动作 对应的特征向量, 表示指数函数,上标 表示转置操作, 表示状态 ‑动作 的路由策略, 表示随机动作集合;

所述目标价值 为:

式中, 表示转移后的状态, 表示节点 与剩余时间预算 ,表示不确定性网络中的终点, 表示转后的状态 对应的广义状态价值;

所述价值函数的更新公式为:

式中, 表示更新后的价值网络参数, 表示掩码时序差分模块学习率。

6.根据权利要求1所述的针对交通不确定性拓扑网络的导航方法,其特征在于,所述步骤S400中,采用离策略更新策略网络的方法为:利用重要性轨迹比校正基于行为策略 采样的轨迹,更新路由策略梯度,进而更新策略网络参数 ;

采用离策略更新价值网络的方法为:

在更新策略网络的基础上,利用 校正动作权重,进而更新价值网络参数 ;其中,表示状态 下动作 对应的路由策略, 表示状态 下动作 对应的行为策略。

7.根据权利要求6所述的针对交通不确定性拓扑网络的导航方法,其特征在于,更新路由策略梯度的公式为:式中, 表示策略网络参数 的梯度算子, 表示路由策略 的期望准时到达概率,表示指示函数, 表示第 条轨迹, 表示第 条轨迹的总耗时, 表示第 条轨迹的长度, 表示长度为 的第 条轨迹对应的状态, 表示长度为 的第 条轨迹对应的动作, 表示状态 下动作 对应的路由策略, 表示生成轨迹总数,表示最大轨迹长度,表示轨迹长度索引;

表示第 条轨迹的重要性轨迹比, 表示状态 下动作 对应的行为策略。

8.根据权利要求6所述的针对交通不确定性拓扑网络的导航方法,其特征在于,所述步骤S400中,对强化学习网络进行迭代训练至收敛,输出最优路由策略,包括:S401、初始化策略网络参数和价值网络参数为随机向量;

S402、设定训练超参数,包括最大迭代次数、每次迭代采集轨迹数、策略网络学习率和价值网络学习率;

S403、执行当前行为策略并采集轨迹存储至经验回放池;

S404、从经验回放池中采样轨迹,并根据离策略更新价值网络参数;

S405、将参数更新的价值网络输出的广义状态‑动作价值作为策略网络更新的评价信号,进而根据离策略更新策略网络参数;

S406、将更新后的策略网络参数同步至行为策略;

S407、重复步骤S403 S406,直到策略网络输出路由策略的准时到达概率波动小于预设~阈值,完成强化学习网络训练,输出最优路由策略。

9.根据权利要求1所述的针对交通不确定性拓扑网络的导航方法,其特征在于,所述步骤S500包括以下分步骤:S501、将最优路由策略部署至智能体;

S502、将智能体实时观测的当前节点、剩余时间以及可通行边集合代入至采用变分线性SoftMax策略参数化智能体的路由策略中,计算可通行边集合内各边的选择概率;

S503、将最大选择概率对应的边作为智能体在当前节点执行的动作;

S504、重复步骤S502 S503,直到智能体达在执行的动作下到终点或剩余时间小于零,~输出导航路径。