利索能及
我要发布
收藏
专利号: 2023105935885
申请人: 陕西科技大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种环境和运动不确定下的机器人复杂任务路径规划方法,其特征在于,包括以下步骤,步骤1,对机器人全局环境进行分解,获得空间集合与邻接矩阵;

步骤2,输入机器人需要满足的复杂任务要求;

步骤3,建立环境估计的随机过程模型,初始化地图估计;

步骤4,机器人使用传感器进行环境观测,并采用基于卡尔曼滤波算法的环境估计算法进行任务环境估计;

步骤5,根据步骤4中当前的环境估计结果、步骤2的复杂任务要求与运动不确定性构建带有高斯过程的有限马尔可夫决策过程;所述有限马尔可夫决策过程五元组,包含状态空间S、动作空间A、转移函数T、奖励函数R、回报G;

步骤6,使用混合模拟退火的SARSA算法求解有限马尔可夫决策过程,得到最优策略;具体包括以下步骤,步骤6.1,SARSA算法使用状态动作对的预期收益值Q值与贝尔曼方程来求得最优值函数,以获得最优策略,具体的Q值更新公式为:k k‑1 k k‑1

Q(st,at)=Q (st,at)+α[Rt+1+γ·Q(st+1,at+1)‑Q (st,at)]步骤6.2,设定动作选择策略为基于模拟退火的动作选择策略:首先在当前动作空间中随机选择动作 采取随机动作 和采取Q值最大的动作的概率分别为 和P(at=argmaxQ(s,a))计算公式为:k

步骤6.3,设计模拟退火过程为:Tu=λ ·T0,Tu为当退火温度,T0为初始温度,Tf为停止温度,λ为降温速率,k为当前迭代轮数,当Tu<Tf时,停止迭代,输出当前值函数Q为最优值函*数Q,并根据当前值函数获得最优策略

步骤7,依据步骤6求解得到的最优策略在环境中移动一次;

步骤8,判断全局任务是否被满足,如果满足则停止,机器人停止移动;如果不满足则返回步骤4,机器人继续进行移动。

2.根据权利要求1所述的一种环境和运动不确定下的机器人复杂任务路径规划方法,其特征在于,步骤1中,采用栅格法将机器人全局环境划分为n个区域,用集合C={c1,c2,…,cn}表示;

生成全局环境的邻接矩阵N,N为n×n的对称矩阵,如果区域ci和区域cj相邻,则N(i,j)=1,否则N(i,j)=0,且N(y,i)=0,i=1,2,…,n。

3.根据权利要求1所述的一种环境和运动不确定下的机器人复杂任务路径规划方法,其特征在于,步骤2中,机器人需要满足的复杂任务要求由一个合取范式描述:式中:G为描述途径任务的合取范式,O为描述禁止访问任务的析取范式,F为描述终点任务的析取范式;对于G和O,定义中途任务区域的集合 与访问中途任务区域集合对应的命题 即机器人在轨迹中访问Πi中的区域时命题Πi为真;对于F,定义终点任务区域的集合 与停止在终点任务区域集合对应的命题 即机器人最终停止在πi中区域时命题πi为真;

其中,G=g1∧g2∧...∧gn, F=f1∧f2∧...∧fn, Pgi∈Pt,Po∈Pt,Pfi∈Pf;最终的目标是使合取范式 为真;同时,定义观测函数H: h: 描述地图区域与任务区域的对应关系;对所有ci∈C,如果 则表示ci是中途任务区域Πi中的区域之一,如果则ci不是中途任务区域;同样的,如果 则表示ci是停止任务区域πi中的区域之一,如果 则ci不是停止任务区域。

4.根据权利要求3所述的一种环境和运动不确定下的机器人复杂任务路径规划方法,其特征在于,步骤3中,具体包括以下步骤,步骤3.1,建立随机过程的状态方程

式中: 为

的概率,即栅格ci是中途任务区域Πi中栅格的概率,H为观测函数,为 的概

率即栅格ci是停止任务区域πi中栅格的概率,h为观测函数,A为过程常数描述了改随机过程随时间演化的特性, 和为过程误差描述了由于外界干扰带来的随机性, 和 均服从N(0,R)的高斯分布;

步骤3.2,定义机器人的环境观测变量:

其中,

步骤3.3,根据实际传感器误差输入传感器的观测误差:ei,j;

步骤3.4,初始化机器人对环境的估计:

步骤3.5,定义机器人对环境的第k轮先验估计:步骤3.6,定义机器人对环境的第k轮后验估计:其中,

5.根据权利要求4所述的一种环境和运动不确定下的机器人复杂任务路径规划方法,其特征在于,步骤4中,具体包括以下步骤,步骤4.1,使用卡尔曼滤波算法根据状态方程和观测值更新环境的估计结果:其中, 是机器人对环境的第k轮先验估计,A为过程常数, 是第k轮估计的过程误差, 是机器人对环境的第k轮后验估计, 是第k轮过程先验方差矩阵,R是过程误差中的高斯分布方差,ei,j是传感器的观测误差, 是机器人的环境观测变量,k是第k轮过程后验方差矩阵,K  是第k轮的卡尔曼增益;通过不断地观测、更新,机器人最终可以获得环境的最佳估计;

步骤4.2,设定概率阈值以减小估计误差对后续求解的影响:其中 为设定的概率阈值。

6.根据权利要求1所述的一种环境和运动不确定下的机器人复杂任务路径规划方法,其特征在于,步骤7中,根据步骤6获得的当前最优策略 输入机器人在当前MDP中所处的状态 其中,c为当前机器人所处的栅格, 为当前中途任务要求G的满足情况向量, 为当前禁止访问任务要求的满足情况向量, 为当前停k k止任务要求的满足情况向量,获得当前状态下的最优动作a ,根据a在环境中移动一次,并到达下一状态 其中c′为下一状态机器人所处的栅格, 为当前途径任务要求G的满足情况向量, 为当前禁止访问任务要求的满足情况向量, 为当前停止任务要求的满足情况向量,并将 作为下一个MDP的初始状态。

7.根据权利要求6所述的一种环境和运动不确定下的机器人复杂任务路径规划方法,其特征在于,步骤8中,根据步骤7获得的下一状态 当时表示任务的所有逻辑要求被满足,算法停止,

否则进入步骤4。

8.一种环境和运动不确定下的机器人复杂任务路径规划系统,其特征在于,包括初始化模块、环境估计模块、运动控制模块和路径规划模块;

所述初始化模块用于将对机器人全局环境进行分解,获得空间集合与邻接矩阵;输入机器人需要满足的复杂任务要求,机器人的复杂任务要求由一个合取范式描述:建立环境估计的随机过程模型,初始化地图估计;

所述环境估计模块,基于卡尔曼滤波的环境估计算法,通过不断地观测、更新,机器人最终可以获得环境的最佳估计;设定概率阈值以减小估计误差对后续求解的影响;

所述运动控制模块用于根据当前的环境估计结果、任务要求与运动不确定性构建带有高斯过程的有限马尔可夫决策过程;所述有限马尔可夫决策过程五元组,包含状态空间S、动作空间A、转移函数T、奖励函数R、回报G;使用混合模拟退火的SARSA算法并求解当前值函数获得最优策略,具体包括以下步骤,步骤6.1,SARSA算法使用状态动作对的预期收益值Q值与贝尔曼方程来求得最优值函数,以获得最优策略,具体的Q值更新公式为:k k‑1 k k‑1

Q(st,at)=Q (st,at)+α[Rt+1+γ·Q(st+1,at+1)‑Q (st,at)]步骤6.2,设定动作选择策略为基于模拟退火的动作选择策略:首先在当前动作空间中随机选择动作 采取随机动作 和采取Q值最大的动作的概率分别为 和P(at=argmaxQ(s,a))计算公式为:k

步骤6.3,设计模拟退火过程为:Tu=λ ·T0,Tu为当退火温度,T0为初始温度,Tf为停止温度,λ为降温速率,k为当前迭代轮数,当Tu<Tf时,停止迭代,输出当前值函数Q为最优值函*数Q,并根据当前值函数获得最优策略

所述路径规划模块用于根据当前机器人状态与当前最优策略在环境中进行移动,移动后判断全局任务是否被满足,如果未满足则继续执行观测、估计、计算并移动,如果满足则算法结束,输出移动轨迹。