1.一种移动机器人的导航控制方法,其特征在于,包括:
利用训练好的导航控制模型控制移动机器人在真实环境中获取目标任务数据;
根据目标任务数据调整导航控制模型中子策略的使用次序,利用导航控制模型对移动机器人进行导航;
所述导航控制模型的训练过程包括:
利用分层强化学习算法构建导航控制模型,将LSTM网络引入导航控制模型作为轨迹编码网络;
搭建导航控制模型的训练环境和移动机器人模型,通过导航控制模型来控制移动机器人与训练环境进行交互获取多组训练数据集;
通过训练数据集对导航控制模型进行训练,获得更新后的导航控制模型,利用更新后的导航控制模型控制移动机器人模型再次与训练环境交互获得多组元训练数据集,通过元训练数据集对导航控制模型的LSTM轨迹编码网络进行元学习训练;重复迭代更新获得函数收敛的最终导航控制模型。
2.根据权利要求1所述的一种移动机器人的导航控制方法,其特征在于,通过训练数据集对导航控制模型进行训练,获得更新后的导航控制模型的方法包括:通过包含多种任务的训练数据集对导航控制模型进行训练,构建导航控制模型的损失函数,根据损失函数计算所述导航控制模型的训练损失值,并通过训练损失值梯度下降方法对导航控制模型参数进行迭代更新,保存每个任务的导航控制模型参数。
3.根据权利要求2所述的一种移动机器人的导航控制方法,其特征在于,通过元训练数据集对导航控制模型的LSTM轨迹编码网络进行元学习训练的方法包括:根据导航控制模型的损失函数构建元训练损失函数,计算所述导航控制模型的元训练损失值,并通过元训练损失值梯度下降方法对导航控制模型中LSTM轨迹编码网络的参数进行迭代更新,获得函数收敛的最终导航控制模型,对最终导航控制模型的参数进行保存。
4.根据权利要求3所述的一种移动机器人的导航控制方法,其特征在于,搭建导航控制模型的训练环境和移动机器人模型,通过导航控制模型来控制移动机器人与训练环境进行交互获取多组训练数据集的方法包括:采用机器人物理仿真引擎MuJoCo平台构建移动机器人模型,对移动机器人模型的传感器参数进行初始化设置;
设计包含若干个障碍物区域和若干个目标点区域的训练环境,分别在障碍物区域和目标点区域随机生成障碍物和目标点获得训练任务,重置障碍物和目标点的位置采集多组训练任务,利用导航控制模型控制移动机器人与训练环境中各组训练任务交互获取训练数据集。
5.根据权利要求4所述的一种移动机器人的导航控制方法,其特征在于,通过导航控制模型控制移动机器人与训练环境中各组训练任务交互获取训练数据集包括:在训练环境中生成一组训练任务,将移动机器人模型放入训练环境,通过移动机器人模型的传感器获取传感器信息;根据传感器信息编码轨迹信息,输出轨迹状态zt和记忆隐变量(ht,ct);
导航控制模型中顶层策略网络πΩ根据得到轨迹状态zt选择策略序号ωt,启用导航控制模型中策略序号ωt对应的子策略网络 所述子策略网络 根据轨迹状态zt输出动作at;
移动机器人模型执行动作at后,移动机器人模型与训练环境进行交互,获得奖励rt,若碰到障碍物时,rt=‑1,若碰到目标点时,rt=1,否则,rt=0;
所述移动机器人模型通过传感器获取下一组传感器信息并编码轨迹信息,获取新的轨迹状态zt+1;
导航控制模型的终止网络 根据轨迹状态zt+1选择是否终止子策略网络 执行动作;若终止子策略网络 执行动作,通过导航控制模型的值函数网络QU重新选择启动的子策略网络利用导航控制模型控制移动机器人模型与该组训练任务进行交互,获取一组训练数据集 在训练环境中重置训练任务,重复迭代过程,获取多组训练数据集
6.根据权利要求5所述的一种移动机器人的导航控制方法,其特征在于,根据传感器信息进行编码轨迹信息,输出轨迹状态zt和记忆隐变量(ht,ct)的方法包括:由传感器信息获取当前时刻移动机器人模型的状态st,读取上一时刻保存的记忆隐变量(ht‑1,ct‑1),移动机器人模型初始状态的记忆隐变量(ht‑1,ct‑1)为零向量;将记忆隐变量(ht‑1,ct‑1)和状态st输入导航控制模型的长短时记忆网络 进行编码轨迹信息,输出轨迹状态zt和记忆隐变量(ht,ct)。
7.根据权利要求6所述的一种移动机器人的导航控制方法,其特征在于,所述导航控制模型的损失函数包括损失函数Lossc、损失函数Lossa和损失函数Lossl;
所述损失函数Lossc的表达公式为:
所述损失函数Lossa的表达公式为:
所述损失函数Lossl的表达公式为:
Lossl=Lossa+Lossc
公式中, 表示在轨迹状态为zi时,选取累积奖励期望最大的子策略表示在轨迹状态为zi+1,选取子策略 时,获得最大累计奖励期望的数值;γ表示为折扣率,范围在[0,1]。
8.根据权利要求7所述的一种移动机器人的导航控制方法,其特征在于,利用更新后的导航控制模型控制移动机器人模型再次与训练环境交互获得多组元训练数据集的方法包括:利用一组训练数据 根据导航控制模型的损失函数,分别计算损失函数Lossc以参数U为自变量的梯度 损失函数Lossa以参数θ为自变量的梯度 损失函数Lossa以参数 为自变量的梯度 以及损失函数Lossl以参数 为自变量的梯度利用梯度下降方法将值函数网络QU、子策略网络 终止网络 和长短时记忆网络 的网络参数更新为U′、(ω,θ′)、 并保存导航控制模型参数;
利用更新后的导航控制模型控制移动机器人模型再次与该组训练任务交互,获取一组元训练数据 重复迭代过程获得T组元训练数据,构建元训练数据集
9.一种移动机器人的导航控制系统,其特征在于,包括:
目标任务采集模块,用于利用训练好的导航控制模型控制移动机器人在真实环境中获取目标任务数据;
策略迁移模块,用于根据目标任务数据调整导航控制模型中子策略的使用次序;
导航模块,利用导航控制模型控制移动机器人进行导航;
导航控制模型构建模块,利用分层强化学习算法构建导航控制模型,将LSTM网络引入导航控制模型作为轨迹编码网络;
训练数据集获取模块,用于搭建导航控制模型的训练环境和移动机器人模型,通过导航控制模型来控制移动机器人与训练环境进行交互获取多组训练数据集;
预训练模块,用于通过训练数据集对导航控制模型进行训练,获得更新后的导航控制模型,利用更新后的导航控制模型控制移动机器人模型再次与训练环境交互获得多组元训练数据集,通过元训练数据集对导航控制模型的LSTM轨迹编码网络进行元学习训练;重复迭代更新获得函数收敛的最终导航控制模型。
10.计算机可读存储介质,其特征在于,其上存储有计算机程序,该程序被处理器执行时实现权利要求1至权利要求8任意一项所述伪装目标检测方法的步骤。