1.一种基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,包括:对无人机采集的多源传感数据进行融合,构建包含空间占据信息、距离信息以及语义风险属性的多属性三维地图;
以无人机当前位置与目标位置为对角线顶点构建三维立方体作为包络区域,根据包络区域得到环境上下文向量;
将环境上下文向量输入至预训练的强化学习策略网络,输出一组路径规划偏好权重;
基于路径规划偏好权重构建临时代价函数,并在多属性三维地图中进行路径连通性测试;若通过连通性测试,则将当前路径规划偏好权重作为路径规划权重,若未通过连通性测试,则采用预设的保守权重作为路径规划权重;基于路径规划权重构建综合代价函数;
基于无人机所在环境选择对应的全局路径规划算法,利用选择出的全局路径规划算法,根据综合代价函数在多属性三维地图中搜索得到可行路径,并将可行路径转化为连续飞行指令。
2.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,所述对无人机采集的多源传感数据进行融合,构建包含空间占据信息、距离信息以及语义风险属性的多属性三维地图,包括:利用无人机采集传感器数据,对传感器数据进行激光雷达运动畸变矫正、体素栅格滤波以及相机畸变矫正;
基于处理后的传感器数据构建占据栅格地图,占据栅格地图包含占据体素和空闲体素,占据体素为有障碍物的体素,空闲体素为无障碍物的体素;
根据占据栅格地图计算空闲体素至最近的障碍物的欧氏距离和指向障碍物外部的排斥梯度,构建包含空间占据信息和距离信息的三维复合地图;
对无人机采集的图像进行语义解析以识别语义类别,根据预设的语义信息对应风险表将不同语义类别映射为对应的语义风险权重,生成二维风险图像;
获取无人机的即时位姿信息以及相机的内参矩阵,将二维风险图像与三维复合地图进行空间映射融合,形成多属性三维地图。
3.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,所述根据包络区域得到环境上下文向量,包括:提取包络区域内的所有体素的语义信息,得到子数据集;
根据子数据集统计占据体素与空闲体素的比例,得到障碍物密度与可通行空间的比例;
根据每个空闲体素距离最近障碍物的距离,计算包络区域内最窄通道的宽度;
统计占据体素与整个包络区域的体素体积占比,得到高风险体素体积占比信息;
根据包络区域内每个体素的语义风险权重计算包络区域的语义风险均值;
根据最窄通道的宽度、高风险体素体积占比信息、语义风险均值、无人机当前的线速度和无人机当前机头朝向与目标点之间的夹角,得到环境上下文向量。
4.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,还包括在构建临时代价函数之前对路径规划偏好权重进行安全性约束处理:检查路径规划偏好权重是否落在预设的安全参数空间内;
若超出安全参数空间,则通过剪裁或空间投影技术将路径规划偏好权重修改至安全参数空间的安全边界内。
5.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,所述综合代价函数用公式表示为:其中, 为第 个体素的综合代价,k为路径规划权重的数量, 为第 个路径规划权重, 为第 个体素的第 个路径规划权重对应的子代价。
6.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,所述基于所在环境选择对应的全局路径规划算法,包括:若包络区域所处的环境为室内,则选择A*算法作为全局路径规划算法;
若包络区域所处的环境为室外,则选择RRT*算法作为全局路径规划算法。
7.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,所述路径规划偏好权重包括:路径长度偏好权重、障碍间隙偏好权重、风险规避以及能耗偏好权重和路径平滑性偏好权重。
8.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,还包括在得到可行路径后,对可行路径进行平滑处理:采用B‑样条算法,以路径轨迹的三阶导数为平滑性度量指标,将折线路径转化为曲线轨迹;
将曲线轨迹转化为带有时间信息的坐标点;
将坐标点叠加至多属性三维地图中进行评估,若坐标点检测到碰撞,则沿当前坐标点指向相邻前后两个节点的向量夹角的角平分线方向移动当前坐标点,直至碰撞消除。
9.根据权利要求1所述的基于语义上下文感知强化学习的无人机路径规划方法,其特征在于,所述强化学习策略网络利用柏林噪声算法生成难度递增的虚拟模拟环境。