1.一种基于强化学习的机器人机械臂轨迹规划方法,其特征在于,包括以下步骤:S1:采集机器人机械臂的环境数据,并对其进行标准化处理,生成标准化后的环境数据;
S2:基于标准化后的环境数据,构建具有运动估计的时间感知状态表示,具有运动估计的时间感知状态表示包括机械臂当前状态、状态历史信息以及基于历史信息预测的周围动态障碍物的运动信息;
S3:基于具有运动估计的时间感知状态表示,构建TD3模型,包括双Q网络、延迟更新机制和目标噪声机制,得到TD3模型;
S4:基于所述TD3模型,引入Time‑Aware Regularization机制,结合任务的时间约束和预测冲突惩罚项,优化TD3模型中的轨迹规划策略,时间约束包括任务完成的时间限制,机器人机械臂的运动时间以及路径的平滑性要求,Time‑Aware Regularization机制通过为不同时间段的动作分配不同的权重,得到优化后的TD3模型;
S5:基于优化后的TD3模型,得到轨迹规划策略,生成机器人机械臂的动作指令,动作指令包括机械臂各关节的速度和加速度命令,并将动作指令传递至机械臂进行实际操作;
S6:在执行过程中,实时监测机器人机械臂的动作及周围环境变化,当环境和机器人状态出现异常,则重新采集新的环境数据并更新状态表示;
S7:输出执行结果,执行结果为机器人机械臂经过轨迹规划后的运动路径;
所述S4具体包括:
S4.1:基于TD3模型,确定任务的时间约束,时间约束包括任务完成的总时间限制、机械臂的运动时间限制以及路径平滑性要求,任务完成的总时间限制为预定的任务期限,运动时间限制为机械臂执行轨迹所需的最大允许时间,所述路径平滑性要求定义为机械臂的运动具有一定的平稳度;
S4.2:在TD3模型的训练过程中,针对时间约束,通过设计时间感知的奖励机制,将任务完成时间、运动时间以及路径平滑性要求转换为加权奖励项,并包含预测冲突惩罚项;
S4.3:所述预测冲突惩罚项基于运动估计信息,判断机械臂的期望运动轨迹与动态障碍物的估计运动轨迹在未来预定时间窗口内发生冲突的潜在风险,并在潜在冲突风险超过安全阈值时,施加惩罚;
S4.4:引入Time‑Aware Regularization机制,Time‑Aware Regularization机制通过在TD3模型中为不同时间段的动作分配不同的权重,对于任务开始阶段,优先考虑快速到达目标,而在任务接近完成阶段,优先考虑路径的平滑性和安全性,避免突变动作;
S4.5:通过Time‑Aware Regularization机制,根据每个时间段的特点,优化TD3模型中的策略网络,优化过程通过加权不同时间段的策略输出,使得在时间约束下,机器人机械臂能够实现最优的轨迹规划;
S4.6:通过结合时间感知的奖励机制和Time‑Aware Regularization机制,优化后的TD3模型根据任务的时间要求、运动时间限制和路径平滑性要求生成合理的轨迹规划策略,得到优化后的TD3模型。
2.根据权利要求1所述的一种基于强化学习的机器人机械臂轨迹规划方法,其特征在于,所述S1具体包括:S1.1:采集机器人机械臂的环境数据,所述环境数据包括机械臂当前位置、速度、加速度、末端执行器状态、周围动态障碍物的位置、速度和加速度、以及温度、湿度、光照强度;
S1.2:对采集的环境数据进行噪声过滤和异常值检测,对经过噪声过滤和异常值检测后的环境数据进行标准化处理,获得标准化后的环境数据。
3.根据权利要求1所述的一种基于强化学习的机器人机械臂轨迹规划方法,其特征在于,所述S2具体包括:S2.1:基于标准化后的环境数据,提取机械臂的当前状态信息,当前状态信息包括机械臂的位置、速度、加速度、末端执行器的工作状态及与环境的相对位置;
S2.2:基于标准化后的环境数据,提取周围环境的历史状态信息,历史状态信息包括周围动态障碍物的位置、速度、加速度的变化趋势,以及环境因素在过去预定时间段内的变化数据;
S2.3:基于历史状态信息,预测周围动态障碍物在未来预定时间窗口内的运动轨迹,得到运动估计信息;
S2.4:结合机械臂当前状态信息和历史状态信息和运动估计信息,构建包含时间感知的状态表示,时间感知的状态表示通过加权融合当前状态信息与历史状态信息,生成时间感知的状态表示;
S2.5:对时间感知的状态表示进行处理,得到适用于轨迹规划的状态特征,状态特征包含机械臂及周围环境的综合信息,得到时间感知的状态表示。
4.根据权利要求1所述的一种基于强化学习的机器人机械臂轨迹规划方法,其特征在于,所述S3具体包括:S3.1:基于时间感知的状态表示,构建TD3模型,TD3模型包括两个Q网络,两个Q网络分别用于估计当前策略的价值函数,通过学习当前状态和动作的值来优化轨迹规划,该过程通过最大化Q值来实现;
S3.2:引入延迟更新机制,延迟更新机制包括在每次训练迭代中,延迟更新策略网络和目标网络,通过每隔多次更新后才对策略网络和目标网络进行更新,减少策略更新的方差;
S3.3:在Q网络的训练过程中,加入目标噪声机制,目标噪声机制通过对目标值引入噪声来平滑Q值的计算,噪声机制在每次更新目标值时对目标值进行扰动;
S3.4:基于两个Q网络,延迟更新机制与目标噪声机制,得到TD3模型。
5.根据权利要求1所述的一种基于强化学习的机器人机械臂轨迹规划方法,其特征在于,所述S5具体包括:S5.1:基于优化后的TD3模型,获取轨迹规划策略,所述轨迹规划策略包括各关节的期望动作,轨迹规划策略输出为任务需求的具体关节命令;
S5.2:根据所述轨迹规划策略,计算机器人机械臂各关节的期望速度和加速度,计算过程根据目标状态、当前状态和任务约束条件进行优化;
S5.3:将计算得到的各关节速度和加速度命令进行处理,所述处理包括对运动命令进行平滑处理,避免出现速度和加速度的突变;
S5.4:根据平滑后的速度和加速度命令,生成各关节的控制指令,所述控制指令用于控制机器人机械臂的运动;
S5.5:将生成的控制指令传递至机器人机械臂,启动机械臂进行实际的任务操作,任务操作包括执行路径跟踪、避障和其他任务动作。
6.根据权利要求1所述的一种基于强化学习的机器人机械臂轨迹规划方法,其特征在于,所述S6具体包括:S6.1:实时监测机器人机械臂的运动状态,包括机械臂的当前位置、速度、加速度以及末端执行器的状态,实时监测通过传感器设备完成,所采集的运动数据用于评估机械臂的实时运动表现;
S6.2:实时监测周围环境的变化,包括动态障碍物的位置、速度、加速度及其他环境数据,所述环境数据通过多个传感器进行采集;
S6.3:根据监测到的环境变化和机械臂的状态异常,判断是否需要对当前轨迹进行调整,判断依据包括机械臂与障碍物的距离、速度变化以及任务的实时要求;
S6.4:若检测到环境变化与机器人状态异常,则重新采集新的环境数据并更新状态表示,更新后的状态表示包括机械臂的当前状态、周围环境变化信息以及历史状态信息;
S6.5:根据更新后的状态表示,重新计算并优化轨迹规划,生成新的轨迹规划策略,所述轨迹规划策略包括新的速度、加速度命令以及路径调整指令。
7.根据权利要求1所述的一种基于强化学习的机器人机械臂轨迹规划方法,其特征在于,所述S7具体包括:S7.1:根据控制指令,机器人机械臂按照规划轨迹执行动作,动作包括机械臂各关节的运动;
S7.2:在执行过程中,监测机械臂的实际运动轨迹,与规划轨迹进行实时比对,计算轨迹误差,轨迹误差包括位置误差、速度误差和加速度误差,轨迹误差用于判断执行精度是否达到任务要求;
S7.3:根据轨迹误差,对控制指令进行动态调整,所述动态调整通过反馈机制实时调整各关节的速度和加速度;
S7.4:对机器人机械臂的执行路径进行后处理,所述后处理包括平滑轨迹;
S7.5:输出最终的执行结果,执行结果为机械臂经过轨迹规划后的最终运动路径,最终运动路径包括关节的实际位置和执行轨迹。