利索能及
我要发布
收藏
专利号: 2024114249653
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于复合控制框架的四轮独立转向与驱动车辆路径跟踪控制方法,其特征在于,将基于模型的双层控制器与基于无模型的深度强化学习辅助控制器相结合,通过深度强化学习辅助控制器对双层控制器的控制变量进行补偿,实现对控制目标精确的跟踪;具体实施步骤包括:步骤1,建立四轮独立转向与驱动车辆的动力学模型;

步骤2,建立深度强化学习过渡模型;四轮独立转向与驱动车辆的状态向量包括可测量的状态 和随机干扰 ;具体包括:在深度强化学习训练过程,将四轮独立转向与驱动车辆的运动控制过程写作: ;由于基于深度强化学习的辅助控制器要根据车辆状态实时对车辆进行控制,构建如下优化问题:(10)

式中, 为基于深度强化学习的辅助控制器动作,表示各车轮的驱动转矩和转向角的辅助控制输入, 表示四轮独立转向与驱动车辆动力学函数, 表示辅助控制器, 表示上层控制器, 表示下层控制器, 表示通过微分运算从横向位移 和横摆角 获得的纵向速度、横向速度和横摆速度的参考路径状态;

将深度强化学习控制器的状态设计为 ,其中 表示

当前实际车辆状态和理想状态之间的误差,表示纵向速度误差,表示横向位移误差,表示航向角误差, 表示控制端广义力;

系统的奖励函数设计为:

(11)

式中, 表示路径跟踪误差的正增益参数, 表示连续控制平稳性的正增益参数, 表示跟踪误差的极限值, 表示是惩罚因子,表示辅助控制变量的变化速度,其目的是保证控制过程具有一定的平滑性;

步骤3,选择孪生延迟深度确定性策略梯度算法实现深度强化学习;

步骤4,采用双层控制架构解决四轮独立转向与驱动车辆在路径跟踪控制中的横纵向耦合问题,该架构由基于非线性模型预测控制的上层控制器和基于序列二次规划的下层控制器组成,上层控制器通过理想路径跟踪状态信息以及车辆当前状态,计算得到车辆当前的状态误差 ,并通过非线性模型预测控制器求解最优控制增量;下层控制器通过序列二次规划求解代价函数,并分配上层控制器的广义控制量 ,以计算下一时刻每个车轮的横向力和纵向力;

步骤5,利用复合控制框架通过两个控制回路对车辆进行控制。

2.如权利要求1所述的基于复合控制框架的四轮独立转向与驱动车辆路径跟踪控制方法,其特征在于,步骤1具体包括:四个轮胎分别被索引为 ;在轮胎坐标系中,每个轮胎的纵向力、横向力、垂向力和转向角分别用 和 表示;车身的动力学方程写作:(1)

式中, 和 表示车辆质量和惯性矩, 表示轮胎与车辆重心之间的距离, 和分别表示车辆的纵向加速度、横向加速度和横摆角加速度;

在路径跟踪控制器的设计过程中,通过调节转向角和车轮扭矩来确定各轮胎的纵向力和横向力;在轮胎坐标系中,采用魔术公式来表示轮胎模型的非线性特征:(2)

式中,表示纵向力或横向力,表示纵向滑移率或滑移角,峰值系数 、刚度系数 、形状系数 和曲率系数 为经验公式的拟合系数;

纵向滑移率 的计算公式为:

(3)

式中, 和 表示轮胎半径和旋转角速度, 轮胎中心位置的实际速度,轮胎速度通过以下公式计算(4)

轮胎的转向角和扭矩表示为

(5)

式中,为驱动转矩, 为滚动摩擦系数, 为轮胎的惯性矩;

基于上述分析,建立了包含七个自由度的车辆动力学模型,通过合理地分配输入参数,以期有效地控制车辆状态,实现高性能的路径跟踪;车辆动力学模型的控制输入矩阵为(6)式中,矩阵 包括车辆左前轮、右前轮、左后轮和右后轮的驱动转矩和转向角;车辆状态矩阵定义为(7)

为了便于设计基于深度强化学习的辅助控制器,四轮独立转向与驱动车辆的动力学方程写作非线性矩阵形式(8)

式中,表示双层控制器的控制输出矩阵, 表示车辆加速度扰动矩阵,表示上层控制器与下层控制器控制量的映射矩阵,表示车辆质量矩阵;为了真实反映外部干扰对车辆动力学的影响,引入了控制端干扰矩阵,该矩阵表示作用在各车轮上的横向和纵向扰动力(9)

方程(9)中的外部干扰通过轮胎动力学模型传递到车身动力学模型,从而确定车身加速度扰动矩阵 。

3.如权利要求1所述的基于复合控制框架的四轮独立转向与驱动车辆路径跟踪控制方法,其特征在于,步骤3具体包括:在正式训练开始之前,智能体通过随机选择动作与环境进行初步交互,以积累足够的初始经验;此步骤确保经验回放池中有足够多样的样本供后续训练使用;对于初始的时间步 ,智能体在每个状态 下随机选择动作 ,执行动作后记录即时奖励 和更新状态 ,并将新的转移样本 存储到经验回放池 中,直到经验池中存储了足够多的样本;初始化策略网络 、两个Q网络 和 ,及其对应的目标网络 、 和,目标网络的初始参数与当前网络相同;经验回放池 在第一步时已经开始收集样本,这些样本将用于后续训练阶段;

从经验回放池 中随机采样一个批次样本 ;经验回放池通过存储和随机采样打破样本的时间相关性,有效减少了策略过拟合问题;然后,使用目标策略网络 生成下一状态 的目标动作 ,并引入噪声 进行平滑化,防止策略网络对动作的过度拟合(12)使用目标Q网络 和 计算目标Q值,取其最小值以减少Q值的过估计问题(13)

式中,为目标Q值,为即时奖励;

将损失函数构建为Q值估计与目标Q值的均方误差: ,使用随机梯度下降法最小化两个Q网络的损失函数;通过损失函数的优化,TD3将逐渐调整Q网络的参数和 ,以提高Q值估计的准确性;TD3引入了延迟策略更新机制,即每更新两次Q网络后更新一次策略网络 ;策略网络的目标是寻找最大化Q值的动作(14)

式中,通过 对 的梯度传播来迭代 ;TD3通过延迟更新,在更加稳定的Q值估计基础上优化策略网络,避免策略网络过早依赖不准确的Q值,使用软更新方法更新目标Q网络和目标策略网络的参数,使目标网络两个目标网络分别从主网络中进行平滑更新(15)式中,为软更新步长;在训练完成后,策略网络 已优化为最优策略;此时,对于给定的状态 ,通过策略网络直接计算出最优动作 ,该动作 用于指导智能体在环境中的实际决策。

4.如权利要求2所述的基于复合控制框架的四轮独立转向与驱动车辆路径跟踪控制方法,其特征在于,步骤4所述的上层控制器通过理想路径跟踪状态信息以及车辆当前状态,计算得到车辆当前的状态误差 ,并通过非线性模型预测控制器求解最优控制增量,具体包括:(16)

式中, 表示时间 的状态误差, 和 分别表示误差权重矩阵以及控制增量权重矩阵,表示松弛因子,以避免无法找到可行解;通过代价函数计算得到广义控制量,以计算车辆下一时刻的状态(17)

式中, 、 和 分别表示车身的广义纵向力、横向力和横摆力矩;

为平衡和最小化车轮利用率,下层控制器通过序列二次规划求解代价函数,并分配上层控制器的广义控制量 ,以计算下一时刻每个车轮的横向力和纵向力(18)

式中,和 分别表示轮胎利用率最小化权重系数和轮胎利用率平衡权重系数;通过轮胎动力学模型将每个车轮的横向力和纵向力分别计算为转角和转矩,得到下一时刻车辆末端控制变量,然后传递给车身实现路径跟踪的闭环控制。

5.如权利要求1所述的基于复合控制框架的四轮独立转向与驱动车辆路径跟踪控制方法,其特征在于,步骤5具体包括:双层控制回路和无模型的深度强化学习辅助控制回路;车辆状态信息传递给上层控制器,以计算下一时刻所需的广义力;同时,以深度强化学习神经网络作为辅助控制器,根据车辆状态信息和外部扰动生成辅助控制项,对上层控制变量进行补偿;下层控制器则负责分配上层控制器传递的广义力,最后给出复合控制框架下的控制变量。