利索能及
我要发布
收藏
专利号: 2025106121830
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-06
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于WOA‑改进TD3算法的车辆纵向控制方法,其特征在于:所述方法建立纵向动力学模型,基于待控制车辆的行驶工况配置关联车辆的行驶状态策略;引入不对称Actor‑Critic网络机制,建立基于马尔可夫决策过程的TD3算法网络预测模型,建立所述预测模型包括以下步骤:S3.1 建立待控制车辆的状态空间和动作空间;

S3.2设计待控制车辆的多目标控制的奖惩函数;

S3.3 引入不对称的Actor‑Critic架构,建立包括一个Actor网络及两个Critic网络的预测模型;

对其输出的期望加速度以优先经验回放机制及WOA优化算法进行迭代训练,训练所述预测模型包括以下步骤:S4.1 构建优先经验回放缓冲池,用于存储交互数据,初始化,以WOA初始优化后的最优向量解码为预测模型的超参数;获取初始状态 ,其中,dact为待控制车辆与前序车辆的间距,ddes为期望安全距离,v为待控制车辆的车速,vp为前序车辆的速度;

S4.2 在当前状态下,Actor网络 根据当前策略选择并执行动作 ,获得下一状态和奖惩函数状态;将经验数据存入优先经验回放缓冲池;

S4.3 从优先经验回放缓冲池采样一个批次的经验数据,采样概率 与优先经验回放机制中的优先级 相关;

S4.4 使用Actor网络的目标策略网络选择下一动作,并根据Critic网络计算目标Q值;

S4.5 更新Critic网络并计算当前Critic网络的损失,基于优先经验回放机制,计算每个经验样本的重要性采样权重;

S4.6 基于预设的延迟更新Actor网络的规则,若满足更新条件,则更新一次Actor网络,并计算Actor网络的损失,否则直接进行S4.7;

S4.7 根据计算的采样概率 ,从优先经验回放缓冲池随机选择一组经验数据,并根据TD误差更新经验优先级,其中,Si为当前样本的状态,ai为当前样本的执行动作,Ri为当前样本的奖惩函数,Si+1为下一样本的状态;

S4.8 更新目标Critic网络;

S4.9 当达到设定的训练回合数或性能满足要求时,结束训练并获得最优期望加速度,否则继续进行WOA优化迭代,重复步骤S4.2至S4.8;

以训练后的预测模型对待控制车辆进行纵向控制。

2.根据权利要求1所述的一种基于WOA‑改进TD3算法的车辆纵向控制方法,其特征在于:关联车辆包括待控制车辆的前序车辆及旁侧车辆,所述纵向动力学模型定义满足,,其中, 为k时刻待控制车辆与前序车辆的间距误差, 为k时刻待控制车辆与前序车辆的间距, 为k时刻的期望安全距离, 为k时刻待控制车辆与前序车辆之间的速度差、 为k时刻待控制车辆的车速, 为k时刻前序车辆的速度,为前序车辆的位置, 为待控制车辆位置, 为k时刻待控制车辆的加速度,为计算时间步长。

3.根据权利要求2所述的一种基于WOA‑改进TD3算法的车辆纵向控制方法,其特征在于:关联车辆的所述行驶状态策略包括直行状态、变道状态、刹车状态;配合所述行驶状态策略设置随机扰动。

4.根据权利要求1所述的一种基于WOA‑改进TD3算法的车辆纵向控制方法,其特征在于:所述多目标控制的奖惩函数包括安全性奖励函数、相对速度惩罚、加速度平滑性惩罚、碰撞惩罚及持续跟随奖励。

5.根据权利要求1所述的一种基于WOA‑改进TD3算法的车辆纵向控制方法,其特征在于:所述Actor网络包括三层全连接隐藏层,Actor网络的学习率 由WOA算法优化迭代后传递;

两个Critic网络分别包括四层全连接隐藏层,Critic网络的学习率 由WOA算法优化迭代后传递。

6.根据权利要求1所述的一种基于WOA‑改进TD3算法的车辆纵向控制方法,其特征在于:采样概率 满足 ,其中, 为样本 的优先级, 为优先级强度,idk为索引,代表优先回放缓冲池中的每个经验,pidk为由idk索引的优先级;

重要性采样权重满足 ,其中, 为重要性采样修正因子, 为优先经验

回放缓冲池的大小;

TD误差满足 ,其中, 为待控制车辆在

当前时刻获得的即时奖励, 为待控制车辆在下一时刻采取动作的价值估计,为待控制车辆在当前时刻采取动作的价值估计,为折扣因子。

7.根据权利要求6所述的一种基于WOA‑改进TD3算法的车辆纵向控制方法,其特征在于:WOA优化迭代包括以下步骤:S4.1.1 确定需要优化的超参数及搜索范围;

S4.1.2 WOA算法初始化,设置最大迭代次数,初始化种群并随机生成一组;初始化每只鲸鱼的适应度,以训练后的累计奖励值作为适应度函数;初始化全局最优解和最优适应度;

S4.1.3 对每只鲸鱼使用当前的超参数配置改进的TD3算法模型;利用累积奖励值计算适应度,若大于最优适应度则更新全局最优解;

S4.1.4 更新当前最优解。

8.一种基于WOA‑改进TD3算法的车辆纵向控制系统,其特征在于:所述系统包括配置于任一待控制车辆的控制器、驱动系统、传动系统和传感设备,传感设备获取待控制车辆的关联车辆的行驶状态,传输至控制器,控制器采用权利要求1~7之一所述的基于WOA‑改进TD3算法的车辆纵向控制方法获取期望加速度,控制器将期望加速度转换为控制指令,驱动系统基于所述控制指令控制待控制车辆的加速和制动,传动系统配合驱动系统实现动力传递。