1.基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于,包括以下步骤:S1、对行驶工况进行分析,确定轮毂电机驱动电动汽车的纵向驾驶动力学模型;
S2、根据实际工况,根据动态偏心对永磁同步电机不平衡磁拉力的影响对永磁同步电动机进行径向不平衡磁拉力建模,建立永磁同步电机模型;
S3、建立车辆垂直振动动力学模型,并确定垂直振动动力学运动方程;
S4、使用滤波白噪声来建立随机路面激励模型;
S5、将S1‑S4获得的纵向驾驶动力学模型、永磁同步电机模型、车辆垂直振动动力学模型、随机路面激励模型进行耦合,形成1/4车辆悬架系统,并根据S1‑S4中纵向驾驶动力学模型、永磁同步电机模型、车辆垂直振动动力学模型、随机路面激励模型的动力学运动方程计算得出1/4车辆悬架系统的状态空间方程;
S6、在1/4车辆悬架系统中搭建基于TD3算法的主动悬架力预测网络模型,以车身垂直加速度、悬架挠度、路面激励与电机不平衡磁拉力作为输入,并输出悬架的主动控制力;
S7、对S6的主动悬架力预测网络模型进行迭代训练;
S8、在仿真软件中利用强化学习工具箱建立主动悬架力预测网络模型的仿真模型,完成仿真验证。
2.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S1中,纵向驾驶动力学模型的纵向驾驶动力学运动方程如下:;
其中, 为整车质量,为车辆实际行驶速度, 为等效纵向力, 、 分别为空气阻力和滚动阻力, 为垂直载荷, 为车轮转动惯量, 表示车轮行驶角速度, 表示轮毂电机产生的加速/制动力矩; 为空气阻力系数, 为车辆前部迎风面积, 为滚动阻力系数, 为车身质量, 为车辆簧下质量, 为重力加速度, 为轮胎弹簧连接件等效刚度, 为车轮半径, 为轮胎挠度。
3.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S2中,径向不平衡磁拉力建模时在仿真软件中通过电磁理论和动力学理论对永磁同步电动机进行建模,建立电动机在车辆行驶过程产生的径向不平衡磁拉力表达式如下:偏心转子气隙近似表示为:
;
其中, 为转子不偏心时的平均气隙长度,α为气隙处与偏心转子所在坐标轴x轴的夹角,为转子几何中心相对于x轴的方向角,r为转子动偏心量;
把气隙磁导展开为级数形式:
;
其中,相对偏心 , 为空气磁导系数,Fourier系数 为:;
根据永磁同步电机原理,空载时三相同步电机的气隙基波磁动势表达为,其中, 为转子激磁电流的基波磁动势, 为电机磁极对数, 为电频率,α为气隙处与偏心转子所在坐标轴x轴的夹角;
气隙磁密分布为: ;
忽略磁密切向分量,法向应力表示为 ;
在转子表面进行周向积分,得到极对数大于3的永磁同步电机径向不平衡磁拉力的解析表达式为 ;
其中, , 、 、 分别为 、 、
时的Fourier系数。
4.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S3中,建立车辆垂直振动动力学模型以轮毂电机气隙为分界面,拆分电机内定子与外转子,垂直振动动力学运动方程如下:;
其中,mb、ms1、mw、ms、mr分别为车身质量、车轴重量、轮胎质量、永磁同步电机定子重量、永磁同步电机转子重量;ks、ksa、kt、kd2、kb、kd1为连接件等效弹簧刚度;cs、cd1、cd2为等效阻尼结构;Fd为永磁同步电机径向不平衡磁拉力;xb、xs1、xw、xz、xs、xr分别为车身、车架、轮胎、道路、定子与转子垂直方向上的位移。
5.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S3中,在车辆垂直振动动力学模型中,加入主动悬架控制器,其产生的主动悬架控制力用 表示。
6.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S4中,随机路面激励模型的计算式为:;
其中, 为拟合位移PSD值, 为空间参考频率,为车辆实际行驶速度, 是均匀分布的白噪声,其均值为0,强度为1,采样频率为100hz, 为低截止频率,其值通常由下式求得: , 为路面的空间截止频率。
7.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S5中,1/4车辆悬架系统的状态空间方程为 ;
其中,为控制模型状态量,
xb 、
xs1、xw、xz、xs、xr分别为车身、车架、轮胎、道路、定子与转子垂直方向上的位移,为随机噪声,包含了路面不平度激励 与永磁同步电机不平衡磁拉力 ,表示为 ;y为输出变量,具有五个变量作为悬架振动的评价指标,分别为车身垂直加速度 、电机加速度 、悬 架 挠 度 、转 子 偏 心 以 及 轮 胎 弹跳 量 ,即;A、B、C为状态空间方程的系数矩阵。
8.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S6中,主动悬架力预测网络模型在TD3算法目标函数的基础上引入双结构目标函数算法,计算式为:;
其中,Q为状态动作值函数, 为目标Q值、 为两个Actor网络的参数, 、为两个Critic目标网络的参数,为即时奖励,为折扣因子,为当前系统状态;
通过使用来优化单个Actor网络来降低计算成本,同时对使用相同的目标函数,即,算法在更新时取 和 的最小值作为目标值;
算法网络结构使用四层Actor网络及四层Critic网络;
其中,Actor网络采用四层式神经网络,输入为系统状态s,输入层有7个节点;第一个隐藏层的激活函数使用ReLU函数,节点数为300;第二个隐藏层的激活函数同样使用ReLU函数,节点数为200;输出层为动作s',有1个节点,网络的学习率设置为0.001;同时采用延迟更新策略,即设置Critic网络每完成6次更新过程之后才对Actor的目标网络进行一次更新;
Critic网络同样采用四层式神经网络,输入为系统状态s和动作a的集合,故输入层包含8个节点;两个隐藏层的节点数分别为200、100;隐藏层的激活函数均采用ReLU函数,网络的学习率设置为0.002。
9.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于:S6中,在主动悬架力预测网络模型中设置奖惩函数;
奖励函数 ,计算式如下:
;
式中, 为车身垂直加速度的导数, 为车身垂直位移, 为车身垂直位移变化量;
设置能量惩罚函数 ,计算式如下:
;
式中, 表示悬架的作动力的输入, 表示悬架作动力输入的变化率;
奖惩函数计算式为: 。
10.根据权利要求1所述的基于TD3算法的轮毂电机驱动电动汽车垂直振动控制方法,其特征在于,S7中,迭代训练步骤如下:S71、设计和初始化,具体为:
设计Actor和Critic网络,包括学习率、衰减系数、最小批量样本数、最大迭代次数、样本储存池容量、延迟更新频率与策略噪声方差参数;
随机初始化Actor和Critic估计网络;
初始化目标Actor和Critic网络,其权重参数为, , , ;
初始化经验储存池D用于存储学习过程中产生的经验数据;
S72、获取初始状态和噪声,具体为:
获取1/4车辆悬架系统的初始状态 ;
其中, 为车身垂直加速度, 为车身垂直位移, 为悬架挠度;
初始化随机噪声 ,其中, 为路面不平度激励, 为永磁同步电机径向不平衡磁拉力;
S73、基于当前状态通过Actor网络获得动作,具体为:在状态 下,Actor网络通过当前策略生成动作 ;其中 表示悬架的作动力的输入;
执行动作并获得新状态 和奖惩函数状态 ;
储存经验数据 到经验池D中,其中 、 分别表示为当前时刻和下一时刻的状态量, 、分别为当前执行动作与奖惩函数;
S74、采样并计算目标动作与目标Q值,具体为:从经验池D中随机采样一个批次的样本 ;
其中,使用目标Actor网络计算目标动作 ;
使用目标Critic网络计算目标Q值 ;
其中, 为即时奖励,为折扣因子,为目标Q网络值, 为即时状态, 两个Critic目标网络的参数;
S75、更新Critic网络,具体为:
使用梯度下降法更新Critic网络:
;
其中,s为当前状态量, 两个Critic目标网络的参数,为当前动作, 为目标Q值;
使用梯度下降法更新Actor网络参数:
, 为critic网络的下降梯度;
进行软更新,更新目标Q网络和目标策略网络的参数,使得目标网络的参数向当前网络的参数缓慢靠拢:,其中, 为软更新系数;
基于当前状态获得最新动作: ;
S76、重复步骤S71至S75,经过M个回合的训练,网络逐步优化,在不需要人为调试主动力的情况下,通过Reward函数提供的奖励值自动学习控制策略,此时,对于给定的状态 ,通过策略网络直接计算出最优动作 。