1.一种基于未知机械臂模型的深度强化学习抑振系统,其特征在于:包括机械臂模块、振动采集模块、处理器和抑振控制模块;
所述机械臂模块,是振动抑制的对象,能够是机器人的悬臂,也能够是单独存在的机械臂;
所述振动采集模块,包括陀螺仪和TTL转485模块,陀螺仪通过固定装置固定在机械臂的末端,实时采集机械臂末端的偏航、俯仰、横滚姿态的振动数据,所述振动数据以TTL电平信号发送至TTL转485模块,以提高其传输距离至1000m,然后将其转化为485电平信号,发送至抑振控制模块;
所述处理器,用来接收实时采集到的机械臂振动数据,并进行处理分析,同时搭载抑振控制模块,实现对机械臂的振动抑制控制;
所述抑振控制模块,其功能为根据实时接收采集到的机械臂振动数据,推导出机械臂系统的阻尼比与频率,进而设计输入整形器,对机械臂运行的加速度信号进行整形,并再次得到振动数据;此时根据深度强化学习DDPG算法选取一个动作,再次对机械臂运行的加速度信号进行整形,得到振动数据,对此次过程的振动数据进行处理,再次根据强化学习DDPG算法选取动作,不断循环此训练过程,直至机械臂达到较好的抑振效果。
2.一种如权利要求1所述的基于未知机械臂模型的深度强化学习抑振系统的抑振方法,其特征在于:将深度强化学习与输入整形二者结合;在机器人机械臂精确动力学模型未知的情况下,通过深度强化学习DDPG算法,不断优化输入整形器参数,以此来对机械臂振动进行优化,以提高机械臂工作效率。
3.根据权利要求2所述的一种基于未知机械臂模型的深度强化学习抑振方法,其特征在于:该方法不需要已知机械臂精确的动力学模型,而是将机械臂系统近似为二阶系统,通过陀螺仪传感器采集机械臂末端振动数据,以此来求解系统的阻尼比与频率,进而设计输入整形器;具体实现步骤如下:步骤1,根据机械臂振动数据推导出其阻尼比与频率参数,将机械臂系统近似为二阶系统,取机械臂振动数据中的俯仰数据,取俯仰数据的最大值为系统的峰值YP,对应的时间为峰值时间tP,对应的超调量为σ,超调量的计算公式如下:σ=[YP‑Y(∞)]/Y(∞)*100% (1)其中,Y(∞)为系统稳定下的输出,ε为系统的阻尼比,联立(1)(2)式求得系统的阻尼比ε,计算公式如下:系统的峰值时间tP计算公式如下:
由式(3)计算出系统的阻尼比,峰值时间tP直接读取,由此得系统的频率wn计算公式为:由此便求出机械臂系统的阻尼比与频率;
步骤2;根据第一步求出的机械臂系统的阻尼比与频率,将机械臂系统近似为二阶系统,表达式为:根据拉普拉斯变换,将系统的表达式改写为传递函数的形式:
输入整形器的时域表达式为:
其中,Ai为脉冲幅值,ti为脉冲时滞,n为输入整形所包含的脉冲个数,对其进行拉普拉斯变换,得到其频域表达式为:引入输入整形后,二阶系统的响应为:
考虑到系统响应的快速性,取n=2,则有:
t1=0 (11)
A1+A2=1 (15)
由式(11)‑(15)便求得输入整形器的参数t1、t2、A1、A2,由此完成输入整形器的设计;
步骤3,对机械臂的加速度进行输入整形,设整形前加速度为a0,整形后的加速度:在0至t2时间段内,加速度a1=A1*a0/(A1+A2),在t2之后,加速度a2=a0,以此完成对机械臂加速度的整形;通过振动采集模块将整形后机械臂的振动数据再次发送至抑振模块;
步骤4,深度强化学习DDPG算法训练:将强化学习DDPG算法与输入整形器两者结合,通过DDPG算法的训练得到最优的输入整形器参数,以此达到最佳抑振效果。
4.根据权利要求3所述的一种基于未知机械臂模型的深度强化学习抑振方法,其特征在于:步骤4中,强化学习DDPG算法训练过程如下:基于深度确定性策略梯度算法,应用深度学习技术,同时基于Actor‑Critic算法的确定性策略算法,该算法中的Actor和Critic都使用深度神经网络来建立近似函数,直接从Actor的策略生成确定性的行为;该算法在学习阶段在确定性行为基础上增加一个噪声函数,以实现在确定性行为周围进行小范围探索;此外,该算法还为Actor和Critic网络分别备份了一套参数来计算行为价值的期待值,以更稳定的提升Critic的策略指导水平,从而减少因近似数据的引导性而发生不收敛的情况,共用到了两个Actor网络,两个Critic网络共4个网络;
奖励机制:在每个循环周期内,求该周期内的振动数据的方差,公式如下:
其中,Di为第i次训练周期,[x1x2x3…xn]为每个振动采样周期的振动数据,x0为0,将Di作为DDPG算法奖励函数的输入,奖励函数公式如下:能够看到振动数据的方差越小,表示机械臂运行越平稳,其奖励值便越大,反之,方差越大,运行过程中振动越剧烈,其奖励值越小;
搭建Critic网络:Critic网络接收的输入是状态以及行为动作,输出“状态‑行为对”的价值,所设计的Critic共有3个隐藏层,处理状态的隐藏层和行为的隐藏层先分开运算,其中处理状态的隐藏层有两个,分别为256个神经元,128个神经元,处理行为的隐藏层为128个神经元,最后通过一个隐藏层全连接在一起输出“状态‑行为对”价值;
搭建Actor网络:Actor网络的输入为状态,输出为行为动作,所设计的Actor共有3个隐藏层,分别为256个、128个、64个神经元,层与层之间全连接;
确定性策略下探索的实现:在生成的行为基础上添加一个随机噪声,使其在确切的行为周围实现一定范围的探索;噪声模型为Ornstein‑Uhlenbeck,能够生成符合马尔科夫过程的随机过程;
至此,完成DDPG算法框架的搭建,最后对该算法的学习率参数进行配置,完成DDPG算法的设计,通过此算法的训练,不断优化输入整形器参数,使机械臂工作越来越平顺。