1.一种基于A3C和事件触发的网络化伺服系统控制方法,其特征在于,包括以下步骤;
1)建立网络化伺服控制系统的系统模型:p m q
定义x(k)∈R 表示系统的状态向量,u(k)∈R 表示系统的控制输入,ω(k)∈R 表示系p统的干扰,y(k)∈R表示系统输出,其中p、m、q分别表示x(k)、u(k)、ω(k)的维度,A,B,F,C都是满足维数要求的系统参数矩阵,则系统模型为:x(k+1)=Ax(k)+Bu(k)+Fω(k)y(k)=Cx(k)
设计基于状态反馈信号的伺服系统控制器:u(k)=Kx(k),K表示控制器增益;
2)设计考虑离散系统的事件触发策略:在网络系统中,受到通信资源受限和长距离传输的影响,存在传输延迟τj,其中为大于0的实数,应用零阶保持器,系统在事件产生器下的动态模型表示为:其中,kj表示系统的采样时刻,当前采样时刻的数据x(kj)是否被发送用来更新控制器由以下的条件判断:T
[x(k)‑x(kj)] Φj[x(k)‑x(kj)]T
≤εjx(k)Φjx(k)
其中,Φj为正定矩阵,然后通过公式推导得到延时函数为:定义最大采样时间 得到:
其中,
3)基于事件触发的网络化伺服系统控制方案设计:定义上一时刻与下一时刻采样时间之间状态误差为:事件触发的判断条件可改写为:
T T
ek(k) Φje(k)k≤εjx(k‑d(k))Φjx(k‑d(k))基于事件触发的网络化伺服控制系统模型可以被描述为:其中 表示系统的初始状态;
4)控制器设计:
给定0≤εj≤1,γ>0,τM>0和适当维度的矩阵Pj>0,Qj>0,Rj>0,Zj>0,Φj>0和K使得下列不等式成立:则基于事件触发的网络化伺服控制系统模型为在均方意义上是指数稳定的并且具有给定的H∞性能水平γ,可得控制器增益K:
5)强化学习A3C方案设计:
基于A3C的强化学习方法对阈值进行优化,得到在保证系统性能的情况下,触发次数较少的动态阈值,强化学习的问题通常可以转化为一个动态规划问题,所以将动态阈值问题转化为一个多维动态规划问题,并用一个五元组(Sr,Ar,Pr,λr,r)表示,其中,Sr设计状态空间、Ar为设计动作空间、Pr为概率转移矩阵、λr为设计折扣函数、r为设计奖励函数;
5.1)设计状态空间Sr,Sr用来表示系统的状态集,为了让训练的阈值使系统能够在保持良好性能的情况下尽可能地减少触发次数,将第n段时间内触发的总数记为tn,将这段时间T内系统的平均输出值记为yn,因此,定义sr,n=[Xn yn tn],其中Xn表示第n段时间内系统的最后一次输出的状态;
5.2)设计动作空间Ar,Ar是由一组在环境中执行的Agent组成,Agent的每一次执行,都会对环境进行更新,Agent的输出是所需要的事件触发条件的阈值,对Agent进行扩张,定义ar,n=εj,nar,n≤εj,其中εj,n表示第n段时间内的阈值,εj表示阈值的上限,将第n段时间内的阈值进行扩张处理,所以定义ar,n,i=εj,n,i=εj,n+0.001*h,h∈[‑5,4],i∈[1,2,...,10];
5.3)概率转移矩阵Pr:Sr*Ar→Λ(Sr)表示在当前环境执行当前动作ar,n后,下一个环境状态sr,n+1的分布,即推导出来的基于事件触发的伺服系统状态空间方程;
5.4)设计折扣函数λr:λr的大小决定了对长期奖励的影响,λr∈[0,1];
5.5)设计奖励函数r(sr,n,ar,n):r(sr,n,ar,n)是将一组相对应的状态‑动作映射到一个标量上的函数,其表示当前动作ar,n施加在以sr,n为状态的当前环境后得到的即时奖励,同时使用双奖励函数,首先,在对Agent进行扩张的情况下,计算出每一条子线程的即时奖励,定义 其中,sr,n,i表示第n段时间内第i条子线程最后的环境状态,并筛选出最小的奖励 定义总奖励函数,其中sr,n,b表示εj,n,i=εj,n的子线程的阈值, 表示奖励为 的环境状态,rb表示状态为sr,n,b的即时奖励, 表示对触发频率和收敛速度的比重。
2.根据权利要求1所述的一种基于A3C和事件触发的网络化伺服系统控制方法,其特征在于所述步骤2)中,延时函数的推导过程如下:由于网络中存在的长时延和短时延,所以,考虑两种延时情况:
2.1.、当 时,定义延时函数:
d(k)=k‑kj,k∈[kj+τj,kj+1+τj+1)可知:
2.2.、当 时,
定义两种时间间隔:
其中 得到:
因此,当l=1,2,3,...d‑1时,x(kj)和x(kj+l)满足:T
[x(kj+l)‑x(kj)] Φj[x(kj+l)‑x(kj)]T
≤εjx(kj+l)Φjx(kj+l)定义:
得到: