1.基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:包括以下步骤:(1)在具有执行器故障和外部扰动的原系统状态空间模型基础上建立包含跟踪误差和状态增量的增广状态空间模型,并根据增广状态空间模型提出性能指标函数;
(2)根据性能指标函数提出值函数以及Q函数,并构建相应的最优控制输入、最坏外部扰动及最优控制增益、最坏外部扰动增益的表达式;
j
(3)给定能使系统稳定的最初的控制增益 与外部扰动增益 并收集数据θj j j
(k)及ρk ,其中, 分别是最初的控制增益和外部扰动增益,θ(k)及ρk 是第j次迭代所产生的包含系统生产信息的数据;
F F
(4)通过强化学习更新控制增益K1、外部扰动增益K2;
(5)如果达到迭代结束条件则迭代结束,否则转回步骤(4)继续迭代。
2.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(1)中的跟踪误差和状态增量的增广状态空间模型为:其中, xΔk+1是原系统在k+1时刻和k时刻的状态之差,yΔk+1是原系统在k+1时刻的跟踪误差; xΔk是原系统在k时刻和k‑1时刻的状态之差,yΔk是原系统在k时刻的跟踪误差;uΔk是原系统在k时刻的迭代更新率;wΔk是原系统在k时刻的外部扰动与在k‑1时刻的外部扰动之差;
是与{Zk,uΔk,wΔk}维数相匹配的系统矩阵,组成 的{A,B,C,D}是原系统的系统矩阵,I是单位矩阵;α是故障系数;Zk为增广状态空间模型在k时刻的状态,uΔk为增广状态空间模型在k时刻的输入,wΔk为增广状态空间模型在k时刻的外部扰动。
3.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(1)中基于所述增广状态空间模型提出的性能指标函数为:其中,Zi是增广状态空间模型在第i时刻的状态、uΔi是增广状态空间模型在第i时刻的输入,i=k,k+1,...,∞,wΔi是增广状态空间模型在第i时刻的外部扰动;Q、R分别是与状态Zi、输入uΔi维数相匹配的正定矩阵;γ≥0,γ代表持续干扰衰减水平。
4.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(2)中的值函数为:其中,Zk是增广状态空间模型在k时刻的状态, 是对称的正定矩阵,值函数满足条件
J*是待实现的性能指标J。
5.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(2)中的Q函数为:T T 2 T
Q*(Zk,uΔk,wΔk)=ZkQZk+uΔkRuΔk‑γwΔkwΔk+V*(Zk+1,uΔk+1,wΔk+1)其中,Zk是增广状态空间模型在k时刻的状态,uΔk是增广状态空间模型在k时刻的输入,wΔk是增广状态空间模型在k时刻的外部扰动,γ≥0,γ代表持续干扰衰减水平,Q、R分别是与状态Zk、输入wΔk维数相匹配的正定矩阵,V*(Zk+1,uΔk+1,wΔk+1)是增广状态空间模型在k+1时刻的值函数。
6.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(2)中的最优控制输入、最坏外部扰动及最优控制增益、最坏外部扰动增益的表达式为:‑1 ‑1 ‑1
uΔk=(Huu‑Huw(Hww) Hwu) (Huw(Hww) HwZ‑HuZ)Zk‑1 ‑1 ‑1
wΔk=(Hww‑Hwu(Huu) Huw) (Hwu(Huu) HuZ‑HwZ)Zk其中,矩阵Huu,Huw,Hww,Hwu,HwZ,HuZ是由Q函数所推得的矩阵H的组成部分。
7.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(3)中,让j=0,j是迭代指标,给定能使系统稳定的最初的控制增益F F 0 j j j j(K1)0和外部扰动增益(K2) ;收集数据θ(k)及ρk ,θ(k)及ρk是第j次迭代所产生的包含系统生产信息的数据。
8.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(4)中通过强化学习更新控制增益、外部扰动增益,根据以下公式进行:j j+1 j
θ(k)L =ρ(k)
j j+1 T j+1 T j+1 T j+1 T j+1 T=θ(k)×[(vec(L1 )) (vec(L2 )) (vec(L3 )) (vec(L4 )) (vec(L5 )) j+1 T T
(vec(L6 )) ]
j j j j j j j
其中,θ (k)=[θ1 (k) θ2 (k) θ3 (k) θ4 (k) θ5 (k) θ6 (k)],j+1 j+1 j+1 j
L1 =P ,L2 =HZu
+1 j+1 j+1 j+1 j+1 j+1 j+1 T,L3 =HZw ,L4 =Huu ‑R,L5 =(Huw ) ,Zk是增广状态空间模型在k时刻
的状态,uΔk是增广状态空间模型在k时刻的输入,wΔk是增广状态空间模型在k时刻的外部扰j+1动,Q、R分别是与状态Zk、输入uΔk维数相匹配的正定矩阵,P 是在第j+1次迭代所得到的P,j+1矩阵Huu,Huw,Hww,Hwu,HwZ,HuZ是由Q函数所推得的矩阵H 的组成部分,j+1指的是第j+1次迭F j F j代,(K1) 是第j次迭代所得到的控制增益,(K2) 是第j次迭代所得到的外部扰动增益。
9.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(4)中的控制增益和外部扰动增益依据以下公式进行更新:F j+1 F j+1
其中,(K1) 是第j+1次迭代所得到的控制增益,(K2) 是第j+1次迭代所得到的外部扰动增益。
10.根据权利要求1所述的基于强化学习的工业过程最小‑最大优化的容错控制方法,其特征在于:所述步骤(5)中的迭代结束条件为:l>0
F j F j+1
其中,l是非常小的正整数,(K1) 和(K1) 分别是第j次和第j+1次迭代所产生的控制F j F j+1增益,(K2) 和(K2) 分别是第j次和第j+1次迭代所产生的外部扰动增益。