利索能及
我要发布
收藏
专利号: 2023108738060
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度强化学习干扰估计器的高性能抗干扰方法,应用于运动控制系统,其特征在于,所述基于深度强化学习干扰估计器的高性能抗干扰方法,包括:建立运动控制系统的等价输入干扰状态空间模型;

设计状态观测器,根据运动控制系统的系统输出 和所述状态观测器的状态观测器增益 得到状态观测值 ;

设计内模系统,并根据运动控制系统的等价输入干扰状态空间模型和内模系统建立运动控制系统的状态反馈控制器,所述状态反馈控制器根据内模系统的状态 和状态观测值 得到状态反馈输出 ,公式表示如下;

其中,为采样时刻,且 =1,2,3…为正整数, 为内模系统的状态 的反馈增益,为状态观测值 的反馈增益;

设计深度强化学习干扰估计器,所述深度强化学习干扰估计器包括等价输入干扰估计器和滤波器 ;

所述等价输入干扰估计器根据观测器增益L、状态反馈输出 和系统控制输入得到总和扰动估计值 ;

基于深度强化学习调整所述滤波器的滤波器增益;

深度强化学习干扰估计器的最终输出为 ,表示对总和扰动估计值 滤波后的扰动估计值, 采用公式表示如下:式中, 和 分别代表Z变换和Z逆变换, 和 分别表示扰动估计值 和总和扰动估计值 的Z变换;

基于扰动估计值 ,在状态反馈控制输出 中加入对其的负补偿量,得到带有扰动补偿的系统控制输入表示如下:其中, 表示运动控制系统的系统控制输入;

其中,

所述基于深度强化学习调整所述滤波器的滤波器增益,包括:采用深度Q网络在给定干扰和随机传感器测量噪声环境下进行滤波器增益学习;

所述深度Q网络的状态空间、动作空间、奖励函数设计如下:式中, 为状态空间, 为输入信号, 为运动控制系统的系统输出,为轨迹跟踪误差, 表示第 个控制周期的滤波器增益, 表示第 个控制周期的滤波器增益, 为动作空间, 表示动作,包含增益 减速、保持、加速动作, 表示减小值、 表示增大值, 、 表示 的上、下界, 为奖励函数,abs表示绝对值函数, 为权重参数,设定为正常数, 表示输出误差绝对值, 表示关联噪声抑制指标。

2.根据权利要求1所述的基于深度强化学习干扰估计器的高性能抗干扰方法,其特征在于,所述建立运动控制系统的等价输入干扰状态空间模型,包括:将运动控制系统表示为:

式中, 表示k时刻的运动控制系统的系统状态, 和 分别为系统位置和速度,x(k+1)表示k+1时刻的运动控制系统的系统状态, 为运动控制系统的系统控制输入, 为运动控制系统的系统输出, 为传感器测量噪声, 是具有系统阶数相同维度的系统矩阵, 表示外部扰动, 表示外部扰动对应的增益矩阵,公式满足约束条件: 构成的运动控制系统具有能观性和能控性;

引入等价输入干扰概念,定义 为运动控制系统的等价输入干扰,即 对系统输出产生的影响等价外部扰动 对系统输出 的影响,则改写运动控制系统为:得到运动控制系统的等价输入干扰状态空间模型。

3.根据权利要求1所述的基于深度强化学习干扰估计器的高性能抗干扰方法,其特征在于,所述设计状态观测器,包括:设计状态观测器为:

式中, 表示 时刻的状态观测值, 是具有系统阶数相同维度的系统矩阵, 为系统输出 的观测值, 为状态观测器增益。

4.根据权利要求1所述的基于深度强化学习干扰估计器的高性能抗干扰方法,其特征在于,所述滤波器采用公式表示如下:式中,为Z变换算子,为指数函数, 为运动控制系统的采样周期, 为截止角频率,为滤波器增益。

5.根据权利要求1所述的基于深度强化学习干扰估计器的高性能抗干扰方法,其特征在于,滤波器 采用深度Q网络学习调整滤波器增益 的步骤包括:步骤1:用随机网络参数 初始化网络 ,复制相同的参数 来初始化目标网络 ,初始化经验回放池 ,选取折扣因子 ,探索概率 ;

步骤2:从状态空间中选择状态;

步骤3:随机生成阈值 ,若 ,选取动作序号 ,执行动作 ;否则,随机选取动作序号,执行动作 ;

步骤4:调整滤波器增益 ;

步骤5:计算奖励 ,状态变为 ;

步骤6:将 存储到经验池 中;

步骤7:若 中数据达到数量阈值,从中选取M个数据 ,对每个数据用目标网络计算临时项 ;随后,最小化目标损失函数 ,更新当前网络 ;

步骤8:间隔 次采样后,复制相同的参数 来更新目标网络 。

6.根据权利要求1所述的基于深度强化学习干扰估计器的高性能抗干扰方法,其特征在于,所述内模系统用公式表示如下:式中, 表示 时刻的内模系统的状态, 和 为具有内模系统阶数相同维度的系统矩阵。