1.一种基于LQR近视距的无人机空战攻击方法,其特征在于,包括以下步骤:S1、使用深度强化学习算法在离线环境中对无人机进行训练;
S2、基于系统模型和目标跟踪信息,计算出最优的控制输入,根据近视距内的目标信息,选择合适的攻击策略;
所述步骤S1包括如下步骤:
S11:使用深度强化学习算法在离线环境中对无人机进行训练,使用Q‑learning算法学习无人机在不同状态下采取的最佳动作;
S12:使用函数逼近方法拟合Q值函数,定义动作向量sb,其中sb=[throttle,pitch,roll],throttle表示油门控制,pitch表示俯仰角控制,roll表示横滚角控制,定义Q值函数为Q(sa,sb),它估计在状态sa下,采取动作sb的长期累积奖励;
S13:通过自身传感器系统周期性感知我方无人机的态势信息sa,敌方态势信息sc,其中,sc为我方无人机通过摄像头传感器获得的基于视频图像的敌方态势信息,根据Minimum jerk算法进行轨迹跟踪,生成追击路径;
所述步骤S2包括如下步骤:
T
S21:将无人机的水平位置和速度设为状态量:X=[p v] ,将加速度设为输入量:u=a,则得到离散时间系统方程:Xd(k+1)=AXd(k)+Bad(k),其中, A为4*4离散时间状态转移矩阵,B为2*4离散时间输入矩阵,S22:将步骤S1所得到的Q值函数作为LQR控制器的成本函数,Q值函数在强化学习中表示了在状态sa采取动作sb时的长期累积奖励,视为状态的权重sa,将Q(sa,sb)作为Q矩阵;
S23:设定权重矩阵R,R为2*2矩阵,用于表示控制输入的权重,R矩阵用于平衡状态误差和控制输入的代价,控制输入的权重根据实际控制需求进行调整;
S24:LQR的优化目标为:
用线性规划方法求解最小代价函数:
T T T ‑1 T
P=Q+APA‑APB(R+BPB) BPA
得到最优的控制增益矩阵K:
‑1 T
K=R *B*P;
S25:在实时控制过程中,持续观测无人机的当前状态sa,计算状态误差e=satarget‑sa,其中satarget是期望的目标状态,根据控制增益矩阵K和状态误差e计算最优的控制输入u:u=‑K*e
S26:将计算得到的最优控制输入u施加到无人机系统中,以实现控制目标,无人机将根据LQR控制输入调整其动作和状态,持续观测状态并进行控制;
S27:无人机持续调整动作和状态,当实时位置满足近视距,敌方无人机在我方无人机的规划路径上时,采取碰撞形式击落敌方无人机。
2.根据权利要求1所述的基于LQR近视距的无人机空战攻击方法,其特征在于,所述步骤S11中,通过自身传感器系统周期性感知我方无人机的态势信息sa,其中v为我方无人机的速度信息,h为我方无人机高度态势信息,ψ, θ分别为无人机航向角,横滚角,俯仰角态势信息,以最大化长期累积奖励,构建Q值函数。
3.根据权利要求1所述的基于LQR近视距的无人机空战攻击方法,其特征在于,所述步骤S12步骤中,为了将Q值函数逼近为一个线性二次函数,需要定义一个特征向量phi(sa,sb)来表示状态和动作的特征,同时增加一些高次项和交叉项,引入非线性关系,即:通过与环境交互,收集一系列的样本数据,包括当前状态sa、采取的动作sb、奖励r和下一个状态sa',利用这些样本数据,建立一个训练集D,其中每个样本包含phi(sa,sb)和目标Q值targetQ,即:D={(phi(sa1,sb1),targetQ1),(phi(sa2,sb2),targetQ2),...}。
4.根据权利要求1所述的基于LQR近视距的无人机空战攻击方法,其特征在于,所述步骤S12中,使用线性回归来优化权重向量w,使得估计的Q值函数逼近目标Q值,线性回归的优化目标表示为:其中n为样本数量。
5.根据权利要求1所述的基于LQR近视距的无人机空战攻击方法,其特征在于,所述步T骤S12中,通过线性函数逼近方法,将Q值函数表示为Q(sa,sb)=w*phi(sa,sb),其中w是线性回归的权重向量,重复执行上述步骤S1,通过不断收集样本数据、计算目标Q值、线性回归拟合和更新Q值函数,逐渐优化Q值函数的估计。