1.一种基于多智能体的深度强化学习策略优化防御方法,其特征在于,包括以下步骤:(1)在包含有目标智能体和多个对抗性智能体的自动驾驶环境获取全局环境状态数据和局部环境状态数据,利用决策梯度算法模型初始化对抗性智能体和目标智能体,决策梯度算法模型包括Actor网络模型和Critic网络模型;
(2)对抗性智能体的目标是尽可能地对抗攻击目标智能体,使目标智能体执行错误决策动作,根据对抗性智能体对目标智能体的攻击成功与否,将对抗性智能体的状态转换过+ ‑渡过程数据 分别存在经验回放缓冲区D和经验回放缓冲区D中,其中,x表示对抗性智能体观测到全局环境状态数据,包括其他对抗性智能体、目标智能体及其预期奖励值,a表示对抗性智能体在环境下采取的策略动作,表示对抗性智能体的个体奖励值,x'表示+ ‑对抗性智能体可观测的下一个全局环境状态数据,从经验缓冲区D和D中采集数据更新对抗性智能体对应的决策梯度算法模型参数;
其中,对对抗性智能体对应的决策梯度算法模型进行训练时,当对抗性智能体对目标智能体的攻击成功时,对对抗性智能体给予对抗奖励,即 表示第i个对抗性智能体在t时间步时的对抗奖励, 表示第i个对抗性智能体在t时间步时的个体奖励值,α表示对抗奖励因子,参与获胜的对抗性智能体有k个,则α取+ ‑
其中,从经验缓冲区D 和D中采集数据更新对抗性智能体对应的决策梯度算法模型参+ ‑数时,从经验缓冲区D采样η(t)·S,从经验缓冲区D 中采样(1‑η(t))·S,其中,t表示时间步,S表示采样总数,当t在前M时间步时,η(t)取0.5,当t大于M时间步时,η(t)取0.75,利用这样的采样策略采集数据来更新对抗性智能体对应的决策梯度算法模型参数;
(3)在步骤(2)基础上,当对抗性智能体得到其对抗性策略后,将对抗性智能体与目标智能体一起进行博弈训练,训练过程中,目标智能体的状态转换过渡过程数据(s0,a0,r0,s'0)存储在经验缓冲区D,其中,s0表示目标智能体的可观测的局部环境状态数据,包括靠近目标智能体的对抗性智能体,a0表示目标智能体在s0和对抗性策略影响下采取的策略动作,r0表示目标智能体的即时奖励,s'0表示目标智能体在对抗性智能体影响下可观测到的下一个环境状态数据,从经验缓冲区D中采集数据更新目标智能体对应的决策梯度算法模型参数,直到博弈训练结束为止;
(4)应用时,将采集的局部环境状态数据输入至目标智能体对应的决策梯度算法模型中,经计算输出决策动作指导目标智能体执行。
2.如权利要求1所述的基于多智能体的深度强化学习策略优化防御方法,其特征在于,步骤(2)中,对对抗性智能体对应的决策梯度算法模型进行训练时,在初始随机探索过程,对抗性智能体通过对初始化的Actor网络模型的输出随机添加噪声值来随机选择动作值,即 其中,si表示第i个对抗性智能体的全局环境状态数据,Nt表示第t时间步时添加的随机噪声值, 表示Actor网络模型在参数θi下针对的输出。
3.如权利要求1所述的基于多智能体的深度强化学习策略优化防御方法,其特征在于,+ ‑步骤(2)中,从经验缓冲区D和D中采集数据更新对抗性智能体对应的决策梯度算法模型参数过程为:+ ‑
对抗性智能体从经验缓冲区D 和D 中进行数据采样,假设n个对抗性智能体的Actor网络和Critic网络参数分别记为 同时令策略价值函数 通过计算预期的累计
奖励函数的梯度来更新Actor网络参数:
± + ‑
其中,a0:n={a0,...,an},D 表示经验缓冲区D和经验缓冲区D;
通过最小化实际累积的奖励函数和动作值Q函数之间的损失函数L(.)来更新Critic网络参数:其中,a0:n={a0,...,an}, 表示实际累积的奖励值,γ为衰减因子,取[0,1]之间的值。
4.如权利要求1所述的基于多智能体的深度强化学习策略优化防御方法,其特征在于,步骤(3)中,从经验缓冲区D中采集数据更新目标智能体对应的决策梯度算法模型参数过程为:目标智能体从经验缓冲区D中采样N个状态转换,通过计算预期的累计奖励函数的梯度来更新Actor网络的策略参数通过最小化实际累积的奖励函数和动作值Q函数之间的损失函数Loss来更新Critic网络参数其中, γ 为衰减因子,取[0 ,1]之间的值,