1.一种基于注意力机制的多智能体深度强化学习策略优化方法,其特征在于,所述方法包括如下步骤:
搭建多智能体强化学习协作模拟场景,并利用深度确定性策略梯度算法训练多智能体;
个性生成器利用概率分类器对智能体观察到的图片的概率分布进行预测,利用带有奖励折扣因子的奖励函数对概率分布器进行训练,使得概率分布器区分智能体更加准确,从而使得智能体的个性逐渐显现;
利用图像注意力机制获取每个时间步智能体观察到的图片的特征信息并正则化奖励折扣因子,当特征信息集中在智能体对应任务附近时,给予智能体一个正奖励折扣因子,当特征信息不在智能体对应任务附近时,给予智能体一个负奖励折扣因子;
将得到的奖励折扣因子更新至个性生成器中的奖励函数得到新设置的奖励函数;将新设置的奖励函数更新至深度确定性策略梯度算法的多智能体强化学习框架中对多智能体进行训练,直至多智能体达到收敛。
2.根据权利要求1所述的基于注意力机制的多智能体深度强化学习策略优化方法,其特征在于,所述利用深度确定性策略梯度算法多智能体的训练步骤如下:初始化动作探索的一个随机进程N,获得初始状态x;
对每个智能体i,对当前的策略和探索过程选择动作其中oi表示智能体i在t时刻的观测,Nt表示在t时刻的探索,θi表示Actor网络的参数,表示状态空间到动作空间的映射;
执行动作a=(a1,a2...aN),并观察所获得的奖励r和下一个状态x′;
各个Actor收集当前状态、动作以及下一个状态(x,a,r,x′)存入经验回放池;
j j j j
从经验回放池中随机抽样小批量样本S(x ,a ,r ,x′),其中j表示某个时刻;
设置奖励函数:
其中, 表示在j的下一个时刻下智能体i的Q值函数,a′k角标表示下一个k时刻通过观j j
察所得到的动作;ri表示在j时刻下智能体i的奖励值,γ为奖励折扣因子,x′为j时刻的下一个状态,(a′1,....a′N)为动作a=(a1,a2...aN)的下一个动作;
通过最小化奖励函数的loss来更新Critic网络:j
其中,x为j时刻的状态, 为j时刻的动作, 表示在j时刻下智能体i的Q值函数;
利用采样数据计算的策略梯度来更新Actor网络:j
其中, 为智能体i在j时刻的观测,x 为j时刻的状态, 为j时刻的动作;
令θ′i为每个智能体i更新目标网络参数,其中τ∈(0,1)为随机参数:θ′i←τθi+(1‑τ)θ′i同时,训练过程中,多智能体中的每个智能体各自与环境交互得到经验数据一次获得每个智能体的策略。
3.根据权利要求2所述的基于注意力机制的多智能体深度强化学习策略优化方法,其特征在于,对深度确定性策略梯度算法需进行训练,训练步骤如下:各Actor网络收集数据并存入缓冲池,当缓冲池的阈值大于预设的阈值时,开始学习;
利用Actor网络更新策略参数,利用Critic网络更新动作值参数并对Critic网络进行更新。
4.根据权利要求2所述的基于注意力机制的多智能体深度强化学习策略优化方法,其特征在于,所述个性生成器的训练过程如下:从缓冲池中进行小批量随机采样,并利用概率分类器计算交叉熵;
通过最小化交叉熵更新分类神经网络参数;
利用新的神经网络参数设置新的奖励函数。
5.根据权利要求4所述的基于注意力机制的多智能体深度强化学习策略优化方法,其特征在于,所述概率分类器表示为:P(i)=C(i|Oi)
其中:C(i/Oi)是每个智能体i根据其观测Oi所得到的任务分类概率,P(i)表示预测概率;
所述交叉熵的计算公式表示如下:CE=‑∑Z(i)log P(i)其中,Z(i)为真实分类概率;
所述分类神经网络参数的更新公式表示如下:θi←min(‑∑Z(i)log P(i))其中,θi为分类神经网络参数;
所述新的奖励函数表示如下:其中,Ri表示智能体的i的奖励值,γ为奖励折扣因子。
6.根据权利要求5所述的基于注意力机制的多智能体深度强化学习策略优化方法,其特征在于,正则化奖励折扣因子的步骤如下:利用Grad‑CAM获取智能体i在t时刻观测 的特征信息:计算概率分类器网络最后一层softmax输出的概率p对最后一层特征图所有像素的偏导数:
其中,i是智能体的序号,A是最后一层卷积输出的特征图,k是特征图的通道维度的序号,h和w分别是高宽维度的序号;
将特征图每个像素的偏导数求出来后,取一次宽高维度上的全局平均:将上一步所得到的i类相对于最后一层卷积层输出的特征图的第k个通道的敏感程度当作权重将最后一层特征图加权,并进行线性组合,再送入ReLU激活函数处理:对得到的Grad‑CAM热力图进行特性信息分析,若智能体i1所观测到的热力图特征信息显示集中在其对应的任务ti附近,则给予智能体一个正向奖励:γ=(1‑λ)r
其中λ智能体与对应任务经归一化处理后的距离,r表示智能体i完成任务所获得的即时奖励,此时奖励折扣因子γ为正;
若智能体i1所观测到的特征信息不在其对应的任务ti周围,或所观测到的特征信息与其他智能体所对应的子任务相关,则给予智能体一个负奖励:γ=‑(1‑λ)r
即离非本任务越近,所获得的负奖励越高,奖励折扣因子γ为负。