利索能及
我要发布
收藏
专利号: 2023110158152
申请人: 电子科技大学长三角研究院(衢州)
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度强化学习的多智能体自主决策方法,其特征在于,应用场景包括:地图、地图中心的夺控点、己方智能体、敌方智能体;己方智能体与敌方智能体拥有相同型号和数量的坦克、战车和步兵,以夺取控制的夺控点为任务;决策方法包括以下步骤:S1、使用一个公共的神经网络 作为目标策略网络Target‑Actor、每个智能体的策略网络Actor,并通过硬编码的方式将智能体的编号及类型作为区分智能体的环境信息提供给目标策略网络Target‑Actor进行训练学习,目标策略网络Target‑Actor为不同的智能体生成不同的对抗策略;

每个智能体的策略网络Actor通过对环境的局部观测信息oi进行决策,输出相应的动作分布和动作ai,同时环境对智能体的动作产生即时奖励S2、奖励重塑模块对即时奖励 进行重塑,得到Rt;奖励重塑模块的计算公式为:

其中,Rt为t时刻重塑的环境即时奖励; 为t时刻环境的即时奖励; 为t时刻智能体的内部即时奖励, 计算公式表示为:其中 为t时刻智能体i的内部即时奖励,其计算公式为:

其中 为t时刻智能体i的剩余弹药数; 为t时刻敌方智能体的数量;η为控

制距离因子对内部即时奖励影响的超参数;di,t为t时刻智能体i与夺控点间的距离;ε′为大于0的极小值;

S3、根据重塑后的Rt,得到智能体与环境的交互产生的经验数据;并基于二级经验队列的全局经验回放池PT‑Buffer来存储和维护每个智能体的历史经验数据;全局经验回放池PT‑Buffer包括二级经验队列PT1和PT2,使用全局经验回放池PT‑Buffer存储历史经验数据时,将经验τi的时间差分误差δi,即评价网络的当前Q值和目标Q值的差和经验的使用次数构成自身的优先级TD‑N;由此得到历史经验τi=[St,At,Rt,S′t+1,A′t+1]|t=i的优先级Pi:其中i∈[1,k];

S4、通过概率求和树从全局经验回放池PT‑Buffer中采集训练样本数据;

S5、根据步骤S4得到的训练样本数据对目标策略网络和全局评价网络进行训练;

S6、将训练得到的目标策略网络参数同步到每个智能体的策略网络Actor。

2.根据权利要求1所述的一种基于深度强化学习的多智能体自主决策方法,其特征在于,所述经验数据表示为[S,O,A,R,S′,A′],其中,S表示当前时间步的全局状态空间集,R表示智能体当前时间步的重塑后的奖励集,O表示智能体当前时间步的局部观测信息集,A表示智能体当前时间步的动作信息集,S′表示下一时间步的全局状态空间集,A′表示智能体下一时间步的动作信息集。

3.根据权利要求2所述的一种基于深度强化学习的多智能体自主决策方法,其特征在于,全局状态空间包括夺控点信息、地图信息和实时裁决信息,所述夺控点信息具体为:所有夺控点的位置、分值、是否被控制;所述地图信息具体为:地图的大小、地图每个位置的地形和高度;所述实时裁决信息具体为:环境当前的时间步、己方净胜分、己方智能体的数量。

4.根据权利要求3所述的一种基于深度强化学习的多智能体自主决策方法,其特征在于,智能体的局部观测信息包括:夺控点位置、地图大小、敌我净胜分、当前时间步;己方位置、血量、弹药量;敌方位置、血量。

5.根据权利要求4所述的一种基于深度强化学习的多智能体自主决策方法,其特征在于,公共的神经网络 的结构为:包含一个由32核5×5卷积层、64核3×3的卷积层、128核1×1的卷积层组成的主干网络,一个256维全连接层以及一个12维的全连接层。

6.根据权利要求5所述的一种基于深度强化学习的多智能体自主决策方法,其特征在于,全局评价网络结构为:包括动作值函数网络和混合网络;

其中动作值函数网络包括进行特征提取与融合的主干网络,1个256维全连接层和1个1维的全连接层,其中主干网络包括32核5×5卷积层、64核3×3的卷积层、128核1×1的卷积层;

混合网络包括多个特征映射模块,每个特征映射模块结构为:包括一个256维的全连接层和一个64维的全连接层。

7.根据权利要求6所述的一种基于深度强化学习的多智能体自主决策方法,其特征在于,步骤S4具体为:从全局经验回放池PT‑Buffer中采集训练样本数据的采样概率计算式为:

其中,Psamp(i)是经验τi的采样概率,α是采样概率的调节因子,在α=0时,对经验进行均匀采样;当α=1时,则按照经验的采样概率即Psamp(i)的大小进行偏好采样;

按照采样概率Psamp(i)对PT2中的历史经验数据进行排序分组,并将采样概率Psamp(i)的倒数作为经验τi在概率求和树上的叶子结点值,将每对相邻叶子结点值的和作为相应父节点的值,以此逐步生成概率求和树;

然后,记按照采样概率Psamp(i)从全局经验回放池PT‑Buffer中采集到的训练样本大小为N,将PT2中的历史经验平均分为N个区间,并在每个区间里随机选取一个值作为抽样概率Psample,然后从根节点开始遍历求和树,当Psample大于节点值Pnode时,更新Psample为Psample与Pnode的差,当Psample小于Pnode时,更新Psample为Pnode,并继续遍历该节点的子树,直到叶子节点时结束;

最后对叶子结点中的经验数据进行均匀采样得到对应的样本数据;

重复以上过程得到N条训练样本数据。