利索能及
我要发布
收藏
专利号: 2020114764976
申请人: 电子科技大学
专利类型:发明专利
专利状态:已下证
更新日期:2025-12-17
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种多核处理器‑单图形处理器的深度强化学习加速方法,其特征在于,包括如下步骤:

1)在多核CPU‑GPU平台下运行该方法,利用CPU的多进程,对于M核CPU,每个核心生成N个强化学习交互环境env,共生成M*N个环境模拟器;

‑ ‑

2)在内存的固定位置分配参数ω、ω ,θ,θ和经验池,由CPU完成初始化,GPU可以通过数据传输总线PCIE进行访问, 其中,ω和θ分别是CPU的两个内存空间保存的动作网络参数‑ ‑

和评估网络参数, ω和θ分别是GPU的两个内存空间保存的当地动作网络参数和当地评估网络参数;

3)将已有的M*N个环境模拟器拆分为两个相同大小的部分,即2个M*N/2个环境模拟器组合, 第一部分环境模拟器先收集状态,将收集完成的状态集合S1发送到GPU,GPU内当地动作网络进行动作采集A1,在动作采集的同时,第二部分环境模拟器启动收集状态, 第一部分状态的相应动作集合A1在GPU采集完成后发送回CPU的第一部分环境模拟器,第一部分环境模拟器接收动作并收集下一轮状态S1,同时第二部分环境模拟器将收集完成的状态集合S2发送到GPU,GPU并行进行动作采集A2;由此循环;在推理阶段,收集M*N个当前状态,组成状态集合S;将S通过PCIE发送至GPU;由S集合获得动作集合A与值函数集合V;将A通过PCIE发送至CPU环境模拟器;获得回报值R与下一状态S‑;将存入经验池;

4)在训练阶段,选取batch量的数据;根据算法计算目标函数;在CPU上执行训练过程,获得更新参数;将更新参数发送给GPU进行复制更新;根据设置清空经验池或清理一部分经验池;

5)根据训练的次数来更新参数θ,ω,系统达到要求后,训练完成。

2.按照权利要求1所述的一种深度强化学习加速训练的方法,特征在于,在CPU上执行多个环境模拟器并与GPU之间利用PCIE通讯。

3.按照权利要求1所述的一种深度强化学习加速训练的方法,特征在于,在CPU‑GPU框架内通过堆叠环境模拟器可以实现负载平衡,达到两倍的深度强化学习的性能加速。

4.按照权利要求1所述的一种深度强化学习加速训练的方法,特征在于,CPU内存、GPU显存的固定位置分配参数,在CPU中执行初始化和读写经验池数据,在CPU和GPU之间通过PCIE进行网络参数读写。