1.一种游戏策略计算方法,其特征在于,包括:
预先采用多个历史游戏样本图像,建立基于评估网络最大动作值和最小动作值权重的游戏策略深度双Q网络模型;
采用所述游戏策略深度双Q网络模型对目标游戏的多个图像进行分析,得到最优评估网络参数;
依据所述最优评估网络参数计算出与所述目标游戏中每个情节中的每个状态分别对应的各个目标动作值;
依据与所述每个情节中的每个状态分别对应的各个所述目标动作值得到与所述目标游戏对应的游戏策略。
2.根据权利要求1所述的游戏策略计算方法,其特征在于,所述预先采用多个历史游戏样本图像,建立基于评估网络最大动作值和最小动作值权重的游戏策略深度双Q网络模型的过程为:S200:依据多个历史游戏样本图像,获取相应的各个情节、与每个所述情节分别对应的各个状态以及与每个所述状态分别对应的各个动作;
‑
S210:初始化评估网络参数θ0、目标网络参数θ0和经验池D;
S220:对第m个情节初始化相应的初始状态sm0,其中,m=[1,M],M为情节总数;
S230:在所述第m个情节经过第t个时间步后的当前状态smt下,根据ε‑greedy策略选择并执行动作amt,进入与第t+1个时间步对应的状态sm(t+1)和立即奖赏rm(t+1),其中,t=[0,T],T为时间步总数;
S240:获取转移样本(smt,amt,rmt,sm(t+1)),并将所述转移样本(smt,amt,rmt,sm(t+1))存入至所述经验池D中;
S250:判断所述经验池中当前的转移样本总数是否达到第一预设值,若是,则从所述经验池中抽取预设数量个目标转移样本;若否,则判断所述t是否等于T,若是,则将所述m更新为m+1,返回执行S220;若否,则将所述t更新为t+1,返回执行S230;
S260:采用第j个目标转移样本计算出目标网络在相应状态下的最大动作值和最小动作值的权重,并依据所述第j个目标转移样本及所述权重对当前的评估网络参数进行更新,得到本次更新后的评估网络参数;
S270:判断所述j是否等于J,其中,J为所预设数量的数值,若是,则将所述更新后的评估网络参数作为最新的评估网络参数;若否,则将所述j更新为j+1,并返回执行S260;
S280:判断当前经过的时间步总数是否达到第二预设值,若是,则将当前最新的评估网络参数值赋值给到当前的目标网络参数,以对所述目标网络参数进行更新;
S290:判断m是否等于M,若是,则结束,获取所述最新的评估网络参数,并将所述最新的评估网络参数作为最优评估网络参数;若否,则将所述m更新为m+1,返回执行S220。
3.根据权利要求2所述的游戏策略计算方法,其特征在于,所述采用第j个目标转移样本计算出目标网络在相应状态下的最大动作值和最小动作值的权重,并依据所述第j个目标转移样本及所述权重对当前的评估网络参数进行更新的过程为:S310:根据第j个目标转移样本计算评估网络具有最大动作值的动作a*j和评估网络具*有最小动作值的动作aLj;其中,aj=argmaxQ(sj(t+1),a;θ),aLj=argminQ(sj(t+1),a;θ),Q(sj(t+1),a;θ)表示评估网络中状态sj(t+1)下的动作值,sj(t+1)表示第j个目标转移样本中的状态sm(t+1),θ表示当前评估网络参数;
S320:依据所述评估网络具有最大动作值的动作、所述评估网络具有最小动作值的动作及第一计算关系式,得到目标网络在状态sj(t+1)下的最大动作值和最小动作值的权重;其中,所述第一计算关系式为:其中,βj表示目标网络在状态sj(t+1)下的最大动
* ‑
作值和最小动作值的权重,Q(sj(t+1),a j;θ)表示目标网络在状态sj(t+1)下的最大动作值,Q‑(sj(t+1),aLj;θ)表示目标网络在状态sj(t+1)下的最小动作值,c表示超参数;
S330:依据所述权重及第二计算关系式计算目标值,其中,第二计算关系式为:WDDQN * * ‑
yj =rjt+γ[βjQ(sj(t+1),aj;θ)+(1‑βj)Q(sj(t+1),a j;θ)],其中,rjt表示第j个目标转*移样本中的立即奖赏rmt,γ∈[0,1]表示折扣率,Q(sj(t+1),a j;θ)表示评估网络中状态sj(t+1)下的最大动作值;
S340:依据所述目标值、所述第j个目标转移样本及第三计算关系式得到本次更新后的评估网络参数;其中,所述第三计算关系式为:WDDQN 2
θ'≈argminθED[(yj ‑Q(sjt,ajt;θ)) ],其中,Q(sjt,ajt;θ)为评估网络中状态sjt下的动作值,sjt为第j个目标转移样本中的状态smt,ajt为第j个目标转移样本中的动作amt,ED表示期望值,θ'表示本次更新后的评估网络参数,并用所述θ'替换所述θ以用于后续计算。
4.根据权利要求2所述的游戏策略计算方法,其特征在于,在所述S260之前,所述方法还包括:计算各个所述目标转移样本的时间差分误差;
按照时间差分误差的大小将各个所述目标转移样本进行排序;
将排序后的各个所述目标转移样本分为两组,并将时间差分误差较小的一组的K值设为第一数值,将另一组的K值设为第二数值,其中,所述第一数值小于所述第二数值;
则,所述S260中的依据所述第j个目标转移样本及所述权重对当前的评估网络参数进行更新,得到本次更新后的评估网络参数的过程为:依据所述第j个目标转移样本、与所述第j个目标转移样本对应的K值及所述权重对当前的评估网络参数进行更新,得到本次更新后的评估网络参数。
5.根据权利要求4所述的游戏策略计算方法,其特征在于,所述依据所述第j个目标转移样本、与所述第j个目标转移样本对应的K值及所述权重对当前的评估网络参数进行更新,得到本次更新后的评估网络参数的过程为:根据第j个目标转移样本计算评估网络具有最大动作值的动作a*j和评估网络具有最小*动作值的动作aLj;其中,aj=argmaxQ(sj(t+1),a;θ),aLj=argminQ(sj(t+1),a;θ),Q(sj(t+1),a;
θ)表示评估网络中状态sj(t+1)下的动作值,sj(t+1)表示第j个目标转移样本中的状态sm(t+1),θ表示当前评估网络参数;
依据所述评估网络具有最大动作值的动作、所述评估网络具有最小动作值的动作及第一计算关系式,得到目标网络在状态sj(t+1)下的最大动作值和最小动作值的权重;其中,所述第一计算关系式为:其中,βj表示目标网络在状态sj(t+1)下的最大动
* ‑
作值和最小动作值的权重,Q(sj(t+1),a j;θ)表示目标网络在状态sj(t+1)下的最大动作值,Q‑(sj(t+1),aLj;θ)表示目标网络在状态sj(t+1)下的最小动作值,c表示超参数;
依据所述权重及第四计算关系式计算目标值,其中,第四计算关系式为:其中,rjt表示第j个目标
*
转移样本中的立即奖赏rmt,γ∈[0,1]表示折扣率,Q(sj(t+1),aj;θk)表示评估网络参数为θk* ‑ ‑的评估网络中状态sj(t+1)下的最大动作值,Q(sj(t+1),a j;θk)表示目标网络参数为θk的目标网络中状态sj(t+1)下的最大动作值,θk表示与当前评估网络参数之前K次更新分别对应的评‑估网络参数中的第k个评估网络参数,θk表示与当前目标网络参数之前K次更新分别对应的目标网络参数中的第k个目标网络参数;
依据所述目标值、所述第j个目标转移样本及第三计算关系式得到本次更新后的评估网络参数;其中,所述第三计算关系式为:其中,Q(sjt,ajt;θ)为评估网络中状态sjt下的动作值,sjt为第j个目标转移样本中的状态smt,ajt为第j个目标转移样本中的动作amt,ED表示期望值,θ”表示本次更新后的评估网络参数,并用所述θ”替换所述θ以用于后续计算。
6.一种游戏策略计算装置,其特征在于,包括:
建立模块,用于预先采用多个历史游戏样本图像,建立基于评估网络最大动作值和最小动作值权重的游戏策略深度双Q网络模型;
分析模块,用于采用所述游戏策略深度双Q网络模型对目标游戏的多个图像进行分析,得到最优评估网络参数;
计算模块,用于依据所述最优评估网络参数计算出与所述目标游戏中每个情节中的每个状态分别对应的各个目标动作值;
确定模块,用于依据与所述每个情节中的每个状态分别对应的各个所述目标动作值得到与所述目标游戏对应的游戏策略。
7.一种游戏策略计算系统,其特征在于,包括:
存储器,用于存储计算机程序;
处理器,用于执行所述计算机程序时实现如权利要求1至5任意一项所述游戏策略计算方法的步骤。
8.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现如权利要求1至5任意一项所述游戏策略计算方法的步骤。