1.一种边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,包括如下步骤:(1)基于排队论对任务到达与任务卸载建立包括车辆终端、路边单元的车联网环境;
(2)若车辆终端不需要路边单元决策,则任务执行总时延为零;若车辆终端需要路边单元决策,则通过停止车辆计算模式和路边单元计算模式计算得到任务执行总时延;
(3)将使任务的总执行时延最小为优化目标,建立优化目标函数;
(4)基于MADDPG网络构建行为‑评价网络,根据步骤(1)构建的车联网环境,利用评价网络评估对智能体行为,优化行为策略,寻找优化目标,训练行为网络;
(5)通过将训练好的每个智能体的行动网络运用于卸载问题,完成车载任务卸载。
2.根据权利要求1所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,将所述路边单元计算模式中的车辆任务执行时延路边单元间传递时延以及车辆终端将任务卸载至路边单元的上传时延相加,得到任务执行总时延;所述路边单元计算模式中的任务执行总时延分为本地处理的总时延和邻居处理的总时延。
3.根据权利要求2所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,所述本地处理的总时延具体为:在路边单元计算模式中,第m个路边单元的任务执行时延表示为:tMECdeal=1/maxMECμ
其中,maxMECμ为路边单元上单位时间内最大处理任务量;
车辆终端k传递到本地路边单元的上传时延由上得为,其中,dri→cloudlet表示传输的数据量,Rri→cloudlet表示从车辆终端到路边单元的传输率;w2
是带宽;pi,c是传输能量,hi,c是信道增益,σ是高斯噪声, 为信道干扰;
路边单元RSUm的任务执行时延表示为tMECdeal=1/maxMECμ,路边单元计算模式中本地处理的总时延为tlocalMEC=tup+tMECdeal。
4.根据权利要求2所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,所述邻居处理的总时延具体为:车辆终端k传递到本地路边单元的上传时延由上得为,Rri→cloudlet表示从车辆终端到路边单元的传输率;
所述本地路边单元传递到邻居路边单元的上传时延为,其中,dri→cloudlet表示传输的数据量,R’ri→cloudie表示从本地路边单元传递到邻居路边单2
元的传输率;w是带宽;pi,c是传输能量,hi,c是信道增益,σ是高斯噪声, 为信道干扰;
路边单元计算模式中邻居处理的总时延为tneighMEC=tup+tMECup+tMECdeal。
5.根据权利要求2所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,将所述停止车辆计算模式中的车辆任务执行时延、车辆终端将任务卸载至路边单元的上传时延,以及路边单元将任务卸载至停止车辆的传输时延,得到任务执行总时延;
具体为:
车辆终端k将任务卸载至路边单元的上传时延表示为
其中,dri→cloudlet表示传输的数据量,Rri→cloudlet表示从车辆终端到路边单元的传输率。
所述从车辆终端到路边单元的传输率的公式如下:
2
其中,w是带宽,pi,c是传输能量,hi,c是信道增益,σ是高斯噪声,信道干扰记为车辆终端k的任务执行时延表示为tvehdeal=1/maxvehμ;
停止车辆计算模式的总时延tlocalveh=2*tup+tvehdeal。
6.根据权利要求2所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,所述步骤(3)中的优化目标表示为:r(t)=‑max(αn(t)*tlocalMEC,βn(t)*tneighMEC,γn(t)*tlocalveh)其中αn(t),βn(t),γn(t)是t时刻分配给本地路边单元、邻居路边单元和停止车辆的任务数。
7.根据权利要求1所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,所述步骤(4)具体包括以下子步骤:(4.1)基于MADDPG网络构建一行为‑评价网络;
(4.2)训练行为‑评价网络,更新行动‑评价网络模型参数θi,得到训练完成后的行为网络。
8.根据权利要求6所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,所述行动‑评价网络模型参数θi的更新公式为:θ′i←γθi+(1‑γ)θ′i
其中,γ为更新因子取值在0‑1之间,θi为训练时行动‑评价网络模型参数,θ′i为目标行动‑评价网络参数。
9.根据权利要求6所述的边缘计算环境下基于深度强化学习的车载任务卸载方法,其特征在于,所述步骤(4.2)具体包括以下子步骤:(4.2.1)初始化参数:
设置循环次数为M,初始化N个智能体,初始化环境状态动作对存储空间D容量,初始化行动最大步长max‑action‑length,初始化评价更新所需环境状态动作对最小对数minibatch,随机初始化网络参数当前值θ与网络参数目标值θ′,其中θ=θ′,获取智能体可采取的行为;
(4.2.2)从环境中读取N个智能体当前环境状态x;
(4.2.3)依据环境更新智能体动作状态:
取每个智能体i,将智能体当前所能观察到的状态oi(传入智能体的行为网络,得到需执行的行动ai,ai=μθi(oi),μ为参数为θ(a)的行动网络函数,并传入环境中获取每个独立智能体执行动作奖励r,执行动作后的环境状态x′,并将(x,a,r,x′)作为智能体环境状态动作对存入智能体环境状态动作对存储空间D,更新当前智能体状态x←x′。重复完成卸载任务或达到最大步长max‑action‑length次数;
(4.2.4)使用评价网络训练行为网络:
对于每一个智能体i,随机从智能体环境状态动作对存储空间D中取得minibatch个记j j j j录样本集合S,其中S中每个元素为(x,a,r,x′),计算参照标准:其中, 为智能体i的以θ(c)为参数的评价网络; 为智能体i的第j个智能体状态动作j对记录中的执行动作奖励,x′表示第j个智能体状态动作对记录中的执行动作后的环境状j态, 为对应x′时的第k个智能体采取的行为,其中μ′k为第k个智能体的以θ(a)为参数的行为网络, 表示第j个智能体状态动作对记录时智能体k所能观察到的状态,γ为更新因子;
并通过对损失函数最小化,公式如下:
j
其中S为样本集合大小,y为第j个记录得出的参照标准, 为智能体i的以θ(c)为参数j j的评价网络,x表示第j个智能体状态动作对记录中的执行动作后的环境状态, 为对应x时的第k个智能体采取的行为。
基于神经网络的反向传播算法获得新的评价网络参数(即Q函数参数)θ(c)′,通过梯度下降方法更新行为网络,实现对智能体的评价,优化智能体行为策略,寻找优化目标,公式如下:获得新的行动网络参数(即μ函数参数)θ(a)′。直至达到预设最大迭代次数,完成更新。
(4.2.5)组合步骤(4.2.4)更新得到的θ(c)′和θ(a)′,得到θ′,通过下式得到最终的θ′,对于每一个智能体,更新其行动‑评价网络参数;
更新行动‑评价网络模型参数θi,公式如下:
θ′i←γθi+(1‑γ)θ′i
其中,γ为更新因子取值在0‑1之间,θi为当前(训练时)行动‑评价网络模型参数,θ′i为目标行动‑评价网络参数;
(4.2.6)重复步骤(4.2.2)~步骤(4.2.5)M次,完成行为网络的训练。
10.一种电子设备,包括存储器和处理器,其中,所述存储器与所述处理器耦接;其中,所述存储器用于存储程序数据,所述处理器用于执行所述程序数据以实现上述权利要求1‑
8任一项所述的边缘计算环境下基于深度强化学习的车载任务卸载方法。