1.一种基于深度强化学习的无人机辅助边缘卸载决策方法,其特征在于,包括如下步骤:步骤1:在交通网络中,部署S台边缘服务器(简称为服务器), 表示服务器的集合;无人机数量为N架;无人机计算单位任务成本为coatd,服务器计算单位任务的成本为coats;每一架无人机都部署在某一服务器的覆盖范围内,辅助服务器完成卸载任务,部署的情况表示为G(t)=[a1,t,a2,t,a3,t,...,aS,t],ai,t表示在t时刻协助服务器i的无人机数量;
步骤2:每个时隙t服务器i的任务到达都服从均值为λi,t的泊松分布;让到达服务器i的任务以pi,t的概率选择服务器i来处理,则服务器端任务的到达速率为λi,tpi,t,无人机端任务的到达速率为λi,t(1‑pi,t),记pt=[p1,t,p2,t,...,ps,t];
步骤3:利用排队论计算任务在服务器处理时的逗留时间(排队时间+处理时间)和任务在无人机处理时的逗留时间,建立最小化任务完成时间和计算任务成本为目标的优化问题P1;
步骤4:采用深度强化学习的算法对步骤3中归纳的数学问题P1进行求解,从而得到单个时隙内无人机辅助方案G(t)、计算任务卸载方案pt。
2.如权利要求1所述的一种基于深度强化学习的无人机辅助边缘卸载决策方法,其特征在于:所述步骤3中,所述任务完成时间和计算任务成本的表达式为:其中Ti,t,s表示任务在服务器i上的逗留时间,Ti,t,d,s表示任务卸载给无人机时的逗留时间;特别 其中μs为服务器的处理速率; 其中 是计算任务在服务器端的发送队列长度, 是服务器的发送强度, 是服务器与无人机之间的上行传输速率,w为无人机与服务器之间的带宽,Pi为服务器i的发2
射功率,gi为服务器i与无人机之间的信道增益,σ为服务器i与无人机之间的噪声,是无人机端计算任务队列长度,其中μd为无人机的处理速率。
3.如权利要求1或2所述的一种基于深度强化学习的无人机辅助边缘卸载决策方法,其特征在于:所述步骤3中,所述限制条件的表达式为:ω1+ω2=1 (1)
pi,t≤1 (3)
λi,t(1‑pi,t)<μtr (4)λi,t(1‑pi,t)<μd×ai,t (5)λi,tpi,t<μs (6)其中式(1)是权重因子的约束,式(2)是辅助的无人机数量的约束,式(3)是卸载的概率约束,式(4)(5)(6)是排队论中任务到达速度和处理速度之间的约束。
4.如权利要求1、2或3所述的一种基于深度强化学习的无人机辅助边缘卸载决策方法,其特征在于:所述步骤4中,采用深度强化学习算法对步骤3中问题P1进行求解的步骤为:步骤4.1:根据时隙之间的独立性以及服务器之间的独立性,将优化问题P1转化为问题P2;
P2:
s.t.(1)~(6)
步骤4.2:通过随机方法初始化两个DNN的网络参数θa,1和θp,1,用网络参数来产生部署决策和卸载决策;初始化两个空的Memory,用来存放经过训练后得到的历史经验;
步骤4.3:选择SoftPlus函数作为第一个DNN网络的隐藏层的激活函数,SoftMax函数作为其输出层函数;每个时隙的任务到达速率λt作为其输入,其输出为 其中表示通过网络参数θa,t在第一个DNN网络中对于λt状态的映射函数;
步骤4.4:选择ReLu作为第二个DNN网络的隐藏层的激活函数,sigmoid函数作为输出层函数;将第一个DNN网络输出得到的 作为输入,输出为 其中 表示通过网络参数θp,t在第二个DNN网络中对于 状态的映射函数;
步骤4.5:上述步骤中得到的 和 为松弛向量,即并不一定是对应状态的最优决策,于是将该时刻的λt和松弛向量 和 内的元素进行升序排列得到 和 将中的每一个元素与 和 中的元素进行遍历计算P2的最小值 得*
到每个服务器的无人机数量G(t) 和卸载决策
* *
步骤4.6:把步骤4.5中 和得到的G(t) 添加到第一个DNN网络的Memory里,G(t) 和*添加第二个DNN的Memory中;如果Memory已满,就用最新的 G(t) 和 替换Memory中最旧的数据;每当时隙数量达到训练间隔δ时,从Memory中联合取出一批数据作为训练样本集和 为一组时间指数;
步骤4.7:用 和 分别训练两个DNN网络,并且使用Adam算法更新优化训练参数θa,t和θp,t;
步骤4.8:重复步骤4.3‑步骤4.7,直到迭代次数达到限定值M;
步骤4.9:利用训练好的深度强化学习网络求出每个时隙无人机部署和卸载方案。