1.一种能量收集MEC系统中任务卸载和资源分配方法,其特征在于,包括以下步骤:基于由多个具有EH功能的终端设备和一个配有边缘服务器的基站组成的MEC系统,分别建立任务队列模型、任务计算模型和能量收集模型;其中,EH为能量收集;
基于MEC系统的动态能量收集、随机任务到达以及实时信道变化,根据任务队列模型、任务计算模型以及能量收集模型建立一个时间平均意义上的长期随机优化问题,以最小化终端设备完成任务的执行时间和能量消耗总成本;
时间平均意义上的长期随机优化问题:
约束条件:
C1:αm(t)∈{0,1};
其中,At={αm(t)}={α1(t),α2(t),...,αm(t)},Bt={βm(t)}={β1(t),β2(t),...,βm(t)}以及 分别表示终端设备任务卸载决策集合,带宽分配集合以及服务器计算资源分配集合;Cm(t)表示终端设备m完成任务的执行时间和能量消耗总成本;αm(t)表示终端设备m的卸载决策变量;βm(t)表示分配给终端设备m的上行链路带宽比例; 表示服务器分配给终端设备m的计算资源; 表示服务器的最大计算资源; 表示在时隙t终端设备m消耗的总能耗;Bm(t)表示时隙t终端设备m电池中剩余电量;em(t)表示时隙t终端设备m收集到的能量; 表示时隙t处理任务花费的总时延;τm表示表示终端设备m的时延容忍阈值;Qm(t)表示在时隙t终端设备m任务队列中的任务量(bit);T表示系统运行时间;M表示终端设备数量;表示求期望;
通过李雅普诺夫优化理论将该优化问题解耦成每个确定时隙内卸载决策子问题以及资源分配子问题;
每个确定时隙内的子问题表示为:
约束条件:
C1:αm(t)∈{0,1};
其中,H(At,Bt,Ft)表示成本函数;V>0是一个衡量惩罚的参数;
卸载决策子问题表示为:
*
其中,(At) 表示在时隙t的最优卸载决策;
资源分配子问题表示为:
s.t.C2‑C7
利用深度强化学习,通过建模马尔可夫决策过程,定义动作空间,状态空间以及奖励函数求解卸载决策子问题,获取最优的卸载策略;
求解解耦后的卸载决策子问题包括利用深度强化学习算法将卸载决策子问题建模成马尔可夫决策过程;根据在每个时隙信道条件的状态、能量队列的状态和任务队列的状态,构建出状态空间;智能体根据当前系统状态基于不同奖励所选择的不同卸载决策,确定出动作空间;根据执行卸载决策后,当前系统反馈给智能体的奖励,构建出奖励函数;
状态空间为:st={hm(t),Qm(t),Bm(t)};
动作空间为:at={αm(t)};
奖励函数为:
其中hm(t)表示终端设备m与基站之间的信道增益,H(At,Bt,Ft)表示成本函数,C0与C1为正常数;
利用自适应遗传算法,通过交叉、变异、选择操作求解资源分配子问题,获取最优的资源分配方案。
2.根据权利要求1所述的一种能量收集MEC系统中任务卸载和资源分配方法,其特征在于,将长期随机优化问题,通过李雅普诺夫随机优化理论解耦成每个确定时隙内的卸载决策子问题以及资源分配子问题包括根据任务队列和能量队列构建出李雅普诺夫二次函数;
通过控制李雅普诺夫二次函数确定出李雅普诺夫漂移函数;根据李雅普诺夫漂移函数确定出李雅普诺夫漂移加惩罚函数;通过最小化李雅普诺夫漂移加惩罚函数,确定出观测到任务队列的状态时进行任务卸载决策和资源分配。
3.根据权利要求1所述的一种能量收集MEC系统中任务卸载和资源分配方法,其特征在于,求解解耦后的资源分配子问题包括利用自适应遗传算法,对种群进行初始化,按照自适应变异因子生成变异向量;按照自适应交叉因子生成交叉向量;将新产生的资源分配个体和目标资源分配个体进行比较,选择相应的资源分配个体进入下一代迭代,直至确定出最终的资源分配个体。
4.根据权利要求3所述的一种能量收集MEC系统中任务卸载和资源分配方法,其特征在于,所述自适应变异因子为:其中,Fk表示第k代的缩放因子,Fmax表示最大缩放因子,Fmin表示最小缩放因子,k表示种群的当前迭代代数,kmax表示种群的最大迭代代数。
5.根据权利要求3所述的一种能量收集MEC系统中任务卸载和资源分配方法,其特征在于,所述自适应交叉因子为:其中,CRk表示第k代的交叉因子,CRmax表示最大交叉因子,CRmin表示最小交叉因子,k表示种群的当前迭代代数,kmax表示种群的最大迭代代数。