1.一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,包括:构建多用户超密集网络,并对网络初始化;网络中的用户设备产生计算任务,并向宏基站发送任务卸载请求;宏基站接收请求后获取用户设备信息以及网络环境信息,并根据获取的用户设备信息构建任务模型,所述环境信息包括用户设备与微基站的信道状态以及MEC服务器的计算资源信息;将任务模型和网络环境信息输入到训练好的任务决策模型中,得到任务卸载决策,所述任务决策模型包括策略网络和动作价值网络;宏基站将任务卸载决策分别发送给用户设备和微基站;用户设备根据任务卸载决策执行任务卸载,微基站根据任务卸载决策分配计算资源进行任务计算;
构建任务模型包括:获取用户设备信息,该信息包括用户设备产生的任务输入数据大小、任务单位CPU循环数、用户对该任务执行时时延需求、用户对任务的能耗需求、用户所能接受的执行任务时的最大能耗以及当前时隙用户设备的剩余电量;根据用户设备信息构建的任务模型,即为:其中,du(t)表示该任务的输入数据大小,cu(t)表示执行该任务的单位CPU循环数,τu(t)表示用户对于该任务的执行时延需求即最大容忍时延, 表示用户对于任务的能耗需求即理想执行能耗, 表示用户所能接受最大执行能耗, 表示在当前时隙用户设备的剩余电量;
确定用户设备所能接受最大执行能耗和理想执行能耗的公式为:
其中,g表示理想能耗计算函数, 表示最大执行能耗, 表示设备剩余电量,为用户设备的最大存储电量,ε为超参数。
2.根据权利要求1所述的一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,多用户超密集网络包括一个宏基站和N个微基站,每个微基站中配置有MEC服务器执行计算任务;每个微基站采用正交频分多址接入用户设备。
3.根据权利要求1所述的一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,对任务决策模型进行训练的过程包括:S1:对任务决策模型的参数进行初始化;
S2:每个时隙将宏基站作为智能体获取当前环境状态信息以及用户设备的任务信息,根据用户任务设备的任务信息构建任务模型;
S3:将当前环境状态信息和任务模型输入到策略网络中,得到任务动作,该任务动作包括当前任务的卸载决策、功率控制以及计算资源分配动作;
S4:根据任务动作计算当前用户的满意度,得到当前宏基站的即时奖励;
S5:宏基站获取下一时刻环境状态信息,并将当前环境状态信息、任务动作、即时奖励以及下一时刻环境状态信息作为四元组存入优先经验重放数组;
S6:采用优先级机制对优先经验重放数组进行采样,将采集的四元组分别输入到策略网络和动作价值网络中进行训练,当宏基站的即时奖励函数收敛时,完成模型的训练。
4.根据权利要求3所述的一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,即时奖励函数为:其中, 表示奖励函数,st表示当前环境状态,at表示动作,u表示某个用户,U表示用户总数,Ou(t)表示用户对宏基站执行当前任务的满意度,€u(t)表示惩罚函数。
5.根据权利要求3所述的一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,采用优先级机制对优先经验重放数组进行采样的过程包括:采用优先级分数公式计算优先经验重放数组中每个数据的优先级分数;根据计算出的优先级分数将数据按照从大到小的顺序进行排序,对排序后的数据进行标号,根据标号对每个数据定义一个抽样值;根据抽样值计算每个数据的抽样概率;根据抽样概率设置任务决策模型训练的学习率。
6.根据权利要求5所述的一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,设置任务决策模型训练学习率的公式为:其中,ψ表示退火变量, 表示所有经验组的数量,α表示初始学习率, 表示抽样概率。
7.根据权利要求3所述的一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,对策略网络进行训练的过程包括:给定当前状态st,策略网络输出动作at=μμ(st;θ),价值网络根据当前状态给该动作一个分数:
μ Q μ
qt=Q(st,μ(st;θ);θ);根据动作分数计算动作价值关于状态的期望J(θ);固定住价Q μ μ值网络参数θ,使用梯度上升算法更新参数θ,当J(θ)收敛时完成策略网络的训练。
8.根据权利要求3所述的一种超密集网络中基于动态用户满意度的边缘计算卸载方法,其特征在于,对动作价值网络进行训练的过程包括:步骤1:从经验重放数组中抽取一组经验组(st,at,rt,st+1);
Q
步骤2:将经验组输入到动作价值网络中,得到qt=Q(st,at;θ)和qt+1=Q(st+1,μ(st+1;
μ Q Q
θ);θ);其中,Q表示价值网络,st表示当前环境状态,at表示动作,θ表示价值网络参数,qt+1表示下一时刻价值网络预测输出,μ表示策略网络参数;
步骤3:根据qt+1计算TD目标,计算公式为:
其中,rt表示即时奖励,γ表示折扣因子;
步骤4:根据TD目标、qt以及qt+1计算网络的损失函数;
Q
步骤5:采用梯度下降算法对θ 进行更新,当网络的损失函数收敛时完成动作价值网络的训练。