1.一种无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述无线供能共生边缘计算网络包括一个基站、 个反向散射设备与 个移动设备,每个移动设备关联一个反向散射设备并在反向散射设备的覆盖范围内移动,所述无线供能共生边缘计算网络的波束成形与计算卸载方法,包括:在每个时隙开始后,所有移动设备进行移动,并在移动结束后将自身的局部状态信息传输给基站;
基站收集所有移动设备的局部状态信息以得到全局状态信息,并使用第一智能体根据全局状态信息输出无线供能时长和下行波束成形设计,将无线供能时长广播给所有移动设备;
每个移动设备使用第二智能体根据局部状态信息和无线供能时长输出当前时隙的卸载决策和能量消耗,选择边缘计算的移动设备将卸载决策和发射功率发送给基站;
基站根据每个反向散射设备的信息年龄状态和选择边缘计算的移动设备的卸载决策和发射功率计算出上行波束成形设计,包括:构建上行波束成形设计优化问题如下:
;
式中, 表示时隙 的上行波束成形设计, 表示时隙 所有选择边缘计算的移动设备的总计算比特量, 表示第 个移动设备的智能体在时隙 波束成形矩阵的秩一约束, 表示时隙 所有选择边缘计算的移动设备集合, 表示第 个反向散射设备在时隙 的次级传输数据量, 表示目标数据量, 表示第 个反向散射设备在时隙 的信息年龄状态, 表示最大容忍信息年龄阈值;
使用半定松弛将所述上行波束成形设计优化问题转化为凸优化问题,并使用凸优化方法求解凸优化问题,得到上行波束成形设计;
基站根据无线供能时长执行无线供能,基站根据下行波束成形设计和上行波束成形设计执行波束成形操作,移动设备根据卸载决策和能量消耗执行任务传输或计算,一个时隙结束。
2.根据权利要求1所述的无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述第一智能体和第二智能体的训练阶段,在基站和移动设备执行后,还进行以下操作:基站计算每个智能体的奖励,生成第一智能体当前时隙的经验并存储到第一智能体的经验回放池,生成每个第二智能体当前时隙的经验并存储到第二智能体的经验回放池;
当经验回放池中的经验数量大于等于预设数量时,第一智能体和第二智能体分别根据随机抽取经验进行参数更新,当前时隙结束;
遍历一个训练轮次的所有时隙后,初始化移动设备的地理位置坐标,开始下一个训练轮次,直至遍历所有训练轮次。
3.根据权利要求2所述的无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述基站计算每个智能体的奖励,包括:确定信息年龄惩罚项:如果第 个反向散射设备在时隙 的信息年龄状态大于最大容忍信息年龄阈值,则取第 个反向散射设备在时隙 的信息年龄状态与最大容忍信息年龄阈值的差值计算信息年龄惩罚项;否则设置第 个反向散射设备的信息年龄惩罚项的值为
0;
计算全局奖励作为每个智能体的奖励,全局奖励包括时隙 选择边缘计算的移动设备的总计算比特量、时隙 选择本地计算的移动设备的总计算比特量,以及所有反向散射设备的信息年龄惩罚项的总和的负值。
4.根据权利要求2所述的无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述第一智能体为软演员‑评论家智能体,所述软演员‑评论家智能体包括一个Actor网络、两个Critic网络,以及两个目标Critic网络,所述第一智能体的参数训练更新过程如下:基于随机抽取的经验计算出两个Critic网络的损失函数;
结合两个Critic网络的损失函数,更新两个Critic网络的参数;
更新完两个Critic网络的参数后,计算Actor网络的损失函数并更新Actor网络的参数;
若当前训练轮次关于2取模的结果等于0,则更新两个目标Critic网络的参数;否则两个目标Critic网络的参数不更新。
5.根据权利要求2所述的无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述第二智能体为参数化深度Q网络智能体,所述参数化深度Q网络智能体包括一个参数化网络、一个Q网络和一个目标Q网络;
并且引入混合神经网络更新每个第二智能体的参数,所述混合神经网络包括一个混合参数化网络、一个混合Q网络和一个混合目标Q网络;所述第二智能体的参数训练更新过程如下:第二智能体使用随机抽取的第 份经验输出Q值和目标Q值;
混合Q网络和混合目标Q网络混合每个第二智能体输出的Q值和目标Q值输出全局Q值和全局目标Q值;
混合Q网络和混合目标Q网络基于全局Q值和全局目标Q值,计算Q网络和混合Q网络的损失函数,并更新Q网络和的混合Q网络参数;
混合参数化网络根据随机抽取的经验计算参数化网络和混合参数化网络的损失函数,并更新参数化网络和混合参数化网络的参数;
若当前训练轮次关于2取模的结果等于0,则混合目标Q网络和每个第二智能体的目标Q网络的参数进行更新;否则混合目标Q网络和每个第二智能体的目标Q网络的参数不更新。
6.根据权利要求5所述的无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述第二智能体使用随机抽取的第 份经验输出Q值和目标Q值,包括:第 个第二智能体的Q值为 ,第 个第二智能
体的目标Q值为 ,
,其中 表示第 个第二智能体在随机抽取的第 份经验中时隙 的局部状态信息, 表示第 个第二智能体的Q网络对随机抽取的第 份经验在时隙 输出的离散动作, 表示第 个第二智能体的参数化网络对随机抽取的第 份经验在时隙 输出的连续动作, 表示第 个第二智能体在随机抽取的第 份经验中时隙 的局部状态信息, 为离散动作集合, 表示第 个第二智能体的Q网络对随机抽取的第 份经验在时隙 输出的离散动作 表示第 个第二智能体的参数化网络对随机抽取的第 份经验在时隙 输出的连续动作,
表示第 个第二智能体的目标Q网络
根据随机抽取的第 份经验在时隙 的局部状态信息选择使Q值最大的动作作为最优动作。
7.根据权利要求5所述的无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述混合Q网络和混合目标Q网络混合每个第二智能体输出的Q值和目标Q值输出全局Q值和全局目标Q值,包括:将 个移动设备的第二智能体输出的Q值,以及时隙 时的全局状态信息 ,通过混合神经网络的混合Q网络进行混合操作,得到时隙 的全局Q值;
将 个移动设备的第二智能体输出的目标Q值,以及时隙 时的全局状态信息 ,通过混合神经网络的混合目标Q网络进行混合操作,得到时隙 的全局目标Q值。
8.根据权利要求5所述的无线供能共生边缘计算网络的波束成形与计算卸载方法,其特征在于,所述混合参数化网络根据随机抽取的经验计算参数化网络和混合参数化网络的损失函数,包括:对每个移动设备的第二智能体基于当前时隙所有离散动作输出的Q值求和得到Q值和;
将 个移动设备的第二智能体输出的Q值和,以及时隙 时的全局状态信息 ,通过混合神经网络的混合参数化网络进行混合操作,得到时隙 的全局参数化Q值;
对所抽取的所有经验的全局参数化Q值求期望得到损失函数,作为每个第二智能体的参数化网络和混合参数化网络共有的损失函数。