1.一种应急通信网络的成帧时间与带宽分配联合优化方法,其特征在于,在时变信道状态下,智能体基于双深度Q网络和经验回放池,执行如下步骤S1‑步骤S6,完成应急通信网络的链路资源分配:步骤S1:构建当前应急通信网络的状态空间,包括当前信道的信干噪比、时延、数据传输速率;
步骤S2:构建当前应急通信网络的动作空间,包括离散的成帧时间和离散的带宽;
步骤S3:基于链路的实际带宽利用率,构建奖励函数;
步骤S3中所构建的奖励函数如下式:
;
其中,表示t时刻的奖励, 表示不包括填充字节的有效数据传输速率,表示信道容量,计算如下:;
;
其中, 为单次统计的时间间隔, 为单次统计时间内传输的有效比特数,不包括填充字节;为分配的带宽; 为信道的信干噪比;
步骤S4:构建双深度Q网络,双深度Q网络包括在线网络和目标网络;其中,在线网络输入当前应急通信网络的状态,在线网络用于动作选择与训练实时更新,目标网络用于计算目标Q值,并基于在线网络参数,定期进行目标网络的软更新;
步骤S5:智能体与应急通信网络环境进行交互,将所产生的经验样本存储于经验回放池中;分别针对每个经验样本,构建基于时序差分误差与当前实时奖励的联合驱动函数,计算采样优先级、采样概率,并赋予重要性采样权重;
步骤S6:当经验回放池中的经验样本数量达到预设阈值时,按采样优先级随机抽取预设数量的经验样本,对智能体进行训练,计算加权损失,通过梯度下降法更新在线网络参数,并软更新目标网络;经过训练后,智能体根据当前应急通信网络的状态,输出最优的动作,完成应急通信网络的链路资源分配。
2.根据权利要求1所述的一种应急通信网络的成帧时间与带宽分配联合优化方法,其特征在于,步骤S1中所构建的当前应急通信网络的状态空间如下式:;
其中, 表示t时刻的应急通信网络的状态, 表示t时刻信道的信干噪比,表示t时刻的时延, 表示t时刻的数据传输速率。
3.根据权利要求2所述的一种应急通信网络的成帧时间与带宽分配联合优化方法,其特征在于,步骤S2中所构建的当前应急通信网络的动作空间如下式:;
其中, 表示t时刻的应急通信网络的动作, 表示t时刻的成帧时间,表示t时刻的带宽。
4.根据权利要求3所述的一种应急通信网络的成帧时间与带宽分配联合优化方法,其特征在于,步骤S4的具体步骤如下:步骤S4.1:在线网络选择下一个状态的Q值最大估计值所对应的动作作为最优动作,如下式所示:;
其中, 表示t时刻的应急通信网络的动作, 表示在线网络, 表示t时刻的应急通信网络的状态,为动作空间的任一动作组合,argmax表示最大值参数;
实时更新在线网络参数,如下式所示:
;
其中,为学习率, 为目标网络计算的目标Q值, 为在线网络计算的当前Q值;表示在线网络参数, 为关于在线网络参数 的梯度,利用梯度下降法,最小化预测值与目标值之间的均方误差,从而更新在线网络的权重;
步骤S4.2:目标网络计算目标Q值,目标Q值的计算如下:;
其中, 为第 个经验样本的奖励, 为折扣因子, 表示在线网络, 表示目标网络,为第 个经验样本的下一状态,argmax表示最大值参数;
进行目标网络的软更新,如下式所示:
;
其中,为目标网络更新参数, 表示目标网络参数。
5.根据权利要求4所述的一种应急通信网络的成帧时间与带宽分配联合优化方法,其特征在于,步骤S5的具体步骤如下:步骤S5.1:智能体与应急通信网络环境进行交互,产生经验样本 ,其中,表示t时刻的应急通信网络的状态, 表示t时刻的应急通信网络的动作, 表示t时刻的奖励, 表示t+1时刻的应急通信网络的状态;将经验样本存储于经验回放池中;
步骤S5.2:分别针对经验回放池中的各经验样本,基于时序差分误差与实时奖励双驱动的经验增强提取机制,计算采样优先级如下式:;
其中, 表示第 个经验样本的采样优先级, 表示第 个经验样本的奖励,表示第 个经验样本对应的应急通信网络的状态, 表示第 个经验样本对应的应急通信网络的动作,为常数;
步骤S5.3:基于采样优先级,计算各经验样本的采样概率如下式:;
其中, 表示第 个经验样本的采样概率,为控制优先程度的超参数,N为经验回放池容量, 为经验回放池中所有经验样本中第 个经验样本的优先级;
步骤S5.4:分别针对每个经验样本,计算重要性采样权重,具体如下式:;
其中, 表示第 个经验样本的重要性采样权重,为控制校正强度的超参数。
6.根据权利要求5所述的一种应急通信网络的成帧时间与带宽分配联合优化方法,其特征在于,步骤S6中智能体的训练过程如下:步骤S6.1:智能体首先观察当前应急通信网络的状态 ,在线网络以 ‑greedy策略选择动作;根据动作设置新的成帧时间,并为链路分配新的带宽;
步骤S6.2:执行动作后,应急通信网络根据奖励函数计算奖励值,并反馈下一时刻的应急通信网络的状态 ,构建经验样本,将经验样本存入经验回放池;
步骤S6.3:智能体更新时,若经验回放池中的经验样本数量大于采样批量大小,则按采样优先级,采样预设数量的经验样本,计算经验样本的目标Q值和当前Q值,并基于损失函数计算损失,具体如下式:;
其中,表示损失函数, 表示采样批量大小, 表示第i个经验样本的重要性采样权重, 表示目标网络计算的目标Q值, 表示在线网络计算的当前Q值;
步骤S6.4:使用Adam优化器执行梯度下降,更新在线网络参数 ,并软更新目标网络参数 ;且每次采样时,重新计算每个经验样本的采样优先级;
步骤S6.5:重复训练,直至连续预设个评估周期内平均奖励的值不超过预设阈值;训练完成后,保存最终的在线网络参数。