利索能及
我要发布
收藏
专利号: 2022111292402
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于多智能体强化学习的上行NOMA‑URLLC资源分配方法,其特征在于,所述方法包括如下步骤:S1、将每个URLLC用户作为一个智能体,分别生成对应的DQN网络;

所述DQN网络的优化目标设置为T个时隙内URLLC用户的解码成功次数最大;

S2、获取每个URLLC用户在不同子信道上的信道状态信息,作为该URLLC用户的当前状态;

S3、将所述每个URLLC用户的当前状态输入所述对应的DQN网络,生成每个URLLC用户的子信道分配动作和功率分配动作;

S4、根据所述每个URLLC用户的子信道分配动作和功率分配动作生成奖励及下一时刻状态;

将所述当前状态、所述子信道分配动作和功率分配动作、所述奖励、所述下一时刻状态存储于DQN网络的经验回放缓冲区;

返回所述步骤S2,直至所述经验回放缓冲区中的经验样本达到一定数量,进入步骤S5;

S5、从所述经验回放缓冲区中抽取一定数量的经验样本训练DQN网络;

返回步骤S2,直至达到所述优化目标,进入步骤S6;

S6、使用所述DQN网络进行每个URLLC用户的子信道分配及功率分配;

DQN网络的优化目标模型设置为:

其中T为时隙数, 以下式取值:

因此优化目标解释为使T个时隙内URLLC用户的总解码成功次数最大;

为了保证URLLC的时延和可靠性,为上述优化目标模型施加如下约束:其中约束(a)约束了用户的解调顺序;约束(b)约束了对每个子信道施加的功率;约束(c)约束了每个用户的速率 大于目标数据速率 约束(d)约束了每个用户的错误解码率 小于目标错误率 约束(e)约束了每个用户只能选择一个子信道;

步骤S3采用如下方法实施:

S31、在当前时隙开始时,将步骤S2中每个URLLC用户获得的当前状态sk(t)输入至与该URLLC用户对应的DQN网络;

S32、生成用于后续选择的动作空间,动作空间中包括多种子信道分配动作和功率分配动作的组合而成的动作;定义动作ak(t)={m,p}∈A,表示每个URLLC用户决定选择哪个子信道及被分配哪个等级的发射功率,其中子信道的选择m∈{1,2,…Ns},发射功率的等级选择p∈{50,150,300,500},单位mW;在本实施例中,由于发射功率被离散为四个功率等级,因此动作空间的维度为信道数*功率等级数Ns×4;

S33、每个DQN网络使用ε‑greedy策略从动作空间中选择子信道分配动作和功率分配动作ak(t);具体的,ε‑greedy策略为以概率ε从动作空间中随机选择一个动作ak(t),或以概率

1‑ε选择动作空间中拥有最大估计Q值的动作ak(t);

奖励r(t)使用如下方法计算:

其中,r(t)为所述奖励,Nu为当前时隙活跃URLLC用户数,Ns为子信道数, 为解码是否成功的布尔值;

其中 与上述相同,

计算得到状态和奖励后,收集经验样本ek(t)={sk(t),ak(t),r(t),sk(t+1)},将经验样本以先进先出的方式储存至经验回放缓冲区,并在经验回放缓冲区中储存了一定数量的经验样本后开始使用这些经验样本训练DQN网络;

经验回访缓冲区中的经验样本数量突破设置数量以后,从其中随机抽取一批经验样本,通过这些经验样本计算Q估计:2

然后计算平方误差L(θ)=(yk(t)‑Q(sk(t),ak(t);θ(t))),通过最小化平方误差的方法训练DQN网络的Q网络:最后利用随机梯度下降更新DQN网络的参数θ,直至优化目标模型达到最大值;

当达到优化目标以后,即使用该DQN网络为每个URLLC活跃用户进行子信道分配和功率分配。

2.如权利要求1所述的一种基于多智能体强化学习的上行NOMA‑URLLC资源分配方法,其特征在于,所述步骤S1中所述优化目标的约束条件包括:用户的解调顺序约束;

对每个子信道的功率约束;

对每个URLLC用户的速率约束;

对每个URLLC用户的解码错误率约束;

对每个URLLC用户的子信道数量约束。

3.如权利要求1所述的一种基于多智能体强化学习的上行NOMA‑URLLC资源分配方法,其特征在于,每个所述DQN网络由三个全连接的隐藏层组成,每个所述隐藏层包含250个神经元;每个所述DQN网络的学习率为0.001,折扣因子为0.9。