1.一种NOMA系统中基于分层深度强化学习的动态频谱接入方法,其特征在于:包括以下步骤:
S1:构造上行多用户多信道的通信场景;基于单个网络单元,构造上行多用户多信道的通信场景,网络单元由一个基站和多个用户组成,基站位于网络单元的中心,N个单天线用户随机分布在基站的覆盖范围之内;在所述网络中,用户通过NOMA技术实现与基站的通信;
所述通信场景内存在M个可供用户接入的独立信道,所述信道为分配给用户的最小资源单位;在所述通信场景中,所有的链路都受到多路径传播和路径损耗所引起的快慢速衰落效应;
所有用户都具有一个容量为L的缓存器用于缓存数据;在每个时隙t的初始阶段,用户n的缓存器状态被定义为Bn(t)∈{bn,0,...,bn,l,bn,L},Bn(t)=bn,l表示用户n缓存的数据包数量为l;每个时隙t内,用户传输的数据包个数表示为:其中Tt表示传输时间;Rn(t)表示用户n能够达到的传输速率;D表示数据包大小;R0=
4Mbps表示用户需要达到的传输速率阈值;
每个时隙t,用户n生成的所有数据包dn(t)为一个整体;当用户n的缓存空间不足以缓存dn(t)时,dn(t)被全部丢弃;在时隙t用户n的丢包数表示为:在时隙t+1的初始阶段,用户n的缓存器状态表示为:S2:建立信道干扰模型;在当前无线通信环境中的所有用户都能够进行功率调整,并且所有用户的发送功率为一个连续的区间,即S21:使用 表示信道m中用户n与基站之间的链路增益,其中表示服从瑞利分布的瑞利衰落信道,βn表示用户n与基站之间的大尺度衰落,定义为:其中λ表示信号的波长; 表示用户n与基站之间的距离;
在时隙t内,基站从信道m中接收到的来自用户n的信号表示为:其中pn(t)∈Pn表示用户n选择的发送功率; 表示用户n通过信道m发送给基站的信号;
S22:基站基于信号强度从强到弱的顺序利用连续干扰消除SIC技术完成信号解码;当基站解码用户n的信号时,基站接收到的干扰表示为:其中, 表示基站在时隙t内通过信道m接收到的来自用户j的信号, 表示用户j是否接入信道m,定义为:
βj,n(t)表示基站接收到的用户j的信号强度是否大于用户n的信号强度,定义为:ηj(t)表示用户j的信号是否已经被解码及解码是否成功,定义为:公式(9)中ηj(t)=0表示解码失败或还未被解码,ηj(t)=1表示已被解码且解码成功;
S23:在每个时隙t,基站从信道m接收到的来自用户n的信干燥比SINR表示为SINRn(t),即:
2
其中σ表示噪声。
因此,用户n的传输速率为:
Rn(t)=Wlog2(1+SINRn(t)) (11)S3:将通信优先级高的用户优先获得信道使用权,确保接入用户解码成功以及最小化系统丢包数的目标表示为一个优化问题;将通信优先级高的用户优先获得信道使用权,并在确保接入的用户都解码成功的基础上最小化系统的丢包数目标表示为一个优化问题,表示为:
s.t.C1:Rn≥R0
C2:0≤pn≤Pmax
其中C1表示用户n的传输速率需要大于规定的阈值,C2表示用户的发送功率限制,C3表示用户n是否接入了信道m以及其信号是否被基站成功解码,当用户n接入信道m且其信号被基站成功解码时 否则 C4确保每一个用户最多接入一个信道;
S4:构建多智能体模型,对S3中优化问题基于马尔可夫决策过程进行建模;智能体表示基站与所有的用户,智能体的状态空间、智能体的动作空间和智能体获得的奖励函数,分别定义如下:
S41:对于基站而言,其状态空间为SBS;每个时隙t,基站获得的状态为sBS(t)=(Bl,1(t‑
1),...,Bl,n(t‑1),...Bl,N(t‑1)),其中Bl,n(t‑1)=Bn(t‑1)‑Cn(t‑1)表示上一时隙通信结束后,用户n的缓存的数据量;对于每个用户,其状态空间为Sn;每个时隙t,用户n获得的状态为 其中n表示智能体的编号,Bn(t)表示用户的缓存数据量,hn,m(t)表示用户n接入信道m后获得的链路增益, 表示基站反馈给用户n的信息,通过公式(6)计算,Rn(t)表示用户接入信道后的传输速率;
S42:动作空间:基站的动作空间为ABS;在每个时隙t,基站选择动作aBS(t);此时,接入方案为ABS(aBS(t))=(a1(t),...,an(t),...,aN(t)),其中an(t)∈{0,1,...,M},an(t)=m表示用户n当前时隙被允许接入信道m,an(t)=0表示不被允许进行通信;每个用户n的动作空间为用户发送功率集,即Pn;
S42:奖励函数:将用户的缓存数据量用来构成奖励函数,该奖励函数表示为:其中PRIn(t)表示时隙t的用户n的通信优先级,定义为:S43:另一个基于传输速率的奖励函数表示为:S44:当接入信道的用户在调整完发送功率后仍然无法传输数据收到相应的惩罚,即:其中, 表示当用户n完成功率调整后能否在信道m中进行数据传输,如果可以,否则 驱动基站进行学习的总奖励函数表示为:RBS(t)=λ0RB(t)+λ1Rrate(t)‑λ2RIn (17);
其中λ0、λ1和λ2分别表示每部分奖励的权重;
S45:当用户的传输速率满足速率阈值时,用户将获得一个积极的奖励,否则,用户将获得一个惩罚Rneg<0;用户n能够获得的奖励函数表示为:在基于马尔可夫过程所构建的深度强化学习算法中,智能体的目标是学习到一个最佳* γ *
策略π,使得智能体获得的累积奖励R (t)最大,最佳策略π表示为:其中
S5:采用集中训练分布执行的方式完成策略的更新和执行;多智能体网络的结构为:基站上构建三个网络,分别为参数为θQ的深度Q网络φQ,参数为θa的动作网络φa和参数为θc的批评网络φc;在执行过程中,基站利用基于DQN网络φQ的深度Q学习算法完成集中式动态频谱接入控制,用户利用基站广播的动作网络参数θa实现连续功率控制;所有的网络参数θQ、θa和θc都在基站处完成更新,且所有参数的更新都采用了经验回放法;
S51:在训练的过程中,基站将获得的经验样本(sBS(t‑1),aBS(t‑1),RBS(t‑1),sBS(t))存入记忆库Maccess中,当记忆库中的样本数量大于训练所需的样本数|ΩQ|=200时,基站从记忆库Maccess中取出包含|ΩQ|个数据样本的训练样本集ΩQ={sBS(i),aBS(i),RBS(i),sBS(i+
1)}用于训练参数θQ;根据ΩQ计算得到DQN网络φQ的损失函数为:其中Q(s(i),a(i);θQ)为网络φQ的输出值,记为动作值函数, 是参数为的目标深度Q网络 的输出值,网络 与φQ具有相同的结构,每完成Qup=100次参数就将更新一次参数 更新过程为
S52:获得损失函数后,网络参数θQ的更新过程表示为:其中αQ表示学习速率;
S53:接入信道的用户将经验样本(sn(t‑1),pn(t‑1),Rn(t‑1),sn(t))存入位于基站的记忆库Mpower中;当记忆库中的样本数量大于训练所需的样本数|Ωn|=128时,基站从Mpower中取出|Ωn|个样本构成训练样本集Ωn={sn(i),pn(i),Rn(i),sn(i)}用于训练参数θa和θc;其中参数θc的更新方式与参数θQ的更新方式相似,首先计算Ωn的损失函数,然后利用梯度下降法完成参数更新,更新过程为:
其中 表示目标状态‑行为值函数,
是目标批评网络 的网络参数, 表示参数为 的目标动作网络 的输出;
S53:参数θa基于梯度完成更新,网络φa中的策略梯度表示为:基于公式(22)所示的策略梯度,网络φa通过梯度上升法更新参数θa,表示为:S54:采用软更新的方式更新目标网络的参数 和 更新过程表示为:本方法的总迭代回合数为Tstep,每回合完成Tenv次迭代,并且在每次迭代中,用户有Tp次调整发送功率的机会。