1.支持6G的NGMA IoE网络的资源分配方法,其特征在于,包括步骤:S1、构建支持6G的NGMA IoE网络的通信网络架构,NGMA IoE网络指下一代多址物联网;
NGMA IoE网络的通信网络架构包括1个接入点即AP、M个物联网设备即IoED、D个分配给IoED的资源块即RB和M个传输链路即TL,M个IoED分为M′个CIDG和M″个DID对,在相同AP中共享相同RB的CID构成一个CIDG,两个D2D通信的DID构成一个DID对,CID指共享蜂窝IoED,DID指采用D2D通信的IoED,D2D通信指设备到设备通信,每个DID对被分成DID发送器即DIDT和D2D接收器即DIDR;AP将RB分配给每个CID,并负责CID之间的通信;采用认知无线电的CDMA模式允许DID与CIDG共享资源;在为TL分配RB时,CIDG和AP之间只考虑一个TL,因为CIDG中的CID共享相同的RB;
S2、基于NGMA IoE网络的通信网络架构建立NGMA IoE网络在资源分配时的冲突图模型;
所述步骤S2具体包括步骤:
S21、用一个无权无向图 表示NGMA IoE网络的通信网络架构,是表示N个元组的顶点集,元组包括AP、CIDG和DID,ε={e1,e2,...,eM}是表N×M示TL集合的边缘集合;并用关联矩阵G={0,1} 表示 的边和顶点之间的关系,G(vn,em)=1表示第n个元组发起第m个TL,否则G(vn,em)=0;
S22、基于NGMA IoE网络中TL之间的冲突关系,建立冲突图模型 其中是表示TL的顶点的集合, 是表示TL之间的冲突关系的边的集合,M×M
中边和顶点之间的关系由邻接矩阵GC={0,1} 表示,其中 表示TL中第m个与第 个冲突,否则
所述步骤S22中,GC通过以下步骤获得:
T
1)对矩阵G进行变换,得到矩阵GCD=(GG)⊙1,运算⊙定义为:M×M
其中a表示矩阵中的元素,b是常数;GCD={0,1} , 表示第m个TL与第个TL直接冲突,否则 直接冲突指第m个TL和第 个TL同时使用相同的RB,并T且具有相同的发送或接收元组;G是矩阵G的转置矩阵;
2)对矩阵G进行变换,得到矩阵 I是单位矩阵;
3)对矩阵 进行变换,得到矩阵 表示矩阵 的转置矩阵,表示第m个TL与第 个TL隐藏冲突,否则 隐藏冲突指第m个TL和第 个TL同时使用相同的RB,并且一个TL的发送或接收元组在另一个TL中的元组的通信范围内;
4)对矩阵GCH进行变换,得到矩阵
5)对矩阵 和 进行变换,得到邻接矩阵
S3、基于所述冲突图模型建立冲突超图模型;
在所述步骤S3中,冲突超图模型表示为 是顶点集, 是超边集,超边集 是 的子集,冲突超图模型的关联矩阵由 表示, 分别表示的顶点数量和 的超边数量,H中的任一元素H(v,e)取值如下:其中H(v,e)=1表示顶点v和超边e是关联的,即超边e包含顶点v;
S4、基于所述冲突超图模型建立NGMA IoE网络的无冲突资源分配问题;
在所述步骤S4中,所述无冲突资源分配问题构建为:其中,O表示网络吞吐量, 表示在时间t第d个RB被分配给第m个IoED的指示变量,则表示第d个RB被分配给第m个IoED, 则第d个RB未被分配给第m个IoED;Rm,d表示被分配第d个RB的第m个IoED的数据传输速率; 表示t时刻TL间的RB分配冲突度,DRB表示D个RB构成的集合, 表示M个IoED构成的集合;max表示最大化,s.t.表示需满足;
定义如下:
T
其中,H表示所述冲突超图模型的超图关联矩阵H的转置矩阵,max(·,1)表示矩阵(·)t的每个元素都与1进行max运算,|| ||1表示L1范数,X表示时间t时的资源分配矩阵:S5、基于所述无冲突资源分配问题构建为以马尔科夫决策过程为指导的马尔科夫决策网络;
在时间t时的状态定义为:
其中, 表示所述冲突超图模型的超图关联矩阵H、所有TL的冲突情况的集合 所有TL的数据传输速率的集合 所有TL的RB分配情况的集合t时刻的资源分配动作at表示为:
M×D
at={0,1} ;
时刻t的奖励函数rt定义为:
π
在策略π下、状态st下执行动作at的状态动作值函数Q(st,at)定义为:π
在策略π下、状态st下的状态值函数V(st)定义为:π π
其中,Q (st+1,at+1)表示状态st+1下执行动作at+1所得Q值, 表示求期望,V (st)表示t时刻的状态值,π(a′|st)表示为状态st下执行动作a'的概率,Q(st,a′)表示在状态st下,采取动作a'所得Q值,γ表示折扣因子;
S6、训练所述马尔科夫决策网络;
S7、训练完成的所述马尔科夫决策网络根据当前NGMA IoE网络的状态进行无干扰资源分配。
2.根据权利要求1所述的支持6G的NGMA IoE网络的资源分配方法,其特征在于,所述步骤S6具体包括步骤:S61、创建多个并行的客户端代理,每个客户端代理的行动者网络和批评者网络分别采用不同的深度神经网络,行动者网络和批评者网络分别表示为 和πθ,其中w和θ分别表示行动者网络和批评者网络的参数;
S62、每个客户端代理首先从全局服务器获得全局行动者网络和全局批评者网络{w,θ}的最新参数,然后在重放缓冲器上计算其损失函数的梯度,然后基于计算的损失函数的梯度更新其本地行动者网络和批评者网络的参数;
S63、每个客户端代理将自身更新后的参数发送到全局服务器,全局服务器对所有客户端代理的参数进行加权平均,以加权平均后的参数更新全局模型,并将更新后的全局模型参数广播给所有的客户端代理。
3.根据权利要求2所述的支持6G的NGMA IoE网络的资源分配方法,其特征在于,在步骤S62中,每个客户端代理的行动者网络和批评者网络的损失函数分别定义为:其中,πθ(at|st;θ)表示状态st下执行动作at的概率, 表示状态st下执行动作at的补偿, 状态st下执行动作at的Q值,表示一个参数值,πθ(a′|st+1;θ)表示状态st+1下执行动作a'的概率, 表示状态st下执行动作a'的Q值。
4.根据权利要求3所述的支持6G的NGMA IoE网络的资源分配方法,其特征在于,在步骤S62中,损失函数 和 的梯度分别表示为:其中,Q(st,at;w)即 π(a|st+1;θ)表示状态st+1下执行动作a的概率,Q(st+1,a;w)表示状态st+1下执行动作a所得Q值。
5.根据权利要求4所述的支持6G的NGMA IoE网络的资源分配方法,其特征在于,在所述步骤S62中,第k个客户端代理的行动者网络和批评者网络的参数分别采用下式进行更新:其中,η是参数更新的学习速率,t表示当前时刻,t‑1表示前一时刻。