利索能及
我要发布
收藏
专利号: 2024103841229
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种近场NOMA系统的波束训练与功率分配方法,其特征在于,包括:S1、对近场NOMA系统进行用户位置信息获取和码本设计;

S2、构建基于DRL的资源分配网络,根据用户位置信息生成第t个时隙的波束训练策略与功率分配策略at,并获得对应的奖励;

S3、利用经验元组对基于DRL的资源分配网络进行训练,获得训练完成的基于DRL的资源分配网络;其中经验元组包括当前时刻与下一时刻用户位置信息、步骤S2中生成的波束训练策略和功率分配策略以及系统执行对应策略获得的奖励;

S4、将当前时隙用户的位置信息输入到训练完成的基于DRL的资源分配网络中,通过最大化近场NOMA系统得到的奖励,动态调整波束训练策略与功率分配策略,获得该系统最大和速率对应的策略,完成波束训练与功率分配。

2.根据权利要求1所述的近场NOMA系统的波束训练与功率分配方法,其特征在于,步骤S1中,用户位置信息获取和码本设计包括以下内容:设定服务的M个用户均处于近场范围内,通过定位获取用户的位置信息,包括仰角和距离,将近场下行信道表示为:其中,发送端天线阵列为{1,2,…,N},N表示发送端天线的总数;L表示发送端与用户之间路径的总数;H(t)表示近场球面波信道向量;gl(t)表示第t个时隙内第l条路径的信道增益;j表示虚数单位;λc表示电磁波的波长;rl(t)表示第t个时隙内第l条路径的距离;θl(t)表示第t个时隙内第l条路径的角度;b(θl(t),rl(t))表示第t个时隙内第l条路径的导向矢量;

对近场NOMA系统进行码本设计,具体表达式为:

1

其中, 表示码字的集合,θ1表示第一个角度采样值,r1表示第一个距离采样环上的第N一个距离采样值,θN表示第N个角度采样值,r1 表示第一个距离采样环上的第N个距离采样值, 表示第S个距离采样环上的第一个距离采样值, 表示第S个距离采样环上的第N个距1

离采样值,b(θ1,r1)表示第一个角度采样与第一个距离采样环决定位置对应的导向矢量,bN(θN,r1)表示第N个角度采样与第一个距离采样环所决定位置对应的导向矢量, 表示第一个角度采样与第S个距离采样环决定位置对应的导向矢量, 表示第N个角度采样与与第S个距离采样环决定位置对应的导向矢量;导向矢量即为码字。

3.根据权利要求1所述的近场NOMA系统的波束训练与功率分配方法,其特征在于,步骤S2中,生成波束训练策略与功率分配策略包括以下内容:S201、构建基于DRL的资源分配网络,包括BTN和PAN;其中BTN包括Q网络Q(st,at;k)和目‑标Q网络Q(st,at;k),将Q网络中的权重复制到目标Q网络中;PAN包括actor网络π(st;φ)、‑ ‑critic网络Q(st,at;ψ)、目标actor网络π(st;φ )和目标critic网络Q(st,at;ψ),critic网络用于评价actor网络的输出,目标actor网络复制actor网络的参数,目标critic网络复制‑critic网络的参数;κ与κ 分别表示Q网络与目标Q网络的参数,st表示第t个时隙的状态,at‑表示第t个时隙的波束训练策略与功率分配策略,φ与φ 分别表示actor网络与目标actor‑网络的参数,ψ与ψ分别表示critic网络与目标critic网络的参数;

S202、将第t个时隙的用户位置信息作为状态st输入到基于DRL的资源分配网络中,经过BTN输出用户分组与波束训练策略 W(1) (k) (K)

(t),…,W (t),…,W (t)},其中st={L1(t),L2(t),…,Lm(t),…,LM(t)},Lm(t)表示第t个时隙内第m个用户所在位置,Lm(t)={θm(t),γm(t)},θm(t)表示第t个时隙内第m个用户相对于基站的角度,γm(t)表示第t个时隙内第m个用户相对于基站的距离,LM(t)表示第t个时隙内第M个用户所在位置,1≤m≤M,M表示用户的总数, 表示判别第m个用户是否在(k)第k个组内的分组系数,W (t)表示第t个时隙内第k组分配的码字,k=1,2,…,K,K表示用户组的总数;

当 则表明第m个用户不在第k个组内,当 则表明第m个用户在第k个组内; 包括每一个用户属于哪一个组以及每一个组在波束训练时所用码字的信息;

S203、 经过PAN中的actor网络,利用策略梯度算法输出功率分配策略其中pm(t)表示第t个时隙内第m个用户的功率,pM(t)表示第t个时隙内第M个用户的功率; 包括基站分配给每一个用户的功率;

S204、获得第t个时隙的波束训练策略与功率分配策略S205、根据获得的波束训练策略与功率分配策略,对用户进行分组、波束训练及功率分配,并将结果反馈给基于DRL的资源分配网络,通过奖励函数计算出对应的奖励。

4.根据权利要求1所述的近场NOMA系统的波束训练与功率分配方法,其特征在于,步骤S3中,获得训练完成的基于DRL的资源分配网络包括以下内容:每个时隙中,基于DRL的资源分配网络与系统环境进行交互以更新当前时刻的状态,并获取下一时刻用户的位置,得到数据样本{st,at,rt,st+1},将该数据样本存储在经验回放池中,即为经验元组,其中st+1表示第t+1个时隙的状态,rt表示第t个时隙的奖励;

基于DRL的资源分配网络的训练分为两个部分:

(1)训练BTN:

从经验回放池中随机选择U个经验元组{st,at,rt,st+1}输入到BTN的目标Q网络中,得到对应的目标Q值yt, 通过最小化损失函数L(κ)对参数κ进行更新,完成BTN的训练, 其中 表示第t个时隙的用户分组与‑

波束训练策略,Q()表示目标Q网络进行的运算,κ与κ 分别表示Q网络与目标Q网络的参数,yu表示第u个经验元组的目标Q值,su表示第u个经验元组的状态, 表示第u个经验元组的用户分组与波束训练策略,u=1,2,…,U;

(2)训练PAN:

从经验回放池中随机选择U′个经验元组{st,at,rt,st+1}输入到PAN的actor网络中,通过确定性梯度下降法对参数φ进行更新,通过最小化损失函数L(ψ)对critic网络中的参数ψ进行更新;

‑ ‑

以软更新的方式更新目标actor网络中的参数φ 和目标critic网络中的参数ψ,具体公式为:‑ ‑

φ =τφ+(1‑τ)φ

‑ ‑

ψ=τψ+(1‑τ)ψ

其中,τ表示软更新权重,st表示第t个时隙的状态,ψ表示表示critic网络的参数,φ表示actor网络的参数。

5.根据权利要求1所述的近场NOMA系统的波束训练与功率分配方法,其特征在于,步骤S4中,波束训练与功率分配包括以下内容:在第t个时隙内第m个用户在第k个组中的信道增益表示为:(k)H 2

Gm(t)=|W (t)Hm(t)|

(k)

其中,Gm(t)表示第t个时隙内第m个用户的信道增益,1≤m≤M,M表示用户的总数,W(k)H (k)(t)表示第t个时隙内第k组分配的码字,W (t)表示W (t)的共轭转置,Hm(t)表示第t个时隙内第m个用户的近场球面波信道向量;

当所有用户的信道增益满足以下条件时:

2 2 2

|G1(t)|>|G2(t)|>…>|GM(t)|;

第m个用户的速率表示为:

其中,GM(t)表示第t个时隙内第M个用户的信道增益,Rm(t)表示第t个时隙内第m个用户的速率,pm(t)表示第t个时隙内第m个用户的功率, 表示判别第t个时隙内第q个用2

户是否在第k个组内的分组系数,pq(t)表示第t个时隙内第q个用户的功率,δ表示加性高斯白噪声功率;

当所有用户功率和小于等于基站能提供的最大功率时,将第t个时隙内的奖励rt设为并作为系统的和速率,反之则将奖励rt设为0。

6.应用于权利要求1的一种近场NOMA系统的波束训练与功率分配方法的系统,其特征在于,包括:用户位置信息获取和码本设计模块,用于对近场NOMA系统进行用户位置信息获取和码本设计;

波束训练策略与功率分配策略获取模块,用于构建基于DRL的资源分配网络,根据输入的用户位置信息生成第t个时隙的波束训练策略与功率分配策略,并获得对应的奖励;

模型训练模块,用于利用经验元组对基于DRL的资源分配网络进行训练,获得训练完成的基于DRL的资源分配网络;

波束训练与功率分配模块,用于将当前时隙所有用户的位置信息输入到训练完成的基于DRL的资源分配网络中,通过最大化系统得到的奖励,动态调整波束训练策略与功率分配策略,获得系统最大和速率对应的策略,完成波束训练与功率分配。

7.一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至5中任一项所述波束训练与功率分配方法的步骤。

8.一种计算机可读的存储介质,所述计算机可读的存储介质存储有计算机程序,其特征在于,所述计算机程序被处理器运行时执行权利要求1至5中任一项所述的波束训练与功率分配方法。