利索能及
我要发布
收藏
专利号: 2022103699046
申请人: 重庆邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-12
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种无蜂窝毫米波大规模MIMO系统的AP开关切换方法,其特征在于,该方法具体包括以下步骤:S1:构建无蜂窝毫米波大规模MIMO系统基于总能效的优化问题模型;

S2:采用SINR感知技术构建效用函数,以实现QoS约束下总能效最大化为优化目标;

S3:构建强化学习模型,包括以下步骤:

S31:构建状态空间分级算法:首先对效用函数离散化分级处理,将状态空间划分为多个状态子空间;然后采用哈希检索法对状态进行哈希编码;最后根据状态空间分级算法更新状态;

S32:深度决斗算法:使用步骤S31更新的状态信息在深度决斗DQN框架下学习,更新网络参数。

2.根据权利要求1所述的AP开关切换方法,其特征在于,步骤S1中,无蜂窝毫米波大规模MIMO系统中,假设系统配置有M个AP和K个用户,每个AP有Nt根天线和 个射频链;每个用户有Nr,k根天线,数据流数为Ns,k;每个用户的带宽为B0,假设系统工作在TDD模式,通过上行训练实现信道估计;每个用户由特定的AP集群提供最好的服务;定义 为第m个AP提供服务的用户集群,集群中的最大用户数为NUE,max, 表示为第k个用户提供服务的AP集群,集群中的最大AP数为NAP,max;第k个用户和第m个AP之间的信道为 该信道采用基于簇的大规模MIMO信道;

构建无蜂窝毫米波大规模MIMO系统基于总能效的优化问题模型,具体包括:针对无蜂窝毫米波大规模MIMO系统基于总能效的AP开关切换策略,定义M个AP的开关映射关系为状态s=[o1,...,om,...,oM],om=1表示第m个AP打开,om=0表示第m个AP关闭,AP激活集合为以状态s为目标变量,第k个用户的干扰协方差矩阵加上有效噪声为Rk,则第k个用户的下行可达速率 总能效 分别表示为:其中,I表示单位矩阵,PT(s)表示总功率,Lk表示第k个用户的合并器,k表示第k个用户,l表示第l个用户, 为噪声功率,pm,k为第m个AP分配给第k个用户的功率,Hm,k表示第m个AP和第k个用户之间的信道矩阵,Fm,l表示第m个AP对第l个用户的预编码矩阵;

以状态s作为目标变量的优化问题表示为:

其中,Pmax表示每个AP的传输功率限制,Rmin表示每个用户的最小频谱效率限制。

3.根据权利要求2所述的AP开关切换方法,其特征在于,步骤S2中,构建效用函数具体包括:定义效用函数 为:其中, 表示对下行可达速率的满意度, 表示对系统总能效的满意度;μ为加权系数,取值在0和1之间,最优μ值的选择需要基于最小化 和Rmin间的差值来最大化系统总能效,即解决其中,εr表示误差容忍度;

确定最优加权系数μ:假设 为在无QoS约束下的最大总能效;Rmax为系统最大可达速率,对应的总能效为 定义可达速率满意函数 能效满意函数 和加权系数μ分别为:其中, 表示总能效,ω表示满意度加权系数。

4.根据权利要求3所述的AP开关切换方法,其特征在于,步骤S2中,SINR感知技术具体包括:第k个用户的信干噪比为2

其中,gk(s)为有用信号功率,Ik(s)为信道干扰功率,σ为噪声功率,则下行可达速率可表示为:(t)

在AP与CPU代理的交互过程中,假设在时刻t‑ΔT与时刻t之间,所有AP的激活状态s保持不变,CPU代理通过多次与环境交互收集所有用户的干扰功率和有用信号功率,该时间间隔内用户k的干扰功率和有用信号功率样本集合分别为Ik={Ik,nΔt},gk={gk,nΔt},Δt=ΔT/Mt,n=1,...,Mt,则用户k在ΔT间隔内Mt个样本的平均干扰功率为和平均有用信号功率为 在时刻t,用户k的平均信干噪比和平均可达速率分别为:

在时刻t,平均总能效和效用函数分别为:

5.根据权利要求4所述的AP开关切换方法,其特征在于,步骤S31中,构建状态空间分级算法具体包括:将权衡后的效用函数进行离散化分级,将连续的效用函数 从小到大划分为P个不同等级的离散效用函数值 则离散效用函数值序列为其中, 为最小效用函数值, 为最大效用函数值;基于效用函数的离散化,状态空间被划分为多个状态子空间;假设状态s对应的效用函数值为 状态s对应的离散效用函数等级p为:假设第t次马尔科夫过程收集到Mt个样本,根据式(14)得到平均可达速率 根据式(15)得到平均总能效 再根据式(16)计算得到 则时刻t的样本为 马尔科夫链样本集为 将不同时刻的样本 存储到缓存空间,如果出现样本偏差的情况,则使用历史状态对应的样本;为了避免 长期使用历史信息而无法实时适应环境变M化,以T为周期初始化样本集 的缓存空间;状态空间的大小为2,当M取值很大时,采用哈希(t) (t)检索方法,对状态s 进行哈希编码hb(s ),根据哈希码索引存取信息通过式(18)能找到与 对应的等级p和分级效用函数 接下来将确定 对应的分级状态 定义 为效用函数 的邻近状态集合:*

在 中,最大总能效对应的状态定义为分级状态 其中t 满足

值得注意的是,不能靠提前离线训练获取,而是CPU代理在与环境交互过程中实时更新;在确定 对应的等级p及其分级样本 之后,p个等级的分级样本集更新为:在实现过程中,需要与 内最优状态进行比较更新。

6.根据权利要求5所述的AP开关切换方法,其特征在于,步骤S32具体包括:在深度决斗(t)训练阶段通过使用SINR感知技术、哈希检索法和状态空间分级算法获取经验信息(s ,a(t) (t) (t+1),r ,s ),然后在深度决斗DQN框架下有效地学习。