利索能及
我要发布
收藏
专利号: 2021100061113
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于强化学习的异构网络资源分配方法,其特征在于,在一个具有M个基站和N个移动用户的异构网络的下行链路中,宏基站MBS有 个,微基站PBS有 个,且满足;

设定 表示基站m与用户n之间的关联关系, 表示基站m与用户n关联;

表示基站m与用户n无关;

设定 表示频谱状态,当用户n与子载波k上的基站m相关联时,频谱状态 使用以下规则确定: 表示用户n使用子载波k; 表示用户n不使用子载波k;

设定 表示用户n与基站m在子载波k上的传输功率;具体如下:表示每个小区基站的总发射功率应该在预设功率限制 之下;

采用块衰落模型表示时隙t中用户n到基站m的下行链路信道增益如下:其中 ,表示包括路径损耗和对数正态阴影在内的大尺度衰落分量,遵循Jakes衰落模型;将小尺度瑞利衰落分量 表示为一阶高斯‑马尔可夫过程:其中 是独立的且具有单位方差的均匀分布的圆对称复高斯随机变量; ,其中 是第一类零阶贝塞尔函数, 是最大多普勒频率;

当不同小区中的用户分配相同的子载波时遭受到的小区间干扰ICI如下表示:其中 表示基站m在子载波k上服务的用户n受到的小区间干扰; 表示在子载波k上基站m'到用户n'的发射功率; 是在子载波k上从基站m'到用户n的信道增益的平方;当 时,由基站m在子载波k上服务的用户n的信号干扰加噪声比如下:其中 是从基站m到用户n的加性高斯白噪声的幂;当基站m的用户n和基站m' 的用户n'同时被分配了子载波k时, 将干扰基站m的用户n,且 ;

步骤S1、针对每个基站部署DNN框架,所述DNN框架基于ADMM算法,并将信道信息CSI作为异构网络权重;根据基站所得用户关联信息、平均干扰功率,给出当前状态下最佳的资源分配策略;具体地,

频谱效率目标优化函数如下:

能源效率目标优化函数如下:

基于ADMM算法解决所述频谱效率目标优化函数,增广拉格朗日函数如下:其中 ,代表拉格朗日乘数, 是惩罚参数;此时,所述频谱效率目标优化函数表示为:

通过分别对 求偏导找到 的最佳解;

步骤S2、将每个基站视为独立代理,基站的状态被作为建模环境;若干代理程序观察同一异构网络环境,并采取行动,同时代理程序通过环境的奖励相互沟通;代理商根据奖励调节政策;具体地:

状态集S:由 个状态组成,包括 ;所述代理程序观察到的用于表征异构网络环境的状态 包括用户关联信息 和干扰功率 ,则异构网络状态表示为: ;

动作集A:根据当前状态,代理基于决策策略π在 处采取动作;该动作包括选择子载波 和相应的传输功率 ;则将动作表示为 ;

奖励:采取行动后,代理程序计算环境的回报 ;将能源效率函数定义为系统模型中的奖励:

设计一个基于DNN的优化框架,结合Q学习以生成策略π;其中所述基于DNN的优化框架的输入是观察到的状态集S,基于DNN的优化框架的输出是动作集A中的所有可执行动作;每个状态动作对都有对应的Q值 ;每个步骤都会选择在每个状态下获得最大Q值的动作,具体如下表示

根据Q学习算法,通过以下公式更新Q值 :其中 和 分别是学习率和折扣因子; 表示下一状态, 表示在状态 下采取行动后获得的报酬,表示状态 下的可执行行动,为可执行行动集; 表示状态 下的Q值, 表示更新后的Q值; 表示状态 下的可执行动作集合 中的最大Q值;每一个代理中的损失函数可以表示为:其中 表示目 标网络的网络参数 ,表示在线网络的网络参数;将信道增益的平方 以及加性高斯噪声 作为第l层的网络参数,其中 代表ADMM算法第l次迭代;

使用 贪心策略从在线网络 中选择动作 ,目标网络 是在线网络的副本,但网络参数在迭代中固定不变;目标网络的网络参数每经过一次迭代后,替换为在线网络中的网络参数。

2.根据权利要求1所述的一种基于强化学习的异构网络资源分配方法,其特征在于,所述步骤S1中基于ADMM算法的资源分配方法具体步骤如下:步骤S1.1、更新当前观测到的状态 ;

步骤S1.2、初始化网络参数 ;

步骤S1.3、设置阈值 ,最大迭代次数 ,开始迭代;根据DNN网络计算;当 时,输出对

应的 。

3.根据权利要求1所述的一种基于强化学习的异构网络资源分配方法,其特征在于,所述步骤S2利用将信道状态信息作为网络权重的ADMM网络得到最佳资源分配方案,具体步骤如下:

步骤S2.1、初始化重现存储 ,DQN网络参数 ,以及目标网络替换步长 ;

步骤S2.2、初始化在线网络 和 ,初始化目标网络 并使 ;

步骤S2.3、设置阈值 ;

步骤S2.4、每个代理程序根据当前状态信息并使用 贪婪策略选择出决策 ;

步骤S2.5、更新环境 ,得到奖励 ;

步骤S2.6、每个代理程序观察所有代理得到的奖励将 存储到各自的D中;

步骤S2.7、从D中随机抽取样本,计算损失函数 ,并更新 ,每隔 步更新目标网络参数 ,直到所有代理满足阈值或者达到最大迭代步骤。