利索能及
我要发布
收藏
专利号: 2023107652363
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度强化学习的移动无线供能物联网资源分配方法,其特征在于,所述移动无线供能物联网包括物联网节点和混合接入点,每个时隙包括控制阶段和传输阶段,其中传输阶段包括数据传输阶段和能量捕获阶段,所述基于深度强化学习的移动无线供能物联网资源分配方法,包括:在所述控制阶段,混合接入点在接收到接收范围内所有物联网节点的状态信息后,基于训练好的深度强化学习网络得到资源分配信息,混合接入点将资源分配信息通过控制信道发送给接收范围内所有的物联网节点;

在所述数据传输阶段,物联网节点在收到资源分配信息后,进行数据解析,获取与自身相关的数据发送时间、能量捕获时间、发送功率和信道获得情况,并查看自身的信道获得情况;

若物联网节点查看自身的信道获得情况为获得数据传输信道,那么该物联网节点使用从混合接入点接收到的数据发送时间和发送功率传输数据;

若物联网节点查看自身的信道获得情况为未获得数据传输信道,那么该物联网节点设置数据发送时间为零,并将能量捕获时间设置为整个传输阶段;

在所述能量捕获阶段,获得数据传输信道的物联网节点在数据传输阶段结束后,根据能量捕获时间进行能量捕获,未获得数据传输信道的物联网节点直接进行能量捕获直到能量捕获阶段结束。

2.根据权利要求1所述的基于深度强化学习的移动无线供能物联网资源分配方法,其特征在于,所述混合接入点在接收到接收范围内所有物联网节点的状态信息后,基于训练好的深度强化学习网络得到资源分配信息,包括:混合接入点通过控制信道发送唤醒数据给接收范围内所有的物联网节点,当物联网节点接收到该唤醒数据时,将状态信息通过控制信道发送给混合接入点;

混合接入点在接收到接收范围内所有的物联网节点的状态信息后,通过信道估计获得接收范围内所有的物联网节点的信道增益状态,将物联网节点的状态信息和对应的信道增益状态合并,并将该合并后的状态输入训练好的深度强化学习网络,得到物联网节点的资源占比情况,包括接收范围内所有的物联网节点的当前数据发送时间占比和当前剩余能量的使用占比,其中当前剩余能量的使用占比表示物联网节点当前发送数据消耗的能量和物联网节点当前剩余能量的比值;

混合接入点通过接收范围内的物联网节点的数据发送时间占比与传输阶段的时间得到接收范围内的物联网节点的数据发送时间;

所述传输阶段的总时间与数据发送时间的差值为能量捕获时间;

混合接入点通过接收范围内的物联网节点的当前剩余能量的使用占比、当前剩余能量和数据发送时间得到接收范围内的物联网节点的发送功率;

混合接入点通过接收范围内的物联网节点的发送功率和数据发送时间得到可实现的吞吐量,同时通过接收范围内的物联网节点的数据包数量与数据发送时间得到需要实现的吞吐量,两者吞吐量取较小值得到接收范围内的物联网节点的可达到的实际吞吐量;

混合接入点从大到小排序接收范围内的物联网节点的实际吞吐量,选取前 个物联网节点分配数据传输信道,其余的物联网节点不分配数据传输信道;

将所述数据发送时间、能量捕获时间、发送功率和信道获得情况定义为资源分配信息。

3.根据权利要求1所述的基于深度强化学习的移动无线供能物联网资源分配方法,其特征在于,所述的基于深度强化学习的移动无线供能物联网资源分配方法,还包括:在每个时隙结束时,所述物联网节点根据预设规律进行移动,并根据泊松过程生成数据包。

4.根据权利要求3所述的基于深度强化学习的移动无线供能物联网资源分配方法,其特征在于,无线供能物联网的覆盖区域被分为 个环形区域,所述物联网节点根据预设规律进行移动,包括:物联网节点根据公式(1)‑(2)进行移动,

其中, 表示第 个环的外半径, 表示物联网节点的分布密度,表示第 个环的外半径, 表示不均匀程度, 表示概率密度函数,表示  在第 个环上的面积分, 表示  在第

个环上的面积分, 表示概率函数以及 表示圆环 ,朝圆心表示物联网节点朝着圆心的方向向圆内移动,朝圆外表示物联网节点朝着圆心的反方向向圆外移动,顺时针表示物联网节点朝着与圆半径垂直的顺时针方向移动,逆时针表示物联网节点朝着与圆半径垂直的逆时针方向移动。

5.根据权利要求1所述的基于深度强化学习的移动无线供能物联网资源分配方法,其特征在于,所述的基于深度强化学习的移动无线供能物联网资源分配方法,还包括,训练所述深度强化学习网络;

所述训练所述深度强化学习网络,包括:

步骤1:初始化深度强化学习网络参数,包含策略网络参数 、价值网络参数 、目标策略网络参数 和目标价值网络参数 ,初始化训练总迭代次数 ;初始化物联网节点分布、物联网节点的能量和数据包数量,设置迭代次数 ;

步骤2:混合接入点获取物联网节点的状态信息和对应的信道增益状态;

步骤3:混合接入点合并物联网节点状态信息和对应的信道增益状态为状态 ;

步骤4:混合接入点把状态 输入到策略网络中,获得动作 ,包括接收范围内所有的物联网节点的数据发送时间占比和当前剩余能量的使用占比,其中当前剩余能量的使用占比表示物联网节点发送数据消耗的能量和物联网节点剩余能量的比值;

步骤5:混合接入点把动作 重新映射,得到接收范围内所有的物联网节点的资源分配信息,然后发送给接收范围内所有的物联网节点;

步骤6:接收范围内所有的物联网节点接收到该资源分配信息后,进行数据解析,获取与自身相关的数据发送时间、能量捕获时间、发送功率和信道获得情况,然后使用所述资源分配信息与混合接入点进行数据传输;

步骤7:混合接入点计算所有物联网节点的实际吞吐量总和 ;

步骤8:混合接入点把时隙 的经验

储存到经验回放池中并随机选取 份

经验,其中, 表示时隙 的状态、 表示时隙 的动作、 表

示时隙 的吞吐量总和以及 表示时隙 的状态;

步骤9:把选取的 份经验根据公式(3)‑(6)使用梯度下降法更新策略网络参数和价值网络参数,其中, 和 分别表示价值函数和策略函数的损失函数,

表示时隙 的动作价值函数, 表示 对

求导, 表示 对 求导, 表示 对 求

导,表示折扣因子, 和 分别是价值网络和策略网络的学习率,表示第份经验,表示第 份经验的状态, 表示第 份经验的动作, 表示第 份经验的奖励,表示时隙 的动作价值函数, 表示时隙 的价值网络参数, 表示时隙 的价值网络参数, 表示时隙 的策略网络参数,表示时隙 的策略网络参数;

步骤10:根据公式(7)‑(8)更新目标策略网络和目标价值网络的参数,其中, 和 表示软更新因子;

步骤11:若 ,则 ,并跳转至步骤2;

步骤12:若 ,训练结束。