利索能及
我要发布
收藏
专利号: 2022104872992
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于USRP RIO的强化学习通信干扰方法,其特征在于,基于数据处理中心、工作在相同频带上的干扰机、发射机,以及与发射机通信连接的接收机;实现干扰机对发射机与接收机进行通信干扰;所述干扰机的感知节点周期性地在预设扫描频段内扫描监测发射机与接收机之间的通信环境,获得发射机与接收机之间频谱数据信息,并将所述频谱数据信息发送给数据处理中心;基于通信信道信息,应用预设已训练好的Q学习引擎模型,获得对应的Q表信息,所述Q表信息包括干扰机当前状态信息Sn与干扰机当前状态信息Sn所对应其下一动作信息an的Q值;所述干扰机周期性读取Q表信息的Q值,并根据Q值对发射机与接收机进行通信干扰;

其中,

所述数据处理中心接收并处理该频谱数据信息,进一步获取发射机与接收机的通信信道信息,具体包括以下步骤A至B:步骤A:基于发射机与接收机之间频谱数据信息,数据处理中心对所述频谱数据信息进行采样处理,获得采样后的频谱数据信息;随后进入步骤B;

步骤B:对采样后的频谱数据信息进行频谱资源判决,获得发射机与接收机的通信信道信息,包括执行步骤B1至步骤B4;

步骤B1:对采样后的频谱数据信息通过如下公式M:

进行判决,获得通信信道信息;其中,Ei为不同的感知节点的同一频段能量检测的频谱数据信息的均值,i为不同的感知节点,N为感知节点的数量,h0和h1分别为判断空闲频谱数据信息和非空闲频谱数据信息的判决门限,F代表了通信信道信息的判决结果;当判决结果F=‑1时,表明该频谱数据信息为未被使用的空闲频谱数据信息,即该通信信道进为空闲信道;当判决结果F=1时,表明该频谱数据信息为已被使用的非空闲频谱数据信息,即该通信信道进为正在通信的信道;当判决结果F=0时,即无法准确界定该频谱数据信息是否已被使用;

如果判决结果F=‑1,则返回步骤B1;

如果判决结果F=1,则返回步骤B1;

如果判决结果F=0,则进入步骤B2;

步骤B2:统计当次判决的所有感知节点的同一频段能量检测的频谱数据信息的均值Ei,随后进入步骤B3或步骤B4;

步骤B3:统计当次判决的所有EiN/2,则判决结果为F=‑1;如果N0

步骤B4:统计当次判决的所有Ei>h1的感知节点的数量N1,如果N1>N/2,则判决结果为F=

1,如果N1

所述Q学习引擎模型,基于通信信道信息,按照如下W训练方法获得:以通信信道信息为输入、通信信道信息所对应的Q表信息中的Q值为输出,针对预设待训练网络进行训练,获得Q学习引擎模型,具体是步骤W1至W2:步骤W1:基于通信信道中干扰机当前状态信息Sn=(jn,un),jn表示干扰机当前干扰的信道,un表示当前通信用户使用的通信信道,计算当前状态信息Sn对应的下一动作信息an,an=jn+1,并执行动作an,随后进入步骤W2;

步骤W2:计算当前通信用户使用的通信信道的下一通信信道信息un+1,并计算动作信息an的奖励值rn,并更新干扰机状态为Sn=Sn+1,对Q表中的Q值进行更新,随后返回步骤W1。

2.根据权利要求1所述的基于USRP RIO的强化学习通信干扰方法,其特征在于,所述Q表信息中的Q值按如下公式:Qn+1(sn,an)=(1‑α)Qn(sn,an)+α(rn+γ*maxQn(sn+1,a)),进行更新,其中:α为学习率;Qn(sn,an)表示n时刻Q表中状态为sn动作为an的Q值;sn+1是在sn状态选择动作an后的下一个状态;rn表示执行动作an后获得的奖励;γ为折扣因子,表示未来奖励的重要性;rn+γ*maxQn(sn+1,a)表示本次Q函数的估计奖励值,Qn+1(sn,an)表示更新的Q值,最后在每次决策后更新Q表。

3.根据权利要求1所述的基于USRP RIO的强化学习通信干扰方法,其特征在于,所述步骤A中,数据处理中心对所述频谱数据信息进行采样处理按如下方法进行采样:预设采样率M对所述频谱数据信息进行采样处理进行采样。

4.根据权利要求1所述的基于USRP RIO的强化学习通信干扰方法,其特征在于,干扰机通过能量检测的方法周期性获得发射机和接收机之间的频谱数据信息。