利索能及
我要发布
收藏
专利号: 2026100304071
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种扩散模型增强的低空无线网络路径选择方法,其特征在于,对网络环境构建一个由扩散模型驱动的双阶段增强决策框架,执行如下步骤S1‑步骤S6,完成路径选择:步骤S1:实时采集网络状态信息,提取当前时刻及其前若干历史时刻的网络状态信息,构建时序的网络状态表征;

步骤S2:采用扩散模型对网络状态表征进行渐进式去噪,生成虚拟网络状态表征,再将其与网络状态表征进行加权融合,形成增强感知状态表征;

步骤S3:将增强感知状态表征输入路径选择决策智慧代理模型,路径选择决策智慧代理模型根据增强感知状态表征,基于DPPO模型,相应输出动作;

步骤S3中,路径选择决策智慧代理模型的工作机制为:将增强感知状态表征 作为路径选择决策智慧代理模型的输入,路径选择决策智慧代理模型基于DPPO算法框架输出路径选择决策结果,路径选择决策智慧代理模型的可选输出对应于网络中所有可行的数据传输路径,每条路径标识为一个独立的决策选项,路径选择决策智慧代理模型的输出结果对应于从可行路径集合中选择一条特定路径,用于承载当前网络业务的数据传输任务;

步骤S4:利用扩散模型,在增强感知状态表征的基础上,通过渐进式去噪过程得到虚拟动作,将路径选择决策智慧代理模型的输出动作和虚拟动作进行权重组合,构造出增强动作;

步骤S5:将增强动作输入网络环境,网络环境依据增强动作执行路径选择,构建奖励函数,计算奖励,将奖励反馈至路径选择决策智慧代理模型;

步骤S6:对路径选择决策智慧代理模型进行迭代训练,直至所基于的DPPO模型收敛,获得训练好的路径选择决策智慧代理模型,应用并完成网络环境中的路径选择。

2.根据权利要求1所述的一种扩散模型增强的低空无线网络路径选择方法,其特征在于,步骤S1具体方法如下:采集任意 时刻的网络状态 ,包括全局业务请求强度 ,各路径的可用带宽资源,路径传输时延 和路径数据丢包率 信息,具体如下式:;

其中,表示网络状态的维度, ;表示路径数量;

基于各历史时刻的网络状态,构建 时刻的网络状态表征如下式:;

其中, 表示 时刻的网络状态表征, 表示 时刻及 时刻前个时间步长的网络状态。

3.根据权利要求2所述的一种扩散模型增强的低空无线网络路径选择方法,其特征在于,步骤S2具体步骤如下:步骤S2.1:在 时刻的网络状态表征 上逐步添加高斯噪声 ,其中 为正态分布,0表示均值向量为零向量,表示单位矩阵,将 逐渐变为纯噪声 ,正向扩散的表达式为:;

其中,当 时, , 为预设噪声调度参数;

步骤S2.2:利用扩散模型预测噪声,获得预测噪声 ,对预测噪声 状态重建得到其输出结果 ,使 , 为虚拟网络状态表征,状态重建的表达式为:;

其中, 为方差控制项, , 为扩散模型内部第1步到第   步的噪声调度参数   的连乘积;预测噪声 的训练表达式 为:;

步骤S2.3:将网络的状态表征 和虚拟网络状态表征 进行加权组合,构造增强感知状态表征 ,其表达式为:;

其中, 为参数化映射函数, 表示网络状态表征变化率, 和 为预设可学习参数; 为权重系数。

4.根据权利要求3所述的一种扩散模型增强的低空无线网络路径选择方法,其特征在于,步骤S4具体步骤如下:步骤S4.1:利用扩散模型初始化一个纯噪声 ,其中 为正态分布,0表示均值向量为零向量,表示单位矩阵;并依据当前时刻的增强感知状态表征 对 逐步去噪,表达式为:;

其中, 为预设噪声调度参数, , 为扩散模型内部第1步到第   步的噪声调度参数   的连乘积; 为方差控制项, ;

步骤S4.2:利用扩散模型预测噪声,获得动作空间预测噪声 ,并对 逆向去噪得到其输出结果 ,使 , 为虚拟动作,逆向去噪的表达式 为:;

对一个已经作用的动作直接加噪,获得网络状态:;

其中, 为t时刻的网络状态; 为增强动作,具体如下式:;

其中, 为权重系数, 和 为可学习预设参数; 表示虚拟动作,路径选择决策智慧代理以概率 选择虚拟动作,以 概率选择动作策略πθ,其中 为控制探索衰减速率,其表达式为:;

其中,为可控参数,为衰减比例因子。

5.根据权利要求4所述的一种扩散模型增强的低空无线网络路径选择方法,其特征在于,步骤S5具体方法如下:将增强动作 输入网络架构,获得网络架构相应的增强感知状态表征 ,在增强感知状态表征 下执行增强动作 后产生复合奖励函数值 ,其表达式为:;

其中, 为基础奖励,为可控融合系数, 为虚拟奖励,虚拟奖励 的表达式为:;

其中,为可控缩放系数, 为t+1时刻的网络状态表征, 为t+1时刻的虚拟网络状态表征。

6.根据权利要求5所述的一种扩散模型增强的低空无线网络路径选择方法,其特征在于,步骤S6中针对路径选择决策智慧代理模型的训练过程如下:步骤S6.1:初始化奖励折扣因子γ,训练回合总数T,交互步长 ,DPPO模型的策略模块学习率λ1,价值模块学习率λ2,经验样本批次大小D,策略模块参数θ,价值模块参数v;

步骤S6.2:分别针对每个训练回合,路径选择决策智慧代理模型获取初始网络状态表征s0;

步骤S6.3:分别针对每个交互步长,获得 时刻的网络状态表征 、增强感知状态表征,将动作 、增强动作 并执行;

步骤S6.4:路径选择决策智慧代理模型计算获得复合奖励函数值 、下一时刻的增强感知状态表征 ,存储经验样本 ;

步骤S6.5:根据下一时刻的增强感知状态表征 更新网络状态表征;

步骤S6.6:重复执行步骤S6.3‑步骤S6.5,完成 次路径选择决策智慧代理模型与网络架构的交互;

步骤S6.7:针对一个批次中的任一经验样本,采集增强感知状态表征 、经验样本i对应的增强动作 、经验样本i对应的复合奖励函数值 、下一时刻的增强感知状态表征,更新路径选择决策智慧代理的参数;

步骤S6.8:计算更新扩散模型参数φ和w;

步骤S6.9:重复执行步骤S6.7‑步骤S6.8,分别使用同个批次中D个经验样本完成路径选择决策智慧代理模型的参数更新和扩散模型参数更新;

步骤S6.10:重复执行步骤S6.1‑步骤S6.9,完成T个训练回合,获得训练好的路径选择决策智慧代理模型。