1.一种基于信息年龄的工业无线网络的联合优化调度方法,其特征在于,该方法具体包括以下步骤:S1:获取工业无线网络的系统信息,基于网络结构建立信息年龄更新模型和能耗更新模型,构造学习最优调度策略的调度网络;
根据传感器节点周期性采样的特性计算信息年龄,定义 为在传感器节点n处的信息年龄,更新过程如下:其中,fn(t)∈{0,1}表示时隙t时传感器节点n的采样动作,进行数据采样则为1,反之为
0;
定义 表示目的节点处的信息年龄, 的更新过程如下:
其中,dn(t)∈{0,1}表示时隙t时传感器节点n发送数据包是否成功,发送数据成功则为
1,反之为0;
定义传感器节点n发送模式和空闲模式的功率分别为Pe和Pi, 为传感器节点n在时隙t时传输数据所花的时间,在时隙t传感器节点n的能耗为 ,则 和 的更新过程分别为:其中,xn和yn分别为传感器节点n的硬实时数据和软实时数据的数据长度, 为时隙长度,R为传输速率, 表示时隙t时传感器节点n的缓冲区数据, =1表示硬实时数据,反之则为软实时数据;bn(t)∈{0,1,2}表示传感器节点n的在时隙t时的工作模式,bn(t)=0表示休眠模式,bn(t)=1表示空闲模式,bn(t)=2表示发送模式;
S2:构建在数据截止时间逾期率约束下最小化系统平均信息年龄和能耗的多目标优化问题,并根据系统目的节点的信息年龄、能耗和逾期率相关参数建立系统的状态空间、动作空间和代价函数,将链路调度的优化问题转化为带约束的马尔可夫决策过程;
S3:使用改进的深度Q网络来近似状态价值函数,并利用好奇心网络加快收敛速度,具体是在每个时隙更新目标节点的信息年龄,利用当前状态和决策输入获取下个状态并存储至经验池,等待网络的损失函数稳定,从而得到链路调度方法。
2.根据权利要求1所述的工业无线网络的联合优化调度方法,其特征在于,步骤S1中,建立信息年龄更新模型和能耗更新模型具体包括:由N个能耗受限的传感器节点和一个共同的目的节点组成的工业无线网络,传感器节点采样的数据通过无线信道传输给目的节点;n∈{1,2,...,N}表示传感器节点的索引;系统通过时隙调度数据包,令t∈{1,2,...,T}表示时隙索引,其中T是最大时隙号;传感器节点n的采样周期为Hn个时隙,每次采样出硬实时数据和软实时数据的概率分别为gn和1‑gn;
传感器节点n的硬实时数据和软实时数据的截止时间分别为Xn个时隙和Yn个时隙;传感器节点n的硬实时数据和软实时数据的数据长度分别为xn和yn;传感器节点的缓冲区只能储存1个数据包,每次采样前都会刷新缓冲区;时隙t只能调度一个传感器节点发送数据给目的节点,并且所有的数据传输都能在一个时隙内完成;传感器节点支持发送、空闲和休眠三种工作模式,休眠模式只会出现在数据传输完成后;使用un(t)表示时隙t时传感器节点n的缓冲区数据,un(t)=1代表缓冲区中的是硬实时数据,反之则为软实时数据;
假设系统的信道的状态是时变的,并将信道建模为Fritchman信道模型;将信道量化为K种状态,信道状态空间β={0,1,2,...,K};信道状态0到G为无误码状态,G+1到K则为有误码状态;设pg为无误码状态下数据传输成功的概率,pb为有误码状态下数据传输成功的概率;
设h(t)为在时隙t时的信道状态,信道状态之间的转移概率表示为pi,j=Pr(h(t+1)=j|h(t)=i);则状态转移矩阵写为如下形式:。
3.根据权利要求2所述的工业无线网络的联合优化调度方法,其特征在于,步骤S2中,构建在数据截止时间逾期率约束下最小化系统平均信息年龄和能耗的多目标优化问题,具体包括以下步骤:S21:建立联合信息年龄和能耗联合优化目标,则目标节点处的长期平均信息年龄和能耗加权和 表示为:其中,β表示权重参数;
S22:定义Π为所有可行策略的集合,策略π∈Π;优化问题公式化表述为:约束条件为:
*
其中,π 表示最优调度策略, 表示最大平均逾期率的阈值; 表示传感器节点n从初始时隙到时隙t时没有在截止时间内成功传输的数据数量, 表示传感器节点n从初始时隙到时隙t时采样到的数据数量, ∈{0,1}表示时隙被调度的传感器,若传感器节点n在时隙t时被调度,则 =1,否则 =0;
S23:通过拉格朗日松弛法解耦优化问题,将逾期率约束通过引入拉格朗日乘子λ转化进目标函数中:其中, 表示优化目标。
4.根据权利要求3所述的工业无线网络的联合优化调度方法,其特征在于,步骤S2中,建立的系统的状态空间 为:其中, , ,
, ,
, ;
建立的系统的动作空间 为:
其中, ;
建立的系统的代价函数 为:
其中, 表示传感器节点n在时隙t时是否数据逾期。
5.根据权利要求4所述的工业无线网络的联合优化调度方法,其特征在于,步骤S3具体包括以下步骤:S31:基于当前Q网络,将当前系统状态 输入至网络获取决策 ,并执行决策;
S32:执行完毕后,将当前状态输入好奇心网络获取下一状态预测值 ,并通过与环境中的实际下一状态 做对比,获取内在奖励 ;
其中,为比例系数;好奇心网络的损失函数 为:
总奖励rtotal(t)为外在奖励re(t)和内在奖励ri(t)之和,然后将交互经验(s(t), A(t), rtotal(t), s(t+1))放入经验池中,从经验池中选择一个批次经验,用于更新网络;
S33:通过经验集合可获取目标值y(t);
其中,γ 表示折扣因子, 表示目标Q网络的Q值, 表示使当前Q网络的Q值 值最小的动作, 和 分别表示当前Q网络的参数和目标Q网络的参数; 为当前Q网络输出的Q值, 为值函数, 为每个动作的优势函数,N+1是调度决策中存在不发送数据的选择;
S34:由目标值y(t)得到损失函数 :
S35:根据梯度下降法更新网络参数,等待网络达到终止条件后,得到面向工业无线网络的调度方法。