1.密集干扰车联网的资源管理方法,其特征在于,包括:构建密集干扰车联网的通信模型;构建的密集干扰车联网的通信模型包括L个车辆用户设备即VUE和N个V2V通信链路即VL和一个路侧基站即BS;VUE与基站之间的链路已事先分配了通信信道和发射功率,第l个信道被第l个VUE使用,因此共有L个通信信道,每个信道的带宽为W,l=1,2,…,L;每个VUE的信道允许被多个VL重复使用,但一个VL在一个时隙内只能访问一个信道;
将所述通信模型中的冲突关系建模为冲突模型;所述冲突模型包括两种冲突关系,直接冲突和隐藏冲突;直接冲突是指在同一时隙t,两个VL使用相同的资源块即RB,并具有相同的发送或接收顶点;隐藏冲突是指在同一时隙t,两个VL同时分配了相同的RB,且其中一个VL的发送或接收顶点位于另一个VL的发送或接收顶点的通信范围内;
采用服务质量指标来衡量所述通信模型的需求,建立所述通信模型的服务质量模型;
所述通信模型的服务质量模型构建为:
其中, 为第l个VUE能够达到的传输速率, 为每个VUE的最小数据速率, 为当分配到为第l个信道时、第n个VL的瞬时信号干扰加噪声比即SINR,γ 0为SINR阈值;
为第n个VL在时隙t的延迟 大于等于VL数据传输的最大可接受延迟Dmax的概率, 为在时隙t开始时第n个VL的队列长度 大于等于延迟超过Dmax的数据包Qmax的概率;po为概率阈值;
基于所述通信模型和所述冲突模型建立超图干扰模型;在所述超图干扰模型中,每个VUE作为一个顶点,VL连接着顶点作为超边,使顶点之间能够通信;t时隙的所述超图干扰模t t t型用入射矩阵I来表征,矩阵I的行代表顶点,列代表超边,矩阵I第n行第e列的元素in,e=
1时为第n个传递顶点包含在第e个超边中,否则in,e=0;
t t t t
用网络冲突度矩阵Φ =log(max(I′R ,1))表征时隙t时密集干扰车联网的情况,I′为t t t入射矩阵I的转置,R 为时隙t时的资源矩阵,资源矩阵R第n行第j列的元素 表示第d个资源块即RB被分配给第n个VL,否则t
密集干扰车联网的整体网络冲突度 计算为: 表示Φ 中1的数量, 表示没有冲突发生,否则
基于所述超图干扰模型和所述服务质量模型,建立所述通信模型的资源分配模型;所述资源分配模型构建为:t
其中,max为最大化,s.t.为使满足,C1至C9为不同的约束条件;T为时隙数量,γl为时隙t时的第l个VUE的信号干扰加噪声比, 为VUE集合, 为VL集合, 为第n个VL的发射功率, 为每个VL的最大发射功率, 为VL的分配索引, 为第l个信道被分配给第n个VL,否则将所述资源分配模型转化为马尔科夫决策模型;
在所述马尔科夫决策模型中:将每一个VL表示为一个代理,每个代理都要接受训练,以制定一种策略,决定其信道选择的最优行动,从而最大化其奖励函数;N个代理的马尔科夫决策模型定义为一个元组 其中 是状态空间, 是行动空间, 是转移概率, 为奖励函数,γ是贴现因子;
状态空间包括V2V信号链路的信道系数 VUE的信道系数 在上一个时隙t‑1与第n个VL相邻的VL的信道分配和第n个VL发射机上队列的当前长度指当前时隙t内将第l个信道上与第n个V2V链路相关的信道功率增益, 指当前时隙t内当重复使用第n个信道通信时第n个VL对第l个VUE的信道干扰参数;
行动空间包括每个代理执行的操作,包括选择信道 和发射功率时隙t时的奖励函数设计为:
其中,惩罚函数U(z)会在奖励的任何部分未得到满足时施加惩罚,z指代惩罚函数括号内的值,U(z)具体如下:其中,常数A1<0,λ1、λ2和λ3是已定义的奖励三个组成部分的权重系数;
对所述马尔科夫决策模型进行求解,获取当前时刻所述密集干扰车联网的资源分配策略。
2.根据权利要求1所述的密集干扰车联网的资源管理方法,其特征在于,在对所述马尔科夫决策模型进行求解时,采用DQN算法逼近所述马尔科夫决策模型的Q值函数;在DQN算法中,每个代理由两个神经网络即Q网络和目标Q网络以及一个经验回放池组成;DQN算法的输入为密集干扰车联网的当前状态,输出为一组动作,即资源分配方案;
在Q网络中,代理接收每个时间步长t的状态信息st作为输入,并输出当前状态st下执行行动空间中各个行动at的行动Q值Q(st,at;w),其中w为Q网络的权重;得到估计Q值后,采用贪婪算法策略选择最佳行动at,即选择Q值最高的行动at;
在代理指定行动at之后,系统会收到返回的回报rt,并进入下一个状态st+1;每个时间步长的一组数据(st,at,rt,st+1)使用经验重放法存储在大小为D的经验重放缓冲区中;
在目标Q网络中,随机采样元组(st,at,rt,st+1)用于计算目标Q网络的期望值,即:‑
yt=rt+maxQ(st+1,at+1;w).
‑
Q(st+1,at+1;w)为目标Q网络在下一状态st+1下执行行动空间中各个下一行动at+1的Q值,‑w是在之前的训练过程中获得的目标Q网络的参数;目标Q网络可以通过最小化损失函数来训练,即:2
L(w)=(yt‑Q(st,at;w))
使用随机梯度下降法计算损失函数,并使用Q网络的权重更新目标Q网络的权重。
3.根据权利要求2所述的密集干扰车联网的资源管理方法,其特征在于,利用联邦学习方法来提高DQN算法的收敛速度,具体为:所有代理都使用全局模型建立本地DQN网络,在全局模型训练过程中,第k个代理从自己的回放缓冲区Dk中随机选择一小批样本Bk,以最小化损失函数进行训练,并更新本地参数然后,在一轮学习结束时,通过参数加权平均得出的全局模型全局参数;
t
时隙t时,全局模型的损失函数L(w)的最小化为:
t
其中,w为时隙t时全局模型的网络参数, 为时隙t时第k个代理的网络参数,K为代理的总数;
时隙t时,全局模型的网络参数更新如下:
其中,η为学习率;在一轮训练过程中,在当前时隙t,每个代理首先获取全局模型的最t‑1新参数w 作为自己的最新参数 计算其损失函数 然后,每个代理计算损失函数的梯度 得到新的本地参数 更新本地模型;本地训练完成后,每个代理将新的本地参数 发送给全局模型的服务器;全局模型的服务器对所有代理的参数进行聚合,得到t新的全局参数w并将该参数群发给每个代理进行下一轮的训练。