利索能及
我要发布
收藏
专利号: 202110488718X
申请人: 江苏大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度强化学习的车载边缘任务集中调度与资源分配联合优化方法,其特征在于,包括如下步骤:步骤1,获取车辆接入的RSU的集合r、请求在RSU区域中的卸载的车辆的任务的相关信息、RSU对应的服务器负载;

步骤2,将车载任务边缘调度与资源分配决策方法转化为数学问题,进行数学建模;

所述步骤2中进行数学建模的方法包括如下:

步骤2.1,考虑到计算车载任务受当前CPU时钟周期与CPU占用率影响,定义计算车载任务所用时长为 其计算方法为:步骤2.2,定义任务j之前共有n‑1个车载任务送入同一个服务器i进行计算,则任务j的计算延迟为 表示任务j的计算延迟,任务j是第n个任务,则:其中 表示任务j之前的任务x的计算延迟,任务x之前共有n‑1个任务;

步骤2.3,根据步骤2.2,则任意服务器i中所有任务的计算延迟总和为:其中,Ni表示服务器SERi中所有任务的数量;

步骤2.4,根据步骤2.3,则所有服务器中的所有任务的计算延迟总和为:其中,I表示所有服务器的总量;

步骤2.5,由于服务器利用率受到新达到的车载任务影响,需重新计算CPU利用率util=util(m,z):其中,ρ表示计算两个任务之间的时间间隔;z={z1,…,zj,…zn},zj={1,0},当zj=1时,表示任务j被服务器运算,当zj=0时表示任务j没有被服务器运算;

步骤2.6,计算RSU的热度标准差;RSU热度用来衡量涌入某个RSU的车载任务的计算量,RSU的热度标准差用来衡量各个RSU的负载均衡的程度,其计算方式如下:其中,μ表示各个RSU的计算量的平均值;

步骤2.7,结合步骤2.4、步骤2.5、步骤2.6,将车载任务边缘调度与资源分配决策转化为求解下列式(7)其中ξ为权重;

步骤3,建立马尔可夫模型并求解步骤2中的数学模型;

建立马尔可夫模型求解式(1)的具体步骤包括如下:步骤3.1,建立马尔可夫状态空间S:

S={t,h,util}             (8)其中各个参数说明如下:

①t={T1,…,Tj,…,Tn},为车载任务q的计算延迟约束集合;

②h={H1,…,Hi,…,Hn},为节点中服务器ser的CPU周期;

③util={U1,…,Ui,…,Un},为节点中服务器ser的CPU占用率;

步骤3.2,建立马尔可夫动作空间A:

A={a,orderQSer}        (9)其中各个参数说明如下:

①a为车载任务q在各个服务器中分配到的计算资源,a={a0,…,ay,…ak},其中ay‑1<ay, 其中a0表示没有被分配到计算资源,即车载任务没有被计算;

②orderQSer表示车载任务q在各个服务器中的放置顺序,其中orderQSer={qSER1,…,qSERx,…qSERn},qSERi表示在SERx中的车载任务集合,其中表示车载任务Qj在服务器SERx

中接收的任务中放置在第order的位置;

步骤3.3,建立马尔可夫奖励函数

n‑1

reward=ε(η)×base+κ×(t‑(TRun(m,h,util)+D ))+ξ×ε(S)/σ(m,μ)   (10)其中各个参数说明如下:①ε(η)为阶跃函数

其中,ε(η)=1时表示车载任务被成功计算,ε(η)=0表示车载任务没有被成功计算;

②base为常数,表示基础奖励,ε(η)×base表示当一个车载任务被成功计算后会获得基础奖励,失败则不会获得基础奖励;

n‑1

③TRun(m,h,util)+D 表示计算一个车载任务所造成的计算延迟;

n‑1

④κ×(t‑(TRun(m,h,util)+D )),其中κ为权重,t为该车载任务允许的最大计算延n‑1迟,则κ×(t‑(TRun(m,h,util)+D ))表示计算该车载任务节省的时间越多则获取到的奖励越多;相反的,如果计算该任务超出了规定的最大时长,则会受到惩罚,超出的时间越多,获得的惩罚越多;

⑤ε(S)是阶跃函数:

ξ为权重,则ξ×ε(S)/σ(m,μ)表示当所有车载任务计算完成后,则计算各个RSU的热度标准差,热度标准差越小则获取的奖励越多,否则获取的奖励越少;

步骤3.4,根据上述步骤建立的马尔可夫模型,使用DDQN算法求解式子(1),得到车载任务边缘调度与资源分配的最优结果;

所述步骤3.4的具体过程如下:

步骤3.4.1,建立当前Q网络,目标Q网络,这两个网络的说明如下:①当前Q网络的网络参数为ω,ω也代指神经网络,ω用来根据当前的状态S选择动作A,动作A作用与当前状态S,生成状态S'和奖励R,奖励R由奖励函数reward获得;

②目标Q网络的网络参数为ω',ω'也代指神经网络,用来评估当前状态的价值,并帮助前Q网络ω的更新;

步骤3.4.2,训练当前Q网络,目标Q网络;

步骤3.4.3,由训练好的当前Q网络得出车载任务边缘调度与资源分配决策的最优结果;

所述步骤3.4.2的具体过程如下:

3.4.2.1,获得当前状态S及其特征向量φ(S);

3.4.2.2,当前Q网络根据状态S生成动作A;

3.4.2.3,根据状态S和动作A计算奖励R,并获取下一状态S'并计算其特征向量φ(S'),将S'定义为当前状态;

3.4.2.4,将之前获取的{φ(S),A,R,φ(S')}存入经验回放池中;

3.4.2.5,计算当前Q网络的Q值;

3.4.2.6,更新当前Q网络参数ω,目标Q网络参数ω';

3.4.2.7,如果当前状态S'是终止状态,则迭代完毕,否则转到步骤3.4.2.1。

2.根据权利要求1所述的一种基于深度强化学习的车载边缘任务集中调度与资源分配联合优化方法,其特征在于,所述步骤1中的相关信息包括:①任务的计算时延约束定义为t={T1,…,Tj,…,Tn};

②将车载任务可能送入的边缘服务器集合定义为ser={SER1,…,SERi,…SERn};

③服务器的CPU时钟周期定义为h={H1,…,Hn},其中Hi表示SERi的CPU时钟周期;

④当前需要处理的车载任务集合为q={Q1,…,Qj,…,Qn}⑤车载任务j占用的CPU周期数为Mji,其中i表示服务器SERi, m={m1,…,mi,…,mn};

⑥服务器的CPU占用率定义为util={U1,…,Ui,…,Un},其中Ui表示服务器SERi的CPU占用率。

3.根据权利要求1所述的一种基于深度强化学习的车载边缘任务集中调度与资源分配联合优化方法,其特征在于,所述步骤3中,建立马尔可夫模型求解式(7)的关键在于寻找车载任务的最佳放置序列以及各个任务分配的最合理计算资源。

4.根据权利要求1所述的一种基于深度强化学习的车载边缘任务集中调度与资源分配联合优化方法,其特征在于,还包括步骤4,将所述训练好的当前Q网络部署至SDN控制器。

5.根据权利要求4所述的一种基于深度强化学习的车载边缘任务集中调度与资源分配联合优化方法,其特征在于,在应用时,当有车载任务的计算要求时,由SDN控制器根据当前网络节点的各种信息,由部署的当前Q网络得出车载任务边缘调度与资源分配决策的最优结果。