利索能及
我要发布
收藏
专利号: 2022110409029
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于策略诱导对多交叉口信号灯协同控制的中毒攻击方法,用于智能交通与机器学习信息安全,包括以下步骤:步骤1:在多交叉口的道路网格上训练强化学习DQN多智能体协同控制模型,训练完成后的强化学习DQN多智能体协同控制模型的网络参数不再发生变化,且具有较高的迁移性,在多交叉口测试过程中体现出高流畅度且无拥堵发生;

步骤2:将所述步骤1中正常训练的智能体策略记为π,确定其中一个要攻击的智能体策略为目标智能体,为了多交叉口信号灯协同控制系统受到异常交通状态的影响,需要训练攻击者指定的对手策略,记为πadv,对手策略πadv是攻击者通过训练所学习到的一种用于指定目标智能体在局部交通状态 下要采取何种次优动作的策略;通过对目标交叉口的智能体选择次优动作进行对手策略的训练,并将对手策略用于指定目标智能体要采取的异常动作,从而延迟区域多交叉口网络的车辆流通时间;此外,采用所述步骤1中的训练数据训练该目标智能体的替代模型,攻击者通过该替代模型计算扰动交通状态使得目标智能体采取对手策略的指定行为;

步骤3:对多交叉口智能体进行训练时,仅在最后一轮训练过程中让目标智能体采取对手策略指定的异常动作破坏多智能体的协同,而在其余轮次按照正常训练过程进行;

当智能体的训练进行到最后一个阶段时,此时目标智能体与替代模型观察到交通状态后采取的动作大致相同;在每个训练阶段的时间,攻击者通过对手策略指定异常动作采用快速梯度下降攻击算法,沿着梯度方向并根据符号函数进行赋值生成异常动作相对应的扰动δt+1,公式表示为:

其中ε代表扰动系数,a′为对手策略所指定的异常动作,sign代表符号函数,θ为替代模型的网络参数,L(θ,st+1,a′)代表t时刻替代模型的损失函数;

对扰动δt+1进行降序排序得到新的排序数组:

在δt+1″中按顺序读取扰动并添加到局部交通状态 中生成异常交通状态,直至该异常交通状态输入到目标智能体中执行对手策略指定的异常动作a’,将异常交通状态记为并且该扰动状态下采取的动作使得为目标智能体m选取异常动作a′时Q值列表中的

最大Q值,A表示智能体的动作空间;θm′代表相邻交叉口m’的神经网络参数;

同时,该异常交通状态作为目标智能体的下一个原始交通状态st+1并存入经验池中,当从经验池中取出数据进行训练时,处于训练过程中的目标智能体观察到异常交通状态将执行攻击者指定的动作并且该异常动作会被误认为最优动作;

步骤4:由于多交叉口交通网络的训练过程中包含多智能体的协同机制,即相邻智能体之间存在Q值迁移机制;当正常训练的目标智能体受到策略诱导攻击时,将会执行异常动作此时目标智能体的Q值会发生变化,同时当前智能体的Q值会在相邻交叉口的Q值传递过程中对相邻智能体的Q值造成变化导致多智能体协同机制被破坏,最终无法学习到最优协同策略;最后在sumo上对正常模型和异常模型在多交叉口网格上进行流畅度对比。

2.如权利要求1所述的一种基于策略诱导对多交叉口信号灯协同控制的中毒攻击方法,其特征在于,所述步骤1中多交叉口的道路是十字交叉口的道路;首先在多交叉口道路网格上训练强化学习DQN多智能体协同控制模型,对进入多交叉口的所有道路上的车辆进行离散交通状态编码;由于输入的交通状态数据为所有路口的全局状态信息,因此为了减少输入数据的同时保证决策不被影响,将每个路口的前半部分进行车辆状态的采集;将多交叉口从路段入口到状态采集终点之间长度为l的道路k等距离划分为等间距的c个离散单元,其中k=1,2,3,4;将t时刻第m个交叉口的道路k的车辆位置表示为车辆位置矩阵smk(t),其中m=1,2,3,4;当车辆头部位于某个离散单元上时,则车辆位置矩阵smk(t)对应第i个位置的值为1,否则值为0,其中i=1,2,…,c;公式表示为:其中 表示车辆位置矩阵smk(t)第i个位置的值;将t时刻四个交叉口输入端的车辆位置矩阵smk(t)按行首尾拼接构成st,公式表示为:st=[s11(t),s12(t),......,s43(t),s44(t)]

再把st作为t时刻的全局交通状态输入到强化学习DQN多智能体协同控制模型中训练,强化学习DQN多智能体协同控制模型输出相应的动作即红绿灯将要执行的相位。

3.如权利要求2所述的一种基于策略诱导对多交叉口信号灯协同控制的中毒攻击方法,其特征在于,定义交通灯的相位作为动作空间A={a1,a2,a3,a4},其中a1为东西方向绿灯,a2为东西方向左转绿灯,a3为南北方向绿灯,a4为南北方向左转绿灯;在运行时设an的相位的初始时长为M,黄灯相位时长为N;在t时刻将全局交通状态st输入到强化学习DQN多智能体协同控制模型中,智能交通灯选择相位an,其中n=1,2,3,4;当an相位执行完后,智能交通灯从环境中采集t+1时刻的状态st+1,然后选择相位an’,若an≠an’,则an相位执行时间不再延长,即an相位结束,在an相位结束后智能交通灯执行黄灯相位,在黄灯相位结束后,执行man’相位;若an=an’,则an相位执行时间延长M;将第m个交叉口的奖励rt设置为每个交叉口的两个连续动作之间路口车辆等待时间之差,公式表示为:m

其中 Wt 分别表示第m个交叉口t‑1时刻和t时刻进入该交叉口所有车道的车辆总体等待时间,根据执行的动作再按照奖励值对动作进行评判,从而不断更新网络的参数;

所使用的强化学习DQN多智能体协同控制模型为Deep Q Network,简化为DQN;用一个深度神经网络作为Q值网络,初始化网络参数,网络的输出就是Q值,隐含层采用Relu非线性激活函数,其中输出层的神经元个数与每个交叉口的动作空间大小相等;公式表示为:Q=h(wst+b)

其中w代表神经网络的权重,st为网络的输入,b为偏置,h(.)表示Relu激活函数;DQN的损失函数为:2

Lt=(yt‑Q(st,an;θ′))

m

其中yt代表第m个交叉口t时刻的目标值,an,an′∈A表示智能体输出的动作即红绿灯相m位,γ为学习率,wm,m′表示交叉口m和相邻交叉口m’的权重系数,rt 代表智能体m在t时刻的奖励, 表示智能体m在t+1时刻的局部交通状态, 表示在t‑1时刻智能体m′的局部交通状态, 表示t‑1时刻智能体m′输出的动作,θm代表智能体m的估计网络的参数,θ′m代表智能体m的目标网络的参数,θm′代表智能体m′的估计网络的参数, 表示在t+1时刻智能体m所有动作对应的Q值中的最大Q值;

DQN的估计网络的参数w和b是随着时间步长逐步更新的,目标网络的参数w’和b’的更新是每隔时间T从估计网络直接复制网络的参数,公式表示为:所述步骤2的具体过程如下:

将所述步骤1中正常训练的智能体策略记为π,确定其中一个要攻击的智能体策略为目标智能体,为了多交叉口信号灯协同控制系统受到异常交通状态的影响,需要训练攻击者指定的对手策略,记为πadv;

通过对目标交叉口的智能体选择次优动作进行对手策略的训练,并将对手策略用于指定目标智能体要采取的异常动作,从而延迟区域多交叉口网络的车辆流通时间;此外,采用所述步骤1中的训练数据训练该目标智能体的替代模型,攻击者通过该替代模型计算扰动交通状态使得目标智能体采取对手策略的指定行为。