1.一种基于模仿学习和注意力机制的深度强化学习策略保护防御方法,其特征在于,包括:
构建自动驾驶场景,并基于自动驾驶场景采集环境状态,利用环境状态进行包含主网络和子线程网络的A3C网络的目标策略的预学习,并根据预学习的A3C网络生成决策动作,与对应的环境状态组成专家状态动作对;
构建包含行动者网络和判别器的模仿学习网络,行动者网络用于依据专家状态动作对中环境状态生成模仿动作,该模仿动作对与输入的环境状态组成模仿状态动作对,判别器用于区分输入的专家状态动作对与模仿状态动作对;
将判别器的输出作为奖励值,来构建模仿学习网络的损失函数,利用该损失函数指导模仿学习网络的模仿策略学习,以更新模仿学习网络的参数,同时,从行动者网络中提取浅层特征,并基于注意力机制生成对抗样本;
将行动者网络的模仿策略的期望奖励值作为惩罚项,重建A3C网络的新目标函数;根据对抗样本和/或新目标函数进行A3C网络的目标策略的对抗学习;
学习结束后,A3C网络中的主网络与对应的参数组成能够防御攻击的目标决策模型。
2.如权利要求1所述的基于模仿学习和注意力机制的深度强化学习策略保护防御方法,其特征在于,利用环境状态进行A3C网络的目标策略的预学习时,每个子线程网络利用采集的环境状态进行目标策略的学习以更新各自的参数,主网络利用各子线程网络的参数的加权求和更新自己的参数,主网络将更新后的参数复制给各子线程网络。
3.如权利要求1所述的基于模仿学习和注意力机制的深度强化学习策略保护防御方法,其特征在于,将判别器的输出作为奖励值,构建的模仿学习网络的损失函数Loss为:其中,s表示状态,a表示动作,a'表示模仿动作,D表示判别器,πIL表示模仿学习网络的模仿策略,πt表示A3C网络的目标策略,也是采样的专家策略,logD(s,a)表示判别器对专家状态动作对的判断,log(1‑D(s,a′))则表示对模仿状态动作对的判断,通过这样一个最大最小博弈过程,循环交替优化行动者网络和判别器来训练所需要的行动者网络和判别器,是模仿策略πIL的熵,由常数λ控制,作为损失函数中的策略正则项,sup表示上确界,即最小上界,就是在提供的状态动作对数据集的情况下求得损失。
4.如权利要求1所述的基于模仿学习和注意力机制的深度强化学习策略保护防御方法,其特征在于,从行动者网络中提取浅层特征,并基于注意力机制生成对抗样本,包括:首先,从行动者网络中提取输入的原始状态图的浅层特征,并对浅层特征进行上采样、reshape、移位处理后,将移位前后的特征图进行乘积运算并经过softmax处理得到通道注意力图;
然后,将通道注意力图与移位前的特征图乘积运算后,再与移位前的特征图进行点积运算,得到像素注意力图;
最后,将像素注意力图经过reshape处理后与原始状态图进行点积运算得到噪声扰动,将噪声扰动与原始状态图点乘运算得到对抗样本。
5.如权利要求1所述的基于模仿学习和注意力机制的深度强化学习策略保护防御方法,其特征在于,将行动者网络的模仿策略的期望奖励值作为惩罚项,重建A3C网络的新目标函数为:其中,τ1和τ2分别是根据目标策略和模仿策略得到的轨迹数据,由多个时刻的动作组成,T1、T2分别表示轨迹数据τ1和τ2包含的时刻数,t表示时刻的索引, 和 分别表示状态st在目标策略πt和模仿策略πIL下Critic网络的值函数值, 分别表示轨迹数据τ1和τ2的奖励值,其中, 等于期望奖励值
6.一种基于模仿学习和注意力机制的深度强化学习策略保护防御装置,包括存储器、处理器以及存储在存储器中并可在处理器上执行的计算机程序,其特征在于,所述处理器执行计算机程序时实现权利要求1~5任一项所述的模仿学习和注意力机制的深度强化学习策略保护防御方法。