利索能及
我要发布
收藏
专利号: 202110598324X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向深度强化学习的策略异常检测方法,其特征在于,包括以下步骤:

构建自动驾驶场景,利用自动驾驶场景采集的状态样本对DDPG网络进行强化学习,优化DDPG网络的参数;

构建包含行动者网络和判别器的模仿学习网络,利用自动驾驶场景采集的状态样本和专家状态动作对对模仿学习网络进行训练,优化行动者网络和判别器的参数;

利用参数优化的DDPG网络基于输入的状态样本生成动作,形成状态动作对,利用参数优化的判别器对状态动作对进行判别,当判别结果为1时,认为状态动作对中的动作未受到攻击,当判别结果为0时,认为状态动作对中的动作存在异常;

当状态动作对中的动作存在异常时,且动作幅度差异在阈值范围外,说明动作受到攻击,利用模仿学习网络生成的状态动作对替换DDPG网络生成的状态动作对,利用模仿学习网络生成的状态动作指导DDPG网络在后续阶段的强化学习过程中做出正确决策。

2.如权利要求1所述的面向深度强化学习的策略异常检测方法,其特征在于,当状态动作对中的动作存在异常时,且动作幅度差异在阈值范围内,则认为是系统误差生成的物理扰动,不进行状态动作对的替换。

3.如权利要求1或2所述的面向深度强化学习的策略异常检测方法,其特征在于,所述动作幅度差异为DDPG网络生成的动作与专家动作之间的差异。

4.如权利要求1或2所述的面向深度强化学习的策略异常检测方法,其特征在于,所述阈值范围为±5°。

5.如权利要求1所述的面向深度强化学习的策略异常检测方法,其特征在于,利用自动驾驶场景采集的状态样本和专家样本对模仿学习网络进行训练时,将状态样本输入至行动者网络,生成状态动作对,并计算状态动作对的第一奖励函数值,同时计算专家状态动作对的第二奖励函数值,以第第二奖励函数值大于第一奖励函数值为目标,不断寻找奖励函数,并利用奖励函数更新行动者网络的参数;

将行动者网络生成的状态动作对和专家状态动作对输入至判别器,通尽可能多地利用专家状态动作对,减少利用状态动作对,来更新判别器的参数,通过判别器的输出来判定状态动作对是否无限接近专家状态动作对,当判别器的输出为0时,表明判别器训练结束。

6.一种面向深度强化学习的策略异常检测装置,包括存储器、处理器以及存储在存储器中并可在处理器上执行的计算机程序,其特征在于,所述处理器执行计算机程序时实现权利要求1~5任一项所述的面向深度强化学习的策略异常检测方法。