1.一种面向强化学习的检测防御异常数据方法,其特征在于,包括以下步骤:S1、采集场景a下小车正常驾驶状态作为样本数据,对样本数据采用主成分分析PCA降维处理,得到前n个特征值的第一累计贡献率α以及相应的变换矩阵P,具体如下:S11、从训练数据存储区中采集场景a下T个时刻的小车正常驾驶状态数据xs组成矩阵X序列作为样本数据;
S12、根据式(1)对每个小车正常驾驶状态数据xs进行标准化处理得到ys:其中, 为ys中第i行第j列的数据, 为xs中第i行第j列的数据,μi为第i行数据的均值,σj为第j行数据的标准差;
S13、根据式(2)计算协方差矩阵S,
其中, 是ys矩阵中第i行数据, 是ys矩阵中第i行数据的转置;
S14、计算协方差矩阵S的特征值λk和对应的特征向量ak,k=1,2,···,m;
S15、将特征值λk按照从大到小排列,λ1≥λ2≥···≥λm;选择累计贡献率大于阈值的前n个特征值对应的特征向量(a1,···,an)组成m行n列的变换矩阵P,前n个特征值的累积贡献率为主成分的第一累计贡献率α,第一累计贡献率α的计算公式如式(3)所示;
或者,根据式(4)计算每个特征值的贡献率ηk,将贡献率按照从大到小排列η1≥η2≥···≥ηm,选择累计贡献率大于阈值的前n个特征值对应的特征向量(a1,···,an)组成m行n列的变换矩阵P,前n个特征值的累积贡献率为主成分的第一累计贡献率α,第一累计贡献率α的计算公式如式(5)所示;
S2、基于DDPG算法建立场景a下自动驾驶训练模型,预训练场景a下自动驾驶训练模型,将状态转换过程存入经验回放缓冲区D,所述的场景a下自动驾驶训练模型包括主网络、目标网络和经验回放缓冲区D;
S3、采集场景a下自动驾驶训练模型训练过程中的状态st,利用变换矩阵P对状态st进行降维处理,计算前n个特征值的第二累计贡献率α’,具体如下:
S31、采集场景a下自动驾驶训练模型训练过程中的状态st;
S32、根据式(6)利用变换矩阵P对状态st进行降维处理得到状态st’;
st’=st·P (6)
S33、计算状态st’的特征值λ’k,k=1,2,···,m,将特征值λ’k按照从大到小排列λ’1≥λ’2≥···≥λ’m,根据式(7)计算前n个特征值的第二累计贡献率α’;
或者根据式(8)计算每个特征值λ’k的贡献率η’k,将贡献率按照从大到小排列η’1≥η’2≥···≥η’m,根据式(9)计算前n个特征值的第二累积贡献率α’,S4、若‖α‑α’‖≥∈,则判定st异常,向对应的奖励值rt增加惩罚项 并将更新后的状态转换过程存储在经验回放缓冲区D中,所述的ξ的取值范围为ξ<0;
S5、根据更新后的奖励值计算损失函数,利用损失函数更新主网络的参数。
2.根据权利要求1所述的面向强化学习的检测防御异常数据方法,其特征在于,根据更新后的奖励值计算损失函数,利用损失函数更新主网络的参数,具体如下:Q
S51、通过最小化损失函数更新主网络的主价值Q网络中的参数θ;
Q
S52、根据更新后的主价值Q网络中的参数θ计算主网络的策略梯度,利用策略梯度来更μ新主网络的主策略网络的策略参数θ。
3.根据权利要求1所述的面向强化学习的检测防御异常数据方法,其特征在于,步骤S15中所述的阈值≥85%。
4.根据权利要求1所述的面向强化学习的检测防御异常数据方法,其特征在于,所述的∈的取值范围为[5%,10%]。
5.根据权利要求1所述的面向强化学习的检测防御异常数据方法,其特征在于,所述的ξ的取值范围为[‑80,‑100]。
6.一种面向强化学习的检测防御异常数据的装置,包括计算机存储器、计算机处理器以及存储在所述计算机存储器中并可在所述计算机处理器上执行的计算机程序,其特征在于,所述计算机处理器执行所述计算机程序时实现权利要求1~5任意一项所述的面向强化学习的检测防御异常数据方法。