1.一种类脑脉冲强化演化的无人驾驶避障方法,其特征在于,包括:
获取当前时刻车道场景中的无人驾驶车辆的状态序列;
根据状态序列和脉冲神经网络,生成无人驾驶车辆当前时刻的避障动作;其中,脉冲神经网络为皮质‑基底神经节‑丘脑网络;
将避障动作与当前时刻环境进行交互,生成当前时刻环境给予的奖励;其中,当前时刻环境为当前时刻车道场景中的环境;
若当前时刻的奖励和上一时刻的奖励的差值超过第一阈值,将当前时刻环境复制到环境回放池,并计算至当前时刻累加的警惕值;其中,警惕值为脉冲神经网络对环境的警惕值;
若至当前时刻累加的警惕值未超过第二阈值,依次基于尖峰时序依赖性可塑性机制和多巴胺调节机制优化脉冲神经网络;其中,优化后的脉冲神经网络用以生成无人驾驶车辆下一时刻的避障动作;
若至当前时刻累加的警惕值超过第二阈值,根据环境回放池中的当前时刻环境,基于遗传算法的离线演化方法优化脉冲神经网络。
2.根据权利要求1所述的方法,其特征在于,皮质‑基底神经节‑丘脑网络中的脉冲神经元A根据基因调控网络A1和伊兹克维奇神经元模型A2构建;
伊兹克维奇神经元模型A2用以对脉冲神经元A的发放行为进行建模;
基因调控网络A1用以生成脉冲神经元A与脉冲神经元B之间的突触权重,基因调控网络A1的输入为输入脉冲神经元A的突触电流;其中,脉冲神经元B为接收脉冲神经元A输出的脉冲神经元。
3.根据权利要求1所述的方法,其特征在于,生成当前时刻环境给予的奖励,公式为:;
;
;
式中,rt为当前时刻t环境给予的奖励,st为当前时刻t无人驾驶车辆的状态序列,Rb(st)为st对应的总离散奖励,Eva(st)为st对应的连续奖励,α为固定系数,dsafe为无人驾驶车辆与障碍物的预设安全距离,dcurrent为当前时刻无人驾驶车辆与障碍物的距离,vcurrent为当前时刻无人驾驶车辆的速度,Rcollision(st)为无人驾驶车辆处于与障碍物碰撞状态的离散奖励,Rspeed(st)为根据当前时刻无人驾驶车辆速度所处区间计算的离散奖励,Robstacle(st)为无人驾驶车辆是否与障碍物保持安全距离的离散奖励,Rlane‑change(st)为无人驾驶车辆成功地变道以避开障碍物的离散奖励,Rfre‑change(st)为无人驾驶车辆连续变道的离散奖励,y1和y2为预设值,C1~C4为四种不同的无人驾驶车辆所处的状态。
4.根据权利要求1所述的方法,其特征在于,计算至当前时刻累加的警惕值,公式为:;
式中, 为至当前时刻t累加的警惕值,β为至上一时刻累加的警惕值,μ为δ(t)的更新率,δ(t)为当前时刻的奖励和上一时刻的奖励的差值。
5.根据权利要求1所述的方法,其特征在于,依次基于尖峰时序依赖性可塑性机制和多巴胺调节机制优化脉冲神经网络,包括:基于尖峰时序依赖性可塑性机制对优化脉冲神经网络进行第一次优化;其中,第一次优化为优化脉冲神经网络中背外侧前额叶皮层与纹状体D1型多巴胺受体之间的突触权重、背外侧前额叶皮层与纹状体D2型多巴胺受体之间的突触权重;
若当前时刻的奖励和上一时刻的奖励的差值大于0,在第一次优化的基础上,增加背外侧前额叶皮层与纹状体D1型多巴胺受体之间的突触权重,减小背外侧前额叶皮层与纹状体D2型多巴胺受体之间的突触权重;
若当前时刻的奖励和上一时刻的奖励的差值不大于0,在第一次优化的基础上,减小背外侧前额叶皮层与纹状体D1型多巴胺受体之间的突触权重,增加背外侧前额叶皮层与纹状体D2型多巴胺受体之间的突触权重。
6.根据权利要求1所述的方法,其特征在于,根据环境回放池中的当前时刻环境,基于遗传算法的离线演化方法优化脉冲神经网络,包括:S1)获取待优化脉冲神经网络背外侧前额叶皮层的脉冲神经元,并将获取的脉冲神经元作为初始核团;
S2)对初始核团进行随机扩展,获得多个新核团,采用新核团替换待优化脉冲神经网络中的初始核团,获得多个新的待优化脉冲神经网络;
S3)遍历所有待优化脉冲神经网络,获取当前时刻环境下精英网络对应的奖励和待优化脉冲神经网络对应的奖励,并将初始精英网络对应的奖励和待优化脉冲神经网络对应的奖励的差值作为对应核团的奖励,根据核团的奖励和核团中每个脉冲神经元的突触权重,计算核团中的每个脉冲神经元的奖励;其中,初始精英网络为历史时刻奖励最高的脉冲神经网络;
S4)若迭代次数到达第三阈值,则将奖励高的前N个脉冲神经元作为最终核团,获得优化后的脉冲神经网络,若迭代次数没有到达第三阈值,对奖励高的前N个脉冲神经元进行变异和繁殖操作,将变异和繁殖操作后的脉冲神经元作为初始核团,转至S2);其中,N为未采用离线演化方法优化的脉冲神经网络的背外侧前额叶皮层的脉冲神经元数量。
7.一种类脑脉冲强化演化的无人驾驶避障装置,其特征在于,包括:
获取模块,获取当前时刻车道场景中的无人驾驶车辆的状态序列;
避障动作生成模块,根据状态序列和脉冲神经网络,生成无人驾驶车辆当前时刻的避障动作;其中,脉冲神经网络为皮质‑基底神经节‑丘脑网络;
奖励生成模块,将避障动作与当前时刻环境进行交互,生成当前时刻环境给予的奖励;
其中,当前时刻环境为当前时刻车道场景中的环境;
警惕值累加模块,若当前时刻的奖励和上一时刻的奖励的差值超过第一阈值,将当前时刻环境复制到环境回放池,并计算至当前时刻累加的警惕值;其中,警惕值为脉冲神经网络对环境的警惕值;
第一优化模块,若至当前时刻累加的警惕值未超过第二阈值,依次基于尖峰时序依赖性可塑性机制和多巴胺调节机制优化脉冲神经网络;其中,优化后的脉冲神经网络用以生成无人驾驶车辆下一时刻的避障动作;
第二优化模块,若至当前时刻累加的警惕值超过第二阈值,根据环境回放池中的当前时刻环境,基于遗传算法的离线演化方法优化脉冲神经网络。
8.根据权利要求7所述的装置,其特征在于,奖励生成模块中,生成当前时刻环境给予的奖励,公式为:;
;
;
式中,rt为当前时刻t环境给予的奖励,st为当前时刻t无人驾驶车辆的状态序列,Rb(st)为st对应的总离散奖励,Eva(st)为st对应的连续奖励,α为固定系数,dsafe为无人驾驶车辆与障碍物的预设安全距离,dcurrent为当前时刻无人驾驶车辆与障碍物的距离,vcurrent为当前时刻无人驾驶车辆的速度,Rcollision(st)为无人驾驶车辆处于与障碍物碰撞状态的离散奖励,Rspeed(st)为根据当前时刻无人驾驶车辆速度所处区间计算的离散奖励,Robstacle(st)为无人驾驶车辆是否与障碍物保持安全距离的离散奖励,Rlane‑change(st)为无人驾驶车辆成功地变道以避开障碍物的离散奖励,Rfre‑change(st)为无人驾驶车辆连续变道的离散奖励,y1和y2为预设值,C1~C4为四种不同的无人驾驶车辆所处的状态。
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储一个或多个程序,一个或多个程序包括指令,指令当由计算设备执行时,使得计算设备执行权利要求1~
6任一所述的方法。
10.一种计算机设备,其特征在于,包括:
一个或多个处理器、以及一个或多个存储器,一个或多个程序存储在一个或多个存储器中并被配置为由一个或多个处理器执行,一个或多个程序包括用于执行权利要求1 6任~一所述的方法的指令。