1.一种神经网络训练方法,其特征在于,所述方法包括:将当前训练周期的环境状态向量输入神经网络中进行处理,获得当前训练周期的动作输出和当前训练周期的衡量输出;
根据所述当前训练周期的环境状态向量和所述当前训练周期的动作输出,确定当前训练周期的第一奖惩反馈;
根据所述当前训练周期的第一奖惩反馈、历史训练周期的第一奖惩反馈和当前训练周期的衡量输出,确定所述神经网络的模型损失,所述历史训练周期包括在所述当前训练周期之前的一个或多个训练周期;
根据所述模型损失,调整所述神经网络的网络参数值;
在所述神经网络满足训练条件时,获得训练后的神经网络。
2.根据权利要求1所述的方法,其特征在于,所述当前周期的衡量输出包括当前训练周期的第一衡量输出和当前训练周期的第二衡量输出。
3.根据权利要求2所述的方法,其特征在于,所述模型损失包括与所述第一衡量输出对应的第一模型损失、与所述第二衡量输出对应的第二模型损失以及与所述动作输出对应的第三模型损失。
4.一种环境处理方法,其特征在于,所述方法包括:将当前周期的环境状态向量输入权利要求1至3中任意一项所述的神经网络中进行处理,获得当前周期的动作输出;
根据当前周期的环境状态向量以及所述当前周期的动作输出,确定当前周期的下一个周期的环境状态向量以及当前周期的第一奖惩反馈。
5.一种神经网络训练装置,其特征在于,包括:输入模块,用于将当前训练周期的环境状态向量输入神经网络中进行处理,获得当前训练周期的动作输出和当前训练周期的衡量输出;
反馈确定模块,用于根据所述当前训练周期的环境状态向量和所述当前训练周期的动作输出,确定当前训练周期的第一奖惩反馈;
模型损失确定模块,用于根据所述当前训练周期的第一奖惩反馈、历史训练周期的第一奖惩反馈和当前训练周期的衡量输出,确定所述神经网络的模型损失,所述历史训练周期包括在所述当前训练周期之前的一个或多个训练周期;
调整模块,用于根据所述模型损失,调整所述神经网络的网络参数值;
神经网络获得模块,用于在所述神经网络满足训练条件时,获得训练后的神经网络。
6.一种环境处理装置,其特征在于,所述装置包括:动作输出获得模块,用于将当前周期的环境状态向量输入权利要求1至3中任意一项所述的神经网络中进行处理,获得当前周期的动作输出;
第三确定模块,用于根据当前周期的环境状态向量以及所述当前周期的动作输出,确定当前周期的下一个周期的环境状态向量以及当前周期的第一奖惩反馈。
7.一种电子设备,其特征在于,包括:
处理器;
用于存储处理器可执行指令的存储器;
其中,所述处理器被配置为:执行权利要求1至3中任意一项所述的方法。
8.一种电子设备,其特征在于,包括:
处理器;
用于存储处理器可执行指令的存储器;
其中,所述处理器被配置为:执行权利要求4所述的方法。
9.一种计算机可读存储介质,其上存储有计算机程序指令,其特征在于,所述计算机程序指令被处理器执行时实现权利要求1至3中任意一项所述的方法。
10.一种计算机可读存储介质,其上存储有计算机程序指令,其特征在于,所述计算机程序指令被处理器执行时实现权利要求4所述的方法。