1.一种基于安全互模拟度量的视觉强化学习方法,其特征在于,具体包括如下步骤:步骤1,构建序列条件变分推断模型、安全互模拟度量模型和安全强化学习模型,并初始化模型参数;所述序列条件变分推断模型用于将高维视觉观测压缩为低维潜在状态表征,所述安全互模拟度量模型用于量化状态之间的行为相似性,使得任意两个所述低维潜在状态表征之间的距离尽可能接近其对应状态之间的安全互模拟度量;
构建序列条件变分推断模型,具体包括:
给定状态空间 动作空间 奖励r和成本c,序列条件变分推断模型旨在通过学习一个联合条件生成分布pθ(o,r,c,z;a),构建一个平滑的潜在状态空间 其参数为θ;
假设 为联合条件推断分布,其参数为 作为联合条件生成分布pθ(o,r,c,z;a)的合理近似;
当给定潜在状态表征z和动作a后,o、r、c之间是条件独立的;换句话说,pθ(o,r,c|z;a)=pθ(o|z;a)pθ(r|z;a)pθ(c|z;a);
最小 化K L散 度以 便使 更接 近p θ (o ,r ,c ,z;a) ,即 ,在安全互模拟度量模型中,安全互模拟度量的定义如下:给定一个连续的 策略π∈Π,其中Π表示策略空间,任意两个状态之间的安全互模拟度量定义为:
其中,ρ为一个非负标量,用于权衡奖励与成本,γ 为折扣因子,以及
步骤2,对于每个环境步,收集经验样本,构建拉格朗日损失函数并更新拉格朗日乘子;
所述收集经验样本,具体为:
通过安全强化学习模型控制智能体按策略采取动作与环境交互,收集经验样本{ot+1,at,rt+1,ct+1}并添加到经验回放池 其中ot+1、at、rt+1与ct+1分别表示智能体t+1时刻的图像观测样本ot+1、t时刻采取的动作at、t+1时刻获得的奖励rt+1与成本ct+1, 为经验回放池;
步骤3,对于每个梯度步,从经验回放池中采样数据序列,构建序列条件变分推断模型损失函数与安全互模拟度量模型损失函数并更新模型参数,更新安全强化学习模型的模型参数;
采用序列 作为序列条件变分推断模型的输入,包括高维图像观测ot、动作向量at、奖励rt、成本ct、以及潜在状态表征zt;
先验潜在状态表征z被分解为 因此,序列条件变分推断模型损失函数为:
考虑到环境中成本的二值化特性,条件成本概率pθ(ct+1|zt+1;at)被定义为Bernoulli分布,条件编码器 条件解码器pθ(ot+1|zt+1;at)、条件奖励函数pθ(rt+1|zt+1;at)、以及潜在状态表征先验分布pθ(zt+1|zt;at),都被建模为多元高斯分布,其均值与对角方差通过一个前馈神经网络来表示;
在安全互模拟度量模型损失函数中采用2‑Wasserstein度量W2;
步骤4,重复步骤2‑3,直到获得最优模型参数。
2.根据权利要求1所述一种基于安全互模拟度量的视觉强化学习方法,其特征在于,对于离散分布,通过使用求和代替积分来计算概率,所述最小化KL散度,具体为,对于单个观测样本 有其中,const表示常数;
最小化 等价于最小化ELBO损失:
3.根据权利要求2所述一种基于安全互模拟度量的视觉强化学习方法,其特征在于,根据所述安全互模拟度量的定义,两个状态之间的安全互模拟度量是通过测量它们的奖励函数、成本函数以及它们相关的动力学模型之间的差异来表征的;安全互模拟度量也满足所ρ有核心的伪度量性质,即对于 给定一个非负标量ρ,映射d: 满足:
ρ ρ
1)非负性:d(si,sj)≥0,且d(si,si)=0;
ρ ρ
2)对称性:d(si,sj)=d(sj,si);
ρ ρ ρ
3)三角不等式:d(si,sj)≤d(si,sl)+d(sl,sj);
因此所定义的安全互模拟度量是一种伪度量,两种状态之间的安全互模拟度量值越ρ小,它们的行为相似性度就越高;当d(si,sj)=0,则表示si与sj等价,记为si~sj。
4.根据权利要求3所述一种基于安全互模拟度量的视觉强化学习方法,其特征在于,给出如下定理,用于说明对于任何给定策略π∈Π,所述安全互模拟度量都能收敛到最小不动点;
定理1:令 为状态空间S上的有界伪度量集合,π为在策略空间Π上不断提升的策略,ρ为一个非负标量;定义伪度量算子则 存在一个最小不动点 其
为安全互模拟度量;
定理2:值差异边界;对于 中的任意两个状态对 给定策略π和非负标π π ρ ρ
量ρ,得到:|V(si)‑V(sj)|≤d(si,sj),其中d为安全互模拟度量。
5.根据权利要求3所述一种基于安全互模拟度量的视觉强化学习方法,其特征在于,在序列条件变分推断模型中,低维潜在状态表征z从编码器 中采样数据序列;
定义高维输入状态s是k个连续视觉观测图像的堆栈,表示为 因此,相对应于状态s的低维潜在状态表征z表示为安全互模拟度量模型满足如下期望准则:在每个批次内,任意两个在潜在空间 上的潜在状态表征 与 之间的L1距离等于它们在原始状态空间 上的安全互模拟度量,即所以,安全互模拟度量模型的学习目标最终被形式化为如下最小化均方误差:
其中,两个状态si和sj之间的安全互模拟度量定义为其中, 是一个习得的潜在动力学模型,其输出为在 上的高斯分布,以便预测未来状态表征, 和 上方的横线均表示停止梯度;
计算两个高斯分布之间的W2度量,即
其中tr(·)表示矩阵的迹,μ和Σ分别为高斯分布的均值与协方差对角阵;对于所有其他距离度量,统一使用L1范数。
6.根据权利要求5所述一种基于安全互模拟度量的视觉强化学习方法,其特征在于,步骤3中构建序列条件变分推断模型损失函数与安全互模拟度量模型损失函数并更新模型参数,具体是更新编码器、解码器和潜在动力学模型:其中, 为序列条件变分推断模型损失函数, 为安全互模拟度量模型损失函数, 为 的梯度。
7.根据权利要求5所述一种基于安全互模拟度量的视觉强化学习方法,其特征在于,所述安全强化学习模型包括奖励价值网络、成本价值网络、策略网络;构建方式如下:奖励价值网络 的损失函数为:
其中,
成本价值网络 的损失函数为:
策略网络 的损失函数为:
其中, 为目标奖励价值网络参数, 为目标成本价值网络参数。