利索能及
我要发布
收藏
专利号: 2023110225142
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-06
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于元强化学习算法的光伏逆变器协同控制方法,包括以下步骤:

S1:建立基于配电网电压控制考虑配电网重构的马尔可夫决策模型;根据配电网电压管理的数学模型,确定马尔可夫决策过程的状态;根据光伏逆变器的工作原理和特性,确定马尔可夫决策过程的动作;根据配电网电压管理的目标,确定马尔科夫决策过程的奖励函数;根据不同的配电网拓扑结构,建立马尔可夫决策过程的集合;根据马尔可夫决策过程的状态转移概率,建立动作价值函数和状态价值函数;

S2:建立元强化学习实时控制算法,即在标准的深度强化学习算法SAC中引入元学习;

SAC是基于演员‑评论家架构的深度强化学习算法;其中,演员负责在每步动作中提供最优动作策略π,其本质是对于特定的状态,产生特定的动作概率分布;评论家用于判定演员动作的优劣程度;元强化学习应用在考虑配电网重构的配电网电压管理的基本假设,适用于元强化学习训练的任务和元强化学习测试的任务服从同一任务分布,即:其中, 表示任务,即特定的配电网拓扑结构; 表示训练用的任务集合,即用来训练参数的配电网拓扑结构的集合; 表示测试用的任务集合,即用来检验训练效果的配电网拓扑结构的集合; 表示任务的概率分布;元强化学习的目标可以总结成如下公式:其中 为智能体神经网络的参数;θ为智能体神经网络中循环神经网络的状态;表示损失函数;f表示智能体的学习策略;

S3:建立训练流程,训练元强化学习算法的流程如下所示;

S31:初始化评论家网络 演员网络 价值函数 和 其

中θ, ψ,分别为网络的参数;初始化目标价值网络 的参数;初始化经验池R;

S32:从训练任务分布 中抽取任务 确定配电网的拓扑结构;进行智能体和环境的交互,将数据存储进经验池;

S33:从经验池中小批量抽取数据 更新评论家网络、价值函数网

络、策略网络、目标价值函数的参数;

S4:将训练完备的元强化学习算法应用于考虑配电网重构的配电网电压管理任务中;

所述步骤S1中,马尔可夫决策模型的构建包括以下过程:

S1‑1:建立状态;智能体通过观察到的状态采取动作并根据动作作用后导致的下一个状态计算奖励函数,所以状态必须尽可能包含所有的信息;在t时刻的状态St用下式表示:其中, 表示t时刻各个节点的有功负荷; 表示t时刻各个节点的无功负荷;

表示t时刻所有光伏发电的有功输出;Vt表示t时刻各个节点的电压幅值;

S1‑2:建立动作;通过调整光伏逆变器输出的无功功率维持配电网电压稳定和优化线路损耗,动作为各个逆变器输出的无功值,用下式表示:其中, 表示t时刻所有光伏逆变器输出的无功功率值;由于光伏逆变器输出的无功功率受到光伏逆变器本身的容量影响,所以智能体动作的上下限分别为 和S1‑3:设置目标和奖励函数;逆变器控制的目标是维持配电网电压的稳定和优化网络损耗;如果配电网存在电压越限,按照(6)式来计算奖励函数;如果不存在电压越限,按照(7)式来计算奖励函数:其中,M为小于0的常数,用于对电压越限的动作作出惩罚;和V分别为电压的上限和下限,此处化为标幺值,分别为1.05和0.95; 表示在t时刻第j个节点的电压; 为配电网所有节点的集合;λ为大于0的常数,用于对减少配电网线路损耗的动作作出奖励; 为t时刻无逆变器注入无功的配电网线路损耗; 表示t时刻经逆变器注入无功功率以后配电网的线路损耗;

S1‑4:建立马尔可夫决策过程的集合;对于一个特定的马尔可夫决策过程,t+1时刻的状态和t时刻获取的奖励完全取决于t时刻的状态以及t时刻采取的动作,和t时刻之前所有的状态无关;即满足下式关系:(St+1,Rt)~ρ(·|St,At)      (8)

对于配电网重构的物理背景,每一次重构会使系统的潮流方程发生改变,即每一次重构会使系统的状态转移概率发生改变;所以每一种配电网拓扑结构对应一个特定的马尔可夫决策过程,将配电网训练时所有可能的拓扑结构的概率分布记作 每次训练时从中随机抽取一组拓扑结构进行N个回合的训练,将这一过程称作一次试验;训练过程总共需要进行M次试验;

S1‑5:建立价值函数;为了权衡长远利益和短期利益,引入状态价值函数和动作价值函数,分别定义如下:其中st表示随机t时刻具体的状态,St表示随机变量,动作At和at同理;γ为大于0小于1的折扣因子,用于权衡长远利益和眼前利益; 表示熵;τ为动作轨迹。

2.如权利要求1所述的一种基于元强化学习算法的光伏逆变器协同控制方法,其特征在于:所述步骤S2中,元强化学习算法的构建包括以下过程:S2‑1:SAC算法的建立;深度强化学习算法SAC主要由两部分组成:策略评估和策略提升;在RSAC中,同时维护4个网络:策略网络 评论家网络 价值函数网络 目标价值函数网络(Target function) 其中ψ为价值函数网络的参数,为目标价值函数网络的参数;其中演员和评论家的作用如上文所述,价值函数用来辅助评论家网络更新参数、目标价值函数网络用来增加算法的稳定性;由式(9)和式(10),可以推断出 和 的关系,将其用式(11)和式(12)表示,其中 的计算公式如式(13)所示;式中α为权衡奖励和熵之间的系数;

其中, 代表在状态St下依照策略 采取动作At的概率密度;由式(11)和式(12)引出各自对应的损失函数;分别如式(14)和式(15)所示;

其中, 表示从经验池 中随机抽取元组(St,At,Rt,St+1); 表示从经验池 中随机抽取状态St;值得注意的是,式(14)中采用的是目标价值函数 而不是价值函数 这样做是为了提高算法的稳定性;

由式(14)和式(15)所示的损失函数,可以得到参数θ和ψ的更新方法:其中η表示学习率;在更新参数θ的时候,目标价值函数的参数 保持恒定;的更新方法如下所示:其中η,β∈(0,1),代表在使用小批量随机梯度下降方法时各自的学习率;

经过充分的训练之后,评论家网络 通过输出Q值对动作作出评估,Q值越大,意味着动作越好;为了提升演员网络的性能,一个直观的想法是让动作的分布和Q值的分布相同,如此大的Q值将对应好的动作;演员网络 的目标如下所示:其中exp{}代表自然指数运算,用以确保 永远是非负的(因为概率密

度总是非负的),并且若 则

并且,根据概率密度的性质,

KL散度可以用来衡量两个概率密度之间的差别;所以,训练的目标可以通过最小化KL散度的值来实现:其中,DKL代表两个分布之间的KL散度;由于式(20)中 的值是和

动作的选择At无关的,所以为了简化,将其记作 根据式(20),损失函数可以定义为:将 代入(21)中,得到损失函数:

最后,可以通过小批量随机梯度下降方法更新参数

S2‑2:元学习和SAC算法的结合;元学习的含义是学会学习(learn to learn),即智能体通过训练获得学习的能力,以快速适应相似的任务;不同于传统的深度强化学习算法对单一的MDP进行训练;元强化学习需要对大量服从同一分布的MDP进行训练从而获取经验,学习如何快速适应新的任务;

元强化学习中智能体和环境的交互过程包括内环和外环;在每一个内环中,智能体对于某一个特定的MDP进行n个回合的训练,这一过程称为一次试验;而外环则是由不同的试验所组成的。

3.如权利要求1所述的一种基于元强化学习算法的光伏逆变器协同控制方法,其特征在于:对于每一次试验,从任务分布 中随机采样一个MDP;对于该次试验中的每一个回合,训练过程与S2‑1中所述一致;元强化学习采用的是循环神经网络(RNN),其输入除了当前时刻的状态St外,还包括上一个时刻的动作At‑1和上一个时刻的奖励Rt‑1,以上的输入和隐藏层的状态ht共同决定下一个时刻的隐藏层状态ht+1和动作At;在内环中,随着回合的变化隐藏层的状态会保留下去;在外环中,不同的试验在一开始会重置隐藏层的状态;不同于传统强化学习的目标是最大化一个回合的收益,元强化学习的目标是最大化一次试验的收益;由于在不同的试验中MDP会发生改变,所以智能体会根据当前的MDP采取相应的策略。