利索能及
我要发布
收藏
专利号: 2023110225123
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-06
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种有载调压变压器和光伏逆变器的软协同控制方法,包括以下步骤:S1:建立软协同控制框架;确定OLTC的动作逻辑,OLTC采用最常用的LDC策略进行控制;

确定LDC控制电路中的电阻R和电抗X,通过Vest=V0‑I0(R+jX)计算远端电压Vest,其中V0和I0表示OLTC处的电压和电流;确定LDC控制的死区范围ΔVdb和动作时延TDt;确定OLTC和光伏逆变器的协同控制框架;

S2:以配电网电压管理为物理背景建立基于记忆的马尔可夫决策过程;确定以配电网电压管理为物理背景的马尔可夫决策过程元组,其中包括智能体的动作At、马尔可夫决策过程的状态St、智能体的奖励Rt、以及状态转移的概率ρ;确定采取决策所依照的历史轨迹Kt;为了使智能体能够充分地探索动作空间、避免陷入局部最优,在马尔可夫决策过程中加入熵;

S3:建立循环软演员‑评论家算法(Recurrent SoftActor‑critic,RSAC);确定RSAC算法的结构,其中包括演员网络、评论家网络、价值网络、以及经验池;确定各个网络的参数更新方法,通过策略评估更新评论家网络的参数,通过策略提升更新演员网络的参数;

S4:根据算法训练智能体;采用离线训练、在线执行的方法;将训练完成的智能体投入使用;

步骤S1所述的建立软协同控制框架包括以下过程:

提出一种软协同控制框架;在此框架内,OLTC将保留其现有的分接头动作控制逻辑,逆变器能间接的控制其无功功率的输出来协助OLTC的分接头动作,协同控制使得配电网的电压稳定以及将线路的损耗降到最低;为了实现这种软协调机制,将电压控制问题表述为基于记忆的马尔可夫决策过程,其中逆变器通过输出无功功率与配有OLTC的配电系统进行交互;基于GRU‑DNN的智能体不是用当前的系统状态,而是根据迄今为止观察到的历史轨迹为逆变器作出动作;当逆变器输出无功功率使状态发生改变,智能体将评估其在当前时刻输出动作的奖励;改变系统的状态和相应的动作将作为历史轨迹反馈给智能体,最终在下一个时刻帮助智能体作出下一个时刻的动作决策;

步骤S2所述的建立基于记忆的马尔可夫决策过程包括以下过程:

S2‑1:建立基于记忆的马尔可夫决策过程元组;采用软控制架构的配电网电压管理问题可以用元组 来表示,其中 和 分别表示动作、状态、奖励、和状态转移概率的集合;

动作即逆变器输出的无功量;在时刻t,智能体输出的动作 是光伏逆变器集群输出的无功量 即 输出动作的上下限分别是 和 在t时刻,完整的马尔科夫状态可以表示为:

其中, 和 表示负载在t时刻的有功和无功量; 表示t时刻光伏的出力大小;

Vt表示t时刻配电网各个节点的电压大小;Zt表示t时刻OLTC的分接头位置;TDt表示t时刻的时延值;软协同控制目标主要有两个:电压不越限、网损最低;根据目标设置的奖励函数如下所示:当配电网有电压越限的时候,按照(2)式计算奖励值;当配电网存在电压越限的时候,按照(3)式计算奖励值;其中,M<0代表着电压越限的惩罚系数; 和V分别是系统电压的最大值和最小值; 代表t时刻第j个节点的电压; 是节点的集合;λ>0是电压未越限且网损降低的奖励系数; 代表在t时刻采取动作At得到的线路损耗; 表示未采取任何动作得到的线路损耗;系统的状态从St转移到St+1,伴随着奖励Rt和动作At;这种状态转移可以用下式表示:(St+1,Rt)~ρ(·|St,At)     (4)

S2‑2:建立历史轨迹;由于OLTC的动作逻辑是关于时间耦合的,所以通过建立历史轨迹,来让智能体做决策:从式(5)中可以看出,Kt包含了一系列的状态和动作;智能体通过Kt输出动作的概率分布πφ(·|Kt)而不是直接输出动作;动作通过从生成的概率分布中随机选取:其中πφ表示策略函数,φ是策略网络的参数;

S2‑3:建立考虑熵的马尔可夫决策过程;不同于传统的深度强化学习的目标,是累积获得的奖励最大化;在马尔可夫决策过程中考虑熵,旨在使智能体充分探索动作空间,避免过早陷入局部最优;学习的目标定义如下:τ代表的是根据策略πφ可以得到的未来轨迹;N代表轨迹的长度;α>0为权衡奖励和熵之间的温度系数;γ∈(0,1)是折扣系数; 代表概率分布的熵;根据(7)式所示的目标,根据策略πφ在未来一段时间内所能获得的量可以用价值函数和动作价值函数表示,分别如式(8)和式(9)所示:

2.如权利要求1所述的一种有载调压变压器和光伏逆变器的软协同控制方法,其特征在于,步骤S 3所述的建立RSAC算法包括以下内容:S3‑1:建立RSAC算法的结构;RSAC算法基于SAC算法构建,区别在于RSAC在SAC的基础上加入了时间的耦合;RSAC算法包括演员网络和评论家网络;演员网络负责做决策、采取动作;评论家网络负责评估演员网络做出动作的优劣程度;

演员网络是由一个嵌入了GRU的深度神经网络所组成的,其中GRU是循环神经网络的一种;GRU的映射规则如下所示:其中 表示GRU的映射规则,φr表示GRU网络参数,Ht表示GRU在t时刻的隐藏层状态;

经过(10)式以后,变维度的历史轨迹Kt就被映射成固定维度的Ht;随后Ht作为深度神经网络的输入,输出为动作的概率分布,即均值和方差;DNN的映射规则如下所示:μt和σt分别表示动作分布的均值和方差,φd表示深度神经网络的参数, 表示深度神经网络的映射规则;演员网络的策略πφ可以表示为:其中φ=[φr,φd],(St,At‑1,Ht‑1)记作 具体采取的动作最终在分布中随机抽取:εt和σ’t分别表示标准高斯分布的均值和方差;动作的取值范围是 评论家通过给出Q值,用于评价在既定策略πφ下依照 采取动作At的好坏;可用下式表示:同理,式(8)所示的价值网络可由下式表示:

为了训练网络的参数,采用从经验池中抽取小批量数据进行随机梯度下降的方法更新参数;经验池用 表示,里面是一系列的元组S3‑2:确定各个网络参数的更新方法;在所提出的RSAC算法中,策略网络的参数φ和评论家网络的参数θ是通过策略评估和策略提升迭代更新的;通过策略评估,评论家网络的参数θ对于既定的策略πφ拥有更好的动作Q值评估表现;改进过后的评论家网络 又进一步通过策略提升更新演员网络的参数φ,更新过后的演员网络πφ′在动作的选择上拥有更好的性能;

式(8)和式(9)所描述的价值函数和动作价值函数满足以上方程:

熵的计算公式如下所示:

其中 代表在策略πφ下动作的概率分布,由式(16)和式(17)得到两个损失函数:其中 表示元组 是从经验池 中随机抽取的, 表

示 是从经验池D中随机抽取的;由式(19)和式(20),可以用随机梯度下降法更新参数θ和ψ:在更新参数θ的时候,参数 保持恒定;参数 的更新方法如下所示:

其中η,β∈(0,1)表示小批量随机梯度下降时的学习率;在充分的训练之后,评论家网络 可以输出Q值用于动作评估,Q值越大意味着动作越好;为了提升演员网络的性能,最直观的方法是使动作的分布和Q值的分布相同;这样可以使大的Q值对应的动作概率更大;

因此,策略分布的目标是:

其中exp{}是取指运算, 可以保证概率是非负的,且

将使得 此外,这种设计

可以使 KL散度可以用来衡量两个概率之间的相似度,所以策略网络的

更新方法可以采用KL散度:

其中DKL表示两个概率密度之间的KL散度;由于 是和At无关的

表达式,所以可以用 来简化表示;根据(25),损失函数可以表示为:将式(13)代入式(26)中,可以得到:

最后,策略网络的更新方法如下所示: