利索能及
我要发布
收藏
专利号: 2024105708015
申请人: 广东技术师范大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种多园区微电网需求响应方法,其特征在于,包括:园区系统环境模型的构建,构建包括柔性负载模型、电化学储能模型、电力效用模型和冷热储能模型的园区微电网系统环境模型;

基于多头注意力特征提取,利用多头注意力机制,动态地选择需要关注的其他园区所共享的信息,以提高系统的性能和效率;

深度强化学习,用于协调园区对柔性负载、电冷热储能的控制,来调整柔性负载和储能系统,重塑电力需求的总体曲线;

所述冷热储能模型是通过存储空气‑水热泵所产生的能量,在夜间或者非生产时段工作,在生产时段释放储能,冷热储能模型的公式如下:soct+1=soct·(1‑ηloss)+QC‑QD;

QC=Qmid,if Qmid>0

QD=|Qmid|,if Qmid=0

其中,soct表示t时段冷热储能,ηloss为自损耗效率,at为强化学习的冷热储能的行动,ηes表示充放能效率, 表示第t时段热泵装置的最大热功率,Qcap表示冷热储能的容量,Quse表示园区用冷用热的实际需求量,Qdem表示冷热储能系统的需求量,Qc表示第t时段冷热储能系统的充能量,QD表示第t时段冷热储能系统的放能量,Qin表示实际进入储能系统的冷热能量,Qout表示储能系统释放的实际冷热能量。

2.根据权利要求1所述的一种多园区微电网需求响应方法,其特征在于:所述柔性负载模型用于根据电力系统需求、市场电价进行调整电力负荷,柔性负载模型的公式如下:s.t.0≤P0≤......≤PG≤Pmax;

G∈N;

其中,不同柔性负载设置不同的负载级别g,0代表负载停止工作,G为负载最大的工作等级,pk为对应级别的负载工作功率,其中k=0,1,2,···,G。

3.根据权利要求1所述的一种多园区微电网需求响应方法,其特征在于:所述电化学储能模型以电池的形式进行充放电,用于用电平低谷时段进行充电,用电尖高峰时段进行放电,电化学储能模型的公式如下:SOCt+1=SOCt·(1‑ηloss)+ED/C(t);

其中,soct表示t时段冷热储能,ηloss为自损耗效率,EDIC(t)表示t时段选择充放电的能量,ηes为充放能效率,Ebattey为计算出的电池实际充放电量。

4.根据权利要求1所述的一种多园区微电网需求响应方法,其特征在于:所述电力效用模型用于根据效用函数的性质,构造基于双曲正切的园区负载电力消耗的满意度效用函数,电力效用模型的公式如下:其中,E(t)为园区t时段负载的电力消耗,K和ω为效用函数的满意度参数。

5.根据权利要求1所述的一种多园区微电网需求响应方法,其特征在于:基于多头注意力特征提取方法包括以下基于多头注意力特征提取模块:观测‑动作输入表示模块:利用经过单层的前馈神经网络 将t时段不同维度的观测状态‑动作向量 映射到相同维度d,输出形状为(n,d)的矩阵表示为x:x={x1,x2,···,xn};

x代表的是输入的观测状态‑动作向量矩阵,其中每一行表示一个时段的观测状态和动作,而xi代表的是x矩阵中的第i行;

每头查询、键、值矩阵计算模块:

对观测‑动作输入表示模块中输出的矩阵输入表示,引入三个权重矩阵 对每一头h,分别经过修正线性单元计算输出查询矩阵Qh、键矩阵Kh和值矩阵Vh,其中,查询矩阵Qh、键矩阵Kh和值矩阵Vh的计算公式如下:加权值矩阵计算模块:

对于每头查询、键、值矩阵计算模块中输出的权重矩阵,通过查询矩阵Qh和键矩阵Kh的内积计算相似度,除以 防止梯度爆炸,然后归一化输出注意力分数矩阵,再与值矩阵Vh进行加权求和,输出加权值矩阵为Zh,加权值矩阵的公式如下:多头合并输出模块:

对于加权值矩阵计算模块中输出的加权值矩阵Zh,按最后一个维度进行拼接,经过两层前馈神经网络 同时嵌入x,输出特征提取后的结果矩阵e如下式所示:

6.根据权利要求1所述的一种多园区微电网需求响应方法,其特征在于:深度强化学习包括分布式执行,分布式执行将多个智能体并行地在各自的环境中学习与决策,并通过合作和协作实现高效的学习和行为;

分布式执行包括以下步骤:

第一步,确定策略函数神经网络:确定性策略函数 输入i园区t时段的时间、天气和用能储能观测值 输出园区协调电冷热荷储控制下应当进行的确定性动作 通过神经网络实现,该神经网络包括参数θ,该参数通过深度强化学习离线更新;

确定策略函数神经网络的状态输入表达式如下:

其中,Οcalendar代表的含义为:基本日历信息,包括月份、周几和一天内第几个时段;

Οweather代表的含义为:室内外温度、室内外湿度、太阳直接辐射、太阳散射辐射;

Οcarbon代表的含义为:不同时段的单位KWH的二氧化碳的排放强度;

Οload代表的含义为:当前时段固定负载、柔性负载的能耗;

Οsolar代表的含义为:当前时段光伏发电值和预测值;

Οdeman代表的含义为:室内温度设置值、用冷需求、用热需求和用电最大的满意度;

Οonsumption代表的含义为:当前时段净能耗、用冷能耗和用热能耗;

第二步,动作探索:

给定第一步中确定性策略函数以及园区观测值,对输出的确定性动作添加高斯噪声,输出新的探索动作,动作探索步骤中的动作表达式为:其中,acooling_storage代表的含义为:蓄冷或者用冷能量值与蓄冷总容量的比值,即aheating_storage代表的含义为:蓄热或者用热能量值与蓄热总容量的比值,即aelectrical_storage代表的含义为:电化学储能在t时段充电或者放电的能量,即ED/C(t);

aflex_load代表的含义为:柔性负载t时段调度后的能耗,即Eflex_load(t);

第三步,奖励计算:

通过计算园区的用电效用和净用电量成本,或者通过计算园区碳排放量,对深度强化学习算法步骤做出的动作进行评价,作为奖励,奖励的计算采用以下方式按加权求和:(a)园区固定负载和柔性负载的用电效用,即U(E(t),ω);

(b)园区净用电量的电费;

(c)园区冷热电储能的结算费用;

(d)园区的碳排放量;

第四步,经验回放池存入:

给定第一步的观测值 和动作 通过环境获取下一时段观测值 再经过第三步的奖励计算步骤获取奖励 将 存入经验回放池。

7.根据权利要求6所述的一种多园区微电网需求响应方法,其特征在于:深度强化学习还包括集中式训练,集中式训练包括以下步骤:

第一步,训练数据集获取:给定包含足够数据的经验回放池,通过随机抽取批量数据集,并记录数据集位置,请求控制中心,控制中心收集连接数据集,并使用基于多头注意力特征提取的方法,返回待训练数据集;

第二步,评价函数神经网络:函数 输入多头注意力目标特征,输出园区观测值 下选择动作 对于所有园区的得分sc,通过神经网络实现,该神经网络包含参数 该参数通过深度强化学习离线更新;

第三步,离线优化器:根据Adam算法,分别对评价函数神经网络的参数和确定性策略函数神经网络的参数进行优化。

8.一种应用于权利要求1‑7任一项所述多园区微电网需求响应方法的多园区微电网需求响应系统,其特征在于,包括:园区系统环境模型的构建模块,用于构建包括柔性负载模型、电化学储能模型、电力效用模型和冷热储能模型的园区微电网系统环境模型;

基于多头注意力特征提取模块,用于利用多头注意力机制,动态地选择需要关注的其他园区所共享的信息,以提高系统的性能和效率;

深度强化学习模块,用于协调园区对柔性负载、电冷热储能的控制,来调整柔性负载和储能系统,重塑电力需求的总体曲线。

9.根据权利要求8所述的一种多园区微电网需求响应系统,其特征在于:初始化阶段包括以下内容:初始化确定性策略网络 评论网络 其中k=1,2,经验回放池D;设置目标参数运行阶段包括以下步骤:

(1)从t=1时段开始,每个园区智能体i观测状态为 进入分布式执行步骤;

(2)每个园区智能体i进入动作探索步骤,执行加入高斯噪声的动作(3)奖励计算步骤观测下一个状态 并计算奖励

(4)经验回放池存入步骤将 存入经验回放池D,进入集中式训练步骤;

(5)训练数据集获取步骤从经验回放池D随机抽取批量数据集(o,a,o′,r),并记录数据集索引,请求控制中心,控制中心收集连接数据集,并经过基于多头注意力特征提取步骤,‑i返回待训练数据集(e,e′,y ),开始训练模型;

(6)园区智能体i计算训练目标值yi:

(7)计算评论网络的损失函数

(8)离线优化器更新评价网络参数

(9)离线优化器更新确定性策略网络参数θi,J(θi)为损失函数:(10)软更新目标网络参数 和

(11)n个园区智能体都完成t时段的训练;

(12)转入t+1时段,直到到达最后时段T,完成一次迭代;

(13)评估模块对已训练模型的进行评估,计算整个时段的园区成本,并且与系统的现有基线进行比较。