1.一种直流降压变换器控制方法,其特征在于,包括:
根据预设目标降压环境,确定网络输入数据和占空比输出范围;
根据所述网络输入数据和占空比输出范围,构建深度强化学习智能体;
将所述深度强化学习智能体与直流降压变换器连接,获取观测数据;
利用所述观测数据以及根据所述观测数据计算获取的回报,对所述深度强化学习智能体进行训练,获取训练好的深度强化学习智能体;
利用训练好的深度强化学习智能体,对所述直流降压变换器进行控制。
2.根据权利要求1所述的直流降压变换器控制方法,其特征在于,所述网络输入数据和观测数据均包括直流降压变换器的负载两端的电压、负载两端的电压的导数、负载两端的电压的延迟信号、负载输入端的电流、负载输入端的电流的导数、负载两端的电压与预设电压的误差、负载两端的电压与预设电压的误差的导数,以及负载两端的电压与预设电压的误差的延迟信号。
3.根据权利要求1所述的直流降压变换器控制方法,其特征在于,所述占空比输出范围的表达式如公式(1)所示:(1)
公式(1)中,为输入直流降压变换器的占空比, 为目标参考占空比, 为占空比变化最大幅度。
4.根据权利要求1所述的直流降压变换器控制方法,其特征在于,所述深度强化学习智能体包括表演家网络和评判家网络;所述表演家网络包括依次连接的输入层、全连接层、ReLU层、全连接层、ReLU层、全连接层、ReLU层、全连接层、tanh层和缩放层;所述评判家网络包括输入数据分支、动作分支和主干网络,所述输入数据分支包括依次连接的输入层、全连接层、ReLU层和全连接层,所述动作分支包括依次连接的输入层和全连接层,所述主干网络包括依次连接的全连接层、ReLU层、全连接层、ReLU层和全连接层,所述输入数据分支和动作分支通过ADD层加和后与所述主干网络连接。
5.根据权利要求4所述的直流降压变换器控制方法,其特征在于,根据所述网络输入数据和占空比输出范围,构建深度强化学习智能体包括:将所述网络输入数据输入至所述表演家网络的输入层,并由所述表演家网络的缩放层输出最优占空比变化值;
将所述网络输入数据输入至所述输入数据分支的输入层,将所述最优占空比变化值输入至所述动作分支的输入层,并由所述评判家网络输出对最优占空比变化值的评价;
根据所述占空比输出范围,利用所述对最优占空比变化值的评价,对所述表演家网络进行参数更新,获取深度强化学习智能体。
6.根据权利要求1所述的直流降压变换器控制方法,其特征在于,利用所述观测数据以及根据所述观测数据计算获取的回报,对所述深度强化学习智能体进行训练,获取训练好的深度强化学习智能体包括:将所述观测数据输入至所述深度强化学习智能体,由所述深度强化学习智能体中的表演家网络输出最优占空比变化值;
利用所述最优占空比变化值对所述直流降压变换器中的PWM信号发生器进行控制,并将所述观测数据和最优占空比变化值输入至所述深度强化学习智能体中的评判家网络,由评判家网络输出对最优占空比变化值的评价;
利用所述对最优占空比变化值的评价,对表演家网络进行参数更新,并利用所述最优占空比变化值和根据所述观测数据计算获取的回报,对评判家网络进行参数更新,获取训练好的深度强化学习智能体。
7.根据权利要求1所述的直流降压变换器控制方法,其特征在于,所述回报的计算公式如公式(2)所示:(2)
公式(2)中,为输入深度强化学习智能体的回报,为观测数据中直流降压变换器的负载两端的电压和预设电压的误差。
8.一种直流降压变换器控制装置,其特征在于,包括:
数据构建模块:用于根据预设目标降压环境,确定网络输入数据和占空比输出范围;
智能体构建模块:用于根据所述网络输入数据和占空比输出范围,构建深度强化学习智能体;
数据获取模块:用于将所述深度强化学习智能体与直流降压变换器连接,获取观测数据;
训练模块:用于利用所述观测数据以及根据所述观测数据计算获取的回报,对所述深度强化学习智能体进行训练,获取训练好的深度强化学习智能体;
控制模块:用于利用训练好的深度强化学习智能体,对所述直流降压变换器进行控制。
9.一种系统,其特征在于,包括处理器及存储介质;
所述存储介质用于存储指令;
所述处理器用于根据所述指令进行操作以执行根据权利要求1 7任一项所述方法的步~骤。
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现权利要求1 7任一项所述方法的步骤。
~