利索能及
我要发布
收藏
专利号: 2022104672750
申请人: 广州大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,包括以下步骤:

S1、根据hspice仿真工具对电路的性能指标进行初始仿真,得到仿真网表数据;

S2、将电路仿真网表数据作为模拟集成电路自定义的系统环境;

S3、根据初始仿真网表数据,获取网表中的最优仿真数据作为系统奖励值;

S4、对电路系统环境,增加约束条件,增加电路可行性。

2.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S1中,给电路工作的电流设置约束条件,设定电流范围为50nA~500nA。

3.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S1中,采用分层序列法实现多目标优化,将优化目标序列列为FTC(x),FLS(x),Fcurrent(x),对温度系数(TC)目标求优解,在电路中,温度系数越小代表电路性能越好,对FTC(x)找出符合约束条件的较优解,作为集合R0。

4.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S2中,线路灵敏度(LS)求优解,在电路中,线路灵敏度越小代表电路性能越好,在集合R0中对FLS(x)找出符合约束条件的较优解,更新优解集合R0作为集合R1,最后对电流(Current)求优解,在电路中,电流越小代表电路功耗越低,在集合R1中对Fcurrent(x)找出符合约束条件的较优解,更新优解集合R1作为最后优解集合R2,并在集合R2中找出最优解,作为多目标的共同最优解(R{max}),作为最后系统的奖励值r。

5.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S3的模拟集成电路自动设计中,网表相当于一个图,为更好地与模拟集成电路进行智能学习交互,本发明将图神经网络更替以往DDPG算法中的Actor网络和Critic网络,将网表作为网络输入,其具体网络更新与训练为:改进Actor网络为图神经网络(Actor‑Graph网络),输入st为模拟集成电路结构MOS管的饱和状态、跨导、结构节点电压、电路电流和初始网表数据;在模拟集成电路中,l和w分别代表MOS管的沟道长和沟道宽,m指m个MOS管并联,MOS管的实际宽度为w与m的乘积,通过Actor‑Graph网络输出MOS管的w、l和m值调整改变后的最新值作为动作at,更新获得最新网表,进行多目标数据处理后,使得Q最大,Q值根据电路系统的奖励r,以及将下一时刻的状态s'和动作现实网络得到的动作a'输入到状态现实网络而得到的Q值的折现值加和得到,Q越大说明网络训练得越好,改进Critic网络为图神经网络(Critic‑Graph网络),根据状态动作对(st,at)预测输出其action value Q(st,at),Q值越精确,网络训练得越好,Target Actor网络和Target Critic网络同时也更替为图神经网络,Actor‑Graph网络每步会在经验池中更新,而Target Actor网络是隔一段时间将Actor‑Graph的网络参数拷贝到Target Actor网络中,实现Target Actor网络的更新。这种“滞后”更新是为了保证在训练Actor‑Graph网络时训练的稳定性;Critic‑Graph网络和Target Critic网络也是一样。

6.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S3中,由初始状态s0,通过Actor‑Graph网络得到动作a0’,采用自适应噪声N得到动作a0=a0’+N,将a0输入到电路系统环境中,得到s1和r1,得到experience(s0,a0,s1,r1),将experience放入经验池中,以此类推,再随机从经验池中选取一批experience进行网络的训练,在网络训练中,不断更新Actor‑Graph网络和Critic‑Graph网络,以获取最大系统奖励值为目标,不断优化电路参数,得到更好的奖励值,即获得更好的电路性能指标。

7.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S3中,选取一批experience进行网络训练,进行智能参数优化,Actor‑Graph网络的loss函数就是‑Q,‑Q越小越好,Q值由Critic‑Graph网络得到,Q值越大,则说明网络训练越好,则电路的性能指标也越好,将experience的s0输入到Actor‑Graph网络中,得到预测的动作a0_predict,不加噪声,将s0和a0_predict输入到Critic‑Graph网络中,得到Q值,以‑Q作为loss函数,以此不断修改Actor‑Graph网络。

8.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S4中,传到Critic‑Graph网络得到更好的Q值,即更好的电路性能指标,Critic‑Graph网络则需要对预测的Q值越精确越好,它的loss函数为Critic‑Graph网络对初始状态的输出值Q值与Target‑Critic网络对下一个状态的输出值Q值的差值,差值越小越好,说明预测值Q值越准确,越可以准确地对Actor‑Graph网络进行评分得到Q值,以此更加准确地修改更新网络,在网络训练与优化中,在规定好相应的学习率,步长和迭代次数等参数后,增加监控机制,即将优化过程中优化效果最好的相应系统奖励值(电路性能指标)和对应的优化参数输出,即最后的系统输出值。

9.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S4中,以全MOS电压基准源电路为例,则网表中最优的温度系数(TC)、线路灵敏度(LS)和电流(Current)进行多数据目标处理优化,重复步骤S2,将处理后的最终数据作为系统奖励值。

10.根据权利要求1所述的改进的深度确定性策略梯度算法的电路参数优化方法,其特征在于,在所述步骤S4中,在推导输出电压时,利用VDS≥4VT条件进行简化,常温下VT为

26mV,则MOS管的VDS需大于104mV,而Vref=VDS6+VDS7,即Vref的最小电压应该是有一个限定值,且如果电路正常工作的话,输出电压也不能太高,因此在利用算法寻优时应该给予一定的输出电压范围,设定输出电压范围为0.3~1.2V。