1.一种基于深度强化学习的离散制造车间鲁棒调度优化方法,其特征在于,所述基于深度强化学习的离散制造车间鲁棒调度优化方法,包括:步骤1、取历史加工数据,利用神经网络拟合工序加工时长关于设备、操作员以及生产初始时刻的函数;
步骤2、建立工厂车间的加工环境模型,所述加工环境模型包括可运行设备数量、在岗操作员以及中间产品的库存数;
步骤3、获取当天需要加工的产品数量;
步骤4、根据加工环境模型以及当天需要加工的产品数量构建离散制造车间鲁棒调度问题,该离散制造车间鲁棒调度问题的目标函数为最小化最大完工时间与最小化完工时间和交付时间的差值;
步骤5、对离散制造车间鲁棒调度问题进行求解,包括:
步骤51、选定特征,包括工序加工时长、工序的结束时间、设备利用率和工序离交付剩余时间这四个二维矩阵;
步骤52、根据四个二维矩阵基于实时加工数据将生产规程状态描述为四通道图像,基于四通道图像利用深度卷积神经网络逼近状态动作值;
步骤53、以启发式规则作为动作空间,基于深度卷积神经网络输出的状态动作值,利用Double DQN算法输出调度优化方案。
2.如权利要求1所述的基于深度强化学习的离散制造车间鲁棒调度优化方法,其特征在于,所述当天需要加工的产品数量,包括:当天订单中的产品数量,以及当天之前的订单中未完成加工的产品数量。
3.如权利要求1所述的基于深度强化学习的离散制造车间鲁棒调度优化方法,其特征在于,所述根据加工环境模型以及当天需要加工的产品数量构建离散制造车间鲁棒调度问题,包括:令工厂车间可运行的设备数为m,当天需要加工的产品数量为n,设备集记为M=(M1,M2,...,Mm),当天订单中的工件集记为J=(J1,J2,...,Jn),第i个工件Ji共有Pi道加工工序,i=1,2,...,n,Oij为工件Ji的第j道工序,j=1,2,...,Pi,中间产品的库存数记为工件集L=(L1,L2,...,LP‑1),其中P为该车间产品加工的最大工序数,Sijk为工件Ji的第j道工序Oij在第k台设备Mk上的开工时间,k=1,2,...,m,Tijk为工序Oij在机器Mk上的工序加工时长,其中Tijk数值由步骤1训练得到的拟合函数输出;
令Cij为工序Oij的完工时间,则最大完工时间Cmax=Max(Cij),因此目标函数中的最小化最大完工时间可描述为函数f1=minMax(Cij),并且令 其中RT为报工需要消耗的时间,Si为工件Ji的第首个待加工工序的开工时间;
令订单中工件Ji的交付时间为Doi,工件Ji加工过程中预测交付时间为Dpi,则目标函数中的最小化完工时间同交付时间的差值可描述为函
数f2=minD,
因此目标函数最终描述为:F=min(α·Cmax+β·D);
其中,约束条件为:
xi,j,k∈{0,1}
Ci,j≥0
α+β=1
式中,xi,j,k为决策变量,当工序Oi,j在设备Mk上加工时取值为1;否则取值为0,α、β为加权权重,Si,j+1表示第i个工件的第j+1道工序的开工时间。
4.如权利要求1所述的基于深度强化学习的离散制造车间鲁棒调度优化方法,其特征在于,所述特征中的工序加工时长的计算方式如下:若当前产品为中间产品,则将当前产品已完成的工序的加工时长设置为0;
若当前产品的工序已经分配至设备,则将已分配的工序的加工时长设置为0;
若当前工序未完成且未分配,则根据步骤1中训练得到的拟合函数得到该工序的加工时长。
5.如权利要求1所述的基于深度强化学习的离散制造车间鲁棒调度优化方法,其特征在于,所述特征中的设备利用率的计算方式如下:设备利用率为每次加工工序所用设备的利用率,初始状态为0,所述利用率计算方式如下:利用率=设备工作时间/(当前时间‑所有工件的第一个工序的开工时间)。
6.如权利要求1所述的基于深度强化学习的离散制造车间鲁棒调度优化方法,其特征在于,所述特征中的工序离交付剩余时间的计算方式如下:工序离交付剩余时间为该工件的交付时间与工件加工过程中预测交付时间的差值,初始状态下同一产品的所有差值相同,初始化为交付时间与生产初始时刻的差值,在工件分配过程中,若该工序已经完成,则工序离交付剩余时间保持不变,否则未完成的工序的工序离交付剩余时间更新为工件的交付时间减去该工件目前最近工序的完工时间。