利索能及
我要发布
收藏
专利号: 2019112410298
申请人: 广东工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2025-10-14
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度强化学习的订单信息处理方法,其特征在于,包括如下步骤:步骤一,对订单数据进行预处理:制出各种订单数据属性列,对订单数据属性列进行特征重要性评估排序,用户自定义删除重要性程度低的订单属性列,得到预处理后的订单数据;

步骤二,搭建神经网络模型,用预处理后的订单数据训练神经网络;在神经网络结构中加入dropout层,采用交叉验证调节模型超参数并修改损失函数,以改进神经网络模型结构;

步骤三,以步骤一中排好顺序的订单属性列为标准,删除新的将要进行决策的订单数据中对应的重要性程度低的订单属性列,将删除后的将要进行决策的订单数据输入搭建好的神经网络模型,获得订单关键要素预测值;

步骤四,将预测值输入强化学习模型,所述强化学习模型为半马尔科夫决策模型,采用QLEARN算法求解,最终得到订单接拒模拟运算结果;

所述步骤一中,采用随机森林法对订单数据属性列进行特征重要性评估排序,包括如下步骤:A1,对每颗决策树,选择相应袋外数据计算袋外数据误差,记为errOBB1;随机对袋外数据所有样本的特征Xj加入噪声干扰,再次计算袋外数据误差,记为errOBB2;设森林有N颗树,则特征X的重要性为:A2,根据A1计算出订单所有特征重要性,并降序排列,确定剔除比例,得到新的特征集;

A3,用新特征集重复A1和A2的过程,直到剩下m个特征,其中m为提前设定量,根据产生的各特征集与其对应的袋外误差率,选择袋外误差率最低的特征集;

步骤一中用户自定义删除重要性程度低的订单属性列后,若存在需要特殊取舍的订单时,采用箱线图分析订单属性列的值,若值异常则剔除这个订单。

2.根据权利要求1所述的基于深度强化学习的订单信息处理方法,其特征在于:所述神经网络结构包括一个数据输入层、五个卷积层、五个池化层、两个全连接隐含层和一个输出层;所述订单数据通过第一个卷积层以及ReLU激活层,变为一组特征;再经过最大值池化层进行降采样;重复多次以上操作,将最后一个池化层的特征图与全连接隐含层相连,经过ReLU激活之后,传递到所述输出层;其中ReLu激活函数为:f(x)=max(0,x),其中x是神经元的值。

3.根据权利要求2所述的基于深度强化学习的订单信息处理方法,其特征在于:所述步骤二中将预处理后的订单数据输入神经网络模型,采用MSE损失函数训练网络,MSE损失函数为: 其中 为预测值,yi为真实值,其中n为订单个数,i为第i个订单。

4.根据权利要求2所述的基于深度强化学习的订单信息处理方法,其特征在于:所述步骤二中将预处理后的订单数据输入神经网络模型,采用MSLE损失函数训练网络,MSLE损失函数为: 其中n为订单个数,i为第i个订单, 为预测值,yi为真实值。

5.根据权利要求1所述的基于深度强化学习的订单信息处理方法,其特征在于,所述步骤四中求解的算法包括如下步骤:B1,初始化决策阶段,n为订单个数;初始化状态-动作值Q(i,a)=0,其中,i∈S,S为当前订单序号,完成已接受订单所需时间;a∈A,A为动作;初始化α、w、v、ε、γ;其中α为学习率,w为单位时间延期惩罚成本,v为拒绝成本,ε为初始探索率,γ为衰变系数,开始系统仿真;

B2,在决策阶段,生成随机数p(0<p<1);判断如果探索率ε=p,则在动作集里随机选择动作a作为系统动作,如果a=接受,则接受订单,如果a=拒绝,则拒绝订单;执行动作a,得到下一阶段的状态,并根据时间拆分法更新Q值;

Qnew(i,a)=Qold(i,a)+α*(r+(γ*max(Qold(i′,a))-Qold(i,a)))其中,r=z*(R-T*w)-|z-1|*J*v;

R=利润;T=延期时间;J=客户等级;

迭代i,直到i=n。

6.根据权利要求1所述的基于深度强化学习的订单信息处理方法,其特征在于:还包括神经网络模型的更新步骤:C1,将新订单数据输入神经网络模型,得出预测y预的值;

C2,真实y真值减去预测y预值后做梯度下降,对权重矩阵w求导得到当前梯度dwi;

C3,更新权重矩阵w;wi=wi-ηdwi;其中:η为学习率,wi是神经元i对应的权重值。