利索能及
我要发布
收藏
专利号: 2024117951243
申请人: 广东海洋大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于强化学习的港口多智能体任务分配方法,其特征在于,包括以下步骤:针对港口多任务环境中的多种作业任务,构建任务集合;

针对不同种类的港口智能设备,构建异构多智能体的动力学模型;

基于所述任务集合和所述动力学模型,构建全局环境模型;

构建协作式的多智能体任务分配机制,利用所述任务分配机制进行任务的分配和调度;

基于所述任务集合、所述动力学模型、所述全局环境模型和所述任务分配机制构建协作强化学习模型,并利用所述协作强化学习模型训练智能体的任务执行策略;

构建任务集合的方法包括:

利用任务的依赖关系和约束条件构建任务图,其中,所述任务图中的每个节点表示一个需要执行的港口作业,每条边表示任务的依赖关系和约束条件;

基于所述任务图计算任务优先级:

其中,P(Ti)表示任务Ti的优先级,ri表示任务Ti的资源要求,di表示任务Ti的执行时长,α1和α2表示权重系数;

利用所述任务优先级构建所述任务集合 ,其中,Tn表示第n个任务,i和n表示自然数;

构建异构多智能体的动力学模型的方法包括:

定义智能体集合 ,其中,Im表示第m个智能体,m表示自然数;

定义状态空间集合 ,其中,sm(t)表示智能体Im在时刻t内的状态,t表示时刻;

定义动作空间集合 ,其中,am(t)表示智能体Im在时刻t内采取的动作;

基于所述状态和所述动作构建所述动力学模型 ,并利用所述动力学模型更新智能体状态:

其中,f( )表示智能体的动力学模型函数,Sm(t+1)表示智能体的状态更新;

利用所述任务分配机制进行任务的分配和调度的方法包括:每个智能体独立计算成本函数 :

其中,β1、β2和β3表示权重系数,dist(Ti,Im)表示任务Ti与智能体Im之间的距离,P(Ti)表示任务的优先级,cdelay(Ti,Im)表示延迟成本;

选择初步的任务捆绑 ,基于所述成本函数计算任务捆绑 的总成本:;

智能体交换捆绑信息,检查是否有任务冲突,若存在任务冲突,则出现冲突的任务会被分配给能够以最低成本执行冲突任务的智能体,之后智能体会更新自己的任务捆绑,重新计算任务的执行顺序和总成本;

重复步骤并多次迭代至任务分配机制逐步收敛,完成任务的分配和调度;

所述协作强化学习模型包括:策略网络和价值网络;

所述策略网络由高层策略网络和低层策略网络构成:,

其中, 表示高层策略网络,用于基于所述任务集合和所述全局环境模型选择子任务,θ表示高层策略网络的参数,h表示高层, 表示高层价值函数,o表示子任务,s表示当前状态; 表示低层策略网络,用于在每个所述子任务内容生成智能体的具体动作,ϕ表示低层策略网络的参数,l表示低层, 表示低层价值函数,a表示具体动作,argmax表示使价值函数Q达到最大值;

所述价值网络由高层价值网络和低层价值网络构成,所述高层价值网络用于评估选择子任务的效果,所述低层价值网络用于评估智能体在执行具体任务时的动作表现:,

h l

其中,μ表示学习率,r表示高层的回报值,r表示低层的回报值,γ表示折扣因子,s’表示下一状态,即智能体在当前状态s执行动作后所到达的状态,o’表示在下一状态s’下可能选择的子任务,a’表示在下一状态s’和子任务o’下可能选择的具体动作;利用协作强化学习模型训练智能体的任务执行策略的方法包括:在多个智能体环境下,智能体通过与全局环境模型的交互,通过集中式训练,多个智能体共享经验回放池,并通过策略网络和价值网络进行协同优化,达到最佳的协调状态;

策略和价值网络的协同优化,要求同时调整策略网络和价值网络,使得总价值最大化;

这种协作优化机制使在策略执行和价值评估间在复杂任务中的多维度中,达到最佳的协调状态:,

其中,st表示在时间步t的状态,ot表示在时间步t选择的子任务,at表示在时间步t执行的具体动作;过强化学习训练,智能体能够逐步学习到最优的任务分配策略和执行策略,提升港口多任务环境中的作业效率。

2.根据权利要求1所述一种基于强化学习的港口多智能体任务分配方法,其特征在于,构建全局环境模型的方法包括:基于港口的地理位置、货物分布和作业要求,构建港口全局环境的状态空间:,

其中,h( )表示智能体与全局环境交互的函数, 表示智能体Im在全局环境下的状态,Locm(t)表示智能体Im在时刻t的地理位置,Cargom(t)表示智能体Im在时刻t的货物分布,Reqm(t)表示智能体Im在时刻t的作业要求,ε表示全局环境变量。

3.根据权利要求1所述一种基于强化学习的港口多智能体任务分配方法,其特征在于,利用所述协作强化学习模型训练智能体的任务执行策略的方法包括:在多个智能体环境下,智能体通过与所述全局环境模型的交互,通过集中式训练,多个智能体共享经验回放池,并通过所述策略网络和所述价值网络进行协同优化,达到最佳的协调状态。

4.一种基于强化学习的港口多智能体任务分配系统,所述分配系统应用权利要求1‑3任一项所述的分配方法,其特征在于,包括:任务集合构建模块、动力学模型构建模块、环境模型构建模块、任务分配模块和任务执行优化模块;

所述任务集合构建模块用于针对港口多任务环境中的多种作业任务,构建任务集合;

所述动力学模型构建模块用于针对不同种类的港口智能设备,构建异构多智能体的动力学模型;

所述环境模型构建模块基于所述任务集合和所述动力学模型,构建全局环境模型;

所述任务分配模块用于构建协作式的多智能体任务分配机制,利用所述任务分配机制进行任务的分配和调度;

所述任务执行优化模块基于所述任务集合、所述动力学模型、所述全局环境模型和所述任务分配机制构建协作强化学习模型,并利用所述协作强化学习模型训练智能体的任务执行策略。