一种基于元强化学习的多机器人动态任务规划方法

allin2026-07-17  41


本发明属于机器人系统任务调度领域,尤其是涉及一种基于元强化学习的多机器人动态任务规划方法。


背景技术:

1、随着科学技术的发展,智能制造成为了我国工业的重要发展方向。其中,多机器人系统在工业生产中得到了越来越广泛的应用,其任务规划方法的开发与优化成为了研究的重点。

2、多机器人系统由多个机器人单元组成,协同完成复杂的任务,如装配、搬运、检测和包装。工业机器人以其高效、精确和稳定的操作能力,显著提高了生产效率和产品质量,减少了人为错误和生产成本。此外,多机器人系统具有较高的灵活性与并行性,能够通过对机器人资源和合理调控,极大地提高了任务的执行效率。在系统中出现无法预料的突发情况时,多机器人系统也能够通过对机器人资源和合理调控,快速适应新的情况,保证任务的顺利进行。

3、面对迅速增长的工业场景规模,多机器人系统的复杂性也对调度算法提出了更高、更复杂的要求,以充分挖掘系统的潜力。现有的多机器人任务规划算法大多要求规划开始前全部任务可知,但在实际工业场景中,任务可能在任何时间到达,无法满足该假设;当工业系统发生变化时,现有算法大多无法在保证算法性能的前提下,快速迁移至新的任务规划场景,而是需要对算法进行调整或重新设计。

4、因此,有必要提供一种基于元强化学习的多机器人动态任务规划方法,来解决上述问题。


技术实现思路

1、本发明的目的是提供一种基于元强化学习的多机器人动态任务规划方法,设计了一种基于元强化学习的任务规划算法,对任务规划模型上的优化问题进行求解。在任务无法预先确定的动态任务规划场景中,算法能在较短时间内获得效率较高的任务规划方案,且在场景发生变化时,算法能在少次更新后达到与原先持平的性能水平,极大地提高了算法对动态环境的适应能力。

2、为实现上述目的,本发明提供了一种基于元强化学习的多机器人动态任务规划方法,包括以下步骤:

3、s1:建立多个具有代表性的任务规划场景的数学模型;

4、s2:应用元强化学习方法,在步骤s1中建立的任务规划场景中进行预训练,得到通用的任务规划算法参数;

5、s3:建立目标任务规划场景的数学模型;

6、s4:应用深度强化学习方法,基于步骤s2中得到的算法参数进行微调,得到适合目标场景的最优任务规划方法。

7、优选的,在步骤s1中,挑选多个具有代表性的任务规划场景做为预训练场景,并对其进行建模,定义场景中的关键变量和约束条件,将实际规划问题转化为组合优化问题,具体表示为:

8、将任务规划问题的时间范围划分为p个离散时间段,每个时间段长度相等,定义任务的时间相关信息均离散为时间段长度的整数倍,则任务的时间相关约束如公式(1)至公式(3)所示,

9、

10、ts,m,n-te,m,n=lg,m+ld,m  (2)

11、

12、其中公式(1)表示任务实际被分配时段必须在任务可用时段及任务对机器人可用时段内;公式(2)表示任务实际被分配时段的长度应为移动至任务所需时长与任务执行时长之和;公式(3)表示同一机器人执行的不同任务不应有重叠;

13、公式(1)-(3)中,m与m′分别表示任意两个不同任务的序号;n表示任意一个机器人的序号;s表示时段的开始时间,e表示时段的结束时间;ld,m为第m个任务tm的执行时长;lg,m为移动至第m个任务tm所需时长;ts,m与te,m分别表示任务tm可用时段的起始时间与结束时间;ts,m,n与te,m,n分别表示任务tm对机器人rn可用时段的起始时间与结束时间;ts,m,n与te,m,n表示任务tm实际被分配给机器人rn的时段的起始时间与结束时间;

14、定义目标函数r如公式(4)所示:

15、

16、表示大小为n的机器人集合,表示大小为m的任务集合,p为时间片段数量;m表示中任意一个任务的序号;n表示中任意一个机器人的序号;pm表示任务tm的优先级;om,n表示任务tm是否被分配给机器人rn,取值为1时,表示任务tm被分配给机器人rn,为0时则相反;规划成功的任务越多,规划的任务优先级越高,r值越大;算法在最大化r值的同时,也应服从机器人间的约束,约束公式如公式(5)所示:

17、

18、约束表示任一任务被不同机器人执行的次数应不大于1;

19、算法与环境进行互动时,从环境获取状态,使用大小为机器人数量n乘时间片段数量p的状态矩阵来表示每个机器人在每个时间片段的占用情况,如公式(6)所示:

20、

21、其中,sm,n,p表示在第m步中,机器人rn在第p个时间片段上的占用情况,将环境的所有可能的状态定义为状态集状态矩阵sm的所有可能取值均在状态集中,满足约束的条件下,在第m步中,算法采取的动作am如公式(7)所示:

22、其中表示算法的动作集,am=0表示不采取任何动作,舍弃任务tm,而am=n时,表示将任务分配给机器人rn,n为一个不大于n的正整数。

23、优选的,在步骤s2中,具体包括以下步骤:

24、s21:初始化强化学习模型,强化学习模型是基于深度神经网络构建的决策模型,能够根据任务规划场景的状态,选择对某一任务的规划,得到最优的规划方案;

25、s22:在多个预训练场景中,分别应用深度强化学习方法,对多个强化学习模型进行训练,深度强化学习模型是深度q网络,神经网络以状态矩阵为输入,输出状态的值函数q,作为决策依据,在每次决策时,深度强化学习模型对该任务的每个可行的规划方案对应的状态矩阵进行q值估计,q值最高的状态矩阵对应的决策为最佳决策,规划动作的选取方式如公式(7)所示:

26、

27、其中,ε为探索率,表示算法倾向于探索新策略的程度,am表示在第m步中算法选择的动作,ar表示在动作空间a的平均分布u(a)上抽取的随机动作;

28、q值的目标值可以表示为算法对未来奖励值的加权和的期望值,其计算公式如(8)所示:

29、

30、其中,γ表示衰减值,表示期望运算。

31、得到公式(8)计算的q值目标值及网络输出的估计值后,对网络参数进行更新,如公式(9)所示:

32、

33、其中,θj为第j次更新后内循环网络的参数;α为内循环网络的学习率,决定了网络参数的更新速度;为损失函数,用于衡量q值目标值与估计值之间的差异;

34、s23:在预训练场景中,生成经验信息,每个内循环模型再次与环境互动,进行任务规划,并存储经验信息,供后续步骤使用;

35、s24:使用步骤s23中存储的经验信息对外循环网络进行更新,透过内循环网络存储的经验进行参数更新,学习预训练场景中的规划方法,外循环网络的参数更新过程如公式(10)所示:

36、

37、其中,θi为第i次更新后外循环网络的参数,β为外循环网络的学习率;

38、s25:重复步骤s22至s24,将内循环网络的参数设置为与外循环网络相同的参数,并进行内循环网络更新、经验采集以及外循环网络更新。

39、优选的,在步骤s4中,在期望应用算法的任务规划场景中,使用深度强化学习方法,再次对外循环网络进行训练,重复训练后,外循环网络应能在该场景中得到最优的任务规划方案,采用公式(4)对任务规划方案进行评估时,r值能达到最高;当任务场景发生变化时,再次对预训练的外循环网络进行训练更新,得到适合新环境的任务规划算法。

40、因此,本发明采用上述一种基于元强化学习的多机器人动态任务规划方法,设计了一种基于元强化学习的任务规划算法,对任务规划模型上的优化问题进行求解。在任务无法预先确定的动态任务规划场景中,该算法能在较短时间内获得效率较高的任务规划方案,且在场景发生变化时,该算法能在少次更新后达到与原先持平的性能水平,极大地提高了算法对动态环境的适应能力。

41、下面通过附图和实施例,对本发明的技术方案做进一步的详细描述。


技术特征:

1.一种基于元强化学习的多机器人动态任务规划方法,其特征在于:包括以下步骤:

2.根据权利要求1所述的一种基于元强化学习的多机器人动态任务规划方法,其特征在于:在步骤s1中,挑选多个具有代表性的任务规划场景做为预训练场景,并对其进行建模,定义场景中的关键变量和约束条件,将实际规划问题转化为组合优化问题,具体表示为:

3.根据权利要求2所述的一种基于元强化学习的多机器人动态任务规划方法,其特征在于:在步骤s2中,具体包括以下步骤:

4.根据权利要求3所述的一种基于元强化学习的多机器人动态任务规划方法,其特征在于:在步骤s4中,在期望应用算法的任务规划场景中,使用深度强化学习方法,再次对外循环网络进行训练,重复训练后,外循环网络应能在该场景中得到最优的任务规划方案,采用公式(4)对任务规划方案进行评估时,r值能达到最高;当任务场景发生变化时,再次对预训练的外循环网络进行训练更新,得到适合新环境的任务规划算法。


技术总结
本发明公开了一种基于元强化学习的多机器人动态任务规划方法,涉及机器人系统任务调度领域,S1:建立多个具有代表性的任务规划场景的数学模型;S2:应用元强化学习方法,在步骤S1中建立的任务规划场景中进行预训练,得到通用的任务规划算法参数;S3:建立目标任务规划场景的数学模型;S4:应用深度强化学习方法,基于步骤S2中得到的算法参数进行微调,得到适合目标场景的最优任务规划方法。本发明设计了一种基于元强化学习的任务规划算法,在任务无法预先确定的动态任务规划场景中,能在较短时间内获得效率较高的任务规划方案,且在场景发生变化时,能在少次更新后达到与原先持平的性能水平,极大地提高了算法对动态环境的适应能力。

技术研发人员:宋鹏,史大威,陈怀宇,崔楷欣,王军政
受保护的技术使用者:北京理工大学
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-29402.html

最新回复(0)