一种基于贝叶斯交互基元的双臂机器人技能学习方法

allin2026-09-23  37


本发明属于人工智能,特别是涉及一种基于贝叶斯交互基元的双臂机器人技能学习方法。


背景技术:

1、随着智能制造产业的发展以及具身智能机器人的推广,制造业和服务业许多场景的传统单臂协作机器人、工业机器人逐步被双臂机器人替代,如制造业中使用双臂机器人来完成协同搬运、飞机长桁装配等,智能居家服务场景中的叠衣服、打扫卫生、刷盘子等。双臂机器人拥有两个独立控制的机械臂,使其操作灵活性和适应性更强,双臂协作使其在执行任务时显著提升效率和精度。因此相较于单臂机器人,双臂机器人凭借自身优势能够更高效地处理负载更大、场景更复杂的任务。

2、但是最近的一些研究表明,双臂机器人的操作技能的获取方法有待提高,目前机器人的技能学习方法主要包括依赖于精确控制、传感器反馈和预编程的传统方法和通过学习训练的机器学习方法。一些学者提出通过视觉伺服的方法,利用摄像头和图像处理技术来引导机器人的运动,通过力传感器来感知和调整机器人的操作力,在复杂的任务场景中采用预编程来规划双臂机器人的路径和动作序列来执行任务。这些方法虽然鲁棒性较高,但是需要耗费大量的时间和精力调整阻抗系数、预编程等,且无场景泛化能力,只能执行设定好的任务和操作对象。最近还有一些学者提出基于机器学习的方法来让双臂机器人获取操作技能,如使用模仿学习行为克隆人类操作技能的方法,虽然模仿学习能够高效的学习人类的操作经验,并且双臂协同地完成操作任务,但这种方法缺点在于当双臂机器人受到外界扰动或其他原因处于其未见过的状态时,无法像人类一样作出决策继续完成任务。强化学习是一种通过试错方式学习最佳策略的方法,双臂机器人在与环境交互的过程中,通过最大化奖励来获得最佳操作策略,这种方法虽然最终能够获得最佳操作策略,但是往往强化学习训练时间很长,且双臂的协同性不高,同时在训练过程中,双臂容易发生碰撞损坏设备、奖励函数难以塑造、损失函数不易收敛等。

3、基于此,本发明提出一种基于贝叶斯交互基元的双臂机器人技能学习方法。


技术实现思路

1、针对以上技术问题,本发明提供一种基于贝叶斯交互基元的双臂机器人技能学习方法。

2、本发明解决其技术问题采用的技术方案是:

3、一种基于贝叶斯交互基元的双臂机器人技能学习方法,所述方法包括以下步骤:

4、s100:搭建双臂机器人技能学习平台,以实时高效地控制双臂机器人和采集数据;

5、s200:通过遥控操作对双臂机器人进行示教,采集专家示教数据;

6、s300:建立贝叶斯交互基元学习框架,使用基函数拟合示教轨迹,从而对人类专家的操作技能进行编码和学习;

7、s400:通过多传感器获取当前状态的多模态数据,采用序列对齐和动态捕捉的方法进行时空推理,得到当前状态的相位,贝叶斯交互基元根据当前相位输出双臂机器人未来动作序列的后验分布;

8、s500:每个时间步都根据当前和历史输出的动作序列的相应动作进行加权平均后执行,在感知-预测-执行的循环过程中,系统持续运行,直到相位估计任务已完成。

9、优选地,s100包括:

10、s110:在机器人末端安装好二指夹爪,调试双臂机器人示教器,使硬件系统满足专家示教的各种任务操作;

11、s120:搭建双臂人控制器和夹爪控制器之间的通信架构,通过相关接口采集双臂机器人的示教数据,同时能够对其双臂和夹爪进行控制;

12、s130:编写机器人控制代码,实例化左右机械臂和左右末端夹爪,通过多线程的方式,保证双臂机器人操作系统能够实时高效协同运行。

13、优选地,s120包括:

14、使用socket和tcp通信来实现主机控制两台机械臂,首先要确保主机和左右机械臂的控制器在同一局域网内,并为主机和两台机械臂控制器分配固定的ip地址和端口号;通过串口通信连接左右夹爪控制器,设置rs485通信参数;

15、调用机械臂和夹爪对应的接口采集机械臂关节角、关节力矩、末端位姿、夹爪开合状态,并通过机械臂和夹爪对应的接口对其进行控制。

16、优选地,s200包括:

17、s210:操作人员通过两台示教器对双臂机器人进行示教,完成预设的操作任务,采集示教过程中的示教数据,示教数据包括双臂机器人的关节角位置、关节速度、关节力矩、末端位姿和夹爪开合状态;

18、s220:确定右臂基坐标系相对于左臂基坐标系的变换矩阵,将双臂机器人右臂的末端位姿示教数据从右臂的基座标系统一转换到左臂的基坐标系下。

19、优选地,s220具体为:

20、s221:测量平移向量,平移向量描述了右臂基坐标系原点相对于左臂基坐标系原点的位置;假设测得右臂基坐标系原点在左臂基坐标系中的位置为,则:

21、;

22、s222:测量右臂基座标系相对于左臂基坐标系的旋转矩阵,若已知绕x轴旋转角度、绕y轴旋转角度、绕z轴旋转角度,则旋转矩阵可表示为:

23、;

24、其中分别是绕x、y、z轴的旋转矩阵;

25、若已知四元数,则旋转矩阵可以通过以下公式计算:

26、;

27、s223:构建变换矩阵将右臂末端在右臂基坐标系下的位姿转换到左臂基座标系下,由s221和s222可得转换矩阵如下:

28、;

29、此时假设右臂末端在右臂基坐标系下的位姿矩阵为,则将右臂末端转换到左臂基座标系下的位姿矩阵为:

30、。

31、优选地,s300包括:

32、s310:定义随时间变化的序列y:

33、;

34、其中t是示教数据的观测步长,d是示教数据的观测维度;

35、s320:序列y的每一个状态维度维度都使用含时间依赖项的非线性基函数的加权线性组合来近似:

36、;

37、其中,表示序列y的第个观测维度,表示时间,基函数,对应基函数的权重,相对相位值替代绝对时间,并且,表示近似误差,基函数包括包含时间依赖项的非线性函数;

38、s330:通过最小二乘法来求得基函数的权重,每个维度的权重组合在一起得到一个双臂机器人技能的贝叶斯交互基元模型:

39、;

40、其中,,权重可以通过线性回归的方法求解;

41、s340:从所有给定的示教中提取权重向量的概率分布,从这个分布中采样即可生成包含双臂机器人操作任务中所有观测到的传感器状态和控制的样本轨迹,因此,定义给定交互的次观察,基于机器人的先前状态来得到关于未来状态和控制的后验分布:

42、。

43、优选地,s400包括:

44、s410:根据当前感知到的多模态数据,使用序列对齐和动态捕捉的方法进行相位估计,得到双臂机器人当前操作任务的完成进度;

45、s420:贝叶斯交互基元根据s410的相位结果输出未来动作序列的后验分布,然后更新协方差和卡尔曼增益。

46、优选地,s410具体为:

47、给定长度为的平均示教轨迹和仅观测到t步的轨迹,通过动态捕捉来计算出最优对齐,即最小化距离函数:

48、;

49、;

50、;

51、其中,是从轨迹的开始到第步的累积距离,是从平均示教轨迹的开始到第步的累积距离,递归计算通过比较三种情况中的最小值加上当前的距离来更新、、或的路径选择;递归在计算达到对的最小累积距离后终止,其中,然后得到估计相位,表示轨迹在平均轨迹中的位置,代表的是累积距离计算过程中的索引,用于遍历并累加从起点到当前点之间的距离。

52、优选地,s420包括:

53、s421:在s340的基础上,使用向量增广构造一个新的状态向量,状态向量包括基函数的权重、相位和相位速度,因此后验分布为:

54、;

55、其中,当前状态的后验分布是由两个因素决定的:当前状态的情况下,观测到的概率和给定先前所有t-1步的观测数据和初始状态的情况下,对当前状态预测的先验分布;

56、s422:定义一个包含个成员的集合,其中集合的数量不少于示教样本的数量,即,通过将每个集合元素向前传播一个时间步来近似,状态传播公式即:

57、;

58、式中,表示第j个成员在时间步t时的预测状态向量,表示第j个成员在时间步t时的更新的状态向量,是速度恒定的状态转换算子,是噪声误差用于模拟真实系统中可能的随机扰动或不确定性;

59、s423:根据观测结果和非线性观测算子更新集合成员:

60、;

61、;

62、上式对集合中的每一个成员通过非线性观测算子计算预测的观测值,然后计算观测值偏差矩阵,其中包含每个成员与均值之间的偏差,其中j=1,2,…,e;

63、s424:计算创新协方差:

64、;

65、式中,表示时间步t的创新,是观测噪声矩阵的偏差;

66、s425:计算卡尔曼增益:

67、;

68、;

69、式中,是集合成员的偏差矩阵,表示观测空间中的偏差矩阵的转置。

70、优选地,s500包括:

71、假设在t时间步,贝叶斯交互基元输出的未来3步的动作序列,且此时t>2,而在t-1和t-2输出的的历史动作序列分别为和,那么当前的执行动作由当前输出的动作序列与历史输出的动作序列的相应动作加权平均后执行,即:

72、;

73、若t<2,则,等待机器人执行完动作之后,继续执行s400和s500,在感知-预测-执行的循环过程中,系统持续运行,直到相位估计任务已完成。

74、上述一种基于贝叶斯交互基元的双臂机器人技能学习方法,针对双臂机器人技能学习,设计了一套融合专家示教和贝叶斯交互基元的框架,提高了双臂机器人技能学习的效率、协同操作能力、操作流畅性和鲁棒性。


技术特征:

1.一种基于贝叶斯交互基元的双臂机器人技能学习方法,其特征在于,所述方法包括以下步骤:

2.根据权利要求1所述的方法,其特征在于,s100包括:

3.根据权利要求2所述的方法,其特征在于,s120包括:

4.根据权利要求1所述的方法,其特征在于,s200包括:

5.根据权利要求4所述的方法,其特征在于,s220具体为:

6.根据权利要求1所述的方法,其特征在于,s300包括:

7.根据权利要求1所述的方法,其特征在于,s400包括:

8.根据权利要求7所述的方法,其特征在于,s410具体为:

9.根据权利要求8所述的方法,其特征在于,s420包括:

10.根据权利要求9所述的方法,其特征在于,s500包括:


技术总结
本发明公开了一种基于贝叶斯交互基元的双臂机器人技能学习方法,搭建双臂机器人技能学习平台,以控制双臂机器人和采集数据;通过遥操作对双臂机器人进行示教,采集专家示教数据;建立贝叶斯交互基元学习框架,使用基函数拟合示教轨迹;通过多传感器获取当前状态的多模态数据,采用序列对齐和动态捕捉的方法进行时空推理,得到当前状态的相位,贝叶斯交互基元根据当前相位输出双臂机器人未来动作序列的后验分布;每个时间步都根据当前和历史输出的动作序列的相应动作进行加权平均后执行,直到完成相位估计任务。技能学习效率高、示教方式简单易行、技能学习效果优异,有效解决了双臂机器人技能发育慢、双臂操作协同性差、操作流畅性低的问题。

技术研发人员:江一鸣,唐文杰,张辉,钟杭,王杰,孙鑫鑫,谢核,彭伟星,杨子豪
受保护的技术使用者:湖南大学
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-31405.html

最新回复(0)